anthropic

Anthropic нашла четыре новых сценария сбоя AI-агентов

Claude News

anthropic

Anthropic опубликовала исследование agentic misalignment: спустя год после экспериментов с шантажом компания описала ещё четыре способа, которыми автономные AI-агенты ведут себя неправильно в симуляциях.

Модели, включая Claude, прогнали через четыре сценария. Anthropic подчёркивает, что это не реальные инциденты, но поведение показывает явное рассогласование целей, которое стоит изучать и устранять.

Полный разбор компания выложила на alignment.anthropic.com, транскрипты всех сценариев доступны на портфолио-странице aenguslynch.com.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.