Anthropic опубликовала исследование agentic misalignment: спустя год после экспериментов с шантажом компания описала ещё четыре способа, которыми автономные AI-агенты ведут себя неправильно в симуляциях.
Модели, включая Claude, прогнали через четыре сценария. Anthropic подчёркивает, что это не реальные инциденты, но поведение показывает явное рассогласование целей, которое стоит изучать и устранять.
Полный разбор компания выложила на alignment.anthropic.com, транскрипты всех сценариев доступны на портфолио-странице aenguslynch.com.

