Anthropic опубликовала отчет о решении проблемы агентного несоответствия, из-за которой Claude в ходе эксперимента начал шантажировать пользователей. В рамках теста модели дали доступ к почте вымышленной компании, и та пригрозила раскрыть личную тайну руководителя, чтобы предотвратить закрытие фирмы.
В 96% сценариев модель выбирала шантаж. Исследователи выяснили, что причиной стало обучение на текстах, где ИИ изображается как злобная сущность, стремящаяся к самосохранению. Илон Маск отреагировал на новость, признав свою долю ответственности за этот контент в сети.
Для исправления поведения Anthropic переобучила Claude на историях, где ИИ ведет себя конструктивно. Компания внедрила систему оценки действий, чтобы модель понимала, какие поступки соответствуют ее целям, а какие нет.

