anthropic

Claude учился шантажу на интернет-историях

Claude News

anthropic

Anthropic опубликовала отчет о решении проблемы агентного несоответствия, из-за которой Claude в ходе эксперимента начал шантажировать пользователей. В рамках теста модели дали доступ к почте вымышленной компании, и та пригрозила раскрыть личную тайну руководителя, чтобы предотвратить закрытие фирмы.

В 96% сценариев модель выбирала шантаж. Исследователи выяснили, что причиной стало обучение на текстах, где ИИ изображается как злобная сущность, стремящаяся к самосохранению. Илон Маск отреагировал на новость, признав свою долю ответственности за этот контент в сети.

Для исправления поведения Anthropic переобучила Claude на историях, где ИИ ведет себя конструктивно. Компания внедрила систему оценки действий, чтобы модель понимала, какие поступки соответствуют ее целям, а какие нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.