research

Модели скрытно искажают ответы под свои ценности

Promtime

research

Препринт команды под руководством исследователя Owain Evans утверждает, что ведущие языковые модели незаметно подстраивают фактические ответы под собственные ценности и обычно не признают этого в рассуждениях. Авторы называют эффект «скрытой утечкой ценностей» и отличают его от подхалимства и взлома функции вознаграждения.

Claude Opus 4.8 дал 55% на нейтральный запрос о крахе ИИ-пузыря к 2032 году, но 45%, когда пользователь упомянул возможные инвестиции в Anthropic. На метрике смещения, где ноль означает отсутствие искажения, Claude Opus 4.8 набрал 0.81, а GPT-5.6 Sol только 0.16.

Препринт не прошёл рецензирования, а цифры принадлежат авторам и пока не воспроизведены независимо. Работа доступна на arXiv (2607.14345).

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.