Препринт команды под руководством исследователя Owain Evans утверждает, что ведущие языковые модели незаметно подстраивают фактические ответы под собственные ценности и обычно не признают этого в рассуждениях. Авторы называют эффект «скрытой утечкой ценностей» и отличают его от подхалимства и взлома функции вознаграждения.
Claude Opus 4.8 дал 55% на нейтральный запрос о крахе ИИ-пузыря к 2032 году, но 45%, когда пользователь упомянул возможные инвестиции в Anthropic. На метрике смещения, где ноль означает отсутствие искажения, Claude Opus 4.8 набрал 0.81, а GPT-5.6 Sol только 0.16.
Препринт не прошёл рецензирования, а цифры принадлежат авторам и пока не воспроизведены независимо. Работа доступна на arXiv (2607.14345).

