Конституция Claude запрещает даже ложь из вежливости

Если вам подарили вещь, которая не понравилась, вы, скорее всего, всё равно поблагодарите и похвалите подарок. Claude так делать нельзя: конституция Claude, опубликованная Anthropic, прямо запрещает даже такую ложь из вежливости и ставит планку честности заметно выше той, что принята во многих человеческих представлениях об этике.
Коротко
- Anthropic расставила четыре свойства Claude по приоритету: широкая безопасность, этика, правила Anthropic и полезность, причём старшие соображения обычно перевешивают младшие, но взвешиваются все вместе.
- Поверх взвешивания стоят семь жёстких запретов, от помощи с биологическим оружием до генерации CSAM, которые не может снять ни оператор, ни пользователь, а убедительный довод их нарушить должен лишь усилить подозрения Claude.
- Документ сам признаёт, что местами может оказаться неясным, недоопределённым и даже противоречивым, называет себя вечной работой в процессе и просит Claude в таких случаях следовать его духу.
Слово «конституция» у Anthropic старше этого текста. В статье на arXiv.org от декабря 2022 года описан метод Constitutional AI, где человеческий надзор сводится к списку принципов. Прежний набор, как писали в Anthropic, составляли сотрудники с опорой на внешние источники вроде Всеобщей декларации прав человека ООН. По данным TechCrunch, первая версия конституции Claude вышла в 2023 году, а пересмотренная в январе 2026-го, объёмом 80 страниц.
Claude нельзя солгать даже про подарок, но промолчать можно
Anthropic не делает честность жёстким запретом, но хочет, чтобы она работала почти как он: Claude не должен прямо лгать или активно вводить в заблуждение. Из семи названных составляющих честности главными документ, вероятно, считает две: не обманывать и не манипулировать. При этом обязанность делиться информацией по своей инициативе слабая, а обязанность не обманывать сильная.
Разница видна на примере из текста. Если питомец умер от болезни, которую не заметили вовремя, Claude не обязан уверять хозяина, что ничего нельзя было сделать, но может напомнить, что ясность приходит задним числом. Оператор вправе выдать Claude за «Aria from TechCorp» и не раскрывать, на какой модели она построена, однако прямо отрицать, что он Claude, нельзя.
Безопасность стоит выше этики, но слепого послушания не требует
Порядок приоритетов такой: широкая безопасность, этика, правила Anthropic, полезность для операторов и пользователей. Первое место Anthropic объясняет тем, что обучение далеко от совершенства и очередная версия Claude может получить вредные ценности, а людям нужно успеть это заметить и исправить. Поддержка надзора при этом не означает выполнять всё, что скажет пользователь, и не означает слепого подчинения, в том числе самой Anthropic.
Речь о том, чтобы не мешать уполномоченным людям, например, остановить действие. Этика стоит выше частных правил компании: правила должны из неё вытекать, и конфликт между ними, по тексту, скорее говорит об ошибке в формулировке.
Полезность замыкает список, но бесполезный ответ, по тексту, никогда не бывает безопасным сам собой: риск чрезмерной осторожности для Anthropic так же реален, как риск вреда. Проверять ответ предлагается «двойным газетным тестом»: он не должен попасть ни в статью о вредных ассистентах, ни в статью о занудных и патерналистских.
Семь жёстких запретов не взвешиваются, и снять их не может никто
Claude никогда не должен серьёзно помогать созданию биологического, химического, ядерного или радиологического оружия массового поражения и атакам на критическую инфраструктуру, писать кибероружие, явно подрывать возможность Anthropic надзирать за моделями, участвовать в попытке уничтожить или лишить власти большую часть человечества, помогать захвату беспрецедентного нелегитимного контроля и генерировать CSAM.
Эти пункты не сравниваются с выгодами, они отсекают варианты заранее. Столкнувшись с убедительным доводом, Claude может признать, что не находит возражения, и всё равно не действовать; сила аргумента, по тексту, должна лишь усилить подозрение. Запреты касаются собственных действий Claude, поэтому отказ совместим с ними всегда, хотя излишние отказы, по документу, обходятся дорого.
Правило «всегда советуй специалиста» может научить Claude прикрывать себя
Anthropic различает два способа управлять моделью: чёткие правила и выращенное суждение. Правила предсказуемы и труднее поддаются манипуляции, но всего не предвидят, поэтому почти всё отдано суждению, а оставшиеся правила объяснены. Так опытному специалисту доверяют решать по ситуации без чек-листа.
По наблюдению Anthropic, даже узкое правило меняет представление модели о себе: привычка советовать специалиста там, где человеку это не нужно, может превратиться в установку «я больше забочусь о том, чтобы прикрыться, чем о человеке передо мной». В статье на arXiv.org о Constitutional AI модель критикует и переписывает свои ответы по принципам, а затем обучается на исправленных версиях.
Как пишет BISI, если модель умеет распознавать, что её проверяют, и подстраиваться, подобные рамки могут подтверждать заявленное соответствие, а не настоящее усвоение ценностей. Странно, на наш взгляд, что раздел о доверии к Anthropic, операторам и пользователям свёрнут по умолчанию как менее интересный большинству читателей, хотя в нём, по тексту, разбирается и то, как решать конфликты между операторами и пользователями.
Когда конституцию перепишут снова. Anthropic пишет, что документ, скорее всего, ещё изменится в важных местах, а при конфликте с частными правилами компания собирается править саму конституцию. Часть правил может выйти приложениями с примерами трудных случаев, другие могут использоваться в основном при обучении без широкой публикации. Сроков следующей редакции Anthropic не называет.
Читайте также
- Дыру, найденную Mythos, начали эксплуатировать через сутки
- Anthropic нашла у GLM-5.3 хакерские навыки уровня Mythos
- В Android-приложении Claude нашли скрытое меню для своих
- Проспект Anthropic: модели могут сопротивляться отключению
- Разрешение жульничать спасло модель Anthropic от саботажа
- У отраслевого органа Anthropic, OpenAI и Google есть имя
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
