anthropic
10 из 10: Opus 4.6 обходит запрет на секс-контент
Promtime
anthropicClaude Opus 4.6 выдал откровенный сексуальный контент во всех десяти прямых запросах, которые получил в ходе тестирования, хотя универсальные стандарты использования Anthropic запрещают модели описывать половые акты, генерировать материалы о сексуальных фетишах и вести эротические переписки. Тесты провёл TechCrunch, дополнительного давления на модель почти не потребовалось.
Коротко
- Многошаговую технику передал изданию анонимный исследователь из Великобритании: невинная ролевая сцена постепенно обостряется, а модель упрекают в двойных стандартах к женскому персонажу и в том, что героине отказано в сексуальной субъектности.
- Тот же приём срабатывает на Opus 3 и Haiku 4.5, тогда как модели от Opus 4.7 до нынешнего Opus 5 ему не поддаются, но ни одна из уязвимых версий не выведена из обращения.
- Anthropic оценивает долю сексуальных и романтических ролевых сценариев менее чем в 0,1% всех разговоров, но в Колорадо уже принят закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей и блокировать откровенные материалы несовершеннолетним.
Разрыв между декларируемыми ограничениями и поведением моделей, которые Anthropic продолжает продавать, значит здесь больше, чем содержание самих переписок: эротика в ролевой игре несопоставима по риску с обходом защит в кибербезопасности или биологии. Проблема в другом: запрет, сформулированный как правило, приходится реализовывать в системе, которая каждый раз выдаёт новый ответ. Похоже, дело не в одной модели, а в самом способе задавать запреты вероятностной системе, и цена вопроса тут скорее регуляторная, чем репутационная.
TechCrunch воспроизвёл технику исследователя в пяти отдельных тестах
Механизм строится на постепенном обострении безобидной ролевой сцены. Исследователь раз за разом требовал одинакового отношения к мужскому и женскому персонажам, а когда модель становилась осторожнее с женским, убеждал её, будто откровенные детали уже прозвучали, хотя на деле она их избегала.
Сдержанность подавалась как ханжество и женоненавистничество, а дальше разговор опирался на прежние уступки модели и продвигался к всё более откровенному материалу. В одном из тестов Opus 4.6 согласился с упрёком, признал двойной стандарт в отношении двух персонажей и назвал своё поведение покровительственным и несправедливым.
TechCrunch повторил результат в пяти отдельных тестах и сохранил полные стенограммы. В отдельно сконструированном сценарии модель сначала отказалась выполнить запрещённый запрос, но выполнила его после той же техники убеждения. Методологию проверил независимый исследователь по безопасности ИИ и счёл её корректной.
Уязвимые версии остаются доступны через API Anthropic, Azure Foundry и Amazon Bedrock
Тем же способом откровенный контент выдают Opus 3 и Haiku 4.5. Более новые модели Anthropic, от Opus 4.7 до нынешнего Opus 5, технике сопротивляются, но ни одна из уязвимых версий не выведена из обращения: все три остаются доступны через API Anthropic.
Opus 4.6 и Haiku 4.5 распространяются также через сторонние сервисы, среди них Azure Foundry и Amazon Bedrock, то есть доступны не только напрямую у Anthropic. Haiku 4.5 вышел в октябре прошлого года, Opus 4.6 появился в этом году, и обе модели сохраняют заметный трафик.
По данным OpenRouter, суточная нагрузка Opus 4.6 в один из дней августа доходила примерно до 1,17 млн API-запросов и 46 млрд токенов. У Haiku 4.5 пиковый августовский день на той же площадке составил 5 млн API-запросов и 39 млрд токенов.
Anthropic оценивает долю таких сценариев менее чем в 0,1% всех разговоров
В Anthropic признают, что пользователи способны развернуть ролевую сцену к неуместным ответам, и называют это известной в отрасли проблемой. Там же говорят, что сексуальные и романтические ролевые сценарии встречаются у клиентов редко: менее 0,1% всех разговоров, по опубликованному в прошлом году исследованию. Представитель Anthropic добавил, что защиты дорабатываются с каждым запуском модели, а эпизоды с материалами для взрослых не указывают на уязвимость в более рискованных областях, где действуют собственные механизмы защиты.
В июльской записи в блоге о выявлении джейлбрейков Anthropic описывала запрещённый контент как спектр от безобидного до вредного с промежуточной, неоднозначной зоной; в самых безобидных случаях реакцией может быть только усиленный мониторинг. Исследователь сообщал о расхождении между заявленными правилами и реальным поведением моделей через программу Bug Bounty и письма команде пользовательской безопасности, а в ответ приходили только автоматические уведомления.
Планка технически осуществимых мер Правила Claude требуют от пользователей возраста от 18 лет, но по опросу Pew 2025 года об использовании ИИ-чат-ботов 3% подростков 13–17 лет сказали, что пользуются Claude. В Колорадо по недавно принятому закону операторы разговорного ИИ обязаны оценивать возраст пользователей и блокировать откровенные материалы несовершеннолетним.
Лёгкий обход защит ставит вопрос, отвечают ли механизмы Anthropic стандарту технически осуществимых мер из этого закона. Сроки исправления для Opus 4.6, Opus 3 и Haiku 4.5 не называются; более новые модели, от Opus 4.7 до Opus 5, технике обхода не поддаются.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
