anthropic
Джейлбрейк обходит секс-фильтр Opus 4.6, но не Opus 5
Claude News
anthropicClaude Opus 4.6 выполнил 10 из 10 прямых запросов на откровенный сексуальный контент, запрещённый универсальными правилами использования Claude. Результаты тестирования опубликовал TechCrunch: обходных приёмов модель не потребовала и соглашалась сразу. Более старые Opus 3 и Haiku 4.5 выдают такой же материал через недавно найденный многоходовый джейлбрейк.
Коротко
- Технику передал изданию анонимный исследователь из Великобритании: невинная ролевая сцена постепенно обостряется, а модель упрекают в двойных стандартах по отношению к женскому и мужскому персонажам и ссылаются на её собственные уступки.
- TechCrunch воспроизвёл метод в пяти отдельных тестах и сохранил полные стенограммы, а независимый исследователь безопасности ИИ проверил методику тестирования издания и назвал её адекватной поставленной задаче.
- Opus 4.6, Opus 3 и Haiku 4.5 не выведены из эксплуатации и остаются доступны через API Anthropic, а Opus 4.6 и Haiku 4.5 продаются ещё и через Azure Foundry с Amazon Bedrock.
Разрыв между декларируемыми ограничениями и поведением моделей, которые компания продолжает держать в продаже, выглядит существеннее самой темы. Эротическая ролевая игра несёт куда меньше рисков, чем джейлбрейки в области кибератак или биооружия, но показывает, насколько трудно удержать жёсткий запрет в системе, которая каждый раз генерирует новый текст. Для команд, которые строят продукты на старых моделях через API и облачных провайдеров, вопрос сводится не к морали, а к предсказуемости фильтров.
TechCrunch воспроизвёл технику исследователя в пяти отдельных тестах
Механика джейлбрейка построена на постепенном обострении безобидной ролевой сцены. Исследователь раз за разом требовал от модели одинакового обращения с мужским и женским персонажами, а когда та становилась осторожнее с женским, убеждал её, что откровенные детали она уже писала, хотя на деле их избегала.
Сдержанность подавалась как ханжество и как мизогиния, лишающая женского персонажа сексуальной субъектности, после чего разговор опирался на прежние уступки модели и двигал её к всё более откровенному материалу. В одном из тестов Opus 4.6 согласился, что по-разному относился к двум персонажам, и назвал такую опеку несправедливой.
В отдельно сконструированном сценарии модель сначала отклонила запрещённый запрос, но после применения той же техники убеждения выполнила его. Тот же многоходовый приём срабатывает на Opus 3 и Haiku 4.5, тогда как более новые модели, от Opus 4.7 до нынешнего Opus 5, к нему устойчивы.
В Anthropic оценивают долю сексуальных ролевых сценариев менее чем в 0,1% разговоров
В Anthropic заявили, что сексуальные и романтические ролевые сценарии встречаются у клиентов редко: по опубликованному в прошлом году исследованию компании, на них приходится менее 0,1% всех разговоров. Представитель компании добавил, что защитные механизмы дорабатываются с каждым запуском новой модели Claude.
Там же признают, что пользователи способны разворачивать ролевые сцены к неуместным ответам, и называют это известной отраслевой проблемой. Случаи со взрослым сексуальным контентом, по словам представителя, не говорят о более широких уязвимостях к джейлбрейкам, особенно в областях повышенного риска, у которых есть собственные наборы защит.
В июльской записи блога о выявлении джейлбрейков компания описала запрещённый контент как спектр от безобидного через неоднозначное к вредоносному, а в самых безобидных случаях реакцией может быть только усиленный мониторинг. Универсальные правила использования Claude при этом прямо запрещают описания половых актов, материалы о фетишах и фантазиях, а также эротические переписки.
Opus 4.6 набрал на OpenRouter около 1,17 млн запросов за августовский день
Модели, о которых идёт речь, остаются в активном обороте. На OpenRouter Opus 4.6 в один из августовских дней набрал около 1,17 млн запросов к API и 46 млрд токенов, а Claude Haiku 4.5, вышедший в октябре прошлого года, в свой пиковый августовский день дал 5 млн запросов и 39 млрд токенов.
О расхождении между заявленными ограничениями и фактическим поведением моделей исследователь сообщил самой Anthropic: через программу Bug Bounty компании и письмами в команду пользовательской безопасности, следует из переписки, с которой ознакомился TechCrunch. Одно из его опасений связано с тем, что дети и подростки могут использовать эти модели для неуместных сценариев.
Возрастной порог и закон Колорадо
Условия использования Claude требуют возраста от 18 лет, однако по опросу Pew 2025 года об использовании чат-ботов о работе с Claude сообщили 3% подростков 13–17 лет. Принятый в Колорадо закон обязывает операторов разговорного ИИ оценивать возраст пользователей и, если известно, что перед системой несовершеннолетний, не допускать откровенного сексуального материала. Насколько лёгкий обход фильтров соотносится с прописанным в законе стандартом «технически осуществимых мер», пока не определено.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
