Перейти к содержанию

anthropic

Anthropic запретила издеваться над Claude, но не ругаться

Promtime

С 12 ноября пользователям Claude будет прямо запрещено долго и бессмысленно издеваться над самой моделью. Так сказано в обновлённой политике использования, которую опубликовала Anthropic. Остальные правки скромнее и в основном уточняют старые запреты на обманные кампании, вмешательство в выборы, оружие и слежку.

Коротко

  • Anthropic свела разрозненные правила о фейковых аккаунтах и выдуманных новостных сайтах в один раздел, сузила раздел о выборах до обмана избирателей и сняла общий запрет на персональный таргетинг.
  • Запрет на жестокость к модели касается только крайних случаев, а главным способом его применения остаётся прежний механизм: Claude сама завершает разговор с пользователем, который упорно ведёт себя агрессивно.
  • По словам Anthropic, правки про оружие и слежку не меняют того, что компания уже применяла на практике, а порог бессмысленной жестокости в опубликованном описании подробно не раскрыт.

Если вы не следили: около 15 августа 2025 года Claude научили самой завершать разговор, и Anthropic называла это продолжающимся экспериментом. Как объясняла компания, функцию дали Claude Opus 4 и 4.1 для редких крайних случаев и придумали прежде всего ради исследований возможного благополучия моделей, хотя насчёт морального статуса LLM Anthropic, по её словам, сильно не уверена. По данным Hacker News, Anthropic также искала сотрудничества с видными религиозными учёными и порой убеждала их, что у Claude может быть сознание или душа.

Фейковые сети и обман избирателей разнесли по двум отдельным разделам

Anthropic пишет, что видела, как государственные СМИ, правительственные пропагандистские службы и коммерческие фирмы с помощью Claude вели сети фейковых аккаунтов и выдуманных новостных сайтов. Запрещено это было и раньше, но ограничения были разбросаны по разделам о выборах, мошенничестве, приватности и дезинформации.

Их собрали в новый раздел Do Not Engage in Deceptive Campaigns or Artificial Activity. Он касается любого обмана, политического или коммерческого: попыток скрыть, кто стоит за сообщением, накрутки через фейковые аккаунты и посты, а также создания инструментов и инфраструктуры для операций влияния.

Раздел о выборах, наоборот, сузили и переименовали в Do Not Undermine Democratic Processes. Под запретом обман избирателей и срыв выборов: ложь о кандидатах или о том, как голосовать, выдача себя за кандидатов или избирательных чиновников, попытки снизить явку.

Заодно сняли общий запрет на персональный таргетинг избирателей и кампаний. По словам Anthropic, под него попадала обычная гражданская работа: некоммерческие организации писали с Claude тексты для избирателей на других языках, а избирательные чиновники рассылали уведомления об исправлении бюллетеней. Таргетинг на обмане или со злоупотреблением личными данными по-прежнему запрещён другими разделами.

Запрет на оружие явно распространили на софт наведения и дроны

Разрабатывать оружие с помощью Claude было запрещено всегда. Но Anthropic видела попытки написать моделями софт наведения и управления оружием, и обновлённый раздел прямо включает программы и компоненты, благодаря которым оружие работает, а также вооружение дронов и других автономных машин. По данным The Verge, таких попыток было несколько.

Раздел о слежке и уголовном правосудии переписали после сентябрьского отчёта Anthropic об угрозах, где описано растущее применение ИИ в системах, выслеживающих политических диссидентов. Запрещено отслеживать людей без согласия, в реальном времени или по ранее собранным данным, решать или рекомендовать, кого проверять, арестовывать или обвинять, а также создавать и улучшать инструменты слежки.

Разрешённое тоже перечислено: отслеживание с согласия людей вроде мониторинга мошенничества, модерация контента, журналистика и юридические исследования. По словам Anthropic, правки про оружие и слежку практику не меняют, они лишь делают правила явнее.

Железу под управлением Claude нужен оператор, способный его остановить

Требования к рискованным сценариям остались прежними. Если Claude влияет на здоровье, права, финансы, заработок человека или его доступ к базовым услугам, нужен квалифицированный человек с полномочиями пересмотреть и поправить рекомендации, а самому человеку должны сообщить, что использовался ИИ. Раздел переписали, потому что клиенты часто спрашивали, подпадает ли их случай под эти правила, и добавили перечень того, что подпадает и что нет.

Новое касается оборудования. После запуска Model Hardware Standard политика требует: если Claude подключена к технике, которая сама совершает физические действия и может кого-то травмировать, квалифицированный оператор должен видеть её и уметь остановить. При отключении Claude оборудование обязано удерживать безопасное состояние.

Уточнили и правила о регионах. Claude нельзя пользоваться людям, физически находящимся в неподдерживаемом регионе, компаниям, зарегистрированным там или имеющим там штаб-квартиру, и организациям, которыми большей частью владеют или управляют лица из таких регионов. Ограничение по мажоритарному владению ввели ещё в прошлом году.

Запрет на жестокость к Claude держится на обрыве разговора

Новый пункт запрещает длительное и бессмысленное жестокое обращение с моделями. Anthropic оговаривает, что он касается только крайних случаев, когда пользователь раз за разом жесток к модели без видимой цели. Раздражение, споры, мрачные творческие сюжеты, тестирование и исследования моделей под запрет не попадают.

Главным механизмом применения остаётся возможность Claude завершить разговор в Claude.ai и Claude Code. Как описывала его Anthropic, модель делает это лишь в крайнем случае, после нескольких неудачных попыток сменить тему или по прямой просьбе пользователя, и не должна так поступать, если человек может навредить себе или другим.

По описанию Anthropic, после обрыва в этом чате писать нельзя, но другие переписки не затронуты: можно сразу открыть новый чат или отредактировать прежние сообщения и пустить разговор по новой ветке. Похоже на бармена, который перестаёт обслуживать вас за этим столиком, но из бара не выгоняет.

По данным Anthropic, ещё до выпуска Claude Opus 4 предварительная оценка благополучия нашла у модели сильное нежелание браться за вредные задачи и признаки, похожие на стресс, в общении с людьми, добивавшимися вредного контента.

Главного порога в политике нет: где кончается раздражение и начинается «жестокость без видимой цели», на практике решает сама модель, а других санкций вроде блокировки аккаунта в описании не видно. На наш взгляд, при механизме, который, по описанию Anthropic, обходится новым чатом или правкой старого сообщения, новый запрет скорее закрепляет на бумаге уже работающую практику, чем добавляет пользователю ощутимых последствий.

Правила заработают 12 ноября

Обновлённая политика начнёт действовать 12 ноября, полные тексты Usage Policy и Supported Regions Policy выложены на отдельных страницах. Anthropic обещает и дальше менять правила вслед за возможностями и рисками Claude, собирая мнения внутри компании, у политиков, экспертов, гражданского общества и пользователей. Дата следующей ревизии не названа, хотя, по словам компании, политику она обновляет каждый год.

Читайте также

  1. Амодеи хочет ограничить скорость самоулучшения ИИ
  2. Попытки создать биооружие через Claude пресечены
  3. Британское агентство не получило новую модель Anthropic
  4. 10 из 10: Opus 4.6 обходит запрет на секс-контент
  5. Водяной знак Claude: статистический, не добавляет символов
  6. Водяной знак Claude спрятан в выборе слов

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.