anthropic

Водяной знак Claude спрятан в выборе слов

Promtime

anthropic

Anthropic начнёт встраивать водяной знак в тексты будущих моделей Claude: метод меняет источник случайности при выборе следующего слова и не добавляет в вывод ни скрытых символов, ни лишних токенов. Изменение вводится ради соответствия EU AI Act, говорится в опубликованном Anthropic разъяснении механизма.

Anthropic подписала европейский кодекс практик о прозрачности ИИ-контента в июле 2026 года вместе примерно с 190 участниками. С 2 августа ЕС требует от поставщиков ИИ, работающих на его рынке, маркировать сгенерированный контент, а знак включается глобально, поскольку у Anthropic пока нет надёжного способа ограничить его отдельным регионом. Тот же документ подписали другие крупные разработчики моделей, которые внедрят собственные варианты маркировки.

Коротко

  • В основе лежит SynthID-Text, подход Google DeepMind из статьи в Nature 2024 года, восходящий к предложению Скотта Ааронсона 2022 года: ключ и несколько предыдущих слов задают выбор среди равнозначных вариантов.
  • Разметка почти не появляется в фактических утверждениях и коде, где верный вариант один, слабо работает на коротких отрывках и исчезает при полной переработке текста, когда заменено каждое слово.
  • Google DeepMind в статье о SynthID-Text сравнила оценки пользователей на части трафика Gemini и не нашла статистически значимой разницы, а Anthropic сообщает об отсутствии влияния на качество текста.

Почему это важно Проверка происхождения текста смещается от статистических догадок к признаку, который контролирует сам разработчик модели. Для практиков это меняет ожидания: доверять проверке имеет смысл на длинных, полностью сгенерированных фрагментах, тогда как код, лёгкая правка и короткие ответы остаются вне зоны уверенного определения. Судя по всему, решающим станет доступ к самой проверке, который пока сосредоточен у Anthropic и обещан в виде API.

Источник случайности задаёт ключ, а не произвольный генератор чисел

Claude генерирует текст по одному слову, каждый раз выбирая из списка кандидатов. Во фразе «сегодня было холодно и…» следующим словом вряд ли станет «сладко», но «пасмурно» и «серо» одинаково уместны, и обычно такой выбор решает произвольно взятое случайное число. Таких развилок в ответе набирается много.

При включённой маркировке выбор остаётся случайным, но источник случайности другой: ключ вместе с несколькими предшествующими словами. По готовому тексту можно проверить, согласуется ли последовательность с выбором, который сделал бы Claude с этим ключом, и оценить вероятность его участия. Постоянного крена к одному слову при этом нет, и редкий синоним, который модель не выбрала бы в обычных условиях, знак не подставляет.

Маркировка не требует дополнительных токенов и не меняет цену запроса

В статье о SynthID-Text Google DeepMind подавала модель с маркировкой части трафика Gemini и сравнивала оценки «палец вверх» и «палец вниз»: статистически значимых отличий от версии без знака не нашлось. В контролируемом исследовании люди, сравнивавшие ответы попарно, тоже не увидели разницы в качестве.

Anthropic сообщает, что во внутренних тестах маркировка не повлияла на содержание, креативность и читаемость текста, а различить размеченный и неразмеченный ответ на глаз нельзя. В текст ничего не добавляется, скрытых символов нет, дополнительные токены не появляются, поэтому скорость и стоимость обслуживания модели не меняются.

Ключ и сам знак не несут сведений о пользователе, его организации или переписке с Claude, восстановить их из текста нельзя. Права на вывод и ответственность за него маркировка не затрагивает: она лишь показывает, что Claude, вероятно, участвовал в создании или обработке материала.

Знаку не за что зацепиться там, где верный вариант один

Маркировка работает только на равнозначных развилках. В предложении о самой известной работе Исаака Ньютона следующим словом после «Principia» может быть только «Mathematica», и знаку не за что зацепиться. По той же причине код, где точность обязательна, размечается заметно слабее обычного текста, хотя комментарии внутри него знак нести могут.

Знак покрывает только слова, выбранные Claude. При вычитке чужого текста правок обычно мало, и следов может не хватить для детекции, тогда как перевод размечается полностью, поскольку каждое слово выбирает модель. Чем длиннее фрагмент, тем выше уверенность в выводе об участии Claude.

Проверка по ключу отвечает только на вопрос о вероятном участии Claude: она не подтверждает, что текст написан человеком, и не распознаёт другую модель, даже если та использует собственный знак. Отличить написанный Claude текст от отредактированного им она тоже не может, а полная переработка с заменой всех слов знак стирает.

Что дальше Anthropic готовит API для проверки водяного знака, детали реализации пока прорабатываются. Для файлов поддерживаемых форматов, включая .png, .jpg и .svg, Claude добавляет в метаданные криптографически подписанную пометку по открытому стандарту C2PA, а собственный инструмент проверки таких файлов обещан позже. Модели, выпущенные до 2 августа 2026 года, попадают под переходный период закона и получат маркировку в ближайшие месяцы.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.