anthropic

Водяной знак Claude меняет только источник случайности

Claude News

anthropic

Anthropic начнёт встраивать водяной знак в текст будущих моделей Claude: используется вариант метода SynthID-Text, при котором в ответ не добавляются ни скрытые символы, ни дополнительные токены. Как объясняет Anthropic, изменение вводится ради соответствия EU AI Act, который с 2 августа требует маркировать ИИ-контент на рынке ЕС.

Коротко

  • Метод работает на выборе между равнозначными словами: вместо обычного генератора случайных чисел следующий токен определяют ключ и несколько предыдущих слов, поэтому в текст ничего не добавляется.
  • На скорость моделей маркировка влияет незначительно, стоимость обслуживания и использования остаётся прежней, а идентифицирующих данных знак не содержит: восстановить пользователя, организацию или чат по нему нельзя.
  • Слабее всего маркировка ложится на код и фактические фрагменты, где верный вариант один, а также на вычитку чужого текста: правок обычно слишком мало, чтобы знак стал заметен детектору.

Почему это важно Для повседневной работы с API и Claude Code изменение выглядит нейтральным: счёт за токены остаётся прежним, а формат ответа не меняется. Значимее другое: маркировка вводится глобально, а не только для ЕС, поэтому проверяемость вывода Claude, судя по всему, станет свойством продукта на всех рынках. Отдельный вопрос: надёжность знака сильнее всего падает там, где Claude чаще всего применяют в разработке, то есть в коде.

SynthID-Text восходит к предложению Скотта Ааронсона 2022 года

Claude генерирует текст по одному слову, выбирая из списка кандидатов. В большинстве случаев несколько вариантов равноценны: после «погода сегодня была холодной и» уместны и «пасмурной», и «серой», и обычно выбор между ними решает случайное число. Маркировка заменяет источник этой случайности: слово задают ключ и несколько предшествующих слов.

Постоянного смещения в сторону конкретных слов при этом не возникает: выбор по-прежнему меняется от предложения к предложению, и метод не подталкивает модель к вариантам, которых она не рассматривала бы, вроде редких синонимов. Сам подход опубликован Google DeepMind в Nature в 2024 году и восходит к предложению Скотта Ааронсона 2022 года, с которым его объединяет общий принцип работы.

Никаких скрытых символов в текст не добавляется, для читателя ответ с водяным знаком неотличим от обычного. Этим ИИ-маркировка отличается от водяных знаков на банкнотах и в документах, которые видны глазом. Обнаружить закономерность может только тот, у кого есть кодирующий её ключ.

Google DeepMind не нашла статистически значимой разницы в оценках Gemini с водяным знаком

Во внутреннем тестировании Anthropic не зафиксировала влияния маркировки на содержание, уровень креативности и читаемость текста. В статье о SynthID-Text команда Google DeepMind раздавала модель с водяным знаком части трафика Gemini и сравнивала оценки «палец вверх» и «палец вниз»: статистически значимых отличий от версии без знака не нашлось. В контролируемом исследовании люди, сравнивавшие ответы попарно, разницы в качестве не увидели.

Проверка по ключу отвечает только на вопрос о вероятности того, что к тексту причастен Claude. Она не подтверждает, что текст написан человеком, и не распознаёт другую модель: у чужого водяного знака будет свой ключ, а возможно, и другой метод. На коротких фрагментах уверенность низкая и растёт вместе с длиной отрывка.

Плотность знака зависит от материала: на фактических фрагментах свободных вариантов мало, и в предложении о «Principia Mathematica» знаку не за что зацепиться. В коде, где вывод обычно должен быть точным, маркировка почти не применяется, оставаясь в основном в комментариях и почти не влияя на сам код.

Кодекс ЕС о прозрачности ИИ-контента подписали около 190 участников

Кодекс практики ЕС о прозрачности ИИ-контента Anthropic подписала в июле 2026 года вместе с несколькими другими крупными разработчиками моделей; всего у документа около 190 подписантов. Он требует от поставщиков ИИ-систем маркировать сгенерированный текст, и собственные водяные знаки внедряют другие разработчики. Знак Claude включается глобально, поскольку устойчивого способа ограничить его регионом у компании пока нет.

Для файлов поддерживаемых типов, включая .png, .jpg и .svg, применяется другой механизм: Claude добавляет в метаданные криптографически подписанную отметку C2PA о том, что файл создан или обработан с его участием. Содержимое файла при этом не меняется, отметку читает любой инструмент с поддержкой C2PA, свой Anthropic обещает предоставить.

Права на вывод и ответственность за него знак не меняет: он лишь помогает проверить, участвовал ли Claude в создании или обработке контента. Отличается он и от детекторов вроде Pangram: те ищут характерные обороты ИИ, поскольку доступа к ключу у них нет.

Что дальше Anthropic готовит API для проверки текста на водяной знак, детали реализации ещё прорабатываются, сроки запуска пока не названы. Для моделей, вышедших до 2 августа 2026 года, закон предусматривает переходный период: маркировку в них добавят в ближайшие месяцы. Компания также продолжает искать способ ограничить применение знака отдельными регионами и обещает сообщить о результатах.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.