anthropic
Anthropic открыла проверку знака Claude
Claude News
anthropicAnthropic объявила о внедрении водяных знаков в тексты Claude по схеме, основанной на SynthID и предложенной Скоттом Ааронсоном в 2022 году. О деталях решения Ааронсон написал в блоге Scottaaronson, связав его появление с требованиями ЕС.
Знак встраивается статистически: модель меняет выбор токенов внутри множества сопоставимых по качеству вариантов, чтобы позднее подтвердить происхождение текста по одной последовательности токенов и ключу генератора.
Коротко
- Водяной знак предназначен для проверки происхождения текста Claude без доступа к исходному запросу или внутренним вероятностям модели.
- Статистический сигнал можно стереть переводом, перефразированием через открытую модель или удалением эмодзи после промежуточной генерации.
- Anthropic заявила, что обнаружение будет доступно всем, однако API для проверки пока остается в разработке.
Решение меняет практический статус технологии, которая несколько лет оставалась исследовательской идеей. Для разработчиков и образовательных организаций важен сам факт проверяемого происхождения, но устойчивость схемы ограничена: текст можно изменить так, чтобы исходный сигнал исчез. Вероятно, именно поэтому водяные знаки будут работать как дополнительный признак, а не как окончательное доказательство авторства.
Водяной знак работает на уровне статистики генерации
При обычной генерации языковая модель и так выбирает один вариант из огромного множества продолжений, которые могут быть близки по качеству. Схема Ааронсона заменяет часть случайности псевдослучайностью и слегка чаще выбирает определенные сочетания слов. Получившийся сигнал распределен по всему тексту и проверяется по последовательности токенов, без промпта и без доступа к вероятностям модели.
Ааронсон утверждает, что такой подход не обязан ухудшать заметным для пользователя образом качество ответа. Причина в том, что пространство приемлемых продолжений намного шире одного выбранного текста, поэтому небольшое статистическое смещение может оставаться внутри этого пространства. Крист, Ганн и Замир позднее усилили исходную конструкцию, добившись криптографической неразличимости, а последующие работы предложили новые улучшения.
Google внедрила близкую схему в текстовые модели Gemini
Google DeepMind уже реализовала похожий механизм в SynthID, который развернут во всех текстовых моделях Gemini. При этом компания существенно ограничила круг пользователей, имеющих доступ к обнаружению знака. По оценке Ааронсона, такое решение оказалось менее полезным для академических коллег, которым нужна проверка возможного использования ИИ студентами.
Anthropic, по словам Ааронсона, заявила о более открытой модели обнаружения, вероятно связывая решение с регулированием в ЕС. Компания сообщила, что проверка будет доступна любому желающему, но одновременно указала: API обнаружения еще дорабатывается. В Калифорнии ранее обсуждалось обязательное нанесение водяных знаков на материалы ИИ, однако принятый подход охватил аудиовизуальный контент и исключил текст.
OpenAI отказалась от внедрения схемы из-за продуктовых рисков
Ааронсон разработал свою схему осенью 2022 года, затем рассказывал о ней на выступлениях, в том числе в Anthropic. В OpenAI ее реализацией и тестированием занимался Хендрик Киршнер. Руководство OpenAI в итоге не одобрило запуск, опасаясь, что клиентам не понравится маркировка и они уйдут к модели без водяных знаков.
По словам Ааронсона, OpenAI теперь также предполагает последующее внедрение подобной функции. Одновременно он указывает на фундаментальное ограничение токеновых схем: сигнал можно удалить дополнительной обработкой. Перевод между английским и французским, вставка эмодзи с их последующим удалением или перефразирование открытой моделью способны разрушить статистический рисунок.
В качестве следующего направления Ааронсон называет семантические водяные знаки, работающие с векторами исходных понятий, а не с отдельными токенами. Такие методы уже показывают результат, хотя не имеют теоретических гарантий. Упомянутый им результат Барака и соавторов указывает, что при правдоподобных предположениях полностью надежной схемы водяных знаков для языковых моделей не существует. Пока в качестве первой линии проверки Ааронсон рекомендует Pangram, детектор ИИ, не основанный на водяных знаках.
API обнаружения остается незавершенным
Следующий практический этап зависит от того, когда Anthropic завершит API и какие ограничения установит для проверки. Источник не называет даты готовности интерфейса и не описывает окончательные параметры доступа. Поэтому объявление уже фиксирует направление продукта, но не дает готового инструмента для независимой проверки каждого текста Claude.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
