anthropic

Знак того типа, что у Claude, стирает только пересборка

Claude News

Водяной знак в тексте нейросети держится на коротких окнах исходных формулировок: в открытых реализациях KGW и EXP после полного переписывания уцелевает около 0,5% таких окон, а точность детектора падает с почти стопроцентной до случайного угадывания. Замеры и разбор механики опубликовал Declaude.

Коротко

  • На каждом шаге генерации секретный ключ делит список кандидатов на зелёные и красные и слегка смещает выбор к зелёным, а окраску считает по короткому окну предыдущих слов.
  • Детектор пересчитывает долю зелёных слов вместо оценки стиля: без знака она держится около половины, а в учебной модели разбора с сильным смещением документ на 1500 слов даёт примерно 55%.
  • Запустить проверку может только держатель ключа: у Google для SynthID работает портал с ранним доступом, а в Anthropic говорят, что собственные инструменты проверки готовятся, срок не назван.

Проверка знака остаётся привилегией провайдера, и это меняет саму постановку спора об авторстве: значение имеет только тест по ключу, а коммерческие детекторы по стилю остаются угадыванием. Судя по описанной механике, устойчивого результата такая проверка даёт мало: знак фиксирует факт обработки моделью, а короткие и однозначные фрагменты вроде кода или цитат почти ничего не несут. Вероятно, поэтому спрос сместится к сервисам самих поставщиков.

Схема Кирхенбауэра 2023 года делит слова-кандидаты на зелёные и красные

Модель на каждом шаге выбирает следующее слово из короткого списка кандидатов с весами, и во многих местах несколько вариантов одинаково уместны. Ключ раскрашивает этот список, а вероятности слегка смещаются в сторону зелёных. Красное слово всё равно может выиграть, поэтому текст читается как обычный.

Раскраска не закреплена за словом навсегда: ключ выводит её из нескольких предыдущих слов, поэтому один и тот же кандидат оказывается зелёным после одного начала фразы и красным после другого. Положение слова в тексте ключу при этом не видно, накапливается только общий перекос в сторону зелёных.

У Google в SynthID смещения нет: несколько кандидатов тянутся из собственных вероятностей модели, ключ их оценивает, и турнирная сетка построена так, что в среднем по розыгрышам шансы каждого слова остаются прежними. Схема Аронсона, сделанная в OpenAI, выводит из ключа сами броски. По данным Anthropic, в размеченный текст ничего не добавляется, скрытых символов там нет, а лишних токенов и дополнительной платы разметка не требует.

После полного переписывания уцелевает около 0,5% окон

Окраска каждого слова считается по короткому окну предыдущих слов, поэтому позиция работает уликой только там, где кусок исходных формулировок сохранился целиком. Лёгкая правка и однопроходный пересказ знак разбавляют: в экспериментах Кирхенбауэра с соавторами детектор снова опознаёт даже человеческий пересказ примерно после 800 токенов, около 600 слов.

В замерах авторов разбора на открытых реализациях KGW и EXP поверх открытой модели после пересборки текста уцелело около 0,5% окон, а AUC детектора упал с 0,99 до примерно 0,5. Знаки, привязанные к самому слову без учёта соседей, держатся заметно лучше: у таких контекстно-независимых схем AUC остаётся в диапазоне 0,73–0,84.

Слабость контекстно-независимой раскраски в другом: при достаточном объёме выдачи её можно восстановить обратным разбором. Есть и знаки, спрятанные в смысле: пересказ с сохранением смысла сохраняет их частично, и единственный известный ответ здесь состоит в регенерации на уровне плана, где исходные формулировки не переиспользуются вовсе.

Google размечает текст Gemini с 2024 года, API остаётся задокументированным исключением

Google размечает текст в приложении и веб-интерфейсе Gemini с 2024 года; API на момент публикации разбора остаётся задокументированным исключением. С августа 2026 новые модели Claude ставят метку на уровне модели, ранние модели обещают подтянуть позже. С 2 августа ЕС требует от поставщиков ИИ, работающих на его рынке, размечать сгенерированный контент.

Найденная метка означает обработку моделью, а не авторство: в документации Anthropic отмечено, что метку получает и человеческий текст, который Claude только вычитал или перевёл. Обратное тоже слабо: чистый результат дают старые модели и тяжёлая правка, а короткие фрагменты и текст с единственным правильным продолжением, вроде кода, цитат и перечней фактов, несут слишком мало сигнала.

Когда появится проверка знака Claude

Инструменты проверки в Anthropic называют готовящимися, дата не объявлена; сроки переноса метки на ранние модели тоже не названы. Схема компании не раскрыта, поэтому прогнать тест на устойчивость против знака Claude снаружи пока нельзя, и опубликованные цифры относятся только к открытым реализациям. Разбор написал Джеймс Падольски в NOPE как сопровождение к declaude, а интерактивные схемы в нём заявлены как учебная модель с иллюстративными параметрами.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.