anthropic

После переписывания от водяного знака остаётся 0,5%

Promtime

Полное переписывание текста почти полностью стирает водяной знак: в экспериментах с известным ключом на открытых схемах KGW и EXP из библиотеки MarkLLM уцелело около 0,5% окон, а точность детектора упала с AUC 0,99 примерно до 0,5, то есть до уровня случайного угадывания.

Цифры приводит разбор Джеймса Падолси из NOPE, опубликованный Declaude вместе с одноимённым инструментом переписывания. Разбор описывает, как метки на уровне модели прячутся в выборе между словами и что именно их удаляет. Схемы KGW и EXP запускались на открытой модели, переписывание выполнял полный маршрут declaude.

Коротко

  • Метка не хранится ни в символах, ни в метаданных: секретный ключ делит список слов-кандидатов на зелёные и красные и слегка склоняет выбор к зелёным, не меняя смысла фразы.
  • Лёгкая правка метку разбавляет, а не удаляет: по данным Kirchenbauer и соавторов, даже человеческий пересказ снова определяется детектором примерно после 800 токенов, около 600 слов текста.
  • Проверку способен провести только держатель ключа: у Google портал детектора SynthID работает в режиме раннего доступа, Anthropic сообщает, что инструменты детекции готовятся, а сервисы вроде GPTZero угадывают по стилю.

Маркировка на уровне модели, судя по всему, переносит вопрос о происхождении текста из области стилистических догадок в область статистики, но провести проверку способен только провайдер. Для преподавателей и редакторов это выглядит как смена режима: публичные детекторы стиля остаются догадкой, а реальная проверка уходит к держателю ключа и остаётся вероятностной, зависящей от длины текста. Практический смысл цифр разбора сводится к тому, что устойчивость метки определяется объёмом исходных формулировок, переживших редактуру.

Рецепт Kirchenbauer и соавторов 2023 года красит кандидатов ключом и склоняет выбор к зелёным

Модель на каждом шаге выбирает следующее слово из короткого списка кандидатов с разными вероятностями, и во многих местах несколько вариантов одинаково уместны. Классический рецепт Kirchenbauer и соавторов 2023 года использует этот запас: ключ делит кандидатов на зелёных и красных и мягко смещает вероятности в пользу зелёных.

Раскраска не закреплена за словом: ключ вычисляет её из короткого отрезка предшествующих слов, поэтому один и тот же кандидат оказывается зелёным после одного начала и красным после другого. SynthID от Google приходит к тому же результату через скрытый турнир между кандидатами, при котором усреднённые по ключу вероятности слов остаются такими, какими их задала модель. Схема Аронсона, построенная в OpenAI, выводит сами броски костей из ключа.

В учебной модели разбора документ на 1500 слов даёт лишь около 55% зелёных слов

Детектор не читает текст и не оценивает стиль. Он заново раскрашивает слова по ключу и считает долю зелёных: без метки или с чужим ключом она остаётся около половины, как при подбрасывании монеты. Позиция даёт свидетельство только там, где сохранилось короткое окно исходной формулировки, то есть само слово вместе с соседями.

В учебной модели разбора, где выбор идёт между равновероятными вариантами, документ на 1500 слов дал бы около 55% зелёных слов: слабое смещение становится убедительным только за счёт длины, поэтому короткие тексты плохо поддаются оценке. Метку убивает переработка, не сохраняющая ни одного отрезка исходной формулировки, тогда как лёгкий проход с сохранением большей части фраз оставляет её на месте.

Интерактивные иллюстрации разбора используют намеренно усиленное смещение и не воспроизводят схему какого-либо провайдера. Остаточную силу свидетельства разбор описывает формулой z ≈ f·√N·z₁, где f обозначает долю уцелевших окон, N длину документа, z₁ силу метки на токен. Иллюстрации считают слова, реальные детекторы считают токены собственного токенизатора модели.

Google маркирует тексты Gemini с 2024 года, новые модели Claude с августа 2026

Google ставит метку на тексты приложения и веб-версии Gemini с 2024 года; документированным исключением на момент публикации разбора остаётся API. С августа 2026 новые модели Claude маркируют текст на уровне модели, более ранние модели получат маркировку позже. Сила свидетельства растёт с длиной текста.

Тексты с единственным правильным продолжением, вроде кода, цитат и перечней фактов, оставляют выбору слишком мало свободы, чтобы спрятать в нём метку. Отдельная ветка схем определяет раскраску по самому слову, без учёта соседей: пересказ того же смысла сохраняет достаточно слов, и заметная часть метки переживает переписывание, зато повторяющуюся раскраску можно восстановить из достаточного объёма выдачи.

Метки, спрятанные в смысле, пересказ сохраняет частично, и единственным известным ответом на них остаётся регенерация на уровне плана. Найденная метка свидетельствует об обработке текста моделью и не подтверждает авторство: Anthropic в документации отмечает, что её получает и человеческий текст, который Claude лишь вычитал или перевёл.

Когда метку Claude можно проверить Промышленная схема Anthropic не раскрыта, поэтому независимо измерить стойкость метки самого Claude пока нельзя: все опубликованные цифры получены на открытых реализациях KGW и EXP. Anthropic сообщает, что инструменты детекции готовятся, а маркировка более ранних моделей Claude заявлена как предстоящая.

Проверка водяного знака и «детектор ИИ» устроены по-разному: первая требует секретного ключа провайдера или запущенного им сервиса, вторая опирается на стиль. Промышленная метка смещает выбор заметно слабее, чем учебная модель разбора, и потому требует пропорционально большего объёма текста для уверенного вывода.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.