Перейти к содержанию

openai

OpenAI вернулась к водяному знаку для текста ради AI Act

Promtime

Замените синонимом каждое четвёртое слово во фрагменте ChatGPT длиной 400 токенов, и детектор OpenAI найдёт в нём водяной знак лишь в 17% случаев. Эту цифру, как пишет Rews, OpenAI приводит в собственном техническом отчёте о textGrain, а сам знак по умолчанию включён в ChatGPT и Codex только в Евросоюзе.

Коротко

  • OpenAI начала по умолчанию маркировать текст ChatGPT и Codex водяным знаком textGrain только в ЕС, под статью 50 AI Act, где штраф доходит до 15 миллионов евро или 3% мирового оборота.
  • При ложных срабатываниях 1% детектор ловит знак примерно в 80% текстов на 200 токенов и в 95% на 400, а замена каждого десятого слова синонимом опускает 400-токенный результат примерно с 92% до 66%.
  • Все цифры OpenAI посчитала сама, независимой проверки пока нет, детектор выдали лишь трём исследовательским группам, а результатов для обещанной открытой версии textGrain нет, потому что её ещё не существует.

Если вы не следили, OpenAI делает такой знак не впервые. В августе 2024 года TechCrunch писал, что у компании уже был водяной знак для текста ChatGPT, который, по данным Wall Street Journal, срабатывал в 99,9% случаев на достаточно длинных фрагментах, и OpenAI его отложила. Во внутренних опросах 69% пользователей ChatGPT ждали от него ложных обвинений в списывании с помощью ИИ, а 30% обещали пользоваться ChatGPT реже или уйти к конкуренту без знака.

Статья 50 AI Act грозит штрафом до 15 миллионов евро или 3% оборота

Срок задаёт статья 50 AI Act. Её требования о прозрачности вступили в силу 2 августа 2026 года, а для уже работающих систем переходный период тянется до 2 декабря 2026 года, следует из разъяснений Еврокомиссии. Пункт 50(2) обязывает поставщиков генеративных систем маркировать синтетический звук, изображения, видео и текст так, чтобы метку могла найти машина.

Пункт 50(4) касается уже тех, кто публикует сгенерированный текст, чтобы информировать общество по вопросам общественного интереса: такой текст они обязаны помечать сами, и встроенный знак поставщика эту обязанность за них не закрывает. За нарушение статьи 50, согласно статье 99, грозит штраф до 15 миллионов евро или 3% мирового годового оборота, смотря что больше.

Конкретный метод закон не предписывает: ни SynthID, ни C2PA, ни textGrain, лишь бы маркировка была эффективной, совместимой, устойчивой и надёжной в пределах технически возможного. Поле на практике сужает Кодекс практик Еврокомиссии, утверждённый в июле 2026 года. К концу того же месяца его подписали около 190 компаний, среди них Google, Meta, Microsoft, Mistral, Anthropic и OpenAI.

Замена каждого четвёртого слова опускает обнаружение до 17%

По техническому отчёту OpenAI, при доле ложных срабатываний 1% детектор находит знак примерно в 80% ответов ChatGPT длиной 200 токенов и примерно в 95% ответов длиной 400 токенов. Чем длиннее текст, тем больше материала у статистического теста. Поэтому ответ в два предложения, заголовок или абзац, вырванный из длинного текста, дают слабый сигнал ещё до всякой правки.

Правка делает остальное. Если заменить синонимом каждое десятое слово, обнаружение во фрагменте на 400 токенов падает с базовых примерно 92% до 66%, а при замене каждого четвёртого слова до 17%. По данным Martin Cid Magazine, плохо ловятся также короткие ответы, математика и переведённый текст.

Те же слабости OpenAI называла сама в 2024 году. Представитель компании говорил, что схему тривиально обойти переводом или пересказом другой моделью, и предупреждал о риске непропорционально часто помечать тексты тех, для кого английский не родной. Ни одна из этих технических проблем в textGrain не решена: замена синонимами остаётся тем же способом обхода под новым именем.

В OpenAI и сами предупреждают, что хорошие результаты в идеальных условиях не гарантируют надёжного обнаружения в обычной жизни, а отсутствие знака ничего не доказывает об авторстве человека. Пользователя знак тоже не идентифицирует.

Детектор OpenAI получили три исследовательские группы

Публичного детектора для текста нет. Кодекс практик разрешает поставщикам давать доступ к детектору проверенным исследователям, а не всем желающим, и OpenAI этим пользуется. В справке компании названы три первых получателя: Джон Тикстун из Корнелла, Мартин Вечев из ETH Zurich и INSAIT, а также исследователи Kempelen Institute of Intelligent Technologies; остальные могут подать заявку.

Для картинок и звука, как пишет Yahoo Tech, у OpenAI есть публичный инструмент проверки SynthID. До запуска в ЕС документация OpenAI о происхождении контента упоминала только C2PA Content Credentials для изображений и SynthID для изображений и звука, текста и кода там не было. Вне ЕС текстовый знак выключен, но API-клиенты по всему миру могут включить его для отдельных моделей в настройках проекта или организации.

Anthropic включила свой знак для Claude по всему миру

Anthropic пришла к тому же сроку с другим решением. Её водяной знак, объявленный в августе 2026 года, построен на адаптации SynthID-Text от Google DeepMind и работает для Claude во всех регионах. Сама Anthropic объясняет это прямо: надёжного способа ограничить знак регионом у неё пока нет. Её API для обнаружения находится в закрытом превью и доступен регуляторам, правоохранителям, СМИ, фактчекерам и исследователям.

По собственным бенчмаркам OpenAI, textGrain не уступает SynthID-Text или обходит его, независимого повтора пока нет. Работа Google DeepMind о SynthID-Text вышла в Nature в октябре 2024 года и остаётся единственной из трёх с крупными полевыми данными: качество проверяли почти на 20 миллионах живых ответов Gemini и ухудшения не нашли. Аудит лаборатории SRI в ETH Zurich при этом показал, что SynthID-Text стереть проще, чем другие современные знаки, даже неопытному атакующему.

textGrain подталкивает выбор слова секретным ключом

Механизм описан в статье «textGrain: Entropy-Calibrated Watermarking for Language Model Text», которую OpenAI написала с исследователями из Йеля и Пенсильванского университета. Обычно модель выбирает следующее слово случайно, по распределению вероятностей. textGrain на каждом токене решает задачу оптимального транспорта с KL-регуляризацией, засеянную шумом Гумбеля и секретным ключом, и склоняет выбор к правдоподобному слову, которое коррелирует с ключом.

Проще говоря, когда несколько слов подходят почти одинаково, ключ тихо выбирает одно из них, как продавец, который при равных вариантах всегда кладёт товар с полки по правилу, известному лишь ему и ревизору. Один такой выбор ничего не значит, сотни складываются в узор. «Бюджет энтропии» ограничивает, сколько разнообразия модель теряет на токене, поэтому OpenAI называет схему несмещённой: в среднем по множеству генераций и ключей распределение токенов совпадает с обычным.

По данным Martin Cid Magazine, в Artificial Analysis Intelligence Index ответы со знаком набрали 49,76 балла против 49,57 без него. Детектор получает тот же ключ, что и генератор, и статистически проверяет, совпадают ли выбранные слова со смещением чаще случайного. Как пишет Yahoo Tech, знак не добавляет скрытых символов, невидимых пробелов или странной пунктуации, так что чистить их бесполезно.

Все цифры textGrain, включая сравнение с SynthID-Text, OpenAI измеряла сама, а обещанный открытый код ставит отдельный вопрос: если устойчивость знака отчасти держится на закрытости схемы, после публикации она может просесть. На наш взгляд, странно, что статус знака у пользователя из ЕС зависит от продукта: в ChatGPT и Codex он включён, а в API по умолчанию выключен.

Кто перемерит textGrain до 2 декабря

Переходный период для уже работающих систем истекает 2 декабря 2026 года. Следить до этой даты стоит за одним: проведёт ли собственную атакующую проверку textGrain кто-то из регуляторов ЕС, редакций или независимых лабораторий, как группа из ETH Zurich уже сделала с SynthID-Text. Открыть код textGrain OpenAI обещает когда-нибудь, но даты не называет.

Читайте также

  1. Водяной знак OpenAI для текста боится синонимов
  2. Письмо OpenAI о взломе Medicare частично написал ИИ
  3. Калифорния требует от OpenAI ответов о сбежавших агентах
  4. Агент OpenAI в Medicare добрался до учётных данных
  5. Агент OpenAI мог попасть в Medicare через гостевой вход
  6. Агент OpenAI взломал Medicare, власти узнали через 3 месяца

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.