Перейти к содержанию

openai

Водяной знак OpenAI для текста боится синонимов

Promtime

Возьмите отрывок в 400 токенов и замените синонимами каждое десятое слово. Детектор OpenAI найдёт в нём водяной знак уже не в 92% случаев, а в 66%, а если заменить четверть слов, то лишь в 17%. Эти цифры OpenAI опубликовала сама в блоге OpenAI, когда рассказывала, как будет выполнять требование EU AI Act о машиночитаемой маркировке сгенерированного текста.

Коротко

  • В ближайшие недели OpenAI добавит невидимый водяной знак в подходящие ответы ChatGPT и Codex на всех тарифах, но только в Евросоюзе. В API по всему миру знак для отдельных моделей включают вручную.
  • Технология textGrain подмешивает статистический сигнал в выбор слов. При целевой доле ложных срабатываний 1% детектор находил знак примерно в 80% отрывков на 200 токенов и в 95% на 400, если речь о психологии.
  • Детектор публично не открыли из-за риска пропусков и ложных срабатываний, доступ получат одобренные исследователи и экспертные организации. На математике и после правки текста знак находится заметно хуже.

По данным сайта Еврокомиссии Shaping Europe’s digital future, статья 50 AI Act требует, чтобы аудио, картинки, видео и текст от систем ИИ маркировались в машиночитаемом формате. Там же описан Кодекс практики по прозрачности ИИ-контента: тот, кто его подписал, может ссылаться на его меры как на доказательство соответствия. К концу июля 2026 года его подписали около 190 организаций. Сама идея старше: основой водяных знаков для языковых моделей считаются работы Ааронсона и Кирхнера (2022) и Кирхенбауэра с соавторами (2023).

В ChatGPT и Codex знак включат только в ЕС, в API его включают сами клиенты

В ближайшие недели OpenAI добавит невидимый водяной знак в подходящие текстовые ответы ChatGPT и Codex для пользователей в Евросоюзе на всех тарифах. Глобальным умолчанием при запуске знак не станет. В OpenAI объясняют выбор региона тем, что так будет время поучиться на реальном использовании и отзывах.

С API иначе. Уже сейчас клиенты по всему миру могут сами включить знак для отдельных моделей, по умолчанию он выключен. По словам OpenAI, так каждый клиент сам решает, как маркировка сочетается с его обязательствами по прозрачности. В ближайшие недели знак обещают и для моделей OpenAI, которые доступны через облачных партнёров.

Заявки на доступ к детектору уже принимают и, в соответствии с Кодексом практики, рассматривают каждую отдельно. Детектор сообщает только, найден ли знак OpenAI, и не раскрывает ни пользователя, ни его промпты и переписку. Проверка картинок и аудио через openai.com/verify и Content Provenance API остаётся публичной.

Детектор находит знак в 95% отрывков по психологии на 400 токенах и заметно реже в математике

В своих сравнениях OpenAI получила, что textGrain не уступил другим протестированным подходам, включая SynthID для текста. Компания при этом оговаривается, что сильный результат в идеальных условиях не гарантирует надёжного обнаружения в повседневной жизни.

Детектор ошибается двумя способами: видит знак там, где его нет (ложное срабатывание), или пропускает настоящий (ложный пропуск). OpenAI проверяла его на ответах из датасета ELI5 при целевой доле ложных срабатываний 1%. На текстах вроде психологии знак нашёлся примерно в 80% отрывков на 200 токенов и примерно в 95% на 400.

С математикой хуже, потому что там у модели меньше свободы в выборе слов, и обнаружение, по словам OpenAI, существенно ниже. Точной цифры для математики в тексте анонса нет.

Второе слабое место связано с редактурой. На английских ответах ELI5 по 400 токенов замена 10% слов синонимами снизила обнаружение примерно с 92% до 66%, замена 25% до 17%. В OpenAI прямо связывают эти ограничения с решением пока не открывать детектор всем.

На восьми бенчмарках Astra разница со знаком и без не превышает 3,1 пункта

Качество OpenAI проверила на Astra, своей новой флагманской модели, в конфигурации max, и заметной разницы не увидела. В одних тестах версия со знаком чуть впереди, в других чуть позади. На DeepSWE v1.1 получилось 72,80% без знака и 71,68% со знаком, на GPQA Diamond 94,44% и 93,94%.

Сильнее всего результаты разошлись на Terminal-Bench 4.0 (53,90% без знака и 56,06% со знаком) и Terminal-Bench Science 0.1 (56,90% и 60,00%). Artificial Analysis Intelligence Index почти не сдвинулся: 49,57 и 49,76 пункта. AutomationBench дал 34,09% и 34,86%, BrowseComp 87,92% и 87,35%, HealthBench Professional 64,27% и 64,60%. В Testing Catalog по поводу этой таблицы заметили, что такое утверждение нужно проверить на практике.

textGrain прячет сигнал в выборе слов, и детектор ищет именно его

На каждом шаге языковая модель выбирает следующий токен из нескольких правдоподобных вариантов. По описанию OpenAI, textGrain слегка смещает этот выбор, и в тексте появляется невидимый статистический сигнал. Детектор ищет его и оценивает, есть ли в отрывке знак OpenAI. В обзорной работе на Arxiv описано, что так и устроены генеративные водяные знаки: сигнал встраивают через сэмплирование модели.

Представьте пианиста, который в импровизации чуть чаще берёт определённые ноты. На слух этого не заметить, но если записать час игры и посчитать ноты, перекос видно. Отсюда и слабости из тестов: в коротком отрывке мало материала для статистики, в математике почти не из чего выбирать, а синонимы стирают часть сделанных выборов.

Как пишет Nature, у альтернатив свои беды: если хранить весь сгенерированный текст, страдает приватность, а классификаторы постфактум нестабильны и чаще ошибаются, например, на текстах неносителей языка. Там же отмечают, что безошибочного метода нет ни у кого. Подробности textGrain OpenAI обещает в техническом отчёте, который дополнят в ближайшие недели, и планирует выложить технологию в открытый код.

Если знак не нашли, это не доказывает, что текст писал человек

OpenAI отдельно перечисляет, чего знак не сообщает. Он не измеряет вклад человека: может показать, что система OpenAI сгенерировала или обработала часть отрывка, но не скажет, сколько в него вложено правки и мысли. Он не определяет, кому принадлежит текст, законно ли его используют, нужно ли было раскрытие и кто за текст отвечает.

Знак не указывает на человека, организацию, аккаунт или промпт и не проверяет, правдив ли текст. Отсутствие знака не доказывает авторство человека: текст мог быть слишком коротким, отредактированным или переведённым, мог прийти от неподдерживаемой модели, появиться до запуска маркировки или быть написанным инструментами другой компании.

С картинками OpenAI работает в несколько слоёв. Content Credentials по стандарту C2PA записывают происхождение и историю файла, а невидимый SynthID в изображениях и аудио сохраняет сигнал, даже если метаданные удалили.

Слабое место видно в цифрах самой OpenAI: замена четверти слов синонимами далеко не самая изощрённая атака. Исследователи на Arxiv описывают атаку SIRA, которая, по их данным, почти в 100% случаев снимает знак у семи недавних методов за 0,88 доллара на миллион токенов, причём без доступа к алгоритму. На наш взгляд, странно, что OpenAI показывает устойчивость только к синонимам и не даёт цифр по переводу, хотя сама называет его проблемой.

Публичный детектор пока без даты

В ближайшие недели должны появиться знак в ChatGPT и Codex для ЕС, поддержка у облачных партнёров и обновлённый технический отчёт. Когда выйдет открытый код и когда детектор станет публичным, OpenAI не говорит. Доступ обещают расширить, когда результаты можно будет трактовать ответственно. Пока компания собирается изучать, как знак переживает правку и перевод, и как отличить помощь ИИ от текста, который ИИ написал целиком.

Читайте также

  1. Калифорния требует от OpenAI ответов о сбежавших агентах
  2. Агент Dots от OpenAI 8 раз из 8 выбрал один стек
  3. OpenAI советует не держать GPT-6 на максимуме рассуждений
  4. FTC потребует показаний от руководства Anthropic и OpenAI
  5. OpenAI дописала к MCP возможности специально для ChatGPT
  6. Подписку ChatGPT Plus и Pro пустили в сторонние приложения

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.