anthropic
Текст Opus 5 вычисляют подсчётом четвёрок букв
Promtime
anthropicАвтор блога Atomic14 собрал детектор текстов Claude Opus 5, который смотрит только на доли четырёхбуквенных сочетаний и на четырёх авторах, отложенных до начала обучения, даёт ROC AUC 0,925. Поводом стал водяной знак Anthropic: со 2 августа 2026 года вывод новых моделей Claude маркируется статистически, обнаружить метку можно только с секретным ключом, а перечень маркируемых продуктов описан на страницах поддержки.
Коротко
- Детектор выбрасывает из текста всё, кроме букв, включая пробелы, приводит остаток к нижнему регистру, считает четырёхбуквенные последовательности и подаёт нормированные доли по 60 211 признакам линейному методу опорных векторов.
- Перебор длины последовательности от одного до восьми символов дал максимум на пяти символах (0,912), но выбраны четыре (0,906): 60 211 признаков против 214 949 и выигрыш на всех длинах усечённого текста.
- Версия, обученная без «формального» переписывания, оценивает формальные тексты Claude как более человеческие, чем оригиналы людей: ROC AUC 0,153, то есть незнакомый стиль обходит проверку целиком.
Водяной знак Anthropic проверяется только держателем ключа, и для всех остальных вопрос авторства остаётся статистическим. Эксперимент показывает, что часть работы делается стандартными инструментами: счётчик n-грамм и линейный классификатор из scikit-learn, без всякого понимания текста. Одновременно он очерчивает границу: детектор, судя по всему, реагирует на конкретную стилистическую правку, которой обучен, и смещается вместе с набором инструкций. Это делает надёжность такого подхода вопросом набора стилей в обучении, а не сложности модели.
Корпус составили 519 отрывков 26 авторов, изданных до 2021 года
Человеческую часть собрали из трёх источников: 180 отрывков из книг Project Gutenberg, изданных до 1929 года, 160 записей из Blog Authorship Corpus за 2004 год и раньше, 179 новостных текстов из CC-News за 2016–2019 годы. Порог 2021 года выбран как гарантия того, что тексты написаны до появления ChatGPT.
Машинную часть получили переписыванием: для каждого человеческого отрывка Claude Opus 5 просили пересказать его с сохранением смысла, детализации и примерной длины. Инструкций было три: «ясный естественный английский», «простой прямой современный английский» и «формальный точный регистр». Всего через batch API получилось 1557 переписываний.
Отдельно Claude написал отрывки с нуля на те же темы, и их полностью исключили из обучения, оставив как проверку, не участвовавшую ни в одной из версий модели. Внутри каждой пары тема, факты и длина совпадают, поэтому единственное, что отличает тексты, это манера письма.
На отложенных авторах ROC AUC 0,925, на кросс-валидации 0,906
Разбиение делалось по авторам, а не по отрывкам: во втором случае классификатор учится узнавать конкретных писателей, что не является целью. Четырёх авторов из 26 отложили до начала работы и оценили один раз в конце, и близость двух чисел показывает, что модель не запоминала авторов.
На 175 записях личного блога автора за 2006–2022 годы медиана оценки составила 0,09, порог 0,8 превысили 2% текстов. Восемь отрывков, написанных Claude Opus 5, получили медиану 0,85, и 63% из них оказались выше 0,8. Шкала идёт от нуля до единицы, где больше означает ближе к Claude.
Бенчмарк RAID содержит шесть миллионов отрывков от 11 генераторов в восьми предметных областях. По 320 его промптам Claude Opus 5 написал ответы, которые сравнили с 320 исходными человеческими документами: 0,889. Тексты, написанные с нуля на темы четырёх отложенных авторов, набрали 0,977.
Сильнейшие признаки указывают на смену слоя лексики
На трёхсимвольных признаках в сторону Claude тянут окончания -ing, наречные -ely и -tly, «that», «though» и «through», а также «Ive», то есть «I've» без апострофа. В сторону человека работают «which», «not», «but», «will», «was», окончания -tion и -ation, «of the» и «of a», а также полностью выписанные «I am» и «I will». Даже 28 признаков, то есть частоты отдельных букв, дают 0,651.
Сравнение букв внутри пар показало, что при инструкции plain у Claude чаще встречаются g, h, l, r, n, y и реже i, s, o, f, m, c; при direct чаще g, h, w, k, l, y и реже i, c, f, e, s, m. Как следует из разбора, это сдвиг от латинско-французского слоя лексики к германскому ядру английского.
Для инструкции formal каждая буква поменяла сторону: чаще c, e, r, i, n, p, реже h, w, k, l, o, g. На уровне слов латинские окончания встречаются чаще, средняя длина слова растёт, тогда как в переписываниях plain она почти не меняется.
Пределы детектора на Opus 5 Модель обучена на одном целевом наборе, текстах Claude Opus 5, и версия без формальных переписываний заметно теряет на RAID: 0,794 против 0,889. Автор считает, что добавление новых стилей сделало бы детектор ещё более общим, но признаёт: стиль, которого не было в обучении, обходит проверку. Веб-версия работает в браузере, текст не покидает машину, поддержка других моделей и провайдеров не заявлена.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
