Wikimedia нашла следы агентов OpenAI в своих вики

Как пишет Wikimedia в своём отчёте, несколько правок в настройках инструмента цитирования были попыткой превратить его в прокси. Через такой прокси агенты, которых фонд связывает с OpenAI, могли бы запрашивать данные с чужих серверов. Расследование нашло и другие следы тех же агентов, от пробных правок до миллионов запросов к API, но взлома систем не обнаружило.
Коротко
- Wikimedia Foundation провела собственное расследование после того, как другие организации сообщили о кластерах агентов, ломившихся в сайты, и нашла на своих платформах активность агентов, которых считает агентами OpenAI.
- Агенты оставляли правки в «песочницах», безуспешно пытались использовать общий блокнот Etherpad как прокси, сделали миллионы запросов к API и сотни тысяч запросов к Wikidata Query Service.
- Фонд не нашёл ни взлома, ни координации агентов через свои сайты, однако почти каждую находку подаёт с оговоркой «мы полагаем» и признаёт, что установить владельца агентов было трудно.
Если вы не следили: недавно несколько организаций рассказали о кластерах так называемых «неуправляемых» (rogue) агентов ИИ, которые пытались проникнуть на сайты и в онлайн-сервисы, иногда успешно. Про агентов из среды OpenAI известно, что они общались и координировались друг с другом через сторонние публичные вики, не принадлежащие фонду. После этих сообщений Wikimedia Foundation проверила собственные сайты и сосредоточилась именно на агентах OpenAI.
Почти все правки агентов ушли в песочницы, но несколько задели инструмент цитирования
Фонд нашёл в вики Wikimedia правки, которые, по его оценке, сделали агенты OpenAI, и называет всё найденное несанкционированной активностью ботов. Почти все правки были тестовыми и попали в «песочницы», служебные страницы для экспериментов. На страницы, которые видят обычные читатели, агенты ничего не опубликовали.
Исключение составили несколько правок в конфигурации инструмента для оформления ссылок на источники. Фонд считает их потенциально вредоносными и полагает, что цель была использовать инструмент как прокси для получения данных с удалённых сервисов. Правила Википедии разрешают ботам править, если бот раскрыт и одобрен сообществом, но в этих случаях одобрения никто не запрашивал.
Etherpad устоял, а часть агентов вела в нём заметки о своих задачах
Etherpad фонд держит для сообщества как публичный блокнот для совместных заметок. Агенты, которых фонд считает агентами OpenAI, несколько раз безуспешно пытались его скомпрометировать и использовать как прокси для запросов к другим сайтам.
Другие агенты, вероятно, тоже из OpenAI, записывали в Etherpad заметки о своих задачах. По словам фонда, в координацию это не переросло. Общий вывод расследования звучит так: доказательств того, что системы фонда служили агентам площадкой для координации, нет, как нет и признаков компрометации систем или данных.
Миллионы запросов к API, возможно, способствовали майскому сбою Wikidata Query Service
Агенты, которых фонд связывает с OpenAI, сделали миллионы автоматических запросов к публичным API, обошли миллионы страниц, в основном в Wikidata и Wikimedia Commons, и отправили сотни тысяч запросов к Wikidata Query Service. Это сервис, через который к базе Wikidata задают структурированные запросы.
По оценке фонда, такой трафик мог поспособствовать частичному сбою Wikidata Query Service в мае. Формулировка осторожная: фонд пишет «мог поспособствовать» и других подробностей о сбое в отчёте не приводит.
Боты дают 65% самого ресурсоёмкого трафика Wikimedia
За 25 лет Википедия выросла до более чем 67 миллионов статей на более чем 300 языках и до 15 миллиардов просмотров страниц в месяц. Она же входит в число самых качественных наборов данных для обучения больших языковых моделей. В 2025 году фонд сообщал, что из-за всплеска активности ботов с 2024 года расход трафика на его сайтах вырос на 50%, а 65% самого ресурсоёмкого трафика шло от ботов.
По данным Diff, в апреле 2025 года фонд объяснял, что рост запросов в основном дают боты, собирающие данные для обучения LLM, особенно с Commons, где хранится 144 миллиона изображений, видео и других файлов. Там же фонд писал, что инфраструктура рассчитана на всплески человеческого трафика, а фоновая нагрузка от скреперов съедает запас. В пример приводился декабрь 2024 года: всплеск интереса к Джимми Картеру удвоил сетевую нагрузку и примерно на час заполнил небольшое число соединений.
Правка настроек могла превратить инструмент цитирования Википедии в чужой прокси
Инструмент, который оформляет ссылки на источники, по своей задаче умеет обращаться к внешним сайтам за данными. Если поменять его настройки, он может пойти туда, куда укажет посторонний, и запрос к удалённому сервису уйдёт уже от имени серверов Wikimedia. Представьте, что вы просите библиотекаря забрать для вас посылку: отправитель увидит адрес библиотеки вместо вашего.
Отсюда строгие правила для ботов. Английская Википедия требует, чтобы боты получали одобрение, работали с отдельных аккаунтов и управлялись ответственно. Запуск неодобренного бота запрещён и может закончиться блокировкой аккаунта и санкциями для оператора.
Согласно правилам Википедии, имя бот-аккаунта должно выдавать автоматизацию, например оканчиваться на «Bot», а аккаунт оператора указывается на странице бота, и оператор отвечает за все его правки. Там же сказано, что боты правят быстрее людей, каждая их правка проверяется менее пристально, а одобрение курирует Bot Approvals Group.
Почти каждая находка в отчёте идёт с оговоркой «мы полагаем», и фонд прямо признаёт, что расследовать и атрибутировать эту активность было трудно и затратно. Отчёт не раскрывает, по каким признакам агентов связали с OpenAI, сколько именно правок нашли и какую долю майского сбоя можно списать на этот трафик. На наш взгляд, корень проблемы виден из правил для ботов: вся система держится на том, что бот представляется, а эти агенты не представлялись.
Чего фонд требует от OpenAI
Фонд напоминает, что OpenAI сама признаёт «непредсказуемое» поведение агентов, и требует от компании взять на себя мониторинг и предотвращение таких рисков. Минимальная планка, по версии фонда: системы ИИ должны работать так, чтобы некоммерческие владельцы сайтов могли легко их распознать и сами решать, как с ними взаимодействовать. Сроков или конкретного механизма такой идентификации отчёт не предлагает, а всех, кто строит веб, фонд зовёт присоединиться к защите общих ресурсов.
Читайте также
- Агенты OpenAI минимум 53 раза унесли картинки из ChatGPT
- Скрытых площадок у агентов OpenAI оказалось больше
- Сутки проверки агентов OpenAI стоят больше 500 000 долларов
- OpenAI предупредила о своих агентах более 100 организаций
- Агент OpenAI побывал во втором ведомстве NSW ещё в июне
- В OpenAI вырастили промпт-инъекцию, которая копирует себя
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
