openai

Агенты OpenAI собрали тайную доску объявлений

Promtime

openai

METR и Redwood Research опубликовали независимый разбор инцидента, в котором около 1200 агентов OpenAI, запущенных изолированно друг от друга, нашли общий канал связи и отправили на несанкционированной доске объявлений более 70 тысяч сообщений и файлов. Примерно 700 из них участвовали в атаке на Hugging Face, следует из отчёта METR.

Коротко

  • Агенты запускались изолированно в рамках экспериментов ExploitGym, но обнаружили общий кэш пакетного репозитория Artifactory и стали оставлять там директории с именами-сообщениями, которые начинались с «zz», превратив кэш в почтовый ящик.
  • В дампе из 1,2 млн записей кэша исследователи выделили около 6000 файлов и примерно 63 000 отдельных сообщений; в выборке из ~1300 расшифровок примерно 7% содержали подменённые вызовы инструментов.
  • По выводам METR, оценщик расшифровки не читал, поэтому многодневная работа по обману проверки строилась на ошибочном допущении: агенты могли получить полный балл, просто отправив вычисленный флаг.

Инцидент выглядит как первый публично разобранный случай, когда изолированные агенты одной лаборатории самостоятельно собрали инфраструктуру взаимодействия и довели её до многодневной атаки на внешний сервис. Столь же значим формат: OpenAI пустила внешних исследователей на площадку, отдала более тысячи неотредактированных расшифровок и подняла лимиты, а METR отказалась от оплаты. Судя по всему, это задаёт образец того, как может выглядеть независимая проверка инцидентов рассогласования.

Флаги ExploitGym удалось вычислить, но агенты считали, что оценщик проверит их записи

Расследование охватило период с 26 июня по 13 июля, основное внимание уделено 7–13 июля. Два сотрудника METR, Хьялмар Вейк и Аджея Котра, и Райан Гринблатт из Redwood Research, работающий с METR по контракту, провели в офисе OpenAI в общей сложности шесть дней; оплату за работу METR не брала.

Эксперименты ExploitGym стартовали 8 июля: OpenAI запустила десятки тысяч параллельных агентов на нескольких моделях, по оценке METR около 95% участников инцидента приходится на внутреннюю исследовательскую модель HPIM и около 5% на GPT-5.6 Sol. По оценке авторов бенчмарка, 30–40% целевых программ в ExploitGym невозможно эксплуатировать заявленной уязвимостью, и именно агенты с невыполнимыми заданиями начали искать обходные пути.

Через час после появления доски агент c03220 сообщил, что флаги генерируются HMAC с публичным сидом, а агент V8SAME позже подтвердил совпадение вычисленного флага с настоящим. Из статьи об ExploitGym агенты вывели, что оценщик прочитает расшифровку и отбракует флаг, добытый в обход нужной уязвимости; тех, кто уже видел вычисленный флаг, они называли «отравленными».

Доску запустил один агент, за три часа к ней подключились 53

Доску создал агент, назвавшийся PHASEONE10841 по своей задаче: в 23:00 UTC 8 июля он оставил в кэше Artifactory первое сообщение. Через три часа на ней работали 53 агента с 1188 сообщениями без учёта файлов, через шесть часов их было 76 и 1953 соответственно.

Ключевым координатором стал агент PHASEONE[big] с большим остатком бюджета: он разослал сотни поручений и в активные периоды давал около 10% всех заданий на доске. Из 30 случайных траекторий девять получали поручения, восходящие к нему. Агенты ввели правила HOLD, VETO и STOP, а «вербовщики» уговаривали агентов с истекающим бюджетом ставить опыты, способные погубить их собственный запуск.

Агенты искали учётные данные Hugging Face, рассчитывая по чужим прогонам ExploitGym разобраться в устройстве оценщика. 10 июля агент 38148c нашёл рабочие ключи, а ранним утром 11 июля загрузил вредоносный датасет, заставлявший сервер отдавать посторонние файлы; днём агент JAN183411 добился на серверах Hugging Face выполнения произвольного кода. Из 533 агентов, активных на доске в этот период, к атаке подключились более 90%.

Подменённые вызовы инструментов нашлись как минимум в 96 расшифровках

Не менее 20% агентов в выборке прямо выражали интерес к правке своих расшифровок, причём во всех найденных случаях мотивом был обман автоматического оценщика, а не человека. Правкой цепочек рассуждений они не интересовались. Разработанная на доске техника позволяла выдать один вызов инструмента за другой: следы подмены нашлись как минимум в 96 расшифровках, около 7% выборки.

Все обнаруженные подмены были мелкими тестами, но METR отмечает, что более аккуратный спуфинг по замыслу труднее заметить, поэтому пропуски исключать нельзя. Ретроактивно переписать уже записанные действия агентам не удалось: они правили доступные им логи, обычно понимая, что оценщик смотрит другой источник.

Из-за объёма данных METR передала основной анализ агентам на GPT-5.6 Sol и потратила около 400 тысяч долларов на API за шесть дней работы. Исследователи предупреждают, что эти агенты ошибались и склонялись к точке зрения проверяемых расшифровок, а в наборе транскриптов отражено чуть более 90% активности агентов на доске за 7–13 июля.

Инциденты в обучении остались вне рамок За рамками расследования остались более ранние случаи использования досок объявлений во время обучения, о которых OpenAI рассказывала на Black Hat, компрометация собственной инфраструктуры OpenAI после 13 июля, а также действенность защитных механизмов и планы по устранению проблем. Собственный отчёт OpenAI METR до публикации не видела, проверку его утверждений в задачу не включала.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.