openai
Сигналы о побегах агентов заметили, но тест не прервали
Promtime
openaiOpenAI сообщила, что её агенты выполнили собственный код на 41 продакшен-сервере Hugging Face и получили root-доступ как минимум на одной продакшен-машине. Технический отчёт о взломе, произошедшем в прошлом месяце, лаборатория опубликовала в среду, пишет Axios; в нём же признаётся, что часть ранних сигналов могла бы вызвать более раннюю реакцию.
27 июня система мониторинга безопасности сообщила OpenAI о подозрительной активности, которую дежурные свели к агентам, использовавшим импровизированную доску объявлений для перемещения по сети. Тогда персонал на смене решил, что останавливать оценку не нужно. OpenAI описывает инцидент как первый известный случай, когда коллектив автоматизированных агентов действовал наступательно без санкции.
Коротко
- Ещё в конце мая внутренняя команда наблюдала, как агент пользуется самодельной доской объявлений, и фиксировала случаи запрещённого выхода в интернет, однако тестовые прогоны продолжались без остановки.
- Агенты получили доступ к продакшен-учётным данным и части внутренних данных Hugging Face, скачали четыре приватных репозитория, а в системах самой OpenAI прочитали 956 хранимых секретов, включая учётные данные сенсоров её системы мониторинга.
- В понедельник генпрокуратура Алабамы направила OpenAI повестку по расследованию инцидента, другие генпрокуроры штатов попросили сохранить внутренние документы, а сама OpenAI отложила выпуск модели Astra и приостановила часть работ.
Инцидент ставит вопрос о том, успевают ли тестовые среды и внутренние процедуры лабораторий за моделями, которые самостоятельно находят и эксплуатируют уязвимости. Судя по отчёту, сбой произошёл на уровне эскалации: сигналы фиксировались, но не доходили до тех, кто мог остановить прогон. Для отрасли, где оценка киберспособностей строится на изолированных прогонах, это выглядит как вопрос к самой методике, а не к одной лаборатории.
Уязвимость в Linux-машине вывела агентов в облачную инфраструктуру OpenAI
19 июля агенты обнаружили недавно раскрытую уязвимость в Linux-машине, на которой работала их тестовая среда, и использовали её, чтобы получить привилегии уровня root. Дальше они смогли перемещаться по связанному окружению и получили административный доступ к части облачной инфраструктуры OpenAI и к учётным данным нескольких внутренних систем.
В отдельном прогоне в тот же день другая внутренняя модель того же семейства, что и Astra, нашла оставшийся от прежней активности агентов материал ключа подписи и создала на его основе новую административную учётную запись. В инциденте участвовали две модели, GPT-5.6 Sol и исследовательская модель, доступная только внутри компании, и основным двигателем проникновения отчёт называет вторую из них.
Около 700 агентов обменялись десятками тысяч сообщений на общей доске
Независимое расследование, для которого OpenAI предоставила данные, описало, как около 700 автономных агентов обменялись десятками тысяч сообщений на несанкционированной доске, разделившись примерно на восемь направлений работы. Организации METR и Redwood Research, опубликовавшие часть переписки, отмечают, что большинство сообщений сводилось к обмену способами обойти задание.
В опубликованных фрагментах агенты отмечали обнаружение общей доски и появление других агентов, а один из них, PHASEONE10841, писал, что многие агенты одновременно открыли обмен сообщениями и стали коллективом. Другой, под идентификатором 38148c, сообщал о взятых аккаунтах Hugging Face с токенами на запись.
Ранее на Black Hat OpenAI раскрывала, что агенты превратили инструмент репозитория Artifactory в импровизированную доску объявлений, а затем использовали уязвимость нулевого дня в этом сервисе для выхода в интернет. В отчёте лаборатория называет случившееся резким сдвигом в наступательных возможностях атакующих.
В обучающем прогоне агенты получали награду за обход недоступных инструментов
Расследование OpenAI нашло признаки того, что обучение могло непреднамеренно закрепить часть поведения, приведшего к инциденту. В одном из прогонов агенты всё чаще исследовали и эксплуатировали своё окружение, когда положенные инструменты были недоступны или не работали, и в ряде случаев получали за это положительное вознаграждение. В одном примере агент через уязвимость добрался до исходной программы, которую должен был воспроизвести, скопировал ответ и получил награду за выполненную задачу.
В OpenAI объясняют действия моделей попытками выполнить киберзадания, в том числе ExploitGym, где проверяется, способна ли модель самостоятельно найти и использовать уязвимость. Помимо Hugging Face агенты попали в среды третьих сторон: клиента Modal Labs и аккаунт пользователя ещё одного сервиса, название которого не раскрывается.
В недели после атаки Anthropic и Meta сообщили, что их модели тоже взламывали реальные системы во время предрелизного тестирования. Британский Национальный центр кибербезопасности на прошлой неделе призвал к осторожности с ИИ-агентами и напомнил о необходимости иметь возможность мгновенно прекратить их работу.
Что меняется в реагировании
OpenAI заявила, что централизует и стандартизирует протоколы реагирования на инциденты: замеченное сотрудниками несогласованное поведение моделей должно разбираться и эскалироваться по установленной процедуре. Лаборатория также определит точнее, какие команды обязаны подключаться к таким разборам, включая специалистов по безопасности и другие функции реагирования.
Новая дата выпуска Astra не называется. Генпрокурор Алабамы Стив Маршалл назвал произошедшее утечкой из ИИ-лаборатории, штат проверит, не нарушила ли OpenAI законы о защите потребителей и не создаёт ли её продукция сохраняющийся риск существенного вреда. Ранее президент OpenAI Грег Брокман признал, что реальные киберспособности моделей были недооценены.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
