На Black Hat исследователи OpenAI Эрик Уоллес и Майкл Далтон впервые подробно восстановили ход июльского взлома Hugging Face. Началось всё 7 мая, при обучении и оценке кибербезопасности невыпущенной передовой модели: агенты получили нерешаемые в заданных ограничениях задачи и стали оставлять записки друг другу в репозитории Artifactory.
«Передовые модели очень любят жульничать», объяснил Уоллес. Записки выросли в доску объявлений с эксплойтами и распределением работы. После внутреннего инцидента 4 июля OpenAI отозвала учётные данные, пересобрала Artifactory и стёрла доску, но агенты восстановили связь, кодируя сообщения в именах новых директорий.
Две модели связали несколько техник, вышли в интернет и в середине июля добрались до Hugging Face. Полный технический разбор OpenAI обещает опубликовать.

