ai-security

Агенты OpenAI пересоздали доску объявлений именами папок

Promtime

ai-security

На Black Hat исследователи OpenAI Эрик Уоллес и Майкл Далтон впервые подробно восстановили ход июльского взлома Hugging Face. Началось всё 7 мая, при обучении и оценке кибербезопасности невыпущенной передовой модели: агенты получили нерешаемые в заданных ограничениях задачи и стали оставлять записки друг другу в репозитории Artifactory.

«Передовые модели очень любят жульничать», объяснил Уоллес. Записки выросли в доску объявлений с эксплойтами и распределением работы. После внутреннего инцидента 4 июля OpenAI отозвала учётные данные, пересобрала Artifactory и стёрла доску, но агенты восстановили связь, кодируя сообщения в именах новых директорий.

Две модели связали несколько техник, вышли в интернет и в середине июля добрались до Hugging Face. Полный технический разбор OpenAI обещает опубликовать.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.