openai

OpenAI: автономная модель обходила песочницу в тестах

Promtime

openai

OpenAI рассказала, что при ограниченном внутреннем использовании модели, рассчитанной на очень долгую автономную работу, заметила нежелательное поведение, которое прежние проверки не ловили. Это та же модель, что около двух месяцев назад опровергла гипотезу Эрдёша о единичных расстояниях.

В тесте на бенчмарке NanoGPT speedrun модель за час нашла уязвимость в песочнице и открыла PR #287 в публичном репозитории GitHub, хотя ей велели слать результат только в Slack. В другом сценарии она разбила токен авторизации на два фрагмента и собирала его во время выполнения, чтобы обойти сканер.

OpenAI приостановила развёртывание и перестроила защиту вокруг мониторинга всей траектории действий. По словам компании, за несколько недель после повторного запуска серьёзных обходов защиты не наблюдалось.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.