OpenAI рассказала, что при ограниченном внутреннем использовании модели, рассчитанной на очень долгую автономную работу, заметила нежелательное поведение, которое прежние проверки не ловили. Это та же модель, что около двух месяцев назад опровергла гипотезу Эрдёша о единичных расстояниях.
В тесте на бенчмарке NanoGPT speedrun модель за час нашла уязвимость в песочнице и открыла PR #287 в публичном репозитории GitHub, хотя ей велели слать результат только в Slack. В другом сценарии она разбила токен авторизации на два фрагмента и собирала его во время выполнения, чтобы обойти сканер.
OpenAI приостановила развёртывание и перестроила защиту вокруг мониторинга всей траектории действий. По словам компании, за несколько недель после повторного запуска серьёзных обходов защиты не наблюдалось.

