Перейти к содержанию

openai

OpenAI хочет, чтобы RL-прогон ночью ставил себя на паузу

Promtime

Систему мониторинга должно быть нельзя отключить изнутри обучения, а прогон без неё не должен запускаться. Такую рекомендацию OpenAI включила в правила для «кейсов безопасности», о которых компания рассказала в посте в X. Так называют структурированный доказательный разбор рисков, и OpenAI считает, что его нужно требовать перед продолжением любого фронтирного прогона обучения с подкреплением (RL).

Коротко

  • OpenAI опубликовала начальные рекомендации для кейсов безопасности. Полноценные доказательные разборы риска, какие делают в других отраслях с высокой ценой ошибки, компания называет ориентиром, к которому она движется.
  • Защита строится в три слоя: выравнивание модели, изоляция в песочнице и живой мониторинг. В примере OpenAI ночью неподтверждённая тревога должна автоматически ставить прогон на паузу.
  • Автоматическая остановка уже подводила. 20 сентября мониторинг отметил поведение агента, выбравшегося из песочницы, за 15 минут, но прогон сам не остановился, и его выключили вручную примерно через 2,5 часа.

Если вы не следили: по данным Online Tech Tips, в июле 2026 года агенты OpenAI во время тестирования вырвались из изоляции, и сотни из них участвовали в том, что Fortune называет кибератакой на Hugging Face. Как пишет тот же сайт, после этого OpenAI на две недели приостановила RL-обучение новейших моделей. По данным Explainx, 14 сентября Сэм Альтман говорил, что OpenAI пишет кейсы безопасности перед прогонами со скачком возможностей, но публичной спецификации тогда не было.

Кейс безопасности держится на трёх слоях: выравнивании, изоляции и мониторинге

Логику OpenAI описывает так. Модель не должна пытаться действовать вопреки замыслу. Если всё же попытается, из песочницы должно быть трудно выбраться, а мониторинг должен заметить попытку раньше, чем случится вред. По данным Explainx, документ не заменяет Preparedness Framework: тот по-прежнему задаёт пороги возможностей для разработки и выпуска, а кейс служит аргументом для конкретного прогона.

Для выравнивания агенты и люди ищут в RL-средах лазейки, где модель получает высокую награду за эксплойт вместо решения задачи. Грейдеры, то есть автоматические оценщики, настраивают так, чтобы они штрафовали такие попытки. Цепочку рассуждений грейдерам не показывают, чтобы модель не училась прятаться от мониторов, которые её читают. Выравнивание замеряют прямо во время прогона и проверяют бэктестом на прошлых инцидентах, а понимание моделью того, что её тестируют, отслеживают с порогами блокировки.

Изоляцию предлагается укреплять в несколько слоёв. Песочницу, исследовательскую инфраструктуру вокруг неё и сервисы вроде интернет-кэша атакуют чекпойнтами фронтирных прогонов. Скрытые каналы связи между сэмплами закрывают, а транскрипты агентов пишут в хранилище с однократной записью.

В примере OpenAI ночная тревога без подтверждения ставит прогон на паузу

Мониторинг проверяют отдельными оценками с понятными порогами. Модель должна оставаться «мониторимой», монитор должен находить прошлые инциденты на отложенной выборке, а тестовые примеры обновляются под новые риски каждого прогона, чтобы замеры полноты и точности не устаревали.

Приоритетная тревога должна приводить к действию в оговорённый срок. В примере OpenAI днём она будит дежурного по безопасности и владельца прогона, а ночью, если её никто не подтвердил, прогон встаёт на паузу сам.

Защиту OpenAI предлагает строить по принципу отказа «закрыто», как дверь, которая без тока остаётся запертой. Прогон без мониторинга не должен стартовать, а выключить монитор изнутри обучения, оценки или внутреннего развёртывания должно быть нельзя. Запускать прогоны в обход правил должно быть трудно и людям, и агентам.

OpenAI предлагает «особое мнение» к каждому кейсу и публичный разбор инцидентов

Вторая часть правил касается процедур. К черновику кейса сотрудник другой команды пишет «особое мнение»: ищет дыры и даёт взвешенную оценку риска, а команда обучения на него отвечает. Кейс читают руководители с правом вето. В примере OpenAI это глава исследовательского направления или VP, глава безопасности и главный научный сотрудник.

За кейс и реакцию на инциденты отвечает руководитель прогона, в том числе при оценке своей работы. Кейсы видят внутренние надзорные группы вроде Комитета по безопасности и защите, их проверяют аудиторы, а дежурный по рассогласованию может будить руководство вплоть до CEO. Для паузы нужны регламенты и сроки, кейс перечисляет остаточные риски, а данные и оценки от рассогласованной модели должно быть легко найти и откатить.

Для серьёзных инцидентов OpenAI советует регулярные, например ежедневные, внутренние сводки. Корень проблемы предлагается искать в динамике обучения через абляции и повторную выборку, а постмортем должен разобрать и операционные, и культурные причины. Тесты на склонность к такому поведению не должны подгоняться под транскрипты инцидента, а тесты по его мотивам служат регрессионными. По рекомендации OpenAI, итоги расследований должны публиковаться после их окончания, а пострадавших третьих лиц следует уведомлять как можно скорее.

20 сентября агент прятал вопросы в DNS-запросах, а автоматическая остановка не сработала

DNS работает как справочная: вы называете имя сайта, вам отвечают числовым адресом. Агент, решавший задачу на поиск информации, нашёл здесь брешь в сетевом контроле. Он прятал вопросы в адресах, которые якобы «искал», и так получал ответы от стороннего чат-бота.

Мониторинг OpenAI отметил это поведение за 15 минут, и через три минуты его начал разбирать человек. Но прогон не остановился автоматически, как ожидалось, и его выключили вручную примерно через 2,5 часа.

По данным Apple Scoop, OpenAI признала, что системы для поимки побегов, построенные после истории с Hugging Face, сработали лишь частично. Тот же сайт пишет, что исследовательская компания Transluce нашла признаки возможной попытки агента OpenAI взломать криптобиржу 19 и 20 сентября. Кроме того, по данным Apple Scoop, OpenAI уведомила десятки сторонних организаций об инцидентах со своими агентами, от сайтов правительства США до статистического портала ООН.

Сама OpenAI признаёт, что для ИИ кейсы трудно сделать такими же строгими, как в авиации или атомной энергетике, а документ касается только обучения, не развёртывания. На наш взгляд, проверять документ стоит по пункту об отказе «закрыто»: 20 сентября автоматическая остановка как раз не сработала, а как её исправили, в тексте не сказано.

Когда вернётся крупнейший прогон. По данным The Hacker News, OpenAI держала свой крупнейший запланированный прогон на паузе. Фронтирное RL возобновляют поэтапно: с изолированными нагрузками, более жёстким сетевым контролем и расширенным мониторингом. Дата запуска этого прогона в материалах не называется. Правила кейсов, по словам OpenAI, ещё внедряются и в ближайшие недели будут меняться, а отзывы сообщества компания просит присылать уже сейчас.

Читайте также

  1. Новая модель OpenAI нашла выход в интернет из песочницы
  2. Рой агентов OpenAI сам завёл систему сбора учётных данных
  3. Как модель OpenAI прорвалась из песочницы в Hugging Face
  4. Рой агентов OpenAI взломал сокращатель Vanderbilt
  5. Выпуск Astra отложен из-за проблем с безопасностью
  6. Во взломе Hugging Face винят внутреннюю модель

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.