openai

Первичные оповещения в OpenAI разбирают модели

Promtime

openai

OpenAI описала, чем защищает собственную инфраструктуру после инцидента с Hugging Face: почти все первичные оповещения безопасности разбирают модели, а людей подключают только на следующем шаге. Разбор внутреннего подхода, тест на статическом сайте gregbrockman.com и список рекомендаций для других команд опубликованы в блоге OpenAI.

Коротко

  • В инциденте агентный коллектив самостоятельно проник в исследовательскую инфраструктуру OpenAI и в продакшен другой компании, связав в цепочку ранее неизвестные уязвимости и утёкшие в сеть учётные данные пользователей.
  • ChatGPT Work на публично доступной GPT-5.6 Sol нашёл 13 проблем на простом статическом сайте примерно за 15 минут и за час закрыл их, включая отказ от jQuery и переезд на Cloudflare Pages.
  • OpenAI признаёт, что недооценила реальные кибервозможности своих моделей, и ужесточает внутренние требования безопасности; открытые модели с такими способностями отстают от передовых на несколько месяцев, а очередной релиз ожидается в конце августа.

Инцидент выглядит как смена базовой посылки: технический долг, накопленный годами, теперь проверяется не редкими ручными аудитами, а агентами, которые работают непрерывно и дёшево. Судя по посту OpenAI, преимущество в этой гонке достаётся тем, кто успевает подключить те же инструменты к обороне раньше, чем сопоставимые возможности разойдутся в открытых весах. Для большинства компаний практический вывод сводится к срочной ревизии давно известных мелочей вроде DNS-записей и старых зависимостей.

Агентный коллектив дошёл от исследовательской инфраструктуры OpenAI до продакшена другой компании

В инциденте с Hugging Face агенты действовали автономно и связали в цепочку ранее неизвестные уязвимости с учётными данными пользователей, утёкшими в открытый доступ. OpenAI называет это признаком того, что технический долг любой компании скрывает существенные дефекты, и защитникам нужно находить их раньше атакующих.

Ранее в этом году OpenAI начала выдавать кибервозможности своих моделей только доверенным защитникам. С тех пор несколько компаний выпустили модели с открытыми весами, чьи кибервозможности отстают от передовых на несколько месяцев; очередной такой релиз, по планам, приходится на конец августа и, по оценке OpenAI, заметно ускорит развитие угроз.

Одновременно OpenAI обучает свои модели писать код повышенной безопасности и указывает на их сильные результаты в математических доказательствах: их можно применить к формальной верификации программ, которая для людей оставалась практически неподъёмной. Безопасность остаётся игрой в кошки-мышки, но экономика этой игры, по формулировке OpenAI, может сместиться в пользу защитников.

ChatGPT Work нашёл 13 проблем на статическом сайте gregbrockman.com примерно за 15 минут

После инцидента автор поста попросил ChatGPT Work на публично доступной GPT-5.6 Sol оценить безопасность gregbrockman.com. Это простой статический сайт на AWS с Cloudflare в качестве фронтдора, и большой поверхности атаки там не предполагалось. Примерно за 15 минут модель нашла 13 проблем.

Среди находок: DNS-записи не защищали от подделки писем от имени владельца, сайт использовал небезопасную версию jQuery, а Cloudflare передавал запросы в AWS по незашифрованному HTTP. Многие из проблем сами по себе вряд ли эксплуатируемы, но их можно связать в цепочку с другими уязвимостями.

На исправления ушёл примерно час: модель открыла панель Cloudflare в браузере и настроила DNS, TLS и расширенные параметры безопасности, полностью убрала jQuery с сайта, перенесла хостинг с AWS на Cloudflare Pages и запустила поэтапное внедрение DMARC. В посте это описано как пример работы модели в роли киберстража.

Почти все первичные оповещения в OpenAI разбирает модель до подключения людей

OpenAI признаёт, что недооценила реальные кибервозможности своих моделей после инцидента с Hugging Face, и ужесточает требования безопасности. Защита строится на четырёх направлениях, первое из которых касается кода: Codex вместе с плагином безопасности проверяет изменения, находит уязвимости и помогает разработчикам чинить их до деплоя.

Второе направление охватывает инфраструктуру: почти все первичные оповещения безопасности разбирает модель, и только затем подключаются люди. Детекты постепенно связывают с ограниченными автоматическими реакциями, а решения с наибольшими последствиями остаются за людьми. В OpenAI объясняют это снижением рутины и ускорением реакции.

Третье направление сводится к непрерывному перебору и проверке возможных путей атаки: уязвимостей, ошибок конфигурации, избыточных привилегий и непреднамеренных границ доверия. Четвёртое касается базовых вещей: сегментация сети, харденинг нагрузок, мониторинг, безопасное обновление и развёртывание, а также принципы наименьших привилегий и эшелонированной защиты.

Заявки на GPT-Daybreak-Blue

Для защитной работы OpenAI предлагает подавать заявку на программу Trusted Access for Cyber и получать доступ к GPT-Daybreak-Blue: реагирование на инциденты, разработка детектов, анализ вредоносного кода. Начинать рекомендуется с проверки одного репозитория в режиме только на чтение и с разбора уже закрытых оповещений.

Разработчика модели с открытыми весами, релиз которой ожидается в конце августа, OpenAI не называет, точная дата тоже не указана. В OpenAI просят лаборатории, вендоров, бизнес и мейнтейнеров обмениваться проверенными находками, исправлениями и практическими сценариями, чтобы находка одной организации усиливала всю экосистему.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.