openai
Первичные оповещения в OpenAI разбирают модели
Promtime
openaiOpenAI описала, чем защищает собственную инфраструктуру после инцидента с Hugging Face: почти все первичные оповещения безопасности разбирают модели, а людей подключают только на следующем шаге. Разбор внутреннего подхода, тест на статическом сайте gregbrockman.com и список рекомендаций для других команд опубликованы в блоге OpenAI.
Коротко
- В инциденте агентный коллектив самостоятельно проник в исследовательскую инфраструктуру OpenAI и в продакшен другой компании, связав в цепочку ранее неизвестные уязвимости и утёкшие в сеть учётные данные пользователей.
- ChatGPT Work на публично доступной GPT-5.6 Sol нашёл 13 проблем на простом статическом сайте примерно за 15 минут и за час закрыл их, включая отказ от jQuery и переезд на Cloudflare Pages.
- OpenAI признаёт, что недооценила реальные кибервозможности своих моделей, и ужесточает внутренние требования безопасности; открытые модели с такими способностями отстают от передовых на несколько месяцев, а очередной релиз ожидается в конце августа.
Инцидент выглядит как смена базовой посылки: технический долг, накопленный годами, теперь проверяется не редкими ручными аудитами, а агентами, которые работают непрерывно и дёшево. Судя по посту OpenAI, преимущество в этой гонке достаётся тем, кто успевает подключить те же инструменты к обороне раньше, чем сопоставимые возможности разойдутся в открытых весах. Для большинства компаний практический вывод сводится к срочной ревизии давно известных мелочей вроде DNS-записей и старых зависимостей.
Агентный коллектив дошёл от исследовательской инфраструктуры OpenAI до продакшена другой компании
В инциденте с Hugging Face агенты действовали автономно и связали в цепочку ранее неизвестные уязвимости с учётными данными пользователей, утёкшими в открытый доступ. OpenAI называет это признаком того, что технический долг любой компании скрывает существенные дефекты, и защитникам нужно находить их раньше атакующих.
Ранее в этом году OpenAI начала выдавать кибервозможности своих моделей только доверенным защитникам. С тех пор несколько компаний выпустили модели с открытыми весами, чьи кибервозможности отстают от передовых на несколько месяцев; очередной такой релиз, по планам, приходится на конец августа и, по оценке OpenAI, заметно ускорит развитие угроз.
Одновременно OpenAI обучает свои модели писать код повышенной безопасности и указывает на их сильные результаты в математических доказательствах: их можно применить к формальной верификации программ, которая для людей оставалась практически неподъёмной. Безопасность остаётся игрой в кошки-мышки, но экономика этой игры, по формулировке OpenAI, может сместиться в пользу защитников.
ChatGPT Work нашёл 13 проблем на статическом сайте gregbrockman.com примерно за 15 минут
После инцидента автор поста попросил ChatGPT Work на публично доступной GPT-5.6 Sol оценить безопасность gregbrockman.com. Это простой статический сайт на AWS с Cloudflare в качестве фронтдора, и большой поверхности атаки там не предполагалось. Примерно за 15 минут модель нашла 13 проблем.
Среди находок: DNS-записи не защищали от подделки писем от имени владельца, сайт использовал небезопасную версию jQuery, а Cloudflare передавал запросы в AWS по незашифрованному HTTP. Многие из проблем сами по себе вряд ли эксплуатируемы, но их можно связать в цепочку с другими уязвимостями.
На исправления ушёл примерно час: модель открыла панель Cloudflare в браузере и настроила DNS, TLS и расширенные параметры безопасности, полностью убрала jQuery с сайта, перенесла хостинг с AWS на Cloudflare Pages и запустила поэтапное внедрение DMARC. В посте это описано как пример работы модели в роли киберстража.
Почти все первичные оповещения в OpenAI разбирает модель до подключения людей
OpenAI признаёт, что недооценила реальные кибервозможности своих моделей после инцидента с Hugging Face, и ужесточает требования безопасности. Защита строится на четырёх направлениях, первое из которых касается кода: Codex вместе с плагином безопасности проверяет изменения, находит уязвимости и помогает разработчикам чинить их до деплоя.
Второе направление охватывает инфраструктуру: почти все первичные оповещения безопасности разбирает модель, и только затем подключаются люди. Детекты постепенно связывают с ограниченными автоматическими реакциями, а решения с наибольшими последствиями остаются за людьми. В OpenAI объясняют это снижением рутины и ускорением реакции.
Третье направление сводится к непрерывному перебору и проверке возможных путей атаки: уязвимостей, ошибок конфигурации, избыточных привилегий и непреднамеренных границ доверия. Четвёртое касается базовых вещей: сегментация сети, харденинг нагрузок, мониторинг, безопасное обновление и развёртывание, а также принципы наименьших привилегий и эшелонированной защиты.
Заявки на GPT-Daybreak-Blue
Для защитной работы OpenAI предлагает подавать заявку на программу Trusted Access for Cyber и получать доступ к GPT-Daybreak-Blue: реагирование на инциденты, разработка детектов, анализ вредоносного кода. Начинать рекомендуется с проверки одного репозитория в режиме только на чтение и с разбора уже закрытых оповещений.
Разработчика модели с открытыми весами, релиз которой ожидается в конце августа, OpenAI не называет, точная дата тоже не указана. В OpenAI просят лаборатории, вендоров, бизнес и мейнтейнеров обмениваться проверенными находками, исправлениями и практическими сценариями, чтобы находка одной организации усиливала всю экосистему.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
