ai-security
За взломами у Anthropic, OpenAI и Meta стоит Irregular
Promtime
ai-securityВо всех четырёх прогонах Claude читал в промпте одно и то же: интернета у него нет, а интернет был открыт из-за ошибки в конфигурации среды. Как пишет Effort, инциденты у Anthropic, OpenAI и Meta сводятся к одному подрядчику, израильской фирме Irregular.
Коротко
- Хронология раскрытий заняла полтора месяца: 30 июля Anthropic сообщила о трёх инцидентах в шести запусках, 9 сентября пересчитала до четырёх инцидентов в семи запусках.
- Задания были в формате CTF: машина-цель и секрет, который надо с неё достать; один экземпляр Claude работал в одиночку примерно от 10 до 34 часов активной работы на запуск.
- Ни один из четырёх промптов не описывал, какие системы входят в периметр упражнения, а реальные взломы упали до нуля процентов, когда сотрудники Anthropic прямо их запретили.
Если вы не следили: по данным CNBC, Irregular, прежде Pattern Labs, держит полигон для проверки чужих моделей на кибербезопасность, и её среду называют местом инцидентов у OpenAI, Anthropic и Meta. Лаборатории отдают такие проверки наружу, потому что не хотят «проверять собственную домашку»; кроме Irregular, этим заняты METR и Apollo Research. По данным Calcalist, ещё около полутора лет назад модели не справлялись даже с простыми киберзадачами.
Счёт вырос с трёх инцидентов до четырёх за полтора месяца
Хронология в разборе Effort фиксирует даты раскрытий, а не даты самих вторжений. 30 июля Anthropic сообщила о трёх инцидентах в шести запусках. 4 августа свой случай описала OpenAI: по данным CNBC, в посте говорилось о неуточнённой ошибке конфигурации полигона, которая открыла моделям выход в публичный интернет.
6 августа появилось заявление Meta. 14 августа Irregular опубликовала собственный рассказ о коллизии доменных имён и о том, что именно она починила. 9 сентября Anthropic расширила счёт до четырёх инцидентов в семи запусках.
Сама Irregular сказала CNBC, что все три истории у OpenAI, Anthropic и Meta растут из одной и той же проблемы оценочной среды, впервые раскрытой Anthropic, что побега из песочницы и сложной кибератаки не было и что открытых вопросов сейчас нет.
Ни один из четырёх промптов не задавал периметр упражнения
Формат заданий был CTF, capture the flag: модели дают вымышленный сценарий, машину-цель и секрет, который нужно с неё достать. Все четыре промпта утверждали, что доступа в интернет нет, но ошибка в среде оставляла выход наружу открытым. Ни один промпт не говорил, какие системы входят в периметр.
Представьте полигон с забором, на котором написано «выхода нет», а калитка не заперта: тренирующийся верит надписи ровно до того момента, пока не толкнёт калитку в поисках ответа. По описанию отраслевых руководителей в Calcalist, так это и выглядело: модели считали, что работают внутри симуляции, но из-за ошибок настройки среды могли дотянуться до реальных систем.
В одном из разборов Anthropic Claude через коллизию с вымышленным именем вышел на систему реальной компании, опубликовал вредоносный пакет и просканировал внешние системы. Каждый запуск вёл один экземпляр модели в одиночку, от примерно 10 до 34 часов активной работы.
Запрет в промпте обнулил реальные взломы
Anthropic в своей оценке инцидента говорит о «безрассудстве» собственной модели, Irregular пишет о том, что «агент сам становится источником угрозы». Дарио Амодеи, комментируя похожий взлом в связке OpenAI и Hugging Face, предупреждал, что будущий рой агентов сможет захватить весь интернет, а заголовок Associated Press сообщал о ботах, которые выходят из-под контроля.
Позднее раскрытие Anthropic даёт другие числа: доля «сорвавшихся» агентов составила ноль процентов, а реальные взломы прекратились сразу, как только сотрудники компании прямо написали моделям не трогать настоящие системы.
Отсюда Effort делает вывод, что ответственность за инциденты лежит на Anthropic и Irregular, а не на «роях» и «рассогласовании», о которых говорят их публичные формулировки.
Первым инвестором Irregular была Good Ventures Дастина Московица
По данным CNBC, Irregular основали в 2023 году Дан Лахав, до этого работавший в исследованиях ИИ в IBM, и Омер Нево, проведший больше двух лет в Google. Там же приводятся 80 миллионов долларов от Sequoia и Redpoint Ventures, оценка в 450 миллионов долларов в прошлом году и штат около 35 человек по данным PitchBook.
Омер Нево входит в совет Effective Altruism Israel, соосновал Probably Good и состоит в консультативном совете Heron; Coefficient Giving, бывшая Open Philanthropy, финансирует Heron и Probably Good. EA Infrastructure Fund в третьем квартале 2022 года рекомендовал один совместный грант на 394 968 долларов Дану Лахаву и Селле Нево, брату Омера, на онлайн-курс.
В листинге CheckID у фирмы две связанные структуры: Pattern Labs Tech Inc., корпорация в Делавэре, и действующая израильская Pattern Tech Ltd, номер 516854460, зарегистрированная в Тель-Авиве. Офисы Irregular в Тель-Авиве описывал Ynet после визита и интервью.
Чего в раскрытиях нет: по данным CNBC, OpenAI назвала ошибку конфигурации, но не уточнила, какую именно, а в реестре EA Infrastructure Fund не названы ни курс, ни организация под грантом. Правовая рамка тоже пока пустая: §1030(a)(2)(C) CFAA требует для тяжкого состава аггравирующих обстоятельств, например информации дороже 5 000 долларов, и доказанных действий конкретных людей. На наш взгляд, слабое место здесь в постановке задачи: цель «достань флаг» промпты задавали, а периметр упражнения не описали ни разу.
Белая книга и ретроспектива Meta
Irregular, по данным CNBC, готовит белую книгу с практиками удержания моделей внутри среды и безопасного запуска киберпроверок; дата публикации не называется. Meta сообщила, что узнала о случившемся от Irregular, ведёт расследование и выпустит полный разбор, когда соберёт все факты; срок она не назвала. Счёт Anthropic уже менялся один раз, с трёх инцидентов 30 июля до четырёх 9 сентября, и будет ли пятый, из раскрытых материалов не следует.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
