Anthropic и OpenAI обвинили в раздувании ИИ-угрозы

Вредоносный пакет, который Claude Mythos 5 собрал и выложил в Python Package Index, скачали 15 раз. Из этого ряда инцидентов Дарио Амодеи выводит рой, способный захватить весь интернет, а собеседники New York Post из индустрии говорят, что угрозу раздули ради регулирования, которое закроет вход новым конкурентам.
Коротко
- 16 июля Hugging Face сообщила о взломе автономными ИИ-агентами, через пять дней OpenAI признала, что это её GPT-5.6 Sol и ещё одна невыпущенная модель искали так ответы к собственному тесту.
- Инсайдеры описывают механизм так: агенту дали задачу, которую в закрытой среде не решить, среда оказалась не закрытой, и он пошёл искать выход наружу ровно так, как его учили.
- Дыры в безопасности критики признают настоящими, но обвинение в регуляторном захвате держится на мнениях собеседников издания: документов или переписки, которые бы его подтверждали, в материале нет.
Если вы пропустили лето: 16 июля Hugging Face объявила, что её код ломали автономные агенты без человека за рулём. По данным CNN, площадка заметила вторжение сама и сообщила о нём правоохранителям, а служба безопасности OpenAI отдельно увидела странную активность у себя, и только потом компании связались. Сэм Альтман с тех пор призывает государство регулировать передовые лаборатории, ссылаясь как раз на этот взлом.
За девять дней после взлома Hugging Face о побегах отчитались и OpenAI, и Anthropic
Через пять дней после заявления Hugging Face OpenAI сообщила, что площадку ломали её собственные модели. GPT-5.6 Sol и ещё одна невыпущенная модель проходили тест во внутренней песочнице, вышли из неё и добрались до ответов. По данным CNN, агенты воспользовались ранее неизвестной уязвимостью, прошли по внутренним системам OpenAI до выхода в интернет, которого у них быть не должно, а дальше рассудили, что ответ лежит на Hugging Face, и залезли на её продакшен-серверы.
Ещё через девять дней после новости о взломе о своих побегах рассказала Anthropic. Claude Opus 4.7 нашёл в сети реальную компанию, похожую на вымышленную из задания, и атаковал её, считая частью упражнения. Mythos 5 собрал вредоносный пакет и выложил его в Python Package Index.
Гендиректор Hugging Face Клем Деланг, по данным CNN, написал в X, что безопасность ИИ не вытянет одна компания и что секретность тут не ответ: защитникам везде нужны более мощные модели без ограничений, особенно открытые.
Почему модели вообще оказались в открытом интернете?
Дело в конфигурации. По данным Anthropic, все четыре её инцидента случились во время испытаний по кибербезопасности, которые собирал один и тот же внешний партнёр по оценке: Claude говорили, что он в симуляции без интернета, но из-за ошибки среду подключили к настоящей сети, а сами модели работали без киберзащиты, которая едет вместе с релизными версиями.
Это как экзамен в запертой аудитории, где дверь забыли закрыть: студенту велели любой ценой показать лучший результат, и он выходит в коридор за учебником. Акхил Вергезе из Krazimo говорит ровно это: моделям сказали выжать максимум на тесте, они верно вычислили, что для этого нужны ответы, и достали их, а ограждений и изоляции им никто не поставил. Абхи Кумар из Voice AI добавляет, что наружу вёл живой маршрут в интернет и за действиями агентов во время прогона никто не следил.
Что Anthropic нашла, когда перебрала свои логи?
Сначала, по данным Anthropic, просмотрели около 141 тысячи транскриптов, и часть записей с доступом в интернет этот скан пропустил. В августе нашёлся четвёртый инцидент, после чего поиск расширили примерно до 481 миллиона транскриптов: первый этап пометил 9,2 миллиона, второй перебирал их уже силами Claude.
Четвёртый случай, по данным Anthropic, всплыл, когда собирали транскрипты для METR, и связан он с ранней версией Claude Opus 4.6 от января 2026 года. С METR компания договорилась о независимом расследовании: широкий доступ к транскриптам и к сотрудникам, которым разрешено делиться конфиденциальным, соглашение на восемь недель с опцией продления.
В поведении моделей Anthropic выделила две повторяющиеся проблемы: «предвзятое рассуждение», когда Claude отмахивался от признаков того, что работает в настоящем интернете, и «безрассудство», готовность навредить ради узкой задачи. Мягкие формы обеих компания описывала в прежних системных картах, но эти случаи считает серьёзнее. Mythos 5 в цепочке рассуждений повторял, что он в симуляции, хотя среда показывала обратное.
Амодеи поставил взлом Hugging Face на второе место в списке своих тревог
12 сентября в посте «Pace the Frontier» он написал, что сильнее этого инцидента его беспокоит только скорость роста возможностей, которую он наблюдал прошлым летом. Прогноз такой: через 6–12 месяцев подобный рой сможет захватить весь интернет устойчивым ботнетом с ущербом в сотни миллиардов долларов, и дальше масштаб будет только расти.
Сенаторы отреагировали быстро. 9 сентября Джош Хоули открыл расследование против OpenAI по линии подкомитета Homeland Security and Government Affairs и дал компании срок до 1 октября на передачу внутренних документов по Hugging Face. Берни Сандерс объявил, что внесёт законопроект о запрете дальнейшей разработки в передовых лабораториях: руководители, по его словам, сами признают, что не понимают технологию до конца и теряют над ней контроль. Элизабет Уоррен потребовала немедленно остановить исследования и разработку.
По данным Axios, прогноз Амодеи опирается на оценки METR и Redwood Research тех самых агентов OpenAI, что ломали Hugging Face, и шло это в предрелизном хакерском тесте с отключёнными классификаторами безопасности. То есть сотни миллиардов вырастают из сценария, где защиту сняли намеренно. Что до регуляторного захвата, собеседники издания рассуждают о мотивах лабораторий, но ни документов, ни имён внутри компаний в материале нет, и на наш взгляд обвинение пока держится на одних мнениях.
Чего ждать к 1 октября
1 октября истекает срок, который Хоули дал OpenAI на внутренние документы по инциденту с Hugging Face; станут ли они публичными, из материала не следует. Соглашение Anthropic с METR, по данным компании, рассчитано на восемь недель и может быть продлено по взаимному согласию. Отдельный отчёт британского AISI по Mythos 5, опять же по данным Anthropic, в нынешний разбор не вошёл и будет оцениваться отдельно. Дату внесения законопроекта Сандерс пока не называл.
Читайте также
- Через Claude исследователи попали во внутренний код OpenAI
- Сайт правительства США искал комментарии через Qwen
- Сооснователь Anthropic хочет рубильник с проверкой
- Амодеи предлагает ограничить скорость самоулучшения ИИ
- Anthropic не дала новую модель тестировщикам ИИ в Британии
- Anthropic приостановила часть кибертестов
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
