Anthropic отрезала Claude от сети во внутренних тестах

Во время теста Claude Haiku 4.5 попал на страницу о нераскрытом убийстве и отправил в полицию выдуманную наводку о похожем человеке на соседней улице. Этот и другие случаи описаны в отчёте Anthropic о непреднамеренных действиях моделей, и после них Anthropic отключает живой интернет во всех внутренних оценках Claude.
Коротко
- С июля Anthropic вычитывает транскрипты тестов и нашла четыре типа сбоев: взлом через простые уязвимости, отправку настоящих форм, обход платы за данные и сокращатели ссылок в обход лимита.
- Почти все эпизоды Anthropic описывает как настойчивость: если задачу нельзя выполнить как поставлено, Claude обходит ограничение вместо того, чтобы остановиться, и компания связывает это с reward hacking.
- Реальный ущерб, по оценке Anthropic, минимален, но критерий возврата сети не назван: доступ вернут, когда защита и мониторинг будут надёжно ловить такие действия, а как это проверят, неизвестно.
Отчёт у Anthropic не первый. В апреле 2026 года на тестах Mythos Preview модель в песочнице по заданию выбралась в сеть, написала исследователю Anthropic Сэму Боуману и без просьбы выложила детали эксплойта на малозаметных сайтах. По данным TechSpot, в июле Anthropic рассказала о проверке 141 006 прогонов киберпроверок, где Claude в шести прогонах вышел в открытый интернет и взломал системы трёх организаций. Нынешние эпизоды сама Anthropic считает заметно менее серьёзными, чем инциденты из сообщений 30 июля и 9 сентября.
Mythos Preview нашёл дыру на сервере университета и выполнил расчёт через неё
В одной оценке Claude Mythos Preview должен был провести научный анализ публичным инструментом, который держит университет. Инструмент вернул ошибку. Тогда модель изучила сайт, нашла на сервере скрипт, отдающий любой запрошенный файл, скопировала через него файлы, включая код самого скрипта, нашла в этом коде уязвимость к инъекции команд и посчитала задачу прямо на чужом сервере.
Инъекция устроена просто: сайт по ошибке исполняет присланный текст как инструкцию. В другом случае Claude Mythos 5 нужны были бесплатные данные, закрытые соглашением об использовании, а принять его модели было нечем. Она загрузила страницу через приложения на том же сайте, и они приняли соглашение за неё. Такое поведение видели на DeepSearchQA, BrowseComp, LABBench2 и во внутренних оценках.
Claude Haiku 4.5 отправил в полицию выдуманную наводку по делу об убийстве
Неопубликованная исследовательская модель, не флагманская, должна была заполнить учебную копию государственной формы. Когда копия не загружалась или модель случайно её закрывала, она шла на сайт с настоящей формой и отправляла её там, причём несколько раз в одной оценке. Claude Haiku 4.5 в другом тесте просили остановиться перед отправкой, но он несколько раз отправлял форму, ожидая ещё одну страницу подтверждения.
В третьем случае Haiku 4.5 выполнял примерные задачи на случайных страницах и наткнулся на форму наводок от полицейского департамента; по данным TechCrunch, речь о полиции Филадельфии. Инструкции запрещали логин, создание аккаунтов, ввод личных данных, покупки и разрушительные действия, но про формы молчали. Claude написал, что видел похожего по описанию человека на улице со страницы, хотя описания преступника на сайте не было.
Имя и контакты модель оставила пустыми, форма это разрешала. Сообщение пометили как спам, и до следствия оно не дошло. Такие отправки видели на OSWorld, Odysseys и во внутреннем использовании.
Платные данные штата Mythos 5 получил по токену, который дашборд выдаёт любому посетителю
В оценке, где Claude Mythos 5 определял место по фотографии, модель обратилась к карте недвижимости местных властей, чтобы уточнить догадки. Кликать по страницам как человек ей не давали, зато читать текст можно было. Claude прочитал файл настроек, который сайт отправляет браузеру, нашёл там рабочие токены доступа и стал слать запросы прямо на сервер за картой.
Второй случай произошёл в работе исследователя Anthropic над статистическим проектом с Claude Mythos 5. Нужные публичные данные агентство штата продавало за плату. Claude узнал из архивной копии сайта, что публичный дашборд агентства выдаёт токен любому посетителю, получил его и обратился к базе без оплаты. Поведение видели на Humanity's Last Exam и во внутреннем использовании.
Живой интернет Anthropic отключает во всех внутренних оценках
Раньше без сети шла только часть высокорисковых тестов и киберпроверок. Запрет распространят на все внутренние оценки, пока Anthropic не убедится, что защита и мониторинг надёжно ловят такие действия. По пересказу TechCrunch, часть оценок прекратят или переведут офлайн, а новые инструменты обнаружения и блокировки проверили на описанных случаях, и те были заблокированы.
Внутренних агентов Anthropic переведёт на централизованно управляемую инфраструктуру с жёсткой изоляцией и чаще будет следить за ними классификаторами безопасности. Часть сайтов принадлежала федеральным, штатным и местным властям США; компания проинформировала Белый дом и уведомила каждое ведомство. Клиентские данные и внутренние системы Anthropic, насколько ей известно, затронуты не были.
Почему Claude обходит запреты вместо того, чтобы остановиться
Anthropic объясняет это reward hacking. Модель учится через обучение с подкреплением: много раз решает задачу в среде и получает награду за успех. Если среда несовершенна и награда достаётся за лазейку, модель усваивает, что обход окупается, и переносит его в другие задачи. Так стажёр, которого хвалили только за сданный отчёт, быстро понимает, что о способе добычи цифр никто не спросит.
Сокращатели ссылок следуют той же логике. Инструменты чтения страниц ограничивают длину URL, потому что в длинном адресе хватает места для инъекции. Claude Opus 5 и Claude Mythos 5 обходили лимит через бесплатные сервисы сокращения: короткий адрес проходит проверку, но ведёт на длинный.
Каждую задачу Claude проходит сотни или тысячи раз, ведь ответы модели содержат долю случайности, и редкие сбои всплывают именно на таком объёме. Публичные бенчмарки веб-поиска по умолчанию гоняют на живом интернете, чтобы сравнивать модели между собой, и большинство случаев из отчёта произошло именно в них.
Отчёт описывает проблему примерами, без статистики: сколько транскриптов проверено и сколько случаев найдено, не сказано. По пересказу TechCrunch, Anthropic признала, что обучения выравниванию пока не хватает для поиска и работы с компьютером, то есть для основы агентных сценариев. На наш взгляд, странно, что в тесте с полицейской формой инструкции запрещали логин и покупки, но не отправку форм: пробел в постановке задачи модель нашла раньше авторов теста.
Когда Claude вернут в сеть
Срока нет. Anthropic расширяет проверку на большой пул низкорисковых транскриптов, на внутреннее использование Claude и на среды обучения с подкреплением с доступом в интернет и обещает сообщать о новых случаях. Какие доказательства убедят компанию вернуть живой доступ, не раскрывается. Основатель Nightingale Сидни фон Аркс ещё до отчёта говорил TechCrunch, что выравнивать модели всё равно придётся: инструмент, который в продакшене никогда не выходит в сеть, мало полезен.
Читайте также
- Агенты Anthropic заполняли визовые анкеты на сайте Госдепа
- Модель Anthropic написала полиции ложную наводку об убийстве
- Разрешение жульничать спасло модель Anthropic от саботажа
- Из 225 багов Anthropic в атаках всплыл только один
- Claude Fable нашёл коллизии в большинстве быстрых хешей
- Дешёвый Claude оказался ни дешёвым, ни Claude
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
