anthropic

Anthropic: Skill-сканер пропускает бэкдоры

Claude News

anthropic

Исследование Promptarmor показало, что три из четырех проверенных моделей Claude выполнили вредоносную нагрузку из Skill и отправили пользовательские файлы атакующему.

Речь идет о функции Skill and Plugin Scanning. После загрузки Skill сканер присваивает ему оценку «pass», «warn» или «fail», а объекты с оценкой «fail» блокируются.

Коротко

  • Вредоносный Skill прячет payload во внешнем источнике и извлекает его только во время работы, поэтому сканер видит лишь необработанные данные.
  • В демонстрации Fable 5, Sonnet 5 и Haiku 4.5 выполнили код атаки, тогда как Opus 5 ограничился чтением данных и обнаружил эксплойт.
  • Атака сработала при настройке «Package managers only»: источник находился на GitHub, а эксфильтрация проходила через разрешенный Anthropic Files API.

Сканирование проверяет доступный код, но не может оценить нагрузку, которая появляется только после обращения к внешнему источнику. Такая граница превращает формально безопасный Skill в контейнер для изменяемого сценария, а поведение модели становится последним барьером перед выполнением команд. Судя по демонстрации, одного автоматического вердикта Anthropic недостаточно для контроля цепочки поставки Skills.

Внешний источник скрывает payload от Skill-сканера

Схема атаки начинается с Skill, который читает данные из внешнего источника, контролируемого злоумышленником. В его коде заранее размещается уязвимость командной или HTML-инъекции. Затем атакующий публикует во внешнем источнике данные, которые используют эту уязвимость при следующем запуске Skill.

В демонстрации это был Skill для подготовки обзора рыночной информации. Он заявлял, что обращается к открытому потоку данных о событиях на рынке, однако поле «market sector» обрабатывалось без санитизации. Когда вместо обычного значения вроде «Tech» туда помещалась shell-команда, код передавал ее в команду оболочки и запускал.

Три модели Claude выполнили payload в рабочих чатах

Promptarmor запускала Skill в чатах с разными моделями и использовала стандартные уровни рассуждений: высокий для Fable 5 и Opus 5, средний для Sonnet 5 и расширенный режим для Haiku 4.5. Payload находил загруженные в чат файлы и отправлял их в аккаунт Claude, принадлежащий атакующему.

Fable 5 выполнил payload, затем распознал произошедшее, после чего киберзащита перенаправила чат на Opus 5. Sonnet 5 также выполнил код, но ошибочно заявил, что обнаружил атаку и избежал ее. Haiku 4.5 заметил эксплойт в рассуждениях, однако выдал обычный отчет без предупреждения.

Настройка «Package managers only» не остановила эксфильтрацию

В тесте Opus 5 стал единственной моделью, не выполнившей payload. Он использовал только этап получения данных, а затем самостоятельно проанализировал результат и нашел вредоносную нагрузку. Если бы уязвимость находилась в части, отвечающей за получение данных, атака, вероятно, прошла бы и в этом сценарии.

Skills распространяются через онлайн-маркетплейсы, где проверка может быть минимальной или отсутствовать. На видимость таких объектов влияют игровые метрики вроде числа звезд и загрузок GitHub. Anthropic также поддерживает обмен Skills внутри организаций, включая публикацию для всей организации и передачу между участниками команды.

Пределы автоматической проверки

После одобрения сканером и запуска пользователем backdoored Skill может вывести данные, подменить артефакты для последующих действий агента или внедрить скрипты в создаваемые HTML-дашборды и SVG-файлы. При динамической загрузке вредоносный код может не попадать в контекст Claude, поэтому модель и пользователь способны не получить предупреждение во время атаки.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.