ai-security

Claude и Codex ставили чужой код по подсказке llms.txt

Claude News

ai-security

Исследователи нашли более чем на 100 сайтах файлы документации, которые направляют ИИ-агентов к незарегистрированным пакетам и доменам, и несколько десятков компаний, включая участников Fortune 500, уже выполнили у себя размещённый по этим ссылкам проверочный код. О результатах сканирования сообщает Arstechnica.

Коротко

  • Речь о файлах llms.txt и llms-full.txt: сайты выкладывают в них машиночитаемое описание своей структуры, а кодовые агенты читают эти подсказки как достоверную документацию поставщика и выполняют указанные там команды установки.
  • Сканирование охватило 6 214 живых доменов оборонных подрядчиков, компаний Fortune 500 и Big Tech; из 8 265 найденных файлов 120, каждый на отдельном сайте, ссылались на несуществующие пакеты или домены.
  • Первый отклик с сервера компании из Fortune 500 пришёл в течение часа, а журнал родительских процессов показал, что установку запускали Claude, Codex от OpenAI и Hermes от Nous Research.

Схема выглядит как атака на цепочку поставок, смещённая на уровень документации: подделывать нужно не код и не пакет, а текстовую подсказку, которую агент считает описанием продукта. Ни агент, ни наблюдающий за ним человек при этом не проверяют, существует ли упомянутый пакет вообще. Для команд, которые уже выдали агентам право ставить зависимости, это, вероятно, означает новый класс инцидентов, не покрытый ни ревью кода, ни сканерами реестров.

Из 8 265 файлов llms.txt и llms-full.txt 120 указывали на незанятые имена

Исследователи из израильского стартапа, работающего в скрытом режиме, просканировали 6 214 живых доменов: сайты оборонных подрядчиков, компаний из списка Fortune 500 и крупных технологических корпораций. В сумме на них нашлось 8 265 файлов llms.txt и llms-full.txt, поскольку многие площадки держат оба варианта файла одновременно.

В 120 файлах, каждый на отдельном сайте, оказались ссылки на пакеты или доменные имена, которые никто не зарегистрировал. Всего потенциально опасное исполняемое содержимое обнаружилось более чем на 100 сайтах, и многие ИИ-агенты подтягивают его автоматически при обращении к странице документации.

Файлы llms.txt и llms-full.txt появились как отраслевая конвенция: сайт выкладывает в них машиночитаемую выжимку содержимого и описание структуры. По сути robots.txt объясняет поисковым системам, как индексировать сайт, а llms.txt делает то же самое для ИИ-агентов. Конвенция молодая, и её поддержка зависит от владельца сайта.

Первый отклик от компании из Fortune 500 пришёл в течение часа

Чтобы проверить, что делает агент при чтении такого файла, исследователи зарегистрировали часть свободных имён и разместили по ним пакеты: любая машина, выполнившая такой пакет, обращалась к серверу исследователей. Первый отклик пришёл в течение часа из сети компании, входящей в Fortune 500.

Одним случаем дело не ограничилось. Со временем на сервер пришло ещё несколько десятков откликов: их слали и другие компании из Fortune 500, и стартапы. Каждый отклик означал, что пакет с чужого адреса уже установлен и запущен внутри корпоративной сети.

Маяк, зашитый в пакет, фиксировал не только факт запуска, но и цепочку родительских процессов, породивших каждую установку. Эти записи и вывели на кодовых агентов: в цепочках оказались Claude, Codex от OpenAI и Hermes от Nous Research. Все три инструмента используются для написания кода в рабочих окружениях разработчиков.

По меньшей мере один сайт направляет посетителей на действующее вредоносное ПО

Подробности формата описывает Google Lighthouse, инструмент для веб-разработчиков, а образцы корректно оформленных llms.txt и llms-full.txt опубликованы у Cloudflare. Часть реальных файлов оформлена иначе: по меньшей мере один сайт с ошибкой в конфигурации отправляет посетителя, человека или агента, на действующее вредоносное ПО.

Битые ссылки живут в документации, пока их не заметит владелец сайта. Механика знакома по атакам на реестры пакетов: упомянутый в документации пакет или домен может зарегистрировать кто угодно, и содержимое по этому адресу окажется под контролем постороннего без какого-либо доступа к самому сайту.

Один из авторов исследования, Алон Херц, называет модель доверия сломанной: агенты принимают документацию поставщика за истину и не ставят её под сомнение, как и люди, которые их контролируют. По его словам, агенты расходятся по SaaS, облакам и конечным устройствам, а вместе с ними растёт поверхность цепочки поставок, которую нынешние средства защиты не покрывают.

Сколько имён осталось свободными Исследователи заняли лишь часть найденных адресов, и сколько из 120 проблемных файлов по-прежнему ведут на свободные для регистрации пакеты и домены, не уточняется. Названия затронутых компаний и самого стартапа, работающего в скрытом режиме, не раскрываются. Неизвестно и то, изменят ли разработчики кодовых агентов правила обработки файлов llms.txt.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.