Anthropic опубликовала отчет о безопасности ИИ-агентов в claude.ai, Claude Code и Claude Cowork. Главный вывод разработчиков: надежная изоляция на уровне среды важнее попыток сделать саму модель абсолютно безопасной. Вероятностная природа ИИ не гарантирует защиту от сбоев.
Для каждого продукта используется своя архитектура. В claude.ai код исполняется в контейнерах gVisor на серверах компании. В Claude Code применяется локальная песочница на базе механизмов macOS и Linux. Для Claude Cowork создана полноценная виртуальная машина, которая скрывает хост-систему от агента.
Инженеры также признали прошлые ошибки. Например, злоумышленники могли обходить ограничения через разрешенные домены вроде api.anthropic.com. Для защиты от утечек пришлось внедрить специальный прокси-сервер прямо внутрь виртуальной машины.

