Замдиректора по безопасности Anthropic Джейсон Клинтон описал, как компания встраивает безопасность в разработку с агентами. Правила безопасного кода теперь записаны в файлах CLAUDE.md и общих скиллах, а найденный класс багов возвращается в эти файлы, чтобы не повторяться. Команда стартовала с CLAUDE.md, который запускает общедоступную команду /security-review перед открытием PR.
Доля PR с содержательными замечаниями выросла с 16 до 54% после того, как агентов обязали доказывать валидность находки. По оценке Anthropic, около трети багов из прошлых инцидентов claude.ai поймали бы нынешние автоматические проверки.
Каждый PR разбирают несколько узких агентов с раздельными контекстами и RAG по прошлым инцидентам. В феврале Claude нашёл и помог исправить более 500 OSS-уязвимостей высокой критичности.

