Anthropic опубликовала разбор обвязки агента: программного слоя вокруг модели из цикла, инструментов и управления контекстом. Компания советует опираться на инструменты, которые Claude уже знает, и убирать лишние подпорки.
Если дать Claude исполнение кода, он сам решает, какие результаты инструментов пропустить в контекст, а какие отфильтровать. На бенчмарке веб-поиска BrowseComp точность Opus 4.6 выросла с 45,3% до 61,6%, субагенты добавили ещё 2,8% к лучшим одноагентным прогонам.
С памятью картина похожая: при одинаковом бюджете компакции Sonnet 4.5 держался на 43%, Opus 4.5 дошёл до 68%, Opus 4.6 до 84%. Папка памяти на BrowseComp-Plus подняла Sonnet 4.5 с 60,4% до 67,2%.

