anthropic

Фильтрация вывода подняла Opus 4.6 на BrowseComp до 61,6%

Promtime

anthropic

Anthropic опубликовала разбор обвязки агента: программного слоя вокруг модели из цикла, инструментов и управления контекстом. Компания советует опираться на инструменты, которые Claude уже знает, и убирать лишние подпорки.

Если дать Claude исполнение кода, он сам решает, какие результаты инструментов пропустить в контекст, а какие отфильтровать. На бенчмарке веб-поиска BrowseComp точность Opus 4.6 выросла с 45,3% до 61,6%, субагенты добавили ещё 2,8% к лучшим одноагентным прогонам.

С памятью картина похожая: при одинаковом бюджете компакции Sonnet 4.5 держался на 43%, Opus 4.5 дошёл до 68%, Opus 4.6 до 84%. Папка памяти на BrowseComp-Plus подняла Sonnet 4.5 с 60,4% до 67,2%.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.