Аналитический ресурс Artificial Analysis обновил рейтинг Coding Agent Index, оценивающий эффективность ИИ-агентов в задачах программирования. В текущем замере Claude Opus демонстрирует более высокие показатели производительности по сравнению с другими конфигурациями Claude Code.
Индекс объединяет результаты трех бенчмарков: SWE-Bench-Pro-Hard-AA, Terminal-Bench v2 и SWE-Atlas-QnA. Эти тесты проверяют способности агентов к навигации по репозиториям, исправлению ошибок и работе в терминале. Методология учитывает точность кода, время выполнения задачи и потребление токенов.
Высокая оценка в индексе не гарантирует превосходство в каждом сценарии, так как реальная работа зависит от приоритетов пользователя: скорости, стоимости или глубины анализа кода.

