anthropic

Claude Opus показывает лучшие результаты в Coding Agent Index

Claude News

anthropic

Аналитический ресурс Artificial Analysis обновил рейтинг Coding Agent Index, оценивающий эффективность ИИ-агентов в задачах программирования. В текущем замере Claude Opus демонстрирует более высокие показатели производительности по сравнению с другими конфигурациями Claude Code.

Индекс объединяет результаты трех бенчмарков: SWE-Bench-Pro-Hard-AA, Terminal-Bench v2 и SWE-Atlas-QnA. Эти тесты проверяют способности агентов к навигации по репозиториям, исправлению ошибок и работе в терминале. Методология учитывает точность кода, время выполнения задачи и потребление токенов.

Высокая оценка в индексе не гарантирует превосходство в каждом сценарии, так как реальная работа зависит от приоритетов пользователя: скорости, стоимости или глубины анализа кода.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.