anthropic

Новые модели Claude тратят больше токенов, но дешевле за решённую задачу

Claude News

anthropic

Автор прогнал 10 задач из Terminal-Bench через Claude Code на трёх моделях: Sonnet 4.6, Opus 4.7 и Opus 4.8. Каждый запуск инструментировался через OpenTelemetry и SigNoz.

По точности: Sonnet решил 5 задач, Opus 4.7 семь, Opus 4.8 восемь. По сырой стоимости дешевле всех Sonnet (6,30 доллара), но Opus 4.8 оказался дешевле Opus 4.7 (8,06 против 8,51).

Ключевая метрика это стоимость за решённую задачу: 1,26 у Sonnet, 1,22 у Opus 4.7, 1,01 у Opus 4.8. Opus 4.8 сжёг больше всего токенов (6,06 млн против 2,88 млн у Sonnet), но почти все они кэш-чтения, самая дешёвая категория.

Ошибки тулов упали с 1,72% у Sonnet до 0,85% у Opus 4.8. Промахи Sonnet это таймауты, единственный промах Opus 4.8 быстрый неверный ответ на сложной задаче.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.