Автор прогнал 10 задач из Terminal-Bench через Claude Code на трёх моделях: Sonnet 4.6, Opus 4.7 и Opus 4.8. Каждый запуск инструментировался через OpenTelemetry и SigNoz.
По точности: Sonnet решил 5 задач, Opus 4.7 семь, Opus 4.8 восемь. По сырой стоимости дешевле всех Sonnet (6,30 доллара), но Opus 4.8 оказался дешевле Opus 4.7 (8,06 против 8,51).
Ключевая метрика это стоимость за решённую задачу: 1,26 у Sonnet, 1,22 у Opus 4.7, 1,01 у Opus 4.8. Opus 4.8 сжёг больше всего токенов (6,06 млн против 2,88 млн у Sonnet), но почти все они кэш-чтения, самая дешёвая категория.
Ошибки тулов упали с 1,72% у Sonnet до 0,85% у Opus 4.8. Промахи Sonnet это таймауты, единственный промах Opus 4.8 быстрый неверный ответ на сложной задаче.

