Alibaba продвигала превью Qwen 3.8-Max как вторую модель после Claude Fable 5, хотя в её таблице на день запуска модель лидирует в одной строке из 12 по агентам для программирования. Независимая связка VulcanBench дала почти обратный результат: режим максимальных усилий оказался в середине списка, настройка по умолчанию на последнем месте.
Разница в бюджетах времени. В сносках Alibaba кодинговые замеры идут с таймаутом в пять часов и до 12 часов на прогон в PaperBench, тогда как VulcanBench отводил от 45 до 60 минут реального времени.
В отчёте VulcanBench от 26 июля минимальный уровень усилий у Claude Opus 5 оказался лучшим: 20 решённых задач из 23 против 18 на высоком уровне. При неограниченном времени высокий уровень лишь сравнивается с самой дешёвой настройкой, стоя в 3,1 раза дороже.

