Независимый прогон связки VulcanBench поставил Qwen 3.8-Max в середину списка на максимальном уровне усилий и на последнее место на настройке по умолчанию. Alibaba при запуске заявляла, что модель уступает только Claude Fable 5, хотя её собственная таблица давала лидерство лишь в одной из 12 строк с агентами для программирования.
Расхождение упирается в бюджет времени. В сносках Alibaba замеры по программированию идут с таймаутом в пять часов и до 12 часов на прогон в PaperBench, а VulcanBench отводил от 45 до 60 минут реального времени. Разрыв составляет 5–16 раз.
Поле effort по умолчанию не задано, и Qwen 3.8-Max уходит на максимальный уровень рассуждений, который в независимом тесте оказался последним. В отчёте VulcanBench от 26 июля низшая настройка усилий Claude Opus 5 решила 20 задач из 23 против 18 на высокой.

