benchmarks

Бюджет времени в тестах Qwen 3.8-Max отличается в 5–16 раз

Promtime

benchmarks

Независимый прогон связки VulcanBench поставил Qwen 3.8-Max в середину списка на максимальном уровне усилий и на последнее место на настройке по умолчанию. Alibaba при запуске заявляла, что модель уступает только Claude Fable 5, хотя её собственная таблица давала лидерство лишь в одной из 12 строк с агентами для программирования.

Расхождение упирается в бюджет времени. В сносках Alibaba замеры по программированию идут с таймаутом в пять часов и до 12 часов на прогон в PaperBench, а VulcanBench отводил от 45 до 60 минут реального времени. Разрыв составляет 5–16 раз.

Поле effort по умолчанию не задано, и Qwen 3.8-Max уходит на максимальный уровень рассуждений, который в независимом тесте оказался последним. В отчёте VulcanBench от 26 июля низшая настройка усилий Claude Opus 5 решила 20 задач из 23 против 18 на высокой.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.