Собственные тесты Alibaba ставят плотную модель на 27 млрд параметров в один ряд с Opus 4.6 от Anthropic в режиме Max, сообщает The New Stack, а на ряде тестов она выходит вперёд, особенно в работе с компьютером, программировании и знаниевых задачах.
На агентном бенчмарке программирования DeepSWE результат вырос с 14,2 балла у Qwen 3.7-Plus до 42,2. Это ниже фронтирных и открытых моделей вроде GLM-5.3, хотя средняя по уровню Gemini 3.6 Flash от Google набрала там только 49%. В сравнении с Muse Glimmer-30B от Meta модель Alibaba лидирует во всех тестах, где приведены обе оценки.
Цифры относятся к исходной версии модели, а не к квантованным сборкам для локального запуска, и по ранним отзывам модель склонна переусложнять рассуждения. Неквантованный репозиторий весит 55,6 ГБ, конвертации сообщества в формате MLX для чипов Apple занимают 16,1 ГБ (4 бита) и 29,5 ГБ (8 бит).

