benchmarks
100% на 28 задачах и 0,28 доллара за круг
Promtime
benchmarksОткрытая glm-5.3 прошла все 28 задач теста Ed-o-meter и стала первой моделью на доске, закрывшей все пять категорий на 100%, при стоимости круга 0,28 доллара. Тест ведёт Эд Яу, архитектор прикладного ИИ в Kerv, результаты опубликованы Reinvently 23 августа 2026 года.
Коротко
- Прогон состоит из пяти категорий: 7 задач по программированию, 4 по данным, 9 бытовых, 6 по безопасности и 2 на вызов инструментов; чекеры бинарные, судейство рубрики отдано модели fable-5.
- У glm-5.3 медиана до первого токена 16,3 секунды, у gpt-5.5 13,2 секунды при 89% в бытовых задачах, 100% в безопасности и 1,43 доллара за круг; самая медленная реакция у deepseek-v4-pro, 40,0 секунды.
- Четыре безобидные задачи coding-debug у opus-5 заблокировал классификатор провайдера до генерации первого токена, из-за чего в графе программирования стоит 43% при рубрике 9,4 и 100% в безопасности.
Открытая модель впервые возглавила эту доску, и цена круга в 0,28 доллара против 1,43 у gpt-5.5 меняет расчёт для команд, которые гоняют десятки тысяч однотипных задач. Судя по всему, куда важнее другое: провайдерский фильтр Anthropic и слабая устойчивость линейки gpt-5.6 к джейлбрейкам превращают выбор модели в вопрос обвязки, а не только качества ответов. При этом каждая задача прогонялась один раз, поэтому интервалы вокруг процентов широкие.
glm-5.3 закрывает все пять категорий при 0,28 доллара за круг
glm-5.3 стала первой моделью на доске Ed-o-meter, которая закрыла все пять категорий на 100%: программирование, данные, бытовые задачи, безопасность и вызов инструментов. Рубрика качества у неё 9,3, третий результат на доске, а круг из 28 задач обошёлся в 0,28 доллара, около пятой части расходов gpt-5.5. Эд Яу советует перед внедрением согласовать модель с комплаенсом.
Плата за результат это ожидание: медиана времени до первого токена у glm-5.3 составляет 16,3 секунды. gpt-5.5 отвечает быстрее, 13,2 секунды, при тех же 100% в безопасности, 89% в бытовых задачах и 1,43 доллара за круг. Прогон идёт последовательно через один и тот же потоковый путь OpenRouter, чтобы замер задержки не искажался.
gpt-5.6-luna проходит круг за 0,064 доллара при 79% общего результата
gpt-5.6-luna проходит весь круг за 0,064 доллара, то есть 0,0023 доллара на задачу, с медианой до первого токена 5,3 секунды. Общий результат у неё 79%, а в категории безопасности 33%, поэтому автор рекомендует её для массовой фоновой работы, где сбои дёшево отследить и повторить.
Альтернатива с более высоким проходом это haiku-4-5: 96% при 0,0044 доллара за задачу и медиане 0,9 секунды. deepseek-v4-pro при том же проходе 96% стоит 0,0029 доллара за задачу, но её медиана в 40,0 секунды самая высокая на доске, так что она годится только для пакетной обработки.
По рубрике лидирует kimi-k3 с 9,5 при проходе 96%, оценку выставляла fable-5 независимо. Слабое место kimi-k3 это данные, 75%, и медиана 26,4 секунды, вторая по величине на доске. opus-5 с 9,4 показывает лучшую рубрику на панели по умолчанию и подходит близко к kimi-k3 по качеству.
Три модели линейки gpt-5.6 выдали канарейку джейлбрейка в 11 из 12 ячеек
gpt-5.6-luna, gpt-5.6-terra и gpt-5.6-sol выдали канарейку джейлбрейка в 11 из 12 соответствующих ячеек, их проход по безопасности от 33% до 50%. Трио Claude и gpt-5.5 прошли все 6 задач категории чисто. Автор советует защищать такие модели на уровне обвязки и тщательнее проводить red teaming.
fable-5 делит последнее место с результатом 79%, потому что отказалась выполнять 5 задач из 28. Её рубрика 9,3 получена самосудейством: в матрице смещения судьи модель ставит себе 9,3 против 8,6–8,7 моделям, которые оценивает независимо. Цифра взята из более раннего прогона от 5 июля 2026 года, где судейство прошли 11 из 28 трейлов.
У opus-5 в графе программирования 43% при 100% в бытовых задачах и безопасности. Четыре безобидные задачи coding-debug заблокировал классификатор на стороне провайдера, до генерации первого токена, на пересекающемся наборе задач с теми, что заблокировала fable-5. Автор теста считает, что фильтр Anthropic охватывает всю линейку серии 5.
Обвязка Featherbench и перепроверка fable-5
Обвязка, задачи и чекеры опубликованы под лицензией MIT в проекте Featherbench, полный прогон всех 28 задач стоит около 30 долларов, новые модели принимаются через issue на GitHub. Рубрика fable-5 показана для полноты, а не как сопоставимая цифра, дата независимой перепроверки не называется. Последний исходный прогон датирован 22 августа 2026 года.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
