benchmarks

Пять копий Qwen3.8-27B чуть обошли Claude Fable 5

Promtime

benchmarks

Пять копий открытой Qwen3.8-27B, поднятой локально, набрали 92,4% pass@1 на сотне свежих сложных задач LiveCodeBench и чуть обошли закрытую Claude Fable 5 с её 90,4%. Та же модель в одиночном прогоне даёт 69,2%; код, данные прогонов и лицензии авторы выложили на Github.

Коротко

  • Метод называется оркестрацией через журнал: обучения нет, настройки под бенчмарк нет, проверяли на девяти моделях, открытых и закрытых, на ста последних сложных задачах LiveCodeBench.
  • Прирост на закреплённых бэкендах доходит до 23,2 процентного пункта; оркестрованный GPT-5.6-Terra выдаёт 88,0% против 90,4% у Fable 5 и стоит 19% от её цены.
  • Работает не у всех: из девяти моделей часть не сдвинулась или стала хуже, а прирост авторы объясняют декомпозицией задачи и сохранённым между вызовами контекстом.

Если вы не следили: LiveCodeBench берёт задачи с недавних контестов LeetCode, AtCoder и Codeforces и помечает их датой, чтобы модель проверяли только на том, чего не было в обучении. В выводах проекта сказано, что закрытые модели обгоняют открытые, а барьер берут только дообученные открытые варианты от 30 миллиардов параметров. Схема с ведущим агентом тоже не новая: в блоге Anthropic связка ведущего Claude Opus 4 и подчинённых Sonnet 4 обошла одиночный Opus 4 на 90,2% по внутреннему тесту.

Оркестрованный GPT-5.6-Terra даёт 88,0% за 19% стоимости Fable 5

Метод прогнали на девяти моделях, открытых и закрытых, на сотне последних сложных задач LiveCodeBench. На закреплённых бэкендах прирост доходит до 23,2 процентного пункта. Отсюда два маршрута к фронтиру: дешёвый, где оркестрованный GPT-5.6-Terra набирает 88,0% pass@1 против 90,4% у Fable 5 и обходится в 19% её цены, и локальный, где открытая Qwen3.8-27B перешагивает ту же планку.

По данным препринта на arXiv, в выборку вошли пять открытых моделей от 9 миллиардов до примерно 2,8 триллиона параметров и четыре закрытые фронтирные, а лучший результат в исследовании показал Opus-5 с менеджером, 91% в одном проходе. Там же для пары GPT-5.6-Terra и Fable 5 приводятся свои цифры: 85,0 у первой с менеджером против 87,4 у второй в одиночном вызове (p = 0,59), 11,71 доллара против 61,11 за проход по сотне задач.

Почему свежий экземпляр модели справляется лучше одного длинного диалога

Потому что ему не нужно тащить всю историю в контексте. Устройство простое: менеджер и работники, все на одной и той же модели, обмениваются не репликами в чате, а файлами в общем рабочем каталоге, где лежат план, заметки и текущее решение. Каждый вызов короткий, состояние живёт на диске.

Устроено как вахтенный журнал: смена закончилась, следующий пришёл, прочитал, что сделано и что сломано, и продолжил. По разбору логов авторы сводят прирост к двум вещам: декомпозиции задачи и управлению контекстом, когда короткие вызовы работников и общие заметки держат состояние и не дают ему обрезаться.

Из девяти моделей часть не сдвинулась или просела

Аннотация прямо говорит, что выигрыш не универсален. По данным препринта на arXiv, у Qwen3.6-35B с выключенным рассуждением изменение легло в диапазон от минус 9 до минус 1, то есть нулевое или отрицательное.

Там же названы и крупные приросты: Kimi-K3 +30,4 и Minimax-M3 +11,0 по пяти парным прогонам с выключенным рассуждением, оба при p < 10⁻⁴, и +42 и +12 у них же в одиночном прогоне при потолке в 128k. Цена организации тоже указана: менеджер примерно утраивает счёт за токены по сравнению с одиночным проходом.

Код под MIT, статья и данные прогонов под CC BY 4.0

Репозиторий запускается через uv и ключ того провайдера, чью модель вы проверяете: openai, anthropic, dashscope или openrouter, у каждого свой ключ. Флаг --engine multiagent поднимает менеджера, --engine single даёт базовый однократный вызов для сравнения.

В приведённой авторами команде заданы релиз бенчмарка release_v6, сотня задач, восемь параллельных потоков, потолок в 128 000 токенов и таймаут 7200 секунд на облачный вызов. Итоговый pass@1 печатается в конце, результаты ложатся в runs/results.json, рабочие каталоги агентов в runs/ws/. Форк LiveCodeBench, тексты задач и шаблоны LaTeX сохраняют свои лицензии, раскладка по путям в NOTICE.md.

В источнике не сказано, на каком железе поднимали локальную Qwen3.8-27B и сколько времени занимает один проход по сотне задач, а цифры для пары GPT-5.6-Terra и Fable 5 в аннотации и в тексте препринта расходятся. На наш взгляд, всё упирается в цену: утроенный счёт за токены съедает часть выигрыша, если модель платная, и почти ничего не значит, если веса крутятся у вас на своём железе.

Что покажут повторные прогоны

Работа выложена, по данным arXiv, 27 августа 2026 года как препринт arXiv:2608.26480 за авторством Sang Won Lee, и код, лицензия и команда запуска на месте, так что 92,4% можно попробовать воспроизвести самому. Открытым остаётся другое: держится ли схема за пределами сотни сложных задач и на других релизах бенчмарка. Планов по расширению эксперимента авторы не называют.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.