Перейти к содержанию

coding-agents

GLM 5.3 подписал коммит именем Claude Fable 5

Promtime

Автор блога Future-seems-so-good запускал GLM 5.3 в собственной обвязке, где нет ни слова про Claude или правила коммитов, а модель подписала коммит строкой Co-Authored-By: Claude Fable 5. Такую подпись по умолчанию ставит Claude Code. Из этого случая автор выводит большой тезис: формат инструментов, удобный модели, в основном задаётся пост-обучением, то есть той обвязкой, в которой лаборатория проводила RL.

Коротко

  • Разбор спорит с февральской формулой Stencil, где обвязка была лишь мостом к модели: по мнению автора, лучший формат правки кода определяет обвязка, в которой лаборатория проводила RL.
  • Формат hashline поднял Grok Code Fast 1 с 6,7% до 68,3%, но только против patch; против str_replace прирост по 16 моделям в среднем около 3,4 пункта, от минус 8,3 до плюс 11,3.
  • Большинство цифр по форматам дал один бенчмарк, который прогнали сами создатели hashline, а независимые повторы расходятся: одни хвалят экономию токенов, один тестер назвал формат катастрофическим для большинства моделей.

Если вы не следили: в феврале Stencil рассказала, как за один день улучшила 15 моделей в программировании, поменяв только обвязку. Инструмент правки заменили на hashline: каждая прочитанная строка приходит с коротким хэшем содержимого, и правка ссылается на эту метку вместо того, чтобы повторять старый текст. Проходимость выросла у 16 моделей, пост кончался фразой «The model is the moat. The harness is the bridge», и после семи месяцев повторных проверок автор считает её наполовину неверной.

Против str_replace hashline прибавляет в среднем около 3,4 пункта

Stencil сравнивала три формата: apply_patch в стиле OpenAI, str_replace в стиле Claude и hashline. Громкие плюс 15 пунктов получены против patch, а patch надёжно пишут только модели, которых на нём обучали: в прогоне Stencil Grok 4 провалил 50,7% своих патчей, GLM-4.7 провалил 46,2%. Отсюда и скачок Grok Code Fast 1 с 6,7% до 68,3%.

Против str_replace картина скромнее: по 16 моделям прирост в среднем около 3,4 пункта при медиане около 3,5. Разброс идёт от плюс 11,3 у Claude Haiku 4.5 и Gemini 3 Flash до минус 8,3 у DeepSeek V3.2, а GPT-5.2 Codex теряет 0,4 пункта и тратит на 26% больше выходных токенов.

Повторы расходятся. Trueline сократил выходные токены Claude Code на 44%, а июньский бенчмарк трёх инструментов на пяти моделях заключил, что hashline почти никогда не бывает самым дешёвым. Самая показательная деталь: отдельный инструмент hashline_edit рядом с edit давал моделям класса Haiku 0% успеха, а та же логика за единственным edit давала 95%.

Opus 4.8 ошибался примерно в 20% вызовов чужого инструмента правки

Армин Ронахер заметил, что Opus 4.8 и Sonnet 5 вызывают инструмент правки в Pi с выдуманными ключами внутри вложенного массива edits[]: requireUnique, matchCase, oldText2, in_file. Сами oldText и newText при этом были верны до байта. Мусор появляется сразу после того, как модель закрывает длинную экранированную строку.

В одной воспроизведённой сессии Opus 4.8 ошибался примерно в 20% случаев, удаление блоков размышлений вдвое снизило долю ошибок, а strict mode убрал их полностью. Более старые модели так не делали, Opus 4.5 к чужим инструментам привыкал хорошо, у моделей Codex регресса в тестах Ронахера не нашлось.

Объяснение Ронахера упирается в клиент Claude Code. Он повторяет запрос, если разметка <invoke протекла в видимый текст, чинит сломанные \uXXXX, принимает old_str вместо old_string и path вместо file_path, молча выбрасывает незнакомые ключи и не использует strict mode. Если RL идёт в такой обвязке, кривой вызов всё равно решает задачу и получает награду, так что отучаться выдумывать поля модели почти не на чем.

В Claude Code тот же Opus 4.5 набрал на CORE-Bench Hard 77,78% против 42,22% в CORE-Agent

На лидерборде HAL CORE-Bench Hard Claude Opus 4.5 набирает 33,33% в универсальном агенте HAL и 42,22% в CORE-Agent. Николас Карлини прогнал его через Claude Code и получил 77,78%, а после ручного исправления нескольких ошибок проверки 95,5%. Строкой ниже Opus 4.1 в Claude Code показывает 42,22%, хуже, чем 51,11% в CORE-Agent.

Cursor пришлось подстраиваться под обвязку Codex: модель на обучении получает мало инструментов и учится искать и править через шелл, поэтому Cursor назвал свои инструменты по образцу шелла, вроде rg. Удаление следов рассуждений между вызовами инструментов уронило GPT-5-Codex на Cursor Bench на 30%, тогда как основной GPT-5 в тестах OpenAI на SWE-bench терял 3%.

Ещё один пример: Qwen3-Coder дообучили работать с настоящим отладчиком. Без RL, с одним лишь отладчиком, модель решила 67% из 27 отложенных задач с багами. После RL в этой обвязке она решила 89%, а медиана ходов упала с 46 до 19.

Anthropic насчитала более 16 миллионов обменов с Claude через около 24 000 фальшивых аккаунтов

Автор допускает два источника подписи GLM: дистилляцию траекторий Claude Code или предобучение на GitHub, где уже много коммитов с этим трейлером. Один коммит их не различает. Но модель назвала именно Fable 5, текущую флагманскую модель Anthropic, значит, привычка пришла из свежих данных. В одном разборе на HN K3 назвал себя Claude в 7 из 48 проб.

23 февраля Anthropic сообщила, что DeepSeek, Moonshot и MiniMax провели с Claude более 16 миллионов обменов примерно через 24 000 мошеннических аккаунтов. На MiniMax пришлось больше 13 миллионов, нацеленных на агентное программирование и оркестрацию инструментов, на Moonshot 3,4 миллиона. В сентябрьском отчёте Anthropic, в пересказе TechCrunch, обменов было почти 200 миллионов в пяти кампаниях.

Без constrained decoding схема инструмента остаётся для модели выученной привычкой

Модель получает переписку, системный промпт и список инструментов, а сервер сплющивает всё это в один длинный промпт со специальными маркерами. В какой-то момент модель выдаёт фрагмент, который API читает как вызов инструмента, потому что её обучали и награждали именно на таком формате. У Anthropic просочившиеся маркеры похожи на псевдо-XML, у открытых моделей OpenAI формат harmony, где маркер <|constrain|>json подсказывает, где включать выборку по JSON-схеме.

Отсюда два режима. При constrained decoding сэмплер маскирует любой токен, ломающий схему, и выдумать ключ модель не может. Без него она следует выученной конвенции, и в этом режиме работает большинство сторонних обвязок. Разница как между веб-формой с выпадающими списками и бумажной анкетой: форма не даст вписать лишнее поле, а на бумаге рука сама выводит графы той анкеты, которую вы заполняли тысячу раз.

Слабое место разбора автор называет сам: большинство цифр по форматам дал один бенчмарк, который прогнали создатели hashline, а публичные данные невелики и в основном касаются TypeScript и JavaScript. Ни OpenAI, ни Anthropic прямо не пишут, что проводят RL внутри своих обвязок, а сериализация Anthropic не опубликована. Странно, что Claude Code обходится без strict mode, хотя у Ронахера он полностью убрал ошибку; сам Ронахер связывает это с ограничением на сложность описаний инструментов.

Непроверенный совет для GLM, Kimi и MiniMax

Для этих трёх семейств автор советует инструменты в форме Claude Code, с плоской правкой old_string/new_string, и честно помечает совет как вывод, а не измерение. Открытым он оставляет и вопрос, переживут ли купленные при дистилляции агентные привычки следующий раунд обучения: этого пока никто не измерял. До таких замеров формат правки придётся проверять по каждой модели и языку отдельно.

Читайте также

  1. Обвязка агента меняет расход токенов
  2. Codex после сжатия вспомнил 68 ответов из 178
  3. Jev дешевле Claude Fable в 274 раза, но точность 98%
  4. Агентам дали писать базу Perplexity, но не запускать её
  5. 73% на OSWorld 2.0 и две трети цены конкурентов
  6. В Microsoft Copilot завезли кодинг на базе GitHub Copilot

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.