Токены рассуждений Luna 6 в Codex зависят от способа входа

Клиент Codex один, модель одна, запрос совпадает байт в байт. При этом Luna 6 от OpenAI на уровне Medium в задаче про книжный магазин через API-ключ сообщает примерно в 32 раза больше токенов рассуждений, чем при входе через подписку ChatGPT Pro. Замеры, код, ответы и данные для проверки авторы эксперимента выложили на GitHub.
Коротко
- Авторы собрали 960 завершённых ответов Luna 6 и Sol 6.1 на уровнях Low, Medium и High в двух задачах и сравнили вход по API-ключу со входом через подписку ChatGPT Pro.
- В задаче про книжный магазин Luna 6 на Medium через API в среднем сообщала о 96,30 токена рассуждений, по подписке о 3,025, а на Low о 68,550 против 0,000.
- Причину расхождения авторы не знают. Проверены два фиксированных промпта, один API-ключ и один Pro-аккаунт, а счётчики показывают расход по отчёту сервера, а не внутренний бюджет рассуждений модели.
Если вы не следили: похожее поведение замечали и до этого эксперимента. В трекере Codex есть issue #49757, где модель Astra сравнивают при входе через Enterprise и через публичный API. В обзоре похожих работ авторы упоминают ещё отчёт про Luna, ошибки в настройке уровня усилий и исследования с другими результатами. Подсказки там есть, но причину их находок ни одна из этих работ не установила.
Luna 6 на уровне Low по подписке показывает 0,000 токенов рассуждений, через API 68,550
В эксперименте две задачи. В первой модель выбирает проекты, укладываясь в бюджет, во второй выясняет, почему книжный магазин рассылает одинаковые письма по два раза. Luna 6 и Sol 6.1 прогоняли на уровнях Low, Medium и High, по 40 ответов на каждое сочетание задачи, модели, уровня и способа входа. Сначала собрали 480 ответов, потом отдельно проанализировали заранее заданную вторую партию, ещё 480.
Сильнее всего счётчики разошлись в задаче про книжный магазин. У Luna 6 через API в среднем выходило 68,550 токена рассуждений на Low, 96,30 на Medium и 148,525 на High, а по подписке Pro 0,000, 3,025 и 85,200 соответственно. Sol 6.1 на уровне High показала 216,675 токена через API и 138,700 по подписке.
Все четыре разницы прошли поправку на множественные сравнения и в исходном исследовании, и в повторном. Поправка нужна потому, что среди десятков сравнений какое-нибудь обязательно окажется «значимым» по чистой случайности, и она отсекает такие совпадения.
Все 480 наборов решений по книжному магазину оказались верными при любом способе входа
Больше токенов не означало лучшего ответа. В задаче про книжный магазин оба способа входа дали правильные решения во всех 480 наборах, в том числе там, где Luna 6 на Low по подписке отчитывалась о нуле токенов рассуждений.
С проектами картина пестрее. По всему набору данных Luna 6 на Low решила задачу верно в 35 случаях из 40 через API и в 18 из 40 по подписке. Разница прошла заранее запланированную консервативную поправку (p = 0,0083), но сами авторы называют этот результат разведочным.
Если смотреть только на новую партию, вышло 19 из 20 против 12 из 20, и поправку эта разница уже не прошла (p = 0,371). Во время повторного сбора подписочный маршрут дважды отказал из-за нехватки мощностей. Авторы сохранили оба сбоя, вручную продолжили запуски, задокументировали это и выполнили исходный план целиком. Вся статистика выше посчитана только по завершённым ответам.
Локальный прокси проверяет, что в каждой паре вход совпадает байт в байт
Каждый ответ начинается с новой сессии Codex. Между клиентом и сервером стоит локальный прокси. Он следит, чтобы в каждой паре в модель уходил один и тот же вход, байт в байт. Различаются только авторизация и адрес сервиса, к которому обращается клиент.
Представьте, что вы отправляете одну и ту же посылку двумя курьерскими службами и сравниваете, какой вес каждая указала в накладной. Прокси здесь гарантирует одинаковое содержимое коробки, а накладную заполняет сервер. Ответы сервера прокси не меняет. Авторы записывают ответы и данные о расходе токенов, сверяют их с собственными записями Codex и оставляют неверные ответы в наборе.
Цифры можно пересчитать локально на Python 3.12 или новее, без единого обращения к моделям. Команды python3 -m experiment verify и python3 -m experiment analyze работают на приложенных данных, а отчёт появляется в output/reports/followup/report.md. Репозиторий открыт под лицензией MIT.
Главное ограничение авторы называют сами: два фиксированных промпта, один API-ключ и один Pro-аккаунт. Счётчики описывают расход, о котором сообщает сервер, и не показывают, сколько модель на самом деле рассуждала, так что из этих данных не следует, что по подписке она думает меньше. На наш взгляд, первыми объяснения требуют ровные 0,000 у Luna 6 на Low по подписке: по открытым данным не отличить, рассуждений нет совсем или их просто не учитывают в отчёте.
Нужны чужие аккаунты и тарифы
Пока неизвестно, насколько часто встречается такое расхождение и чем оно вызвано. Ответить на это, по словам авторов, могут только независимые запуски, особенно с другими аккаунтами, тарифами и в другие даты. Полезными они считают и прогоны, где разницы не найдётся. Когда появится следующая партия данных, в материалах не сказано.
Читайте также
- GPT-6 Astra на части аккаунтов похожа на gpt-5.6-luna
- Подписку ChatGPT Plus и Pro пустили в сторонние приложения
- Подписчики Codex ждали сброса лимитов, а получили скорость
- Агент Dots от OpenAI 8 раз из 8 выбрал один стек
- Dot от OpenAI бесплатен, пока не откроет задачу в Codex
- В корпоративный Codex завозят GLM-5.3 Flash и Kimi K3
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
