openai
Час ожидания в Codex стоит до 188 миллионов токенов
Promtime
openaiМодель пообещала опрашивать логи реже. Через 0,3 секунды goal-режим Codex запустил следующий ход, и, как разобрал Relux, за 48 минут таких ходов набралось 173, каждый с перечитыванием 120–470 тысяч токенов контекста.
Коротко
- Из 3808 сессий Codex за июль, август и сентябрь 2026 года те 52, где был включён goal-режим, съели половину от 59,2 миллиарда входных токенов, а час ожидания обходился в 83–188 миллионов.
- Goal перезапускает модель через 0,03 секунды после конца хода, а ожидание засчитывается, только если в этом ходу она опросила живой процесс, и каждая такая проверка стоит полного контекста заново.
- Инструмент паузы clock.sleep объявлен в каталоге у одной модели, gpt-6-astra, остальным его включают флагом вручную, а формулу перевода токенов в проценты недельного лимита никто не публиковал.
Если вы не следили: летом подписчики жаловались, что лимит утекает на мелких задачах. По сообщениям на форуме OpenAI Developer Community, 22 августа 2026 года пользователь плана ChatGPT Pro 5x писал, что выбрал недельную квоту за 12 часов на настройке Extra High, а днём раньше другой собирался отменить подписку. Внятного разбора причин там не было, был запрос на прозрачность расчёта.
За 48 минут goal-режим сделал 466 вызовов модели
Оркестратор ждал дочерних агентов. Работал он на muse-spark 1.3 через провайдер opencode. За 48 минут goal-режим запустил 173 продолжения, в сумме 466 вызовов модели и 149 миллионов входных токенов, пока провайдер не ответил 429. Из 181 хода сессии 135 состояли ровно из одной команды: прочитать журнал событий дочернего процесса.
Опрос возвращался меньше чем за секунду, медианный ход длился десять секунд, средний семнадцать. Растянуть его не вышло: muse-spark передавал числа в аргументах как дробные, 60000.0 вместо 60000, и парсер Codex такие вызовы отклонял. Все 10 вызовов write_stdin и 23 из 25 вызовов с yield_time_ms падали с ошибкой вида invalid type: floating point. Потолок одного похода в шелл остался десятисекундным.
52 сессии из 3808 съели половину входных токенов
Для разбора собраны все роллауты Codex с двух машин за июль, август и сентябрь 2026 года: 3808 файлов, 59,2 миллиарда входных токенов и 129 миллионов выходных, версии CLI от 0.144 до 0.154. Goal-режим был включён в 52 сессиях, полутора процентах, и на них пришлось 29,2 миллиарда входных токенов. Семь самых дорогих сессий архива, от 1,8 до 5,7 миллиарда каждая, все с goal; самая тяжёлая сессия без него весит 1,2 миллиарда.
Лимит видел ту же картину. За десять недель недельное окно тринадцать раз доходило до 99% и одиннадцать раз до 100%, а ошибка об исчерпании лимита встречается в 28 календарных днях. От начала окна до 99% проходило в медиане 25 часов, в самом быстром случае 7, в самом медленном 93. Пятичасовое окно за тот же период кончилось дважды.
97,8% входного трафика шло из кэша, и лимит это не спасло
Языковая модель не помнит разговор. На каждый шаг ей заново отправляют всю стенограмму, и она отвечает одним действием: вызовом инструмента или текстом. Цена работы равна числу шагов, умноженному на размер контекста, даже если шаг сводится к «запусти tail». Это как если бы на каждое «ну что, готово?» собеседник заново зачитывал вам всю переписку с начала.
Кэш счёт смягчает, но не убирает. В архиве 97,8% входных токенов пришли из KV-кэша, где повторно не считаются уже посчитанные значения, а у OpenAI кэшированный вход стоит 10% обычного тарифа и включается на промптах длиннее 1024 токенов. Формулу перевода токенов в проценты лимита подписки не публиковали: клиент Codex получает от сервера только процент расхода и время сброса.
Инструмент паузы объявлен в каталоге у одной модели
clock.sleep спит до двенадцати часов и просыпается от нового ввода. Он приехал в PR 28429, вышел в 0.141.0 18 июня 2026 года и носит нынешнее имя с 0.143.0 от 8 июля. Регистрируется он, только если в каталоге модели заявлена поддержка clock или флаг включён в конфиге. В каталоге clock есть у gpt-6-astra: за весь архив sleep вызывали 420 раз, из них 418 на ней.
Остальным остаётся шелл, а контракт goal в continuation.md засчитывает ожидание, только когда модель в этом же ходу опросила живой процесс. В двух goal-сессиях на gpt-6-astra час ожидания стоил 10–15 миллионов входных токенов при 55–100 вызовах со сном по 45 секунд. В Claude Code, по документации, условие между ходами проверяет отдельная маленькая модель, при долгой фоновой работе первая проверка приходит через 30 минут с удвоением интервала и не больше трёх раз без человека.
Роллауты в разборе не опубликованы, ссылки даны только на исходники Codex, а формула лимита закрыта, поэтому входные токены там считают целиком, без скидки на кэш. Свой рецепт (включить sleep флагом, ждать все дочерние процессы одним вызовом, ставить бюджет на каждую цель) автор сам называет непроверенным на масштабе. Странно, на наш взгляд, другое: goal-режим доступен всем моделям, а инструмент, без которого он вырождается в холостой цикл, объявлен в каталоге у одной.
Пока clock.sleep не выдали всем. Флаг в ~/.codex/config.toml включает инструмент любой модели: [features] sleep_tool = { mode = "always_on" }. Моделям на кастомных провайдерах, которые пишут 60000.0, он не поможет, пока не починят сериализацию чисел. Codex предлагают выдавать sleep при активной цели, делать паузу между продолжениями и принимать дробное там, где ждут целое; на момент публикации разбора утечка не закрыта. Свои сессии можно пересчитать скриптом codex-rollout-audit.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
