openai

Сохранение рассуждений подняло ARC-AGI-3 с 13,3% до 38,3%

Promtime

openai

OpenAI показала, насколько результат GPT-5.6 зависит от обвязки: на ARC-AGI-3 модель GPT-5.6 Sol набрала 13,3% в стандартной конфигурации и 38,3% после включения сохранения рассуждений между ходами и встроенного сжатия длинных диалогов. Выходных токенов при этом ушло примерно в шесть раз меньше, саму модель не меняли, говорится в руководстве OpenAI для разработчиков.

Коротко

  • GPT-5.6 обучали сразу под три архитектурных приёма: повторное использование уже проделанной работы, параллельную декомпозицию через подагентов и вынос детерминированных операций в код, каждый из них доступен через примитивы Responses API.
  • На BrowseComp GPT-5.5 в режиме Extra High три месяца назад показала 84,36% при стоимости $33,27, а GPT-5.6 Luna в том же режиме на старте 84,04% за $1,33, после чего цены снизили ещё раз.
  • Во всём семействе минимальный срок жизни кэша промптов вырос до 30 минут, точки разрыва кэша теперь задаются детерминированно внутри контекстного окна, а ключ prompt_cache_key повышает шанс попасть на прежний инференс-движок.

Почему это важно Разрыв между двумя запусками одной и той же модели на ARC-AGI-3 говорит о том, что вклад обвязки в результат агента сопоставим с вкладом самой модели. Для разработчиков это, судя по всему, меняет порядок действий при оптимизации: выбор уровня рассуждений и способа хранения контекста становится таким же рычагом, как переход на более крупную модель. Сопоставление моделей по одним лишь числам бенчмарков при этом становится менее информативным: конфигурация запуска влияет на результат не меньше.

GPT-5.6 Luna показала 84,04% на BrowseComp за $1,33

BrowseComp проверяет способность модели искать малоизвестные факты. Три месяца назад GPT-5.5 в режиме Extra High набрала на этом наборе 84,36% при общей стоимости $33,27. GPT-5.6 Luna в том же режиме на старте дала практически тот же результат, 84,04%, за $1,33, а после этих замеров цены снизили ещё раз.

На Agents' Last Exam GPT-5.6 Sol на низком уровне рассуждений обошла GPT-5.5 на высоком при неизменной обвязке. В OpenAI отмечают, что при большем объёме вычислений на инференсе Luna и Terra часто работают на уровне GPT-5.4 и GPT-5.5, оставаясь заметно дешевле, а стартапы в боевых нагрузках экономят, снижая уровень рассуждений относительно прежних значений по умолчанию.

Младшие модели семейства OpenAI предлагает под высокочастотные нагрузки, чувствительные к задержке сценарии и повторяющиеся шаги внутри агентных цепочек. В качестве примера в руководстве приводится legal-tech: разбор рукописных заметок перед агентным анализом переносится с флагмана на Terra или Luna, что, по данным OpenAI, даёт значимую экономию.

Программный вызов инструментов выносит обработку выводов за пределы контекстного окна

OpenAI делит работу агента на две части: решения, требующие суждения, и перемещение, фильтрацию и объединение данных. Если агент получил 100 документов, отбирает их по дате и ищет нужные транзакции, промежуточные результаты не обязаны проходить через контекстное окно модели. Программный вызов инструментов рассчитан именно на такие шаги.

В этом режиме GPT-5.6 пишет JavaScript, чтобы оркестрировать инструменты, запускает независимые вызовы параллельно и обрабатывает их выводы за пределами контекстного окна. Модели остаётся оценочная часть, а стоимость, задержка и деградация контекста, по описанию OpenAI, снижаются. Все три вмешательства заложены в модель на этапе обучения.

Два других приёма отвечают за преемственность работы. Сохранение рассуждений между ходами и встроенное сжатие длинных диалогов удерживают связность на длинной дистанции и избавляют модель от восстановления прежнего контекста заново. Именно эта пара дала прирост на ARC-AGI-3 при примерно шестикратном сокращении выходных токенов, отмечается в руководстве.

Многоагентный режим Responses API устроен так же, как настройка ultra в ChatGPT

В многоагентной схеме главный агент раздаёт задачи подагентам, те работают параллельно и возвращают результат для финальной сборки. OpenAI указывает, что на сложных распараллеливаемых задачах это ускоряет выполнение и повышает качество ответа. Режим включается нативно в Responses API, тот же механизм лежит в основе настройки ultra в ChatGPT.

Поведение подагентов управляемо: модель сама оценивает их нужное число и момент запуска, но явные инструкции повышают шанс, что дополнительные токены тратятся только там, где это улучшает результат. Во всём семействе минимальный срок жизни кэша промптов вырос до 30 минут, а точки разрыва кэша теперь задаются детерминированно внутри контекстного окна.

Использование ключа prompt_cache_key, по описанию OpenAI, повышает вероятность того, что запрос попадёт на тот же инференс-движок, который ранее обслуживал такой же префикс, и это снижает задержку. По данным OpenAI, стартапы за счёт новых настроек заметно улучшили долю попаданий в кэш.

Что дальше Примитивы доступны в Responses API уже сейчас: сохранение рассуждений, встроенное сжатие, многоагентная оркестрация и программный вызов инструментов включаются на стороне запроса. Цены на GPT-5.6 после стартовых замеров BrowseComp снижены ещё раз, актуальные значения OpenAI приводит в отдельной публикации. Сроки следующих обновлений семейства не называются, как и планы по дальнейшим изменениям прайс-листа.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.