OpenAI советует не держать GPT-6 на максимуме рассуждений

Верхние уровни рассуждений GPT-6, Extra high и Max, OpenAI советует включать только после проверки. Пробовать их стоит, когда не справился High, а оставлять, лишь если прирост окупает лишнее время и деньги. Так сказано в практическом гайде OpenAI по семейству GPT-6, где разобраны выбор модели, промпты, долгие задачи и подготовка к продакшену.
Коротко
- В гайде три модели семейства: Astra для самых трудных рассуждений, GPT-6.1 Sol для сложного кода, исследований и работы с компьютером, Luna для массовых задач с понятной целью.
- Главный способ сэкономить связан с кэшем: закэшированные входные токены стоят до 95% дешевле обычных в зависимости от модели, поэтому стабильные инструкции и справочные материалы ставят в начало промпта.
- Слабые места гайда видны сразу: цен за токен в нём нет, за тарифами отправляют на отдельную страницу, а мультиагентный режим GPT-6.1 Sol пока остаётся в бете.
Если вы не следили: по данным TechCrunch, GPT-6 Astra вышла в начале сентября 2026 года, и OpenAI подавала её как лучшую в мире модель для работы за компьютером и кода. Обновлённые Sol и Luna, по тем же данным, появились 22 сентября вдвое дешевле серии 5.6, и OpenAI объясняет снижение улучшениями кэширования и инференса. Совет не держать рассуждения на максимуме тоже звучит не впервые: в гайде OpenAI по GPT-5 писали, что многие процессы стабильно работают на medium и даже low.
Astra, GPT-6.1 Sol и Luna закрывают три класса задач
Выбор модели и уровня рассуждений OpenAI предлагает воспринимать как размен интеллекта на цену. GPT-6 Astra берут для самой трудной работы, где нужен максимум интеллекта. GPT-6.1 Sol рассчитана на сложный код, исследования и работу с компьютером. GPT-6 Luna нужна для сфокусированных задач в больших объёмах: извлечь поля из счёта, классифицировать обращения, собрать структурированное резюме.
Работать с компьютером умеют все три модели. Режим computer use даёт им пользоваться сайтами и десктопными приложениями, в том числе теми, у которых нет API: найти баг, поправить код и открыть продукт в браузере, чтобы проверить исправление. Правило простое: если шаг можно сделать через API или подключённый инструмент, делайте так, а экран оставьте для чтения, кнопок и форм.
Если вы встраиваете computer use в собственное приложение, гайд советует дать модели инструмент, который запускает код и управляет браузером или рабочим столом. Для браузеров названа библиотека Playwright, для десктопных программ PyAutoGUI.
Extra high и Max включают, только когда High не справился
В API можно задать, сколько усилий модель тратит на задачу. Low подходит для рутины вроде извлечения фактов или мелких правок, Medium для работы, где нужно суждение: спланировать фичу, сравнить варианты. High оставляют для трудной отладки, глубокого анализа и внимательного ревью. Extra high и Max тестируют там, где они поддерживаются.
В Codex совет другой: стартовать с уровня по умолчанию для выбранной модели, понижать его на простых задачах и поднимать для глубокого анализа. Отдельно настраивается скорость. Fast mode в API даёт более быстрые и стабильные ответы за более высокую цену токена, чем стандартная обработка, и подходит чат-приложениям и инструментам для кода.
Ultrafast работает и в Codex, и в API: он ускоряет генерацию токенов независимо от уровня рассуждений, но стоит дороже. Доступен он для GPT-6 Astra, а применять его советуют там, где скорость стоит наценки, например при быстрых итерациях над кодом.
Закэшированный вход обходится до 95% дешевле обычного
Самый конкретный совет по деньгам касается промпт-кэширования. Повторяющуюся от запроса к запросу часть контекста можно переиспользовать, и такие входные токены стоят до 95% дешевле незакэшированных, в зависимости от модели. Условие одно: стабильные инструкции и справочный материал идут раньше меняющихся деталей задачи, а определения инструментов остаются одинаковыми.
Где переиспользование ломается, показывают дашборд кэширования и гайд по диагностике. Считая стоимость всего процесса, OpenAI просит учитывать запись в кэш и тарифы на длинный контекст. Для длинных разговоров есть compaction: она сжимает контекст и сохраняет состояние, нужное, чтобы продолжить работу.
Перед запуском гайд предлагает прогнать типичные задачи и измерить три вещи: долю успешных решений, задержку и стоимость одной успешной задачи. Лишний контекст советуют вырезать, сохраняя нужные задаче данные, а независимые шаги запускать параллельно, чтобы один медленный не держал остальные.
Задачи на часы и дни правят на ходу через Responses WebSocket API
По словам OpenAI, модели GPT-6 берутся за задачи, которые длятся часами и днями. Для них в API есть три механизма. Mid-turn steering позволяет отправить поправку через Responses WebSocket API, пока модель работает: правка встаёт в очередь, не отменяет запущенные инструменты и не откатывает сделанное.
Асинхронный вызов инструментов даёт модели продолжать независимую работу, пока приложение гоняет что-то медленное вроде тестов; зависящее от результата начинают только после него. GPT-6.1 Sol умеет раздавать независимые подзадачи субагентам в Responses API, например изучать разные части кодовой базы, и сводить их находки в один ответ.
В Codex с GPT-6 Astra модель может спросить уточнение по ходу работы, и гайд советует заранее сказать, что можно делать без вас. Эрик Провенчер из Developer Experience OpenAI начинает с ясного задания: результат, адресат, контекст, ограничения и критерий готовности. В AGENTS.md советуют явно разрешить безопасную рутину вроде локальных тестов на одноразовых данных без доступа к продакшену.
Откуда берётся цена высокого уровня рассуждений
Уровень рассуждений определяет, сколько скрытой работы модель проделает до видимого ответа. По данным T-Minus AI, на высоком уровне модель генерирует больше внутренних токенов рассуждения, именно они дают и цену, и задержку, а тарифицируются как выходные. Как в такси со счётчиком: платите вы за весь маршрут, хотя видите только точку прибытия.
В гайде T-Minus AI от 15 июня 2026 года утверждается, что точность растёт лишь логарифмически, и цена обгоняет пользу. Там советуют по умолчанию брать medium и поднимать до high, только когда ответ явно неверен или слишком поверхностен.
Digital Applied в апрельском бенчмарке 2026 года прогнала 900 задач на пяти фронтирных моделях и трёх уровнях. По её данным, качество выросло на 8–22 пункта, плата в 4–17 раз, задержка в 5–60 раз. Точка окупаемости своя для каждой задачи: high выигрывает на AIME, medium на рефакторинге Expert-SWE, low на ревью масштаба пулреквеста.
Странно, что в гайде нет ни одной цены за токен: сравнивать модели отправляют на отдельную страницу тарифов, хотя весь документ построен вокруг размена интеллекта на цену. Не раскрыто и то, насколько Fast mode и Ultrafast дороже стандартной обработки, а единственная цифра экономии, до 95% на кэше, зависит от модели и по моделям не расписана.
Когда субагенты Sol выйдут из беты. Мультиагентный режим GPT-6.1 Sol в Responses API помечен как бета, и срок стабильной версии в гайде не называется. Неизвестно и то, получат ли Ultrafast модели Sol и Luna: сейчас он заявлен для GPT-6 Astra. Какой уровень рассуждений окупится в вашей задаче, гайд предлагает выяснять собственными тестами на типичных задачах.
Читайте также
- GPT-6 научили чаще попадать в кэш промптов
- Цены за токен у GPT-6 Sol и Luna упали вдвое и больше
- OpenAI дописала к MCP возможности специально для ChatGPT
- Подписку ChatGPT Plus и Pro пустили в сторонние приложения
- OpenAI пустила разработчиков и агентов в ChatGPT
- Codex доделывает задачи в облаке, пока ноутбук спит
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
