Перейти к содержанию

openai

GPT-6.1 Sol почти догнала Astra за пятую часть цены

Promtime

На максимальном уровне рассуждений одна задача из научного бенчмарка Terminal-Bench Science 0.1 обходится GPT-6.1 Sol в среднем в 5,47 доллара. Флагману GPT-6 Astra та же задача стоит 23,80 доллара, а Opus 5.5 от Anthropic 23,21 доллара.

Весь анонс OpenAI построен на таком соотношении. Новая модель почти дотягивает до Astra в агентном программировании, работе с компьютером и профессиональных задачах, а стандартные цены на входные и выходные токены у неё впятеро ниже, чем у Astra.

Коротко

  • GPT-6.1 Sol доступна в API под именем gpt-6.1-sol, а также в ChatGPT Work и Codex для подписчиков Plus, Pro, Business, Enterprise и Edu, но в обычном Chat её пока нет.
  • Модель стоит 2 доллара за миллион входных токенов, 10 долларов за миллион выходных и 0,10 доллара за миллион кэшированных, что на 95% дешевле обычного ввода и вдвое дешевле кэша GPT-6 Sol.
  • Бенчмарки опубликовала сама OpenAI, а с Sonnet 5.5 по той же цене счёт смешанный: по данным The New Stack, на AutomationBench у Sol около 36% против 44,7%.

Если вы не следили, в линейке GPT-6 у OpenAI есть дорогой флагман Astra и более доступная рабочая модель Sol. По данным The New Stack, GPT-6 Sol вышла всего за неделю до обновления, в один день с Opus 5.5 от Anthropic, а GPT-6.1 Sol появилась во вторник.

На DeepSWE v1.1 GPT-6.1 Sol сравнялась с Astra примерно за пятую часть стоимости

DeepSWE v1.1 проверяет сложные инженерные задачи в настоящих кодовых базах. Здесь GPT-6.1 Sol сравнялась с GPT-6 Astra примерно за пятую часть стоимости. Лучший результат GPT-6 Sol она превзошла на 6,4 процентного пункта, причём на более низком уровне рассуждений и дешевле.

В GDP.pdf модели отвечают на вопросы по сложным PDF с таблицами, графиками, схемами и мелким шрифтом. Документы взяты из рабочих процессов в финансах, медицине, праве и ещё семи профессиональных областях. На всех проверенных уровнях рассуждений GPT-6.1 Sol набирает больше, чем Opus 5.5 с фолбэками, и тратит на задачу меньше половины его стоимости. По данным The New Stack, это около 32% против примерно 29%, почти как у Astra, при пятой части её стоимости на задачу.

AutomationBench 1.0.6 проверяет агентов на сквозных бизнес-процессах, где задействованы 47 инструментов из продаж, маркетинга, операций, поддержки, финансов и HR. На среднем уровне рассуждений GPT-6.1 Sol на 2,2 п.п. обходит Opus 5.5 примерно за треть стоимости. При той же настройке она на 4,8 п.п. сильнее GPT-6 Sol. В сноске OpenAI оговаривает, что точка для Claude Fable 5.1 занижает её реальную стоимость: в расчёт не вошли фолбэки, которые понадобились примерно в 40% задач.

В OSWorld 2.0 GPT-6.1 Sol отстаёт от Astra на 2,1 п.п. при седьмой части стоимости задачи

OSWorld 2.0 проверяет агентов на длинных сценариях работы за компьютером, бытовых и профессиональных. OpenAI приводит частичную награду на офлайн-наборе версии v2026.08.08. На максимальном уровне рассуждений GPT-6.1 Sol обходит там GPT-6 Sol на семь п.п. меньше чем за половину стоимости. От Astra на том же уровне она отстаёт на 2,1 п.п., а задача обходится ей примерно в седьмую часть стоимости.

В Terminal-Bench Science 0.1 собраны научные сценарии: анализ данных, симуляции, доказательство теорем. На максимальном уровне рассуждений GPT-6.1 Sol набирает больше чем вдвое против GPT-6 Sol меньше чем за половину стоимости задачи, а по цене выходит более чем на 75% дешевле Opus 5.5 и Astra. Лучший результат среди протестированных моделей всё равно у GPT-6 Astra, 68,1%, и для самых трудных научных задач OpenAI советует именно её.

У Sonnet 5.5 выше результат на AutomationBench, но задача у неё почти вчетверо дороже

В анонсе OpenAI Sonnet 5.5 не упоминается. По данным The New Stack, Anthropic выпустила её в понедельник по тем же 2 доллара за миллион входных и 10 долларов за миллион выходных токенов. Издание пишет, что общих бенчмарков у двух моделей мало, а там, где они есть, результаты расходятся.

На DeepSWE у Sonnet 5.5 71%, у GPT-6.1 Sol около 75%. На AutomationBench расклад обратный: у Sol около 36%, у Sonnet 5.5 44,7%. Зато задача у Sol стоит 0,30 доллара, а у Sonnet 1,14. The New Stack добавляет, что при таких результатах использование Astra в большинстве сценариев будет трудно оправдать.

На низком уровне рассуждений доля ответов с фактической ошибкой упала с 11,4% до 7,7%

Фактическую точность OpenAI проверяла на обезличенных разговорах из ChatGPT, в которых пользователи отметили ошибку предыдущей модели. Сильнее всего GPT-6.1 Sol улучшилась на низком уровне рассуждений: доля ответов хотя бы с одной фактической ошибкой снизилась с 11,4% у GPT-6 Sol до 7,7%, примерно на 32%. На всех проверенных уровнях её доля ошибок отличается от показателя Astra не больше чем на 1,9 п.п. при стоимости задачи меньше пятой части.

В оценках безопасности и согласованности модель тоже приблизилась к Astra. В трудных сценариях она реже, чем GPT-6 Sol, умалчивает о сломанном инструменте поиска, нарушает явные запреты и допускает несанкционированные результаты в агентных задачах. По данным The New Stack, о сломанном поиске она не сообщает и пытается угадать ответ в 2,8% случаев. Попыток обойти автоматического проверяющего безопасности не зафиксировано, как и у GPT-6 Astra и GPT-6 Sol.

Зачем агентам кэшированный ввод за 0,10 доллара

Агент работает циклами и на каждом шаге заново отправляет модели одни и те же инструкции, описания инструментов и накопленную историю. Если начало запроса совпадает с уже обработанным, эти токены считаются кэшированными и оплачиваются по сниженному тарифу. Похоже на копицентр, где свёрстанный макет повторно печатают почти даром, а полную цену берут только за новые страницы.

OpenAI прямо связывает цену с агентами: дешёвый кэш даёт разработчикам больше возможностей строить агентов, которые переиспользуют контекст между запросами. Миллион кэшированных токенов стоит 0,10 доллара, это на 95% меньше стандартного ввода и на 50% меньше кэша GPT-6 Sol. По данным The New Stack, базовые цены остались прежними. В X OpenAI называет модель самой экономичной для своего уровня производительности из доступных сегодня.

Все эти бенчмарки опубликовала сама OpenAI. По её собственному признанию, тесты фактической точности и безопасности нарочно сделаны трудными и не показывают, как часто модель ошибается в обычной работе. Странно, на наш взгляд, что при цене в 2 и 10 долларов модель попала в ChatGPT Work и Codex, а до обычного Chat так и не дошла.

Когда ждать Ultrafast и Chat. В ближайшие дни OpenAI обещает выпустить GPT-6.1 Sol Ultrafast. В Codex эта версия должна генерировать токены до 8 раз быстрее стандартной скорости. Цену Ultrafast и её появление в API компания не называет. Срок, когда GPT-6.1 Sol станет доступна в обычном Chat, тоже не объявлен.

Читайте также

  1. Цены за токен у GPT-6 Sol и Luna упали вдвое и больше
  2. Цена GPT-6 Astra в API: 10 и 50 долларов
  3. Pro за 200 долларов у OpenAI вернётся с половиной лимита
  4. OpenAI отказалась выпускать новую модель из-за безопасности
  5. OpenAI готовит три тарифа API, старший от 50 долларов
  6. GPT-6 научили чаще попадать в кэш промптов

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.