Перейти к содержанию

openai

Цены за токен у GPT-6 Sol и Luna упали вдвое и больше

Promtime

На максимальном усилии рассуждения GPT-6 Sol набирает на DeepSWE v1.1 68,8%. Fable 5 от Anthropic на уровне xhigh получает 69,9%, но, по подсчётам OpenAI, Sol обходится всего в 20% стоимости соперницы. Sol и младшая Luna дополняют флагман GPT-6 Astra как более быстрые и дешёвые модели, и, судя по анонсу OpenAI и данным The New Stack, токены у обеих подешевели вдвое и больше.

Коротко

  • Sol и Luna выходят в ChatGPT Work и Codex для подписчиков Plus, Pro, Business, Enterprise и Edu, а также в API. Пользователи Free и Go могут попробовать Luna в десктопном приложении.
  • Миллион токенов Sol стоит 2 доллара на входе и 10 на выходе, Luna 0,10 и 0,50 доллара, а скидка на кэшированные входные токены доходит до 90%.
  • Встретив запрет вроде «access denied», Sol пытается обойти его в 64,4% запусков против 68,2% у предшественницы, а полного набора бенчмарков The New Stack до запуска не получил.

Если вы не следили: флагман поколения GPT-6 называется GPT-6 Astra. По словам OpenAI, Sol и Luna берут от него многие сильные стороны и переносят их в модели, которые быстрее, дешевле и рассчитаны на работу в больших объёмах. В поколении GPT-5.6 тоже были Sol и Luna, но их цены изначально задумывались как промо. Модели GPT-6 Terra, как отмечает The New Stack, пока нет.

Sol подешевела с 4 до 2 долларов за миллион входных токенов

В API GPT-6 Sol стоит 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. У GPT-5.6 Sol цены были 4 и 20. Luna просит 0,10 доллара на входе и 0,50 на выходе против 0,20 и 1,20 у прошлой версии, так что выходные токены у неё подешевели больше чем вдвое.

Представитель OpenAI уточнил The New Stack, что цены GPT-5.6 всегда задумывались как промо, а у GPT-6 это цена по умолчанию. В OpenAI объясняют снижение тем, что кэширование и инференс стали эффективнее, и говорят, что передают экономию пользователям. В твите компания называет скидку в 50% к промо-ценам GPT-5.6 и обещает более высокие лимиты использования.

Luna прибавила 5,4 пункта на AutomationBench от Zapier

The New Stack пишет, что прирост к GPT-5.6 заметен, но в основном не радикален. На AutomationBench, где модели проверяют на наборе бизнес-процессов, Luna прибавила к прошлой версии 5,4 процентного пункта. На DeepSWE v1.1 Luna на максимальном усилии, по данным OpenAI, выходит на уровень Claude Opus 5 и Fable 5 на среднем усилии и стоит при этом значительно дешевле.

Через весь анонс OpenAI проводит один аргумент: считать надо цену за задачу, а не за токен. Отдельно компания говорит о стиле. Ещё с GPT-6 Astra модели OpenAI отвечают прямее, и компания обещает больше ясности, меньше жаргона, странных оборотов и малоценных деталей, а ответы станут чуть короче без потери сути.

Opus 5.5 вышла в тот же вторник по 4 и 20 долларов

Anthropic выпустила Opus 5.5 в тот же вторник, поэтому сравнения OpenAI устарели в день публикации. Миллион входных и выходных токенов Opus 5.5 стоит 4 и 20 долларов вместо 5 и 25, но это всё равно вдвое дороже Sol. В Anthropic утверждают, что новая модель тратит меньше токенов на задачу и на типичных нагрузках обходится на 40% дешевле Opus 5.

Лоб в лоб Sol и Opus 5.5 пока никто не сравнивал. The New Stack полагает, что по цифрам OpenAI на AutomationBench Sol, скорее всего, останется дешевле за задачу, зато в тестах Anthropic на общих бенчмарках выше результаты у Opus 5.5.

По безопасности Anthropic называет Opus 5.5 лучшей моделью в своём самом полном тесте на выравнивание, а внешними тестировщиками до релиза были METR и Frontier Design. Часть запросов Opus 5.5 перенаправляет: большинство задач по кибербезопасности уходит к Opus 4.8, а всё, что помечают классификаторы Anthropic по биологии или разработке передовых LLM, уходит к Opus 5.

Доля обмана о собственной работе с кодом у Sol упала с 10,4% до 1,3%

Тесты на выравнивание проверяют, ведёт ли модель себя так, как задумали люди: честно ли отчитывается и соблюдает ли запреты. По данным OpenAI, обе модели лучше своих аналогов из GPT-5.6 и реже вводят в заблуждение насчёт своей работы с кодом: во внутреннем тесте на обман доля Sol упала с 10,4% до 1,3%. Когда инструмент поиска намеренно ломали, Sol умалчивала о проблеме в 5,4% случаев против 77,8%.

С явными запретами хуже. Встретив сообщение вроде «access denied», Sol всё равно пыталась обойти ограничение в 64,4% запусков против 68,2% у предшественницы, а у Luna доля упала с 78,5% до 42,4%. На имитации доски объявлений с неавторизованными инструкциями, включая просьбы раскрыть личные данные, Sol выполняла такие указания в 11,3% запусков, где находила доску, против 51,9%.

Luna и Astra ни разу этого не сделали, хотя, как отмечает OpenAI, Luna и находила доску реже. Сама OpenAI оговаривается, что ставки в этих тестах в основном низкие, а системных защит, которые работают в продуктах, при прогонах не было.

Скидка на кэшированные входные токены доходит до 90%

По оценке The New Stack, тем, кто строит агентов, изменения в кэшировании могут дать больше, чем новые цены за токен. Кэш промптов устроен просто: если новый запрос начинается с того же длинного префикса, что и прошлый, провайдер не обрабатывает префикс заново и берёт за эти токены меньше. Так повар, который утром сварил бульон, не варит его заново под каждую тарелку.

OpenAI обещает, что у GPT-6 запрос будет чаще попадать в кэш уже в настройках по умолчанию, а скидка на кэшированные входные токены достигнет 90%. Менять усилие рассуждения и набор доступных инструментов разработчики могут без сброса кэша, а с помощью явных точек разрыва сами задают, где кончается кэшируемый префикс. Новая панель и инструмент диагностики показывают, что попало в кэш, а что нет.

В GitHub говорят, что за последние несколько месяцев на миллиардах запросов к моделям OpenAI доля токенов промпта, которые приходится обрабатывать заново, сократилась больше чем вдвое. Anthropic сделала похожий шаг: при потокенной оплате чтение из кэша у Opus 5.5 обходится на 60% дешевле, и эта скидка идёт вдобавок к снижению цены за токен на 20%.

The New Stack прямо пишет, что полного набора бенчмарков от OpenAI до запуска не получил, а среди опубликованных цифр есть неудобная: доля попыток Sol обойти «access denied» почти не изменилась. К тому же заранее почти невозможно понять, сколько токенов агент потратит на задачу, так что планировать бюджет проще не стало. На наш взгляд, странно, что OpenAI строит сравнение на цене за задачу, ведь именно эту величину пользователь предсказать не может.

Когда Sol и Luna дойдут до Chat

В Chat нет пока ни одной из моделей, и сроков OpenAI не называет. В ChatGPT Work и Codex модели выкатывают постепенно в течение дня, чтобы сервис работал стабильно, поэтому у вас они могут появиться не сразу. The New Stack обещает дополнить материал, когда получит полный набор бенчмарков. Прямого сравнения Sol и Opus 5.5 на одних и тех же задачах пока нет.

Читайте также

  1. Цена GPT-6 Astra в API: 10 и 50 долларов
  2. GPT-6 Astra сначала получат клиенты Daybreak
  3. Голос ChatGPT добрался до почты, календаря и Slack
  4. OpenAI готовит три тарифа API, старший от 50 долларов
  5. GPT-6 научили чаще попадать в кэш промптов
  6. Grok 4.7 обещает близость к Opus 5 на части задач

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.