openai

После снижения цены на 80% Luna вышла в лидеры SQL

Promtime

openai

OpenAI снизила цену GPT-5.6 Luna на 80%, и в агентном SQL-бенчмарке MotherDuck модель на максимальном усилии вышла на первое место с точностью 99,8% при цене в пять раз ниже прежнего лидера, Gemini-3-Flash на низком усилии. Результаты опубликованы в блоге MotherDuck.

Коротко

  • В агентном SQL-бенчмарке MotherDuck модель Luna на максимальном усилии сместила с первого места Gemini-3-Flash на низком усилии, сохранив точность 99,8%, а стоимость прогона оказалась в пять раз ниже.
  • На бенчмарке семантического моделирования расходы упали в десять раз по сравнению с Luna неделей ранее, и дополнительный двукратный выигрыш в MotherDuck связывают с улучшениями кэширования модели.
  • В DeepSWE Luna отстаёт от Fable на 3% при цене менее одной десятой, а ответ с низкой задержкой, по расчётам команды, обходится дешевле полуцента с учётом затрат на модель и базу данных.

Почему это важно Экономика агентной аналитики, судя по всему, перестаёт упираться в стоимость интеллекта: если точный SQL стоит доли цента, ограничителем становятся задержка хранилища и качество описания предметной области. Для дата-команд это меняет приоритеты вложений, поскольку документирование бизнес-логики и регулярные прогоны оценок дают больше отдачи, чем выбор самой сильной модели. Вероятно, в выигрыше окажутся те, кто строит обвязку без привязки к одной лаборатории.

MotherDuck зафиксировала десятикратное падение расходов на семантическом моделировании

Снижение цены команда заметила в собственных прогонах сразу, и поначалу там предположили ошибку в замерах. На бенчмарке семантического моделирования расходы оказались в десять раз ниже, чем у Luna неделей ранее. Дополнительный двукратный выигрыш в MotherDuck связывают с улучшениями кэширования модели.

В бенчмарке DeepSWE Luna уступает Fable 3% при цене менее одной десятой. Сопоставимым по масштабу сдвигом в MotherDuck называют выход Opus 4.5, после которого модели, по оценке команды, стали практичны для профессиональных объёмов кода; Luna при этом занимает новый участок кривой цена/качество, оставаясь быстрой и дешёвой.

Замеры MotherDuck проводит через OpenRouter в собственной обвязке. Такой подход в команде объясняют возможностью прогонять модели любых фронтирных лабораторий в течение нескольких часов после выхода: интеллектуальную собственность там предлагают развивать на уровне обвязки и контекстного слоя, а саму модель рассматривать как взаимозаменяемый товар.

Аналитические движки бывают в 1000 раз быстрее транзакционных на подходящей нагрузке

Пока один ход агента занимал десятки секунд, ускорение базы данных слабо влияло на общее время ответа. После удешевления и ускорения модели узким местом, по формулировке MotherDuck, становится транзакционная база: на аналитически устроенных запросах аналитические движки бывают в 1000 раз быстрее, а многие вопросы агентов устроены именно так.

Отдельно там отмечают время старта хранилища: если аналитический движок поднимается 30 секунд, система с низкой задержкой успевает за это время ответить на десять вопросов агента. Нагрузка агентов носит всплесковый характер, поэтому в MotherDuck предлагают бессерверную схему, при которой ответ обходится дешевле полуцента с учётом расходов на модель и базу данных.

Прогон оценочных наборов подешевел в пять раз

Исторически тесты в дата-командах сводились к проверкам качества данных: отсутствие дублей в идентификаторах клиентов, отсутствие NULL в ценах заказов, корректные ссылки на товары. Для агентной аналитики MotherDuck предлагает наборы из вопросов на естественном языке с заранее известными правильными ответами, вычисленными по данным.

Экономию от пятикратного удешевления прогонов в команде предлагают тратить на более частые запуски: сравнивать новые модели и подбирать настройки внутри них вместо значений по умолчанию от одной лаборатории. Дата-команда OpenAI, как отмечает MotherDuck, главной ценностью своего eval-фреймворка считала отлов регрессий в контекстном слое.

Отдельный сценарий: ловить колебания качества, когда при нехватке мощностей инфраструктура выдачи ухудшает ответы модели, и переключаться на более подходящую. Еженедельных прогонов для этого недостаточно, тем более что бизнес-логика меняется, и запуск новой программы скидок способен сломать расчёт выручки у агента.

Что дальше Детали бенчмарка семантического моделирования MotherDuck обещает раскрыть в отдельной публикации, сроки не называются; предварительный обзор результатов команда уже выложила. Практические шаги, которые она предлагает сейчас, сводятся к замене крупной модели на низком усилии на Luna на максимальном.

Дальше в MotherDuck ожидают проявления парадокса Джевонса: удешевление ответов ведёт к росту числа запросов, от параллельной проверки пяти гипотез до предварительного расчёта ответов на типовые вопросы клиентов вместо ожидания выбора из списка.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.