openai
После снижения цены на 80% Luna вышла в лидеры SQL
Promtime
openaiOpenAI снизила цену GPT-5.6 Luna на 80%, и в агентном SQL-бенчмарке MotherDuck модель на максимальном усилии вышла на первое место с точностью 99,8% при цене в пять раз ниже прежнего лидера, Gemini-3-Flash на низком усилии. Результаты опубликованы в блоге MotherDuck.
Коротко
- В агентном SQL-бенчмарке MotherDuck модель Luna на максимальном усилии сместила с первого места Gemini-3-Flash на низком усилии, сохранив точность 99,8%, а стоимость прогона оказалась в пять раз ниже.
- На бенчмарке семантического моделирования расходы упали в десять раз по сравнению с Luna неделей ранее, и дополнительный двукратный выигрыш в MotherDuck связывают с улучшениями кэширования модели.
- В DeepSWE Luna отстаёт от Fable на 3% при цене менее одной десятой, а ответ с низкой задержкой, по расчётам команды, обходится дешевле полуцента с учётом затрат на модель и базу данных.
Почему это важно Экономика агентной аналитики, судя по всему, перестаёт упираться в стоимость интеллекта: если точный SQL стоит доли цента, ограничителем становятся задержка хранилища и качество описания предметной области. Для дата-команд это меняет приоритеты вложений, поскольку документирование бизнес-логики и регулярные прогоны оценок дают больше отдачи, чем выбор самой сильной модели. Вероятно, в выигрыше окажутся те, кто строит обвязку без привязки к одной лаборатории.
MotherDuck зафиксировала десятикратное падение расходов на семантическом моделировании
Снижение цены команда заметила в собственных прогонах сразу, и поначалу там предположили ошибку в замерах. На бенчмарке семантического моделирования расходы оказались в десять раз ниже, чем у Luna неделей ранее. Дополнительный двукратный выигрыш в MotherDuck связывают с улучшениями кэширования модели.
В бенчмарке DeepSWE Luna уступает Fable 3% при цене менее одной десятой. Сопоставимым по масштабу сдвигом в MotherDuck называют выход Opus 4.5, после которого модели, по оценке команды, стали практичны для профессиональных объёмов кода; Luna при этом занимает новый участок кривой цена/качество, оставаясь быстрой и дешёвой.
Замеры MotherDuck проводит через OpenRouter в собственной обвязке. Такой подход в команде объясняют возможностью прогонять модели любых фронтирных лабораторий в течение нескольких часов после выхода: интеллектуальную собственность там предлагают развивать на уровне обвязки и контекстного слоя, а саму модель рассматривать как взаимозаменяемый товар.
Аналитические движки бывают в 1000 раз быстрее транзакционных на подходящей нагрузке
Пока один ход агента занимал десятки секунд, ускорение базы данных слабо влияло на общее время ответа. После удешевления и ускорения модели узким местом, по формулировке MotherDuck, становится транзакционная база: на аналитически устроенных запросах аналитические движки бывают в 1000 раз быстрее, а многие вопросы агентов устроены именно так.
Отдельно там отмечают время старта хранилища: если аналитический движок поднимается 30 секунд, система с низкой задержкой успевает за это время ответить на десять вопросов агента. Нагрузка агентов носит всплесковый характер, поэтому в MotherDuck предлагают бессерверную схему, при которой ответ обходится дешевле полуцента с учётом расходов на модель и базу данных.
Прогон оценочных наборов подешевел в пять раз
Исторически тесты в дата-командах сводились к проверкам качества данных: отсутствие дублей в идентификаторах клиентов, отсутствие NULL в ценах заказов, корректные ссылки на товары. Для агентной аналитики MotherDuck предлагает наборы из вопросов на естественном языке с заранее известными правильными ответами, вычисленными по данным.
Экономию от пятикратного удешевления прогонов в команде предлагают тратить на более частые запуски: сравнивать новые модели и подбирать настройки внутри них вместо значений по умолчанию от одной лаборатории. Дата-команда OpenAI, как отмечает MotherDuck, главной ценностью своего eval-фреймворка считала отлов регрессий в контекстном слое.
Отдельный сценарий: ловить колебания качества, когда при нехватке мощностей инфраструктура выдачи ухудшает ответы модели, и переключаться на более подходящую. Еженедельных прогонов для этого недостаточно, тем более что бизнес-логика меняется, и запуск новой программы скидок способен сломать расчёт выручки у агента.
Что дальше Детали бенчмарка семантического моделирования MotherDuck обещает раскрыть в отдельной публикации, сроки не называются; предварительный обзор результатов команда уже выложила. Практические шаги, которые она предлагает сейчас, сводятся к замене крупной модели на низком усилии на Luna на максимальном.
Дальше в MotherDuck ожидают проявления парадокса Джевонса: удешевление ответов ведёт к росту числа запросов, от параллельной проверки пяти гипотез до предварительного расчёта ответов на типовые вопросы клиентов вместо ожидания выбора из списка.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
