benchmarks

73% на OSWorld 2.0 и две трети цены конкурентов

Promtime

benchmarks

Simular заявила, что её десктопный агент Sai решает 73% задач бенчмарка OSWorld 2.0, собранного из 108 длинных рабочих сценариев, на каждый из которых у квалифицированного специалиста уходит больше часа. Обновлённые результаты компания опубликовала в четверг, о прогоне бенчмарка подробно рассказывает Thenewstack.

Коротко

  • Sai работает с полноценными десктопными приложениями и веб-страницами, вызывает API и пишет код, комбинируя фронтирные модели со специализированными, которые отвечают за поиск элементов интерфейса, рассуждение и проверку результата.
  • Для сравнения Simular приводит 62,57% у GPT-5.6 Sol по данным OpenAI и 70,57% у Opus 5 по данным Anthropic, причём собственный результат достигнут примерно за две трети их стоимости.
  • Ставка Simular на нейросимволический подход означает, что решённая задача записывается в код и воспроизводится одинаково, поэтому обработка сотого счёта обходится дешевле, чем первого, а стоимость агента остаётся, по обещанию компании, доступной для частных пользователей.

Спор идёт не столько о процентах, сколько о цене единицы полезной работы: агент, закрывающий офисную рутину, конкурирует со стоимостью человеческого часа, и цена прогона становится таким же показателем, как точность. Ставка Simular выглядит как попытка вынести часть планирования из модели в код и тем самым сбить счёт за токены. Проверить это извне пока трудно: цифры опубликованы самой Simular и опираются на её собственный прогон бенчмарка.

OSWorld 2.0 вышел 26 июня и измеряет задачи в часах

OSWorld 2.0 выпустила лаборатория Executable Language Grounding (XLANG Lab) из группы HKU NLP Университета Гонконга: релиз состоялся 26 июня, обновление вышло 8 августа. В отличие от первой версии, где задачи занимали минуты, здесь они измеряются часами и требуют работы сразу с несколькими источниками данных.

Типовые сценарии: собрать чеки, разбросанные по почте и отчётам о расходах, отреагировать на сообщение, пришедшее в середине работы, точно следовать инструкции вроде правил возмещения расходов и разобраться с противоречивыми данными. В Simular считают этот набор самым надёжным открытым бенчмарком отрасли и наиболее близким к реальной работе.

Ранее открытый агент Simular Agent S первым превзошёл человеческий уровень на OSWorld 1.0 в декабре прошлого года. Сама Simular базируется в Пало-Альто, описывает себя как исследовательскую агентную компанию и основана бывшими исследователями Google DeepMind Ang Li (CEO) и Jiachen Yang (CTO). Сам агент Sai вышел в марте этого года.

Sai делает примерно в 1,5 раза меньше вызовов модели

Экономию Simular объясняет нейросимволическим планированием: Sai выполняет больше действий за ход и в среднем примерно в 1,5 раза меньше вызовов модели, чем чистые модели. Роль символического языка играет Simulang, скилл Claude Code для десктопной автоматизации на macOS, на котором агент планирует и выполняет длинные подзадачи.

Размер входа удерживается в границах адаптивным суммированием, а постоянный префикс промпта сохраняется как можно дольше до момента сжатия, что улучшает кэширование. Планирование в коде даёт доступ к ключевым данным задачи в оперативной памяти на всём протяжении выполнения. Для локализации элементов интерфейса, чистого рассуждения и проверки вызываются отдельные специализированные модели, чтобы не тратить дорогие на шаги, где полный контекст не нужен.

CTO Simular Jiachen Yang говорит The New Stack, что агенты для повседневной необходимой работы, вроде поиска кандидатов, сверки счетов или подборки новостей, не должны разорять пользователя только потому, что базовая модель обучалась решать открытые математические гипотезы. «Потомки сочтут нелепым, что сегодня модели всё ещё строят именно так», говорит он.

Sai решал Chrome Dino как задачу программирования

Sai, GPT-5.6 Sol и Opus 5 проверяли в том числе на Chrome Dino: повторяющейся игре в реальном времени, где нужно набрать заданный счёт на живой странице. Sai измерил по сырым пикселям линию земли, скорость препятствий и собственную задержку ввода, а затем написал и запустил на виртуальной машине управляющий цикл одним вызовом execute.

Вторая показательная задача, под номером 28, называется записью на вакцинацию: агент получает письмо о необходимых прививках, скан прививочной карты на рабочем столе и сайт бронирования с ограничениями по цене, расстоянию и дате, тот же сценарий проходили GPT-5.6 Sol и Opus 5.

Santiago Valdarrama пишет в LinkedIn, что работа на полном десктопе, а не только в браузере или через API, открывает класс задач, недоступных большинству агентов, поскольку многие приложения блокируют стандартную автоматизацию. Baljinder Lally в той же дискуссии добавляет, что демонстрации выглядят убедительно, но надёжность даёт сочетание ограничителей, наблюдаемости и контрольных точек с участием человека.

Когда результаты дойдут до лидерборда

Результаты Sai пока не отображаются на официальном сайте OSWorld 2.0, как это было с первой версией бенчмарка. В Simular говорят, что подают их в лидерборд и загружают трассы выполнения на Hugging Face, а публикацию собственных цифр на своём сайте называют обычной практикой отрасли, ссылаясь на OpenAI и Anthropic.

Сроки появления строки в лидерборде OSWorld 2.0 не называются, как и конкретная цена прогона: Simular ограничивается оценкой примерно в две трети затрат GPT-5.6 Sol и Opus 5, а также обещанием, что стоимость останется доступной и для частных пользователей, и для компаний.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.