openai

Astra заявлена лучшей в тестах работы за компьютером

Promtime

openai

По заявлению OpenAI, GPT-6 Astra показала лучшие результаты на Agents' Last Exam, AutomationBench и ScreenSpot Pro. Все три проверяют, как модель выполняет рабочие задачи за компьютером в разных профессиях, то есть кликает, ищет элементы на экране и доводит операции до конца.

В том же ряду OpenAI называет FrontierMath Tier 4, ARC-AGI 3 и TerminalBench-4.0, а для научных задач Terminal-Bench Science 0.1 и HealthBench Pro. Конкретных значений компания в этих сообщениях не приводит. Прогон на ARC-AGI-3 ранее опубликовала ARC Prize: 99,9% на связке Provider Adapter, 3 сентября.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.