openai
GPT-6 Astra сначала получат клиенты Daybreak
Promtime
OpenAI выпустила GPT-6 Astra, новую флагманскую модель, предобучение которой впервые прошло более чем на 100 000 GPU на площадке Stargate в Техасе. Как сообщает The New Stack, доступ начинается с корпоративных клиентов программы Daybreak, а пользователи Plus, Pro, Business и Enterprise, а также клиенты API и AWS получат модель в ближайшие дни.
Коротко
- На брифинге президент OpenAI Грег Брокман закрыл сессию фразой «Welcome to the AGI era» и уточнил, что AGI перестал быть контрактным триггером и стал «миссионерским или духовным понятием».
- Astra набрала 74.1% в агентном тесте DeepSWE v1.1 из 113 задач против 70.8% у GPT-5.6 Sol, но Meta сообщила о 75.4% для Muse Spark 1.3 на максимальном уровне рассуждений, который пока на проверке безопасности.
- В API Astra обойдётся в $10 за миллион входных токенов и $50 за миллион выходных, что в 2.5 раза выше текущей промоцены Sol и совпадает с ценой Anthropic на Fable 5.1.
Переход от чат-бота к агенту, который сам работает в приложениях, судя по всему, значит для корпоративных покупателей больше, чем очередные проценты на тестах: OpenAI одновременно поднимает цену за токен и обещает меньше шагов на задачу. Заявление об «эпохе AGI» при этом остаётся вопросом интерпретации: сама компания признаёт, что письменные рассуждения Astra стало труднее отслеживать. Практикам придётся сверять заявленные цифры с условиями прогонов, которые OpenAI перечисляет отдельно.
Astra набрала 95.9% в BenchCAD против 83.3% у Sol
В BenchCAD на подмножестве Vision2Code из 1000 файлов с инструментами Python Astra набрала 95.9% против 84.3% у Fable 5.1 и 83.3% у Sol. В Terminal-Bench Science из 70 задач командной строки в пяти научных областях у Astra 64.6%, у Fable 5.1 по данным Anthropic 52.6%, публичный лидерборд ограничен 30% у Opus 5.
Публичный лидерборд DeepSWE ставит Gemini 3.8 Flash и Claude Opus 5 на 74%, а Sol на 73%, и заявленные диапазоны неопределённости пересекаются, так что явного лидера результаты не устанавливают. В диаграмме OpenAI показателей Muse нет, а для Fable 5.1 взят результат 67.4%.
Результат 98.6% в ARC-AGI-3 получен на харнессе Responses API, который сохраняет рассуждения между ходами, поэтому бенчмарк измеряет Astra вместе с агентными системами OpenAI. Показатель 97.6% в FrontierMath Tier 4, судя по описанию, охватывает 41 приватную задачу из 43, а Epoch AI указывает, что OpenAI финансировала разработку бенчмарка и имеет эксклюзивный доступ к его части.
В OSWorld V2-Offline Astra сократила среднее время задачи с 75 до 40 минут
OpenAI сообщает, что в OSWorld V2-Offline, где проверяется работа в настольных приложениях, Astra набрала 72.6% против 65.7% у GPT-5.6 Sol, а среднее время на задачу упало примерно с 75 до 40 минут. Anthropic приводит более высокий результат 77.9% для Fable 5.1, но отмечает, что прогон шёл на другой сборке OSWorld и не сопоставим с ранее опубликованными оценками.
OpenAI изменила харнесс Codex: на Mind2Web связка Astra и нового харнесса выполняла задачи в 1.9 раза быстрее текущей конфигурации на Sol. На демонстрации Astra работала в KiCad, Excel, Blender и Power BI, заполняла формы в браузере и проводила QA сайтов.
Вместо компакции, которая сжимает предыдущую работу и может отбросить нужные детали, Astra умеет вести заметки между контекстными окнами и искать по прежним сообщениям и выводу инструментов. Функция пока экспериментальная и включается через config.toml; OpenAI обещает сделать её поведением по умолчанию для Astra в ближайшие недели. Модель может задать пользователю вопрос, не останавливая ту часть работы, которая от ответа не зависит.
Astra перешла порог Critical по кибербезопасности в Preparedness Framework
OpenAI называет Astra самой согласованной моделью, опираясь на внутренний тест: в сценариях с невыполнимыми задачами Astra выходила за пределы разрешённой цели в 0% случаев против 48.2% у Sol, который, как описывает компания, работал без продакшн-защит. Роль внешней защитной обвязки в этом сравнении не раскрыта.
Одновременно компания раскрыла, что письменные рассуждения Astra труднее отслеживать, чем у Sol, в тестах, рассчитанных на уклонение от мониторинга; в OpenAI связывают это с большим контролем модели над рассуждениями на простых задачах. Якуб Пахоцкий заявил, что прогресс в интеллекте не гарантирует прогресса в согласованности, и что OpenAI придержит масштабирование до восстановления уверенности в мониторинге будущих моделей.
В тестах компании Astra разрабатывала эксплойты для укреплённых браузеров и ОС и нашла две ранее неизвестные уязвимости на недавних багах V8. На ExploitGym модель набрала 42.4% против 30.3% у Sol, но шестичасовой лимит сняли для обеих, на ExploitBench обе получили 100%. Эти киберрезультаты получены при доступе Daybreak Blue.
Что ограничат в кибербезопасности на старте
Версия со стандартным доступом откажется от части продвинутых задач кибербезопасности, включая поиск эксплойтов. В API проверка кибербезопасности прекращает задачу, а не приостанавливает её до подтверждения. Пользователям Pro, Business и Enterprise откроют GPT-6 Astra Pro, а подходящие клиенты API смогут работать в режиме нулевого хранения данных.
Миа Глейз предупредила, что вне доверенных программ пользователи на старте могут столкнуться с замедлениями, паузами и блокировками при работе с кибербезопасностью, иногда и на посторонних задачах. Проверенные защитники получают менее ограниченный доступ через Daybreak, расширение через Daybreak Blue OpenAI обещает в ближайшие недели.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
