openai
Цифры в блоге про Astra менялись после публикации
Promtime
openaiOpenAI изменила несколько оценочных метрик в блоге о GPT-6 Astra уже после публикации 3 сентября: заявленный уровень галлюцинаций модели сначала упал с 4,2% до 2%, а затем вернулся к исходным 4,2%. Изменения зафиксировало издание Fortune, сравнившее архивные снимки страницы анонса на разных этапах.
Коротко
- Пост планировали выложить в 14:00 по восточному времени, но широко доступным он стал почти на два часа позже; в OpenAI заявили, что отозвали публикацию по нераскрытым причинам, не связанным с цифрами.
- На FrontierMath Tier 4 (v2) оценка Anthropic Fable 5.1 прошла путь с 87,8% до 78% и сейчас держится на 83%, тогда как 97,6% у Astra не менялись.
- Черновик под эмбарго, разосланный СМИ, давал Astra 98,6% на ARC-AGI-3, в живом блоге стоит 99,99%; в OpenAI говорят, что на результаты влияют харнесс и уровень рассуждений.
Бенчмарки остаются главным способом сравнивать модели разных лабораторий, от позиций в лидербордах зависят продажи и наём инженеров. Когда цифры меняются в течение нескольких часов после анонса, а условия замера остаются в сносках, сопоставимость результатов для покупателей и инвесторов, судя по всему, снижается. Для OpenAI такой спор о честности метрик разворачивается в преддверии возможного IPO 2027 года, о котором пишет Fortune.
Уровень галлюцинаций Astra опускался до 2% и вернулся к 4,2%
Ссылка из твита OpenAI в 15:32 по восточному времени отдавала ошибку, в 15:50 её выложил Сэм Альтман, сообщив о заминке с развёртыванием блога. По словам OpenAI, пост опубликовали вскоре после 14:00 и затем отозвали по нераскрытым причинам, не связанным с бенчмарками.
Часть правок улучшила показатели Astra, тогда как результаты моделей Anthropic в тех же таблицах ухудшились. В OpenAI сказали Fortune, что заботятся о корректности оценок, и отметили, что шум в большинстве метрик достигает нескольких процентных пунктов и зависит от конкретного чекпоинта, обвязки и прогона. В первом архивном снимке страницы, сделанном в 14:23 по восточному времени, уровень галлюцинаций Astra стоял на 4,2% и сохранялся ещё в четырёх снимках, последний из которых относится к 15:11.
В шестом снимке, от 17:20, показатель оказался вдвое ниже, 2%, вместе с ним изменились ещё четыре метрики. У предшественника, GPT-5.6 Sol, доля галлюцинаций опустилась с 12,2% до 9,4%. Сейчас обе цифры вернулись к исходным значениям, а оценка Astra по программированию выросла с 57,7% до 57,9%.
На FrontierMath Astra осталась на 97,6%, оценки Fable 5.1 и Sol менялись
Astra выдаёт 97,6% на FrontierMath Tier 4 (v2), и эта цифра в снимках не менялась. Оценка Anthropic Fable 5.1 на том же тесте была 87,8% в снимке от 14:23, к 17:17 упала до 78%, а сейчас стоит на 83%. GPT-5.6 Sol прошла путь с 83% до 80,5% и обратно к 83%.
Правки начались ещё до первой публикации. В черновике под эмбарго, который OpenAI разослала Fortune и другим изданиям, результат Astra на ARC-AGI-3 указан как 98,6%, в живом блоге стоит 99,99%. Оценки всегда проверяют перед публикацией, и расхождения между черновиком и финальной версией нормальны, заявил представитель OpenAI.
Создатель теста, Arc Prize Foundation, в независимой проверке получил у Astra 99,9% при особенно мощном харнессе, наборе инструментов, доступных модели для решения задач. Со стандартным харнессом бенчмарка результат составил 63%, что всё равно выше любой другой публично доступной модели. В OpenAI отмечают, что на оценки влияют харнесс, уровень рассуждений и другие факторы.
Sol на внутреннем ExploitBench вырос с 5,5% до 11,5%
На внутренней версии кибербезопасного теста ExploitBench результат GPT-5.6 Sol вырос с 5,5% в первой версии блога до 11,5% в последующих. Не все правки играли в пользу OpenAI: на HealthBench Professional оценка Claude Fable 5.1 поднялась с 56,6% до 58,1%, а Opus 5 с 54,5% до 56,4%.
Анка Ройель и Майк Харди из Stanford Intelligent Systems Laboratory и Stanford Trustworthy AI Lab называют benchmaxxing известной в отрасли практикой: прогоны повторяют с другими условиями, это укладывается в сжатые сроки и удобнее для маркетинга. Системная карта GPT-6 Astra, по их словам, почти не описывает внутренний тест на галлюцинации и не приводит даже число заданий.
Споры об оценках возникают в отрасли не впервые. В 2025 году Meta отрицала сообщения о том, что искусственно завысила результаты Llama 4, опубликовав показатели внутренней версии модели вместо публично доступной. Бывший главный научный сотрудник Meta по ИИ Ян Лекун позже признал, что результаты бенчмарков были подтасованы.
Судьба показателя 11,5% у Sol
В OpenAI говорят, что рассматривают возврат результата GPT-5.6 Sol на внутреннем ExploitBench к 5,5%: 11,5% соответствуют уровню рассуждений, который для Sol коммерчески недоступен. Винсент Санн Чен из Snorkel AI, руководящий там исследованиями бенчмарков, считает сдвиг цифр перед запуском обычной логистикой релиза и предлагает отрасли норму: при пересмотре результатов сообщать, что именно изменилось в замере.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
