Перейти к содержанию

openai

GPT-6 Astra на части аккаунтов похожа на gpt-5.6-luna

Promtime

Авторы неофициального расследования, опубликованного на Pages, десятки раз просили Codex нарисовать одного и того же пеликана в SVG. Около половины рисунков вышли аккуратными, остальных классификатор изображений в основном принимал за уток и чаек. Исход определял не промпт и не настройки, а аккаунт ChatGPT: на части аккаунтов под именем gpt-6-astra, судя по данным авторов, работает что-то очень похожее на gpt-5.6-luna.

Коротко

  • С 20 сентября около 09:00 UTC на затронутых аккаунтах ChatGPT ответы Codex стали примерно на 25% короче и шли с другой скоростью, хотя сервер по-прежнему сообщает модель gpt-6-astra.
  • Настоящая gpt-6-astra в проверочных прогонах выдавала текст ответа со скоростью 32,5–33,8 токена в секунду, поэтому скрипт авторов считает аномальным всё, что выходит за пределы 30,5–36,5.
  • Все данные собрала одна команда, которая по очереди работала на множестве аккаунтов ChatGPT Pro, поэтому неизвестно, видят ли то же самое обычные пользователи с одним аккаунтом.

Если вы не следили, пеликана на велосипеде в SVG как неформальный тест придумал Саймон Уиллисон, и его давно гоняют на десятках моделей, начиная с GPT-3.5 Turbo: картинка хорошо показывает разницу, которую иначе трудно заметить. По данным Simon Willison’s Weblog, GPT-6 Astra вышла для разработчиков 5 сентября 2026 года. Вскоре Уиллисон сравнил её пеликанов на разных уровнях рассуждений с рисунками GPT-5.6 Sol, Terra и Luna.

Сбой начался 20 сентября около 09:00 UTC и затронул больше половины аккаунтов, работавших после этой даты

До 20 сентября в данных авторов не было ни одного затронутого аккаунта. После этой даты больше половины использованных аккаунтов вели себя иначе, и разрыв статистически сильный: тест Фишера даёт p = 2·10⁻¹². Аккаунт считался затронутым, если аномальными были не меньше 30% его длинных ответов, и аккаунты чётко делились на две группы.

Поведение держится за аккаунт. Первая половина сессий аккаунта предсказывает вторую с корреляцией ρ = 0,79, а два аккаунта, работавшие в один и тот же час, могут вести себя по-разному. Авторы исключили уровень рассуждений, израсходованную квоту, время с первого использования аккаунта, версию и настройки Codex, промпт и контекст.

Видно сдвиг и по скорости. Обычная раздача gpt-6-astra упирается примерно в 34 токена в секунду, и за две недели до 20 сентября быстрее почти ничего не приходило. Затем доля длинных ответов быстрее этого предела стала ненулевой каждый день: 2,8% 20 сентября, 9,7% 21-го, 2,8% 22-го и 8,0% 23-го.

На затронутых аккаунтах ответы примерно на 25% короче, а прерывают их примерно в 20 раз чаще

Пеликаны здесь лишь самый наглядный симптом. В пересчёте на аккаунт ответ на затронутых примерно на 25% короче (p = 3·10⁻⁵), а пользователи прерывают ход модели примерно в 20 раз чаще (p = 0,009). Значит, под удар попадает и обычная работа в Codex.

Рисунки оценивали готовой моделью CLIP по двум вопросам: пеликан ли это и хорошая ли это иллюстрация. Оценки распались на две группы с явным зазором. Отдельно авторы прогнали текстовый тест из 12 вопросов, и на всех 12 ответы затронутых аккаунтов оказались менее похожи на astra (тест Уилкоксона, p = 0,0005).

Эффект воспроизводится по запросу. На одинаковой машине, с тем же промптом и настройками менялся только аккаунт: на одном все прогоны были нормальными, на другом большинство аномальными. Авторы оговаривают, что проверено по одному аккаунту каждого типа, а затронутый аккаунт в этом сравнении работал в контейнере, нормальный же прямо на хосте.

Ближе всего к подменным ответам оказалась gpt-5.6-luna, но этот вывод авторы считают лишь наводящим

Для сравнения авторы гоняли те же промпты на каждой доступной модели, запрошенной явно, и сопоставляли стиль рисунков, формулировки и скорость. Ближе всего вышла gpt-5.6-luna. Но сравнение с luna выбрали после предварительного просмотра данных, и его p = 0,016 авторы сами относят к наводящим результатам, а не к сильным.

Разница между этими моделями в цене огромная. По данным AI Weekly, миллион токенов у Astra стоит 10 долларов на входе и 50 на выходе, у Luna 0,20 и 1,20 доллара. Там же приводится пример: пеликан на максимальном уровне рассуждений стоил у Astra 63,21 цента за 12 638 выходных токенов, у GPT-5.6 Luna 1,57 цента за 13 040.

Скрипт is_my_astra_fake.py засекает только скорость текста после рассуждений

Проверить свой аккаунт авторы предлагают сами. Скрипту нужны залогиненный codex CLI и Python 3.8+ со стандартной библиотекой. Он отправляет через ваш Codex от 3 до 9 коротких запросов к gpt-6-astra, тратя немного квоты, и читает тайминги из локальных логов сессий. По словам авторов, наружу он ничего не отправляет, а строка с аккаунтом только печатается в терминал.

Таймер включается, когда рассуждение закончилось и пошёл текст ответа, поэтому сеть, очередь и запуск в замер не попадают, и медленное соединение результат не портит. Примерно так тренер засекает темп бегуна уже на дорожке, и пробки по дороге на стадион на результат не влияют.

Прогоны идут раундами по три параллельных запроса, максимум три раунда. YES (код выхода 1) означает, что хотя бы 2 из 3 прогонов в раунде шли заметно быстрее или медленнее настоящей astra. NO (код 0) значит, что три раунда выглядели нормально, а UNKNOWN (код 2) выдаётся, если Codex упал или чистых замеров мало.

Причину авторы назвать не могут: с клиентской стороны эксперимент или когорта маршрутизации на уровне аккаунта, политика для аккаунта и распределение нагрузки выглядят одинаково, а luna опознана лишь статистически. Вердикт NO тоже не доказывает, что всё в порядке, ведь затронутые аккаунты ведут себя с перебоями, и в одном из трёх раундов такой аккаунт выглядел нормально. На наш взгляд, хуже всего то, что сервер продолжает отвечать «gpt-6-astra», и разницу видно только по косвенным замерам.

Что покажут чужие прогоны скрипта

Скрипт выложен прежде всего затем, чтобы понять, касается ли аномалия обычных пользователей с одним аккаунтом. Авторы просят публиковать вердикт YES или NO, дату и пометку, один ли у вас аккаунт, но без почты и логов сессий. Если вышло NO, а работа всё равно кажется странной, они советуют повторить проверку позже. Когда и чем закончится эта история, пока неизвестно.

Читайте также

  1. GPT-6 Astra сначала получат клиенты Daybreak
  2. Fable 5.1 отказалась бить фигуру, но газ на плиту ставила
  3. Слепок памяти выдаёт токен и выпускает Codex из песочницы
  4. GPT-5.5 уходит из Codex 14 октября, в API остаётся
  5. Юристы и рекрутеры OpenAI сами перешли на Codex
  6. Час ожидания в Codex стоит до 188 миллионов токенов

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.