openai

GPT-6 Astra опередил Claude Fable 5.1 на 35 баллов

Claude News

openai

GPT-6 Astra от OpenAI возглавил лидерборд WebDev у Code Arena с результатом 1 797 баллов и опередил Claude Fable 5.1, у которой 1 762 балла, разрыв составил 35 баллов. Цифры приводит публикация в Threads, они относятся к состоянию таблицы на 5 сентября.

Коротко

  • Таблицу WebDev формируют краудсорсингом по системе Elo: рейтинг опирается более чем на 650 тысяч голосов, поданных по 126 моделям, и итоговый балл показывает положение модели относительно остальных участников этого лидерборда.
  • По приведённой в исходной публикации цитате, GPT-6 Astra перестраивает границу Парето как лучшая по результату модель при цене 40 долларов за миллион токенов, и этот тариф совпадает с ценой последней модели Claude.
  • Claude Fable 5.1 вышла незадолго до этого и ранее возглавляла Artificial Analysis Intelligence Index, а на лидерборде WebDev по опубликованным на 5 сентября данным модель удерживает вторую строчку с 1 762 баллами.

Практическое значение здесь скорее у совпадения ценников: по приведённой оценке, обе модели находятся в одной тарифной точке, поэтому выбор под фронтенд-задачи смещается к качеству генерации, а не к экономии. Краудсорсинговые рейтинги отражают предпочтения пользователей площадки, и лидерство в такой таблице, вероятно, окажется подвижным. Верхняя строчка меняется быстрее, чем команды успевают перестраивать рабочие пайплайны под другую модель, а данные лидерборда фиксируют лишь один срез.

GPT-6 Astra идёт первым с 1 797 баллами против 1 762 у Claude Fable 5.1

Лидерборд WebDev у Code Arena посвящён веб-разработке. Первую строчку в нём занимает GPT-6 Astra от OpenAI с результатом 1 797 баллов, Claude Fable 5.1 идёт следом с 1 762 баллами, и разрыв между двумя моделями составляет 35 баллов. Приведённые цифры относятся к состоянию таблицы на 5 сентября, подтверждений, что расстановка сохранилась, нет.

Claude Fable 5.1 вышла незадолго до появления этих данных, ранее модель занимала первое место в Artificial Analysis Intelligence Index. На лидерборде WebDev по цифрам на 5 сентября она идёт второй с 1 762 баллами. Индекс Artificial Analysis и таблица WebDev остаются разными рейтингами, и первое место в одном не означает первого места в другом.

Рейтинг WebDev опирается более чем на 650 тысяч голосов по 126 моделям

Оценки на дорожке WebDev формируются краудсорсингом: таблица опирается более чем на 650 тысяч голосов, поданных по 126 моделям. Голоса подают пользователи площадки, из них складываются баллы Elo, по которым модели и расставляются в таблице. GPT-6 Astra и Claude Fable 5.1 занимают в этом списке первые две строчки.

Система Elo пришла из шахмат: она описывает относительную силу участников и выражает её одним числом, которое имеет смысл только рядом с числами остальных участников той же таблицы. Абсолютного качества сгенерированного кода такая оценка не измеряет, она фиксирует исход сравнений между моделями. В рейтингах языковых моделей ту же шкалу применяют для сравнения моделей между собой.

GPT-6 Astra назван лучшей моделью при цене 40 долларов за миллион токенов

В исходной публикации приводится оценка, по которой GPT-6 Astra перестраивает границу Парето и оказывается лучшей по результату моделью при цене 40 долларов за миллион токенов. Там же сказано, что этот тариф совпадает с ценой последней модели Claude, то есть обе модели сопоставляются в одной ценовой точке. Формулировка относится именно к этому уровню цены.

It also reshapes the Pareto frontier as the best-performing model at $40/Mtoken, which matches the latest Claude model pricing.

Граница Парето в таких сопоставлениях описывает набор моделей, каждую из которых при её цене не удаётся обойти по качеству: более высокий результат обходится дороже. Набор таких моделей меняется, когда в какой-то ценовой точке появляется более сильный результат. Смена лидера в отдельной точке означает, что прежнее сочетание цены и результата в ней уступило место другому.

Отметка в 2 000 баллов

В исходной публикации отметка в 2 000 баллов упоминается как открытый вопрос: дойдёт ли до неё верхняя строчка к концу года. Подтверждений этому нет, как и данных о том, сохранилась ли расстановка после 5 сентября, к которому относятся приведённые цифры. Дата следующего обновления лидерборда WebDev не называется.

Отдельных тарифов по GPT-6 Astra и по последней модели Claude в публикации не приведено: названа только общая точка в 40 долларов за миллион токенов, к которой привязана оценка о границе Парето. Данных о том, менялся ли этот уровень после 5 сентября, нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.