openai

OpenAI представила GeneBench-Pro

Promtime

openai

GeneBench-Pro это бенчмарк из 129 задач по вычислительной биологии: геномика, количественная биология, трансляционная медицина. Задачи проверяют не знание фактов, а способность модели делать исследовательские суждения: справляться с неоднозначностью, пересматривать гипотезы и выбирать верный путь анализа.

Каждая задача построена синтетически с известной причинной структурой, поэтому ответы оцениваются детерминированно. 82 из 129 задач проверяли внешние эксперты.

Лучшая модель GPT-5.6 Sol набирает 28.7% на максимальном уровне reasoning и 31.5% в Pro-режиме. Год назад на исходном GeneBench модель GPT-5 давала меньше 5%. Одна задача требует у человека 20-40 часов работы при инференсе в несколько долларов. OpenAI открывает 10 задач на Hugging Face и передаст 50 задач сервису Artificial Analysis для независимой оценки.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.