GeneBench-Pro это бенчмарк из 129 задач по вычислительной биологии: геномика, количественная биология, трансляционная медицина. Задачи проверяют не знание фактов, а способность модели делать исследовательские суждения: справляться с неоднозначностью, пересматривать гипотезы и выбирать верный путь анализа.
Каждая задача построена синтетически с известной причинной структурой, поэтому ответы оцениваются детерминированно. 82 из 129 задач проверяли внешние эксперты.
Лучшая модель GPT-5.6 Sol набирает 28.7% на максимальном уровне reasoning и 31.5% в Pro-режиме. Год назад на исходном GeneBench модель GPT-5 давала меньше 5%. Одна задача требует у человека 20-40 часов работы при инференсе в несколько долларов. OpenAI открывает 10 задач на Hugging Face и передаст 50 задач сервису Artificial Analysis для независимой оценки.

