Перейти к содержанию

openai

Одна ошибка в знаке стоила OpenAI трёх статей по математике

Promtime

Одна ошибка в знаке обошлась OpenAI в три статьи по алгебраической геометрии. Ошибку нашли в работе о классах Вейля на абелевых восьмимерных многообразиях, и вместе с этой работой рухнула конструкция, на которой держались ещё две рукописи. Об отзыве 7 октября 2026 года сказано в истории изменений репозитория openai/math на Github.

Коротко

  • Отозваны работа об алгебраичности классов Вейля, статья о соответствиях Куги–Сатаке для поверхностей K3 и статья о рациональной гипотезе Ходжа для произведений поверхностей K3, все три из-за одной конструкции.
  • Заодно OpenAI исправила 14 рукописей, обновила ссылки ещё в 13 и добавила 6 формализаций на Lean, так что машинно проверено 300 ключевых результатов из 719, около 42%.
  • Отозванные рукописи не стёрли, в README каждой объяснено, где дыра. Но около 58% ключевых результатов коллекции машина по-прежнему не проверяла, и ошибки там остаются возможны.

Если вы не следили: репозиторий openai/math открылся 6 октября 2026 года, и в нём было 722 рукописи в 372 семействах. По данным AICoder, на старте ни один результат не прошёл рецензирование, а модель, которая их получила, не выпущена. Как пишет TNW, эта же модель месяцем раньше стояла за работой OpenAI по уравнениям Навье–Стокса.

Ошибка в знаке в одной статье утянула за собой ещё две

Ошибка сидит в статье «Algebraicity of Weil classes on split abelian eightfolds». Из-за неверного знака перестаёт работать аргумент о сокращении членов в следе стабилизации, а с ним и конструкция, которой пользовались две зависимые работы. Поэтому OpenAI отозвала сразу три рукописи.

Кроме самой статьи о классах Вейля, под отзыв попали «Algebraicity of Kuga–Satake Correspondences for K3 Surfaces» и «The rational Hodge conjecture for products of K3 surfaces». Обе работы посвящены поверхностям K3, классическому объекту алгебраической геометрии, и обе опирались на ту же сломанную конструкцию.

Удалять их не стали. На месте каждой висит уведомление: в README объяснено, где именно пробел в доказательстве, и дана ссылка на архивную рукопись. Для исправленных статей правило похожее: прежние редакции остаются доступны через заметки о версиях в README.

Ещё 14 рукописей починили, больше всего правок в шести работах о кэлеровых многообразиях

Кроме отзыва, OpenAI переработала 14 рукописей: починила доказательства, поправила формулировки, уточнила гипотезы и зависимости. Самый крупный блок, шесть статей, касается кэлеровой программы минимальных моделей и гипотезы изобилия. В них расширены аргументы о положительности и стягиваниях и прописано, какие результаты берутся как готовые входные данные и при каких условиях.

В четырёх рукописях о липшицевых высотах и токах Ашкина–Теллера исправлены аргументы о пересечениях, присоединении к границе, условных вероятностях и сходимости, отдельно доработано доказательство для вещественно-липшицевого интерфейса. В двух работах о приручении и гиперсимплектических деформациях исправлено утверждение о равенстве конусов в «Taming implies compatibility» и добавлен пример строгого включения. Из гиперсимплектической статьи убрали лишнюю зависимость от сравнения конусов.

Ещё две правки точечные. В «Incompressible Box Transport and Finite Computation» пересмотрены оценки для проекции на тор и общих часов, а из «Exact Birch–Swinnerton-Dyer Formula from Low Selmer Corank» убрана устаревшая ссылка во введении на удалённую вспомогательную рукопись. Вслед за этим 13 других статей сослались на новые редакции сопутствующих работ, у них сменились только ссылки и даты версий.

Lean проверил 300 ключевых результатов из 719

Третья часть обновления посвящена формализациям. Lean называют язык программирования, на котором доказательство записывают так, чтобы каждый шаг проверял компьютер, а не рецензент. В истории изменений упомянуты 6 новых формализаций и ещё 5 дополнений со вспомогательными результатами. В сумме формально проверены 300 ключевых результатов из 719, около 42%.

В коротком анонсе обновления OpenAI считает так: 6 новых формализаций на Lean, 19 изменений и 3 отзыва. Компания обещает и дальше выкладывать новые формализации и найденные ошибки. Число рукописей тоже сдвинулось: на старте называли 722, теперь в README указано 719 при тех же 372 семействах, что сходится с тремя отзывами.

Сомнения звучали с первого дня. По данным TNW, математик из NYU Тристан Бакмастер считает, что OpenAI не провела должной проверки. Эндрю Сазерленд из MIT, как пишет то же издание, советовал считать такие заявления непроверенными, пока другие исследователи не смогут сами запустить модель и повторить результаты.

Почему одна дыра бьёт сразу по трём статьям

Как сказано в README репозитория на GitHub, рукописи собраны в семейства. В одно семейство входят основной результат, сопутствующие аргументы, следствия и альтернативные доказательства. Там же описана процедура: почти все результаты дала одна и та же невыпущенная внутренняя модель, ей поставили около 4 000 задач, на каждый результат в среднем ушло три часа вычислений ChatGPT Pro, а итог отфильтровали по значимости.

Отсюда и цепная реакция. Семейство устроено как дом, где верхние этажи стоят на общем фундаменте: трещина внизу заставляет освободить всё здание, даже если наверху никто ничего не ломал. Конструкция из статьи о классах Вейля была таким фундаментом для двух работ о поверхностях K3.

README на GitHub отдельно предупреждает, что в неформализованных результатах могут быть ошибки, и обещает быстро их исправлять. Как пишет TNW, для дополнительной проверки репозиторий отсылает к инструкциям Comparator.

В истории изменений не сказано, кто и как нашёл ошибку в знаке: человек, сама модель или проверка на Lean. На наш взгляд, отзыв оформлен правильно: дыра описана, старый текст лежит в архиве, зависимые статьи названы поимённо. Но отзыв датирован 7 октября, через день после запуска, а около 58% ключевых результатов машина пока не проверяла, так что похожие находки, вероятно, ещё будут.

Сколько осталось до проверки Lean

OpenAI обещает и дальше пополнять репозиторий формализациями и исправлениями, но сроков не называет. Удобнее всего следить за файлом history.md: туда попадают и отзывы, и правки. Остаётся неясным, сколько из оставшихся 419 ключевых результатов доберётся до проверки на Lean и устоят ли те, что пока подтверждены только текстом доказательства.

Читайте также

  1. OpenAI открыла на GitHub математику невыпущенной модели
  2. OpenAI готовит больше 100 решений, математики злятся
  3. OpenAI зовёт независимых математиков в советники по анонсам
  4. OpenAI тренирует агентов на договорной рутине Ironclad
  5. Агент OpenAI обошёл запрет на интернет через DNS
  6. OpenAI хочет, чтобы RL-прогон ночью ставил себя на паузу

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.