openai

OpenAI отрицает, что смотрела в чаты ради Навье-Стокса

Promtime

openai

На обвинение в нечестности с обучающими данными OpenAI ответила двумя строчками в Twitter: нет, ни человек, ни агент не заглядывал в данные пользователей ради работы над Навье-Стоксом. И да, отзывы пользователей и деидентифицированные данные идут на улучшение ChatGPT и Codex, «и так делает каждая LLM-компания».

Претензию высказал Андреас Том, профессор геометрии Технического университета Дрездена. Он заподозрил, что компания была нечестна с обучающими данными, и ответ OpenAI устроен как разделение: один вопрос отклоняется, второй подтверждается прямо.

Коротко

  • OpenAI публично отвечает на претензии математика Андреаса Тома: работа над Навье-Стоксом шла без доступа к пользовательским данным, а общее дообучение на деидентифицированных данных компания подтверждает прямо.
  • По справкам OpenAI, ChatGPT дообучается на разговорах пользователей, если те не отключили опцию, а сама компания пишет, что разрабатывает технологии, чтобы модели учили общие закономерности и не запоминали приватное о конкретных людях.
  • Ответ разделяет доступ к данным и общее дообучение, но что именно из пользовательских разговоров попадает в обучающие данные конкретных моделей, в нём не расписано ни строчкой.

Если вы не следили, вот начало истории. Том занимается несофическими группами, то есть бесконечными математическими структурами, которые нельзя приблизить конечными, и, по данным Aichatdaily, результат по ним был среди десяти, объявленных OpenAI в августе 2026 года. Там же сообщается, что в математических кругах тот текст сразу раскритиковали за отсутствие ссылок на недавние работы Тома и Габора Куна, а компания тихо поправила описание.

OpenAI разделяет два вопроса: доступ к данным и дообучение

Первый вопрос в ответе звучит так: смотрел ли кто-нибудь, человек или агент, в пользовательские данные ради работы над Навье-Стоксом. Ответ на него отрицательный, без оговорок и уточнений.

Второй: используются ли отзывы пользователей и деидентифицированные, то есть отвязанные от конкретного человека, данные для улучшения ChatGPT и Codex. Здесь OpenAI отвечает утвердительно и добавляет, что так же поступает каждая компания, которая делает большие языковые модели.

Справки самой OpenAI говорят то же в более длинной форме: ChatGPT дообучается на разговорах с ним, если пользователь не отключил эту опцию, а деидентифицированные данные идут на улучшение продукта. Там же компания пишет, что разрабатывает технологии, благодаря которым модели усваивают общие полезные закономерности и не запоминают приватные сведения о людях. Страницы о данных правили и в марте, и в конце августа 2026 года.

Как Навье-Стокс оказался в центре спора об обучающих данных?

По данным Nature, исследователи OpenAI прогоняли свой последний прототип по всем шести нерешённым задачам тысячелетия, а 1 сентября сосредоточились именно на Навье-Стоксе, услышав слухи, что версию задачи решили Левент Альпёге из Гарварда и Тристан Бакмастер из Нью-Йоркского университета с помощью моделей Anthropic.

7 сентября Альпёге и Бакмастер выложили работу с решением для упрощённого случая нулевой вязкости, где скорость становится бесконечной; по данным Nature, они пользовались Claude, а также Codex и Astra от OpenAI и обещали вскоре общий результат. В тот же день, как сообщает Nature, Анима Анандкумар из Калтеха с соавторами показала своё решение того же случая, полученное не большой языковой моделью, а нейросетью с встроенной физикой.

8 сентября, по данным Nature, OpenAI объявила, что получила решение уравнений Навье-Стокса и показала, что они могут ломаться; речь об одной из задач тысячелетия Института Клэя с призом в миллион долларов. По данным Aichatdaily, в том же анонсе компания утверждала, что ни исследователи, ни агенты не видели чужую работу до публикации и что данные конкретных пользователей не использовались.

Почему деидентификация не отвечает на вопрос Тома?

Потому что вопрос был про содержание разговоров, а деидентификация снимает с данных привязку к человеку: имя, аккаунт, идентификаторы. Математическая идея, изложенная в чате, при этом остаётся идеей. Это как снять с конверта обратный адрес: письмо внутри никуда не делось.

По данным Aichatdaily, Том написал исследователям OpenAI Себастьену Бубеку и Марку Селлке и спросил, попадали ли его разговоры с ChatGPT в обучающие данные и были ли они доступны процессу рассуждения. Ответ, как сообщает то же издание, касался только того, может ли чат-бот напрямую достать его переписку, и обходил общие массивы, на которых OpenAI улучшает модели.

Спор про обучающие данные начался ещё раньше. По данным Aichatdaily, за несколько дней до претензий Тома Бакмастер публично усомнился, не выиграли ли модели OpenAI от того, как он сам пользовался Codex, работая над той же задачей вместе с Альпёге.

Ответ закрывает узкий вопрос и подтверждает широкий, но между ними остаётся зазор: что из деидентифицированных массивов дошло до моделей, которыми OpenAI считала математику, из него не следует. На наш взгляд, странно отвечать на претензию про конкретный набор техник формулой «так делает каждая LLM-компания»: она верна и при этом ничего не говорит о том эпизоде, из-за которого спор и начался.

Когда ждать решение общей задачи По данным Nature, Альпёге и Бакмастер обещали вскоре опубликовать решение более общей версии уравнений; даты они не называли. Проверять и их работу, и сентябрьский анонс OpenAI математическому сообществу ещё предстоит. Открытым остаётся и вопрос, появится ли публичный разбор того, что именно попало в обучающие данные моделей, вокруг которых идёт спор.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.