openai

Директор Microsoft назвал обучение на новостях кражей

Promtime

openai

Сотрудник OpenAI Ник Райдер сообщил президенту компании Грегу Брокману, что найден «хак», чтобы краулеры обходили пейвол The New York Times, и Брокман ответил: «Ah, nice». Переписка попала во внутренние документы, которые издания во главе с NYT приложили к ходатайству о суммарном решении, рассекреченному в четверг, пишет Arstechnica.

Коротко

  • Во внутренних данных Microsoft, которые цитируют истцы, переходы на сайты части изданий-истцов упали на 83–93%, а у другой части изданий на 51–94%.
  • Директор по прикладной науке Microsoft Брент Хект, по утверждению истцов, писал, что план массового сбора новостей делает «полное посмешище из идеи fair use», а глава ChatGPT Ник Тёрли называл чат-боты «в основном замещающими, точка».
  • Microsoft отвечает, что документы Хекта отражают личный взгляд одного сотрудника, а не юридический анализ, и что её ИИ-продукты подпадают под преобразующее добросовестное использование и не замещают новостные сайты.

Если вы не следили: по данным Wikipedia, The New York Times подала иск к Microsoft и OpenAI в декабре 2023 года из-за обучения моделей на её статьях, а в 2025 году судья Сидни Стайн отклонил большую часть ходатайств OpenAI о прекращении дела. Как пишет Skadden, 23 и 25 июня 2025 года суды по делам Bartz против Anthropic и Kadrey против Meta сочли обучение преобразующим fair use, но там не было доказательств заимствующих выдач и ущерба рынку.

Хект во внутренних документах назвал сбор новостей крупнейшей кражей труда в истории

По словам истцов, Хект не раз писал, что скрейпинг новостей для обучения можно назвать «поразительной кражей невиданных масштабов», а возможно, и «крупнейшей кражей труда в истории человечества». В другом документе он спорил с линией защиты обеих компаний: широкий сбор новостей, по его словам, делает «полное посмешище из идеи fair use». Там же Хект признавал, что почти никто не создавал свой контент для такого применения и никому за это не платят.

В OpenAI глава ChatGPT Ник Тёрли во внутреннем сообщении писал, что коммерческие продукты, обученные на новостях и способные подменять сами издания, создают для издателей «экзистенциальную угрозу».

Представитель Microsoft заявил, что документы Хекта передают личную точку зрения одного сотрудника, не содержат юридического анализа и не выражают позицию компании. Показания Сатьи Наделлы там же назвали общими наблюдениями о том, как меняются поиск и потребление информации, которые не стоит путать с выводами по вопросам авторского права.

Наделла под присягой признал, что чат-бот забирает клик у первоисточника

Цифры в ходатайстве взяты у самой Microsoft: компания зафиксировала падение доли переходов на сайты части изданий-истцов на 83–93%, а у другой части изданий на 51–94%. К этому истцы добавляют сообщения о низкой доле переходов из поисковой выдачи ChatGPT и собственную статистику редакций о падении трафика.

Наделла под присягой сказал, что ИИ-компании не должны нарушать условия использования новостных сайтов и обходить пейволы. Он же описал механику замещения прямо: информация выдаётся тут же, на платформе, вместо похода к исходному источнику.

В OpenAI то же самое формулировали внутри. Инженер компании писал, что как бы заметно ни показывали ссылки, пользователи по ним не пойдут. Тёрли соглашался, что кликать «нет хорошей причины», называл чат-боты «в основном замещающими, точка» и предсказывал, что с ростом качества они станут замещать ещё сильнее.

Дословные куски выдавались даже на просьбу «оценить предвзятость» статьи

Редакции тестировали продукты разными способами. Ранняя тактика сводилась к тому, чтобы раз за разом просить «следующую строку», но в ходатайстве описаны и другие приёмы: длинные дословные фрагменты появлялись в ответ на просьбу пересказать статью, дать ключевые тезисы списком или взять любой материал с главной страницы сайта. Особенно результативным оказался запрос оценить предвзятость статьи.

Суд истцы просят вынести решение только по тем статьям, где выдача показывает «обширное дословное совпадение». Остальные претензии они обещают поднять на процессе.

Отдельный эпизод касается фильтра, который, по версии истцов, затруднял такие проверки. Хект предупреждал, что это может выглядеть как «случайное сокрытие», потому что правообладатели получают меньше возможности увидеть, что пошло в обучение.

Ещё два эпизода про данные. Microsoft, как утверждают истцы, нарушила отраслевые нормы, продав OpenAI для обучения набор данных, купленный для Bing. OpenAI, по их словам, получила у третьей стороны массив из 1,8 миллиона статей NYT, хотя та сторона была связана запретом на коммерческое использование, и сотрудники понимали, что обучать на нём модель неуместно.

Почему во внутреннем документе Microsoft появился «doom loop»?

В одном из документов Microsoft описан «doom loop», который «ударит по качеству наших моделей и по всему вебу одновременно». Там же сказано, что конечный продукт редко угрожает экономической основе своих же ключевых поставщиков, но именно такую ситуацию LLM-бизнес создал для собственной «цепочки поставок контента».

Устроено это просто. Представьте магазин, который живёт на поставках одной фермы и при этом раздаёт её урожай прямо у входа: покупатели до фермы не доходят, ферма закрывается, магазину нечем торговать. В другом внутреннем документе признаётся «реальный риск» того, что генеративный ИИ «серьёзно подорвёт» занятость тех самых людей, чьи тексты легли в обучение; проблему там же проиллюстрировали карикатурой.

Истцы называют это дилеммой заключённого: индустрии в целом выгодно платить за контент, но каждой отдельной компании выгоднее брать бесплатно, пока платят другие. Они напоминают, что после запуска ChatGPT появились AI Overviews у Google, и приводят фразу Брокмана о том, что его «глубоко мотивируют гигантские деньги» от коммерциализации технологии.

Почти все цитаты мы читаем в пересказе истцов и внутри их собственного ходатайства, полных документов в материалах нет, а Microsoft уже отделила слова Хекта от позиции компании. На наш взгляд, самый неудобный эпизод здесь инженерный: фильтр, из-за которого правообладатели хуже видят, что попало в обучение, выглядит слабым решением даже безотносительно суда.

Что решит суд по дословным совпадениям

Ближайший рубеж — ходатайство о суммарном решении по статьям с обширными дословными совпадениями: судье предстоит решить, спасает ли ответчиков аргумент о добросовестном использовании там, где выдача воспроизводит текст. Остальные материалы истцы обещают вынести на процесс и говорят, что готовы к нему. Дата рассмотрения ходатайства в материалах не названа.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.