«Исследовательская миссия» в OpenAI: вытеснить писателей

Записка августа 2019 года из рассекреченных материалов звучит так: «Мы обучили GPT-3 на пиратском! Никому не показывать». Разбор документов по делу Authors Guild против OpenAI и Microsoft опубликовал Publishers Weekly; в тех же бумагах лежат показания о том, что модели потеснят авторов жанровой прозы на Amazon.
Коротко
- Нанятый в 2022 году улучшать тексты моделей Тарун Гогинени описал «исследовательскую миссию» как создание машины, которая вытеснит писателей, а жалобы авторов счёл «приемлемым экономическим потрясением».
- Microsoft знала об использовании LibGen как минимум с апреля 2019 года, а в 2022 году OpenAI вычистила файлы библиотеки из систем и хранилищ; операция называлась Project Clear.
- Все цитаты взяты из меморандума истцов и их исправленного заявления о неоспариваемых фактах (документы 1982 и 1987), то есть из выборки переписки и показаний, отобранной одной стороной спора.
Если вы не следили за книжными исками к разработчикам моделей: по данным NPR, в августе 2025 года Anthropic согласилась заплатить 1,5 миллиарда долларов по коллективному иску авторов из-за обучения Claude на пиратских копиях книг. Платили примерно по 3000 долларов за книгу, в класс вошли 482 460 книг, а сама компания обязалась уничтожить скачанные файлы.
Директор по политике OpenAI в мае 2020 года допускал, что опасения авторов проигнорируют
Цитаты из внутренней переписки и показаний Authors Guild приводит по меморандуму истцов, поданному в поддержку ходатайства о частичном суммарном решении. Само ходатайство стороны подали меньше двух недель назад, и уже после этого часть материалов сняли с грифа.
В показаниях мая 2020 года директор по политике Джек Кларк говорил: чем лучше результат по GPT-X, тем сильнее авторы жанровой прозы будут беспокоиться о замещении на Amazon. Он же допускал, что художники выскажут тревогу, «а мы, скорее всего, проигнорируем их опасения и всё равно выпустим».
Гогинени пришёл поднимать качество текстов и назвал целью замену писателей
В 2022 году OpenAI наняла Таруна Гогинени руководить работой над качеством письма моделей. Свою «исследовательскую миссию» он описывал как создание машины, которая вытеснит авторов. Про претензии, что «датасеты краденые», и про то, что авторы теряют заказы из-за конкуренции с ИИ, он знал, но особого сочувствия, как сказано в меморандуме, они у него не вызывали.
Там же приводится его формулировка о скорой «смерти читателя», когда «машины создают шлак для других машин». В показаниях фигурирует и твит: если Джордж Мартин умрёт раньше времени, «GPT напишет следующую книгу „Песни льда и пламени“».
Microsoft знала про LibGen с апреля 2019 года, а в 2022-м файлы удалили
Из материалов следует, что Microsoft знала об использовании OpenAI библиотеки LibGen как минимум с апреля 2019 года. В 2022 году OpenAI вычистила эти файлы из своих систем и хранилищ; работа шла под названием Project Clear. Вице-президент по исследованиям Боб Макгроу писал коллегам, что на фоне обилия новостей об OpenAI сейчас подходящий момент убрать LibGen из систем и хранилища, и спрашивал, что для этого потребуется.
Рассекречивание в деле Authors Guild идёт следом за материалами из иска The New York Times к Microsoft и OpenAI: там использование миллионов новостных статей для обучения больших языковых моделей названо «экзистенциальной угрозой» для газетных издателей.
По данным The Wall Street Journal, директор по прикладной науке Microsoft Брент Хект вскоре после иска NYT писал, что компании запустили «doom loop», который ударит и по качеству моделей, и по всему вебу, и называл необычной ситуацию, когда конечный продукт угрожает экономической основе своих поставщиков контента.
Почему удаление файлов LibGen не закрывает вопрос об обучении?
Короткий ответ: суды в соседних делах разводят два разных действия. LibGen это теневая библиотека, откуда книги скачивают целиком, и обучение на них и хранение самих копий разбираются отдельно. Судья Уильям Алсуп в июне 2025 года провёл эту границу прямо: обучение на законно купленных и оцифрованных книгах он счёл добросовестным использованием, а по скачанным и оставленным у себя пиратским копиям у него «каждый фактор против добросовестного использования».
Аналогия простая: одно дело прочитать книгу в библиотеке и написать потом свою, другое дело держать дома ящик ворованных экземпляров. По данным White & Case, два решения Северного округа Калифорнии с разницей в два дня в июне 2025 года признали обучение на книгах добросовестным использованием: у Алсупа оно «исключительно преобразующее», у судьи Чхабриа по Llama компании Meta «в высокой степени преобразующее».
По тому же разбору, оба судьи оговорились: другая экономическая аргументация могла изменить исход, а ответственность за копирование и хранение пиратских библиотек с компаний не снималась.
По данным NPR, в деле Anthropic суд установил, что компания скачала больше 7 миллионов книг, про которые знала, что они пиратские, в том числе не менее 5 миллионов из LibGen и не менее 2 миллионов из Pirate Library Mirror.
Контекста вокруг цитат в материалах нет: мы видим отдельные фразы, а не переписку целиком, и подбирала их сторона истцов. На наш взгляд, Project Clear решает вопрос хранения файлов, но не вопрос моделей, которые на этих файлах уже обучены, и граница, которую в июне 2025 года провёл Алсуп, проходит ровно здесь.
Суммарное решение и вопрос о хранении
Обе стороны подали ходатайства о суммарном решении меньше двух недель назад; когда суд их рассмотрит, в материалах не сказано. Главный практический вопрос: применят ли к OpenAI и Microsoft ту же границу между обучением и хранением пиратских копий, что провёл судья Алсуп, и достаточно ли для второй части удаления файлов в 2022 году. Ответа на это в рассекреченных бумагах нет.
Читайте также
- Директор Microsoft назвал обучение на новостях кражей
- Аргумент OpenAI: 1 899 слов из «Игры престолов»
- Сканы Бодлианской библиотеки ушли в обучение OpenAI
- Иск о копирайте: Seattle Times и Newsday против OpenAI
- Ещё 30 исков к OpenAI из-за стрельбы в Tumbler Ridge
- Власти США встали на сторону OpenAI в иске NYT
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
