Сканы Бодлианской библиотеки ушли в обучение OpenAI

Во внутренних документах Оксфорда, о которых пишет The Guardian, сканы из Бодлианской библиотеки описаны прямо: они нужны, чтобы «пополнить обучающий набор OpenAI». В марте 2025 года университет объявлял о партнёрстве и говорил о доступе к текстам для студентов и исследователей. Об обучении моделей в том анонсе не было ни слова.
Коротко
- С марта 2025 года Оксфорд оцифровывает тексты Бодлианской библиотеки с помощью программ OpenAI. К июню 2025 года компания получила 125 000 изображений диссертаций XIX и XX веков.
- Кроме диссертаций, отсканированы 10 000 «уличных баллад» XVI века, а сотрудники обсуждали оцифровку писем Марии Эджуорт и тетрадей Дороти Ходжкин с записями о пенициллине.
- Университет называет объём «скромным», уточняет, что речь только о текстах без авторских прав и неэксклюзивном доступе OpenAI, и отвергает версию, что обучение моделей скрывали от публики и студентов.
Если вы не следили: о партнёрстве с OpenAI Оксфорд объявил в марте 2025 года. По данным OX, то есть самого университета, стороны договорились о пятилетнем сотрудничестве. Исследователи получают модели o1 и 4o и гранты через программу NextGenAI, а Бодлианская библиотека запускает пилот по оцифровке материалов из общественного достояния. Одной из первых коллекций, по данным OX, назывались 3 500 диссертаций из разных дисциплин 1498–1884 годов.
К июню 2025 года OpenAI получила 125 000 сканов из фонда Бодлианской библиотеки
Из внутренних документов следует, что к июню 2025 года OpenAI передали 125 000 изображений, отсканированных с исторических диссертаций. Среди них докторские работы европейских и американских университетов XIX и XX веков. Отсканирована и редкая коллекция из 10 000 «уличных баллад» XVI века: листков с текстами песен и нотами, которые когда-то раздавали на перекрёстках тюдоровской Англии.
Сотрудники обсуждали и следующие кандидаты на оцифровку: ирландские государственные бумаги XVIII века, частные письма ирландской писательницы Марии Эджуорт и тетради Дороти Ходжкин с записями о пенициллине. Весь фонд библиотеки насчитывает 23 млн единиц, и контракт открывает перспективу его массовой оцифровки. В протоколах заседаний упоминается и будущий чат-бот «Ask the Bod».
Оксфорд стал единственным британским участником программы NextGenAI
Похожие соглашения OpenAI заключила с американскими исследовательскими библиотеками: Бостонской публичной библиотекой, Калтехом, MIT и Мичиганским университетом. Все они входят в проект NextGenAI, и Оксфорд в нём единственный участник из Великобритании.
В OpenAI говорят, что компания «гордится» возможностью сделать так, чтобы нынешние модели ИИ сохранили историческое знание мира для будущего. По словам представителя компании, технологией в повседневной жизни пользуются больше миллиарда человек, и поэтому важно, чтобы она отражала разные культуры, истории и взгляды.
Внутри университета энтузиазм разделяли не все. Протоколы заседаний, полученные по запросу о свободе информации, фиксируют опасения сотрудников, включая членов комитета по управлению Бодлианской библиотекой. Их беспокоили репутационные риски партнёрства с OpenAI и то, как сделка вокруг энергоёмкой технологии сочетается с экологическими обязательствами Оксфорда.
Букинисты получают заказы на справочник по сельхозорудиям Африки XVIII века
Продавцы книг рассказывают о волне заказов на малоизвестные издания вроде руководства по сельскохозяйственным орудиям в Африке XVIII века или биографий автомобилистов 1950-х. Владельцы букинистических магазинов предполагают, что таких книг почти наверняка нет в сети в цифровом виде, а значит, для следующего поколения моделей ИИ они представляют свежие данные.
С книгами при этом обращаются по-разному. Anthropic, ближайший конкурент OpenAI, потратила десятки миллионов долларов на покупку книг, у которых срезали корешки, сканировали страницы и затем отправляли их в макулатуру. В Anthropic говорят, что редкие и антикварные книги компания не покупает и не уничтожает.
Издание 404 Media вложило трекер в заказ из букинистического магазина и проследило посылку до склада Amazon в США, где книги тоже разбирали и сканировали. Фонды Бодлианской библиотеки по сделке с OpenAI остаются целыми.
Зачем моделям книги, которых нет в интернете
Коротко: интернет засорён. Модели OpenAI учатся находить закономерности в словах, поглощая огромные объёмы данных, и так «учатся» писать связные предложения и решать другие задачи. Но сайты, которые собирают для обучения, всё сильнее заполнены текстами, написанными самим ИИ, пользы от них становится меньше, и разработчики повернули к физическим, часто историческим, книжным собраниям.
Как описывает IBM, обучение большой языковой модели начинается с миллиардов или триллионов слов из книг, статей, сайтов и кода. Данные чистят, затем режут на токены, то есть короткие фрагменты текста. По данным IBM, на первом этапе модель учится без разметки: правильный ответ ей никто не подсказывает, закономерности она ищет сама.
Представьте ксерокопию, снятую с ксерокопии: каждый следующий слой чуть мутнее предыдущего. Модель, которая учится на текстах других моделей, рискует получить именно такой мутный отпечаток. Диссертации XIX века и баллады XVI века написаны людьми задолго до ИИ, поэтому букинисты и называют подобные тексты свежими данными.
Бодлианская библиотека начнёт выкладывать сканы в открытый доступ в ближайшие месяцы
Представитель Оксфорда называет объём оцифровки «скромным» и уточняет, что речь только о текстах, на которые истекли авторские права, а OpenAI использует материалы на неэксклюзивной основе. Права на сканы остаются у Бодлианской библиотеки, и она начнёт публиковать их в открытом доступе в ближайшие месяцы, как и результаты других партнёрств по оцифровке.
Версию, что обучение моделей скрывали от публики и студентов, в университете отвергают. По словам представителя, главным интересом Оксфорда была оцифровка, но сотрудники открыто говорили, что проект заодно даст данные для обучения. В университете добавляют, что проект сделает материалы доступнее для людей, которым иначе было бы трудно до них добраться.
Самого важного в материалах нет: условия контракта, его финансовая сторона и то, какая часть фонда в 23 млн единиц действительно пойдёт в оцифровку, не раскрываются. На наш взгляд, слово «скромный» плохо сочетается с протоколами, где обсуждаются массовая оцифровка всего фонда и чат-бот «Ask the Bod». Неясно и то, где именно сотрудники открыто говорили об обучении, если в мартовском анонсе об этом не было ни слова.
Когда сканы появятся в открытом доступе
Библиотека обещает начать публикацию в ближайшие месяцы, но точной даты университет не называет. Открытыми остаются два вопроса: дойдёт ли дело до массовой оцифровки фонда в 23 млн единиц и появится ли чат-бот «Ask the Bod», о котором пока известно только из протоколов. Судьба ирландских государственных бумаг, писем Эджуорт и тетрадей Ходжкин тоже не решена: пока их только обсуждали.
Читайте также
- «Исследовательская миссия» в OpenAI: вытеснить писателей
- Директор Microsoft назвал обучение на новостях кражей
- Страх апокалипсиса подрезал IPO Anthropic на 2 триллиона
- Ставку на OpenAI SoftBank займёт мусорными облигациями
- OpenAI сожжёт почти 280 миллиардов долларов к 2030 году
- Rhodium: у китайского ИИ 10% от выручки OpenAI и Anthropic
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
