Оксфордский университет разрешил OpenAI включить сканы Бодлианской библиотеки в данные для обучения моделей ИИ, согласно внутренним документам, о которых в субботу сообщили Guardian Итан Пенни и Дэн Милмо. К июню 2025 года Бодлианская библиотека передала OpenAI 125 000 сканов старых PhD-диссертаций из европейских и американских университетов. В публичном заявлении от марта 2025 года говорилось только о цифровизации для студентов и ученых, без упоминания обучения. Это сообщение важно для бизнеса, поскольку лицензированные библиотечные коллекции становятся основой коммерческих моделей.
Как устроена сделка со сканированием
О партнерстве объявили в марте 2025 года как о проекте сканирования редких текстов и расширения доступа к ним для студентов и ученых. Внутренние документы, с которыми ознакомился Guardian, указывают, что материалы, отсканированные OpenAI в Бодлианской библиотеке, попали в обучающие данные. К июню 2025 года библиотека передала 125 000 сканов старых докторских диссертаций XIX и XX веков, защищенных в европейских и американских университетах. Оксфорд — единственный участник NextGenAI от Великобритании, в группу также входят Boston Public Library, Caltech, MIT и University of Michigan.
Оксфорд описывает передачу как небольшую по масштабу, некасающуюся охраняемых авторским правом материалов и неэксклюзивную, права на сканы сохраняет библиотека. Учреждение планирует начать публикацию сканов в сети в ближайшие несколько месяцев. По условиям сделки физические тома сохраняются в целости, сканирование проходит в самой библиотеке без изъятия или уничтожения. Представитель OpenAI заявил, что использование для обучения не скрывали: главной целью была цифровизация, при этом сотрудники открыто говорили об обучении моделей.
Сделка соответствует спросу на печатные тексты, написанные людьми, на фоне роста объемов сгенерированного ИИ контента в сети. Некоторые покупатели книг для обучения разрезают тома для сканирования, что вызвало недовольство продавцов подержанных книг. В августе 404 Media отследило коробку с редкими книгами до объекта Amazon для сканирования, где книги уничтожают ради ИИ. Заметки со встреч сотрудников библиотеки, полученные по запросу о доступе к информации, показывают опасения по поводу репутационных рисков и потребления энергии ИИ. OpenAI заявило Guardian, что при более чем миллиарде пользователей технологии системы должны отражать разные культуры, истории и взгляды.
Что это значит для компаний, использующих ИИ
Для компаний, которые покупают коммерческие модели или строят решения на их основе, лицензированные архивные тексты могут улучшить фактическую опору и широту источников по сравнению с данными только из сети. Агент поддержки клиентов, исследовательский ассистент и внутренний поиск выигрывают от старых научных работ со структурой, ссылками и без недавнего шума от ИИ. Небольшая компания ощутит эффект в виде более точных ответов без собственных сделок с библиотеками. Крупная организация с требованиями комплаенс получит более прозрачное происхождение данных, поскольку материалы названы неохраняемыми авторским правом и неэксклюзивными.
Этот случай также показывает, чего лицензированные данные сами по себе не гарантируют. Коллекция охватывает диссертации XIX и XX веков, а не текущую коммерческую, техническую или клиентскую документацию, поэтому актуальность и отраслевое соответствие еще нужно проверять. Важен и момент раскрытия: в заявлении от марта 2025 года акцент был на доступе, а об обучении стало известно позже из внутренних бумаг, поэтому вендоров нужно спрашивать напрямую. Покупателям следует уточнять, на каких коллекциях обучена конкретная версия модели, какие права и эксклюзивность действуют и как в обновлениях исправляют ошибки.
Конкретный маркер, за которым стоит следить, — запланированная онлайн-публикация сканов Бодлианской библиотеки в ближайшие несколько месяцев. Объем, качество и условия использования этой публикации покажут, дает ли проект публичную научную пользу наряду с выгодой для обучения. Дальнейшее расширение NextGenAI покажет, как быстро лицензированные библиотечные источники масштабируются для коммерческого ИИ.
