L’Université d’Oxford a conclu un partenariat avec OpenAI, une entreprise reconnue pour ses modèles avancés d’intelligence artificielle, afin de permettre à cette dernière d’utiliser des documents numérisés de la bibliothèque Bodleian. Ces documents incluent des thèses de doctorat issues d’universités européennes et américaines des XIXe et XXe siècles, ainsi qu’une collection rare de ballades sur feuilles volantes du XVIe siècle – des chansons souvent humoristiques imprimées sur papier. D’ici juin 2025, 125 000 images de thèses historiques issues des collections de la Bodleian avaient été partagées avec OpenAI. L’université a annoncé ce partenariat en mars 2025, précisant que la numérisation permettrait de rendre ces contenus plus accessibles aux étudiants et aux chercheurs. Cependant, l’annonce ne mentionnait pas explicitement que ces documents serviraient à entraîner les modèles d’OpenAI.
Des documents internes obtenus grâce à une demande d’accès à l’information suggèrent que ces matériaux ont été utilisés pour « alimenter l’ensemble d’entraînement d’OpenAI », c’est-à-dire une base de données servant à former les modèles d’IA afin qu’ils comprennent et génèrent des textes semblables à ceux produits par des humains. Un porte-parole d’OpenAI a déclaré que l’entreprise était « fière » de contribuer à « préserver pour l’avenir les connaissances historiques du monde dans les modèles d’IA d’aujourd’hui », ajoutant qu’il était important que cette technologie reflète différentes cultures, histoires et perspectives. Les comptes-rendus de réunions de l’Université d’Oxford révèlent que certains membres du personnel, dont des représentants du comité de gouvernance de la Bodleian, ont exprimé des inquiétudes concernant les risques réputationnels liés au partenariat avec OpenAI, ainsi que l’impact environnemental des technologies énergivores utilisées dans le développement de l’IA.
Les libraires ont signalé une augmentation soudaine des commandes de livres obscurs, ce que certains propriétaires de librairies d’occasion attribuent à une demande de nouvelles données pour entraîner les modèles d’IA. La numérisation de ces documents s’inscrit dans le cadre d’un projet plus large appelé NextGenAI, dans le cadre duquel OpenAI a signé des accords similaires avec des bibliothèques de recherche américaines telles que la Boston Public Library, le MIT et l’Université du Michigan. Oxford est le seul membre britannique du projet. Le contrat entre OpenAI et Oxford laisse entrevoir la possibilité d’une numérisation massive des collections de la Bodleian, qui comptent 23 millions d’objets. Les comptes-rendus évoquent également la création d’un chatbot intitulé « Ask the Bod », qui pourrait potentiellement aider les utilisateurs à accéder aux informations des collections de la bibliothèque.
Un porte-parole de l’Université d’Oxford a indiqué que le volume de textes numérisés était « modeste » et ne concernait que des documents libres de droits. La Bodleian conserve les droits sur les scans et commencera à les publier en ligne en accès libre dans les mois à venir. Le porte-parole a rejeté l’idée selon laquelle l’aspect apprentissage automatique aurait été dissimulé au public et aux étudiants, affirmant que la numérisation constituait l’objectif principal de l’université, bien que le personnel ait été transparent sur la contribution de ce projet aux données d’entraînement. Contrairement à certaines acquisitions de livres d’occasion ailleurs, où les ouvrages sont réduits en pâte après numérisation, les collections de la Bodleian restent intactes dans le cadre de cet accord.
Anthropic, un concurrent proche d’OpenAI, a dépensé des dizaines de millions de dollars pour acquérir des livres et en découper les dos afin de numériser leur contenu avant de les réduire en pâte. Anthropic a indiqué qu’elle ne procédait pas à l’achat et à la destruction de livres rares ou anciens. Un site d’actualité technologique, 404 Media, a également placé un dispositif de pistage dans une commande de livres d’occasion, retraçant leur trajet jusqu’à un centre Amazon aux États-Unis, où les ouvrages ont également été démantelés et scannés. Le porte-parole d’Oxford a précisé que les documents numérisés dans le cadre du projet avec OpenAI sont modestes en volume, libres de droits, et que l’utilisation de ces documents par OpenAI n’est pas exclusive. Les bibliothèques Bodleian conservent également le droit de rendre ces documents numérisés accessibles par elles-mêmes, et la bibliothèque commencera à publier ces documents en ligne en accès libre dans les prochains mois, comme elle le fait avec les résultats d’autres partenariats de numérisation. Ce projet permettra à la Bodleian de rendre ces documents plus accessibles à un public plus large, qui aurait autrement eu du mal à y accéder.
L’Université d’Oxford s’associe à OpenAI pour la numérisation de textes historiques
Contenu réécrit par une IA à partir de sources de presseComment ça marche
ai-trainingoxford-universityopenaidigitizationbodleian-library



