De nouveaux documents judiciaires rendus publics dans le cadre d’un procès opposant OpenAI, Microsoft et des groupes de défense des droits d’auteur révèlent des discussions internes chez OpenAI concernant l’utilisation de livres piratés issus de Library Genesis (LibGen) pour entraîner des modèles d’intelligence artificielle. Selon les rapports, des employés comme Tom Brown et Ben Mann auraient qualifié LibGen de « putain de louche », tandis que Dario Amodei aurait exprimé des inquiétudes quant au manque de transparence dans le nommage des ensembles de données d’entraînement « Books1 » et « Books2 », sans en révéler l’origine. Ces ensembles, contenant respectivement 12 milliards et 55 milliards de tokens, ont servi à entraîner GPT-3 et GPT-3.5.
Une ordonnance fédérale datant de février 2026 indique qu’un employé d’OpenAI avait téléchargé des livres piratés depuis LibGen dès 2018. D’après l’équipe juridique de l’entreprise, ces ensembles de données ont été supprimés d’ici mi-2022 et ne sont plus utilisés. Cependant, la Authors Guild et des auteurs de renom comme John Grisham et Jonathan Franzen demandent à la justice de statuer sur une violation des droits d’auteur par OpenAI, remettant en cause la défense de la société fondée sur la fair use (exception de courte citation). OpenAI affirme que l’entraînement de modèles génératifs sur des œuvres protégées peut relever de la fair use, la décrivant comme une utilisation « transformative, analytique et non expressive ».
Le litige met également en lumière l’impact économique de l’IA générative sur les auteurs, certains employés d’OpenAI reconnaissant que la concurrence des outils d’IA pourrait entraîner des pertes d’emplois dans le secteur de l’écriture. Dans une affaire distincte, Bartz v. Anthropic, un règlement à hauteur de 1,5 milliard de dollars a été conclu en juillet 2026. Le tribunal a estimé que l’entraînement de modèles d’IA pouvait relever de la fair use, mais que le téléchargement de livres depuis des bibliothèques pirates ne le pouvait pas. Cette distinction pourrait influencer le procès en cours impliquant OpenAI.
D’autres évolutions dans le domaine du livre numérique incluent la collaboration entre l’University of Oxford et OpenAI pour numériser ses collections, les préoccupations liées à la présence de contenus générés par IA dans les prix littéraires, ainsi que les efforts des éditeurs pour encadrer l’utilisation de l’IA via des plateformes de licences. Les actions en justice contre les sites de piratage et l’intégration de l’IA dans la production d’audiobooks continuent de façonner le paysage en constante évolution de l’édition numérique.
L'utilisation par OpenAI de livres piratés pour la formation de l'IA sous la loupe d'un litige juridique
Contenu réécrit par une IA à partir de sources de presseComment ça marche
openaicopyrightfair-useai-traininglibgenlegal-dispute



