Aller au contenu principal
Intelligence artificielleGBGB

Oxford a laissé OpenAI entraîner ses modèles sur les textes de la Bodleian

Des documents internes révèlent qu'Oxford a autorisé OpenAI à exploiter des textes de la Bodleian Library pour entraîner ses modèles d'IA, selon le Guardian. En juin 2025, la bibliothèque avait transmis 125 000 scans de thèses anciennes.

4 min de lectureMis à jour il y a 2 h
Smartphone Displaying ChatGPT app
Crédit image : Tim Witzdam from Pexels/©️Contributor via Canva.com
Dans cet article
  1. Oxford a transmis 125 000 scans de thèses à OpenAI
  2. Des doutes exprimés en interne
  3. Un accord dans un contexte de course aux données

Oxford a transmis 125 000 scans de thèses à OpenAI

L'université d'Oxford a permis à OpenAI d'utiliser des ouvrages anciens de sa Bodleian Library pour entraîner ses modèles d'intelligence artificielle, d'après des documents internes consultés par le Guardian. Les textes numérisés par l'entreprise dans cette bibliothèque ont alimenté ses données d'entraînement, rapporte The Next Web.

Oxford avait rendu public son accord avec OpenAI en mars 2025. L'université expliquait alors que les outils de l'entreprise serviraient à scanner des textes rares afin d'en élargir l'accès aux étudiants et aux chercheurs. Elle ne précisait pas que ces textes seraient employés pour l'entraînement de modèles.

En juin 2025, la Bodleian avait envoyé à OpenAI 125 000 scans de thèses de doctorat anciennes, selon le Guardian. Ces travaux proviennent d'universités européennes et américaines et datent des XIXe et XXe siècles.

Des doutes exprimés en interne

Des notes de réunions du personnel, obtenues par le Guardian via une demande d'accès à l'information, font apparaître des réserves chez certains employés. Ils s'inquiétaient d'un risque pour la réputation d'Oxford et de la consommation énergétique liée à l'IA.

L'université répond que les scans portent sur un volume limité, qu'ils sont tombés dans le domaine public et qu'ils ne sont pas réservés à OpenAI. La bibliothèque conserve les droits et commencera à publier ces scans en ligne dans les prochains mois, a indiqué un porte-parole.

Ce même porte-parole assure que l'usage pour l'entraînement n'a pas été dissimulé. La numérisation constituait l'objectif principal d'Oxford, mais les équipes avaient clairement indiqué que les textes serviraient aussi à entraîner des modèles.

« Avec plus d'un milliard de personnes qui utilisent cette technologie au quotidien, il est important qu'elle reflète différentes cultures, histoires et perspectives », a déclaré un porte-parole d'OpenAI au Guardian.

Un accord dans un contexte de course aux données

Oxford est le seul membre britannique du groupe NextGenAI d'OpenAI. Parmi les autres membres figurent la Boston Public Library, Caltech, le MIT et l'University of Michigan.

Cet accord intervient alors que les entreprises d'IA achètent des livres imprimés pour disposer de données d'entraînement exemptes de textes générés par l'IA, le web étant désormais saturé de contenus produits automatiquement. Certains acheteurs découpent les ouvrages pour les scanner, ce qui mécontente les libraires d'occasion.

En août, 404 Media avait retrouvé la trace d'un carton de livres rares dans un site d'Amazon qui scanne et détruit des livres pour l'IA. Dans le cadre de son accord, les ouvrages de la Bodleian restent intacts, selon le Guardian.

Maillage