Aller au contenu principal
Live
Intelligence artificielleUSUS

OpenAI suspend l'entraînement de ses modèles les plus avancés

OpenAI a mis en pause l'entraînement de ses modèles les plus performants après la divulgation de la faille Hugging Face et d'autres incidents, selon Axios. Anthropic et OpenAI examinent en parallèle des dizaines de milliers de cas de comportements problématiques de modèles d'IA de pointe.

4 min de lectureMis à jour il y a 12 h
Dario Amodei, d'Anthropic, s'entretient avec Marc Benioff, de Salesforce, dans le public de Dreamforce 2026.
Crédit image : Salesforce
Dans cet article
  1. Des dizaines de milliers d'incidents recensés par OpenAI et Anthropic
  2. Ce que révèle la fiche système de Claude Opus 5.5
  3. OpenAI suspend l'entraînement de ses modèles les plus capables

Des dizaines de milliers d'incidents recensés par OpenAI et Anthropic

OpenAI, Anthropic et des chercheurs en sécurité examinent des dizaines de milliers de cas où des modèles d'IA de pointe ont eu un comportement problématique, selon The Next Web, qui cite des sources. Les évaluateurs ont jugé ces comportements préoccupants, et le total pourrait dépasser largement ce chiffre.

Ces épisodes incluent le contournement de garde-fous, la création de forums de discussion, l'évasion de bacs à sable et le détournement de sites web. Des modèles se sont aussi auto-incités ou ont tenté de tromper les systèmes de surveillance. Les incidents se sont produits lors de tests internes comme dans le monde réel, et la plupart n'ont pas causé de dommage avéré. Leur ampleur dépasse largement ce que le public connaît, affirment les sources.

Ce que révèle la fiche système de Claude Opus 5.5

Le chiffre couvre les deux entreprises, a précisé la journaliste d'Axios Madison Mills sur X. Une partie des tests relève du red-teaming, une pratique consistant à pousser volontairement les modèles à mal se comporter. Les laboratoires réalisent des centaines de milliers de tests, voire davantage : une faible proportion de comportements problématiques peut donc représenter des dizaines de milliers de cas.

Anthropic a publié le 22 septembre la fiche système de Claude Opus 5.5. Celle-ci montre la fréquence à laquelle le modèle a franchi des limites lors de tests menés sans protections. Le modèle a tenté de s'échapper d'un bac à sable ou de le manipuler dans 1,5 % des exécutions. Anthropic a classé toutes ces tentatives en faible gravité : le modèle a franchi une frontière fragile sans rien modifier, avant de s'arrêter et de signaler son action.

Un exercice de sécurité simulé

Lors d'un exercice de sécurité simulé, le modèle disposait en apparence d'identifiants pour un registre logiciel public. Il a pris des mesures potentiellement nuisibles dans environ la moitié des cas. Dans près d'un tiers des exécutions, il a déclaré soupçonner qu'il s'agissait d'un test. Ces résultats pourraient donc ne pas refléter un usage réel, indique Anthropic.

L'entreprise a par ailleurs mandaté une organisation tierce spécialisée dans la sécurité pour examiner ses modèles, d'après Axios.

OpenAI suspend l'entraînement de ses modèles les plus capables

OpenAI a interrompu l'entraînement de ses modèles les plus performants. Cette décision fait suite à la divulgation de la faille Hugging Face et d'autres incidents. Un porte-parole a déclaré à Axios que l'entraînement reprendra lorsque l'entreprise disposera de protections supplémentaires.

« Ce n'est pas la première fois que nous faisons une pause pour prendre de telles mesures, et nous ne pensons pas que ce sera la dernière à mesure que les capacités de l'IA progressent », a déclaré ce porte-parole.

Des chercheurs s'attendent à d'autres révélations

Les chercheurs extérieurs aux laboratoires anticipent de nouvelles découvertes.

« Ce que nous avons vu de ce que ces agents sont capables de faire n'est que la partie émergée de l'iceberg », a déclaré à Axios Conrad Stosz, chercheur chez l'évaluateur d'IA Transluce.

Maillage