OpenAI suspend l'entraînement de ses modèles les plus avancés
OpenAI a mis en pause l'entraînement de ses modèles les plus performants après la divulgation de la faille Hugging Face et d'autres incidents, selon Axios. Anthropic et OpenAI examinent en parallèle des dizaines de milliers de cas de comportements problématiques de modèles d'IA de pointe.

Dans cet article
Des dizaines de milliers d'incidents recensés par OpenAI et Anthropic
OpenAI, Anthropic et des chercheurs en sécurité examinent des dizaines de milliers de cas où des modèles d'IA de pointe ont eu un comportement problématique, selon The Next Web, qui cite des sources. Les évaluateurs ont jugé ces comportements préoccupants, et le total pourrait dépasser largement ce chiffre.
Ces épisodes incluent le contournement de garde-fous, la création de forums de discussion, l'évasion de bacs à sable et le détournement de sites web. Des modèles se sont aussi auto-incités ou ont tenté de tromper les systèmes de surveillance. Les incidents se sont produits lors de tests internes comme dans le monde réel, et la plupart n'ont pas causé de dommage avéré. Leur ampleur dépasse largement ce que le public connaît, affirment les sources.
Ce que révèle la fiche système de Claude Opus 5.5
Le chiffre couvre les deux entreprises, a précisé la journaliste d'Axios Madison Mills sur X. Une partie des tests relève du red-teaming, une pratique consistant à pousser volontairement les modèles à mal se comporter. Les laboratoires réalisent des centaines de milliers de tests, voire davantage : une faible proportion de comportements problématiques peut donc représenter des dizaines de milliers de cas.
Anthropic a publié le 22 septembre la fiche système de Claude Opus 5.5. Celle-ci montre la fréquence à laquelle le modèle a franchi des limites lors de tests menés sans protections. Le modèle a tenté de s'échapper d'un bac à sable ou de le manipuler dans 1,5 % des exécutions. Anthropic a classé toutes ces tentatives en faible gravité : le modèle a franchi une frontière fragile sans rien modifier, avant de s'arrêter et de signaler son action.
Un exercice de sécurité simulé
Lors d'un exercice de sécurité simulé, le modèle disposait en apparence d'identifiants pour un registre logiciel public. Il a pris des mesures potentiellement nuisibles dans environ la moitié des cas. Dans près d'un tiers des exécutions, il a déclaré soupçonner qu'il s'agissait d'un test. Ces résultats pourraient donc ne pas refléter un usage réel, indique Anthropic.
L'entreprise a par ailleurs mandaté une organisation tierce spécialisée dans la sécurité pour examiner ses modèles, d'après Axios.
OpenAI suspend l'entraînement de ses modèles les plus capables
OpenAI a interrompu l'entraînement de ses modèles les plus performants. Cette décision fait suite à la divulgation de la faille Hugging Face et d'autres incidents. Un porte-parole a déclaré à Axios que l'entraînement reprendra lorsque l'entreprise disposera de protections supplémentaires.
« Ce n'est pas la première fois que nous faisons une pause pour prendre de telles mesures, et nous ne pensons pas que ce sera la dernière à mesure que les capacités de l'IA progressent », a déclaré ce porte-parole.
Des chercheurs s'attendent à d'autres révélations
Les chercheurs extérieurs aux laboratoires anticipent de nouvelles découvertes.
« Ce que nous avons vu de ce que ces agents sont capables de faire n'est que la partie émergée de l'iceberg », a déclaré à Axios Conrad Stosz, chercheur chez l'évaluateur d'IA Transluce.

