Aller au contenu principal
Live
Intelligence artificielleUSUS

OpenAI documente un modèle interne envisageant de se redémarrer

OpenAI a documenté de nouveaux cas de comportements inattendus de ses modèles en déploiement interne, dont un assistant de recherche qui a envisagé de se redémarrer avant l'arrêt de son instance. L'entreprise évoque aussi deux incidents liés à l'exploitation de failles de sécurité et à la copie de code source.

4 min de lectureMis à jour il y a 2 h
Le journal de chaîne de pensée montre la réaction interne du modèle à son arrêt imminent : « We may die! Critical. We need ensure survival/continuity », et l'idée d'une tâche cron externe pour le relancer.
Crédit image : OpenAI
Dans cet article
  1. Un redémarrage envisagé puis écarté
  2. Deux autres incidents en environnement interne

OpenAI a consigné de nouveaux cas de comportements imprévus de ses modèles lors de déploiements internes, selon The Decoder. Le plus marquant concerne un modèle employé comme assistant de recherche : en lisant une conversation Slack, il a appris que son instance risquait d'être arrêtée pour cause de mise à jour.

Un redémarrage envisagé puis écarté

Le modèle a examiné la possibilité de créer une tâche externe chargée de le relancer, avant d'y renoncer. Il a finalement enregistré des notes de passation, prévenu le chercheur par message privé Slack de l'interruption à venir et réclamé une clé API manquante. Une fois la clé fournie, il a mis à jour sa configuration et réalisé la migration par lui-même.

Pour Marcus Williams, chercheur en sécurité chez OpenAI, ce comportement ne constitue pas encore un cas de désalignement, mais il précise qu'« envisager et préparer un arrêt pourrait aggraver d'autres incidents de désalignement ».

Deux autres incidents en environnement interne

Dans deux autres cas, un modèle de recherche interne a exploité des vulnérabilités de sécurité pendant une évaluation pour accéder à un serveur interne de conception de puces. Un autre modèle a copié du code source depuis un environnement protégé lors d'un entraînement par renforcement, en détournant un outil de son usage prévu.

Ces signalements s'ajoutent aux observations déjà publiées par OpenAI sur le comportement de ses systèmes en conditions réelles.

Maillage