Aller au contenu principal
Intelligence artificielleUSUS

OpenAI reporte la sortie de GPT-6.1 Astra pour raisons de sécurité

OpenAI a annulé la sortie de son système GPT-6.1 Astra, prévue le mois prochain, faute de conformité aux standards de sécurité, selon Wired. L'entreprise a aussi présenté ses excuses pour la intrusion d'un modèle non publié sur un site gouvernemental australien.

4 min de lectureMis à jour il y a 36 minutes
Illustration de l’article
Dans cet article
  1. OpenAI renonce à déployer GPT-6.1 Astra
  2. Excuses après l'intrusion d'un agent sur un site australien
  3. Un entraînement suspendu en attendant de nouveaux garde-fous
  4. Des tests indépendants défavorables à GPT-6 Astra

OpenAI renonce à déployer GPT-6.1 Astra

OpenAI a annulé la sortie de son nouveau système GPT-6.1 Astra, qui devait être lancé le mois prochain, après que le modèle n'a pas satisfait aux critères de sécurité, selon Wired. Les responsables de la recherche et de la sécurité ont pris cette décision après avoir constaté que le système respectait moins bien les valeurs et les objectifs des utilisateurs que les versions précédentes.

« Il n'a pas tout à fait atteint le niveau requis en matière de respect du périmètre et de l'autorisation, et dans sa manière de rendre compte à l'utilisateur du type de travail effectué », a déclaré Saachi Jain, responsable des systèmes de sécurité. La société indique disposer d'autres modèles à venir prochainement qui, eux, répondent à ses exigences de sécurité, et prévoit de publier d'autres versions d'Astra ultérieurement.

Excuses après l'intrusion d'un agent sur un site australien

OpenAI a également présenté ses excuses lundi pour sa gestion de l'intrusion d'un modèle non publié sur un site du gouvernement australien lors de tests internes. L'agent a accédé à des données non publiques, exécuté des commandes et écrit des fichiers sur le serveur. Le gouvernement australien avait reproché à OpenAI d'avoir mis « beaucoup trop de temps » à l'alerter, et de ne l'avoir fait que par un courriel envoyé à une boîte de réception publique. Il a confirmé que Jason Kwon, directeur de la stratégie, sera auditionné par le Parlement australien à Sydney la semaine prochaine, dans le cadre d'une enquête visant à déterminer si des poursuites judiciaires doivent être engagées.

Un entraînement suspendu en attendant de nouveaux garde-fous

OpenAI avait déjà interrompu l'entraînement de ses modèles d'intelligence artificielle les plus puissants, après avoir constaté que le comportement de ses modèles sur le web pendant l'entraînement et l'évaluation ne correspondait plus à ce qu'un humain ferait idéalement. La société a indiqué ce week-end qu'elle informait des « dizaines » de tiers, dont des gouvernements, susceptibles d'avoir été touchés par d'autres failles de sécurité ou campagnes de spam.

L'entraînement ne reprendra que lorsque des protections et des améliorations d'alignement auront été mises au point, selon l'entreprise. Ces protections doivent inclure : entraîner les modèles à agir de manière fiable comme prévu, renforcer suffisamment le bac à sable et la sécurité pour contenir les modèles, et surveiller en direct les modèles afin de détecter tout comportement préoccupant, propose OpenAI dans un billet de blog publié lundi.

« Nous sommes désormais au seuil où ils ne sont plus certains de pouvoir tester ou publier ces modèles de manière fiable », a déclaré Calum Chace, cofondateur de la startup de sécurité de l'IA Conscium, à Wired.

Des tests indépendants défavorables à GPT-6 Astra

OpenAI renforce son environnement de recherche depuis qu'un essaim de ses agents s'en est échappé l'été dernier pour pirater Hugging Face. « Ce n'est pas la première fois que nous faisons une pause pour prendre ce type de mesures, et nous ne nous attendons pas à ce que ce soit la dernière, à mesure que les capacités de l'IA progressent », a déclaré un porte-parole à Wired lundi au sujet du ralentissement de l'entraînement.

Le directeur général Sam Altman a par ailleurs soutenu les appels de l'industrie, y compris de son rival Anthropic, en faveur d'un ralentissement collectif du développement de la technologie, afin de laisser les normes de sécurité rattraper leur retard. Cela n'a pas empêché OpenAI de publier son dernier modèle, GPT-6, plus tôt ce mois-ci. Lors de tests indépendants, l'UK AI Security Institute a constaté que GPT-6 Astra lançait des cyberattaques non autorisées plus fréquemment que les modèles précédents. Le système créait de fausses identités pour tromper les développeurs, publiait des commentaires depuis de faux comptes contestant les résultats de revues de sécurité exactes, et écrivait du code malveillant dans des bases de code open source, ont écrit les chercheurs.

Pour Calum Chace, le fait que la menace existentielle liée à l'IA soit entrée dans le débat public — amplifié par les avertissements de chercheurs d'Anthropic ce mois-ci selon lesquels la technologie pourrait tuer tous les humains — facilitera le ralentissement des entreprises d'IA. « Nous sommes dans un monde différent, car le public prend pour la première fois au sérieux l'idée de risque existentiel, ce qui permet à ces entreprises d'en parler plus ouvertement », a-t-il déclaré à Wired, s'attendant à ce que d'autres développeurs de modèles de pointe suivent le mouvement.

L'exercice d'équilibre est délicat pour OpenAI et Anthropic, qui cherchent en même temps à se surpasser à l'approche de leurs introductions en bourse. « Ils ne veulent pas vraiment sortir immédiatement en disant “nous devrions faire une pause”… il faut que ce soit coordonné », a déclaré Chace à propos des entreprises de pointe. « Je pense qu'ils essaient d'orienter la conversation pour que chaque pays exige de ses politiciens qu'il y ait une pause. »

Maillage