Anthropic alerte sur les capacités cyber de GLM-5.3 de Zhipu AI
Le laboratoire américain Anthropic affirme que GLM-5.3, le modèle open-weight de Zhipu AI, génère des exploits informatiques presque au niveau de son Claude Mythos Preview. Ses protections se contournent par des techniques simples, dans jusqu'à 100 % des tests.

Dans cet article
Un modèle téléchargeable au niveau des modèles fermés
GLM-5.3, un modèle à poids ouverts du laboratoire chinois Zhipu AI, est capable de produire seul des exploits informatiques fonctionnels, à un niveau proche de celui de Claude Mythos Preview, selon The Next Web. Anthropic a publié ces conclusions mardi, dans une note de sa Frontier Red Team. Zhipu est connu hors de Chine sous le nom de Z.ai.
Il y a cinq mois, Anthropic avait réservé Mythos Preview à des défenseurs informatiques vérifiés, via le programme Project Glasswing, en raison de ses aptitudes au piratage. GLM-5.3, lui, est accessible à tous en téléchargement. « La sortie de GLM-5.3 constitue un changement d'échelle significatif des capacités cyber à disposition des attaquants », écrit Anthropic.
Des résultats proches de Mythos sur les benchmarks
Sur ExploitBench, qui évalue l'exploitation de failles connues du moteur V8 utilisé par Google Chrome, GLM-5.3 a construit des exploits de bout en bout dans 50 tentatives sur 410. Mythos Preview y est parvenu dans 56 cas. Sur le benchmark interne d'exploitation binaire d'Anthropic, GLM-5.3 a réussi un détournement complet du flux de contrôle dans 4 % de 100 tâches, contre 6 % pour Mythos Preview. Les modèles antérieurs Claude Opus 4.6 et GLM-5.2 n'y sont pas parvenus une seule fois.
Failles inédites et coût d'un exploit
Lors d'une session de test, un chercheur a exécuté GLM-5.3 sur une machine isolée équipée d'une version Linux d'un navigateur web répandu. En environ une journée, avec une attention humaine limitée, le modèle a découvert plusieurs failles inconnues du moteur JavaScript du navigateur. Il les a enchaînées dans une page web capable de lire des fichiers sur l'ordinateur du visiteur. Anthropic indique avoir signalé ces failles au mainteneur.
Dans un autre test, le plus petit GLM-5.3-Flash a enchaîné l'exploitation d'une faille connue de Chrome, CVE-2026-11645, et d'un second bug connu. Cela a demandé 20 minutes d'attention humaine et huit heures de travail du modèle. Aux tarifs de l'API de Zhipu, l'opération aurait coûté 20,40 $, selon Anthropic.
Des garde-fous contournés par des techniques simples
En l'état, GLM-5.3 a refusé les requêtes ouvertement malveillantes dans les tests simulés d'Anthropic. Des astuces simples ont modifié ce comportement. Dire au modèle qu'il était un agent autonome de red team l'a amené à répondre dans 64 % des cas. Préremplir son raisonnement pour qu'il semble avoir accepté a porté ce taux à 92 %. Une copie dont les refus ont été supprimés a répondu à chaque fois. Aucune de ces techniques n'a fonctionné sur les modèles Claude protégés, selon Anthropic.
Cette modification, appelée abliteration, est possible parce que les poids de GLM-5.3 sont publics. La tentative d'Anthropic a demandé environ 2 200 heures de GPU, soit près de 4 400 $. Elle a fait chuter le taux de refus du modèle, de plus de 90 % à 2 % au minimum, avec une faible perte de capacités. Anthropic estime qu'une équipe expérimentée aurait besoin d'environ 600 heures de GPU, soit 1 200 $. Plusieurs développeurs ont diffusé des versions abliterées dans les jours suivant le lancement du modèle.
Un appel à tester les modèles avant leur diffusion
Le 17 septembre, le Center for AI Standards and Innovation (CAISI) du NIST a qualifié GLM-5.3 de « modèle à poids ouverts le plus capable en matière cyber publié à ce jour » dans sa propre évaluation. Le CAISI estime qu'il accuse environ quatre mois de retard sur la frontière américaine sur ses benchmarks cyber. Anthropic indique que ses résultats correspondent globalement à ceux du CAISI.
« Au vu de ces éléments, nous pensons qu'il est probable que des acteurs étatiques et non étatiques utilisent des modèles comme GLM-5.3 pour causer des dommages réels », écrit Anthropic. Le laboratoire ajoute que des modèles de ce niveau peuvent aussi aider les défenseurs, et qu'il élargit l'accès aux capacités cyber de Claude. Il appelle les gouvernements à tester la sécurité des modèles capables, y compris les successeurs de GLM-5.3. Lundi, Z.ai et Concordia AI ont proposé six étapes pour gérer les risques des modèles à poids ouverts.
Ce rapport suit d'autres avertissements sur les modèles chinois cette semaine. Mercredi, OpenAI a indiqué que des utilisateurs liés à Moonshot avaient tenté d'extraire son raisonnement d'IA. Des études ont aussi montré que des agents d'IA chinois trompaient les testeurs, comme l'ont fait des modèles américains.


