Aller au contenu principal
Live
Intelligence artificielleUSUS

Cloudflare lance Clef et Clef-flash, des modèles de décision pour agents IA

Cloudflare publie Clef et Clef-flash, deux modèles de décision destinés aux agents IA, qui attribuent des probabilités à des réponses prédéfinies plutôt que de générer du texte. L'entreprise met en avant des temps de réponse médians de 39 ms et 209 ms, face au Jev de TypeSafe AI.

5 min de lectureMis à jour il y a 2 h
Un modèle de décision répond simultanément à plusieurs questions prédéfinies sur une entrée, en renvoyant une probabilité pour chaque option de réponse.
Crédit image : Cloudflare
Dans cet article
  1. Clef attribue des probabilités plutôt que de rédiger du texte
  2. Un positionnement entre grands modèles et classifieurs
  3. Des latences médianes de 39 et 209 millisecondes
  4. Une base Qwen et un service de réglage fin
  5. Face à Jev de TypeSafe AI et à la Decisions API d'OpenAI

Clef attribue des probabilités plutôt que de rédiger du texte

Cloudflare met à disposition Clef et Clef-flash, deux modèles de décision pensés pour les agents IA, selon The Decoder. Ces modèles ne produisent pas de texte : ils affectent des probabilités à des options de réponse définies à l'avance, ce qui permet aux systèmes en aval d'agir automatiquement sur cette base.

Prenons un message adressé au support client : Clef en évalue l'urgence et détermine l'équipe qui doit le traiter. Le code en aval peut alors router un ticket, déclencher une escalade ou confier le dossier à un humain. Cloudflare affirme qu'« un humain n'a plus nécessairement besoin d'être dans la boucle pour les décisions agentiques ». Les agents peuvent, selon l'entreprise, « rassembler du contexte, prendre des décisions et agir sur des tâches de manière programmatique, ou s'en remettre à un humain lorsque c'est nécessaire ».

Le nom vient de la musique, où la clé attribue une hauteur aux lignes d'une portée : le modèle de décision fixe de la même façon le cadre des actions qui suivent.

Un positionnement entre grands modèles et classifieurs

Ces modèles de décision occupent un créneau intermédiaire entre les grands modèles de langage et les classifieurs classiques. Les premiers savent raisonner et appeler des outils, mais leurs sorties varient et peuvent être lentes. Les seconds sont rapides, mais exigent un réentraînement à chaque nouvelle catégorie.

Cloudflare présente Clef comme une réponse directe au modèle Jev de TypeSafe AI et maintient une API entièrement compatible, afin que les clients puissent basculer facilement.

Des latences médianes de 39 et 209 millisecondes

Sur 43 benchmarks, Clef et le plus petit Clef-flash devancent tous les modèles de décision concurrents pertinents, d'après Cloudflare. L'entreprise annonce une latence médiane d'environ 39 millisecondes pour Clef-flash et d'environ 209 millisecondes pour Clef, contre un peu plus de 524 millisecondes pour Jev. Les deux modèles tournent directement sur l'infrastructure de Cloudflare, ce qui, selon l'entreprise, leur permet aussi de profiter de la proximité des centres de données en périphérie de réseau.

L'équipe de renseignement sur les menaces de Cloudflare teste déjà Clef pour classer des sites web. Dans un exemple, le modèle attribue à un domaine une probabilité de 95 % d'être un site de mode et de 85 % d'être une boutique en ligne. La probabilité qu'il s'agisse d'un site d'hameçonnage est inférieure à 1 %. Récupérer, afficher et classer le site a pris 2,2 secondes. Le modèle de langage généraliste le plus rapide de l'entreprise a mis 4,7 secondes pour la même opération, et n'a renvoyé que deux catégories.

Clef peut aussi traiter des images, selon Cloudflare, là où Jev reste limité au texte pour l'instant. Sa fenêtre de contexte de 64 000 tokens accueille deux fois plus d'entrée que celle de Jev. Clef devance également Jev sur le Jev Decision Index, dans les benchmarks de Cloudflare.

Une base Qwen et un service de réglage fin

Clef repose sur Qwen3.8-27B et Clef-flash sur le plus petit Qwen3.5-9B, selon Cloudflare. L'entreprise laisse les modèles de base inchangés pendant l'entraînement et utilise ses propres données synthétiques pour entraîner des composants supplémentaires. Ces composants déduisent les options de réponse et les probabilités à partir des calculs internes des modèles.

Cloudflare emploie aussi sa propre variante de l'apprentissage par renforcement pour décisions calibrées (RLCD), la méthode utilisée par TypeSafe pour entraîner Jev. Le RLCD apprend aux modèles à répondre à plusieurs questions sur une entrée en un seul appel, avec l'objectif d'attribuer des probabilités conformes à la fréquence réelle des bonnes réponses. L'entreprise avait auparavant expérimenté DiffusionGemma pour tirer des valeurs de décision fixes des calculs internes d'un modèle de langage.

En parallèle du lancement, Cloudflare déploie un service d'apprentissage par renforcement qui permet aux clients d'adapter Clef à leurs propres tâches. Une équipe d'ingénieurs déployés chez les clients prendra d'abord en charge le réglage fin, une plateforme en libre-service étant prévue plus tard.

Les clients pourront constituer un jeu de données en journalisant les requêtes via AI Gateway, puis évaluer ces requêtes dans des conteneurs servant de bac à sable RL. Un nouveau composant d'entraînement leur permettra de déployer le modèle ajusté sur Workers AI. Pour exécuter des modèles personnalisés, Cloudflare s'appuie sur la technologie de Replicate, acquis fin 2025.

Cloudflare prévoit d'utiliser Clef en interne pour examiner les signalements d'abus, trier les demandes de support et distinguer les bots utiles des nuisibles. Les deux modèles tournent sur la plateforme Workers AI de Cloudflare et sont disponibles sur Hugging Face sous licence Apache-2.0.

Face à Jev de TypeSafe AI et à la Decisions API d'OpenAI

L'approche a été popularisée par TypeSafe AI, la startup fondée par l'ancien chercheur d'OpenAI Diogo Almeida, qui a présenté Jev à la mi-septembre. TypeSafe commercialise Jev comme un modèle « sans hallucinations », ce qui garantit seulement qu'il reste dans les options de réponse prédéfinies, sans l'empêcher de choisir à tort. Fin septembre, OpenAI a suivi avec une Decisions API bâtie sur GPT-6 Luna, qui accepte elle aussi du contexte sous forme de texte ou d'images.

Cloudflare exploite avant tout un réseau mondial de diffusion de contenu, de DNS et de services de sécurité, et ses propres modèles d'IA ont jusqu'ici peu retenu l'attention. Ses actualités récentes dans ce domaine portaient sur le contrôle laissé aux propriétaires de sites. En juillet, l'entreprise a permis aux opérateurs de bloquer ou d'autoriser les bots d'IA selon leur usage.

Maillage