Deux modèles, aucune sortie textuelle

Cloudflare a publié Clef et Clef-flash, deux modèles de décision qui ne génèrent pas de texte du tout. Dans un billet du 1er octobre, l’entreprise indique que les deux sont à poids ouverts sous licence Apache 2.0 sur Hugging Face et hébergés sur sa plateforme Workers AI, et qu’ils sont compatibles au niveau de l’API avec Jev System One de Typesafe AI, le modèle qui a créé cette catégorie il y a quelques semaines.

Un modèle de décision reçoit un état d’entrée et un ensemble de questions typées, et renvoie une probabilité pour chaque réponse autorisée. L’exemple de Cloudflare est un message de support : est-ce urgent, quelle équipe doit le traiter, quelle est la gravité. La sortie est un enregistrement structuré de probabilités sur lequel le code appelant agit sans qu’un humain le lise.

Comment il est construit

Clef gèle une base Qwen3.8-27B et Clef-flash une base Qwen3.5-9B, avec des adaptateurs de rang faible de rang 256 et une tête de routage entraînée par-dessus. À l’inférence, la base effectue une passe de préremplissage seule, puis le modèle note en parallèle les choix de schéma valides. Rien n’est produit jeton par jeton, et c’est de là que vient la vitesse.

Une développeuse travaillant à un bureau avec deux écrans
Les modèles renvoient des probabilités typées sur lesquelles agit le programme appelant. Photo d'illustration. ThisIsEngineering · pexels · Pexels License

Cloudflare a aussi entraîné avec une perte de Brier aux côtés d’une entropie croisée lissée pour calibrer les probabilités, et avec une méthode qu’elle appelle apprentissage par renforcement pour décisions calibrées, qui accorde un crédit partiel aux réponses ordinales voisines. Deux différences avec Jev sont faciles à énoncer : Clef dispose d’un encodeur visuel et peut classer des images, ce que Jev ne fait pas aujourd’hui, et il offre une fenêtre de contexte de 64k contre 32k pour Jev.

Les chiffres, et à qui ils appartiennent

Tous les chiffres qui suivent sont ceux de Cloudflare, mesurés par Cloudflare. Dans le tableau de dix lignes publié à partir du Jev Decision Index, un modèle Clef obtient le meilleur score sur sept lignes — dont 94,20 de macro-F1 sur BANKING77 contre 79,74 pour Jev, et 97,73 sur un jeu d’électroménager contre 52,27 pour Jev. Jev devance sur When2Call et BRIGHT, et DiffusionGemma Jev sur PhishNChips.

Câbles de brassage en fibre optique branchés sur un commutateur réseau
Clef et Clef-flash sont hébergés sur le réseau de périphérie de Cloudflare. Photo d'illustration. Brett Sayles · pexels · Pexels License

Côté latence, sur 43 séries de tests, Cloudflare rapporte une médiane de 209,3 ms pour Clef et 38,8 ms pour Clef-flash, contre 524,1 ms pour Jev. Un concurrent nommé Laya est encore plus rapide, à 5,8 ms de médiane, mais le tableau de Cloudflare lui attribue 38,13 là où les modèles Clef dépassent 98, et sa latence p95 est moins bonne que celle de Clef-flash. Sur la suite d’évaluation de Typesafe elle-même, Cloudflare dit que Clef a battu Jev sur trois flux de travail sur quatre, perdant sur l’observabilité des traces d’agents.

Le résultat interne qui mérite d’être répété vient de l’équipe renseignement sur les menaces de Cloudflare, qui utilise Clef pour catégoriser des domaines : 2,2 secondes pour récupérer, afficher et classer un site, contre 4,7 secondes pour gpt-oss-120b, qui n’a renvoyé que deux classements.

L’activité d’affinage qui se cache derrière

Aux côtés des modèles, Cloudflare lance un service d’affinage par apprentissage par renforcement, assuré d’abord par son équipe d’ingénieurs déployés puis, dit-elle, en libre-service. Les briques sont des produits existants — AI Gateway pour collecter les données de requêtes, Workers AI pour les exécutions, Containers comme bac à sable d’apprentissage par renforcement — plus un nouveau composant nommé Trainer et le travail d’accueil de modèles tiers issu du rachat de Replicate.

C’est cette partie qu’il faut suivre. Les poids ouverts rendent le modèle facile à essayer ; la chaîne d’affinage est ce qui retiendrait les clients. Jev a deux semaines, Amazon a sorti son propre modèle de décision la même semaine, et personne en dehors des éditeurs n’a encore publié de comparaison indépendante de l’un d’eux.