To modeller, ingen tekstudgang
Cloudflare har udgivet Clef og Clef-flash, to beslutningsmodeller, der slet ikke genererer tekst. I et indlæg 1. oktober oplyser selskabet, at begge har åbne vægte under Apache 2.0 på Hugging Face og kører på platformen Workers AI, og at begge er API-kompatible med Typesafe AI’s Jev System One, modellen der skabte kategorien for nogle uger siden.
En beslutningsmodel modtager en inputtilstand og et sæt typede spørgsmål og returnerer en sandsynlighed for hvert tilladt svar. Cloudflares eksempel er en supporthenvendelse: haster den, hvilket team skal tage den, hvor alvorlig er påvirkningen. Outputtet er en struktureret post med sandsynligheder, som kaldende kode kan handle på, uden at nogen læser den.
Hvordan den er bygget
Clef fryser en Qwen3.8-27B-stamme og Clef-flash en Qwen3.5-9B, med lavrangsadaptere af rang 256 og et routinghoved trænet ovenpå. Ved inferens laver stammen en ren prefill-kørsel, og modellen scorer derefter de gyldige skemavalg parallelt. Intet produceres token for token, og det er der, hastigheden kommer fra.

Cloudflare trænede også med et Brier-tab ved siden af etiketudjævnet krydsentropi for at kalibrere sandsynlighederne, og med en metode, selskabet kalder forstærkende læring til kalibrerede beslutninger, som giver delvis kredit for nærliggende ordinalsvar. To forskelle fra Jev er lette at sige: Clef har en billedkoder og kan klassificere billeder, hvilket Jev ikke gør i dag, og den har et kontekstvindue på 64k mod Jevs 32k.
Tallene, og hvem de tilhører
Alle tal nedenfor er Cloudflares, målt af Cloudflare. I den tirækkede tabel, selskabet offentliggjorde fra Jev Decision Index, har en Clef-model den højeste score på syv rækker — blandt andet 94,20 i makro-F1 på BANKING77 mod Jevs 79,74 og 97,73 på et hvidevaresæt mod Jevs 52,27. Jev fører på When2Call og BRIGHT, og DiffusionGemma Jev på PhishNChips.

For forsinkelse på tværs af 43 testkørsler rapporterer Cloudflare en median på 209,3 ms for Clef og 38,8 ms for Clef-flash mod 524,1 ms for Jev. En konkurrent ved navn Laya er endnu hurtigere med 5,8 ms i median, men Cloudflares egen tabel giver den 38,13, hvor Clef-modellerne ligger over 98, og dens p95-forsinkelse er dårligere end Clef-flashs. I Typesafes egen evalueringssuite siger Cloudflare, at Clef slog Jev i tre ud af fire arbejdsgange, men tabte på observerbarhed af agentspor.
Det interne resultat, der er værd at gentage, kommer fra Cloudflares trusselsefterretningshold, som bruger Clef til at kategorisere domæner: 2,2 sekunder til at hente, gengive og klassificere et websted mod 4,7 sekunder for gpt-oss-120b, der oven i købet kun returnerede to klassifikationer.
Finjusteringsforretningen nedenunder
Ved siden af modellerne lancerer Cloudflare en tjeneste til finjustering med forstærkende læring, først leveret af selskabets udstationerede ingeniørhold og senere, siger det, som selvbetjening. Delene er eksisterende produkter — AI Gateway til at indsamle forespørgselsdata, Workers AI til kørslerne, Containers som sandkasse — plus en ny komponent ved navn Trainer og arbejdet med egne modeller, der kom ud af opkøbet af Replicate.
Det er den del, man skal følge. Åbne vægte gør modellen let at prøve; finjusteringskæden er det, der ville få kunder til at blive. Jev er to uger gammel, Amazon udsendte sin egen beslutningsmodel samme uge, og ingen uden for leverandørerne har endnu offentliggjort en uafhængig sammenligning af nogen af dem.