To modeller, ingen tekstutdata

Cloudflare har sluppet Clef og Clef-flash, to beslutningsmodeller som ikke genererer tekst i det hele tatt. I et innlegg 1. oktober opplyser selskapet at begge har åpne vekter under Apache 2.0 på Hugging Face og kjøres på plattformen Workers AI, og at begge er API-kompatible med Typesafe AIs Jev System One, modellen som skapte kategorien for noen uker siden.

En beslutningsmodell tar imot en inndatatilstand og et sett typede spørsmål, og returnerer en sannsynlighet for hvert tillatt svar. Cloudflares eksempel er en supporthenvendelse: haster den, hvilket team skal ta den, hvor alvorlig er virkningen. Utdataene er en strukturert post med sannsynligheter som kallende kode kan handle på uten at noen leser den.

Hvordan den er bygget

Clef fryser en Qwen3.8-27B-stamme og Clef-flash en Qwen3.5-9B, med lavrangsadaptere av rang 256 og et rutingshode trent oppå. Ved inferens gjør stammen en ren prefill-passering, og modellen poengsetter deretter de gyldige skjemavalgene parallelt. Ingenting produseres token for token, og det er der farten kommer fra.

En programvareutvikler som jobber ved et skrivebord med to skjermer
Modellene returnerer typede sannsynligheter som kallende program handler på. Illustrasjonsfoto. ThisIsEngineering · pexels · Pexels License

Cloudflare trente også med et Brier-tap ved siden av etikettutjevnet kryssentropi for å kalibrere sannsynlighetene, og med en metode selskapet kaller forsterkende læring for kalibrerte beslutninger, som gir delvis uttelling for nærliggende ordinalsvar. To forskjeller fra Jev er enkle å si: Clef har en bildekoder og kan klassifisere bilder, noe Jev ikke gjør i dag, og den har et kontekstvindu på 64k mot Jevs 32k.

Tallene, og hvem de tilhører

Alle tallene under er Cloudflares, målt av Cloudflare. I tabellen med ti rader selskapet publiserte fra Jev Decision Index har en Clef-modell høyest poengsum på sju rader — blant annet 94,20 i makro-F1 på BANKING77 mot Jevs 79,74, og 97,73 på et hvitevaresett mot Jevs 52,27. Jev leder på When2Call og BRIGHT, og DiffusionGemma Jev på PhishNChips.

Fiberoptiske patchekabler koblet til en nettverkssvitsj
Clef og Clef-flash kjøres på Cloudflares kantnettverk. Illustrasjonsfoto. Brett Sayles · pexels · Pexels License

For ventetid på tvers av 43 testkjøringer rapporterer Cloudflare en median på 209,3 ms for Clef og 38,8 ms for Clef-flash, mot 524,1 ms for Jev. En konkurrent som heter Laya er enda raskere med 5,8 ms i median, men Cloudflares egen tabell gir den 38,13 der Clef-modellene ligger over 98, og dens p95-ventetid er dårligere enn Clef-flash sin. I Typesafes egen evalueringssuite sier Cloudflare at Clef slo Jev i tre av fire arbeidsflyter, men tapte på observerbarhet for agentspor.

Det interne resultatet som er verdt å gjenta, kommer fra Cloudflares trusseletterretningsteam, som bruker Clef til å kategorisere domener: 2,2 sekunder på å hente, gjengi og klassifisere et nettsted, mot 4,7 sekunder for gpt-oss-120b, som dessuten bare returnerte to klassifiseringer.

Finjusteringsforretningen under det hele

Ved siden av modellene lanserer Cloudflare en tjeneste for finjustering med forsterkende læring, først levert av selskapets utplasserte ingeniørteam og senere, sier det, som selvbetjening. Delene er eksisterende produkter — AI Gateway for å samle forespørselsdata, Workers AI for kjøringer, Containers som sandkasse — pluss en ny komponent som heter Trainer og arbeidet med egne modeller som kom ut av oppkjøpet av Replicate.

Det er den delen å følge. Åpne vekter gjør modellen lett å prøve; finjusteringskjeden er det som ville få kunder til å bli. Jev er to uker gammel, Amazon slapp sin egen beslutningsmodell samme uke, og ingen utenfor leverandørene har ennå publisert en uavhengig sammenligning av noen av dem.