Ett API-anrop för ljud, video, bilder och text
Cloudflare har lagt till en multimodal medlem i sin Clef-familj av beslutsmodeller och sänkt priset på den billigaste med mer än hälften. Clef-omni tar emot ljud som wav eller mp3 och video som mp4 eller webm, vid sidan av bilder och text, och behandlar allt i en enda pipeline och ett enda API-anrop. Företaget publicerade detaljerna på torsdagen i ett inlägg av Michelle Chen.
Modellen bygger på Alibabas Qwen3-Omni-30B-A3B-Instruct, en mixture-of-experts-modell. Cloudflare uppger att man behöll förståelsedelen och kastade komponenterna för talsyntes, och sedan tränade med Qwen3-stommen fryst, lågrangsadaptrar och en korsentropiförlust med etikettutjämning plus Brier-kalibrering. Liksom resten av familjen genererar den inga utdatatokens alls, utan returnerar en sannolikhet över en fast uppsättning alternativ.
Vad den kostar och hur snabb den är
Clef-omni kostar 0,15 dollar per miljon indatatokens. Cloudflare anger medianlatenser på omkring 130 millisekunder för enbart text, cirka 150 med bilder, några hundra millisekunder för ljud och runt 1,5 sekunder för en 21 sekunder lång video med ljud. Vikterna är publicerade på Hugging Face som Cloudflare/clef-omni, och modell-id:t i Workers AI är @cf/cloudflare/clef-omni.

Den skarpare förändringen gäller Clef-flash, som går från 0,09 till 0,038 dollar per miljon indatatokens — billigare, påpekar Cloudflare, än Jev, TypeSafe AI-modellen som startade kategorin. Priset har ett pris: det hostade kontextfönstret sjunker från 64 000 tokens till 24 000. Cloudflare uppger att bara 0,24 procent av förfrågningarna överstiger 24 000 indatatokens, och att vikterna på Hugging Face, tränade för 256 000, är oförändrade.
En serverändring, inte en ny modell
Grundmodellen Clef behåller sina 0,24 dollar per miljon indatatokens och sitt fönster på 64 000, men har blivit snabbare: Cloudflare flyttade den till SGLang, bidrog med stödet i pull request #42721 och släppte det i SGLang 0.5.22. De publicerade siffrorna visar att medianlatensen faller från 262 till 152 millisekunder vid ungefär 800 tokens, från 616 till 305 vid omkring 3 400 och från 2 721 till 1 635 vid omkring 16 000. Vikterna ändrades inte.

“Vi har hört er: ni vill ha en beslutsmodell som är billig nog att bygga in i vilket arbetsflöde som helst”, skrev företaget.
Tabellen är Cloudflares egen
Inlägget publicerar resultat på tio offentliga tester och fem interna arbetsflödesutvärderingar, alla körda av Cloudflare. Enligt deras siffror når Clef-omni 94,8 i makro-F1 på BANKING77 mot 79,74 för Jev, och 97,7 på CLINC150+OOS mot 89,27. Jev leder i andra, bland annat When2Call, där Cloudflare anger Jev till 80,97 och Clef-omni till 63,3. Ingen oberoende utvärdering av någon av dem har publicerats.
Cloudflare uppger att Clef är API-kompatibel med Jev, så att byta är en fråga om att byta modell-id, och att de egna teamen använder familjen för att stänga skräppostärenden i ett offentligt dokumentationsarkiv, moderera pluginbibliotek mot nätfiske, leta efter personuppgifter och upptäcka skadliga domäner. Ändringsloggen för Workers AI bär samma datum. Det som är värt att följa är om fönstret på 24 000 tokens visar sig svida mer för de 0,24 procenten än genomsnittet antyder.