Una sola llamada para audio, vídeo, imágenes y texto
Cloudflare ha añadido un miembro multimodal a su familia Clef de modelos de decisión y ha recortado a menos de la mitad el precio del más barato. Clef-omni acepta audio en wav o mp3 y vídeo en mp4 o webm, además de imágenes y texto, y lo procesa todo en una sola canalización y una sola llamada a la API. La empresa publicó los detalles el jueves en una entrada firmada por Michelle Chen.
El modelo se apoya en Qwen3-Omni-30B-A3B-Instruct, de Alibaba, un modelo de mezcla de expertos. Cloudflare dice que conservó la parte de comprensión y descartó los componentes de salida de texto a voz, y que después entrenó con el tronco de Qwen3 congelado, adaptadores de rango bajo y una función de pérdida de entropía cruzada con suavizado de etiquetas más calibración por puntuación de Brier. Como el resto de la familia, no genera ningún token de salida: devuelve una probabilidad sobre un conjunto fijo de opciones.
Cuánto cuesta y cuánto tarda
Clef-omni cuesta 0,15 dólares por millón de tokens de entrada. Cloudflare da latencias medianas de unos 130 milisegundos solo con texto, unos 150 con imágenes, unos cientos de milisegundos con audio y alrededor de 1,5 segundos para un vídeo de 21 segundos con sonido. Los pesos están publicados en Hugging Face como Cloudflare/clef-omni, y el identificador del modelo en Workers AI es @cf/cloudflare/clef-omni.

El cambio más brusco afecta a Clef-flash, que pasa de 0,09 a 0,038 dólares por millón de tokens de entrada, más barato, señala Cloudflare, que Jev, el modelo de TypeSafe AI que abrió la categoría. El precio trae una contrapartida: la ventana de contexto alojada baja de 64.000 tokens a 24.000. Cloudflare dice que solo el 0,24 % de las peticiones supera los 24.000 tokens de entrada, y que los pesos de Hugging Face, entrenados para 256.000, no cambian.
Un cambio de servidor, no un modelo nuevo
El modelo Clef base mantiene sus 0,24 dólares por millón de tokens de entrada y su ventana de 64.000, pero se ha vuelto más rápido: Cloudflare lo migró a SGLang, aportó el soporte en la pull request #42721 y lo lanzó con SGLang 0.5.22. Sus cifras publicadas muestran la latencia mediana cayendo de 262 a 152 milisegundos con unos 800 tokens, de 616 a 305 con unos 3.400 y de 2.721 a 1.635 con unos 16.000. Los pesos no cambiaron.

“Hemos escuchado vuestros comentarios: queréis un modelo de decisión lo bastante asequible como para incorporarlo a cualquier flujo de trabajo”, escribió la empresa.
La tabla de resultados es de Cloudflare
La entrada publica puntuaciones en diez pruebas públicas y cinco evaluaciones internas de flujos de trabajo, todas ejecutadas por Cloudflare. Según sus cifras, Clef-omni alcanza 94,8 de macro-F1 en BANKING77 frente a 79,74 de Jev, y 97,7 en CLINC150+OOS frente a 89,27. Jev gana en otras, como When2Call, donde Cloudflare sitúa a Jev en 80,97 y a Clef-omni en 63,3. No se ha publicado ninguna evaluación independiente de ninguno de los dos.
Cloudflare dice que Clef es compatible con la API de Jev, de modo que cambiar es cuestión de cambiar el identificador del modelo, y que sus propios equipos usan la familia para cerrar incidencias de spam en un repositorio público de documentación, moderar bibliotecas de complementos contra el phishing, buscar identificadores personales y detectar dominios maliciosos. El registro de cambios de Workers AI lleva las mismas fechas. Lo que merece seguimiento es si la ventana de 24.000 tokens acaba doliendo a ese 0,24 % más de lo que sugiere la media.