Dos modelos, ninguna salida de texto
Cloudflare ha publicado Clef y Clef-flash, dos modelos de decisión que no generan texto en absoluto. En una entrada del 1 de octubre la compañía dijo que ambos son de pesos abiertos bajo licencia Apache 2.0 en Hugging Face y están alojados en su plataforma Workers AI, y que son compatibles a nivel de API con Jev System One de Typesafe AI, el modelo que creó esta categoría hace unas semanas.
Un modelo de decisión recibe un estado de entrada y un conjunto de preguntas tipadas, y devuelve una probabilidad para cada respuesta admitida. El ejemplo de Cloudflare es un mensaje de soporte: si es urgente, qué equipo debe atenderlo, cuál es la gravedad. La salida es un registro estructurado de probabilidades sobre el que el código puede actuar sin que nadie lo lea.
Cómo está construido
Clef congela un backbone Qwen3.8-27B y Clef-flash uno Qwen3.5-9B, con adaptadores de rango bajo de rango 256 y una cabeza de enrutamiento entrenada encima. En inferencia el backbone hace una pasada solo de prefill y el modelo puntúa en paralelo las opciones válidas del esquema. Nada se produce token a token, y de ahí viene la velocidad.

Cloudflare también entrenó con una pérdida de Brier junto a entropía cruzada suavizada para calibrar las probabilidades, y con un método que llama Aprendizaje por Refuerzo para Decisiones Calibradas, que da crédito parcial a respuestas ordinales adyacentes. Dos diferencias frente a Jev son fáciles de enunciar: Clef tiene un codificador de visión y puede clasificar imágenes, cosa que Jev hoy no hace, y tiene una ventana de contexto de 64k frente a los 32k de Jev.
Las cifras, y de quién son
Todas las cifras siguientes son de Cloudflare, medidas por Cloudflare. En la tabla de diez filas que publicó a partir del Jev Decision Index, un modelo Clef obtiene la puntuación más alta en siete filas, incluidos 94,20 de macro-F1 en BANKING77 frente al 79,74 de Jev, y 97,73 en un conjunto de electrodomésticos frente al 52,27 de Jev. Jev encabeza en When2Call y BRIGHT, y DiffusionGemma Jev en PhishNChips.

En latencia, sobre 43 ejecuciones de pruebas, Cloudflare informa de una mediana de 209,3 ms para Clef y 38,8 ms para Clef-flash, frente a 524,1 ms de Jev. Un rival llamado Laya es aún más rápido, con 5,8 ms de mediana, pero la propia tabla de Cloudflare le da 38,13 donde los modelos Clef superan 98, y su latencia p95 es peor que la de Clef-flash. En la suite de evaluación de la propia Typesafe, Cloudflare dice que Clef superó a Jev en tres de cuatro flujos, perdiendo en observabilidad de trazas de agentes.
El resultado interno que merece repetirse viene del equipo de inteligencia de amenazas de Cloudflare, que usa Clef para categorizar dominios: 2,2 segundos para descargar, renderizar y clasificar un sitio, frente a 4,7 segundos de gpt-oss-120b, que además solo devolvió dos clasificaciones.
El negocio de ajuste fino que hay debajo
Junto a los modelos, Cloudflare lanza un servicio de ajuste fino por aprendizaje por refuerzo, prestado primero por su equipo de ingeniería desplegada y más adelante, dice, en autoservicio. Las piezas son productos existentes —AI Gateway para recoger datos de peticiones, Workers AI para las ejecuciones, Containers como entorno de RL— más un componente nuevo llamado Trainer y el trabajo de traer tu propio modelo surgido de su adquisición de Replicate.
Esa es la parte a vigilar. Los pesos abiertos hacen fácil probar el modelo; la cadena de ajuste fino es lo que haría quedarse a los clientes. Jev tiene dos semanas, Amazon sacó su propio modelo de decisión la misma semana, y nadie ajeno a los fabricantes ha publicado todavía una comparación independiente de ninguno de ellos.