Dois modelos, nenhuma saída de texto

A Cloudflare lançou o Clef e o Clef-flash, dois modelos de decisão que não geram texto nenhum. Num artigo de 1 de outubro, a empresa disse que ambos têm pesos abertos sob licença Apache 2.0 no Hugging Face e correm na sua plataforma Workers AI, e que são compatíveis ao nível da API com o Jev System One da Typesafe AI, o modelo que criou esta categoria há algumas semanas.

Um modelo de decisão recebe um estado de entrada e um conjunto de perguntas tipadas, e devolve uma probabilidade para cada resposta admitida. O exemplo da Cloudflare é uma mensagem de apoio: é urgente, que equipa deve tratá-la, qual a gravidade. A saída é um registo estruturado de probabilidades sobre o qual o código que chama pode agir sem que ninguém o leia.

Como está construído

O Clef congela uma base Qwen3.8-27B e o Clef-flash uma Qwen3.5-9B, com adaptadores de baixa ordem de ordem 256 e uma cabeça de encaminhamento treinada por cima. Na inferência a base faz uma passagem só de preenchimento prévio e o modelo pontua em paralelo as escolhas válidas do esquema. Nada é produzido token a token, e é daí que vem a velocidade.

Uma programadora a trabalhar numa secretária com dois monitores
Os modelos devolvem probabilidades tipadas sobre as quais o programa que chama atua. Foto ilustrativa. ThisIsEngineering · pexels · Pexels License

A Cloudflare treinou também com uma perda de Brier ao lado de entropia cruzada suavizada para calibrar as probabilidades, e com um método a que chama aprendizagem por reforço para decisões calibradas, que dá crédito parcial a respostas ordinais vizinhas. Duas diferenças face ao Jev são fáceis de enunciar: o Clef tem um codificador de visão e consegue classificar imagens, o que o Jev hoje não faz, e tem uma janela de contexto de 64k contra os 32k do Jev.

Os números, e de quem são

Todos os números abaixo são da Cloudflare, medidos pela Cloudflare. Na tabela de dez linhas que publicou a partir do Jev Decision Index, um modelo Clef tem a pontuação mais alta em sete linhas — incluindo 94,20 de macro-F1 no BANKING77 contra 79,74 do Jev, e 97,73 num conjunto de eletrodomésticos contra 52,27 do Jev. O Jev lidera no When2Call e no BRIGHT, e o DiffusionGemma Jev no PhishNChips.

Cabos de fibra ótica ligados a um comutador de rede
O Clef e o Clef-flash correm na rede de periferia da Cloudflare. Foto ilustrativa. Brett Sayles · pexels · Pexels License

Em latência, ao longo de 43 execuções de testes, a Cloudflare reporta uma mediana de 209,3 ms para o Clef e 38,8 ms para o Clef-flash, contra 524,1 ms do Jev. Um rival chamado Laya é ainda mais rápido, com 5,8 ms de mediana, mas a própria tabela da Cloudflare dá-lhe 38,13 onde os modelos Clef passam dos 98, e a sua latência p95 é pior do que a do Clef-flash. Na suite de avaliação da própria Typesafe, a Cloudflare diz que o Clef bateu o Jev em três de quatro fluxos de trabalho, perdendo na observabilidade de rastos de agentes.

O resultado interno que vale a pena repetir vem da equipa de informação sobre ameaças da Cloudflare, que usa o Clef para categorizar domínios: 2,2 segundos para obter, renderizar e classificar um site, contra 4,7 segundos do gpt-oss-120b, que ainda por cima só devolveu duas classificações.

O negócio de afinação que está por baixo

Ao lado dos modelos, a Cloudflare lança um serviço de afinação por aprendizagem por reforço, prestado primeiro pela sua equipa de engenharia destacada e mais tarde, diz, em autosserviço. As peças são produtos existentes — AI Gateway para recolher dados de pedidos, Workers AI para as execuções, Containers como caixa de areia de aprendizagem por reforço — mais um componente novo chamado Trainer e o trabalho de trazer o teu próprio modelo saído da aquisição da Replicate.

É essa a parte a seguir. Pesos abertos tornam o modelo fácil de experimentar; a cadeia de afinação é o que faria os clientes ficar. O Jev tem duas semanas, a Amazon lançou o seu próprio modelo de decisão na mesma semana, e ninguém fora dos fabricantes publicou ainda uma comparação independente de qualquer um deles.