Un modelo que no sabe escribir

Perplexity publicó el jueves pplx-decider-v1-27b, un modelo de pesos abiertos alojado en Hugging Face bajo licencia Apache 2.0 y afinado a partir de Qwen3.8-27B. Es multimodal, acepta texto e imágenes, y no genera prosa. Devuelve una opción elegida de un conjunto fijo junto con probabilidades calibradas.

Esa es la propiedad que define a la categoría. Un modelo de decisión responde en una de unas pocas formas tipadas — sí o no, una de n opciones, una puntuación ordenada — y como el espacio de salida está cerrado, la respuesta se puede comprobar en lugar de analizar. Para un agente que decide si un pasaje recuperado respalda una afirmación, o si un ticket de soporte es una solicitud de reembolso, eso es todo el requisito.

Qué dicen las pruebas, y quién las ha hecho

En el panel propio de Perplexity de once pruebas y 7.210 muestras, pplx-decider sacó un 85,71 por ciento global frente al 84,51 por ciento de Jev, el modelo de TypeSafe AI que abrió la categoría en septiembre. La ficha del modelo reporta un 90,60 por ciento en TabFact, 89,20 en Circa, 88,80 en RAGTruth, 84,18 en FinancialPhraseBank y 83,30 en WinoGrande, y un 74,76 por ciento global para el Qwen3.8-27B base del que parte.

Una mano pulsando un botón en un dispositivo
Los pesos se publican bajo la licencia Apache 2.0. Foto ilustrativa. RDNE Stock project · pexels · Pexels License

El margen sobre Jev es de 1,2 puntos en un panel que eligió Perplexity, y el desglose no es uniforme: según el recuento de AI Weekly, Jev puntúa más alto en seis de las once pruebas, con Perplexity por delante en FinancialPhraseBank, RAGTruth, TabFact y Circa. La mayor diferencia está en RAGTruth, donde Perplexity reporta 88,80 frente a 77,27.

Una ventaja de un punto en un panel elegido por el proveedor no es por sí sola una afirmación de capacidad que valga mucho. Que los pesos estén en Hugging Face bajo Apache 2.0 es la parte que puede comprobar cualquiera con una GPU.

Tres en dos días

Amazon abrió Strands Decider, un modelo de 2.000 millones de parámetros, el miércoles. Cloudflare abrió dos modelos Clef la misma semana. El de Perplexity es el mayor de los tres con 27.000 millones de parámetros, y el único afinado a partir de una base abierta existente en lugar de entrenado para el propósito.

Paquetes avanzando por una cinta de clasificación
Los sistemas de agentes hacen gran número de pequeñas llamadas de clasificación. Foto ilustrativa. Kampus Production · pexels · Pexels License

La velocidad de esa convergencia es la noticia real. Los sistemas de agentes hacen un número enorme de pequeñas llamadas de clasificación, cada una de las cuales hoy pasa por un modelo de propósito general construido para escribir al que se le pide elegir. Cobrar por tokens de generación que nunca se generan es una ineficiencia evidente, y el mercado la ha encontrado toda a la vez.

Lo que hay que vigilar es si algún evaluador independiente publica un panel que no haya elegido ninguno de estos proveedores. Ya existen cuatro modelos de decisión y cada comparación entre ellos hasta ahora la ha hecho uno de sus autores.