Strands Labs, de Amazon, ha publicado Strands Decider 2B, un modelo de código abierto que no genera texto en absoluto. Dado un conjunto de opciones predefinidas, las puntúa y devuelve la mejor con un valor de confianza. Esa es toda su salida.
Es rápido precisamente por lo que no hace. Strands Labs informa de una latencia mediana de unos 115 milisegundos en una Nvidia RTX 3090 local y de unos 153 milisegundos en un MacBook con chip M3.
Cómo está construido
El modelo parte de un tronco Qwen3.5-2B preentrenado, le retira la cabeza de modelado de lenguaje y la sustituye por una cabeza de puntero que puntúa los estados ocultos en la posición de cada opción frente a la posición de un token de respuesta. Esa cabeza de puntero tiene poco más de un millón de parámetros. El ajuste fino usa un adaptador LoRA de rango 16.

Strands Labs afirma que ocupa el tercer puesto de 33 modelos de su clase de dos mil millones de parámetros en JevBench por precisión y calibración combinadas; la calibración se mide con la puntuación de Brier, que pregunta si el valor de confianza significa algo, y no si la respuesta es correcta. Los pesos están en Hugging Face, y los datos de entrenamiento, los guiones y el historial completo de iteraciones, en GitHub.
Una clase de modelo con un mes de vida
Los modelos de decisión no existían como categoría en septiembre. TypeSafe creó una con Jev, llamado así por el economista William Stanley Jevons y su argumento de que un coste que baja puede elevar la demanda en lugar de reducirla. Han seguido decenas de imitadores.

Marc Brooker, el ingeniero de Amazon que dirigió el trabajo, planteó el atractivo en términos operativos: un paso de flujo que puede estructurarse para ser más fiable, con menor latencia y posiblemente menor coste. El consejero delegado de TypeSafe fue menos generoso con el campo que inició, y dijo a TechCrunch que la hornada actual parece más gente de aprendizaje automático queriendo implementar una arquitectura interesante que un equipo dedicado a hacer útil la inteligencia.
Por qué importa más allá de la novedad
La mayoría de los marcos de agentes encaminan pidiendo a un modelo grande que emita una palabra y luego analizándola. Eso es caro, lento y poco fiable en silencio, porque un modelo que escribe “opción B” no ofrece ninguna medida utilizable de cuán seguro estaba. Una cabeza dedicada que devuelve una puntuación calibrada sobre un conjunto fijo de opciones elimina ambos problemas justo en el paso donde los agentes más se equivocan.
Qué vigilar
Si JevBench aguanta como medida. Un banco de pruebas creado junto a un producto por la empresa que inventó la categoría es lo primero que un rival discutiría, y hasta ahora nadie lo ha hecho.