Otra forma de responder

Un grupo del laboratorio Hazy Research de Stanford y de Nvidia ha publicado CLM-8B, un modelo de pesos abiertos que no genera texto en absoluto. Dada una situación y una lista de acciones posibles, produce una representación de cada una y devuelve aquella cuya representación queda más cerca de la del estado.

Esa es toda la idea. Donde un modelo de lenguaje escribe una elección token a token, un modelo de lenguaje contrastivo trata la elección como un problema de emparejamiento. Los autores son Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré y Azalia Mirhoseini. Kwok lo anunció el 23 de septiembre.

Es el segundo modelo de esta forma que aparece este mes, después de Jev, de TypeSafe AI, que abrió acceso anticipado el 15 de septiembre. CLM-8B es el abierto.

Qué se entrena en realidad

El 8B del nombre es un codificador Qwen3-8B congelado. Lo que el equipo ha entrenado son dos pequeñas cabezas de proyección —una para estados y otra para acciones— colocadas encima, con un objetivo contrastivo InfoNCE bidireccional que acerca el par correcto de estado y acción y aleja a las acciones rivales.

Primer plano de una placa de circuito impreso
Lo entrenado son dos pequeñas cabezas de proyección sobre un codificador Qwen3-8B congelado. Imagen ilustrativa. Jeremy Waterhouse · pexels · Pexels License

El entrenamiento tuvo tres fases: unos 60 millones de pares de pregunta y respuesta de Nemotron, luego unos 30 millones de negativos difíciles sintéticos y, por último, alrededor de un millón de trayectorias de agentes.

Como los estados y las acciones se codifican por separado, la representación de una acción puede calcularse una vez y reutilizarse. De ahí viene la velocidad: no hace falta releer el conjunto de candidatos en cada decisión.

Las cifras, y quién las ha producido

Todas las cifras que siguen son de los propios autores, publicadas junto al modelo.

Sin ajuste previo, informan de un rendimiento “a la par de Jev en tareas de uso de ordenador, juegos y llamada a herramientas, con una latencia hasta 9 veces menor”. El artículo de VentureBeat recoge las comparaciones concretas: 95,2 por ciento en la prueba de llamada a herramientas BFCL v4 frente al 99,2 de Jev, y 26 de 30 tareas de WikiRacing completadas frente a las 30 de Jev. El intercambio es precisión por latencia, y la ficha del modelo lo dice.

Un programador escribiendo código en la pantalla de un portátil
El modelo apunta a las llamadas de enrutamiento y selección de herramientas. Imagen ilustrativa. Lukas Blazek · pexels · Pexels License

Ajustado como verificador —puntuando soluciones candidatas en lugar de elegir herramientas— informan de un 81,6 por ciento en DeepSWE y un 87,6 por ciento en Terminal-Bench 2.1, cifras que describen como el mejor resultado conocido para ese papel, con una latencia de cuatro a seis veces menor. Ninguno de estos resultados ha sido reproducido de forma independiente todavía.

Por qué importa

Enrutar, clasificar, ordenar y seleccionar salidas son llamadas que el software hace constantemente, y hoy la mayoría se resuelven pidiendo a un gran modelo de lenguaje que escriba una respuesta y analizándola después. Un modelo que devuelve la elección directamente elimina a la vez el coste de generación y el paso de análisis.

Jev demostró que hay mercado para eso. CLM-8B pone la misma forma bajo licencia Apache 2.0, con el código en GitHub y un espacio de pruebas al lado, lo que significa que la comparación ya puede hacerla cualquiera en lugar de anunciarla uno u otro proveedor.

El equipo dice que un CLM-35B multimodal, entrenado con un conjunto más amplio, llegará a principios de octubre.