Tres valores por peso

PrismML publicó el 17 de septiembre Ternary Bonsai 2 27B, una versión comprimida del Qwen3.8 27B de Alibaba que guarda cada peso como uno de tres valores —menos uno, cero o más uno— con escalado FP16 aplicado grupo a grupo. La compañía sitúa el resultado en 1,76 bits efectivos por peso y una huella total de 5,9 GB, más de nueve veces menor que el original en precisión completa.

La afirmación de compresión es toda la historia, así que la cifra de retención carga con el peso. En una batería de 20 pruebas que cubre razonamiento, matemáticas, programación, seguimiento de instrucciones, visión y uso agéntico de herramientas, PrismML declara un agregado de 83,9 para la versión ternaria frente a 85,4 para el Qwen3.8 27B en precisión completa: un 98,2 por ciento de retención. Son mediciones propias de la empresa, publicadas junto al lanzamiento, no una evaluación independiente.

También son una mejora sobre su intento anterior. PrismML dice que el primer Bonsai 27B retenía alrededor del 95 por ciento; la brecha cerrada esta vez equivale a unos tres puntos de la puntuación del modelo base.

Una caja de ordenador de sobremesa con el panel lateral quitado
Ilustración: la empresa declara 46,8 tokens por segundo en un Apple M5 Max. Anete Lusina · pexels · Pexels License

Dónde coloca a un modelo 5,9 GB

La investigación sobre cuantización vive sobre todo en artículos académicos. La afirmación práctica aquí es de ubicación: con 5,9 GB, un modelo de 27.000 millones de parámetros con contexto de 262.000 tokens y entrada de texto e imagen cabe en memoria de consumo, junto a un sistema operativo y lo que sea que esté corriendo.

PrismML declara hasta 143 tokens por segundo en una Nvidia GeForce RTX 5090 y 46,8 tokens por segundo en un Apple M5 Max, hardware de clase portátil en el segundo caso. También da una cifra energética de 0,714 milivatios-hora por token en una RTX 4090, que según la empresa es un 40 por ciento más eficiente que los modelos de 8.000 millones en precisión completa.

La comparación que conviene retener es esa última. Un 27B ternario que cuesta menos energía por token que un 8B denso no compite con la frontera: compite con los modelos pequeños que la gente ejecuta hoy en local porque nada mayor cabe.

Primer plano de los ventiladores de una tarjeta gráfica
Ilustración: PrismML declara hasta 143 tokens por segundo en una RTX 5090. Matheus Bertelli · pexels · Pexels License

La licencia es la otra mitad

Bonsai 2 27B se publica bajo Apache 2.0, que permite el uso comercial sin acuerdo aparte.

Merece la pena señalarlo porque el linaje del modelo base se ha movido en dirección contraria. Alibaba publicó el domingo Qwen-Image-2.1 bajo su Licencia de Investigación Qwen, que restringe el uso a fines no comerciales, tras haber lanzado el anterior Qwen-Image bajo Apache 2.0. Que un derivado lleve una licencia más permisiva que los lanzamientos recientes de su familia es una posición inusual, y depende por completo de los términos del punto de control base concreto sobre el que PrismML construyó.

Qué vigilar

La cifra de retención necesita confirmación independiente. Un agregado de 20 pruebas publicado por quien vende la compresión es un punto de partida, no un resultado, y los esquemas ternarios se han degradado históricamente de forma desigual: aguantan en tareas cortas y bien estructuradas y ceden en trabajo agéntico de horizonte largo, que es justo la parte de la batería más difícil de resumir en un solo número.