Tre värden per vikt

PrismML släppte Ternary Bonsai 2 27B den 17 september, en komprimerad version av Alibabas Qwen3.8 27B som lagrar varje vikt som ett av tre värden — minus ett, noll eller plus ett — med FP16-skalning applicerad gruppvis. Bolaget anger resultatet till 1,76 effektiva bitar per vikt och ett totalt avtryck på 5,9 GB, mer än nio gånger mindre än originalet i full precision.

Komprimeringspåståendet är hela nyheten, så retentionssiffran bär tyngden. Över en svit på 20 tester som täcker resonemang, matematik, kodning, instruktionsföljning, syn och agentisk verktygsanvändning uppger PrismML ett sammanvägt värde på 83,9 för den ternära versionen mot 85,4 för Qwen3.8 27B i full precision — 98,2 procents retention. Det är bolagets egna mätningar, publicerade tillsammans med släppet, inte en oberoende utvärdering.

De är också en förbättring av bolagets eget tidigare försök. PrismML uppger att första Bonsai 27B behöll omkring 95 procent; gapet som stängts den här gången motsvarar ungefär tre poäng av basmodellens resultat.

Ett stationärt datorchassi med sidopanelen avtagen
Illustration: bolaget uppger 46,8 token per sekund på en Apple M5 Max. Anete Lusina · pexels · Pexels License

Var 5,9 GB placerar en modell

Forskning om kvantisering lever mest i artiklar. Det praktiska påståendet här handlar om placering: vid 5,9 GB får en modell med 27 miljarder parametrar, 262 000 tokens kontext och text- och bildinmatning plats i konsumentminne, jämte ett operativsystem och vad som nu körs.

PrismML uppger upp till 143 token per sekund på ett Nvidia GeForce RTX 5090 och 46,8 token per sekund på en Apple M5 Max — hårdvara i laptopklass i det senare fallet. Bolaget anger också 0,714 milliwattimmar per token på ett RTX 4090, vilket det säger är omkring 40 procent effektivare än modeller på 8 miljarder parametrar i full precision.

Den sista jämförelsen är den som är värd att hålla fast vid. En ternär 27B som kostar mindre energi per token än en tät 8B konkurrerar inte med fronten; den konkurrerar med de små modeller folk kör lokalt i dag för att inget större får plats.

Närbild på kylfläktarna på ett grafikkort
Illustration: PrismML uppger upp till 143 token per sekund på ett RTX 5090. Matheus Bertelli · pexels · Pexels License

Licensen är den andra halvan

Bonsai 2 27B släpps under Apache 2.0, som tillåter kommersiell användning utan separat avtal.

Det är värt att notera eftersom basmodellens släktled rört sig åt andra hållet. Alibaba släppte på söndagen Qwen-Image-2.1 under sin Qwen Research License, som begränsar användningen till icke-kommersiella ändamål, efter att ha släppt tidigare Qwen-Image under Apache 2.0. Att ett derivat bär en mer tillåtande licens än familjens senaste släpp är en ovanlig position, och den hänger helt på villkoren för just den baskontrollpunkt PrismML byggt på.

Att hålla ögonen på

Retentionssiffran behöver oberoende bekräftelse. Ett sammanvägt värde från 20 tester publicerat av den part som säljer komprimeringen är en utgångspunkt, inte ett resultat, och ternära scheman har historiskt försämrats ojämnt: de håller på korta, välstrukturerade uppgifter och faller ifrån på agentiskt arbete med lång horisont, vilket är just den del av sviten som är svårast att sammanfatta i en enda siffra.