Ett genererat titelkort med texten 'Bonsai vs Ternary Bonsai 2 27B', med undertexten 'Två lågbitssatsningar, två olika måttstockar', ovanför tre kort med texten 'Vikter: 0,43 GB vs 5,93 GB', 'Kvalitetspåstående: jämförande vs 98,2 % bibehållande' och 'Kisel: Hexagon NPU vs Apple silicon och CUDA', med en sidfot som lyder 'Alla kvalitetssiffror är leverantörsrapporterade och inte reproducerade.' OrcaRouter-logotypen sitter i nedre högra hörnet.
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: Två lågbitssatsningar, två olika måttstockar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ 1-bit Bonsai 2B visions-språkmodell bredvid Ternary Bonsai 2 27B och den uppenbara jämförelsen — 2 miljarder parametrar mot 27 miljarder, 0,43 GB språkvikter mot 5,93 GB — är det minst intressanta med paret. Det intressanta är att de två modellerna, från samma leverantör och samma komprimeringsprogram, inte rapporterar sin kvalitet på samma sätt. Ternary Bonsai 2 27B rapporterar retention: den behåller över 98 % av den aggregerade benchmark-prestandan hos sin fullprecisions-motsvarighet, mätt mot sig själv. 1-bit Bonsai 2B rapporterar en jämförelse: den uppnådde "jämförbara benchmark-resultat" mot en Qwen 3 1.7B-modell vid 4-bit-kvantisering, mätt mot någon annans modell vid en annan precision. Den ena är ett uttalande om hur mycket som förlorades. Den andra är ett uttalande om hur den står sig. Ingen av dem är ett uttalande om hur bra någon av modellerna är i absoluta termer, och de två kan inte läsas på samma skala.

Den distinktionen spelar större roll än parametrantalet, eftersom den avgör vad du faktiskt kan dra för slutsatser av leverantörens siffror — och utifrån den evidens som publicerats hittills är det ärliga svaret mindre än vad rubriksiffrorna antyder.

Två kvalitetspåståenden, två olika måttstockar

Ternary Bonsai 2 27B, som släpptes den 17 september 2026, är en ternär {−1, 0, +1}-ombyggnad av Qwen3.8-27B vid 1,76 effektiva bitar per vikt, och siffran som PrismML lyfter fram är att den behåller mer än 98 % av fullprecisionsmodellens samlade benchmarkprestanda. Det är ett bevarandepåstående, och bevarandepåståenden är självreferentiella till sin konstruktion: de talar om hur mycket av originalet som överlevde komprimeringen, inte var originalet stod. En modell som behåller 98 % av en medioker baslinje är fortfarande en medioker modell, och Qwen3.8-27B är inte medioker — men siffran ensam säger inte det, och den kan inte jämföras mellan basmodeller.

Den 1-bitars Bonsai 2B vision-language-modellen, som tillkännagavs den 23 september 2026 för glasögonplattformen Snapdragon AR1 Gen 1, är en 1,7B 1-bitars språkmodell plus en 0,3B 4-bitars vision-encoder. Dess publicerade kvalitetsuttalande skiljer sig till sin karaktär: PrismML utvärderade den mot en Qwen 3 1.7B-modell vid 4-bitars kvantisering över BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K och GPQA Diamond, och rapporterade att de två konfigurationerna uppnådde jämförbara resultat. Det är ett påstående om paritet mot en extern baslinje. Det säger att komprimeringen inte uppenbart kostade dig något jämfört med den 4-bitarsväg du annars skulle ha använt – vilket är exakt rätt fråga för en lansering i enhetsklass, och ett mycket svagare påstående än "den här modellen är bra".

Det finns alltså ingen tolkning där 98,2 % slår ”jämförande” eller tvärtom. De är svar på två olika frågor, ställda mot två olika referenser, i två olika testsviter, av samma leverantör. Den som rangordnar dessa två modeller på grundval av de två meningarna rangordnar meningarna.

Basmodellerna kommer från olika platser

Det finns en andra strukturell skillnad, och det är den som kommer att spela roll under det kommande året. Ternary Bonsai 2 27B är en omkomprimering av en extern modell – Alibabas Qwen3.8-27B. Dess kvalitetstak sätts av någon annans utgivningsschema, och dess generationskadens följer Qwens snarare än PrismML:s. När Qwen släpper en ny 27B får Bonsai 27B-linjen en ny indata, och retentionssiffran räknas om mot en ny baslinje.

1-bit Bonsai 2B bygger på PrismML:s egen Bonsai 1.7B. Dess tak sätts internt, dess uppdateringstakt är det PrismML som väljer, och dess förbättringar kommer från komprimeringsreceptet och kernelvägen snarare än från ett utbyte av en uppströmsmodell. Det är en annan typ av tillgång: långsammare att förbättra i fråga om rå förmåga, helt under leverantörens kontroll och – som glasögonlanseringen visar – möjlig att optimera för en specifik accelerator på ett sätt som en allmän omkomprimering inte kan.

Båda är legitima strategier. De är inte utbytbara, och den du vill ha beror på om din färdplan är förankrad i Qwens eller i enhetens.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Specifikationskontrasten, en rad i taget

• Parametrar – en 1,7B 1-bitars LLM plus en 0,3B 4-bitars visionsencoder i glasögonmodellen, mot en modell i 27B-klassen härledd från Qwen3.8-27B i Ternary Bonsai 2 27B.

• Representation — binär {−1, +1} med FP16-gruppvis skalning i glasögonmodellen, mot ternär {−1, 0, +1} med samma skalning vid 1,76 effektiva bitar per vikt i 27B.

• Språkmodellvikter — 0,43 GB för 1-bitars 1,7B, mot 5,93 GB för PTQ1_0-packningen av Ternary Bonsai 2 27B, med en 7,25 GB PQ2_0-packning också tillgänglig.

• Kontext — 1 024 tokens på glasögonmodellen, mot en full kontext på 262 000 tokens på Ternary Bonsai 2 27B.

• Accelerator — Qualcomm Hexagon NPU via ett QNN SDK med stöd för 1-bitarskärnor, mot Apple silicon via MLX och NVIDIA via CUDA.

• Kvalitetsanspråk – "jämförande benchmarkresultat" mot en 4-bitars Qwen 3 1.7B, gentemot en bibehållningsgrad på "över 98 %" av baslinjen med full precision för Qwen3.8-27B. Båda är rapporterade av leverantören, ingen av dem oberoende reproducerad, uppmätta på olika testsviter.

Körtid — en Qualcomm NPU-verktygskedja för glasögonmodellen, gentemot PrismML:s egen llama.cpp-fork och en MLX-container för 27B, varav ingen stöds av standardversionen av llama.cpp.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Vad lågbitssatsningen ger i varje enskilt fall

Komprimeringsfilosofin är densamma i båda modellerna och förtjänar att nämnas, eftersom det är familjens egentliga tes: den lågbitiga representationen körs från början till slut – inbäddningar, attention, MLP:er och LM-huvudet – med FP16-gruppvis skalning och inga flyktvägar till högre precision. Ingen av modellerna behåller ett flyttalsskyddsnät för de delar som är svåra att kvantisera. Det är en mer aggressiv hållning än de flesta kvantiseringsarbeten intar, och det är vad som överhuvudtaget möjliggör 1,76 bitar per vikt och 0,43 GB vikter.

Var vadet betalar sig varierar. I Ternary Bonsai 2 27B är utdelningen kapacitet per byte på hårdvara du redan äger: en modell i 27B-klassen i 5,93 GB, som körs på en laptop eller en telefon, vid 98 % av sin baslinje. I 1-bit Bonsai 2B är utdelningen existens på en enhetsklass som inte hade något alternativ: en multimodal modell i 0,43 GB språkvikter, på en NPU, med 15,36 tokens per sekund. Den första är en bättre version av något som redan fungerade. Den andra är något som inte fungerade tidigare.

Där nivågränsen ligger

Dessa två är inte alternativ, och att behandla dem som en direkt jämförelse missar den driftsättningsform som båda utgåvorna pekar mot. En glasögon- eller wearable-produkt kör 2B lokalt eftersom inget annat ryms. En laptop- eller telefonprodukt kör 27B eftersom den kan. I samma stund som en produkt spänner över båda — en telefonapp parad med glasögon, en laptopapp med en assistent på enheten — slutar frågan att handla om vilken modell och blir vilka förfrågningar varje nivå får besvara.

Den gränsen är värd att lägga i konfiguration snarare än i applikationskod, eftersom båda nivåerna kommer att förändras. 27B-gränsen flyttas när Qwen släpper en ny version, 2B-gränsen flyttas när PrismML ändrar receptet, och en hårdkodad regel om kontextlängd eller kapacitet går sönder vid båda händelserna. En routningspolicy som eskalerar förfrågningar bortom den lokala nivåns budget till en hostad modell överlever båda förändringarna; den lokala nivån förblir en nivå bland flera i stället för ett antagande som löper genom hela klienten. OrcaRouter är lagret som gör den eskaleringen – en slutpunkt över 200+ hostade modeller, med failover inkluderat, med policyn uttryckt som konfiguration. Ingen av Bonsai-modellerna routas här; båda är lokala nedladdningar. Det som ligger här är nivån ovanför dem, och med en lokal modell på 1 024 tokens gör den nivån det mesta av arbetet.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Vad skulle avgöra det?

Tre mätningar skulle förvandla det här paret från två marknadsföringspåståenden till en jämförelse. En uppdelning per benchmark bakom raden "jämförande resultat", så att avvägningen mot 4-bitars blir synlig i stället för sammanfattad. En bevarandesiffra för 1-bitars Bonsai 2B mot dess egen fullprecisionsbaslinje – den mätning som PrismML använder för 27B-serien och inte publicerade här. Och en oberoende utvärdering av endera modellen, eftersom varje siffra i båda utgåvorna för närvarande kommer från leverantören.

Tills en av dem existerar är den försvarbara ståndpunkten den som siffrorna faktiskt stöder: Ternary Bonsai 2 27B är den bättre modellen med bred marginal, och 1-bit Bonsai 2B är den enda av de två som körs på enheten den byggdes för. De två påståendena är inte oförenliga, och det faktum att samma leverantör mätte dem med olika måttstockar är det som är värt att komma ihåg nästa gång en av dessa siffror citeras utan sin baslinje.