Ett genererat titelkort med texten ”Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF” och undertexten ”Färre bitar, bättre poäng”, ovanför tre kort med texterna ”Bitar per vikt: 1,76 vs 2,2”, ”Storlek: 5,93 GB vs 7,3 GB” och ”Medelvärde för leverantörens svit: 83,9 vs 75,2”, med en sidfot som lyder ”Bonsai-siffror rapporterade av leverantören; IQ2_XXS-siffror enligt leverantörs- och communitytester.” OrcaRouter-logotypen sitter längst ner till höger.
Engineering & Research

Ternary Bonsai 2 27B mot Qwen3.8-27B IQ2_XXS GGUF: Färre bitar, bättre poäng

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ternary Bonsai 2 27B är mindre än IQ2_XXS GGUF-versionen av Qwen3.8-27B och, enligt de siffror som publicerats med den, också bättre – vilket inte borde vara möjligt om allt som skilde dem åt vore en bitbudget. Bonsai-versionen bär 1,76 bitar per vikt i en fil på 5,93 GB. Den konventionella 2-bitars kvantiseringen av samma basmodell bär ungefär 2,2 bitar per vikt i en fil på omkring 7,3 GB. Prism ML, som tillkännagav den ternära versionen den 17 september 2026, rapporterar ett genomsnitt på 83,9 över 20 benchmarks för sin modell mot 75,2 för jämförelsepunkten IQ2_XXS – en skillnad på 8,7 punkter till fördel för modellen som använder färre bitar.

Den inversionen är hela historien, och den är inget trick. De två filerna skapas av olika processer i olika skeden av modellens liv, och skillnaden mellan dessa processer är värd mer än skillnaden i bitbredd. Det är också jämförelsen där det populära rådet – "ta bara en 2-bitars kvantisering, de är bra nu" – stöter på sitt tydligaste motexempel, och där motexemplet har en oberoende mätning bakom sig i stället för en leverantörs ord.

Paradoxen är mekanismen

IQ2_XXS är ett kvantiseringsformat för efterträning. Modellen tränas till konvergens i full precision och därefter avrundas dess vikter till en lågbitrepresentation som väljs av ett anpassningsförfarande. Modellen får aldrig en chans att anpassa sig; den mäts i efterhand och approximeras. i-quant-familjen är en förbättring jämfört med äldre k-quants genom att använda en viktighetsmatris – en kalibreringskörning som avgör vilka vikter som förtjänar mer av den tillgängliga precisionen – men den grundläggande ordningen för operationerna är oförändrad. Träna, sedan komprimera.

Bonsai vänder på den ordningen. Prism ML:s beskrivning av sin egen metod är att den helt övergav efterträningskvantisering och genomdrev den ternära begränsningen under träningen: framåtpasset beräknar med vikter begränsade till {−1, 0, +1}, medan bakåtpasset fortfarande bär fullprecisionsgradienter. Modellen ägnar sin träning åt att lära sig representationer som överlever begränsningen, i stället för att begränsningen påtvingas representationer som aldrig förväntade sig den. Algoritmen beskrivs som proprietär IP, men formen på den kommer att vara bekant för alla som har läst BitNet-forskningen.

Två förbättringar ligger ovanpå, och båda syns i aritmetiken. Den första är selektiv precision: 26,2 miljoner parametrar – cirka 0,098 % av modellen, ungefär 52 MB i bf16, mestadels den rekurrenta tillståndsvägen hos de linjära attention-lagren plus normaliseringsvikter – hålls i full precision i stället för att ternariseras. Den andra är en blockvis rotation. Varje viktmatris transformeras av en Walsh–Hadamard-rotation med blockstorlek 1 024 innan de ternära värdena väljs, vilket sprider utliggare över koordinater och gör en tre nivåers approximation mindre destruktiv. Rotationen viks in i de lagrade vikterna, så den kostar inga extra byte; i stället appliceras motsvarande transform på aktiveringar vid körning.

Den där sista detaljen har en konsekvens som du stöter på redan vid första försöket att köra den, och det är den verkliga kostnaden för angreppssättet.

Vilken IQ2_XXS menar du, och vad får den faktiskt för poäng?

Innan man jämför kvalitet, en korrigering som de flesta genomgångar hoppar över: "IQ2_XXS" är inte en enda artefakt. Det är en kvantiseringstyp i llama.cpp, och samma typ tillämpad av olika verktygskedjor på samma basmodell producerar filer som skiljer sig betydligt i storlek och avsevärt i kvalitet.

Det tydligaste offentliga beviset är en oberoende jämförelse som publicerades den 15 augusti 2026 av en användare som undersökte huruvida en sub-2-bitars Qwen3.8-27B var värd att bygga överhuvudtaget. Testet är en wikitext-2 KL-divergensmätning, 100 delar vid 512 kontext, mot en lokalt byggd Q8_0-referens med en perplexitet på 6,7500, där varje kandidat använder samma importance-matris, korpus, baslinje och llama.cpp-bygge i en och samma sittning. Resultaten:

• unsloth UD-IQ2_XXS — 8,39 GiB, perplexitet 7,6528, medel-KLD 0,146, median-KLD 0,076, top-1-överensstämmelse 82,98 %

• bartowski IQ2_XXS — 8,75 GiB, perplexitet 8,5352, medel-KLD 0,301, median-KLD 0,162, top-1-överensstämmelse 76,53 %

Den dynamiska varianten är 0,36 GiB mindre än den statiska och cirka 2,1 gånger bättre på genomsnittlig KLD – vid 1,13 gånger baslinjens perplexitet. Två filer med samma etikett, åtskilda av en faktor två på måttet som mäter hur långt utdatadistributionen har förskjutits. Samma test fann att varje kandidat under 2 bitar var sämre än båda publicerade IQ2-alternativen, vilket är varför det praktiska golvet för denna basmodell ligger vid IQ2 snarare än under det.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

Detta spelar roll för jämförelsen eftersom det ändrar vad "7,3 GB IQ2_XXS-bygget" syftar på. Prism ML:s siffra kommer från dess egen kvantisering av basmodellen vid 2,2 bitar per vikt. Ett dynamiskt unsloth-bygge av samma familj mäter 8,39 GiB. Ett bartowski-bygge mäter 8,75 GiB. Storleksskillnaden mellan Bonsai och "IQ2_XXS" ligger därför någonstans mellan 1,4x och 1,5x beroende på vilket bygge du menar – större än vad rubrikens 1,23x antyder, och allt detta innan kvalitetsjämförelsen ens börjar.

Var efterträningsbygget går sönder, och varför det är lätt att missa

Det aggregerade gapet på 8,7 punkter är det minst informativa sättet att ange skillnaden, eftersom försämringen i IQ2_XXS-bygget inte är enhetlig. Den är selektiv, och mönstret är motsatsen till vad de flesta skulle förutse.

• MMLU-Redux — efterträningsversionen står sig respektabelt, i intervallet mitten till höga 80.

• GPQA Diamond — cirka 65,5, mot 85,76 för den ternära versionen

• AIME26 — i intervallet 57,5 till 78,6 beroende på byggversion, mot 95,83 för den ternära byggversionen

• LiveCodeBench — i intervallet 56,4 till 70,05, mot 90,07 för den ternära byggversionen

De exakta IQ2-siffrorna varierar mellan Prism ML:s sviter och community-mätningarna, och intervallen ovan omfattar båda, men formen är konsekvent i alla källor: ytlig kunskap överlever, och allt som kräver en ihållande kedja av resonemang försämras kraftigt. Det är just det felmod som ett informellt test inte hittar. Be ett 2-bitarsbygge att sammanfatta ett dokument eller svara på en faktabaserad fråga, och det presterar som en mycket större modell. Be det att hålla en flerstegsderivation eller producera icke-trivial kod, och kollapsen är plötslig snarare än gradvis. Det är därför "det kändes bra när jag testade det" inte är bevis om en kvantiserad modell – det är bevis om de prompter du råkade testa.

Det ternära bygget uppvisar inte den kollapsen på samma benchmarks. Prism ML rapporterar AIME26 på 95,83 mot 94,58 för sin fullprecisionsbas, och LiveCodeBench på 90,07 mot 90,05 – i praktiken samma nivå, och det enskilt mest användbara påståendet i släppet, eftersom det säger att begränsningen vid träningstid köpte det som efterträningsbegränsningen förlorar.

Motargumentet, som är verkligt och som kvalitetstabellen inte fångar

Allt ovan talar för det ternära bygget vad gäller kvalitet per byte. Det finns en dimension där den konventionella GGUF vinner ohotat, och det är ingen liten sådan: den körs på programvaran du redan har.

IQ2_XXS-bygget av Qwen3.8-27B är en standardartefakt från llama.cpp. Det laddas i llama.cpp, Ollama, LM Studio, Jan och allt annat som länkar mot ggml, på alla plattformar som ggml stöder, utan att någon fork krävs och utan några specialkärnor. Dess viktighetsmatris kan byggas om eller ersättas. Det beter sig som alla andra kvantiserade modeller du har på disken.

Ternary Bonsai 2 27B gör det inte. De ternära kärnorna för den här arkitekturens hybrid-attention finns i Prism ML:s egen fork av llama.cpp. Vanlig llama.cpp avvisar PTQ1_0 och PQ2_0 som okända typer – och har ingen aning om vad den ska göra med den roterade basen som dessa packar förutsätter. MLX-bygget för Apple Silicon har Metal- och CPU-kärnor men ingen CUDA-väg, så på en NVIDIA-maskin faller det tillbaka på en CPU-forward-pass som kan ta minuter. Prism ML listar visserligen integration med flera körmiljöer, men den underliggande poängen kvarstår: den här modellens användbarhet begränsas av huruvida din valda körmiljö har fått lära sig om den.

Det är den ärliga avvägningen. Du väljer mellan en build som är 1,4 gånger större, mätbart sämre på exakt de uppgifter du med störst sannolikhet vill ha en 27B-modell till, och universellt körbar — och en build som är mindre och bättre, i ett ekosystem som för närvarande inte är mer än ett labbs fork plus de körtidsmiljöer som har adopterat den.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

Vad som krävs för att köra någon av dem

Minnesaritmetiken är snävare än vad filstorlekarna antyder, eftersom filerna inte är det enda som ligger i VRAM.

• IQ2_XXS-bygge – 8,39 till 8,75 GiB vikter, vilket lämnar ungefär 7,5 GB fritt på ett 16 GB-kort för kontext och draft-modeller. Det oberoende testet ovan konstaterar specifikt att ett 8,39 GiB-bygge redan får plats med en 2,1 GB draft-modell vid sidan av sig.

• Ternary Bonsai 2 27B — 5,93 GB för PTQ1_0-språkmodellen, plus 0,63 GB vision tower om du överhuvudtaget använder bilder, plus kontext. Prism ML:s PQ2_0-packning kostar 7,25 GB och är det snabbare alternativet på hårdvara som begränsas av instruktionsgenomströmning snarare än bandbredd.

När det gäller hastighet är de rapporterade ternära värdena 142,5 tok/s vid avkodning på ett RTX 5090 och 46,8 tok/s på en Apple M5 Max; tredjepartsrapporteringen om IQ2-bygget är tunnare, med en Vulkan-mätning på dubbla Radeon-kort på omkring 3,8 tok/s vid generering, även om den siffran säger mer om just den bakänden än om kvantiseringen. Betrakta genomströmningstalen på båda sidor som starkt hårdvaruspecifika.

Var OrcaRouter passar in, och var det inte gör det

Ingen av dessa filer är något som en router serverar. De är lokala artefakter, och den ärliga beskrivningen är att OrcaRouter inte hostar någon av dem – det här är en jämförelse av vad som körs på din egen hårdvara. Det som däremot finns på vår sida är modellen som de båda härstammar från. Qwen3.8-27B i full precision är tillgänglig via OrcaRouters egen infrastruktur för 0,33 USD per miljon indatatokens och 2,40 USD per miljon utdatatokens, med modellens inbyggda 262K-kontext och dess intakta kontroll av resonemangsinsats på låg/medel/hög nivå.

Det ger en hybridlösning som det är värt att vara konkret kring. Kör det komprimerade bygget lokalt för de uppgifter det är bra på, och skicka de enstaka förfrågningar som behöver full precision till den hostade basmodellen via samma nyckel – inget avtal med en andra leverantör, ingen kodändring, eftersom båda sidor talar samma API. Om det lokala bygget visar sig vara fel för en arbetsbelastning kan den förfrågan som misslyckas växlas över automatiskt i stället för att returneras som ett fel, vilket är ett billigare sätt att upptäcka att en kvantisering är olämplig än att upptäcka det i produktion.

Den korta versionen

• Mätt som publicerad kvalitet per byte vinner ternärbygget tydligt, och vinsten är koncentrerad till resonemang och kod — de kategorier där post-training-bygget försämras mest.

• Vad gäller portabilitet vinner IQ2_XXS-bygget precis lika tydligt. Standardkörtidsmiljöer överallt, ingen fork, inga specialkärnor, inget tyst skräp-felläge.

• Jämförelsen är inte "1,76 bitar mot 2,2 bitar". Det är "en representation som valts under träningen mot en som anpassats i efterhand", och skillnaden på 0,44 bitar är ett avrundningsfel i jämförelse med det.

• Varje kvalitetssiffra för den ternära builden i den här artikeln är Prism ML:s egen mätning på en svit som Prism ML valt. KLD-resultaten för IQ2-byggena är oberoende, från en enda körning och specifika för en basmodell och en testmängd; de är de starkaste tredjepartsbevisen i den här jämförelsen och de säger ingenting om Bonsai.

Gapet kommer att slutas även från andra hållet, och förmodligen snart. Om de ternära kärnorna hamnar uppströms i llama.cpp försvinner den enda allvarliga invändningen mot Bonsai, och valet blir enkelt. Fram till dess behåller IQ2_XXS-bygget en verklig fördel som inte har något att göra med hur bra det är.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

Om du ska bestämma dig den här veckan tar testet som avgör saken en eftermiddag: ta tjugo prompter från din egen arbetsbelastning som kräver mer än ett resonemangssteg, kör båda byggena och poängsätt svaren blint. De publicerade tabellerna talar om var du ska titta. De kan inte tala om för dig huruvida ditt arbete finns där.