
Ternary Bonsai 2 27B mot Qwen3.8-27B IQ2_XXS GGUF: Färre bitar, bättre poäng
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B är mindre än IQ2_XXS GGUF-versionen av Qwen3.8-27B och, enligt de siffror som publicerats med den, också bättre – vilket inte borde vara möjligt om allt som skilde dem åt vore en bitbudget. Bonsai-versionen bär 1,76 bitar per vikt i en fil på 5,93 GB. Den konventionella 2-bitars kvantiseringen av samma basmodell bär ungefär 2,2 bitar per vikt i en fil på omkring 7,3 GB. Prism ML, som tillkännagav den ternära versionen den 17 september 2026, rapporterar ett genomsnitt på 83,9 över 20 benchmarks för sin modell mot 75,2 för jämförelsepunkten IQ2_XXS – en skillnad på 8,7 punkter till fördel för modellen som använder färre bitar.
Den inversionen är hela historien, och den är inget trick. De två filerna skapas av olika processer i olika skeden av modellens liv, och skillnaden mellan dessa processer är värd mer än skillnaden i bitbredd. Det är också jämförelsen där det populära rådet – "ta bara en 2-bitars kvantisering, de är bra nu" – stöter på sitt tydligaste motexempel, och där motexemplet har en oberoende mätning bakom sig i stället för en leverantörs ord.
Paradoxen är mekanismen
IQ2_XXS är ett kvantiseringsformat för efterträning. Modellen tränas till konvergens i full precision och därefter avrundas dess vikter till en lågbitrepresentation som väljs av ett anpassningsförfarande. Modellen får aldrig en chans att anpassa sig; den mäts i efterhand och approximeras. i-quant-familjen är en förbättring jämfört med äldre k-quants genom att använda en viktighetsmatris – en kalibreringskörning som avgör vilka vikter som förtjänar mer av den tillgängliga precisionen – men den grundläggande ordningen för operationerna är oförändrad. Träna, sedan komprimera.
Bonsai vänder på den ordningen. Prism ML:s beskrivning av sin egen metod är att den helt övergav efterträningskvantisering och genomdrev den ternära begränsningen under träningen: framåtpasset beräknar med vikter begränsade till {−1, 0, +1}, medan bakåtpasset fortfarande bär fullprecisionsgradienter. Modellen ägnar sin träning åt att lära sig representationer som överlever begränsningen, i stället för att begränsningen påtvingas representationer som aldrig förväntade sig den. Algoritmen beskrivs som proprietär IP, men formen på den kommer att vara bekant för alla som har läst BitNet-forskningen.
Två förbättringar ligger ovanpå, och båda syns i aritmetiken. Den första är selektiv precision: 26,2 miljoner parametrar – cirka 0,098 % av modellen, ungefär 52 MB i bf16, mestadels den rekurrenta tillståndsvägen hos de linjära attention-lagren plus normaliseringsvikter – hålls i full precision i stället för att ternariseras. Den andra är en blockvis rotation. Varje viktmatris transformeras av en Walsh–Hadamard-rotation med blockstorlek 1 024 innan de ternära värdena väljs, vilket sprider utliggare över koordinater och gör en tre nivåers approximation mindre destruktiv. Rotationen viks in i de lagrade vikterna, så den kostar inga extra byte; i stället appliceras motsvarande transform på aktiveringar vid körning.
Den där sista detaljen har en konsekvens som du stöter på redan vid första försöket att köra den, och det är den verkliga kostnaden för angreppssättet.
Vilken IQ2_XXS menar du, och vad får den faktiskt för poäng?
Innan man jämför kvalitet, en korrigering som de flesta genomgångar hoppar över: "IQ2_XXS" är inte en enda artefakt. Det är en kvantiseringstyp i llama.cpp, och samma typ tillämpad av olika verktygskedjor på samma basmodell producerar filer som skiljer sig betydligt i storlek och avsevärt i kvalitet.
Det tydligaste offentliga beviset är en oberoende jämförelse som publicerades den 15 augusti 2026 av en användare som undersökte huruvida en sub-2-bitars Qwen3.8-27B var värd att bygga överhuvudtaget. Testet är en wikitext-2 KL-divergensmätning, 100 delar vid 512 kontext, mot en lokalt byggd Q8_0-referens med en perplexitet på 6,7500, där varje kandidat använder samma importance-matris, korpus, baslinje och llama.cpp-bygge i en och samma sittning. Resultaten:
• unsloth UD-IQ2_XXS — 8,39 GiB, perplexitet 7,6528, medel-KLD 0,146, median-KLD 0,076, top-1-överensstämmelse 82,98 %
• bartowski IQ2_XXS — 8,75 GiB, perplexitet 8,5352, medel-KLD 0,301, median-KLD 0,162, top-1-överensstämmelse 76,53 %
Den dynamiska varianten är 0,36 GiB mindre än den statiska och cirka 2,1 gånger bättre på genomsnittlig KLD – vid 1,13 gånger baslinjens perplexitet. Två filer med samma etikett, åtskilda av en faktor två på måttet som mäter hur långt utdatadistributionen har förskjutits. Samma test fann att varje kandidat under 2 bitar var sämre än båda publicerade IQ2-alternativen, vilket är varför det praktiska golvet för denna basmodell ligger vid IQ2 snarare än under det.

Detta spelar roll för jämförelsen eftersom det ändrar vad "7,3 GB IQ2_XXS-bygget" syftar på. Prism ML:s siffra kommer från dess egen kvantisering av basmodellen vid 2,2 bitar per vikt. Ett dynamiskt unsloth-bygge av samma familj mäter 8,39 GiB. Ett bartowski-bygge mäter 8,75 GiB. Storleksskillnaden mellan Bonsai och "IQ2_XXS" ligger därför någonstans mellan 1,4x och 1,5x beroende på vilket bygge du menar – större än vad rubrikens 1,23x antyder, och allt detta innan kvalitetsjämförelsen ens börjar.
Var efterträningsbygget går sönder, och varför det är lätt att missa
Det aggregerade gapet på 8,7 punkter är det minst informativa sättet att ange skillnaden, eftersom försämringen i IQ2_XXS-bygget inte är enhetlig. Den är selektiv, och mönstret är motsatsen till vad de flesta skulle förutse.
• MMLU-Redux — efterträningsversionen står sig respektabelt, i intervallet mitten till höga 80.
• GPQA Diamond — cirka 65,5, mot 85,76 för den ternära versionen
• AIME26 — i intervallet 57,5 till 78,6 beroende på byggversion, mot 95,83 för den ternära byggversionen
• LiveCodeBench — i intervallet 56,4 till 70,05, mot 90,07 för den ternära byggversionen
De exakta IQ2-siffrorna varierar mellan Prism ML:s sviter och community-mätningarna, och intervallen ovan omfattar båda, men formen är konsekvent i alla källor: ytlig kunskap överlever, och allt som kräver en ihållande kedja av resonemang försämras kraftigt. Det är just det felmod som ett informellt test inte hittar. Be ett 2-bitarsbygge att sammanfatta ett dokument eller svara på en faktabaserad fråga, och det presterar som en mycket större modell. Be det att hålla en flerstegsderivation eller producera icke-trivial kod, och kollapsen är plötslig snarare än gradvis. Det är därför "det kändes bra när jag testade det" inte är bevis om en kvantiserad modell – det är bevis om de prompter du råkade testa.
Det ternära bygget uppvisar inte den kollapsen på samma benchmarks. Prism ML rapporterar AIME26 på 95,83 mot 94,58 för sin fullprecisionsbas, och LiveCodeBench på 90,07 mot 90,05 – i praktiken samma nivå, och det enskilt mest användbara påståendet i släppet, eftersom det säger att begränsningen vid träningstid köpte det som efterträningsbegränsningen förlorar.
Motargumentet, som är verkligt och som kvalitetstabellen inte fångar
Allt ovan talar för det ternära bygget vad gäller kvalitet per byte. Det finns en dimension där den konventionella GGUF vinner ohotat, och det är ingen liten sådan: den körs på programvaran du redan har.
IQ2_XXS-bygget av Qwen3.8-27B är en standardartefakt från llama.cpp. Det laddas i llama.cpp, Ollama, LM Studio, Jan och allt annat som länkar mot ggml, på alla plattformar som ggml stöder, utan att någon fork krävs och utan några specialkärnor. Dess viktighetsmatris kan byggas om eller ersättas. Det beter sig som alla andra kvantiserade modeller du har på disken.
Ternary Bonsai 2 27B gör det inte. De ternära kärnorna för den här arkitekturens hybrid-attention finns i Prism ML:s egen fork av llama.cpp. Vanlig llama.cpp avvisar PTQ1_0 och PQ2_0 som okända typer – och har ingen aning om vad den ska göra med den roterade basen som dessa packar förutsätter. MLX-bygget för Apple Silicon har Metal- och CPU-kärnor men ingen CUDA-väg, så på en NVIDIA-maskin faller det tillbaka på en CPU-forward-pass som kan ta minuter. Prism ML listar visserligen integration med flera körmiljöer, men den underliggande poängen kvarstår: den här modellens användbarhet begränsas av huruvida din valda körmiljö har fått lära sig om den.
Det är den ärliga avvägningen. Du väljer mellan en build som är 1,4 gånger större, mätbart sämre på exakt de uppgifter du med störst sannolikhet vill ha en 27B-modell till, och universellt körbar — och en build som är mindre och bättre, i ett ekosystem som för närvarande inte är mer än ett labbs fork plus de körtidsmiljöer som har adopterat den.

Vad som krävs för att köra någon av dem
Minnesaritmetiken är snävare än vad filstorlekarna antyder, eftersom filerna inte är det enda som ligger i VRAM.
• IQ2_XXS-bygge – 8,39 till 8,75 GiB vikter, vilket lämnar ungefär 7,5 GB fritt på ett 16 GB-kort för kontext och draft-modeller. Det oberoende testet ovan konstaterar specifikt att ett 8,39 GiB-bygge redan får plats med en 2,1 GB draft-modell vid sidan av sig.
• Ternary Bonsai 2 27B — 5,93 GB för PTQ1_0-språkmodellen, plus 0,63 GB vision tower om du överhuvudtaget använder bilder, plus kontext. Prism ML:s PQ2_0-packning kostar 7,25 GB och är det snabbare alternativet på hårdvara som begränsas av instruktionsgenomströmning snarare än bandbredd.
När det gäller hastighet är de rapporterade ternära värdena 142,5 tok/s vid avkodning på ett RTX 5090 och 46,8 tok/s på en Apple M5 Max; tredjepartsrapporteringen om IQ2-bygget är tunnare, med en Vulkan-mätning på dubbla Radeon-kort på omkring 3,8 tok/s vid generering, även om den siffran säger mer om just den bakänden än om kvantiseringen. Betrakta genomströmningstalen på båda sidor som starkt hårdvaruspecifika.
Var OrcaRouter passar in, och var det inte gör det
Ingen av dessa filer är något som en router serverar. De är lokala artefakter, och den ärliga beskrivningen är att OrcaRouter inte hostar någon av dem – det här är en jämförelse av vad som körs på din egen hårdvara. Det som däremot finns på vår sida är modellen som de båda härstammar från. Qwen3.8-27B i full precision är tillgänglig via OrcaRouters egen infrastruktur för 0,33 USD per miljon indatatokens och 2,40 USD per miljon utdatatokens, med modellens inbyggda 262K-kontext och dess intakta kontroll av resonemangsinsats på låg/medel/hög nivå.
Det ger en hybridlösning som det är värt att vara konkret kring. Kör det komprimerade bygget lokalt för de uppgifter det är bra på, och skicka de enstaka förfrågningar som behöver full precision till den hostade basmodellen via samma nyckel – inget avtal med en andra leverantör, ingen kodändring, eftersom båda sidor talar samma API. Om det lokala bygget visar sig vara fel för en arbetsbelastning kan den förfrågan som misslyckas växlas över automatiskt i stället för att returneras som ett fel, vilket är ett billigare sätt att upptäcka att en kvantisering är olämplig än att upptäcka det i produktion.
Den korta versionen
• Mätt som publicerad kvalitet per byte vinner ternärbygget tydligt, och vinsten är koncentrerad till resonemang och kod — de kategorier där post-training-bygget försämras mest.
• Vad gäller portabilitet vinner IQ2_XXS-bygget precis lika tydligt. Standardkörtidsmiljöer överallt, ingen fork, inga specialkärnor, inget tyst skräp-felläge.
• Jämförelsen är inte "1,76 bitar mot 2,2 bitar". Det är "en representation som valts under träningen mot en som anpassats i efterhand", och skillnaden på 0,44 bitar är ett avrundningsfel i jämförelse med det.
• Varje kvalitetssiffra för den ternära builden i den här artikeln är Prism ML:s egen mätning på en svit som Prism ML valt. KLD-resultaten för IQ2-byggena är oberoende, från en enda körning och specifika för en basmodell och en testmängd; de är de starkaste tredjepartsbevisen i den här jämförelsen och de säger ingenting om Bonsai.
Gapet kommer att slutas även från andra hållet, och förmodligen snart. Om de ternära kärnorna hamnar uppströms i llama.cpp försvinner den enda allvarliga invändningen mot Bonsai, och valet blir enkelt. Fram till dess behåller IQ2_XXS-bygget en verklig fördel som inte har något att göra med hur bra det är.

Om du ska bestämma dig den här veckan tar testet som avgör saken en eftermiddag: ta tjugo prompter från din egen arbetsbelastning som kräver mer än ett resonemangssteg, kör båda byggena och poängsätt svaren blint. De publicerade tabellerna talar om var du ska titta. De kan inte tala om för dig huruvida ditt arbete finns där.
