
Ternary Bonsai 2 27B vs Qwen3.8-27B: Vad 47,9 gigabyte av precision faktiskt köper
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B och Qwen3.8-27B är samma modell i två numeriska världar. De delar arkitektur, tokenizer, träningshärkomst och ett kontextfönster på 262 144 token. Det som skiljer dem åt är hur vikterna skrivs ned: Qwen3.8-27B lagrar var och en som ett 16-bitars flyttal och upptar 53,81 GB i sin FP16-referensform, medan Ternary Bonsai 2 27B lagrar var och en som en av tre symboler och upptar 5,93 GB. Prism ML tillkännagav den komprimerade versionen den 17 september 2026 och lade upp den på Hugging Face under Apache 2.0; de ursprungliga vikterna för Qwen3.8-27B publicerades den 13 augusti 2026, också under Apache 2.0.
Jämförelsen som spelar roll är inte vilken som är bättre. Det är vad de saknade 47,9 GB kostar dig, och det ärliga svaret är snävare och mer specifikt än vad något av lägren kommer att berätta för dig. Prism ML rapporterar att deras bygge behåller 98,2 % av fullprecisionsmodellens genomsnitt över en svit med 20 benchmarktester – 83,9 mot 85,4. Siffran är leverantörens egen, uppmätt i leverantörens egen testrigg, och en dag efter lanseringen har ingen utanför Prism ML reproducerat den. Aggregatet döljer också den del du faktiskt borde bry dig om, eftersom de 1,8 poängen inte är jämnt fördelade. På de två benchmarktester som belastar långvarigt mjukvaruutvecklingsarbete är gapet inte 1,8 % – det är närmare 25 %.
Samma nätverk, nedskrivet på ett annat sätt
Börja med det som komprimeringen inte rör, för det är anledningen till att jämförelsen över huvud taget är intressant. Antalet lager, den dolda storleken, vokabuläret, uppmärksamhetsmönstret och visionstornet tillhör basmodellen. Qwen3.8-27B är en konstruktion med hybriduppmärksamhet: 48 linjära uppmärksamhetslager av typen Gated DeltaNet varvade med 16 lager för full uppmärksamhet, en uppdelning på ungefär 3:1, över 64 lager med en dold storlek på 5 120 och ett vokabulär på 248 320 tokens. Det till största delen linjära stamnätet är det som över huvud taget gör en 262K-kontext överkomlig, och det är egenskapen som Bonsai ärver oförändrad.
Det som Prism ML ändrade är representationen av språkmodellens matriser, plus de kärnor som behövs för att utföra beräkningar på dem. Prism ML:s vitbok delar upp de 27,36 miljarder parametrarna i 24,35 miljarder i språkryggraden fördelat över 64 block, 2,54 miljarder i inbäddningen och LM-huvudet, och 0,47 miljarder i ett visionstorn med 27 block. Visionstornet levereras som en separat 4-bitars mmproj-fil på cirka 0,63 GB och laddas endast när en bild faktiskt anländer, så en driftsättning med enbart text betalar aldrig för det.
En praktisk konsekvens av den där mestadels linjära designen är värd att påpeka innan någon benchmarkdiskussion. Eftersom arkitekturen inte är en konventionell transformer måste lågbitkärnorna skrivas specifikt för den. Standardversionen av llama.cpp avvisar båda Prism ML:s packningar som okända typer – och, ännu farligare, laddar ett äldre ternärt format utan klagomål och producerar flytande nonsens, eftersom ingen matchande rotation tillämpas på aktiveringarna. Om du kör den här modellen på en binär som inte känner till den får du inget felmeddelande. Du får ett självsäkert, felaktigt resultat.
Jämförelsen, kategori för kategori
Här är leverantörens uppdelning av 20 benchmarkar, med fullprecisionsbasen som referens. Varje siffra i den här listan är Prism ML:s; ingen av dem är oberoende verifierad.
• Matematik — 96,57 för Ternary Bonsai 2 27B mot 97,06 för Qwen3.8-27B. I praktiken samma nivå.
• Kodning — 81,58 vs 82,17. Även nära, och den kategori som hela tekniken argumenteras kring.
• Instruktionsföljning — 82,66 vs 81,25. Den komprimerade modellen ligger före här, vilket är den enda raden i tabellen som verkligen är förvånande.
• Kunskap och resonemang — 83,95 mot 86,66. En nedgång på 2,7 punkter, och den enskilt största bidragande orsaken till de saknade 1,8 punkterna.
• Agentiskt och verktygsanrop — 77,57 vs 79,74, som omfattar τ2-Bench på 80,22 och BFCL v3 på 74,92.
• Vision — 78,59 vs 81,64, den största kategoriförlusten. Observera att visionstornet i sig inte är den komprimerade delen; det är språkmodellen som läser dess utdata som är det.

Läs formen snarare än genomsnittet, och en tydligare historia framträder. Komprimering är nästan gratis när det gäller matematik, kodning och instruktionsföljning, och den är kostsam när det gäller kunskap och vision. Det är motsatsen till den folkliga visdomen om lågbitmodeller, som hävdar att ytlig kunskap överlever och att resonemangsförmågan kollapsar. Här är det kunskapen som urholkas och resonemangsförmågan som håller.
Var de 1,8 poängen faktiskt finns
Aggregatet är ett medelvärde över tjugo benchmarkar, och medelvärden är där skillnader gömmer sig. Plocka fram de enskilda resultaten och två av dem är mycket sämre än genomsnittet antyder.
Terminal-Bench 2.1 — 52,8 för den ternära byggversionen mot 69,7 för full precision
• SWE-bench Verified — 60,8 mot 80,6
Båda landar nära tre fjärdedelar av fullprecisionspoängen. Som kontrast landar AIME26 på 95,83, LiveCodeBench på 90,07 och AA-LCR på 77,0 – inom en poäng från den okomprimerade modellen. Detta är första gången Bonsai-familjen överhuvudtaget utvärderas på Terminal-Bench, och Prism ML är explicit i sitt eget material om att den förmåga till långsiktig mjukvaruutveckling som utlovades i första generationen är delvis, inte helt, levererad.
Så den praktiska frågan är inte "behåller det 98,2 %" utan "vad är min arbetsbelastning". Om du kör en kodagent som håller en plan över dussintals verktygsanrop och redigerar filer under flera minuter, tillhör du kategorin med 25 % gap, och det aggregerade talet är direkt vilseledande. Om du gör matematik, kodgenerering i ett enda steg, extrahering, klassificering eller chatt, tillhör du de kategorier där gapet rundas bort. Det mest användbara med leverantörens egen tabell är att den låter dig göra den distinktionen i stället för att gissa.
Vad var och en egentligen behöver för att kunna köras
Hårdvaruhistorien är mindre symmetrisk än storleksförhållandet antyder. En FP16-modell på 53,81 GB får inte plats på en 16 GB bärbar dator överhuvudtaget, vilket gör jämförelsen mindre till "snabbare kontra långsammare" och mer till "möjligt kontra inte". Prism ML:s standardiserade mätningar vid batchstorlek 1, utan vision tower:
• NVIDIA RTX 5090 — 142,5 tok/s avkodning med PQ2_0-packningen, vid 0,582 mWh per token
• Apple M5 Max — 46,8 tok/s avkodning, med promptbearbetning på cirka 765 tok/s
• Apple M5 Pro — 27,7 tok/s avkodning
• Apple M4 Pro — 18,0 tok/s avkodning, där promptbearbetning nära 125 tok/s blir den begränsande faktorn för mycket långa kontexter
Det viktiga förbehållet är att inget av detta är en enda binärfil. PTQ1_0-packningen ger dig 5,93 GB vid 1,76 bitar per vikt; PQ2_0 kostar 7,25 GB vid 2,16 bitar per vikt och ger avkodningshastighet på hårdvara där instruktionsgenomströmning, inte minnesbandbredd, är begränsningen. MLX-bygget för Apple Silicon är en tredje artefakt med sin egen redovisning – en affin 2-bitarsbehållare som lagrar en bias som de ternära vikterna inte behöver, och hamnar på 2,25 bitar per vikt och 8,005 GiB på disk, med Metal- och CPU-kärnor men ingen CUDA-väg. ”Det körs i 5,9 GB” är sant för exakt en av de filerna på exakt rätt runtime.
Kostnadsjämförelsen, ärligt framställd
Det finns två sätt att betala för Qwen3.8-27B och bara ett sätt att betala för dess komprimerade syskonmodell. Ternary Bonsai 2 27B är en nedladdning: Apache 2.0, din hårdvara, ingen mätning. Qwen3.8-27B är både en nedladdning och en hostad tjänst, och om du väljer den hostade vägen är den relevanta siffran den som står på modellsidan — 0,33 USD per miljon indatatoken och 2,40 USD per miljon utdatatoken, som serveras från OrcaRouters egen infrastruktur i stället för att vidaresäljas från någon annans.
Det är där OrcaRouter förtjänar en plats i den här jämförelsen i stället för en fotnot. Den routade versionen av Qwen3.8-27B har samma 262K-kontext, tar emot text, bilder och video och exponerar den reasoning-effort-kontroll som modellen levereras med. Den ligger bakom samma nyckel som över 200 andra modeller utan påslag ovanpå leverantörens listpris, vilket betyder mer än det låter: eftersom listpriset förs vidare i stället för att säljas vidare, syns en leverantörsprisändring här samma dag i stället för vid nästa avtalsförnyelse. För ett team som vill ha fullprecisionsbasen som eskaleringsnivå ovanför en lokal Bonsai är det en slutpunkt och en nyckel i stället för två leverantörsrelationer.

Vilken att välja
Beslutet handlar mest om var arbetet utförs, inte om vilken modell som är bättre, eftersom de är samma modell för de flesta uppgifter.
• Välj Qwen3.8-27B i full precision när uppgiften är långsiktig och agentisk, när du utvärderar eller finjusterar, när du behöver 1M-token YaRN-kontext, eller när visionsnoggrannhet är avgörande. Siffrorna för Terminal-Bench och SWE-bench är anledningen.
• Välj Ternary Bonsai 2 27B när arbetet måste ske på hårdvara du äger, när alternativet är att inte köra en 27B-modell alls, eller när arbetsbelastningen är matematik, kodning, extraktion eller verktygsfritt resonemang där kategorierna ligger på samma nivå.
• Välj inte utifrån aggregeringen. 83,9 och 85,4 ligger tillräckligt nära varandra för att ett enda utbyte av benchmark skulle kunna ändra deras inbördes ordning, och endast ett av de två talen är oberoende verifierat.
Det som verkligen är nytt här är inte att en 27B-modell får plats i sex gigabyte – den första Bonsai-generationen gjorde det i juli. Det är att instruktionsföljningen presterade bättre än föräldramodellen och att matematik och kodning presterade på samma nivå, vilket är ett annat påstående än "liten för sin storlek". Huruvida det håller för din arbetsbelastning är precis det som en dags ålder inte kan säga dig, och den första oberoende utvärderingen av den här modellen är resultatet som är värt att vänta på.

Om du vill köra jämförelsen på dina egna prompter i stället för på en benchmark-svit är den snabbaste vägen att anropa den hostade Qwen3.8-27B via en enda endpoint och köra ternary-bygget lokalt, och sedan diffa utdatan på de uppgifter du faktiskt har. Det är ett förmiddagsarbete och det kommer att säga dig mer om de 1,8 punkterna än någon publicerad tabell.
