Ett genererat titelkort med texten 'Ternary Bonsai 2 27B vs Qwen3.8-27B' och underrubriken 'Samma nätverk vid två precisioner', ovanför tre kort med texten 'Filstorlek: 5,93 GB vs 53,81 GB', 'Minskning: 9,05x' och 'Kontext: 262K tokens, båda', med en sidfot som lyder 'Bibehållande av 98,2 % är leverantörsrapporterat och ej reproducerat.' OrcaRouter-logotypen sitter i nedre högra hörnet.
Guides & Insights

Ternary Bonsai 2 27B vs Qwen3.8-27B: Vad 47,9 gigabyte av precision faktiskt köper

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ternary Bonsai 2 27B och Qwen3.8-27B är samma modell i två numeriska världar. De delar arkitektur, tokenizer, träningshärkomst och ett kontextfönster på 262 144 token. Det som skiljer dem åt är hur vikterna skrivs ned: Qwen3.8-27B lagrar var och en som ett 16-bitars flyttal och upptar 53,81 GB i sin FP16-referensform, medan Ternary Bonsai 2 27B lagrar var och en som en av tre symboler och upptar 5,93 GB. Prism ML tillkännagav den komprimerade versionen den 17 september 2026 och lade upp den på Hugging Face under Apache 2.0; de ursprungliga vikterna för Qwen3.8-27B publicerades den 13 augusti 2026, också under Apache 2.0.

Jämförelsen som spelar roll är inte vilken som är bättre. Det är vad de saknade 47,9 GB kostar dig, och det ärliga svaret är snävare och mer specifikt än vad något av lägren kommer att berätta för dig. Prism ML rapporterar att deras bygge behåller 98,2 % av fullprecisionsmodellens genomsnitt över en svit med 20 benchmarktester – 83,9 mot 85,4. Siffran är leverantörens egen, uppmätt i leverantörens egen testrigg, och en dag efter lanseringen har ingen utanför Prism ML reproducerat den. Aggregatet döljer också den del du faktiskt borde bry dig om, eftersom de 1,8 poängen inte är jämnt fördelade. På de två benchmarktester som belastar långvarigt mjukvaruutvecklingsarbete är gapet inte 1,8 % – det är närmare 25 %.

Samma nätverk, nedskrivet på ett annat sätt

Börja med det som komprimeringen inte rör, för det är anledningen till att jämförelsen över huvud taget är intressant. Antalet lager, den dolda storleken, vokabuläret, uppmärksamhetsmönstret och visionstornet tillhör basmodellen. Qwen3.8-27B är en konstruktion med hybriduppmärksamhet: 48 linjära uppmärksamhetslager av typen Gated DeltaNet varvade med 16 lager för full uppmärksamhet, en uppdelning på ungefär 3:1, över 64 lager med en dold storlek på 5 120 och ett vokabulär på 248 320 tokens. Det till största delen linjära stamnätet är det som över huvud taget gör en 262K-kontext överkomlig, och det är egenskapen som Bonsai ärver oförändrad.

Det som Prism ML ändrade är representationen av språkmodellens matriser, plus de kärnor som behövs för att utföra beräkningar på dem. Prism ML:s vitbok delar upp de 27,36 miljarder parametrarna i 24,35 miljarder i språkryggraden fördelat över 64 block, 2,54 miljarder i inbäddningen och LM-huvudet, och 0,47 miljarder i ett visionstorn med 27 block. Visionstornet levereras som en separat 4-bitars mmproj-fil på cirka 0,63 GB och laddas endast när en bild faktiskt anländer, så en driftsättning med enbart text betalar aldrig för det.

En praktisk konsekvens av den där mestadels linjära designen är värd att påpeka innan någon benchmarkdiskussion. Eftersom arkitekturen inte är en konventionell transformer måste lågbitkärnorna skrivas specifikt för den. Standardversionen av llama.cpp avvisar båda Prism ML:s packningar som okända typer – och, ännu farligare, laddar ett äldre ternärt format utan klagomål och producerar flytande nonsens, eftersom ingen matchande rotation tillämpas på aktiveringarna. Om du kör den här modellen på en binär som inte känner till den får du inget felmeddelande. Du får ett självsäkert, felaktigt resultat.

Jämförelsen, kategori för kategori

Här är leverantörens uppdelning av 20 benchmarkar, med fullprecisionsbasen som referens. Varje siffra i den här listan är Prism ML:s; ingen av dem är oberoende verifierad.

• Matematik — 96,57 för Ternary Bonsai 2 27B mot 97,06 för Qwen3.8-27B. I praktiken samma nivå.

• Kodning — 81,58 vs 82,17. Även nära, och den kategori som hela tekniken argumenteras kring.

• Instruktionsföljning — 82,66 vs 81,25. Den komprimerade modellen ligger före här, vilket är den enda raden i tabellen som verkligen är förvånande.

• Kunskap och resonemang — 83,95 mot 86,66. En nedgång på 2,7 punkter, och den enskilt största bidragande orsaken till de saknade 1,8 punkterna.

• Agentiskt och verktygsanrop — 77,57 vs 79,74, som omfattar τ2-Bench på 80,22 och BFCL v3 på 74,92.

• Vision — 78,59 vs 81,64, den största kategoriförlusten. Observera att visionstornet i sig inte är den komprimerade delen; det är språkmodellen som läser dess utdata som är det.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

Läs formen snarare än genomsnittet, och en tydligare historia framträder. Komprimering är nästan gratis när det gäller matematik, kodning och instruktionsföljning, och den är kostsam när det gäller kunskap och vision. Det är motsatsen till den folkliga visdomen om lågbitmodeller, som hävdar att ytlig kunskap överlever och att resonemangsförmågan kollapsar. Här är det kunskapen som urholkas och resonemangsförmågan som håller.

Var de 1,8 poängen faktiskt finns

Aggregatet är ett medelvärde över tjugo benchmarkar, och medelvärden är där skillnader gömmer sig. Plocka fram de enskilda resultaten och två av dem är mycket sämre än genomsnittet antyder.

Terminal-Bench 2.1 — 52,8 för den ternära byggversionen mot 69,7 för full precision

• SWE-bench Verified — 60,8 mot 80,6

Båda landar nära tre fjärdedelar av fullprecisionspoängen. Som kontrast landar AIME26 på 95,83, LiveCodeBench på 90,07 och AA-LCR på 77,0 – inom en poäng från den okomprimerade modellen. Detta är första gången Bonsai-familjen överhuvudtaget utvärderas på Terminal-Bench, och Prism ML är explicit i sitt eget material om att den förmåga till långsiktig mjukvaruutveckling som utlovades i första generationen är delvis, inte helt, levererad.

Så den praktiska frågan är inte "behåller det 98,2 %" utan "vad är min arbetsbelastning". Om du kör en kodagent som håller en plan över dussintals verktygsanrop och redigerar filer under flera minuter, tillhör du kategorin med 25 % gap, och det aggregerade talet är direkt vilseledande. Om du gör matematik, kodgenerering i ett enda steg, extrahering, klassificering eller chatt, tillhör du de kategorier där gapet rundas bort. Det mest användbara med leverantörens egen tabell är att den låter dig göra den distinktionen i stället för att gissa.

Vad var och en egentligen behöver för att kunna köras

Hårdvaruhistorien är mindre symmetrisk än storleksförhållandet antyder. En FP16-modell på 53,81 GB får inte plats på en 16 GB bärbar dator överhuvudtaget, vilket gör jämförelsen mindre till "snabbare kontra långsammare" och mer till "möjligt kontra inte". Prism ML:s standardiserade mätningar vid batchstorlek 1, utan vision tower:

• NVIDIA RTX 5090 — 142,5 tok/s avkodning med PQ2_0-packningen, vid 0,582 mWh per token

• Apple M5 Max — 46,8 tok/s avkodning, med promptbearbetning på cirka 765 tok/s

• Apple M5 Pro — 27,7 tok/s avkodning

• Apple M4 Pro — 18,0 tok/s avkodning, där promptbearbetning nära 125 tok/s blir den begränsande faktorn för mycket långa kontexter

Det viktiga förbehållet är att inget av detta är en enda binärfil. PTQ1_0-packningen ger dig 5,93 GB vid 1,76 bitar per vikt; PQ2_0 kostar 7,25 GB vid 2,16 bitar per vikt och ger avkodningshastighet på hårdvara där instruktionsgenomströmning, inte minnesbandbredd, är begränsningen. MLX-bygget för Apple Silicon är en tredje artefakt med sin egen redovisning – en affin 2-bitarsbehållare som lagrar en bias som de ternära vikterna inte behöver, och hamnar på 2,25 bitar per vikt och 8,005 GiB på disk, med Metal- och CPU-kärnor men ingen CUDA-väg. ”Det körs i 5,9 GB” är sant för exakt en av de filerna på exakt rätt runtime.

Kostnadsjämförelsen, ärligt framställd

Det finns två sätt att betala för Qwen3.8-27B och bara ett sätt att betala för dess komprimerade syskonmodell. Ternary Bonsai 2 27B är en nedladdning: Apache 2.0, din hårdvara, ingen mätning. Qwen3.8-27B är både en nedladdning och en hostad tjänst, och om du väljer den hostade vägen är den relevanta siffran den som står på modellsidan — 0,33 USD per miljon indatatoken och 2,40 USD per miljon utdatatoken, som serveras från OrcaRouters egen infrastruktur i stället för att vidaresäljas från någon annans.

Det är där OrcaRouter förtjänar en plats i den här jämförelsen i stället för en fotnot. Den routade versionen av Qwen3.8-27B har samma 262K-kontext, tar emot text, bilder och video och exponerar den reasoning-effort-kontroll som modellen levereras med. Den ligger bakom samma nyckel som över 200 andra modeller utan påslag ovanpå leverantörens listpris, vilket betyder mer än det låter: eftersom listpriset förs vidare i stället för att säljas vidare, syns en leverantörsprisändring här samma dag i stället för vid nästa avtalsförnyelse. För ett team som vill ha fullprecisionsbasen som eskaleringsnivå ovanför en lokal Bonsai är det en slutpunkt och en nyckel i stället för två leverantörsrelationer.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

Vilken att välja

Beslutet handlar mest om var arbetet utförs, inte om vilken modell som är bättre, eftersom de är samma modell för de flesta uppgifter.

• Välj Qwen3.8-27B i full precision när uppgiften är långsiktig och agentisk, när du utvärderar eller finjusterar, när du behöver 1M-token YaRN-kontext, eller när visionsnoggrannhet är avgörande. Siffrorna för Terminal-Bench och SWE-bench är anledningen.

• Välj Ternary Bonsai 2 27B när arbetet måste ske på hårdvara du äger, när alternativet är att inte köra en 27B-modell alls, eller när arbetsbelastningen är matematik, kodning, extraktion eller verktygsfritt resonemang där kategorierna ligger på samma nivå.

• Välj inte utifrån aggregeringen. 83,9 och 85,4 ligger tillräckligt nära varandra för att ett enda utbyte av benchmark skulle kunna ändra deras inbördes ordning, och endast ett av de två talen är oberoende verifierat.

Det som verkligen är nytt här är inte att en 27B-modell får plats i sex gigabyte – den första Bonsai-generationen gjorde det i juli. Det är att instruktionsföljningen presterade bättre än föräldramodellen och att matematik och kodning presterade på samma nivå, vilket är ett annat påstående än "liten för sin storlek". Huruvida det håller för din arbetsbelastning är precis det som en dags ålder inte kan säga dig, och den första oberoende utvärderingen av den här modellen är resultatet som är värt att vänta på.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

Om du vill köra jämförelsen på dina egna prompter i stället för på en benchmark-svit är den snabbaste vägen att anropa den hostade Qwen3.8-27B via en enda endpoint och köra ternary-bygget lokalt, och sedan diffa utdatan på de uppgifter du faktiskt har. Det är ett förmiddagsarbete och det kommer att säga dig mer om de 1,8 punkterna än någon publicerad tabell.