
Bonsai vs Bonsai 27B: Ett familjenamn, sexton gånger så många parametrar
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Den som väljer ur den här familjen enbart efter namn kommer att få fel modell, och anledningen är att det bara namnet "Bonsai" inte är en modell. Det är familjen, och sedan den här veckan innehåller familjen en visionsspråkmodell med 2 miljarder parametrar som körs på ett par smartglasögon och en modell med 27 miljarder parametrar som körs på en telefon, en bärbar dator eller en stationär dator. Den första är den 1-bitars visionsspråkmodellen Bonsai 2B som tillkännagavs den 23 september 2026 – en 1,7B 1-bitars språkmodell plus en 0,3B 4-bitars visionskodare, kontext på 1 024 token, byggd på Bonsai 1.7B. Den andra är Bonsai 27B, som släpptes den 14 juli 2026 under Apache 2.0, byggd på Qwen3.6-27B med en kontext på 262 000 token och ett val mellan en ternär byggversion på 5,9 GB eller en binär byggversion på 3,9 GB. De delar ett namn, en leverantör, en komprimeringsfilosofi och nästan inget annat. Sexton gånger så många parametrar, tvåhundrafemtiosex gånger så lång kontext och två helt olika enheter.
Den här sidan är till för personen som sökte efter en av dem och hamnade på den andra.
Namngivningsproblemet, uttryckt i klartext
PrismML:s modellmeny listar för närvarande Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B och Bonsai Image. Meddelandet om glasögonen lägger till en vision-språkmodell med 2 miljarder parametrar ovanpå Bonsai 1.7B-linjen. Så enbart "Bonsai" kan betyda vilken som helst av minst fyra parameterklasser och två generationer, och storlekssuffixet är det enda som skiljer dem åt. Det är inte en kritik av namngivningen – det är den normala formen för en modellfamilj – men det innebär att familjenamnet inte säger något om vad du laddar ner.
Den användbara uppdelningen är inte generation, det är enhetsklass. Allt i 27B-serien förutsätter att du har någonstans mellan 4 GB och 8 GB minne att ge en språkmodell och är villig att lägga det. Allt i 1.7B-serien förutsätter att du har några hundra megabyte och inte mer. Detta enda faktum avgör vilken halva av familjen som är relevant för dig innan någon benchmark gör det.
Vad var och en faktiskt är
• Parametrar — 1,7B 1-bitars LLM plus en 0,3B 4-bitars visionskodare i glasögonmodellen, mot en modell i 27B-klassen härledd från Qwen3.6-27B i Bonsai 27B.
• Kontext — 1 024 tokens på glasögonmodellen, jämfört med en full kontext på 262 000 tokens på Bonsai 27B.
• Språkmodellvikter — 0,43 GB för 1-bitars 1,7B, mot 5,9 GB för ternära Bonsai 27B och 3,9 GB för dess 1-bitarsversion.
• Representation — binära {−1, +1}-vikter med FP16-gruppvis skalning i båda, vilket är det 1-bitsrecept som familjen är uppbyggd kring; Bonsai 27B erbjuder dessutom en ternär {−1, 0, +1}-variant vid 1,71 effektiva bitar per vikt.
• Målkisel — Qualcomm Hexagon NPU:n på Snapdragon AR1 Gen 1-glasögonplattformen, kompilerat genom ett QNN SDK med stöd för 1-bitarskärnor, mot Apple silicon via MLX och NVIDIA via CUDA för Bonsai 27B.
• Avkodningsgenomströmning — 15,36 tokens per sekund på en testplattform med 4 GB AR1 Gen 1 för glasögonmodellen, jämfört med ungefär 11 tokens per sekund på en iPhone 17 Pro, 87 på en Apple M5 Max och 163 på en RTX 5090 för 1-bit Bonsai 27B.
Alla dessa siffror är leverantörens, och de två uppsättningarna mättes på olika hårdvara mot olika baslinjer, så de beskriver två produkter snarare än två punkter på en kurva.

Där Bonsai 27B vinner, och det är inte ens nära
Kontext är det första, och marginalen är inte en nyans. Ett fönster på 262 000 token rymmer en kodbas, ett långt dokument, en transkription eller en aktiv agentsession med utrymme över. Ett fönster på 1 024 token rymmer en kort instruktion och en bild. Om din arbetsbelastning innebär att läsa något längre än en sida är Bonsai 27B den enda av de två som överhuvudtaget kan göra jobbet, och ingen mängd smart promptning på glasögonmodellen stänger det gapet, eftersom gränsen är minnet som reserverats för nyckel-värde-tillstånd snarare än storleken på vikterna.
Kapacitet är andraplatsen. Bonsai 27B:s ternära bygge rapporteras behålla omkring 95 % av sin fullprecisionsbaslinje över en svit på 15 benchmarks i tänkandeläge, och dess 1-bitarsbygge omkring 90 %, med de största förlusterna inom vision och verktygsanvändning. Det är leverantörssiffror från leverantörens egen svit, och de är fortfarande något helt annat än en modell med 2 miljarder parametrar, vars enda publicerade kvalitetsuttalande är att den uppnådde "jämförbara benchmarkresultat" mot en 4-bitars Qwen 3 1.7B. Glasögonmodellen jämförs inte med en 27B-modell av sin egen tillverkare, eftersom jämförelsen inte skulle vara till nytta.
Ekosystemet är det tredje. Bonsai 27B levereras i GGUF-, MLX- och AWQ-packningar med dokumenterade körmiljöer, så det finns en väg att köra den på hårdvara du redan äger. Glasögonmodellen finns i en Qualcomm NPU-verktygskedja.

Där 2B vinner, och det är hela poängen
En språkmodell på 0,43 GB får plats där en på 5,9 GB inte kan vara, och glasögonplattformen är en av dem. Det är hela argumentet, och det är ett starkare argument än specifikationskontrasten får det att låta, eftersom enheterna i fråga inte har något alternativ: ett par glasögon med 4 GB delat plattformsminne kan inte köra Bonsai 27B i någon version, och en telefon kan inte köra den ternära versionen utan att ge upp det mesta som telefonen är till för.
Det finns en andra vinst som får mindre uppmärksamhet: 1-bitsrepresentationen är inte en kompromiss för den här enhetsklassen, den är det möjliggörande knepet. PrismML:s egen formulering är att 1-bitsvägen levererar ungefär motsvarande intelligens som samma modell vid 4-bitars precision, samtidigt som den använder ungefär en fjärdedel av minnet och genererar tokens med mer än dubbelt så hög hastighet. För en enhet som alltid är på, där varje milliwatt och varje megabyte är omstridd, är den avvägningen själva produkten.
Så de två modellerna konkurrerar inte. 2B är den som körs när det inte finns någon annanstans att köra. 27B är den som körs när det finns.
Nivågränsen är det verkliga beslutet
Nästan ingen väljer mellan dessa två. Den realistiska driftsättningen har båda: en liten ständigt aktiv modell på enheten för de förfrågningar som ryms inom 1 024 tokens, och något större bakom den för allt annat. När man väl accepterar den formen är ingenjörsfrågan inte längre ”vilken Bonsai” utan ”var går gränsen, och vem upprätthåller den”.
Om den tvingas fram i applikationskoden blir den raden en gren som måste skrivas om varje gång den lokala modellen ändrar kontextlängd eller kapacitet — vilket, med de senaste tre månadernas bevisning, sker ungefär varje månad. Om den tvingas fram som en routingpolicy blir den en enda regel om kontextbudget och krävd kapacitet, och den lokala nivån förblir en nivå i stället för att bli ett antagande inbakat genom klienten. Det är den nivån som OrcaRouter verkar på: en slutpunkt framför över 200 hostade modeller, med failover och eskaleringspolicyn uttryckt i konfiguration. Ingen av Bonsai-modellerna routas här — båda är nedladdningar som du kör på din egen hårdvara — så den ärliga formuleringen är att routinglagret täcker nivån ovanför den lokala, och med en lokal modell på 1 024 token är det den nivån där merparten av trafiken kommer att landa.

Om du måste välja en
• Du bygger för glasögon, bärbara enheter eller vilken ständigt påslagen enhet som helst — den 1-bitars Bonsai 2B-visionsspråkmodellen är det enda alternativet här, och kontexten på 1 024 token är den designbegränsning du bygger kring snarare än emot.
• Du bygger för en telefon — 1-bit Bonsai 27B på 3,9 GB är den största modellen i den här familjen som ryms inom en minnesbudget i iPhone-klass, och den ger dig ett 262K-kontext som glasögonmodellen inte kan matcha.
• Du bygger för en laptop eller stationär dator — ternary Bonsai 27B-bygget är det kvalitetsinriktade valet i familjen, och 1-bit-bygget ger hastighet snarare än kapacitet.
• Du bygger en hybrid — bestäm eskaleringsregeln först och modellen sedan. Modellen kan du byta ut; gränsen kan du inte, när den väl sitter i klienten.
Det som är värt att hålla ögonen på är huruvida NPU-vägen som gjorde glasögonlanseringen möjlig sträcker sig uppåt. Om 1-bitarskärnor på mobila acceleratorer generaliserar blir 1.7B-linjen större och argumentet för en 27B-modell i en telefon starkare. Fram till dess förblir familjens två halvor tydligt åtskilda av enhetsklass, vilket gör valet enklare än det gemensamma namnet antyder.
