
Bonsai vs Ternary Bonsai 2 27B: Twee low-bit weddenschappen, twee verschillende linialen
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Zet het 1-bit Bonsai 2B visie-taalmodel naast Ternary Bonsai 2 27B, en de voor de hand liggende vergelijking — 2 miljard parameters tegenover 27 miljard, 0,43 GB aan taalgewichten tegenover 5,93 GB — is het minst interessante aan het duo. Het interessante is dat de twee modellen, van dezelfde leverancier en hetzelfde compressieprogramma, hun kwaliteit niet op dezelfde manier rapporteren. Ternary Bonsai 2 27B rapporteert retentie: het behoudt meer dan 98% van de geaggregeerde benchmarkprestaties van zijn tegenhanger met volledige precisie, gemeten tegen zichzelf. De 1-bit Bonsai 2B rapporteert een vergelijking: hij behaalde "vergelijkbare benchmarkresultaten" tegen een Qwen 3 1.7B-model bij 4-bit kwantisatie, gemeten tegen het model van iemand anders bij een andere precisie. De ene is een bewering over hoeveel er verloren is gegaan. De andere is een bewering over hoe het zich verhoudt. Geen van beide is een bewering over hoe goed een van beide modellen in absolute zin is, en de twee kunnen niet op dezelfde schaal worden gelezen.
Dat onderscheid is belangrijker dan het aantal parameters, want het bepaalt wat je daadwerkelijk kunt concluderen uit de cijfers van de leverancier — en op basis van het tot nu toe gepubliceerde bewijs is het eerlijke antwoord minder dan de kerncijfers doen vermoeden.
Twee kwaliteitsclaims, twee verschillende linialen
Ternary Bonsai 2 27B, uitgebracht op 17 september 2026, is een ternaire {−1, 0, +1}-herbouw van Qwen3.8-27B met 1,76 effectieve bits per gewicht, en het cijfer waarmee PrismML vooroploopt, is dat het meer dan 98% van de totale benchmarkprestaties van het volledige-precisiemodel behoudt. Dat is een retentieclaim, en retentieclaims zijn per constructie zelfreferentieel: ze vertellen je hoeveel van het origineel de compressie heeft overleefd, niet waar het origineel stond. Een model dat 98% van een middelmatige baseline behoudt, is nog steeds een middelmatig model, en Qwen3.8-27B is niet middelmatig — maar het getal alleen zegt dat niet, en het kan niet tussen basismodellen worden vergeleken.
Het 1-bit Bonsai 2B vision-languagemodel, aangekondigd op 23 september 2026 voor het Snapdragon AR1 Gen 1-brillenplatform, is een 1,7B 1-bit taalmodel plus een 0,3B 4-bit vision-encoder. De kwaliteitsverklaring die het publiceert, is van een andere aard: PrismML evalueerde het tegen een Qwen 3 1.7B-model bij 4-bit kwantisatie op BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K en GPQA Diamond, en meldde dat de twee configuraties vergelijkbare resultaten behaalden. Dat is een pariteitsclaim ten opzichte van een externe baseline. Het zegt dat de compressie je niet duidelijk heeft benadeeld ten opzichte van het 4-bit-pad dat je anders zou hebben gebruikt — wat precies de juiste vraag is voor een release in de apparaatklasse, en een veel zwakkere bewering dan "dit model is goed".
Er is dus geen enkele interpretatie waarin 98,2% "comparative" verslaat of omgekeerd. Het zijn antwoorden op twee verschillende vragen, gesteld tegen twee verschillende referenties, op twee verschillende suites, door dezelfde leverancier. Wie deze twee modellen op basis van die twee zinnen rangschikt, rangschikt de zinnen.
De basismodellen komen van verschillende plaatsen.
Er is een tweede structureel verschil, en dat is het verschil dat het komende jaar van belang zal zijn. Ternary Bonsai 2 27B is een hercompressie van een extern model — Alibaba's Qwen3.8-27B. Het kwaliteitsplafond wordt bepaald door het releaseschema van iemand anders, en de generatiecadans volgt die van Qwen in plaats van die van PrismML. Wanneer Qwen een nieuwe 27B uitbrengt, krijgt de Bonsai 27B-lijn een nieuwe input, en wordt het retentiecijfer opnieuw berekend tegen een nieuwe baseline.
De 1-bit Bonsai 2B is gebouwd op de eigen Bonsai 1.7B van PrismML. Het plafond wordt intern bepaald, de updatefrequentie is aan PrismML om te kiezen, en de verbeteringen komen uit het compressierecept en het kernelpad, niet uit een upstream-modelwissel. Dat is een ander soort bezit: langzamer in het verbeteren van ruwe capaciteit, volledig onder controle van de leverancier, en — zoals de release van de bril laat zien — in staat om te worden afgestemd op een specifieke accelerator op een manier die een algemene hercompressie niet kan.
Beide zijn legitieme strategieën. Ze zijn niet onderling verwisselbaar, en welke je wilt, hangt ervan af of je roadmap verankerd is aan die van Qwen of aan het apparaat.

Het specificatiecontrast, één regel tegelijk.
• Parameters — een 1,7B 1-bit LLM plus een 0,3B 4-bit vision encoder in het brillenmodel, tegenover een model uit de 27B-klasse dat is afgeleid van Qwen3.8-27B in Ternary Bonsai 2 27B.
• Representatie — binair {−1, +1} met FP16 groepsgewijze schaling in het glasses-model, tegenover ternair {−1, 0, +1} met dezelfde schaling bij 1,76 effectieve bits per gewicht in de 27B.
• Taalmodelgewichten — 0,43 GB voor de 1-bit 1,7B, tegenover 5,93 GB voor de PTQ1_0-packing van Ternary Bonsai 2 27B, met daarnaast ook een 7,25 GB PQ2_0-packing beschikbaar.
• Context — 1.024 tokens op het brillenmodel, tegenover een volledige context van 262.000 tokens op Ternary Bonsai 2 27B.
• Versneller — de Qualcomm Hexagon NPU via een QNN SDK met ondersteuning voor 1-bit-kernels, tegenover Apple silicon via MLX en NVIDIA via CUDA.
• Kwaliteitsclaim — "vergelijkende benchmarkresultaten" ten opzichte van een 4-bits Qwen 3 1.7B, tegenover "meer dan 98%" behoud van de volledige-precisie Qwen3.8-27B-baseline. Beide door de leverancier gerapporteerd, geen van beide onafhankelijk gereproduceerd, gemeten op verschillende suites.
• Runtime — een Qualcomm-NPU-toolchain voor het brillenmodel, tegenover de eigen llama.cpp-fork van PrismML en een MLX-container voor de 27B, die standaard llama.cpp geen van beide ondersteunt.

Wat de low-bit-inzet in elk geval oplevert
De compressiefilosofie is in beide modellen hetzelfde, en het is de moeite waard om die te benoemen, want het is de eigenlijke these van de familie: de laag-bitsrepresentatie loopt end-to-end — embeddings, attention, MLP's en de LM-head — met FP16 groepsgewijze schaling en zonder ontsnappingsroutes naar hogere precisie. Geen van beide modellen behoudt een float-veiligheidsnet voor de onderdelen die moeilijk te kwantiseren zijn. Dat is een agressievere positie dan de meeste kwantisatie-inspanningen innemen, en dat is wat 1,76 bits per gewicht en 0,43 GB aan gewichten überhaupt mogelijk maakt.
Waar de inzet zich uitbetaalt, verschilt. In Ternary Bonsai 2 27B is de opbrengst capaciteit per byte op hardware die je al bezit: een model van 27B-klasse in 5,93 GB, draaiend op een laptop of een telefoon, op 98% van zijn baseline. In de 1-bit Bonsai 2B is de opbrengst het bestaan op een apparaatklasse die geen optie had: een multimodaal model in 0,43 GB aan taalgewichten, op een NPU, met 15,36 tokens per seconde. Het eerste is een betere versie van iets dat al werkte. Het tweede is iets dat voorheen niet werkte.
Waar de tier-grens ligt
Deze twee zijn geen alternatieven, en ze als een rechtstreekse confrontatie behandelen gaat voorbij aan de deployment-vorm waar beide releases op wijzen. Een brillen- of wearable-product draait de 2B lokaal omdat niets anders past. Een laptop- of telefoonproduct draait de 27B omdat het kan. Zodra een product beide bestrijkt — een telefoonapp gekoppeld aan een bril, een laptopapp met een on-device assistent — is de vraag niet langer welk model, maar welke verzoeken elke tier mag beantwoorden.
Die grens kun je beter in configuratie vastleggen dan in applicatiecode, want beide lagen zullen verschuiven. De 27B-grens verschuift wanneer Qwen uitkomt, de 2B-grens verschuift wanneer PrismML het recept wijzigt, en een hardgecodeerde regel over contextlengte of capaciteit breekt bij beide gebeurtenissen. Een routeringsbeleid dat verzoeken die het budget van de lokale laag overschrijden, doorschuift naar een gehost model, overleeft beide wijzigingen; de lokale laag blijft één laag onder meerdere in plaats van een aanname die door de client heen loopt. OrcaRouter is de laag die die escalatie uitvoert — één endpoint voor meer dan 200 gehoste modellen, inclusief failover, met het beleid uitgedrukt als configuratie. Geen van beide Bonsai's wordt hier gerouteerd; beide zijn lokale downloads. Wat hier zit, is de laag daarboven, en met een lokaal model van 1.024 tokens doet die laag het meeste werk.

Wat zou het beslechten?
Drie metingen zouden dit tweetal veranderen van twee marketingclaims in een vergelijking. Een uitsplitsing per benchmark achter de regel 'vergelijkende resultaten', zodat de trade-off tegen 4-bit zichtbaar wordt in plaats van samengevat. Een retentiecijfer voor de 1-bit Bonsai 2B ten opzichte van zijn eigen full-precision-baseline — de meting die PrismML voor de 27B-lijn gebruikt en hier niet heeft gepubliceerd. En een onafhankelijke evaluatie van een van beide modellen, aangezien elk cijfer in beide releases momenteel van de leverancier afkomstig is.
Totdat een van die bestaat, is de verdedigbare positie degene die de cijfers daadwerkelijk ondersteunen: Ternary Bonsai 2 27B is met ruime marge het betere model en de 1-bit Bonsai 2B is de enige van de twee die draait op het apparaat waarvoor het is gebouwd. Die twee uitspraken zijn niet met elkaar in tegenspraak, en het feit dat dezelfde leverancier ze met verschillende meetlatten heeft gemeten, is wat het onthouden waard is de volgende keer dat een van deze cijfers zonder de bijbehorende baseline wordt geciteerd.
