
Bonsai vs Bonsai 27B: Eén familienaam, zestien keer zoveel parameters
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Iedereen die deze familie op naam koopt, krijgt het verkeerde model, en de reden is dat de kale naam "Bonsai" geen model is. Het is de familie, en sinds deze week bevat de familie een vision-language model met 2 miljard parameters dat op een slimme bril draait en een model met 27 miljard parameters dat op een telefoon, een laptop of een desktop draait. De eerste is het 1-bit Bonsai 2B vision-language model dat op 23 september 2026 werd aangekondigd — een 1,7B 1-bit taalmodel plus een 0,3B 4-bit vision-encoder, 1.024-token context, gebaseerd op Bonsai 1.7B. De tweede is Bonsai 27B, uitgebracht op 14 juli 2026 onder Apache 2.0, gebaseerd op Qwen3.6-27B met een 262.000-token context en een keuze uit een 5,9 GB ternaire build of een 3,9 GB binaire build. Ze delen een naam, een leverancier, een compressiefilosofie en bijna niets anders. Zestien keer zoveel parameters, tweehonderdzesenvijftig keer zoveel context, en twee totaal verschillende apparaten.
Deze pagina is voor de persoon die naar een van beide zocht en op de andere terechtkwam.
Het naamgevingsprobleem, eenvoudig uitgelegd
Het modelmenu van PrismML vermeldt momenteel Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B en Bonsai Image. De aankondiging van de bril voegt een vision-languagemodel met 2 miljard parameters toe bovenop de Bonsai 1.7B-lijn. Dus "Bonsai" alleen kan elk van minstens vier parameterklassen en twee generaties betekenen, en het formaatachtervoegsel is het enige dat onderscheid maakt. Dat is geen kritiek op de naamgeving — het is de normale vorm van een modelfamilie — maar het betekent wel dat de familienaam geen informatie bevat over wat je aan het downloaden bent.
De nuttige scheidslijn is niet generatie, maar apparaatklasse. Alles in de 27B-lijn gaat ervan uit dat je ergens tussen 4 GB en 8 GB geheugen hebt om aan een taalmodel te geven en bereid bent dat te besteden. Alles in de 1.7B-lijn gaat ervan uit dat je een paar honderd megabyte hebt en niet meer. Dat enkele feit bepaalt welke helft van de familie voor jou relevant is, nog voordat welke benchmark dan ook dat doet.
Wat elk ervan eigenlijk is
• Parameters — een 1,7B 1-bit-LLM plus een 0,3B 4-bit-visionencoder in het brillenmodel, tegenover een model uit de 27B-klasse dat is afgeleid van Qwen3.6-27B in Bonsai 27B.
• Context — 1.024 tokens op het brillenmodel, tegenover een volledige context van 262.000 tokens op Bonsai 27B.
• Taalmodelgewichten — 0,43 GB voor de 1-bits 1,7B, tegenover 5,9 GB voor de ternaire Bonsai 27B en 3,9 GB voor de 1-bits variant daarvan.
• Representatie — binaire {−1, +1}-gewichten met FP16 groepsgewijze scaling in beide, wat het 1-bitrecept is waarop de familie is gebouwd; Bonsai 27B biedt daarnaast een ternaire {−1, 0, +1}-build met 1,71 effectieve bits per gewicht.
• Doelsilicon — de Qualcomm Hexagon NPU op het Snapdragon AR1 Gen 1-brillenplatform, gecompileerd via een QNN SDK met 1-bit-kernelondersteuning, tegenover Apple silicon via MLX en NVIDIA via CUDA voor Bonsai 27B.
• Decodeerthroughput — 15,36 tokens per seconde op een 4 GB AR1 Gen 1-testplatform voor het brillenmodel, tegenover ongeveer 11 tokens per seconde op een iPhone 17 Pro, 87 op een Apple M5 Max en 163 op een RTX 5090 voor de 1-bit Bonsai 27B.
Al die cijfers zijn afkomstig van de leverancier, en de twee sets zijn op verschillende hardware en tegen verschillende baselines gemeten, dus ze beschrijven twee producten in plaats van twee punten op een curve.

Waar Bonsai 27B wint, en het is niet eens nipt
Context staat voorop, en het verschil is geen detail. Een venster van 262.000 tokens bevat een codebase, een lang document, een transcript of een werkende agentsessie, met ruimte over. Een venster van 1.024 tokens bevat één korte instructie en één afbeelding. Als je werkbelasting inhoudt dat je iets leest dat langer is dan een pagina, is Bonsai 27B de enige van de twee die het werk überhaupt kan doen, en geen enkele hoeveelheid slimme prompting op het brillenmodel dicht die kloof, omdat de limiet het geheugen is dat is gereserveerd voor key-value-toestand en niet de grootte van de gewichten.
Capabiliteit staat op de tweede plaats. Van de ternaire build van Bonsai 27B wordt gemeld dat deze ongeveer 95% van zijn baseline met volledige precisie behoudt in een suite van 15 benchmarks in denkmodus, en zijn 1-bit build ongeveer 90%, met de grootste verliezen bij beeldverwerking en toolgebruik. Dat zijn cijfers van de leverancier op de eigen suite van de leverancier, en ze zijn nog steeds van een andere orde dan een model met 2 miljard parameters waarvan de enige gepubliceerde kwaliteitsverklaring is dat het "vergelijkbare benchmarkresultaten" behaalde ten opzichte van een 4-bit Qwen 3 1.7B. Het brillenmodel wordt door zijn eigen maker niet vergeleken met een 27B-model, omdat de vergelijking niet nuttig zou zijn.
Ecosysteem is de derde. Bonsai 27B wordt geleverd in GGUF-, MLX- en AWQ-pakketten met gedocumenteerde runtimes, dus er is een manier om het te draaien op hardware die je al bezit. Het brillenmodel bestaat binnen een Qualcomm NPU-toolchain.

Waar de 2B wint, en dat is het hele punt
Een taalmodel van 0,43 GB past op plekken waar een van 5,9 GB niet kan komen, en het brillenplatform is een van die plekken. Dat is het hele argument, en het is een sterker argument dan het specificatiecontrast doet vermoeden, omdat de apparaten in kwestie geen alternatief hebben: een bril met 4 GB gedeeld platformgeheugen kan Bonsai 27B in geen enkele build huisvesten, en een telefoon kan de ternaire build niet huisvesten zonder het grootste deel op te geven waarvoor de telefoon dient.
Er is een tweede voordeel dat minder aandacht krijgt: de 1-bitsrepresentatie is op deze apparaatklasse geen compromis, het is de truc die het mogelijk maakt. PrismML's eigen formulering is dat het 1-bitspad ruwweg dezelfde intelligentie levert als hetzelfde model op 4-bitsprecisie, terwijl het ongeveer een kwart van het geheugen gebruikt en tokens met meer dan tweemaal de snelheid genereert. Voor een apparaat dat altijd aan staat, waar om elke milliwatt en elke megabyte wordt gestreden, is die ruil het product.
Dus de twee modellen concurreren niet met elkaar. De 2B is wat draait wanneer er nergens anders te draaien valt. De 27B is wat draait wanneer dat wel het geval is.
De tiergrens is de echte beslissing
Bijna niemand kiest tussen deze twee. Een realistische deployment heeft beide: een klein altijd actief model op het apparaat voor de verzoeken die binnen 1.024 tokens passen, en iets groters erachter voor al het andere. Zodra je die opzet accepteert, is de technische vraag niet langer "welke Bonsai" maar "waar ligt de grens, en wie handhaaft die".
Als het in applicatiecode wordt afgedwongen, wordt die regel een vertakking die telkens opnieuw moet worden geschreven wanneer het model op het apparaat zijn contextlengte of capaciteit wijzigt — wat, op basis van de aanwijzingen van de afgelopen drie maanden, ongeveer maandelijks gebeurt. Als het als routeringsbeleid wordt afgedwongen, wordt het één regel over contextbudget en vereiste capaciteit, en blijft de lokale laag een laag in plaats van een aanname die door de hele client heen is ingebakken. Dat is de laag waarop OrcaRouter opereert: één endpoint vóór meer dan 200 gehoste modellen, met failover en het escalatiebeleid uitgedrukt in configuratie. Geen van beide Bonsai's wordt hier gerouteerd — beide zijn downloads die je op je eigen hardware draait — dus de eerlijke formulering is dat de routeringslaag de laag boven de lokale dekt, en met een lokaal model van 1.024 tokens is die laag waar het meeste verkeer terechtkomt.

Als je er één moet kiezen
• Je bouwt voor brillen, wearables of elk altijd-aan-apparaat — het 1-bit Bonsai 2B visie-taalmodel is hier de enige optie, en de context van 1.024 tokens is de ontwerpbeperking waar je omheen bouwt in plaats van ertegen.
• Je bouwt voor een telefoon — 1-bit Bonsai 27B op 3,9 GB is het grootste model in deze familie dat binnen een geheugenbudget van iPhone-klasse past, en het levert je een context van 262K op die het brillenmodel niet kan benaderen.
• Je bouwt voor een laptop of desktop — de ternaire Bonsai 27B-build is de kwaliteitsgerichte keuze binnen de familie, en de 1-bit-build levert snelheid op in plaats van capaciteit.
• Je bouwt een hybride — bepaal eerst de escalatieregel en pas daarna het model. Het model kun je vervangen; de grens niet, zodra die in de client zit.
Wat de moeite waard is om te volgen, is of het NPU-pad dat de release van de bril mogelijk maakte, zich naar boven uitstrekt. Als 1-bit kernels op mobiele accelerators generaliseren, wordt de 1,7B-lijn groter en wordt het pleidooi voor een 27B-model op een telefoon sterker. Tot dan blijven de twee helften van de familie netjes gescheiden door apparaatklasse, wat de keuze gemakkelijker maakt dan de gedeelde naam suggereert.
