Eine generierte Titelkarte mit der Aufschrift „Bonsai vs Bonsai 27B“, mit dem Untertitel „Ein Familienname, sechzehnmal so viele Parameter“, über drei Karten mit der Aufschrift „Kontext: 1.024 Token vs. 262K“, „LLM-Gewichte: 0,43 GB vs. 5,9 GB“ und „Zielgerät: Smart Glasses vs. Smartphone, Laptop, Desktop“, mit einer Fußzeile mit der Aufschrift „Vom Anbieter angegebene Werte; die beiden Modelle werden nicht auf einer gemeinsamen Benchmark-Suite gebencht.“ Das OrcaRouter-Logo befindet sich unten rechts.
Guides & Insights

Bonsai vs. Bonsai 27B: Ein Familienname, sechzehnmal so viele Parameter

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Wer diese Familie nach Namen kauft, bekommt das falsche Modell, und der Grund dafür ist, dass der bloße Name „Bonsai“ kein Modell ist. Er steht für die Familie, und seit dieser Woche umfasst die Familie ein Vision-Sprachmodell mit 2 Milliarden Parametern, das auf einer Datenbrille läuft, und ein Modell mit 27 Milliarden Parametern, das auf einem Telefon, einem Laptop oder einem Desktop-Computer läuft. Das erste ist das am 23. September 2026 angekündigte 1-Bit-Vision-Sprachmodell Bonsai 2B — ein 1-Bit-Sprachmodell mit 1,7B Parametern plus ein 4-Bit-Vision-Encoder mit 0,3B Parametern, Kontext von 1.024 Token, aufgebaut auf Bonsai 1.7B. Das zweite ist Bonsai 27B, veröffentlicht am 14. Juli 2026 unter Apache 2.0, aufgebaut auf Qwen3.6-27B mit einem Kontext von 262.000 Token und der Wahl zwischen einer ternären Variante mit 5,9 GB oder einer binären Variante mit 3,9 GB. Sie teilen einen Namen, einen Anbieter, eine Kompressionsphilosophie und fast nichts sonst. Sechzehnmal so viele Parameter, 256-mal so viel Kontext und zwei völlig unterschiedliche Geräte.

Diese Seite ist für die Person, die nach einem von ihnen gesucht hat und bei dem anderen gelandet ist.

Das Benennungsproblem, klar ausgedrückt

Das Modellmenü von PrismML listet derzeit Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B und Bonsai Image auf. Die Brillenankündigung fügt der Bonsai-1.7B-Reihe ein Vision-Language-Modell mit 2 Milliarden Parametern hinzu. „Bonsai“ allein kann also für mindestens vier Parameterklassen und zwei Generationen stehen, und nur das Größen-Suffix unterscheidet eindeutig. Das ist keine Kritik an der Namensgebung – es ist die normale Form einer Modellfamilie –, aber es bedeutet, dass der Familienname keinerlei Information darüber liefert, was man herunterlädt.

Der nützliche Schnitt ist nicht die Generation, sondern die Geräteklasse. Alles in der 27B-Reihe geht davon aus, dass Sie irgendwo zwischen 4 GB und 8 GB Speicher für ein Sprachmodell zur Verfügung haben und bereit sind, diesen einzusetzen. Alles in der 1.7B-Reihe geht davon aus, dass Sie ein paar hundert Megabyte und nicht mehr haben. Diese eine Tatsache entscheidet, welche Hälfte der Familie für Sie relevant ist, bevor es irgendein Benchmark tut.

Was jedes einzelne tatsächlich ist

• Parameter — 1,7B-1-Bit-LLM sowie ein 0,3B-4-Bit-Vision-Encoder im Brillenmodell, gegenüber einem Modell der 27B-Klasse, das von Qwen3.6-27B in Bonsai 27B abgeleitet ist.

• Kontext — 1.024 Token beim Brillenmodell, gegenüber einem vollständigen Kontext von 262.000 Token bei Bonsai 27B.

• Sprachmodell-Gewichte — 0,43 GB für das 1-Bit-1,7B, gegenüber 5,9 GB für das ternäre Bonsai 27B und 3,9 GB für dessen 1-Bit-Build.

• Darstellung — binäre {−1, +1}-Gewichte mit FP16-gruppenweiser Skalierung in beiden, was das 1-Bit-Rezept ist, auf dem die Familie aufbaut; Bonsai 27B bietet zusätzlich einen ternären {−1, 0, +1}-Build mit 1,71 effektiven Bits pro Gewicht.

• Ziel-Silizium — die Qualcomm Hexagon NPU auf der Snapdragon AR1 Gen 1 Brillen-Plattform, kompiliert über ein QNN SDK mit 1-Bit-Kernel-Unterstützung, gegen Apple Silicon via MLX und NVIDIA via CUDA für Bonsai 27B.

• Dekodierungsdurchsatz — 15,36 Token pro Sekunde auf einer 4-GB-AR1-Gen-1-Testplattform für das Brillenmodell, gegenüber etwa 11 Token pro Sekunde auf einem iPhone 17 Pro, 87 auf einem Apple M5 Max und 163 auf einer RTX 5090 für das 1-Bit-Bonsai 27B.

Jede dieser Zahlen stammt vom Anbieter, und die beiden Datensätze wurden auf unterschiedlicher Hardware und gegen unterschiedliche Ausgangswerte gemessen, sie beschreiben also zwei Produkte und nicht zwei Punkte auf einer Kurve.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Wo Bonsai 27B gewinnt – und das nicht knapp

Der Kontext steht an erster Stelle, und der Abstand ist keine Nebensache. Ein 262.000-Token-Fenster fasst eine Codebasis, ein langes Dokument, ein Transkript oder eine laufende Agentensitzung mit reichlich Platz übrig. Ein 1.024-Token-Fenster fasst eine kurze Anweisung und ein Bild. Wenn Ihre Workload das Lesen von irgendetwas umfasst, das länger als eine Seite ist, ist Bonsai 27B von den beiden das einzige, das die Aufgabe überhaupt bewältigen kann, und kein noch so geschicktes Prompting beim Brillen-Modell schließt diese Lücke, denn die Grenze ist der für den Key-Value-Zustand reservierte Speicher und nicht die Größe der Gewichte.

Die Leistungsfähigkeit steht an zweiter Stelle. Berichten zufolge behält der ternäre Build von Bonsai 27B über eine 15-Benchmark-Suite im Thinking-Modus etwa 95 % seiner Vollpräzisions-Baseline und sein 1-Bit-Build etwa 90 %, wobei die größten Verluste bei Vision und Tool-Nutzung auftreten. Das sind Herstellerangaben zur eigenen Suite des Herstellers, und sie sind immer noch eine ganz andere Kategorie als ein Modell mit 2 Milliarden Parametern, dessen einzige veröffentlichte Qualitätsaussage darin besteht, dass es „vergleichbare Benchmark-Ergebnisse“ gegenüber einem 4-Bit-Qwen 3 1.7B erzielt hat. Das Brillenmodell wird von seinem eigenen Hersteller nicht mit einem 27B-Modell verglichen, weil der Vergleich nicht nützlich wäre.

Das Ökosystem ist das dritte. Bonsai 27B ist in GGUF-, MLX- und AWQ-Packungen mit dokumentierten Laufzeitumgebungen erhältlich, sodass es einen Weg gibt, es auf Hardware auszuführen, die Sie bereits besitzen. Das Brillenmodell existiert innerhalb einer Qualcomm-NPU-Toolchain.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Wo die 2B gewinnt, und genau das ist der springende Punkt

Ein Sprachmodell mit 0,43 GB passt an Orte, an die eines mit 5,9 GB nicht gelangen kann, und die Brillenplattform ist einer davon. Das ist das ganze Argument, und es ist stärker, als der Spezifikationskontrast vermuten lässt, denn die betreffenden Geräte haben keine Alternative: Eine Brille mit 4 GB gemeinsam genutztem Plattformspeicher kann Bonsai 27B in keiner Build-Variante hosten, und ein Telefon kann den Ternär-Build nicht hosten, ohne das meiste aufzugeben, wofür das Telefon gedacht ist.

Es gibt einen zweiten Gewinn, der weniger Beachtung findet: Die 1-Bit-Darstellung ist in dieser Geräteklasse kein Kompromiss, sondern der entscheidende Trick, der alles ermöglicht. PrismMLs eigene Darstellung besagt, dass der 1-Bit-Pfad ungefähr die gleiche Intelligenz wie dasselbe Modell mit 4-Bit-Präzision liefert, dabei aber nur etwa ein Viertel des Speichers benötigt und Tokens mit mehr als doppelter Geschwindigkeit erzeugt. Für ein Always-on-Gerät, bei dem jedes Milliwatt und jedes Megabyte umkämpft sind, ist genau dieser Tausch das Produkt.

Die beiden Modelle konkurrieren also nicht. Das 2B ist das, was läuft, wenn es sonst keine andere Möglichkeit gibt. Das 27B ist das, was läuft, wenn es eine gibt.

Die Stufengrenze ist die eigentliche Entscheidung

Fast niemand entscheidet sich zwischen diesen beiden. Der realistische Einsatz hat beides: ein kleines, immer aktives Modell auf dem Gerät für die Anfragen, die in 1.024 Token passen, und etwas Größeres dahinter für alles andere. Sobald man diese Form akzeptiert, ist die technische Frage nicht mehr „welches Bonsai“, sondern „wo verläuft die Grenze, und wer setzt sie durch“.

Im Anwendungscode erzwungen, wird diese Zeile zu einer Verzweigung, die jedes Mal neu geschrieben werden muss, wenn das On-Device-Modell seine Kontextlänge oder seine Fähigkeiten ändert – was, gemessen an den letzten drei Monaten, ungefähr monatlich der Fall ist. Als Routing-Richtlinie erzwungen, wird sie zu einer einzigen Regel über das Kontextbudget und die erforderliche Fähigkeit, und die lokale Ebene bleibt eine Ebene, statt zu einer Annahme zu werden, die sich durch den gesamten Client zieht. Das ist die Ebene, auf der OrcaRouter arbeitet: ein einziger Endpunkt vor über 200 gehosteten Modellen, mit Failover und der in der Konfiguration ausgedrückten Eskalationsrichtlinie. Keines der beiden Bonsai-Modelle wird hier geroutet – beide sind Downloads, die man auf der eigenen Hardware ausführt –, sodass die ehrliche Einordnung lautet, dass die Routing-Ebene die Ebene über der lokalen abdeckt, und bei einem lokalen Modell mit 1.024 Token ist diese Ebene diejenige, auf der der meiste Traffic landen wird.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Wenn du dich für eines entscheiden müsstest

• Sie entwickeln für Brillen, Wearables oder jedes Always-on-Gerät — das 1-Bit-Bonsai-2B-Vision-Language-Modell ist hier die einzige Option, und der 1.024-Token-Kontext ist die Designvorgabe, um die herum Sie entwickeln, statt gegen sie.

• Sie entwickeln für ein Telefon – 1-bit Bonsai 27B mit 3,9 GB ist das größte Modell dieser Familie, das in ein Speicherbudget der iPhone-Klasse passt, und es verschafft Ihnen einen 262K-Kontext, an den das Brillenmodell nicht heranreicht.

• Du baust für einen Laptop oder Desktop – der ternäre Bonsai 27B-Build ist die qualitätsorientierte Wahl in der Familie, und der 1-Bit-Build erkauft Geschwindigkeit statt Leistungsfähigkeit.

• Sie bauen ein Hybridsystem – entscheiden Sie zuerst über die Eskalationsregel und erst danach über das Modell. Das Modell können Sie austauschen; die Grenze nicht, sobald sie im Client ist.

Beachtenswert ist, ob sich der NPU-Pfad, der die Veröffentlichung der Brille möglich gemacht hat, nach oben fortsetzt. Wenn sich 1-Bit-Kernels auf mobilen Beschleunigern generalisieren lassen, wächst die 1.7B-Reihe, und das Argument für ein 27B-Modell auf einem Smartphone wird stärker. Bis dahin bleiben die beiden Hälften der Familie sauber nach Geräteklasse getrennt, was die Wahl einfacher macht, als der gemeinsame Name vermuten lässt.