Eine generierte Titelkarte mit dem Text „Bonsai vs. Ternary Bonsai 2 27B", untertitelt mit „Zwei Low-Bit-Wetten, zwei verschiedene Maßstäbe", über drei Karten mit den Texten „Gewichte: 0,43 GB vs. 5,93 GB", „Qualitätsangabe: vergleichend vs. 98,2 % Beibehaltung" und „Silizium: Hexagon NPU vs. Apple Silicon und CUDA", mit einer Fußzeile „Alle Qualitätswerte wurden vom Anbieter angegeben und nicht reproduziert." Das OrcaRouter-Logo befindet sich unten rechts.
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: Zwei Low-Bit-Wetten, zwei verschiedene Maßstäbe

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Setzt man das 1-Bit-Bonsai-2B-Vision-Language-Modell neben Ternary Bonsai 2 27B, ist der offensichtliche Vergleich – 2 Milliarden Parameter gegen 27 Milliarden, 0,43 GB Sprachgewichte gegen 5,93 GB – das am wenigsten Interessante an dem Paar. Interessant ist, dass die beiden Modelle, vom selben Anbieter und aus demselben Komprimierungsprogramm, ihre Qualität nicht auf dieselbe Weise angeben. Ternary Bonsai 2 27B gibt eine Retention an: Es behält über 98 % der aggregierten Benchmark-Leistung seines Vollpräzisions-Pendants, gemessen an sich selbst. Das 1-Bit-Bonsai-2B gibt einen Vergleich an: Es erzielte „vergleichbare Benchmark-Ergebnisse“ gegenüber einem Qwen-3-1.7B-Modell bei 4-Bit-Quantisierung, gemessen am Modell eines anderen bei einer anderen Präzision. Das eine ist eine Aussage darüber, wie viel verloren ging. Das andere ist eine Aussage darüber, wie es sich im Vergleich schlägt. Keines von beiden ist eine Aussage darüber, wie gut eines der beiden Modelle in absoluten Maßstäben ist, und die beiden lassen sich nicht auf derselben Skala lesen.

Diese Unterscheidung ist wichtiger als die Parameteranzahl, denn sie entscheidet darüber, was man aus den Zahlen des Anbieters tatsächlich schließen kann – und nach den bisher veröffentlichten Belegen ist die ehrliche Antwort weniger, als die Schlagzeilenzahlen nahelegen.

Zwei Qualitätsaussagen, zwei verschiedene Maßstäbe

Ternary Bonsai 2 27B, veröffentlicht am 17. September 2026, ist ein ternärer {−1, 0, +1}-Neuaufbau von Qwen3.8-27B mit 1,76 effektiven Bits pro Gewicht, und die Zahl, mit der PrismML vorangeht, ist, dass es mehr als 98 % der aggregierten Benchmark-Leistung des vollpräzisen Modells beibehält. Das ist eine Beibehaltungsaussage, und Beibehaltungsaussagen sind konstruktionsbedingt selbstreferenziell: Sie sagen dir, wie viel vom Original die Komprimierung überstanden hat, nicht wo das Original stand. Ein Modell, das 98 % einer mittelmäßigen Basis beibehält, ist immer noch ein mittelmäßiges Modell, und Qwen3.8-27B ist nicht mittelmäßig – aber die Zahl allein sagt das nicht, und sie lässt sich nicht über Basismodelle hinweg vergleichen.

Das 1-Bit-Bonsai-2B-Vision-Language-Modell, angekündigt am 23. September 2026 für die Snapdragon AR1 Gen 1 Brillenplattform, ist ein 1,7B-1-Bit-Sprachmodell plus ein 0,3B-4-Bit-Vision-Encoder. Die dazu veröffentlichte Qualitätsaussage ist von anderer Art: PrismML evaluierte es gegen ein Qwen 3 1.7B-Modell mit 4-Bit-Quantisierung über BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K und GPQA Diamond hinweg und berichtete, dass die beiden Konfigurationen vergleichbare Ergebnisse erzielten. Das ist eine Paritätsbehauptung gegenüber einer externen Baseline. Sie besagt, dass die Komprimierung Sie gegenüber dem 4-Bit-Pfad, den Sie sonst verwendet hätten, nicht offensichtlich etwas gekostet hat – was genau die richtige Frage für ein Geräteklassen-Release ist und eine viel schwächere Aussage als „dieses Modell ist gut“.

Es gibt also keine Lesart, auf der 98,2 % „vergleichend“ übertrifft oder umgekehrt. Sie sind Antworten auf zwei verschiedene Fragen, gestellt anhand zweier verschiedener Referenzen, auf zwei verschiedenen Suiten, vom selben Anbieter. Wer diese beiden Modelle aufgrund dieser beiden Sätze bewertet, bewertet die Sätze.

Die Basismodelle kommen von verschiedenen Orten.

Es gibt einen zweiten strukturellen Unterschied, und er ist derjenige, der im kommenden Jahr von Bedeutung sein wird. Ternary Bonsai 2 27B ist eine Re-Kompression eines externen Modells – Alibabas Qwen3.8-27B. Seine Qualitätsobergrenze wird durch den Veröffentlichungszeitplan eines anderen festgelegt, und seine Generationskadenz folgt eher der von Qwen als der von PrismML. Wenn Qwen ein neues 27B veröffentlicht, erhält die Bonsai-27B-Reihe einen neuen Input, und der Retentionswert wird gegen eine neue Baseline neu berechnet.

Der 1-Bit-Bonsai 2B basiert auf PrismMLs eigenem Bonsai 1.7B. Seine Obergrenze wird intern festgelegt, sein Update-Takt liegt bei PrismML, und seine Verbesserungen stammen aus dem Kompressionsrezept und dem Kernel-Pfad statt aus einem Austausch des Upstream-Modells. Das ist eine andere Art von Asset: langsamer bei der Verbesserung der Rohleistung, vollständig unter der Kontrolle des Anbieters und – wie die Veröffentlichung der Brille zeigt – in der Lage, auf einen bestimmten Beschleuniger abgestimmt zu werden, und zwar auf eine Weise, die eine allgemeine Neukomprimierung nicht leisten kann.

Beides sind legitime Strategien. Sie sind nicht austauschbar, und welche Sie wählen sollten, hängt davon ab, ob Ihre Roadmap an Qwen oder am Gerät verankert ist.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Der Spezifikationskontrast, Zeile für Zeile

• Parameter — ein 1,7B-1-Bit-LLM plus ein 0,3B-4-Bit-Vision-Encoder im Brillenmodell, gegenüber einem Modell der 27B-Klasse, abgeleitet von Qwen3.8-27B in Ternary Bonsai 2 27B.

• Repräsentation — binär {−1, +1} mit gruppenweiser FP16-Skalierung im Glasses-Modell, gegenüber ternär {−1, 0, +1} mit derselben Skalierung bei 1,76 effektiven Bits pro Gewicht im 27B.

• Sprachmodell-Gewichte — 0,43 GB für das 1-Bit-1,7B, gegenüber 5,93 GB für das PTQ1_0-Packing von Ternary Bonsai 2 27B, wobei ein 7,25 GB PQ2_0-Packing ebenfalls verfügbar ist.

Kontext — 1.024 Tokens beim Brillenmodell, gegenüber einem vollständigen Kontext von 262.000 Tokens bei Ternary Bonsai 2 27B.

• Accelerator — die Qualcomm Hexagon NPU über ein QNN SDK mit 1-Bit-Kernel-Unterstützung, gegen Apple Silicon über MLX und NVIDIA über CUDA.

• Qualitätsbehauptung — „vergleichende Benchmark-Ergebnisse“ gegenüber einem 4-Bit Qwen 3 1.7B, gegenüber einer Beibehaltung von „über 98 %“ der vollpräzisen Qwen3.8-27B-Baseline. Beide vom Anbieter angegeben, keine unabhängig reproduziert, auf unterschiedlichen Test-Suiten gemessen.

• Laufzeit — eine Qualcomm-NPU-Toolchain für das Brillenmodell, gegen PrismMLs eigenen llama.cpp-Fork und einen MLX-Container für das 27B, die beide von Standard-llama.cpp nicht unterstützt werden.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Was die Low-Bit-Wette jeweils bringt

Die Kompressionsphilosophie ist in beiden Modellen dieselbe, und es lohnt sich, sie zu benennen, denn sie ist die eigentliche These der Familie: Die Niedrigbit-Darstellung läuft durchgängig – Embeddings, Attention, MLPs und der LM-Head – mit gruppenweiser FP16-Skalierung und ohne Auswege zu höherer Präzision. Keines der beiden Modelle behält ein Float-Sicherheitsnetz für die Teile, die schwer zu quantisieren sind. Das ist eine aggressivere Position, als die meisten Quantisierungsarbeiten einnehmen, und genau das macht 1,76 Bit pro Gewicht und 0,43 GB Gewichte überhaupt erst möglich.

Wo sich die Wette auszahlt, ist unterschiedlich. Bei Ternary Bonsai 2 27B ist der Gewinn Fähigkeit pro Byte auf Hardware, die Sie bereits besitzen: ein Modell der 27B-Klasse in 5,93 GB, das auf einem Laptop oder einem Smartphone läuft, bei 98 % seiner Baseline. Bei 1-bit Bonsai 2B ist der Gewinn die Existenz auf einer Geräteklasse, die keine Option hatte: ein multimodales Modell in 0,43 GB Sprachgewichten, auf einer NPU, bei 15,36 Token pro Sekunde. Ersteres ist eine bessere Version von etwas, das bereits funktionierte. Letzteres ist etwas, das zuvor nicht funktionierte.

Wo die Tier-Grenze liegt

Diese beiden sind keine Alternativen, und sie als direkten Vergleich zu behandeln, verfehlt die Deployment-Form, auf die beide Releases hinauslaufen. Ein Brillen- oder Wearable-Produkt führt das 2B lokal aus, weil nichts anderes passt. Ein Laptop- oder Telefonprodukt führt das 27B aus, weil es das kann. Sobald ein Produkt beide abdeckt – eine mit einer Brille gekoppelte Telefon-App, eine Laptop-App mit einem On-Device-Assistenten –, geht es nicht mehr darum, welches Modell, sondern darum, welche Anfragen jede Stufe beantworten darf.

Diese Grenze sollte man eher in der Konfiguration als im Anwendungscode festhalten, weil sich beide Ebenen verschieben werden. Die 27B-Grenze verschiebt sich, wenn Qwen ausliefert, die 2B-Grenze verschiebt sich, wenn PrismML das Rezept ändert, und eine fest codierte Regel zu Kontextlänge oder Fähigkeiten bricht bei beiden Ereignissen. Eine Routing-Richtlinie, die Anfragen jenseits des Budgets der lokalen Ebene an ein gehostetes Modell eskaliert, übersteht beide Änderungen; die lokale Ebene bleibt eine Ebene unter mehreren statt einer Annahme, die sich durch den Client zieht. OrcaRouter ist die Schicht, die diese Eskalation übernimmt — ein einziger Endpunkt für über 200 gehostete Modelle, Failover inklusive, mit der als Konfiguration ausgedrückten Richtlinie. Kein Bonsai wird hier geroutet; beide sind lokale Downloads. Was hier sitzt, ist die Ebene über ihnen, und mit einem lokalen Modell mit 1.024 Token erledigt diese Ebene die meiste Arbeit.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Was würde es klären

Drei Messungen würden dieses Paar von zwei Marketingbehauptungen in einen Vergleich verwandeln. Eine Aufschlüsselung pro Benchmark hinter der Zeile „Vergleichsergebnisse“, sodass der Trade-off gegenüber 4-Bit sichtbar wird, statt zusammengefasst zu werden. Ein Retentionswert für das 1-Bit-Bonsai 2B gegenüber seiner eigenen Vollpräzisions-Baseline — die Messung, die PrismML für die 27B-Linie verwendet und hier nicht veröffentlicht hat. Und eine unabhängige Evaluation eines der beiden Modelle, da derzeit jede Zahl in beiden Veröffentlichungen vom Anbieter stammt.

Bis eines davon existiert, ist die vertretbare Position diejenige, die die Zahlen tatsächlich stützen: Ternary Bonsai 2 27B ist mit großem Abstand das bessere Modell, und das 1-bit Bonsai 2B ist das einzige der beiden, das auf dem Gerät läuft, für das es gebaut wurde. Diese beiden Aussagen stehen nicht im Widerspruch, und die Tatsache, dass derselbe Anbieter sie mit unterschiedlichen Maßstäben gemessen hat, ist das, was man sich merken sollte, wenn das nächste Mal eine dieser Zahlen ohne ihre Vergleichsbasis zitiert wird.