
Bonsai auf Smart Glasses: Ein 2B-1-Bit-VLM läuft auf Snapdragon AR1 Gen 1
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Die Zahl, die entscheidet, wofür diese Ankündigung tatsächlich gut ist, ist nicht 4x, und sie ist nicht 2x. Sie ist 1.024 – die Kontextlänge des Modells, das PrismML am 23. September 2026 auf dem Snapdragon Summit auf eine Smartglasses-Brille gebracht hat. Das 1-Bit-Bonsai-2B-Vision-Language-Modell, ein System mit 2 Milliarden Parametern auf Basis von Bonsai 1.7B, läuft lokal auf KI-Smartglasses, die von der Snapdragon AR1 Gen 1 Platform angetrieben werden, und die Werte, die PrismML anführt, sind Speicher und Geschwindigkeit: 0,43 GB LLM-Gewichte gegenüber 1,66 GB für das entsprechende 4-Bit-1.7B-Modell, eine Reduktion um den Faktor 3,83, und 15,36 Token pro Sekunde gegenüber 7,44, eine Verbesserung um den Faktor 2,06. Beide Werte stammen vom Anbieter selbst, beide wurden auf einer 4-GB-Testplattform gemessen, und beide werden gegen ein Qwen 3 1.7B 4-Bit-Modell gemessen. Sie werden nicht gegen irgendein Bonsai 27B gemessen, und sie werden nicht gegen irgendetwas Gehostetes gemessen. Sie als Aussage über die Qualität von Bonsai zu lesen, wäre ein Fehler; sie als Aussage darüber zu lesen, was in ein Speicherbudget der Smartglasses-Klasse passt, ist die richtige Lesart.
Was wurde angekündigt, an einem Ort
PrismMLs Ankündigung – mit Datumszeile Pasadena, im Zusammenhang mit Qualcomms Snapdragon Summit – bringt ein Vision-Language-Modell mit 2 Milliarden Parametern auf die AR1 Gen 1 Brillenplattform. Die Aufteilung besteht aus einem 1,7B-Sprachmodell mit 1 Bit plus einem 0,3B-Vision-Encoder mit 4 Bit, bei einer Kontextlänge von 1.024 Tokens. Es basiert auf PrismMLs Bonsai 1.7B, ist also das untere Ende der Bonsai-Familie und keine neue Architektur, und es wurde für die Qualcomm Hexagon NPU mit einem internen QNN SDK mit 1-Bit-Kernel-Unterstützung kompiliert.
Die Schlagzeile behauptet, wie vom Anbieter angegeben:
• Ermöglicht ein Modell mit viermal so vielen Parametern innerhalb derselben Speicherbeschränkungen bei einigen Brillen-Formfaktoren.
• Liefert in etwa die gleiche Intelligenz wie dasselbe Modell bei 4-Bit-Präzision, verbraucht dabei aber etwa 4-mal weniger Speicher.
• Erzeugt Tokens mehr als doppelt so schnell.
Diese drei Sätze sind die Pressemitteilung. Die konkreten Messwerte hinter den Speicher- und Geschwindigkeitsangaben sind die 0,43 GB gegenüber 1,66 GB und die 15,36 gegenüber 7,44 Tokens pro Sekunde, beide auf einer Plattform, die mit 4 GB Arbeitsspeicher konfiguriert ist. Der AR1 Gen 1 selbst wird mit einer Spitzenleistung von 6 TOPS und 2.304 MACs pro Taktzyklus angegeben – eine Angabe für die Plattform, nicht für die Inferenz von Sprachmodellen, ein Unterschied, den die eigenen Zahlen der Ankündigung deutlich machen, indem sie Tokens pro Sekunde separat angeben.

Das 4x ist eine Aussage zum Speicher, und die Baseline ist ein anderes Modell.
Das ist der Teil, bei dem es sich lohnt, langsamer zu werden, denn „4x“ ist die Art von Zahl, die weiter reist als der Satz, aus dem sie stammt. Jeder Vergleich, den PrismML für das Brillenmodell veröffentlicht hat, bezieht sich auf eine 4-Bit-Quantisierung von Qwen 3 1.7B – dieselbe Parameterklasse, dieselbe Aufgabe, eine andere Quantisierung. Das ist ein legitimer und nützlicher Vergleich: Es ist der Vergleich, dem sich ein Brillen-OEM tatsächlich gegenübersieht, bei dem die Frage lautet, ob ein 1-Bit-Pfad genug Speicher zurückholt, um die Kernel-Arbeit zu rechtfertigen. Es ist kein Vergleich mit einer 4-Bit-Version von Bonsai, und es ist kein Vergleich mit einem größeren Bonsai, das irgendwo anders läuft.
Die der Ankündigung beigefügte Benchmark-Fußnote ist auf dieselbe Weise vorsichtig. PrismML hat das Bonsai 1.7B 1-bit LLM im September 2026 gegen das Qwen 3 1.7B 4-bit-Modell anhand von BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K und GPQA Diamond evaluiert, und das berichtete Ergebnis ist, dass die beiden Konfigurationen „vergleichbare Benchmark-Ergebnisse erzielten“. Vergleichbar, nicht überlegen. In der Ankündigung gibt es keine Einzelwerte je Benchmark und keine unabhängige Reproduktion von all dem, was für ein Edge-Release in der Startwoche normal ist und genau der Grund dafür, dass die Zahlen als vom Anbieter gemeldet geführt werden sollten, bis jemand außerhalb von PrismML sie durchführt.
1.024 Tokens sind die Spezifikation, die das Produkt prägt.
Ein Vision-Language-Modell auf einer Brille ist eine andere Arbeitslast als ein Vision-Language-Modell in einem Chatfenster, und die Kontextlänge ist der Punkt, an dem sich das zeigt. Bei 1.024 Token kann das Modell eine kurze Anweisung plus das, worauf eine Kamera gerade gerichtet ist, aufnehmen. Ein Gesprächsverlauf, ein Dokument oder eine lange Kette früherer Turns findet darin keinen Platz. Das ist kein Mangel des Releases – es ist die Einschränkung, die das Release möglich gemacht hat, denn KV-Cache und Aktivierungen müssen in denselben 4 GB wie die Gewichte liegen, und ein Modell der 27B-Klasse mit einem 262K-Token-Kontext braucht um Größenordnungen mehr Platz für diesen Zustand.
Die ehrliche Beschreibung dessen, was ausgeliefert wurde, lautet also: ein leistungsfähiger Assistent mit kurzem Kontext, der vollständig auf dem Gerät läuft. Brillenartige Aufgaben – dies erkennen, jenes lesen, das Schild vor mir übersetzen, eine Frage zu dem beantworten, was ich gerade betrachte – passen in 1.024 Token. Alles, was sich die letzten zehn Minuten merken muss, passt nicht hinein, und keine noch so starke 1-Bit-Kompression ändert etwas daran, denn die Grenze ist der Zustand, nicht die Gewichte.
Was das Edge-Ökosystem daraus mitnehmen sollte
Das wirklich neue Engineering in dieser Ankündigung ist nicht das Modell. Es ist der Kernel-Pfad: ein 1-Bit-LLM, das über ein QNN SDK mit 1-Bit-Kernel-Unterstützung für die Hexagon NPU kompiliert wurde. Niedrigbit-Gewichte lassen sich schon seit einer Weile auf CPUs und GPUs ausführen, und PrismMLs eigene Bonsai-27B-Veröffentlichungen haben das auf Apple Silicon und NVIDIA-Hardware demonstriert. Binärgewichts-Kernel auf eine mobile NPU zu bringen, ist ein anderes Problem, denn der Datenpfad des Beschleunigers, sein Packing-Format und sein Scheduling müssen alle eine Darstellung berücksichtigen, die überhaupt kein Float-Typ ist.
Wenn sich dieser Weg über dieses eine Modell hinaus verallgemeinern lässt – und die Sprache des SDK legt nahe, dass PrismML genau das beabsichtigt –, dann ist die interessante Konsequenz, dass die 1-Bit-Familie aufhört, eine Laptop- und Smartphone-Geschichte zu sein, und zu einer Geschichte von Always-on-Geräten wird. Die 4-GB-Plattform in der Ankündigung ist die derzeitige Obergrenze. Alles, was den Platzbedarf der Gewichte bei gleichbleibender Qualität verringert, erhöht die Größe des Modells, das darunter passt.

Die On-Device-Behauptung verdient einen Vorbehalt.
Vollständig lokale multimodale Inferenz auf einer Brille ist eine starke Behauptung, und es lohnt sich, das Demonstrierte vom Implizierten zu trennen. Die AR1 Gen 1 ist eine Brillenplattform, die für Always-on-Sensorik und Audio konzipiert ist; Qualcomms eigene Positionierung für Sprachmodelle auf dem Gerät war im Allgemeinen hybrid, wobei das Gerät erledigt, was es kann, und den Rest an ein gekoppeltes Telefon oder die Cloud weitergibt. Qualcomms erste öffentliche Demonstration eines kleinen Sprachmodells auf dem Gerät war an die Plattform AR1+ Gen 1 geknüpft und nicht an AR1 Gen 1. Keiner der beiden Punkte widerspricht PrismMLs Ankündigung – die Ankündigung besagt, dass das Modell lokal auf dem AR1 Gen 1 läuft, und die eigenen Durchsatz- und Speicherwerte des Anbieters passen zu einem kleinen Modell, das genau das tut –, doch sie bedeuten, dass das darauf aufgebaute praktische Produkt mit ziemlicher Sicherheit eine lokale Ebene mit einem Eskalationspfad sein wird, kein Gerät, das nie mit irgendetwas anderem spricht.
Das ist ohnehin die richtige Architektur. Ein lokales Modell mit 1.024 Token ist sehr gut bei Anfragen, die in 1.024 Token passen, und kann diejenigen nicht beantworten, die nicht passen.
Wohin der Eskalationspfad gehört
Für alle, die auf einem Release wie diesem aufbauen, lautet die Designfrage nicht, ob das Brillenmodell gut ist – sondern was mit der Anfrage geschieht, die es nicht bedienen kann. Im Anwendungscode beantwortet, wird daraus ein Haufen Sonderfälle, der jedes Mal neu geschrieben werden muss, wenn das On-Device-Modell seine Größe oder seinen Kontext ändert. Als Routing-Richtlinie beantwortet, wird daraus eine einzige Regel: Anfragen, die das Kontextbudget der lokalen Stufe überschreiten oder Tools bzw. Reasoning erfordern, die die lokale Stufe nicht bietet, werden an ein gehostetes Modell eskaliert. Diese Richtlinie ist genau die Art von Sache, für die OrcaRouter existiert – ein Endpunkt vor über 200 gehosteten Modellen, mit Failover und der Richtlinie, ausgedrückt in der Konfiguration statt im Client. Bonsai selbst wird hier nicht geroutet; es ist ein Download, den man auf der eigenen Hardware ausführt. Was die Routing-Schicht abdeckt, ist die Grenze darüber, und an dieser Grenze wird ein Brillen-Deployment die meiste Zeit seiner Entwicklungsarbeit verbringen.

Was als Nächstes ansehen
Drei Dinge würden dies von einer Ankündigung zu einer Plattform machen. Eine Aufschlüsselung pro Benchmark hinter der Zeile „vergleichende Ergebnisse“, damit der Trade-off gegenüber 4-Bit sichtbar wird statt nur zusammengefasst. Ein größeres Kontextfenster auf demselben NPU-Pfad, was eher ein Zustandsspeicher-Problem als ein Gewichtsproblem ist und daher das schwierigere der beiden. Und eine unabhängige Bewertung des 1-Bit-1,7B-LLM gegenüber seinem 4-Bit-Pendant, denn jede Zahl in dieser Veröffentlichung stammt derzeit von der Partei, die es gebaut hat.
Bis dahin ist die zutreffende Zusammenfassung eng gefasst und nützlich: Ein multimodales Modell mit 2 Milliarden Parametern läuft jetzt auf einem Gerät der Brillenklasse mit 0,43 GB Sprachgewichten, bei ungefähr doppelter Geschwindigkeit und ungefähr einem Viertel des Speicherbedarfs des 4-Bit-Äquivalents, bei einem Kontextbudget von 1.024 Token. Das ist ein echter Schritt für die Inferenz auf dem Gerät und ein kleiner Schritt für die Leistungsfähigkeit des Modells, und beides ist nicht dieselbe Aussage.
