
Bonsai sur lunettes intelligentes : un VLM 1 bit de 2B fonctionnant sur Snapdragon AR1 Gen 1
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 36 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 182 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Le nombre qui détermine à quoi cette annonce est réellement utile n'est pas 4x et ce n'est pas 2x. C'est 1 024 — la longueur de contexte du modèle que PrismML a mis sur une paire de lunettes intelligentes au Snapdragon Summit le 23 septembre 2026. Le modèle vision-langage Bonsai 2B 1 bit, un système de 2 milliards de paramètres basé sur Bonsai 1.7B, s'exécute localement sur des lunettes intelligentes IA alimentées par la plateforme Snapdragon AR1 Gen 1, et les chiffres que PrismML met en avant sont la mémoire et la vitesse : 0,43 Go de poids LLM contre 1,66 Go pour le modèle 1.7B 4 bits correspondant, une réduction de 3,83x, et 15,36 jetons par seconde contre 7,44, une amélioration de 2,06x. Les deux chiffres sont ceux du fournisseur, tous deux ont été mesurés sur une plateforme de test de 4 Go, et tous deux sont mesurés par rapport à un modèle Qwen 3 1.7B 4 bits. Ils ne sont pas mesurés par rapport à un Bonsai 27B, et ils ne sont pas mesurés par rapport à quoi que ce soit hébergé. Les interpréter comme une affirmation sur la qualité de Bonsai serait une erreur ; les interpréter comme une affirmation sur ce qui tient dans un budget mémoire de classe lunettes est la bonne approche.
Ce qui a été annoncé, en un seul endroit
L'annonce de PrismML — datée de Pasadena, liée au Snapdragon Summit de Qualcomm — place un modèle vision-langage de 2 milliards de paramètres sur la plateforme de lunettes AR1 Gen 1. La répartition est un modèle de langage 1,7B à 1 bit plus un encodeur visuel 0,3B à 4 bits, avec une longueur de contexte de 1 024 jetons. Il est construit sur Bonsai 1.7B de PrismML, il s'agit donc du petit modèle de la famille Bonsai plutôt que d'une nouvelle architecture, et il a été compilé pour le NPU Qualcomm Hexagon à l'aide d'un SDK QNN interne avec prise en charge des noyaux 1 bit.
Le titre affirme, comme indiqué par le fournisseur :
• Permet de faire tenir un modèle avec 4 fois plus de paramètres dans les mêmes contraintes de mémoire, sur certains formats de lunettes.
• Offre à peu près l'intelligence équivalente du même modèle en précision 4 bits tout en utilisant environ 4 fois moins de mémoire.
• Génère des jetons à une vitesse plus de 2 fois supérieure.
Ces trois phrases constituent le communiqué. Les mesures précises qui sous-tendent les affirmations sur la mémoire et la vitesse sont 0,43 Go contre 1,66 Go et 15,36 contre 7,44 tokens par seconde, toutes deux sur une plateforme configurée avec 4 Go de mémoire. L’AR1 Gen 1 lui-même est annoncé avec un pic de 6 TOPS et 2 304 MACs par cycle — un chiffre pour la plateforme, et non pour l’inférence de modèle de langage, une distinction que les chiffres de l’annonce elle-même mettent clairement en évidence en citant séparément les tokens par seconde.

Le 4x est une affirmation sur la mémoire, et la référence est un modèle différent.
C’est la partie sur laquelle il vaut la peine de ralentir, car « 4x » est le genre de chiffre qui circule plus loin que la phrase dont il est issu. Toutes les comparaisons que PrismML a publiées pour le modèle destiné aux lunettes portent sur une quantification 4 bits de Qwen 3 1,7 B — la même classe de paramètres, la même tâche, une quantification différente. Il s’agit d’une comparaison légitime et utile : c’est celle à laquelle un fabricant de lunettes OEM est réellement confronté, où la question est de savoir si une approche à 1 bit permet de récupérer suffisamment de mémoire pour justifier le travail sur les noyaux. Ce n’est pas une comparaison avec une version 4 bits de Bonsai, et ce n’est pas non plus une comparaison avec un Bonsai plus grand exécuté ailleurs.
La note de bas de page sur les benchmarks accompagnant l’annonce est prudente de la même manière. PrismML a évalué le LLM 1-bit Bonsai 1.7B face au modèle 4-bit Qwen 3 1.7B en septembre 2026 sur BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K et GPQA Diamond, et le résultat rapporté est que les deux configurations « ont obtenu des résultats comparables sur les benchmarks ». Comparables, pas supérieurs. L’annonce ne contient aucun score par benchmark et aucune reproduction indépendante de tout cela, ce qui est normal pour une version edge sortie la semaine du lancement et c’est exactement pourquoi les chiffres doivent être considérés comme déclarés par le fournisseur jusqu’à ce que quelqu’un d’extérieur à PrismML les exécute.
1 024 tokens, c’est la spec qui façonne le produit
Un modèle vision-langage sur lunettes représente une charge de travail différente de celle d’un modèle vision-langage dans une fenêtre de chat, et c’est au niveau de la longueur de contexte que cela se voit. À 1 024 jetons, le modèle peut contenir une courte instruction ainsi que ce qu’une caméra regarde actuellement. Il ne peut pas contenir un historique de conversation, un document ni une longue chaîne de tours précédents. Ce n’est pas un défaut de la version — c’est la contrainte qui a rendu cette version possible, car le cache KV et les activations doivent résider dans les mêmes 4 Go que les poids, et un modèle de classe 27B avec un contexte de 262K jetons a besoin de plusieurs ordres de grandeur d’espace supplémentaire pour cet état.
Donc, la description honnête de ce qui a été livré, c’est un assistant compétent à contexte court qui tourne entièrement sur l’appareil. Les tâches typiques des lunettes — reconnaître ceci, lire cela, traduire le panneau devant moi, répondre à une question sur ce que je regarde — tiennent dans 1 024 tokens. Tout ce qui doit se souvenir des dix dernières minutes n’y tient pas, et aucune quantité de compression à 1 bit n’y change rien, car la limite, c’est l’état, pas les poids.
Ce que l’écosystème de l’edge devrait en tirer
La véritable nouveauté d'ingénierie dans cette annonce n'est pas le modèle. C'est le chemin des kernels : un LLM 1 bit compilé pour le NPU Hexagon via un SDK QNN avec prise en charge des kernels 1 bit. Les poids à faible nombre de bits sont exécutables sur CPU et GPU depuis un certain temps, et les propres versions Bonsai 27B de PrismML l'ont démontré sur Apple silicon et le matériel NVIDIA. Faire tourner des kernels à poids binaires sur un NPU mobile est un problème différent, car le chemin de données de l'accélérateur, son format d'empaquetage et son ordonnancement doivent tous s'accommoder d'une représentation qui n'est pas du tout un type flottant.
Si cette voie se généralise au-delà de ce seul modèle — et le langage du SDK laisse entendre que PrismML le souhaite — alors la conséquence intéressante est que la famille 1-bit cesse d'être une histoire d'ordinateurs portables et de téléphones pour devenir une histoire d'appareils toujours actifs. La plateforme de 4 Go annoncée constitue le plafond actuel. Tout ce qui réduit l'empreinte des poids à qualité constante augmente la taille du modèle qui peut tenir sous ce plafond.

L'affirmation sur le traitement local mérite une réserve
L’inférence multimodale entièrement locale sur une paire de lunettes est une affirmation forte, et il vaut la peine de séparer ce qui est démontré de ce qui est sous-entendu. L’AR1 Gen 1 est une plateforme de lunettes conçue pour la captation et l’audio en continu ; la façon dont Qualcomm présente elle-même les modèles de langage embarqués a généralement été hybride, l’appareil traitant ce qu’il peut et transmettant le reste à un téléphone appairé ou au cloud. La première démonstration publique par Qualcomm d’un petit modèle de langage embarqué était liée à la plateforme AR1+ Gen 1 plutôt qu’à l’AR1 Gen 1. Aucun de ces points ne contredit l’annonce de PrismML — l’annonce indique que le modèle s’exécute localement sur l’AR1 Gen 1, et les chiffres de débit et de mémoire avancés par le fournisseur lui-même sont compatibles avec un petit modèle faisant exactement cela — mais ils signifient que le produit concret construit sur cette base sera presque certainement un palier local avec un chemin d’escalade, et non un appareil qui ne communique jamais avec autre chose.
C’est de toute façon la bonne architecture. Un modèle local de 1 024 tokens est très bon sur les requêtes qui tiennent en 1 024 tokens, et il ne peut pas répondre à celles qui n’y tiennent pas.
Où le chemin d'escalade a sa place
Pour quiconque développe sur une version comme celle-ci, la question de conception n'est pas de savoir si le modèle embarqué dans les lunettes est bon — c'est ce qui advient de la requête qu'il ne peut pas traiter. Résolue dans le code de l'application, cette question devient un amas de cas particuliers qu'il faut réécrire chaque fois que le modèle embarqué change de taille ou de contexte. Résolue comme politique de routage, elle se réduit à une règle : les requêtes qui dépassent le budget de contexte du palier local, ou qui exigent des outils ou un raisonnement dont le palier local ne dispose pas, sont escaladées vers un modèle hébergé. Cette politique est exactement le type de chose pour lequel OrcaRouter existe — un point de terminaison devant plus de 200 modèles hébergés, avec basculement et la politique exprimée dans la configuration plutôt que dans le client. Bonsai lui-même n'est pas routé ici ; c'est un téléchargement que vous exécutez sur votre propre matériel. Ce que la couche de routage couvre, c'est la frontière située au-dessus, et c'est à cette frontière qu'un déploiement de lunettes consacrera l'essentiel de son temps d'ingénierie.

Que regarder ensuite
Trois choses feraient passer cela d’une annonce à une plateforme. Une ventilation par benchmark derrière la ligne « résultats comparatifs », afin que le compromis face au 4 bits soit visible plutôt que résumé. Une fenêtre de contexte plus grande sur le même chemin NPU, ce qui est un problème de mémoire d’état plutôt qu’un problème de poids, et donc le plus difficile des deux. Et une évaluation indépendante du LLM 1,7 B à 1 bit par rapport à son équivalent 4 bits, car chaque chiffre de cette publication provient actuellement de la partie qui l’a construit.
Jusque-là, le résumé exact est étroit et utile : un modèle multimodal de 2 milliards de paramètres tourne désormais sur un appareil de la classe des lunettes avec 0,43 Go de poids de langage, à environ deux fois la vitesse et avec environ un quart de la mémoire de l’équivalent 4 bits, sur un budget de contexte de 1 024 jetons. C’est un vrai pas pour l’inférence embarquée et un petit pas pour la capacité du modèle, et les deux ne sont pas la même affirmation.
