Une carte de titre générée affichant « Bonsai vs Bonsai 27B », sous-titrée « Un même nom de famille, seize fois plus de paramètres », surmontant trois cartes indiquant « Contexte : 1 024 tokens vs 262K », « Poids du LLM : 0,43 Go vs 5,9 Go » et « Appareil cible : lunettes connectées vs téléphone, ordinateur portable, ordinateur de bureau », avec un pied de page indiquant « Chiffres déclarés par le fournisseur ; les deux modèles ne sont pas évalués sur une suite de tests commune. » Le logo OrcaRouter se trouve en bas à droite.
Guides & Insights

Bonsai vs Bonsai 27B : un même nom de famille, seize fois plus de paramètres

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Quiconque achète cette famille en se fiant à son nom obtiendra le mauvais modèle, et la raison en est que le simple nom « Bonsai » n'est pas un modèle. C'est la famille, et depuis cette semaine, la famille contient un modèle vision-langage de 2 milliards de paramètres qui tourne sur une paire de lunettes connectées et un modèle de 27 milliards de paramètres qui tourne sur un téléphone, un ordinateur portable ou un ordinateur de bureau. Le premier est le modèle vision-langage Bonsai 2B à 1 bit annoncé le 23 septembre 2026 — un modèle de langage 1,7B à 1 bit plus un encodeur visuel 0,3B à 4 bits, un contexte de 1 024 jetons, basé sur Bonsai 1.7B. Le second est Bonsai 27B, publié le 14 juillet 2026 sous licence Apache 2.0, basé sur Qwen3.6-27B avec un contexte de 262 000 jetons et le choix entre une version ternaire de 5,9 Go ou une version binaire de 3,9 Go. Ils partagent un nom, un fournisseur, une philosophie de compression et presque rien d'autre. Seize fois plus de paramètres, deux cent cinquante-six fois plus de contexte, et deux appareils entièrement différents.

Cette page s'adresse à la personne qui a cherché l'un d'eux et est tombée sur l'autre.

Le problème de nommage, dit simplement

Le menu des modèles de PrismML répertorie actuellement Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B et Bonsai Image. L’annonce des lunettes ajoute un modèle vision-langage de 2 milliards de paramètres à la gamme Bonsai 1.7B. Ainsi, « Bonsai » seul peut désigner au moins quatre classes de paramètres et deux générations, et le suffixe de taille est la seule chose qui permet de lever l’ambiguïté. Ce n’est pas une critique du nommage — c’est la forme normale d’une famille de modèles — mais cela signifie que le nom de la famille ne donne aucune information sur ce que vous téléchargez.

La distinction utile n’est pas la génération, c’est la classe d’appareil. Tout ce qui est dans la gamme 27B suppose que vous disposez d’entre 4 Go et 8 Go de mémoire à allouer à un modèle de langage et que vous êtes prêt à les dépenser. Tout ce qui est dans la gamme 1,7B suppose que vous disposez de quelques centaines de mégaoctets et pas plus. Ce seul fait détermine quelle moitié de la famille vous concerne avant même le moindre benchmark.

Ce que chacun est réellement

• Paramètres — un LLM 1 bit de 1,7B plus un encodeur visuel 4 bits de 0,3B dans le modèle de lunettes, contre un modèle de classe 27B dérivé de Qwen3.6-27B dans Bonsai 27B.

• Contexte — 1 024 tokens sur le modèle de lunettes, contre un contexte complet de 262 000 tokens sur Bonsai 27B.

• Poids du modèle de langage — 0,43 Go pour le 1,7B à 1 bit, contre 5,9 Go pour le Bonsai 27B ternaire et 3,9 Go pour sa version 1 bit.

• Représentation — pondérations binaires {−1, +1} avec une mise à l’échelle par groupe en FP16 dans les deux cas, ce qui correspond à la recette 1 bit sur laquelle repose la famille ; Bonsai 27B propose en outre une variante ternaire {−1, 0, +1} à 1,71 bit effectif par poids.

• Silicium cible — le NPU Hexagon de Qualcomm sur la plateforme de lunettes Snapdragon AR1 Gen 1, compilé via un SDK QNN avec prise en charge des noyaux 1 bit, face au silicium Apple via MLX et à NVIDIA via CUDA pour Bonsai 27B.

• Débit de décodage — 15,36 jetons par seconde sur une plateforme de test AR1 Gen 1 de 4 Go pour le modèle de lunettes, contre environ 11 jetons par seconde sur un iPhone 17 Pro, 87 sur un Apple M5 Max et 163 sur une RTX 5090 pour le 1-bit Bonsai 27B.

Tous ces chiffres proviennent du fournisseur, et les deux ensembles ont été mesurés sur du matériel différent par rapport à des références différentes, de sorte qu'ils décrivent deux produits plutôt que deux points sur une même courbe.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Là où Bonsai 27B gagne, et ce n'est pas serré.

Le contexte est le premier critère, et la marge n'est pas une simple nuance. Une fenêtre de 262 000 tokens contient une base de code, un long document, une transcription ou une session d'agent en cours, avec de la place à revendre. Une fenêtre de 1 024 tokens contient une seule instruction courte et une seule image. Si votre charge de travail implique de lire quoi que ce soit de plus d'une page, Bonsai 27B est le seul des deux qui puisse faire le travail, tout court, et aucune quantité de prompting astucieux sur le modèle pour lunettes ne comble cet écart, car la limite est la mémoire réservée à l'état clé-valeur plutôt que la taille des poids.

La capacité est le deuxième point. La version ternaire de Bonsai 27B conserverait environ 95 % de sa référence en pleine précision sur une suite de 15 benchmarks en mode raisonnement, et sa version 1 bit environ 90 %, les pertes les plus importantes concernant la vision et l’utilisation d’outils. Ce sont des chiffres du fournisseur, sur la suite du fournisseur lui-même, et ils restent d’un tout autre ordre que ceux d’un modèle de 2 milliards de paramètres dont la seule déclaration de qualité publiée est qu’il a obtenu des « résultats de benchmark comparables » face à un Qwen 3 1.7B en 4 bits. Le modèle pour lunettes n’est pas comparé à un modèle 27B par son propre fabricant, car la comparaison ne serait pas utile.

L’écosystème arrive en troisième. Bonsai 27B est livré en packagings GGUF, MLX et AWQ avec des runtimes documentés, il existe donc un moyen de l’exécuter sur du matériel que vous possédez déjà. Le modèle de lunettes existe au sein d’une chaîne d’outils NPU Qualcomm.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Là où le 2B gagne, et c'est tout l'enjeu

Un modèle de langage de 0,43 Go tient dans des endroits où un modèle de 5,9 Go ne peut pas aller, et la plateforme de lunettes est l’un d’eux. C’est tout l’argument, et c’est un argument plus solide que ne le laisse entendre le contraste des spécifications, car les appareils en question n’ont pas d’alternative : une paire de lunettes avec 4 Go de mémoire de plateforme partagée ne peut héberger Bonsai 27B dans aucune version, et un téléphone ne peut héberger la version ternaire sans renoncer à la majeure partie de ce à quoi le téléphone sert.

Il y a un second gain qui reçoit moins d’attention : la représentation en 1 bit n’est pas un compromis sur cette catégorie d’appareils, c’est l’astuce qui rend tout possible. Selon la propre formulation de PrismML, le chemin en 1 bit offre à peu près l’intelligence équivalente du même modèle en précision 4 bits, tout en utilisant environ un quart de la mémoire et en générant des tokens plus de deux fois plus vite. Pour un appareil toujours actif, où chaque milliwatt et chaque mégaoctet sont disputés, ce compromis est le produit.

Donc les deux modèles ne sont pas en concurrence. Le 2B est celui qui s'exécute quand il n'y a nulle part ailleurs où le faire. Le 27B est celui qui s'exécute quand il y a un endroit où le faire.

La frontière entre les niveaux est la vraie décision

Presque personne ne choisit entre ces deux-là. Le déploiement réaliste comporte les deux : un petit modèle toujours actif sur l’appareil pour les requêtes qui tiennent dans 1 024 tokens, et quelque chose de plus grand derrière pour tout le reste. Une fois que vous acceptez cette configuration, la question d’ingénierie cesse d’être « quel Bonsai » et devient « où se situe la limite, et qui la fait respecter ».

Imposée dans le code de l'application, cette ligne devient une branche qu'il faut réécrire chaque fois que le modèle embarqué change de longueur de contexte ou de capacité — ce qui, au vu des trois derniers mois, est à peu près mensuel. Imposée comme politique de routage, elle devient une règle unique portant sur le budget de contexte et la capacité requise, et le niveau local reste un niveau au lieu de devenir une hypothèse intégrée dans tout le client. C'est le niveau auquel opère OrcaRouter : un point de terminaison devant plus de 200 modèles hébergés, avec basculement et la politique d'escalade exprimée dans la configuration. Aucun des deux Bonsai n'est routé ici — les deux sont des téléchargements que vous exécutez sur votre propre matériel —, donc la formulation honnête est que la couche de routage couvre le niveau au-dessus du niveau local, et avec un modèle local de 1 024 jetons, c'est à ce niveau que la majeure partie du trafic atterrira.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Si vous devez en choisir un

• Vous développez pour des lunettes, des objets portables ou tout appareil toujours actif — le modèle vision-langage Bonsai 2B 1-bit est la seule option ici, et le contexte de 1 024 jetons est la contrainte de conception autour de laquelle vous construisez plutôt que contre laquelle vous vous battez.

• Vous développez pour un téléphone — Bonsai 27B en 1 bit à 3,9 Go est le plus grand modèle de cette famille qui tient dans un budget mémoire de classe iPhone, et il vous offre un contexte de 262 K que le modèle pour lunettes ne peut approcher.

• Vous développez pour un ordinateur portable ou de bureau — la version ternaire Bonsai 27B est le choix axé sur la qualité de la famille, et la version 1 bit privilégie la vitesse plutôt que la capacité.

• Vous construisez un hybride — décidez d'abord de la règle d'escalade, puis du modèle. Le modèle, vous pouvez le remplacer ; la limite, non, une fois qu'elle est dans le client.

Ce qu’il vaut la peine de surveiller, c’est de savoir si la voie NPU qui a rendu possible le lancement des lunettes s’étend vers le haut. Si les noyaux 1 bit sur les accélérateurs mobiles se généralisent, la gamme 1.7B s’élargit et l’argument en faveur d’un modèle 27B sur un téléphone se renforce. D’ici là, les deux moitiés de la famille restent nettement séparées par catégorie d’appareil, ce qui rend le choix plus simple que ne le suggère le nom partagé.