
Bonsai vs Ternary Bonsai 2 27B : deux paris low-bit, deux règles différentes
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Placez le modèle vision-langage 1-bit Bonsai 2B à côté du Ternary Bonsai 2 27B et la comparaison évidente — 2 milliards de paramètres contre 27 milliards, 0,43 Go de poids de langage contre 5,93 Go — est la chose la moins intéressante du duo. Ce qui est intéressant, c'est que les deux modèles, du même fournisseur et du même programme de compression, ne rapportent pas leur qualité de la même manière. Le Ternary Bonsai 2 27B rapporte une rétention : il conserve plus de 98 % de la performance agrégée aux benchmarks de sa contrepartie en pleine précision, mesurée par rapport à lui-même. Le 1-bit Bonsai 2B rapporte une comparaison : il a obtenu des « résultats de benchmark comparables » face à un modèle Qwen 3 1.7B en quantification 4-bit, mesuré par rapport à un modèle tiers à une précision différente. L'un est une déclaration sur ce qui a été perdu. L'autre est une déclaration sur la façon dont il se situe. Ni l'un ni l'autre n'est une déclaration sur la qualité absolue de l'un ou l'autre modèle, et les deux ne peuvent pas être lues sur la même échelle.
Cette distinction importe davantage que le nombre de paramètres, car elle détermine ce que vous pouvez réellement conclure des chiffres du fournisseur — et d’après les données publiées à ce jour, la réponse honnête est inférieure à ce que suggèrent les chiffres mis en avant.
Deux allégations de qualité, deux règles différentes
Ternary Bonsai 2 27B, publié le 17 septembre 2026, est une reconstruction ternaire {−1, 0, +1} de Qwen3.8-27B à 1,76 bit effectif par poids, et le chiffre que PrismML met en avant est qu'il conserve plus de 98 % des performances globales aux benchmarks du modèle en pleine précision. C'est une affirmation de rétention, et les affirmations de rétention sont autoréférentielles par construction : elles vous disent quelle part de l'original a survécu à la compression, pas où se situait l'original. Un modèle qui conserve 98 % d'une base médiocre reste un modèle médiocre, et Qwen3.8-27B n'est pas médiocre — mais le chiffre seul ne le dit pas, et il ne peut pas être comparé d'un modèle de base à l'autre.
Le modèle vision-langage Bonsai 2B à 1 bit, annoncé le 23 septembre 2026 pour la plateforme de lunettes Snapdragon AR1 Gen 1, est un modèle de langue 1 bit de 1,7 B, plus un encodeur visuel 4 bits de 0,3 B. Sa déclaration de qualité publiée est d'une autre nature : PrismML l'a évalué face à un modèle Qwen 3 1.7B en quantification 4 bits sur BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K et GPQA Diamond, et a rapporté que les deux configurations ont obtenu des résultats comparables. C'est une affirmation de parité vis-à-vis d'une référence externe. Cela signifie que la compression ne vous a pas manifestement pénalisé par rapport à l'approche 4 bits que vous auriez utilisée sinon — ce qui est exactement la bonne question pour une version destinée aux appareils, et une affirmation bien plus faible que « ce modèle est bon ».
Ainsi, il n’existe aucune interprétation selon laquelle 98,2 % l’emporte sur « comparative », ni l’inverse. Ce sont des réponses à deux questions différentes, posées par rapport à deux références différentes, sur deux suites différentes, par le même fournisseur. Quiconque classe ces deux modèles en se fondant sur ces deux phrases classe les phrases.
Les modèles de base proviennent d’endroits différents.
Il existe une deuxième différence structurelle, et c'est celle qui comptera au cours de l'année à venir. Ternary Bonsai 2 27B est une recompression d'un modèle externe — le Qwen3.8-27B d'Alibaba. Son plafond de qualité est fixé par le calendrier de publication de quelqu'un d'autre, et sa cadence générationnelle suit celle de Qwen plutôt que celle de PrismML. Lorsque Qwen livre un nouveau 27B, la gamme Bonsai 27B reçoit une nouvelle entrée, et le chiffre de rétention est recalculé par rapport à une nouvelle référence.
Le Bonsai 2B 1-bit est construit sur le Bonsai 1.7B de PrismML. Son plafond est défini en interne, sa cadence de mise à jour est choisie par PrismML, et ses améliorations proviennent de la recette de compression et du chemin de kernel plutôt que du remplacement d'un modèle en amont. C'est un type d'actif différent : plus lent à progresser en capacités brutes, entièrement sous le contrôle du fournisseur, et — comme le montre la sortie des lunettes — capable d'être optimisé pour un accélérateur spécifique d'une manière qu'une re-compression générale ne permet pas.
Les deux sont des stratégies légitimes. Elles ne sont pas interchangeables, et celle que vous voulez dépend de si votre feuille de route est ancrée sur celle de Qwen ou sur l’appareil.

Le contraste de la spécification, une ligne à la fois
• Paramètres — un LLM 1 bit de 1,7 B plus un encodeur visuel 4 bits de 0,3 B dans le modèle des lunettes, contre un modèle de classe 27 B dérivé de Qwen3.8-27B dans Ternary Bonsai 2 27B.
• Représentation — binaire {−1, +1} avec mise à l’échelle par groupe FP16 dans le modèle glasses, contre ternaire {−1, 0, +1} avec la même mise à l’échelle à 1,76 bit effectif par poids dans le 27B.
• Poids du modèle de langage — 0,43 Go pour le 1-bit 1,7B, contre 5,93 Go pour le packing PTQ1_0 de Ternary Bonsai 2 27B, avec un packing PQ2_0 de 7,25 Go également disponible.
• Contexte — 1 024 tokens sur le modèle de lunettes, contre un contexte complet de 262 000 tokens sur Ternary Bonsai 2 27B.
• Accélérateur — le NPU Qualcomm Hexagon via un SDK QNN avec prise en charge des noyaux 1-bit, face à Apple silicon via MLX et NVIDIA via CUDA.
• Revendication de qualité — « résultats de benchmark comparatifs » face à un Qwen 3 1.7B en 4 bits, face à une rétention de « plus de 98 % » de la référence Qwen3.8-27B en pleine précision. Les deux rapportés par le fournisseur, aucun reproduit de façon indépendante, mesurés sur des suites différentes.
• Environnement d’exécution — une chaîne d’outils NPU Qualcomm pour le modèle de lunettes, face au fork llama.cpp propre à PrismML et à un conteneur MLX pour le 27B, que le llama.cpp standard ne prend en charge ni l’un ni l’autre.

Ce que le pari low-bit achète dans chaque cas
La philosophie de compression est la même dans les deux modèles et il vaut la peine de la nommer, car c'est la thèse réelle de la famille : la représentation en bits faibles fonctionne de bout en bout — embeddings, attention, MLP et tête LM — avec une mise à l'échelle par groupes en FP16 et sans échappatoires de plus haute précision. Aucun des deux modèles ne conserve de filet de sécurité en virgule flottante pour les parties difficiles à quantifier. C'est une position plus agressive que celle adoptée par la plupart des travaux de quantification, et c'est ce qui rend possibles 1,76 bit par poids et des poids de 0,43 Go.
Là où le pari paie diffère. Dans Ternary Bonsai 2 27B, le gain est la capacité par octet sur du matériel que vous possédez déjà : un modèle de classe 27B dans 5,93 GB, tournant sur un ordinateur portable ou un téléphone, à 98 % de sa référence. Dans le 1-bit Bonsai 2B, le gain est l'existence sur une catégorie d'appareils qui n'avait aucune option : un modèle multimodal dans 0,43 GB de poids de langage, sur un NPU, à 15,36 tokens par seconde. Le premier est une meilleure version de quelque chose qui fonctionnait déjà. Le second est quelque chose qui ne fonctionnait pas auparavant.
Où se situe la limite de niveau
Ces deux-là ne sont pas des alternatives, et les traiter comme une comparaison frontale passe à côté de la forme de déploiement vers laquelle pointent les deux versions. Un produit de lunettes ou de wearable exécute le 2B en local parce que rien d'autre ne convient. Un produit ordinateur portable ou téléphone exécute le 27B parce qu'il le peut. Dès qu'un produit couvre les deux — une application téléphone appairée à des lunettes, une application ordinateur portable avec un assistant embarqué —, la question n'est plus de savoir quel modèle, mais quelles requêtes chaque palier est autorisé à traiter.
Cette frontière mérite d’être placée dans la configuration plutôt que dans le code applicatif, car les deux paliers vont évoluer. La ligne des 27B évolue lorsque Qwen publie une version, celle des 2B évolue lorsque PrismML modifie la recette, et une règle codée en dur sur la longueur de contexte ou les capacités est mise en défaut par ces deux événements. Une politique de routage qui fait remonter vers un modèle hébergé les requêtes dépassant le budget du palier local résiste à ces deux changements ; le palier local reste un palier parmi plusieurs plutôt qu’une hypothèse inscrite dans tout le client. OrcaRouter est la couche qui effectue cette escalade — un point de terminaison unique pour plus de 200 modèles hébergés, avec basculement inclus, et avec la politique exprimée sous forme de configuration. Aucun des deux Bonsai n’est routé ici ; tous deux sont des téléchargements locaux. Ce qui se trouve ici, c’est le palier au-dessus d’eux, et avec un modèle local de 1 024 jetons, ce palier fait la majeure partie du travail.

Qu'est-ce qui réglerait ça ?
Trois mesures suffiraient à faire de ce duo, aujourd’hui deux arguments marketing, une véritable comparaison. Une ventilation par benchmark derrière la ligne « résultats comparatifs », afin que le compromis face au 4 bits soit visible au lieu d’être résumé. Un chiffre de rétention pour le Bonsai 2B en 1 bit par rapport à sa propre référence en pleine précision — la mesure que PrismML utilise pour la gamme 27B et qu’elle n’a pas publiée ici. Et une évaluation indépendante de l’un ou l’autre modèle, puisque chaque chiffre des deux publications provient actuellement du fournisseur.
Jusqu’à ce que l’un de ceux-ci existe, la position défendable est celle que les chiffres étayent réellement : Ternary Bonsai 2 27B est le meilleur modèle, et de loin, et le 1-bit Bonsai 2B est le seul des deux à tourner sur l’appareil pour lequel il a été conçu. Ces deux affirmations ne sont pas contradictoires, et le fait que le même fournisseur les ait mesurés avec des règles différentes est ce qu’il faut retenir la prochaine fois que l’un de ces chiffres sera cité sans sa référence de base.
