
Ternary Bonsai 2 27B vs Qwen3.8-27B : ce que 47,9 gigaoctets de précision apportent réellement
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B et Qwen3.8-27B sont le même modèle dans deux mondes numériques. Ils partagent une architecture, un tokenizer, une lignée d’entraînement et une fenêtre de contexte de 262 144 tokens. Ce qui les sépare, c’est la façon dont les poids sont écrits : Qwen3.8-27B stocke chacun comme un flottant 16 bits et occupe 53,81 Go dans sa forme de référence FP16, tandis que Ternary Bonsai 2 27B stocke chacun comme l’un de trois symboles et occupe 5,93 Go. Prism ML a annoncé la version compressée le 17 septembre 2026 et l’a mise sur Hugging Face sous Apache 2.0 ; les poids originaux de Qwen3.8-27B ont été publiés le 13 août 2026, également sous Apache 2.0.
La comparaison qui compte n'est pas de savoir laquelle est meilleure. C'est ce que vous coûtent les 47,9 Go manquants, et la réponse honnête est plus étroite et plus précise que ce que l'un ou l'autre camp vous dira. Prism ML rapporte que sa version conserve 98,2 % de la moyenne du modèle en pleine précision sur une suite de 20 benchmarks — 83,9 contre 85,4. Ce chiffre est celui du fournisseur lui-même, mesuré sur son propre banc d'essai, et un jour après la sortie, personne en dehors de Prism ML ne l'a reproduit. L'agrégat masque aussi la partie qui devrait réellement vous importer, car les 1,8 points ne sont pas répartis uniformément. Sur les deux benchmarks qui mettent à l'épreuve l'ingénierie logicielle soutenue, l'écart n'est pas de 1,8 % — il est plus proche de 25 %.
Le même réseau, noté différemment
Commencez par ce que la compression ne touche pas, car c'est la raison pour laquelle la comparaison est intéressante tout court. Le nombre de couches, la taille cachée, le vocabulaire, le motif d'attention et la tour de vision appartiennent au modèle de base. Qwen3.8-27B est une conception à attention hybride : 48 couches d'attention linéaire Gated DeltaNet entrelacées avec 16 couches d'attention complète, une répartition d'environ 3:1, sur 64 couches avec une taille cachée de 5 120 et un vocabulaire de 248 320 jetons. C'est cette colonne vertébrale essentiellement linéaire qui rend un contexte de 262K abordable en premier lieu, et c'est la propriété que Bonsai hérite sans changement.
Ce que Prism ML a changé, c'est la représentation des matrices du modèle de langage, ainsi que les noyaux nécessaires pour effectuer des calculs sur celles-ci. Son livre blanc répartit les 27,36 milliards de paramètres en 24,35 milliards dans le backbone linguistique, sur 64 blocs, 2,54 milliards dans l'embedding et la tête LM, et 0,47 milliard dans une tour de vision de 27 blocs. La tour de vision est livrée sous forme d'un fichier mmproj 4 bits distinct d'environ 0,63 Go et n'est chargée que lorsqu'une image arrive réellement, de sorte qu'un déploiement texte uniquement n'en paie jamais le coût.
Une conséquence pratique de cette conception en grande partie linéaire mérite d’être signalée avant toute discussion sur les benchmarks. Comme l’architecture n’est pas un transformer classique, les noyaux à faible nombre de bits ont dû être écrits spécifiquement pour elle. La version standard de llama.cpp rejette les deux packings de Prism ML comme types inconnus — et, plus dangereusement, charge un ancien format ternaire sans broncher et produit un non-sens fluide, car aucune rotation correspondante n’est appliquée aux activations. Si vous exécutez ce modèle sur un binaire qui ne le connaît pas, vous n’obtiendrez pas d’erreur. Vous obtiendrez une sortie erronée mais énoncée avec assurance.
La comparaison, catégorie par catégorie
Voici la ventilation des 20 benchmarks du fournisseur, avec la base en pleine précision comme référence. Chaque chiffre de cette liste provient de Prism ML ; aucun n’a été vérifié indépendamment.
• Maths — 96,57 pour Ternary Bonsai 2 27B contre 97,06 pour Qwen3.8-27B. Quasiment à égalité.
• Codage — 81,58 vs 82,17. Également proches, et c’est la catégorie sur laquelle porte tout le débat autour de la technique.
• Suivi d'instructions — 82.66 vs 81.25. Le modèle compressé est en tête ici, ce qui est la seule ligne du tableau qui soit vraiment surprenante.
• Connaissances et raisonnement — 83,95 vs 86,66. Une baisse de 2,7 points, et le principal contributeur, à lui seul, aux 1,8 point manquants.
• Agentique et appel d'outils — 77,57 vs 79,74, couvrant τ2-Bench à 80,22 et BFCL v3 à 74,92.
• Vision — 78,59 vs 81,64, la perte la plus importante de la catégorie. À noter que la tour de vision elle-même n'est pas la partie compressée ; c'est le modèle de langage qui lit ses sorties qui l'est.

Lisez la forme plutôt que la moyenne, et une histoire plus claire apparaît. La compression est presque gratuite pour les mathématiques, la programmation et le suivi d’instructions, et elle est coûteuse pour les connaissances et la vision. C’est l’inverse de la sagesse populaire sur les modèles à faible précision, selon laquelle les connaissances de surface survivent et le raisonnement s’effondre. Ici, ce sont les connaissances qui s’érodent et le raisonnement qui tient.
Où se trouvent réellement les 1,8 points
L’agrégat est une moyenne sur vingt benchmarks, et c’est dans les moyennes que les écarts se cachent. Isolez les résultats individuels : deux d’entre eux sont bien pires que ne le suggère la moyenne.
• Terminal-Bench 2.1 — 52,8 pour la version ternaire contre 69,7 pour la pleine précision
• SWE-bench Verified — 60,8 contre 80,6
Les deux frôlent les trois quarts du score en pleine précision. En regard, AIME26 affiche 95,83, LiveCodeBench 90,07 et AA-LCR 77,0 — à un point près du modèle non compressé. C’est la toute première fois que la famille Bonsai est évaluée sur Terminal-Bench, et Prism ML indique explicitement dans ses propres documents que la capacité d’ingénierie logicielle à long horizon qu’elle avait promise dans la première génération n’est que partiellement livrée, et non pleinement.
La question pratique n’est donc pas « retient-il 98,2 % ? » mais « quelle est ma charge de travail ? ». Si vous exécutez un agent de codage qui conserve un plan sur des dizaines d’appels d’outils et modifie des fichiers pendant plusieurs minutes, vous appartenez à la catégorie où l’écart est de 25 %, et le chiffre agrégé induit activement en erreur. Si vous faites des mathématiques, de la génération de code en un seul tour, de l’extraction, de la classification ou de la conversation, vous appartenez aux catégories où l’écart disparaît à l’arrondi. Ce que le tableau du fournisseur lui-même a de plus utile, c’est qu’il vous permet de faire cette distinction au lieu de deviner.
Ce dont chacun a réellement besoin pour fonctionner
Le volet matériel est moins symétrique que ne le suggère le rapport de taille. Un modèle FP16 de 53,81 GB ne rentre pas du tout sur un ordinateur portable de 16 GB, ce qui rend la comparaison moins « plus rapide contre plus lent » et davantage « possible ou non ». Les mesures standardisées de Prism ML à une taille de lot de 1, tour de vision exclue :
• NVIDIA RTX 5090 — 142,5 tok/s en décodage sur le packing PQ2_0, à 0,582 mWh par token
• Apple M5 Max — 46,8 tok/s en décodage, avec un traitement du prompt autour de 765 tok/s
• Apple M5 Pro — 27,7 tok/s en décodage
• Apple M4 Pro — 18,0 tok/s en décodage, le traitement du prompt approchant 125 tok/s devenant la contrainte limitante sur les contextes très longs
L’important avertissement, c’est que rien de tout cela ne constitue un seul binaire. L’empaquetage PTQ1_0 vous donne 5,93 Go à 1,76 bit par poids ; PQ2_0 coûte 7,25 Go à 2,16 bits par poids et permet de gagner en vitesse de décodage sur du matériel où c’est le débit d’instructions, et non la bande passante mémoire, qui est la limite. La version MLX pour Apple Silicon est un troisième artefact avec sa propre comptabilité — un conteneur affine 2 bits qui stocke un biais dont les poids ternaires n’ont pas besoin, pour aboutir à 2,25 bits par poids et 8,005 Gio sur disque, avec des noyaux Metal et CPU mais pas de chemin CUDA. « Il tourne en 5,9 Go » n’est vrai que pour exactement un de ces fichiers, sur exactement le bon environnement d’exécution.
La comparaison des coûts, présentée honnêtement
Il existe deux façons de payer pour Qwen3.8-27B et une seule façon de payer pour son homologue compressé. Ternary Bonsai 2 27B est un téléchargement : Apache 2.0, votre matériel, aucun compteur. Qwen3.8-27B est à la fois un téléchargement et un service hébergé, et si vous choisissez la voie de l'hébergement, le chiffre pertinent est celui de la page du modèle — 0,33 $ par million de jetons d'entrée et 2,40 $ par million de jetons de sortie, servi depuis l'infrastructure propre d'OrcaRouter plutôt que revendu depuis celle d'un tiers.
C'est là qu'OrcaRouter gagne sa place dans cette comparaison plutôt qu'une note de bas de page. La version routée de Qwen3.8-27B embarque le même contexte de 262K, accepte le texte, les images et la vidéo, et expose le contrôle d'effort de raisonnement fourni avec le modèle. Il se trouve derrière la même clé que plus de 200 autres modèles, sans marge ajoutée au prix catalogue du fournisseur, ce qui compte plus qu'on ne le pense : parce que le prix catalogue est répercuté plutôt que revendu, un changement de prix d'un fournisseur apparaît ici le jour même plutôt qu'à la prochaine renégociation de contrat. Pour une équipe qui veut la base en pleine précision comme niveau d'escalade au-dessus d'un Bonsai local, cela représente un seul point de terminaison et une seule clé plutôt que deux relations fournisseurs.

Lequel choisir
La décision porte surtout sur l’endroit où le travail est effectué, et non sur le modèle qui est meilleur, car pour la plupart des tâches, il s’agit du même modèle.
• Choisissez Qwen3.8-27B en précision complète lorsque la tâche est à long horizon et de nature agentique, lorsque vous évaluez ou affinez, lorsque vous avez besoin du contexte YaRN de 1 M de tokens, ou lorsque la précision de vision est déterminante. Les chiffres de Terminal-Bench et de SWE-bench en sont la raison.
• Choisissez Ternary Bonsai 2 27B lorsque le travail doit s’exécuter sur du matériel que vous possédez, lorsque l’alternative est de ne pas exécuter du tout un modèle 27B, ou lorsque la charge de travail relève des mathématiques, du codage, de l’extraction ou du raisonnement sans outils, où les catégories sont à égalité.
• Ne vous basez pas sur l’agrégat pour choisir. 83,9 et 85,4 sont suffisamment proches pour qu’un simple échange de benchmark puisse inverser leur ordre, et un seul des deux chiffres est vérifié de manière indépendante.
Ce qui est réellement nouveau ici, ce n'est pas qu'un modèle 27B tienne dans six gigaoctets — la première génération Bonsai l'a fait en juillet. C'est que le suivi d'instructions se soit révélé meilleur que celui du modèle parent et que les mathématiques et le code soient au même niveau, ce qui est une affirmation différente de « petit pour sa taille ». Savoir s'il tient face à votre charge de travail est exactement ce qu'un jour d'existence ne peut pas vous dire, et la première évaluation indépendante de ce modèle est le résultat qu'il vaut la peine d'attendre.

Si vous voulez effectuer la comparaison sur vos propres prompts plutôt que sur une suite de benchmarks, le chemin le plus rapide consiste à appeler le Qwen3.8-27B hébergé via un point de terminaison, à exécuter la version ternaire en local, puis à comparer les sorties sur les tâches que vous avez réellement. C'est l'affaire d'une matinée, et cela vous en apprendra plus sur les 1,8 point que n'importe quel tableau publié.
