
Ternary Bonsai 2 27B vs Qwen3.8-27B: cosa si ottiene davvero con 47,9 gigabyte di precisione
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B e Qwen3.8-27B sono lo stesso modello in due mondi numerici. Condividono un'architettura, un tokenizer, una discendenza di addestramento e una finestra di contesto di 262.144 token. Ciò che li separa è il modo in cui i pesi vengono scritti: Qwen3.8-27B memorizza ciascuno come un float a 16 bit e occupa 53,81 GB nella sua forma di riferimento FP16, mentre Ternary Bonsai 2 27B memorizza ciascuno come uno di tre simboli e occupa 5,93 GB. Prism ML ha annunciato la build compressa il 17 settembre 2026 e l'ha pubblicata su Hugging Face con licenza Apache 2.0; i pesi originali di Qwen3.8-27B sono stati pubblicati il 13 agosto 2026, anch'essi con licenza Apache 2.0.
Il confronto che conta non è quale dei due sia migliore. È quanto ti costa il 47,9 GB mancante, e la risposta onesta è più ristretta e più specifica di quanto ti direbbe l'una o l'altra fazione. Prism ML riferisce che la sua build mantiene 98,2%della media del modello a piena precisione su una suite di 20 benchmark — 83,9 contro 85,4. Quel numero è del produttore stesso, misurato sul suo proprio banco di prova, e a un giorno dal rilascio nessuno al di fuori di Prism ML lo ha riprodotto. L'aggregato inoltre nasconde la parte che dovrebbe davvero interessarti, perché gli 1,8 punti non sono distribuiti in modo uniforme. Sui due benchmark che mettono sotto stress l'ingegneria del software continuativa, il divario non è dell'1,8% — è più vicino al 25%.
La stessa rete, scritta in modo diverso
Iniziamo da ciò che la compressione non tocca, perché è proprio il motivo per cui il confronto è interessante. Il numero di layer, la dimensione nascosta, il vocabolario, il pattern di attenzione e la torre visiva sono quelli del modello base. Qwen3.8-27B è un design ad attenzione ibrida: 48 layer di attenzione lineare Gated DeltaNet alternati a 16 layer di attenzione completa, una suddivisione all'incirca 3:1, su 64 layer con una dimensione nascosta di 5.120 e un vocabolario di 248.320 token. È proprio quella backbone prevalentemente lineare a rendere sostenibile in primo luogo un contesto da 262K, ed è la proprietà che Bonsai eredita invariata.
Ciò che Prism ML ha cambiato è la rappresentazione delle matrici del modello linguistico, più i kernel necessari per calcolare su di esse. Il suo whitepaper suddivide i 27,36B di parametri in 24,35B nel backbone linguistico su 64 blocchi, 2,54B nell'embedding e nella LM head, e 0,47B in una torre visiva di 27 blocchi. La torre visiva viene distribuita come file mmproj a 4 bit separato di circa 0,63 GB e viene caricata solo quando arriva effettivamente un'immagine, quindi un deployment solo testo non ne paga mai il costo.
Una conseguenza pratica di quel design in gran parte lineare vale la pena segnalarla prima di qualsiasi discussione sui benchmark. Poiché l'architettura non è un transformer convenzionale, i kernel a basso numero di bit hanno dovuto essere scritti appositamente per essa. Il llama.cpp standard rifiuta entrambi i packing di Prism ML come tipi sconosciuti — e, cosa più pericolosa, carica senza protestare un vecchio formato ternario e produce sciocchezze fluenti, perché non ha alcuna rotazione corrispondente applicata alle attivazioni. Se esegui questo modello su un binario che non lo conosce, non otterrai un errore. Otterrai un output sicuro di sé e sbagliato.
Il confronto, categoria per categoria
Ecco la ripartizione dei 20 benchmark del fornitore, con la base a piena precisione come riferimento. Ogni cifra in questo elenco è di Prism ML; nessuna di esse è verificata in modo indipendente.
• Matematica — 96,57 per Ternary Bonsai 2 27B vs 97,06 per Qwen3.8-27B. Praticamente allo stesso livello.
• Programmazione — 81.58 vs 82.17. Anche vicino, e la categoria su cui si sta discutendo l'intera tecnica.
• Aderenza alle istruzioni — 82,66 vs 81,25. Il modello compresso è in vantaggio qui, che è l'unica riga della tabella che è davvero sorprendente.
• Conoscenza e ragionamento — 83,95 vs 86,66. Un calo di 2,7 punti, e il singolo maggiore responsabile degli 1,8 punti mancanti.
• Agentico e chiamata di strumenti — 77,57 vs 79,74, coprendo τ2-Bench a 80,22 e BFCL v3 a 74,92.
• Visione — 78,59 vs 81,64, la perdita maggiore tra le categorie. Si noti che la torre di visione in sé non è la parte compressa; lo è il modello linguistico che ne legge gli output.

Leggi la forma anziché la media e appare una storia più chiara. La compressione è quasi gratuita su matematica, programmazione e capacità di seguire le istruzioni, ed è costosa su conoscenza e visione. Questo è l'opposto della saggezza popolare sui modelli a basso numero di bit, secondo cui la conoscenza superficiale sopravvive e il ragionamento crolla. Qui è la conoscenza che si erode e il ragionamento che tiene.
Dove si trovano davvero gli 1,8 punti
L'aggregato è una media su venti benchmark, e le medie sono il posto in cui i divari si nascondono. Estrai i singoli risultati e due di essi sono molto peggiori di quanto la media lasci intendere.
• Terminal-Bench 2.1 — 52,8 per la build ternaria contro 69,7 per la precisione completa
• SWE-bench Verified — 60,8 contro 80,6
Entrambi si collocano vicino ai tre quarti del punteggio di piena precisione. Di contro, AIME26 arriva a 95,83, LiveCodeBench a 90,07 e AA-LCR a 77,0 — entro un punto dal modello non compresso. È la prima volta in assoluto che la famiglia Bonsai viene valutata su Terminal-Bench, e Prism ML dichiara esplicitamente nei propri materiali che la capacità di ingegneria del software a lungo orizzonte promessa nella prima generazione è stata fornita solo in parte, non del tutto.
Quindi la domanda pratica non è "mantiene il 98,2%?" ma "qual è il mio carico di lavoro?". Se stai eseguendo un agente di codifica che mantiene un piano attraverso decine di chiamate a strumenti e modifica file nell'arco di minuti, rientri nella categoria con il divario del 25%, e il numero aggregato è attivamente fuorviante. Se stai facendo matematica, generazione di codice a turno singolo, estrazione, classificazione o chat, rientri nelle categorie in cui il divario si annulla. La cosa più utile della tabella del fornitore stesso è che ti permette di fare questa distinzione invece di tirare a indovinare.
Ciò di cui ciascuno ha effettivamente bisogno per funzionare
Il quadro hardware è meno simmetrico di quanto suggerisca il rapporto dimensionale. Un modello FP16 da 53,81 GB non entra affatto in un laptop da 16 GB, il che rende il confronto meno una questione di «più veloce contro più lento» e più di «possibile contro non possibile». Le misurazioni standardizzate di Prism ML con batch size 1, vision tower esclusa:
• NVIDIA RTX 5090 — 142,5 tok/s in decodifica sul packing PQ2_0, a 0,582 mWh per token
• Apple M5 Max — 46,8 tok/s in decodifica, con elaborazione del prompt intorno a 765 tok/s
• Apple M5 Pro — 27,7 tok/s in decodifica
• Apple M4 Pro — 18,0 tok/s in decodifica, con l'elaborazione del prompt vicina a 125 tok/s che diventa il vincolo determinante sui contesti molto lunghi
L'avvertenza importante è che nulla di tutto questo è un unico binario. Il packing PTQ1_0 ti dà 5,93 GB a 1,76 bit per peso; PQ2_0 costa 7,25 GB a 2,16 bit per peso e fa guadagnare velocità di decodifica su hardware in cui il limite è il throughput delle istruzioni, non la larghezza di banda della memoria. La build MLX per Apple Silicon è un terzo artefatto con un proprio computo — un contenitore affine a 2 bit che memorizza un bias di cui i pesi ternari non hanno bisogno, arrivando a 2,25 bit per peso e 8,005 GiB su disco, con kernel Metal e CPU ma nessun percorso CUDA. «Gira in 5,9 GB» è vero per esattamente uno di quei file su esattamente il runtime giusto.
Il confronto dei costi, presentato con onestà
Ci sono due modi per pagare Qwen3.8-27B e un solo modo per pagare il suo fratello compresso. Ternary Bonsai 2 27B è un download: Apache 2.0, il tuo hardware, nessun contatore. Qwen3.8-27B è sia un download sia un servizio ospitato, e se scegli la via del servizio ospitato la cifra rilevante è quella riportata sulla pagina del modello — 0,33 $ per milione di token in input e 2,40 $ per milione di token in output, erogato dall'infrastruttura di OrcaRouter stessa anziché rivenduto da quella di qualcun altro.
È qui che OrcaRouter si guadagna un posto in questo confronto invece di essere una nota a piè di pagina. La build con routing di Qwen3.8-27B porta lo stesso contesto da 262K, accetta testo, immagini e video, ed espone il controllo dello sforzo di ragionamento con cui il modello viene distribuito. Si trova dietro la stessa chiave di oltre 200 altri modelli, senza alcun ricarico sul prezzo di listino del fornitore, e questo conta più di quanto sembri: poiché il prezzo di listino viene trasferito così com'è anziché rivenduto, una variazione di prezzo del fornitore compare qui lo stesso giorno invece che al successivo rinnovo contrattuale. Per un team che vuole la base a piena precisione come livello di escalation sopra un Bonsai locale, si tratta di un solo endpoint e di una sola chiave invece di due rapporti con altrettanti fornitori.

Quale scegliere
La decisione riguarda principalmente dove viene svolto il lavoro, non quale modello sia migliore, perché nella maggior parte dei compiti sono lo stesso modello.
• Scegli Qwen3.8-27B a precisione completa quando il compito è a lungo orizzonte e agentico, quando stai valutando o facendo fine-tuning, quando ti serve il contesto YaRN da 1M token, o quando la precisione della visione è determinante. I numeri di Terminal-Bench e SWE-bench sono il motivo.
• Scegli Ternary Bonsai 2 27B quando il lavoro deve avvenire su hardware di tua proprietà, quando l'alternativa è non eseguire affatto un modello da 27B, oppure quando il carico di lavoro è matematica, programmazione, estrazione o ragionamento senza strumenti, dove le categorie sono alla pari.
• Non scegliere in base all'aggregato. 83,9 e 85,4 sono abbastanza vicini che un singolo scambio di benchmark potrebbe invertirne l'ordine, e solo uno dei due numeri è verificato in modo indipendente.
Ciò che qui è davvero nuovo non è che un modello da 27B stia in sei gigabyte — la prima generazione di Bonsai ci è riuscita a luglio. È che la capacità di seguire le istruzioni si è rivelata superiore a quella del modello genitore e che matematica e programmazione sono risultate allo stesso livello, il che è un'affermazione diversa da «piccolo per le sue dimensioni». Se regga sul tuo carico di lavoro è esattamente ciò che un solo giorno di vita non può dirti, e la prima valutazione indipendente di questo modello è il risultato che vale la pena attendere.

Se vuoi eseguire il confronto sui tuoi prompt anziché su una suite di benchmark, la via più rapida è chiamare Qwen3.8-27B ospitato tramite un unico endpoint ed eseguire localmente la build ternaria, poi confrontare gli output sulle attività che hai davvero. È il lavoro di una mattina e ti dirà di più sui punti 1,8 di qualsiasi tabella pubblicata.
