Una scheda del titolo generata che recita 'Ternary Bonsai 2 27B vs Qwen3.8-27B' con il sottotitolo 'La stessa rete a due precisioni', sopra tre schede che recitano 'Dimensione del file: 5,93 GB vs 53,81 GB', 'Riduzione: 9,05x' e 'Contesto: 262K token, entrambi', con un piè di pagina che recita 'La ritenzione del 98,2% è dichiarata dal fornitore e non riprodotta.' Il logo OrcaRouter si trova in basso a destra.
Guides & Insights

Ternary Bonsai 2 27B vs Qwen3.8-27B: cosa si ottiene davvero con 47,9 gigabyte di precisione

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ternary Bonsai 2 27B e Qwen3.8-27B sono lo stesso modello in due mondi numerici. Condividono un'architettura, un tokenizer, una discendenza di addestramento e una finestra di contesto di 262.144 token. Ciò che li separa è il modo in cui i pesi vengono scritti: Qwen3.8-27B memorizza ciascuno come un float a 16 bit e occupa 53,81 GB nella sua forma di riferimento FP16, mentre Ternary Bonsai 2 27B memorizza ciascuno come uno di tre simboli e occupa 5,93 GB. Prism ML ha annunciato la build compressa il 17 settembre 2026 e l'ha pubblicata su Hugging Face con licenza Apache 2.0; i pesi originali di Qwen3.8-27B sono stati pubblicati il 13 agosto 2026, anch'essi con licenza Apache 2.0.

Il confronto che conta non è quale dei due sia migliore. È quanto ti costa il 47,9 GB mancante, e la risposta onesta è più ristretta e più specifica di quanto ti direbbe l'una o l'altra fazione. Prism ML riferisce che la sua build mantiene 98,2%della media del modello a piena precisione su una suite di 20 benchmark — 83,9 contro 85,4. Quel numero è del produttore stesso, misurato sul suo proprio banco di prova, e a un giorno dal rilascio nessuno al di fuori di Prism ML lo ha riprodotto. L'aggregato inoltre nasconde la parte che dovrebbe davvero interessarti, perché gli 1,8 punti non sono distribuiti in modo uniforme. Sui due benchmark che mettono sotto stress l'ingegneria del software continuativa, il divario non è dell'1,8% — è più vicino al 25%.

La stessa rete, scritta in modo diverso

Iniziamo da ciò che la compressione non tocca, perché è proprio il motivo per cui il confronto è interessante. Il numero di layer, la dimensione nascosta, il vocabolario, il pattern di attenzione e la torre visiva sono quelli del modello base. Qwen3.8-27B è un design ad attenzione ibrida: 48 layer di attenzione lineare Gated DeltaNet alternati a 16 layer di attenzione completa, una suddivisione all'incirca 3:1, su 64 layer con una dimensione nascosta di 5.120 e un vocabolario di 248.320 token. È proprio quella backbone prevalentemente lineare a rendere sostenibile in primo luogo un contesto da 262K, ed è la proprietà che Bonsai eredita invariata.

Ciò che Prism ML ha cambiato è la rappresentazione delle matrici del modello linguistico, più i kernel necessari per calcolare su di esse. Il suo whitepaper suddivide i 27,36B di parametri in 24,35B nel backbone linguistico su 64 blocchi, 2,54B nell'embedding e nella LM head, e 0,47B in una torre visiva di 27 blocchi. La torre visiva viene distribuita come file mmproj a 4 bit separato di circa 0,63 GB e viene caricata solo quando arriva effettivamente un'immagine, quindi un deployment solo testo non ne paga mai il costo.

Una conseguenza pratica di quel design in gran parte lineare vale la pena segnalarla prima di qualsiasi discussione sui benchmark. Poiché l'architettura non è un transformer convenzionale, i kernel a basso numero di bit hanno dovuto essere scritti appositamente per essa. Il llama.cpp standard rifiuta entrambi i packing di Prism ML come tipi sconosciuti — e, cosa più pericolosa, carica senza protestare un vecchio formato ternario e produce sciocchezze fluenti, perché non ha alcuna rotazione corrispondente applicata alle attivazioni. Se esegui questo modello su un binario che non lo conosce, non otterrai un errore. Otterrai un output sicuro di sé e sbagliato.

Il confronto, categoria per categoria

Ecco la ripartizione dei 20 benchmark del fornitore, con la base a piena precisione come riferimento. Ogni cifra in questo elenco è di Prism ML; nessuna di esse è verificata in modo indipendente.

• Matematica — 96,57 per Ternary Bonsai 2 27B vs 97,06 per Qwen3.8-27B. Praticamente allo stesso livello.

• Programmazione — 81.58 vs 82.17. Anche vicino, e la categoria su cui si sta discutendo l'intera tecnica.

• Aderenza alle istruzioni — 82,66 vs 81,25. Il modello compresso è in vantaggio qui, che è l'unica riga della tabella che è davvero sorprendente.

• Conoscenza e ragionamento — 83,95 vs 86,66. Un calo di 2,7 punti, e il singolo maggiore responsabile degli 1,8 punti mancanti.

• Agentico e chiamata di strumenti — 77,57 vs 79,74, coprendo τ2-Bench a 80,22 e BFCL v3 a 74,92.

• Visione — 78,59 vs 81,64, la perdita maggiore tra le categorie. Si noti che la torre di visione in sé non è la parte compressa; lo è il modello linguistico che ne legge gli output.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

Leggi la forma anziché la media e appare una storia più chiara. La compressione è quasi gratuita su matematica, programmazione e capacità di seguire le istruzioni, ed è costosa su conoscenza e visione. Questo è l'opposto della saggezza popolare sui modelli a basso numero di bit, secondo cui la conoscenza superficiale sopravvive e il ragionamento crolla. Qui è la conoscenza che si erode e il ragionamento che tiene.

Dove si trovano davvero gli 1,8 punti

L'aggregato è una media su venti benchmark, e le medie sono il posto in cui i divari si nascondono. Estrai i singoli risultati e due di essi sono molto peggiori di quanto la media lasci intendere.

• Terminal-Bench 2.1 — 52,8 per la build ternaria contro 69,7 per la precisione completa

• SWE-bench Verified — 60,8 contro 80,6

Entrambi si collocano vicino ai tre quarti del punteggio di piena precisione. Di contro, AIME26 arriva a 95,83, LiveCodeBench a 90,07 e AA-LCR a 77,0 — entro un punto dal modello non compresso. È la prima volta in assoluto che la famiglia Bonsai viene valutata su Terminal-Bench, e Prism ML dichiara esplicitamente nei propri materiali che la capacità di ingegneria del software a lungo orizzonte promessa nella prima generazione è stata fornita solo in parte, non del tutto.

Quindi la domanda pratica non è "mantiene il 98,2%?" ma "qual è il mio carico di lavoro?". Se stai eseguendo un agente di codifica che mantiene un piano attraverso decine di chiamate a strumenti e modifica file nell'arco di minuti, rientri nella categoria con il divario del 25%, e il numero aggregato è attivamente fuorviante. Se stai facendo matematica, generazione di codice a turno singolo, estrazione, classificazione o chat, rientri nelle categorie in cui il divario si annulla. La cosa più utile della tabella del fornitore stesso è che ti permette di fare questa distinzione invece di tirare a indovinare.

Ciò di cui ciascuno ha effettivamente bisogno per funzionare

Il quadro hardware è meno simmetrico di quanto suggerisca il rapporto dimensionale. Un modello FP16 da 53,81 GB non entra affatto in un laptop da 16 GB, il che rende il confronto meno una questione di «più veloce contro più lento» e più di «possibile contro non possibile». Le misurazioni standardizzate di Prism ML con batch size 1, vision tower esclusa:

• NVIDIA RTX 5090 — 142,5 tok/s in decodifica sul packing PQ2_0, a 0,582 mWh per token

• Apple M5 Max — 46,8 tok/s in decodifica, con elaborazione del prompt intorno a 765 tok/s

• Apple M5 Pro — 27,7 tok/s in decodifica

• Apple M4 Pro — 18,0 tok/s in decodifica, con l'elaborazione del prompt vicina a 125 tok/s che diventa il vincolo determinante sui contesti molto lunghi

L'avvertenza importante è che nulla di tutto questo è un unico binario. Il packing PTQ1_0 ti dà 5,93 GB a 1,76 bit per peso; PQ2_0 costa 7,25 GB a 2,16 bit per peso e fa guadagnare velocità di decodifica su hardware in cui il limite è il throughput delle istruzioni, non la larghezza di banda della memoria. La build MLX per Apple Silicon è un terzo artefatto con un proprio computo — un contenitore affine a 2 bit che memorizza un bias di cui i pesi ternari non hanno bisogno, arrivando a 2,25 bit per peso e 8,005 GiB su disco, con kernel Metal e CPU ma nessun percorso CUDA. «Gira in 5,9 GB» è vero per esattamente uno di quei file su esattamente il runtime giusto.

Il confronto dei costi, presentato con onestà

Ci sono due modi per pagare Qwen3.8-27B e un solo modo per pagare il suo fratello compresso. Ternary Bonsai 2 27B è un download: Apache 2.0, il tuo hardware, nessun contatore. Qwen3.8-27B è sia un download sia un servizio ospitato, e se scegli la via del servizio ospitato la cifra rilevante è quella riportata sulla pagina del modello — 0,33 $ per milione di token in input e 2,40 $ per milione di token in output, erogato dall'infrastruttura di OrcaRouter stessa anziché rivenduto da quella di qualcun altro.

È qui che OrcaRouter si guadagna un posto in questo confronto invece di essere una nota a piè di pagina. La build con routing di Qwen3.8-27B porta lo stesso contesto da 262K, accetta testo, immagini e video, ed espone il controllo dello sforzo di ragionamento con cui il modello viene distribuito. Si trova dietro la stessa chiave di oltre 200 altri modelli, senza alcun ricarico sul prezzo di listino del fornitore, e questo conta più di quanto sembri: poiché il prezzo di listino viene trasferito così com'è anziché rivenduto, una variazione di prezzo del fornitore compare qui lo stesso giorno invece che al successivo rinnovo contrattuale. Per un team che vuole la base a piena precisione come livello di escalation sopra un Bonsai locale, si tratta di un solo endpoint e di una sola chiave invece di due rapporti con altrettanti fornitori.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

Quale scegliere

La decisione riguarda principalmente dove viene svolto il lavoro, non quale modello sia migliore, perché nella maggior parte dei compiti sono lo stesso modello.

• Scegli Qwen3.8-27B a precisione completa quando il compito è a lungo orizzonte e agentico, quando stai valutando o facendo fine-tuning, quando ti serve il contesto YaRN da 1M token, o quando la precisione della visione è determinante. I numeri di Terminal-Bench e SWE-bench sono il motivo.

• Scegli Ternary Bonsai 2 27B quando il lavoro deve avvenire su hardware di tua proprietà, quando l'alternativa è non eseguire affatto un modello da 27B, oppure quando il carico di lavoro è matematica, programmazione, estrazione o ragionamento senza strumenti, dove le categorie sono alla pari.

• Non scegliere in base all'aggregato. 83,9 e 85,4 sono abbastanza vicini che un singolo scambio di benchmark potrebbe invertirne l'ordine, e solo uno dei due numeri è verificato in modo indipendente.

Ciò che qui è davvero nuovo non è che un modello da 27B stia in sei gigabyte — la prima generazione di Bonsai ci è riuscita a luglio. È che la capacità di seguire le istruzioni si è rivelata superiore a quella del modello genitore e che matematica e programmazione sono risultate allo stesso livello, il che è un'affermazione diversa da «piccolo per le sue dimensioni». Se regga sul tuo carico di lavoro è esattamente ciò che un solo giorno di vita non può dirti, e la prima valutazione indipendente di questo modello è il risultato che vale la pena attendere.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

Se vuoi eseguire il confronto sui tuoi prompt anziché su una suite di benchmark, la via più rapida è chiamare Qwen3.8-27B ospitato tramite un unico endpoint ed eseguire localmente la build ternaria, poi confrontare gli output sulle attività che hai davvero. È il lavoro di una mattina e ti dirà di più sui punti 1,8 di qualsiasi tabella pubblicata.