Una card del titolo generata che recita 'Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF' con il sottotitolo 'Meno bit, punteggi migliori', sopra tre card che recitano 'Bit per peso: 1.76 vs 2.2', 'Dimensione: 5.93 GB vs 7.3 GB' e 'Media della suite del fornitore: 83.9 vs 75.2', con un piè di pagina che recita 'Dati Bonsai dichiarati dal fornitore; dati IQ2_XXS secondo il fornitore e i test della community.' Il logo OrcaRouter si trova in basso a destra.
Engineering & Research

Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: meno bit, punteggi migliori

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ternary Bonsai 2 27B è più piccolo della versione GGUF IQ2_XXS di Qwen3.8-27B e, stando ai numeri pubblicati con esso, anche migliore — il che non dovrebbe essere possibile se tutto ciò che li separasse fosse un budget di bit. La versione Bonsai contiene 1,76 bit per peso in un file da 5,93 GB. La quantizzazione convenzionale a 2 bit dello stesso modello di base contiene circa 2,2 bit per peso in un file di circa 7,3 GB. Prism ML, che ha annunciato la versione ternaria il 17 settembre 2026, riporta una media su 20 benchmark di 83,9 per il suo modello contro 75,2 per il punto di confronto IQ2_XXS — un divario di 8,7 punti a favore del modello che usa meno bit.

Quell'inversione è tutta la storia, e non è un trucco. I due file sono prodotti da processi diversi in fasi diverse della vita del modello, e la differenza tra quei processi vale più della differenza di ampiezza in bit. È anche il confronto in cui il consiglio popolare — "basta prendere un quant a 2 bit, ormai vanno bene" — si imbatte nel suo controesempio più chiaro, e in cui il controesempio ha dietro di sé una misurazione indipendente anziché la parola di un fornitore.

Il paradosso è il meccanismo

IQ2_XXS è un formato di quantizzazione post-addestramento. Il modello viene addestrato fino alla convergenza in piena precisione e poi, in seguito, i suoi pesi vengono arrotondati in una rappresentazione a basso numero di bit scelta da una procedura di fitting. Il modello non ha mai la possibilità di adattarsi; viene misurato a posteriori e approssimato. La famiglia i-quant migliora i vecchi k-quants usando una matrice di importanza — una passata di calibrazione che decide quali pesi meritano una quota maggiore della precisione disponibile — ma l'ordine fondamentale delle operazioni resta invariato. Addestra, poi comprimi.

Bonsai inverte quest'ordine. La descrizione che Prism ML dà del proprio metodo è che ha abbandonato del tutto la quantizzazione post-addestramento e ha imposto il vincolo ternario durante l'addestramento: il passaggio in avanti calcola con pesi limitati a {−1, 0, +1}, mentre il passaggio all'indietro continua a trasportare gradienti a piena precisione. Il modello trascorre il proprio addestramento ad apprendere rappresentazioni che sopravvivono al vincolo, invece di vedersi imporre il vincolo su rappresentazioni che non se l'aspettavano mai. L'algoritmo è descritto come proprietà intellettuale proprietaria, ma la sua struttura sarà familiare a chiunque abbia letto il filone di ricerca su BitNet.

Due perfezionamenti si aggiungono, ed entrambi sono visibili nell'aritmetica. Il primo è la precisione selettiva: 26,2 milioni di parametri — circa lo 0,098% del modello, all'incirca 52 MB in bf16, per lo più il percorso dello stato ricorrente degli strati di attenzione lineare più i pesi di normalizzazione — vengono mantenuti in piena precisione anziché ternarizzati. Il secondo è una rotazione a blocchi. Ogni matrice dei pesi viene trasformata da una rotazione di Walsh–Hadamard con dimensione del blocco pari a 1.024 prima che vengano scelti i valori ternari, il che distribuisce gli outlier tra le coordinate e rende meno distruttiva un'approssimazione a tre livelli. La rotazione è incorporata nei pesi memorizzati, quindi non costa byte aggiuntivi; la trasformazione corrispondente viene invece applicata alle attivazioni in fase di esecuzione.

Quell'ultimo dettaglio ha una conseguenza che incontri al primo tentativo di eseguire la cosa, ed è il vero costo dell'approccio.

Quale IQ2_XXS intendi, e che punteggio ottiene effettivamente

Prima di confrontare la qualità, una precisazione che gran parte della copertura mediatica trascura: «IQ2_XXS» non è un singolo artefatto. È un tipo di quantizzazione di llama.cpp, e lo stesso tipo applicato da toolchain diverse allo stesso modello di base produce file che differiscono in modo rilevante per dimensione e in modo sostanziale per qualità.

L'evidenza pubblica più chiara è un confronto indipendente pubblicato il 15 agosto 2026 da un utente che indagava se valesse la pena costruire un Qwen3.8-27B sub-2-bit. Il test è una misurazione della divergenza KL su wikitext-2, 100 chunk con contesto 512, rispetto a un riferimento Q8_0 creato localmente con una perplessità di 6,7500, con ogni candidato che utilizza la stessa matrice di importanza, lo stesso corpus, la stessa baseline e la stessa build di llama.cpp in un'unica sessione. I risultati:

• unsloth UD-IQ2_XXS — 8,39 GiB, perplessità 7,6528, KLD media 0,146, KLD mediana 0,076, accordo top-1 82,98%

• bartowski IQ2_XXS — 8,75 GiB, perplessità 8,5352, KLD media 0,301, KLD mediana 0,162, accordo top-1 76,53%

La variante dinamica è 0,36 GiB più piccola di quella statica e circa 2,1 volte migliore sulla KLD media — a 1,13 volte la perplessità di riferimento. Due file che portano la stessa etichetta, separati da un fattore due sulla metrica che misura quanto si è discostata la distribuzione dell'output. Lo stesso test ha rilevato che ogni candidato sotto i 2 bit era peggiore di entrambe le opzioni IQ2 pubblicate, motivo per cui il limite pratico per questo modello base si colloca a IQ2 anziché al di sotto.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

Questo è importante per il confronto perché cambia a cosa si riferisce «la build IQ2_XXS da 7,3 GB». Il dato di Prism ML proviene dalla sua quantizzazione del modello base a 2,2 bit per peso. Una build dinamica unsloth della stessa famiglia misura 8,39 GiB. Una build bartowski misura 8,75 GiB. Il divario dimensionale tra Bonsai e «IQ2_XXS» è quindi compreso tra 1,4x e 1,5x a seconda della build a cui ci si riferisce — più ampio dell'1,23x che il titolo implica, e tutto prima ancora che inizi il confronto sulla qualità.

Dove si rompe la build post-training, e perché è facile non accorgersene

Il divario aggregato di 8,7 punti è il modo meno informativo di esprimere la differenza, perché il degrado nella build IQ2_XXS non è uniforme. È selettivo, e il pattern è l'opposto di ciò che la maggior parte delle persone prevedrebbe.

• MMLU-Redux — la build post-training tiene bene, nella fascia medio-alta degli 80

• GPQA Diamond — circa 65,5, contro 85,76 per la build ternaria

• AIME26 — nell'intervallo da 57,5 a 78,6 a seconda della build, contro 95,83 per la build ternaria

• LiveCodeBench — nell'intervallo da 56.4 a 70.05, contro 90.07 per la build ternaria

I valori esatti di IQ2 variano tra le suite di Prism ML e le misurazioni della comunità, e gli intervalli sopra riportati coprono entrambi, ma la forma è coerente in ogni fonte: la conoscenza superficiale sopravvive, e qualsiasi cosa richieda una catena di ragionamento sostenuta degrada bruscamente. È esattamente la modalità di fallimento che un test occasionale non riesce a trovare. Chiedi a una build a 2 bit di riassumere un documento o rispondere a una domanda fattuale e si comporta come un modello molto più grande. Chiedile di sostenere una derivazione a più passaggi o produrre codice non banale e il collasso è improvviso anziché graduale. È per questo che "sembrava andare bene quando l'ho provato" non è una prova su un modello quantizzato — è una prova sui prompt che ti è capitato di provare.

La build ternaria non mostra quel collasso sugli stessi benchmark. Prism ML riporta AIME26 a 95,83 contro 94,58 per la sua base a piena precisione, e LiveCodeBench a 90,07 contro 90,05 — praticamente allo stesso livello, e la singola affermazione più utile del rilascio, perché dice che il vincolo in fase di addestramento ha ottenuto ciò che quello in fase di post-addestramento perde.

La controargomentazione, che è reale e che la tabella di qualità non coglie

Tutto quanto sopra favorisce la build ternaria in termini di qualità per byte. C'è una dimensione in cui il GGUF convenzionale vince nettamente, e non è una dimensione da poco: gira sul software che hai già.

La build IQ2_XXS di Qwen3.8-27B è un artefatto llama.cpp standard. Si carica in llama.cpp, Ollama, LM Studio, Jan e in qualsiasi altra cosa che faccia il link a ggml, su ogni piattaforma supportata da ggml, senza bisogno di fork e senza kernel speciali. La sua importance matrix può essere ricostruita o sostituita. Si comporta come ogni altro modello quantizzato che hai sul disco.

Ternary Bonsai 2 27B no. I kernel ternari per l'attenzione ibrida di questa architettura risiedono nel fork di llama.cpp di Prism ML. Il llama.cpp standard rifiuta PTQ1_0 e PQ2_0 come tipi non riconosciuti — e non ha idea di cosa fare con la base ruotata che quei pacchetti presuppongono. La build MLX per Apple Silicon ha kernel Metal e CPU ma nessun percorso CUDA, quindi su una macchina NVIDIA ripiega su un forward pass su CPU che può richiedere minuti. Prism ML elenca effettivamente l'integrazione con diversi runtime, ma il punto di fondo resta: l'usabilità di questo modello è limitata dal fatto che il runtime che scegli sia stato o meno istruito al riguardo.

Questo è il vero compromesso. Stai scegliendo tra una build che è 1,4 volte più grande, misurabilmente peggiore proprio nei compiti per cui con ogni probabilità vuoi un modello da 27B, e universalmente eseguibile — e una build più piccola e migliore, su un ecosistema che al momento si riduce al fork di un solo laboratorio più i runtime che l'hanno adottato.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

Cosa serve per eseguire l'uno o l'altro

I conti della memoria sono più tirati di quanto le dimensioni dei file facciano pensare, perché i file non sono l'unica cosa nella VRAM.

• Build IQ2_XXS — da 8,39 a 8,75 GiB di pesi, lasciando circa 7,5 GB liberi su una scheda da 16 GB per contesto e modelli draft. Il test indipendente sopra rileva specificamente che una build da 8,39 GiB può già ospitare anche un modello draft da 2,1 GB.

• Ternary Bonsai 2 27B — 5,93 GB per il modello linguistico PTQ1_0, più la torre di visione da 0,63 GB se usi immagini, anche solo in minima parte, più il contesto. Il packing PQ2_0 di Prism ML costa 7,25 GB ed è l'opzione più veloce su hardware limitato dal throughput delle istruzioni anziché dalla larghezza di banda.

Sulla velocità, i valori ternari riportati sono 142,5 tok/s in decodifica su una RTX 5090 e 46,8 tok/s su un Apple M5 Max; le segnalazioni di terze parti sulla build IQ2 sono più scarse, con una misurazione Vulkan su due schede Radeon di circa 3,8 tok/s in generazione, anche se quel numero dice più di quel particolare backend che della quantizzazione. Considera i valori di throughput su entrambi i fronti come fortemente dipendenti dall'hardware.

Dove OrcaRouter è adatto, e dove non lo è

Nessuno di questi due file è qualcosa che un router serve. Sono artefatti locali, e la formulazione onesta è che OrcaRouter non ospita né l'uno né l'altro — questo è un confronto su ciò che gira sul tuo hardware. Ciò che invece sta dalla nostra parte è il modello da cui entrambi derivano. Qwen3.8-27B a piena precisione è disponibile tramite l'infrastruttura di OrcaRouter a 0,33 $ per milione di token in input e 2,40 $ per milione di token in output, con il contesto nativo da 262K del modello e il suo controllo dello sforzo di ragionamento basso/medio/alto intatti.

Ne risulta una configurazione ibrida sulla quale vale la pena essere concreti. Esegui la build compressa in locale per i compiti in cui è valida, e instrada la richiesta occasionale che necessita di piena precisione verso il modello base ospitato tramite la stessa chiave — nessun secondo contratto con un fornitore, nessuna modifica al codice, perché entrambe le parti parlano la stessa API. Se la build locale si rivela inadatta per un carico di lavoro, la richiesta che fallisce può essere trasferita automaticamente in caso di errore anziché restituita come errore, il che è un modo più economico per scoprire che una quantizzazione non è adatta rispetto a scoprirlo in produzione.

La versione breve

• In termini di qualità pubblicata per byte, la build ternaria vince chiaramente, e il vantaggio è concentrato su ragionamento e codice — le categorie in cui la build post-training degrada maggiormente.

• Quanto alla portabilità, la build IQ2_XXS vince altrettanto chiaramente. Runtime standard ovunque, nessun fork, nessun kernel speciale, nessuna modalità di errore silenziosa con dati spazzatura.

• Il confronto non è «1,76 bit contro 2,2 bit». È «una rappresentazione scelta durante l'addestramento rispetto a una adattata successivamente», e la differenza di 0,44 bit è un errore di arrotondamento in confronto a ciò.

• Ogni valore di qualità per la build ternaria in questo articolo è una misurazione di Prism ML su una suite scelta da Prism ML. I risultati KLD per le build IQ2 sono indipendenti, a esecuzione singola e specifici per un unico modello di base e un unico set di test; sono l'evidenza di terze parti più solida in questo confronto e non dicono nulla su Bonsai.

Il divario si colmerà anche dall'altra direzione, e probabilmente presto. Se i kernel ternari arriveranno upstream in llama.cpp, l'unica obiezione seria a Bonsai svanisce e la scelta diventa semplice. Fino ad allora la build IQ2_XXS conserva un vantaggio reale che non ha nulla a che vedere con quanto sia buona.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

Se stai decidendo questa settimana, il test che risolve la questione richiede un pomeriggio: prendi venti prompt dal tuo carico di lavoro che richiedono più di un passaggio di ragionamento, esegui entrambe le build e valuta le risposte in cieco. Le tabelle pubblicate ti dicono dove guardare. Non possono dirti se il tuo lavoro si trova lì.