
Bonsai vs Ternary Bonsai 2 27B: Due scommesse low-bit, due metri di valutazione diversi
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Metti il modello visione-linguaggio 1-bit Bonsai 2B accanto a Ternary Bonsai 2 27B e il confronto ovvio — 2 miliardi di parametri contro 27 miliardi, 0,43 GB di pesi linguistici contro 5,93 GB — è la cosa meno interessante della coppia. La cosa interessante è che i due modelli, dello stesso fornitore e dello stesso programma di compressione, non dichiarano la propria qualità allo stesso modo. Ternary Bonsai 2 27B riporta la ritenzione: mantiene oltre il 98% delle prestazioni aggregate di benchmark della sua controparte a piena precisione, misurate rispetto a sé stesso. Il 1-bit Bonsai 2B riporta un confronto: ha ottenuto «risultati di benchmark comparativi» rispetto a un modello Qwen 3 1.7B a quantizzazione 4-bit, misurati rispetto al modello di qualcun altro a una precisione diversa. L'uno è un'affermazione su quanto è stato perso. L'altro è un'affermazione su come si posiziona. Nessuno dei due è un'affermazione su quanto sia valido l'uno o l'altro modello in termini assoluti, e i due non possono essere letti sulla stessa scala.
Quella distinzione conta più del numero di parametri, perché decide ciò che si può effettivamente concludere dai numeri del fornitore — e, sulla base delle prove pubblicate finora, la risposta onesta è meno di quanto suggeriscano le cifre di punta.
Due affermazioni di qualità, due metri di giudizio diversi
Ternary Bonsai 2 27B, rilasciato il 17 settembre 2026, è una ricostruzione ternaria {−1, 0, +1} di Qwen3.8-27B a 1,76 bit effettivi per peso, e il dato con cui PrismML parte è che conserva più del 98% delle prestazioni aggregate sui benchmark del modello a piena precisione. Questa è un'asserzione di conservazione, e le asserzioni di conservazione sono autoreferenziali per costruzione: ti dicono quanto dell'originale è sopravvissuto alla compressione, non a che livello si ponesse l'originale. Un modello che conserva il 98% di una baseline mediocre resta comunque un modello mediocre, e Qwen3.8-27B non è mediocre — ma il numero da solo non lo dice, e non può essere confrontato tra modelli di base.
Il modello visione-linguaggio Bonsai 2B a 1 bit, annunciato il 23 settembre 2026 per la piattaforma per occhiali Snapdragon AR1 Gen 1, è un modello linguistico a 1 bit da 1,7B più un encoder visivo a 4 bit da 0,3B. La sua dichiarazione di qualità pubblicata è di natura diversa: PrismML lo ha valutato rispetto a un modello Qwen 3 1.7B a quantizzazione a 4 bit su BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K e GPQA Diamond, e ha riportato che le due configurazioni hanno ottenuto risultati comparabili. Si tratta di un'affermazione di parità rispetto a una baseline esterna. Indica che la compressione non ti è costata in modo evidente rispetto al percorso a 4 bit che avresti altrimenti utilizzato — il che è esattamente la domanda giusta per un rilascio di classe dispositivo, e un'affermazione molto più debole di "questo modello è buono".
Quindi non esiste alcuna lettura in cui il 98,2% batta "comparativo" o viceversa. Sono risposte a due domande diverse, poste rispetto a due riferimenti diversi, su due suite diverse, dallo stesso fornitore. Chiunque metta in classifica questi due modelli sulla base di quelle due frasi sta mettendo in classifica le frasi.
I modelli di base provengono da luoghi diversi
C'è una seconda differenza strutturale, ed è quella che conterà nel corso del prossimo anno. Ternary Bonsai 2 27B è una ricompressione di un modello esterno — Qwen3.8-27B di Alibaba. Il suo tetto di qualità è determinato dal calendario di rilascio di qualcun altro, e la sua cadenza generazionale segue quella di Qwen piuttosto che quella di PrismML. Quando Qwen rilascia un nuovo 27B, la linea Bonsai 27B riceve un nuovo input, e il valore di retention viene ricalcolato rispetto a una nuova baseline.
Il Bonsai 2B a 1 bit è basato sul Bonsai 1.7B di PrismML. Il suo tetto è stabilito internamente, la sua cadenza di aggiornamento è scelta da PrismML, e i suoi miglioramenti derivano dalla ricetta di compressione e dal percorso kernel anziché dalla sostituzione di un modello upstream. Questo è un tipo diverso di asset: più lento a migliorare in capacità grezza, completamente sotto il controllo del fornitore e — come mostra il rilascio degli occhiali — in grado di essere ottimizzato per uno specifico acceleratore in un modo che una ricompressione generale non può.
Entrambe sono strategie legittime. Non sono intercambiabili, e quella che vuoi dipende dal fatto che la tua roadmap sia ancorata a quella di Qwen o al dispositivo.

Il contrasto delle specifiche, una riga alla volta
• Parametri — un LLM da 1,7B a 1 bit più un encoder visivo da 0,3B a 4 bit nel modello degli occhiali, rispetto a un modello di classe 27B derivato da Qwen3.8-27B in Ternary Bonsai 2 27B.
• Rappresentazione — binaria {−1, +1} con scaling group-wise FP16 nel modello degli occhiali, contro ternaria {−1, 0, +1} con lo stesso scaling a 1,76 bit effettivi per peso nel 27B.
• Pesi del modello linguistico — 0,43 GB per il 1,7B a 1 bit, contro 5,93 GB per il packing PTQ1_0 di Ternary Bonsai 2 27B, con anche disponibile un packing PQ2_0 da 7,25 GB.
Contesto — 1.024 token sul modello degli occhiali, rispetto a un contesto completo di 262.000 token su Ternary Bonsai 2 27B.
• Acceleratore — la NPU Qualcomm Hexagon tramite un QNN SDK con supporto ai kernel a 1 bit, contro Apple silicon tramite MLX e NVIDIA tramite CUDA.
• Dichiarazione sulla qualità — «risultati comparativi di benchmark» rispetto a un Qwen 3 1.7B a 4 bit, rispetto a una conservazione «superiore al 98%» della baseline Qwen3.8-27B a piena precisione. Entrambi dichiarati dal fornitore, nessuno dei due riprodotto in modo indipendente, misurati su suite diverse.
• Runtime — una toolchain NPU Qualcomm per il modello degli occhiali, contro il fork di llama.cpp di PrismML stesso e un container MLX per il 27B, nessuno dei due supportato da llama.cpp standard.

Che cosa si ottiene con la scommessa low-bit in ciascun caso
La filosofia di compressione è la stessa in entrambi i modelli e vale la pena nominarla, perché è la tesi effettiva della famiglia: la rappresentazione a bassi bit va end-to-end — embedding, attention, MLP e la testa LM — con scalatura group-wise in FP16 e nessuna scappatoia verso una precisione superiore. Nessuno dei due modelli mantiene una rete di sicurezza in virgola mobile per le parti difficili da quantizzare. È una posizione più aggressiva di quella adottata dalla maggior parte dei lavori di quantizzazione, ed è ciò che rende possibile 1,76 bit per peso e pesi da 0,43 GB.
Dove la scommessa dà i suoi frutti è diverso. In Ternary Bonsai 2 27B il ritorno è la capacità per byte sull'hardware che già possiedi: un modello di classe 27B in 5,93 GB, in esecuzione su un laptop o un telefono, al 98% della sua baseline. Nel 1-bit Bonsai 2B il ritorno è l'esistenza su una classe di dispositivi che non aveva alcuna opzione: un modello multimodale in 0,43 GB di pesi linguistici, su un NPU, a 15,36 token al secondo. Il primo è una versione migliore di qualcosa che già funzionava. Il secondo è qualcosa che prima non funzionava.
Dove si trova il confine del livello
Questi due non sono alternative, e trattarli come un confronto diretto manca la forma di distribuzione verso cui puntano entrambe le release. Un prodotto occhiali o wearable esegue il 2B localmente perché nient'altro è adatto. Un prodotto laptop o telefono esegue il 27B perché può. Nel momento in cui un prodotto copre entrambi — un'app per telefono abbinata a occhiali, un'app per laptop con un assistente on-device — la domanda smette di essere quale modello e diventa quali richieste ogni livello è autorizzato a soddisfare.
Quel confine merita di stare nella configurazione anziché nel codice dell'applicazione, perché entrambi i livelli si sposteranno. La linea dei 27B si sposta quando Qwen rilascia una nuova versione, quella dei 2B si sposta quando PrismML cambia la ricetta, e una regola codificata in modo fisso sulla lunghezza del contesto o sulle capacità si rompe a entrambi gli eventi. Una politica di routing che inoltra le richieste oltre il budget del livello locale verso un modello ospitato sopravvive a entrambi i cambiamenti; il livello locale resta uno tra diversi livelli invece di essere un'assunzione intrecciata in tutto il client. OrcaRouter è il livello che fa quell'escalation — un unico endpoint su oltre 200 modelli ospitati, failover incluso, con la politica espressa come configurazione. Nessuno dei due Bonsai viene instradato qui; entrambi sono download locali. Ciò che sta qui è il livello sopra di essi, e con un modello locale da 1.024 token quel livello fa la maggior parte del lavoro.

Cosa lo risolverebbe
Tre misurazioni trasformerebbero questa coppia da due affermazioni di marketing in un confronto. Una ripartizione per benchmark dietro la riga dei "risultati comparativi", così che il compromesso rispetto al 4-bit sia visibile invece di essere riassunto. Un dato di ritenzione per il Bonsai 2B a 1-bit rispetto alla sua stessa baseline a piena precisione — la misurazione che PrismML usa per la linea 27B e che non ha pubblicato qui. E una valutazione indipendente di uno dei due modelli, dato che ogni cifra in entrambi i comunicati proviene attualmente dal fornitore.
Finché non ne esiste uno, la posizione difendibile è quella che i numeri supportano davvero: Ternary Bonsai 2 27B è il modello migliore con un ampio margine e il modello 1-bit Bonsai 2B è l'unico dei due che gira sul dispositivo per cui è stato costruito. Queste due affermazioni non sono in contraddizione, e il fatto che lo stesso fornitore li abbia misurati con righelli diversi è la cosa da ricordare la prossima volta che una di queste cifre viene citata senza la sua baseline.
