
Kolibri vs Granite 4.2 3B: una scommessa sulla sparsità da 78B, e il modello 3B che si rifiuta di giocare la stessa partita
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Kolibri e Granite 4.2 3B uno accanto all'altro e la prima osservazione onesta è che non è una sfida alla pari, e non nella direzione che si potrebbe supporre. Kolibri è il modello mixture-of-experts da 78,1 miliardi di parametri di Aleph Alpha, rilasciato il 3 ottobre 2026, che attiva 3,46 miliardi di parametri per token. Granite 4.2 3B è il modello di ragionamento dense da circa tre miliardi di parametri di IBM, i cui pesi sono arrivati su Hugging Face il 7 agosto 2026, con la model card e il blog tecnico pubblicati il 25 agosto. Uno ha ventisei volte i parametri totali dell'altro. La ragione per cui appartengono alla stessa decisione è che entrambi sono Apache 2.0, entrambi solo testo, entrambi pensati per il self-hosting, ed entrambi erano rivolti allo stesso acquirente: un team che vuole intelligence documentale su hardware che controlla, con la provenienza necessaria a superare una revisione di procurement. La domanda interessante non è quale dei due sia migliore. È che cosa compri effettivamente con un budget di parametri ventisei volte superiore, e quanto costa portarselo dietro.
La discrepanza, detta chiaramente
Granite 4.2 3B è un modello denso standalone post-addestrato a partire da Granite-4.1-3B-Base, parte della famiglia Granite 4.2 che IBM ha rilasciato fino ad agosto. Ha 40 livelli con grouped-query attention, un contesto nativo di 128K che IBM estende a 512K in una quinta fase di pre-addestramento, e tre modalità di pensiero per query: pensiero completo per impostazione predefinita, un percorso a basso sforzo e un percorso senza pensiero. La scheda di IBM è insolitamente schietta su ciò che il 3B non è. A differenza dei suoi fratelli 8B e 30B, ha deliberatamente saltato il blocco specializzato di apprendimento per rinforzo agentico addestrato in ambienti SWE-agent, terminale e di ricerca, motivo per cui IBM non riporta alcun valore SWE-bench per esso e descrive il modello come uno specialista del ragionamento anziché un agente.
Kolibri va nella direzione opposta su ogni asse. Cinquanta livelli, ognuno dei quali mixture-of-experts, 384 esperti per livello con uno condiviso e sei instradati, e un rapporto di sparsità di circa 22,6 a 1. Il suo contesto è nativamente di 262.144 token, validato fino a 1.048.576, con la scheda che consiglia di rimanere a 262.144 o meno per i carichi di lavoro sensibili alla latenza. Quattro livelli di sforzo di ragionamento. Invocazione di strumenti in stile Hermes con un parser vLLM fornito nello stesso repository dei pesi. E un ingombro di circa 78 GB in FP8, con la configurazione minima della scheda pari a due schede A100 80 GB, due H100 SXM5, una H200, una B200 o una B300.
Parametri — Kolibri: 78.103.074.560 in totale, 3.457.573.120 attivi per token. Granite 4.2 3B: circa 3B densi, tutti i parametri attivi su ogni token.
• Contesto — Kolibri: 16.384 addestrato, 65.536 con addestramento intermedio, 262.144 nativo, 1.048.576 convalidato. Granite 4.2 3B: 128K nativo, esteso a 512K.
• Modalità di pensiero — Kolibri: nessuna, bassa, media, alta, impostate tramite il template della chat. Granite 4.2 3B: completa, a basso sforzo e non-thinking, per query.
• Chiamata di strumenti — Kolibri: in stile Hermes, con un parser incluso. Granite 4.2 3B: sì, ma non il percorso addestrato con RL agentico che hanno ricevuto i suoi fratelli maggiori.
• Lingue — Kolibri: tedesco e inglese, per scelta progettuale e nient'altro. Granite 4.2 3B: inglese come priorità, con alle spalle la più ampia formazione multilingue di IBM.
• Ingombro — Kolibri: circa 78 GB in FP8, minimo due GPU. Granite 4.2 3: all'incirca 6–8 GB in bfloat16, meno di 2 GB quantizzato, di classe laptop.
• Licenza — entrambe Apache 2.0, entrambe senza clausola aggiuntiva sull'uso accettabile né soglia di utenti attivi mensili.
• Servizio — Kolibri: il plugin vLLM aleph-alpha-inference o l'immagine container pubblicata. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF e Ollama sotto granite4.2:3b.

Cosa offrono i 75 miliardi di parametri in più
Tre cose, e vale la pena essere precisi su quali di esse siano stabilite e quali soltanto affermate.
Il primo è tedesco. Questa è la differenza reale più netta tra i due modelli e non è una riga di benchmark. Aleph Alpha ha costruito Kolibri attorno a un corpus bilingue tedesco-inglese, puntando a circa il 20 per cento di tedesco in una sessione di pre-addestramento da 20 trilioni di token, e si è ritrovata con un bacino tedesco da 2,4 trilioni di token, di cui l'80 per cento è stato curato o generato dal laboratorio stesso. La scheda spiega perché ciò abbia richiesto lavoro: i dataset tedeschi aperti deduplicati fornivano solo 390 miliardi di token, un ordine di grandezza in meno, così il laboratorio ha ritarato un filtro di Common Crawl specificamente per il tedesco e ha riformulato documenti tedeschi esistenti in voci enciclopediche, dialoghi e passaggi. Il dettaglio del filtro è quello da ricordare. Una pipeline standard di dati linguistici scarta i documenti con troppe parole lunghe, e la prosa amministrativa tedesca supera regolarmente il limite inglese sulla lunghezza media delle parole — quindi le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione. IBM non ha costruito Granite per quel corpus. Granite 4.2 3B gestirà il tedesco; non è stato progettato attorno al registro giuridico e amministrativo tedesco, e nessuna classifica ti dirà la differenza.
Il secondo è il contesto lungo che sopravvive a documenti reali. Il tetto di 512K di Granite è davvero grande, ma i due modelli ci sono arrivati in modo diverso e il design posizionale di Kolibri è l'argomento di contesto lungo più convenzionale. Considera i dati RULER di IBM — 67,52 a 64K e 55,30 a 128K nel materiale pubblicato della famiglia 4.2 — come la divulgazione onesta di quanto la qualità di recupero si degradi a 128K, e ricorda che Kolibri non ha alcuna curva di degradazione pubblicata equivalente.
Il terzo è il margine di ragionamento grezzo, ed è qui che la risposta onesta è «non quanto suggerisce il rapporto tra i parametri». La pipeline di addestramento di Kolibri le ha garantito un pre-addestramento da 20.000 miliardi di token su 768 NVIDIA B200 nell'arco di 21 giorni, e la tabella comparativa di Aleph Alpha stessa, con Kolibri a reasoning effort high, la pone a 75,5 sulla media inglese e a 70,8 sulla media tedesca di un confronto tra quattordici modelli — dove perde contro un modello denso da 27 miliardi di parametri di Alibaba sulla maggior parte delle righe. I numeri di punta dichiarati per Granite 4.2 3B sono i suoi: AIME 2025 a 78,33, GPQA a 54,80, LiveCodeBench v6 a 69,71 e MMLU-Pro a 67,84, tutti riportati da IBM e non replicati. Suite diverse, harness diversi, fornitori diversi. Non esiste da nessuna parte un numero a parità di harness per questo abbinamento, e non abbiamo intenzione di inventarne uno.
Dove ciascuno vince davvero
Esegui Granite 4.2 3B se il tuo vincolo è la macchina. Con 6–8 GB in bfloat16, o meno di 2 GB quantizzato, entra in un laptop, in una singola GPU da workstation o in un box edge air-gapped che non vedrà mai due H100. Serve tramite cinque runtime diversi, tra cui Ollama e GGUF, il che conta quando la destinazione del deployment è il laptop di qualcun altro anziché il tuo rack. E la sua scheda è insolitamente affidabile proprio perché IBM ha messo per iscritto ciò che ha lasciato fuori. Un fornitore che rinuncia a rivendicare risultati SWE-bench per un 3B ti sta dicendo dove si ferma il modello.
Esegui Kolibri se il corpus è il punto e l'hardware esiste. Un team con contratti, documentazione tecnica o pratiche amministrative in lingua tedesca, un nodo a due GPU già esistente e il requisito che i pesi non lascino mai l'edificio è esattamente il destinatario per cui è stata progettata questa release. La finestra nativa da 262.144 token, la KV cache FP8, i quattro livelli di effort e il percorso di tool-calling di Hermes puntano tutti a flussi di lavoro documentali più che alla chat. Il tokenizer bilingue fa parte dello stesso argomento: Aleph Alpha riporta 4,90 byte medi per token su testo web tedesco, contro 4,35 per GPT-5 e 3,28 per Kimi K3, tutti misurati dal fornitore sul corpus del fornitore, e più caratteri per token è un effetto diretto sul costo di inferenza, non un punteggio. Se regge, si moltiplica su ogni pagina che elabori.
L'asimmetria che nessuno pubblicizza sta nei dati. IBM ha pubblicato i pesi di Granite 4.2 3B e un resoconto tecnico dettagliato di come è stato costruito il modello, ma non i dati di addestramento. Aleph Alpha ha pubblicato la pipeline, la provenienza dei dati e il dato energetico insieme ai pesi di Kolibri — 20 trilioni di token di pre-addestramento, 9,5×10² MWh includendo l'overhead del data center ed escludendo il fine-tuning supervisionato e l'apprendimento per rinforzo. Per un team che deve rispondere a "da dove provengono i testi di questo modello", questa differenza non è cosmetica.

La realtà del routing per entrambi
Nessuno dei due modelli è presente oggi in un catalogo ospitato. Kolibri non ha alcuno SKU API di fornitore — il rilascio è costituito da pesi più un report tecnico — e Granite 4.2 3B viene distribuito come pesi per cinque stack di runtime, senza alcun endpoint ospitato da IBM. Entrambi sono proposte self-hosted, e la domanda pratica per la maggior parte dei team non è quale adottare, ma se il carico di lavoro giustifichi possederne uno.
Ecco dove un livello di routing si guadagna il suo posto, anche per i modelli che non ospita. Abbiamo sondato il catalogo OrcaRouter con ogni grafia di entrambi i nomi dei modelli e né Kolibri né Granite 4.2 3B sono presenti, quindi non faremo finta del contrario. Quello che OrcaRouter ti offre è il modo economico per scoprire se la decisione sull'hardware è giustificata prima di prenderla: indirizza un percorso di test verso un piccolo tier mixture-of-experts già instradato — la variante Gemma 4 26B-A4B a $0.06 per milione di token in input e $0.33 per milione in output, con una finestra di 262,144 token — e verifica se il tuo carico di lavoro su documenti in tedesco ha davvero bisogno di ciò che offre Kolibri, su una chiave compatibile con OpenAI, al prezzo di listino del provider senza nulla in più. Se è così, acquisti le GPU con le prove anziché con un'intuizione. Se non è così, hai appena risparmiato un ordine di hardware.
Il verdetto, e cosa lo cambierebbe
Questo non è un confronto con un vincitore. Kolibri e Granite 4.2 3B rispondono a domande diverse a punti di prezzo diversi, e l'unico ranking onesto è per vincolo: se il vincolo è l'hardware, Granite 4.2 3B è l'unico dei due che si qualifica. Se il vincolo è il lavoro documentale di registro normativo tedesco on premises, Granite 4.2 3B non è mai stato in corsa e Kolibri è l'artefatto più interessante — un legittimo rilascio open-weights da 78B, Apache 2.0, con la pipeline dati e il tokenizer pubblicati accanto ai pesi.
Due cose risolverebbero il confronto. Un'esecuzione indipendente di Kolibri su un task di document-QA in tedesco metterebbe alla prova l'affermazione che il rilascio è stato effettivamente creato per sostenere, dato che nessuna classifica attualmente la misura. E una riproduzione indipendente dei numeri di ragionamento di Granite 4.2 3B ti direbbe se una macchina di classe laptop può essere all'altezza sul sottoinsieme del tuo carico di lavoro che non ha mai avuto bisogno di 78 miliardi di parametri fin dall'inizio. Finché una di queste non si concretizza, compra in base ai vincoli, non al numero di parametri.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
