
Kolibri vs Gemma 4 12B: 78 miliardi di parametri contro 12, e solo uno di loro ha un punteggio
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 218 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Kolibri e Gemma 4 12B sono le due estremità di uno spettro che i rilasci a pesi aperti di solito non consentono di confrontare a parità di condizioni. Il Kolibri di Aleph Alpha è stato rilasciato il 3 ottobre 2026: 78,1 miliardi di parametri totali, 3,46 miliardi attivi per token, una finestra di contesto convalidata di 1.048.576 token, solo tedesco e inglese, Apache 2.0. Gemma 4 12B è stato rilasciato il 3 giugno 2026: 11,95 miliardi di parametri densi, una finestra di contesto di 262.144 token, input di testo, immagini, audio e video, Apache 2.0. Uno dei due ha un punteggio indipendente e riproducibile pubblicamente. L'altro ha una tabella di benchmark del fornitore. Questa asimmetria non è una nota a piè di pagina di questo confronto; è il confronto stesso, perché tutto il resto che conta per chi acquista — costo per attività, qualità per watt, se funzionerà sui tuoi documenti — passa attraverso di essa.
Dovremmo essere altrettanto diretti sulla forma del confronto, perché un titolo che accosta un modello 78B a un modello 12B invita alla conclusione sbagliata. Non sono concorrenti. Uno è un deployment da 78 GB pensato per il lavoro documentale del settore pubblico tedesco e industriale su rack di proprietà del cliente; l'altro è un modello multimodale unificato da 12 miliardi di parametri che gira su un portatile e dispone di un indice indipendente di 14. Quello che segue è un resoconto di a cosa serve realmente ciascuno, di dove i numeri pubblicati consentono e non consentono di classificarli, e di quanto costa non avere un punteggio indipendente.
L'unico numero di cui ti puoi fidare qui, e quello di cui non puoi.
Artificial Analysis ha misurato Gemma 4 12B, nella sua configurazione di ragionamento. I risultati, come pubblicati sulla loro pagina del modello, sono quelli da cui partire:
• Intelligenza — un Artificial Analysis Intelligence Index di 14, che lo colloca nella fascia di classe più alta con una posizione #21 tra i 142 modelli di quel confronto, rispetto a una mediana di 8 per modelli comparabili.
• Velocità — 112,5 token di output al secondo, #21 di 142 nella vista velocità, e superiore alla mediana di 91 token per modelli comparabili.
• Prezzo — 0,10 $ per milione di token di input e 0,30 $ per milione di token di output, che la loro pagina segnala come alquanto costoso rispetto a una mediana di 0,03 $ e 0,15 $ per modelli di dimensioni e classe simili.
• Specifica — contesto di 262.144 token, 12 miliardi di parametri totali, Apache 2.0, input di testo, immagini, voce e video, output di testo.
Il verdetto riassuntivo di Artificial Analysis è insolitamente schietto per una pagina di classifica, e merita di essere ripetuto: Gemma 4 12B è tra i modelli leader per intelligenza ma è alquanto costoso rispetto ad altri modelli open-weight di dimensioni simili. Si tratta di una valutazione reale, indipendente e riproducibile, fornita da una terza parte che non ha alcun interesse in nessuno dei due fornitori.
Kolibri non ha nulla di equivalente. Non esiste una pagina modello di Artificial Analysis per esso, e al momento in cui scriviamo nessuna terza parte ha riprodotto la suite di valutazione. Ciò che esiste è la tabella comparativa di Aleph Alpha stessa, sulla quale Kolibri ottiene 75,5 sulla media inglese e 70,8 sulla media tedesca nella sua suite di attività. Si tratta di medie percentuali non ponderate su un insieme di benchmark scelto dal fornitore, su un harness scritto dal fornitore, con reasoning effort high. Non sono un Intelligence Index, e i due numeri non possono essere convertiti l'uno nell'altro né messi a confronto diretto. Chiunque presenti "Kolibri 75,5 contro Gemma 14" come una classifica sta confrontando una percentuale su una scala con un punteggio su un'altra. La posizione onesta è che la qualità di Gemma 4 12B è misurata, mentre quella di Kolibri è dichiarata.
Quello che la tabella del fornitore ti permette di fare è leggere lungo le righe. Gemma 4 26B-A4B IT, il modello mixture-of-experts di Google fratello del 12B, compare nella tabella di Aleph Alpha a 71,9 in inglese e 66,3 in tedesco, al di sotto di Kolibri in entrambi i casi. È la cosa più vicina a una verifica incrociata disponibile, e comporta la stessa avvertenza: harness del fornitore, numeri del fornitore. È un segnale debole, non una prova.

Dense 12B contro sparse 78B non è il mismatch che sembra
Il divario architetturale è più ampio del divario nei parametri, una volta considerato ciò che viene effettivamente calcolato per token.
• Calcolo per token — Gemma 4 12B attiva tutti gli 11,95 miliardi di parametri su ogni token. Kolibri attiva 3.457.573.120 dei suoi 78.103.074.560, all'incirca un ventiduesimo del modello, con un esperto condiviso e sei esperti instradati per livello su 384.
• Memoria — il compromesso va nella direzione opposta ed è brutale. Gemma 4 12B in bfloat16 è nell'ordine dei 24 GB di pesi. La scheda di Kolibri indica i pesi FP8 a circa 78 GB, con un minimo di due schede A100 80 GB, due H100 SXM5, una H200, una B200 o una B300.
• Attenzione — Gemma 4 utilizza un ibrido di attenzione locale a finestra scorrevole e attenzione globale completa, con il livello finale sempre globale. Kolibri utilizza una ripartizione 4:1 tra finestra scorrevole e grouped-query su 50 livelli tutti MoE.
• Contesto — 262.144 token per Gemma 4 12B; 262.144 nativi per Kolibri, convalidati fino a 1.048.576 senza scaling posizionale.
Quindi l'inquadramento onesto di "78B contro 12B" è che Kolibri vince sul costo di attivazione e perde sull'ingombro in termini di peso, e nessuno dei due vantaggi è gratis. Un modello sparso che attiva 3,46 miliardi di parametri per token deve comunque tenere tutti i 78 miliardi in memoria, ed è per questo che la soglia minima per il deployment è una coppia di acceleratori da 80 GB anziché una singola scheda consumer. Gemma 4 12B fa il compromesso opposto: una quota maggiore del modello si attiva a ogni token, ma entra su hardware che una persona può acquistare.
C'è una peculiarità specifica del tedesco sul fronte Kolibri che cambia l'aritmetica più che la classifica. Il suo tokenizer misura in media 4,90 byte per token su testo web tedesco, contro 4,13 di Gemini, 4,17 della famiglia Qwen3.5–3.8 e 4,35 di GPT-5, secondo le misurazioni di Aleph Alpha stessa. Un minor numero di token per documento tedesco è una riduzione diretta del costo di inferenza e, per un carico di lavoro che è testo amministrativo tedesco a milioni, quell'effetto può valere più di qualche punto indice. Inoltre è interamente riportato dal fornitore.

Cosa ognuno può effettivamente vedere
È qui che il confronto smette di essere equilibrato, e si tratta di un dato di specifica più che di un'affermazione sulla qualità. Gemma 4 12B è un modello multimodale unificato: la sua scheda descrive un'architettura priva di encoder che proietta patch di immagini grezze e forme d'onda audio direttamente nello spazio di embedding del modello linguistico, con testo, immagini, voce e video in input e testo in output. È progettato per funzionare su dispositivi consumer senza encoder separati da predisporre.
Kolibri legge testo, in due lingue, e nient'altro. Aleph Alpha lo inquadra deliberatamente come profondità anziché ampiezza: due lingue, fortemente curate, piuttosto che un'ampia miscela multilingue. Non c'è alcuna torre di visione, alcun percorso audio, alcun video. Se il tuo carico di lavoro include moduli scansionati, chiamate registrate o fotografie di attrezzature, Gemma 4 12B è un candidato e Kolibri no, qualunque cosa dicano le righe dei benchmark. Se il tuo carico di lavoro è un corpus di documenti tedeschi e inglesi che non deve mai lasciare l'edificio, il contrario è più vicino al vero — ma nota che il requisito "non lascia mai l'edificio" è soddisfatto anche da Gemma 4 12B, poiché i pesi sono Apache 2.0 e scaricabili.
Quale sia più economico dipende da cosa stai acquistando
I due modelli hanno prezzi in valute che non si convertono. Gemma 4 12B ha un tasso di mercato: 0,10 $ e 0,30 $ per milione di token, come misurato tra i fornitori da Artificial Analysis, e più economico al livello MoE sugli endpoint instradati. Kolibri non ha alcun tasso, perché Aleph Alpha non vende inferenza per esso — il rilascio è costituito da pesi, un report tecnico e una scheda del modello.
• Gemma 4 12B su una rotta ospitata — 0,10 $ per milione di token in input e 0,30 $ per milione in output secondo i dati di Artificial Analysis. Nel nostro catalogo, il fratello MoE Gemma 4 26B-A4B IT è listato a 0,06 $ in input e 0,33 $ in output con una finestra di 262.144 token, e il più grande Gemma 4 31B IT dense a 0,13 $ e 0,38 $; quelli sono i prezzi di listino dei provider passati così come sono, l'unico numero su cui non aggiungiamo nulla.
• Kolibri sul tuo hardware — 78 GB di pesi, un plugin vLLM dal pacchetto aleph-alpha-inference del fornitore, e un minimo di una H200 o B200, oppure una coppia di H100 SXM5. Il costo è un acquisto in conto capitale, uno slot nel rack e una persona in grado di gestire un deployment vLLM, ammortizzato su tutti i token che generi.
Quelli non sono lo stesso acquisto e il confronto non è “quale costa meno”. Si tratta di stabilire se il carico di lavoro ha una forma che giustifica il possesso dell’hardware. Un team che elabora un corpus documentale fisso e sensibile ad alto volume può uscirne nettamente avvantaggiato sul fronte self-hosted. Un team che sviluppa una funzionalità di prodotto che chiama un modello per qualche milione di token al giorno quasi mai.
Una pratica soluzione intermedia: il tier Gemma è su OrcaRouter oggi, sullo stesso endpoint compatibile con OpenAI usato da tutto il resto, con failover tra provider e il prezzo di listino del provider passato così com'è, senza nulla aggiunto per token. Questo lo rende un modo economico per misurare il tuo volume effettivo di token su una rotta ospitata prima di decidere se una distribuzione sovrana da 78 GB sia giustificata. Vale la pena dire chiaramente cosa non è: non instradiamo Kolibri. Abbiamo sondato il catalogo con ogni grafia del nome del fornitore e del modello, e non c'è. Al momento il self-hosting è l'unico modo per chiamarlo.

Chi dovrebbe scegliere cosa
La regola decisionale è abbastanza breve da poter essere enunciata in tre righe.
Scegli Gemma 4 12B se ti serve qualcosa di diverso da testo in tedesco e inglese, se hai bisogno di un numero di qualità misurato prima di impegnarti, se il modello deve girare su hardware che già possiedi, o se preferisci noleggiare token invece di possedere un rack. È l'unico dei due con un punteggio indipendente, una velocità pubblicata e un prezzo di mercato.
Scegli Kolibri se il tuo requisito è un modello di ragionamento da 78 miliardi di parametri i cui pesi, la provenienza dei dati di addestramento, il consumo energetico e la licenza sono tutti documentati, distribuito all'interno del tuo perimetro, con un tokenizer progettato per la prosa amministrativa tedesca e un comportamento di astensione su cui un flusso di lavoro regolamentato possa fare affidamento. Questo è un obiettivo ristretto, e Aleph Alpha vi ha mirato deliberatamente.
Non scegliere l'uno o l'altro sulla base di una riga di benchmark che hai visto in un post di lancio. Il 14 di Gemma 4 12B è una misurazione fatta da qualcun altro e che puoi verificare. Il 75.5 di Kolibri è un'affermazione fatta dal suo autore, e l'unica persona che al momento può falsificarla è un cliente con due H100 e un corpus di documenti.
