
Kolibri, spiegato: Aleph Alpha rilascia un modello tedesco-inglese da 78 miliardi con licenza Apache 2.0
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 218 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Aleph Alpha ha rilasciato Kolibri il 3 ottobre 2026, un modello mixture-of-experts da 78,1 miliardi di parametri che attiva 3,46 miliardi di parametri per token, presenta una finestra di contesto convalidata di 1.048.576 token e viene distribuito con i pesi completi su Hugging Face sotto licenza Apache 2.0. Il laboratorio di Heidelberg lo ha pubblicato il Giorno della riunificazione tedesca, insieme a un rapporto tecnico, una model card in tedesco e inglese e un resoconto insolitamente dettagliato di come è stato addestrato. Il modello con cui viene confrontato in tutta la documentazione di Aleph Alpha è Kolibri Origin — il predecessore da 30,6 miliardi di parametri e 3,27 miliardi attivi che ha terminato il pre-addestramento l'11 giugno 2026 e non è mai stato reso pubblico. Due modelli, a tre mesi di distanza, e la distanza tra loro è la cosa più interessante del rilascio.
Ciò che rende Kolibri meritevole di una lettura attenta non è che sia il modello più potente disponibile. Nelle stesse tabelle di confronto di Aleph Alpha non lo è, e ci arriveremo. Ciò che è notevole è che un laboratorio europeo abbia distribuito un modello open-weight di questa scala, con la pipeline di addestramento, la provenienza dei dati e il dato energetico pubblicati insieme ad esso, e abbia impostato la licenza su Apache 2.0 anziché su una licenza di ricerca su misura. Per i team le cui regole di approvvigionamento partono da "dove finiscono i dati", quella combinazione è il prodotto.
La scheda tecnica, e i due numeri che contano
Tutto ciò che segue proviene dalla model card che Aleph Alpha ha pubblicato insieme ai pesi; nulla di esso è stato ancora riprodotto in modo indipendente, e al momento in cui scriviamo non esiste una riga di Artificial Analysis per Kolibri.
• Parametri totali — 78.103.074.560, con 3.457.573.120 attivi per token, un rapporto di circa 22,6 a 1.
• Architettura — un transformer a 50 strati, con tutti gli strati di tipo mixture-of-experts, 384 esperti per strato di cui 1 condiviso e 6 instradati, e un rapporto 4:1 tra attenzione a finestra scorrevole e attenzione con query raggruppate lungo l'intero stack.
• Contesto — addestrato a 16.384 token, addestrato in fase intermedia a 65.536, ed esteso a un nativo 262.144. Poiché la codifica posizionale viene applicata solo nei layer a finestra scorrevole, Aleph Alpha afferma che la finestra può essere estesa senza scalatura posizionale, e ha validato la qualità e l'efficienza di servizio fino a 1.048.576 token. La scheda consiglia di rimanere a o al di sotto di 262.144 per lavori sensibili alla latenza e per compiti complessi.
• Precisione — pesi FP8 in blocchi 128×128 con attivazioni quantizzate dinamicamente, valutati con una cache KV in FP8; gli embedding, l'LM head, le normalizzazioni e il router MoE restano in bfloat16.
• Ragionamento — quattro livelli di impegno: nessuno, basso, medio e alto, impostati tramite il template della chat.
• Tool calling — sì, in stile Hermes, con un parser vLLM fornito nello stesso repository dei pesi.
• Lingue — tedesco e inglese, e nient'altro. Ciò viene dichiarato come una scelta progettuale più che come un'omissione.
• Addestramento — 20 trilioni di token di pre-addestramento su un corpus bilingue filtrato, circa 62,5 per cento inglese, 23,9 per cento tedesco e 13,6 per cento codice, più 3,44 trilioni di token di addestramento intermedio e 201 miliardi per l'estensione del contesto lungo.
• Calcolo — 768 NVIDIA B200 su 96 nodi HGX, 21 giorni di pre-addestramento per 511 ore e 392.000 ore GPU, a un valore dichiarato di 6,4×10²³ FLOP. L'addestramento intermedio ha aggiunto cinque giorni e 90.000 ore GPU; l'estensione del contesto lungo ha aggiunto 13 ore e 10.000 ore GPU.
• Energia — 9,5×10² MWh stimati, incluso l'overhead del data center, coprendo pre-training, mid-training e training a contesto lungo, ma escludendo il fine-tuning supervisionato e l'apprendimento per rinforzo.
• Licenza — Apache 2.0. Nessuna clausola aggiuntiva sull'uso accettabile, nessuna soglia di utenti attivi mensili, nessun termine commerciale separato.
Due di quelle righe sono quelle che un acquirente dovrebbe leggere due volte. Il numero di parametri attivi è ciò che si paga all'inferenza, e 3,46 miliardi di attivi su 78 miliardi totali è un rapporto di sparsità aggressivo — è l'intera ragione per cui un modello di queste dimensioni può essere servito su due GPU. E il valore del contesto è indicato come 262.144 nativo con 1.048.576 convalidato, il che è un'affermazione più prudente del semplice "contesto da 1M" che si vedrà nella maggior parte dei resoconti di questa release.

Due modelli, a tre mesi di distanza
Kolibri è il secondo modello di quella che Alepha Alpha chiama la sua Model Series, e la timeline che ha pubblicato è la parte del rilascio che gran parte della copertura salta.
Il lavoro sulla pipeline di addestramento è iniziato a gennaio 2026. Kolibri Origin ha terminato il pre-training alla scala obiettivo l'11 giugno 2026 — 30,6 miliardi di parametri totali, 3,27 miliardi attivi, una finestra di contesto di 65.536 token, 7.510 miliardi di token di addestramento, 50 livelli di cui due densi e 48 MoE, e un'unica modalità di ragionamento. È stato convalidato internamente e mai rilasciato pubblicamente. Kolibri ha terminato il pre-training l'11 settembre 2026.
• Parametri — 30,6 miliardi in totale e 3,27 miliardi attivi, contro 78,1 miliardi in totale e 3,46 miliardi attivi.
• Contesto — 8.192 token di contesto di pre-training su Origin, rispetto a 16.384 su Kolibri, fino a un contesto nativo di 262.144.
• Dati — 7,51 trilioni di token di pre-training su Origin, contro 20 trilioni, estratti da un pool grezzo di oltre 200 trilioni che la pipeline ha filtrato, deduplicato e curato.
• Architettura — due layer densi più 48 layer MoE su Origin, contro 50 layer MoE, con un design dell'attenzione modificato, il triplo del numero di esperti, maggiore sparsità e un algoritmo di routing sostituito.
• Ragionamento — una modalità su Origin, rispetto a nessuna, bassa, media e alta su Kolibri.
• Rilascio — nessun rilascio pubblico per Origin, 3 ottobre 2026 per Kolibri.
I numeri che variano maggiormente sono quelli delle suite di attività, dove lo stesso sistema di valutazione ha attribuito un punteggio a entrambi i modelli. Sulla media tedesca della suite post-training Origin ha ottenuto 46,4 e Kolibri 70,8; sulla media inglese, 54,1 contro 75,5. Su AIME 2025 in tedesco, 73,5 contro 87,5. Sui benchmark interni customer-proxy che il fornitore pubblica come set verticale, la suite dei fornitori automotive è passata da 0,72 a 0,99, i semiconduttori da 0,35 a 0,80, il settore pubblico tedesco da 0,54 a 0,75, la tecnologia degli azionamenti industriali da 0,31 a 0,60 e l'aerospazio da 0,14 a 0,59.
Quei numeri verticali interni sono gestiti dai fornitori su suite di valutazione costruite dai fornitori e progettate attorno ai clienti dei fornitori, quindi trattali come una descrizione dell'intento anziché come un punteggio. Lo scopo di pubblicarli è che spiegano per cosa è stato ottimizzato il modello: non una classifica, ma un insieme di documenti di settori regolamentati.

Il tedesco qui è una scelta di design, non un tag di lingua.
La maggior parte delle schede modello "multilingue" indica un mix di addestramento che includeva per caso un po' di tedesco. Questa è costruita al contrario, e la scheda è specifica sulla meccanica.
Aleph Alpha ha scoperto tramite esperimenti con piccoli modelli proxy che circa il 20 per cento di dati tedeschi nella miscela produceva i risultati migliori, il che per un'esecuzione da 20.000 miliardi di token significava trovare 4.000 miliardi di token tedeschi. I dataset tedeschi aperti, deduplicati e filtrati, hanno fornito 390 miliardi — un ordine di grandezza in meno rispetto all'obiettivo. Ha colmato il divario in tre modi: ritarando un filtro di Common Crawl specificamente per il tedesco, che ha prodotto 1.300 miliardi di token organici unici; riformulando documenti tedeschi esistenti in voci in stile enciclopedico, dialoghi domanda-risposta e passaggi testuali, che ha prodotto circa 1.000 miliardi in più ed è diventata la singola più grande fonte tedesca; e la traduzione, usata solo in Kolibri Origin e abbandonata per Kolibri. Il tedesco è finito come pool unico di 2.400 miliardi di token, l'80 per cento del quale curato o generato internamente, osservato al 21,3 per cento dei token di pre-addestramento dopo l'upsampling.
Il dettaglio sul filtro merita di essere citato, perché è il tipo di cosa che viene fuori solo in un laboratorio che ha davvero fatto addestramento sul tedesco. Una pipeline standard per dati linguistici scarta i documenti con troppe parole lunghe — ma la prosa amministrativa tedesca supera abitualmente il limite inglese sulla lunghezza media delle parole, così le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione. L'ovvia conseguenza commerciale è che un modello addestrato su un filtro inglese standard non possiede praticamente alcun vocabolario giuridico-amministrativo tedesco, e nessun benchmark te lo dirà.
Il tokenizer riceve lo stesso trattamento. Aleph Alpha ha addestrato un tokenizer bilingue tedesco-inglese con un vocabolario di 128.000 token usando un nuovo metodo che chiama UniBPE, il quale mantiene la fusione bottom-up della codifica byte-pair ma seleziona le fusioni con un obiettivo unigram. Sul testo web tedesco riporta 4,90 byte medi per token, davanti a GPT-5 con 4,35, Gemini con 4,13, Qwen3.5–3.8 con 4,17, GLM 5.3 con 3,93, DeepSeek V4 con 3,72 e Kimi K3 con 3,28 — tutti dati dichiarati dal fornitore nel suo stesso confronto. Più testo per token significa meno token per attività, il che è un effetto diretto sul costo di inferenza più che un'affermazione sulla qualità, ed è il tipo di guadagno di efficienza che si accumula in un carico di lavoro di elaborazione documentale.
Ciò che la tabella del fornitore non risolve
Aleph Alpha ha pubblicato un confronto di post-training che copre quattordici modelli, ed è più utile della maggior parte delle tabelle di lancio perché non lusinga il soggetto.
Sullo stesso harness, con Kolibri impostato su reasoning effort high, Qwen3.8 27B ottiene 80,2 sulla media inglese contro il 75,5 di Kolibri, e 79,9 sulla media tedesca contro 70,8. È anche in testa su GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified e i due benchmark long-context. Nemotron 3 Super 120B-A12B ottiene 73,0 in inglese contro il 75,5 di Kolibri — più vicino, e in vantaggio su AIME 2025. Gemma 4 26B-A4B IT ottiene 71,9 e 66,3 sulle due medie.
Quindi il riassunto onesto del rilascio non è "lo stato dell'arte". È che Kolibri si trova nel mezzo di un campo di modelli che attivano tra tre e dodici miliardi di parametri per token, che batte chiaramente quelli molto più piccoli, e che perde contro un modello denso da 27 miliardi di parametri di Alibaba sulla maggior parte delle righe della propria tabella pur attivando circa un ottavo dei parametri. L'inquadramento di Aleph Alpha per questo è la frontiera di Pareto della qualità rispetto ai token decodificati al secondo per GPU — nessuno dei modelli confrontati offre più qualità allo stesso costo di servizio, o la stessa qualità a un costo inferiore. Questa è l'affermazione da interrogare, ed è un'affermazione di economia del servizio, non di capacità.
Nessuno di questi valori è verificato in modo indipendente. Non esiste una voce di Artificial Analysis per Kolibri, nessuna replica da terzi del framework di valutazione, e i benchmark verticali sono costruiti dal fornitore. Il confronto è inoltre strutturalmente generoso verso Kolibri in una direzione e poco generoso nell'altra: tutti e quattordici i modelli sono stati eseguiti tramite l'harness proprietario di Aleph Alpha con prompt identici e impostazioni few-shot identiche, che è il modo giusto di farlo, ma resta comunque l'harness di un solo laboratorio. Considera ogni numero in questa sezione come riportato dal fornitore finché qualcun altro non lo esegue.

Cosa ti serve per eseguirlo
Kolibri non è un modello da provare su un laptop. I pesi FP8 comportano un'occupazione di memoria del modello di circa 78 GB, e il minimo lato schede è di due schede A100 80 GB, due H100 SXM5, una H200, una B200 o una B300; la configurazione consigliata è due H100 SXM5, due H200, una B200 o una B300.
Servirlo significa installare il pacchetto aleph-alpha-inference, che fornisce il plugin Kolibri per vLLM e fissa la versione di vLLM supportata, oppure scaricare l'immagine container ghcr.io/aleph-alpha/aleph-alpha-inference. Da lì si tratta di una normale invocazione di vLLM con la KV cache FP8, il parser di ragionamento Kolibri e il parser delle chiamate di strumenti Kolibri. I contesti oltre 262.144 token richiedono un flag esplicito maximum-model-length e un override dell'embedding posizionale. I parametri di campionamento consigliati sono temperature 1,0, top-p 0,97 e top-k 128.
La superficie API è compatibile con OpenAI, il che conta più di quanto sembri: lo sforzo di ragionamento viene passato attraverso il template della chat come valore reasoning_effort, e le chiamate agli strumenti vengono emesse nel campo standard tools. Un team che parla già il formato chat-completions può puntare il codice esistente a un endpoint Kolibri su una macchina nel proprio edificio senza un livello wrapper.
Cosa Kolibri non ha ancora
Vale la pena dichiarare apertamente quattro assenze, perché la copertura del lancio tende a saltarle.
• Nessuna valutazione indipendente. Artificial Analysis non ha una pagina del modello per Kolibri, e nessuna terza parte ha pubblicato una riproduzione della tabella di benchmark del fornitore.
• Nessun endpoint ospitato dal fornitore. Il rilascio comprende i pesi più un rapporto tecnico; non esiste alcuno SKU API Aleph Alpha per Kolibri nel materiale pubblicato insieme al modello.
• Nessuna rotta su OrcaRouter, e nessuna su qualsiasi aggregatore che saremmo disposti a nominare. Abbiamo sondato il catalogo con ogni possibile grafia del prefisso del fornitore e del nome del modello, e Kolibri non c'è — quindi se vuoi chiamarlo, devi scaricare 78 GB e avviare tu stesso un endpoint vLLM. Preferiamo dirlo piuttosto che lasciar intendere che lo serviamo.
• Nessun input multimodale. Testo in entrata, testo in uscita, due lingue. È il compromesso che il laboratorio ha accettato per privilegiare la profondità rispetto all'ampiezza, e per un deployment di elaborazione documentale è probabilmente quello giusto, ma è un confine reale.
Se ciò di cui hai davvero bisogno oggi è un piccolo modello mixture-of-experts che puoi chiamare senza acquistare due GPU, il tier Gemma 4 MoE è la cosa più vicina già disponibile su un endpoint instradato, a $0,06 per milione di token in input e $0,33 per milione in output sulla variante 26B-A4B, con una finestra di 262.144 token. Per chiunque valuti un deployment sovrano self-hosted da 78B rispetto a questo, il confronto utile non sono le righe dei benchmark — sono 78 GB di VRAM e una trattativa di procurement contrapposti a una voce di costo per token. OrcaRouter instrada quel tier su un'unica chiave compatibile con OpenAI, con il prezzo di listino del provider passato così com'è e senza alcun ricarico, il che è il modo economico per scoprire se il carico di lavoro giustifica il possesso dell'hardware.
Kolibri stesso è l'artefatto più interessante. Un modello tedesco-inglese da 78 miliardi di parametri con licenza Apache 2.0, con la pipeline dei dati, il metodo del tokenizer, il dato energetico e una storia di iterazione durata tre mesi pubblicati accanto ai pesi, è un tipo di rilascio diverso dal solito weight drop — la divulgazione fa parte del prodotto, non è un post di blog che ne parla. Se l'affermazione sul Pareto regga è ormai una domanda per chi ha due H100 e un cronometro, e la risposta non arriverà da chi ha scritto la scheda del modello.
