Hero card generata per l'explainer di Kolibri, con titolo "Kolibri: un modello open-weight da 78B dalla Germania" e sottotitolo "78B totali / 3,46B attivi / contesto da 1M token / Apache 2.0" e tre icone lineari flat: un colibrì, una pila di livelli e un lucchetto sopra un documento. Il logo OrcaRouter si trova nella striscia sotto l'artwork.
Guides & Insights

Kolibri, spiegato: Aleph Alpha rilascia un modello tedesco-inglese da 78 miliardi con licenza Apache 2.0

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Aleph Alpha ha rilasciato Kolibri il 3 ottobre 2026, un modello mixture-of-experts da 78,1 miliardi di parametri che attiva 3,46 miliardi di parametri per token, presenta una finestra di contesto convalidata di 1.048.576 token e viene distribuito con i pesi completi su Hugging Face sotto licenza Apache 2.0. Il laboratorio di Heidelberg lo ha pubblicato il Giorno della riunificazione tedesca, insieme a un rapporto tecnico, una model card in tedesco e inglese e un resoconto insolitamente dettagliato di come è stato addestrato. Il modello con cui viene confrontato in tutta la documentazione di Aleph Alpha è Kolibri Origin — il predecessore da 30,6 miliardi di parametri e 3,27 miliardi attivi che ha terminato il pre-addestramento l'11 giugno 2026 e non è mai stato reso pubblico. Due modelli, a tre mesi di distanza, e la distanza tra loro è la cosa più interessante del rilascio.

Ciò che rende Kolibri meritevole di una lettura attenta non è che sia il modello più potente disponibile. Nelle stesse tabelle di confronto di Aleph Alpha non lo è, e ci arriveremo. Ciò che è notevole è che un laboratorio europeo abbia distribuito un modello open-weight di questa scala, con la pipeline di addestramento, la provenienza dei dati e il dato energetico pubblicati insieme ad esso, e abbia impostato la licenza su Apache 2.0 anziché su una licenza di ricerca su misura. Per i team le cui regole di approvvigionamento partono da "dove finiscono i dati", quella combinazione è il prodotto.

La scheda tecnica, e i due numeri che contano

Tutto ciò che segue proviene dalla model card che Aleph Alpha ha pubblicato insieme ai pesi; nulla di esso è stato ancora riprodotto in modo indipendente, e al momento in cui scriviamo non esiste una riga di Artificial Analysis per Kolibri.

• Parametri totali — 78.103.074.560, con 3.457.573.120 attivi per token, un rapporto di circa 22,6 a 1.

• Architettura — un transformer a 50 strati, con tutti gli strati di tipo mixture-of-experts, 384 esperti per strato di cui 1 condiviso e 6 instradati, e un rapporto 4:1 tra attenzione a finestra scorrevole e attenzione con query raggruppate lungo l'intero stack.

• Contesto — addestrato a 16.384 token, addestrato in fase intermedia a 65.536, ed esteso a un nativo 262.144. Poiché la codifica posizionale viene applicata solo nei layer a finestra scorrevole, Aleph Alpha afferma che la finestra può essere estesa senza scalatura posizionale, e ha validato la qualità e l'efficienza di servizio fino a 1.048.576 token. La scheda consiglia di rimanere a o al di sotto di 262.144 per lavori sensibili alla latenza e per compiti complessi.

• Precisione — pesi FP8 in blocchi 128×128 con attivazioni quantizzate dinamicamente, valutati con una cache KV in FP8; gli embedding, l'LM head, le normalizzazioni e il router MoE restano in bfloat16.

• Ragionamento — quattro livelli di impegno: nessuno, basso, medio e alto, impostati tramite il template della chat.

• Tool calling — sì, in stile Hermes, con un parser vLLM fornito nello stesso repository dei pesi.

• Lingue — tedesco e inglese, e nient'altro. Ciò viene dichiarato come una scelta progettuale più che come un'omissione.

• Addestramento — 20 trilioni di token di pre-addestramento su un corpus bilingue filtrato, circa 62,5 per cento inglese, 23,9 per cento tedesco e 13,6 per cento codice, più 3,44 trilioni di token di addestramento intermedio e 201 miliardi per l'estensione del contesto lungo.

• Calcolo — 768 NVIDIA B200 su 96 nodi HGX, 21 giorni di pre-addestramento per 511 ore e 392.000 ore GPU, a un valore dichiarato di 6,4×10²³ FLOP. L'addestramento intermedio ha aggiunto cinque giorni e 90.000 ore GPU; l'estensione del contesto lungo ha aggiunto 13 ore e 10.000 ore GPU.

• Energia — 9,5×10² MWh stimati, incluso l'overhead del data center, coprendo pre-training, mid-training e training a contesto lungo, ma escludendo il fine-tuning supervisionato e l'apprendimento per rinforzo.

• Licenza — Apache 2.0. Nessuna clausola aggiuntiva sull'uso accettabile, nessuna soglia di utenti attivi mensili, nessun termine commerciale separato.

Due di quelle righe sono quelle che un acquirente dovrebbe leggere due volte. Il numero di parametri attivi è ciò che si paga all'inferenza, e 3,46 miliardi di attivi su 78 miliardi totali è un rapporto di sparsità aggressivo — è l'intera ragione per cui un modello di queste dimensioni può essere servito su due GPU. E il valore del contesto è indicato come 262.144 nativo con 1.048.576 convalidato, il che è un'affermazione più prudente del semplice "contesto da 1M" che si vedrà nella maggior parte dei resoconti di questa release.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Due modelli, a tre mesi di distanza

Kolibri è il secondo modello di quella che Alepha Alpha chiama la sua Model Series, e la timeline che ha pubblicato è la parte del rilascio che gran parte della copertura salta.

Il lavoro sulla pipeline di addestramento è iniziato a gennaio 2026. Kolibri Origin ha terminato il pre-training alla scala obiettivo l'11 giugno 2026 — 30,6 miliardi di parametri totali, 3,27 miliardi attivi, una finestra di contesto di 65.536 token, 7.510 miliardi di token di addestramento, 50 livelli di cui due densi e 48 MoE, e un'unica modalità di ragionamento. È stato convalidato internamente e mai rilasciato pubblicamente. Kolibri ha terminato il pre-training l'11 settembre 2026.

• Parametri — 30,6 miliardi in totale e 3,27 miliardi attivi, contro 78,1 miliardi in totale e 3,46 miliardi attivi.

• Contesto — 8.192 token di contesto di pre-training su Origin, rispetto a 16.384 su Kolibri, fino a un contesto nativo di 262.144.

• Dati — 7,51 trilioni di token di pre-training su Origin, contro 20 trilioni, estratti da un pool grezzo di oltre 200 trilioni che la pipeline ha filtrato, deduplicato e curato.

• Architettura — due layer densi più 48 layer MoE su Origin, contro 50 layer MoE, con un design dell'attenzione modificato, il triplo del numero di esperti, maggiore sparsità e un algoritmo di routing sostituito.

• Ragionamento — una modalità su Origin, rispetto a nessuna, bassa, media e alta su Kolibri.

• Rilascio — nessun rilascio pubblico per Origin, 3 ottobre 2026 per Kolibri.

I numeri che variano maggiormente sono quelli delle suite di attività, dove lo stesso sistema di valutazione ha attribuito un punteggio a entrambi i modelli. Sulla media tedesca della suite post-training Origin ha ottenuto 46,4 e Kolibri 70,8; sulla media inglese, 54,1 contro 75,5. Su AIME 2025 in tedesco, 73,5 contro 87,5. Sui benchmark interni customer-proxy che il fornitore pubblica come set verticale, la suite dei fornitori automotive è passata da 0,72 a 0,99, i semiconduttori da 0,35 a 0,80, il settore pubblico tedesco da 0,54 a 0,75, la tecnologia degli azionamenti industriali da 0,31 a 0,60 e l'aerospazio da 0,14 a 0,59.

Quei numeri verticali interni sono gestiti dai fornitori su suite di valutazione costruite dai fornitori e progettate attorno ai clienti dei fornitori, quindi trattali come una descrizione dell'intento anziché come un punteggio. Lo scopo di pubblicarli è che spiegano per cosa è stato ottimizzato il modello: non una classifica, ma un insieme di documenti di settori regolamentati.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

Il tedesco qui è una scelta di design, non un tag di lingua.

La maggior parte delle schede modello "multilingue" indica un mix di addestramento che includeva per caso un po' di tedesco. Questa è costruita al contrario, e la scheda è specifica sulla meccanica.

Aleph Alpha ha scoperto tramite esperimenti con piccoli modelli proxy che circa il 20 per cento di dati tedeschi nella miscela produceva i risultati migliori, il che per un'esecuzione da 20.000 miliardi di token significava trovare 4.000 miliardi di token tedeschi. I dataset tedeschi aperti, deduplicati e filtrati, hanno fornito 390 miliardi — un ordine di grandezza in meno rispetto all'obiettivo. Ha colmato il divario in tre modi: ritarando un filtro di Common Crawl specificamente per il tedesco, che ha prodotto 1.300 miliardi di token organici unici; riformulando documenti tedeschi esistenti in voci in stile enciclopedico, dialoghi domanda-risposta e passaggi testuali, che ha prodotto circa 1.000 miliardi in più ed è diventata la singola più grande fonte tedesca; e la traduzione, usata solo in Kolibri Origin e abbandonata per Kolibri. Il tedesco è finito come pool unico di 2.400 miliardi di token, l'80 per cento del quale curato o generato internamente, osservato al 21,3 per cento dei token di pre-addestramento dopo l'upsampling.

Il dettaglio sul filtro merita di essere citato, perché è il tipo di cosa che viene fuori solo in un laboratorio che ha davvero fatto addestramento sul tedesco. Una pipeline standard per dati linguistici scarta i documenti con troppe parole lunghe — ma la prosa amministrativa tedesca supera abitualmente il limite inglese sulla lunghezza media delle parole, così le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione. L'ovvia conseguenza commerciale è che un modello addestrato su un filtro inglese standard non possiede praticamente alcun vocabolario giuridico-amministrativo tedesco, e nessun benchmark te lo dirà.

Il tokenizer riceve lo stesso trattamento. Aleph Alpha ha addestrato un tokenizer bilingue tedesco-inglese con un vocabolario di 128.000 token usando un nuovo metodo che chiama UniBPE, il quale mantiene la fusione bottom-up della codifica byte-pair ma seleziona le fusioni con un obiettivo unigram. Sul testo web tedesco riporta 4,90 byte medi per token, davanti a GPT-5 con 4,35, Gemini con 4,13, Qwen3.5–3.8 con 4,17, GLM 5.3 con 3,93, DeepSeek V4 con 3,72 e Kimi K3 con 3,28 — tutti dati dichiarati dal fornitore nel suo stesso confronto. Più testo per token significa meno token per attività, il che è un effetto diretto sul costo di inferenza più che un'affermazione sulla qualità, ed è il tipo di guadagno di efficienza che si accumula in un carico di lavoro di elaborazione documentale.

Ciò che la tabella del fornitore non risolve

Aleph Alpha ha pubblicato un confronto di post-training che copre quattordici modelli, ed è più utile della maggior parte delle tabelle di lancio perché non lusinga il soggetto.

Sullo stesso harness, con Kolibri impostato su reasoning effort high, Qwen3.8 27B ottiene 80,2 sulla media inglese contro il 75,5 di Kolibri, e 79,9 sulla media tedesca contro 70,8. È anche in testa su GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified e i due benchmark long-context. Nemotron 3 Super 120B-A12B ottiene 73,0 in inglese contro il 75,5 di Kolibri — più vicino, e in vantaggio su AIME 2025. Gemma 4 26B-A4B IT ottiene 71,9 e 66,3 sulle due medie.

Quindi il riassunto onesto del rilascio non è "lo stato dell'arte". È che Kolibri si trova nel mezzo di un campo di modelli che attivano tra tre e dodici miliardi di parametri per token, che batte chiaramente quelli molto più piccoli, e che perde contro un modello denso da 27 miliardi di parametri di Alibaba sulla maggior parte delle righe della propria tabella pur attivando circa un ottavo dei parametri. L'inquadramento di Aleph Alpha per questo è la frontiera di Pareto della qualità rispetto ai token decodificati al secondo per GPU — nessuno dei modelli confrontati offre più qualità allo stesso costo di servizio, o la stessa qualità a un costo inferiore. Questa è l'affermazione da interrogare, ed è un'affermazione di economia del servizio, non di capacità.

Nessuno di questi valori è verificato in modo indipendente. Non esiste una voce di Artificial Analysis per Kolibri, nessuna replica da terzi del framework di valutazione, e i benchmark verticali sono costruiti dal fornitore. Il confronto è inoltre strutturalmente generoso verso Kolibri in una direzione e poco generoso nell'altra: tutti e quattordici i modelli sono stati eseguiti tramite l'harness proprietario di Aleph Alpha con prompt identici e impostazioni few-shot identiche, che è il modo giusto di farlo, ma resta comunque l'harness di un solo laboratorio. Considera ogni numero in questa sezione come riportato dal fornitore finché qualcun altro non lo esegue.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

Cosa ti serve per eseguirlo

Kolibri non è un modello da provare su un laptop. I pesi FP8 comportano un'occupazione di memoria del modello di circa 78 GB, e il minimo lato schede è di due schede A100 80 GB, due H100 SXM5, una H200, una B200 o una B300; la configurazione consigliata è due H100 SXM5, due H200, una B200 o una B300.

Servirlo significa installare il pacchetto aleph-alpha-inference, che fornisce il plugin Kolibri per vLLM e fissa la versione di vLLM supportata, oppure scaricare l'immagine container ghcr.io/aleph-alpha/aleph-alpha-inference. Da lì si tratta di una normale invocazione di vLLM con la KV cache FP8, il parser di ragionamento Kolibri e il parser delle chiamate di strumenti Kolibri. I contesti oltre 262.144 token richiedono un flag esplicito maximum-model-length e un override dell'embedding posizionale. I parametri di campionamento consigliati sono temperature 1,0, top-p 0,97 e top-k 128.

La superficie API è compatibile con OpenAI, il che conta più di quanto sembri: lo sforzo di ragionamento viene passato attraverso il template della chat come valore reasoning_effort, e le chiamate agli strumenti vengono emesse nel campo standard tools. Un team che parla già il formato chat-completions può puntare il codice esistente a un endpoint Kolibri su una macchina nel proprio edificio senza un livello wrapper.

Cosa Kolibri non ha ancora

Vale la pena dichiarare apertamente quattro assenze, perché la copertura del lancio tende a saltarle.

• Nessuna valutazione indipendente. Artificial Analysis non ha una pagina del modello per Kolibri, e nessuna terza parte ha pubblicato una riproduzione della tabella di benchmark del fornitore.

• Nessun endpoint ospitato dal fornitore. Il rilascio comprende i pesi più un rapporto tecnico; non esiste alcuno SKU API Aleph Alpha per Kolibri nel materiale pubblicato insieme al modello.

• Nessuna rotta su OrcaRouter, e nessuna su qualsiasi aggregatore che saremmo disposti a nominare. Abbiamo sondato il catalogo con ogni possibile grafia del prefisso del fornitore e del nome del modello, e Kolibri non c'è — quindi se vuoi chiamarlo, devi scaricare 78 GB e avviare tu stesso un endpoint vLLM. Preferiamo dirlo piuttosto che lasciar intendere che lo serviamo.

• Nessun input multimodale. Testo in entrata, testo in uscita, due lingue. È il compromesso che il laboratorio ha accettato per privilegiare la profondità rispetto all'ampiezza, e per un deployment di elaborazione documentale è probabilmente quello giusto, ma è un confine reale.

Se ciò di cui hai davvero bisogno oggi è un piccolo modello mixture-of-experts che puoi chiamare senza acquistare due GPU, il tier Gemma 4 MoE è la cosa più vicina già disponibile su un endpoint instradato, a $0,06 per milione di token in input e $0,33 per milione in output sulla variante 26B-A4B, con una finestra di 262.144 token. Per chiunque valuti un deployment sovrano self-hosted da 78B rispetto a questo, il confronto utile non sono le righe dei benchmark — sono 78 GB di VRAM e una trattativa di procurement contrapposti a una voce di costo per token. OrcaRouter instrada quel tier su un'unica chiave compatibile con OpenAI, con il prezzo di listino del provider passato così com'è e senza alcun ricarico, il che è il modo economico per scoprire se il carico di lavoro giustifica il possesso dell'hardware.

Kolibri stesso è l'artefatto più interessante. Un modello tedesco-inglese da 78 miliardi di parametri con licenza Apache 2.0, con la pipeline dei dati, il metodo del tokenizer, il dato energetico e una storia di iterazione durata tre mesi pubblicati accanto ai pesi, è un tipo di rilascio diverso dal solito weight drop — la divulgazione fa parte del prodotto, non è un post di blog che ne parla. Se l'affermazione sul Pareto regga è ormai una domanda per chi ha due H100 e un cronometro, e la risposta non arriverà da chi ha scritto la scheda del modello.