
Il primo giorno di Kolibri: Aleph Alpha ha aperto 78 miliardi di pesi tedesco-inglesi, e la reazione corre più avanti delle prove
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Ventiquattro ore dopo che Aleph Alpha ha pubblicato Kolibri, la reazione si è consolidata in una singola frase, e vale la pena smontarla. Il laboratorio di Heidelberg ha messo un modello mixture-of-experts da 78,1 miliardi di parametri su Hugging Face sotto Apache 2.0 il 3 ottobre 2026, lo ha annunciato la stessa mattina nella propria newsroom e dal proprio account, e il giorno successivo il riassunto che circolava nei feed sull'IA recitava: 78 miliardi di parametri totali, 3,46 miliardi attivi per token, pesi aperti sotto Apache 2.0, costruito per tedesco e inglese. Ogni clausola di quella frase è verificabile dal repository. Ciò che è rimasto in gran parte non detto è quali parti del rilascio siano fatti misurati e quali siano affermazioni che gli autori hanno fatto sul proprio modello che nessuno fuori Heidelberg ha eseguito. Questo divario è la storia del primo giorno, e conta più del numero da titolo.
Cominciamo dalla cronologia, perché una quantità sorprendente di reazioni ha interpretato la cosa come un misterioso rilascio silenzioso, e non lo era affatto. Il repository Hugging Face Aleph-Alpha/Kolibri-1 è stato creato il 2 ottobre 2026 alle 05:54:02 UTC, la model card riporta una data di rilascio dichiarata del 3 ottobre, e il post nella newsroom del fornitore è uscito la stessa mattina alle 08:43:53 GMT — il Giorno dell'Unità tedesca, una data che il laboratorio ha chiaramente scelto. L'account di Aleph Alpha ha pubblicato un post in merito nel giro di pochi minuti. Non c'è stato alcun embargo stampa né un evento di lancio, ed è probabilmente da lì che deriva l'inquadratura del "rilascio silenzioso", ma un post nella newsroom del fornitore, un report tecnico e un annuncio ufficiale non sono un rilascio silenzioso. Sono un rilascio normale che la stampa AI generalista semplicemente non ha coperto quel giorno.
Il numero che la reazione sta ripetendo
Il motivo per cui tutti citano la cifra di 3,46B attivi è che è l'unico numero nel rilascio che cambia ciò che un acquirente deve possedere. Kolibri è un transformer a 50 strati in cui ogni strato è una mixture-of-experts, con 384 esperti per strato, uno condiviso e sei instradati, su un totale di 78.103.074.560 parametri. Per ogni token ne attiva 3.457.573.120 — un rapporto di sparsità di circa 22,6 a 1. Questo è ciò che rende un modello da 78 miliardi di parametri servibile su una coppia di H100 invece che su un rack, ed è l'affermazione più significativa del rilascio.
Attorno ad esso si trovano le altre cifre principali, tutte provenienti dalla scheda del modello anziché da un'esecuzione dedicata:
• Contesto — addestrato a 16.384 token, addestrato in fase intermedia a 65.536, nativo a 262.144 e validato fino a 1.048.576. La scheda consiglia di restare a 262.144 o al di sotto per attività sensibili alla latenza. Nota bene che il semplice "1M di contesto" che vedrai nei riepiloghi è il tetto massimo validato, non la finestra nativa.
• Precisione — pesi FP8 in blocchi 128x128 con attivazioni quantizzate dinamicamente, valutati con una cache KV FP8; gli embedding, la LM head, le norm e il router MoE restano in bfloat16.
• Ragionamento — quattro livelli di impegno — nessuno, basso, medio, alto — impostati tramite il template della chat, con chiamata agli strumenti in stile Hermes e un parser vLLM distribuito nello stesso repository dei pesi.
• Lingue — tedesco e inglese, e nient'altro.
• Addestramento — 20 trilioni di token di pre-addestramento su un corpus bilingue filtrato composto all'incirca per il 62,5 per cento da inglese, per il 23,9 per cento da tedesco e per il 13,6 per cento da codice, oltre a 3,44 trilioni di token di addestramento intermedio e 201 miliardi per l'estensione al contesto lungo.
• Calcolo ed energia — 768 NVIDIA B200 su 96 nodi HGX, 21 giorni di pre-addestramento per 511 ore e 392.000 GPU-ore a un valore riportato di 6,4x10^23 FLOPs, e un consumo stimato di 9,5x10^2 MWh includendo l'overhead del data center, escludendo il fine-tuning supervisionato e il reinforcement.
• Licenza — Apache 2.0. Nessuna clausola aggiuntiva sull'uso accettabile, nessuna soglia di utenti attivi mensili, nessun termine commerciale separato.
Le due affermazioni che nessuno ha verificato
Questa è la parte del primo giorno che la reazione ha saltato, ed è la parte che decide se Kolibri è importante o soltanto interessante.
La prima è la tesi dell'economia del serving. La posizione di Aleph Alpha non è che Kolibri sia il modello più forte disponibile — nella tabella comparativa del laboratorio stesso non lo è, e il laboratorio lo dichiara. La sua impostazione è che nessun modello confrontato offra una qualità superiore a parità di costo di serving, o la stessa qualità a un costo inferiore, lungo una frontiera di Pareto della qualità rispetto ai token decodificati al secondo per GPU. È un'affermazione sul throughput su hardware specifico, ed è esattamente il tipo di affermazione che solo una terza parte con un cronometro e due H100 può dirimere. Nessuno lo ha fatto. Non esiste alcuna voce di Artificial Analysis per Kolibri al 4 ottobre 2026, né alcuna replica di terze parti dell'harness di valutazione.
La seconda è l'affermazione sul tokenizer. Aleph Alpha ha addestrato un tokenizer bilingue tedesco-inglese con un vocabolario di 128.000 token usando un metodo che chiama UniBPE, e riporta 4,90 byte medi per token su testo web tedesco, contro GPT-5 a 4,35, Gemini a 4,13, Qwen 3.5-3.8 a 4,17, GLM 5.3 a 3,93, DeepSeek V4 a 3,72 e Kimi K3 a 3,28. Ognuno di quei valori è del fornitore stesso, misurato sul corpus del fornitore stesso, contro concorrenti scelti dal fornitore. Più testo per token è un effetto reale sul costo di inferenza più che un'affermazione sulla qualità, e se regge si accumula su qualsiasi carico di lavoro di elaborazione documenti — ma è la misurazione di un solo laboratorio, non il risultato di un benchmark.
Il tedesco è il punto, ed è l'ingegneria più interessante della release
La maggior parte delle schede modello "multilingue" descrive un mix di addestramento che includeva per caso il tedesco. Questa è costruita al contrario, e la scheda è insolitamente specifica sui meccanismi.
Esperimenti su piccoli modelli proxy hanno portato Aleph Alpha a un obiettivo di circa il 20 per cento di dati tedeschi nella miscela, il che, per un addestramento da 20 trilioni di token, significava trovare 4 trilioni di token tedeschi. I dataset tedeschi aperti, deduplicati e filtrati, ne hanno forniti 390 miliardi — un ordine di grandezza in meno. Il laboratorio ha colmato il divario in tre modi: ritarando un filtro di Common Crawl specificamente per il tedesco, che ha prodotto 1,3 trilioni di token organici unici; riformulando documenti tedeschi esistenti in voci enciclopediche, dialoghi domanda-risposta e passaggi di testo, che ha prodotto circa un altro trilione ed è diventata la singola più grande fonte tedesca; e la traduzione, che era stata usata per il modello predecessore e deliberatamente abbandonata per Kolibri. Il tedesco ha finito per costituire un pool unico di 2,4 trilioni di token, l'80 per cento del quale curato o generato internamente, arrivando dopo l'upsampling a rappresentare il 21,3 per cento dei token di pre-addestramento.
Il dettaglio del filtro è una di quelle cose che emergono solo in un laboratorio che ha effettivamente addestrato sul tedesco. Una pipeline standard di dati linguistici scarta i documenti con troppe parole lunghe — ma la prosa amministrativa tedesca supera abitualmente il limite inglese sulla lunghezza media delle parole, quindi le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione. Un modello addestrato su un filtro inglese standard non possiede praticamente alcun vocabolario giuridico-amministrativo tedesco, e nessun benchmark te lo dirà.
Cosa mostra effettivamente la tabella di confronto
Aleph Alpha ha pubblicato un confronto post-training che copre quattordici modelli, ed è più utile della maggior parte delle tabelle di lancio perché non lusinga il soggetto in esame. Sullo stesso harness con Kolibri a reasoning effort high, Qwen3.8 27B ottiene 80,2 sulla media inglese contro il 75,5 di Kolibri, e 79,9 sulla media tedesca contro 70,8, e primeggia su GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified ed entrambi i benchmark a contesto lungo. Nemotron 3 Super 120B-A12B ottiene 73,0 in inglese contro il 75,5 di Kolibri. Gemma 4 26B-A4B IT ottiene 71,9 e 66,3 sulle due medie.
Quindi il riassunto onesto del rilascio non è "allo stato dell'arte". È che Kolibri si colloca nel mezzo di un campo di modelli che attivano tra tre e dodici miliardi di parametri per token, che batte chiaramente quelli molto più piccoli, e che perde contro un modello denso da 27 miliardi di parametri di Alibaba nella maggior parte delle righe della propria tabella, pur attivando circa un ottavo dei parametri. Se l'economia colmi quel divario è la rivendicazione di Pareto, e la rivendicazione di Pareto non è verificata.

Come lo chiameresti davvero, oggi
Non esiste alcun endpoint ospitato dal fornitore — la release è costituita dai pesi più un report tecnico, senza alcuno SKU dell'API Aleph Alpha per Kolibri nel materiale pubblicato. Non esiste nemmeno una route per esso su OrcaRouter: abbiamo sondato il catalogo con ogni grafia del prefisso del fornitore e del nome del modello e Kolibri non è presente, quindi invocarlo oggi significa scaricare circa 78 GB di pesi FP8 ed eseguire tu stesso un endpoint vLLM dal pacchetto aleph-alpha-inference o dall'immagine container pubblicata.
Questa è una vera decisione di approvvigionamento, non una nota a piè di pagina, ed è qui che un livello di routing si guadagna il suo posto anche per un modello che non ospita. Il confronto onesto per chiunque valuti un deployment sovrano self-hosted da 78B non sono le righe dei benchmark — sono 78 GB di VRAM e una conversazione di approvvigionamento contrapposta a una voce di costo per token su hardware di proprietà altrui. Se ciò che ti serve davvero questo mese è un piccolo modello mixture-of-experts che puoi chiamare senza comprare due GPU, il tier Gemma 4 26B-A4B è la cosa più vicina già disponibile su un endpoint instradato, a $0.06 per milione di token in input e $0.33 per milione in output con una finestra di 262.144 token, e OrcaRouter instrada quel tier su una singola chiave compatibile con OpenAI al prezzo di listino del provider senza nulla in più. È il modo economico per scoprire se il carico di lavoro giustifica possedere l'hardware prima che l'hardware arrivi.

Cosa tenere d'occhio, e cosa cambierebbe il verdetto
Tre cose, in ordine di quanto sposterebbero l'immagine.
Una misurazione indipendente del throughput nella configurazione a due H100 consigliata per la scheda confermerebbe o affonderebbe l'affermazione sul Pareto, che è l'unica affermazione nel comunicato a essere realmente innovativa anziché una ripetizione di una scheda tecnica. Una riproduzione indipendente delle medie delle suite di attività in tedesco e inglese ti direbbe se il divario rispetto a Qwen3.8 27B è così ristretto come suggerisce la tabella del fornitore stesso o ancora più ristretto. E una valutazione in lingua tedesca su testo amministrativo reale — non un benchmark generale tradotto — metterebbe alla prova proprio ciò per cui il comunicato è stato effettivamente creato, che nessuna classifica attualmente misura.
Finché uno di questi non si concretizzerà, l'inquadramento corretto è quello che il repository stesso supporta. Kolibri è un rilascio open-weights da un laboratorio europeo, a una scala che i laboratori europei non avevano mai raggiunto prima, con termini Apache 2.0 che nessun incumbent ha eguagliato, una pipeline di dati pubblicata insieme ai pesi e una storia di iterazione su due modelli che è più interessante del numero in titolo. È anche, per ora, un modello le cui cifre più citate provengono dai suoi stessi autori. Entrambe queste frasi sono vere dal primo giorno, e la seconda è quella che la reazione ha tralasciato.

