
Kolibri vs Solar Mini 4: lo stesso budget attivo da 3B, due scommesse molto diverse
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli rilasciati a diciassette giorni di distanza, entrambi calibrati per spendere circa tre miliardi di parametri attivi per token, e quanto ad adottarli concretamente non potrebbero essere più diversi. Kolibri di Aleph Alpha è un modello da 78,1 miliardi di parametri con pesi Apache-2.0 che scarichi e servi da solo: non esiste alcun endpoint ospitato e, a oggi, non c'è un solo punteggio indipendente che lo riguardi, da nessuna parte. Solar Mini 4 di Upstage è un modello da 35 miliardi di parametri che non puoi scaricare affatto — esiste solo come endpoint a consumo, e ha già un Artificial Analysis Intelligence Index di 24,05. Il numero di parametri attivi ti dice quanto costa eseguirne uno. Nient'altro di quel numero ti dice quanto ti costa iniziare.
Il motivo per cui i totali divergono così tanto — 78,1B contro 35B con una porzione attiva quasi identica — è che entrambi sono architetture sparse mixture-of-experts, e i due laboratori hanno fatto scelte opposte su quanta capacità di esperti tenere in riserva. Kolibri dispone di 384 esperti e instrada verso 1 condiviso più 6 di essi per token. Solar Mini 4 dichiara una suddivisione 35B/3B e nulla sul numero dei suoi esperti. Quando due modelli vengono pubblicizzati sullo stesso valore attivo, è il totale dei parametri, non il valore attivo, a decidere la tua spesa hardware — e qui si tratta di una differenza di 2,2× sullo stesso budget di calcolo dichiarato.
Cosa sia in realtà ognuno
• Parametri totali — Kolibri 78.10B vs Solar Mini 4 35B
• Parametri attivi per token — Kolibri 3.46B vs Solar Mini 4 3B
• Pesi — Kolibri Apache 2.0, pesi completi su Hugging Face rispetto a Solar Mini 4 chiuso; solo API
• Contesto — Kolibri 1.048.576 token validati rispetto a Solar Mini 4 512K secondo la documentazione di Upstage, 1.048.576 secondo la model card di Artificial Analysis
• Output massimo — Kolibri non limitato dal fornitore rispetto a Solar Mini 4 128.000 token
• Lingue — Kolibri tedesco e inglese vs Solar Mini 4 inglese, coreano e giapponese
• Data limite delle conoscenze — Kolibri 18 giugno 2026 vs Solar Mini 4 febbraio 2026
• Distribuzione — Kolibri self-hosted (vLLM) vs Solar Mini 4 ospitato sulla Console e sul Playground di Upstage e on-premises
• Valutazione indipendente — Kolibri: nessuna pubblicata vs Solar Mini 4 AA Intelligence Index 24.05
Kolibri: 78 miliardi di parametri, e nessuno fuori dal laboratorio lo ha valutato
Aleph Alpha ha pubblicato Kolibri il 3 ottobre 2026, deliberatamente in occasione del Giorno della Riunificazione tedesca, come primo esponente di una nuova famiglia e successore di Kolibri Origin. La scheda del modello è insolitamente trasparente su ciò che è stato impiegato per realizzarla: 20 trilioni di token di pre-training, 3,44 trilioni di mid-training e 201 miliardi di long-context training, il tutto eseguito su 768 GPU B200 in 21 giorni per circa 6,4×10²³ FLOP e all'incirca 950 MWh. Il fornitore offre inoltre spontaneamente il conteggio dei guasti — 38 interruzioni non programmate, circa una ogni 10.000 ore GPU — un dato che i laboratori di solito omettono.

L'architettura è una storia pulita di MoE sparsa. Cinquanta livelli con un rapporto 4:1 tra attenzione a finestra scorrevole (finestre da 512 token) e attenzione globale, che si attiva solo ogni quinto livello. Pesi FP8 con scaling a blocchi 128×128 e una cache KV FP8. Kolibri Origin, per confronto, usava 128 esperti instradati a 8 vie, una dimensione nascosta degli esperti di 768 e attenzione completa su ogni livello, su dati in inglese tagliati a settembre 2024. Kolibri passa a 384 esperti instradati a 6 vie con una dimensione nascosta di 512, e sposta entrambe le date di taglio linguistiche al 18 giugno 2026.
La pipeline tedesca è la parte che è davvero difficile da acquistare altrove. Aleph Alpha ha addestrato il proprio tokenizer UniBPE e riporta il testo tedesco a 4,90 byte per token, contro 4,35 di GPT-5, 4,17 di Qwen3.5 e 4,13 di Gemini. Si tratta di un tokenizer che rivendica una compressione del tedesco migliore di qualsiasi modello multilingue di frontiera, ed è il meccanismo concreto dietro la proposta di deployment sovrano: meno token per documento tedesco significa meno token fatturati e una finestra effettiva più lunga sullo stesso hardware.
Ogni dato sulle prestazioni disponibile per Kolibri proviene dalla scheda del modello di Aleph Alpha stessa, e va letto come tale. La tabella riportata dal fornitore colloca Kolibri a un punteggio complessivo di 75,5 nelle valutazioni in inglese e 70,8 in tedesco, 84,3 su GPQA Diamond in inglese contro 81,3 in tedesco, 21,5 su Humanity's Last Exam in inglese contro 15,9 in tedesco, 66,4 su SWE-Bench Verified, 85,9 su LiveCodeBench v6 e 68,3 su AA-LCR. Sono numeri non verificati. Non esiste una pagina di Artificial Analysis per Kolibri — l'URL del modello del tracker restituisce un 404 — quindi nulla in quella tabella è stato riprodotto in modo indipendente, e l'articolo che stai leggendo non può renderlo più solido di quanto non sia.
Ciò che la scheda rende davvero solido è la storia del serving. Il minimo hardware è due A100 da 80 GB, oppure due H100 SXM5, oppure una singola H200, B200 o B300. Una ricetta vLLM pubblicata la esegue con --kv-cache-dtype fp8 e parser dedicati per reasoning e tool-call, a temperatura 1.0, top-p 0.97 e top-k 128, con una manopola reasoning_effort che spazia tra none, low, medium e high. Una singola B300 che serve un modello da 78B con un contesto validato di 1M token è la forma concreta dell'offerta: compri la macchina, e poi ti assumi il costo marginale di ogni token.
Solar Mini 4: noleggi la slice attiva da 3B invece di comprarla
Solar Mini 4 è arrivato il 22 settembre 2026 — snapshot solar-mini4-260922, alias solar-mini4 — come modello piccolo orientato agli agenti di Upstage: 35B totali, 3B attivi, cutoff di febbraio 2026, inglese, coreano e giapponese, con modalità chat, ragionamento, output strutturato e tool calling. È disponibile tramite Console e Playground di Upstage, e per la distribuzione on-premises, ma non c'è alcun download dei pesi né licenza da esaminare. La documentazione di Upstage riporta anche "Dati non raccolti" per esso, che è la linea di conformità che conta se lo si mette davanti a traffico reale.

A differenza di Kolibri, Solar Mini 4 è stato sottoposto a un harness indipendente. Artificial Analysis lo colloca a un Intelligence Index di 24,05, con un valore misurato di 1,01% su Terminal-Bench 4.0, 47,6% su SciCode, 83,3% su AA-LCR e 25,8% su Humanity's Last Exam. Il post di lancio di Upstage presenta il 24,1 come l'Intelligence Index più alto tra i modelli con 3B di parametri attivi, davanti a Qwen3.6 35B A3B a 18 e a Nemotron 3.5 Lightning a 13 — un'inquadratura che è equa per ciò che copre e, cosa degna di nota, è esattamente così ristretta come sembra, poiché è un'affermazione sulla classe dei 3B attivi piuttosto che sui modelli piccoli in generale.
La metrica che dovrebbe orientare il modo in cui pianifichi il budget per questo non è l'Indice. La ripartizione dei costi per attività di Artificial Analysis colloca Solar Mini 4 a circa $0,36 per attività dell'Intelligence-Index, e circa $0,30 di quella cifra — all'incirca l'82% — è costituito da scritture nella cache dei prompt. Le letture della cache costano $0,03 e l'output generato è solo $0,035. Il modello emette circa 88.300 token di output per attività, di cui circa 71.600 sono token di ragionamento. In altre parole: questo è un modello economico la cui bolletta è dominata dalla riscrittura di un lungo contesto, non dai token che restituisce. I costi per valutazione vanno da $1,63 per Terminal-Bench 4.0 fino a $0,95 per AA-Briefcase. La velocità mediana di output è di 198 token al secondo con un tempo al primo chunk di 1,58 secondi.
Il prezzo di ciascun percorso
Oggi Solar Mini 4 non è al prezzo di listino. La pagina dei prezzi di Upstage stessa ne riporta una scaletta con date: 0,03 $ per milione di input, 0,003 $ per quelli in cache e 0,12 $ in output — uno sconto di lancio del 70% — fino al 10 ottobre 2026 UTC, poi 0,05 $ / 0,005 $ / 0,20 $ dall'11 ottobre e infine il listino di 0,10 $ / 0,01 $ / 0,40 $ dal 23 ottobre. Il post di lancio di Upstage descrive lo sconto in modo più vago di quanto faccia il programma della pagina dei prezzi stessa; la scaletta sopra è la versione con le date, ed è quella su cui vale la pena pianificare. Notate dove si trova lo sconto più forte: l'input in cache scende a un decimo della tariffa di input, il che premia esattamente il carico di lavoro con contesto stabile a lungo per il quale il profilo di costo della scrittura in cache sopra riportato applica un addebito.
Il prezzo di Kolibri è un ordine di acquisto. Non c'è una tariffa per milione di token da confrontare perché non esiste un contatore in hosting: paghi GPU ed elettricità, e l'unico segnale pubblico di costo del fornitore è la run di addestramento stessa: circa 950 MWh per produrre il modello. Se possiedi già capacità di inferenza, il costo marginale per token di Kolibri si avvicina al costo dell'elettricità; se non la possiedi, il biglietto d'ingresso è una macchina con due A100 o superiore. È una forma di impegno fondamentalmente diversa da quella di un modello che puoi chiamare a milioni di token e smettere di chiamare domani, ed è la decisione reale che le due opzioni presentano.
Dove si sovrappongono, e dove il confronto non regge
• Calcolo attivo — quasi identico: 3,46B contro 3B per token
• Tutto ciò che ne segue — non comparabile, perché solo uno dei due ha prove verificate
• Miglior punteggio misurato — Solar Mini 4 ha un indice verificato di 24,05; Kolibri ha una tabella del fornitore e nessun punteggio verificato.
• Tedesco — Kolibri è l'unico dei due addestrato per questo, a 4,90 byte per token; Solar Mini 4 non lo elenca
• Coreano e giapponese — Solar Mini 4 li elenca entrambi; Kolibri non ne elenca nessuno
• Contesto lungo — Kolibri convalida ben 1.048.576 token; la documentazione di Solar Mini 4 dichiara 512K, mentre la sua scheda su Artificial Analysis riporta 1M, quindi considera il limite massimo come dipendente dal fornitore
• Tempo al primo token — Solar Mini 4 si misura in minuti, perché ti registri; Kolibri si misura in giorni, perché devi montare una macchina in rack
• Modello di costo — per token, decrescente con la scala di sconti, rispetto a capitale più energia
Il riassunto onesto è che questo non è un confronto che si risolve in una classifica. La tabella del fornitore di Kolibri include persino il proprio set di confronto — GLM-4.7 Flash 30B-A3B a 64,7 complessivo in inglese, Nemotron 3 Nano 30B-A3B a 65,6, Qwen3.5 35B-A3B a 74,7, Qwen3.6 35B-A3B a 71,4, Gemma 4 26B-A4B IT a 71,9, tutti contro il 75,5 di Kolibri stesso — e ognuna di quelle righe è un numero di Aleph Alpha stesso, eseguito dallo stesso laboratorio sul proprio harness. È una mappa utile dell'area dei modelli con 3B attivi. Non è una classifica indipendente.
Se quello che vuoi è un MoE con 3B attivi su una chiave oggi
Nessuno dei due modelli in questo confronto è su OrcaRouter, e vale la pena essere precisi sul perché. Kolibri non ha ancora alcun tipo di inferenza ospitata — sono pesi e una ricetta vLLM, quindi non c'è nulla a cui un router possa puntare. Solar Mini 4 è servito da Upstage e dal canale on-premises di Upstage stesso; non lo instradiamo, e non instradiamo alcun modello Upstage. Se vuoi l'uno o l'altro, lo ottieni direttamente dai fornitori.
Il route che offriamo è la classe circostante — la fascia sparsa di piccoli MoE all'interno della quale entrambi questi modelli competono. Gemma 4 26B-A4B IT è a catalogo a $0.06 in ingresso e $0.33 in uscita per milione di token, con una finestra di 262.144 token. Qwen3.5 35B-A3B è a $0.057 / $0.459 e Qwen3.6 35B-A3B a $0.248 / $1.485, con una finestra di 262.144 token e 65.536 token di output massimo. È lo stesso scambio che stanno facendo i due modelli qui sopra — una fetta attiva da 3B a 4B acquistata al prezzo di un modello piccolo — disponibile su una sola chiave API con il prezzo di listino del fornitore passato a markup 0%, così una variazione di prezzo del fornitore arriva sulla tua fattura lo stesso giorno in cui viene annunciata, anziché al rinnovo contrattuale successivo. Failover automatico conta qui più del solito: quando valuti un modello sparso non ancora collaudato, una seconda rotta dietro la stessa chiave è ciò che impedisce a un pomeriggio storto di trasformarsi in un'interruzione del servizio.

Cosa fare e cosa guardare
Scegli Kolibri se il tedesco o l’inglese sono il tuo carico di lavoro, se i dati non possono lasciare il tuo rack e se disponi — o sei disposto ad acquistare — delle GPU per servire 78B a FP8. In quella configurazione è l’unico di questi due modelli a essere persino un’opzione, e il contesto convalidato da 1M di token con un tokenizer tedesco da 4,90 byte per token è un vantaggio reale, anche se misurato dal fornitore. Scegli Solar Mini 4 se vuoi essere in produzione questa settimana, se il coreano o il giapponese sono in roadmap e se il tuo carico di lavoro è un contesto lungo e stabile che lo sconto sulla cache premia; prevedi un budget per le scritture nella cache, non per i token di output.
La domanda aperta è la stessa per entrambi, ed è una questione di prove più che di capacità. I 75,5 e 84,3 di Kolibri sono numeri di Aleph Alpha ottenuti sull'harness di Aleph Alpha, e finché un tracker indipendente non lo eseguirà, chiunque li citi sta citando il laboratorio. Il 24,05 di Solar Mini 4 è reale ed è stato riprodotto, ma l'Index è un'istantanea di un modello che è ancora a metà della scala di sconti, con i prezzi di listino che non arriveranno prima del 23 ottobre. Tenete d'occhio la prima valutazione indipendente di Kolibri, e osservate quanto costa davvero Solar Mini 4 una volta esaurita la scala di sconti — perché a $0,10 / $0,40 i conti economici del noleggio della fetta da 3B sono diversi dai $0,03 / $0,12 che vi vengono quotati oggi.
