Card hero generata per Kolibri vs Qwen 3.8, intitolata "Kolibri vs Qwen 3.8" con il sottotitolo "servizio tedesco sovrano contro una famiglia cinese aperta", un'icona di colibrì a sinistra e il contorno di una nuvola a destra, ai due lati di un sottile divisore. Il logo OrcaRouter si trova nella striscia sotto la grafica.
Guides & Insights

Kolibri vs Qwen 3.8: il modello tedesco perde sulla propria tabella, ed è proprio questo il punto

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cominciamo dalla frase che quasi tutta la copertura del lancio di Kolibri ha omesso. Nella tabella di benchmark che Aleph Alpha ha pubblicato insieme al proprio modello il 3 ottobre 2026, il modello con cui viene confrontato più spesso non è un rivale europeo né uno americano. È Qwen3.8 27B, il tier open-weight di quella generazione del fornitore, rilasciato il 13 agosto 2026 — e, secondo i numeri della stessa Aleph Alpha, vince. Qwen3.8 27B ottiene 80,2 sulla media inglese e 79,9 sulla media tedesca della stessa suite di valutazione che assegna a Kolibri 75,5 e 70,8. È in testa su GPQA Diamond, 89,2 contro 84,3. È in testa su LiveCodeBench v6, 93,8 contro 85,9. È in testa su SWE-Bench Verified, 72,6 contro 66,4, e su entrambi i benchmark a contesto lungo, 76,9 contro 64,5 su LongBench Pro e 81,3 contro 68,3 su AA-LCR. Un modello cinese dense da 27 miliardi di parametri, valutato da un laboratorio tedesco, batte il modello di punta da 78 miliardi di parametri di quel laboratorio su gran parte della sua stessa tabella. Non è uno scandalo. È il fatto più utile del lancio, perché impone la domanda su a cosa serva davvero Kolibri.

Un chiarimento prima che il confronto vada oltre, perché "Qwen 3.8" indica una famiglia più che un modello, e qui le distinzioni contano. Qwen3.8-Max è il modello di punta ospitato di Alibaba, attivo dal 3 agosto 2026 con una finestra di contesto da 1M token a 2,00 $ per milione di token di input e 6,00 $ di output. Qwen3.8-27B è la fascia open-weights, rilasciata il 13 agosto 2026 con una finestra da 262.144 token. Qwen3.8-Flash è la fascia di volume, rilasciata il 26 agosto 2026 con la finestra da 1M token e prezzi molto più bassi. E il semplice Qwen3.8 — annunciato il 19 luglio 2026 come modello di punta open-weight da 2,4 trilioni di parametri — non è stato rilasciato; esiste come pagina di monitoraggio del catalogo e come annuncio. Tutto quanto segue riguarda quello con i pesi che puoi scaricare ed eseguire, cioè il 27B.

Dove Kolibri vince davvero, ricavato dalla stessa tabella

Le righe in cui Kolibri supera Qwen3.8 27B non sono sparse a caso. Si raggruppano, e il raggruppamento è il prodotto.

• Astensione — su RGB Negative, Kolibri ottiene 85,6 contro 70,6. Quando il contesto non contiene la risposta, Kolibri lo dichiara molto più spesso.

• Invocazione di strumenti sotto vincolo — su τ²-bench telecom, 94,7 contro 82,5; sulla suite verticale per fornitori automobilistici, 99,0 contro 97,3.

• Contesto molto lungo — su SealQA senza distrattori oltre i 24k token, 100,0 contro 94,4.

Economia del serving in tedesco — un tokenizer bilingue a 4,90 byte medi per token su testo web tedesco, contro 4,17 per la famiglia Qwen3.5–3.8 secondo la misurazione di Aleph Alpha stessa. Meno token per documento tedesco equivalgono a una riduzione diretta dei costi di inferenza che si vede in fattura e in nessuna riga di benchmark.

Tre di quei quattro riguardano il comportamento più che la capacità. L'astensione, le chiamate a strumenti vincolate e il recupero con grounding su contesti lunghi sono ciò che si richiede a un modello che legge il materiale della propria organizzazione e da cui ci si aspetta che ammetta quando il materiale non risponde alla domanda. Aleph Alpha ha costruito l'intero rilascio attorno a questa scommessa, e la tabella mostra che la scommessa sta dando i suoi frutti.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Le righe in cui Qwen3.8 27B vince riguardano l'ampiezza: conoscenza in entrambe le lingue, domande scientifiche di livello post-laurea, programmazione competitiva, ingegneria del software a livello di repository, comprensione di documenti lunghi. Se la tua esigenza è un modello generale forte a un basso prezzo per token con pesi aperti, Qwen3.8 27B è il modello migliore e la tabella lo dice con l'inchiostro dello stesso fornitore.

Quella lettura è corroborata là dove quella di Kolibri non lo è. Artificial Analysis ha misurato Qwen3.8 27B in modo indipendente, nella sua configurazione di ragionamento Xhigh, e riporta un Intelligence Index di 34, al primo posto tra i 142 modelli di quel confronto, 45,4 token di output al secondo, un contesto di 256.000 token e una licenza Apache 2.0. La loro nota è poco lusinghiera in un modo ormai familiare — molto verboso, con 200 milioni di token generati durante la valutazione dell'indice contro una mediana di 82 milioni, e lento — ma il punteggio in sé è una misurazione di terze parti dell'avversario. Kolibri non ha alcuna pagina su Artificial Analysis. Quindi il modello più forte in questo confronto è stato verificato in modo indipendente e quello più debole è parola del fornitore: l'opposto di come viene di solito presentato un flagship europeo di prima generazione.

Due tipi di dichiarazione sulla catena di fornitura, orientate in direzioni opposte

Entrambi questi rilasci sono argomentazioni su da dove proviene un modello, e le argomentazioni sono immagini speculari.

Il caso di Aleph Alpha è la provenienza come funzionalità. Kolibri è stato addestrato da team tedeschi su infrastrutture in Germania e Finlandia, ai sensi del diritto UE e tedesco. La scheda divulga il mix di pre-addestramento — 20 trilioni di token a circa il 62,5% di inglese, il 23,9% di tedesco e il 13,6% di codice — i budget di mid-training e long-context, il calcolo esatto: 768 NVIDIA B200 su 96 nodi HGX per 21 giorni, e una stima di 9,5×10² MWh di energia inclusi i costi generali del data center. Dichiara il metodo di addestramento fin nel dettaglio dei layer: un transformer mixture-of-experts a 50 strati con una ripartizione 4:1 tra sliding-window e grouped-query attention, Muon ed Exact Quantile Balancing su 384 esperti con 1 condiviso e 6 routed. Dodicimila parole di divulgazioni allegate a un download di 78 GB, e una posizione dichiarata come firmatario sul Codice di pratica per l'IA per scopi generali dell'UE.

Il caso di Alibaba è diverso per natura: non "possiamo rendere conto di ogni decisione" ma "ecco i pesi, prendeteli". Pesi aperti con licenza Apache a una scala e una qualità che hanno reso Qwen il default di fatto in tutto il mondo, un vocabolario di 248.077 token che copre ben oltre cento lingue, e un ecosistema di serving che è stato ottimizzato attorno a quei checkpoint per un tempo sufficientemente lungo da far sì che quasi ogni stack di inferenza li supporti out of the box. L'argomento della sovranità lì riguarda la disponibilità: nessun fornitore può ritirare il modello, perché hai già il file.

Entrambe le affermazioni sono oneste e rispondono a paure diverse. Un acquirente del settore pubblico in Baden-Württemberg è preoccupato per la giurisdizione e l'auditabilità, e Kolibri è rivolto proprio a questa preoccupazione. Un gruppo di ricerca a Nairobi o São Paulo è preoccupato dal fatto che un modello sia bloccato dietro una carta di credito, in una valuta con cui non possono pagare, e i pesi aperti di Qwen rispondono a quest'ultima preoccupazione. Ciò che non è onesto è far finta che una delle due sia un confronto di capacità, perché la tabella delle capacità ha già dato la sua risposta.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Il divario di licenze è reale ma più ristretto di quanto sembri

Kolibri è Apache 2.0. Qwen3.8 27B è open weights con licenza Apache. Entrambi non prevedono clausole di acceptable use, né soglie di utenti attivi mensili, né termini commerciali separati — il che li colloca in un gruppo ristretto e significa che nessuno dei due richiede una revisione legale prima dell'uso commerciale.

Ciò che li separa è tutto ciò che segue la licenza. Kolibri arriva con un plugin vLLM e un pacchetto parser forniti dal fornitore, un'immagine container, quattro livelli di sforzo di ragionamento configurabili tramite il chat template, un comportamento di astensione esplicito e una configurazione di campionamento consigliata. Qwen3.8 27B arriva come pesi che Transformers, vLLM e SGLang sanno già servire, con un formato di chiamata degli strumenti a cui l'ecosistema più ampio ha avuto mesi per adattarsi.

L'hardware di deployment differisce lungo le stesse linee. I pesi FP8 di Kolibri occupano circa 78 GB e richiedono come minimo due schede A100 da 80 GB, due H100 SXM5, una H200, una B200 o una B300. Qwen3.8 27B in bfloat16 è all'incirca 54 GB di pesi, ovvero un singolo acceleratore da 80 GB a precisione piena oppure una build quantizzata su molto meno. Il modello tedesco costa più hardware e restituisce meno benchmark in cambio. È uno scambio svantaggioso solo se stavi comprando benchmark.

Cosa ti dicono e non ti dicono i cartellini dei prezzi

Kolibri non ha un prezzo, perché Aleph Alpha non vende inferenza per Kolibri. Il rilascio consiste in pesi, un rapporto tecnico e una card; non esiste alcuno SKU ospitato. Qualunque cifra di costo per Kolibri è un calcolo di ammortamento dell'hardware che devi fare da te.

Qwen3.8 ha un prezzo pubblico su tre fasce, e quella intermedia è quella che conta per un team che confronta l'hosting in proprio con l'affitto.

• Qwen3.8-Max — 2,00 $ per milione di token in input e 6,00 $ in output, contesto di 1M di token, letture dalla cache a 0,25 $, rilasciato il 3 agosto 2026.

• Qwen3.8-27B — $0,33 in input e $2,40 in output, contesto di 262.144 token, rilasciato il 13 agosto 2026. Questi sono i pesi aperti, quindi questo prezzo è quello che paghi se preferisci non eseguirli.

• Qwen3.8-Flash — $0,15 per l'input e $0,47 per l'output con la finestra da 1M token, rilasciato il 26 agosto 2026.

Quelli sono i prezzi di listino dei provider su OrcaRouter, riportati tal quali senza nulla aggiunto per token, che è la proprietà utile quando la domanda è se un deployment self-hosted si ripaga da solo: puoi misurare il tuo volume reale di token sui tier ospitati prima di impegnarti nell'hardware. Non aggiungiamo un margine, quindi un taglio di prezzo di un fornitore è attivo dalla nostra parte lo stesso giorno. Tutti e tre i tier di Qwen3.8 sono instradabili oggi su una chiave compatibile con OpenAI con failover automatico tra provider, e il prossimo Qwen3.8 da 2,4 trilioni di parametri ha una pagina di catalogo in attesa dei pesi, invece di un segnaposto che finge di servirli.

Kolibri non è instradabile. Abbiamo sondato il catalogo con ogni grafia di fornitore e modello ed è assente — quindi l'unico modo per chiamarlo è il download da 78 GB. Se vuoi sapere quanto costerebbe il modello tedesco per il tuo carico di lavoro, la risposta è un rack e una persona in grado di eseguire vLLM, e attualmente nessuna terza parte può farti un preventivo per qualcos'altro.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Chi dovrebbe comprare cosa

La decisione non verte sulla qualità, perché tale questione è già stata risolta dalla tabella del fornitore stesso a favore di Alibaba. Verte su quale rischio ci si sta assicurando.

• Scegli Kolibri se il vincolo determinante è la giurisdizione, la documentazione sulla provenienza o l'auditabilità — se devi essere in grado di rispondere a dove sono provenuti i dati di addestramento, dove è stato eseguito il calcolo e in base a quale legge, e se il carico di lavoro è costituito da documenti tedeschi e inglesi elaborati all'interno del tuo perimetro. Per questo paghi un sovrapprezzo di capacità, e il sovrapprezzo è visibile nella tabella sopra.

• Scegli Qwen3.8 27B se il vincolo limitante è la capacità per dollaro, l’ampiezza linguistica o il supporto dell’ecosistema. È il modello più forte secondo la valutazione di Aleph Alpha stessa, è con licenza Apache, funziona su un solo acceleratore e i livelli ospitati partono da $0,33 per milione di token di input se preferisci non eseguirlo affatto.

• Considera entrambi nella stessa architettura se il carico di lavoro ha un nucleo regolamentato e una periferia generale. I documenti che non possono lasciare l'edificio vanno a un endpoint Kolibri self-hosted; il lavoro di riepilogo, traduzione e codice va a un tier Qwen3.8 instradato a un terzo di centesimo per mille token. Una chiave API, una regola di routing, i prezzi di listino del provider passati attraverso, e il failover gestito per te — il che è un accordo considerevolmente più utile che scegliere uno di questi due e far finta che l'altro non esista.