
Qwen 3.8 vs Kimi K3: due giganti cinesi, e ora uno è più economico
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Questi sono i due modelli cinesi di frontiera più importanti del 2026, e sono cugini stretti: entrambi enormi sistemi sparse Mixture-of-Experts, entrambi con contesto da 1M token, entrambi multimodali, entrambi con pesi open promessi. Kimi K3 di Moonshot è in realtà il più grande dei due, con 2,8T di parametri totali contro i 2,4T di Qwen — un utile promemoria che il numero di parametri non è una classifica.
Fino al 3 agosto 2026 questo confronto era sbilanciato in un modo specifico: Kimi K3 aveva un Artificial Analysis Intelligence Index certificato di 57.1, un ranking #1 LMArena per il codice frontend, prezzi pubblicati e pesi distribuiti, mentre Qwen3.8-Max aveva un titolo da 2.4T e nient'altro. La GA ha cambiato decisamente l’economia del confronto. Qwen ora pubblica $2 / $6 per milione di token contro i $3 / $15 di Kimi — il che rende il modello più grande e più collaudato anche il più caro, con un ampio margine.
Una nota per gli sviluppatori — il modo più rapido per risolvere la questione è eseguirli entrambi sui tuoi stessi prompt. OrcaRouter offre oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, così puoi mettere Qwen 3.8 Max contro Kimi K3 sullo stesso compito senza dover integrare due SDK.
TL;DR: verdetto. Kimi K3 vince ancora per le prove: un AA Intelligence Index certificato di 57,1 (#3), il primo posto di LMArena per il frontend-code a 1679, e pesi aperti che sono davvero pronti. Qwen3.8-Max non è ancora stato valutato da nessun valutatore indipendente. Ma GA ha dato a Qwen due vantaggi concreti. Sul prezzo, ora è sostanzialmente più economico — $2 / $6 contro $3 / $15, il che significa 2,5× in meno sull'output. E nell'unico test testa a testa di terze parti esistente, Qwen ha perso il punteggio principale 80 a 83 pur essendo l'agente dal comportamento visibilmente migliore: 354 citazioni di repository contro 274, 22 richieste gateway contro 53 e zero chiamate di strumenti fallite contro due. Kimi per la qualità certificata; Qwen per un'esecuzione agentica più economica e pulita.
Punti chiave
• Kimi K3 è il modello più grande — 2.8T MoE contro i 2.4T di Qwen, circa 400B in più — il che è un buon argomento contro il considerare il numero di parametri come indicatore delle capacità.
• Qwen3.8-Max è in GA dal 3 agosto 2026 a $2 / $6 per 1M flat, contro i $3 / $15 di Kimi K3 (AA blended ~$2,31). Qwen ora è 2,5× più economico in output.
• Kimi K3 detiene la posizione certificata: AA Intelligence Index 57.1 (#3), dietro solo a Fable 5 e GPT-5.6 Sol, più LMArena frontend-code #1 (1679). Qwen3.8-Max è ancora senza punteggio.
• Nell'unico test diretto (Trilogy AI), Kimi ha superato di poco Qwen 83 a 80 complessivamente — ma Qwen ha fatto più citazioni di repo (354 vs 274), meno richieste gateway (22 vs 53), e ha avuto zero chiamate di strumenti fallite (vs due), con una valutazione dell'uso degli strumenti di 9/10 rispetto all'8/10 di Kimi.
• Qwen ora riporta numeri agentici e di coding: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (rispetto al 40.7 del predecessore) — tutti riportati da Alibaba.
• I tempi di apertura favoriscono ancora Kimi: i suoi pesi sono essenzialmente pronti; quelli di Qwen sono promessi entro la settimana, senza ancora licenza né repository.
Nota sull'accuratezza: tutti i dati sulla qualità di Qwen3.8-Max sono dichiarati da Alibaba e non verificati da terze parti. I dati di Kimi K3 provengono da Artificial Analysis e LMArena. Il confronto testa a testa è un singolo test di Trilogy AI e va considerato come un singolo dato, non come una classifica generale. Il prezzo di Qwen è quello del listino GA e sostituisce lo sconto di anteprima di luglio.
Specifiche e prezzo, fianco a fianco
Ecco i dati concreti, con ogni cifra attribuita alla sua fonte.
• Produttore / stato — Qwen3.8-Max: Alibaba; GA (3 agosto 2026); Kimi K3: Moonshot; rilascio open-weight
• Architettura — Qwen3.8-Max: ~2.4T totali, MoE sparso (parametri attivi ancora non rivelati); Kimi K3: 2.8T MoE, visione nativa (Artificial Analysis)
• Finestra di contesto — Qwen3.8-Max: 1M token (983,616 con thinking; output massimo 131,072); Kimi K3: 1M token (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: ancora senza punteggio; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / classifica — Qwen3.8-Max: Non valutato pubblicamente; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Punteggi dichiarati dal fornitore — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (dichiarato da Alibaba); Kimi K3: posizionamento misurato da terze parti
• Prezzi (in / out) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fisso; input in cache $0.25; Kimi K3: $3 / $15 per 1M (AA miscelato ~$2.31), cache hit $0.30
• Pesi aperti — Qwen3.8-Max: Promesso entro la settimana (nessuna licenza ancora); Kimi K3: Pesi aperti; pesi pronti
• Velocità — Qwen3.8-Max: p50 TTFT 1.64s (telemetria a 7 giorni di OrcaRouter); Kimi K3: verboso e lento (~34s TTFT, secondo AA)
Due cose inquadrano questo confronto, e una di esse si è completamente invertita il 3 agosto.
Innanzitutto, il rapporto di prezzo si è invertito. Fino a luglio, Kimi K3 era il modello con un prezzo reale e Qwen era il modello con un coupon di sconto. Ora entrambi pubblicano le tariffe, e il modello più collaudato e più grande è quello più caro: $3 / $15 contro $2 / $6. In output — dove il ragionamento e la generazione di codice spendono i loro soldi — Kimi costa 2,5× in più. Qwen applica anche una tariffa fissa su tutto il suo contesto da 1 milione di token, e il suo input in cache a $0,25 è leggermente inferiore al tasso di cache-hit di Kimi, pari a $0,30. Per qualsiasi carico di lavoro ad alto volume, la convenienza economica di Qwen è ora chiaramente migliore.
In secondo luogo, il divario di prove è rimasto invariato, ed è il motivo per cui Kimi vince ancora. L'Intelligence Index di 57.1 di Kimi K3 lo colloca al terzo posto assoluto, dietro solo a Fable 5 e GPT-5.6 Sol — questo è il verdetto di un valutatore neutrale. Il suo primo posto in LMArena frontend-code con 1679 è un risultato crowdsourced da molti confronti alla cieca. Il Terminal-Bench 86.6 e il GPQA Diamond 92.6 di Qwen sono numeri reali, ma provengono da Alibaba stessa, su un harness che nessun altro ha eseguito. Un utile riferimento: il predecessore Qwen3.7-Max ha ottenuto 46 sull'indice AA contro i 57.1 di Kimi, quindi Qwen ha bisogno di un grande salto generazionale solo per pareggiare.
C'è anche un dettaglio sulla latenza che merita attenzione, perché va contro la narrazione abituale. Artificial Analysis misura Kimi K3 a circa 34 secondi di tempo al primo token — davvero lento. La telemetria GA di OrcaRouter mostra Qwen3.8-Max con un TTFT p50 di 1,64 secondi. Queste misurazioni provengono da fonti diverse e non sono un confronto controllato, ma complicano l'ipotesi dell'era di anteprima secondo cui Qwen sarebbe quello lento della coppia.

L'unico test testa a testa, leggilo attentamente.
Questo è l'unico confronto nella serie in cui una terza parte ha messo entrambi i modelli l'uno contro l'altro sullo stesso compito, il che lo rende degno di essere letto attentamente piuttosto che di essere ridotto a un vincitore.
Trilogy AI ha eseguito un compito di comprensione architetturale — comprendere un repository reale e raggiungere una corretta conclusione architetturale — e ha valutato i risultati:
• Punteggio complessivo — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Citazioni repo — Qwen3.8-Max: 354; Kimi K3: 274
• Richieste gateway — Qwen3.8-Max: 22; Kimi K3: 53
• Chiamate a strumenti non riuscite — Qwen3.8-Max: 0; Kimi K3: 2
• Valutazione uso strumenti — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Tasso di hit della cache — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi ha vinto il punteggio principale per tre punti. Ma guarda le colonne di processo, perché per l'ingegneria agentica contano più del punteggio. Qwen è giunta alla stessa conclusione architetturale di base utilizzando meno della metà delle richieste gateway producendo il 29% in più di citazioni di grounding e — il dettaglio che dovrebbe interessare chiunque costruisca agenti — zero chiamate di strumenti fallite contro le due di Kimi.
{{1}}Le chiamate agli strumenti fallite sono ciò che realmente compromette gli agenti di produzione.{{/1}} Si susseguono a cascata: una chiamata malformata produce un errore che il modello deve interpretare, {{2}}che consuma turni,{{/2}} che rischia di causare ulteriori errori. {{3}}Un modello che effettua 22 richieste pulite mentre un altro ne effettua 53 con due fallimenti è più economico e più prevedibile da gestire, anche se ottiene tre punti in meno sulla risposta.{{/3}} {{4}}Combinato con il tasso di output di Qwen più conveniente di 2,5×,{{/4}} {{5}}l'economia operativa di quella esecuzione favorisce sostanzialmente Qwen.{{/5}}
L'avvertenza è che si tratta di un solo compito, un solo valutatore, una sola esecuzione. Non è una suite di benchmark e non generalizza. L'indice 57.1 di Kimi e il ranking frontend #1 si basano su molte più prove di quante ne offra questo singolo test. La conclusione corretta è limitata: su almeno un compito agentico realistico, Qwen è stato l'utente di strumenti più disciplinato, pur perdendo leggermente in qualità di output.

Costo in pratica: esecuzioni agentiche in volume
Prendi un agente di analisi dei repository: 250.000 token di contesto di codice per esecuzione, 12.000 token di output.
• Qwen3.8-Max: 0,25M × $2 = $0,50, più 0,012M × $6 = $0,072. ≈ $0,57 per esecuzione.
• Kimi K3: 0.25M × $3 = $0.75, più 0.012M × $15 = $0.18. ≈ $0.93 per esecuzione.
• A 1.500 esecuzioni/giorno: Qwen ≈ $858/giorno; Kimi ≈ $1.395/giorno — circa $16.000/mese di differenza.
• Con la cache su un repository stabile: l'input in cache di Qwen a $0,25/1M porta l'esecuzione a ≈ $0,14; il tasso di cache hit di Kimi a $0,30 la porta a ≈ $0,26.
Il divario è reale a entrambe le estremità, e il risultato Trilogy lo amplifica: se Qwen usa davvero meno della metà delle richieste gateway per completare un lavoro comparabile, la differenza di costo effettivo sui compiti agentici è più ampia di quanto suggerisca il solo listino prezzi.
Entrambi i modelli fatturano i token di ragionamento come output, quindi le configurazioni che richiedono molto reasoning costano più della stima ingenua da entrambe le parti — ma la tariffa di $6 di Qwen rende quella penalità 2,5 volte più piccola.
Apertura: quasi parità, tempistiche diverse
Questo è l'asse su cui i due sono più simili e la differenza è puramente una questione di prontezza. I pesi di Kimi K3 sono aperti e sostanzialmente pronti. Quelli di Qwen3.8-Max sono promessi entro la settimana, senza testo di licenza, scheda del modello o repository ancora — ed è la licenza che determina se puoi usare un modello a livello commerciale.
In pratica, nessuno dei due modelli di punta è auto-ospitabile da un team normale. Qwen a 2,4T è di circa 1,2TB in 4-bit contro circa 141GB per H200; Kimi a 2,8T è ancora più grande. Entrambi richiedono otto o più acceleratori di fascia alta, e il numero di parametri attivi non divulgato da Alibaba significa che non puoi nemmeno modellare il throughput di Qwen.
Ecco perché il contemporaneamente annunciato Qwen3.8-27B è importante qui. Inoltre, passando a pesi aperti e funzionando, secondo quanto riportato, con circa 17GB di VRAM, offre alla famiglia Qwen una vera proposta on-premise che né il modello di punta da 2.4T né quello da 2.8T fornisce. Se i pesi aperti sono la tua ragione effettiva per scegliere tra questi due, il 27B cambia le carte in tavola più di quanto faccia ciascuno dei due giganti.
Domande frequenti
Qwen 3.8 è meglio di Kimi K3?
Non sulla base di prove certificate. Kimi K3 detiene un indice AA Intelligence Index indipendente di 57,1 (#3) e il primo posto di LMArena per il codice frontend, mentre Qwen3.8-Max rimane senza punteggio da parte di ogni valutatore terzo. Nell'unico test diretto disponibile Kimi ha vinto 83 a 80. I vantaggi di Qwen sono il prezzo (output 2,5× più economico) e, nello stesso test, un uso più pulito degli strumenti.
Quale modello è più grande?
Kimi K3, con 2,8 trilioni di parametri totali contro i 2,4 trilioni di Qwen3.8-Max — circa 400 miliardi in più. Nessuno dei due, però, rivela abbastanza perché ciò sia significativo: Alibaba non ha mai pubblicato il numero di parametri attivi di Qwen, che è il dato che determina effettivamente il costo di servizio in un modello Mixture-of-Experts.
Qual è più economico?
Qwen3.8-Max, chiaramente, dalla GA. Offre $2 / $6 per 1M contro i $3 / $15 di Kimi K3 — il 33% in meno sull'input e 2,5× in meno sull'output. La tariffa di Qwen è piatta su tutto il contesto di 1M, e il suo input in cache a $0,25 batte leggermente il tasso di cache-hit di Kimi a $0,30.
Cosa ha mostrato realmente il test testa a testa?
Il compito di comprensione dell'architettura di Trilogy AI ha assegnato a Kimi 83 e a Qwen 80. Ma Qwen ha prodotto 354 citazioni di repository contro le 274 di Kimi, ha utilizzato 22 richieste gateway contro 53, ha registrato zero chiamate agli strumenti fallite contro due, e ha ottenuto 9/10 sull'uso degli strumenti contro l'8/10 di Kimi. Kimi ha fornito la risposta migliore; Qwen è stato l'agente più disciplinato. È un solo compito, quindi trattalo come un dato isolato piuttosto che come una classifica.
Qwen 3.8 Max è uscito dall'anteprima?
Sì, il 3 agosto 2026, con un listino prezzi pubblicato e un endpoint compatibile con OpenAI e DashScope. La campagna crediti Qoder di luglio non descrive più come viene venduto.
Quale è più veloce?
Probabilmente ora Qwen, che ribalta l'assunzione dell'era di anteprima. Artificial Analysis misura Kimi K3 a circa 34 secondi di tempo al primo token; la telemetria GA di 7 giorni di OrcaRouter mostra Qwen3.8-Max con una TTFT p50 di 1,64 secondi. Fonti diverse e non un confronto controllato, ma entrambi i modelli hanno la reputazione di essere verbosi, e la TTFT misurata di Kimi è davvero lenta.
Posso auto-ospitare uno dei due?
Non realisticamente su scala di punta: i modelli da 2.4T e 2.8T richiedono otto o più GPU di classe H200. I pesi di Kimi sono pronti oggi; quelli di Qwen sono promessi entro la settimana, ma senza ancora una licenza. Per una vera opzione on-premise, il Qwen3.8-27B annunciato contestualmente (presumibilmente ~17GB di VRAM) è la scelta pratica nella famiglia Qwen.
Il risultato finale
Qwen 3.8 vs Kimi K3 è il confronto più ravvicinato di questa serie, e la disponibilità generale lo ha diviso nettamente lungo due assi. Kimi K3 mantiene la corona della qualità in virtù di ciò che un arbitro ha misurato: 57.1 sull'Intelligence Index, terzo complessivo, e il primo posto di LMArena per il codice frontend. Queste non sono affermazioni — sono risultati, e Qwen non ha nulla di equivalente.
Quello che Qwen ha vinto il 3 agosto è la partita dei costi, e l'ha vinta in modo netto: {{1}}$2 / $6 contro $3 / $15, prezzo piatto su un milione di token, con caching leggermente più economico{{/1}}. Aggiungete il risultato di Trilogy secondo cui Qwen ha completato un compito agentico comparabile con la metà delle richieste gateway e zero chiamate di strumenti fallite, e Qwen appare come il modello operativamente più efficiente anche laddove è quello meno accurato. Osservate due eventi: {{2}}il primo punteggio indipendente dell'Intelligence Index per Qwen3.8-Max e il rilascio dei pesi con una licenza{{/2}}. Se Qwen ottiene un punteggio anche solo vicino al 57.1 di Kimi, il divario di prezzo rende molto difficile giustificare Kimi per attività ad alto volume. Fino ad allora, Kimi è il modello di cui ti fidi e Qwen è quello che puoi permetterti di eseguire — e il modo onesto di scegliere è sui tuoi repository.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
