Qwen 3.8 vs Kimi K3: I due giganti cinesi open-weight, testa a testa
Guides & Insights

Qwen 3.8 vs Kimi K3: I due giganti cinesi open-weight, testa a testa

Autore

jinhao song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Di tutti i modelli con cui Qwen 3.8 Max viene confrontato, Kimi K3 di Moonshot è il rivale più naturale: entrambi sono enormi modelli cinesi Mixture-of-Experts, entrambi sono di classe open-weight, entrambi sono notoriamente verbosi, approfonditi e lenti. Sono, di fatto, i due più grandi giganti del mondo open-weight cinese — e insolitamente, non dobbiamo indovinare come si confrontano, perché qualcuno li ha messi uno contro l'altro sullo stesso compito. Questo rende questo il confronto più ricco della serie: non rivendicazioni dei fornitori contro numeri verificati, ma un vero testa a testa.

Prima dei dettagli, una nota per i costruttori — il modo onesto per risolvere una rivalità così stretta è eseguire entrambi sul tuo carico di lavoro e osservare il compromesso tra completezza e velocità. OrcaRouter mette a disposizione più di 200 modelli dietro un unico endpoint compatibile con OpenAI, così puoi mettere Qwen 3.8 contro Kimi K3 sugli stessi prompt senza dover configurare due SDK.

TL;DR verdetto. Nell'unico confronto diretto che abbiamo (Trilogy AI, un compito di comprensione dell'architettura), Kimi K3 ha ottenuto 83/100 e Qwen 3.8 Max 80/100 — un margine stretto di 3 punti per Kimi. Ma Qwen era quella più *accurata*: 354 citazioni di repository contro 274, 22 richieste gateway contro 53, e zero chiamate a strumenti fallite contro due, al costo di una latenza più alta e più token. Entrambi hanno raggiunto il 90% di hit di cache e la stessa decisione architetturale di base. Oggi Kimi K3 è la scelta più sicura tra i modelli a pesi aperti — ha un punteggio certificato (57.1, #3 su Artificial Analysis), la corona del frontend Arena e pesi che sono essenzialmente disponibili. Qwen 3.8 è quello da tenere d'occhio: più ambizioso, più esaustivo nell'esplorazione, ma senza punteggio sulle classifiche pubbliche con pesi solo "in arrivo."

Punti chiave

•  Qwen 3.8 Max è un MoE da 2.4T parametri in anteprima; Kimi K3 è un MoE da 2.8T con contesto da 1M e visione nativa — il che significa che Qwen è circa 400B parametri in meno, un promemoria che un numero maggiore di parametri non equivale a una migliore qualità.

• Nell'unico test diretto (Trilogy AI), Kimi K3 ha superato Qwen da 80 a 83 nel complesso — ma Qwen ha fatto più citazioni di repo (354 contro 274), meno richieste gateway (22 contro 53), e ha avuto zero chiamate strumento fallite (contro due).

•  Kimi K3 ha un AA Intelligence Index certificato di 57.1 (#3) — dietro a Fable 5 e GPT-5.6 Sol, davanti a tutto il resto. Qwen 3.8 ha nessun benchmark indipendente.

•  Kimi K3 detiene anche il primo posto nella classifica frontend-code di LMArena (1679); Qwen 3.8 non è stato valutato nelle classifiche pubbliche.

• L'apertura è quasi paritaria, ma i tempi differiscono: i pesi di Kimi K3 sono aperti/promessi e essenzialmente pronti; quelli di Qwen 3.8 sono "coming soon" senza data, licenza o repository ancora.

I dati di Qwen 3.8 sono dichiarazioni del fornitore o impressioni iniziali e non controllate — non verificato in modo indipendente. I dati dell'indice e del prezzo di Kimi K3 sono attribuiti ad Artificial Analysis e potrebbero differire dai report di Moonshot. Il confronto diretto di Trilogy AI è un singolo compito, non una suite di benchmark completa. Il prezzo di anteprima di Qwen 3.8 è uno sconto temporaneo; verifica le tariffe prima di pianificare il budget.

Specifiche e prezzo, fianco a fianco

Ecco i dati concreti, ogni dato dei concorrenti attribuito alla propria fonte.

•  Produttore / stato — Qwen 3.8 Max: Alibaba; anteprima (19 luglio 2026); Kimi K3: Moonshot; rilascio open-weight

•  Architettura — Qwen 3.8 Max: ~2.4T totali, MoE sparso (parametri attivi non divulgati); Kimi K3: 2.8T MoE, visione nativa (fonte: Artificial Analysis)

•  Finestra di contesto — Qwen 3.8 Max: Segnalato ~1M tokens (non confermato ufficialmente); Kimi K3: 1M tokens (fonte: Artificial Analysis)

• AA Intelligence Index — Qwen 3.8 Max: Ancora nessun punteggio — non valutato; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / leaderboard — Qwen 3.8 Max: Non valutato pubblicamente; Kimi K3: Frontend-code #1, 1679 (LMArena)

• Prezzi (input / output) — Qwen 3.8 Max: Solo anteprima (~90% di sconto; API per token non pubblicata); Kimi K3: $3 / $15 per 1 milione (AA blended ~$2.31)

• Pesi aperti — Qwen 3.8 Max: Promesso "presto" (non rilasciato); Kimi K3: Peso aperto; pesi pronti/vicini

•  Velocità — Qwen 3.8 Max: Modello più lento testato (pratico); Kimi K3: Verboso e lento (~34s TTFT, per AA)

Due elementi incorniciano l'intero confronto. Primo, la cella vuota "AA Intelligence Index" per Qwen 3.8 è la storia: il 57.1 di Kimi K3 è il verdetto di un arbitro neutrale che lo colloca al #3 nel mondo, dietro solo a Fable 5 e GPT-5.6 Sol; la posizione di Qwen 3.8 si basa sull'inquadramento del venditore e su una manciata di esecuzioni pratiche. Secondo, nota l'inversione dimensionale — Qwen 3.8 (2.4T) è in realtà circa 400B parametri in meno rispetto a Kimi K3 (2.8T). Il modello di Alibaba è quello che le persone descrivono come "più grande in ambizione", ma sul conteggio grezzo dei parametri Kimi è il gigante più grande, ed è quello con il punteggio certificato a sostegno. Entrambi sono notoriamente verbosi e lenti, quindi la latenza è un pareggio; i veri fattori di differenziazione sono la prova e la disponibilità dei pesi, e oggi entrambi favoriscono Kimi.

L'unico vero scontro diretto che abbiamo

Questo è il raro confronto in cui non dobbiamo fare inferenze. Trilogy AI ha eseguito entrambi i modelli su un singolo compito di comprensione dell'architettura — leggere e ragionare su un codice reale — e ha pubblicato il confronto affiancato. Kimi K3 ha vinto nel punteggio principale, ma il comportamento sottostante racconta una storia più interessante.

•  Punteggio complessivo — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100

•  Citazioni repo — Qwen 3.8 Max: 354; Kimi K3: 274

•  Richieste gateway — Qwen 3.8 Max: 22; Kimi K3: 53

•  Chiamate di strumenti fallite — Qwen 3.8 Max: 0; Kimi K3: 2

•  Valutazione dell'uso degli strumenti — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10

• Tasso di hit della cache — Qwen 3.8 Max: >90%; Kimi K3: >90%

Leggi le colonne, non solo la riga superiore. Kimi K3 ha vinto con 3 punti, ma Qwen 3.8 è stato il lavoratore più meticoloso: ha citato 80 posti in più nel repository (354 contro 274), ha raggiunto la sua conclusione in molte meno richieste gateway (22 contro 53), ha effettuato zero chiamate a strumenti fallite contro le due di Kimi, e ha superato Kimi nella valutazione dell'uso degli strumenti (9 contro 8). Il compromesso è esattamente quello che ci si aspetterebbe dal carattere di Qwen altrove — esplora in modo esaustivo, il che comporta una latenza maggiore e più token totali. Fondamentalmente, entrambi i modelli hanno preso la stessa decisione architetturale di base, quindi non è che uno abbia ragione e l'altro torto; è che Kimi arriva a una risposta leggermente più votata più velocemente, e Qwen ci arriva con più prove e una disciplina degli strumenti più pulita. Se il tuo lavoro premia un'esplorazione esaustiva e ben citata, il profilo di Qwen è interessante; se vuoi l'opzione provata e più veloce per la risposta, Kimi ha vinto il round.

Domande frequenti

Qwen 3.8 è meglio di Kimi K3?

Non sulla base delle prove esistenti oggi. Nel confronto diretto (Trilogy AI), Kimi K3 ha ottenuto 83/100 contro 80/100 di Qwen, e Kimi ha un Artificial Analysis Index certificato di 57.1 (#3) oltre alla corona dell'arena frontend-code, mentre Qwen 3.8 non ha alcun punteggio indipendente. Il vantaggio di Qwen era la completezza — più citazioni di repository (354 contro 274), meno richieste gateway e zero chiamate di strumenti fallite — ma questo è un vantaggio di stile, non un comprovato vantaggio di capacità.

Qwen 3.8 è più grande — questo lo rende migliore?

No, ed è in realtà il contrario per quanto riguarda le dimensioni: Qwen 3.8 ha circa 2.4T di parametri contro i circa 2.8T di Kimi K3, quindi Kimi è il più grande dei due di circa 400B. Un numero maggiore di parametri non equivale comunque a una migliore qualità — Kimi è sia più grande che con punteggi più alti, il che è un chiaro promemoria che l'architettura, l'addestramento e la messa a punto contano più del numero grezzo di parametri.

Come si confrontano i prezzi?

Kimi K3 è un modello pubblicato, durevole $3 / $15 per 1M token (Artificial Analysis lo media a circa $2,31). L'anteprima di Qwen 3.8 è fortemente scontata (circa il 90% di sconto) ma non ha un prezzo API per token pubblicato e lo sconto è temporaneo, quindi un confronto stabile dei prezzi non è ancora possibile. Per la pianificazione del budget oggi, Kimi è quello con un numero reale.

Qual è la scelta open-weight migliore?

Entrambe sono di classe open-weight, ma i tempi differiscono. I pesi di Kimi K3 sono aperti e sostanzialmente pronti; quelli di Qwen 3.8 sono promessi "in arrivo" senza data, licenza o repository pubblicati. Se i pesi aperti sono il motivo per cui ne scegliete uno, Kimi è la scelta su cui potete agire ora.

Quale dovrei usare oggi?

Kimi K3 è la scelta predefinita più sicura: ha ottenuto un punteggio (#3), i pesi sono pronti e ha vinto il confronto diretto. Opta per Qwen 3.8 quando apprezzi un'esplorazione esaustiva e ben citata e un uso pulito degli strumenti rispetto alla velocità, e consideralo come quello da tenere d'occhio per quando i suoi pesi saranno disponibili e arriverà un punteggio indipendente.

Il risultato finale

Qwen 3.8 vs Kimi K3è la cosa più vicina che questa serie ha a uno scontro leale: due giganti cinesi a pesi aperti, entrambi verbosi, entrambi accurati, entrambi lenti. Kimi K3 vince il round oggi perché vince le cose che determinano l'adozione — una posizione #3 verificata, la corona del frontend Arena, un prezzo pubblicato, e pesi che sono pronti — e ha superato Qwen da 80 a 83 nell'unico vero confronto diretto. Ma quel confronto mostra anche perché Qwen 3.8 merita attenzione: è stato il modello più meticoloso, citando più parti del codebase, usando meno richieste, e facendo zero chiamate a strumenti fallite. Se un'esplorazione esaustiva è ciò che il tuo lavoro premia, e se Alibaba pubblica i pesi e un punteggio indipendente si colloca vicino alla cima, questa rivalità potrebbe capovolgersi. Fino ad allora, Kimi K3 è la scelta più sicura tra i pesi aperti, e Qwen 3.8 è lo sfidante da testare con i tuoi stessi prompt.


© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube