
Qwen 4 Max vs Kimi K3: la promessa open-weights incontra la consegna open-weights
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Moonshot AI ha rilasciato Kimi K3 il 16 luglio 2026 e poi ha fatto la cosa di cui la maggior parte dei laboratori parla soltanto: ha pubblicato i pesi. Il checkpoint da 2,8 trilioni di parametri è arrivato il 27 luglio 2026 con licenza Modified MIT, undici giorni dopo il lancio. Nel frattempo, la conferenza Yunqi del 22 settembre 2026 è stata usata per annunciare Qwen 4 Max come flagship di una famiglia Qwen 4 a quattro livelli che include un Qwen 4 27B a pesi aperti — un livello promesso, non distribuito. Questi due fatti sono il confronto. Tutto il resto su Qwen 4 Max è attualmente sconosciuto, e il divario tra un livello aperto promesso e uno consegnato è dove questo testa a testa ha effettivamente qualcosa da dire.
Cosa ha messo sul tavolo Kimi K3 a luglio
Kimi K3 è un mixture-of-experts da 2,8 trilioni di parametri che attiva 16 esperti su 896 per token, mettendo all'opera circa 104 miliardi di parametri a ogni singolo passaggio. Dispone di una finestra di contesto di 1.048.576 token sia sul lato di input sia su quello di output e accetta input di testo, immagini e video con output testuale. La sua API first-party è quotata a 3,00 $ per milione di token di input, 15,00 $ per milione di token di output e 0,30 $ per milione di token di input in cache, mentre le tariffe di terze parti sono inferiori.
L'architettura è la parte che la stessa anteprima di Alibaba riecheggia. Kimi K3 si basa su Kimi Delta Attention e Attention Residuals, che secondo Moonshot garantiscono un'efficienza di scaling migliore di circa 2,5 volte rispetto a Kimi K2 e una decodifica fino a 6,3 volte più veloce con contesti da un milione di token. È lo stesso problema a cui punta QSA di Qwen — rendere l'attenzione sostenibile a lunghezze estreme — il che significa che le due famiglie non competono tanto sulla scala quanto su quale design di attenzione sparsa invecchia meglio.
I punteggi che Moonshot ha pubblicato al lancio, riportati dal fornitore e non riprodotti all'epoca:
• Artificial Analysis Intelligence Index — 57, all'epoca terzo dietro Claude Fable 5 e GPT-5.6 Sol. Quel valore era stato registrato secondo una revisione precedente dell'indice; in seguito l'indice è stato ricostruito due volte, quindi si tratta di un dato storico, non attuale.
• Frontend Code Arena — primo posto a 1.679 Elo, davanti a entrambi i modelli che l'avevano superato nell'indice generale
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, in vantaggio su Opus 4.8 e GPT-5.6 Sol
• DeepSearchQA — 0,95, primo posto, e MATH-Vision 0,98, anche primo
• GPQA-Diamond — 0,94
Il materiale di lancio di Moonshot stesso ammette che K3 è ancora dietro a Claude Fable 5 e GPT-5.6 Sol in quanto a capacità complessive, il che è una frase più utile di qualsiasi affermazione di primo posto che la preceda. La forma interessante dei numeri è che un modello terzo nell'indice generale è arrivato primo nel codice frontend e primo nella ricerca a lungo orizzonte — un profilo che dice che l'indice aggregato sta nascondendo uno strumento specializzato anziché descrivere uno generale.

Che cosa ha promesso Alibaba, e quanto vale una promessa
L'annuncio di Qwen 4 ha indicato quattro livelli. Qwen 4 Max come modello di punta, Qwen 4 Flash per il throughput, Qwen 4 Plus come fascia media equilibrata e Qwen 4 27B come livello locale open-weight. Il responsabile di Qwen LLM, Liu Da Yiheng, ha descritto la famiglia come addestrata su un'architettura di nuova generazione e ha detto che sarebbe arrivata presto. Non c'è alcuna data, nessuna model card, nessun identificatore API, nessuna presenza nei cloud, nessun prezzo e nessun punteggio pubblicato per nessuno dei quattro.
Due cose specifiche di quell’annuncio vengono riportate in modo errato, ed entrambe sono importanti per chiunque cerchi di pianificare tenendone conto:
• La cifra da 5.000 a 10.000 miliardi di parametri associata alla copertura di Qwen 4 non è una specifica di Qwen 4. Appartiene alla roadmap di Qwen 4.5 e Qwen 5. Nessun numero di parametri di alcun tipo è stato pubblicato per Qwen 4 Max
• La continuazione dei nomi dei livelli non porta avanti le specifiche. La finestra di contesto, il prezzo e la licenza di Qwen 4 Max sono sconosciuti; i numeri di Qwen3.8-Max in commercio — 1.000.000 di token a $2,00 e $6,00 per milione — descrivono un modello diverso
Il motivo per cui la fascia 27B è quella interessante non ha nulla a che fare con i benchmark. È l'unica fascia della linea Qwen 4 che storicamente è stata rilasciata con pesi aperti, e la generazione Qwen 3.8 ha mostrato ciò che questo rende possibile: nel giro di pochi giorni dall'arrivo dei pesi 27B, la comunità aveva prodotto conversioni MLX, quantizzazioni NVFP4 e fine-tune di ogni genere. Un 27B annunciato è un impegno verso un ecosistema a valle, ed è la consegna più prevedibile sulla roadmap.
Ma il prevedibile non viene consegnato. I pesi di Kimi K3 sono un file che puoi scaricare oggi. I pesi di Qwen 4 27B sono una riga in un intervento a una conferenza.
I pesi aperti e i pesi eseguibili sono affermazioni diverse
C'è una trappola nel considerare Kimi K3 come la risposta open-weights, e vale la pena dirlo chiaramente perché è l'overclaim più comune nella copertura dei modelli di frontiera cinesi. Un mixture-of-experts da 2,8 trilioni di parametri è un artefatto su scala datacenter. Pesi pubblicati significano che ti è permesso eseguirlo, che puoi ispezionarlo, che puoi fare fine-tuning e che puoi quantizzarlo. Non significano che tu possa eseguirlo su una workstation. Un serving efficiente di un checkpoint di quelle dimensioni richiede decine di acceleratori, e il lavoro di quantizzazione che segue un rilascio aperto — le varianti in stile NVFP4 e REAP che circolano nel giro di settimane — riguarda tanto il rendere il modello servibile quanto il renderlo più piccolo.
Quindi la lettura onesta della licenza di Kimi K3 è più ristretta e comunque significativa: è un modello di frontiera verificabile, modificabile e auto-ospitabile, sotto una licenza MIT modificata, per le organizzazioni che dispongono dell'hardware necessario per servirlo. Si tratta di un vero asset strategico e di una soluzione poco adatta a chiunque abbia interpretato "open weights" come "gira sul mio laptop".
Lo stesso avvertimento varrà per Qwen 4 27B se e quando sarà rilasciato — e si applica con meno forza, perché un tier da 27B a pesi aperti è davvero su scala locale in un modo in cui un flagship da 2,8T non lo è. È proprio per questo che, in questo confronto, il tier Qwen 4 27B merita più attenzione del tier Max, anche se è il tier Max quello con cui l'annuncio ha esordito.

La questione commerciale sotto la questione della licenza
La tariffa di prima parte di Kimi K3, pari a 3,00 $ per l'input e 15,00 $ per l'output per milione di token, rappresenta una posizione premium, e Moonshot è stata esplicita nel dichiarare che il suo prezzo è deliberatamente superiore a quello della fascia economica del mercato cinese. Rispetto a Qwen3.8-Max, a 2,00 $ e 6,00 $, ciò equivale a una volta e mezza la tariffa di input e a due volte e mezza quella di output — un divario abbastanza ampio da richiedere che un carico di lavoro tenga conto dei punti di forza specifici di Kimi K3, tra cui il codice frontend e la ricerca a lungo termine, perché il sovrapprezzo valga la pena.
OrcaRouter instrada kimi/kimi-k3 insieme alla famiglia Qwen 3.8 su un unico endpoint compatibile con OpenAI a 0% di ricarico, il che significa che ti viene fatturata la tariffa di listino del fornitore anziché un equivalente maggiorato. In un confronto in cui la differenza di prezzo sull'output è di un fattore 2,5, l'assenza di un margine di piattaforma non è un dettaglio trascurabile — un sovrapprezzo del dieci percento su una tariffa di output di 15,00 $ equivale a 1,50 $ per milione di token, più dell'intero costo di input del modello più economico in questo confronto. Lo stesso endpoint offre failover automatico e un DSL di routing per esprimere le policy in modo esplicito, ovvero il modo in cui provi un modello con il profilo di Kimi K3 su una fetta del traffico di produzione senza puntare un intero percorso su un fornitore che non hai mai eseguito prima.
Ciò che OrcaRouter non offre è Qwen 4 Max o qualsiasi livello di Qwen 4, perché nessuno di essi esiste ancora come prodotto.

Cosa guardare, e cosa ignorare
Tre segnali sposterebbero questo confronto, e sono abbastanza specifici da tenere d'occhio:
• I pesi di Qwen 4 27B. Non la tabella di benchmark del tier Max — il checkpoint 27B, la sua licenza e la sua dimensione. È il rilascio che ti dirà se l'impegno di Alibaba verso i pesi aperti in questa generazione è reale quanto quello della precedente
• La licenza di Qwen 4 Max, se esiste. Se Alibaba pubblica i pesi del suo modello di punta come ha fatto per Qwen3.8-Max, l'argomento dei pesi aperti in questo confronto smette di essere un vantaggio di Kimi e diventa un pareggio
• Una nuova lettura indipendente su Kimi K3. I punteggi di lancio di Moonshot erano autodichiarati e l'indice Artificial Analysis è stato ricostruito due volte nel frattempo, per cui sia il 57 sia l'Elo di Frontend Code Arena devono essere riparametrati prima di poter essere confrontati con qualsiasi valore attuale
Ciò che va ignorato è qualsiasi tabella di specifiche di Qwen 4 Max che compaia prima che Alibaba pubblichi una model card, e qualsiasi affermazione secondo cui i pesi aperti di Kimi K3 lo rendano eseguibile localmente. Entrambi gli errori stanno già circolando. Nel frattempo, il confronto su cui puoi basarti è tra due modelli che esistono: Kimi K3 a una tariffa premium con pesi consegnati e un profilo di coding realmente differenziato, e Qwen3.8-Max a meno della metà della tariffa di output con una finestra fissa da un milione di token e pesi propri. Questa è una scelta reale, con un prezzo da entrambe le parti, e non richiede di aspettare che una slide di una conferenza diventi un prodotto.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
