
GPT-6 Luna vs Kimi K3: Quattro volte il throughput, un trentesimo del prezzo, una vera eccezione
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Due modelli, entrambi rilasciati negli ultimi tre mesi, entrambi posizionati come il livello economico di una famiglia di frontiera, ed entrambi in errore su cosa significhi "livello economico" nello stesso identico modo — cioè per nulla. Kimi K3 è il flagship open-weight di Moonshot AI, pubblico con licenza MIT modificata dal 27 luglio 2026, al prezzo di 3,00 $ per milione di token in input e 15,00 $ per milione in output, con letture dalla cache a 0,30 $. GPT-6 Luna è il livello di volume del fornitore, disponibile in generale dal 22 settembre 2026 a 0,10 $ e 0,50 $, con letture dalla cache a un centesimo. Trenta volte sull'input, trenta volte sull'output, e una licenza da un lato che l'altro non può offrire a nessun prezzo.
Il listino prezzi, però, non è ciò che decide questo abbinamento, perché non è abbastanza vicino da richiedere una decisione. A deciderlo è un numero che nessuno dei due fornitori mette in evidenza: la velocità di output misurata. Kimi K3 genera 38,7 token al secondo. GPT-6 Luna ne genera 153,9. È un divario di quattro volte e, per qualsiasi carico di lavoro in cui il modello è un componente all'interno di un ciclo anziché un endpoint con cui parla una persona, una differenza di throughput di quattro volte cambia l'architettura, non la bolletta.
Cosa sono in realtà questi due
Kimi K3 è un modello mixture-of-experts da 2,8 trilioni di parametri con 104 miliardi di parametri attivi per token, una finestra di contesto di 1.048.576 token, un limite di output di 1.048.576 token e pesi pubblicati su Hugging Face con licenza Modified MIT. È il modello open-weight con il punteggio più alto sulla classifica indipendente — primo tra 112 modelli open-weight — e occupa la prima posizione nella classifica WebDev di Code Arena con 1.679 Elo. Moonshot riporta 88,3% su Terminal-Bench 2.0, che è un dato del fornitore e non riprodotto in modo indipendente.
GPT-6 Luna è il livello di fascia piccola della generazione GPT-6 di OpenAI, collocandosi sotto GPT-6 Sol a $2,00/$10,00 e ben sotto il flagship GPT-6 Astra a $10,00/$50,00. Input testo e immagini, output testo, una finestra di 1.050.000 token con un massimo di 922.000 token in input e un tetto di 128.000 token in output, e sforzo di ragionamento selezionabile da none a low, medium, high, xhigh e max, con medium come predefinito. È chiuso, con identificatore unico, e disponibile per chiunque possieda una chiave API.
Uno è un download. Uno è un endpoint. Entrambi hanno un prezzo basato sul volume. Questa è la forma del confronto.
Le carte, riga per riga
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1M — GPT-6 Luna $0,10 vs Kimi K3 $3,00
• Output per 1M — GPT-6 Luna 0,50 $ vs Kimi K3 15,00 $ Wait — should I localize decimal separators? Italian uses comma as decimal separator. "$0.50" → "0,50 $" or "$0,50". Hmm. The instruction says preserve URLs and brand/product names; prices aren't brands. Localizing number formats is typical for localization. But changing could be risky. Many localization engines do localize numbers. I'll go with Italian convention: "0,50 $" and "15,00 $". Hmm, but the dollar sign placement — Italian typically writes "$0,50" or "0,50 $". Actually in Italian, currency symbol usually follows: "0,50 $". Some write "$0,50". I think a safer approach: keep the numbers as-is since it's a price comparison likely in dollars, and changing format could be considered altering data. But professional localization would adapt. Hmm. I'll localize: "0,50 $" and "15,00 $". Actually let me reconsider — many tech pricing pages keep the original format to avoid ambiguity. The instruction emphasizes preserving markers and brand names, doesn't mention numbers. I'll do Italian formatting since that's proper localization. Final: "• Output per 1M — GPT-6 Luna 0,50 $ vs Kimi K3 15,00 $" Hmm, "per 1M" — in Italian "per 1M" works. Or "per milione". Keep "1M". I'll go with that.• Output per 1M — GPT-6 Luna 0,50 $ vs Kimi K3 15,00 $
• Input in cache per 1M — GPT-6 Luna $0,01 vs Kimi K3 $0,30, un decimo della propria tariffa di input su entrambe le schede
• Clausola sul contesto lungo — GPT-6 Luna raddoppia input e cache e aumenta l'output di 1,5× oltre 272.000 token di input, applicata all'intera richiesta, mentre per Kimi K3 non è pubblicata alcuna clausola equivalente sulla sua scheda
• Finestra di contesto — GPT-6 Luna 1.050.000 token con 922.000 di input massimo vs Kimi K3 1.048.576 token
• Output massimo — GPT-6 Luna 128.000 token vs Kimi K3 1.048.576 token, otto volte il tetto massimo
• Indice di intelligenza, indipendente — GPT-6 Luna 37 al massimo sforzo vs Kimi K3 44 al massimo sforzo, stessa revisione dell'indice
• Punteggio con impegno predefinito — GPT-6 Luna 29 al suo livello medio predefinito vs Kimi K3 misurato alla sua impostazione massima
• Costo per attività Index, indipendente — GPT-6 Luna circa $0,07 vs Kimi K3 $2,00
Token di output nell'esecuzione dell'indice — GPT-6 Luna 150M vs Kimi K3 160M, rispetto a una mediana della classifica di 88M; entrambi sono molto più verbosi del modello mediano della classifica
• Velocità di output, indipendente — GPT-6 Luna 153.9 token/sec vs Kimi K3 38.7 token/sec
• Pesi — GPT-6 Luna chiusi, solo API vs Kimi K3 pubblici su Hugging Face dal 27 luglio 2026
• Licenza — GPT-6 Luna non applicabile vs Kimi K3 MIT modificata, che non è lo stesso strumento della MIT
• Parametri totali — GPT-6 Luna non divulgati vs Kimi K3 2.800 miliardi, di cui 104 miliardi attivi per token
• Evidenza di rilievo — tool calling e cicli agentici di GPT-6 Luna a un decimo di centesimo per mille token di input in cache, contro Kimi K3 Code Arena WebDev #1 a 1.679 Elo, Terminal-Bench 2.0 88,3% dichiarato dal fornitore, miglior punteggio open-weight nella classifica indipendente
• Su OrcaRouter — GPT-6 Luna non è nel nostro catalogo, mentre Kimi K3 è instradabile al prezzo di listino di Moonshot

Il throughput è la specifica che nessuno mette nei titoli
Un modello da 38,7 token al secondo e un modello da 153,9 token al secondo non sono lo stesso prodotto con etichette di prezzo diverse. Sono prodotti diversi.
Prendi un'attività in cui il modello deve produrre una risposta di 1.500 token — un riassunto, un'estrazione strutturata, una patch di codice con la relativa spiegazione. A 153,9 token al secondo, quella risposta richiede circa dieci secondi. A 38,7 ne richiede circa trentanove. Nessuno dei due valori include il tempo di ragionamento o la latenza di rete, quindi il divario nel mondo reale è più ampio di quattro volte in proporzione, non più ristretto.
Ora mettilo in un ciclo. Un agente che effettua trenta chiamate al modello per completare un compito — pianifica, seleziona uno strumento, legge il risultato, decide il passo successivo, ripete — produce forse 15.000 token di output attraverso quelle chiamate. GPT-6 Luna impiega circa 97 secondi per generare. Kimi K3 ne impiega circa 388. Questa è la differenza tra un compito che un utente aspetta e un compito che un utente programma, e nessuna quantità di permissività della licenza lo cambia.
La verbosità aggrava il problema della velocità invece di compensarlo. Kimi K3 ha generato 160 milioni di token in output completando l'indice indipendente, contro i 150 milioni di GPT-6 Luna — quindi in quella valutazione il modello più lento produceva anche leggermente più token, non meno. I due modelli sono ugualmente verbosi; semplicemente non sono ugualmente veloci, e su una scheda con tariffazione sull'output essere verbosi costa due volte.
Vale la pena dirlo chiaramente: questo non è un difetto di Kimi K3. Un modello da 2,8 trilioni di parametri con 104 miliardi attivi svolge più lavoro per token rispetto a un modello di fascia piccola, e il dato di throughput è una misura di quel lavoro. La domanda rilevante è se il tuo carico di lavoro necessita di quel lavoro. Se sì, 38,7 token al secondo è il prezzo della capacità. Se no, stai pagando per una riflessione che non hai richiesto, trenta volte tanto.
Dove vivono i sette punti di K3
Kimi K3 ottiene 44 sull'Intelligence Index indipendente con sforzo massimo. GPT-6 Luna ottiene 37 con la stessa impostazione. Sette punti, su un indice composito in cui un punto rientra nel rumore di una ripetizione — e i due sono separati da circa ventotto volte quanto a costo per attività completata: 2,00 $ contro circa 0,07 $.
Quei sette punti non sono distribuiti in modo uniforme. La reputazione di Kimi K3 è concentrata sul coding e sul lavoro software agentico, ed è il motivo per cui il modello esiste: la classifica WebDev di Code Arena lo vede primo a 1.679 Elo, e il dato dell'88,3% del Terminal-Bench 2.0 del fornitore è una misurazione di agente di coding. La posizione di GPT-6 Luna nel coding è un passo indietro anziché in avanti — il suo Coding Agent Index si attesta a 41, due punti sotto il GPT-5.6 Luna che ha sostituito, con i cali concentrati in SWE-Atlas-QnA e DeepSWE v1.1. Se il vostro lavoro è un agente che scrive software su un repository reale, si tratta di un divario di sette punti nell'indice e di una regressione generazionale di due punti che puntano nella stessa direzione, e la tesi a favore del livello economico diventa considerevolmente più debole.
Dove i sette punti non arrivano è la classe di lavoro per cui GPT-6 Luna è prezzato. Classificazione, estrazione, routing, riepilogo in blocco, il ciclo interno di un agente che ha bisogno di un rapido sì o no: su questi compiti i due modelli produrranno lo stesso output utilizzabile nella stragrande maggioranza dei casi, e la differenza non sopravvivrà al contatto con il tuo set di valutazione. L'indice misura un composito che dà molto peso al ragionamento a lungo orizzonte e alla programmazione, e nessuna delle due è ciò che richiede una decisione di routing.
Un caveat da collegare ai valori dell'indice su entrambi i fronti: questa classifica è una valutazione rolling e la sua revisione conta. Istantanee precedenti della stessa classifica collocavano Kimi K3 ben più in alto del 44 mostrato dalla nostra rilevazione odierna, perché il composito, l'harness e l'insieme dei modelli cambiano tutti. Qualsiasi confronto che si basi sullo scarto preciso tra due modelli su un indice rolling si basa su qualcosa che non resterà fermo. La lettura onesta è che questi due si trovano in fasce di capacità adiacenti ai loro livelli massimi, e che l'indice non può dirti quale sia migliore per il tuo compito.
L'eccezione: cosa ti dà davvero la Modified MIT
La licenza di Kimi K3 è l'unica dimensione su cui GPT-6 Luna non ha alcuna risposta, a qualunque prezzo, e merita più precisione di quanta ne riceva di solito la locuzione «pesi aperti».
I pesi sono pubblici su Hugging Face e la licenza è Modified MIT, non MIT. Questa distinzione conta: una licenza Modified MIT in genere pone delle condizioni — comunemente l'obbligo di mostrare un'attribuzione quando il modello viene usato in un prodotto oltre una certa scala — e chiunque intenda costruire un prodotto commerciale sui pesi dovrebbe leggere lo strumento effettivo anziché il nome di famiglia a cui assomiglia. Non è un motivo per evitarla. È un motivo per non descriverla come MIT in un documento di approvvigionamento.
Ciò che si ottiene con il download è reale e circoscritto. Garantisce una soglia minima di costo, nel senso che un'occupazione GPU fissa può battere una fattura a consumo a volume sufficiente. Garantisce l'indipendenza dalla roadmap di un fornitore: un modello che ospiti tu non può essere deprecato sotto i tuoi piedi. Garantisce la possibilità di fare fine-tuning sulla tua distribuzione. E garantisce l'opzione di mantenere i prompt entro i tuoi confini, il che per alcuni team chiude il confronto prima ancora che si parli di prezzo.
Quello che costa è l’hardware. Un modello mixture-of-experts da 2,8 trilioni di parametri con 104 miliardi di parametri attivi non è un modello che gira su una workstation. Servirlo con un throughput di produzione è un impegno su scala cluster con un costo in conto capitale, un costo operativo e un profilo di latenza che possiedi invece di noleggiare. Non è un argomento contro il self-hosting di Kimi K3 — è un argomento secondo cui il confronto corretto non è 15,00 $ per milione di token di output contro 0,00 $, ma 15,00 $ per milione di token di output contro un costo per token a pieno carico che include il silicio e le persone. Per un piccolo numero di organizzazioni quel numero è più basso. Per la maggior parte non lo è, e il punto di crossover è più lontano di quanto la licenza faccia sembrare.
Eseguendone uno, o entrambi
Kimi K3 è su OrcaRouter al prezzo di listino di Moonshot, con il prezzo pass-through, il che significa che un cambio di tariffa del fornitore è attivo dalla nostra parte lo stesso giorno. Il failover automatico è la parte che si guadagna il suo posto per questo modello in particolare: il degrado di un endpoint Kimi K3 self-hosted o di terze parti è esattamente lo scenario in cui si vuole che il percorso si sposti senza un deployment, e un modello da 38,7 token al secondo ha meno margine per assorbire un upstream lento rispetto a uno veloce.
GPT-6 Luna non è nel nostro catalogo al momento in cui scriviamo e vi si accede tramite l'API di OpenAI stessa, quindi un team che li vuole entrambi usa un'unica chiave per Kimi K3 insieme a qualunque cosa già utilizzi per OpenAI. Questo è anche l'abbinamento in cui il DSL di routing fa qualcosa che una suddivisione hard-coded non può fare: una regola che invia il lavoro di coding e a lungo orizzonte a Kimi K3 e tutto ciò che è consumato da programmi e di breve durata a GPT-6 Luna esprime un confine che si sposta ogni volta che uno dei due vendor rilascia novità, e si sposta come configurazione anziché come percorso di codice. La fusione di modelli è l'altra configurazione che vale la pena nominare qui — un panel composto da un modello lento e accurato e uno veloce ed economico che rispondono insieme, con il membro economico che gestisce il volume e quello costoso che arbitra i casi che contano, è una forma a cui questa coppia di modelli si adatta insolitamente bene, perché l'asimmetria di costo tra loro è abbastanza ampia che spendere una chiamata a Kimi K3 su una piccola frazione del traffico è sostenibile.

Quale, e quando
Prendi GPT-6 Luna se il tuo carico di lavoro è ad alto volume, consumato da programmi e sensibile alla latenza. Classificazione, estrazione, routing, riepilogo in blocco, il ciclo interno di un agente. A $0,10/$0,50 con una lettura in cache da un centesimo e quattro volte il throughput di Kimi K3, l'aritmetica non è vicina e la differenza di latenza non è marginale. Imposta esplicitamente il parametro effort, perché il valore predefinito è medium e il 37 in evidenza è un numero di massimo sforzo, e mantieni le chiamate lunghe sul lato giusto della linea dei 272.000 token.
Prendi Kimi K3 se hai bisogno dei pesi, se il tuo lavoro è coding agentico su un repository reale in cui la sua posizione WebDev e l'88,3% riportato dal fornitore su Terminal-Bench 2.0 sono le prove che contano, se hai bisogno di un tetto di output superiore a 128.000 token, o se la tua organizzazione non può inviare prompt a un endpoint chiuso. Accetta 38,7 token al secondo come parte dell'accordo, e leggi i termini Modified MIT invece di darli per scontati.
L'errore che questo confronto invita a commettere è trattare il tasso di trenta volte come la risposta a una domanda sulla capacità. È la risposta a una domanda sui token. La questione della capacità si risolve stabilendo se hai bisogno dei pesi o della velocità, e quelle due risposte puntano in direzioni opposte.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
