Scheda del titolo hero per un confronto tra GPT-6 e Kimi K3. Il titolo recita «GPT-6 vs Kimi K3». Un chip recita «Kimi K3: contesto 1.048.576, 3,00 $ / 15,00 $, rilasciato il 15/07/2026». Un chip recita «GPT-6 Sol: contesto 1.050.000, 2,00 $ / 10,00 $, GA 22/09/2026». Un piè di pagina recita «Entrambi accettano input testuale e immagini; prezzi e punteggi sono diversi».
Guides & Insights

GPT-6 vs Kimi K3: due modelli da milioni di token che si specializzano in modo diverso

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-6 Sol e Kimi K3 sono i due modelli con più probabilità di essere preselezionati per lo stesso lavoro: una finestra di contesto da un milione di token, input di immagini e un prezzo che rende accessibili i documenti lunghi. Ci sono arrivati da direzioni opposte. Kimi K3 è lo specialista del contesto lungo di MoonshotAI, rilasciato il 15 luglio 2026, e la sua scheda è costruita attorno al recall — ottiene l'88,7% nel test di recall su contesto lungo di Artificial Analysis, davanti a ogni modello del fornitore con cui possiamo confrontarlo. GPT-6 Sol è il generalista di fascia media del fornitore, distribuito il 22 settembre 2026 a 2,00 $ per milione di token in input e 10,00 $ per milione in output, e il suo punto di forza è l'ampiezza: una finestra leggermente più ampia, un indice composito di ragionamento generale più alto e un token di output più economico.

Quindi la formulazione onesta non è migliore contro peggiore. È recall contro ragionamento, ed è determinata da ciò che fai con il milione di token una volta che li hai caricati.

Le finestre hanno le stesse dimensioni sulla carta

Entrambe le schede dichiarano all'incirca un milione di token, e la differenza è cosmetica. La finestra di Kimi K3 è di 1.048.576 token — esattamente 2^20, il milione binario che ogni modello a contesto lungo cita. Quella di GPT-6 Sol è 1.050.000, un numero decimale tondo più grande di circa 1.400 token. Per qualsiasi carico di lavoro tu possa effettivamente inserirci, sono la stessa finestra. Non scegliere in base a questo.

Ciò che differisce è il resto della busta, ed è una breve lista.

• Contesto: Kimi K3 1.048.576 token, GPT-6 Sol 1.050.000 — di fatto allo stesso livello
• Modalità di input: Kimi K3 accetta testo e immagini; GPT-6 Sol accetta testo, immagini e file
• Limite massimo di output: GPT-6 Sol 128.000 token in una singola risposta; la scheda di Kimi K3 non pubblica una cifra massima di output
• Prezzo standard: Kimi K3 3,00 $ in / 15,00 $ out per milione, GPT-6 Sol 2,00 $ in / 10,00 $ out
• Input in cache: Kimi K3 0,30 $ per milione, GPT-6 Sol 0,20 $ per milione
• Prezzo per contesto lungo: Kimi K3 indica una singola tariffa senza livelli documentati; GPT-6 Sol applica all'intera richiesta, oltre 272.000 token di input, un prezzo di 4,00 $ in / 15,00 $ out
• Controlli di ragionamento: GPT-6 Sol espone un reasoning.effort configurabile; Kimi K3 espone parametri reasoning e reasoning-effort attraverso la stessa interfaccia compatibile con OpenAI

Il tetto di output mancante su Kimi K3 vale la pena di essere segnalato anziché attenuato: MoonshotAI pubblica un dato sul contesto e nessun dato sull'output massimo, quindi un sistema che dipende da un tetto di output rigido per la pianificazione non può ricavarne uno dalla scheda. Il livello a contesto lungo è l'altra asimmetria, e va in una direzione controintuitiva — la tariffa di riferimento di GPT-6 Sol è più bassa, ma la sua riprezzatura dell'intera richiesta oltre 272K significa che una chiamata da 300.000 token viene fatturata a $4,00 / $15,00 dal primo token, mentre la tariffa unica di Kimi K3 di $3,00 / $15,00 non è documentata come soggetta ad alcuno scatto. Per un documento molto lungo, Kimi K3 può finire per essere il più economico dei due sull'input nonostante la tariffa di riferimento più alta.

Recall è il prodotto effettivo di Kimi K3.

Il motivo per cui scegliere Kimi K3 non è che abbia una finestra ampia — diversi modelli ce l'hanno. È che conserva ciò che contiene. Nella valutazione di richiamo su contesto lungo di Artificial Analysis, riportata nel catalogo dei modelli, Kimi K3 ottiene l'88,7% contro l'83,7% di GPT-6 Sol. Si tratta di un divario di cinque punti nel test esatto che misura se un modello è in grado di trovare e usare un dettaglio sepolto in un input lungo, ed è il tipo di divario che si manifesta come veri fallimenti in produzione — lo strumento di riepilogo che tralascia la clausola a pagina 400, il revisore di contratti che non nota la sezione di manleva.

Kimi K3 è anche in testa nella programmazione, e con un margine più ampio di quanto suggerisca l'indice composito. Nell'indice di programmazione si colloca a 76,2 con un posizionamento nella top ten dei modelli valutati, e registra l'85,0% su terminal-bench v2.1 — il benchmark agentico da riga di comando da cui dipende l'utilità di un agente di programmazione. Il suo punteggio GPQA Diamond, 93,5%, è nella fascia più alta della classifica.

Il terreno su cui GPT-6 Sol risponde è quello dei punteggi compositi e del codice scientifico. Il suo indice di intelligenza generale, 47,6, è quattro punti sopra il 43,6 di Kimi K3 e vicino al decile più alto; i due sono alla pari su SciCode, rispettivamente al 57,6% e al 59,5%, entro il rumore di una singola esecuzione; e su Humanity's Last Exam il 47,9% di GPT-6 Sol supera di poco il 46,9% di Kimi K3. Nessuna di queste differenze su un singolo benchmark è abbastanza ampia da giustificare una scelta da sola.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

Costi in base al carico di lavoro, non a un listino prezzi.

Le schede tariffarie sono fuorvianti perché il rapporto tra token di input e di output è diverso per ogni attività, e questi due modelli non concordano su quale lato dello scambio sia più economico. Kimi K3 è più economico partendo dal presupposto che il tuo lavoro sia prevalentemente di input — documenti lunghi in entrata, risposte brevi in uscita. GPT-6 Sol è più economico partendo dal presupposto che il tuo lavoro sia bilanciato o a prevalenza di output, perché la sua tariffa di output è inferiore di un terzo.

• Scenario "leggi un libro e riassumilo" (900K input, 4K output): Kimi K3 ≈ $2.76, GPT-6 Sol ≈ $3.64 prima che si applichi la nuova tariffazione dei 272K; con la nuova tariffazione, l'intera chiamata di GPT-6 Sol passa al tier superiore e il divario si allarga
• Scenario agentico bilanciato (60K input, 20K output): Kimi K3 ≈ $0.48, GPT-6 Sol ≈ $0.32
• Scenario di generazione di codice (30K input, 60K output): Kimi K3 ≈ $0.99, GPT-6 Sol ≈ $0.66

Questa è pura aritmetica dei token sulle tariffe pubblicate di ciascun fornitore ed esclude l'input in cache, il che avvantaggia il modello su cui si fa maggiormente uso della cache. La forma della risposta è ciò che conta: per il puro lavoro di richiamo su input lungo vince la tariffa fissa di Kimi K3, mentre per qualsiasi cosa che scriva molto in risposta vince la tariffa di output inferiore di GPT-6 Sol. Nessuno dei due è universalmente più economico, e un confronto che indica un solo vincitore sul prezzo senza dichiarare il rapporto tra i token non misura nulla.

La provenienza fa parte della decisione

Kimi K3 è sviluppato da MoonshotAI, un laboratorio cinese, e GPT-6 Sol da OpenAI. Quella differenza non è un benchmark e non compare su un listino prezzi, ma per i carichi di lavoro regolamentati decide la rosa dei candidati prima ancora che si discuta del prezzo. La scheda di MoonshotAI nel catalogo non pubblica un campo relativo alla licenza, quindi nulla di quanto qui riportato va letto come un'affermazione sulla disponibilità dei pesi in un senso o nell'altro — se i pesi aperti sono importanti per il tuo deployment, verificalo alla fonte invece di presumerlo dal nome della famiglia.

Per i team che hanno bisogno di entrambi — un modello di laboratorio cinese per una parte della pipeline e un modello OpenAI per un'altra, con routing e residenza gestiti in un unico posto — è proprio per questo che vale la pena avere un unico gateway invece di due set di credenziali. Su OrcaRouter sia kimi/kimi-k3 sia GPT-6 Sol sono route attive nello stesso catalogo, al prezzo di listino del provider con markup 0%, così una variazione delle tariffe di MoonshotAI o OpenAI è attiva lo stesso. Il failover automatico fa sì che una route degradata su uno dei due provider non mandi giù la pipeline, e il DSL di routing ti permette di inviare il lavoro a forte componente di recall a Kimi K3 e il lavoro a forte componente di generazione a GPT-6 Sol per regola anziché per intuizione.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

Quale mettere nella pipeline

Scegli Kimi K3 quando il compito è il recupero e la conservazione su input molto lunghi — revisione di documenti legali e medici, comprensione del codice dell'intero repository, analisi di trascrizioni su centinaia di documenti — e quando i tuoi prompt sono così ricchi di input che la tariffa fissa di 3,00 $ batte il nuovo prezzo di GPT-6 Sol. Il suo vantaggio nel recall e la sua posizione nella top ten per la programmazione sono i due numeri che giustificano la scelta.

Scegli GPT-6 Sol quando il lavoro è quello di un assistente generale supportato da una finestra da un milione di token: ragionamento misto, serializzazione in JSON, cicli agentici che scrivono molto in risposta e qualsiasi flusso di lavoro in cui un tetto di output di 128.000 token è un vantaggio più che un vincolo. È più economico sull'output, espone un controllo esplicito dello sforzo di ragionamento e il suo indice composito è il segnale generale più forte. Dove una pipeline fa genuinamente entrambe le cose, la risposta onesta è instradare anziché scegliere — il che è un'affermazione sulla forma del tuo traffico, non su nessuno dei due modelli.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno