Un tabellone comparativo a due colonne generato automaticamente, intitolato "GPT-6.1 Sol vs Kimi K3 - il tabellone". Colonna di sinistra "GPT-6.1 Sol": righe con "Indice di intelligenza: 51,8", "Costo per attività dell'indice: 0,72 $", "Token di output nell'esecuzione dell'indice: 67M", "AA-LCR contesto lungo: 0,83", "Finestra di contesto: 1.050.000", "Pesi: chiusi". Colonna di destra "Kimi K3": righe con "Indice di intelligenza: 43,6", "Costo per attività dell'indice: 2,00 $", "Token di output nell'esecuzione dell'indice: 160M", "AA-LCR contesto lungo: 0,89", "Finestra di contesto: 1.048.576", "Pesi: aperti su Hugging Face". Un piè di pagina recita "Dati indipendenti secondo Artificial Analysis v4.3.2 al massimo sforzo."
Guides & Insights

GPT-6.1 Sol vs Kimi K3: Il download esiste, e continua a non essere l'opzione economica

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Kimi K3 è il controesempio che di solito chiude questo genere di discussioni. Moonshot AI ha rilasciato il modello da 2,8 trilioni di parametri a luglio 2026 e ne ha pubblicato i pesi — moonshotai/Kimi-K3 è su Hugging Face, senza restrizioni, con oltre un milione di download e un'ultima revisione a settembre. Quindi qui non c'è nessun asterisco del tipo "aperto in linea di principio, trattenuto per irrobustire la sicurezza", nessuna pausa di due settimane da aspettare. GPT-6.1 Sol, che OpenAI ha rilasciato il 29 settembre 2026, è chiuso e disponibile solo via API, e lo sarà per sempre. E sulla classifica indipendente il modello scaricabile ottiene 43,6 contro 51,8 del modello chiuso, pur costando 2,00 $ per attività di indice completata contro 0,72 $. I pesi aperti dovrebbero essere la via di fuga economica; in questo confronto sono il lato costoso dello scambio, e il motivo non è la licenza.

Cosa è ciascun modello

Kimi K3 è un modello mixture-of-experts sparso con 2.800 miliardi di parametri totali e circa 104 miliardi — all'incirca il 3,7% — attivi per token. Dispone di una finestra di contesto di 1.048.576 token, accetta testo e immagini come input e restituisce testo. Il checkpoint pubblicato è un artefatto FP8 ed è un download davvero grande; un deployment di produzione sul proprio hardware è una decisione da cluster più che da workstation. La rivendicazione architetturale di Moonsh​oot è uno schema ibrido di attenzione lineare che, a suo dire, è sostanzialmente più veloce nella decodifica a contesto lungo, oltre al lavoro sui residui e sul routing che ha reso servibile un modello da 2,8 trilioni di parametri.

GPT-6.1 Sol è l'aggiornamento di fascia media di Open​AI — sotto GPT-6 Astra, sopra GPT-6 Luna — con una finestra di 1.050.000 token, un tetto di output di 128.000 token, input testo, immagini e file, e data di riferimento delle conoscenze al 30 aprile 2026. Il ragionamento si articola low fino a max con medium come impostazione predefinita; il livello none che il precedente GPT-6 Sol accettava viene ora rifiutato del tutto, e la nota di migrazione di Open​AI stessa indirizza gli sviluppatori su low. Il prezzo è di $2.00 e $10.00 per milione di token, con input in cache a $0.10.

Una riga per dimensione, entrambi i lati su ciascuna:

• Input — GPT-6.1 Sol 2,00 $ per 1M vs Kimi K3 3,00 $ per 1M
• Output — GPT-6.1 Sol 10,00 $ per 1M vs Kimi K3 15,00 $ per 1M
• Input in cache — GPT-6.1 Sol 0,10 $ per 1M vs Kimi K3 0,30 $ per 1M
• Finestra di contesto — 1.050.000 token vs 1.048.576 token; una differenza dello 0,1%, irrilevante
• Output massimo — 128.000 token in entrambi i casi
• Parametri totali e attivi — non divulgati vs 2.800 miliardi totali, 104 miliardi attivi per token
• Modalità — testo, immagine e file in input, testo in output vs testo e immagine in input, testo in output
• Pesi — chiusi, solo API vs aperti, senza restrizioni, oltre 1 milione di download
• Clausola sul contesto lungo — riprezza l'intera richiesta oltre 272.000 token di input, con 2× su input e cache e 1,5× sull'output vs nessuna clausola equivalente sulla scheda pubblicata
• Intelligence Index, indipendente, massimo sforzo — 51,8 vs 43,6
• Costo per attività dell'indice, indipendente — 0,72 $ vs 2,00 $
• Token di output nell'esecuzione dell'indice — 67 milioni vs 160 milioni, rispetto a una mediana della classifica di 140 milioni per la sua classe di confronto

L'unica valutazione che K3 vince, e perché è importante

Prima dell'aritmetica, l'eccezione, perché è reale. Valutazione per valutazione, al massimo sforzo, su Artificial Analysis v4.3.2, GPT-6.1 Sol è in testa in sette casi su dieci e non pareggia nulla, ma il modello che vince la valutazione di ragionamento a contesto lungo è K3:

• AA-LCR v1.1 — Kimi K3 0,887 vs GPT-6.1 Sol 0,830. Un vantaggio di sei punti sulla valutazione creata specificamente per il ragionamento su input lunghi.
• SciCode — Kimi K3 0,595 vs GPT-6.1 Sol 0,542. K3 è in testa anche sulla programmazione scientifica.
• Terminal-Bench 4.0 — Kimi K3 0,126 vs GPT-6.1 Sol 0,561. Un divario di 43 punti nella direzione opposta, e di gran lunga la differenza più ampia dell'abbinamento.
• Humanity's Last Exam — Kimi K3 0,469 vs GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 vs GPT-6.1 Sol 41,5; sull'affidabilità fattuale i due non appartengono alla stessa classe di modelli.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 vs GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 vs GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 e 0,234; Sol 0,649, 0,310 e 0,317.

Il risultato di AA-LCR è quello che vale la pena prendere sul serio, perché è l'unico numero che contraddice la narrazione del costo per attività, e indica un carico di lavoro in cui la risposta che sembra economica è sbagliata in entrambe le direzioni. Se il tuo traffico è fatto di input molto lunghi, una risposta generata modesta e un forte riutilizzo di un prefisso stabile — la forma in cui la verbosità non riesce mai a farsi sentire — la combinazione di K3 di un punteggio di contesto lungo di prim'ordine, un input immagine e un checkpoint scaricabile si adatta meglio di quella di Sol, e il dato di costo per attività per l'esecuzione dell'indice non si applica a te. Questa è la versione onesta di "i pesi aperti valgono un premio": a volte il modello aperto è semplicemente il modello migliore per il lavoro, e qui lo è su un asse.

Vale anche la pena di dire ciò che quei due successi hanno in comune. K3 è forte là dove un compito può essere risolto in un unico lungo atto di lettura o ragionamento, e debole là dove deve essere eseguito in molti piccoli passaggi e verificato. Il divario di 43 punti su Terminal-Bench e il divario di 22 punti di onniscienza sono la stessa constatazione vista da due angolazioni: l'esecuzione agentica prolungata non è ciò per cui questo checkpoint è stato ottimizzato.

L'aritmetica, che è ciò che in realtà decide

Il tariffario di K3 è 1,5× quello di Sol su ogni voce e il suo costo misurato per attività di indicizzazione completata è 2,8×, e la differenza tra 1,5 e 2,8 è interamente spiegata dal volume di token. La misurazione del consiglio stesso è di 160 milioni di token di output per K3 contro 67 milioni per Sol sulla stessa suite di dieci valutazioni. K3 produce 2,4 volte l'output a 1,5 volte il prezzo, e 2,4 × 1,5 fa 3,6 — la cifra di 2,00 $ contro 0,72 $ del consiglio è un po' più favorevole del rapporto puro perché i contributi di input e cache la compensano leggermente, ma la direzione non è in discussione.

Il marketing di Moonsh​oot stesso va contro questo in un modo che vale la pena leggere con attenzione. L'azienda sostiene che K3 emetta meno token di output rispetto al suo predecessore, e il lavoro architetturale — lo schema di attenzione, il design residuale — è mirato esattamente al costo di decodifica su contesti lunghi. Entrambe le cose possono essere vere mentre il modello è ancora due volte più verboso della mediana di un benchmark su una suite generale. Le due affermazioni riguardano cose diverse: l'efficienza rispetto a un Kimi precedente e l'efficienza rispetto al campo. Solo la seconda è quella sulla quale vieni fatturato, ed è quella che il comitato indipendente misura.

Il caching lo attenua. Entrambe le tariffe di input in cache sono un decimo della tariffa di input non in cache del rispettivo modello — $0,30 per K3, $0,10 per Sol — quindi la linea della cache non cambia l'ordinamento, ma significa che un carico di lavoro con molte richieste e poche risposte riduce il divario all'incirca al rapporto del tariffario piuttosto che al rapporto misurato del compito. E la clausola di contesto lungo di Sol va nella direzione opposta: oltre 272.000 token di input, riprezza l'intera richiesta a $4,00 e $15,00 con cache a $0,20, che è l'unica fascia in cui la tariffa piatta di K3 vince nettamente. Vale la pena saperlo per due motivi, perché è anche la fascia in cui il punteggio di contesto lungo di K3 è il numero migliore in questo confronto.

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

Quanto valgono davvero i pesi aperti, qui

Tre cose, e vale la pena tenerle separate, perché "open weights" viene di solito usato come un unico argomento quando invece sono tre.

Il primo è che puoi andartene. Se Moonshoot viene acquisita, cambia la licenza per le versioni future, depreca K3 o aumenta il prezzo della sua API, un checkpoint che hai già scaricato continua a funzionare. Non è un'ipotesi per questo laboratorio: Moonshoot ha sospeso i nuovi abbonamenti entro circa 48 ore da un rilascio precedente per proteggere la qualità del servizio per i clienti paganti esistenti, il che è una dimostrazione dal vivo che l'accesso all'API è una decisione di policy piuttosto che una proprietà. Niente di tutto questo compare in una tabella dei costi per attività e tutto quanto è reale.

Il secondo è che puoi fissare. Una revisione fissa, messa a punto, in esecuzione all'interno di un confine che controlli, è una cosa che si può mostrare a un revisore e che un'API non può fornire. Per il traffico regolamentato vale più di un listino prezzi.

Il terzo — quello che di solito si dà per scontato — è che sarà più economico. Non lo è. Il checkpoint è un artefatto FP8 da 2,8 trilioni di parametri, e le linee guida di deployment pubblicate sono impostate su configurazioni multi-acceleratore anziché su un singolo nodo. Un team che gestisce già quella classe di cluster ha qui un'opzione concreta e il calcolo cambia del tutto, perché il costo marginale di un token diventa l'elettricità. Un team che non lo fa sta confrontando una bolletta API con un acquisto in conto capitale, e la bolletta API vince con ampio margine. Il riassunto onesto è che i pesi aperti qui ti danno la possibilità di andartene, non quella di operare a basso costo.

Entrambi su un unico tasto, che è la parte che rende utile lo scambio.

Kimi K3 è su OrcaRouter al prezzo di listino proprio di Moonsh​oot — $3.00 e $15.00 per milione di token con una lettura cache da $0.30, invariato rispetto alla scheda del fornitore — e GPT-6.1 Sol è approdato sulle nostre rotte al prezzo di Open​AI il giorno del rilascio, $2.00 e $10.00 con input in cache a $0.10 e il passo da 272,000 token passato esattamente come elencato. Non viene aggiunto nulla a nessuno dei due. La piattaforma trasmette il prezzo di listino del fornitore invece di applicare un ricarico, quindi un cambio di tariffa di Moonsh​oot e un cambio di tariffa di Open​AI compaiono entrambi dalla nostra parte lo stesso giorno in cui compaiono presso il fornitore, senza un secondo contratto o un rivenditore in mezzo.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

Il motivo che per questa coppia conta più che per la maggior parte è che i due modelli appartengono a modalità di errore diverse. GPT-6.1 Sol è il modello che si esegue per esecuzione prolungata, cicli di tool e affidabilità fattuale; Kimi K3 è il modello che si esegue per input molto lunghi, dove si vuole il miglior punteggio sul contesto lungo e si vuole un checkpoint come copertura contro la decisione aziendale di qualcun altro. Non sono scelte in competizione, sono due percorsi sullo stesso traffico. Tenere entrambi dietro un unico endpoint, con failover automatico tra loro e una regola che sposta il lavoro sugli input lunghi a K3 e il lavoro di esecuzione a Sol, è ciò che converte "abbiamo un fallback open-weight" da una riga in un documento di progettazione in qualcosa che funziona alle tre del mattino durante una chiamata che sta fallendo.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Dove ognuno appartiene

• Agenti da terminale, coding su scala repository, esecuzione multi-step — GPT-6.1 Sol, su un divario di 43 punti in Terminal-Bench 4.0. Non c'è partita.
• Risposte dove un'allucinazione costa cara — GPT-6.1 Sol, su un divario di 22 punti in AA-Omniscience.
• Input molto lunghi con una risposta generata breve — Kimi K3. Il miglior punteggio di ragionamento su contesto lungo in questo confronto, input di immagini e una verbosità che non ha mai modo di applicarsi.
• Self-hosting o uno stack di inferenza che devi poter congelare — Kimi K3, e solo se gestisci già tu l'hardware. Il checkpoint è il prodotto finale; l'economia di eseguirlo è una questione separata.
• Una copertura contro un fornitore che cambia i propri termini — Kimi K3, e questo è l'unico argomento a cui GPT-6.1 Sol non può rispondere a nessun prezzo.
• Scegliere in base al listino — né K3 né Sol è l'opzione economica in questo confronto, e nessuno dei due è l'opzione economica nella linea GPT-6. Se è la fattura l'input decisivo, il modello che cerchi è più in basso nel listino prezzi, non dall'altra parte di questa tabella.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno