
GPT-6 Sol vs Kimi K3: tre assunzioni sui pesi aperti, messe alla prova con un'unica fattura
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Acquistare pesi aperti è di solito una scommessa su tre cose: che saranno più economici, che ti danno il controllo e che sono un'assicurazione contro un fornitore che cambia idea. Kimi K3, il modello da 2,8 trilioni di parametri che Moonshot AI ha rilasciato con pesi aperti il 27 luglio 2026, e GPT-6 Sol, il modello chiuso distribuito il 22 settembre 2026, sono un caso di prova limpido per tutte e tre, perché i due modelli sono abbastanza vicini sulla classifica neutrale che le assunzioni devono sostenere da sole l'argomentazione.
Ecco come se la cavano. K3 non è più economico per attività — è circa due volte più costoso, a $3,00 e $15,00 per milione di token contro i $2,00 e $10,00 di Sol. Il controllo è reale, ma ha un limite hardware che la maggior parte dei team non supererà. E l'assicurazione è l'unica ipotesi che regge completamente, il che la rende l'unica per cui valga la pena pagare. Quello che segue è l'aritmetica dietro ciascuno.
I due modelli, in breve
Kimi K3 è un modello sparse mixture-of-experts con 2,8 trilioni di parametri totali e circa 104 miliardi — circa il 3,7% — attivi per token, pubblicato con licenza Modified MIT con una finestra di contesto di 1.048.576 token. Le affermazioni architetturali di Moonshot sono specifiche: Kimi Delta Attention, uno schema ibrido di attenzione lineare che l'azienda dichiara fino a 6,3 volte più veloce nella decodifica su contesti lunghi, più Attention Residuals e un framework Stable LatentMoE. Accetta in input testo e immagini e restituisce testo. Il modello non distillato supera 1 TB di dimensione e un deployment in produzione è descritto in termini di una dotazione minima di 64 acceleratori.
GPT-6 Sol è chiuso, con identificatore singolo, e ha un prezzo fisso di $2,00 e $10,00 con una lettura in cache da $0,20 e scritture in cache da $2,50, con riprezzamento dell'intera richiesta oltre i 272.000 token di input a $4,00 e $15,00. È testo e immagini in input, testo in output, con una finestra di 1.050.000 token, un input massimo di 922.000 token, un limite di output di 128.000 token e una data di cutoff delle conoscenze del 20 aprile 2026.
Le finestre di contesto sono, in pratica, lo stesso numero — una differenza dello 0,1%. Questo elimina la ragione più comune per preferirne una, e significa che la decisione dipende interamente dalle tre ipotesi.
Primo presupposto: i pesi aperti costano meno. Non è così.
• Input — GPT-6 Sol 2,00 $ per milione di token vs Kimi K3 3,00 $ per milione di token
• Output — GPT-6 Sol $10,00 per milione di token vs Kimi K3 $15,00 per milione di token
• Input in cache — GPT-6 Sol $0,20 per milione di token contro Kimi K3 $0,30 per milione di token; entrambi sono un decimo della tariffa per input non in cache
• Intelligence Index, indipendente — GPT-6 Sol 48 al massimo sforzo vs Kimi K3 44 al massimo sforzo
• Costo per attività Index, indipendente — GPT-6 Sol 1,06 $ vs Kimi K3 2,00 $
• Token di output per l'esecuzione dell'indice — GPT-6 Sol 77M vs Kimi K3 160M
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Kimi K3 1.048.576 token
• Pesi — GPT-6 Sol chiuso vs Kimi K3 aperto, scaricabile e ospitabile autonomamente
• Licenza — GPT-6 Sol non applicabile vs Kimi K3 Modified MIT
• Parametri totali — GPT-6 Sol non divulgati vs Kimi K3 2.800 miliardi, di cui 104 miliardi attivi per token
Sol costa meno su ogni voce del tariffario, e il divario è più ampio proprio dove i carichi di lavoro agentici spendono il loro denaro. Il comitato indipendente concorda sulla direzione e all'incirca sulla portata: Sol costa circa la metà per ogni attività completata, con quattro punti indice in più. K3 ha generato poco più del doppio dei token di output per eseguire lo stesso indice.
Una sfumatura impedisce che si tratti di una disfatta. Moonshot sostiene che K3 genera il 21% in meno di token di output rispetto al suo predecessore, e il lavoro architetturale — lo schema di attenzione, il design residuale — è mirato direttamente al costo di decodifica su contesti lunghi. Su un carico di lavoro dominato da input molto lunghi, le funzionalità di efficienza di K3 potrebbero colmare parte del divario mostrato dall'esecuzione dell'indice. Nessuno ha pubblicato quella misurazione su un banco di prova comparabile, quindi trattala come un'affermazione del fornitore con un meccanismo plausibile, non come un risultato.


Seconda ipotesi: i pesi aperti ti danno il controllo. Fino a un limite hardware.
Il controllo è reale e vale la pena affermarlo con precisione, perché «pesi aperti» viene spesso usato in modo approssimativo. Una licenza MIT modificata su un checkpoint scaricabile significa che puoi eseguire il modello sul tuo hardware, metterlo a punto, fissare una revisione specifica e mantenere l'inferenza entro un confine che controlli. Nulla di tutto ciò è disponibile con GPT-6 Sol a qualsiasi prezzo.
Non significa che il self-hosting sia un sostituto dell'API in termini di costi. Le cifre pubblicate collocano il checkpoint a piena precisione a circa 4,9 TB, ovvero intorno ai 397 GB con quantizzazione a 1 bit, con una soglia minima di deployment nella fascia dei 410 GB di memoria combinata e deployment di produzione descritti in termini di 64 acceleratori. Un team che gestisce già quella classe di cluster ha qui un'opzione reale. Un team che non lo fa sta confrontando una bolletta API con un acquisto in conto capitale, e la bolletta API vince con un ampio margine.
La versione onesta dell'argomentazione sul controllo è più limitata di quanto venga di solito affermato: i pesi aperti ti danno la possibilità di andartene, non quella di eseguire a basso costo. Sono due cose diverse, e solo una delle due è disponibile per la maggior parte dei team.
Ipotesi tre: i pesi aperti sono un'assicurazione. Questa regge.
La terza ipotesi resiste a ogni numero sopra, ed è la ragione per cui K3 ha un mercato in assoluto. Moonshot può essere acquisita, può cambiare la propria licenza per le versioni future, può deprecare K3, può aumentare il prezzo, può sospendere gli abbonamenti — e ha sospeso i nuovi abbonamenti entro 48 ore dal rilascio per proteggere la qualità del servizio per i clienti paganti esistenti, il che è una dimostrazione concreta che l'accesso alle API è una decisione di policy, non una proprietà.
Se K3 viene deprecato, i pesi che hai scaricato continuano a funzionare. Se Moonshot triplica il prezzo dell'API, il tuo deployment self-hosted non ne risente. Se devi dimostrare a un auditor che il tuo stack di inferenza è bloccato a una revisione nota, un checkpoint te lo garantisce e un'API no. Niente di tutto questo compare in una tabella dei costi per attività, e tutto quanto è reale.
La questione è quanto valga. Sui numeri sopra, stai pagando circa il doppio per attività completata per quella copertura assicurativa, più quattro punti indice di capacità. Per un carico di lavoro in cui una deprecazione delle API è un'interruzione dell'attività, è economico. Per un carico di lavoro in cui ti basterebbe cambiare modello, è un premio per una copertura che non eserciterai mai.
Entrambi sono su un unico tasto, se vuoi che lo siano

Kimi K3 è nel catalogo di OrcaRouter al prezzo di listino di Moonshot, secondo il modello pass-through che rende attiva una variazione delle tariffe Moonshot dalla nostra parte lo stesso giorno anziché dopo che un rivenditore rinegozia. GPT-6 Sol non è nel nostro catalogo al momento in cui scriviamo ed è raggiungibile tramite l'API di OpenAI stessa.
Quella combinazione vale più di quanto sembri per questa particolare decisione, perché i due modelli appartengono a modalità di guasto diverse. Il motivo per eseguire K3 non è che sia più economico — non lo è — ma che è una copertura, e una copertura alla quale non puoi passare rapidamente non è granché come copertura. Tenere K3 dietro lo stesso endpoint di tutto il resto, con failover automatico e una regola di instradamento modificabile nella configurazione, è ciò che trasforma «abbiamo un fallback open-weight» da una diapositiva in una presentazione in qualcosa che funziona alle 3 del mattino.
A cosa serve ciascuno
• Se vuoi il costo più basso per attività completata su lavoro generico — GPT-6 Sol, e il margine è di circa 2×.
• Se vuoi la capacità più alta sulla classifica neutrale dei due — GPT-6 Sol di quattro punti.
• Se gestisci già un cluster nella classe di memoria da 400 GB e oltre e hai bisogno di inferenza all'interno del tuo perimetro — K3, e il calcolo cambia completamente, perché il costo marginale dei pesi non è lo stesso del costo dell'hardware.
• Se la tua vera esigenza è che il tuo modello non ti possa essere portato via — K3, e questo è l'unico argomento nel confronto a cui Sol non può rispondere.
• Se stai scegliendo in base al prezzo per token perché K3 sembra il modello cinese più economico — controlla prima il numero di token. Con 160 milioni di token di output per l'esecuzione dell'indice rispetto ai 77 milioni di Sol, la tariffa più economica sta comprando più token, non un conto più basso.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
