Una card con titolo hero generata per un articolo intitolato "Grok 4.7 vs Kimi K3 — prezzo contro contesto", con il sottotitolo "Due modelli di frontiera, due scommesse diverse" e chip statistiche che indicano prezzo $2/$6 vs $3/$15, contesto 500K vs 1M, e pesi aperti no vs sì.
Guides & Insights

Grok 4.7 vs Kimi K3: Metà del prezzo, metà del contesto, nessuno dei pesi

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Prendi un mese da 300 milioni di token di lavoro di coding agentico e fallo passare attraverso entrambi i modelli alle loro tariffe di listino, e la scelta smette di sembrare una questione da benchmark. Grok 4.7, che SpaceXAI ha rilasciato il 21 settembre 2026, costa $2 per milione di token in input e $6 per milione in output. Kimi K3, che Moonshot AI ha rilasciato il 16 luglio 2026, costa $3 e $15. In quel mese ipotetico — diciamo 200M di input e 100M di output — Grok 4.7 arriva a circa $1.000 e Kimi K3 a circa $2.100. Il divario non è una differenza di arrotondamento; è il budget di un secondo modello. In cambio, Kimi K3 ti offre una finestra di contesto da 1.000.000 di token invece di 500.000, input video nativo oltre che immagini, e pesi scaricabili. Grok 4.7 ti offre un modello chiuso più veloce ed economico, addestrato esplicitamente per il lavoro da terminale a lungo orizzonte che anche Kimi K3 prende di mira. Entrambi sono di classe frontier. Non sono lo stesso acquisto.

I due modelli, in breve

Grok 4.7 è il modello all'avanguardia di SpaceXAI per la programmazione e il lavoro intellettuale, basato su un modello di base più grande di Grok 4.6 e sottoposto a un ciclo di apprendimento per rinforzo più lungo, mirato a compiti che possono richiedere ore. È proprietario — nessun peso, nessun download — serve una finestra di contesto di 500.000 token, accetta in input testo e immagini e restituisce testo, e supporta livelli di impegno di ragionamento da low a xhigh. Il suo claim principale è velocità e prezzo: SpaceXAI lo posiziona come circa due volte più veloce di modelli comparabili a circa la metà del prezzo.

Kimi K3 è il modello mixture-of-experts aperto di punta di Moonshot AI, il primo modello aperto della classe dei tremila miliardi di parametri: 2,8 trilioni di parametri totali, con 104 miliardi attivi per token, basato su Kimi Delta Attention e su pesi MXFP4 consapevoli della quantizzazione. Accetta in input testo, immagini e video, offre un contesto di 1.000.000 di token, esegue il ragionamento sempre attivo con uno sforzo configurabile e i suoi pesi sono scaricabili con la Kimi K3 License — uso commerciale consentito, con restrizioni. È, per progettazione, il modello che puoi portarti a casa.

Questa è l'intera differenza strutturale tra loro. Uno è un endpoint chiuso, economico e veloce. L'altro è un artefatto aperto, più costoso e più lento, con il doppio del contesto. Tutto ciò che segue è una conseguenza di questo.

Cosa confrontano effettivamente i benchmark

È qui che la maggior parte delle analisi comparative tra Grok 4.7 e Kimi K3 sbaglia, quindi vale la pena essere diretti: i numeri pubblicati dei due modelli in gran parte non misurano le stesse cose, e almeno una coppia che sembra comparabile non lo è.

Comincia dalla coppia che è davvero fuorviante. Il materiale di lancio di Kimi K3 cita un punteggio Terminal-Bench 2.1 di 88,3. Il materiale di lancio di Grok 4.7 cita Terminal-Bench 4.0 al 38,0%. Quelle sono versioni diverse del benchmark con set di attività diversi e punteggi diversi, e metterle fianco a fianco suggerirebbe che Kimi K3 sia più del doppio del modello agentico. Non è un'interpretazione difendibile, e nessuno dovrebbe ripeterla. Entrambi i numeri sono anche dichiarati dal fornitore — nessuno dei due è stato riprodotto in modo indipendente.

Ciò che si può confrontare è il composito indipendente, e lì i due sono vicini. Sull'attuale Artificial Analysis Intelligence Index, versione v4.3.2, Kimi K3 ottiene 44 — secondo su 113 modelli, il piazzamento più alto di qualsiasi modello a pesi aperti nella classifica. Grok 4.7 ottiene 46, sedicesimo su 655. Due punti di distanza, con il piazzamento di Kimi K3 ottenuto al massimo sforzo di ragionamento. Sul composito combinato, questi modelli sono pari.

• Composito indipendente — Grok 4.7 46 su AA Intelligence Index v4.3.2 contro Kimi K3 44 sulla stessa versione. In pratica, un pareggio.

• Finestra di contesto — Grok 4.7 500.000 token vs Kimi K3 1.000.000 token. Un vantaggio reale e incondizionato per Kimi K3, e l'unica differenza nelle specifiche senza alcun caveat.

• Modalità di input — Grok 4.7 testo e immagine vs Kimi K3 testo, immagine e video. Kimi K3 è più ampio, se il tuo carico di lavoro include video.

• Pesi — Grok 4.7 proprietario, nessun download rispetto a Kimi K3 con pesi aperti secondo la Licenza Kimi K3. Per un requisito on-premise o air-gapped questa è l'unica riga che conta.

• Prezzo per milione di token — Grok 4.7 $2 in input / $6 in output contro Kimi K3 $3 in input / $15 in output, con la tariffa di input in cache di Kimi a $0,30 per milione. Grok 4.7 è più economico su ogni fronte, e drasticamente più economico in output.

• Controllo del livello di ragionamento — Grok 4.7 da low a xhigh rispetto a Kimi K3 sempre attivo con livello configurabile. Funzionalmente simili; la differenza è che Grok 4.7 ti consente di ridurre il ragionamento.

• Evidenze agentiche riportate dal fornitore — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (tutte riportate dal fornitore) vs Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena primo posto con 1.679 Elo (riportato dal fornitore al lancio). Non comparabili — vedi sopra.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Dove vanno effettivamente i soldi

La scheda tariffaria sottovaluta il divario, perché i due modelli consumano token in modo diverso. Grok 4.7 è un ragionatore prolisso — Artificial Analysis ha misurato 240 milioni di token di output generati durante l'esecuzione del suo Intelligence Index, contro una mediana di 92 milioni tra i modelli. Kimi K3 è il tipo opposto di costoso: è un grande modello di ragionamento sempre attivo, e a $15 per milione di token di output, la verbosità è ciò che stai comprando.

Quindi il modello di costo onesto non è "$2/$6 contro $3/$15". È token di output per attività completata, moltiplicati per la tariffa di output, più token di input includendo ogni ritentativo, moltiplicati per la tariffa di input. Un modello che risolve un'attività in un'unica lunga passata a $6 per milione può battere un modello che richiede tre tentativi a $15 per milione, e può anche perdere contro di esso se le passate del modello economico sono abbastanza lunghe. Questa è una misurazione che esegui sul tuo repository, non una che qualcuno pubblica per te.

Un'asimmetria vale la pena di conoscerla prima di eseguirlo: Grok 4.6, predecessore di Grok 4.7, applica un cliff di prezzo a 200.000 token di input, dove una richiesta che supera quella soglia comporta una riprezzatura dell'intera richiesta al doppio della tariffa. Il lavoro su contesti lunghi dal lato Grok richiede che ciò venga verificato rispetto all'attuale listino prezzi del modello che si distribuisce, perché una finestra da 500.000 token e un cliff da 200.000 token interagiscono male. Il prezzo di Kimi K3 è fisso, il che è il vantaggio più discreto dei due.

Dove ognuno si rompe

Entrambi i modelli hanno una modalità di guasto che il materiale di lancio non mette in primo piano, e sono guasti diversi.

Il punto debole di Kimi K3 è l'affidabilità sotto carico sostenuto. Test della community e indipendenti al lancio hanno riportato che le sue prestazioni agentiche peggiorano man mano che le esecuzioni si prolungano — risultati solidi su singola esecuzione, tassi di successo più deboli su esecuzioni prolungate — e che la sua velocità di output si attesta intorno ai 37-38 token al secondo, il che è lento per la programmazione interattiva. Moonshot ha anche dovuto sospendere i nuovi abbonamenti consumer poco dopo il lancio perché la domanda ha superato la capacità, il che dice qualcosa sul margine di capacità di serving lato hosted.

Quello di Grok 4.7 ha la forma opposta: è veloce, economico e chiuso, il che significa che non puoi ispezionarlo, non puoi eseguirlo da solo e non puoi proteggerti da una deprecazione. SpaceXAI ha già reso pubblica la sequenza di Grok 4.8, Grok 4.9 e Grok 5 successiva a questa release, e Grok 4.6 è durato circa cinque settimane prima di essere superato. Qualsiasi cosa tu costruisca su Grok 4.7 dovrebbe essere costruita in modo che l'ID del modello sia un valore di configurazione, non un presupposto.

C'è una terza considerazione che non è un fallimento di nessuno dei due modelli: nessuno dei due è la risposta giusta per un'esecuzione autonoma di due settimane, ed entrambi i fornitori hanno dimostrato esattamente questo. Le demo pubblicate di coding autonomo di 16 giorni e 48 ore sono condotte dai fornitori, su compiti scelti dai fornitori, senza riproduzione indipendente. Vale la pena conoscerle, ma non vale la pena pianificarci sopra.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Eseguire entrambi, e perché questa è la vera risposta

Il divario di costo e il divario di contesto puntano in direzioni opposte, ed è questo l'argomento a favore del non sceglierne uno solo. Kimi K3 vale il suo prezzo sui lavori su scala repository, dove una finestra da 1M significa non dover suddividere l'input in blocchi, e su qualunque cosa debba essere ospitata in autonomia. Grok 4.7 vale il suo prezzo sul volume — cicli di agenti con molti turni, pipeline a forte densità di chiamate di strumenti e lunghe sessioni da terminale in cui dominano la velocità e il costo dell'output.

Kimi K3 è su OrcaRouter, il che rende quella separazione una decisione di routing anziché di approvvigionamento. È presente nel catalogo al prezzo di listino di Moonshot e, poiché OrcaRouter trasferisce i prezzi di listino dei provider con 0% di ricarico, un taglio di prezzo del fornitore è attivo qui lo stesso giorno in cui viene annunciato, anziché al rinnovo contrattuale successivo. Per i carichi di lavoro in cui una passata a contesto lungo e una passata di esecuzione dovrebbero collaborare anziché competere — un modello che tiene in vista l'intero repository, un altro che agisce su di esso — il DSL di routing compone più modelli in un'unica chiamata, e la fusione di modelli consente a un panel di modelli di rispondere insieme quando il compito vale la spesa extra. Una sola chiave API copre Kimi K3 più oltre 200 altri modelli, così la metà esecutiva di quella separazione può provenire dal modello più economico e veloce per il lavoro, anziché da quello che per caso detiene il contesto.

C'è una cosa da chiarire: i pesi aperti di Kimi K3 sono scaricabili, ma l'endpoint ospitato è quello a cui instrada OrcaRouter. Se il tuo requisito è davvero l'inferenza on-premise, quello è un progetto di self-hosting sul tuo hardware, non una decisione di routing — ed è l'unico scenario in cui questo confronto ha una sola risposta corretta.

Il verdetto, e l'unico numero da tenere a mente

Se scegli in base a costo e velocità, Grok 4.7 vince e non c'è gara: metà del prezzo di input, meno della metà del prezzo di output, erogazione più rapida e una manopola del ragionamento che puoi abbassare. Se scegli in base al contesto, all'ampiezza delle modalità o alla possibilità di possedere il modello, Kimi K3 vince con gli stessi criteri. Se scegli solo in base alle capacità, il punteggio composito indipendente dice che sono separati da due punti, e dovresti decidere in base alla tua valutazione personale anziché sul grafico di lancio di uno dei due fornitori.

Il numero a cui attenersi è quello in cima: $2/$6 contro $3/$15. Tutto il resto in questo confronto è negoziabile, ma quel rapporto no.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno