
MiMo-V2.6-Pro vs Grok 4.6: entrambi i fornitori hanno pubblicato i numeri DeepSWE, e nessuno dei due compare in classifica
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Due fornitori, un benchmark, due numeri che non si possono sottrarre. Il materiale di lancio di SpaceXAI per Grok 4.6 riporta il 65,9% su DeepSWE v1.1. Il materiale di Xiaomi per MiMo-V2.6-Pro riporta 72,57 su DeepSWE v1.1. Letti insieme, suggeriscono che il modello open-weights più economico batte quello proprietario di frontiera di quasi sette punti. Letti con attenzione, non dicono quasi nulla, perché uno è una percentuale da presentazione di lancio sull'harness del fornitore stesso e l'altro è una media di tre prove da un'esecuzione di reinforcement learning sul grader di Xiaomi, e nessuno dei due è stato inviato alla classifica pubblica di DeepSWE. Il confronto tra MiMo-V2.6-Pro e Grok 4.6 che supera l'esame è sull'indice indipendente, e lì la risposta è l'opposto dei numeri dei fornitori: 46 contro 44, a favore di Xiaomi, per due punti.
Grok 4.6 è stato rilasciato il 12 agosto 2026 da SpaceXAI ed è il modello in carica in questo confronto — un modello di frontiera già distribuito e ampiamente utilizzato, con un listino prezzi documentato e mesi di misurazioni indipendenti alle spalle. Xiaomi MiMo-V2.6-Pro è diventato disponibile a livello generale il 22 settembre 2026, con i suoi repository di checkpoint di apprendimento per rinforzo comparsi il giorno precedente, ed è il nuovo arrivato. Entrambi sono capaci di ragionamento, entrambi sono progettati per lavoro agentico di lunga durata, e il divario di prezzo tra loro è abbastanza ampio che l'inesperienza del nuovo arrivato è l'unica cosa che frena il confronto.
Cosa è realmente ciascun modello
Grok 4.6 è proprietario, accetta input testuali e immagini e restituisce testo, e ha una knowledge cutoff al 1° febbraio 2026. La sua finestra di contesto è di 500.000 token, la metà di quella dei suoi principali concorrenti e la specifica più determinante della sua scheda. Le sue tariffe di listino sono 2,00 $ per milione di token di input, 0,50 $ per milione di token di input in cache e 6,00 $ per milione di token di output al di sotto dei 200.000 token di prompt, con un salto a quella soglia: a 200K o oltre le tariffe diventano 4,00 $, 1,00 $ e 12,00 $, e il livello superiore fattura l'intera richiesta anziché la porzione oltre la soglia. L'elaborazione prioritaria raddoppia la tariffa standard. Artificial Analysis ha misurato 63,0 token di output al secondo e 42,79 secondi al primo token alla massima intensità, e 2.351,83 $ per eseguire l'indice completo.
Xiaomi MiMo-V2.6-Pro è un modello sparse mixture-of-experts con 1,02 trilioni di parametri totali e 42 miliardi attivati per token, con una finestra di contesto di 1M token e multimodalità nativa su testo, immagine, video e audio. È con licenza MIT e pesi scaricabili, e Xiaomi ha mantenuto il prezzo della generazione precedente invece di riprezzare al rialzo il nuovo checkpoint — $0,43 per milione di token di input e $0,87 per milione di output, uno sconto cache del 99% e un costo misto di $0,18 con un mix 7:2:1 di cache-hit/input/output. Artificial Analysis ha misurato 134,3 token di output al secondo, 2,15 secondi al primo token e $206,66 per eseguire l'indice — $0,13 per attività.
• Pesi — MiMo-V2.6-Pro con licenza MIT e scaricabile; Grok 4.6 proprietario, solo API
• Parametri — MiMo-V2.6-Pro 1,02T totali / 42B attivi; Grok 4.6 non divulgati
• Contesto — MiMo-V2.6-Pro 1M token; Grok 4.6 500K, con un salto di prezzo a 200K di input
• Modalità — MiMo-V2.6-Pro accetta testo, immagini, video e audio; la superficie di input pubblicata di Grok 4.6 è testo e immagini
• Punteggio dell'indice — MiMo-V2.6-Pro 46; Grok 4.6 44, entrambi Artificial Analysis v4.3.2
• Prezzo di listino — MiMo-V2.6-Pro 0,43 $ / 0,87 $ per 1 milione; Grok 4.6 2,00 $ / 6,00 $, che raddoppia oltre 200K di input
• Tariffa combinata — MiMo-V2.6-Pro 0,18 $ per 1M; Grok 4.6 1,35 $
• Costo di esecuzione dell'indice — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83
• Velocità — MiMo-V2.6-Pro 134,3 token di output al secondo; Grok 4.6 63,0
• Tempo al primo token — MiMo-V2.6-Pro 2,15 secondi; Grok 4.6 42,79 secondi
• Data limite delle conoscenze — MiMo-V2.6-Pro non pubblicato; Grok 4.6 1 febbraio 2026

Il benchmark che entrambi i fornitori hanno eseguito, e perché non è comparabile
DeepSWE v1.1 è una valutazione reale, pubblica e di terze parti di agenti di programmazione, gestita da Datacurve, ed è l'unica famiglia di task sulla quale entrambe le aziende hanno scelto di pubblicare dei risultati. Il che la rende allettante. Non dovrebbe essere usata come confronto diretto, e il motivo non è che uno dei due fornitori stia mentendo — è che le due cifre descrivono misurazioni diverse dello stesso nome di task.
Il 72,57 di Xiaomi è una media di tre sul proprio harness con mini-swe-agent, prodotto durante una sessione di reinforcement learning anziché da un release candidate congelato, e riportato accanto a un valore di partenza di 58,4. La sessione è documentata come 30 step e circa 750.000 traiettorie per modello, completata in meno di sei giorni a una spesa dichiarata di circa 2,62 milioni di dollari per il modello Pro. Non è stata sottoposta alla classifica di Datacurve. Il 65,9% di SpaceXAI per Grok 4.6 è un dato da slide di lancio proveniente dal set di valutazione interno del fornitore, riportato accanto a guadagni rispetto a Grok 4.5 di 11,9 punti sullo stesso benchmark — e la classifica pubblica riporta una configurazione di Grok 4.6 sottoposta a circa il 67%, che è abbastanza vicino al numero del fornitore da suggerire che l'harness sia almeno approssimativamente allineato. Ciò non vale per il dato di Xiaomi, che non ha alcun corrispettivo pubblico.
Quindi l'affermazione onesta è questa: sulla classifica pubblica, Grok 4.6 è presente e MiMo-V2.6-Pro è assente. Sul composito indipendente, entrambi sono stati effettivamente testati dallo stesso valutatore, il modello di Xiaomi è in vantaggio di due punti. Questi due fatti non sono in contraddizione. Misurano semplicemente cose diverse, e il secondo è quello da citare.
Il contesto da 500K è la specifica che determina i carichi di lavoro reali
Mezzo milione di token è una finestra di contesto ampia per qualsiasi standard normale e piccola per il 2026. I modelli con cui MiMo-V2.6-Pro è raggruppato si attestano tutti a 1M, e la conseguenza pratica si manifesta esattamente nei carichi di lavoro per cui Grok 4.6 viene pubblicizzato. Un agente di coding a lunga esecuzione che mantiene un repository, una trascrizione degli strumenti e un piano accumulato supererà i 200.000 token di prompt in una sessione — e a quella soglia, le tariffe di Grok 4.6 raddoppiano e si applicano retroattivamente all'intera richiesta. La stessa sessione su MiMo-V2.6-Pro arriva a un milione di token senza cambi di fascia.
Questa è allo stesso tempo una differenza di specifiche e una differenza di struttura tariffaria, e la seconda è facile da trascurare quando si confrontano le tariffe di riferimento. Una tariffa mista di $1,35 per Grok 4.6 contro $0,18 per MiMo-V2.6-Pro è un divario di 7,5x. Su un prompt che supera i 200K si allarga a circa 15x, perché la tariffa di Grok raddoppia e quella di Xiaomi non cambia.
Anche la controargomentazione è agli atti, e merita di esserlo. La tesi di lancio di Grok 4.6 era l'efficienza dei turni anziché il contesto grezzo: nella valutazione agentica in cui è stato confrontato con Claude Opus 5 su compiti identici, ha terminato in circa 53 turni e circa 500 milioni di token di input contro circa 103 turni e due miliardi di token per l'altro modello, a un costo stimato di 0,84 $ per compito — il valore più basso tra i modelli di frontiera in quel confronto. Un modello che percorre il ciclo la metà delle volte non ha bisogno di altrettanto contesto, e non consuma altrettanti token. Questo è un vero vantaggio architetturale ed è l'argomento più forte a favore di Grok 4.6 contro qualsiasi alternativa più economica per token, inclusa questa.

Raggiungere ciascuno di loro
Grok 4.6 è su OrcaRouter come grok/grok-4.6, raggiungibile tramite un unico endpoint compatibile con OpenAI al prezzo di listino del fornitore con 0% di ricarico — così una variazione di prezzo di SpaceXAI, compresa una variazione di quella soglia di 200K, è attiva dalla nostra parte lo stesso giorno. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter. Nessun modello Xiaomi lo è, e la via per raggiungerlo oggi è la piattaforma di Xiaomi stessa o uno dei cataloghi di terze parti che lo elencano. Dirlo chiaramente è più utile che lasciare che una pagina di modello lasci intendere il contrario.
Quanto valga in pratica quell'asimmetria è un esperimento a basso costo. Grok 4.6 è il modello per cui potresti già stare pagando. MiMo-V2.6-Pro è un miglioramento di due punti sull'indice a una frazione della tariffa, lanciato questa settimana, con un'unica rotta di servizio alle spalle. La domanda a cui vale la pena rispondere non è quale sia migliore in astratto, ma quanta parte del tuo traffico Grok il modello Xiaomi possa gestire sui tuoi prompt — e rispondervi aprendo un secondo contratto, una seconda chiave e un secondo rapporto di fatturazione è l'attrito che impedisce che il test venga fatto. Con un unico endpoint e il failover automatico tra provider, il confronto è una modifica di configurazione, e qui la metà del failover conta più del solito: un modello lanciato questa settimana e inserito in elenco da un solo fornitore API quando Artificial Analysis l'ha rilevato non è qualcosa da mettere in un percorso di produzione senza una via di ripiego.

Quale scegliere
Scegli Grok 4.6 quando l'efficienza dei turni è ciò che stai ottimizzando — lunghi cicli di agenti in cui la capacità del modello di finire nella metà dei passaggi vale più del suo costo per token — oppure quando vuoi un modello con mesi di misurazioni indipendenti alle spalle anziché una settimana. I suoi 63 token al secondo e il tempo di 42,79 secondi al primo token lo rendono un modello per batch e carichi di lavoro offline in termini interattivi, e il suo contesto da 500K con un salto di prezzo a 200K induce a mantenere i prompt brevi.
Scegli MiMo-V2.6-Pro quando esegui loop ripetitivi e ad alto consumo di contesto che supererebbero il limite di 200K di Grok, quando hai bisogno di una latenza del primo token abbastanza bassa da poter essere attesa da un umano, quando vuoi i pesi nella tua infrastruttura, oppure quando il volume rende il divario di tariffa combinata di 7.5x il numero decisivo. Il suo vantaggio di due punti nell'indice è abbastanza piccolo da non dover essere il motivo da solo; il costo di $206.66 contro $2,351.83 per eseguire la stessa suite di valutazione è un motivo migliore.
Ciò che risolverebbe la questione aperta è una configurazione DeepSWE presentata per MiMo-V2.6-Pro. Grok 4.6 ne ha già una. Nel momento in cui il modello di Xiaomi compare sulla classifica pubblica con un harness dichiarato, un intervallo di confidenza e un costo per attività, il 72,57 smette di essere un numero del fornitore e il confronto sopra diventa un confronto reale — e, dato il divario di due punti sull'indice, potrebbe andare in un senso o nell'altro.
OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di ricarico, così una variazione di prezzo del fornitore è attiva lo stesso giorno.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
