
GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: stessa manovra, due offerte diverse
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due laboratori hanno eseguito la stessa manovra nella stessa quindicina, e la parte interessante è che l'hanno eseguita su presupposti opposti riguardo a ciò che un cliente sta acquistando. GPT-6 Astra Ultrafast è il modello di punta del fornitore venduto attraverso l'Ultrafast serving tier — il modello rilasciato il 3 settembre 2026, il tier ampiamente disponibile dal 29 settembre 2026, e citato nel post del 1° ottobre di NVIDIA come in esecuzione su GPU Blackwell. Xiaomi MiMo v2.6 Pro Ultraspeed è la versione di Xiaomi, rilasciata il 22 settembre 2026: lo stesso checkpoint da 1,02 trilioni di parametri di MiMo-V2.6-Pro, servito più velocemente, a circa dieci volte il tasso standard.
Uno di essi è il modo più veloce per chiamare un modello di frontiera. L'altro è il tier veloce più economico esistente. Non sono concorrenti nel senso comune — dovresti scrivere un'applicazione molto strana per scegliere tra un modello di punta chiuso da 300 $ per milione di token e un modello a pesi aperti da 8,70 $ per milione di token. Ciò che rende l'abbinamento degno di una pagina è che entrambi sono tier di velocità più che modelli, quindi confrontarli isola l'unica domanda che un tier di velocità pone: per cosa esattamente stai pagando il multiplo?
Entrambe le fasce vendono la stessa non-cosa.
Nessuno dei due nomi è un checkpoint. È questa la parte che la copertura del lancio tende a offuscare, perciò vale la pena affrontarla in modo meccanico.
• Cosa indica il nome — GPT-6 Astra Ultrafast è GPT-6 Astra con il campo della richiesta service_tier: "ultrafast" impostato; l'id del modello nella richiesta è ancora gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed è il checkpoint MiMo-V2.6-Pro servito su un percorso più veloce, prezzato come voce a sé stante.
• Cosa cambia — batching, decodifica speculativa, allocazione hardware, limiti di concorrenza, gestione delle connessioni. Tutto ciò che sta tra i pesi e la tua richiesta HTTP, e nulla all'interno dei pesi.
• Ciò che non cambia — le risposte. Lo stesso checkpoint con le stesse impostazioni dovrebbe produrre lo stesso contenuto a una velocità diversa. Se due corsie dello stesso modello divergono su input identico, quello è un difetto da segnalare, non una capacità che hai acquistato.
• Perché questo è importante per questo confronto — poiché nessuno dei due livelli dichiara un miglioramento dei benchmark rispetto alla propria fascia standard, l'intera decisione d'acquisto si riduce al prezzo per token messo a confronto con i secondi risparmiati. Il che significa che le due offerte si decidono con l'aritmetica, non con la valutazione.
C'è però un'asimmetria nell'impostazione, e non è nei livelli. UltraSpeed di Xiaomi poggia su un modello con licenza aperta — i pesi di MiMo-V2.6 portano una licenza MIT, secondo le stesse model card di Xiaomi, e la famiglia è stata rilasciata insieme al suo ambiente di addestramento RL. Ultrafast di OpenAI poggia su un flagship chiuso a cui puoi accedere solo tramite un'API. Pagare un multiplo di velocità per pesi aperti è una decisione reversibile; puoi sempre servire il checkpoint da te. Pagarlo per un flagship chiuso, no.

I due multipli di prezzo, e ciò che acquistano
Ecco dove la coppia smette di essere simmetrica, e i numeri sono insolitamente netti su entrambi i lati perché ciascun fornitore ha prezzato un multiplo anziché un valore assoluto.
• GPT-6 Astra Ultrafast — 60,00 $ per milione di token di input, 6,00 $ per input in cache, 75,00 $ per scrittura in cache e 300,00 $ di output, rispetto ai 10,00 $ e 50,00 $ del livello standard. Uniformemente 6.00x su ogni colonna, passando a 120,00 $ e 450,00 $ oltre 272.000 token di input. Il livello standard è attivo nel nostro catalogo al prezzo di listino di OpenAI, che è il modo più economico per raggiungere il modello di punta.
• Xiaomi MiMo v2.6 Pro Ultraspeed — 4,35 $ in input e 8,70 $ in output per milione di token, rispetto alla linea Pro standard a 0,44 $ e 0,87 $. Si tratta di circa 9,9x in input ed esattamente 10x in output.
• Le dichiarazioni di velocità associate a quei moltiplicatori — sia OpenAI sia NVIDIA limitano Astra Ultrafast a una generazione di token "fino a 8 volte" più veloce rispetto alla modalità standard di Astra. Il materiale di Xiaomi stesso dichiara una velocità di output fino a 20 volte superiore rispetto al servizio Pro standard; gli elenchi di cataloghi di terze parti che descrivono lo stesso modello nello stesso giorno parlano di circa 10 volte. Non è stata pubblicata alcuna misurazione che concili quelle due cifre.
• Il rapporto tra moltiplicatore e velocità — il prezzo 6x di OpenAI compra un tetto dichiarato di 8x, quindi il livello è prezzato al di sotto del suo stesso miglior caso. A seconda di quale cifra si creda, il prezzo 10x di Xiaomi compra un tetto dichiarato da 10x a 20x, quindi al tetto dichiarato dal fornitore l'operazione è favorevole e alla cifra inferiore è un semplice pareggio.
Questa è la singola differenza più rilevante ai fini della decisione tra le due, ed è più ridotta di quanto suggeriscano i prezzi di copertina. Per unità di latenza rimossa secondo le dichiarazioni dei fornitori stessi, Astra Ultrafast è la migliore delle due offerte. Per token di lavoro, Xiaomi UltraSpeed è circa quattordici volte più economico sull'input e trentaquattro volte più economico sull'output rispetto alle tariffe di Ultrafast, e da due a sei volte più economico rispetto alla corsia standard di Astra — ma è un modello diverso, e considerevolmente meno capace, ovvero il compromesso che stai effettivamente facendo. Le schede modello di Xiaomi per la famiglia pubblicano informazioni su architettura e addestramento anziché un punteggio aggregato indipendente, e per essa non è stata pubblicata affatto alcuna lettura dall'indice sul quale viene misurata l'ammiraglia di OpenAI.

Ciò che i due fornitori hanno scelto di divulgare
Le fasce di velocità sono più un test di trasparenza che un test di prestazioni, perché ciò che ti servirebbe per verificare l’affermazione — una distribuzione della latenza a una concorrenza dichiarata — è interamente nelle mani del fornitore.
Il post del 1° ottobre di NVIDIA è la dichiarazione pubblica più specifica alla base del tier Astra, e ciò che fornisce è l'attribuzione piuttosto che la misurazione: GPU Blackwell, disponibilità nell'API OpenAI e per gli utenti idonei di ChatGPT Work e Codex, e due ingegneri OpenAI che descrivono il ciclo. Philippe Tillet, responsabile dell'inferenza di OpenAI, afferma che Astra può "trasformare quella conoscenza in kernel ad alte prestazioni che rendono l'hardware NVIDIA convincente"; Uday Ruddarraju, chief technology officer per il calcolo di OpenAI, afferma che "abbiamo usato i nostri modelli interni per ottimizzare l'inferenza sulle GPU NVIDIA". Nessuna delle due frasi è accompagnata da un dato di throughput per il tier. L'8x si regge da solo, non qualificato oltre a "fino a".
La divulgazione di Xiaomi è andata nella direzione opposta: ha pubblicato l'economia dell'addestramento, incluso l'ambiente di apprendimento per rinforzo e il codice, mentre le sue model card contengono dettagli sull'architettura anziché sul serving. Il tier UltraSpeed stesso è arrivato con un'affermazione di 20x e nessuna curva di latenza pubblicata. Il che significa che sulla domanda a cui un tier di velocità dovrebbe rispondere, entrambi i fornitori sono ugualmente poco utili, e il pareggio su questo punto è la constatazione onesta.
Scegliere, se davvero devi
I due livelli non si sovrappongono molto, quindi la decisione riguarda meno scegliere un vincitore che riconoscere quale dei due acquisti sia il tuo.
Scegli Astra Ultrafast se il lavoro è agentico e la scelta del modello è già stata fatta. Un job con 40.000 token di output passa da 2,00 $ a 12,00 $, e il tier è l'unico modo per ottenere la qualità di un modello frontier a un ritmo più rapido. La documentazione di OpenAI stessa è esplicita sulla precondizione operativa: consiglia WebSockets "soprattutto per le applicazioni agentiche che effettuano molte chiamate a strumenti in rapida successione", avvertendo che "senza una connessione persistente, l'overhead di rete può ridurre i guadagni in termini di latenza". Attiva il tier e lascia HTTP per richiesta al di sotto di esso, e avrai pagato 6 volte tanto per una frazione dell'accelerazione. Vale anche la pena sapere, prima di integrarlo: il tier supporta solo la residenza dei dati negli Stati Uniti e l'elaborazione globale, senza endpoint di elaborazione regionali nell'UE o in altre regioni non statunitensi, ed è stato lanciato con limiti di frequenza iniziali bassi anche per gli account che altrimenti si qualificherebbero per limiti superiori.
Scegli MiMo v2.6 Pro Ultraspeed se il modello è un input di base per una pipeline che potresti ospitare tu stesso. La licenza MIT significa che il canale Pro standard non è la tua unica opzione di riserva: il self-hosting lo è. A $4,35 e $8,70 è abbastanza economico che un tier più veloce valga la pena di essere abilitato in via speculativa anziché giustificato per singolo task, e il suo contesto da 1 milione di token eguaglia quello del flagship. Tuttavia, comprendi ciò che stai acquistando: una tariffa circa dieci volte superiore per un modello che resta indietro rispetto alla frontiera, il che è lo scambio corretto per l'estrazione ad alto volume e quello sbagliato per qualsiasi cosa in cui la qualità della risposta condizioni il flusso di lavoro.
Nessuno dei due tier veloci è su OrcaRouter, e vale la pena dirlo apertamente anziché limitarsi a lasciarlo intendere. Ciò che invece è su OrcaRouter è openai/gpt-6-astra — il flagship del tier standard, a 10,00 $ e 50,00 $ per milione di token, con lo scatto long-context a 20,00 $ e 75,00 $, una finestra di contesto di 1.050.000 token e un output massimo di 128.000 token, su un endpoint compatibile con OpenAI. Qui non è ospitato alcun modello Xiaomi, quindi MiMo-V2.6-Pro e la sua corsia UltraSpeed sono raggiungibili solo tramite l'API di Xiaomi stessa e diverse piattaforme di terze parti. L'uso pratico di un endpoint con oltre 200 modelli in questo confronto non è l'accesso ai tier veloci. È che, quando vuoi sapere se la corsia costosa sta ripagando il suo multiplo, puoi inviare lo stesso prompt a un modello più economico con le stesse credenziali e la stessa chiave, nella richiesta successiva, e scoprirlo. È l'esperimento più economico disponibile ed è quello che risponde alla domanda — perché nessun fornitore ha pubblicato la curva di latenza che ti permetterebbe di rispondere senza misurare.

La lettura onesta
Entrambi i fornitori hanno pubblicato un listino prezzi per la latenza nelle ultime tre settimane, e nessuno dei due ha pubblicato una misurazione. Questa simmetria è la notizia, e ha una conseguenza pratica: le uniche cifre su cui puoi agire oggi sono i prezzi, e sono insolitamente informative perché entrambe le parti hanno applicato un prezzo pari a un multiplo netto anziché a un numero su misura.
Il livello rapido di OpenAI costa sei volte la sua tariffa standard e dichiara un tetto di otto. Quello di Xiaomi costa dieci volte la propria tariffa standard e dichiara un tetto compreso tra dieci e venti, a seconda di quale numero si creda. Letta come aritmetica sulle cifre dei fornitori stessi, le due sono quasi alla pari: il livello di OpenAI acquista un tetto dichiarato che vale 1,33 unità di velocità per unità di prezzo, quello di Xiaomi tra 1,0 e 2,0 con lo stesso calcolo — e il motivo per cui entrambi i livelli possono essere difendibili è che vendono ad acquirenti diversi che non prenderanno mai seriamente in considerazione l'opzione dell'altro. I prezzi sono anche l'unica parte di ciascuno dei due accordi che oggi sia verificabile, dato che un listino prezzi è un fatto pubblicato e una dichiarazione sulla latenza no.
