Una card del titolo generata con il titolo principale 'GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed', il sottotitolo 'Stessa manovra, due offerte diverse', e due schede che riportano 'Multiplo di prezzo: 6x vs 10x' e 'Velocità dichiarata: 8x vs 20x', con un piè di pagina che riporta 'Dati dichiarati dal fornitore, settembre-ottobre 2026'.
Guides & Insights

GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: stessa manovra, due offerte diverse

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due laboratori hanno eseguito la stessa manovra nella stessa quindicina, e la parte interessante è che l'hanno eseguita su presupposti opposti riguardo a ciò che un cliente sta acquistando. GPT-6 Astra Ultrafast è il modello di punta del fornitore venduto attraverso l'Ultrafast serving tier — il modello rilasciato il 3 settembre 2026, il tier ampiamente disponibile dal 29 settembre 2026, e citato nel post del 1° ottobre di NVIDIA come in esecuzione su GPU Blackwell. Xiaomi MiMo v2.6 Pro Ultraspeed è la versione di Xiaomi, rilasciata il 22 settembre 2026: lo stesso checkpoint da 1,02 trilioni di parametri di MiMo-V2.6-Pro, servito più velocemente, a circa dieci volte il tasso standard.

Uno di essi è il modo più veloce per chiamare un modello di frontiera. L'altro è il tier veloce più economico esistente. Non sono concorrenti nel senso comune — dovresti scrivere un'applicazione molto strana per scegliere tra un modello di punta chiuso da 300 $ per milione di token e un modello a pesi aperti da 8,70 $ per milione di token. Ciò che rende l'abbinamento degno di una pagina è che entrambi sono tier di velocità più che modelli, quindi confrontarli isola l'unica domanda che un tier di velocità pone: per cosa esattamente stai pagando il multiplo?

Entrambe le fasce vendono la stessa non-cosa.

Nessuno dei due nomi è un checkpoint. È questa la parte che la copertura del lancio tende a offuscare, perciò vale la pena affrontarla in modo meccanico.

• Cosa indica il nome — GPT-6 Astra Ultrafast è GPT-6 Astra con il campo della richiesta service_tier: "ultrafast" impostato; l'id del modello nella richiesta è ancora gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed è il checkpoint MiMo-V2.6-Pro servito su un percorso più veloce, prezzato come voce a sé stante.

• Cosa cambia — batching, decodifica speculativa, allocazione hardware, limiti di concorrenza, gestione delle connessioni. Tutto ciò che sta tra i pesi e la tua richiesta HTTP, e nulla all'interno dei pesi.

• Ciò che non cambia — le risposte. Lo stesso checkpoint con le stesse impostazioni dovrebbe produrre lo stesso contenuto a una velocità diversa. Se due corsie dello stesso modello divergono su input identico, quello è un difetto da segnalare, non una capacità che hai acquistato.

• Perché questo è importante per questo confronto — poiché nessuno dei due livelli dichiara un miglioramento dei benchmark rispetto alla propria fascia standard, l'intera decisione d'acquisto si riduce al prezzo per token messo a confronto con i secondi risparmiati. Il che significa che le due offerte si decidono con l'aritmetica, non con la valutazione.

C'è però un'asimmetria nell'impostazione, e non è nei livelli. UltraSpeed di Xiaomi poggia su un modello con licenza aperta — i pesi di MiMo-V2.6 portano una licenza MIT, secondo le stesse model card di Xiaomi, e la famiglia è stata rilasciata insieme al suo ambiente di addestramento RL. Ultrafast di OpenAI poggia su un flagship chiuso a cui puoi accedere solo tramite un'API. Pagare un multiplo di velocità per pesi aperti è una decisione reversibile; puoi sempre servire il checkpoint da te. Pagarlo per un flagship chiuso, no.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

I due multipli di prezzo, e ciò che acquistano

Ecco dove la coppia smette di essere simmetrica, e i numeri sono insolitamente netti su entrambi i lati perché ciascun fornitore ha prezzato un multiplo anziché un valore assoluto.

• GPT-6 Astra Ultrafast — 60,00 $ per milione di token di input, 6,00 $ per input in cache, 75,00 $ per scrittura in cache e 300,00 $ di output, rispetto ai 10,00 $ e 50,00 $ del livello standard. Uniformemente 6.00x su ogni colonna, passando a 120,00 $ e 450,00 $ oltre 272.000 token di input. Il livello standard è attivo nel nostro catalogo al prezzo di listino di OpenAI, che è il modo più economico per raggiungere il modello di punta.

• Xiaomi MiMo v2.6 Pro Ultraspeed — 4,35 $ in input e 8,70 $ in output per milione di token, rispetto alla linea Pro standard a 0,44 $ e 0,87 $. Si tratta di circa 9,9x in input ed esattamente 10x in output.

• Le dichiarazioni di velocità associate a quei moltiplicatori — sia OpenAI sia NVIDIA limitano Astra Ultrafast a una generazione di token "fino a 8 volte" più veloce rispetto alla modalità standard di Astra. Il materiale di Xiaomi stesso dichiara una velocità di output fino a 20 volte superiore rispetto al servizio Pro standard; gli elenchi di cataloghi di terze parti che descrivono lo stesso modello nello stesso giorno parlano di circa 10 volte. Non è stata pubblicata alcuna misurazione che concili quelle due cifre.

• Il rapporto tra moltiplicatore e velocità — il prezzo 6x di OpenAI compra un tetto dichiarato di 8x, quindi il livello è prezzato al di sotto del suo stesso miglior caso. A seconda di quale cifra si creda, il prezzo 10x di Xiaomi compra un tetto dichiarato da 10x a 20x, quindi al tetto dichiarato dal fornitore l'operazione è favorevole e alla cifra inferiore è un semplice pareggio.

Questa è la singola differenza più rilevante ai fini della decisione tra le due, ed è più ridotta di quanto suggeriscano i prezzi di copertina. Per unità di latenza rimossa secondo le dichiarazioni dei fornitori stessi, Astra Ultrafast è la migliore delle due offerte. Per token di lavoro, Xiaomi UltraSpeed è circa quattordici volte più economico sull'input e trentaquattro volte più economico sull'output rispetto alle tariffe di Ultrafast, e da due a sei volte più economico rispetto alla corsia standard di Astra — ma è un modello diverso, e considerevolmente meno capace, ovvero il compromesso che stai effettivamente facendo. Le schede modello di Xiaomi per la famiglia pubblicano informazioni su architettura e addestramento anziché un punteggio aggregato indipendente, e per essa non è stata pubblicata affatto alcuna lettura dall'indice sul quale viene misurata l'ammiraglia di OpenAI.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

Ciò che i due fornitori hanno scelto di divulgare

Le fasce di velocità sono più un test di trasparenza che un test di prestazioni, perché ciò che ti servirebbe per verificare l’affermazione — una distribuzione della latenza a una concorrenza dichiarata — è interamente nelle mani del fornitore.

Il post del 1° ottobre di NVIDIA è la dichiarazione pubblica più specifica alla base del tier Astra, e ciò che fornisce è l'attribuzione piuttosto che la misurazione: GPU Blackwell, disponibilità nell'API OpenAI e per gli utenti idonei di ChatGPT Work e Codex, e due ingegneri OpenAI che descrivono il ciclo. Philippe Tillet, responsabile dell'inferenza di OpenAI, afferma che Astra può "trasformare quella conoscenza in kernel ad alte prestazioni che rendono l'hardware NVIDIA convincente"; Uday Ruddarraju, chief technology officer per il calcolo di OpenAI, afferma che "abbiamo usato i nostri modelli interni per ottimizzare l'inferenza sulle GPU NVIDIA". Nessuna delle due frasi è accompagnata da un dato di throughput per il tier. L'8x si regge da solo, non qualificato oltre a "fino a".

La divulgazione di Xiaomi è andata nella direzione opposta: ha pubblicato l'economia dell'addestramento, incluso l'ambiente di apprendimento per rinforzo e il codice, mentre le sue model card contengono dettagli sull'architettura anziché sul serving. Il tier UltraSpeed stesso è arrivato con un'affermazione di 20x e nessuna curva di latenza pubblicata. Il che significa che sulla domanda a cui un tier di velocità dovrebbe rispondere, entrambi i fornitori sono ugualmente poco utili, e il pareggio su questo punto è la constatazione onesta.

Scegliere, se davvero devi

I due livelli non si sovrappongono molto, quindi la decisione riguarda meno scegliere un vincitore che riconoscere quale dei due acquisti sia il tuo.

Scegli Astra Ultrafast se il lavoro è agentico e la scelta del modello è già stata fatta. Un job con 40.000 token di output passa da 2,00 $ a 12,00 $, e il tier è l'unico modo per ottenere la qualità di un modello frontier a un ritmo più rapido. La documentazione di OpenAI stessa è esplicita sulla precondizione operativa: consiglia WebSockets "soprattutto per le applicazioni agentiche che effettuano molte chiamate a strumenti in rapida successione", avvertendo che "senza una connessione persistente, l'overhead di rete può ridurre i guadagni in termini di latenza". Attiva il tier e lascia HTTP per richiesta al di sotto di esso, e avrai pagato 6 volte tanto per una frazione dell'accelerazione. Vale anche la pena sapere, prima di integrarlo: il tier supporta solo la residenza dei dati negli Stati Uniti e l'elaborazione globale, senza endpoint di elaborazione regionali nell'UE o in altre regioni non statunitensi, ed è stato lanciato con limiti di frequenza iniziali bassi anche per gli account che altrimenti si qualificherebbero per limiti superiori.

Scegli MiMo v2.6 Pro Ultraspeed se il modello è un input di base per una pipeline che potresti ospitare tu stesso. La licenza MIT significa che il canale Pro standard non è la tua unica opzione di riserva: il self-hosting lo è. A $4,35 e $8,70 è abbastanza economico che un tier più veloce valga la pena di essere abilitato in via speculativa anziché giustificato per singolo task, e il suo contesto da 1 milione di token eguaglia quello del flagship. Tuttavia, comprendi ciò che stai acquistando: una tariffa circa dieci volte superiore per un modello che resta indietro rispetto alla frontiera, il che è lo scambio corretto per l'estrazione ad alto volume e quello sbagliato per qualsiasi cosa in cui la qualità della risposta condizioni il flusso di lavoro.

Nessuno dei due tier veloci è su OrcaRouter, e vale la pena dirlo apertamente anziché limitarsi a lasciarlo intendere. Ciò che invece è su OrcaRouter è openai/gpt-6-astra — il flagship del tier standard, a 10,00 $ e 50,00 $ per milione di token, con lo scatto long-context a 20,00 $ e 75,00 $, una finestra di contesto di 1.050.000 token e un output massimo di 128.000 token, su un endpoint compatibile con OpenAI. Qui non è ospitato alcun modello Xiaomi, quindi MiMo-V2.6-Pro e la sua corsia UltraSpeed sono raggiungibili solo tramite l'API di Xiaomi stessa e diverse piattaforme di terze parti. L'uso pratico di un endpoint con oltre 200 modelli in questo confronto non è l'accesso ai tier veloci. È che, quando vuoi sapere se la corsia costosa sta ripagando il suo multiplo, puoi inviare lo stesso prompt a un modello più economico con le stesse credenziali e la stessa chiave, nella richiesta successiva, e scoprirlo. È l'esperimento più economico disponibile ed è quello che risponde alla domanda — perché nessun fornitore ha pubblicato la curva di latenza che ti permetterebbe di rispondere senza misurare.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

La lettura onesta

Entrambi i fornitori hanno pubblicato un listino prezzi per la latenza nelle ultime tre settimane, e nessuno dei due ha pubblicato una misurazione. Questa simmetria è la notizia, e ha una conseguenza pratica: le uniche cifre su cui puoi agire oggi sono i prezzi, e sono insolitamente informative perché entrambe le parti hanno applicato un prezzo pari a un multiplo netto anziché a un numero su misura.

Il livello rapido di OpenAI costa sei volte la sua tariffa standard e dichiara un tetto di otto. Quello di Xiaomi costa dieci volte la propria tariffa standard e dichiara un tetto compreso tra dieci e venti, a seconda di quale numero si creda. Letta come aritmetica sulle cifre dei fornitori stessi, le due sono quasi alla pari: il livello di OpenAI acquista un tetto dichiarato che vale 1,33 unità di velocità per unità di prezzo, quello di Xiaomi tra 1,0 e 2,0 con lo stesso calcolo — e il motivo per cui entrambi i livelli possono essere difendibili è che vendono ad acquirenti diversi che non prenderanno mai seriamente in considerazione l'opzione dell'altro. I prezzi sono anche l'unica parte di ciascuno dei due accordi che oggi sia verificabile, dato che un listino prezzi è un fatto pubblicato e una dichiarazione sulla latenza no.