Een gegenereerde titelkaart met de kop 'GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed', de subkop 'Dezelfde manoeuvre, twee verschillende deals', en twee kaarten met de tekst 'Prijsveelvoud: 6x vs 10x' en 'Snelheidsclaim: 8x vs 20x', met een voettekst met de tekst 'Door leveranciers gerapporteerde cijfers, september-oktober 2026'.
Guides & Insights

GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: dezelfde manoeuvre, twee verschillende deals

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee labs voerden in dezelfde twee weken dezelfde manoeuvre uit, en het interessante is dat ze dat deden op basis van tegenovergestelde aannames over wat een klant koopt. GPT-6 Astra Ultrafast is het vlaggenschip van de leverancier, verkocht via de Ultrafast-servingtier — het model dat op 3 september 2026 werd uitgebracht, de tier die sinds 29 september 2026 breed beschikbaar is, en genoemd in NVIDIA's bericht van 1 oktober als draaiend op Blackwell-GPU's. Xiaomi MiMo v2.6 Pro Ultraspeed is Xiaomi's versie, uitgebracht op 22 september 2026: hetzelfde checkpoint met 1,02 biljoen parameters als MiMo-V2.6-Pro, sneller geserveerd, tegen ongeveer tien keer het standaardtarief.

Een van beide is de snelste manier om een frontier-model aan te roepen. De andere is de goedkoopste snelle tier die bestaat. Het zijn geen concurrenten in de gebruikelijke zin — je zou een heel vreemde applicatie moeten schrijven om te kiezen tussen een gesloten vlaggenschipmodel van $300 per miljoen tokens en een open-weightmodel van $8,70 per miljoen tokens. Wat deze combinatie een pagina waard maakt, is dat beide snelheidstiers zijn en geen modellen, dus door ze te vergelijken blijft precies de ene vraag over die een snelheidstier oproept: waar betaal je dat veelvoud precies voor?

Beide niveaus verkopen hetzelfde niet-ding

Geen van beide namen is een checkpoint. Dit is het onderdeel dat de berichtgeving over de lancering geneigd is te verdoezelen, dus loont het om hier mechanisch te werk te gaan.

• Waar de naam op wijst — GPT-6 Astra Ultrafast is GPT-6 Astra met het aanvraagveld service_tier: "ultrafast" ingesteld; het model-id in de aanvraag is nog steeds gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed is het MiMo-V2.6-Pro-checkpoint dat via een sneller pad wordt aangeboden, met een eigen prijsregel.

• Wat verandert — batching, speculatieve decoding, hardwaretoewijzing, limieten voor gelijktijdigheid, verbindingsafhandeling. Alles tussen de gewichten en je HTTP-verzoek, en niets binnen de gewichten.

• Wat niet verandert — de antwoorden. Hetzelfde checkpoint met dezelfde instellingen zou dezelfde inhoud met een andere snelheid moeten produceren. Als twee sporen van hetzelfde model divergeren bij identieke invoer, is dat een defect om te melden, niet een mogelijkheid die je hebt gekocht.

• Waarom dat belangrijk is voor deze vergelijking — omdat geen van beide niveaus een benchmarkverbetering ten opzichte van zijn eigen standaardvariant claimt, valt de hele aankoopbeslissing uiteen in prijs per token tegenover bespaarde seconden. Dat betekent dat de twee aanbiedingen door rekenwerk worden beslist, niet door evaluatie.

Er zit echter één asymmetrie in de framing, en die zit niet in de niveaus. Xiaomi's UltraSpeed rust op een openlijk gelicentieerd model — de MiMo-V2.6-gewichten dragen een MIT-licentie, volgens Xiaomi's eigen modelkaarten, en de familie werd uitgebracht met zijn RL-trainingsomgeving. OpenAI's Ultrafast rust op een gesloten flagship dat je alleen via een API kunt bereiken. Een snelheidsveelvoud betalen voor open gewichten is een omkeerbare beslissing; je kunt de checkpoint altijd zelf serveren. Dat betalen voor een gesloten flagship is dat niet.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

De twee koersmultiples, en wat ze kopen

Hier houdt het paar op symmetrisch te zijn, en de cijfers zijn aan beide kanten ongewoon rond, omdat elke leverancier een veelvoud hanteerde in plaats van een absoluut bedrag.

• GPT-6 Astra Ultrafast — $60,00 per miljoen inputtokens, $6,00 voor gecachte input, $75,00 voor cache-write en $300,00 voor output, tegenover $10,00 en $50,00 van de standaardlaag. Uniform 6,00x in elke kolom, oplopend naar $120,00 en $450,00 boven 272.000 inputtokens. De standaardlaag is beschikbaar in onze catalogus tegen de lijstprijs van OpenAI, wat de goedkoopste manier is om het vlaggenschip te bereiken.

• Xiaomi MiMo v2.6 Pro Ultraspeed — $4,35 invoer en $8,70 uitvoer per miljoen tokens, tegenover de standaard Pro-variant van $0,44 en $0,87. Dat is ongeveer 9,9x op invoer en precies 10x op uitvoer.

• De snelheidsclaims die aan die veelvouden kleven — OpenAI en NVIDIA stellen voor Astra Ultrafast beide een maximum vast van 'tot 8x' snellere tokengeneratie dan de Astra-standaardmodus. Xiaomi's eigen materiaal claimt tot 20x uitvoersnelheid ten opzichte van de standaard Pro-service; catalogusvermeldingen van derden die hetzelfde model op dezelfde dag beschrijven, vermelden ongeveer 10x. Er is geen meting gepubliceerd die die twee cijfers met elkaar verzoent.

• De verhouding van veelvoud tot snelheid — OpenAI's 6x-prijs levert een geclaimd plafond van 8x op, dus de prijs van het niveau ligt onder zijn eigen beste scenario. Afhankelijk van wiens cijfer je gelooft, levert Xiaomi's 10x-prijs een geclaimd plafond van 10x tot 20x op, dus bij het plafond van de leverancier is de transactie gunstig en bij het lagere cijfer is het lood om oud ijzer.

Dat is het meest beslissingsrelevante verschil tussen de twee, en het is kleiner dan de prijzen in de koppen doen vermoeden. Per eenheid verwijderde latentie volgens de eigen claims van de leveranciers is Astra Ultrafast de betere van de twee deals. Per token werk is Xiaomi UltraSpeed ongeveer veertien keer goedkoper op input en vierendertig keer goedkoper op output vergeleken met de Ultrafast-tarieven, en twee tot zes keer goedkoper dan Astra's standaardvariant — maar het is een ander model, en een aanzienlijk minder capabel model, en dat is de afweging die je feitelijk maakt. Xiaomi's eigen modelkaarten voor de familie publiceren feiten over architectuur en training in plaats van een onafhankelijke geaggregeerde score, en voor dit model is helemaal geen meting gepubliceerd uit de index waarop OpenAI's vlaggenschip wordt gemeten.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

Wat de twee leveranciers kozen te onthullen

Snelheidscategorieën zijn eerder een openbaarmakingstest dan een prestatietest, omdat hetgeen je nodig zou hebben om de claim te verifiëren — een latentieverdeling bij een vermelde gelijktijdigheid — volledig in handen van de leverancier is.

De post van NVIDIA van 1 oktober is de meest specifieke publieke verklaring achter de Astra-tier, en wat die bijdraagt is toeschrijving in plaats van meting: Blackwell-GPU's, beschikbaarheid in de OpenAI API en voor in aanmerking komende ChatGPT Work- en Codex-gebruikers, en twee OpenAI-engineers die de lus beschrijven. Philippe Tillet, inference lead bij OpenAI, zegt dat Astra "die kennis kan omzetten in high-performance kernels die NVIDIA-hardware aantrekkelijk maken"; Uday Ruddarraju, chief technology officer of compute bij OpenAI, zegt: "we hebben onze interne modellen gebruikt om inference op NVIDIA-GPU's te optimaliseren." Geen van beide uitspraken gaat gepaard met een doorvoercijfer voor de tier. De 8x staat op zichzelf, zonder enige kwalificatie anders dan "tot".

Xiaomi's openbaarmaking ging de andere kant op — het publiceerde de trainingseconomie, inclusief de reinforcement-learningomgeving en -code, en zijn modelkaarten bevatten feiten over de architectuur in plaats van over serving. De UltraSpeed-tier zelf kwam met een 20x-claim en geen gepubliceerde latentiecurve. Dat betekent dat beide leveranciers op de vraag die een snelheidstier beoogt te beantwoorden even weinig behulpzaam zijn, en dat het gelijkspel daar de eerlijke bevinding is.

Kiezen, als je echt moet

De twee tiers overlappen elkaar niet veel, dus de beslissing gaat minder over het kiezen van een winnaar dan over het herkennen welke van de twee aankopen de jouwe is.

Kies Astra Ultrafast als het werk agentisch is en de modelkeuze al is gemaakt. Een taak met 40.000 outputtokens gaat van $2,00 naar $12,00, en de tier is de enige manier om frontier-modelkwaliteit in een hoger tempo te krijgen. OpenAI's eigen documentatie is expliciet over de operationele voorwaarde: het adviseert WebSockets, "vooral voor agentische applicaties die veel tool-aanroepen snel achter elkaar doen", met de waarschuwing dat "zonder een persistente verbinding netwerkoverhead de latentiewinst kan verminderen". Zet de tier aan en laat per-request-HTTP eronder staan, en je hebt 6x betaald voor een fractie van de snelheidswinst. Ook goed om te weten voordat je het integreert: de tier ondersteunt alleen dataresidentie in de VS en wereldwijde verwerking, zonder EU- of andere niet-Amerikaanse regionale verwerkings-endpoints, en werd gelanceerd met lage initiële snelheidslimieten, zelfs voor accounts die anders voor meer in aanmerking zouden komen.

Kies MiMo v2.6 Pro Ultraspeed als het model een commodity-input is voor een pipeline die je zelf zou kunnen hosten. De MIT-licentie betekent dat de standaard Pro-lane niet je enige terugvaloptie is — self-hosting is dat. Voor $4,35 en $8,70 is het goedkoop genoeg dat een snellere tier het waard is om speculatief in te schakelen in plaats van per taak gerechtvaardigd te worden, en zijn 1-tokencontext is die van het vlaggenschip. Begrijp echter wel wat je koopt: een ruwweg tien keer zo hoog tarief voor een model dat achterblijft bij de frontier, wat de juiste afweging is voor high-volume-extractie en de verkeerde voor alles waarbij de antwoordkwaliteit de workflow bepaalt.

Geen van beide snelle tiers zit op OrcaRouter, en dat kun je maar beter gewoon zeggen in plaats van eromheen te draaien. Wat wel op OrcaRouter zit, is openai/gpt-6-astra — de flagship van de standaardtier, voor $10,00 en $50,00 per miljoen tokens, met de lange-contextstap op $20,00 en $75,00, een context van 1.050.000 tokens en een maximale output van 128.000 tokens, via een OpenAI-compatibel endpoint. Er wordt hier helemaal geen Xiaomi-model gehost, dus MiMo-V2.6-Pro en zijn UltraSpeed-lane zijn alleen bereikbaar via Xiaomi's eigen API en verschillende platforms van derden. Het praktische nut van een endpoint met meer dan 200 modellen in deze vergelijking is niet de toegang tot de snelle tiers. Het is dat je, wanneer je wilt weten of de dure lane zijn veelvoud waard is, dezelfde prompt naar een goedkoper model kunt sturen met dezelfde inloggegevens en dezelfde sleutel, in het volgende verzoek, en erachter komt. Dat is het goedkoopste experiment dat beschikbaar is, en het is degene die de vraag beantwoordt — want geen enkele leverancier heeft de latentiecurve gepubliceerd waarmee je die vraag zou kunnen beantwoorden zonder te meten.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

De eerlijke lezing

Beide leveranciers hebben in de afgelopen drie weken een tariefkaart voor latentie uitgebracht, en geen van beide leverde een meting. Die symmetrie is het verhaal, en die heeft een praktisch gevolg: de enige cijfers waarop je vandaag kunt handelen, zijn de prijzen, en die zijn ongewoon informatief omdat beide partijen een zuivere veelvoud hanteerden in plaats van een getal op maat.

De snelle tier van OpenAI kost zes keer zijn eigen standaardtarief en claimt een plafond van acht. Die van Xiaomi kost tien keer zijn eigen standaardtarief en claimt een plafond ergens tussen tien en twintig, afhankelijk van wiens cijfer je gelooft. Als je het als rekenkunde met de eigen cijfers van de aanbieders leest, ontlopen de twee elkaar nauwelijks: de tier van OpenAI levert een geclaimd plafond op van 1,33 eenheden snelheid per eenheid prijs, die van Xiaomi levert volgens dezelfde berekening tussen 1,0 en 2,0 op — en de reden dat ze beide verdedigbaar kunnen zijn, is dat de twee tiers aan verschillende kopers verkopen die elkaars optie nooit serieus zullen overwegen. De prijzen zijn ook het enige onderdeel van beide deals dat vandaag auditeerbaar is, aangezien een tariefkaart een gepubliceerd feit is en een latentieclaim niet.