Eine generierte Titelkarte mit der Schlagzeile „GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed“, dem Untertitel „Gleiches Manöver, zwei verschiedene Angebote“ und zwei Karten mit der Aufschrift „Preisvielfaches: 6x vs 10x“ und „Geschwindigkeitsangabe: 8x vs 20x“, mit einer Fußzeile „Vom Anbieter angegebene Werte, September–Oktober 2026“.
Guides & Insights

GPT-6 Astra Ultrafast vs. Xiaomi MiMo v2.6 Pro Ultraspeed: Dasselbe Manöver, zwei unterschiedliche Deals

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Labore führten in denselben zwei Wochen dasselbe Manöver durch, und das Interessante daran ist, dass sie es auf der Grundlage gegensätzlicher Annahmen darüber durchführten, was ein Kunde kauft. GPT-6 Astra Ultrafast ist das Flaggschiff des Anbieters, vertrieben über die Ultrafast-Serving-Stufe – das am 3. September 2026 veröffentlichte Modell; die Stufe ist seit dem 29. September 2026 allgemein verfügbar, und in NVIDIAs Beitrag vom 1. Oktober wird es als auf Blackwell-GPUs laufend genannt. Xiaomi MiMo v2.6 Pro Ultraspeed ist Xiaomis Version, veröffentlicht am 22. September 2026: derselbe Checkpoint mit 1,02 Billionen Parametern wie MiMo-V2.6-Pro, schneller bereitgestellt, zu ungefähr dem Zehnfachen des Standardtarifs.

Eines davon ist der schnellste Weg, ein Frontier-Modell aufzurufen. Das andere ist die günstigste schnelle Stufe, die es gibt. Sie sind keine Konkurrenten im üblichen Sinne – man müsste eine sehr seltsame Anwendung schreiben, um zwischen einem geschlossenen Flaggschiff für 300 Dollar pro Million Token und einem Open-Weight-Modell für 8,70 Dollar pro Million Token zu wählen. Was die Paarung eine Seite wert macht, ist, dass es sich bei beiden um Geschwindigkeitsstufen und nicht um Modelle handelt, sodass ein Vergleich zwischen ihnen die eine Frage isoliert, die eine Geschwindigkeitsstufe aufwirft: Wofür genau zahlt man den Mehrfachpreis?

Beide Stufen verkaufen dasselbe Nicht-Ding

Weder der eine noch der andere Name ist ein Checkpoint. Das ist der Punkt, den die Launch-Berichterstattung gern verwischt, deshalb lohnt es sich, hier mechanisch vorzugehen.

• Worauf der Name verweist — GPT-6 Astra Ultrafast ist GPT-6 Astra mit dem Anfragefeld service_tier: "ultrafast" gesetzt; die Modell-ID in der Anfrage ist weiterhin gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed ist der MiMo-V2.6-Pro-Checkpoint, der über einen schnelleren Pfad bereitgestellt wird und als eigener Posten abgerechnet wird.

• Was sich ändert – Batching, spekulative Dekodierung, Hardware-Zuweisung, Nebenläufigkeitsgrenzen, Verbindungsverwaltung. Alles zwischen den Gewichten und Ihrer HTTP-Anfrage, und nichts innerhalb der Gewichte.

• Was sich nicht ändert — die Antworten. Derselbe Checkpoint sollte bei denselben Einstellungen denselben Inhalt mit einer anderen Geschwindigkeit erzeugen. Wenn zwei Lanes desselben Modells bei identischer Eingabe divergieren, ist das ein zu meldender Defekt, keine Fähigkeit, die du gekauft hast.

• Warum das für diesen Vergleich wichtig ist — denn da keine der beiden Stufen eine Benchmark-Verbesserung gegenüber ihrer eigenen Standard-Spur beansprucht, reduziert sich die gesamte Kaufentscheidung auf den Preis pro Token gegenüber eingesparten Sekunden. Was bedeutet, dass die beiden Angebote durch Arithmetik entschieden werden, nicht durch Bewertung.

Es gibt allerdings eine Asymmetrie in der Darstellung, und sie liegt nicht in den Stufen. Xiaomis UltraSpeed steht über einem offen lizenzierten Modell – die MiMo-V2.6-Gewichte tragen laut Xiaomis eigenen Model Cards eine MIT-Lizenz, und die Familie wurde zusammen mit ihrer RL-Trainingsumgebung veröffentlicht. OpenAIs Ultrafast steht über einem geschlossenen Flaggschiff, das man nur über eine API erreichen kann. Für offene Gewichte ein Geschwindigkeitsvielfaches zu bezahlen, ist eine umkehrbare Entscheidung; man kann den Checkpoint jederzeit selbst hosten. Für ein geschlossenes Flaggschiff ist das nicht der Fall.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

Die beiden Preis-Multiples und was sie kaufen

Hier hört das Paar auf, symmetrisch zu sein, und die Zahlen sind auf beiden Seiten ungewöhnlich sauber, weil jeder Anbieter ein Vielfaches statt eines absoluten Werts bepreist hat.

• GPT-6 Astra Ultrafast — 60,00 $ pro Million Eingabe-Tokens, 6,00 $ für gecachte Eingabe, 75,00 $ für Cache-Schreiben und 300,00 $ für Ausgabe, gegenüber 10,00 $ und 50,00 $ der Standardstufe. Einheitlich 6,00x über alle Spalten, ab 272.000 Eingabe-Tokens mit einem Sprung auf 120,00 $ und 450,00 $. Die Standardstufe ist in unserem Katalog zu OpenAIs Listenpreis verfügbar, dem günstigsten Weg zum Flaggschiff.

• Xiaomi MiMo v2.6 Pro Ultraspeed — 4,35 $ pro Million Token für die Eingabe und 8,70 $ pro Million Token für die Ausgabe, gegenüber der Standard-Pro-Lane mit 0,44 $ und 0,87 $. Das ist ungefähr 9,9x bei der Eingabe und genau 10x bei der Ausgabe.

• Die Geschwindigkeitsangaben, die mit diesen Multiplikatoren verbunden sind — OpenAI und NVIDIA begrenzen Astra Ultrafast beide auf „bis zu 8x“ schnellere Token-Generierung als der Astra-Standardmodus. Xiaomis eigenes Material behauptet bis zu 20x Ausgabegeschwindigkeit gegenüber dem Standard-Pro-Dienst; Katalogeinträge von Drittanbietern, die dasselbe Modell am selben Tag beschreiben, nennen etwa 10x. Es gibt keine Messung, die diese beiden Zahlen miteinander in Einklang bringt.

• Das Verhältnis von Multiplikator zu Geschwindigkeit — OpenAIs 6-facher Preis erkauft eine angegebene Obergrenze von 8x, sodass diese Stufe unter ihrem eigenen Bestfall liegt. Je nachdem, wessen Zahl man glaubt, erkauft Xiaomis 10-facher Preis eine angegebene Obergrenze von 10x bis 20x, sodass der Handel an der Obergrenze des Anbieters vorteilhaft ausfällt und bei der niedrigeren Zahl ein reines Nullgeschäft ist.

Das ist der mit Abstand entscheidungsrelevanteste Unterschied zwischen den beiden, und er ist kleiner, als die Schlagzeilenpreise vermuten lassen. Pro Einheit entfernter Latenz – nach den eigenen Angaben der Anbieter – ist Astra Ultrafast der bessere von beiden. Pro Token Arbeit ist Xiaomi UltraSpeed gemessen an den Ultrafast-Tarifen beim Input rund vierzehnmal günstiger und beim Output rund vierunddreißigmal günstiger und zwischen zwei- und sechsmal günstiger als Astras Standardspur – doch ist es ein anderes Modell und ein deutlich leistungsschwächeres, und das ist der Kompromiss, den Sie eingehen. Xiaomis eigene Modellkarten für die Familie veröffentlichen Architektur- und Trainingsfakten statt einer unabhängigen Gesamtpunktzahl, und dafür wurde überhaupt kein Messwert aus dem Index veröffentlicht, auf dem das Flaggschiff gemessen wird.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

Was die beiden Anbieter zu offenlegen beschlossen

Geschwindigkeitsstufen sind eher ein Offenlegungstest als ein Leistungstest, denn das, was man zur Überprüfung der Behauptung bräuchte – eine Latenzverteilung bei einer angegebenen Nebenläufigkeit –, liegt vollständig in den Händen des Anbieters.

NVIDIAs Beitrag vom 1. Oktober ist die konkreteste öffentliche Angabe hinter dem Astra-Tier, und was er beiträgt, ist Zuschreibung statt Messung: NVIDIA-GPUs, Verfügbarkeit in der OpenAI-API und für berechtigte ChatGPT Work- und Code-Nutzer sowie zwei OpenAI-Ingenieure. Philippe Tillet, OpenAIs Leiter für Inferenz, sagt, Astra könne „dieses Wissen in Hochleistungs-Kernels umsetzen, die NVIDIA-Hardware attraktiv machen“; Uday Ruddarraju, OpenAIs Chief Technology Officer für Compute, sagt: „Wir haben unsere internen Modelle genutzt, um die Inferenz auf NVIDIA-GPUs zu optimieren.“ Keiner der beiden Sätze enthält einen Durchsatzwert für das Tier. Die 8x steht für sich allein, nicht näher qualifiziert außer durch „bis zu“.

Xiaomis Offenlegung ging in die andere Richtung – sie veröffentlichte die Trainingsökonomie, einschließlich der Reinforcement-Learning-Umgebung und des Codes, und ihre Modellkarten enthalten Architekturfakten statt Serving-Fakten. Die UltraSpeed-Stufe selbst kam mit einer 20x-Behauptung und ohne veröffentlichte Latenzkurve. Das bedeutet, dass bei der Frage, zu deren Beantwortung es eine Geschwindigkeitsstufe gibt, beide Anbieter gleichermaßen wenig hilfreich sind, und der Gleichstand dort ist der ehrliche Befund.

Wählen, wenn es wirklich sein muss

Die beiden Stufen überschneiden sich kaum, deshalb geht es bei der Entscheidung weniger darum, einen Sieger zu küren, als darum zu erkennen, welcher der beiden Käufe deiner ist.

Wähle Astra Ultrafast, wenn die Arbeit agentisch ist und die Modellwahl bereits getroffen wurde. Ein Auftrag mit 40.000 Output-Token verteuert sich von $2.00 auf $12.00, und die Stufe ist der einzige Weg, Frontier-Modell-Qualität mit höherer Geschwindigkeit zu bekommen. OpenAIs eigene Dokumentation ist eindeutig zur operativen Voraussetzung: Sie empfiehlt WebSockets „besonders für agentische Anwendungen, die viele Tool-Aufrufe in schneller Folge ausführen“, und warnt, dass „ohne eine persistente Verbindung der Netzwerk-Overhead die Latenzgewinne verringern kann“. Aktiviere die Stufe und lasse HTTP pro Anfrage darunter – und du hast das Sechsfache für einen Bruchteil der Geschwindigkeitssteigerung bezahlt. Ebenfalls wissenswert, bevor du es einbindest: Die Stufe unterstützt nur US-Datenresidenz und globale Verarbeitung, ohne EU- oder andere nicht-US-regionale Verarbeitungsendpunkte, und sie startete mit niedrigen anfänglichen Ratenlimits, selbst für Konten, die andernfalls für mehr infrage kämen.

Wählen Sie MiMo v2.6 Pro Ultraspeed, wenn das Modell ein Commodity-Input für eine Pipeline ist, die Sie selbst hosten könnten. Die MIT-Lizenz bedeutet, dass die Standard-Pro-Lane nicht Ihr einziger Fallback ist – Self-Hosting ist es. Bei $4.35 und $8.70 ist es günstig genug, dass eine schnellere Stufe spekulativ aktiviert werden sollte, statt pro Aufgabe gerechtfertigt zu sein, und sein 1M-Token-Kontext entspricht dem des Flaggschiffs. Verstehen Sie jedoch, was Sie kaufen: eine ungefähr zehnfache Rate für ein Modell, das hinter der Frontier zurückbleibt, was für High-Volume-Extraktion die richtige Wahl und für alles die falsche ist, bei dem die Antwortqualität über den Workflow entscheidet.

Keine der beiden schnellen Stufen ist auf OrcaRouter verfügbar, und das sollte man klar sagen, statt es nur anzudeuten. Was auf OrcaRouter verfügbar ist, ist openai/gpt-6-astra — das Flaggschiff der Standardstufe, zu 10,00 $ und 50,00 $ pro Million Token, mit der Long-Context-Stufe bei 20,00 $ und 75,00 $, einem Kontext von 1.050.000 Token und einer maximalen Ausgabe von 128.000 Token, über einen OpenAI-kompatiblen Endpunkt. Hier wird überhaupt kein Xiaomi-Modell gehostet, sodass MiMo-V2.6-Pro und seine UltraSpeed-Spur nur über Xiaomis eigene API und mehrere Drittanbieter-Plattformen erreichbar sind. Der praktische Nutzen eines Endpunkts mit über 200 Modellen in diesem Vergleich ist nicht der Zugang zu den schnellen Stufen. Er besteht darin, dass man, wenn man wissen möchte, ob die teure Spur ihren mehrfachen Preis verdient, denselben Prompt an ein günstigeres Modell mit denselben Zugangsdaten und demselben Schlüssel in der nächsten Anfrage senden und es herausfinden kann. Das ist das günstigste verfügbare Experiment, und es ist dasjenige, das die Frage beantwortet — denn kein Anbieter hat die Latenzkurve veröffentlicht, mit der man sie beantworten könnte, ohne zu messen.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Die ehrliche Lesart

Beide Anbieter haben in den letzten drei Wochen eine Preisliste für Latenz veröffentlicht, und keiner hat eine Messung mitgeliefert. Diese Symmetrie ist die eigentliche Geschichte, und sie hat eine praktische Konsequenz: Die einzigen Zahlen, nach denen Sie sich heute richten können, sind die Preise, und diese sind ungewöhnlich aussagekräftig, weil beide Seiten ein glattes Vielfaches als Preis angesetzt haben statt einer maßgeschneiderten Zahl.

OpenAIs Fast-Tier kostet das Sechsfache seines eigenen Standardtarifs und nennt eine Obergrenze von acht. Xiaomis Fast-Tier kostet das Zehnfache seines eigenen Standardtarifs und nennt eine Obergrenze irgendwo zwischen zehn und zwanzig, je nachdem, wessen Zahl man glaubt. Als Rechnung mit den eigenen Zahlen der Anbieter betrachtet, nehmen sich die beiden kaum etwas: OpenAIs Tarif erkauft eine behauptete Obergrenze im Wert von 1,33 Geschwindigkeitseinheiten pro Preiseinheit, Xiaomis Tarif erkauft nach derselben Rechnung zwischen 1,0 und 2,0 — und der Grund, warum beide vertretbar sein können, ist, dass die beiden Tarife an unterschiedliche Käufer verkauft werden, die die Option des jeweils anderen nie ernsthaft in Betracht ziehen würden. Die Preise sind außerdem der einzige Teil beider Angebote, der heute prüfbar ist, denn eine Preisliste ist eine veröffentlichte Tatsache und eine Latenzangabe nicht.