
MiMo-V2.6-Pro vs. GPT-5.6 Sol: Ein Indexpunkt, das Zweiundzwanzigfache der gemischten Rate
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Auf dem Artificial Analysis Intelligence Index v4.3.2, abgelesen am 22. September 2026, erzielt das GPT-5.6 Sol des Anbieters bei maximalem Aufwand 47 Punkte und Xiaomis MiMo-V2.6-Pro 46. Ein Punkt. Die von Artificial Analysis für die beiden veröffentlichten Mischsätze – ein 7:2:1-Mix aus Cache-Treffern, Eingabe und Ausgabe – betragen 3,08 $ für GPT-5.6 Sol und 0,18 $ für MiMo-V2.6-Pro. Zweiundzwanzigmal so viel Geld für einen Indexpunkt ist das gesamte Wesen dieses Duells, und die interessante Frage ist nicht, ob der Punkt das wert ist. Sie lautet, in welchen konkreten Anfragen der Punkt steckt, denn die Aggregatzahl verrät es Ihnen nicht.
Was das Paar überhaupt des Vergleichs wert macht, ist, dass sie nicht offensichtlich in dieselbe Kategorie fallen. GPT-5.6 Sol ist ein proprietäres Frontier-Modell mit einem Multi-Agenten-Modus und einer entsprechenden Preisliste. Xiaomi MiMo-V2.6-Pro ist ein MIT-lizenzierter Open-Weights-Checkpoint, der am 22. September 2026 veröffentlicht wurde, wobei die Reinforcement-Learning-Repositories am Tag zuvor erschienen, und er ist so bepreist, als wäre er ein Modell der Mittelklasse. Dass ein offenes Modell mit einer Billion Parametern nur einen Punkt von OpenAIs Flaggschiff entfernt liegt, ist die Nachricht. Was man mit dieser Tatsache anfängt, ist eine separate Entscheidung.
Die beiden Modelle, einfach ausgedrückt
GPT-5.6 Sol wurde am 9. Juli 2026 als Flaggschiff der GPT-5.6-Familie zusammen mit Terra und Luna veröffentlicht, und OpenAI leitet den bloßen gpt-5.6-Alias darauf um. Es ist proprietär, akzeptiert Text- und Bildeingaben und gibt Text zurück, unterstützt Reasoning-Aufwand von none bis xhigh plus einen „ultra“-Multiagentenmodus, der exklusiv für Sol ist, und hat einen Wissensstichtag im Februar 2026. Der Listenpreis beträgt 4,00 $ pro Million Eingabe-Tokens und 20,00 $ pro Million Ausgabe-Tokens auf OpenAIs First-Party-API, mit gecachter Eingabe zu 0,50 $ und einem Kontextfenster von 1 Mio. Tokens. Artificial Analysis maß 77,3 Ausgabe-Tokens pro Sekunde und 127,21 Sekunden bis zum ersten Token, bei Kosten von 3.464,84 $ für das Ausführen des vollständigen Index.
Xiaomi MiMo-V2.6-Pro ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden pro Token aktivierten Parametern, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio. Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben umzupreisen, weshalb ein Modell dieser Größe mit 0,43 $ und 0,87 $ pro Million Token bei einem Cache-Rabatt von 99 % gelistet wird. Artificial Analysis maß 134,3 Output-Token pro Sekunde, 2,15 Sekunden bis zum ersten Token und 206,66 $ für den Durchlauf des Index — 0,13 $ pro Aufgabe.
• Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; GPT-5.6 Sol proprietär, nur über API
• Parameter — MiMo-V2.6-Pro 1,02 T insgesamt / 42 Mrd. aktiv; GPT-5.6 Sol nicht angegeben
• Kontext — 1 Mio. Token bei beiden; GPT-5.6 Sol begrenzt die Ausgabe auf 128K
• Modalität — MiMo-V2.6-Pro nimmt Text, Bild, Video und Audio entgegen; die veröffentlichte Eingabeoberfläche von GPT-5.6 Sol ist Text und Bild
• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; GPT-5.6 Sol 4,00 $ / 20,00 $, zwischengespeicherte Eingabe 0,50 $
• Gemischter Tarif — MiMo-V2.6-Pro 0,18 $ pro 1 Mio.; GPT-5.6 Sol 3,08 $
• Gemessene Kosten pro Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; GPT-5.6 Sol 3.464,84 $ für den vollständigen Index
• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Tokens/Sekunde; GPT-5.6 Sol 77,3
• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 Sekunden; GPT-5.6 Sol 127,21 Sekunden
• Reasoning-Steuerung — GPT-5.6 Sol bietet none/low/medium/high/xhigh/max sowie einen Ultra-Multiagentenmodus; MiMo-V2.6-Pro veröffentlicht keine entsprechende Stufenleiter

Wo der eine Punkt tatsächlich liegt
Eine Lücke von einem Punkt bei einem Composite aus zehn Evaluierungen ist ein Rundungsfehler auf der Gesamtebene und eine Kluft auf der Komponentenebene. Die Suite umfasst AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1 – Reasoning, Wissen, Mathematik und Coding – und keiner der beiden Anbieter veröffentlicht eine Aufschlüsselung pro Evaluierung für diese beiden Modelle. Dieses Fehlen ist eine echte Einschränkung auf beiden Seiten dieser Seite und es lohnt sich, sie zu benennen, statt sie mit einem Composite zu übertünchen.
Was aktenkundig ist, ist richtungsweisend, und es deutet auf agentische Arbeit als den Bereich, in dem sich die Lücke konzentriert. Das Launch-Material von GPT-5.6 Sol nennt 53,6 % bei Agents' Last Exam, einer seit Langem laufenden Evaluierung professioneller Workflows über 55 Bereiche hinweg, die OpenAI als neuen Höchstwert bezeichnete; 64,6 % bei SWE-Bench Pro; 88,8 % bei Terminal-Bench 2.1; und 62,6 % bei OSWorld 2.0 für Computernutzung. Sein BrowseComp-Wert von 90,4 % steigt im Ultra-Modus, der vier parallele Subagenten mit ungefähr dem Vierfachen der Token-Kosten ausführt, auf 92,2 %. Das sind Herstellerangaben auf Hersteller-Harnessen, und für jede einzelne gilt der übliche Vorbehalt – doch es sind die Kategorien, in denen eine Gesamtlücke von einem Punkt am wenigsten wahrscheinlich gleichmäßig verteilt ist, und Xiaomi veröffentlicht keine vergleichbare agentische Aufschlüsselung für MiMo-V2.6-Pro.
Das Gegengewicht ist, dass die eigenen Herstellerzahlen von MiMo-V2.6-Pro zu einer völlig anderen Aufgabenfamilie gehören. Xiaomi berichtet, dass das Modell über seinen Reinforcement-Learning-Lauf hinweg auf DeepSWE v1.1 von 58,4 auf 72,57 steigt, bewertet mit mini-swe-agent als Durchschnitt aus drei auf Xiaomis eigenem Grader und nie bei einem öffentlichen Leaderboard eingereicht. 72,57 neben irgendeinen Sol-Wert zu stellen, würde einen Vergleich erfinden, den es nicht gibt. Die einzige Zahl, gegen die beide Modelle tatsächlich vom selben Evaluator getestet wurden, ist die 46 und die 47.
Der Kostenvergleich, richtig gemacht
Die Arithmetik pro Token unterschätzt die Kluft, weil die beiden Modelle nicht dieselbe Anzahl an Tokens verbrauchen, um dieselbe Aufgabe zu erledigen. Die faire einzelne Zahl ist der Wert, den Artificial Analysis gemessen hat, um seinen vollständigen Index gegen jedes Modell laufen zu lassen: $206,66 für MiMo-V2.6-Pro und $3.464,84 für GPT-5.6 Sol. Dieselbe Suite, derselbe Harness, identisch gemessen — ein 16,8-facher Unterschied bei einem kontrollierten Aufgabensatz, und einer, der bereits die Tatsache berücksichtigt, dass Sol ein Reasoning-Modell ist, das Tokens zum Denken ausgibt.
Jetzt eine Produktionsschleife. Ein 30-Schritte-Agentenlauf, der pro Schritt 200.000 Token Kontext liest und pro Schritt 2.000 Token schreibt, umfasst 6 Millionen Eingabe- und 60.000 Ausgabe-Token pro Lauf. Bei GPT-5.6 Sol zum Listenpreis sind das 24,00 $ Eingabe und 1,20 $ Ausgabe — 25,20 $ pro Lauf vor Caching. Bei MiMo-V2.6-Pro sind es 2,58 $ und 0,05 $ — 2,63 $. Caching verändert beides: Die zwischengespeicherte Eingabe von Sol zu 0,50 $ gegenüber dem 99-%-Rabatt von MiMo-V2.6-Pro lässt das teure Modell bei einer kontextlastigen Schleife immer noch um eine Größenordnung vorne liegen — und genau diese Schleife führt ein Agent aus.
Die Latenz-Hälfte des Vergleichs ist krasser als die Preishälfte und erhält weniger Aufmerksamkeit. GPT-5.6 Sol brauchte 127,21 Sekunden bis zum ersten Token. MiMo-V2.6-Pro brauchte 2,15. Das ist ein neunundfünfzigfacher Unterschied, und es ist die Zahl, die darüber entscheidet, ob ein interaktives Produkt überhaupt möglich ist. Sol ist bei maximalem Aufwand in der Praxis ein Batch-Modell – Sie reichen ein, Sie warten, Sie kommen zurück. Wenn Ihre Anwendung beim ersten Token blockiert, ist die Entscheidung bereits für Sie getroffen, egal, was der Index sagt.

Ein Schlüssel, beide Spuren
Beide Modelle sind über einen einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag erreichbar — GPT-5.6 Sol als openai/gpt-5.6-sol, was unsere eigene Route dorthin ist. Da wir den Listenpreis des Anbieters ohne Aufschlag weitergeben, ist eine Preisänderung auf einer der beiden Seiten noch am selben Tag bei uns live, statt auf ein neues Angebot zu warten.
Das Routing-DSL ist der Punkt, an dem diese Paarung nicht nur praktisch, sondern interessant wird. Zwei Modelle, einen Indexpunkt voneinander entfernt, von denen eines sechzehnmal mehr pro Aufgabe kostet, sind keine Alternativen, zwischen denen man wählen muss – sie sind eine Konfiguration mit zwei Spuren. Schicke den Großteil einer Workload auf die günstige Spur und leite den Rest anhand eines von dir definierten Prädikats auf die teure um: Anfragen, die einen Selbsttest nicht bestehen, Anfragen, die eine Komplexitätsregel erfüllen, Anfragen, deren Ausfallkosten die Token-Kosten so weit übersteigen, dass der Punkt eine günstige Versicherung ist. Failover ist die andere Hälfte davon. Sol wird breitflächig bereitgestellt; MiMo-V2.6-Pro ist diese Woche erschienen und wurde von einem einzigen API-Anbieter gelistet, als Artificial Analysis es erfasste – eine dünne Route für ein Modell, das man in einen Produktionspfad legen würde. Ein Router, der zurückfallen kann, macht die günstige Spur sicher adoptierbar und macht zugleich die teure Spur optional statt verpflichtend.

Welches soll man wählen?
Wähle GPT-5.6 Sol, wenn die Kosten eines Fehlers bei der Aufgabe die Token-Kosten in den Schatten stellen – langfristig angelegte agentische Arbeit mit echten Auswirkungen, Computer-Use-Automatisierung, Tool-Nutzung, bei der ein falscher Aufruf schlimmer ist als ein langsamer, alles, wofür Sie ohnehin bereits einen Menschen dafür bezahlen, die Ausgabe zu prüfen. Der Index-Lauf für 3.464,84 $ ist kein Grund, es zu meiden; er ist der Preis dieser Stufe, und die Stufe existiert aus gutem Grund.
Wähle MiMo-V2.6-Pro, wenn das Volumen die einschränkende Größe ist, wenn die Arbeitslast kontextlastig und repetitiv ist, wenn du eine First-Token-Latenz brauchst, die niedrig genug ist, dass ein Mensch darauf warten kann, wenn du die Gewichte in deiner eigenen Infrastruktur haben willst — MIT erlaubt kommerziellen Einsatz, Modifikation und weiteres Training — oder wenn die Unit Economics nur bei einem Fünftel Cent pro tausend Token funktionieren. Seine 134,3 Token pro Sekunde machen es interaktiv nutzbar, auf eine Weise, wie es die meisten offenen Billionen-Parameter-Modelle nicht sind, und das ist eine Fähigkeit, kein Rabatt.
Nimm beide, wenn du einen Router hast, denn die ehrliche Antwort auf „Welches ist besser“ ist, dass eine Differenz von einem Punkt im zusammengesetzten Score kein Urteil ist — sie ist eine Messung davon, wie ähnlich sie im Durchschnitt sind und wie unterschiedlich sie am Tail wahrscheinlich sind. Der Fehlermodus, den es zu vermeiden gilt, ist, sich auf das günstige Modell zu standardisieren, weil das Verhältnis 22x beträgt, im dritten Monat festzustellen, dass eine Klasse von Anfragen das teure Modell braucht, und keinen Weg zu haben, sie dorthin zu routen. Der spiegelbildliche Fehler ist, Sol-Preise für einen Zusammenfassungsjob zu zahlen, den ein 46-Index-Modell identisch erledigt. Keines von beiden ist ein Modellproblem. Beides ist Konfiguration, und Konfiguration ist der Teil, den man an einem Dienstagnachmittag ändern kann.
OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag bereit, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist.
