
GPT-6.1 Sol vs. Qwen3.8-Max: Die Rechnung, nicht die Preisliste
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Nimm eine nächtliche Repository-Wartungsaufgabe, lass sie einen Monat lang einmal pro Nacht laufen und setze GPT-6.1 Sol und Qwen3.8-Max abwechselnd darauf an. Nach den aufgabenbezogenen Zahlen von Artificial Analysis v4.3.2 kostet GPT-6.1 Sol für diese dreißig Nächte 21,72 $ und Qwen3.8-Max kostet 162,27 $ – eine Differenz von 140,55 $ pro Monat, etwa 1.690 $ pro Jahr, für eine Aufgabe, deren Token-Preisliste 2,00 $ für Eingabe und 10,00 $ für Ausgabe gegenüber 2,00 $ für Eingabe und 6,00 $ für Ausgabe nennt. Die Preise pro Million Token unterscheiden sich bei der Eingabe nur um einen Rundungsfehler und das chinesische Modell ist bei der Ausgabe 40 % günstiger, doch die Rechnung unterscheidet sich um den Faktor 7,5. Der Anbieter hat GPT-6.1 Sol am 29. September 2026 veröffentlicht; Qwen3.8-Max ist seit dem 3. August 2026 live.
Diese Lücke ist kein Preistrick und kein Benchmark-Artefakt – sie ist alles, was dieser Vergleich zu sagen hat, und sie rührt von einer einzigen Zahl her, die Ihnen keine Preisliste zeigt.
Was jedes Modell ist
GPT-6.1 Sol ist OpenAIs aktuelles Flaggschiff für Reasoning und Coding, eine Woche nach dem GPT-6 Sol veröffentlicht, den es ablöst, zum gleichen Listenpreis von 2,00 $ / 10,00 $, mit einem Cache-Input-Preis von 0,10 $ und einem Kontextfenster von 1.050.000 Token. Es wird für agentische Arbeit angeboten: Seine Best-for-Tags auf unserer eigenen Modellkarte lauten Reasoning, Coding und Agentic, und es trägt die Qualitätsbewertung der Spitzenklasse.
Qwen3.8-Max ist Alibabas agentisches Flaggschiff – ein geschlossenes, nur über API nutzbares Modell, das Text-, Bild- und Videoeingaben verarbeitet und ein Kontextfenster von 1.000.000 Token bietet. Anders als die kleineren Qwen-Veröffentlichungen besitzt dieses Modell keine veröffentlichten Gewichte. Bei Artificial Analysis liegt es mit 45,42 auf dem Intelligence Index auf Platz 17 von 147 Modellen, mit einem Coding Index von 76,2, der in diesem Bereich Rang 9 belegt. Es ist kein schwaches Modell. Es ist schlicht ein teures, wenn man es denken lässt.
Die Nummer, die nicht auf der Tarifkarte steht

Artificial Analysis verzeichnet für Qwen3.8-Max 107.730 Ausgabe-Tokens pro Aufgabe, davon 70.830 Reasoning-Tokens. GPT-6.1 Sol erzeugt 38.128 Ausgabe-Tokens, 25.190 davon Reasoning. Das chinesische Modell schreibt 2,8-mal so viele Tokens, um dieselbe Frage zu beantworten, und schreibt sie für 40 % weniger pro Token.
• Ausgabe-Tokens pro Aufgabe — 38.128 vs. 107.730; Qwen schreibt 2,8× mehr
• Davon Schlussfolgern — 25.190 vs. 70.830
• Kosten pro Aufgabe — 0,724 $ vs. 5,409 $; Qwen kostet 7,5× mehr
• Zeit pro Aufgabe — 640 s vs. 2.152 s; etwa 11 Minuten vs. etwa 36
• Zeit bis zum ersten Antwort-Token — 332,0 s vs. 55,1 s
• Intelligence Index — 51,83 vs. 45,42
• Kontextfenster — 1.050.000 vs. 1.000.000 Token
• Akzeptierte Eingaben — Text, Bild und Datei vs. Text, Bild und Video
Multipliziere, und der Rabatt verschwindet. Ein Modell, das fast dreimal so viele Tokens zu einem um 40 % niedrigeren Satz ausgibt, kostet nicht weniger – allein bei der Ausgabe kostet es etwa 1,7-mal so viel, und die gemessene Pro-Aufgabe-Zahl setzt den tatsächlichen Faktor auf 7,5, sobald Input, gecachte Lesevorgänge und die Länge der produktiven Antwort berücksichtigt werden.
Beachten Sie die vierte und fünfte Zeile, denn sie zeigen in entgegengesetzte Richtungen und erklären zusammen, was Qwen3.8-Max ist. Es liefert sein erstes Token in 55 Sekunden, während GPT-6.1 Sol fünfeinhalb Minuten braucht, und verbringt dann sechsunddreißig Minuten mit der Erledigung der Aufgabe, während das OpenAI-Modell in elf Minuten fertig ist. Das ist ein Modell, das sofort zu sprechen beginnt und sehr lange nachdenkt. Für eine Chat-Oberfläche mit einer gestreamten Antwort liest sich das wie Reaktionsschnelligkeit. Bei einem unbeaufsichtigten nächtlichen Job ist es Wall-Clock-Zeit, für die Sie ebenfalls bezahlen.
Drei Bereiche, in denen Qwen3.8-Max wirklich führend ist
Die Indexlücke beträgt über die gesamte Suite hinweg 6,4 Punkte – eine Zahl, die gern so zitiert wird, als wäre sie einheitlich. Sie ist es nicht, und die Abweichung ist aufschlussreich:
• GPQA Diamond — Qwen3.8-Max 0,9283 vs. GPT-6.1 Sol in diesem Durchlauf nicht veröffentlicht
• GDPval — 1.671,4 vs 1.575,09
• Terminal-Bench 2.1 — 0,8876 vs. nicht in diesem Durchlauf veröffentlicht
• AutomationBench — 0,5619 vs. 0,6487
• SciCode — in diesem Durchlauf nicht veröffentlicht vs. 0,5417 für GPT-6.1 Sol
• CritPT — 0,1771 vs. 0,3171
Qwen3.8-Max gewinnt die wissenschaftlichen Fragen auf Graduiertenniveau und die Stichprobe beruflicher Aufgaben, was für ein Modell seiner Generation ein echtes Ergebnis ist und der Grund dafür, dass sein Coding-Index auf Platz 9 von 138 liegt. Es verliert die schwierigeren forschungsnahen Evaluierungen — CritPT um 14 Punkte — und es verliert AutomationBench um 8,7, wobei Letzteres am ehesten unbeaufsichtigter Computerarbeit ähnelt. Welche der beiden Sie für Ihre Arbeitslast für wichtiger halten, ist die eigentliche Entscheidung; die 6,4-Punkte-Schlagzeile ist ein Durchschnitt über eine Meinungsverschiedenheit, kein Urteil.
Was die zusätzlichen Tokens bringen – und was nicht
Lange Reasoning-Spuren sind per Definition keine Verschwendung. Ein Modell, das 70.830 Tokens für das Nachdenken über eine schwierige Aufgabe aufwendet, tut etwas, das das kürzere Modell möglicherweise überspringt, und in den Evaluationen, in denen Qwen3.8-Max vorne liegt, ist dieses Nachdenken plausibel der Grund dafür. Der Fehlermodus besteht darin, dass man dafür bei jeder Aufgabe bezahlt, nicht nur bei den schwierigen. Die Anzahl der Reasoning-Tokens ist eine Eigenschaft der Kalibrierung des Modells, nicht der Schwierigkeit der Frage, und ein Modell, das eine einzeilige Extraktion überdenkt, berechnet Ihnen das.
Um herauszufinden, welche deiner Aufgaben welche ist, muss man aufhören, die Modellwahl als global zu behandeln. Das bringt uns zu dem Teil, bei dem es sich um eine Konfigurationsänderung handelt.
Unsere eigene Modellkarte für GPT-6.1 Sol enthält die bereitgestellten Kennzahlen des Subjekts: den Kostensatz von 2,00 $ / 10,00 $, das Kontextfenster von 1.050.000 Token, einen p50-Wert von 4,54 Sekunden bis zum ersten Token und einen gespeicherten Indexblock von Artificial Analysis auf derselben Seite wie die Preisangaben, gegen die eine Anwendung tatsächlich routen würde.

Ein Schlüssel, ein Messgerät, zwei Modelle
Beide Modelle sind über einen einzigen OrcaRouter-Endpunkt erreichbar — eine API für 200+ Modelle, der Listenpreis des Anbieters wird mit 0 % Aufschlag durchgereicht. Die OrcaRouter-Karte für Qwen3.8-Max enthält den Bereitstellungstarif zusammen mit dem 1.000.000-Token-Kontextfenster, den Eingabemodalitäten Text/Bild/Video und dem Sieben-Tage-Volumen von 101,4 Millionen Token — die Zahlen, anhand derer eine Anwendung routet, direkt neben denen, über die der Artikel streitet. Diese Durchreichung ist speziell für Qwen3.8-Max wichtig, denn ein Modell, dessen Wirtschaftlichkeit vom Ausgabe-Token-Volumen dominiert wird, ist eines, dessen Anbieter es jederzeit neu bepreisen kann, und ein Durchreichungszähler bedeutet, dass die Änderung Ihre Rechnung an dem Tag erreicht, an dem Alibaba sie veröffentlicht, und nicht nach dem Zeitplan eines Wiederverkäufers.

Die interessantere Verwendung der Routing-Ebene ist hier die Routing-DSL, mit der du Modelle zu einem einzigen Aufruf zusammenstellen kannst, statt eines für die gesamte Anwendung auszuwählen. Teile den nächtlichen Job auf: Ein günstiges Modell klassifiziert und extrahiert, GPT-6.1 Sol übernimmt die Reasoning- und Verifikationsschritte, und Qwen3.8-Max ist für die Aufgaben reserviert, bei denen seine lange Abwägung und seine GPQA-Klasse-Wissenschaftsstärke tatsächlich die Antwort verändern. Automatisches Failover deckt den Rest ab – wenn ein Anbieter während des Laufs schlechter wird, wird die Anfrage verschoben, statt den Batch fehlschlagen zu lassen.
Keines von beidem ist ein Grund, sich für ein Modell zu entscheiden. Sie sind der Grund, warum du die Wahl nicht einmal treffen und dann mit ihr leben musst.
Der Anruf und das, worauf man achten sollte
Zahle den 7,5-fachen Preis nur dort, wo die Denkarbeit ihn rechtfertigt. Bei einem allgemeinen nächtlichen Job ist GPT-6.1 Sol mit 0,724 $ pro Aufgabe der vertretbare Standard, und die 1.690 $ im Jahr sind real. Wo es um harte Wissenschaft oder berufliches Schlussfolgern mit überprüfbarer Antwort geht, sind die 0,9283 von Qwen3.8-Max auf GPQA Diamond die Tokens wert — genau das macht es besser.
Das Entscheidende ist, ob Alibaba seine Preise neu festlegt. Ein 2,8×-Token-Modell zu 2,00 $/6,00 $ ist so bepreist, als wären Tokens das knappe Gut; das Verhalten des Modells selbst macht Tokens reichlich. Wenn sich die Output-Rate wesentlich bewegt, verschiebt sich die Rechnung in diesem Artikel mit, und die Weitergabe-Anzeige wird Ihnen das am selben Tag zeigen, an dem es passiert.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
