
GPT-6 Sol vs. Qwen3.8-Max: Die eine Zeile, in der das geschlossene Modell nicht mithalten kann
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fast jeder Vergleich zwischen GPT-6 Sol und Qwen3.8-Max wird anhand der Kosten entschieden werden, und fast jeder davon wird die Kosten in dieselbe Richtung falsch einschätzen. Qwen3.8-Max, das gehostete Flaggschiff des Anbieters, kostet seit seiner allgemeinen Verfügbarkeit am 3. August 2026 2,00 US-Dollar pro Million Input-Tokens und 6,00 US-Dollar pro Million Output-Tokens, wobei der datierte Qwen3.8-Max-0902-Snapshot am 2. September erschien. GPT-6 Sol erreichte am 22. September 2026 die allgemeine Verfügbarkeit – 2,00 US-Dollar Input und 10,00 US-Dollar Output. Identischer Input-Preis und 40 % günstigerer Output laut der Preisliste von Qwen3.8-Max – und in der unabhängigen Testumgebung rund das Fünffache an Kosten, um eine Aufgabe abzuschließen.
Doch es gibt einen zweiten, saubereren Unterschied, den das Kostenargument immer wieder verschüttet, und er ist derjenige, der manche Workloads tatsächlich entscheidet. Qwen3.8-Max akzeptiert Video. GPT-6 Sol nicht. Das ist keine Preiszeile und keine Benchmark-Zeile; es ist eine Fähigkeit, die eines dieser Modelle besitzt und die das andere nicht annähernd erreichen kann, und es ist der einzige Teil dieses Duells, an dem keine noch so große Arbeit an Token-Effizienz etwas ändern wird.

Zwei Flaggschiffe, zwei unterschiedliche Formen
Qwen3.8-Max ist ein Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Abfrage etwa 95 Milliarden Parameter aktiv sind – das zweitgrößte gehostete Modell im Produktivbetrieb hinter Kimi K3. Sein Kontextfenster umfasst eine Million Token bei einer Ausgabegrenze von 131.072 Token, seine Eingabemodalitäten sind Text, Bild und Video, und es unterstützt Reasoning-Aufwand über niedrig, mittel und sehr hoch hinweg mit strukturierten Ausgaben und Tool-Aufrufen. Das gehostete Flaggschiff ist nicht als Open Weights verfügbar; das herunterladbare Artefakt derselben Generation ist eine separate Veröffentlichung mit eigenen Einschränkungen.
GPT-6 Sol akzeptiert Text und Bilder als Eingabe und gibt Text aus. Sein Kontextfenster umfasst 1.050.000 Token, mit einer maximalen Eingabe von 922.000 Token und einer Ausgabeobergrenze von 128.000 Token. Der Preis beträgt pauschal 2,00 $ und 10,00 $, mit 0,20 $ für zwischengespeichertes Lesen und 2,50 $ für Cache-Schreibvorgänge; oberhalb von 272.000 Eingabe-Token wird die gesamte Anfrage auf 4,00 $ und 15,00 $ neu bepreist. Es ist geschlossen, hat eine einzige Kennung, und OpenAI hat die Preise als dauerhaft statt als Aktionspreise beschrieben.
Die Fensterwerte liegen nur etwa 7 % auseinander, und die Ausgabeobergrenzen liegen im selben Bereich. Die Modalitätenliste ist die einzige strukturelle Lücke – und sie verläuft nur in eine Richtung.
Zeile für Zeile
• Eingabe — GPT-6 Sol 2,00 $ pro Million Tokens vs. Qwen3.8-Max 2,00 $ pro Million Tokens; die Zahl in der Überschrift ist identisch
• Ausgabe — GPT-6 Sol 10,00 $ pro Million Token vs. Qwen3.8-Max 6,00 $ pro Million Token; Alibabas Tarif ist 40 % niedriger
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro Million Token vs. Qwen3.8-Max 0,25 $ pro Million Token für implizite Cache-Lesevorgänge, mit einem expliziten Cache-Lesevorgang zu 0,17 $ und einem expliziten Cache-Schreibvorgang zu 2,50 $
• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. Qwen3.8-Max 1.000.000 Token
• Maximale Ausgabe — GPT-6 Sol 128.000 Token vs. Qwen3.8-Max 131.072 Token
• Eingabemodalitäten — GPT-6 Sol Text und Bild vs. Qwen3.8-Max Text, Bild und Video
• Umgang mit langem Kontext — GPT-6 Sol bepreist die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 2× Eingabe- und Cache-Tarifen und 1,5× Ausgabe neu, gegenüber Qwen3.8-Max mit einem einheitlichen Tarif über das gesamte Fenster, was die einzige Stelle ist, an der die Qwen-Tarifkarte strukturell besser statt nur geringfügig günstiger ist.
• Reasoning-Aufwand — GPT-6 Sol none, low, medium (Standard), high, xhigh, max vs. Qwen3.8-Max low, medium und extra-high
• Wissensstichtag — GPT-6 Sol 20. April 2026 vs. Qwen3.8-Max nicht als einzelnes Datum veröffentlicht
• Datierter Snapshot — GPT-6 Sol eine einzige rollierende Kennung vs. Qwen3.8-Max-0902, verfügbar als gepinnte Revision vom 2. September 2026 zum selben Preis
Die Langkontext-Preiszeile verdient mehr Aufmerksamkeit, als sie üblicherweise bekommt. Der Zuschlag von GPT-6 Sol ist eine Stufe, die auf die gesamte Anfrage angewendet wird, sodass ein Agentenlauf mit 900.000 Tokens jeden Token mit 4,00 $ und 15,00 $ berechnet. Qwen3.8-Max berechnet eine einzige Stufe über das gesamte Fenster. Für eine Workload, die oberhalb von 272.000 Tokens liegt, sind die beiden Tarifkarten überhaupt nicht mehr vergleichbar – das vordergründig günstigere Modell ist mit großem Abstand das teurere, und die Richtung der Differenz hängt völlig davon ab, wo Ihr Kontext liegt.

Die Preisliste sagt 40 % günstiger. Der Prüfstand sagt fünfmal die Rechnung.
Artificial Analysis hat Qwen3.8-Max-0902 mit einem Intelligence-Index-Wert von 45 gemessen, bei Kosten von 5,41 $ pro abgeschlossener Index-Aufgabe, wobei über den gesamten Lauf hinweg 190 Millionen Ausgabe-Tokens generiert wurden. In der Zusammenfassung wird das Modell als „auffallend langsam und sehr wortreich“ beschrieben. GPT-6 Sol erreichte 48 bei 1,06 $ pro Aufgabe mit 77 Millionen Ausgabe-Tokens.
Liest man diese drei Paare zusammen, zeigt sich die Form des Aufeinandertreffens. Qwen liegt drei Indexpunkte zurück, hat zweieinhalbmal so viele Tokens erzeugt und kostete pro abgeschlossener Aufgabe etwa fünfmal so viel – bei einem Tarif, bei dem seine Ausgabe um 40 % günstiger ist. Der Mechanismus ist nicht subtil. Bei 6,00 $ pro Million Ausgabe-Tokens kosten 190 Millionen Tokens 1,14 $ pro Indexlauf allein für die Ausgabe, bevor die Eingabe hinzugerechnet wird; bei 10,00 $ pro Million kosten Sols 77 Millionen Tokens 0,77 $. Der günstigere Tarif erkauft mehr Tokens, nicht eine kleinere Rechnung.
Dies ist dasselbe Muster, das sich über das gesamte September-Feld hinweg zeigt, und es lohnt sich, es als Regel festzuhalten statt als Tatsache über diese beiden Modelle: Auf einer Preistabelle pro Token ist ein Rabatt von 40 % auf die Ausgabe nichts wert, wenn das Modell zweieinhalb Mal so viele Tokens ausgibt. Die Kosten pro abgeschlossener Aufgabe sind der einzige Wert, der Bestand hat.
Was Alibaba veröffentlichte, und das Problem der Aufwandseinstellung
Alibabas eigene Benchmark-Tabelle ist die längste in diesem Vergleich und die am wenigsten vergleichbare. Von Anbietern gemeldete Werte setzen Qwen3.8-Max bei PaperBench und IFBench an die Spitze, während es bei SWE-bench Pro und Humanity's Last Exam zurückliegt; die Reasoning-Aufwandsskala – niedrig, mittel, extrahoch – lässt sich nicht direkt auf OpenAIs sechsstufige Skala abbilden. Ein mit extrahoch veröffentlichter Wert ist nicht dasselbe Produkt wie ein mit mittel veröffentlichter Wert, und keiner der beiden Anbieter kennzeichnet, welche Stufe eine bestimmte Zahl in einem Vergleichsdiagramm erzeugt hat.
Das ist der ehrliche Grund, sich hier nicht auf die Tabelle des einen oder anderen Anbieters zu stützen. Alibabas Zahlen werden auf Alibabas Harness mit Alibabas Effort-Einstellung ausgeführt; die von OpenAI auf dem von OpenAI. Die Artificial-Analysis-Zahlen existieren genau deshalb, weil beide davon für einen direkten Vergleich unbrauchbar sind, und sie sind die oben verwendeten.
Reproduzierbarkeit ist ein echtes Feature, und sie kostet null.
Der datierte Snapshot ist die am meisten unterschätzte Zeile in diesem Vergleich. Qwen3.8-Max-0902 ist eine gepinnte Revision vom 2. September 2026, von der Alibaba sagt, dass sie dieselben Fähigkeiten und dieselbe Preisgestaltung wie das Basismodell bietet. Sie zu pinnen bedeutet, dass sich das Modell hinter Ihrem Endpoint nicht von einem Dienstag auf einen Donnerstag unter Ihnen weg ändert.
GPT-6 Sol hat kein Äquivalent. Es ist eine einzige rollierende Kennung – dieselbe Modellseite trägt einen Standard-Snapshot und keine datierten Varianten –, was bedeutet, dass das, was Sie im September gebenchmarkt haben, nicht garantiert dasselbe ist, was Sie im November aufrufen. Für die meisten Teams ist das in Ordnung. Für eine regulierte Pipeline, die nachweisen muss, was eine Ausgabe erzeugt hat, ist es ein echter Unterschied, und es ist einer, den Alibaba kostenlos hergibt, während OpenAI ihn überhaupt nicht anbietet.
Die Videolinie ist diejenige, die entscheidet.
Alles oben ist ein Vergleich. Dieser Teil nicht. Wenn Ihre Eingabe Video enthält – Bildschirmaufzeichnungen, Inspektionsaufnahmen, Vorlesungsmitschnitte, alles, bei dem die Information in Bewegung statt in einem Standbild steckt –, akzeptiert Qwen3.8-Max es nativ, und GPT-6 Sol hat keinen Weg dazu. Sie können eine Modalität nicht durch Prompting umgehen. Sie können ein Video nicht in Bilder vorverarbeiten und dasselbe erhalten, denn die zeitliche Information ist der springende Punkt, und keine noch so große Zahl von Indexpunkten in einem Text-Benchmark ersetzt die Eingabe, die Ihre Aufgabe tatsächlich erfordert.
Der umgekehrte Fall ist ebenfalls erwähnenswert, denn hier wird der Vergleich nicht mehr einseitig. Wenn Ihre Eingabe aus Text und Bildern besteht, ist Sol pro Aufgabe günstiger, liegt vier Punkte auf dem neutralen Board vorn und ist bei gecachten Lesevorgängen günstiger. Die Videofunktion ist kein Zünglein an der Waage zu Ihren Gunsten; sie wird schlicht nicht genutzt.
Weiterleiten einer Entscheidung, die zwei separate Antworten hat

Dabei handelt es sich um eine Konstellation, in der die richtige Architektur tatsächlich aus zwei Modellen besteht, nicht aus einem, und der Grund dafür ist, dass die Aufteilung nach der Eingabemodalität erfolgt und nicht nach der Schwierigkeit. Eine Pipeline, die Video verarbeitet und über Text Schlussfolgerungen zieht, benötigt beide, und die Routing-Regel ist eine Eigenschaft der Anfrage und keine Ermessensentscheidung.
Qwen3.8-Max ist in OrcaRouters Katalog — der datierte Snapshot qwen/qwen3.8-max-0902 ist routbar zu Alibabas Listenpreis im Pass-through-Modell, was bedeutet, dass eine Tarifänderung von Alibaba am selben Tag auf unserer Seite live ist statt erst, nachdem ein Reseller nachverhandelt hat. GPT-6 Sol ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und über OpenAIs eigene API erreichbar. Die Routing-DSL ist das Element, das genau auf diesen konkreten Fall passt: eine Regel, die Anfragen mit Video in die eine Richtung und alles andere in die andere schickt, ist genau das, wofür sie gedacht ist, und automatisches Failover bedeutet, dass der Modalitätszweig nicht zum Single Point of Failure wird.
Wo jedes einzelne gewinnt
• Video rein, Text raus — Qwen3.8-Max, und es gibt keinen Wettbewerb zu beschreiben.
• Text und Bild als Eingabe, Kosten pro abgeschlossener Aufgabe als Metrik — GPT-6 Sol, um rund das Fünffache auf der unabhängigen Testumgebung.
• Arbeit mit zwischengespeichertem Präfix — GPT-6 Sol. Dessen Cache-Lesevorgang ist geringfügig günstiger und sein Token-Volumen beträgt weniger als die Hälfte.
• Anfragen über 272.000 Input-Tokens — Qwen3.8-Max. Die Neuberechnung von Sol für die gesamte Anfrage ist der größte einzelne Kostenunterschied in diesem Vergleich und in den beworbenen Tarifen nicht sichtbar.
• Reproduzierbares Pinning — Qwen3.8-Max-0902, das nichts zusätzlich kostet und die einzige gepinnte Revision der beiden ist.
• Wenn Ihnen ein Diagramm gezeigt wurde, in dem Qwen bei SWE-bench Pro vorne liegt – prüfen Sie, wessen Harness es erzeugt hat und bei welcher Effort-Einstellung. Im unabhängigen Board liegt Qwen in der Gesamtwertung drei Punkte zurück, und die Herstellertabellen sind nicht auf derselben Skala wie einander.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
