
GPT-6 vs. Qwen 3.8 Max: Der eine verarbeitet Video, der andere schreibt länger
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
GPT-6 Sol und Qwen3.8 Max berechnen denselben Input-Tarif — 2,00 US-Dollar pro Million Tokens, beide — und unterscheiden sich dann in zwei Dimensionen, die eine reine Preistabelle nicht zutage bringt. Qwen3.8 Max, seit dem 3. August 2026 allgemein verfügbar, ist das einzige der beiden Modelle, das Video akzeptiert: Seine Eingabemodalitäten sind Text, Bild und Video, während GPT-6 Sol Text, Bild und Datei annimmt. GPT-6 Sol, den der Anbieter am 22. September 2026 ausgelieferte, ist das einzige der beiden mit einer veröffentlichten Ausgabegrenze, 128.000 Tokens, und das einzige, hinter dem eine Consumer-Oberfläche steht — der ChatGPT-Rollout vom 7. Oktober, der das Modell mehr als 1,2 Milliarden wöchentlichen Nutzern vorstellte.
Die Sortierfrage ist also nicht, was stärker ist. Sie ist, ob deine Eingabe Video ist und ob deine Ausgabe lang ist.
Video ist die erste Gabelung
Die meisten Modellvergleiche lassen sich auf Preis und Benchmark reduzieren, und dieser hier weist einen harten strukturellen Unterschied auf, der diese zweitrangig macht. Wenn Ihre Pipeline Video aufnimmt – Überwachungsaufnahmen, aufgezeichnete Meetings, Sport- oder Vorlesungsmaterial, Produktdemo-Reels –, kann Qwen3.8 Max den Clip innerhalb der Anfrage entgegennehmen. Auf seiner Karte ist Video als Eingabemodalität neben Text und Bild aufgeführt, bis zum Million-Token-Fenster, was bei Video Frame-Sampling plus Transkript in einem einzigen Aufruf bedeutet statt einer separaten Extraktionsstufe. GPT-6 Sol kann das nicht. Seine Modalitäten sind Text, Bild und Datei; auf der Karte gibt es keinen Videoeingang, und keine noch so gute Prompt-Engineering-Kunst ersetzt ihn.
Diese eine Zeile entscheidet über die Shortlist für eine Video-Pipeline, und sie ist auf einer Tarifkarte nicht sichtbar. Wirklich austauschbar sind die beiden Modelle bei Text- und Bildarbeit, und dort gilt der unten stehende Preis- und Benchmark-Vergleich.
Eine ehrliche Anmerkung zur Video-Behauptung: Die Modalität ist dokumentiert, das Schema jedoch nicht. Keine der Katalogeinträge der Anbieter führt Auflösung, Bildrate oder Clip-Längengrenzen auf, daher bedeutet „unterstützt Video“, dass der Eingabetyp existiert, nicht dass ein bestimmter Clip in der Qualität eingelesen wird, die Sie benötigen. Testen Sie es mit Ihrem eigenen Material, bevor Sie darauf aufbauen.
Die Ausgangsseite verläuft in die andere Richtung
Dreht man die Anfrage um, kehrt sich der Vorteil um: GPT-6 Sol gibt eine maximale Ausgabe von 128.000 Token pro Antwort an. Die Karte von Qwen3.8 Max gibt ein Kontextfenster an, aber keine Zahl zur maximalen Ausgabe; ein System, das gegen eine harte Ausgabeobergrenze kalkuliert, kann eine solche also nicht aus den Daten des Anbieters ablesen – dieselbe Lücke, die auf mehreren Karten von Hosting-Plattformen auftaucht und die man besser als unbekannt denn als unbegrenzt behandeln sollte.
Was veröffentlicht wird, ist die Preis-Asymmetrie auf der Ausgabeseite, und sie ist das Gegenteil der Video-Geschichte. Qwen3.8 Max berechnet 6,00 $ pro Million Ausgabe-Token gegenüber 10,00 $ bei GPT-6 Sol — ein Rabatt von 40 % auf jedes Token, das das Modell schreibt. Eine ausgabelastige Arbeitslast, etwa die Generierung langer Texte oder die Serialisierung eines großen strukturierten Artefakts, ist auf Qwen3.8 Max pro Arbeitseinheit deutlich günstiger, und das gilt unabhängig davon, dass der Eingabepreis identisch ist.
Beachten Sie außerdem, dass die Modellkarte von Qwen3.8 Max einen einzigen Eingabetarif ohne dokumentierte Long-Context-Stufe aufführt, während GPT-6 Sol die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 4,00 $ für Eingabe und 15,00 $ für Ausgabe neu berechnet. OpenAIs Modellseite nennt die Regel ausdrücklich: Prompts oberhalb dieser Schwelle werden für die gesamte Anfrage mit dem 2-fachen Eingabe- und Cache-Tarif sowie dem 1,5-fachen Ausgabe-Tarif berechnet. Bei einem Prompt mit mehr als 272.000 Token verdoppelt sich der effektive Eingabetarif von GPT-6 Sol auf 4,00 $, während der von Qwen3.8 Max bei 2,00 $ bleibt – was den scheinbaren Gleichstand bei der Eingabe erneut umkehrt.
Was der unabhängige Vorstand sagt
Artificial Analysis führt beide Modelle, und der zusammengesetzte Index hat GPT-6 Sol vorn, während mehrere Einzeltests in die andere Richtung ausschlagen. Jede Zahl unten stammt vom Evaluator, nicht von einem Anbieter.
• Intelligenz-Index: GPT-6 Sol 47,6, Qwen3.8 Max 45,4 — GPT-6 Sol liegt um etwa zwei Punkte vorn
• Coding-Index: Qwen3.8 Max 76,2 mit einem Top-Ten-Rang; das Coding-Profil von GPT-6 Sol ist vergleichbar, doch der Qwen-Eintrag trägt einen stärkeren Rang
• GPQA Diamond: Qwen3.8 Max 92,8 %, der Wert von GPT-6 Sol ist der höhere der beiden in derselben Testfamilie
• Humanity's Last Exam: Qwen3.8 Max 43,1 %, GPT-6 Sol 47,9 %
• Long-Context-Recall: Qwen3.8 Max 80,3 %, GPT-6 Sol 83,7 %
• SciCode: Qwen3.8 Max 52,1 %, GPT-6 Sol 57,6 %
• Agentische Tool-Nutzung: Qwen3.8 Max 88,8 % bei terminal-bench v2.1 und 47,8 % bei tau-banking, beides stark
Das Muster ist, dass GPT-6 Sol die allgemeinen Reasoning-Composites und die Science- und Recall-Tests gewinnt, während Qwen3.8 Max das schärfere Coding- und Tool-Use-Modell ist. Es gelten zwei Vorbehalte, und sie sind nicht bloß dekorativ. Erstens wurden diese Indexwerte an unterschiedlichen Terminen ausgewertet, sodass zwei Punkte zwischen Revisionen innerhalb der Bewegung liegen, die ein erneuter Durchlauf erzeugt, und keine feststehende Lücke sind. Zweitens sind die veröffentlichten Zahlen von Qwen3.8 Max die Läufe des Evaluators auf dem Modell, wie es von Alibabas Endpunkt bereitgestellt wird, und der Anbieter hat außerdem einen datierten Snapshot, Qwen3.8 Max (0902), am 2. September 2026 zum selben Preis von $2.00 / $6.00 ausgeliefert — wenn Sie einen Snapshot festlegen, bestätigen Sie, welchen Sie aufrufen, bevor Sie eine Punktzahl nennen.

Was OpenAIs Rollout am 7. Oktober hinzufügt
Die ChatGPT-Veröffentlichung ist eher eine Verbreitungstatsache als eine Fähigkeitstatsache, aber sie verändert, was ein Leser unter „GPT-6“ versteht. Am 7. Oktober 2026 begann OpenAI, GPT-6 im Rahmen der Funktion „Intelligent UI“ in ChatGPT auszurollen, wobei der Chat-Tab zuerst Plus, Pro, Business und Enterprise erreichte und Free und Go ab dem 8. Oktober folgten; die Unternehmensverfügbarkeit hängt von den Einstellungen der Arbeitsplatz-Administratoren ab. Die Modelle, die Work und Codex antreiben, blieben unverändert.
Zwei Details sind für diesen Vergleich wichtig. Das ChatGPT-Erlebnis wird bei den kostenpflichtigen Consumer-Tarifen von GPT-6 Sol angetrieben – das GPT-6, dem über eine Milliarde Menschen begegnen, ist also dasselbe Modell, das du über die API aufrufst, kein separater Checkpoint. Und GPT-6 ist eine Familie, kein einzelnes Modell: GPT-6 Astra steht über Sol bei $10.00 / $50.00 und GPT-6 Luna darunter bei $0.10 / $0.50. Wenn ein Vergleich „GPT-6“ gegen Qwen3.8 Max nennt, ohne zu sagen, welche Stufe, wird standardmäßig meist gegen Sol verglichen und gegen Astra, wenn der stärkste Fall gewünscht ist. Die Stufe zu benennen ist der Unterschied zwischen einem fairen Vergleich und einem rhetorischen.
Kosten, gemessen an Formen statt an Raten
Da die Input-Raten gleichauf liegen und die Output-Raten divergieren, hängt der Gewinner vollständig vom Verhältnis von Input-Tokens zu Output-Tokens ab. Gegen die veröffentlichten Preise jedes Anbieters gerechnet, ohne Caching:
• Video- und Transkriptanalyse (500K Eingabe, 6K Ausgabe): Qwen3.8 Max ≈ 1,04 $, GPT-6 Sol nicht anwendbar — keine Videoeingabe
• Dokumentenanalyse (250K Eingabe, 5K Ausgabe): Qwen3.8 Max ≈ 0,53 $, GPT-6 Sol ≈ 0,55 $, bevor seine 272K-Schwelle greift, und höher, sobald die gesamte Anfrage neu bepreist wird
• Langform-Generierung (40K Eingabe, 80K Ausgabe): Qwen3.8 Max ≈ 0,56 $, GPT-6 Sol ≈ 0,88 $
• Ausgewogener agentischer Loop (60K Eingabe, 20K Ausgabe): Qwen3.8 Max ≈ 0,24 $, GPT-6 Sol ≈ 0,32 $
Die Form des Ergebnisses ist stabil: Qwen3.8 Max ist das günstigere Modell für denselben Token-Mix, weil die Input-Raten gleichauf liegen und seine Output-Rate niedriger ist. GPT-6 Sols Gegenargument ist überhaupt nicht der Preis – es sind der Reasoning-Composite, die Consumer-Surface-Validierung und eine dokumentierte Output-Obergrenze, die die Budgetplanung unkompliziert macht.
Ein betrieblicher Hinweis, den es zu erwähnen lohnt, weil die Karten ihn nicht enthalten. Im Playground von OrcaRouter gemessen, wies die Qwen3.8-Max-Route in der ersten Oktoberwoche 2026 eine mediane First-Token-Latenz von etwa 5.809 ms und rund 50 Ausgabe-Token pro Sekunde bei niedriger Fehlerrate auf; die GPT-6-Sol-Route verzeichnete im selben Zeitfenster einen schnelleren Durchsatz, aber eine deutlich höhere Fehlerrate. Dies sind Beobachtungen auf gemeinsam genutzten Routen, keine Anbieter-SLAs, und sie ändern sich von Woche zu Woche – was dafür spricht, den eigenen Datenverkehr zu messen, statt der Modellkarte eines der beiden Modelle zu vertrauen.
Beide unter einem Schlüssel betreiben
Die realistische Antwort für ein Team, das auf der einen Seite Videoarbeit und auf der anderen Seite reasoning-intensive Arbeit hat, ist, dass kein Modell eindeutig gewinnt und beide in den Stack gehören. Dafür ist ein Gateway da. Auf OrcaRouter sind sowohl qwen/qwen3.8-max als auch GPT-6 Sol live-Routen im selben Katalog hinter einer OpenAI-kompatiblen API, zum Listenpreis des Anbieters mit 0 % Aufschlag — sodass eine Preisänderung von Alibaba oder OpenAI Sie noch am selben Tag erreicht und nicht erst bei Ihrer nächsten Rechnungsabstimmung, und es gibt keinen separaten Anmeldedatensatz oder SDK-Pfad pro Anbieter.
Zwei Funktionen übernehmen hier eine konkrete Aufgabe. Automatisches Failover hält eine Pipeline am Leben, wenn die Route eines Anbieters schlechter wird, was direkt relevant ist, wenn man bedenkt, wie unterschiedlich sich diese beiden Routen im selben Messfenster verhalten haben. Und die Routing-DSL lässt die Anfrage entscheiden: Senden Sie alles, was eine Video-Eingabe enthält, an Qwen3.8 Max, senden Sie Long-Context-Reasoning-Arbeit an GPT-6 Sol, und lassen Sie ein Prädikat auf Eingabemodalität und Anfragegröße die Wahl treffen statt einer hartcodierten Modell-ID, die manuell geändert werden muss, wenn sich der Traffic verschiebt.

Die Kurzfassung: Wenn Ihre Eingaben Video umfassen, ist Qwen3.8 Max der einzige der beiden, der sie verarbeiten kann, und es ist das günstigere Modell bei jeder Token-Mischung, sobald die Anfrage vorliegt. Wenn Ihre Arbeit Reasoning mit Text und Bildern ist und Sie lange, begrenzte Ausgaben sowie einen validierten Standard in Consumer-Qualität benötigen, ist GPT-6 Sol die stärkere Karte im zusammengesetzten Index und das Modell mit einer dokumentierten Ausgabe. Wo Sie beides brauchen, routen Sie – und lassen Sie die Modalität der Anfrage den Routing-Schlüssel sein, nicht einen Release-Zyklus.

In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
