
GPT-6 Luna vs. Qwen3.8-Max: Das günstigste Modell in diesem Vergleich ist auch das einzige, das Videos ansieht
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Die offensichtliche Rahmung dieser Paarung ist die falsche. Qwen3.8-Max listet bei $2.00 pro Million Input-Tokens und $6.00 pro Million Output, Cache-Reads zu $0.25. GPT-6 Luna listet bei $0.10 und $0.50, Cache-Reads zu einem Cent. Zwanzigmal beim Input, zwölfmal beim Output, fünfzigmal beim gecachten Input — eine Preisspanne, die so groß ist, dass der Vergleich entschieden wirkt, bevor er überhaupt beginnt.
Es ist nicht entschieden, weil die beiden Modelle nicht um dieselbe Anfrage konkurrieren. Qwen3.8-Max akzeptiert Text, Bild und Video, und seine Ausgabegrenze von 131.072 Tokens liegt leicht über den 128.000 von GPT-6 Luna. GPT-6 Luna akzeptiert nur Text und Bild. Alibabas Modell erreicht 58 im unabhängigen Intelligence Index – Erster in seiner Klasse auf dem Agentic-Board – und GPT-6 Luna erreicht 37 bei maximalem Aufwand, 29 bei Standardeinstellung. Das eine ist ein Flaggschiff mit einer Open-Weight-Abstammung und einer Video-Eingabemodalität. Das andere ist eine Volumenstufe mit einer Geschwindigkeitskennzahl und einer Cache-Rate von einem Cent. Die Preislücke ist kein Rabatt auf dasselbe; sie beschreibt zwei verschiedene Dinge.
Was jedes dieser beiden ist
Qwen3.8-Max ist Alibabas Flaggschiff der 3.8-Generation, ein Checkpoint der Max-Klasse, dessen zugrundeliegendes Modell – Qwen3.8-2.4T-A95B – am 12. August 2026 öffentlich unter einer eigenen Lizenz veröffentlicht wurde, womit es das erste Qwen der Max-Klasse mit offenen Gewichten überhaupt ist. Das gehostete Flaggschiff selbst wird vom unabhängigen Gremium weiterhin als proprietär gelistet. Es bietet ein Kontextfenster von 1.000.000 Tokens, eine Obergrenze von 131.072 Tokens für die Ausgabe, Eingabe von Text, Bild und Video sowie wählbaren Reasoning-Aufwand in den Stufen niedrig, mittel und sehr hoch. Eine angepinnte Revision Qwen3.8-Max-0902 ist zum selben Preis verfügbar – ein kleines Detail mit echtem operativem Nutzen.
GPT-6 Luna ist OpenAI's Effizienzstufe vom 22. September 2026, angesiedelt unter GPT-6 Sol zu $2,00/$10,00 und dem Flaggschiff GPT-6 Astra zu $10,00/$50,00. Text und Bild als Eingabe, Text als Ausgabe, ein Fenster von 1.050.000 Token mit maximal 922.000 Eingabe, eine Obergrenze von 128.000 Token für die Ausgabe und Effort von none über low, medium, high, xhigh und max mit medium als Standard. Geschlossen, einzelne Kennung, für jeden mit einem API-Schlüssel verfügbar.
Das eine akzeptiert Video und kann in seiner Basisform heruntergeladen werden. Das andere akzeptiert Bilder und ist schnell. Beide sind für die Nutzung in großem Umfang bepreist. Die Überschneidung zwischen diesen beiden Aussagen ist kleiner, als das Preisverhältnis vermuten lässt.
Die Karten, Zeile für Zeile
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Eingabe pro 1M — GPT-6 Luna $0.10 vs. Qwen3.8-Max $2.00
• Output pro 1 Mio. — GPT-6 Luna 0,50 $ vs. Qwen3.8-Max 6,00 $
• Zwischengespeicherte Eingabe pro 1 Mio. — GPT-6 Luna 0,01 $ vs. Qwen3.8-Max 0,25 $ für implizite Cache-Lesevorgänge, mit einem expliziten Cache-Lesevorgang zu 0,17 $ und einem expliziten Cache-Schreibvorgang zu 2,50 $
• Langkontext-Klausel — GPT-6 Luna verdoppelt Input und Cache und erhöht den Output oberhalb von 272.000 Input-Tokens um das 1,5-Fache, angewendet auf die gesamte Anfrage, gegenüber Qwen3.8-Max mit einer pauschalen Stufe über das gesamte Fenster hinweg, was der einzige Punkt ist, an dem die Qwen-Karte strukturell besser statt nur marginal billiger ist
• Kontextfenster — GPT-6 Luna 1.050.000 Token vs. Qwen3.8-Max 1.000.000 Token
• Maximale Ausgabe — GPT-6 Luna 128.000 Tokens vs. Qwen3.8-Max 131.072 Tokens
• Eingabemodalitäten — GPT-6 Luna Text und Bild vs. Qwen3.8-Max Text, Bild und Video
• Reasoning-Aufwand — GPT-6 Luna keine, niedrig, mittel (Standard), hoch, xhoch, maximal vs. Qwen3.8-Max niedrig, mittel und extrahoch
• Intelligenzindex, unabhängig — GPT-6 Luna 37 bei maximalem Aufwand vs. Qwen3.8-Max 58
• Agentic Index, unabhängig — Qwen3.8-Max 58, Erster in seiner Klasse; kein vergleichbarer GPT-6-Luna-Wert veröffentlicht
• Punktzahl bei Standardaufwand — GPT-6 Luna 29 im standardmäßigen mittleren Modus vs. Qwen3.8-Max, gemessen bei maximaler Einstellung
• Kosten pro Index-Aufgabe, unabhängig — GPT-6 Luna etwa 0,07 $ vs. Qwen3.8-Max 5,41 $
• GDPval, unabhängig — Qwen3.8-Max 1.739 Elo bei 64 Turns pro Aufgabe, was in dieser Evaluierung grob 1,14 $ pro abgeschlossener Aufgabe entspricht; es wurde kein vergleichbarer Lauf von GPT-6 Luna veröffentlicht.
• Halluzinationsrate bei AA-Omniscience — Qwen3.8-Max 40 %, eine Verschlechterung gegenüber 23 % in der vorherigen Generation; GPT-6 Luna 77 %, zurückgegangen von 93 %
• Datierter Snapshot — GPT-6 Luna eine einzelne rollierende Kennung vs. Qwen3.8-Max-0902, verfügbar als gepinnte Revision vom 2. September 2026 zum selben Preis
• Gewichte — GPT-6 Luna geschlossen, nur API vs. Qwen3.8-Max, dessen Basis-Checkpoint Qwen3.8-2.4T-A95B seit dem 12. August 2026 unter einer eigenen Lizenz öffentlich ist, während das gehostete Flaggschiff als proprietär gelistet wird
• Auf OrcaRouter — GPT-6 Luna nicht in unserem Katalog vs. Qwen3.8-Max routbar zu Alibabas Listenpreis

Video ist keine Feature-Zeile, sondern eine andere Workload
Die Modalitätszeile ist diejenige, die mehr tatsächliche Vergleiche entscheidet als die Preiszeile, und sie wird üblicherweise als Kontrollkästchen gelesen.
Qwen3.8-Max akzeptiert Video. GPT-6 Luna nicht. Wenn Ihre Pipeline über eine Bildschirmaufnahme, eine Produktdemo, eine Vorlesungsaufzeichnung, einen Abschnitt einer Überwachungskamera oder einen UI-Walkthrough reasoning betreiben muss, endet der Vergleich genau dort, und der zwanzigfache Preisunterschied wird irrelevant – Sie wählen nicht zwischen einer teuren und einer günstigen Option, sondern zwischen einer Option und gar keiner Option. Das Extrahieren von Frames und deren Übergabe als Bilder ist ein Workaround, kein Äquivalent, und jeder, der einen gebaut hat, kennt den Unterschied sowohl bei den Kosten als auch bei der Qualität.
Wenn Ihre Pipeline aus Text und Bildern besteht, schweigt die Modalitätszeile und die Preiszeile spricht. Das ist die ehrliche Trennung, und es lohnt sich, deutlich zu sagen, auf welcher Seite davon Sie stehen, bevor Sie irgendetwas anderes auf dieser Seite lesen.
Die Agentic Gap ist real, und sie ist die teure Hälfte der Preisdifferenz.
Qwen3.8-Max erzielt 58 auf dem unabhängigen Intelligence Index. GPT-6 Luna erzielt 37 bei maximalem Aufwand und 29 bei seiner standardmäßigen mittleren Einstellung. Einundzwanzig Punkte bei übereinstimmenden Einstellungen, neunundzwanzig bei Standardeinstellungen – bei einem zusammengesetzten Index, bei dem ein einzelner Punkt innerhalb des Rauschens eines erneuten Durchlaufs liegt, ist ein Unterschied dieser Größe kein Rauschen.
Qwen3.8-Max ist vor allem im agentischen Arbeiten verortet. Es erreicht 58 Punkte auf dem unabhängigen Agentic Index, Platz eins in seiner Klasse, und 1.739 Elo auf GDPval bei 64 Schritten pro Aufgabe. Die letzte Zahl ist die aussagekräftigste, denn sie misst, wie ein Modell eine Aufgabe über vierundsechzig aufeinanderfolgende Entscheidungen hinweg zusammenhält, und sie hat ein Preisschild: rund 1,14 US-Dollar pro abgeschlossener Aufgabe in dieser Evaluation. Vergleicht man das mit den Kosten von GPT-6 Luna pro Index-Aufgabe von etwa 0,07 US-Dollar, dann ist die ehrliche Aussage nicht, dass Qwen teuer ist. Sondern dass Qwen gebeten wird, eine viel schwierigere Sache zu tun, und sie tut es.
Die logische Folge ist, dass das Defizit von einundzwanzig Punkten bei GPT-6 Luna ebenso wenig gleichmäßig über Ihre Arbeitslast verteilt ist. Bei einer kurzen, klar spezifizierten, von Programmen genutzten Aufgabe – dieses Feld extrahieren, dieses Ticket klassifizieren, diese Anfrage weiterleiten – liefern beide Modelle fast immer dieselbe brauchbare Antwort, und die Indexlücke bleibt in Ihrer Evaluierung unsichtbar. Bei einer Aufgabe, die vierundsechzig aufeinanderfolgende Aktionen mit einem Kontrollpunkt am Ende erfordert, ist die Lücke der Unterschied zwischen dem Abschließen und dem stillen Aufhören auf halbem Weg – und genau für diese Aufgabe wurde Qwen3.8-Max gebaut und GPT-6 Luna nicht.
Eine Zahl fällt in die andere Richtung aus und verdient es, genannt statt verschwiegen zu werden. Die Halluzinationsrate von Qwen3.8-Max auf dem Omniscience-Board liegt bei 40 %, gegenüber 23 % in der vorherigen Generation – eine erhebliche Regression, und zwar eine, die sich in der Produktion als selbstsicher falsche Antworten zeigt statt als Benchmark-Zeile. Bei GPT-6 Luna liegt sie bei 77 %, gegenüber 93 %. Beide Werte sind absolut hoch, und das günstigere Modell ist bei diesem Maß weiterhin das schlechtere der beiden. Keine der beiden Zahlen ist ein Grund, ein Modell zu bevorzugen; beide sind Gründe, bei allem, wo eine erfundene Tatsache teuer ist, einen Menschen oder einen Prüfer mit einzubeziehen.
Die Langkontext-Klausel ist die einzige Zeile, in der Qwen bei der Struktur gewinnt.
GPT-6 Luna enthält eine Klausel, die Qwen3.8-Max nicht hat: Anfragen über 272.000 Eingabe-Tokens werden mit dem Doppelten der Eingabe- und Cache-Sätze und dem 1,5-Fachen des Ausgabe-Satzes abgerechnet, angewendet auf die gesamte Anfrage statt auf den Teil, der über der Grenze liegt. Ein Aufruf mit 300.000 Tokens auf GPT-6 Luna wird mit 0,20 $ pro Million Eingabe-Tokens für alle 300.000 Tokens abgerechnet, weil er die Grenze um 28.000 überschritten hat. Teilen Sie dasselbe Dokument in zwei Aufrufe auf, und die Kosten halbieren sich, ohne dass sich der Prompt ändert.
Qwen3.8-Max ist über sein gesamtes 1.000.000-Token-Fenster hinweg konstant. Bei wirklich riesigen einzelnen Anfragen lässt das die zwölffache Lücke beim Ausgabepreis kleiner erscheinen, als sie aussieht, und kann sie sogar umkehren: Ab 272.000 Eingabe-Tokens verdoppelt sich der effektive Eingabepreis von GPT-6 Luna auf 0,20 $, und sein Ausgabepreis steigt auf 0,75 $ – gegenüber Qwens konstanten 2,00 $ und 6,00 $. Die Lücke verringert sich bei der Eingabe von zwanzigfach auf zehnfach und bei der Ausgabe von zwölffach auf achtfach. Immer noch groß – doch die Workloads, die am ehesten einen Arbeitskontext von 300.000 Tokens haben, sind genau die agentischen, auf die beide Anbieter abzielen, und die Teams, die sie betreiben, sind die Teams, denen das auffallen wird.
Die andere strukturelle Zeile ist die fixierte Revision. Qwen3.8-Max-0902 ist zum selben Preis wie die rollierende Kennung erhältlich, was bedeutet, dass ein Team, das reproduzierbares Verhalten über ein Modell-Update hinweg benötigt, dies ohne Aufpreis haben kann. GPT-6 Luna bietet kein Äquivalent. Das ist eine kleine Zeile auf einer Preisliste und eine große Zeile in einem Post-Mortem.
Einen von ihnen ausführen, oder beide
Qwen3.8-Max ist auf OrcaRouter zu Alibabas Listenpreis verfügbar, im Rahmen des Pass-through-Pricings, was bedeutet, dass eine Preisänderung eines Anbieters am selben Tag bei uns live ist. Zwei Dinge an unserer Routing-Schicht verdienen ihren Platz für dieses spezielle Modell: automatisches Failover, weil ein gehostetes Flaggschiff mit einer veröffentlichten Open-Weight-Basis mehr Upstreams hat als ein geschlossenes Modell eines einzelnen Anbieters und es mehr Möglichkeiten gibt, dass einer davon beeinträchtigt wird; und die Behandlung fest angehefteter Revisionen, die es einer Route ermöglicht, Qwen3.8-Max-0902 explizit festzuhalten statt das zu übernehmen, worauf der rollierende Bezeichner nächste Woche aufgelöst wird.
GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und wird über OpenAIs eigene API erreicht, sodass ein Team, das beide möchte, einen Schlüssel für Qwen3.8-Max neben dem verwendet, was es bereits für OpenAI nutzt. Dies ist außerdem die Kombination, bei der die Routing-DSL mehr wert ist als eine statische Aufteilung, weil die Grenze zwischen den beiden Modellen eine Modalitätsprüfung und eine Längenprüfung statt einer Präferenz ist: Anfragen mit Video gehen an Qwen3.8-Max, weil nichts anderes sie bedienen kann, Anfragen über 272.000 Eingabe-Tokens gehen an Qwen3.8-Max, weil der Preissprung des anderen Modells sie dort teurer macht, und alles andere geht an das Modell, das ein Zwanzigstel des Preises kostet. Das ist eine Regel, und sie gehört in die Konfiguration statt in einen Anwendungszweig.

Welches, und wann
Wählen Sie Qwen3.8-Max, wenn irgendeiner der folgenden Punkte zutrifft. Ihre Pipeline benötigt Video als Eingabe. Ihre Anfragen überschreiten regelmäßig 272.000 Eingabe-Tokens, wobei sein Pauschaltarif die Neubepreisung von GPT-6 Luna unterbietet. Ihre Ausgabe überschreitet 128.000 Tokens. Ihre Arbeit ist langhorizontige agentische Ausführung mit einem verifizierbaren Endpunkt, wobei seine 58 auf dem Agentic-Board und 1.739 Elo auf GDPval bei 64 Turns pro Aufgabe die entscheidenden Belege sind. Oder Sie benötigen eine gepinnte Revision für Reproduzierbarkeit und sind bereit, dafür zu bezahlen – was, zum selben Preis wie die rollierende Kennung, bedeutet, dass Sie es nicht sind.
Nehmen Sie GPT-6 Luna, wenn nichts davon zutrifft und Ihre Arbeitslast hochvolumig, von Programmen konsumiert, text- und bildbasiert und kurz ist. Klassifizierung, Extraktion, Routing, Massen-Zusammenfassung, die innere Schleife eines Agenten, der eine schnelle statt einer sorgfältigen Antwort braucht. Bei $0.10/$0.50 mit einem gecachten Lesevorgang für einen Cent und Kosten pro abgeschlossener Aufgabe von rund einem Fünfzehntel derjenigen von Qwen3.8-Max ist die Rechnung alles andere als knapp. Setzen Sie den Effort-Parameter explizit – der Standardwert ist medium und die beworbene 37 ist ein Maximalaufwands-Wert – und halten Sie lange Aufrufe auf der richtigen Seite der 272.000-Token-Grenze.
Der Fehler, zu dem dieser Vergleich verleitet, besteht darin, den zwanzigfachen Eingabepreis als Urteil zu lesen. Er ist ein Urteil über eine Workload-Form und schweigt zu den drei Zeilen, die die andere entscheiden: ob die Anfrage Video enthält, ob sie 272.000 Token überschreitet und ob die Antwort vierundsechzig aufeinanderfolgende Schritte überstehen muss.

In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
