
GPT-6 Luna vs. DeepSeek V4 Pro: Ein Indexpunkt, fünfmal der Preis – und das Plädoyer dafür, seine eigenen Gewichte zu besitzen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hier ist die Zahl, die dieses Duell entscheiden sollte und es nicht tut: GPT-6 Luna erreicht bei maximalem Aufwand 37 Punkte im Artificial Analysis Intelligence Index. DeepSeek V4 Pro erreicht bei derselben Index-Revision ebenfalls bei maximalem Aufwand 36 Punkte. Ein Punkt Abstand, bei einem Composite, bei dem ein einzelner Punkt innerhalb des Rauschens eines erneuten Durchlaufs liegt – und die beiden Modelle liegen preislich etwa um den Faktor fünf auseinander. GPT-6 Luna wird mit 0,10 US-Dollar pro Million Eingabe-Tokens und 0,50 US-Dollar pro Million Ausgabe-Tokens gelistet. DeepSeek V4 Pro 0813 wird außerhalb der Spitzenzeiten mit 0,66 und 1,98 US-Dollar gelistet, was sich während seines Peak-Fensters auf 1,32 und 3,96 US-Dollar verdoppelt.
Wenn das die ganze Geschichte wäre, wäre dieser Artikel einen Absatz lang und würde mit „Verwenden Sie GPT-6 Luna“ enden. Das ist nicht die ganze Geschichte, und der Grund dafür ist die eine Dimension, in der sich der Vergleich vollständig umkehrt: Die Gewichte von DeepSeek V4 Pro sind offen und MIT-lizenziert. Das Modell, das fünfmal mehr pro Token kostet, ist das Modell, das Sie herunterladen, verändern, feinabstimmen und für immer auf Ihrer eigenen Hardware ausführen dürfen. Das ist keine Fußnote zum Preisargument – für eine bestimmte Käuferklasse ist es das gesamte Argument, und die Markteinführung von GPT-6 Luna am 22. September hat es eher verschärft als beigelegt.
Was wurde veröffentlicht, und wann?
GPT-6 Luna ist OpenAIs kleine Stufe, veröffentlicht am 22. September 2026, zusammen mit GPT-6 Sol für $2.00/$10.00 und unterhalb des Flaggschiffs GPT-6 Astra für $10.00/$50.00. OpenAI beschreibt es als das effizienteste Modell des Unternehmens für fokussierte Aufgaben mit hohem Volumen. Es bietet ein Kontextfenster von 1.050.000 Tokens mit maximal 922.000 Input und einer Obergrenze von 128.000 Tokens für die Ausgabe, akzeptiert Text und Bild und stellt Reasoning-Aufwand von none über low, medium, high, xhigh und max bereit – wobei medium der Standard ist.
DeepSeek V4 Pro 0813 ist der GA-Build von DeepSeeks Flaggschiffmodell der vierten Generation, veröffentlicht am 13. August 2026, das die April-Vorschau unter derselben Kennung deepseek-v4-pro ersetzt. Es ist ein reines Textmodell nach dem Mixture-of-Experts-Prinzip mit insgesamt 1,6 Billionen Parametern und 49 Milliarden aktiven, einem Kontextfenster von 1 Mio. Token und einer ungewöhnlich großzügigen Obergrenze von 384.000 Token für die Ausgabe – dreimal so viel wie bei GPT-6 Luna. Die Gewichte wurden auf Hugging Face als deepseek-ai/DeepSeek-V4-Pro-0813 ungefähr einen halben Tag nach dem Livegang der API veröffentlicht: 66 fp8-Shards, ohne Zugangsbeschränkung, MIT. Unsere eigene Katalogseite für das Modell trägt noch immer das Datum der April-Vorschau statt des August-GA-Datums, was man wissen sollte, wenn man Daten von Produktseiten statt aus Versionshinweisen abliest.
Beide sind auf Schlussfolgerungen ausgerichtet und für langen Kontext gemacht. Nur eine davon ist eine Datei, die man in der Hand halten kann.
Die Tarifkarten, ehrlich gesagt.
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. DeepSeek V4 Pro 0,66 $ außerhalb der Stoßzeiten / 1,32 $ zu Stoßzeiten
• Output pro 1 Mio. — GPT-6 Luna 0,50 $ vs. DeepSeek V4 Pro 1,98 $ außerhalb der Stoßzeiten / 3,96 $ zu Stoßzeiten
• Zwischengespeicherte Eingabe — GPT-6 Luna 0,01 $ pro 1 Mio., ein Rabatt von 90 % auf den eigenen Tarif, im Vergleich zu DeepSeek V4 Pro mit einem Cache-Rabatt von 97 %, der tiefere Prozentsatz auf einer höheren Basis
• Spitzenzeitfenster — GPT-6 Luna keine, den ganzen Tag über gleichbleibend, während sich DeepSeek V4 Pro zwischen 01:00–04:00 und 06:00–10:00 UTC verdoppelt
• Langkontext-Klausel — GPT-6 Luna verdoppelt Eingabe und Cache und erhöht die Ausgabe um das 1,5-Fache bei über 272K Eingabe, angewendet auf die gesamte Anfrage, im Vergleich zu DeepSeek V4 Pro, für das auf seiner Karte kein Langkontext-Zuschlag veröffentlicht ist
• Kontext und Ausgabe — GPT-6 Luna 1.050.000 Eingabe / 128.000 Ausgabe vs. DeepSeek V4 Pro 1.048.576 Eingabe / 384.000 Ausgabe
• AA Intelligence Index — GPT-6 Luna 37 bei maximalem Aufwand vs. DeepSeek V4 Pro 36 bei maximalem Aufwand, gleiche Index-Revision
• Punktzahl bei Standard-Aufwand — GPT-6 Luna 29 bei mittlerem Aufwand vs. DeepSeek V4 Pro 36 bei seiner maximalen Einstellung, dem von Artificial Analysis gemessenen Aufwand.
• Reasoning-Aus-Schalter — GPT-6 Luna none bis max vs. DeepSeek V4 Pro nur low, high und max
• Kosten für die Ausführung des Index — GPT-6 Luna 122,39 $ vs. DeepSeek V4 Pro 1.122,27 $
• Gewichte — GPT-6 Luna geschlossen, nur API vs. DeepSeek V4 Pro offen, MIT-lizenziert, selbst hostbar
• Auf OrcaRouter — GPT-6 Luna nicht in unserem Katalog vs. DeepSeek V4 Pro zu DeepSeeks Listenpreis routbar

Liest man diese Zeilen zusammen, ist die Form ungewöhnlich: Das geschlossene Modell ist bei jeder Pro-Token-Zeile günstiger, außer bei gecachtem Input, und das offene Modell gewinnt bei der Ausgabelänge, beim Langkontext-Verhalten und bei dem einen Punkt, der sich überhaupt nicht pro Token bepreisen lässt.
Warum die Ein-Punkt-Differenz nicht das eigentliche Thema ist
Ein Ein-Punkt-Unterschied auf einem zusammengesetzten Index ist kein handlungsrelevanter Fähigkeitsunterschied, und es lohnt sich, klar zu sagen, dass dies die uninteressanteste Zahl im Artikel ist. Zwei Dinge daran sind allerdings sehr wohl wichtig.
Das erste ist, dass sich die Indexrevision verschiebt. Frühere Momentaufnahmen derselben Bewertung setzten die Max-Effort-Punktzahl von DeepSeek V4 Pro deutlich höher an als die 36, die unsere heutige Erfassung zeigt, und die Werte von GPT-6 Astra schwankten in innerhalb eines einzigen Monats veröffentlichtem Material über 52,8, 53 und 54,7. Jeder Vergleich, der sich auf die genaue Lücke zwischen zwei Modellen in einem rollierenden Index stützt, stützt sich auf etwas, das nicht stillhält. Die ehrliche Lesart ist, dass diese beiden Modelle an ihren Obergrenzen im selben Fähigkeitsband liegen, und der Index kann Ihnen nicht sagen, welches für Ihre Aufgabe besser ist.
Das zweite ist der Standard-Aufwand, und hier ist die Lücke real. GPT-6 Lunas 37 ist ein Wert bei maximalem Aufwand. Sein Standard ist medium, wo es 29 erreicht. DeepSeek V4 Pros 36 ist ebenfalls sein Wert bei maximalem Aufwand, und es ist auch die Einstellung, mit der Artificial Analysis es laufen ließ. Ein Team, das GPT-6 Luna einsetzt und nichts ändert, läuft mit 29 gegen 36 – ein Sieben-Punkte-Defizit in die falsche Richtung und genau die Art von Sache, die in einer Produktions-Post-Mortem als „das billige Modell ist schlechter“ auftaucht, wenn das eigentliche Problem ein Standard ist.
Was die Open Weights tatsächlich wert sind
Hier hört der Preisvergleich auf, reine Arithmetik zu sein, und wird zu einer Frage, die Ihr Geschäft betrifft. MIT-lizenzierte Gewichte verschaffen Ihnen vier Dinge, und jedes trägt ein Preisschild, das nie auf einer Tarifkarte auftaucht.
Das erste ist eine Untergrenze bei den Kosten. Preisgestaltung pro Token ist Miete; Gewichte sind ein Vermögenswert. Wenn Ihr Volumen groß genug ist, dass eine feste GPU-Kapazität eine verbrauchsabhängige Rechnung unterbietet, ist DeepSeek V4 Pro das einzige dieser beiden Modelle, bei dem diese Option überhaupt existiert. Bei den Tarifen von GPT-6 Luna ist der Break-even-Punkt weit entfernt – ein Preis von einem Cent für gecachte Eingaben lässt sich mit gemieteter Hardware wirklich kaum unterbieten –, aber „weit entfernt“ ist eine andere Aussage als „unmöglich“, und es ist eine Einbahnstraße: Von Self-Hosting zu einer API können Sie jederzeit wechseln, in die andere Richtung nicht.
Der zweite Punkt ist die Unabhängigkeit von der Roadmap eines Anbieters. Die Aktionspreise von GPT-5.6 Luna hatten ein angegebenes Ablaufdatum. Die von GPT-6 Luna sind dauerhaft, laut OpenAI – doch Dauerhaftigkeit ist ein Versprechen über ein Modell, das ein Anbieter jederzeit außer Betrieb nehmen kann, wenn er einen Nachfolger auf den Markt bringt. Ein Modell, das Sie selbst hosten, kann Ihnen nicht unter den Füßen weg abgekündigt werden. Für alle, die eine erzwungene Migration bei einem geschlossenen Modell durchgemacht haben, ist das mehr wert als ein Faktor fünf bei den Tokens.
Das Dritte sind Daten. Wenn der Prompt Material enthält, das Ihre Infrastruktur nicht verlassen darf, endet der Vergleich hier und es spielt keine Rolle, was GPT-6 Luna kostet.
Der vierte Punkt ist, dass man es feinabstimmen kann. GPT-6 Luna ist überhaupt nicht für Feinabstimmung verfügbar – verfügbar sind ausschließlich Chat Completions, Responses und Batch, und das ist die vollständige Liste. Die Gewichte von DeepSeek V4 Pro können auf Ihrer eigenen Datenverteilung trainiert werden, was bei einer eng gefassten, volumenstarken Aufgabe oft ein größerer Gewinn ist als jeder Allzweck-Indexpunkt.
All dem hält GPT-6 Luna entgegen, dass es bei einem gemischten 3:1-Verhältnis von Eingabe zu Ausgabe außerhalb der Spitzenzeiten rund fünfmal günstiger ist und während DeepSeeks Spitzenzeiten eher zehnmal günstiger, dass sein Tarif für zwischengespeicherte Eingaben ein Zehntel seines ohnehin niedrigen Eingabetarifs beträgt, dass es angewiesen werden kann, das Schlussfolgern vollständig einzustellen, und dass sein Listenpreis sich nicht zweimal täglich verdoppelt. Für eine Arbeitslast ohne Datenresidenz-Beschränkung, ohne Fine-Tuning-Anforderung und ohne Neigung, Inferenzinfrastruktur zu betreiben, ist das eine eindeutige Antwort.
Die Migration ist kleiner, als der Preisunterschied vermuten lässt
Der Wechsel zwischen diesen beiden ist eher eine Konfigurationsänderung als eine Portierung. Beide verwenden die OpenAI-kompatible Chat-Completions-Form, beide bringen ein Kontextfenster der 1M-Klasse mit, und bei den Fehlermodi handelt es sich um die erwartbaren und nicht um strukturelle.
Zwei davon sollten hervorgehoben werden, bevor Sie Traffic verlagern. Die Long-Context-Klausel von GPT-6 Luna ist die teure: Überschreiten Sie 272.000 Input-Tokens, wird die gesamte Anfrage neu bepreist – doppelter Input und Cache sowie 1,5-facher Output –, sodass ein Aufruf mit 300.000 Tokens doppelt so viel kostet wie derselbe Aufruf, auf zwei Aufrufe aufgeteilt. DeepSeek V4 Pro hat keine solche Klausel, was bedeutet, dass bei wirklich riesigen einzelnen Anfragen die fünffache Preislücke kleiner ist, als sie aussieht, und sich bei einem Aufruf zu Stoßzeiten umkehren kann. Und die Output-Obergrenze ist eine harte Beschränkung und keine bloße Präferenz: 128.000 Tokens gegenüber 384.000. Eine Pipeline, die lange strukturierte Artefakte generiert, passt möglicherweise überhaupt nicht in GPT-6 Luna, und kein noch so großer Preisvorteil ändert daran etwas.
DeepSeek V4 Pro ist bei OrcaRouter zum Listenpreis von DeepSeek verfügbar, mit der Durchreichung der Preise, durch die eine Änderung der Anbieterpreise noch am selben Tag auf unserer Seite ankommt — relevant für ein Modell, dessen Preise sich bereits zwischen Peak- und Off-Peak-Zeiten ändern. GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und wird über die eigene API von OpenAI erreicht, sodass ein Team, das beide möchte, einen Schlüssel für DeepSeek V4 Pro zusammen mit dem verwendet, was es bereits für OpenAI nutzt. Automatisches Failover ist der Teil, der sich in dieser speziellen Kombination seinen Platz verdient: Ein beeinträchtigter selbst gehosteter oder Drittanbieter-DeepSeek-Endpunkt ist genau das Szenario, in dem Sie möchten, dass die Route ohne ein Deployment wechselt.

Wer sollte welche auswählen?
Wählen Sie DeepSeek V4 Pro, wenn einer der folgenden Punkte zutrifft. Der Prompt darf Ihre Infrastruktur nicht verlassen. Sie müssen ein Fine-Tuning durchführen. Sie erzeugen Ausgaben mit mehr als 128.000 Tokens. Ihre Anfragen überschreiten regelmäßig 272.000 Eingabe-Tokens. Oder Ihr Volumen ist groß genug, dass Sie lieber GPUs kaufen als Tokens zu mieten, und Sie möchten die Option haben, später umzusteigen, ohne die Anwendung neu zu schreiben.
Nimm GPT-6 Luna, wenn nichts davon zutrifft und deine Workload hochvolumig, von Programmen konsumiert und kurz ist. Klassifizierung, Extraktion, Routing, Massenzusammenfassung, die innere Schleife eines Agenten. Bei $0.10/$0.50 mit einem Preis von einem Cent für gecachten Input und Batch zum halben Preis ist das rechnerisch keine knappe Sache, und der Ein-Punkt-Unterschied im Index bei maximalem Effort wird in deinem Eval nicht sichtbar sein. Betreibe es auf medium, prüfe die Zwei-Punkte-Regression des Coding Agent Index anhand deiner eigenen Tests statt anhand einer Anbieter-Grafik, und halte deine langen Calls auf der richtigen Seite der 272.000-Token-Grenze.
Der Fehler, den es zu vermeiden gilt, besteht darin, den fünffachen Preisunterschied als die Antwort zu betrachten. Er ist die Antwort auf eine Frage – was kostet ein Token – und schweigt zu den vier Fragen, die darüber entscheiden, ob Sie diese Workload in zwei Jahren noch ausführen können.

In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
