Hero-Titelkarte mit der Aufschrift „GPT-6 vs. DeepSeek V4 Pro“, mit einem Chip mit der Aufschrift „GPT-6 in ChatGPT für alle 2026-10-07“, zwei Preiszeilen mit der Aufschrift „GPT-6 Sol $2 / $10“ und „DeepSeek V4 Pro $0,66 / $1,98 Spitzenwert“, einem Chip mit der Aufschrift „DeepSeek: MIT-lizenzierte Gewichte, 384K max. Ausgabe“ und einer Fußzeile mit der Aufschrift „Vom Anbieter gemeldete Angaben im Text gekennzeichnet; Indexzahlen gemäß Artificial Analysis.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

GPT-6 vs. DeepSeek V4 Pro: Den einen kann man bei jedem mieten, den anderen kann man mit nach Hause nehmen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Es gibt genau eine Sache, die man mit DeepSeek V4 Pro tun kann, die man mit GPT-6 Sol nicht tun kann: es mit nach Hause nehmen. DeepSeek V4 Pro ist ein MIT-lizenziertes Mixture-of-Experts-Flaggschiff – insgesamt 1,6 Billionen Parameter, davon 49 Milliarden pro Token aktiv – veröffentlicht am 13. August 2026, und der Checkpoint ist herunterladbar. GPT-6 Sol hat geschlossene Gewichte, wurde von OpenAI am 22. September 2026 ausgeliefert und ist Stand 7. Oktober 2026 außerdem das Modell, das unter den kostenpflichtigen Tarifen von ChatGPTs globalem Rollout für mehr als 1,2 Milliarden wöchentliche Nutzer sitzt.

Alles andere in diesem Vergleich hängt davon ab, welchen Maßstab man anlegt. Auf der Preisliste liegen die beiden um den Faktor vier auseinander. Betrachtet man, was die Erstellung einer fertigen Antwort in der unabhängigen Testsuite tatsächlich gekostet hat, liegen sie um den Faktor 1,55 auseinander. Im Intelligence Index scheinen die Zeilen sechzehn Punkte auseinanderzuliegen und sind nach der eigenen dokumentierten Methodik des Bewerters überhaupt nicht subtrahierbar. Herauszufinden, welche dieser drei Zahlen eine Entscheidung steuern sollte, ist die ganze Aufgabe, und die Antwort fällt je nachdem anders aus, ob man einen Anbieter oder eine Datei auswählt.

Was die einzelnen Modelle sind, jeweils in einem Absatz

GPT-6 Sol ist die mittlere Stufe der GPT-6-Reihe von OpenAI – unterhalb des Flaggschiffs GPT-6 Astra, oberhalb des Budget-Modells GPT-6 Luna – mit einem Kontextfenster von 1.050.000 Token, einer Ausgabegrenze von 128.000 Token, Text-, Bild- und Dateieingabe, nativen Tool-Aufrufen, strukturierten Ausgaben und einem Reasoning-Aufwand, der über fünf Stufen von niedrig bis max wählbar ist. Es ist die Stufe, auf die OpenAI ChatGPT Plus, Pro, Business und Enterprise weiterleitet, und der Preis beträgt $2.00 pro Million Eingabe-Token und $10.00 pro Million Ausgabe-Token, mit einer Long-Context-Stufe, die die gesamte Anfrage mit $4.00 bzw. $15.00 neu bepreist, sobald der Prompt 272.000 Eingabe-Token überschreitet.

DeepSeek V4 Pro ist ein Flaggschiff-Modell ausschließlich für Text mit einem Kontextfenster von 1.048.576 Token und einer maximalen Ausgabe von 384.000 Token – dreimal so hoch wie die Obergrenze von GPT-6 Sol – und bietet zu keinem Preis Bildverarbeitung. Die eigene API-Dokumentation von Dee​pSeek gibt es mit $0,66 pro Million Eingabe-Token und $1,98 pro Million Ausgabe-Token während der Spitzenzeiten an, halbiert auf $0,33 und $0,99 außerhalb der Spitzenzeiten, wobei Cache-Treffer außerhalb der Spitzenzeiten $0,022 kosten. Spitzenzeiten sind 01:00–04:00 und 06:00–10:00 UTC an Wochentagen; alles andere, einschließlich Wochenenden und chinesischer gesetzlicher Feiertage, gilt als außerhalb der Spitzenzeiten.

Die drei Messgeräte

Beginnen Sie mit demjenigen, das am häufigsten zitiert wird, denn es ist dasjenige, das am häufigsten ohne seinen Kontext zitiert wird. Artificial Analysis bewertet DeepSeek V4 Pro mit 36,0 und GPT-6 Sol mit 47,6 im Intelligence Index v4.3.2. Elfeinhalb Punkte sind die Art von Abstand, die einen Vergleich beendet.

Das sollte es nicht, und der Evaluator sagt es selbst. Artificial Analysis vergleicht Open-Weights-Modelle nur mit anderen Open-Weights-Modellen derselben Größenklasse, mit der Grenze bei 150 Milliarden Parametern, und proprietäre Modelle über eine Preisspanne hinweg bei einem gemischten Input-zu-Output-Verhältnis von 3:1. Das sind zwei unterschiedliche Vergleichsgruppen, die zwei unterschiedliche Skalen hervorbringen. Eine 36 und eine 47,6 in benachbarten Zeilen derselben Tabelle sind kein direkter Vergleich, und die ehrliche Vorgehensweise ist, das zu sagen, statt die eine von der anderen abzuziehen und es Leistungsfähigkeit zu nennen.

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

Die beiden Messgeräte, die vergleichbar sind, sagen etwas Nützlicheres:

• Gemischter Preis im Verhältnis 3:1 — GPT-6 Sol 4,00 $ pro 1 Mio. vs. DeepSeek V4 Pro 0,99 $ zu Spitzenzeiten bzw. 0,50 $ außerhalb der Spitzenzeiten; eine Spanne von 4× bis 8×, je nachdem, wann Sie den Lauf durchführen
• Kosten pro abgeschlossener Indexaufgabe — GPT-6 Sol 1,04 $ vs. DeepSeek V4 Pro 0,67 $; eine Spanne von 1,55×
• Generierte Ausgabe-Token über die Suite hinweg — GPT-6 Sol 76,8 Mio. vs. DeepSeek V4 Pro 162,9 Mio., das günstige Modell schreibt also 2,1× so viel, um dieselbe Arbeit zu erledigen
• Maximale Ausgabe — DeepSeek V4 Pro 384.000 Token vs. GPT-6 Sol 128.000; eine Obergrenze von 3×
• Multimodale Eingabe — GPT-6 Sol verarbeitet Text, Bilder und Dateien vs. DeepSeek V4 Pro nur Text
• Gewichte — DeepSeek V4 Pro MIT-lizenziert und herunterladbar vs. GPT-6 Sol geschlossen

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

Die vierte und fünfte Zeile erklären die zweite. Ein 4×-Unterschied in den Schlagzeilen, der bei echter Arbeit auf 1,55× zusammenfällt, ist das, was passiert, wenn das günstigere Modell zugleich das ausführlichere ist: DeepSeek V4 Pro erzeugte über denselben Evaluierungsdatensatz hinweg 2,1× so viele Ausgabe-Tokens wie GPT-6 Sol. Ausführlichkeit ist ein Kostenmultiplikator, der nie auf einer Preisseite auftaucht, und sie ist die mit Abstand am häufigsten überlesene Zahl in diesem Duell.

Wo das offene Modell wirklich gewinnt

Zwei Stellen, und beide sind struktureller Natur statt marginal.

Die Ausgabegrenze ist der erste Punkt. 384.000 Token gegenüber 128.000 sind ein dreifacher Unterschied, und er entscheidet über ganze Kategorien von Arbeit: ein großes strukturiertes Artefakt in einem einzigen Aufruf zu erzeugen, ein langes Dokument ohne Verkettung zu schreiben, ein großes Refactoring als eine einzige Antwort zu produzieren. GPT-6 Sol kann das zu keinem Preis, denn die Grenze ist keine Abrechnungsstufe – sie ist das Maximum des Modells.

Agentische Tool-Nutzung ist der zweite Punkt, und zwar bei einer bestimmten Messung. DeepSeek V4 Pro erzielt 96,2 % bei τ²-Bench, der Evaluierung für agentische Tool-Nutzung, und das ist die Zahl, mit der DeepSeek seine eigene Model Card anführt. Es ist außerdem die Zahl, die der OrcaRouter-Katalogeintrag des Modells wiederholt, also die Version der Behauptung, auf die unsere eigenen Leser stoßen würden. GPT-6 Sols vergleichbarer τ²-Bench-Wert ist nicht auf demselben Leaderboard veröffentlicht, also ist der Vergleich als richtungsweisend zu betrachten: Bei dem einen Benchmark, den DeepSeek als Schlagzeile gewählt hat, steht das offene Modell an der Spitze des Feldes, und das geschlossene Modell hat keine Zahl in derselben Spalte eingetragen.

Und der Punkt mit dem Eigentum, der überhaupt kein Benchmark ist. Ein herunterladbarer MIT-Checkpoint bedeutet, dass Sie das Modell auf Ihrer eigenen Hardware ausführen, eine Anfrage aus fremden Netzwerken heraushalten, es feinabstimmen, eine Version fixieren und wissen können, dass sie auch in drei Jahren noch da sein wird. Kein Anbieter kann es für veraltet erklären, neu bepreisen oder aus einer Preisliste streichen. Für eine bestimmte Käufergruppe – regulierte Branchen, alle mit einer Vorgabe zur Datenresidenz, alle, die schon einmal durch die Abkündigung eines Modells auf die Nase gefallen sind – ist das mehr als elf Indexpunkte wert.

Wo GPT-6 Sol gewinnt – und es ist nicht nur der Index

Terminal-Bench 4.0 ist die wenig schmeichelhafteste Zeile auf der Karte von DeepSeek V4 Pro: 14,1 % gegenüber 43,9 % bei GPT-6 Sol. Das ist keine Rundungsdifferenz, und es weist auf ein echtes Profil hin – das offene Modell ist stark bei der Multi-Turn-Tool-Orchestrierung und schwach bei der langfristigen Terminalarbeit, aus der moderne Coding-Agenten gemacht sind. Wenn Ihre Arbeitslast ein Agent ist, der eine Shell-Sitzung zwanzig Minuten lang zusammenhalten muss, sagt diese einzelne Bewertung mehr über Ihre Erfahrung voraus als der Index-Composite.

Multimodalität ist das zweite. DeepSeek V4 Pro ist Text-in, Text-out. GPT-6 Sol nimmt Bilder und Dateien entgegen, und das ist kein bloßes Feature-Häkchen — dokumentlastige professionelle Arbeit bedeutet Screenshots, gescannte Seiten, Diagramme und PDFs, und ein reines Textmodell kann in diese Kategorie überhaupt nicht vordringen.

Das Dritte ist das, was diese Woche passiert ist. GPT-6 ist am 7. Oktober im Chat-Tab von ChatGPT für Plus, Pro, Business und Enterprise erschienen, wobei Free und Go ab dem 8. Oktober folgen, mit einer Fähigkeit, die OpenAI Intelligent UI nennt – Antworten, die pro Frage Text, Grafiken, Diagramme, Formulare und antippbare Steuerelemente zusammenstellen, anstatt standardmäßig auf Prosa zurückzugreifen. Das ist eine Oberfläche, kein API-Feature, und es ändert keine Zeile Ihres Integrationscodes. Was es jedoch verändert, ist der allgegenwärtige Standard: Das Modell, das Ihr Team bereits in einem Browser-Tab geöffnet hat, ist jetzt GPT-6, und Prototypenarbeit driftet zu dem Modell, das ohne Schlüssel erreichbar ist. Laut Anbieterangaben, die nicht reproduziert wurden, behauptet OpenAI außerdem, dass GPT-6 bei Extra High genauso schnell zu antworten beginnt wie GPT-5.6 bei Medium und dass GPT-6 Instant bei suchgestützten Fragen 44 % früher zu antworten beginnt.

Eines ausführen oder beide ausführen

Der Grund, warum genau diese Paarung leichter abzusichern ist als die meisten anderen, ist, dass beide Modelle auf demselben Katalog stehen. OrcaRouter leitet GPT-6 Sol und DeepSeek V4 Pro — zusammen mit über 200 weiteren Modellen — über einen einzigen OpenAI-kompatiblen Endpunkt mit einem einzigen Schlüssel weiter, und das mit 0 % Aufschlag auf den Listenpreis des Anbieters. Diese Durchleitung ist es, die die Peak-/Off-Peak-Struktur verständlich statt rätselhaft macht: Die Off-Peak-Halbierung von DeepSeek stammt vom Anbieter, wir rühren sie nicht an, und wenn ein Anbieter seine Preise ändert, ist die Änderung hier noch am selben Tag live.

Hier wird auch die Entscheidung über das Peak-Fenster zu einer Routing-Entscheidung. Der Off-Peak-Tarif von DeepSeek V4 Pro ist halb so hoch wie sein Peak-Tarif, und die Peak-Fenster sind feste UTC-Zeiten. Ein Batch-Job, der verschoben werden kann, sollte um sie herum geplant werden, und ein latenzempfindlicher Pfad sollte aus ihnen herausgehalten werden. Wenn beide Modelle hinter einem Schlüssel stehen, ist die Aufteilung eine Konfiguration und kein zweiter Anbietervertrag: Leiten Sie Bulk- und Long-Output-Arbeiten außerhalb der Peak-Zeiten an DeepSeek V4 Pro, leiten Sie den multimodalen und reasoning-intensiven Verkehr an GPT-6 Sol, und lassen Sie automatisches Failover ein Rate-Limit auf beiden Seiten abdecken, anstatt es in der Produktion zu entdecken.

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Was ich tatsächlich tun würde

Wenn Sie Bilder, Dateien oder einen Frontier-Reasoning-Score benötigen und eine API erwerben, ist GPT-6 Sol die Antwort, und die elf Indexpunkte sind größtenteils nebensächlich – das multimodale Gate entscheidet es, bevor die Benchmarks überhaupt abstimmen können. Wenn Sie eine 384.000-Token-Ausgabe, eine Lizenz, die Sie behalten können, ein On-Premise-Deployment oder die niedrigsten Kosten pro abgeschlossener Aufgabe auf dem Markt benötigen, gewinnt DeepSeek V4 Pro, und die Indexlücke ist die Peer-Gruppe von jemand anderem.

Was ich nicht tun würde, ist, 36 gegenüber 47,6 als Leistungsgefälle zu lesen und daraufhin zu kaufen. Die vergleichbaren Messgrößen – 0,67 $ gegenüber 1,04 $ pro Aufgabe und ein 2,1-facher Ausführlichkeitsunterschied, der sich hinter einer 4-fachen Schlagzeilen-Spanne verbirgt – zeichnen ein viel realistischeres Bild als die Indexzeilen, und sie sind es, die auf einer Rechnung auftauchen.

Als Nächstes gilt es zu beobachten, ob Dee​pSeek die Terminal-Bench-Lücke in einem V4-Pro-Refresh schließt, denn das ist die eine Messung, bei der das offene Modell wirklich zurückzuliegen scheint und nicht nur anders bewertet wird. GPT-6 wiederum hat gerade aufgehört, eine Wahl zu sein, und ist zum Default geworden, und gegen Defaults lässt sich schwer argumentieren, selbst wenn der Benchmark etwas anderes sagt.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert