Eine generierte Hero-Karte mit dem Titel „GPT-6 Sol vs. DeepSeek V4 Pro“, der Schlagzeile „12 Indexpunkte“, mit zwei Zeilen, die „geschlossene API zu $2.00/$10.00 pro 1M“ gegen „offene Gewichte unter MIT-Lizenz zu $1.32/$3.96 pro 1M“ gegenüberstellen, und dem OrcaRouter-Logo unten rechts.
Guides & Insights

GPT-6 Sol vs. DeepSeek V4 Pro: Eine Zwölf-Punkte-Lücke im Index für den vierfachen Preis

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist die Rechnung, die niemand auf eine Launch-Seite schreibt. DeepSeek V4 Pro erreicht 36 Punkte im Intelligence Index von Artificial Analysis. GPT-6 Sol erreicht 48. GPT-6 Sol kostet 2,00 $ pro Million Input-Tokens und 10,00 $ pro Million Output-Tokens. DeepSeek V4 Pro kostet in derselben Rangliste 1,32 $ und 3,96 $ – und die eigene veröffentlichte Preisliste, umgerechnet, ergibt ungefähr 0,42 $ und 0,87 $. Die Zwölf-Punkte-Lücke zwischen GPT-6 Sol und DeepSeek V4 Pro wird also mit dem Eineinhalb- bis Vierfachen des Preises erkauft, je nachdem, wessen Preisliste man liest, und das Modell auf der günstigeren Seite ist das, das man selbst herunterladen und ausführen kann.

Das ist die gesamte Entscheidung, und sie ist wirklich knapper, als der Punktestand vermuten lässt. DeepSeek V4 Pro erschien am 13. August 2026 als MIT-lizenziertes Mixture-of-Experts-Modell mit insgesamt 1,6 Billionen Parametern und 49 Milliarden aktiven pro Token. GPT-6 Sol erschien am 22. September 2026 als Frontier-Modell mit geschlossenen Gewichten zum halben Preis seines eigenen Vorgängers. Das eine ist eine Handelsware, die man selbst hosten kann; das andere ist eine Fähigkeit, die man mietet. Beide bieten ein Kontextfenster von einer Million Token. Beide sind Reasoning-Modelle. Keines von beiden ist offensichtlich der falsche Kauf.

Die Zahl, die darüber entscheidet

Beginnen wir mit dem, worüber sich beide Anbieter einig sind: dem Kontext. DeepSeek V4 Pro verfügt über ein 1M-Kontextfenster mit einer maximalen Ausgabe von 384K. GPT-6 Sol wird von Artificial Analysis mit 872.000 Token gelistet, gegenüber einer Obergrenze von 1,05M; an anderer Stelle in OpenAIs Materialien wird eine Ausgabebegrenzung von 128K genannt. DeepSeek bietet dreimal so viel Ausgabekapazität und ein vergleichbares Eingabefenster.

Dann das, was nur eines von ihnen hat: eine Preisklippe bei der Neubepreisung von langem Kontext. Die $2/$10 von GPT-6 Sol gelten unterhalb von 272.000 Eingabe-Tokens. Darüber wird die gesamte Anfrage neu bepreist – der Input verdoppelt sich ungefähr auf $4 und der Output steigt um die Hälfte auf etwa $15. DeepSeek V4 Pro hat keinen entsprechenden Schritt; seine veröffentlichten Tarife gelten über das gesamte Fenster hinweg, mit einem am 17. August eingeführten Peak- und Off-Peak-Zeitplan, der den Preis nach Tageszeit statt nach Kontextlänge ändert.

Setzt man das zusammen, kehrt sich der Vergleich am oberen Ende um. Eine Anfrage an DeepSeek V4 Pro mit 400K Tokens Kontext kostet den normalen Tarif. Dieselbe Anfrage auf GPT-6 Sol kostet ungefähr das Doppelte des beworbenen Preises. Wenn Ihre Arbeitslast von Natur aus langkontextig ist – Dokumentenanalyse, Agenten für große Repositories, erweitertes Transkript-Reasoning –, ist die effektive Preislücke zwischen diesen beiden Modellen viel größer, als $2 gegenüber $1,32 vermuten lassen.

A generated two-column scoreboard titled 'GPT-6 Sol vs DeepSeek V4 Pro — the scoreboard'. Left column GPT-6 Sol: Price $2.00/$10.00, AA Index 48, Weights 'closed', Max output 128K, Terminal-Bench 2.1 'n/a', Context 872K. Right column DeepSeek V4 Pro: Price $1.32/$3.96, AA Index 36, Weights 'MIT', Max output 384K, Terminal-Bench 2.1 87.9, Context 1M. Footer: 'DeepSeek figures per DeepSeek and Artificial Analysis.'

Wo DeepSeek V4 Pro wirklich wettbewerbsfähig ist

Die Agentic- und Coding-Ergebnisse von DeepSeek sind kein Kompromiss beim Budget. Den vom Anbieter veröffentlichten Zahlen zufolge:

• Terminal-Bench 2.1 — DeepSeek V4 Pro 87,9

• Toolathlon-verifiziert — DeepSeek V4 Pro 74.1

• DeepSWE — DeepSeek V4 Pro 62,7

• SWE-bench Verified — DeepSeek V4 Pro 80,6

• AA Intelligence Index — DeepSeek V4 Pro 36, Platz 8 von 114 gemessenen Modellen

• Ausgabegeschwindigkeit — DeepSeek V4 Pro 67,8 Token/s

• Lizenz — MIT, offene Gewichte, selbst hostbar

Das Index-Ranking verdient einen zweiten Blick. Sechsunddreißig Punkte bringen DeepSeek V4 Pro auf Platz acht von 114 Modellen auf der Tabelle, was eine starke Position für ein Modell mit herunterladbaren Gewichten und einer MIT-Lizenz ist. Die Lücke zu GPT-6 Sol ist real, doch sie verläuft zwischen „sehr gut“ und „Frontier“, nicht zwischen „brauchbar“ und „nicht brauchbar“.

Die MIT-Lizenz ist der Teil, für den es kein GPT-6-Sol-Äquivalent gibt. Wenn Ihre Randbedingung Datenresidenz, ein Air-Gapped-Deployment, Kosten pro Token, die bei hoher Auslastung gegen null gehen, oder einfach der Wunsch ist, dass die Abkündigung eines Anbieters kein Migrationsereignis wird, dann ist DeepSeek V4 Pro das einzige dieser beiden, das die Frage beantwortet. GPT-6 Sol ist ausschließlich als API verfügbar und wird es auch bleiben.

Wo GPT-6 Sol davonzieht

Zwölf Index-Punkte sind an diesem Ende der Tabelle ein großer Abstand. GPT-6 Sol belegt Platz 18 von 212 gemessenen Modellen gegenüber DeepSeeks Platz 8 von 114 und erreicht diese Position mit einer Reihe vom Anbieter veröffentlichter agentischer Ergebnisse, die DeepSeek nicht bestreitet:

• AutomationBench — GPT-6 Sol 33,2 % bei 0,27 $ pro Aufgabe

• Letzte Prüfung der Agenten — GPT-6 Sol 56,4 %

• DeepSWE v1.1 — GPT-6 Sol 68,8 %

• OSWorld 2.0 — GPT-6 Sol 60,5 %

• Ausgabegeschwindigkeit — GPT-6 Sol 104,4 Tokens/Sek., im Vergleich zu DeepSeek V4 Pro mit 67,8

Diese Werte wurden von den Anbietern gemeldet, und OpenAI hat eine eigene Testumgebung verwendet; betrachte sie daher als Behauptungen, nicht als Messungen. Zwei Vorbehalte sollte man mitnehmen. OpenAI hat in mehreren Zeilen veröffentlichte Konkurrenzwerte verwendet, anstatt das Modell des Wettbewerbers erneut auszuführen, und sein Diagrammpunkt für Claude Fable 5.1 in Agents' Last Exam schließt Opus-5-Fallbacks aus, die bei etwa 40 % der Aufgaben ausgelöst wurden. Keiner der beiden Vorbehalte betrifft den DeepSeek-Vergleich direkt, aber sie sind der Grund, die gesamte Tabelle mit Vorsicht zu betrachten.

Die unabhängige Einschätzung ist abgewogener als die beider Anbieter. Artificial Analysis fand heraus, dass GPT-6 Sol die Kosten pro Aufgabe gegenüber GPT-5.6 Sol in etwa halbiert und dabei eine Mischung aus Verbesserungen und Rückschritten hervorbringt – darunter Rückschritte bei GDPval-AA v2.1. Ein Modell, das an manchen Stellen Leistungsfähigkeit gegen eine deutliche Kostensenkung eintauscht, ist ein Modell, das verändert, was man sich leisten kann zu betreiben, nicht eines, das überall die Obergrenze anhebt.

Und das Latenzprofil von GPT-6 Sol ist eine echte Belastung. Die Zeit bis zum ersten Token beträgt 107,18 Sekunden gegenüber einem Board-Median von 3,87. Das ist der langsamste erste Token im Board, und zwar mit großem Abstand. DeepSeek V4 Pro ist ebenfalls kein schnelles Modell, aber es bewegt sich nicht in dieser Größenordnung, und für jede interaktive Oberfläche ist der Unterschied nur in eine Richtung ein Ausschlusskriterium.

Offene Gewichte gegen eine gemietete Frontier

Dies ist die Dimension, in der die beiden Modelle nicht wirklich konkurrieren. DeepSeek V4 Pro ist ein 1,6T-Parameter-MoE mit 49B aktiven Parametern, MIT-lizenziert und herunterladbar. Das bedeutet feste Kosten, die sich bei Volumen auf null amortisieren, eine Bereitstellung, die Sie kontrollieren, und ein Modell, das nicht hinter Ihrem Rücken für veraltet erklärt werden kann. Es bedeutet auch, dass der Serving-Stack, die GPU-Rechnung und jede Regression bei Ihnen liegen.

GPT-6 Sol ist der umgekehrte Trade. Sie zahlen für immer pro Token, Sie erhalten Frontier-Fähigkeiten, ohne Hardware zu besitzen, und OpenAI kann den Preis, die Preisliste oder die Verfügbarkeit mit einem Blogbeitrag ändern – wie am 22. September, als OpenAI den Preis seines eigenen Flaggschiffs halbierte. Es gibt keine Version von GPT-6 Sol, die man pinnen kann.

Die richtige Herangehensweise ist nicht die Frage „Was ist besser?“, sondern „Welches Risiko ist Ihnen lieber?“ Anbieterrisiko gegen Betriebsrisiko. Für ein Start-up ohne Infrastrukturteam und mit volatilem Traffic ist die API eindeutig die richtige Wahl. Für eine Organisation mit vorhandener GPU-Kapazität, einer Compliance-Grenze oder einer Workload, deren Volumen eine Preisgestaltung pro Token absurd erscheinen lässt, gewinnen die offenen Gewichte allein aus wirtschaftlicher Sicht, und zwölf Index-Punkte sind ein Preis, den man zu zahlen bereit ist.

Wenn du aufhören möchtest zu wählen

Es gibt eine Variante dieser Entscheidung, die keine Festlegung erfordert. DeepSeek V4 Pro ist auf OrcaRouter zum Listenpreis von DeepSeek verfügbar, mit dem Pass-through-Modell, das bedeutet, dass sich eine Preisänderung von DeepSeek – einschließlich des Zeitplans für Spitzen- und Nebenzeiten – auf unserer Seite noch am selben Tag niederschlägt, statt erst, nachdem ein Wiederverkäufer neu verhandelt hat. GPT-6 Sol ist nach aktuellem Stand nicht in unserem Katalog; es ist über die eigene API von OpenAI erreichbar, sodass eine Route, die beide abdeckt, einen Schlüssel für DeepSeek V4 Pro und eine direkte Integration für OpenAI bedeutet.

Diese Aufteilung ist aus einem bestimmten Grund sinnvoll: Diese beiden Modelle fallen unterschiedlich aus. Eine Open-Weight-Bereitstellung fällt aus, wenn Ihre Hardware ausfällt; eine API fällt aus, wenn der Anbieter ausfällt. Automatisches Failover über Anbieter hinweg verwandelt diese in einen beeinträchtigten Nachmittag statt in einen Ausfall, und die Möglichkeit, eine Route zwischen einem günstigen Hochdurchsatz-Modell und einem teuren, sorgfältigen Modell zu verschieben, indem man eine Konfiguration statt einen Codepfad ändert, ist das, was es Ihnen erlaubt, der Preiskurve zu folgen, statt auf sie zu wetten.

A screenshot of the Artificial Analysis page for GPT-6 Sol (max), showing an Intelligence rank of 18th of 212 models, a Cost rank of 49th and a Verbosity rank of 43rd, input pricing of $2.00 and output of $10.00 per 1M tokens with a 90% cache discount, a cost per Intelligence Index task of $1.06, an 872k-token context window, 77M tokens generated during the index run, and a total of $1,550.08 spent evaluating the model on the Intelligence Index.

Wer sollte welche auswählen?

Wählen Sie DeepSeek V4 Pro, wenn Sie Infrastruktur, eine Compliance-Grenze oder ein Volumenproblem haben. Es ist MIT-lizenziert, steht auf Platz acht von 114 im unabhängigen Index, bietet 384K Ausgabekapazität, und seine Preisliste weist keine Kontext-Klippe auf. Es ist die richtige Antwort für alle, deren bindende Einschränkung Kosten bei Skalierung oder Kontrolle über die Bereitstellung sind, und die Zwölf-Punkte-Lücke zu GPT-6 Sol ist der Preis dafür.

Wähle GPT-6 Sol, wenn du die Frontier brauchst und dein Kontext unter 272K Token bleibt. Es erzielt 48 gegenüber 36, generiert Token etwa 50 % schneller und ist mit 2 $/10 $ das günstigste Topmodell, das OpenAI je gebaut hat. Du solltest nur wissen, was du kaufst: eine Wartezeit von hundert Sekunden auf das erste Token, eine Long-Context-Stufe, die den Satz verdoppelt, und ein Modell, dessen unabhängige Bewertung eine Mischung aus Fortschritten und Rückschritten statt eines sauberen Sprungs nach vorn ist.

Und wenn die Antwort „beides, je nach Anfrage“ lautet, ist das keine Unentschlossenheit. Es ist die richtige Architektur für einen Markt, in dem zwei Anbieter innerhalb von sechs Wochen jeweils ihre Flaggschiff-Preise halbiert haben und keiner aufgehört hat, sich zu bewegen.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the Tools, JSON and Reasoning badges, a 1M-token context with 384K maximum output and text-only input, a 3.56s p50 time to first token, and the description of DeepSeek V4 Pro as a flagship MoE with 1.6T total / 49B active parameters built for top-tier reasoning and agentic tool use.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert