
GPT-6.1 Sol vs. DeepSeek V4 Pro: Drei Meter, drei verschiedene Antworten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Frag, wie weit GPT-6.1 Sol und DeepSeek V4 Pro auseinanderliegen, und die ehrliche Antwort ist, dass es davon abhängt, welchen Maßstab man anlegt, und die drei Maßstäbe weichen stärker voneinander ab, als die meisten Modellvergleiche in allem voneinander abweichen. Beim Preis pro Million Tokens, gemischt in einem Verhältnis von 3:1 zwischen Eingabe und Ausgabe, stehen 4,00 $ gegen 0,99 $ — ein Faktor von vier. Bei dem, was es tatsächlich kostete, dieselbe Evaluierungssuite laufen zu lassen, stehen 0,72 $ gegen 0,67 $ pro Aufgabe — sieben Prozent. Im Artificial Analysis Intelligence Index stehen sie 51,8 gegen 36 — sechzehn Punkte, was entscheidend klingt, bis man sich ansieht, womit jede Zahl verglichen wurde, denn die eigene Methodik dieses Evaluators ordnet die beiden Modelle in unterschiedliche Ligen ein. GPT-6.1 Sol wurde am 29. September 2026 veröffentlicht, mit 2,00 $ für die Eingabe und 10,00 $ für die Ausgabe sowie einem 1.050.000-Token-Fenster. DeepSeek V4 Pro ist ein MIT-lizenziertes Mixture-of-Experts-Flaggschiff, 1,6 Billionen Parameter mit 49 Milliarden aktiven, veröffentlicht am 13. August 2026 zu 0,66 $ und 1,98 $ mit einem 1.048.576-Token-Fenster. Eines ist ein Textmodell, das man herunterladen kann. Das andere sieht Bilder. Herauszufinden, nach welchem der drei Maßstäbe man sich tatsächlich richten sollte, ist die ganze Aufgabe.
Die Indexzeile ist nicht der Vergleich, nach dem sie aussieht.
Beginnen Sie mit der Zahl, die am häufigsten zitiert wird, denn sie ist diejenige, die am häufigsten falsch zitiert wird.
Artificial Analysis veröffentlicht seine Methodik zusammen mit seinem Leaderboard, und zwei Sätze darin sind hier relevant. Modelle mit offenen Gewichten, heißt es, werden nur mit anderen Modellen mit offenen Gewichten derselben Größenklasse verglichen – tiny, small, medium, large –, wobei die Grenze bei 150 Milliarden Parametern liegt. Proprietäre Modelle werden stattdessen über ein Preisband hinweg verglichen, bei einem gemischten Input-zu-Output-Verhältnis von 3:1. Das sind zwei verschiedene Vergleichsgruppen. DeepSeek V4 Pro 0813 hat offene Gewichte – das FAQ des Bewerters selbst sagt das und verweist auf die veröffentlichten Gewichte –, und mit insgesamt 1,6 Billionen Parametern fällt es in die große Klasse der offenen Gewichte. GPT-6.1 Sol ist proprietär und wird gegen Modelle in seinem eigenen Preisband bewertet.
Eine 51,8 und eine 36, die in benachbarten Zeilen derselben Tabelle stehen, sind daher kein direkter Vergleich. Sie sind ein Wert gegen eine Vergleichsgruppe und ein Wert gegen eine andere, weshalb die Kosten pro Aufgabe vergleichbar sind und die rohen Indexzahlen nicht. Wenn Sie wissen möchten, ob DeepSeek V4 Pro gut für ein herunterladbares Modell ist, dann ist 36 die Zahl, die das beantwortet. Wenn Sie wissen möchten, wie es sich gegen ein gehostetes Frontier-Modell schlägt, wird die Indexspalte Ihnen das nicht sagen, und hier ist der ehrliche Zug, das auch zu sagen, statt 36 von 51,8 abzuziehen und es eine Lücke zu nennen.
Was sich sauber vergleichen lässt: die Preiskarten, die Kontext- und Ausgabelimits, die Modalitätslisten und die Kosten für die Ausführung derselben Evaluationssuite – denn die letzte Zahl ist eine Abrechnung identischer Arbeit, kein Score.
Was die rohen Messgeräte sagen

• Eingabepreis — GPT-6.1 Sol 2,00 $ vs. DeepSeek V4 Pro 0,66 $ pro Million Tokens
• Ausgabepreis — GPT-6.1 Sol 10,00 $ vs. DeepSeek V4 Pro 1,98 $, mit Abstufung auf 1,32 $ und 3,96 $ innerhalb von zwei vierstündigen UTC-Zeitfenstern an Wochentagen
• Cache-Lesen — GPT-6.1 Sol 0,10 $ vs. DeepSeek V4 Pro 0,022 $ pro Million Tokens; beide cachen, und die günstige Seite ist nochmals 4,5× günstiger
• Kosten pro Indexierungsaufgabe — GPT-6.1 Sol 0,72 $ vs. DeepSeek V4 Pro 0,67 $
• Ausgabe-Tokens, ausgegeben auf der Index-Suite — GPT-6.1 Sol 67M gegenüber DeepSeek V4 Pro 160M
• Maximale Ausgabe — DeepSeek V4 Pro 384.000 Token vs. GPT-6.1 Sol 128.000 Token
• Modalitäten — GPT-6.1 Sol akzeptiert Text, Bilder und Dateien; DeepSeek V4 Pro akzeptiert nur Text
Die vierte und fünfte Zeile sind das interessante Paar. DeepSeek V4 Pro erzeugt bei derselben Suite 2,4-mal so viele Tokens und ist pro Aufgabe dennoch 7 % günstiger, weil seine Ausgaberate ein Fünftel der von GPT-6.1 Sol beträgt. So sieht ein preisgetriebenes Modell aus, wenn man den Output statt die Rate misst: Die Ausführlichkeit ist real, und sie hebt den Vorteil nicht auf. Das Zeitfenster ist der Haken. Zwei vierstündige Blöcke an Wochentagen – 40 der 168 Stunden einer Woche – verdoppeln den Listenpreis auf 1,32 $ und 3,96 $, und dieser Aufschlag gilt für dieselben Tokens, die andernfalls auf jeder der beiden Karten die günstigsten wären.
Was das günstigere Modell nicht macht
Drei Dinge, und jedes einzelne davon ist eine harte Grenze statt eines Kompromisses.
Es sieht nicht. DeepSeek V4 Pro ist Text-in, Text-out. Keine Screenshots, keine gescannten PDFs, kein Lesen von Diagrammen, kein Diagramm in einem Ticket. Computer-Nutzung und dokumentenintensive Workflows – genau die Workloads, für die GPT-6.1 Sol positioniert ist – sind zu jedem Preis ausgeschlossen. Wenn Ihre Pipeline Bilder bereits an ein Vision-Modell weiterleitet, ist das kein Problem; wenn nicht, ist es die entscheidende Einschränkung.
Es gibt keinen Veröffentlichungsrhythmus, auf den man sich planerisch verlassen könnte. Der Name „deepseek-v4-pro" verweist seit August auf den 0813-Build, und das ging nicht leise vonstatten: Der Anbieter kündigte die Stilllegung des Builds für den 14. September an, zog die Ankündigung zwei Tage vor dem Termin zurück und bediente die API weiter, ohne die Abrechnung zu ändern. Unser eigener Katalog führt ihn weiterhin als Flaggschiff mit demselben Kontextfenster, derselben Ausgabeobergrenze und demselben Parallelitätslimit. Ein Anbieter, der eine Deprecation binnen zwei Tagen zurückziehen kann, kann es ebenso gut auch bleiben lassen; die operative Lehre daraus ist nicht, dass das Modell instabil wäre, sondern dass der Name ein Zeiger ist – und das Verhalten an eine Build-ID statt an einen Routennamen zu binden, ist die günstige Versicherung.
Es trägt das umgebende Wissen nicht mit sich. GPT-6.1 Sol ist acht Tage alt und hat bereits eine unabhängige Konfiguration veröffentlicht; DeepSeek V4 Pro hat eine längere Evaluierungshistorie und eine deutlich größere Anwenderbasis, einschließlich eines veröffentlichten Serving-Stacks und Durchsatzarbeiten von Drittanbietern. Für ein selbstgehostetes Deployment ist dieser Materialbestand mehr wert als die Indexzeile, denn genau ihn zieht man zu Rate, wenn sich das Modell auf der eigenen Hardware merkwürdig verhält und nicht in einem Benchmark.
Wenn der viermal günstigere Zähler der falsche Zähler ist
Wäre das günstige Modell einfach in allem schlechter, wäre dies ein kurzer Artikel. Die unbequeme Tatsache ist, dass die beiden bei identischer Arbeit pro Aufgabe 7 % auseinanderliegen und sich um den Faktor 2,4 darin unterscheiden, wie viel sie schreiben, um dorthin zu gelangen. Das bedeutet, dass die Blended-Token-Metrik – die, die 4× anzeigt – einen Unterschied misst, den Sie größtenteils nicht bezahlen, weil sie einen Token-Mix bepreist, den Sie vielleicht nie senden. Und die Index-Metrik – die, die 16 Punkte anzeigt – misst über zwei Peer-Gruppen hinweg und lässt sich nicht subtrahieren.
Die praktische Aufteilung ist also nicht „Frontier-Modell für schwere Arbeit, günstiges Modell für einfache Arbeit“. Sie erfolgt nach Modalität und Volumen. Alles, was ein Bild enthält, geht an GPT-6.1 Sol, und ebenso alles, bei dem die Antwort kurz und das Reasoning der teure Teil ist – seine fünf Aufwandsstufen, von low bis max mit medium als Standard, lassen Sie Reasoning kaufen, ohne Prosa zu kaufen, und sein gecachter Input zu 0,10 $ macht einen langen, wiederholt verwendeten Prompt günstig. Alles, was nur Text ist, ein hohes Volumen hat und längere Antworten toleriert – Klassifizierung, Extraktion, Zusammenfassung, Massengenerierung gegen ein Ausgabebudget von 384.000 Token –, geht an DeepSeek V4 Pro, idealerweise außerhalb der beiden UTC-Fenster.
Beides auf einer Taste, und die Aufteilung ist eine Konfigurationszeile
Beide Modelle sind auf OrcaRouter zu den von ihren Anbietern selbst veröffentlichten Preisen verfügbar, ohne Aufschlag: GPT-6.1 Sol bei 2,00 $ / 10,00 $, ab 272.000 Prompt-Tokens steigend auf 4,00 $ / 15,00 $, und DeepSeek V4 Pro bei 0,66 $ / 1,98 $, wobei die beiden Zeitfenster wie aufgeführt übernommen werden. Ein Schlüssel, eine Rechnung, ein OpenAI-kompatibler Endpunkt für beide.
Das ist der Grund, warum es sich lohnt, die obige Aufteilung niederzuschreiben, statt über sie zu streiten. Eine Modalitätsaufteilung lässt sich als Routing-Regel ausdrücken, sodass bildhaltige Anfragen an das Vision-Modell und der Großteil des Texts an das günstige Modell gehen, ohne dass die Anwendung geändert werden muss; wenn eine Route schlechter wird, verschiebt ein Failover den Aufruf, statt ihn fehlschlagen zu lassen. Und weil sich beide am selben Endpunkt befinden, lässt sich der Preisvergleich, der wirklich zählt – Ihrer, mit Ihrem Traffic, bei Ihrer Token-Zusammensetzung –, aus Ihren eigenen Rechnungen erstellen statt aus dem Durchschnitt einer Benchmark-Suite.


Das Fazit in einem Satz lautet: Die viermal günstigere Lesart ist die, der man misstrauen sollte, und die Sieben-Prozent-Lesart ist die, die man prüfen sollte. Viermal ist das, was der gemischte Zähler über einen Token-Mix aussagt, den Sie möglicherweise nicht senden. Sieben Prozent ist das, was dieselbe Auswertung bei beiden kostet, und dabei ist ein 2,4-facher Ausführlichkeitsunterschied bereits eingerechnet. Die sechzehn Punkte sind real, sie verteilen sich außerdem auf zwei Vergleichsgruppen, und die Einschränkung, die bei den meisten Deployments dieses Paares tatsächlich den Ausschlag gibt, ist überhaupt keine Zahl: Eines dieser Modelle kann einen Screenshot lesen, das andere nicht.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
