Eine generierte Hero-Karte für GPT-6.1 Sol vs. DeepSeek V4 Pro mit der Überschrift „Drei Metriken, drei verschiedene Antworten“, mit drei Metrik-Karten mit den Angaben „Gemischter Preis 4x“, „Kosten pro Index-Aufgabe 1,07x“ und „Intelligenzindex 16 Punkte“, einer Zeile „Das eine ist proprietär und kann Bilder sehen. Das andere ist MIT-lizenziert, offene Gewichte und nur Text.“, einer Fußzeile „Preise laut OpenAI und DeepSeek; Index- und Kosten-pro-Aufgabe-Werte laut Artificial Analysis, die Open-Weights- und proprietäre Modelle in unterschiedlichen Vergleichsgruppen gegenüberstellt.“, und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

GPT-6.1 Sol vs. DeepSeek V4 Pro: Drei Meter, drei verschiedene Antworten

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Frag, wie weit GPT-6.1 Sol und DeepSeek V4 Pro auseinanderliegen, und die ehrliche Antwort ist, dass es davon abhängt, welchen Maßstab man anlegt, und die drei Maßstäbe weichen stärker voneinander ab, als die meisten Modellvergleiche in allem voneinander abweichen. Beim Preis pro Million Tokens, gemischt in einem Verhältnis von 3:1 zwischen Eingabe und Ausgabe, stehen 4,00 $ gegen 0,99 $ — ein Faktor von vier. Bei dem, was es tatsächlich kostete, dieselbe Evaluierungssuite laufen zu lassen, stehen 0,72 $ gegen 0,67 $ pro Aufgabe — sieben Prozent. Im Artificial Analysis Intelligence Index stehen sie 51,8 gegen 36 — sechzehn Punkte, was entscheidend klingt, bis man sich ansieht, womit jede Zahl verglichen wurde, denn die eigene Methodik dieses Evaluators ordnet die beiden Modelle in unterschiedliche Ligen ein. GPT-6.1 Sol wurde am 29. September 2026 veröffentlicht, mit 2,00 $ für die Eingabe und 10,00 $ für die Ausgabe sowie einem 1.050.000-Token-Fenster. DeepSeek V4 Pro ist ein MIT-lizenziertes Mixture-of-Experts-Flaggschiff, 1,6 Billionen Parameter mit 49 Milliarden aktiven, veröffentlicht am 13. August 2026 zu 0,66 $ und 1,98 $ mit einem 1.048.576-Token-Fenster. Eines ist ein Textmodell, das man herunterladen kann. Das andere sieht Bilder. Herauszufinden, nach welchem der drei Maßstäbe man sich tatsächlich richten sollte, ist die ganze Aufgabe.

Die Indexzeile ist nicht der Vergleich, nach dem sie aussieht.

Beginnen Sie mit der Zahl, die am häufigsten zitiert wird, denn sie ist diejenige, die am häufigsten falsch zitiert wird.

Artificial Analysis veröffentlicht seine Methodik zusammen mit seinem Leaderboard, und zwei Sätze darin sind hier relevant. Modelle mit offenen Gewichten, heißt es, werden nur mit anderen Modellen mit offenen Gewichten derselben Größenklasse verglichen – tiny, small, medium, large –, wobei die Grenze bei 150 Milliarden Parametern liegt. Proprietäre Modelle werden stattdessen über ein Preisband hinweg verglichen, bei einem gemischten Input-zu-Output-Verhältnis von 3:1. Das sind zwei verschiedene Vergleichsgruppen. DeepSeek V4 Pro 0813 hat offene Gewichte – das FAQ des Bewerters selbst sagt das und verweist auf die veröffentlichten Gewichte –, und mit insgesamt 1,6 Billionen Parametern fällt es in die große Klasse der offenen Gewichte. GPT-6.1 Sol ist proprietär und wird gegen Modelle in seinem eigenen Preisband bewertet.

Eine 51,8 und eine 36, die in benachbarten Zeilen derselben Tabelle stehen, sind daher kein direkter Vergleich. Sie sind ein Wert gegen eine Vergleichsgruppe und ein Wert gegen eine andere, weshalb die Kosten pro Aufgabe vergleichbar sind und die rohen Indexzahlen nicht. Wenn Sie wissen möchten, ob DeepSeek V4 Pro gut für ein herunterladbares Modell ist, dann ist 36 die Zahl, die das beantwortet. Wenn Sie wissen möchten, wie es sich gegen ein gehostetes Frontier-Modell schlägt, wird die Indexspalte Ihnen das nicht sagen, und hier ist der ehrliche Zug, das auch zu sagen, statt 36 von 51,8 abzuziehen und es eine Lücke zu nennen.

Was sich sauber vergleichen lässt: die Preiskarten, die Kontext- und Ausgabelimits, die Modalitätslisten und die Kosten für die Ausführung derselben Evaluationssuite – denn die letzte Zahl ist eine Abrechnung identischer Arbeit, kein Score.

Was die rohen Messgeräte sagen

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Eingabepreis — GPT-6.1 Sol 2,00 $ vs. DeepSeek V4 Pro 0,66 $ pro Million Tokens

• Ausgabepreis — GPT-6.1 Sol 10,00 $ vs. DeepSeek V4 Pro 1,98 $, mit Abstufung auf 1,32 $ und 3,96 $ innerhalb von zwei vierstündigen UTC-Zeitfenstern an Wochentagen

• Cache-Lesen — GPT-6.1 Sol 0,10 $ vs. DeepSeek V4 Pro 0,022 $ pro Million Tokens; beide cachen, und die günstige Seite ist nochmals 4,5× günstiger

• Kosten pro Indexierungsaufgabe — GPT-6.1 Sol 0,72 $ vs. DeepSeek V4 Pro 0,67 $

• Ausgabe-Tokens, ausgegeben auf der Index-Suite — GPT-6.1 Sol 67M gegenüber DeepSeek V4 Pro 160M

• Maximale Ausgabe — DeepSeek V4 Pro 384.000 Token vs. GPT-6.1 Sol 128.000 Token

• Modalitäten — GPT-6.1 Sol akzeptiert Text, Bilder und Dateien; DeepSeek V4 Pro akzeptiert nur Text

Die vierte und fünfte Zeile sind das interessante Paar. DeepSeek V4 Pro erzeugt bei derselben Suite 2,4-mal so viele Tokens und ist pro Aufgabe dennoch 7 % günstiger, weil seine Ausgaberate ein Fünftel der von GPT-6.1 Sol beträgt. So sieht ein preisgetriebenes Modell aus, wenn man den Output statt die Rate misst: Die Ausführlichkeit ist real, und sie hebt den Vorteil nicht auf. Das Zeitfenster ist der Haken. Zwei vierstündige Blöcke an Wochentagen – 40 der 168 Stunden einer Woche – verdoppeln den Listenpreis auf 1,32 $ und 3,96 $, und dieser Aufschlag gilt für dieselben Tokens, die andernfalls auf jeder der beiden Karten die günstigsten wären.

Was das günstigere Modell nicht macht

Drei Dinge, und jedes einzelne davon ist eine harte Grenze statt eines Kompromisses.

Es sieht nicht. DeepSeek V4 Pro ist Text-in, Text-out. Keine Screenshots, keine gescannten PDFs, kein Lesen von Diagrammen, kein Diagramm in einem Ticket. Computer-Nutzung und dokumentenintensive Workflows – genau die Workloads, für die GPT-6.1 Sol positioniert ist – sind zu jedem Preis ausgeschlossen. Wenn Ihre Pipeline Bilder bereits an ein Vision-Modell weiterleitet, ist das kein Problem; wenn nicht, ist es die entscheidende Einschränkung.

Es gibt keinen Veröffentlichungsrhythmus, auf den man sich planerisch verlassen könnte. Der Name „deepseek-v4-pro" verweist seit August auf den 0813-Build, und das ging nicht leise vonstatten: Der Anbieter kündigte die Stilllegung des Builds für den 14. September an, zog die Ankündigung zwei Tage vor dem Termin zurück und bediente die API weiter, ohne die Abrechnung zu ändern. Unser eigener Katalog führt ihn weiterhin als Flaggschiff mit demselben Kontextfenster, derselben Ausgabeobergrenze und demselben Parallelitätslimit. Ein Anbieter, der eine Deprecation binnen zwei Tagen zurückziehen kann, kann es ebenso gut auch bleiben lassen; die operative Lehre daraus ist nicht, dass das Modell instabil wäre, sondern dass der Name ein Zeiger ist – und das Verhalten an eine Build-ID statt an einen Routennamen zu binden, ist die günstige Versicherung.

Es trägt das umgebende Wissen nicht mit sich. GPT-6.1 Sol ist acht Tage alt und hat bereits eine unabhängige Konfiguration veröffentlicht; DeepSeek V4 Pro hat eine längere Evaluierungshistorie und eine deutlich größere Anwenderbasis, einschließlich eines veröffentlichten Serving-Stacks und Durchsatzarbeiten von Drittanbietern. Für ein selbstgehostetes Deployment ist dieser Materialbestand mehr wert als die Indexzeile, denn genau ihn zieht man zu Rate, wenn sich das Modell auf der eigenen Hardware merkwürdig verhält und nicht in einem Benchmark.

Wenn der viermal günstigere Zähler der falsche Zähler ist

Wäre das günstige Modell einfach in allem schlechter, wäre dies ein kurzer Artikel. Die unbequeme Tatsache ist, dass die beiden bei identischer Arbeit pro Aufgabe 7 % auseinanderliegen und sich um den Faktor 2,4 darin unterscheiden, wie viel sie schreiben, um dorthin zu gelangen. Das bedeutet, dass die Blended-Token-Metrik – die, die 4× anzeigt – einen Unterschied misst, den Sie größtenteils nicht bezahlen, weil sie einen Token-Mix bepreist, den Sie vielleicht nie senden. Und die Index-Metrik – die, die 16 Punkte anzeigt – misst über zwei Peer-Gruppen hinweg und lässt sich nicht subtrahieren.

Die praktische Aufteilung ist also nicht „Frontier-Modell für schwere Arbeit, günstiges Modell für einfache Arbeit“. Sie erfolgt nach Modalität und Volumen. Alles, was ein Bild enthält, geht an GPT-6.1 Sol, und ebenso alles, bei dem die Antwort kurz und das Reasoning der teure Teil ist – seine fünf Aufwandsstufen, von low bis max mit medium als Standard, lassen Sie Reasoning kaufen, ohne Prosa zu kaufen, und sein gecachter Input zu 0,10 $ macht einen langen, wiederholt verwendeten Prompt günstig. Alles, was nur Text ist, ein hohes Volumen hat und längere Antworten toleriert – Klassifizierung, Extraktion, Zusammenfassung, Massengenerierung gegen ein Ausgabebudget von 384.000 Token –, geht an DeepSeek V4 Pro, idealerweise außerhalb der beiden UTC-Fenster.

Beides auf einer Taste, und die Aufteilung ist eine Konfigurationszeile

Beide Modelle sind auf OrcaRouter zu den von ihren Anbietern selbst veröffentlichten Preisen verfügbar, ohne Aufschlag: GPT-6.1 Sol bei 2,00 $ / 10,00 $, ab 272.000 Prompt-Tokens steigend auf 4,00 $ / 15,00 $, und DeepSeek V4 Pro bei 0,66 $ / 1,98 $, wobei die beiden Zeitfenster wie aufgeführt übernommen werden. Ein Schlüssel, eine Rechnung, ein OpenAI-kompatibler Endpunkt für beide.

Das ist der Grund, warum es sich lohnt, die obige Aufteilung niederzuschreiben, statt über sie zu streiten. Eine Modalitätsaufteilung lässt sich als Routing-Regel ausdrücken, sodass bildhaltige Anfragen an das Vision-Modell und der Großteil des Texts an das günstige Modell gehen, ohne dass die Anwendung geändert werden muss; wenn eine Route schlechter wird, verschiebt ein Failover den Aufruf, statt ihn fehlschlagen zu lassen. Und weil sich beide am selben Endpunkt befinden, lässt sich der Preisvergleich, der wirklich zählt – Ihrer, mit Ihrem Traffic, bei Ihrer Token-Zusammensetzung –, aus Ihren eigenen Rechnungen erstellen statt aus dem Durchschnitt einer Benchmark-Suite.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

Das Fazit in einem Satz lautet: Die viermal günstigere Lesart ist die, der man misstrauen sollte, und die Sieben-Prozent-Lesart ist die, die man prüfen sollte. Viermal ist das, was der gemischte Zähler über einen Token-Mix aussagt, den Sie möglicherweise nicht senden. Sieben Prozent ist das, was dieselbe Auswertung bei beiden kostet, und dabei ist ein 2,4-facher Ausführlichkeitsunterschied bereits eingerechnet. Die sechzehn Punkte sind real, sie verteilen sich außerdem auf zwei Vergleichsgruppen, und die Einschränkung, die bei den meisten Deployments dieses Paares tatsächlich den Ausschlag gibt, ist überhaupt keine Zahl: Eines dieser Modelle kann einen Screenshot lesen, das andere nicht.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert