Eine generierte Titelkarte für den Artikel „Mistral Large 4 vs DeepSeek V4 Pro“, die den Titel in fettgedruckter geometrischer Sans-Serif-Schrift zeigt, darunter den Untertitel „Zwillingsarchitekturen, entgegengesetzte Wetten“ und darüber eine Reihe aus drei flachen Linien-Icons – zwei gleichartige Netzwerkknoten, einer mit einem Download-Pfeil und einer ausgegraut – auf weißem Hintergrund mit blau- und cyanfarbenen Farbverlaufsakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Mistral Large 4 vs. DeepSeek V4 Pro: Zwillingsarchitekturen, entgegengesetzte Wetten

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden Modelle in diesem Vergleich sind auf dem Papier nahezu identisch und könnten in der Praxis nicht unterschiedlicher sein. Mistral Large 4 ist ein Sparse-Mixture-of-Experts mit 1,05 Billionen Parametern und 49 Milliarden aktiven Parametern, angekündigt am 6. Oktober 2026. DeepSeek V4 Pro ist ein Sparse-Mixture-of-Experts mit 1,6 Billionen Parametern und 49 Milliarden aktiven Parametern, veröffentlicht am 24. April 2026. Gleiches Aktivierungsbudget, gleiche Architekturfamilie, gleicher Anspruch auf Frontier-Leistung zu Open-Weight-Kosten — und genau eines von ihnen hat Gewichte, die man heute herunterladen kann.

Diese Gegenüberstellung ist nicht die Erfindung dieses Artikels. Mistrals eigener Launch-Post vergleicht an drei verschiedenen Stellen namentlich mit DeepSeek V4 Pro: agentisches Coding, Wissensarbeit mit langem Zeithorizont und Automatisierung von Business-Workflows. Die andere Seite dieselbe Frage zu stellen – was DeepSeek V4 Pro bereits leistet, das Mistral Large 4 verspricht – erweist sich als der schnellste Weg zu sehen, was die Preview tatsächlich hinzufügt.

Die Spezifikation, nebeneinander

Gelesen am 6. Oktober: Mistrals Zahlen aus seiner eigenen Ankündigung und Modellkarte, DeepSeeks aus seinem Live-Katalogeintrag:

• Gesamt- vs. aktive Parameter — 1,05 Billionen gesamt / 49 Milliarden aktiv vs. 1,6 Billionen gesamt / 49 Milliarden aktiv

• Modalitäten — Text und Bild als Eingabe, Text als Ausgabe vs. nur Text

• Kontextfenster — 1M laut Mistral, 524.288 in der Konfiguration, die Artificial Analysis testet, gegenüber 1M im Betrieb

• Ausgabe-Obergrenze — für die Vorschau nicht veröffentlicht vs. 384K Tokens

• Preis pro Million, Eingabe / Ausgabe — 1,36 $ / 4,18 $ Listenpreis, derzeit 0,68 $ / 2,09 $ im Angebot, vs. 0,66 $ / 1,98 $

• Zwischengespeicherte Eingabe pro Million — 0,14 $, derzeit 0,07 $, vs. 0,022 $

• Gewichte — für Ende Oktober versprochen, Lizenz ungenannt vs. jetzt verfügbar

• Trainingsinfrastruktur — 3.800 NVIDIA Grace Blackwell GPUs in Mistrals eigenen europäischen Rechenzentren vs. DeepSeeks eigenen Cluster

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' appears at version v26.10 described as 'A state-of-the-art, open-weight, general-purpose multimodal model', with no licence badge, next to a Mistral Large 3 card at v25.12 that carries an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Die Symmetrie des 49B-Aktivierungswerts ist die Schlagzeile und zugleich die Falle. Aktive Parameter bestimmen, was die Generierung eines Tokens kostet; Gesamtparameter bestimmen, was das Modell weiß. DeepSeeks 1,6T gegenüber Mistrals 1,05T bedeuten, dass DeepSeek pro berechnetem Token rund 50 % mehr Kapazität mit sich führt – ein echter Vorteil bei wissensintensiver Arbeit und überhaupt kein Vorteil bei Aufgaben, bei denen der Engpass die Befolgung von Anweisungen oder die Tool-Nutzung ist.

Was der unabhängige Index sagt

Beide Modelle haben Seiten auf Artificial Analysis, was dies zu einem der wenigen Vergleiche in der Reihe macht, bei denen beide Seiten mit derselben Messumgebung gemessen werden. Intelligence Index v4.3, abgelesen am 6. Oktober:

• Intelligenz-Index — 38,4 für Mistral Large 4 Preview vs. 36,0 für DeepSeek V4 Pro 0813

• Kosten pro Indexierungsaufgabe — 1,13 $ vs. 0,67 $

• Terminal-Bench 4.0 — 26,8 % vs. 14,1 %

• Humanity's Last Exam — 35,0 % vs. 41,0 %

• AutomationBench, Geschäftsworkflows — 59,9 % vs. 56,7 %

• τ²-Bench, agentische Tool-Nutzung — für die Vorschau nicht veröffentlicht vs. 96,2 %

• SciCode — 54,2 % vs. 51,0 %

Das ist ein viel engeres Rennen, als die Preisschilder vermuten lassen, und die Unstimmigkeiten sind aufschlussreich statt bloßes Rauschen. Mistral Large 4 gewinnt die Zeile zum agentischen Programmieren mit fast dreizehn Punkten und die Zeile zur Workflow-Automatisierung knapp, während DeepSeek V4 Pro bei offenem Wissen mit sechs Punkten gewinnt und pro Aufgabe 40 % weniger kostet. Beachten Sie außerdem, dass der Index die Kosten auf Cache-Lesevorgänge, Cache-Schreibvorgänge, Reasoning-Tokens und Antwort-Tokens verteilt – Mistrals Cache wird mit 90 % Rabatt berechnet, während DeepSeeks mit 97 % Rabatt berechnet wird, weshalb zwei Modelle mit ähnlichen Listenpreisen bei 1,13 $ bzw. 0,67 $ pro abgeschlossener Aufgabe landen.

A generated two-column scoreboard titled 'Mistral Large 4 vs DeepSeek V4 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': total and active params 1.05T / 49B; Intelligence Index v4.3 38.4; Terminal-Bench 4.0 26.8%; AutomationBench 59.9%; modalities text and image in; weights promised end of October. Right column 'DeepSeek V4 Pro': total and active params 1.6T / 49B; Intelligence Index v4.3 36.0; Terminal-Bench 4.0 14.1%; AutomationBench 56.7%; modalities text only; weights open and available now.

Wo DeepSeek V4 Pro bereits gewonnen hat

Der entscheidende Unterschied ist kein Benchmark. Er besteht darin, dass DeepSeek V4 Pro heute Open-Weight ist und Mistral Large 4 eine Vorschau, die vom eigenen Cluster ihres Herstellers bereitgestellt wird. Mistral sagt, die Gewichte erscheinen Ende Oktober – eine Zusage, kein Artefakt. Seine Hugging-Face-Organisation, geprüft am 6. Oktober, enthält nichts Neueres als Juli. Bis ein Repository mit einer Lizenzdatei auftaucht, gehört das Argument für Selbstbereitstellung, das Mistral anführt, DeepSeek.

Der zweite Unterschied ist die Verfügbarkeitsbreite. DeepSeek V4 Pro ist seit April routbar und mit großem Abstand das meistgenutzte Modell in unserem eigenen Katalog – 1,13 Milliarden Token in den letzten sieben Tagen zum Zeitpunkt des Verfassens, gegenüber den zig Millionen, die ein typisches Frontier-Modell verarbeitet. Dieses Volumen ist für einen Käufer auf eine Weise wichtig, wie es ein Leaderboard nicht ist: Es bedeutet, dass die Fehlermodi bekannt sind, die Durchsatzeigenschaften bekannt sind und die Anbieter, die es führen, durch den Produktionsverkehr anderer einem Stresstest unterzogen wurden.

DeepSeek gewinnt auch bei der langweiligen Mechanik. Eine Ausgabegrenze von 384K gegenüber einer unveröffentlichten, 1M Kontext, der tatsächlich bereitgestellt statt nur angegeben wird, und ein reiner Textumfang, der den Durchsatz bei langem Kontext vorhersagbar macht. Wenn Ihre Workload Dokumentenanalyse, Langtextgenerierung oder wissensintensive Extraktion über eine Million Token umfasst, ist DeepSeek V4 Pro günstiger, offener und bewährter als die Mistral-Vorschau – in jeder Hinsicht.

Wo Mistral Large 4 die bessere Wahl ist

Mistral hat die Zeilen, die es benchmarkt, sorgfältig ausgewählt, und die Coding-Lücke ist keine Kosmetik. 26,8 % gegenüber 14,1 % auf Terminal-Bench 4.0 ist ungefähr doppelt so hoch und deckt sich mit Mistrals Behauptung von 61,7 % auf DeepSWE v1.1 und 59,4 % auf SWE-Atlas-QnA — Zahlen, die laut Mistral von Artificial Analysis privat vor der öffentlichen Einführung des Harness ausgewertet wurden, weshalb sie noch nicht im öffentlichen Index stehen. Wenn diese erscheinen – oder auch nicht –, wird das die Coding-Frage klären.

Multimodalität ist die zweite eindeutige Trennung. Mistral Large 4 verarbeitet Bilder nativ, mit einem dedizierten Vision-Encoder mit 1,6 Mrd. Parametern, und Mistral reklamiert das modernste visuelle Grounding unter offenen Modellen für sich – genannt werden 42 % gegenüber 41 % für GPT-6 Astra auf Dense 200. DeepSeek V4 Pro ist reiner Text, und der Katalogeintrag sagt das unmissverständlich. Jede Pipeline, die Screenshots, technische Zeichnungen, gescannte Einreichungen oder das Lesen von Diagrammen umfasst, hat hier einen Kandidaten, nicht zwei.

Und dann ist da noch der Cyber-Bereich, in dem Mistrals Behauptung schärfer ausfällt als alles, was DeepSeek veröffentlicht hat: 82 % im Test des Artificial Analysis Cyber Index, bei dem ein Modell eine echte Sicherheitslücke reproduzieren und patchen soll – angeblich der höchste Wert aller Modelle –, und 93 % bei den Wettbewerbsübungen von Cybench. Das sind vom Anbieter angeführte Zahlen, und sie sollten als solche gekennzeichnet werden – doch sie stehen in einem unabhängigen Index, und es wurde kein vergleichbares DeepSeek-Ergebnis veröffentlicht. Für die Sicherheitsarbeit ist die ehrliche Einschätzung, dass Mistral Large 4 einen Vorsprung beansprucht, der nicht als falsch erwiesen wurde.

Der letzte Unterscheidungsfaktor ist jurisdiktioneller Art. Mistral trainierte das Modell auf 3.800 Grace-Blackwell-GPUs in seinen eigenen europäischen Rechenzentren und stellt die Preview dort bereit, mit einem europäischen Deployment, das durchgängig unter europäischem Recht betrieben wird. Für einen europäischen regulierten Käufer, dessen Alternative ein chinesisches Open-Weight-Modell oder ein geschlossenes US-Modell ist, ist das eine eigene Kategorie.

Die Preisgestaltung, richtig gelesen

Bei keinem der beiden Modelle ist der Listenpreis allein die ganze Geschichte. Der Katalogeintrag von DeepSeek V4 Pro enthält zwei Zeitfenster – 01:00–04:00 und 06:00–10:00 UTC –, in denen der angegebene Tarif multipliziert wird; eine Workload, die in diese Stunden fällt, kostet also doppelt so viel wie der beworbene Preis. Die 0,68 $ / 2,09 $ für Mistral Large 4 sind ein Einführungsangebot gegenüber einer Preisliste von 1,36 $ / 4,18 $; das Angebot ist der Preis heute, und die Preisliste ist der Preis, auf dessen Grundlage Sie Ihre Rechnung kalkulieren sollten.

Wo OrcaRouter hier für Klarheit sorgt, ist die Durchleitung: 0 % Aufschlag auf die Listenpreise der Anbieter – das bedeutet, dass eine Preissenkung eines Anbieters noch am selben Tag Ihre Preissenkung ist und ein Aktionspreis eines Anbieters weitergegeben statt einbehalten wird. DeepSeek V4 Pro ist heute hinter einem OpenAI-kompatiblen Endpunkt zum Tarif seines Anbieters routingfähig, mit denselben Zugangsdaten wie über 200 weitere Modelle, mit automatischem Failover zwischen Anbietern, wenn einer an Leistung verliert. Mistral Large 4 ist nicht in unserem Katalog – die Vorschauversion erreicht man über Mistrals eigene API und mehrere Drittplattformen – wenn Sie also heute beide Seiten dieses Vergleichs gleichzeitig betreiben möchten, bedeutet das eine Route über uns und eine direkt.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model identity, a 1M-token context window, a 384K maximum output, text-only input with text output, the 2026-04-24 release date, a p-50 time-to-first-token figure of 2.23 seconds, pricing of $0.66 per million input and $1.98 per million output, and a code sample using the api.orcarouter.ai base URL. The page describes the model as a 1.6T-total, 49B-active flagship MoE with a 1,048,576-token context and 384,000-token maximum output that is text-only.

Welches soll man wählen?

Wenn Sie Gewichte brauchen, die Sie selbst halten können, 384K Ausgaben, eine Million Tokens bereitgestellten Kontext, die niedrigsten Kosten pro abgeschlossener Aufgabe unter den beiden und ein Modell, dessen Verhalten andere in der Produktion bereits gebrochen haben, dann ist DeepSeek V4 Pro kein Kompromiss – es ist das fertige Produkt gegenüber einem Trailer. Es ist die richtige Standardwahl für Dokumenten-, Wissens- und Langformarbeit, und seine offenen Gewichte bedeuten, dass die Obergrenze dessen, was Sie damit tun können, Ihre eigene Infrastruktur ist und nicht die Roadmap eines Anbieters.

Wenn Ihre Workload agentisches Coding ist, wenn sie Bilder umfasst, wenn sie Sicherheitsarbeit umfasst oder wenn europäische Gerichtsbarkeit eine Anforderung statt einer Präferenz ist, dann ist Mistral Large 4 das Modell, das das Preview-Risiko wert ist – und das Risiko ist begrenzt, denn Mistral hat sich zu den Gewichten und zu einem Red-Teaming-Fenster mit genanntem Ende verpflichtet. Legen Sie jetzt einen Teil des Traffics darauf, behalten Sie DeepSeek V4 Pro für den Rest, und lassen Sie die beiden die Architekturfrage anhand Ihrer Daten klären. Das 49B-Aktivierungsbudget wird von beiden Seiten gleich aussehen; was sich unterscheidet, ist alles drumherum.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert