
MiniMax M3.1 Flash Preview vs. DeepSeek V4 Flash: Zwei günstige 1M-Kontext-Tickets, ein riesiges Sternchen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 468 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 192 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Wenn Sie auf der Suche nach einem Kontextfenster mit einer Million Tokens zu einem niedrigen Preis pro Token sind, sind MiniMax-M3.1-Flash-Preview und DeepSeek V4 Flash die beiden Namen, die immer wieder auftauchen – und sie sind nicht wirklich die gleiche Art von Produkt. DeepSeek V4 Flash ist ein außer Betrieb genommenes Modell, dessen Kennung noch antwortet und das in einer Anbieter-Preisliste lebt, die Sie auf den Cent genau lesen können. MiniMax-M3.1-Flash-Preview ist eine Live-Vorschau ohne veröffentlichte Preisangabe. Der folgende Vergleich ist daher teils ein Spezifikationsvergleich und teils eine Demonstration davon, wie unterschiedlich diese beiden Anbieter ein und dieselbe Preisklasse zu verkaufen versuchen.
Beide Seiten davon sind es wert, präzise dargelegt zu werden, denn die Zahlen, die darüber entscheiden, sind über die Preisseite eines Anbieters, den Dokumentationsbaum eines Anbieters und unseren eigenen Katalog verstreut, und eine der am häufigsten wiederholten Behauptungen über DeepSeek V4 Flash – sein Preis – ist eine, die DeepSeek inzwischen ersetzt hat.
Worin die beiden Datenblätter tatsächlich übereinstimmen
Die Eckdaten liegen so dicht beieinander, dass sie nicht ausschlaggebend sind – mit einer Ausnahme, die niemand bewirbt.
• Kontextfenster — 1.000.000 Tokens für MiniMax-M3.1-Flash-Preview gegenüber 1.048.576 für DeepSeek V4 Flash: nominell identisch, ein Unterschied von 48.576 Tokens
• Maximale Ausgabe — für MiniMax-M3.1-Flash-Preview nicht veröffentlicht; 384.000 Tokens für DeepSeek V4 Flash, was zu diesem Preis ungewöhnlich ist und die Zahl sein dürfte, die viele Kaufentscheidungen bestimmen sollte
• Eingabemodalitäten — Text, Bild und Video für MiniMax-M3.1-Flash-Preview; nur Text für DeepSeek V4 Flash
• Steuerung des Denkens — eine Aufwandsleiter von niedrig bis maximal, Denken dauerhaft aktiviert, für MiniMax-M3.1-Flash-Preview; Denken oder Nicht-Denken bei DeepSeek V4 Flash, wobei Nicht-Denken eine echte Option ist
• Protokollunterstützung — Anthropic-kompatible, OpenAI-kompatible und OpenAI-Responses-Endpunkte für MiniMax-M3.1-Flash-Preview; dieselben drei plus Chat-Präfix-Vervollständigung bei DeepSeek V4 Flash
• Gewichte — keine für MiniMax-M3.1-Flash-Preview; die Gewichte von DeepSeek V4 Flash wurden veröffentlicht, obwohl das Modell selbst überholt wurde
• Preis — für MiniMax-M3.1-Flash-Preview nicht veröffentlicht; veröffentlicht und niedrig für DeepSeek V4 Flash
Lies diese Liste zweimal, denn die Ausgabegrenze ist die unauffällige. Eine Million Tokens Kontext bei 384.000 Tokens Ausgabe ist ein wirklich langes Generierungsfenster für einen einzelnen Durchlauf. Eine Million Tokens Kontext bei einer nicht offengelegten Ausgabegrenze ist ein Versprechen über das Lesen, nicht über das Schreiben. Wenn deine Arbeitslast „ein Repository lesen, einen Migrationsplan ausgeben“ lautet, ist die zweite Zahl diejenige, die entscheidet, ob die Aufgabe in einen einzigen Aufruf passt.
Wobei jede einzelne gemessen wird
Dies ist der unangenehmste Abschnitt des Vergleichs, und er ist kurz.
DeepSeek V4 Flash hat einen Benchmark-Eintrag, und dieser ist unabhängig. Artificial Analysis bewertet es mit 34,3 auf dem Intelligence Index — auf Platz 42 von 145 Modellen in diesem Index — mit 69,1 auf dem Coding Index und 90,8 % auf GPQA Diamond. Der Wert 95,0 auf τ²-Bench, mit dem unser eigener Katalogeintrag anführt, ist dieselbe Zahl, die DeepSeeks Launch-Material enthielt, also eine Herstellerangabe in Gesellschaft unabhängiger Werte statt einer auditierten. Sein Long-Context-Recall liegt bei 79,7 %, und seine terminal-bench-Zahl liegt bei 78,7 % auf dem v2.1-Harness. Das sind echte, vergleichbare Messungen eines bekannten Modells.
MiniMax-M3.1-Flash-Preview hat keine. MiniMax hat mit der Veröffentlichung keine Evaluierungstabelle publiziert, und auch keine dritte Partei hat eine – das Modell taucht im Index von Artificial Analysis überhaupt nicht auf. Das ist keine Lücke in unserer Recherche; es ist der aktuelle Stand der öffentlichen Aufzeichnung, und das bedeutet, dass jede Qualitätsaussage über das neuere Modell in diesem Moment ein Hersteller-Adjektiv ist. Wer Ihnen heute eine Benchmark-Tabelle zu MiniMax-M3.1-Flash-Preview präsentiert, zitiert entweder das ältere MiniMax-M3 oder erfindet sie.

DeepSeek V4 Flash wird nicht zu dem Preis verkauft, an den du dich erinnerst.
Hier ist die Falle. Die weithin zitierte Zahl für DeepSeek V4 Flash – 0,14 $ pro Million Eingabe-Token und 0,28 $ pro Million Ausgabe-Token – war der Tarif, den das Modell vor dem 10. September 2026 hatte. An diesem Datum veröffentlichte DeepSeek DeepSeek-V4.1-Flash, stellte sowohl V4 Flash als auch das Experiment V4-Flash-Vision-Exp ein und senkte die Preise. Der deepseek-v4-flash-Bezeichner funktioniert weiterhin, aber in der Dokumentation von DeepSeek heißt es, dass er vorübergehend auf V4.1 Flash umgeleitet und zum Flash-Preis abgerechnet wird. Mit anderen Worten: Sie können den alten Modellnamen weiterhin eingeben; Sie rufen nicht das alte Modell auf.
Die wirklich relevante Vergleichskarte ist also die aktuelle, pro 1 Mio. Token – und Off-Peak ist die günstigere Hälfte davon:
• Cache-Miss-Eingabe — 0,15 $ außerhalb der Spitzenzeiten, 0,30 $ zu Spitzenzeiten
• Cache-Hit-Eingabe — 0,003 $ außerhalb der Spitzenzeiten, 0,006 $ zu Spitzenzeiten
• Ausgabe — 0,60 $ außerhalb der Spitzenzeiten, 1,20 $ zu Spitzenzeiten
• Spitzenzeitfenster — 01:00–04:00 und 06:00–10:00 UTC, Montag bis Freitag, ausgenommen chinesische Feiertage; alles andere, einschließlich ganzer Wochenenden, gilt als außerhalb der Spitzenzeiten
Dagegen hat MiniMax-M3.1-Flash-Preview keinerlei Preis pro Token. Seine Kosten entsprechen dem, was Ihr Nutzerplatz im Token Plan kostet – 22 $, 55 $ oder 132 $ pro Monat für Plus, Max und Ultra –, verbraucht über einen gemeinsam genutzten Kontingentpool zum Pay-as-you-go-Listenpreis des jeweiligen Modells, wobei sich der Anbieter das Recht vorbehält, die Zusammensetzung dieses Pools zu ändern. Für ein festes Monatsbudget mit vorhersehbarem Volumen kann das ein hervorragendes Preis-Leistungs-Verhältnis sein. Für ein Projekt, das Kosten pro Aufruf zuordnen muss, ist es Undurchsichtigkeit im Gewand eines Abonnements.
Der Grund, warum dies auf der DeepSeek-Seite mehr als sonst zählt, ist der Peak-Multiplikator. Ein Team in Europa oder Asien, das gerade seinen Arbeitstag absolviert, befindet sich für einen erheblichen Teil seines Verkehrs innerhalb eines Peak-Fensters und zahlt für dieses Privileg den doppelten Preis, was einen nominellen Eingabe-Tarif von $0.15 für genau die Stunden, in denen die meisten Produkte ausgelastet sind, in $0.30 verwandelt. Kalkulieren Sie anhand der Peak-Spalte, es sei denn, Ihr Verkehr läuft tatsächlich nachts in UTC.
Wo MiniMax M3.1 Flash Preview die falsche Wahl ist
Drei Fälle – und die ersten beiden sind leicht zu übersehen, weil sie dokumentiert und nicht abgezogen werden.
Die Ausgabeobergrenze ist unbekannt. Wenn Ihre Aufgabe in einer langen Generierung endet – einer vollständigen Spezifikation, einer Transkript-Neufassung, einem annotierten Bericht –, wählen Sie ein Ausgabebudget, das Sie nicht sehen können. DeepSeek V4 Flash veröffentlicht 384.000. Diese Asymmetrie begünstigt das ältere Modell bei allem, das viel schreibt.
Denken kann nicht deaktiviert werden. Senden Sie thinking: {"type": "disabled"} an MiniMax-M3.1-Flash-Preview und Sie erhalten einen HTTP 400: Das Modell erfordert adaptives Denken. Bei DeepSeek V4 Flash existiert der Nicht-Denken-Modus und ist ein unterstützter Schalter. Für High-Throughput-Klassifizierung, Routing oder kurze strukturierte Extraktion zahlt ein Modell, das immer zuerst denkt, Latenz und Token, die Sie nicht angefordert haben — und der einzige Hebel, den Sie haben, ist das Reduzieren von Aufwand auf niedrig, nicht das Entfernen des Denkens.
Es ist nicht über Pay-as-you-go aufrufbar. Die Dokumentation des Anbieters stellt eindeutig klar, dass MiniMax-M3.1-Flash-Preview derzeit nur über Token Plan und MiniMax Code verfügbar ist, und der Subscription Key ist nicht mit einem Pay-as-you-go-API-Schlüssel austauschbar. Wenn Sie bereits einen Seat haben, ist es eine einzeilige Änderung. Wenn nicht, bedeutet die Evaluierung dieses Modells, ein Abonnement zu kaufen.
Wo die DeepSeek-Zahl die falsche Entscheidung ist
Das Spiegelbild ist, dass DeepSeek V4 Flash nur Text verarbeitet und bereits überholt ist. Es hat nie Bilder akzeptiert — diese Arbeit erforderte den separaten experimentellen Build, der inzwischen zusammen mit ihm eingestellt wurde — und die Modellkennung liefert jetzt andere Gewichte, als der Name vermuten lässt. Eine Pipeline, die auf deepseek-v4-flash festgelegt ist, um Reproduzierbarkeit zu gewährleisten, verlässt sich auf eine Weiterleitung, die DeepSeek als temporär beschreibt.
MiniMax-M3.1-Flash-Preview verarbeitet Text, Bild und Video nativ und ist das derzeit stärkste Textmodell des Anbieters. Videoeingabe zu einem Flash-Preispunkt ist in dieser Klasse nicht üblich.
Beide Einschränkungen weisen für alle, die Produktionsverkehr betreiben, in dieselbe Richtung: Die Kennung auf der Rechnung und das Modell, das geantwortet hat, sind nicht auf Dauer garantiert dasselbe, und eine Routing-Schicht ist der Ort, an dem das gehandhabt wird, statt entdeckt zu werden.

Wie man das an einem Nachmittag entscheidet
Beginne mit dem Ende der Aufgabe statt mit dem Anfang.
Wenn die Aufgabe Langtextgenerierung ist – alles, was am Ende Zehntausende von Tokens schreibt –, ist DeepSeek V4 Flash der einzige der beiden, der eine Obergrenze veröffentlicht, die groß genug ist, um sie zuzusichern, und seine Preisliste ist niedrig genug, dass der Spitzenlast-Multiplikator verkraftbar ist. Kalkuliere die Kosten für Spitzenlast, nicht für Schwachlast, und behandle die zurückgezogene Kennung als eine Migration, die du noch nicht durchgeführt hast, statt als stabilen Vertrag.
Wenn es die Aufgabe ist, multimodale Eingaben unter einem festen Monatsbudget zu lesen und zu analysieren – Bildschirmaufzeichnungen, gescannte Dokumente, Videoüberprüfung –, dann ist MiniMax-M3.1-Flash-Preview die leistungsfähigere Ausprägung, und innerhalb eines Platzes im Token Plan ist es der günstigste Weg, bei dieser Kontextlänge Videoeingaben zu erhalten. Nehmen Sie in Kauf, dass Sie ein Modell ohne Messwerte kaufen, und begrenzen Sie den Schadensradius: Belassen Sie die Arbeitslast, auf die es ankommt, bei etwas mit einer veröffentlichten Preisliste, und lassen Sie die Preview die explorative Hälfte übernehmen.
Wenn beide Beschreibungen auf Ihre Pipeline zutreffen, ist das eher ein Routing-Problem als ein Problem der Modellauswahl – und genau dafür gibt es uns. DeepSeek V4 Flash auf OrcaRouter liegt beim Tarif des Anbieters mit 0 % Aufschlag – sein Katalogeintrag zeigt $0.22 pro Million Input-Tokens und $0.66 pro Million Output-Tokens, was die Peak-Spalte der aktuellen Flash-Karte ist und direkt durchgereicht wird – zusammen mit MiniMax-M3 und MiniMax M2.7 in derselben Preisklasse mit demselben Key. Ein Endpunkt erreicht 200+ Modelle mit automatischem Failover dahinter, sodass eine Workload zwischen Preisklassen wechseln kann, ohne eine zweite Integration. MiniMax-M3.1-Flash-Preview ist nicht in unserem Katalog; um darauf zuzugreifen, braucht man den Token Plan des Anbieters und dessen Coding-Produkt.
Die Ein-Zeilen-Version: DeepSeek V4 Flash ist die bekannte Größe mit der veröffentlichten Obergrenze für die Ausgabe, der lesbaren Preisliste und einem Nachfolger, der still auf seinen Namen hört; MiniMax-M3.1-Flash-Preview ist der neuere, multimodale, noch nicht vermessene, für den man ein Abonnement braucht, um ihn auszuprobieren. Keines von beiden ist ein Grund, sich für das andere zu entscheiden — sie sind nur die Fakten, die man aus einem Preis-pro-Token-Vergleich nicht bekommen würde, der eine von DeepSeek im September eingestellte Preisliste zitiert.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
