
Dots vs. MiniMax M3: Den Worker mieten oder den Reader herunterladen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 349 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 210 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Das günstigste Modell in diesem Batch ist zugleich dasjenige, das Sie behalten dürfen, und diese Kombination ist der ganze Vergleich. MiniMax M5.1, veröffentlicht am 31. Mai 2026, wird als das Flaggschiff-Open-Weight-Modell von MiniMax beschrieben: Text-, Bild- und Videoeingabe, Textausgabe, ein Kontextfenster von 1.048.576 Token, bis zu 512.000 Token Ausgabe in einer einzigen Antwort und ein Listenpreis von 0,30 US-Dollar pro Million Eingabe-Token und 1,20 US-Dollar pro Million Ausgabe-Token, bei zwischengespeicherter Eingabe 0,06 US-Dollar — etwa ein Drittel dessen, was GPT-5.6 Terra für dieselben Token berechnet. Dots ist der Always-on-Agent des Unternehmens, angekündigt am 29. September 2026 beim DevDay: Er bekommt einen eigenen Cloud-Computer und Browser, arbeitet mit mehr als 4.000 verbundenen Apps, läuft auf GPT-6 Astra und ist in Pro und Business Premium enthalten, ohne dass irgendwo eine Kontingentangabe veröffentlicht wurde. Das eine ist eine Komponente, die Sie in der Hand halten können. Das andere ist ein Dienst, den Sie nur abonnieren können.
Der Preis ist nicht die interessante Zahl
Dreißig Cent pro Million Eingabe-Tokens sind die Schlagzeile, aber die interessanten Zahlen sind die beiden, die bestimmen, was man anfordern kann. Die erste ist eine maximale Ausgabe von 512.000 Tokens – sechsmal so viel, wie GPT-5.6 Sol in einer Antwort ausgeben wird, und die höchste Ausgabegrenze aller Modelle in diesem Vergleichsset. Die zweite ist 83 bei Long-Context-Recall, was hoch genug ist, dass das Kontextfenster eine nutzbare Arbeitsfläche ist und nicht nur eine Zahl auf einem Spezifikationsblatt.
Nimmt man das zusammen, wird eine bestimmte Klasse von Aufgaben günstig: das lange Ding aus der langen Quelle erzeugen. Ein 400-seitiges technisches Handbuch, für ein anderes Publikum umgeschrieben. Ein Migrationsleitfaden, aus einem kompletten Repository erstellt. Eine Forschungszusammenfassung, die selbst die Länge eines Berichts hat. Bei $0,30 und $1,20 pro Million ist ein Auftrag, der bei einem Frontier-Modell ein vierstelliger Posten wäre, hier ein Rundungsfehler – und die Tatsache, dass die Ausgabeobergrenze in Hunderttausenden von Tokens statt in Zehntausenden gemessen wird, macht daraus eine Anfrage statt zwanzig.
Zur Messung ist ein Vorbehalt anzumerken. Das Latenz-Panel unseres Katalogs meldet für M3 über dasselbe Sieben-Tage-Fenster, in dem 18,35 Millionen Tokens an Verkehr zu verzeichnen sind, eine mediane Zeit bis zum ersten Token von 10,00 Sekunden, und dieser Wert liegt genau am oberen Ende des vom Panel angezeigten Bereichs. Betrachten Sie ihn als Artefakt des Fensters, nicht als Charakterisierung des Modells. Die Verkehrszahl ist diejenige, die Ihnen sagt, dass es tatsächlich genutzt wird.

Video ist der Input, mit dem niemand rechnet
Vision ist inzwischen Grundvoraussetzung, daher ist die Modalität, die noch den Unterschied macht, Video. M3 akzeptiert es nativ, neben Text und Bildern, und das verändert die Gestalt einer Pipeline, statt bloß eine Fähigkeit zu einer Liste hinzuzufügen. Ein Support-Archiv aus Bildschirmaufzeichnungen, eine Reihe von Dashcam-Clips, ein Semester an Vorlesungsaufzeichnungen — das war früher ein Vorverarbeitungsproblem, bei dem man Frames mit einem Tool abtastete und sie mit einem anderen beschrieb. Ein Modell, das Video direkt liest, fasst zwei Stufen zu einem einzigen Aufruf zusammen.
Das macht auch die Kostenkalkulation weniger vorhersehbar, denn Video ist teuer anzusehen, und zwar auf eine Art, wie Text es nicht ist, und die größte Zahl auf einer Rechnung ist meist der Input, für den niemand ein Budget vorgesehen hat. Ein günstiger Preis pro Token macht es sicher, damit zu experimentieren: Bei 0,30 $ pro Million Input-Tokens ist eine gelegentliche fünfstündige Datenaufnahme erschwinglich genug, um prototypisch umgesetzt statt in einem Planungsmeeting diskutiert zu werden.
Was die offenen Gewichte tatsächlich ändern
MiniMax beschreibt M3 als Open-Weight-Modell, was bedeutet, dass die Gewichte veröffentlicht und nicht nur als Dienst bereitgestellt werden, und das ist eine andere Art von Garantie als ein Abonnement. Wenn MiniMax morgen den Dienst einstellen, die Preise ändern oder die Kennung als veraltet einstufen würde, würde das Modell nicht verschwinden – es liefe weiter auf Hardware, die Sie bereits gekauft haben, mit der Quantisierung, die gerade passte. Das macht Selbst-Hosting im Allgemeinen nicht billiger; ein großes Sparse-Mixture-of-Experts selbst zu betreiben, ist ein echtes Engineering-Projekt. Es macht die Abhängigkeit überlebensfähig, was eine andere Aussage ist – und diejenige, auf die es ankommt, wenn Sie entscheiden, worauf Sie aufbauen.
Ein Punkt bietet die gegenteilige Garantie. OpenAI besitzt den Computer, den Browser, die Konnektoren und das Kontingent, und deine Abhilfe, falls sich irgendetwas davon ändert, besteht darin, es nicht mehr zu verwenden. Das ist eine faire Vereinbarung — Mieten ist, wie die meisten Teams anfangen sollten —, aber es ist nicht dieselbe Vereinbarung, und der Unterschied wird erst an dem Tag sichtbar, an dem es darauf ankommt.

Sechs Unterschiede, die eine Entscheidung verändern
• Garantie — ein Dienst, der Bedingungen ändern kann, gegen Gewichte, die Sie behalten können (MiniMax M3 wird als Open-Weight beschrieben; ein Punkt ist in keiner Weise herunterladbar)
• Kosten pro Arbeitseinheit — für dot nicht veröffentlicht, gegenüber 0,30 $ und 1,20 $ pro Million Token mit Cache-Lesevorgängen zu 0,06 $, der niedrigste Preis in dieser Vergleichsgruppe
• Obergrenze für Einzelanfragen — nicht einmal mit einem Punkt dokumentiert, gegenüber 1.048.576 Eingabe-Token und 512.000 Ausgabe-Token
• Modalitäten eingehend – Nachrichten und Daten verbundener Apps für einen Dot, gegenüber Text, Bild und Video für das Modell
• Modalitäten raus — Änderungen innerhalb anderer Software, gegen Text und nur Text
• Unabhängige Einstufung — für einen Punkt existiert kein Benchmark; M3 hat einen Artificial Analysis Intelligence Index von 29,2 und belegt damit unter 145 gemessenen Modellen den sechzigsten Platz, was Mittelfeld ist und wissenswert, bevor man annimmt, dass der günstige Tarif Frontier-Reasoning erkauft. Das tut er nicht.
Wo jeder Einzelne sich seine Zeile auf der Rechnung verdient
Die ehrliche Lesart des veröffentlichten Profils von M3 ist, dass es ein Volumenmodell ist, kein Frontier-Modell: 92,9 auf GPQA Diamond sind wettbewerbsfähig, 59 auf SWE Bench Pro sind respektabel, und der im Mittelfeld liegende Intelligence Index ist das verräterische Zeichen. Worin es gewinnt, sind Kosten pro Arbeitseinheit, Output-Obergrenze, Video und Einsetzbarkeit, in dieser Reihenfolge. Das ist ein gutes Modell, um es unter die teure Schicht einer Pipeline zu legen – die Schritte Zusammenfassen, Extrahieren, Transkribieren, Langtext-Generieren und Viele-Versuche-Ausfächern –, und ein schlechtes, um es an deren Spitze zu setzen.
OrcaRouter bietet es als minimax/minimax-m3 zum Listenpreis des Anbieters MiniMax mit 0 % Aufschlag an, in demselben Katalog wie über 200 Modelle hinter einem einzigen Schlüssel, mit automatischem Failover über vorgelagerte Anbieter hinweg und einer Routing-DSL für das Senden einer einzelnen Anfrage an das Modell, das sie bearbeiten soll. Genau diese Anordnung macht die Zweischichtenaufteilung praktikabel statt theoretisch: Derselbe Schlüssel, der ein günstiges Modell für das Volumen erreicht, erreicht ein Frontier-Modell für die Aufrufe, die stimmen müssen, und nichts kommt in einem Dot an, weil Dots gar nicht im Katalog stehen — kein Endpunkt, keine Kennung, keine Ersatzintelligenz.
Was am Montag zu tun ist
Wenn Sie einen Audio- oder Videokorpus haben und keine günstige Möglichkeit, ihn anzusehen, beginnen Sie dort: M3 ist das einzige Modell in diesem Set, das Video zu diesem Preis nativ liest, und das Experiment kostet fast nichts. Wenn Sie eine Art von Arbeit haben, die immer wieder fallen gelassen wird, weil niemand sie verfolgt, ist the dot das dafür gemachte Produkt, und das nutzungsbasierte Modell wird nicht vorgeben, es zu sein.
Die beiden geraten nur dann in Konflikt, wenn du annimmst, dass eine gewinnen muss. Das Abonnement jagt; der heruntergeladene Reader liest. Besitze den zweiten, miete den ersten, und halte die Grenze zwischen ihnen so explizit, dass du jede von beiden ersetzen könntest, ohne die andere neu zu schreiben.

