Eine generierte Hero-Karte mit dem Titel 'GPT-6.1 Sol vs MiniMax M3' und zwei abgerundeten Panels: links 'GPT-6.1 Sol' mit den Angaben 'OpenAI – veröffentlicht am 29. September 2026', '$2,00 Eingabe / $10,00 Ausgabe pro 1 Mio.', 'AA-Index 51' und '$0,72 pro Aufgabe'; rechts 'MiniMax M3' mit den Angaben 'MiniMax – veröffentlicht am 31. Mai 2026', '$0,30 Eingabe / $1,20 Ausgabe pro 1 Mio.', 'AA-Index 29,2' und '$0,51 pro Aufgabe'; dazwischen die Zeile 'Günstigere Karte, kleinere Rechnung – 22,6 Indexpunkte Unterschied'; Fußzeile 'Zahlen: Artificial Analysis v4.3.2.' und das OrcaRouter-Logo unten rechts.
Guides & Insights

GPT-6.1 Sol vs. MiniMax M3: Die günstigere Preisliste verliert auf der Rechnung

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MiniMax M3 asks for a fraction of what GPT-6.1 Sol asks — $0.30 per million input tokens against $2.00, $1.20 per million output against $10.00 — and by the meter that actually runs, it is cheaper: $0.508 per task against $0.724 on Artificial Analysis's v4.3.2 evaluation. That is a genuine win, and it is also the whole of the argument, because the same measurement that hands M3 the lower bill hands GPT-6.1 Sol a 22.6-point index lead, and the benchmark set that measures whether a model can finish agentic work rather than describe it turns the gap into a wall. The vendor shipped GPT-6.1 Sol on 29 September 2026. The company released M3, its 428-billion-parameter open-weight model, on 31 May 2026.

Beide sind live, beide haben einen Preis, und beide sind nur einen API-Aufruf entfernt. Was folgt, ist die Rechnung, die zwischen ihnen entscheidet, und die zwei Stellen, an denen die Rechnung nicht die ganze Geschichte ist.

Was jedes Modell tatsächlich ist

GPT-6.1 Sol ist OpenAIs aktuelles Flaggschiff für Reasoning und Software-Engineering — ein geschlossenes Modell, veröffentlicht nur eine Woche nach dem GPT-6 Sol, das es ersetzt, und zum selben Listenpreis von 2,00 $ / 10,00 $ wie sein Vorgänger verkauft. Es hat einen Preis von 0,10 $ für gecachte Eingaben, die Hälfte dessen, was GPT-6 Sol für Cache-Treffer berechnete, und es ist das Modell, auf das OpenAI verweist, wenn von agentischem Coding statt von Chat die Rede ist.

MiniMax M3 ist ein Mixture-of-Experts-Modell mit insgesamt 428 Milliarden Parametern und 23 Milliarden aktiven pro Token, veröffentlicht unter der MiniMax Community License – eine Open-Weights-Veröffentlichung mit einer individuellen Lizenz mit nicht-kommerziellem Einschlag, nicht einer von der OSI anerkannten. Es wird von einem breiten Spektrum von Inferenzanbietern bereitgestellt: Artificial Analysis verzeichnet fünfzehn Hosts für M3 gegenüber acht für GPT-6.1 Sol. Diese Breite ist der praktische Vorteil offener Gewichte, und sie ist auch der Grund, warum der Preiswettbewerb bei M3 schneller war als bei dem geschlossenen Modell.

Die Tarifkarte und der Zähler, der sie außer Kraft setzt

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Stellt man die beiden veröffentlichten Tarifkarten nebeneinander, ist das alles andere als knapp.

• Eingabe — GPT-6.1 Sol 2,00 $ pro 1 Mio. vs. MiniMax M3 0,30 $ pro 1 Mio.; M3 ist 85 % günstiger
• Ausgabe — 10,00 $ pro 1 Mio. vs. 1,20 $ pro 1 Mio.; M3 ist 88 % günstiger
• Cache-Eingabe — 0,10 $ pro 1 Mio. vs. 0,06 $ pro 1 Mio.
• Kosten pro AA-Aufgabe — 0,724 $ vs. 0,508 $; M3 ist 30 % günstiger, nicht 85 %
• Ausgabe-Tokens pro Aufgabe — 38.128 vs. 48.192; M3 schreibt 26 % mehr
• Zeit pro Aufgabe — 640 s vs. 486 s
• Kontextfenster — 1.050.000 vs. 1.048.576 Tokens; praktisch gleich
• Maximale Ausgabe — 128.000 Tokens vs. 512.000; M3 wird eine sehr lange Antwort schreiben
• Akzeptierte Eingaben — Text, Bild und Datei vs. Text, Bild und Video
• Index-Rang — GPT-6.1 Sol 10. von 147 Modellen vs. MiniMax M3 62.

Die beiden günstigen Zeilen oben sind die, die ein Beschaffungsblatt sieht. Die dritte Zeile ist die, die die Rechnung bezahlt, und sie besagt, dass ein Preislisten-Vorteil von 85–88 % zu einem realen Vorteil von 30 % wird, weil M3 mehr Tokens pro Aufgabe ausgibt und weil eine Aufgabe keine feste Arbeitsmenge ist. Preislisten bepreisen Tokens; Arbeit wird in Aufgaben abgerechnet. Jeder Vergleich, der bei den ersten beiden Zeilen endet, vergleicht die falschen Zahlen in der falschen Einheit.

Wo die dreißig Prozent aufhören zu zählen

Die Aufgabenkosten liegen so nah beieinander, dass die Index-Lücke bei allem jenseits von Massentext den Ausschlag gibt. Artificial Analysis führt GPT-6.1 Sol mit 51,83 und MiniMax M3 mit 29,22 – eine Spanne von 22,6 Punkten, die zudem nicht gleichmäßig über die Suite verteilt ist. Bei den Evaluierungen, bei denen ein Modell ein Terminal bedienen, ein Repository bearbeiten und seine eigene Arbeit überprüfen soll, sind die beiden Modelle nicht in derselben Kategorie:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs. MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs. 0.0048
• AA-Omniscience — 41.53 vs. 1.35
• MMLU-Pro — 0.8595 vs. 0.7856
• AutomationBench — 0.6487 vs. 0.2125
• τ²-bench — nicht veröffentlicht für GPT-6.1 Sol in diesem Durchlauf vs. 0.8889 für M3
• GPQA Diamond — nicht veröffentlicht für GPT-6.1 Sol in diesem Durchlauf vs. 0.9293 für M3
• CritPT — 0.3171 vs. 0.0371

Lesen Sie das sorgfältig, denn es ist kein sauberer Durchmarsch, und die Ausnahmen sind der interessante Teil. MiniMax M3 erreicht 0.8889 auf τ²-bench, der Bewertung für Tool-Nutzung und Kundenservice-Dialoge, und 0.9293 auf GPQA Diamond — ein wissenschaftlicher Wert auf Graduiertenniveau, der jeden in diesem speziellen Durchlauf veröffentlichten OpenAI-Wert übertrifft. M3 ist ein kompetenter Schlussfolgerer und ein guter Anwender von Tools in Dialogen. Bei Terminal-Bench 4.0 erreicht es 0.0202. Das ist nicht „schlechter“; das ist ein Modell, das eine mehrstufige Repository-Aufgabe überhaupt nicht zusammenhalten kann, und kein Rabatt auf Tokens macht eine Aufgabe, bei der das Modell scheitert, billiger als die Aufgabe, die das Modell abschließt.

Es gibt einen Kostenfaktor zweiter Ordnung, den die Pro-Task-Kennzahl verbirgt. M3 verzeichnet 48.192 Ausgabe-Tokens pro Aufgabe und eine Zeit bis zur ersten Antwort von 23,0 Sekunden gegenüber 332,0 Sekunden bei GPT-6.1 Sol – das kleine Modell beginnt fast sofort zu sprechen und denkt dann ausführlich nach. Wenn Ihr Workload latenzempfindlich, aber wenig tiefgehend ist, ist das ein Pluspunkt für M3. Wenn er agentisch ist, ist die Token-Anzahl das, wofür Sie bezahlen, und die Endpunktzahl ist das, was Sie bekommen.

Unsere eigene Model Card für GPT-6.1 Sol enthält dieselben Zahlen in der Form, gegen die Sie tatsächlich routen würden: den Tarif von 2,00 $ / 10,00 $, einen Kontext von 1.050.000 Token, eine p50-Zeit bis zum ersten Token von 4,54 Sekunden und den Artificial-Analysis-Index samt Benchmark-Block auf derselben Seite.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Was die offenen Gewichte hier wert sind

Dass M3 herunterladbar ist, ist das stärkste Argument dafür, und es lohnt sich, genau zu sein, was das bringt. Es bringt Lizenzbedingungen, die es ermöglichen, das Modell innerhalb der eigenen Grenzen zu betreiben — nützlich, wenn die Daten diese nicht verlassen dürfen —, und es bringt den Preiswettbewerb, der von fünfzehn unabhängigen Hosts ausgeht. Es bringt keine günstige Bereitstellung: 428 Milliarden Parameter bei 23 Milliarden aktiven brauchen weiterhin ernsthafte Inferenz-Hardware, und die MiniMax Community License ist eine individuelle Lizenz mit Bedingungen, keine uneingeschränkte. Für die meisten Teams bedeutet „open weights“ einen besseren Preis für gehostete Inferenz, nicht eine Box im Rack.

Die OrcaRouter-Karte für MiniMax M3 ist der Ort, an dem die bereitgestellten Zahlen stehen: der Tarif von 0,30 $ / 1,20 $, das Kontextfenster von 1.048.576 Token, die maximale Ausgabe von 512.000 Token, Text-/Bild-/Video-Eingabe und ein Sieben-Tage-Volumen von 56,4 Millionen Token über die Anbieter hinweg, die es routen.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Beide hinter einer Taste

Der praktische Grund, warum dieser Vergleich eine Konfigurationsänderung und keine Migration ist, liegt darin, dass beide Modelle über einen einzigen OrcaRouter-Endpunkt erreichbar sind – eine API für über 200 Modelle, bei der der Listenpreis des Anbieters ohne Aufschlag (0 %) durchgereicht wird. Das bedeutet, eine Preisänderung bei MiniMax schlägt am selben Tag auf Ihrer Rechnung durch, an dem der Anbieter sie veröffentlicht, und nicht erst, wenn ein Wiederverkäufer neu verhandelt. Für M3 ist das wichtiger als für seinen Konkurrenten: Der ganze Grund, auf ein Open-Weight-Modell zu setzen, ist ja, dass sich sein Preis und seine Host-Liste ständig bewegen, und ein durchgereichter Zähler ist die einzige Art, die ein bewegliches Ziel mitverfolgt.

Automatisches Failover ist die andere Hälfte. M3 wird von vielen Anbietern mit unterschiedlicher Zuverlässigkeit bedient, und die Routing-Schicht kann eine Anfrage auf einen anderen Host verschieben, wenn einer an Leistung verliert, ohne dass der Aufrufer weiß, auf welchem Host sie gelandet ist. Das ist der ehrliche Weg, ein Modell zu übernehmen, dessen Terminal-Bench-Score sagt: „nicht für den kritischen Pfad“ – setze es dort ein, wo ein Retry günstig ist.

Welches, wenn du dich heute entscheiden müsstest

Wenn es sich bei der Arbeit um Massentext handelt – Extraktion, Zusammenfassung, Klassifizierung, Dialog, alles, bei dem die Ausgabe Prosa ist und der Fehlermodus ein falscher Satz statt eines fehlgeschlagenen Builds ist –, ist MiniMax M3 die richtige Standardwahl, und die dreißig Prozent sind echtes Geld. Nutzen Sie die GPQA- und τ²-bench-Zahlen als Beleg: Dies ist ein leistungsfähiges Modell, das zufällig günstig ist.

Wenn die Arbeit agentisch ist – Repositories, Terminals, Toolchains, alles mit einem Verifikationsschritt –, ist der Wert 0,0202 bei Terminal-Bench 4.0 ein Ausschlusskriterium, und GPT-6.1 Sol mit 0,5606 für 0,724 $ pro Aufgabe ist das bessere Geschäft, selbst bei 85 % mehr pro Token. Die Preisliste war nie das, was du gekauft hast.

Die nützliche Antwort lautet, dass Sie sich nicht ein für alle Mal entscheiden müssen. Leiten Sie die einfache Stufe an M3, leiten Sie die agentische Stufe an GPT-6.1 Sol und behalten Sie beide hinter einem einzigen Credential — die Routing-DSL fügt die beiden zu einem einzigen Aufruf zusammen, wenn eine Aufgabe als Extraktion beginnt und sich in einen Reparaturauftrag verwandelt.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert