
MiniMax M3.1 Flash Preview vs MiniMax M3: Kiedy to nowszy model jest bardziej ryzykowny
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 468 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 192 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Dokumentacja samego dostawcy umieszcza teraz MiniMax-M3.1-Flash-Preview powyżej MiniMax-M3, a ta kolejność ma dużą moc przekonywania. To najnowszy model tekstowy w tej linii, ma to samo okno kontekstowe na milion tokenów i dodaje kontrolę głębokości myślenia, której nie ma starszy model. Tabela nie pokazuje jednak, że starszy model jest jedynym z tych dwóch, który można pobrać, ustalić jego cenę za token, porównać go z czymkolwiek w benchmarkach albo wywołać bez subskrypcji — i że nowszy odebrał przełącznik, który dawał ci MiniMax-M3.
To nie jest historia o modelu, który został zastąpiony. To historia o tym, jak dostawca dzieli własną linię na konia roboczego rozliczanego za użycie i podgląd dostępny wyłącznie w ramach subskrypcji, a te dwa nie są wymienne w żadnym kierunku. Oto czym tak naprawdę jest każde z nich.
Dwie karty specyfikacji, obok siebie
Zacznij od tego, co podają własne strony dostawcy w przypadku obu, ponieważ kształt różnicy ujawnia się tutaj, a nie w tabeli benchmarków.
• Ogłoszono — MiniMax-M3 1 czerwca 2026 r. wraz z notą architektoniczną, arkuszem wyników benchmarków i cennikiem; MiniMax-M3.1-Flash-Preview 27 września 2026 r. wraz z wpisem w dokumentacji i postem na koncie agenta MiniMax • Okno kontekstowe — 1 000 000 tokenów w obu przypadkach, zgodnie z tabelami modeli MiniMax • Maksymalna liczba tokenów wyjściowych — 512 000 tokenów dla MiniMax-M3 w naszym wpisie katalogowym, wartość, której sam MiniMax nie publikuje; nigdzie nieopublikowana dla MiniMax-M3.1-Flash-Preview • Modalności wejściowe — tekst, obraz i wideo na wejściu, tekst na wyjściu, w obu przypadkach • Kontrola rozumowania — parametr thinking, którego pominięcie można nakazać w MiniMax-M3 i który można wydzielić do pola reasoning_details za pomocą reasoning_split; w MiniMax-M3.1-Flash-Preview rozumowanie jest obowiązkowe, a reasoning_split nie można wyłączyć • Głębokość rozumowania — niedostępna w MiniMax-M3; drabinka effort obejmująca low, medium, high, xhigh i max, domyślnie max, w MiniMax-M3.1-Flash-Preview • Publikowana prędkość generowania — około 100+ tokenów na sekundę dla MiniMax-M3, zgodnie z tabelą modeli MiniMax; nic nie opublikowano dla MiniMax-M3.1-Flash-Preview • Wagi — MiniMax-M3 ma otwarte wagi i publiczne repozytorium; MiniMax-M3.1-Flash-Preview nie ma żadnego • Ceny — 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych dla MiniMax-M3 według stawki dostawcy; dla MiniMax-M3.1-Flash-Preview nie istnieje stawka za token • Dostęp — MiniMax-M3 w modelu płatności za zużycie i w Token Plan, z możliwością kierowania przez platformy zewnętrzne; MiniMax-M3.1-Flash-Preview wyłącznie w Token Plan i MiniMax Code
Dwa wiersze tam należą do innej kategorii niż pozostałe. Podana prędkość wyjściowa to liczba producenta tylko dla starszego modelu, więc nowszy model jest sprzedawany jako ten szybki, bez podanej wartości. A kontrola nad myśleniem poszła w przeciwnym kierunku niż marketing: nowszy model oferuje precyzyjniejszą kontrolę nad tym, ile myśli, jednocześnie odbierając ci możliwość całkowitego powstrzymania go od myślenia.
Przełącznik, który MiniMax odebrał
To szczegół, który najprawdopodobniej da się we znaki, i jest udokumentowany, a nie ukryty. W przypadku MiniMax-M3 wysłanie thinking: {"type": "disabled"} w punkcie końcowym zgodnym z OpenAI pomija myślenie i zwraca bezpośrednią odpowiedź; w punkcie końcowym zgodnym z Anthropic myślenie jest domyślnie wyłączone i można je włączyć za pomocą adaptive. W MiniMax-M3.1-Flash-Preview identyczne żądanie zwraca HTTP 400 z komunikatem requires adaptive thinking. Nie ma obsługiwanego sposobu na uzyskanie odpowiedzi bez rozumowania.
W praktyce oznacza to, że obciążenie, które wykorzystywało MiniMax-M3 jako tani, szybki klasyfikator lub router — krótki prompt na wejściu, krótka odpowiedź strukturalna na wyjściu, bez łańcucha myśli — nie ma bezpośredniej ścieżki aktualizacji do nowszego modelu. Możesz obniżyć effort do low, a wytyczne MiniMax wyraźnie mówią, że obniżenie effort to zamierzony sposób na zmniejszenie opóźnienia i liczby tokenów związanych z myśleniem, a nie na całkowite wyłączenie myślenia. Ale tokeny i opóźnienie nie spadają do zera, a w przypadku zadania ekstrakcji o dużym wolumenie, które zapisuje cztery pola na wywołanie, „zawsze najpierw myśli" to inny kształt kosztów niż „myśli, gdy zostanie poproszony".

Co jest faktycznie mierzone na każdym
Jedna strona tego porównania ma liczby, a druga ma pustą kolumnę, i warto być precyzyjnym co do tego, które liczby są czyje.
Niezależny dorobek MiniMax-M3 jest prawdziwy: Artificial Analysis umieszcza go na 29,2 w Intelligence Index — 60. miejscu na 145 — z 58,6 w Coding Index, 59,18 w swoim indeksie matematycznym, 92,9% w GPQA Diamond w ramach tej samej rodziny indeksów, 83% skuteczności przywoływania długiego kontekstu i 82,9% w IFBench. To oceny zewnętrzne modelu, który każdy może pobrać i uruchomić ponownie. Podane przez sam MiniMax wyniki premierowe dla M3 — BrowseComp 83,5%, SWE-Bench Pro 59,0%, Terminal-Bench 2.1 66,0%, MCP Atlas 74,2%, OSWorld-Verified 70% — to dane dostawcy i nie widzieliśmy, żeby zostały odtworzone.
MiniMax-M3.1-Flash-Preview nie ma ani jednego, ani drugiego. MiniMax nie opublikował żadnej tabeli wyników, a model nie widnieje w indeksie Artificial Analysis, więc nie ma niezależnego wyniku, wskaźnika kodowania, wskaźnika przywoływania w długim kontekście ani pomiaru halucynacji. Każda krążąca o nim charakterystyka — „szybki”, „niezawodny”, „stworzony do codziennego programowania” — to własny przymiotnik dostawcy z wpisu o premierze. Warto powiedzieć o tym braku wprost, ponieważ działa on w obie strony: nie wykazano, żeby cokolwiek było gorsze, i nie wykazano, żeby cokolwiek było lepsze.
Ta asymetria to cała decyzja. MiniMax-M3 możesz ocenić jeszcze dziś po południu, pobierając go lub wywołując go, a tę ocenę możesz porównać z publicznym rankingiem. Z MiniMax-M3.1-Flash-Preview możesz tylko korzystać i wyrobić sobie prywatną opinię.
Gdzie nowszy model naprawdę wygrywa
Łatwo byłoby odczytać powyższe jako argument za ignorowaniem nowego modelu, ale to również nie jest właściwy wniosek. Trzy rzeczy są realne i specyficzne dla niego.
Drabina wysiłku to realna możliwość, a nie przełącznik. Pięć poziomów — od low do max — pozwala jednemu modelowi obsłużyć rutynową zmianę nazwy i refaktoryzację całego repozytorium przy różnych kosztach obliczeniowych, a jej skuteczność udokumentowano wyłącznie dla MiniMax-M3.1-Flash-Preview. W przypadku MiniMax-M3 wybór jest binarny. Jeśli Twoim problemem jest to, że nie potrafisz przewidzieć opóźnienia poszczególnych zadań, regulowana głębokość to dokładnie ta kontrola, której chciałeś.
To obecny najlepszy model w ofercie dostawcy, co oznacza, że dziedziczy wszystko, czego linia M-series nauczyła się od czerwca; MiniMax wyraźnie podkreśla, że to najnowszy model do rozumowania agentowego, korzystania z narzędzi, kodowania i zadań z długim kontekstem. Mechanizm przeplatanego myślenia i użycia narzędzi wprowadzony w M3 jest zachowany, łącznie z wymogiem dołączania pełnej odpowiedzi — wraz z blokami myślenia i wszystkim innym — z powrotem do historii wiadomości.
A do tego przyjmuje wideo, w cenie Flash, w ramach subskrypcji. MiniMax-M3 również to potrafi, w cenie za token. Jeśli już płacisz za miejsce w Token Plan, a jedyną przeszkodą w korzystaniu z wejścia wideo był dla Ciebie koszt krańcowy za wywołanie, M3.1-Flash-Preview usuwa tę przeszkodę.
Gdzie starszy model wciąż jest tym, po który warto sięgnąć
Trzy przypadki, wszystkie dotyczą przewidywalności, a nie jakości.
Gdy musisz modelować koszty. MiniMax-M3 ma cennik: 0,30 USD za milion tokenów wejściowych, 1,20 USD za milion wyjściowych oraz stawkę odczytu z pamięci podręcznej 0,06 USD za milion w naszym katalogu. Miesięczny rachunek za dane obciążenie możesz oszacować co do centa, zanim je uruchomisz. MiniMax-M3.1-Flash-Preview nie ma żadnej stawki za token na stronach MiniMax, więc jego koszt to Twoja subskrypcja podzielona przez to, ile go używasz — w porządku przy stałym budżecie, bezużyteczne w ekonomice jednostkowej.
Gdy potrzebujesz, aby model był modelem. MiniMax-M3 ma otwarte wagi: możesz go pobrać, uruchomić na własnym sprzęcie i mieć pewność, że artefakt odpowiadający na Twoje wywołania za sześć miesięcy jest tym samym, który odpowiada na nie dziś. MiniMax-M3.1-Flash-Preview nie ma checkpointu, a dostęp w wersji preview oznacza, że stos obsługi, skład limitów i dostępność są kontrolowane przez dostawcę i wyraźnie podlegają zmianom.
Gdy potrzebujesz odpowiedzi bez rozumowania. Jak wyżej — to jedyna regresja możliwości w porównaniu i właśnie ona zaskakuje ludzi, ponieważ nowszy model, który nie potrafi czegoś, co potrafił starszy, nie jest przypadkiem, na który ktokolwiek się przygotowuje.

Dzwoniąc do obu z jednego miejsca
Kłopot w tym, że te dwa modele kupuje się inaczej — jeden jest rozliczany za zużycie, drugi w subskrypcji — a naturalnym odruchem jest opowiedzenie się po jednej stronie. Bardziej przydatnym posunięciem jest kierowanie między nimi zależnie od charakteru zadania, co działa tylko wtedy, gdy strona rozliczana za zużycie jest osiągalna z tego samego miejsca co wszystko inne.
MiniMax-M3 w OrcaRouteroferuje cenę katalogową MiniMax z dodaną 0% marżą, więc 0,30 USD i 1,20 USD z cennika to rzeczywisty koszt wywołania, bez dodatkowej marży platformy. Znajduje się na tym samym endpointcie zgodnym z OpenAI co MiniMax M2.7 — ta sama stawka 0,30 USD/1,20 USD za okno 200 000 tokenów, również z otwartymi wagami — oraz co ponad 200 innych modeli, za jednym kluczem API, z automatycznym przełączaniem awaryjnym między dostawcamigdy jeden z endpointów zaczyna szwankować. W zestawieniu z naszą własną telemetrią, która jest zupełnie innym rodzajem liczby niż dane dostawcy: przez ostatnie siedem dni M3 odpowiadał z szybkością około 238 tokenów wyjściowych na sekundę przy p50 wynoszącym około 4,1 sekundy do pierwszego tokena, z odsetkiem błędów blisko 0,15%, mierzonym w playgroundzie OrcaRouter. Jeśli chcesz traktować MiniMax-M3 jako niezawodną połowę potoku, a MiniMax-M3.1-Flash-Preview jako połowę eksperymentalną, niezawodna połowa to jedna linia konfiguracji, a nie druga relacja z dostawcą. Sam MiniMax-M3.1-Flash-Preview nie znajduje się w naszym katalogu; droga do niego prowadzi przez własny Token Plan i produkt do kodowania tego dostawcy.
To, co zmieniłoby ten artykuł, jest konkretne i łatwe do sprawdzenia. Opublikowany cennik dla MiniMax-M3.1-Flash-Preview zniweczyłby główny powód, by preferować M3 ze względów ekonomicznych. Zestaw niezależnych ocen zastąpiłby pustą kolumnę czymś porównywalnym. Checkpoint do pobrania usunąłby zarzut dotyczący odtwarzalności. Dopóki nie pojawi się przynajmniej jedno z nich, MiniMax-M3 pozostaje modelem w tej parze, który można rozliczyć — a nowszy pozostaje szybszą, lepiej kontrolowaną, niezmierzoną wersją zapoznawczą, za którą MiniMax zdecydował się pobierać opłatę miesięcznie, a nie za token.

