
MiniMax M3.1: Co mówią przeciekłe dokumenty zapowiedzi — a czego nikt nie potwierdził
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 434 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 183 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Na Hugging Face znajduje się checkpoint o rozmiarze 250 GB o nazwie MiniMax-M3.1-preview-private, którego nikt spoza garstki partnerów inferencyjnych nie może otworzyć. Istnieje dokument datowany na 22 września, który czyta się dokładnie jak notatka architektoniczna dostawcy, krążący w publicznym repozytorium inżynierii partnerskiej, a nie na własnej stronie dostawcy. A 26 września cieszący się dużą popularnością obserwator modeli opublikował, że MiniMax M3.1 to „następny nadchodzący model na przyszły tydzień” i że już testują jego wersję zapoznawczą. Złóż te trzy elementy razem, a otrzymasz cały publiczny zapis MiniMax M3.1 — modelu, którego nazwa, zmiany architektury, liczba wag i tydzień premiery są w obiegu, a o żadnym z nich dostawca nie powiedział publicznie ani słowa. Poprzednik, od którego pochodzi, MiniMax M3, to inna historia: ten został wydany i to właśnie on jest powodem, dla którego ktokolwiek interesuje się tym modelem.
Tak wygląda z zewnątrz model, który nie został jeszcze wydany, i warto być precyzyjnym co do kształtu dowodów, ponieważ te trzy wątki nie są równie mocne. Istnienie checkpointu zostało potwierdzone: wiele niezależnych przesłanek wskazuje na tę samą nazwę prywatnego repozytorium i tę samą liczbę plików. Dokument architektury nie został potwierdzony w ten sposób — to transkrypcja osoby trzeciej i może być autentyczny, nieaktualny albo częściowo wymyślony. Twierdzenie o „nadchodzącym tygodniu” to czyjeś oczekiwanie, a nie harmonogram. Wszystko w tym artykule jest oznaczone z mocą, jaką faktycznie ma, i niczego tutaj nie należy czytać jako zapowiedzi wydania.
To, co czyni MiniMax M3.1 wartym artykułu, zanim jeszcze istnieje, to jego poprzednik. MiniMax M3 był, według większości relacji, najmocniejszym modelem o otwartych wagach, jaki MiniMax wypuścił — modelem tekstowo-obrazowo-wideo z 1M tokenów, który osiągnął Artificial Analysis Intelligence Index na poziomie 29,2 i wciąż jest jednym z niewielu otwartych modeli, które utrzymają naprawdę długi kontekst w spójności. Jeśli M3.1 zadebiutuje w ostatnim tygodniu września, liczby, które mają znaczenie dla dewelopera, to nie wiarygodność wycieku, lecz to, co zmieniło się w warstwach i ile kosztuje jego serwowanie — a w obu tych kwestiach wyciekły dokument jest wyjątkowo konkretny.
Co jest potwierdzone, a co jest tylko w obiegu
Uczciwy podział, na dzień 27 września 2026:
• Potwierdzono: nie istnieje żadna publiczna wersja MiniMax M3.1. Organizacja MiniMaxAI na Hugging Face zwraca kod 401 — czyli odpowiedź platformy „nie znaleziono lub nie jest widoczne dla Ciebie” — w przypadku MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview i MiniMaxAI/MiniMax-M3.1-preview-private jednakowo. Jej najnowsze publiczne przesłane pliki to wciąż MiniMax-Music3 (7 sierpnia 2026) i MiniMax-H3 (28 lipca 2026).
• Potwierdzone: nie da się trasować MiniMax M3.1 w żadnym miejscu, które możemy sprawdzić. Nie ma go w katalogu modeli OrcaRouter ani w publicznych wykazach, które monitorujemy; model MiniMax, który faktycznie możesz dziś wywołać, to MiniMax M3, pod minimax/minimax-m3.
• Potwierdzono: MiniMax nie opublikowało niczego. Ani karty modelu, ani wpisu na blogu, ani strony z cennikiem, ani wag, ani identyfikatora modelu API. Nie ma relacji prasowych o premierze, ponieważ żadnej premiery nie było.
• W obiegu: dokument architektury. Jest reprodukowany dosłownie w publicznym repozytorium — longsco/innoferra-eval, pakiet do onboardingu partnerów dla hostowanych punktów końcowych modeli, utworzony 23 września 2026 r. — pod nazwą pliku PREVIEW-20260922.md, z nagłówkiem opisującym go jako dokument dostawcy udostępniony 25 września oraz zastrzeżeniem, że "nazwa modelu, data wydania przez dostawcę i publiczna premiera pozostają uzależnione od faktycznego wydania". To jest zastrzeżenie samego dokumentu, nie nasze, i jest ono słuszne: kopia notatki dostawcy sporządzona przez stronę trzecią nie jest oświadczeniem MiniMax.
• W obiegu: checkpoint o rozmiarze 250 GB i jego druga publikacja. Specyfikacja onboardingu repozytorium odnotowuje prywatny multimodalny checkpoint w MiniMaxAI/MiniMax-M3.1-preview-private — 62 pliki, 48 plików safetensors, około 250 GB, ciąg architektury MiniMaxM3SparseForConditionalGeneration — a następnie większą drugą publikację, MiniMax-M3.1-preview2-dspark-private, przy 101 plikach i około 236 GB, która dodała spekulacyjny szkic fp8 o rozmiarze 2,3 GB. Oba są prywatne. Nie możemy otworzyć żadnego z nich, a ty też nie możesz.
• W obiegu: harmonogram. Wpis z 26 września to jedyne publicznie podane określenie daty, a „nadchodzący tydzień” to oczekiwanie. Traktuj tydzień 28 września jako okno do obserwacji, a nie jako datę.
Jedyny dokument, który zawiera szczegóły techniczne
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
Wszystko, co konkretnie wiadomo o projekcie MiniMax M3.1, prowadzi z powrotem do tego jednego pliku markdown oraz dwóch towarzyszących mu plików w tym samym repozytorium: dokumentu demonstracyjnego SGLang opisującego, jak checkpoint ma być serwowany, i pliku spec.yaml, który ma spełniać partnerski endpoint. Gdy czyta się repozytorium jako całość, wygląda ono jak dostawca inferencji robiący dokładnie to, co robi dostawca inferencji — otrzymuje wczesną wersję od MiniMax, zapisuje, co się zmieniło, i buduje dla niej zestaw testów walidacyjnych. To repozytorium nie jest zestawem prasowym i nie zostało napisane, by kogokolwiek przekonywać.
To jest punkt na jego korzyść, a jednocześnie granica tego, co dowodzi. Nic w nim nie jest podpisane przez MiniMax. Trzy dokumenty zgadzają się ze sobą w sposób, w jaki zgadzają się prawdziwe dokumenty — te same stałe kwantyzacji, te same nazwy zmiennych środowiskowych, te same flagi uruchomieniowe — i różnią się w sposób, w jaki różnią się prawdziwe dropy: podgląd z 22 września mówi, że nowa metoda dekodowania spekulatywnego nie ma confidence head, a drugi drop checkpointu dostarczył wersję roboczą konfiguracji z enable_confidence_head ustawionym na true. Zmyślenie zwykle nie zawierałoby łuku korekcyjnego. Ale „niezwykle spójne” nie oznacza „potwierdzone”, a typowym błędem czytelnika jest przyjęcie poniższych stałych jako opublikowanego projektu MiniMax, gdy są one co najwyżej prywatnym projektem MiniMax odczytanym przez kogoś innego.
Pięć zmian inżynieryjnych zgodnie z tym dokumentem
Oto różnica między MiniMax M3 i MiniMax M3.1, zgodnie z opisem w dokumencie. Każdy wiersz pochodzi od dostawcy i nie został poddany audytowi — żadna niezależna strona nie dokonała pomiaru jakiegokolwiek wyniku MiniMax M3.1.
• Pokrycie uwagi. Pełna uwaga w pierwszych trzech warstwach zostaje zastąpiona rzadką uwagą, więc wszystkie warstwy są rzadkie. W MiniMax M3 pierwsze trzy warstwy były kotwicą pełnej uwagi rzadkiego stosu.
• Precyzja uwagi — „Q8KV4”. Zapytania, w tym zapytania indeksatora, wychodzą z projekcji w BF16 i są rzutowane na FP8 E4M3. Klucze i wartości — ponownie w tym te indeksatora — są kwantowane do E2M1, cztery bity, w blokach po 16, ze skalą E4M3 na blok równą amax/6, ograniczoną do [1/512, 448]. Dokument podkreśla, że drabinka jest round-half-to-even z asymetrycznymi progami, że zewnętrzna skala tensora wynosi dokładnie 1, a zerowa wartość musi być kodowana jako dodatnie zero. M3 używał ośmiobitowej ścieżki KV z tej samej rodziny, więc to ponownie zmniejsza o połowę liczbę bajtów KV.
• Precyzja ekspertów. Eksperci routowani MoE przechodzą z MXFP8 na W4A4 NVFP4, przy czym wspólny ekspert jest celowo wykluczony. Dwie projekcje ekspertów otrzymują różne schematy aktywacji: FC1 stosuje dynamiczną skalę na wiersz wynoszącą 2688 podzielone przez maksimum bezwzględne wiersza, przy czym skalę wiersza stosuje się po GEMM, ale przed funkcją aktywacji; FC2 używa stałej skali zewnętrznej wynoszącej 16. Praktyczna konsekwencja, wyjaśniona w README partnera, jest bezpośrednia: „dostawca, który przepuszcza checkpoint przez ogólną ścieżkę NVFP4 bez tych ustawień, wygeneruje po cichu inne wyniki numeryczne.”
• Dekodowanie spekulacyjne. Głowica wielotokenowej predykcji w stylu EAGLE zniknęła, zastąpiona metodą, którą MiniMax nazywa DSpark — zwykłą głowicą Markowa, a w dokumencie z 22 września bez głowicy pewności. To zmiana o największym wpływie na to, jak odczuwalny jest obsługiwany endpoint, ponieważ jest to jedyna dźwignia szybkości na strumień w tej konstrukcji. Silnik demonstracyjny, który MiniMax dołączył wraz z checkpointem, nie zawiera DSpark, a dostawca zmierzył tę lukę: na tej samej ramce o rozmiarze 80 000 tokenów bez spekulacji przepustowość na strumień wynosi 63,9 tokena na sekundę przy współbieżności 1 i spada poniżej 60 przy współbieżności 4, więc sam dokument konkluduje, że bez DSpark stos nie jest w stanie utrzymać docelowego opóźnienia pod obciążeniem.
• Nowe pole żądania. MiniMax M3.1 dodaje pole reasoning_effort najwyższego poziomu przyjmujące wartości max, xhigh, high, medium lub low, wstrzykiwane do promptu systemowego jako znacznik wysiłku przez szablon czatu. M3 miał tylko przełącznik myślenia z opcjami adaptive i disabled. Dokument zauważa, co dziwne i w sposób szczególny, że pole jest przekazywane bez walidacji i bez wymaganej wartości domyślnej — co dostawca odczytał jako pozwolenie na zaakceptowanie albo odrzucenie wartości spoza listy, i co oznacza, że dwa zgodne punkty końcowe mogłyby zachowywać się różnie w przypadku tego samego żądania.

Dwa szczegóły w checkpointcie zasługują na osobne wyróżnienie, bo to właśnie takie rzeczy zwykle pomija wpis o premierze. Po pierwsze, checkpoint zawiera zarówno konfigurację preprocesora obrazu, jak i konfigurację preprocesora wideo — MiniMax M3.1 to model multimodalny z założenia, a nie model tekstowy z później doklejonym widzeniem, a wytyczne samego dostawcy mówią, by nie odrzucać danych wejściowych w postaci obrazów na nowym stosie. Po drugie, druga publikacja checkpointu całkowicie usunęła klucze MTP i NEXTN i nie dodała niczego, co by je zastępowało, dlatego draft DSpark musiał pojawić się jako osobny artefakt o rozmiarze 2,3 GB. W głównych wagach nie ma głowy draftu, którą można by włączyć.
Dlaczego nie ma wyników benchmarków M3.1 i dlaczego nie jest to przeoczenie
Każde omówienie wycieku w końcu dochodzi do części, w której albo wymyśla tabelę benchmarków, albo przyznaje, że jej nie ma. MiniMax M3.1 nie ma żadnej. Specyfikacja partnerska mówi o tym wprost, w polu, które istnieje wyłącznie po to, by powstrzymać kogoś przed popełnieniem tego błędu:
• „Nie opublikowano jeszcze wartości bazowych dla wersji 3.1; nie należy ponownie wykorzystywać liczb z M3 jako progów akceptacji.”
Ta instrukcja to najbardziej użyteczne zdanie w całym korpusie, ponieważ leniwa wersja tego artykułu zapisuje wyniki MiniMax M3 w Artificial Analysis pod nagłówkiem MiniMax M3.1. Nie powinna. To samo repozytorium uruchamia sondy AIME-25 i GPQA-Diamond przeciwko własnemu endpointowi MiniMax M3.1 i zapisuje je jako porównania typu członek zespołu kontra dostawca, przy czym wyniki nie są rozstrzygnięte: w przypadku GPQA-Diamond: 0,904 dla przebiegu zespołu wobec 0,813 dla przebiegu dostawcy, a na 600-pytaniowym podzbiorze MMLU-Pro: 0,898 wobec 0,821. To dwa przebiegi tej samej ewaluacji, które się ze sobą nie zgadzają, a nie wynik modelu, i są oznaczone jako podgląd z uwzględnieniem powtórzeń. Ktokolwiek dziś cytuje pojedynczą liczbę z benchmarku MiniMax M3.1, cytuje coś, co jeszcze nie istnieje.
Czym jest MiniMax M3, żeby można było określić skalę kontynuacji
MiniMax M3 został wydany pod koniec maja 2026 r. i pojawił się na Hugging Face 2 czerwca — 428 miliardów parametrów całkowitych, z 23 miliardami aktywnych, 60 warstw, 128 ekspertów routowanych z routingiem top-4, 4 głowy KV wobec 64 głów uwagi oraz okno kontekstowe wynoszące 1 048 576 tokenów z maksymalną długością wyjścia 512 000. Po stronie niezależnej Artificial Analysis ocenia go na 29,2 w Intelligence Index, co daje mu 60. miejsce na 145 próbkowanych modeli, z wynikiem 58,6 w indeksie kodowania i p50 wynoszącym 3348 milisekund do pierwszego tokenu w naszej własnej telemetrii routingu. Sam MiniMax podaje dla niego kluczowy wynik 83,5 w BrowseComp, co jest danymi dostawcy i jako takie nie zostało poddane audytowi.
Cennik to część, która najlepiej znosi upływ czasu w cyklu wycieków. MiniMax M3 kosztuje 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych, a odczyty z pamięci podręcznej to 0,06 USD — i jest dostępny na OrcaRouter jako minimax/minimax-m3, po cenie katalogowej dostawcy z 0% narzutu, więc jeśli MiniMax wyceni M3.1 w ten sam sposób, nowa stawka będzie aktywna po naszej stronie w dniu, w którym się pojawi, a nie dopiero cykl rozliczeniowy później.
Nie chodzi w powtarzaniu tego wszystkiego o nostalgię. Chodzi o to, że jedynym powodem, dla którego ktokolwiek w tym tygodniu odświeża stronę organizacji Hugging Face, jest to, że MiniMax M3 był wystarczająco dobry, by jego następca stał się kwestią produkcyjną, a nie widowiskiem — i że model z 428 miliardami parametrów i kontekstem 1M w cenie $0.30/$1.20 wyznacza poprzeczkę cenowo-wydajnościową, którą M3.1 musi przeskoczyć, a nie tylko poprzeczkę możliwości.
Kwestia anonimowego ogłoszenia i dlaczego być może już na nią odpowiedziano
Jeden wątek z początku września warto tutaj zamknąć. Na zewnętrznej platformie programistycznej pojawił się anonimowy ukryty wpis z kontekstem 1 000 000 tokenów, ceną 0 USD i obowiązkowymi poziomami rozumowania; opisaliśmy go pod nazwą Space Bunny Alpha, odnotowując częstość bazową, że każdy tego typu anonimowy wpis w końcu zostaje przypisany do jakiegoś dostawcy — Pony Alpha stał się modelem Zhipu, Hunter Alpha stał się modelem Xiaomi, a Ox Alpha — wydaniem MiniMax pod inną nazwą. Tokenizator i odciski anomalii w tym wpisie wskazywały na checkpoint wersji zapoznawczej MiniMax. Jeśli MiniMax M3.1 rzeczywiście pojawi się w tym tygodniu, najbardziej prawdopodobna interpretacja jest taka, że anonimowy wpis był jego testem terenowym, a zagadka rozstrzygnie się przez ogłoszenie, a nie przez dalszą pracę śledczą. To wnioskowanie, nie dowód, i jest to ostatnie wnioskowanie w tym tekście.

Na co uważać i co robić w tym tygodniu
Sygnały, które zmieniłyby to z przecieku w premierę, są konkretne i weryfikowalne, a nie są to te, które śledzi większość komentarzy. Publiczne repozytorium Hugging Face w organizacji MiniMaxAI — nie prywatne — z kartą modelu to najsilniejszy pojedynczy wskaźnik; historia przesłanych materiałów tej organizacji jest publiczna i datuje każdą premierę co do dnia. Strona modelu MiniMax lub identyfikator modelu w API to drugi wskaźnik. Opublikowana cena to trzeci — i ten, który ma znaczenie dla budżetu. Tabela benchmarków w Artificial Analysis z datą po premierze to czwarty — i jedyny niezależny.
Do tego czasu praktyczne stanowisko dla każdego, kto buduje, nie różni się od żadnego innego tygodnia przed premierą: modelem, do którego możesz dziś kierować ruch, jest MiniMax M3, jeden klucz API daje do niego dostęp obok ponad 200 innych modeli, automatyczne przełączanie awaryjne oznacza, że chwilowe wahnięcie endpointu nie staje się twoją awarią, a przypięta lub mieszana trasa przez routing DSL albo panel modeli odpowiadających wspólnie dzięki fuzji modeli to sposób na ograniczenie ryzyka związanego z modelem, którego nie wdrożyłeś produkcyjnie. Jeśli M3.1 się pojawi, to podmiana jednego ID modelu, a nie migracja — co jest całym argumentem przeciw budowaniu dedykowanej integracji w oparciu o przeciek.
Jednej rzeczy ten artykuł nie zrobi: nie będzie udawał, że wie kiedy. Punkt kontrolny jest prawdziwy, dokumenty są konkretne, a najnowsze publiczne twierdzenie to osoba mówiąca „w przyszłym tygodniu”. Z tych trzech tylko pierwsze dwa można zweryfikować samodzielnie.
