Główna karta tytułowa dla MiniMax M3 vs Muse Spark 1.2, z podtytułem „Cena za token, kontekst, przepustowość i gdzie rozchodzą się benchmarki”, przedstawiająca dwie abstrakcyjne zaokrąglone karty zwrócone do siebie po obu stronach cienkiego pionowego separatora, przy czym lewa karta ma niebieski akcent, a prawa cyjanowy, oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MiniMax M3 vs Muse Spark 1.2: Czterokrotna różnica w cenie kontra dominacja w benchmarkach

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniMax M3 kosztuje 0,30 USD za milion tokenów wejściowych w naszym katalogu. Muse Spark 1.2 kosztuje 1,25 USD. To 4,2-krotna różnica na wejściu i 3,5-krotna na wyjściu — i jest to najistotniejszy fakt dotyczący tej pary, ponieważ na tych samych stronach katalogu Muse Spark 1.2 prowadzi przed MiniMax M3 w każdym wierszu testów porównawczych wspólnym dla obu modeli. Jeden to tania opcja z otwartymi wagami, z gwarantowanym przez dostawcę użytecznym kontekstem 512K i górnym limitem wyjścia 512K. Drugi to punkt kontrolny rozumowania Meta, który jest już o jedną generację za swoją własną rodziną, a mimo to wciąż osiąga lepsze wyniki niemal wszędzie. Reszta tej strony dotyczy tego, które z tych dwóch faktów faktycznie rozstrzyga o danym obciążeniu — a odpowiedź nie jest jednakowa dla wszystkich obciążeń.

Czym tak naprawdę jest każdy z tych modeli

Oba trafiły do sprzedaży w tym roku i żaden nie jest nowy. To ma znaczenie, ponieważ strona porównawcza napisana tak, jakby któryś z nich dopiero wchodził na rynek, sama stanie się nieaktualna w ciągu miesiąca.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 to własne wydanie MiniMax, ogłoszone na blogu dostawcy 2026-06-01 pod nagłówkiem „MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model”. Wpis zaczyna się bez ogródek: „MiniMax M3 został oficjalnie wydany dziś”. Trzy twierdzenia MiniMax na jego temat są następujące: osiąga on wydajność na poziomie frontier w kodowaniu i pracy agentowej, wykorzystuje MSA (MiniMax Sparse Attention), nową architekturę uwagi zaproponowaną przez firmę, oraz jest natywnie multimodalny — przyjmuje dane wejściowe w postaci obrazu i wideo i, jak mówi MiniMax, „potrafi obsługiwać komputer stacjonarny”. MiniMax dodaje, że te trzy możliwości to warunek konieczny dla zamkniętych modeli frontier, a M3 jest „pierwszym i jedynym modelem o otwartych wagach, który łączy wszystkie trzy”. Nasz katalog podaje, że model jest dostępny od 2026-05-31, dzień wcześniej niż data na blogu.

Muse Spark 1.2 należy do Meta. Nasz katalog datuje go na 2026-08-05. Nie jest to nowa warstwa — to zaktualizowany checkpoint względem Muse Spark 1.1 o nieco wyższej wydajności, udostępniany w tej samej warstwie Standard przy identycznym cenniku, co czyni go aktualizacją typu drop-in, a nie osobnym produktem. Jego wyróżniającą cechą jest zakres danych wejściowych: tekst, obrazy, wideo, audio i PDF. Dane wyjściowe to tekst.

Jedna informacja kontekstowa należy tutaj, a nie powinna być zakopana gdzieś dalej. Meta przeniosła rodzinę Muse Spark na checkpoint 1.3 w dniu 2026-09-02, co czyni 1.2 poprzednią generacją jej własnej linii. Stało się to trzy tygodnie temu, więc nie jest to nowość i ta strona nie traktuje tego jako nowości — ale każdy, kto dziś wybiera między tymi dwoma, powinien wiedzieć, że porównuje aktualny model MiniMax z zastąpionym modelem Meta.

Cena za milion tokenów i ile faktycznie kosztuje obciążenie

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

Opublikowane stawki, pobrane ze strony każdego modelu w naszym własnym katalogu, który przekazuje cenę katalogową dostawcy bez doliczania marży:

• Wejście — MiniMax M3 0,30 USD za 1 mln tokenów vs Muse Spark 1.2 1,25 USD za 1 mln tokenów

• Wyjście — MiniMax M3 1,20 USD za 1 mln vs Muse Spark 1.2 4,25 USD za 1 mln

• Odczyt z pamięci podręcznej — MiniMax M3 0,060 USD za 1 mln vs Muse Spark 1.2 0,150 USD za 1 mln

• Współczynnik — Muse Spark 1.2 wynosi 4,2x dla wejścia, 3,5x dla wyjścia, 2,5x dla odczytów z pamięci podręcznej

Te abstrakcyjne proporcje stają się konkretne w kalkulatorze kosztów na każdej stronie. Ustaw oba na 10 milionów tokenów miesięcznie przy 70% udziale tokenów wejściowych — rozsądny kształt dla zadania podsumowywania lub ekstrakcji i domyślna wartość, z którą dostarczany jest estymator — a MiniMax M3 wychodzi na 5,70 USD miesięcznie. Muse Spark 1.2 wychodzi na 11,30 USD miesięcznie. Włącz buforowanie promptów, a to samo obciążenie wyniesie około 4,86 USD wobec około 9,63 USD. Kalkulator oznacza oba jako szacunki oparte na cenie katalogowej, co jest właściwym zastrzeżeniem: rzeczywiste liczby tokenów zależą od tokenizera dostawcy.

Przy tanim obciążeniu różnica to pieniądze na kawę. Sedno tkwi w kształcie krzywej, a nie w wartościach bezwzględnych: obciążenie obejmujące sto milionów tokenów miesięcznie, z przewagą tokenów wyjściowych, przechodzi z trzycyfrowych kwot na czterocyfrowe już po stronie samego Muse Spark. Jeśli koszt jest ograniczeniem, które skłoniło cię do przyjrzenia się temu połączeniu, to właśnie tę liczbę warto modelować na własnym ruchu.

Ponieważ przekazujemy cenę katalogową dostawcy bezpośrednio, bez marży, obniżka ceny dostawcy pojawia się po naszej stronie tego samego dnia, w którym zostaje ogłoszona, a oba te modele są kierowane tutaj — jeden klucz obejmuje oba, więc wycenianie ich względem siebie nie wymaga drugiej umowy ani zmiany w kodzie.

Okno kontekstowe, a co faktycznie się w nim mieści

To jest sekcja, w której oba wyglądają najbardziej podobnie na karcie specyfikacji, a najmniej podobnie w praktyce.

• Okno kontekstowe — MiniMax M3 1,048,576 tokenów vs Muse Spark 1.2 1,048,576 tokenów

• Maksymalna moc wyjściowa — MiniMax M3 512 000 tokenów vs Muse Spark 1.2 131 072 tokenów

• Obsługiwane dane wejściowe — MiniMax M3: tekst, obraz i wideo vs Muse Spark 1.2: tekst, obraz, wideo, audio i PDF

• Powierzchnia wyjściowa — oba emitują wyłącznie tekst

• Parametry strukturalne — MiniMax M3 udostępnia tools i tool_choice; Muse Spark 1.2 udostępnia reasoning_effort i structured_outputs

Oba okna kontekstowe mają ten sam milion tokenów, więc pytanie „kto ma więcej kontekstu” nie ma zwycięzcy. Wiersz maksymalnej długości odpowiedzi jest tym, co je różni: odpowiedź MiniMax M3 może sięgać 512 000 tokenów, czyli około czterokrotnie więcej niż pułap Muse Spark 1.2 wynoszący 131 072. Jeśli Twoja praca polega na generowaniu długich tekstów — przepisaniu całego pliku, długim raporcie, danych wyjściowych w skali transkrypcji — ta różnica ma charakter strukturalny, a nie przyrostowy. Jeśli Twoja praca to krótkie odpowiedzi na długie dane wejściowe, ta różnica nie ma znaczenia.

Wiersz dotyczący danych wejściowych wypada tu na odwrót. Muse Spark 1.2 przyjmuje dźwięk i PDF bezpośrednio; udokumentowany zakres danych wejściowych MiniMax M3 kończy się na obrazie i wideo. Pipeline, który przetwarza nagrania rozmów lub zeskanowane dokumenty, ma do wykonania inną ilość przetwarzania wstępnego w przypadku każdego z tych dwóch.

Po stronie MiniMax twierdzenie dotyczące kontekstu zawiera uwagę architektoniczną, którą warto wyraźnie oznaczyć jako własną uwagę dostawcy. MiniMax przypisuje długokontekstowe zachowanie M3 mechanizmowi MSA (MiniMax Sparse Attention), który — jak opisuje nasz katalog — obsługuje do 1 mln tokenów kontekstu „z gwarantowanym minimum 512 tys.”. Sformułowanie o gwarantowanym minimum pochodzi od MiniMax; nie możemy wskazać niezależnego pomiaru, który by je potwierdzał, więc próg 512 tys. należy traktować jako twierdzenie dostawcy, a nie sprawdzoną wartość.

Opóźnienie i przepustowość na naszej własnej bramie

To są dane, do których możemy odnieść się najbardziej bezpośrednio, ponieważ są to nasze własne liczby. Obejmują siedem dni do 2026-09-23 i opisują ruch na naszej bramie, a nie benchmark dostawcy.

• p50 czasu do pierwszego tokenu — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s

• p95 czas do pierwszego tokenu — MiniMax M3 10,00 s vs Muse Spark 1.2 10,00 s

• Szybkość wyjściowa — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s

• Wskaźnik błędów — MiniMax M3 0,12% vs Muse Spark 1.2 0,15%

• Ruch, ostatnie 7 dni — MiniMax M3 153,8 mln tokenów vs Muse Spark 1.2 79,6 mln tokenów

Jeśli spojrzeć na to uczciwie, obraz jest podzielony. W przypadku czasu do pierwszego tokenu oba są blisko siebie — 4,28 wobec 4,82 sekundy przy medianie, a p95 jest identyczny co do setnej części sekundy i wynosi 10,00 sekundy, co jest artefaktem zaokrąglenia wynikającym z tego, że oba znajdują się blisko tego samego pułapu, a nie prawdziwym remisem. Jeśli chodzi o prędkość wyjściową, wcale nie są blisko siebie: Muse Spark 1.2 strumieniuje z szybkością około 1,75× większą niż MiniMax M3, co zmienia wrażenie, jakie długie generowanie sprawia użytkownikowi, który je obserwuje, nawet gdy całkowity koszt jest wyższy. Wskaźniki błędów różnią się między sobą jedynie w granicach błędu zaokrąglenia, a oba są niskie.

Wiersz ruchu warto odczytywać jako sygnał, a nie tablicę wyników: w ciągu tych samych siedmiu dni MiniMax M3 przepuścił przez naszą bramę około dwa razy więcej tokenów niż Muse Spark 1.2. To właśnie wybiera rynek, a nie to, co mówią benchmarki, i w tym zestawieniu te dwa się nie zgadzają.

Kierowanie ruchu do obu przez jeden punkt końcowy to także tani sposób, by sprawdzić, który z nich lepiej sprawdza się w Twoim obciążeniu, ponieważ przełączanie awaryjne sprawia, że degradacja po stronie dostawcy w którymkolwiek z modeli trafia na działającą ścieżkę zamiast kończyć się błędem.

Wywoływanie narzędzi i praca agentowa w długim horyzoncie

To tutaj oba są najbardziej rozbieżne pod względem zmierzonych wyników i tutaj zastrzeżenia mają największe znaczenie.

• Terminal-Bench v2.1 — MiniMax M3 52,4 kontra Muse Spark 1.2 80,1

• tau_banking (użycie narzędzi) — MiniMax M3 12,3 vs Muse Spark 1.2 34,8

• MCP Atlas — MiniMax M3 74,2 (zgłoszone przez producenta) vs Muse Spark 1.2 — nie zmierzono

• BrowseComp — MiniMax M3 83,5 (zgłoszone przez dostawcę) vs Muse Spark 1.2 — nie zmierzono

• OSWorld-Verified — MiniMax M3 70.0 (zgłoszone przez producenta) vs Muse Spark 1.2 – nie zmierzono

Pierwsze dwa wiersze pochodzą z panelu benchmarkowego na naszych własnych stronach katalogowych i są jedynymi wierszami agentowymi, które oba modele wypełniły. Nie są blisko siebie: Muse Spark 1.2 ponad dwukrotnie przewyższa MiniMax M3 w tau_banking i wyprzedza w Terminal-Bench v2.1 o prawie 28 punktów. Jeśli Twoje obciążenie to agent o długim horyzoncie z powierzchnią narzędzi, to największa pojedyncza różnica na tej stronie.

Kolejne trzy wiersze to własne wyniki MiniMax, opublikowane we wpisie o premierze. Nie są porównywalne z dwoma pierwszymi — inne harnessy, brak niezależnego audytu — ale to jedyne opublikowane liczby dla MiniMax M3 w tych zadaniach, więc ich pominięcie zaniżałoby obraz modelu. Odczytuj je jako dane raportowane przez dostawcę i nic więcej.

Jedna rozbieżność zasługuje na osobny akapit, ponieważ to właśnie taki rodzaj rzeczy, który strona porównawcza zwykle wygładza. W poście MiniMaxa zapowiadającym premierę Terminal-Bench 2.1 podano jako 66,0 dla M3, wewnątrz obrazu wykresu, bez towarzyszącej tabeli liczbowej. Niezależny wiersz Terminal-Bench v2.1 na naszej stronie katalogowej pokazuje 52,4 dla tego samego modelu. Nazwy zadań są wystarczająco podobne, że czytelnicy zetkną się z nimi obok siebie, a obie liczby różnią się o ponad 13 punktów. Nie zamierzamy ogłaszać, że jedna z nich jest błędna: prawdopodobne wyjaśnienie to inny harness lub inna konfiguracja uruchomienia, a uczciwym stwierdzeniem jest, że własna liczba dostawcy i liczba objęta audytem się nie zgadzają, przy czym liczba dostawcy jest wyższa.

Listy parametrów opowiadają mniejszą, bardziej praktyczną historię. MiniMax M3 udostępnia tools i tool_choice, więc wyborem narzędzia można sterować z poziomu żądania. Muse Spark 1.2 udostępnia reasoning_effort, więc zamiast tego można sterować głębokością rozumowania. Żaden z nich nie udostępnia pokrętła drugiego. Jeśli problemem sterowania w Twojej aplikacji jest „spraw, by wywoływała właściwą funkcję”, wskazuje to w jedną stronę; jeśli jest nim „spraw, by myślała dłużej nad trudnymi przypadkami”, wskazuje w drugą.

Programowanie

Programowanie to sztandarowe twierdzenie MiniMax M3 i obszar, w którym zmierzona luka jest dla niego najbardziej kłopotliwa.

• AA Coding Index — MiniMax M3 38,7 vs Muse Spark 1.2 72,2

• SciCode — MiniMax M3 43.1 vs Muse Spark 1.2 57.4

• SWE-Bench Pro — MiniMax M3 59,0 (zgłoszone przez dostawcę) vs Muse Spark 1.2 — nie zmierzono

• KernelBench Hard — MiniMax M3 28,8 (według dostawcy) vs Muse Spark 1.2 — nie zmierzono

Pozycjonowanie M3 przez MiniMax stawia kodowanie na pierwszym miejscu — nagłówek premiery umieszcza „Frontier Coding” przed kontekstem miliona tokenów i multimodalnością. Podawany przez MiniMax wynik SWE-Bench Pro na poziomie 59,0 to mocna liczba na harnessie producenta. Jednak w niezależnych wierszach Coding Index i SciCode, które wypełniły oba modele, Muse Spark 1.2 prowadzi z dużą przewagą, a różnica 33 punktów w Coding Index jest drugą co do wielkości na tej stronie, zaraz po tau_banking.

Nie ma uczciwego sposobu, aby na podstawie dostępnych dowodów przedstawić MiniMax M3 jako lepszy model do kodowania. Można powiedzieć, że własne wyniki producenta dotyczące kodowania są wysokie, a niezależne nie, w tym samym schemacie co wspomniana wyżej rozbieżność w Terminal-Bench. Każdy, czyja decyzja zależy od kodowania, powinien przykładać większą wagę do audytowanych wierszy niż do wykresów z wpisu premierowego i powinien testować na własnym repozytorium, a nie na jednym lub drugim.

Tam, gdzie są naprawdę blisko siebie

Trzy wiersze nie dają zwycięzcy, a przyznanie tego jest bardziej użyteczne niż sztuczne wyłonienie jednego.

• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, różnica 0,5 punktu, która w każdym praktycznym ujęciu jest remisem

• p95 czasu do pierwszego tokenu — w obu przypadkach 10,00 s w ciągu ostatnich siedmiu dni na naszej bramie

• Okno kontekstowe i modalność wyjściowa — identyczne przy 1,048,576 tokenach wejściowych i wyjściu tylko tekstowym

W rozumowaniu naukowym na poziomie magisterskim te dwa modele są praktycznie nie do odróżnienia i jest to jedyny wiersz rozumowania, w którym znacznie tańszy model MiniMax M3 dorównuje droższemu. Warto o tym pamiętać, czytając zagregowane wskaźniki: luka między tymi modelami nie jest jednolita w różnych obszarach możliwości — koncentruje się na pracy agentowej i programowaniu, a w przypadku pytań wielokrotnego wyboru wymagających dużej wiedzy jest w przybliżeniu zerowa.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Wybierz MiniMax M3, jeśli, wybierz Muse Spark 1.2, jeśli

Dwa fakty z akapitu otwierającego układają się różnie w zależności od tego, co budujesz, więc oto podział bez owijania w bawełnę.

• Wybierz MiniMax M3, jeśli koszt za token jest wiążącym ograniczeniem, jeśli potrzebujesz długich odpowiedzi powyżej 131 072 tokenów, jeśli potrzebujesz otwartych wag, jeśli chcesz wejście wideo bez osobnego pipeline'u albo jeśli chcesz wykonywać pracę wiedzową z dużym udziałem rozumowania za około jedną czwartą ceny wejściowej — GPQA Diamond to łeb w łeb i to jest ten wiersz, w którym tani model zasługuje na swoje miejsce.

• Wybierz Muse Spark 1.2, jeśli Twoim obciążeniem jest długohoryzontowy agent z narzędziami, jeśli potrzebujesz najwyższych audytowanych wyników kodowania, jeśli chcesz mieć jawną regulację reasoning_effort, jeśli musisz bezpośrednio przyjmować dane audio lub PDF albo jeśli potrzebujesz szybkiego wyjścia strumieniowego — 507 tok/s wobec 289 tok/s to widoczna różnica, a nie różnica z benchmarku.

• Jeśli jeszcze nie wiesz, który, rozstrzygający dowód nie znajduje się na tej stronie. Przetestuj oba modele na próbce własnego ruchu i zmierz wyniki; kalkulator cen na stronie każdego modelu w ciągu minuty pokaże Ci aspekt kosztowy, a siedmiodniowe dane o opóźnieniach powyżej są tym, co najbardziej przypomina podgląd aspektu wydajności.

Oba są dostępne przez jedno API bez narzutu ponad cenę katalogową dostawcy, więc test to zmiana identyfikatora modelu, a nie migracja, a automatyczne przełączanie awaryjne sprawia, że gorszy dzień u któregokolwiek z dostawców zamienia się w wolniejszą odpowiedź, a nie awarię.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie