Wygenerowana karta hero zatytułowana „GPT-6.1 Sol vs MiniMax M3" z dwoma zaokrąglonymi panelami: po lewej „GPT-6.1 Sol" z pozycjami „OpenAI – wydany 29 września 2026", „2,00 USD za wejście / 10,00 USD za wyjście za 1 mln", „AA Index 51,8" i „0,72 USD za zadanie"; po prawej „MiniMax M3" z pozycjami „MiniMax – wydany 31 maja 2026", „0,30 USD za wejście / 1,20 USD za wyjście za 1 mln", „AA Index 29,2" i „0,51 USD za zadanie"; między nimi wiersz „Tańsza karta, mniejszy rachunek – różnica 22,6 punktu indeksu"; stopka „Dane: Artificial Analysis v4.3.2." oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6.1 Sol kontra MiniMax M3: Ukryta dotacja tokenowa: Jak długi kontekst po cichu na nowo wycenia Twojego agenta

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniMax M3 żąda ułamka tego, czego GPT-6.1 Sol żąda — 0,30 USD za milion tokenów wejściowych wobec 2,00 USD, 1,20 USD za milion tokenów wyjściowych wobec 10,00 USD — a według miernika, który faktycznie działa, jest tańszy: 0,508 USD za zadanie wobec 0,724 USD w ewaluacji Artificial Analysis v4.3.2. To prawdziwe zwycięstwo i zarazem całość argumentu, ponieważ ten sam pomiar, który daje M3 niższy rachunek, daje GPT-6.1 Sol przewagę 22,6 punktu w indeksie, a zestaw benchmarków, który mierzy, czy model potrafi ukończyć pracę agentową, a nie ją opisać, zamienia tę różnicę w mur. Dostawca wydał GPT-6.1 Sol 29 września 2026 r. Firma wydała M3, swój model o otwartych wagach z 428 miliardami parametrów, 31 maja 2026 r.

Oba są już uruchomione, oba mają ustaloną cenę i od obu dzieli jedno wywołanie API. To, co następuje, to arytmetyka, która rozstrzyga między nimi, oraz dwa miejsca, w których arytmetyka nie mówi całej prawdy.

Czym tak naprawdę jest każdy model

GPT-6.1 Sol to obecny flagowy model OpenAI do rozumowania i inżynierii oprogramowania — model zamknięty, wydany zaledwie tydzień po zastępowanym przez siebie GPT-6 Sol i sprzedawany w tej samej cenie katalogowej $2.00 / $10.00 co jego poprzednik. Ma stawkę $0.10 za wejście z pamięci podręcznej, czyli o połowę niższą niż ta, którą GPT-6 Sol pobierał za trafienia w pamięć podręczną, i to właśnie ten model OpenAI wskazuje, gdy mówi o kodowaniu agentowym, a nie o czacie.

MiniMax M3 to model typu mieszanina ekspertów o łącznej liczbie 428 miliardów parametrów i 23 miliardach aktywnych na token, opublikowany na licencji MiniMax Community License — wydanie z otwartymi wagami na niestandardowej licencji o niekomercyjnym charakterze, a niezatwierdzonej przez OSI. Jest obsługiwany przez szerokie grono dostawców inferencji: Artificial Analysis odnotowuje piętnaście hostów dla M3 w porównaniu z ośmioma dla GPT-6.1 Sol. Ta różnorodność to praktyczna zaleta otwartych wag i zarazem powód, dla którego konkurencja cenowa wokół M3 postępowała szybciej niż wokół modelu zamkniętego.

Cennik i licznik, który go unieważnia

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Zestaw dwie opublikowane karty stawek i nie ma nawet porównania.

• Wejście — GPT-6.1 Sol 2,00 USD za 1 mln vs MiniMax M3 0,30 USD za 1 mln; M3 jest tańszy o 85%
• Wyjście — 10,00 USD za 1 mln vs 1,20 USD za 1 mln; M3 jest tańszy o 88%
• Buforowane wejście — 0,10 USD za 1 mln vs 0,06 USD za 1 mln
• Koszt na zadanie AA — 0,724 USD vs 0,508 USD; M3 jest tańszy o 30%, a nie o 85%
• Tokeny wyjściowe na zadanie — 38 128 vs 48 192; M3 pisze o 26% więcej
• Czas na zadanie — 640 s vs 486 s
• Okno kontekstu — 1 050 000 vs 1 048 576 tokenów; praktycznie bez różnicy
• Maksymalne wyjście — 128 000 tokenów vs 512 000; M3 napisze jedną bardzo długą odpowiedź
• Akceptowane dane wejściowe — tekst, obraz i plik vs tekst, obraz i wideo
• Pozycja w indeksie — GPT-6.1 Sol 10. z 147 modeli vs MiniMax M3 62.

Dwie tanie pozycje na górze to te, które widzi arkusz zakupowy. Trzecia pozycja jest tą, która płaci rachunek, i mówi, że przewaga 85–88% w cenniku staje się 30-procentową przewagą w rzeczywistości, ponieważ M3 emituje więcej tokenów na zadanie i ponieważ zadanie nie jest stałą ilością pracy. Cenniki wyceniają tokeny; praca jest wyceniana w zadaniach. Każde porównanie, które zatrzymuje się na pierwszych dwóch pozycjach, porównuje niewłaściwe liczby, w niewłaściwej jednostce.

Gdzie trzydzieści procent przestaje mieć znaczenie

Koszt zadania jest na tyle zbliżony, że o wszystkim poza tekstem masowym decyduje różnica w indeksie. Artificial Analysis plasuje GPT-6.1 Sol na 51,83, a MiniMax M3 na 29,22 — rozpiętość 22,6 punktu, która nie rozkłada się równomiernie w całym zestawie. W ewaluacjach wymagających od modelu obsługi terminala, edycji repozytorium i weryfikacji własnej pracy te dwa modele nie należą do tej samej kategorii:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ-b — nie opublikowano dla GPT-6.1 Sol w tym przebiegu vs 0.8889 dla M3
• GPQA Diamond — nie opublikowano dla GPT-6.1 Sol w tym przebiegu vs 0.9293 dla M3
• CritPT — 0.3171 0.0371

Przeczytaj to uważnie, bo to nie jest całkowite zwycięstwo, a najciekawsze są wyjątki. MiniMax M3 uzyskuje 0,8889 w τ²-bench, ewaluacji użycia narzędzi i dialogów obsługi klienta, oraz 0,9293 w GPQA Diamond — wynik z zakresu nauk ścisłych na poziomie magisterskim, który bije każdy wynik OpenAI opublikowany w tym konkretnym przebiegu. M3 to kompetentny model rozumujący i sprawny użytkownik narzędzi w rozmowie. W Terminal-Bench 4.0 uzyskuje 0,0202. To nie jest „gorzej”; to model, który kompletnie nie potrafi utrzymać spójności wieloetapowego zadania w repozytorium, a żadna zniżka na tokeny nie sprawi, że zadanie, które modelowi się nie udaje, będzie tańsze niż zadanie, które model kończy.

Istnieje koszt drugiego rzędu, który ukrywa wskaźnik na zadanie. M3 odnotowuje 48 192 tokeny wyjściowe na zadanie i czas do pierwszej odpowiedzi wynoszący 23,0 sekundy w porównaniu z 332,0 sekundami GPT-6.1 Sol — mały model zaczyna mówić niemal natychmiast, a potem długo rozumuje. Jeśli Twoje obciążenie jest wrażliwe na opóźnienia, ale płytkie, to punkt na korzyść M3. Jeśli jest agentowe, płacisz za liczbę tokenów, a otrzymujesz wynik końcowy.

Nasza własna karta modelu dla GPT-6.1 Sol zawiera te same liczby w formie, na podstawie której faktycznie kierowałbyś ruch: stawkę $2.00 / $10.00, okno kontekstowe obejmujące 1 050 000 tokenów, p50 czasu do pierwszego tokenu wynoszący 4,54 sekundy oraz indeks Artificial Analysis i blok benchmarków znajdujące się na tej samej stronie.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Ile tu są warte otwarte wagi

Najsilniejszym argumentem za M3 jest to, że można go pobrać, i warto sprecyzować, co to daje. Daje to warunki licencyjne pozwalające uruchomić model w obrębie własnej infrastruktury — przydatne, gdy dane nie mogą jej opuścić — oraz konkurencję cenową wynikającą z piętnastu niezależnych dostawców. Nie zapewnia jednak taniego wdrożenia: 428 miliardów parametrów przy 23 miliardach aktywnych parametrów wciąż wymaga poważnego sprzętu do wnioskowania, a MiniMax Community License to niestandardowa licencja obwarowana warunkami, a nie licencja bez ograniczeń. Dla większości zespołów „otwarte wagi” oznaczają lepszą cenę za hostowaną inferencję, a nie sprzęt w szafie rack.

Karta OrcaRouter dla MiniMax M3 to miejsce, w którym znajdują się prezentowane liczby: stawka 0,30 USD / 1,20 USD, okno kontekstu 1 048 576 tokenów, maksymalna liczba tokenów wyjściowych 512 000, wejście tekstowe/obrazowe/wideo oraz siedmiodniowy wolumen 56,4 mln tokenów u dostawców kierujących do niego ruch.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Oba za jednym klawiszem

Praktyczny powód, dla którego to porównanie jest zmianą konfiguracji, a nie migracją, jest taki, że oba modele są osiągalne z jednego punktu końcowego OrcaRouter — jednego API dla ponad 200 modeli, z ceną katalogową dostawcy przekazywaną przy 0% marży, co oznacza, że zmiana stawki MiniMax trafia na Twój rachunek tego samego dnia, w którym dostawca ją publikuje, a nie wtedy, gdy odsprzedawca ponownie wynegocjuje warunki. Ma to większe znaczenie w przypadku M3 niż w przypadku jego rywala: cały sens kierowania ruchu do modelu o otwartych wagach polega na tym, że jego cena i lista hostów się zmieniają, a licznik przekazujący koszty to jedyny rodzaj, który śledzi ruchomy cel.

Automatyczne przełączanie awaryjne to druga połowa. M3 jest obsługiwany przez wielu dostawców o różnej niezawodności, a warstwa routingu może przenieść żądanie do innego hosta, gdy jeden z nich zacznie działać gorzej, bez wiedzy wywołującego, na którym hoście wylądowało. To uczciwy sposób na przyjęcie modelu, którego wynik w Terminal-Bench mówi „nie na ścieżkę krytyczną” — umieść go tam, gdzie ponowna próba jest tania.

Który, jeśli musisz wybrać dzisiaj?

Jeśli zadanie polega na masowym przetwarzaniu tekstu — ekstrakcji, streszczaniu, klasyfikacji, dialogu, czymkolwiek, gdzie wynikiem jest proza, a trybem awarii błędne zdanie, a nie zepsuty build — MiniMax M3 jest właściwym domyślnym wyborem, a te trzydzieści procent to prawdziwe pieniądze. Wykorzystaj liczby GPQA i τ²-bench jako dowód: to zdolny model, który przypadkiem jest tani.

Jeśli praca ma charakter agentowy — repozytoria, terminale, łańcuchy narzędzi, cokolwiek z krokiem weryfikacji — to 0,0202 w Terminal-Bench 4.0 dyskwalifikuje, a GPT-6.1 Sol z wynikiem 0,5606 za 0,724 USD na zadanie jest korzystniejszą ofertą, nawet przy 85% wyższym koszcie za token. Cennik nigdy nie był tym, co kupowałeś.

Praktyczna odpowiedź jest taka, że nie musisz wybierać raz na zawsze. Skieruj płytką warstwę do M3, skieruj warstwę agentową do GPT-6.1 Sol i trzymaj obie za jednym poświadczeniem — DSL routingu łączy te dwie w jedno wywołanie, gdy zadanie zaczyna się jako ekstrakcja, a zamienia się w zadanie naprawcze.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie