
MiMo-V2.6-Pro kontra Grok 4.6: Obaj dostawcy opublikowali wyniki DeepSWE, a żaden z nich nie znajduje się na tablicy wyników
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Two vendors, one benchmark, two numbers that cannot be subtracted. SpaceXAI's launch material for Grok 4.6 reports 65.9% on DeepSWE v1.1. Xiaomi's material for MiMo-V2.6-Pro reports 72.57 on DeepSWE v1.1. Read together they suggest the cheaper open-weights model beats the proprietary frontier one by nearly seven points. Read carefully they say almost nothing, because one is a launch-deck percentage on the vendor's own harness and the other is an average-of-three from a reinforcement-learning run on Xiaomi's own grader, and neither has been submitted to the public DeepSWE board. The comparison between MiMo-V2.6-Pro and Grok 4.6 that survives scrutiny is on the independent index, and there the answer is the reverse of the vendor numbers: 46 against 44, in Xiaomi's favour, by two points.
Grok 4.6 został wydany 12 sierpnia 2026 roku przez SpaceXAI i jest tu obecnym graczem — dostarczonym, szeroko udostępnianym modelem frontier z udokumentowanym cennikiem i miesiącami niezależnych pomiarów za sobą. Xiaomi MiMo-V2.6-Pro stał się powszechnie dostępny 22 września 2026 roku, a jego repozytoria checkpointów uczenia ze wzmocnieniem pojawiły się dzień wcześniej — to nowicjusz. Oba potrafią rozumować, oba powstały z myślą o długotrwałej pracy agentowej, a różnica cen między nimi jest tak duża, że jedynym, co hamuje to porównanie, jest brak doświadczenia nowicjusza.
Czym tak naprawdę jest każdy model
Grok 4.6 jest zastrzeżony, przyjmuje dane wejściowe w postaci tekstu i obrazów, a zwraca tekst, oraz ma datę odcięcia wiedzy na 1 lutego 2026. Jego okno kontekstowe wynosi 500 000 tokenów, co stanowi połowę rozmiaru okien głównych konkurentów i jest najważniejszą specyfikacją w jego karcie. Jego ceny katalogowe wynoszą 2,00 USD za milion tokenów wejściowych, 0,50 USD za milion buforowanych tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych poniżej 200 000 tokenów podpowiedzi, z progiem na tej granicy: przy 200K lub powyżej stawki wynoszą 4,00 USD, 1,00 USD i 12,00 USD, a wyższy próg rozlicza całe żądanie, a nie tylko część powyżej granicy. Przetwarzanie priorytetowe podwaja standardową stawkę. Artificial Analysis zmierzyło 63,0 tokenów wyjściowych na sekundę i 42,79 sekundy do pierwszego tokenu przy maksymalnym wysiłku, oraz 2 351,83 USD za uruchomienie pełnego indeksu.
Xiaomi MiMo-V2.6-Pro to rzadki model typu mixture-of-experts o łącznej liczbie 1,02 biliona parametrów i 42 miliardach aktywowanych na token, z oknem kontekstowym 1 mln tokenów i natywną multimodalnością obejmującą tekst, obraz, wideo i dźwięk. Jest objęty licencją MIT, z wagami możliwymi do pobrania, a Xiaomi utrzymało ceny z poprzedniej generacji, zamiast podnosić ceny nowego checkpointu — 0,43 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych, 99% zniżki na pamięć podręczną oraz łączny koszt 0,18 USD przy mieszance 7:2:1 trafień w pamięć podręczną / danych wejściowych / danych wyjściowych. Artificial Analysis zmierzyło 134,3 tokenów wyjściowych na sekundę, 2,15 sekundy do pierwszego tokena i 206,66 USD na uruchomienie indeksu — 0,13 USD na zadanie.
• Wagi — MiMo-V2.6-Pro na licencji MIT i do pobrania; Grok 4.6 zastrzeżony, tylko przez API
• Parametry — MiMo-V2.6-Pro łącznie 1,02T / 42B aktywnych; Grok 4.6 nieujawnione
• Kontekst — MiMo-V2.6-Pro 1 mln tokenów; Grok 4.6 500 tys., z progiem cenowym przy 200 tys. danych wejściowych
• Modalność — MiMo-V2.6-Pro obsługuje tekst, obraz, wideo i audio; opublikowany zakres danych wejściowych Grok 4.6 to tekst i obraz.
• Wynik indeksu — MiMo-V2.6-Pro 46; Grok 4.6 44, oba według Artificial Analysis v4.3.2
• Cena katalogowa — MiMo-V2.6-Pro 0,43 USD / 0,87 USD za 1 mln; Grok 4.6 2,00 USD / 6,00 USD, podwaja się powyżej 200 tys. tokenów wejściowych
• Stawka mieszana — MiMo-V2.6-Pro 0,18 USD za 1 mln; Grok 4.6 1,35 USD
• Koszt uruchomienia indeksu — MiMo-V2.6-Pro 206,66 USD; Grok 4.6 2351,83 USD
• Szybkość — MiMo-V2.6-Pro 134,3 tokenów wyjściowych na sekundę; Grok 4.6 63,0
• Czas do pierwszego tokenu — MiMo-V2.6-Pro 2,15 sekundy; Grok 4.6 42,79 sekundy
• Data odcięcia wiedzy — MiMo-V2.6-Pro nieopublikowany; Grok 4.6 1 lutego 2026

Test porównawczy, który przeprowadzili obaj dostawcy, i dlaczego nie da się go porównać
DeepSWE v1.1 to prawdziwa, publiczna, niezależna ewaluacja agentów kodujących prowadzona przez Datacurve i jest to ta jedna rodzina zadań, względem której obie firmy zdecydowały się publikować wyniki. To czyni ją kuszącą. Nie należy jej używać do bezpośredniego porównania, a powodem nie jest to, że którykolwiek z dostawców kłamie — chodzi o to, że te dwie liczby opisują różne pomiary tej samej nazwy zadania.
Wynik 72,57 Xiaomi to średnia z trzech przebiegów na własnym harnessie z mini-swe-agent, uzyskana podczas treningu uczenia ze wzmocnieniem, a nie z zamrożonego kandydata do wydania, i podana obok wyjściowej wartości 58,4. Przebieg udokumentowano jako 30 kroków i około 750 000 trajektorii na model, ukończony w niecałe sześć dni przy publikowanym koszcie około 2,62 mln dolarów dla modelu Pro. Nie został zgłoszony do tablicy Datacurve. Wynik 65,9% SpaceXAI dla Grok 4.6 to liczba z prezentacji premierowej, pochodząca z własnego zbioru ewaluacyjnego dostawcy, podana obok przewagi nad Grok 4.5 wynoszącej 11,9 punktu w tym samym benchmarku — a publiczna tablica zawiera zgłoszoną konfigurację Grok 4.6 na poziomie około 67%, co jest wystarczająco bliskie liczbie dostawcy, by sugerować, że harness jest przynajmniej z grubsza zgodny. Nie dotyczy to jednak wyniku Xiaomi, który nie ma żadnego publicznego odpowiednika.
Więc szczere stwierdzenie jest takie: na publicznej tablicy Grok 4.6 jest obecny, a MiMo-V2.6-Pro jest nieobecny. W niezależnym zestawieniu zbiorczym oba zostały faktycznie poddane ocenie przez tego samego ewaluatora, a model Xiaomi prowadzi o dwa punkty. Te dwa fakty nie stoją ze sobą w sprzeczności. Mierzą po prostu różne rzeczy, a to drugie jest tym, które należy cytować.
Kontekst 500K to specyfikacja, która decyduje o rzeczywistych obciążeniach
Pół miliona tokenów to duże okno kontekstowe według wszelkich normalnych standardów, a jak na 2026 rok — małe. Modele, z którymi zestawia się MiMo-V2.6-Pro, wszystkie mają 1 mln, a praktyczna konsekwencja uwidacznia się dokładnie w tych obciążeniach, dla których reklamowany jest Grok 4.6. Długotrwale działający agent kodujący, utrzymujący repozytorium, zapis narzędzi i narastający plan, przekroczy w sesji 200 000 tokenów promptu — a na tym progu stawki Grok 4.6 podwajają się i mają zastosowanie wstecz do całego żądania. Ta sama sesja na MiMo-V2.6-Pro dochodzi do miliona tokenów bez zmiany poziomu.
To jednocześnie różnica w specyfikacji i różnica w strukturze cen, a tę drugą łatwo przeoczyć przy porównywaniu stawek katalogowych. Uśredniona stawka 1,35 USD za Grok 4.6 w zestawieniu z 0,18 USD za MiMo-V2.6-Pro to 7,5-krotna różnica. Przy prompcie przekraczającym 200K rośnie ona do blisko 15-krotności, ponieważ stawka dla Groka podwaja się, a stawka Xiaomi pozostaje bez zmian.
Kontrargument również został odnotowany i należy mu się to. Tezą startową Grok 4.6 była efektywność tur, a nie surowy kontekst: w ocenie agentowej, w której porównywano go z Claude Opus 5 na identycznych zadaniach, ukończył je w około 53 turach i przy około 500 milionach tokenów wejściowych, podczas gdy drugi model potrzebował około 103 tur i dwóch miliardów tokenów, przy szacowanym koszcie 0,84 USD na zadanie — najniższym wyniku wśród modeli frontierowych w tym porównaniu. Model, który przechodzi pętlę o połowę mniej razy, nie potrzebuje tak dużego kontekstu i nie spala tak wielu tokenów. To autentyczna przewaga architektoniczna i najsilniejszy argument za Grok 4.6 przeciwko każdej tańszej alternatywie rozliczanej za token, w tym tej.

Docieranie do każdego z nich
Grok 4.6 jest dostępny w OrcaRouter jako grok/grok-4.6, osiągalny przez jeden endpoint zgodny z OpenAI po cenie katalogowej dostawcy z 0% narzutu — zatem zmiana ceny SpaceXAI, w tym zmiana tego progu 200K, obowiązuje u nas tego samego dnia. Xiaomi MiMo-V2.6-Pro nie jest dostępny w OrcaRouter. Żaden model Xiaomi nie jest dostępny, a droga do niego prowadzi dziś przez własną platformę Xiaomi albo jeden z katalogów firm trzecich, które go wymieniają. Mówienie tego wprost jest bardziej użyteczne niż pozwalanie, by strona modelu sugerowała, że jest inaczej.
To, ile ta asymetria jest warta w praktyce, jest tanim eksperymentem. Grok 4.6 to model, za który możesz już płacić. MiMo-V2.6-Pro to poprawa o dwa punkty w indeksie przy ułamku stawki, wydany w tym tygodniu, z jedną trasą obsługi za sobą. Pytanie, na które warto odpowiedzieć, nie brzmi, który jest lepszy w teorii, ale jak dużą część Twojego ruchu z Grok model Xiaomi może przejąć na Twoich własnych promptach — a odpowiadanie na nie przez otwieranie drugiej umowy, drugiego klucza i drugiej relacji rozliczeniowej to tarcie, które powstrzymuje ten test przed odbyciem się. Przy jednym punkcie końcowym i automatycznym przełączaniu awaryjnym między dostawcami porównanie sprowadza się do zmiany konfiguracji, a część dotycząca przełączania awaryjnego ma tu większe znaczenie niż zwykle: model, który pojawił się w tym tygodniu i był wymieniony przez jednego dostawcę API, gdy Artificial Analysis go odnotowało, nie jest czymś, co należy umieszczać na ścieżce produkcyjnej bez ścieżki zapasowej.

Po który sięgnąć?
Wybierz Grok 4.6, gdy optymalizujesz efektywność tur — długie pętle agentowe, w których zdolność modelu do ukończenia zadania w połowie kroków jest warta więcej niż jego stawka za token — albo gdy chcesz model z miesiącami niezależnych pomiarów za sobą, a nie z tygodniem. Jego 63 tokeny na sekundę i 42,79 sekundy do pierwszego tokenu czynią go modelem do obciążeń wsadowych i offline w kategoriach interakcyjnych, a kontekst 500K z progiem cenowym przy 200K przemawia za utrzymywaniem krótkich promptów.
Wybierz MiMo-V2.6-Pro, gdy uruchamiasz powtarzalne pętle o dużym zapotrzebowaniu na kontekst, które przekroczyłyby limit 200K Groka, gdy potrzebujesz opóźnienia pierwszego tokenu wystarczająco niskiego, by człowiek był w stanie poczekać, gdy chcesz mieć wagi we własnej infrastrukturze, albo gdy wolumen sprawia, że 7,5-krotna różnica w mieszanej stawce staje się decydującą liczbą. Jego dwupunktowa przewaga w indeksie jest na tyle mała, że nie powinna być powodem sama w sobie; koszt 206,66 USD wobec 2351,83 USD za uruchomienie tego samego zestawu ewaluacyjnego jest lepszym powodem.
Otwartą kwestię rozstrzygnęłaby przesłana konfiguracja DeepSWE dla MiMo-V2.6-Pro. Grok 4.6 już ją ma. Gdy tylko model Xiaomi pojawi się na publicznej tablicy wyników z podanym harnessem, przedziałem ufności i kosztem na zadanie, 72,57 przestaje być liczbą dostawcy, a powyższe porównanie staje się rzeczywiste — a przy dwupunktowej różnicy w indeksie może pójść w jedną albo drugą stronę.
OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny przez dostawcę jest widoczna tego samego dnia.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
