
MiMo-V2.6-Pro vs DeepSeek V4 Pro: Dwa otwarte flagowce dzieli dziesięć punktów indeksu
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro i DeepSeek V4 Pro to obiekty tego samego rodzaju — bilionowoparametrowe chińskie flagowce typu mixture-of-experts, na licencji MIT, z kontekstem 1 mln tokenów, otwartymi wagami, które możesz pobrać już dziś — a dzieli je dziesięć punktów w Artificial Analysis Intelligence Index v4.3.2, 46 przeciwko 36. Nie zgadzają się też co do tego, do czego służy flagowiec. DeepSeek V4 Pro, wydany 13 sierpnia 2026 r., to model rozumowania wyłącznie tekstowy: 1,6 biliona parametrów, z czego 49 miliardów aktywnych, a w jego publicznej specyfikacji nigdzie nie ma wejścia wizyjnego, audio ani wideo. Xiaomi MiMo-V2.6-Pro, wydany 21 września 2026 r., ma 1,02 biliona parametrów, z czego 42 miliardy aktywne, i przyjmuje tekst, obraz, wideo oraz dźwięk. Ta różnica rozstrzyga o większej liczbie wdrożeń niż te dziesięć punktów i to ją trzeba ustalić w pierwszej kolejności, zanim porówna się cokolwiek innego.
Ta sama licencja, różne maszyny
Zacznij od tego, co jest naprawdę identyczne, bo jest tego więcej, niż można by się spodziewać w przypadku dwóch konkurujących laboratoriów. Oba są udostępniane w publicznych repozytoriach z oznaczeniem licencji MIT, co oznacza komercyjne wdrożenie, modyfikację i dalsze trenowanie bez progu przychodowego ani klauzuli dotyczącej dziedziny zastosowania. Oba deklarują okno kontekstu o rozmiarze 1 mln tokenów. Oba są rzadkimi projektami mieszanin ekspertów — architektura stała się domyślnym rozwiązaniem w tej skali, a nie wyróżnikiem. I oba zostały wytrenowane przez laboratoria, które publikują mniej niż zachodnie czołowe laboratoria na temat metody.
• Parametry — MiMo-V2.6-Pro 1,02T łącznie / 42 mld aktywne; DeepSeek V4 Pro 1,6T łącznie / 49 mld aktywne
• Modalność wejściowa — MiMo-V2.6-Pro: tekst, obraz, wideo, audio; DeepSeek V4 Pro: tylko tekst
• Kontekst — 1 mln tokenów w obu; DeepSeek V4 Pro ogranicza wyjście do 384 tys. tokenów
• Wynik indeksu — MiMo-V2.6-Pro 46 w Intelligence Index v4.3.2; DeepSeek V4 Pro 36 w tej samej wersji
• Koszt za zadanie Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67
• Stawka katalogowa — MiMo-V2.6-Pro 0,43 / 0,87 USD za 1 mln tokenów; DeepSeek V4 Pro 1,32 / 3,96 USD według zestawienia Artificial Analysis, przed własnym harmonogramem DeepSeek w taryfach szczytowych i poza szczytowych
• Szybkość — MiMo-V2.6-Pro 134,3 tokenów wyjściowych na sekundę; DeepSeek V4 Pro 97,4
• Czas do pierwszego tokenu — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s
Przeczytaj tę listę dwa razy, bo dwa wiersze są kontrintuicyjne. Mniejszy model zdobywa o dziesięć punktów więcej — 42 miliardy aktywnych parametrów pokonujące 49 miliardów to nie różnica zaokrąglenia, to efekt po treningu i najwyraźniejszy sygnał w tym porównaniu, że jakość uczenia ze wzmocnieniem prześcignęła surową skalę jako dźwignię. A tańszy model jest także szybszy, zarówno pod względem przepustowości, jak i kosztu na zadanie, co jest odwrotnością zwykłego kompromisu. Xiaomi nie sprzedaje ci zniżki w zamian za cierpliwość. Przewaga DeepSeek to czas do pierwszego tokenu, 1,62 sekundy wobec 2,15 — realna, ale to jedyna kategoria, w której prowadzi V4 Pro.

Dlaczego ta sama wersja indeksu ma tutaj znaczenie
Porównywanie modeli z otwartymi wagami między kolejnymi wersjami indeksu to najczęstszy powód, dla którego większość publikowanych porównań jest błędna, więc numer wersji nie jest drobnym przypisem. Artificial Analysis przebudowało Intelligence Index do wersji v4.3 we wrześniu 2026 r. i wyniki znacząco się przesunęły w obrębie tej granicy — Claude Opus 5 stracił trzy punkty między v4.2 a v4.3, a stawka modeli z otwartymi wagami ułożyła się na nowo. Obie liczby powyżej pochodzą z wersji v4.3.2, co oznacza, że 46 i 36 są ze sobą bezpośrednio porównywalne. Nie są porównywalne ze starszymi liczbami, które znajdziesz w innych źródłach dla któregokolwiek z tych modeli.
To nie jest hipotetyczne. DeepSeek V4 Pro był powszechnie podawany z wynikiem 53 w skali wcześniejszego indeksu w sierpniu 2026 roku, a nasze własne relacje z tego okresu to zawierały. W wersji v4.3.2 ten sam model wskazuje 36. W samym modelu nic się nie zmieniło; zmieniła się linijka. Jeśli masz arkusz kalkulacyjny z 53 obok 46 dla MiMo-V2.6-Pro, masz porównanie, które wskaże ci niewłaściwy model. Prawidłowe zestawienie to 46 przeciw 36, a prawidłowy wniosek jest taki, że model wydany pięć tygodni później, przy dwóch trzecich liczby parametrów, ma znaczną przewagę.
Luka w raportowaniu między dwoma laboratoriami
Istnieje druga, subtelniejsza różnica i dotyczy ona tego, co każde laboratorium jest gotowe poddać sprawdzeniu.
Wynik 46 dla MiMo-V2.6-Pro to pomiar Artificial Analysis. Dom ewaluacyjny przeprowadził własny zestaw testów — dziesięć ewaluacji obejmujących rozumowanie, wiedzę, matematykę i kodowanie — na wydanym modelu i opublikował wynik wraz z liczbami operacyjnymi: 134,3 tokena na sekundę, 2,15 sekundy do pierwszego tokena, 99% zniżki na cache, 0,13 USD za zadanie indeksowe i całkowity koszt ewaluacji 206,66 USD. To liczba strony trzeciej dotycząca modelu Xiaomi.
Kluczowe wskaźniki agentowe DeepSeek V4 Pro pochodzą od samego DeepSeek, a różnica między nimi a tymi niezależnymi została udokumentowana. Materiały premierowe firmy podają Terminal-Bench 2.1 na poziomie 87,9, DeepSWE na 62,7, CyberGym na 83,3 i SWE-bench Verified na 80,6. W niezależnych uruchomieniach Terminal-Bench 2.1 wypada na 78,7 — około dziewięciu punktów poniżej wartości podanej przez producenta — a Artificial Analysis Coding Index na 68,8. Żadna z tych wartości producenta nie została odtworzona, a wielkość różnicy w Terminal-Bench jest powodem, by resztę zestawu traktować jako deklaracje, a nie pomiary.
Xiaomi ma własną wersję tego samego problemu. Jego dashboard raportuje, że MiMo-V2.6-Pro przechodzi z 58,4 na 72,57 w DeepSWE v1.1 w trakcie swojego przebiegu uczenia ze wzmocnieniem, oceniany na własnym harnessie Xiaomi z mini-swe-agent przy średniej z trzech. To nie jest zgłoszenie do rankingu i żaden zewnętrzny podmiot go nie powtórzył. Zatem żaden z modeli nie ma czystego świadectwa zdrowia w benchmarkach producenta. Różnica polega na tym, że MiMo-V2.6-Pro dysponuje również niezależnym wynikiem złożonym, którego premiera DeepSeek nie miała w równoważnym momencie — a jeśli wybierasz między nimi na podstawie dowodów, a nie marketingu, to właśnie ta asymetria powinna się liczyć.

Jak to wygląda na produkcji
Różnica w modalnościach to praktyczny punkt rozgałęzienia i rzadziej przemawia na korzyść DeepSeek, niż sugerowałaby dziesięciopunktowa różnica. Jeśli Twój potok przetwarza zrzuty ekranu, pliki PDF renderowane jako obrazy, klatki wideo lub dźwięk, MiMo-V2.6-Pro obsługuje to natywnie w jednym modelu, a DeepSeek V4 Pro nie obsługuje tego w ogóle — potrzebny byłby osobny model wizyjny z przodu, co oznacza drugi kontrakt, drugi tryb awarii i drugi rachunek. Jeśli Twoje obciążenie to wyłącznie rozumowanie tekstowe, dodatkowa modalność jest zbędnym balastem, za który nic nie płacisz.
Koszt na zadanie indeksowania to druga liczba, którą warto wziąć pod uwagę. 0,13 USD wobec 0,67 USD to pięciokrotna różnica w kontrolowanym, identycznym zestawie zadań, mierzona w ten sam sposób dla obu. DeepSeek stosuje harmonogram rozliczeń szczytowy/poza szczytowy, który może znacznie obniżyć jego efektywną stawkę w zależności od tego, kiedy wykonasz wywołanie, więc rzeczywisty stosunek maleje poza godzinami szczytu, a rośnie w szczycie — szczegół, który ma znaczenie, jeśli Twój ruch jest szarpany i nie możesz wybrać, kiedy nadejdzie.
I tu strona DeepSeeka ma prawdziwą przewagę, która nie ma nic wspólnego z samym modelem: jest na naszej platformie. DeepSeek V4 Pro jest dostępny jako deepseek/deepseek-v4-pro przez klucz OrcaRouter w cenie katalogowej dostawcy z 0% marży, z automatycznym przełączaniem awaryjnym między dostawcami i dostępnym dodatkowo DSL routingu — więc arytmetyka szczytów i poza szczytem, rozrzut między dostawcami i ścieżka awaryjna to wszystko rzeczy, które konfigurujesz, a nie takie, które budujesz. MiMo-V2.6-Pro nie ma na naszej platformie i powiemy to wprost: dotarcie do niego dzisiaj oznacza platformę samego Xiaomi albo jeden z katalogów firm trzecich, które go wymieniają, a Artificial Analysis w momencie rejestracji naliczyło dla niego jednego dostawcę API. Jedna ścieżka to nie ścieżka produkcyjna, co jest najsilniejszym argumentem za tym, by traktować MiMo-V2.6-Pro jako model do oceny teraz i do ostrożnego kierowania do niego ruchu, z czymś innym w odwodzie.
Który i kiedy
Wybierz DeepSeek V4 Pro, jeśli Twoja praca obejmuje wyłącznie tekst, jeśli potrzebujesz pułapu wyjściowego 384K, jeśli chcesz najszybszy czas do pierwszego tokenu z tych dwóch, albo jeśli już korzystasz z naszej platformy i chcesz ścieżkę open-weights o bilionie parametrów, z przełączaniem awaryjnym i bez nowej integracji. To obecny lider nie bez powodu, a te pięć tygodni starszeństwa oznacza pięć tygodni narzędzi, kwantyzacji i receptur wdrożeniowych, których model z września jeszcze nie zgromadził.
Wybierz MiMo-V2.6-Pro, jeśli zadanie jest multimodalne, jeśli koszt na zadanie dominuje w Twojej ekonomii jednostkowej, jeśli przepustowość liczy się bardziej niż pół sekundy opóźnienia albo jeśli chcesz obecnego lidera wśród modeli z otwartymi wagami w niezależnie mierzonym indeksie. Licencja MIT w obu przypadkach oznacza, że kwestia wag jest rozstrzygnięta tak czy inaczej — możesz uruchomić każdy z nich na własnym sprzęcie, dostroić go i wprowadzić go na rynek komercyjnie.
Konfiguracja, którą warto rozważyć, wcale nie jest wyborem. Router pozwala zachować ścieżkę DeepSeek do rozumowania wyłącznie tekstowego w stawkach poza szczytem i dodać ścieżkę MiMo do żądań multimodalnych, z fallbackiem przed węższą trasą. To nie jest zabezpieczanie się; to dopasowanie każdego żądania do modelu, który faktycznie je obsługuje, co jest tańszą i trwalszą odpowiedzią niż wybór zwycięzcy i nadzieja, że obciążenie nigdy nie zmieni kształtu.

Pytanie, na które to porównanie jeszcze nie może odpowiedzieć
Najczęściej cytowane benchmarki obu modeli są przeprowadzane przez dostawców i nie zostały odtworzone. W przypadku DeepSeek V4 Pro ta luka pozostaje otwarta od sierpnia i sprawia, że jego niezależne wyniki wypadają niżej niż dane z premiery. W przypadku MiMo-V2.6-Pro niezależny wynik zbiorczy istnieje, ale rozbicia na zadania agentowe już nie — Artificial Analysis publikuje 46, a nie kryjący się pod nim rozrzut wyników poszczególnych ewaluacji, który to szczegół mówi, czy model należy do pętli agentowej, czy do potoku odpowiadania na pytania.
Dopóki ten rozrzut nie zostanie opublikowany i dopóki ktoś nie uruchomi ponownie środowiska testowego DeepSWE firmy Xiaomi, możliwe do obrony stanowisko jest węższe niż marketing któregokolwiek z laboratoriów: MiMo-V2.6-Pro przoduje w niezależnym wskaźniku złożonym i w zmierzonym koszcie na zadanie, DeepSeek V4 Pro przoduje pod względem dojrzałości, długości odpowiedzi, opóźnienia pierwszego tokenu i osiągalności przez trasę, za którą stoi redundancja. Pięć tygodni to krótka przewaga startowa i jedyna, jaką ma DeepSeek.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
