Karta hero radaru modeli OrcaRouter dla porównania między MiMo-V2.6-Pro i DeepSeek V4 Pro, z podtytułem „Dwa otwarte flagowce, dziesięć punktów indeksu różnicy.”, z jednym panelem na model i stopką informującą, że oba są na licencji MIT z oknem kontekstowym 1 mln tokenów oraz że wyniki to v4.3.2 i nie są porównywalne z wcześniejszymi wersjami indeksu.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: Dwa otwarte flagowce dzieli dziesięć punktów indeksu

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Xiaomi MiMo-V2.6-Pro i DeepSeek V4 Pro to obiekty tego samego rodzaju — bilionowoparametrowe chińskie flagowce typu mixture-of-experts, na licencji MIT, z kontekstem 1 mln tokenów, otwartymi wagami, które możesz pobrać już dziś — a dzieli je dziesięć punktów w Artificial Analysis Intelligence Index v4.3.2, 46 przeciwko 36. Nie zgadzają się też co do tego, do czego służy flagowiec. DeepSeek V4 Pro, wydany 13 sierpnia 2026 r., to model rozumowania wyłącznie tekstowy: 1,6 biliona parametrów, z czego 49 miliardów aktywnych, a w jego publicznej specyfikacji nigdzie nie ma wejścia wizyjnego, audio ani wideo. Xiaomi MiMo-V2.6-Pro, wydany 21 września 2026 r., ma 1,02 biliona parametrów, z czego 42 miliardy aktywne, i przyjmuje tekst, obraz, wideo oraz dźwięk. Ta różnica rozstrzyga o większej liczbie wdrożeń niż te dziesięć punktów i to ją trzeba ustalić w pierwszej kolejności, zanim porówna się cokolwiek innego.

Ta sama licencja, różne maszyny

Zacznij od tego, co jest naprawdę identyczne, bo jest tego więcej, niż można by się spodziewać w przypadku dwóch konkurujących laboratoriów. Oba są udostępniane w publicznych repozytoriach z oznaczeniem licencji MIT, co oznacza komercyjne wdrożenie, modyfikację i dalsze trenowanie bez progu przychodowego ani klauzuli dotyczącej dziedziny zastosowania. Oba deklarują okno kontekstu o rozmiarze 1 mln tokenów. Oba są rzadkimi projektami mieszanin ekspertów — architektura stała się domyślnym rozwiązaniem w tej skali, a nie wyróżnikiem. I oba zostały wytrenowane przez laboratoria, które publikują mniej niż zachodnie czołowe laboratoria na temat metody.

• Parametry — MiMo-V2.6-Pro 1,02T łącznie / 42 mld aktywne; DeepSeek V4 Pro 1,6T łącznie / 49 mld aktywne

• Modalność wejściowa — MiMo-V2.6-Pro: tekst, obraz, wideo, audio; DeepSeek V4 Pro: tylko tekst

• Kontekst — 1 mln tokenów w obu; DeepSeek V4 Pro ogranicza wyjście do 384 tys. tokenów

• Wynik indeksu — MiMo-V2.6-Pro 46 w Intelligence Index v4.3.2; DeepSeek V4 Pro 36 w tej samej wersji

• Koszt za zadanie Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Stawka katalogowa — MiMo-V2.6-Pro 0,43 / 0,87 USD za 1 mln tokenów; DeepSeek V4 Pro 1,32 / 3,96 USD według zestawienia Artificial Analysis, przed własnym harmonogramem DeepSeek w taryfach szczytowych i poza szczytowych

• Szybkość — MiMo-V2.6-Pro 134,3 tokenów wyjściowych na sekundę; DeepSeek V4 Pro 97,4

• Czas do pierwszego tokenu — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Przeczytaj tę listę dwa razy, bo dwa wiersze są kontrintuicyjne. Mniejszy model zdobywa o dziesięć punktów więcej — 42 miliardy aktywnych parametrów pokonujące 49 miliardów to nie różnica zaokrąglenia, to efekt po treningu i najwyraźniejszy sygnał w tym porównaniu, że jakość uczenia ze wzmocnieniem prześcignęła surową skalę jako dźwignię. A tańszy model jest także szybszy, zarówno pod względem przepustowości, jak i kosztu na zadanie, co jest odwrotnością zwykłego kompromisu. Xiaomi nie sprzedaje ci zniżki w zamian za cierpliwość. Przewaga DeepSeek to czas do pierwszego tokenu, 1,62 sekundy wobec 2,15 — realna, ale to jedyna kategoria, w której prowadzi V4 Pro.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Dlaczego ta sama wersja indeksu ma tutaj znaczenie

Porównywanie modeli z otwartymi wagami między kolejnymi wersjami indeksu to najczęstszy powód, dla którego większość publikowanych porównań jest błędna, więc numer wersji nie jest drobnym przypisem. Artificial Analysis przebudowało Intelligence Index do wersji v4.3 we wrześniu 2026 r. i wyniki znacząco się przesunęły w obrębie tej granicy — Claude Opus 5 stracił trzy punkty między v4.2 a v4.3, a stawka modeli z otwartymi wagami ułożyła się na nowo. Obie liczby powyżej pochodzą z wersji v4.3.2, co oznacza, że 46 i 36 są ze sobą bezpośrednio porównywalne. Nie są porównywalne ze starszymi liczbami, które znajdziesz w innych źródłach dla któregokolwiek z tych modeli.

To nie jest hipotetyczne. DeepSeek V4 Pro był powszechnie podawany z wynikiem 53 w skali wcześniejszego indeksu w sierpniu 2026 roku, a nasze własne relacje z tego okresu to zawierały. W wersji v4.3.2 ten sam model wskazuje 36. W samym modelu nic się nie zmieniło; zmieniła się linijka. Jeśli masz arkusz kalkulacyjny z 53 obok 46 dla MiMo-V2.6-Pro, masz porównanie, które wskaże ci niewłaściwy model. Prawidłowe zestawienie to 46 przeciw 36, a prawidłowy wniosek jest taki, że model wydany pięć tygodni później, przy dwóch trzecich liczby parametrów, ma znaczną przewagę.

Luka w raportowaniu między dwoma laboratoriami

Istnieje druga, subtelniejsza różnica i dotyczy ona tego, co każde laboratorium jest gotowe poddać sprawdzeniu.

Wynik 46 dla MiMo-V2.6-Pro to pomiar Artificial Analysis. Dom ewaluacyjny przeprowadził własny zestaw testów — dziesięć ewaluacji obejmujących rozumowanie, wiedzę, matematykę i kodowanie — na wydanym modelu i opublikował wynik wraz z liczbami operacyjnymi: 134,3 tokena na sekundę, 2,15 sekundy do pierwszego tokena, 99% zniżki na cache, 0,13 USD za zadanie indeksowe i całkowity koszt ewaluacji 206,66 USD. To liczba strony trzeciej dotycząca modelu Xiaomi.

Kluczowe wskaźniki agentowe DeepSeek V4 Pro pochodzą od samego DeepSeek, a różnica między nimi a tymi niezależnymi została udokumentowana. Materiały premierowe firmy podają Terminal-Bench 2.1 na poziomie 87,9, DeepSWE na 62,7, CyberGym na 83,3 i SWE-bench Verified na 80,6. W niezależnych uruchomieniach Terminal-Bench 2.1 wypada na 78,7 — około dziewięciu punktów poniżej wartości podanej przez producenta — a Artificial Analysis Coding Index na 68,8. Żadna z tych wartości producenta nie została odtworzona, a wielkość różnicy w Terminal-Bench jest powodem, by resztę zestawu traktować jako deklaracje, a nie pomiary.

Xiaomi ma własną wersję tego samego problemu. Jego dashboard raportuje, że MiMo-V2.6-Pro przechodzi z 58,4 na 72,57 w DeepSWE v1.1 w trakcie swojego przebiegu uczenia ze wzmocnieniem, oceniany na własnym harnessie Xiaomi z mini-swe-agent przy średniej z trzech. To nie jest zgłoszenie do rankingu i żaden zewnętrzny podmiot go nie powtórzył. Zatem żaden z modeli nie ma czystego świadectwa zdrowia w benchmarkach producenta. Różnica polega na tym, że MiMo-V2.6-Pro dysponuje również niezależnym wynikiem złożonym, którego premiera DeepSeek nie miała w równoważnym momencie — a jeśli wybierasz między nimi na podstawie dowodów, a nie marketingu, to właśnie ta asymetria powinna się liczyć.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Jak to wygląda na produkcji

Różnica w modalnościach to praktyczny punkt rozgałęzienia i rzadziej przemawia na korzyść DeepSeek, niż sugerowałaby dziesięciopunktowa różnica. Jeśli Twój potok przetwarza zrzuty ekranu, pliki PDF renderowane jako obrazy, klatki wideo lub dźwięk, MiMo-V2.6-Pro obsługuje to natywnie w jednym modelu, a DeepSeek V4 Pro nie obsługuje tego w ogóle — potrzebny byłby osobny model wizyjny z przodu, co oznacza drugi kontrakt, drugi tryb awarii i drugi rachunek. Jeśli Twoje obciążenie to wyłącznie rozumowanie tekstowe, dodatkowa modalność jest zbędnym balastem, za który nic nie płacisz.

Koszt na zadanie indeksowania to druga liczba, którą warto wziąć pod uwagę. 0,13 USD wobec 0,67 USD to pięciokrotna różnica w kontrolowanym, identycznym zestawie zadań, mierzona w ten sam sposób dla obu. DeepSeek stosuje harmonogram rozliczeń szczytowy/poza szczytowy, który może znacznie obniżyć jego efektywną stawkę w zależności od tego, kiedy wykonasz wywołanie, więc rzeczywisty stosunek maleje poza godzinami szczytu, a rośnie w szczycie — szczegół, który ma znaczenie, jeśli Twój ruch jest szarpany i nie możesz wybrać, kiedy nadejdzie.

I tu strona DeepSeeka ma prawdziwą przewagę, która nie ma nic wspólnego z samym modelem: jest na naszej platformie. DeepSeek V4 Pro jest dostępny jako deepseek/deepseek-v4-pro przez klucz OrcaRouter w cenie katalogowej dostawcy z 0% marży, z automatycznym przełączaniem awaryjnym między dostawcami i dostępnym dodatkowo DSL routingu — więc arytmetyka szczytów i poza szczytem, rozrzut między dostawcami i ścieżka awaryjna to wszystko rzeczy, które konfigurujesz, a nie takie, które budujesz. MiMo-V2.6-Pro nie ma na naszej platformie i powiemy to wprost: dotarcie do niego dzisiaj oznacza platformę samego Xiaomi albo jeden z katalogów firm trzecich, które go wymieniają, a Artificial Analysis w momencie rejestracji naliczyło dla niego jednego dostawcę API. Jedna ścieżka to nie ścieżka produkcyjna, co jest najsilniejszym argumentem za tym, by traktować MiMo-V2.6-Pro jako model do oceny teraz i do ostrożnego kierowania do niego ruchu, z czymś innym w odwodzie.

Który i kiedy

Wybierz DeepSeek V4 Pro, jeśli Twoja praca obejmuje wyłącznie tekst, jeśli potrzebujesz pułapu wyjściowego 384K, jeśli chcesz najszybszy czas do pierwszego tokenu z tych dwóch, albo jeśli już korzystasz z naszej platformy i chcesz ścieżkę open-weights o bilionie parametrów, z przełączaniem awaryjnym i bez nowej integracji. To obecny lider nie bez powodu, a te pięć tygodni starszeństwa oznacza pięć tygodni narzędzi, kwantyzacji i receptur wdrożeniowych, których model z września jeszcze nie zgromadził.

Wybierz MiMo-V2.6-Pro, jeśli zadanie jest multimodalne, jeśli koszt na zadanie dominuje w Twojej ekonomii jednostkowej, jeśli przepustowość liczy się bardziej niż pół sekundy opóźnienia albo jeśli chcesz obecnego lidera wśród modeli z otwartymi wagami w niezależnie mierzonym indeksie. Licencja MIT w obu przypadkach oznacza, że kwestia wag jest rozstrzygnięta tak czy inaczej — możesz uruchomić każdy z nich na własnym sprzęcie, dostroić go i wprowadzić go na rynek komercyjnie.

Konfiguracja, którą warto rozważyć, wcale nie jest wyborem. Router pozwala zachować ścieżkę DeepSeek do rozumowania wyłącznie tekstowego w stawkach poza szczytem i dodać ścieżkę MiMo do żądań multimodalnych, z fallbackiem przed węższą trasą. To nie jest zabezpieczanie się; to dopasowanie każdego żądania do modelu, który faktycznie je obsługuje, co jest tańszą i trwalszą odpowiedzią niż wybór zwycięzcy i nadzieja, że obciążenie nigdy nie zmieni kształtu.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

Pytanie, na które to porównanie jeszcze nie może odpowiedzieć

Najczęściej cytowane benchmarki obu modeli są przeprowadzane przez dostawców i nie zostały odtworzone. W przypadku DeepSeek V4 Pro ta luka pozostaje otwarta od sierpnia i sprawia, że jego niezależne wyniki wypadają niżej niż dane z premiery. W przypadku MiMo-V2.6-Pro niezależny wynik zbiorczy istnieje, ale rozbicia na zadania agentowe już nie — Artificial Analysis publikuje 46, a nie kryjący się pod nim rozrzut wyników poszczególnych ewaluacji, który to szczegół mówi, czy model należy do pętli agentowej, czy do potoku odpowiadania na pytania.

Dopóki ten rozrzut nie zostanie opublikowany i dopóki ktoś nie uruchomi ponownie środowiska testowego DeepSWE firmy Xiaomi, możliwe do obrony stanowisko jest węższe niż marketing któregokolwiek z laboratoriów: MiMo-V2.6-Pro przoduje w niezależnym wskaźniku złożonym i w zmierzonym koszcie na zadanie, DeepSeek V4 Pro przoduje pod względem dojrzałości, długości odpowiedzi, opóźnienia pierwszego tokenu i osiągalności przez trasę, za którą stoi redundancja. Pięć tygodni to krótka przewaga startowa i jedyna, jaką ma DeepSeek.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie