Karta hero radaru modeli OrcaRouter dla Xiaomi MiMo-V2.6-Pro, zatytułowana nazwą modelu i wierszem „Otwarte wagi, 46 w indeksie, $0.43 / $0.87”, z dwoma panelami oznaczonymi „Co wydano” i „Ile to kosztuje”.
Guides & Insights

Xiaomi MiMo-V2.6-Pro na czele Open-Weights Index z wynikiem 46 — i publikuje rachunek za trening

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Xiaomi MiMo-V2.6-Pro jest teraz najwyżej sklasyfikowanym modelem z otwartymi wagami w Artificial Analysis Intelligence Index, z wynikiem 46 w wersji v4.3.2 — o jeden punkt przed GLM-5.3 i o dwa punkty przed Kimi K3, oraz o dwadzieścia punktów powyżej 26, które jego poprzednik MiMo-V2.5-Pro uzyskał wcześniejszej skali indeksu. Liczba ta została wygenerowana przez Artificial Analysis, który uruchomił własny system testowy, a nie przez Xiaomi, i jest to pojedynczy najbardziej użyteczny fakt w tym wydaniu. Drugim najbardziej użytecznym faktem jest cena podana obok: 0,43 USD za milion tokenów wejściowych, 0,87 USD za milion tokenów wyjściowych, w porównaniu z 5,00 USD i 25,00 USD dla Claude Opus 5 — modelu, który znajduje się o pięć punktów indeksu wyżej. Trzecim jest ten, którego nikt nie spodziewał się, że Xiaomi ujawni: publiczne rozliczenie tego, ile faktycznie kosztował przebieg uczenia ze wzmocnieniem, który wytworzył MiMo-V2.6-Pro.

Wynik to pomiar, a nie twierdzenie.

Prawie wszystko, co się publikuje o premierze chińskiego modelu, trafia do nas jako liczba od dostawcy, a czytelnicy nauczyli się ją dyskontować. Ta jest inna — a różnica ta zasługuje na precyzję, bo relacje z premiery już ją rozmyły.

Artificial Analysis ocenił sam MiMo-V2.6-Pro na kompozycie v4.3.2 — dziesięć ewaluacji obejmujących rozumowanie, wiedzę, matematykę i kodowanie, w tym AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. 46 to wynik, jaki zwrócił ten zestaw. Zarejestrowano również charakterystyki operacyjne, które decydują, czy model jest użyteczny, a nie tylko dobry: 134,3 tokenu wyjściowego na sekundę, 2,15 sekundy do pierwszego tokenu, 99% zniżki na pamięć podręczną i zmierzony koszt 0,13 USD za zadanie Intelligence Index.

Dwie z nich zasługują na podkreślenie. 134,3 tokena na sekundę stawia MiMo-V2.6-Pro na jedenastym miejscu spośród 114 modeli pod względem szybkości — w przypadku modelu typu mixture-of-experts o bilionie parametrów to wynik serwowania, a nie tylko trenowania. A 0,13 USD za zadanie to liczba, która przetrwa zderzenie z budżetem: to kwota, jaką faktycznie kosztowało uruchomienie indeksu na tym modelu, mierzona w ten sam sposób dla każdego modelu na liście, co czyni ją porównywalną w sposób, w jaki nagłówkowe stawki za token nie są.

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

Co obejmuje, a czego nie obejmuje indeks

Korona modeli open-weight jest prawdziwa, ale węższa, niż się wydaje. Z wynikiem 46 MiMo-V2.6-Pro przewodzi kategorii open-weight. Nie przewodzi jednak indeksowi. Czołówkę v4.3 tworzą Claude Fable 5.1 przy maksymalnym wysiłku z domyślnym fallbackiem oraz GPT-6 Astra przy maksymalnym wysiłku, oba z wynikiem 53, przy czym Claude Opus 5 ma 51, a Claude Fable 5 – 50. Uczciwe ujęcie to więc pięciopunktowa luka do czołówki w złożonym wskaźniku, który nagradza szerokość, oraz dwudziestopunktowa poprawa względem poprzedniej generacji samego Xiaomi.

• Lider open-weights — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44

• Czołówka tego samego indeksu — Claude Fable 5.1 (maks., zapasowy) 53, GPT-6 Astra (maks.) 53, Claude Opus 5 (maks.) 51

• Szybkość — 134,3 tokenów wyjściowych/s, jedenaste miejsce wśród 114 zmierzonych modeli; mediana dla tej klasy rozmiaru wynosi 77,9

• Czas do pierwszego tokenu — 2,15 sekundy wobec mediany wynoszącej 2,34 sekundy

• Koszt na zadanie Intelligence Index — 0,13 USD, przy czym cała ewaluacja kosztuje 206,66 USD

• Stawka katalogowa — 0,43 USD za milion tokenów wejściowych, 0,87 USD za milion tokenów wyjściowych, 99% zniżki na pamięć podręczną oraz łączna stawka 0,18 USD przy mieszance trafień w pamięć podręczną / danych wejściowych / danych wyjściowych wynoszącej 7:2:1

Jedna liczba na stronie Artificial Analysis jest prawdziwym zastrzeżeniem, a nie przechwałką: w momencie pisania uwzględniono tylko jednego dostawcę API dla MiMo-V2.6-Pro. To obecnie praktyczne wąskie gardło tego modelu i nie jest to problem jakości — to problem dostępności. Model dostępny tylko przez jedną trasę nie ma przełączania awaryjnego. Jeśli ta trasa ulegnie degradacji, Twoja aplikacja ulegnie degradacji wraz z nią, a router istnieje właśnie po to, by zapewnić przełączanie awaryjne. Istotna obserwacja dla każdego, kto planuje z myślą o tym wydaniu, jest taka, że nie hostujemy MiMo-V2.6-Pro i nie będziemy udawać, że jest inaczej; droga do niego wiedzie dziś przez własną platformę Xiaomi oraz garstkę katalogów firm trzecich, które go wymieniają.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

Dwie liczby, których nie wolno mieszać

Xiaomi opublikowało również własne wyniki benchmarków, a one są obiektem innego rodzaju niż 46. Panel firmy podaje, że MiMo-V2.6-Pro przesunął się z 58,4 na 72,57 w DeepSWE v1.1 w trakcie swojego przebiegu uczenia ze wzmocnieniem, ocenianego za pomocą mini-swe-agent przy średniej z trzech. To środowisko testowe Xiaomi, system oceniający Xiaomi, przebieg offline Xiaomi. Nie został zgłoszony do publicznej tabeli liderów DeepSWE i nie został przez nikogo odtworzony.

Przeczytaj oba obok siebie, a pojawia się pokusa, by potraktować 72,57 jako wynik na równi z 74%, które publiczna tablica DeepSWE umieszcza w najwyższym przedziale. Nie są one w tej samej skali. Wynik z rankingu to zgłoszona konfiguracja, Pass@1, z opublikowanym przedziałem ufności i średnim kosztem na zadanie; wynik dostawcy to ocena wewnętrzna, do której nie dołączono niczego z tych elementów. Nasze własne omówienie z 21 września podnosiło tę kwestię, gdy liczby były jeszcze odczytami z dashboardu, i pozostaje aktualne teraz, gdy wagi są już opublikowane. Narzędzie testowe dostawcy może być całkowicie uczciwe i nadal nie być wpisem w rankingu, ponieważ wpis w rankingu to twierdzenie o konkretnej konfiguracji w konkretnych warunkach, które strona trzecia może ponownie uruchomić.

Ta sama dyscyplina dotyczy wydatków na trening. Xiaomi podaje około 3 474 715 USD łącznie dla przebiegów Pro i Flash — 2 620 670 USD dla Pro, 854 044 USD dla Flash — przy czym każdy z nich obejmował ponad trzydzieści kroków uczenia ze wzmocnieniem i około 750 000 trajektorii, a ukończono je w mniej niż sześć dni. To własne dane Xiaomi dotyczące rozliczania mocy obliczeniowej. Są interesujące, ponieważ laboratoria prawie nigdy ich nie publikują, a nie są to ceny API, koszt, który poniesiesz, ani liczba poddana audytowi przez jakąkolwiek stronę trzecią.

Co Xiaomi faktycznie wypuściło

To wydanie to rzadki model mieszaniny ekspertów o łącznej liczbie 1,02 biliona parametrów, z 42 miliardami aktywowanymi na token, oknem kontekstowym o długości 1 mln tokenów oraz natywną multimodalnością w zakresie tekstu, obrazu, wideo i audio. Jego model siostrzany Xiaomi MiMo-V2.6-Flash ma tę samą architekturę w mniejszej skali: 309 miliardów łącznie i 15 miliardów aktywnych. Opublikowane wagi mają oznaczenie licencji MIT, a pakiet wydania obejmuje raport techniczny, instrukcje wdrożenia oraz — według Xiaomi — środowiska treningowe uczenia ze wzmocnieniem i kod potrzebny do zbadania i odtworzenia etapu post-training.

Ta ostatnia kwestia to zasadnicza różnica między tą premierą a typowym ogłoszeniem API i warto oddzielić ją od marketingu. Opublikowanie środowiska RL to twierdzenie, że konfigurację treningową można poddać badaniu. Czy opublikowane środowiska wystarczają do odtworzenia wyniku 72,57, to osobne pytanie, które rozstrzygną ludzie próbujący tego dokonać, a nie informacje o wydaniu. Własne notatki treningowe Xiaomi opisują przebieg, w którym w jednym przebiegu połączono zadania z zakresu kodowania, agentów ogólnych, zadań wizualnych i cyberbezpieczeństwa, z oceniającymi, którzy szeregują udane trajektorie i redystrybuują nagrodę w kierunku lepszych ścieżek — i odnotowują także awarie: restart GPU z powodu braku pamięci wywołany nierównowagą obciążenia ekspertów, awarię sieci między klastrem treningowym a wdrożeniem oceniającym oraz restart Flash po błędzie infrastruktury, który przez około trzy godziny pozostawał niewykryty. Opublikowanie awarii obok sukcesów jest tym, co czyni resztę ujawnienia wiarygodną.

Ile kosztuje połączenie i gdzie leży kwestia routingu

Przy 0,43 USD i 0,87 USD za milion tokenów MiMo-V2.6-Pro jest wyceniany jak model średniej klasy, a benchmarkowany jak czołowy model open-weights. Xiaomi utrzymało standardową cenę poprzedniej generacji MiMo-V2.5, zamiast podnosić cenę nowego checkpointu, dlatego stawka wygląda nisko względem liczby parametrów. 99% zniżki na cache oznacza, że intensywnie korzystająca z cache pętla agenta odczytuje swój kontekst praktycznie za darmo, i właśnie tam faktycznie kumuluje się rachunek agenta długoterminowego.

Istnieje wersja tej transakcji, która trasuje się czysto, i taka, która nie. Wersja, która się trasuje: modele frontier, z którymi porównywałbyś MiMo-V2.6-Pro — Claude Opus 5 za $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — są wszystkie osiągalne przez jeden klucz OrcaRouter w cenie katalogowej dostawcy z 0% marży, więc obniżka ceny przez dostawcę któregokolwiek z nich obowiązuje u nas tego samego dnia, a reguła routingu może skierować żądanie do drugiego modelu, gdy pierwszy jest wolny lub niedostępny. Ma to tu większe znaczenie niż zwykle, ponieważ model z najlepszym wynikiem wśród otwartych wag jest też tym, do którego droga jest najwęższa. Złożenie obu — taniej ścieżki otwartych wag do pracy masowej i ścieżki frontier dla trudnej końcówki — to decyzja routingowa, a to ten rodzaj decyzji, który przestaje być zakładem w momencie, gdy obie ścieżki są na tym samym kluczu.

Jeszcze jeden produkt, który warto rozróżnić, bo łatwo go pomylić z samym modelem: Xiaomi oferuje również MiMo-V2.6-Pro-UltraSpeed, hostowany poziom usługowy zbudowany z tego samego checkpointu. Materiały własne Xiaomi twierdzą, że przy tej samej jakości zapewnia on nawet dwudziestokrotnie wyższą prędkość generowania wyników niż standardowa usługa Pro; katalogi podmiotów trzecich podają około dziesięciokrotności. To dwie różne liczby opisujące ten sam poziom, nikt nie opublikował rozkładów opóźnień na żądanie, które by je uzgodniły, a ten poziom wiąże się z istotnie wyższą stawką. Nic w UltraSpeed nie zmienia tego, co potrafią wagi — zmienia się tylko to, jak szybko będą je wykonywać serwery kogoś innego.

Co zmieniłoby ten obraz

Trzy rzeczy, w kolejności od tego, jak bardzo by miały znaczenie.

Druga i trzecia ścieżka serwowania. Liczba modeli dostępnych tylko u jednego dostawcy w Artificial Analysis jest ograniczeniem dla całej reszty. Więcej ścieżek oznacza przełączanie awaryjne, konkurencję cenową na warstwie serwowania i możliwość wprowadzenia modelu do ścieżki produkcyjnej, a nie tylko eksperymentu.

Niezależne odtworzenie wyników DeepSWE. Wynik 46 jest już niezależny; 72,57 już nie. Jeśli przebiegi z zewnątrz wypadną blisko niego, argument za modelem znacznie się wzmocni. Jeśli wypadną istotnie poniżej, liczba Artificial Analysis pozostaje tą, której należy ufać, a liczba podana przez dostawcę dołącza do długiej listy zapewnień premierowych, które nie przetrwały kontaktu z rzeczywistością.

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

Rozbicie na poszczególne ewaluacje. Wynik złożony to tylko wynik złożony. To, w których z dziesięciu ewaluacji MiMo-V2.6-Pro wygrywa, a w których przegrywa, stanowi różnicę między modelem, który wdrażasz do kodowania agentowego, a modelem, który wdrażasz do odpowiadania na pytania wymagające dużego udziału wyszukiwania, a sam indeks ci tego nie powie. Ten szczegół jest tym, na co należy patrzeć dalej, i tym, czego potrzebuje konfiguracja routingu, zanim warto ją zapisać.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie