
Xiaomi MiMo-V2.6-Pro na czele Open-Weights Index z wynikiem 46 — i publikuje rachunek za trening
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro jest teraz najwyżej sklasyfikowanym modelem z otwartymi wagami w Artificial Analysis Intelligence Index, z wynikiem 46 w wersji v4.3.2 — o jeden punkt przed GLM-5.3 i o dwa punkty przed Kimi K3, oraz o dwadzieścia punktów powyżej 26, które jego poprzednik MiMo-V2.5-Pro uzyskał wcześniejszej skali indeksu. Liczba ta została wygenerowana przez Artificial Analysis, który uruchomił własny system testowy, a nie przez Xiaomi, i jest to pojedynczy najbardziej użyteczny fakt w tym wydaniu. Drugim najbardziej użytecznym faktem jest cena podana obok: 0,43 USD za milion tokenów wejściowych, 0,87 USD za milion tokenów wyjściowych, w porównaniu z 5,00 USD i 25,00 USD dla Claude Opus 5 — modelu, który znajduje się o pięć punktów indeksu wyżej. Trzecim jest ten, którego nikt nie spodziewał się, że Xiaomi ujawni: publiczne rozliczenie tego, ile faktycznie kosztował przebieg uczenia ze wzmocnieniem, który wytworzył MiMo-V2.6-Pro.
Wynik to pomiar, a nie twierdzenie.
Prawie wszystko, co się publikuje o premierze chińskiego modelu, trafia do nas jako liczba od dostawcy, a czytelnicy nauczyli się ją dyskontować. Ta jest inna — a różnica ta zasługuje na precyzję, bo relacje z premiery już ją rozmyły.
Artificial Analysis ocenił sam MiMo-V2.6-Pro na kompozycie v4.3.2 — dziesięć ewaluacji obejmujących rozumowanie, wiedzę, matematykę i kodowanie, w tym AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. 46 to wynik, jaki zwrócił ten zestaw. Zarejestrowano również charakterystyki operacyjne, które decydują, czy model jest użyteczny, a nie tylko dobry: 134,3 tokenu wyjściowego na sekundę, 2,15 sekundy do pierwszego tokenu, 99% zniżki na pamięć podręczną i zmierzony koszt 0,13 USD za zadanie Intelligence Index.
Dwie z nich zasługują na podkreślenie. 134,3 tokena na sekundę stawia MiMo-V2.6-Pro na jedenastym miejscu spośród 114 modeli pod względem szybkości — w przypadku modelu typu mixture-of-experts o bilionie parametrów to wynik serwowania, a nie tylko trenowania. A 0,13 USD za zadanie to liczba, która przetrwa zderzenie z budżetem: to kwota, jaką faktycznie kosztowało uruchomienie indeksu na tym modelu, mierzona w ten sam sposób dla każdego modelu na liście, co czyni ją porównywalną w sposób, w jaki nagłówkowe stawki za token nie są.

Co obejmuje, a czego nie obejmuje indeks
Korona modeli open-weight jest prawdziwa, ale węższa, niż się wydaje. Z wynikiem 46 MiMo-V2.6-Pro przewodzi kategorii open-weight. Nie przewodzi jednak indeksowi. Czołówkę v4.3 tworzą Claude Fable 5.1 przy maksymalnym wysiłku z domyślnym fallbackiem oraz GPT-6 Astra przy maksymalnym wysiłku, oba z wynikiem 53, przy czym Claude Opus 5 ma 51, a Claude Fable 5 – 50. Uczciwe ujęcie to więc pięciopunktowa luka do czołówki w złożonym wskaźniku, który nagradza szerokość, oraz dwudziestopunktowa poprawa względem poprzedniej generacji samego Xiaomi.
• Lider open-weights — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• Czołówka tego samego indeksu — Claude Fable 5.1 (maks., zapasowy) 53, GPT-6 Astra (maks.) 53, Claude Opus 5 (maks.) 51
• Szybkość — 134,3 tokenów wyjściowych/s, jedenaste miejsce wśród 114 zmierzonych modeli; mediana dla tej klasy rozmiaru wynosi 77,9
• Czas do pierwszego tokenu — 2,15 sekundy wobec mediany wynoszącej 2,34 sekundy
• Koszt na zadanie Intelligence Index — 0,13 USD, przy czym cała ewaluacja kosztuje 206,66 USD
• Stawka katalogowa — 0,43 USD za milion tokenów wejściowych, 0,87 USD za milion tokenów wyjściowych, 99% zniżki na pamięć podręczną oraz łączna stawka 0,18 USD przy mieszance trafień w pamięć podręczną / danych wejściowych / danych wyjściowych wynoszącej 7:2:1
Jedna liczba na stronie Artificial Analysis jest prawdziwym zastrzeżeniem, a nie przechwałką: w momencie pisania uwzględniono tylko jednego dostawcę API dla MiMo-V2.6-Pro. To obecnie praktyczne wąskie gardło tego modelu i nie jest to problem jakości — to problem dostępności. Model dostępny tylko przez jedną trasę nie ma przełączania awaryjnego. Jeśli ta trasa ulegnie degradacji, Twoja aplikacja ulegnie degradacji wraz z nią, a router istnieje właśnie po to, by zapewnić przełączanie awaryjne. Istotna obserwacja dla każdego, kto planuje z myślą o tym wydaniu, jest taka, że nie hostujemy MiMo-V2.6-Pro i nie będziemy udawać, że jest inaczej; droga do niego wiedzie dziś przez własną platformę Xiaomi oraz garstkę katalogów firm trzecich, które go wymieniają.

Dwie liczby, których nie wolno mieszać
Xiaomi opublikowało również własne wyniki benchmarków, a one są obiektem innego rodzaju niż 46. Panel firmy podaje, że MiMo-V2.6-Pro przesunął się z 58,4 na 72,57 w DeepSWE v1.1 w trakcie swojego przebiegu uczenia ze wzmocnieniem, ocenianego za pomocą mini-swe-agent przy średniej z trzech. To środowisko testowe Xiaomi, system oceniający Xiaomi, przebieg offline Xiaomi. Nie został zgłoszony do publicznej tabeli liderów DeepSWE i nie został przez nikogo odtworzony.
Przeczytaj oba obok siebie, a pojawia się pokusa, by potraktować 72,57 jako wynik na równi z 74%, które publiczna tablica DeepSWE umieszcza w najwyższym przedziale. Nie są one w tej samej skali. Wynik z rankingu to zgłoszona konfiguracja, Pass@1, z opublikowanym przedziałem ufności i średnim kosztem na zadanie; wynik dostawcy to ocena wewnętrzna, do której nie dołączono niczego z tych elementów. Nasze własne omówienie z 21 września podnosiło tę kwestię, gdy liczby były jeszcze odczytami z dashboardu, i pozostaje aktualne teraz, gdy wagi są już opublikowane. Narzędzie testowe dostawcy może być całkowicie uczciwe i nadal nie być wpisem w rankingu, ponieważ wpis w rankingu to twierdzenie o konkretnej konfiguracji w konkretnych warunkach, które strona trzecia może ponownie uruchomić.
Ta sama dyscyplina dotyczy wydatków na trening. Xiaomi podaje około 3 474 715 USD łącznie dla przebiegów Pro i Flash — 2 620 670 USD dla Pro, 854 044 USD dla Flash — przy czym każdy z nich obejmował ponad trzydzieści kroków uczenia ze wzmocnieniem i około 750 000 trajektorii, a ukończono je w mniej niż sześć dni. To własne dane Xiaomi dotyczące rozliczania mocy obliczeniowej. Są interesujące, ponieważ laboratoria prawie nigdy ich nie publikują, a nie są to ceny API, koszt, który poniesiesz, ani liczba poddana audytowi przez jakąkolwiek stronę trzecią.
Co Xiaomi faktycznie wypuściło
To wydanie to rzadki model mieszaniny ekspertów o łącznej liczbie 1,02 biliona parametrów, z 42 miliardami aktywowanymi na token, oknem kontekstowym o długości 1 mln tokenów oraz natywną multimodalnością w zakresie tekstu, obrazu, wideo i audio. Jego model siostrzany Xiaomi MiMo-V2.6-Flash ma tę samą architekturę w mniejszej skali: 309 miliardów łącznie i 15 miliardów aktywnych. Opublikowane wagi mają oznaczenie licencji MIT, a pakiet wydania obejmuje raport techniczny, instrukcje wdrożenia oraz — według Xiaomi — środowiska treningowe uczenia ze wzmocnieniem i kod potrzebny do zbadania i odtworzenia etapu post-training.
Ta ostatnia kwestia to zasadnicza różnica między tą premierą a typowym ogłoszeniem API i warto oddzielić ją od marketingu. Opublikowanie środowiska RL to twierdzenie, że konfigurację treningową można poddać badaniu. Czy opublikowane środowiska wystarczają do odtworzenia wyniku 72,57, to osobne pytanie, które rozstrzygną ludzie próbujący tego dokonać, a nie informacje o wydaniu. Własne notatki treningowe Xiaomi opisują przebieg, w którym w jednym przebiegu połączono zadania z zakresu kodowania, agentów ogólnych, zadań wizualnych i cyberbezpieczeństwa, z oceniającymi, którzy szeregują udane trajektorie i redystrybuują nagrodę w kierunku lepszych ścieżek — i odnotowują także awarie: restart GPU z powodu braku pamięci wywołany nierównowagą obciążenia ekspertów, awarię sieci między klastrem treningowym a wdrożeniem oceniającym oraz restart Flash po błędzie infrastruktury, który przez około trzy godziny pozostawał niewykryty. Opublikowanie awarii obok sukcesów jest tym, co czyni resztę ujawnienia wiarygodną.
Ile kosztuje połączenie i gdzie leży kwestia routingu
Przy 0,43 USD i 0,87 USD za milion tokenów MiMo-V2.6-Pro jest wyceniany jak model średniej klasy, a benchmarkowany jak czołowy model open-weights. Xiaomi utrzymało standardową cenę poprzedniej generacji MiMo-V2.5, zamiast podnosić cenę nowego checkpointu, dlatego stawka wygląda nisko względem liczby parametrów. 99% zniżki na cache oznacza, że intensywnie korzystająca z cache pętla agenta odczytuje swój kontekst praktycznie za darmo, i właśnie tam faktycznie kumuluje się rachunek agenta długoterminowego.
Istnieje wersja tej transakcji, która trasuje się czysto, i taka, która nie. Wersja, która się trasuje: modele frontier, z którymi porównywałbyś MiMo-V2.6-Pro — Claude Opus 5 za $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — są wszystkie osiągalne przez jeden klucz OrcaRouter w cenie katalogowej dostawcy z 0% marży, więc obniżka ceny przez dostawcę któregokolwiek z nich obowiązuje u nas tego samego dnia, a reguła routingu może skierować żądanie do drugiego modelu, gdy pierwszy jest wolny lub niedostępny. Ma to tu większe znaczenie niż zwykle, ponieważ model z najlepszym wynikiem wśród otwartych wag jest też tym, do którego droga jest najwęższa. Złożenie obu — taniej ścieżki otwartych wag do pracy masowej i ścieżki frontier dla trudnej końcówki — to decyzja routingowa, a to ten rodzaj decyzji, który przestaje być zakładem w momencie, gdy obie ścieżki są na tym samym kluczu.
Jeszcze jeden produkt, który warto rozróżnić, bo łatwo go pomylić z samym modelem: Xiaomi oferuje również MiMo-V2.6-Pro-UltraSpeed, hostowany poziom usługowy zbudowany z tego samego checkpointu. Materiały własne Xiaomi twierdzą, że przy tej samej jakości zapewnia on nawet dwudziestokrotnie wyższą prędkość generowania wyników niż standardowa usługa Pro; katalogi podmiotów trzecich podają około dziesięciokrotności. To dwie różne liczby opisujące ten sam poziom, nikt nie opublikował rozkładów opóźnień na żądanie, które by je uzgodniły, a ten poziom wiąże się z istotnie wyższą stawką. Nic w UltraSpeed nie zmienia tego, co potrafią wagi — zmienia się tylko to, jak szybko będą je wykonywać serwery kogoś innego.
Co zmieniłoby ten obraz
Trzy rzeczy, w kolejności od tego, jak bardzo by miały znaczenie.
Druga i trzecia ścieżka serwowania. Liczba modeli dostępnych tylko u jednego dostawcy w Artificial Analysis jest ograniczeniem dla całej reszty. Więcej ścieżek oznacza przełączanie awaryjne, konkurencję cenową na warstwie serwowania i możliwość wprowadzenia modelu do ścieżki produkcyjnej, a nie tylko eksperymentu.
Niezależne odtworzenie wyników DeepSWE. Wynik 46 jest już niezależny; 72,57 już nie. Jeśli przebiegi z zewnątrz wypadną blisko niego, argument za modelem znacznie się wzmocni. Jeśli wypadną istotnie poniżej, liczba Artificial Analysis pozostaje tą, której należy ufać, a liczba podana przez dostawcę dołącza do długiej listy zapewnień premierowych, które nie przetrwały kontaktu z rzeczywistością.

Rozbicie na poszczególne ewaluacje. Wynik złożony to tylko wynik złożony. To, w których z dziesięciu ewaluacji MiMo-V2.6-Pro wygrywa, a w których przegrywa, stanowi różnicę między modelem, który wdrażasz do kodowania agentowego, a modelem, który wdrażasz do odpowiadania na pytania wymagające dużego udziału wyszukiwania, a sam indeks ci tego nie powie. Ten szczegół jest tym, na co należy patrzeć dalej, i tym, czego potrzebuje konfiguracja routingu, zanim warto ją zapisać.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
