
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: Jeden checkpoint, dziesięciokrotnie wyższa cena
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed i Xiaomi MiMo-V2.6-Pro to nie dwa modele. To jeden model sprzedawany na dwa sposoby. Oba są obsługiwane z tego samego checkpointu MiMo-V2.6 o bilionie parametrów, który Xiaomi opublikowało we wrześniu 2026 r. — poziom Pro serii Xiaomi MiMo-V2.6, którego mniejszym odpowiednikiem jest Xiaomi MiMo-V2.6-Flash. Różnica między dwiema ofertami Pro polega wyłącznie na tym, jak szybko generowane są tokeny i ile się za nie płaci. Poziom standardowy kosztuje 0,435 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych. Poziom UltraSpeed kosztuje 4,35 USD i 8,70 USD. To czysty stosunek dziesięć do jednego po obu stronach licznika i kupuje obietnicę około dziesięciokrotnie większej szybkości generowania — obietnicę, którą Xiaomi składa na temat własnego stosu obsługi, i taką, dla której żaden niezależny benchmark nie opublikował jeszcze liczby.
Zatem interesujące pytanie nie brzmi: który model jest lepszy. Brzmi ono: czy dziesięciokrotny mnożnik to właściwa cena za dziesięciokrotnie większą szybkość — i okazuje się, że ma to precedens, który warto przeczytać, zanim zdecydujesz się oprzeć na tym ścieżkę produkcyjną.
Szybka warstwa to decyzja o obsłudze, a nie decyzja o modelu
Według samego Xiaomi linia UltraSpeed dorównuje jakością standardowemu modelowi, a różni się tylko przepustowością. To ma większe znaczenie, niż się wydaje, bo usuwa typowy powód do wahania przed nowym poziomem. Nie zakładasz, że inny checkpoint będzie miał inną osobowość, inny sposób odmawiania albo inne dziwactwa formatowania. Zakładasz, że te same wagi, uruchomione w bardziej agresywnej konfiguracji serwowania, będą zachowywać się tak samo na twoich promptach. Jeśli to się potwierdzi, przełączanie między tymi dwoma poziomami to zmiana konfiguracji, a nie migracja.
To, co zawiera ta konfiguracja serwowania, nie zostało udokumentowane dla tej generacji. Poprzedni poziom UltraSpeed, zbudowany na punkcie kontrolnym MiMo-V2.5-Pro w czerwcu 2026 r., został opisany przez Xiaomi jako wykorzystujący kwantyzację FP4 wyłącznie w warstwach ekspertów, blokowo-równoległy schemat dekodowania spekulatywnego o nazwie DFlash oraz środowisko wykonawcze o nazwie TileRT, i działał na pojedynczym węźle z ośmioma GPU. Xiaomi nie opublikowało równoważnych szczegółów dla poziomu V2.6. Wcześniejszy stos należy traktować jako kontekst tego, w jaki sposób uzyskuje się tę szybkość, a nie jako opis tego, co działa obecnie.
Rodzina, w której się znajduje, jest krótka. Obok dwóch wariantów Pro jest MiMo-V2.6-Flash, mniejszy brat o 309 miliardach parametrów całkowitych i 15 miliardach aktywnych. Pro to flagowy model typu sparse mixture-of-experts: Artificial Analysis podaje, że ma 1,0 biliona parametrów całkowitych przy 42 miliardach aktywnych na token, okno kontekstu o długości 1 miliona tokenów oraz licencję MIT i wagi na Hugging Face. Te liczby warto zapamiętać, ponieważ całe porównanie się na nich opiera.
Co jest faktycznie zweryfikowane, a co nie

Asymetria między dwiema kolumnami powyżej jest najważniejszą rzeczą w tym artykule. Niemal wszystko, co da się zmierzyć w przypadku tego zestawienia, zostało zmierzone po wolnej stronie.
Artificial Analysis przeprowadziło benchmark MiMo-V2.6-Pro i podaje dla niego Intelligence Index na poziomie 46 — najwyższy wynik w klasie 114 modeli, do której zalicza ten model. Mierzy 134,3 tokena wyjściowego na sekundę przez API Xiaomi, wobec mediany klasowej 77,9, oraz czas do pierwszego fragmentu 2,15 sekundy wobec mediany 2,34. Podaje koszt zadania Intelligence Index na 0,13 USD, 99% zniżki na cache w cenie wejściowej oraz objętość wyjścia na poziomie 140 milionów tokenów. To niezależne liczby dla nazwanej konfiguracji i jedyna twarda kotwica przepustowości, jaką ma to porównanie.
Dla UltraSpeed zweryfikowana lista jest znacznie krótsza:
• Szybkość wyjściowa — około dziesięć razy większa niż w standardowym poziomie, podana przez Xiaomi i powtórzona przez platformy, które ją wymieniają. Żadna strona trzecia nie opublikowała pomiaru tokenów na sekundę dla tego konkretnego poziomu.
• Cena — 4,35 USD za milion tokenów wejściowych i 8,70 USD za milion tokenów wyjściowych, co stanowi dziesięciokrotność standardowego poziomu w obu przypadkach. Obok tych dwóch stawek nie podano poziomu pamięci podręcznej.
• Jakość — „odpowiada oryginałowi”, znowu twierdzenie dostawcy. Nie opublikowano żadnej niezależnej oceny endpointu UltraSpeed, więc twierdzenie, że jakość się nie zmieniła, jest niesprawdzone, a nie obalone.
• Kontekst i modalność — 1 048 576 tokenów oraz natywne wejście tekstowe, obrazowe, wideo i audio, odziedziczone z bazowego checkpointu.
Jest też benchmark dostawcy, który warto wymienić dokładnie ze względu na to, jaką przebył drogę. Publiczny panel Xiaomi do uczenia ze wzmocnieniem, który we wrześniu 2026 r. transmitował na żywo przebiegi po treningu V2.6, podaje wyniki DeepSWE v1.1 wynoszące 72,57 dla przebiegu Pro i 65,68 dla Flash. Pochodzą one z własnej ewaluacji offline Xiaomi przeprowadzonej z użyciem harnessa mini-swe-agent przy średniej z trzech; nigdy nie zostały zgłoszone do publicznego rankingu i nie zostały odtworzone poza laboratorium. Jeśli widziałeś 72,57 cytowane jako wynik rankingowy, to liczba dostawcy przebrana za wynik rankingowy.

Precedens: ostatnim razem Xiaomi pobrało opłatę trzy razy, a nie dziesięć.
To nie pierwszy poziom szybkości Xiaomi, a poprzedni jest najbardziej użytecznym porównaniem w całej historii — ponieważ mnożnik się zmienił.
MiMo-V2.5-Pro-UltraSpeed pojawił się w czerwcu 2026 r., zbudowany w oparciu o checkpoint V2.5-Pro, a jego cena była około trzykrotnie wyższa niż stawka za tokeny wyjściowe standardowego modelu. Przekaz Xiaomi był wtedy taki sam jak teraz: około dziesięciokrotnie większa prędkość generowania. Ówczesne relacje podawały utrzymującą się przepustowość na poziomie około 1000 tokenów na sekundę ze szczytami blisko 1200, na pojedynczym węźle z ośmioma GPU, choć sama strona modelu podawała szerszy zakres od 500 do 1000 — i żadna z tych informacji nie została niezależnie zweryfikowana. Dostęp był możliwy po wypełnieniu formularza zgłoszeniowego, a nie w ramach otwartej rejestracji.
Zestaw oba obok siebie, a sedno tkwi w zmianie. Mnożnik szybkości pozostał na poziomie około dziesięciu. Mnożnik ceny przesunął się z trzech do dziesięciu. To zupełnie inna oferta przy tym samym rodzaju ulepszenia, a Xiaomi nie opublikowało wyjaśnienia tej zmiany. Może to odzwierciedlać rzeczywiście droższe serwowanie — większy checkpoint, bardziej agresywną konfigurację dekodowania lub bardziej ograniczone moce przerobowe na starcie. Może to odzwierciedlać ceny obowiązujące w oknie premiery dla poziomu, który jest dostępny zaledwie od jednego dnia. To, czego jednak jeszcze brakuje, to publiczne uzasadnienie, które można sprawdzić.
Warto zwrócić uwagę na jedną praktyczną różnicę dla każdego, kto korzystał z poziomu V2.5: tamten był próbą z ograniczonym dostępem. Poziom V2.6 jest wymieniany jako ogólnie dostępny za pośrednictwem własnego API Xiaomi i kilku platform innych firm, po opublikowanych stawkach, bez etapu zgłoszenia. Cokolwiek jeszcze się zmieniło, bariera związana z jego wypróbowaniem zmalała.
Ile kosztuje dziesięciokrotny wzrost w rzeczywistym obciążeniu
Procenty ukrywają kształt tego zjawiska, więc oto arytmetyka dla konkretnego przebiegu agenta — takiego, który w ciągu swojego życia wczytuje 20 milionów tokenów wejściowych i emituje 2 miliony tokenów wyjściowych. To ciężkie, ale nie egzotyczne obciążenie agentowe, takie, w którym model zapętla się na wywołaniach narzędzi i ponownie odczytuje własny kontekst.
• Poziom standardowy, dane wejściowe — 20 mln tokenów po 0,435 USD za milion: 8,70 USD.
• Poziom standardowy, wyjście — 2 mln tokenów po 0,87 USD za milion: 1,74 USD.
• Plan standardowy, łącznie — 10,44 USD za uruchomienie.
• Poziom UltraSpeed, wejście — 20 mln tokenów po 4,35 USD za milion: 87,00 USD.
• Plan UltraSpeed, dane wyjściowe — 2 mln tokenów po 8,70 USD za milion: 17,40 USD.
• Poziom UltraSpeed, razem — 104,40 USD za przebieg.
Różnica wynosi $93.96 i jest to dokładnie dziesięć razy cały rachunek, a nie dziesięć razy jedna jego pozycja, ponieważ obie stawki skalują się razem. A teraz druga strona księgi. Przy 134,3 tokena wyjściowego na sekundę, które Artificial Analysis mierzy dla standardowego poziomu, wygenerowanie 2 milionów tokenów wyjściowych zajmuje nieco ponad cztery godziny czystego czasu generowania. Przy dziesięciokrotnie większej prędkości zajmuje to około dwudziestu pięciu minut. Zatem dodatkowe $94 odzyskuje gdzieś w okolicach trzech i pół godziny czasu zegarowego w tym przebiegu — około $27 za każdą zaoszczędzoną godzinę, jeśli chcesz to tak ująć.
To, czy ta transakcja jest korzystna, zależy w całości od tego, ile wart jest dla ciebie czas zegarowy, a jest jeden szczegół, który kłóci się z naiwną interpretacją. W standardowym poziomie cena wejścia ma 99% zniżki za cache na stronie Artificial Analysis, co oznacza, że wejściowa połowa rachunku może spaść niemal do zera przy obciążeniach, które wielokrotnie czytają ten sam kontekst. W ofercie UltraSpeed podane są dwie główne stawki i żaden poziom cache. Jeśli twoje obciążenie jest mocno oparte na cache, efektywny mnożnik to nie dziesięć — jest znacznie gorszy, bo tracisz zniżkę po tej stronie, po której płaciłeś niemal nic. Jeśli twoje obciążenie jest zdominowane przez dane wyjściowe i w niewielkim stopniu korzysta z cache, dziesięć razy jest bliskie rzeczywistej liczbie. Zmierz swój własny miks, zanim zaufasz którejkolwiek z tych liczb.
Asymetria otwartych wag
Istnieje różnica strukturalna między tymi dwoma poziomami, która nie ma nic wspólnego z ceną ani szybkością, i może mieć większe znaczenie niż każda z tych rzeczy.
MiMo-V2.6-Pro jest udostępniany na licencji MIT, a wagi publikowane są w Hugging Face. Pozwala to na komercyjne wdrożenia, modyfikacje i dalsze trenowanie, a także oznacza, że standardowy model ma dolną granicę ceny, której żaden dostawca nie może podnieść: jeśli stawka za hostowanie przestanie mieć sens, możesz samodzielnie uruchomić checkpoint. Nie dorównasz przepustowości Xiaomi na własnym sprzęcie i zapłacisz za GPU, ale ta opcja istnieje i wyznacza górny limit tego, ile może pobierać wariant hostowany.
UltraSpeed nie ma takiego progu. Nie istnieją wagi UltraSpeed, ponieważ ten poziom to stos obsługi, a nie model — checkpoint jest tym samym, który jest już publiczny, a wynajmujesz zdolność Xiaomi do szybkiego jego uruchamiania. To uzasadniona rzecz na sprzedaż i ma taki sam kształt jak każdy inny poziom szybkości na rynku. Oznacza to jednak, że dziesięciokrotna stawka nie ma żadnej konkurencyjnej kontroli poza innymi dostawcami uruchamiającymi te same otwarte wagi i nie ma furtki samodzielnego hostowania, jeśli cena znowu się zmieni.

Zestaw to z obrazem dostępności. Standardowy checkpoint jest osiągalny przez własne kanały Xiaomi i kilka platform zewnętrznych, a także jest dostępny do pobrania. Poziom UltraSpeed jest osiągalny przez własne API Xiaomi i kilka platform zewnętrznych, i to jedyny sposób, by go uzyskać. Dla każdego, kto rozważa długoterminową zależność, ta różnica w opcjonalności jest warta uwzględnienia w kalkulacji obok stawki za token.
Kto powinien co wziąć?
Ta decyzja rozstrzyga się jednoznacznie w zależności od tego, jaka część Twoich kosztów to tokeny wyjściowe, a jaka część Twojego budżetu opóźnienia to generowanie, a nie kolejkowanie.
• Wybierz UltraSpeed, gdy obciążenie jest zdominowane przez dane wyjściowe, w niewielkim stopniu korzysta z pamięci podręcznej i jest interaktywne — generowanie długich tekstów, pętle agentów, w których model zapisuje dużo rozumowania między wywołaniami narzędzi, lub cokolwiek, gdzie człowiek czeka na drugim końcu żądania.
• Wybierz warstwę standardową, gdy obciążenie w dużym stopniu opiera się na pamięci podręcznej, toleruje przetwarzanie wsadowe lub jest wrażliwe na koszty krańcowe — masowa klasyfikacja, odpowiadanie wspomagane wyszukiwaniem na stałym korpusie, nocne przebiegi ewaluacyjne, cokolwiek, gdzie cztery godziny generowania są w porządku, bo nikt tego nie obserwuje.
• Wybierz standardowy plan, jeśli chcesz mieć możliwość samodzielnego hostowania. Jeśli Twoja polityka zgodności wymaga wag, które możesz przechowywać u siebie, UltraSpeed nie jest dostępny dla Ciebie za żadną cenę.
• Nie wybieraj żadnego, dopóki nie zmierzysz. Twierdzenie o dziesięciokrotności jest tu kluczową liczbą i obecnie pochodzi od dostawcy. Jedno popołudnie spędzone na przepuszczeniu własnych promptów przez oba poziomy powie ci więcej niż jakiekolwiek publikowane dane, ponieważ jedyna liczba przepustowości, którą ktokolwiek niezależnie zweryfikował, dotyczy wolniejszej strony porównania.
Co do ostatniej kwestii — mechanika testowania warstwy udostępniania jest taka sama jak testowania modelu i właśnie tam warstwa routingu zasługuje na swoje miejsce. OrcaRouter udostępnia ponad 200 modeli za jednym kluczem API w cenie katalogowej dostawcy, z przenoszoną marżą 0%, więc zmiana ceny u dostawcy pojawia się po Twojej stronie tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Automatyczne przełączanie awaryjne sprawia, że warstwa, którą wciąż oceniasz, nigdy nie trafia samodzielnie na ścieżkę produkcyjną, a DSL routingu pozwala kierować jedną klasę żądań do szybkiego endpointu, a wszystko inne do standardowego, bez utrzymywania dwóch integracji. Nic z tego nie wymaga konkretnie modeli Xiaomi — chodzi o to, że decyzje na poziomie warstw, takie jak ta, łatwo odwrócić, gdy warstwy znajdują się za jednym kluczem.
Co rozstrzygnęłoby tę sprawę?
Uczciwy stan rzeczy w kwestii porównania MiMo-V2.6-Pro-UltraSpeed z MiMo-V2.6-Pro jest taki, że połowa tego jest zmierzona, a połowa opiera się na twierdzeniach. Wariant standardowy ma niezależny Intelligence Index, niezależny wskaźnik przepustowości i opublikowane otwarte wagi. Wariant szybki ma cenę, okno kontekstowe i obietnicę dostawcy, że to ten sam model, tylko szybszy.
Trzy rzeczy zamknęłyby tę lukę. Niezależny pomiar przepustowości na endpoincie UltraSpeed — Artificial Analysis zmierzyło standardową warstwę przez API Xiaomi, więc takie samo podejście jest możliwe i po prostu jeszcze do niego nie doszło. Polityka pamięci podręcznej dla szybkiej warstwy, ponieważ to właśnie jej brak sprawia, że dziesięciokrotny rachunek zamienia się w coś gorszego przy pracy intensywnie korzystającej z pamięci podręcznej. I jakikolwiek opublikowany szczegół na temat stosu serwowania V2.6, w sposób, w jaki Xiaomi udokumentowało ekspertów FP4, DFlash i TileRT dla generacji V2.5.
Do tego czasu dziesięciokrotna cena jest faktem, a dziesięciokrotna szybkość to tylko twierdzenie. Jeśli Twoje obciążenie w dużej mierze polega na generowaniu wyników i ktoś czeka, to twierdzenie warto przetestować na własnych promptach — i warto przetestować je za warstwą, która pozwala przełączyć się z powrotem jeszcze tego samego popołudnia, jeśli się nie sprawdzi.
