
MiMo-V2.6-Pro vs MiMo-V2.6-Flash: 3-krotna różnica w cenie, której nie wyjaśniają dwa benchmarki
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
W tabelach ewaluacyjnych samego Xiaomi MiMo-V2.6-Flash pokonuje MiMo-V2.6-Pro. Chodzi o wiersz CyberGym, a przewaga wynosi 95,1 do 94,0. To jeden wiersz na piętnaście i właśnie dlatego warto uważnie przeczytać resztę tego porównania, zamiast zakładać, że flagowy model zawsze jest odpowiedzią — ponieważ MiMo-V2.6-Flash kosztuje około jednej trzeciej tego, co MiMo-V2.6-Pro, a w większości wierszy oba modele dzieli zaledwie kilka punktów.
Oba modele zostały opublikowane jako repozytoria Hugging Face 21 września 2026 roku, na licencji MIT, w odstępie osiemnastu sekund, jako osobne przebiegi treningowe, a nie szczeble jednej drabiny. Xiaomi MiMo-V2.6-Pro to poziom biliona parametrów. MiMo-V2.6-Flash to poziom efektywności. Pytanie, na które odpowiada ta strona, brzmi: który z nich ma trafić na Twoją ścieżkę produkcyjną, a uczciwa odpowiedź zależy od liczby, której nie ma w żadnym z tych wydań.
Czym jest każdy z nich
• Parametry — Xiaomi MiMo-V2.6-Pro: 1,02 bln parametrów łącznie, z 42 mld aktywnych na token, w porównaniu z Xiaomi MiMo-V2.6-Flash: około 309 mld parametrów łącznie, z 15 mld aktywnych
• Architektura — obie to rzadkie mieszaniny ekspertów z natywnym wejściem omnimodalnym; Flash ma udokumentowane 48 warstw, 39 z oknem przesuwnym i 9 z pełną uwagą, rozmiar ukryty 4096, 256 ekspertów routowanych z 8 aktywnymi i bez ekspertów współdzielonych, a także transformer wizyjny 681 mln, tokenizator audio 308 mln i enkoder patchy audio 127 mln
• Kontekst — 1 mln tokenów w obu, z maksymalnie 128 000 tokenów wyjściowych w obu
• Licencja — MIT w obu, wagi dostępne bez ograniczeń w obu
• Cena — 0,435 USD za wejście i 0,87 USD za wyjście za milion tokenów dla Pro, wobec 0,14 USD i 0,28 USD dla Flash: 3,1-krotna różnica po obu stronach karty
• Wejście przy trafieniu w pamięć podręczną — 0,0036 USD za milion dla Pro, 0,0028 USD dla Flash
• Koszty treningu — Xiaomi podaje około 2,62 mln USD na przebieg RL dla Pro i 854 tys. USD dla Flash; każdy ukończono w mniej niż sześć dni, w 30 krokach uczenia ze wzmocnieniem i około 750 000 trajektorii
• Wynik niezależnego indeksu — 46 dla Xiaomi MiMo-V2.6-Pro w Artificial Analysis Intelligence Index v4.3.2; brak opublikowanego wyniku dla MiMo-V2.6-Flash
Tej ostatniej linijki warto się trzymać. Wszystko powyżej, z wyjątkiem wyniku Pro, jest podane przez Xiaomi.
Gdzie za trzykrotną cenę nie dostaje się prawie nic
Tabela 3 Xiaomi zestawia oba rozwiązania obok siebie w zestawach testowych, na których trenowano tę serię, a w przypadku pracy agentowej w długim horyzoncie różnice są niewielkie:
• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2
Spójrz na tę kolumnę, a przewaga flagowego modelu wynosi głównie od jednego do czterech punktów, a jeden wiersz został całkowicie przegrany. W przepływie pracy, w którym różnica między 67,9 a 71,9 to różnica między ukończeniem zadania a jego niepowodzeniem, trzykrotnie wyższa cena jest tania. W przepływie pracy, w którym to różnica między dwiema akceptowalnymi odpowiedziami, nie jest. Tabele dostawców z takimi miejscami po przecinku zachęcają do fałszywej precyzji — nikt poza Xiaomi ich nie uruchamiał, a dwupunktowa różnica w wewnętrznie ocenianym zestawie testów z zapasem mieści się w zakresie, który może przesunąć inny oceniający lub inna polityka ponownych prób.

Gdzie dużo kupuje
Istnieje grupa wierszy, w których luka przestaje być kwestią zaokrągleń. Każdy z nich to praca związana z bezpieczeństwem:
• ExploitGym — Pro 17,8, Flash 6,0
• ExploitBench — Pro 47,9, Flash 25,3
• SEC Bench Pro — Pro 66,3, Flash 47,5
• Ostatni egzamin agentów — Pro 31,6, Flash 27,6
• Terminal Bench 4.0 — Pro 34,9, Flash 28,8
W ExploitGym flagowiec wypada trzykrotnie lepiej niż tańszy model, czyli dokładnie w takim samym stosunku jak cena, a w SEC Bench Pro – 1,4x. Taki wzorzec jest właśnie tym, czego można oczekiwać od modelu z 42B aktywnych parametrów w porównaniu z modelem z 15B: zadanie wymagające długiego łańcucha rozumowania bez punktów częściowych to właśnie ten rodzaj zadania, w którym ujawnia się dodatkowa pojemność, a CyberGym wypadający odwrotnie to wyjątek potwierdzający, że oba przebiegi nauczyły się różnych rzeczy, a nie tej samej rzeczy przy różnych rozmiarach.
Więc ten podział pokrywa się z rzeczywistą granicą obciążenia, a nie z granicą marketingową. Praca agentowa o dużym wolumenie i łagodnym kryterium sukcesu — wyszukiwanie informacji, klasyfikacja, rutynowe edycje, wywołania, które uratuje ponowna próba — to domena Flasha. Praca, w której błędna odpowiedź jest kosztowna, a częściowa odpowiedź jest bezwartościowa — tworzenie exploitów, przegląd bezpieczeństwa, sesje terminalowe z wieloetapowym stanem — to miejsce, w którym poziom Pro zasługuje na swoją wielokrotność.
Liczba, która nie istnieje
MiMo-V2.6-Flash nie ma strony modelu Artificial Analysis. Jego siostrzany model ma. Ta asymetria jest najważniejszą rzeczą na tej stronie, ponieważ oznacza, że jedyną niezależnie zmierzoną wartością gdziekolwiek w serii MiMo-V2.6 jest 46 obok Xiaomi MiMo-V2.6-Pro. Każda liczba Flash powyżej — w tym wiersz CyberGym, w którym wygrywa — pochodzi ze środowiska testowego Xiaomi, programu oceniającego Xiaomi i uruchomienia offline Xiaomi.
Można zasadnie argumentować, że jest to stan tymczasowy: w momencie pisania model ma zaledwie dzień, a ocena przez strony trzecie wymaga czasu. Można też zasadnie argumentować, że ma to charakter strukturalny, ponieważ Flash należy do segmentu masowego, a segmenty masowe przyciągają mniej uwagi przy benchmarkowaniu. Tak czy inaczej, praktyczną konsekwencją na dziś jest to, że nie można porównywać Flash z niczym spoza jego własnej rodziny z taką samą pewnością, z jaką można porównywać Pro. Jeśli wybierasz między Flash a modelem innej marki niż Xiaomi na podstawie stosunku ceny do jakości, porównujesz wartość podaną przez producenta z wartością zmierzoną przez kogoś innego.
Obie karty modeli zawierają to samo drugie zastrzeżenie. Żadne z tych repozytoriów nie jest wdrażane przez żadnego dostawcę usług wnioskowania — Hugging Face mówi o tym wprost na każdej stronie, a Artificial Analysis doliczyło się zaledwie jednego dostawcy API dla wersji Pro. Nie hostujemy żadnego z tych checkpointów, więc żadnego z nich nie da się wywołać przez naszą infrastrukturę. Droga do obu prowadzi przez własną platformę Xiaomi oraz katalogi firm trzecich, które je udostępniają.

Cena, którą płacisz sprzętem, a nie tokenami.
Cena za token to tylko połowa tego, ile kosztuje cię checkpoint, a te dwie wartości różnią się na dysku znacznie bardziej niż w cenniku. MiMo-V2.6-Flash publikuje 172,9 GB wag FP8 w 65 shardach. Xiaomi MiMo-V2.6-Pro ma około trzy razy więcej parametrów, co sprawia, że jego surowe pobranie mieści się w przedziale pół terabajta przed jakąkolwiek kwantyzacją — a jego własne repozytorium podaje rozmiar modelu Safetensors wynoszący 524 mld parametrów, wartość, której nie da się uzgodnić ani z łączną liczbą 1,02 bln, ani z liczbą 42 mld aktywnych parametrów.
Ta różnica zmienia kształt decyzji. Flash przy 172,9 GB to model, który mały zespół może samodzielnie hostować na wynajmowanych zasobach i traktować jak towar masowy. Pro przy około trzykrotnie większym rozmiarze to decyzja o klastrze — doniesienia wokół premiery szacowały dwa przebiegi treningowe na odpowiednio około 4000 i 8000 GPU równoważnych H200. Jeśli powodem, dla którego patrzysz na otwarte wagi, jest chęć mieć opcję zaprzestania płacenia za token, te dwa checkpointy dają tę możliwość przy bardzo różnych skalach zaangażowania.
Wybór między nimi
Zasada, która przetrwa powyższe zastrzeżenia, to wybierać według klasy obciążenia, a nie według średniej z benchmarków. Flash do wszystkiego, co możesz spokojnie ponowić; Pro do wszystkiego, gdzie ponowienie cię nie uratuje. Potem mierz, bo żaden z modeli nie ma niezależnego wyniku w benchmarkach, na których naprawdę ci zależy.
Zestawienie dwóch checkpointów obok siebie to sytuacja, w której router robi coś, czego nie zrobi kontrakt na pojedynczy model. Skierowanie większości ruchu do taniej warstwy i eskalowanie do droższej tylko trudnych przypadków to ta sama decyzja co na tej stronie, wyrażona jako konfiguracja, a nie jako przepisanie — i właśnie do takiej kompozycji służy warstwa routingu. Ma to też znaczenie dla samej ceny: przekazujemy cenę katalogową dostawcy bez narzutu, stawka 0%, więc jeśli Xiaomi obniży stawkę na którymkolwiek z checkpointów, liczba po naszej stronie zmieni się tego samego dnia, a nie przy kolejnym odnowieniu umowy. Dotyczy to modeli, które mamy w ofercie. W przypadku konkretnie pary MiMo-V2.6 — dziś nadal kupujesz bezpośrednio od Xiaomi.
Co by to rozstrzygnęło
Dwie rzeczy zamieniłyby to z decyzji uznaniowej w kwestię arytmetyczną. Strona Artificial Analysis dla MiMo-V2.6-Flash umieściłaby oba checkpointy na tej samej osi kosztu na zadanie, która obecnie plasuje Pro na poziomie $0.133 za zadanie Intelligence Index, a porównanie rozstrzygnęłoby się samo. Niezależna replikacja klastra bezpieczeństwa — ExploitGym, ExploitBench, SEC Bench Pro — potwierdziłaby, czy trzykrotna różnica w tych wierszach jest właściwością modelu, czy właściwością oceniającego.
Do tego czasu można bronić stanowiska, że Xiaomi MiMo-V2.6-Flash jest lepszym zakupem dla większości zespołów przez większość czasu, a Xiaomi MiMo-V2.6-Pro jest lepszym zakupem dla wąskiej klasy zadań, w których niepowodzenie jest kosztownym wynikiem. Jedyny wiersz, w którym Flash wygrywa, tego nie podważa — ale to przydatne przypomnienie, że dopłata za flagowca to twierdzenie o obciążeniu, a nie o modelu.

