Karta hero radaru modeli OrcaRouter z nagłówkiem „MiMo-V2.6-Flash vs Qwen 3.8”, podtytułem „Pobranie kontra licznik, a tylko jedna strona ma wynik od podmiotu trzeciego”, z lewym panelem dla MiMo-V2.6-Flash: 309B łącznie / 15B aktywnych, licencja MIT, bez ograniczeń dostępu i Brak niezależnego wyniku, z prawym panelem dla Qwen3.8-Max: 2,4T łącznie / 95B aktywnych, 2,00 USD za wejście / 6,00 USD za wyjście za 1 mln i AA Index 45, aktualna skala, oraz trzema plakietkami poniżej: Flash: opublikowano 21 września 2026, Qwen: rozliczany od 3 sierpnia 2026 i Routowalne: tylko Qwen3.8-Max.
Guides & Insights

MiMo-V2.6-Flash vs Qwen3.8-Max: Pobranie kontra licznik, a tylko jeden z nich ma wynik

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

O tym, jak zwykle zapisuje się to porównanie, decyduje jedna liczba — i nie jest to benchmark. Qwen3.8-Max jest modelem hostowanym, który Artificial Analysis mierzy w sposób ciągły, więc ma aktualny Intelligence Index na poziomie 45 w zrekalibrowanej skali v4.3, prędkość generowania 39,2 tokena na sekundę oraz cenę katalogową 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. MiMo-V2.6-Flash, który Xiaomi opublikowało jako wagi do pobrania 21 września 2026 r., nie ma żadnej z tych rzeczy: żadnego cennika dostawcy, żadnego identyfikatora modelu ogłoszonego przez Xiaomi ani żadnej strony Artificial Analysis. Wszystko, co opublikowano o możliwościach MiMo-V2.6-Flash, pochodzi z własnych tabel ewaluacyjnych Xiaomi w karcie modelu. Ani jedna liczba nie została ponownie przeliczona przez kogoś, kto nie pracuje dla Xiaomi.

Ta asymetria nie jest zarzutem wobec modelu. To fakt dotyczący tego, jakim rodzajem zakupu jest każdy z nich, i zmienia to, co faktycznie można wywnioskować z bezpośredniego porównania. Dalsza część tego tekstu dotyczy trzech rzeczy, które naprawdę da się porównać — kształtu twierdzenia, kosztu tokena i licencji — plus jednej liczby, która jest prawdziwa, zmierzona niezależnie i nie należy do żadnego z modeli z nagłówka.

Po pierwsze, który Qwen 3.8 i który MiMo

Obie nazwy w tym nagłówku to rodziny udające punkty kontrolne, a podstawienia nie są nieszkodliwe.

• Qwen3.8-Max — flagowy model hostowany Alibaba, zaprezentowany 3 sierpnia 2026 r. Rzadki model mieszaniny ekspertów o 2,4 biliona parametrów, z około 95 miliardami parametrów aktywnych na token, kontekstem 1 mln tokenów oraz wejściem tekstowym, obrazowym i wideo. To model, który w dalszej części tego artykułu jest traktowany jako przeciwnik.

• Qwen3.8-Max (0902) — datowana migawka z 2 września tego samego modelu, udostępniona jako osobny wpis z tymi samymi cenami 2,00 USD i 6,00 USD oraz limitem wyjściowym 131 072 tokenów. Bieżąca strona Artificial Analysis dotyczy tej kompilacji, co ma znaczenie, gdy podajesz wynik indeksu.

• Qwen3.8-2.4T-A95B — checkpoint z otwartymi wagami tego samego rdzenia, dostępny do pobrania od 12 sierpnia 2026 r. na licencji Qwen3.8-Max. Obsługuje wyłącznie tekst, myślenie jest zawsze włączone, a jego natywny kontekst wynosi 262K, a nie milion. To nie jest model z nagłówka.

• MiMo-V2.6-Flash — rzadki checkpoint typu mixture-of-experts firmy Xiaomi o łącznej liczbie 309B parametrów i 15B aktywnych, udostępniony bez ograniczeń na Hugging Face na licencji MIT, natywnie omnimodalny, z deklarowanym kontekstem 1M tokenów. To efektywnościowy wariant w wydaniu dwóch checkpointów, którego flagowcem jest MiMo-V2.6-Pro o łącznej liczbie 1,02T parametrów i 42B aktywnych.

• MiMo-V2-Flash — model z grudnia 2025 r. Ten sam łączny rozmiar 309B, te same 15B aktywnych parametrów, to samo okno przesuwne 128 tokenów. Inny przebieg treningu, inna tabela benchmarków i kontekst 256K. Każda strona, która w rankingu zestawia „MiMo-V2-Flash” z modelem Qwen, porównuje niewłaściwą generację, a sama karta specyfikacji ci tego nie powie.

Kolizja MiMo jest ostrzejsza z tych dwóch pułapek, ponieważ liczby identyfikujące model są także tymi samymi liczbami, które są identyczne między checkpointami z 2025 i 2026. Kolizja Qwen jest łagodniejsza, ale ma swoją cenę: otwarte wagi 2.4T i hostowane API to różne artefakty o różnych warunkach, a porównanie, które je zamieni, błędnie określi zarówno możliwości, jak i licencję.

Indeks został przebudowany, a numer, który większość stron wciąż drukuje, zniknął.

Oto tryb awarii, na który trzeba uważać, zanim pojawi się jakikolwiek wynik.

Artificial Analysis przekalibrował swój Intelligence Index do wersji v4.3 7 września 2026 r. Wyniki sprzed tej daty nie są porównywalne z wynikami po niej, a bieżąca strona Qwen3.8-Max nosi Zaktualizowaną plakietkę oznaczającą skorygowany wynik. Powszechnie krążąca liczba 58 dla Qwen3.8-Max należy do starej skali. Obecny Qwen3.8-Max (0902) wskazuje 45, co daje mu 19. miejsce wśród 202 modeli, które Artificial Analysis umieszcza w tej klasie.

To nie jest pedanteria. 58 obok 46 odczytuje się jako różnica dwunastu punktów. Te same dwa modele w tej samej aktualnej skali dzieli zaledwie jeden punkt — a 46 nie jest nawet modelem, o którym jest ten artykuł:

• Qwen3.8-Max (0902), zmierzony niezależnie — Intelligence Index 45 w wersji v4.3. Prędkość generowania 39,2 tokena na sekundę, co daje 151. miejsce na 202, co — jak zauważa sama strona — jest wolne. Koszt na zadanie Intelligence Index: 5,41 USD. Tokeny wyjściowe wygenerowane do ukończenia indeksu: 190 mln.

• MiMo-V2.6-Pro, niezależnie zmierzony — Intelligence Index 46, pierwsze miejsce wśród 114 modeli w klasie otwartych wag. Szybkość generowania 134,3 tokena na sekundę. Koszt na zadanie Intelligence Index: 0,13 USD. Tokeny wyjściowe do ukończenia indeksu: 140 mln.

• MiMo-V2.6-Flash, o który faktycznie chodzi — nie istnieje żadna strona Artificial Analysis. Nie ma czego cytować.

Przeczytaj wszystkie trzy razem, a uczciwe podsumowanie jest niewygodne dla obu dostawców. Porównanie, którego wszyscy chcą — Flash kontra Qwen3.8-Max w neutralnej skali — nie istnieje i nie można go skonstruować na podstawie tabel dostawców, ponieważ obaj dostawcy uruchamiali różne zestawy testowe na różnych checkpointach w różnym czasie, a następnie porównywali się z modelami innych firm, które również uruchamiali. Istnieje natomiast jednopunktowa różnica między flagowym Qwen a Xiaomi większym checkpointem, przy około jednej czterdziestej kosztu na zadanie indeksowe. To najciekawsza rzeczywista liczba w tym starciu i dotyczy modelu, którego nie wymienia żadna ze stron z nagłówka.

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

Co tabele dostawców powiedzą, a czego nie

Obaj dostawcy publikują liczby. Nie są to jednak liczby tego samego rodzaju, a zestawienie ich kolumna po kolumnie daje raczej wykres niż wniosek — ale kształt tych twierdzeń wciąż warto przeczytać, bo mówi, co każde laboratorium obrało za cel optymalizacji.

• Agent kodu — Xiaomi podaje MiMo-V2.6-Flash w DeepSWE v1.1 67,9, Terminal Bench 2.1 87,6, ProgramBench 26,0 i MiMo Code Bench 61,2. Alibaba podaje Qwen3.8-Max w SWE-bench Pro 67,7 i Terminal-Bench 2.1 86,6. Wyniki Terminal-Bench są na tyle bliskie, że o kolejności prawdopodobnie decyduje harness, a nie model.

• Agent ogólny — Xiaomi podaje AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 i Agents' Last Exam 27,6 dla Flash. Alibaba podaje OSWorld-Verified 86,1, WideSearch 81,9 i Agent's Last Exam 52,4 dla Qwen3.8-Max. W przypadku dwóch benchmarków, które uruchomiły oba laboratoria, podawane wyniki Qwen są wyższe — na własnym środowisku testowym Alibaby.

• Wiedza i bezpieczeństwo — Xiaomi prowadzi CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) i SEC Bench Pro (47.5). Alibaba prowadzi GPQA Diamond (92.6), Humanity's Last Exam (43.6) i PaperBench (93.0). Prawie się nie pokrywają, więc prawie nie ma czego porównywać.

Jedyną naprawdę użyteczną rzeczą, jaką może pokazać tabela dostawcy, jest wewnętrzna niespójność — a Xiaomi taką ma. Jego publiczny dashboard RL, który transmitował przebieg treningu przez wrzesień, opublikował MiMo-V2.6-Flash z wynikiem 65.68 w DeepSWE v1.1 przy użyciu harnessu mini-swe-agent przy średniej z trzech. Gotowa karta modelu podaje 67.9 dla wydanych wag. Opisują one odpowiednio snapshot treningowy i wydany artefakt, a różnica dwóch punktów jest tej samej wielkości co różnica między dwoma checkpointami Xiaomi. Jeśli od zeszłego tygodnia cytujesz liczbę z dashboardu, jest już nieaktualna.

Rachunek, i to właśnie w tym miejscu dwa modele przestają być porównywalne.

To sekcja, która decyduje o wdrożeniach, i wcale nie jest to blisko.

• Qwen3.8-Max jest rozliczany za użycie. 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion wyjściowych według międzynarodowego cennika Alibaby, z rabatem za pamięć podręczną, który Artificial Analysis mierzy na poziomie 88%, i kosztem 5,41 USD na zadanie Intelligence Index. Dokumentacja Alibaby dla regionu Chin podaje 12 CNY i 36 CNY za milion dla tej samej pary. Możesz to wywołać dziś po południu i otrzymać rachunek.

• MiMo-V2.6-Flash to plik do pobrania. Xiaomi nie publikuje na własnej stronie stawki za token dla generacji MiMo-V2.6 ani nie ogłosiło żadnego identyfikatora umożliwiającego wywołanie któregokolwiek z checkpointów, więc nie ma czego rozliczać. Jest natomiast 172,9 GB danych wag FP8 w 65 shardach, nie licząc KV cache dla kontekstu 1 mln tokenów, oraz sekcja wdrożeniowa zalecająca SGLang przy tensor parallel 16 ze współczynnikiem data-parallel równym 2 albo przepis vLLM przy tensor parallel 8 — wielowęzłowe zadanie serwowania.

• Oferty podmiotów trzecich nie są cennikiem. Strony katalogowe rzeczywiście podają kwoty dla serii MiMo-V2.6, a Artificial Analysis wskazuje tylko jednego dostawcę API oferującego MiMo-V2.6-Pro za 0,435 USD i 0,87 USD za milion. To oferta dostawcy dla większego checkpointu, a nie cena Xiaomi, i dla Flash nie istnieje w ogóle.

Zatem arytmetyka to rozliczana pozycja w zestawieniu z decyzją kapitałową. Przy kilkuset milionach tokenów miesięcznie Qwen3.8-Max to rachunek, który można prognozować, a Flash to węzeł, który kupowałbyś, by obsługiwać model, którego nikt poza Xiaomi nie zmierzył. Przy miliardach tokenów miesięcznie otwarta ścieżka zaczyna wygrywać pod względem kosztów i właśnie w tym momencie licencja przestaje być prawnym przypisem, a staje się daną wejściową procesu zakupowego.

Licencje nie są tym samym zezwoleniem

MIT jest w zasadzie tak permisywna, jak tylko mogą być otwarte wagi. Licencja Qwen3.8-Max nie jest licencją MIT, a ta różnica ma realne znaczenie.

MiMo-V2.6-Flash jest udostępniany na licencji MIT, bez progu przychodów, bez progu liczby użytkowników, bez odrębnej umowy komercyjnej i bez klauzuli badawczej. Komercyjne wdrożenia, modyfikacja, redystrybucja i dalsze trenowanie są dozwolone, a dostęp do repozytorium nie jest ograniczony.

Licencja Qwen3.8-Max przyznaje prawo do użytkowania, modyfikacji, dystrybucji, sublicencjonowania, sprzedaży, wdrażania, hostowania i dostrajania, pod dwoma warunkami. Produkt lub usługa, które przekraczają 100 milionów miesięcznych aktywnych użytkowników lub20 milionów USD miesięcznego przychodu, musi w widoczny sposób wyświetlać nazwę modelu w swoim interfejsie. Natomiast przedsiębiorstwo świadczące usługi typu model-as-a-service lub asystenta pracy opartego na AI, którego łączny przychód przekracza 50 milionów USD w dowolnych dwunastu następujących po sobie miesiącach, potrzebuje oddzielnej licencji od Alibaba przed rozpoczęciem użytkowania komercyjnego. Użytkowanie wewnętrzne jest wyłączone, pod warunkiem że model lub jego możliwości nie są ujawniane stronom trzecim.

Dla większości zespołów żaden z tych warunków nie obowiązuje. W przypadku odnoszącego sukcesy biznesu platformowego jeden z nich jednak obowiązuje — i wiąże dokładnie w momencie, gdy model stał się kluczowym elementem. Warto również zauważyć, że warunki te dotyczą możliwych do pobrania wag 2.4T, a nie hostowanego API, do którego zamiast tego mają zastosowanie warunki dostawcy. Te dwie ścieżki wiążą się z różnymi zobowiązaniami, co jest kolejnym powodem, aby nie porównywać otwartego checkpointu z hostowanym tak, jakby były tym samym produktem.

Gdzie OrcaRouter pasuje, a gdzie nie

Qwen3.8-Max jest dostępny w routingu na OrcaRouter, zarówno w wpisie bazowym, jak i w datowanym snapshocie 0902, przez jeden klucz API w cenie katalogowej dostawcy, z zerowym narzutem przekazywanym dalej. Ma to tutaj szczególne znaczenie z dwóch powodów. Po pierwsze, kompilacja 0902 jest osobnym wpisem, a nie cichym zastąpieniem, więc DSL routingu może przypiąć ruch wrażliwy na powtarzalność do datowanego snapshotu, podczas gdy wszystko inne podąża za warstwą bazową — bez drugiej integracji, bez zmian w kodzie. Po drugie, ponieważ cena katalogowa jest przekazywana dalej, a nie objęta narzutem, zmiana cennika Alibaba trafia po Twojej stronie tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy, co utrzymuje uczciwość powyższego porównania rozliczenia licznikowego i węzłowego w miarę zmian cen. Obciążenia mocno oparte na pamięci podręcznej również zachowują zniżkę dostawcy na cache, zamiast tracić jej część na marżę resellera.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

MiMo-V2.6-Flash nie jest nigdzie dostępny w routingu, także u nas. Nie routujemy żadnego modelu Xiaomi, a wiersz dostępności na karcie samego Xiaomi wskazuje na kanały Xiaomi: platformę MiMo API, AI Studio, MiMo Code i aplikację desktopową. Jeśli chcesz ten checkpoint, pobierasz 172,9 GB i szukasz węzła.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

Który i kiedy

Wybierz Qwen3.8-Max, jeśli chcesz mieć możliwości bez sprzętu, jeśli nie masz pewności co do wolumenu albo jeśli chcesz mieć opcję niezależnego pomiaru, zanim się zobowiążesz. Zaakceptuj, że 45 w bieżącym indeksie to pozycja w środku czołówki, a nie szczytowa, że 39,2 tokena na sekundę to dość wolno, by miało to znaczenie wewnątrz pętli agenta, oraz że 190 mln tokenów wyjściowych potrzebnych do ukończenia Intelligence Index to w przybliżeniu dwukrotność mediany — gadatliwość kosztuje pieniądze po stronie licznika rozliczanej za wyjście.

Wybierz MiMo-V2.6-Flash, jeśli ograniczeniem jest licencja, ścieżka danych albo długoterminowy rachunek, który możesz amortyzować — i jeśli masz węzeł. Warunki MIT bez progu przychodowego to naprawdę inne uprawnienie niż licencja z progiem MAU i wyzwalaczem podziału przychodów, a dla firmy, która spodziewa się być duża, to jest powód, by go wybrać. Zaplanuj budżet na obsługę wielowęzłową, rozmiar ustalaj na podstawie opublikowanych danych o wagach, a nie strony repozytorium, i każdą liczbę w karcie Xiaomi traktuj jako podaną przez dostawcę, dopóki ktoś spoza laboratorium jej nie odtworzy.

A jeśli wybierasz już dziś, a nie w następnym kwartale, najpierw skorzystaj z opcji rozliczanej za zużycie. Miesiąc z Qwen3.8-Max powie ci, czego tak naprawdę potrzebuje twoje obciążenie. Węzeł powie ci tylko to, co sam chciałeś usłyszeć.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie