
MiMo-V2.6-Pro vs Qwen3.8-Max: Jeden punkt indeksu, sześciokrotnie wyższa cena
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max to model o 2,4 biliona parametrów, który aktywuje 95 miliardów z nich na token i działa u jednego dostawcy. Xiaomi MiMo-V2.6-Pro to model o 1,02 biliona parametrów, który aktywuje 42 miliardy na token, uzyskuje o jeden punkt więcej w tym samym niezależnym indeksie, a jego wywołanie kosztuje około jednej szóstej tego co tamto. Te fakty niezręcznie ze sobą współgrają, a sposób, w jaki je pogodzisz, to cała decyzja między tymi dwoma. W skrócie: w Artificial Analysis Intelligence Index v4.3.2 Xiaomi MiMo-V2.6-Pro uzyskuje 46 punktów, a Qwen3.8-Max 45 — remis w granicach szumu — podczas gdy cennik podaje 0,43 i 0,87 dolara za milion tokenów w porównaniu z 2,00 i 6,00 dolara.
Czym tak naprawdę jest każdy model
Qwen3.8-Max to flagowy model Alibaby, ogólnie dostępny od 3 sierpnia 2026, i był największym modelem, jaki linia Qwen wydała w momencie premiery. Jest to rzadka architektura mixture-of-experts oparta na architekturze Qwen 3.5, o łącznej liczbie 2,4 biliona parametrów, z około 95 miliardami aktywnymi na token, oknem kontekstowym o rozmiarze 1M tokenów, do 131 000 tokenów wyjściowych oraz multimodalnym wejściem dla tekstu, obrazu i wideo. Alibaba obniżyła międzynarodową stawkę do 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion wyjściowych, z wejściem z pamięci podręcznej po 0,25 USD, i przedstawiała to jako około 40% ceny wejścia Claude Opus 5. Aktualizacja punktowa, Qwen3.8-Max-0902, pojawiła się 2 września 2026 i to właśnie ten model Artificial Analysis obecnie benchmarkuje na 45.
Xiaomi MiMo-V2.6-Pro osiągnął ogólną dostępność 22 września 2026 r., trzy dni przed napisaniem tego porównania, a repozytoria punktów kontrolnych uczenia ze wzmocnieniem pojawiły się dzień wcześniej. To rzadki model mieszaniny ekspertów o łącznej liczbie 1,02 biliona parametrów i 42 miliardach aktywnych na token, z tym samym oknem kontekstowym 1 mln tokenów, natywną multimodalnością obejmującą tekst, obraz, wideo i dźwięk oraz wagami opublikowanymi na licencji MIT. Xiaomi utrzymało ceny poprzedniej generacji, zamiast podnosić cenę nowego punktu kontrolnego, dlatego widnieje w cenniku po 0,43 i 0,87 USD z 99% zniżką za pamięć podręczną i mieszaną stawką 0,18 USD.
• Aktywne obliczenia na token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, mniej niż połowa
• Łączna liczba parametrów — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T
• Wynik indeksu — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, oba w Artificial Analysis v4.3.2
• Szybkość generowania — Xiaomi MiMo-V2.6-Pro 134,3 tokenów/sekundę; Qwen3.8-Max 39,2, wobec mediany dla tej klasy wynoszącej 72,5
• Czas do pierwszego tokena — Xiaomi MiMo-V2.6-Pro 2,15 sekundy; Qwen3.8-Max 2,93
• Cena katalogowa — Xiaomi MiMo-V2.6-Pro 0,43 USD / 0,87 USD za 1 mln; Qwen3.8-Max 2,00 USD / 6,00 USD
• Stawka mieszana — Xiaomi MiMo-V2.6-Pro 0,18 USD za 1 mln przy proporcji 7:2:1 trafień w pamięć podręczną/wejść/wyjść; Qwen3.8-Max 1,18 USD
• Wagi — Xiaomi MiMo-V2.6-Pro na licencji MIT i do pobrania; Qwen3.8-Max był udostępniany jako zastrzeżony endpoint, z wydaniem open-weight tylko tekstowym, które porzuca kontekst 1M i wejście wizyjne
• Osiągalność — jeden dostawca API zliczany dla każdego w Artificial Analysis
Wynik jest remisowy. Prędkość nie.
Jeden punkt w złożonym wyniku z dziesięciu ewaluacji to nie różnica, na której ktokolwiek powinien opierać działania, a bardziej użytecznym sygnałem jest to, co działo się pod spodem. Model z mniej niż połową aktywnych parametrów na token uzyskał nieznacznie wyższy wynik i generował odpowiedzi trzy i pół raza szybciej — 134,3 tokena na sekundę wobec 39,2, podczas gdy mediana dla porównywalnych modeli rozumujących wynosi 72,5. Qwen3.8-Max jest najwolniejszym spośród modeli klasy frontier mierzonych na tej stronie, a to konsekwencja projektowa aktywowania 95 miliardów parametrów na token, a nie przypadkowy efekt sposobu serwowania.
Opóźnienie opowiada odwrotną historię niż ta, którą sugerują liczby parametrów. Qwen3.8-Max osiąga pierwszy token w 2,93 sekundy wobec 2,15 u Xiaomi, a różnica jest znacznie mniejsza niż różnica w przepustowości — Qwen3.8-Max jest wolny, gdy już zacznie pisać, a nie wolny w rozpoczęciu. W interfejsie czatu, w którym odpowiedź jest krótka, ta różnica ledwie się ujawnia. W pętli agenta generującej dziesiątki tysięcy tokenów wyjściowych przepustowość to cały czas rzeczywisty, a różnica 3,4× kumuluje się w każdej turze przebiegu.

Gdzie tabele dostawców są rozbieżne i dlaczego nie jest to sprzecznością
Alibaba opublikowała obszerną tabelę dla Qwen3.8-Max i jest ona naprawdę mocna: Terminal-Bench 2.1 na poziomie 86,6, SWE-bench Pro 67,7, PaperBench 93,0, GPQA Diamond 92,6, IFBench 82,8, OSWorld-Verified 86,1 oraz Humanity's Last Exam 43,6. To wyniki uzyskane przez dostawcę na własnych środowiskach testowych Alibaby, a część z nich na własnych benchmarkach Alibaby, więc są to twierdzenia, a nie pomiary — ale to twierdzenia dotyczące powszechnie używanych benchmarków, co czyni je bardziej porównywalnymi między laboratoriami niż wynik z dedykowanego środowiska.
Kluczowy wynik Xiaomi to 72,57 w DeepSWE v1.1, w górę z bazowego poziomu 58,4, mierzony za pomocą mini-swe-agent przy średniej z trzech przebiegów na własnym graderze Xiaomi, w ramach przebiegu uczenia ze wzmocnieniem, który Xiaomi udokumentowało jako trzydzieści kroków i około 750 000 trajektorii przy opublikowanym nakładzie około 2,62 mln USD. Nie został zgłoszony do publicznego rankingu DeepSWE i żadna strona trzecia go nie odtworzyła. Zestawianie 72,57 z wynikiem Qwen 67,7 w SWE-bench Pro i ogłaszanie pięciopunktowego zwycięstwa Xiaomi byłoby porównywaniem dwóch różnych benchmarków, dwóch różnych harnessów i dwóch różnych konwencji punktowania. Istnieje dokładnie jedna miarka, względem której oba modele zostały uruchomione przez kogoś innego niż ich twórca, i wskazuje ona 46 do 45.
Dwie z bardziej istotnych liczb Qwen3.8-Max wcale nie są wynikami. Alibaba ogłosiła, że wagi zostaną udostępnione jako open source wraz z Qwen3.8-27B, a checkpoint, który się pojawił, jest tylko tekstowy i nie zawiera pełnego kontekstu 1M tokenów ani wejścia wizyjnego, które ma obsługiwany endpoint Max. Zatem „Qwen3.8-Max ma otwarte wagi” i „Qwen3.8-Max jest multimodalnym endpointem z kontekstem 1M” to oba prawdziwe stwierdzenia o różnych artefaktach, a plan wdrożenia oparty na pierwszym, który oczekuje drugiego, nie przetrwa kontaktu. Wydanie punktowe 0902 tymczasem przeniosło model na szczyt jednej publicznej areny tworzenia stron internetowych bez zmiany numeru wersji — przypomnienie, że model, który benchmarkowałeś w sierpniu, niekoniecznie jest modelem obsługującym Twoje żądania we wrześniu.
Czy otwarte wagi oznaczają, że możesz samodzielnie hostować którykolwiek z nich?
Dla Xiaomi MiMo-V2.6-Pro zasadniczo tak: licencja MIT, żadna umowa komercyjna nie jest potrzebna. W praktyce checkpoint o 1,02 bln parametrów przy 42 mld aktywnych wymaga wielowęzłowego klastra serwującego, co jest zupełnie innym poziomem zobowiązania niż wywoływanie API. Publikowanie wag sprawia, że self-hosting jest legalny, ale nie tani.
W przypadku Qwen3.8-Max odpowiedź jest węższa, niż sugeruje reputacja. Otwarte wydanie jest wyłącznie tekstowe i pozbawione pełnego okna kontekstowego, więc samodzielne hostowanie daje istotnie mniejszy model niż ten, na którym zmierzono 45. Jeśli chcesz uzyskać konfigurację z benchmarku, produktem jest serwowany endpoint, a endpoint jest zastrzeżony.
Wywołanie któregokolwiek z nich i arytmetyka, która o tym decyduje
Oba modele są liczone u jednego dostawcy API przez Artificial Analysis, co jest nietypowe w przypadku dwóch flagowych modeli i sprawia, że przełączanie awaryjne staje się kwestią praktyczną, a nie miłym dodatkiem. Qwen3.8-Max jest dostępny w OrcaRouter jako qwen/qwen3.8-max — jeden endpoint zgodny z OpenAI w cenie katalogowej samego Alibaba z 0% marży, więc wspomniane wyżej $2.00 i $6.00 są przekazywane bez zmian, a zmiana ceny po stronie Alibaba obowiązuje u nas tego samego dnia. Nasze własne pomiary wskazują, że p50 tego endpointu wynosi około 3,3 sekundy i to na tej liczbie należy się opierać w planowaniu, a nie na teoretycznym najlepszym przypadku, a łańcuch zapasowy sprawia, że zawieszone żądanie jest ponawiane na inny upstream, zanim rozpocznie się odpowiedź. Xiaomi MiMo-V2.6-Pro nie ma w OrcaRouter; nie ma tam żadnego modelu Xiaomi, a droga do niego prowadzi dziś przez własną platformę Xiaomi i katalogi firm trzecich, które go wymieniają.
Arytmetyka kosztów to miejsce, w którym to starcie faktycznie się rozstrzyga, i nie jest to arytmetyka, na którą wskazują stawki z nagłówków. Przy mieszance 7:2:1 trafień w pamięć podręczną / danych wejściowych / danych wyjściowych uśrednione stawki wynoszą 0,18 USD i 1,18 USD za milion — różnica 6,6×, szersza niż różnice 4,6× na wejściu i 6,9× na wyjściu, ponieważ 99-procentowa zniżka Xiaomi na pamięć podręczną jest głębsza niż 88-procentowa Alibaby. Artificial Analysis odnotowuje również koszt 0,13 USD na zadanie Intelligence Index dla Xiaomi MiMo-V2.6-Pro, mierzony identycznie dla każdego modelu w rankingu. Przepuść to samo obciążenie przez oba modele, a tańszy model okaże się tym, który uzyskał wyższy wynik — co jest niecodzienną rzeczą, którą można napisać, i powodem, dla którego to porównanie nie jest formalnością.

Kto powinien się przełączyć, a kto nie
Jeśli dziś korzystasz z Qwen3.8-Max i działa, nie ma pilnego powodu, by przechodzić. Luka w indeksie to jedna kwestia, obsługa wizji i długiego kontekstu jest sprawdzona w Twoim obciążeniu, a Alibaba wciąż rozwija tę linię — pokazuje to aktualizacja 0902. Argumentem za przejściem są przepustowość i koszt mieszany, i jest to mocny argument tylko wtedy, gdy Twój ruch jest zdominowany przez wyjście lub ma długi horyzont: agenci, generowanie kodu, cokolwiek, co zapisuje znacznie więcej, niż czyta.
Jeśli zaczynasz od zera, na podstawie opublikowanych dowodów trudno zakwestionować ten ranking. Model Xiaomi jest szybszy, tańszy pod każdym względem, objęty licencją MIT i minimalnie wyprzedza konkurencję w jedynym niezależnie przeprowadzonym zestawieniu zbiorczym obejmującym oba modele. Przeciwwagi są prawdziwe i konkretne: trzy dni historii w środowisku produkcyjnym, pojedyncza trasa obsługi i brak publicznego wpisu w benchmarku do sprawdzenia. Taki zestaw argumentów przemawia za ocenianiem go w torze obok obecnego rozwiązania, a nie za zastępowaniem go — właśnie do tego służy konfiguracja routingu i dlatego użytecznym posunięciem jest umieszczenie kandydata i obecnego rozwiązania za jednym kluczem, a nie wybieranie zwycięzcy z tabeli wyników.

Co zmieniłoby tę odpowiedź?
Trzy rzeczy. Drugi i trzeci dostawca dla Xiaomi MiMo-V2.6-Pro usunąłby jedyny strukturalny zarzut wobec niego i zamieniłby różnicę cen w realną decyzję, a nie kuszącą możliwość. Niezależne uruchomienie konfiguracji DeepSWE albo potwierdziłoby wynik 72,57, albo by go wycofało, a każdy z tych wyników jest wart więcej niż sama liczba. A rozbicie wyników na poszczególne ewaluacje w v4.3.2 pokazałoby, które z dziesięciu ewaluacji wygrywa każdy model — wynik złożony to wynik złożony, a model, który przoduje w kodowaniu agentowym, i model, który przoduje w odpowiadaniu na pytania wymagające intensywnego wyszukiwania, mogą uzyskać ten sam wynik indeksowy, będąc jednocześnie złym wyborem do zadań tego drugiego.
