
MiMo-V2.6-Pro vs Claude Opus 5: 21 razy taniej, o pięć punktów indeksowych w tyle
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 632 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Xiaomi MiMo-V2.6-Pro i Claude Opus 5 to dwa końce jednej transakcji, a ta transakcja ma swoją cenę. W rankingu Artificial Analysis Intelligence Index v4.3.2 Claude Opus 5 (maksymalny wysiłek) uzyskuje wynik 51, a Xiaomi MiMo-V2.6-Pro — 46. W cenniku Claude Opus 5 kosztuje 5,00 USD za milion tokenów wejściowych i 25,00 USD za milion tokenów wyjściowych; MiMo-V2.6-Pro kosztuje 0,43 USD i 0,87 USD. Wykonaj dzielenie, a odpowiedź to 11,6x na wejściu i 28,7x na wyjściu — oraz 21x w przypadku stawki mieszanej, którą Artificial Analysis publikuje dla każdego z nich. Pięć punktów indeksu kosztuje dwadzieścia jeden razy więcej pieniędzy. To, czy to okazja, czy marnotrawstwo, zależy wyłącznie od tego, jak twoje obciążenie wykorzysta piąty punkt, a większość zespołów nigdy tego nie ustala przed podjęciem decyzji.
Te dwa modele, mówiąc wprost
Claude Opus 5 to flagowy własnościowy model Anthropic, wydany 24 lipca 2026 r., z oknem kontekstowym 1 mln tokenów i nieujawnioną liczbą parametrów. Xiaomi MiMo-V2.6-Pro to rzadki model mieszaniny ekspertów o łącznej liczbie 1,02 biliona parametrów i 42 miliardach aktywowanych, z oknem kontekstowym 1 mln tokenów, natywną multimodalnością obejmującą tekst, obraz, wideo i audio oraz opublikowanymi wagami na licencji MIT.
• Wagi — MiMo-V2.6-Pro na licencji MIT i do pobrania; Claude Opus 5 jest zastrzeżony, dostępny tylko przez API
• Parametry — MiMo-V2.6-Pro 1,02 bln łącznie / 42 mld aktywnych; Claude Opus 5 nieujawnione
• Kontekst — po 1 mln tokenów w obu; Claude Opus 5 ogranicza wyjście do 128K w Messages API i 300K w Batch API
• Modalność — MiMo-V2.6-Pro przyjmuje tekst, obraz, wideo i dźwięk; publikowany zakres danych wejściowych Claude Opus 5 to tekst i obraz
• Cena katalogowa — MiMo-V2.6-Pro 0,43 USD / 0,87 USD za 1 mln tokenów; Claude Opus 5 5,00 USD / 25,00 USD
• Pamięć podręczna — MiMo-V2.6-Pro podaje 99-procentowy rabat na pamięć podręczną; Claude Opus 5 odczytuje pamięć podręczną po $0.50 za 1 mln, a zapis kosztuje $6.25 przy TTL 5 minut
• Zmierzony koszt na zadanie Intelligence Index — MiMo-V2.6-Pro 0,13 USD; Claude Opus 5 5,86 USD
• Obsługa — MiMo-V2.6-Pro 134,3 tokenów wyjściowych na sekundę i 2,15 s do pierwszego tokenu; Claude Opus 5 57,9 tokenów na sekundę
Ta ostatnia para to ta, która ginie. Tańszy model jest także szybszy — o współczynnik 2,3 w przepustowości wyjściowej — ponieważ działa na sprzęcie kontrolowanym przez Xiaomi i jego partnerów i może agresywnie przetwarzać wsadowo. Claude Opus 5 przy maksymalnym wysiłku to model rozumujący, wykonujący więcej pracy na token; różnica w szybkości nie jest wadą, to inny produkt. Ale to oznacza, że ta tania ścieżka nie płaci za swoją zniżkę opóźnieniem. Płaci za nią pięcioma punktami indeksu i ogonem zadań, w którym żyje ten piąty punkt.

Gdzie tak naprawdę znajduje się pięć punktów
Pięciopunktowa różnica w kompozycie dziesięciu ewaluacji nie rozkłada się równomiernie, a agregat ukrywa to, co najważniejsze. Oba modele uruchomiono na tym samym zestawie v4.3.2, który obejmuje AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. Opublikowane strony nie podają wyników poszczególnych ewaluacji dla żadnego z modeli, co jest prawdziwym ograniczeniem po obu stronach tego porównania i warto o tym powiedzieć, zamiast zamiatać to pod dywan.
To, co jest odnotowane, ma charakter orientacyjny. Claude Opus 5 przy maksymalnym wysiłku uzyskał 49,0% w Terminal-Bench 4.0 w ramach zestawu v4.3, za GPT-6 Astra z 59,1% i Claude Fable 5.1 z 52,0%. W AutomationBench-AA Opus 5 ukończył każde zadanie bez naruszenia zabezpieczeń w 28,3% przepływów pracy, wobec 41,6% dla GPT-6 Astra i 32,1% dla Fable 5.1. To są twarde liczby dotyczące agentów i właśnie w tych kategoriach pięciopunktowa różnica w wyniku łącznym najprawdopodobniej nie rozkłada się równomiernie — własny wpis MiMo-V2.6-Pro w indeksie nie publikuje porównywalnego wyodrębnienia wyników agentowych.
Tymczasem liczby dostawców, które publikują obie firmy, nie są ze sobą porównywalne i warto powiedzieć wprost, dlaczego. Materiały premierowe Anthropic podają SWE-bench Verified na poziomie 96,0% i SWE-bench Pro na 79,2%; jeden z trackerów zauważa, że Opus 5 został wydany bez osobnego wpisu SWE-bench, a nie istnieje dla niego niezależnie audytowana wartość SWE-bench Verified. Materiały Xiaomi podają, że MiMo-V2.6-Pro przeszedł z 58,4 do 72,57 na DeepSWE v1.1 w trakcie swojego przebiegu RL, na własnym środowisku testowym Xiaomi z mini-swe-agent przy średniej z trzech, i nie został zgłoszony do publicznej tablicy DeepSWE. Dwa środowiska testowe dostawców, dwa różne zadania, brak nakładania się. Zestawienie 96,0% obok 72,57 i wyciągnięcie wniosku byłoby wymyślaniem porównania, które nie istnieje.

Porównanie kosztów, zrobione jak należy
Kalkulacja kosztu na pojedynczy token zaniża tę różnicę, ponieważ oba modele nie zużywają tej samej liczby tokenów do wykonania tego samego zadania. Artificial Analysis zmierzyła, ile faktycznie kosztowało uruchomienie pełnego Intelligence Index w przypadku każdego z nich: 0,13 USD dla MiMo-V2.6-Pro i 5,86 USD dla Claude Opus 5. To 45-krotna różnica przy kontrolowanym, identycznym zestawie zadań i jest to najuczciwsza dostępna pojedyncza liczba, ponieważ oba modele zmierzono w ten sam sposób.
Teraz zestaw to z prawdopodobną pętlą produkcyjną. Przebieg agenta w 30 krokach, który odczytuje 200 000 tokenów kontekstu na krok i zapisuje 2 000 tokenów na krok, to 6 milionów tokenów wejściowych i 60 000 tokenów wyjściowych na przebieg. W Claude Opus 5 przy cenie katalogowej to 30,00 USD za wejście i 1,50 USD za wyjście — 31,50 USD na przebieg przed jakimkolwiek buforowaniem. W MiMo-V2.6-Pro to 2,58 USD za wejście i 0,05 USD za wyjście — 2,63 USD. Dzięki rabatom na pamięć podręczną oferowanym przez obu dostawców koszt wejścia załamuje się w obu modelach, a proporcja się przesuwa, a nie znika: 99% rabatu na pamięć podręczną w tanim modelu w porównaniu z odczytem z pamięci podręcznej za 0,50 USD w drogim modelu wciąż pozostawia drogi model o rząd wielkości z przodu w pętli intensywnie korzystającej z kontekstu.
Co stanowi cały argument za tanią ścieżką i przeciw całkowitemu przejściu. Jeśli Twoje obciążenie to pętla agenta o długim horyzoncie, która setki razy ponownie odczytuje ten sam kontekst, różnica kosztów na przebieg nie jest błędem zaokrąglenia — to różnica między funkcją, na której uruchamianie dla każdego użytkownika cię stać, a taką, na której nie. To argument za umieszczeniem MiMo-V2.6-Pro przed większością Twojego ruchu. Nie jest to argument za usunięciem Claude Opus 5, ponieważ zadania, w których piąty punkt indeksu się zwraca, są z założenia tymi zadaniami, w których porażka taniego modelu jest kosztowna.

Jak tutaj wygląda decyzja o routingu
Claude Opus 5 jest dostępny poprzez pojedynczy klucz OrcaRouter w cenie listowej dostawcy z 0% marży, jako anthropic/claude-opus-5, a modele frontier, z którymi chciałbyś go porównać, znajdują się obok niego pod tym samym kluczem. Ponieważ przekazujemy cenę listową dostawcy bez marży, zmiana ceny przez dostawcę po którejkolwiek stronie obowiązuje u nas tego samego dnia, zamiast czekać na ponowną wycenę. Interesująca część tkwi w DSL routingu: możesz połączyć oba modele w jedno wywołanie, zamiast wybierać między nimi, wysłać większość obciążenia do taniej ścieżki i skierować resztę — zadania, które nie przejdą autoweryfikacji albo spełniają predykat złożoności — do droższej. Przełączanie awaryjne to druga połowa. Claude Opus 5 ma szerokie pokrycie dostawców; MiMo-V2.6-Pro był wymieniany przez jednego dostawcę API, gdy Artificial Analysis go odnotowało, co stanowi wąską trasę dla modelu, który chciałbyś umieścić na ścieżce produkcyjnej. Router, który potrafi przełączyć się awaryjnie, sprawia, że tania ścieżka jest bezpieczna do wdrożenia.
Warto powiedzieć to wprost, bo łatwo założyć inaczej: nie hostujemy MiMo-V2.6-Pro. Dostęp do niego dziś oznacza platformę samego Xiaomi albo jeden z katalogów firm trzecich, które go wymieniają. Argument dotyczący routingu mówi tu o tym, jak używasz modelu takiego jak ten obok tych, które rzeczywiście oferujemy, a nie o twierdzeniu, że jest to jeden z naszych.
Który wybrać
Wybierz Claude Opus 5, gdy koszt niepowodzenia zadania przewyższa koszt tokenów na tyle, że pięć punktów indeksu to tanie ubezpieczenie — praca agentowa o długim horyzoncie z realnymi skutkami ubocznymi, korzystanie z narzędzi, gdzie błędne wywołanie jest gorsze niż powolne wywołanie, cokolwiek, gdzie już płacisz człowiekowi za sprawdzanie wyników. Stawka 5,86 USD za zadanie indeksowe nie jest powodem, by go unikać; to cena tego poziomu, a ten poziom istnieje nie bez powodu.
Wybierz MiMo-V2.6-Pro, gdy ograniczeniem jest wolumen, gdy obciążenie jest mocno kontekstowe i powtarzalne, gdy chcesz mieć wagi we własnej infrastrukturze — licencja MIT pozwala na wdrożenie komercyjne, modyfikacje i dalsze trenowanie — albo gdy budujesz coś, czego ekonomika jednostkowa działa tylko przy jednej piątej centa za tysiąc tokenów. Jego 134,3 tokena na sekundę czyni go zdatnym do użytku interaktywnego w sposób, w jaki większość otwartych modeli o bilionie parametrów nie jest.
Wybierz oba, jeśli masz router, ponieważ uczciwa odpowiedź na pytanie „który jest lepszy” brzmi: nie konkurują o te same żądania. Tryb awarii, którego należy unikać, to ten, który kosztuje najwięcej: ustandaryzowanie na tanim modelu, bo nagłówkowy współczynnik wynosi 21x, odkrycie w trzecim miesiącu, że konkretna klasa żądań wymaga drogiego, i brak ścieżki, by ją tam skierować. Drugi tryb awarii to lustrzane odbicie — płacenie stawek Opus 5 za zadanie streszczania, które model o indeksie 46 kończy identycznie. Żaden z nich nie jest problemem związanym z modelem. Oba to problemy konfiguracji, a konfiguracja to ta część, którą możesz zmienić w zwykłe wtorkowe popołudnie.
