Karta główna radaru modeli OrcaRouter do porównania MiMo-V2.6-Pro i Claude Opus 5, z podtytułem „Pięć punktów indeksu. Dwadzieścia jeden razy większa cena.”, z jednym panelem na model.
Guides & Insights

MiMo-V2.6-Pro vs Claude Opus 5: 21 razy taniej, o pięć punktów indeksowych w tyle

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Xiaomi MiMo-V2.6-Pro i Claude Opus 5 to dwa końce jednej transakcji, a ta transakcja ma swoją cenę. W rankingu Artificial Analysis Intelligence Index v4.3.2 Claude Opus 5 (maksymalny wysiłek) uzyskuje wynik 51, a Xiaomi MiMo-V2.6-Pro — 46. W cenniku Claude Opus 5 kosztuje 5,00 USD za milion tokenów wejściowych i 25,00 USD za milion tokenów wyjściowych; MiMo-V2.6-Pro kosztuje 0,43 USD i 0,87 USD. Wykonaj dzielenie, a odpowiedź to 11,6x na wejściu i 28,7x na wyjściu — oraz 21x w przypadku stawki mieszanej, którą Artificial Analysis publikuje dla każdego z nich. Pięć punktów indeksu kosztuje dwadzieścia jeden razy więcej pieniędzy. To, czy to okazja, czy marnotrawstwo, zależy wyłącznie od tego, jak twoje obciążenie wykorzysta piąty punkt, a większość zespołów nigdy tego nie ustala przed podjęciem decyzji.

Te dwa modele, mówiąc wprost

Claude Opus 5 to flagowy własnościowy model Anthropic, wydany 24 lipca 2026 r., z oknem kontekstowym 1 mln tokenów i nieujawnioną liczbą parametrów. Xiaomi MiMo-V2.6-Pro to rzadki model mieszaniny ekspertów o łącznej liczbie 1,02 biliona parametrów i 42 miliardach aktywowanych, z oknem kontekstowym 1 mln tokenów, natywną multimodalnością obejmującą tekst, obraz, wideo i audio oraz opublikowanymi wagami na licencji MIT.

• Wagi — MiMo-V2.6-Pro na licencji MIT i do pobrania; Claude Opus 5 jest zastrzeżony, dostępny tylko przez API

• Parametry — MiMo-V2.6-Pro 1,02 bln łącznie / 42 mld aktywnych; Claude Opus 5 nieujawnione

• Kontekst — po 1 mln tokenów w obu; Claude Opus 5 ogranicza wyjście do 128K w Messages API i 300K w Batch API

• Modalność — MiMo-V2.6-Pro przyjmuje tekst, obraz, wideo i dźwięk; publikowany zakres danych wejściowych Claude Opus 5 to tekst i obraz

• Cena katalogowa — MiMo-V2.6-Pro 0,43 USD / 0,87 USD za 1 mln tokenów; Claude Opus 5 5,00 USD / 25,00 USD

• Pamięć podręczna — MiMo-V2.6-Pro podaje 99-procentowy rabat na pamięć podręczną; Claude Opus 5 odczytuje pamięć podręczną po $0.50 za 1 mln, a zapis kosztuje $6.25 przy TTL 5 minut

• Zmierzony koszt na zadanie Intelligence Index — MiMo-V2.6-Pro 0,13 USD; Claude Opus 5 5,86 USD

• Obsługa — MiMo-V2.6-Pro 134,3 tokenów wyjściowych na sekundę i 2,15 s do pierwszego tokenu; Claude Opus 5 57,9 tokenów na sekundę

Ta ostatnia para to ta, która ginie. Tańszy model jest także szybszy — o współczynnik 2,3 w przepustowości wyjściowej — ponieważ działa na sprzęcie kontrolowanym przez Xiaomi i jego partnerów i może agresywnie przetwarzać wsadowo. Claude Opus 5 przy maksymalnym wysiłku to model rozumujący, wykonujący więcej pracy na token; różnica w szybkości nie jest wadą, to inny produkt. Ale to oznacza, że ta tania ścieżka nie płaci za swoją zniżkę opóźnieniem. Płaci za nią pięcioma punktami indeksu i ogonem zadań, w którym żyje ten piąty punkt.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Gdzie tak naprawdę znajduje się pięć punktów

Pięciopunktowa różnica w kompozycie dziesięciu ewaluacji nie rozkłada się równomiernie, a agregat ukrywa to, co najważniejsze. Oba modele uruchomiono na tym samym zestawie v4.3.2, który obejmuje AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. Opublikowane strony nie podają wyników poszczególnych ewaluacji dla żadnego z modeli, co jest prawdziwym ograniczeniem po obu stronach tego porównania i warto o tym powiedzieć, zamiast zamiatać to pod dywan.

To, co jest odnotowane, ma charakter orientacyjny. Claude Opus 5 przy maksymalnym wysiłku uzyskał 49,0% w Terminal-Bench 4.0 w ramach zestawu v4.3, za GPT-6 Astra z 59,1% i Claude Fable 5.1 z 52,0%. W AutomationBench-AA Opus 5 ukończył każde zadanie bez naruszenia zabezpieczeń w 28,3% przepływów pracy, wobec 41,6% dla GPT-6 Astra i 32,1% dla Fable 5.1. To są twarde liczby dotyczące agentów i właśnie w tych kategoriach pięciopunktowa różnica w wyniku łącznym najprawdopodobniej nie rozkłada się równomiernie — własny wpis MiMo-V2.6-Pro w indeksie nie publikuje porównywalnego wyodrębnienia wyników agentowych.

Tymczasem liczby dostawców, które publikują obie firmy, nie są ze sobą porównywalne i warto powiedzieć wprost, dlaczego. Materiały premierowe Anthropic podają SWE-bench Verified na poziomie 96,0% i SWE-bench Pro na 79,2%; jeden z trackerów zauważa, że Opus 5 został wydany bez osobnego wpisu SWE-bench, a nie istnieje dla niego niezależnie audytowana wartość SWE-bench Verified. Materiały Xiaomi podają, że MiMo-V2.6-Pro przeszedł z 58,4 do 72,57 na DeepSWE v1.1 w trakcie swojego przebiegu RL, na własnym środowisku testowym Xiaomi z mini-swe-agent przy średniej z trzech, i nie został zgłoszony do publicznej tablicy DeepSWE. Dwa środowiska testowe dostawców, dwa różne zadania, brak nakładania się. Zestawienie 96,0% obok 72,57 i wyciągnięcie wniosku byłoby wymyślaniem porównania, które nie istnieje.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

Porównanie kosztów, zrobione jak należy

Kalkulacja kosztu na pojedynczy token zaniża tę różnicę, ponieważ oba modele nie zużywają tej samej liczby tokenów do wykonania tego samego zadania. Artificial Analysis zmierzyła, ile faktycznie kosztowało uruchomienie pełnego Intelligence Index w przypadku każdego z nich: 0,13 USD dla MiMo-V2.6-Pro i 5,86 USD dla Claude Opus 5. To 45-krotna różnica przy kontrolowanym, identycznym zestawie zadań i jest to najuczciwsza dostępna pojedyncza liczba, ponieważ oba modele zmierzono w ten sam sposób.

Teraz zestaw to z prawdopodobną pętlą produkcyjną. Przebieg agenta w 30 krokach, który odczytuje 200 000 tokenów kontekstu na krok i zapisuje 2 000 tokenów na krok, to 6 milionów tokenów wejściowych i 60 000 tokenów wyjściowych na przebieg. W Claude Opus 5 przy cenie katalogowej to 30,00 USD za wejście i 1,50 USD za wyjście — 31,50 USD na przebieg przed jakimkolwiek buforowaniem. W MiMo-V2.6-Pro to 2,58 USD za wejście i 0,05 USD za wyjście — 2,63 USD. Dzięki rabatom na pamięć podręczną oferowanym przez obu dostawców koszt wejścia załamuje się w obu modelach, a proporcja się przesuwa, a nie znika: 99% rabatu na pamięć podręczną w tanim modelu w porównaniu z odczytem z pamięci podręcznej za 0,50 USD w drogim modelu wciąż pozostawia drogi model o rząd wielkości z przodu w pętli intensywnie korzystającej z kontekstu.

Co stanowi cały argument za tanią ścieżką i przeciw całkowitemu przejściu. Jeśli Twoje obciążenie to pętla agenta o długim horyzoncie, która setki razy ponownie odczytuje ten sam kontekst, różnica kosztów na przebieg nie jest błędem zaokrąglenia — to różnica między funkcją, na której uruchamianie dla każdego użytkownika cię stać, a taką, na której nie. To argument za umieszczeniem MiMo-V2.6-Pro przed większością Twojego ruchu. Nie jest to argument za usunięciem Claude Opus 5, ponieważ zadania, w których piąty punkt indeksu się zwraca, są z założenia tymi zadaniami, w których porażka taniego modelu jest kosztowna.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

Jak tutaj wygląda decyzja o routingu

Claude Opus 5 jest dostępny poprzez pojedynczy klucz OrcaRouter w cenie listowej dostawcy z 0% marży, jako anthropic/claude-opus-5, a modele frontier, z którymi chciałbyś go porównać, znajdują się obok niego pod tym samym kluczem. Ponieważ przekazujemy cenę listową dostawcy bez marży, zmiana ceny przez dostawcę po którejkolwiek stronie obowiązuje u nas tego samego dnia, zamiast czekać na ponowną wycenę. Interesująca część tkwi w DSL routingu: możesz połączyć oba modele w jedno wywołanie, zamiast wybierać między nimi, wysłać większość obciążenia do taniej ścieżki i skierować resztę — zadania, które nie przejdą autoweryfikacji albo spełniają predykat złożoności — do droższej. Przełączanie awaryjne to druga połowa. Claude Opus 5 ma szerokie pokrycie dostawców; MiMo-V2.6-Pro był wymieniany przez jednego dostawcę API, gdy Artificial Analysis go odnotowało, co stanowi wąską trasę dla modelu, który chciałbyś umieścić na ścieżce produkcyjnej. Router, który potrafi przełączyć się awaryjnie, sprawia, że tania ścieżka jest bezpieczna do wdrożenia.

Warto powiedzieć to wprost, bo łatwo założyć inaczej: nie hostujemy MiMo-V2.6-Pro. Dostęp do niego dziś oznacza platformę samego Xiaomi albo jeden z katalogów firm trzecich, które go wymieniają. Argument dotyczący routingu mówi tu o tym, jak używasz modelu takiego jak ten obok tych, które rzeczywiście oferujemy, a nie o twierdzeniu, że jest to jeden z naszych.

Który wybrać

Wybierz Claude Opus 5, gdy koszt niepowodzenia zadania przewyższa koszt tokenów na tyle, że pięć punktów indeksu to tanie ubezpieczenie — praca agentowa o długim horyzoncie z realnymi skutkami ubocznymi, korzystanie z narzędzi, gdzie błędne wywołanie jest gorsze niż powolne wywołanie, cokolwiek, gdzie już płacisz człowiekowi za sprawdzanie wyników. Stawka 5,86 USD za zadanie indeksowe nie jest powodem, by go unikać; to cena tego poziomu, a ten poziom istnieje nie bez powodu.

Wybierz MiMo-V2.6-Pro, gdy ograniczeniem jest wolumen, gdy obciążenie jest mocno kontekstowe i powtarzalne, gdy chcesz mieć wagi we własnej infrastrukturze — licencja MIT pozwala na wdrożenie komercyjne, modyfikacje i dalsze trenowanie — albo gdy budujesz coś, czego ekonomika jednostkowa działa tylko przy jednej piątej centa za tysiąc tokenów. Jego 134,3 tokena na sekundę czyni go zdatnym do użytku interaktywnego w sposób, w jaki większość otwartych modeli o bilionie parametrów nie jest.

Wybierz oba, jeśli masz router, ponieważ uczciwa odpowiedź na pytanie „który jest lepszy” brzmi: nie konkurują o te same żądania. Tryb awarii, którego należy unikać, to ten, który kosztuje najwięcej: ustandaryzowanie na tanim modelu, bo nagłówkowy współczynnik wynosi 21x, odkrycie w trzecim miesiącu, że konkretna klasa żądań wymaga drogiego, i brak ścieżki, by ją tam skierować. Drugi tryb awarii to lustrzane odbicie — płacenie stawek Opus 5 za zadanie streszczania, które model o indeksie 46 kończy identycznie. Żaden z nich nie jest problemem związanym z modelem. Oba to problemy konfiguracji, a konfiguracja to ta część, którą możesz zmienić w zwykłe wtorkowe popołudnie.