Główna karta tytułowa z napisem „Xiaomi MiMo-V2.6-Flash już jest” nad podtytułem „309 mld otwartych wag, licencja MIT, kontekst 1 mln tokenów – opublikowano 21 września 2026 r.”, z czterema plakietkami w kształcie pigułek: „łącznie 309 mld / 15 mld aktywnych”, „173 GB wag FP8”, „kontekst 1 mln tokenów” oraz „w zestawie raport techniczny”.
Guides & Insights

Xiaomi MiMo-V2.6-Flash już dostępny: otwarty model 309B, który hostujesz samodzielnie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiMo-V2.6-Flash przestał być zadaniem treningowym 21 września 2026 o 15:39 UTC, kiedy zespół MiMo od Xiaomi opublikował checkpoint jako XiaomiMiMo/MiMo-V2.6-Flash-RL na Hugging Face — bez ograniczeń dostępu, na licencji MIT, z dołączonym raportem technicznym, 65 shardów wag w indeksie. XiaomiMiMo/MiMo-V2.6-Pro-RL pojawił się osiemnaście sekund później. Tydzień wcześniej oba modele były dwiema kartami oznaczonymi jako „zatrzymane" na publicznym dashboardzie treningowym, a szeroko powtarzana opinia na ich temat głosiła, że nie istnieją żadne wagi. Teraz są plikami, które każdy może pobrać i uruchomić. To realna zmiana w tym, co można zrobić z modelem, a to coś innego niż ogłoszenie o nim.

Zacznijmy od znacznika czasu, ponieważ wydanie pojawiło się bez zwykłej choreografii dostawcy. Własny blog Xiaomi, sprawdzony 22 września, wciąż pokazuje grudniową premierę MiMo-V2-Flash z 2025 r. jako najnowszy wpis. Nie ma eseju o premierze V2.6, opublikowanego cennika nowej generacji ani wywoływalnego identyfikatora modelu, który Xiaomi ogłosiłoby dla któregokolwiek z checkpointów. Istnieje repozytorium, raport techniczny, receptury wdrożeniowe i zestaw tabel benchmarków prowadzonych przez dostawcę — plus pewien złośliwy drobiazg w karcie modelu, który ma znaczenie tylko dla osób planujących faktycznie załadować tę rzecz.

Dwie karty, które możesz trzymać

Oba checkpointy są natywnie omnimodalne, z deklarowanym kontekstem o długości 1 mln tokenów, i oba są objęte licencją MIT — można ich używać komercyjnie, dostrajać, redystrybuować, bez progu przychodowego i bez klauzuli badawczej. Karta określa Flash jako „zrównoważony pod względem wydajności checkpoint” tej serii, a Pro jako flagowy model; ciekawe jest to, czym oba się różnią, gdy spojrzy się na konfiguracje, a nie na marketingowe zdanie.

• Liczba parametrów — MiMo-V2.6-Flash 309B łącznie, z 15B aktywowanych na token; MiMo-V2.6-Pro 1,02T łącznie, z 42B aktywowanych. Oba to rzadkie mieszaniny ekspertów.

• Backbone — Flash ma 48 warstw (39 z oknem przesuwnym, 9 globalnej uwagi), rozmiar ukryty 4096, 256 ekspertów routowanych z 8 aktywowanymi, okno przesuwne o rozmiarze 128 tokenów, brak współdzielonych ekspertów. Pierwszy blok to globalna uwaga z gęstą siecią feed-forward; wszystko po nim się przeplata.

• Enkodery — MiMo ViT z 681 mln parametrów (28 warstw, 24 z oknem przesuwnym oraz 4 pełne), tokenizator audio z 308 mln parametrów i enkoder patchy audio z 127 mln parametrów, dzięki czemu tekst, obraz, wideo i audio wchodzą do tego samego modelu, a nie do trzech poskręcanych ze sobą potoków.

• Dekodowanie spekulatywne — pięciowarstwowy szkicownik wielotokenowej predykcji w stylu DFlash, opisany w karcie jako przewidujący siedem tokenów z wyprzedzeniem na jeden przebieg w przód w celu równoległej weryfikacji.

• Pamięć masowa — opublikowany indeks podaje 172,9 GB danych wagowych w 65 shardach, w FP8 (e4m3) z dynamicznym schematem aktywacji. Przekłada się to na około dziewięć bajtów na parametr: Xiaomi udostępniło duży model, a nie jego skwantyzowaną wersję o rozmiarze laptopa.

Trzy liczby, które się nie zgadzają

Warto powiedzieć to wprost, ponieważ wszystkie trzy wpływają na decyzję o wdrożeniu, a nie na argument dotyczący benchmarku, i żaden z nich nie jest złowrogi — wyglądają jak rozbieżność w dokumentacji między opisem, stroną repozytorium a dostarczonymi plikami.

Pierwszym z nich jest dekoder spekulacyjny. Podsumowanie modelu mówi, że głowica MTP to pięciowarstwowy model szkicujący przewidujący siedem tokenów na przebieg. config.json w tym samym repozytorium ustawia num_nextn_predict_layers na 3. Obie te liczby nie mogą opisywać tego samego artefaktu, a to konfiguracja jest tym, co odczyta środowisko uruchomieniowe. Jeśli szacujesz pamięć na potrzeby dekodowania spekulacyjnego, zaufaj konfiguracji i zweryfikuj po załadowaniu.

Drugi jest subtelniejszy i wcale nie jest błędem jako takim, lecz raczej konwencją nazewnictwa, która czyta się jak błąd. Repozytorium nosi nazwę MiMo-V2.6-Flash-RL, co nasuwa założenie, że to adapter do uczenia ze wzmocnieniem, a nie model. To jest model. Sufiks -RL oznacza linię pochodzącą z fazy po treningu — ten checkpoint jest wynikiem mieszanego przebiegu RL, który Xiaomi transmitował na żywo, a nie LoRĄ siedzącą na wierzchu jakiegoś innego modelu bazowego. Indeks wag to potwierdza: dziesiątki tysięcy tensorów obejmujących cały szkielet, enkoder wizji, stos audio oraz drafter.

Trzecia to ta, na którą natrafisz najpierw, jeśli dobierasz sprzęt na podstawie strony repozytorium, a nie karty modelu. Blok Safetensors na tej stronie podaje 159 mld parametrów. To nie jest żadna z dwóch liczb z karty — ani 309B łącznie, ani 15B aktywnych — i to właśnie tę wartość osoba planująca zasoby najprawdopodobniej skopiuje, bo znajduje się obok przycisku pobierania. Xiaomi nie wyjaśniło tej różnicy i nie możemy jej rozstrzygnąć z zewnątrz; najbardziej prawdopodobne wyjaśnienie to konwencja liczenia skwantyzowanych tensorów, a nie inny model. Bezpiecznym rozwiązaniem jest dobieranie sprzętu na podstawie opublikowanych danych o wagach: 172,9 GB w formacie FP8 w 65 shardach to liczba, za którą trzeba zapłacić w VRAM niezależnie od tego, jak liczone są parametry.

Co mówią benchmarki i kto je przeprowadził

Każda liczba poniżej pochodzi z własnych tabel ewaluacyjnych Xiaomi w karcie modelu. Żadna z nich nie została niezależnie odtworzona, żadna nie pojawia się w publicznym rankingu, a kolumny porównawcze to własne przebiegi tych samych zestawów testów wykonane przez dostawcę na modelach innych firm. Traktuj kształt wyników jako informacyjny, a miejsca po przecinku jako dekorację.

• Agent kodujący — DeepSWE v1.1: Flash 67,9, Pro 71,9, w porównaniu z Claude Opus 5 na poziomie 74,0, GPT-5.6 Sol na poziomie 73,0 i Claude Fable 5 na poziomie 70,0. W Terminal Bench 2.1 Flash osiąga 87,6 wobec 89,1 Claude'a Opus 5 — różnica na tyle niewielka, że o wyniku decydować może nie model, lecz środowisko testowe.

• Agent ogólny — AutomationBench v1.0.6 plasuje Flasha na 52,3, powyżej zarówno GPT-5.6 Sol (45,8), jak i Claude Opus 5 (50,3) w teście Xiaomi. Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.

• Cyberbezpieczeństwo — najbardziej asymetryczna kolumna w tabeli. CyberGym: Flash 95,1, powyżej własnego większego brata z wynikiem 94,0, a MiMo-V2.5-Pro osiąga 40,0. Potem podłoga się urywa: ExploitGym 6,0 dla Flasha wobec 22,1 dla Opus 5, ExploitBench 25,3 wobec 70,0, SEC Bench Pro 47,5 wobec 79,1 dla GPT-5.6 Sol.

• Agent wizualny — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.

Jedna liczba zasługuje na wyodrębnienie, bo to właśnie taki szczegół, jaki zwykle ukrywa wpis o premierze. Panel RL Xiaomi opublikował Flash na poziomie 65.68 w DeepSWE v1.1 — a karta modelu podaje teraz 67.9 dla tego samego benchmarku na gotowym checkpointcie. To nie ten sam pomiar. Liczba z panelu była oznaczona jako mini-swe-agent, avg@3, na snapshocie treningowym; tabela na karcie to ewaluacja offline wydanych wag przeprowadzona przez dostawcę. Różnica dwóch punktów to zysk z ostatniej części przebiegu plus wszystko, co zmieniło się w konfiguracji ewaluacji, a nikt poza Xiaomi nie potrafi obecnie rozdzielić tych dwóch rzeczy. Jeśli cytujesz 65.68 od zeszłego tygodnia, jest to teraz nieaktualna liczba dotycząca innego artefaktu.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

Ile kosztuje faktyczne uruchomienie tego

Otwarte wagi to licencja, a nie rachunek, i właśnie tutaj wydanie staje się mniej radosne. Sekcja wdrożeniowa samej karty zaleca SGLang (równoległość tensorowa 16, równoległość danych 2, z włączoną wielowarstwową ścieżką spekulacyjną w stylu EAGLE) lub przepis vLLM przy równoległości tensorowej 8, i zauważa, że stabilny vLLM może nie nadążać za architekturą. To zadanie serwowania na wielu węzłach dla modelu 309B, którego wagi zajmują około 173 GB, zanim doliczy się pamięć podręczną KV dla kontekstu 1 mln tokenów. Zalecane próbkowanie to temperatura 1.0, top_p 0.95.

Uczciwe ujęcie „open source” w tym przypadku jest takie: Xiaomi usunęło barierę licencyjną, a barierę sprzętową pozostawiło dokładnie tam, gdzie była. Dostrajanie Flasha na własnych śladach jest teraz legalne i możliwe; robienie tego na czymkolwiek mniejszym niż poważny węzeł GPU już nie. To realna i odmienna oferta od hostowanego endpointu i dlatego dwa sposoby korzystania z tej generacji nie konkurują ze sobą — obejmują różne budżety.

Jeśli chcesz tę możliwość bez węzła, modelami, z którymi Xiaomi porównuje się w tej tabeli, są praktyczna alternatywa: GPT-5.6 Sol, Claude Opus 5 i Claude Fable 5 można wywołać już dziś, a dostęp do nich to jeden klucz API w cenie katalogowej dostawcy z 0% marży przekazywanej przez OrcaRouter, więc decyzja, którą tak naprawdę podejmujesz, to „kupić węzeł” czy „rozliczać wywołania”. Jeśli chcesz zobaczyć, jak warstwa możliwa do wywołania wypada w tych samych zadaniach programistycznych, zanim zaangażujesz się w którąkolwiek ze stron, tablica programistyczna jest szybszą lekturą niż tabela dostawcy. Czego natomiast nie możesz dziś zrobić na żadnym routerze, to wywołać samego MiMo-V2.6-Flash — nie routujemy żadnego modelu Xiaomi, a wiersz o dostępności w karcie samego Xiaomi wskazuje na kanały Xiaomi: platformę MiMo API, AI Studio, MiMo Code i aplikację desktopową.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

Kwestia cenowa jest wciąż otwarta

Xiaomi nie opublikowało stawki za token dla MiMo-V2.6-Flash. Relacje z premiery mówią, że seria zachowa cennik API MiMo-V2.5, a to twierdzenie prasowe, a nie cennik producenta — opublikowane zagraniczne stawki generacji V2.5 wynosiły około jednej dziesiątej dolara za milion tokenów wejściowych, a wejście z pamięci podręcznej było o rząd wielkości tańsze, ale nic na stronie Xiaomi nie potwierdza, że nowe checkpointy je dziedziczą. Dopóki nie pojawi się cennik, każda liczba, jaką zobaczysz dla endpointu MiMo-V2.6, jest czyimś domysłem.

Brakuje jeszcze dwóch rzeczy i obie znajdują się na liście zadań samego Xiaomi, a nie kogokolwiek innego. Podczas transmisji na żywo o RL Luo Fuli stwierdziła, że środowiska treningowe i kod RL zostaną udostępnione jako open source, a materiał premierowy powtarza to zobowiązanie; repozytoria zawierają obecnie wagi, raport techniczny i instrukcje wdrożenia, a nie stos treningowy. Brak też niezależnej oceny: żadnego zgłoszenia do rankingu, żadnego ponownego uruchomienia przez strony trzecie kolumn DeepSWE lub CyberGym. To właśnie ta luka ma największe znaczenie dla każdego, kto decyduje, czy model 309B z aktywnym budżetem 15B jest wart węzła.

Co zmieniłoby obraz sytuacji

Warto obserwować trzy sygnały, w przybliżonej kolejności według tego, jak mocno przesunęłyby decyzję. Opublikowany cennik zamienia to z projektu self-hostingowego w pozycję w budżecie, którą można porównać z hostowaną czołówką. Uruchomienie przez stronę trzecią na tych samych zestawach testowych — DeepSWE lub Terminal Bench, zgłoszone, a nie podane samodzielnie — rozstrzygnęłoby, czy 67,9 to rzeczywista pozycja, czy korzystna konfiguracja. A środowiska RL, jeśli się pojawią, byłyby ciekawszym artefaktem dla większości zespołów, ponieważ to ich właśnie potrzeba, aby odtworzyć pętlę samodoskonalenia na własnych danych.

Do tego czasu praktyczna interpretacja tego wydania jest wąska i jasna. MiMo-V2.6-Flash to prawdziwy model agentowy o otwartych wagach, na licencji MIT, omnimodalny, o rozmiarze, który zakłada klaster — i jest to pierwszy checkpoint w generacji MiMo-V2.6, który można trzymać w rękach, a to więcej, niż można było o nim powiedzieć w zeszłym tygodniu.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie