Główna karta tytułowa artykułu „MiMo-V2.6: Co pokazuje praca o RL”, z nadtytułem „RAPORT TECHNICZNY” i podtytułem „Raport Xiaomi o mieszanym RL — odczytany pod kątem tego, co weryfikuje, a czego nie”. Cztery zaokrąglone etykiety zawierają napisy „Zamrożony router MoE”, „Koszt oceniającego 12,7%”, „DeepSWE od 58,4 do 72,6” i „Indeks AA 46”. Wiersz stopki zawiera tekst „Wartości DeepSWE zgłoszone przez dostawcę; indeks AA 46 zmierzony przez Artificial Analysis.” Logo OrcaRouter jest wkomponowane w prawym dolnym narożniku.
Guides & Insights

MiMo-V2.6: Co tak naprawdę pokazuje praca Xiaomi o RL i co pozostawia niezweryfikowane

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Większość publikowanych w tym miesiącu artykułów o modelach to artykuły o architekturze. Raport techniczny stojący za Xiaomi MiMo-V2.6-Pro i Xiaomi MiMo-V2.6-Flash nie jest. Zatytułowany MiMo-V2.6: Skalowanie uczenia ze wzmocnieniem w kierunku samodoskonalenia, przesłany 21 września 2026 r. i przypisany do LLM-Core Xiaomi, niemal wcale nie poświęca miejsca szkieletowi rzadkiej mieszaniny ekspertów, a niemal całą swoją objętość poświęca jednemu pytaniu: co się dzieje, gdy cały budżet po treningu trafia do jednego mieszanego przebiegu uczenia ze wzmocnieniem. Raport DeepSeek-V4.1-Flash z kolei jest dokumentem poświęconym pamięci — jego objętość poświęcona jest skompresowanej rzadkiej uwadze, ponownemu wykorzystaniu KV między warstwami i przechowywaniu FP4. Zestaw je obok siebie, a okażą się argumentami o tym, skąd biorą się możliwości, i nie są zgodne.

Raport jest wart przeczytania na własnych warunkach, ale wart jest też uważnej lektury, bo jest samoopisem laboratorium, które przeprowadziło ten przebieg. Nazywa swoje mechanizmy, pokazuje swoje ablacje, publikuje swoje niepowodzenia i tym samym tchem podaje liczby, których nie da się zweryfikować z zewnątrz. Oddzielenie tych dwóch rzeczy to większość pracy. Ten tekst to robi, a został napisany 23 września 2026 r. — dwa dni po tym, jak checkpointy zostały udostępnione, gdy artykuł jest najnowszą i najsłabiej potwierdzoną rzeczą na ich temat.

Dlaczego data na papierze ma większe znaczenie niż zwykle

Punkty kontrolne MiMo-V2.6-Pro i MiMo-V2.6-Flash od Xiaomi trafiły do hubu modeli 21 września 2026 r. z licencją MIT i bez ograniczeń dostępu. Raport jest datowany na ten sam dzień i osiągnął szczyt listy trendów w serwisie preprintów, w którym został opublikowany. Ten moment jest powodem, dla którego to materiał newsowy, a nie retrospekcja: praca nie jest późniejszym wyjaśnieniem modelu, który wszyscy już zbenchmarkowali. Pojawia się wraz z wagami, zanim ktokolwiek spoza Xiaomi opublikował niezależne uruchomienie.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Taka kolejność jest również główną słabością tego artykułu jako dowodu. Wszystko, co z niej wynika — krzywa DeepSWE, wzrosty współczynnika zaliczeń, obrona przed reward hackingiem — to twierdzenie o procesie treningowym, który zaszedł raz, w jednym laboratorium, na jednym klastrze i którego nikt inny nie odtworzył. Wątek, który zwrócił uwagę na raport, uznaje to za najciekawszy element: to artykuł o danych i eksperymentach, a nie o architekturze, a eksperymenty to dokładnie ten rodzaj wyniku, który albo się replikuje, albo nie.

Trzy osie skalowania, a tylko jedna z nich to problem sprzętowy

Sposób ujęcia w raporcie jest taki, że obliczenia w uczeniu ze wzmocnieniem skalowano jednocześnie wzdłuż trzech osi, a trzecia z nich to ta, która zmienia sposób myślenia o tej metodzie.

• Partia i przepustowość — 1 568 próbek na aktualizację, z których każda jest rozwijana do szesnastu rolloutów, co daje około 25 000 trajektorii na krok i zużywa od 2,7 do 3,7 miliarda tokenów na krok przy długościach kontekstu sięgających miliona tokenów. Architektura rolloutów jest w pełni asynchroniczna, co sprawia, że taki rozmiar partii jest w ogóle możliwy do udźwignięcia.

• Środowiska — pojedynczy mieszany przebieg obejmujący zadania z zakresu kodu, ogólnych agentów, wizji oraz cyberbezpieczeństwa, prowadzony jednocześnie w ramach kilku systemów obsługi agentów, zamiast osobnych przebiegów RL dla poszczególnych domen. Własny skrót Xiaomi na to to „You Only RL Once”. Argument za mieszaniem jest taki, że zyski w jednej zdolności wzmacniają pozostałe; ryzyko polega na tym, że wolny typ zadań zostanie zagłodzony, co — jak podaje raport — jest rozwiązywane za pomocą adaptacyjnego szeregowania.

• Moc obliczeniowa oceniającego — oś, która nie dotyczy GPU w zwykłym sensie. Binarne zaliczenie/niezaliczenie nie pozwala uszeregować dwóch rozwiązań, które oba przechodzą, więc sam sygnał nagrody staje się tym, co się skaluje. Agentowy grader porównuje szesnaście prób dla zadania łącznie i tworzy sygnał stopniowany zamiast bitu.

Ta trzecia oś to miejsce, w którym sformułowanie „self-improvement” w tytule zyskuje uzasadnienie, i zarazem miejsce, w którym raport jest najbardziej odsłonięty. Model oceniający własne rollouty to powierzchnia reward hackingu, a raport traktuje go właśnie jako taką.

Dwa mechanizmy, które naprawdę warto zrozumieć

Grupowa redystrybucja korzyści

Po każdym kroku polityka generuje szesnaście prób na zadanie, a wszystkie z nich trafiają do wspólnej przestrzeni roboczej, aby model oceniający mógł przeanalizować je razem, a nie pojedynczo. Poprawki, które przeszły, są następnie oceniane w pięciu wymiarach: czy podejście pasuje do problemu, czy implementacja jest precyzyjna i pozbawiona niepotrzebnych mechanizmów awaryjnych, czy zmiana jest minimalna, czy nie modyfikuje niczego poza zakresem oraz czy pasuje do stylu otaczającego kodu. Te z poprawek, które przeszły, ale uplasowały się niżej, otrzymują mniej pozytywnego wzmocnienia. Poprawka potwierdzona jako hack zostaje wyzerowana i potraktowana jako niepowodzenie.

Konsekwencją jest sygnał treningowy, który skłania ku krótszym, tańszym rozwiązaniom, a nie tylko poprawnym — raport ujmuje to jako sterowanie w stronę mniejszej liczby tokenów na zadanie. To jest ta część, którą warto zapamiętać, ponieważ główne wyniki przedstawione później w artykule wskazują w przeciwnym kierunku.

Grupowa synteza nagród

Offline’owa połowa tego samego pomysłu. Zamiast czerpać jakość wyłącznie z oceniającego działającego na żywo, zespół wstępnie oblicza rubryki dla poszczególnych zadań i mnoży binarną nagrodę testową przez oceny jakości i zachowania czerpane z tych rubryk. Raport opisuje to jako budowanie rubryk na podstawie kontrastujących przebiegów — to znaczy z przypadków, w których wynik się różnił, bo właśnie tam znajduje się informacja.

Ocenianie nie jest darmowe. Raport szacuje koszt oceniających na około 12,7% całkowitego kosztu uczenia ze wzmocnieniem MiMo-V2.6-Pro. Ta jedna liczba jest najużyteczniejszą rzeczą w artykule dla każdego, kto rozważa skopiowanie tej metody, ponieważ zamienia „skaluj swoich oceniających” z pomysłu w pozycję kosztową.

Zamrożony router to wynik, który większość zespołów skopiuje w pierwszej kolejności.

Sekcja raportu dotycząca stabilności zawiera ustalenie, które broni się samo — niezależne od MiMo-V2.6 i niezależne od tego, jak dobrze radzi sobie model.

W przypadku trenowalnych routerów mieszaniny ekspertów obciążenie ekspertów mocno dryfowało przez dwadzieścia kroków. Współczynnik zmienności między ekspertami wzrósł z 0,78 do 2,0. Szczytowe obciążenie najbardziej obciążonego eksperta wzrosło z sześciokrotności średniej do szesnastokrotności. Udział zimnych ekspertów — tych, do których trafia niemal żaden ruch — wzrósł z 0,5% do 22%. Przywrócenie wag routerów do ich wartości początkowych w kroku 20 natychmiast przywróciło równowagę.

Odpowiedzią Xiaomi było zamrożenie routera MoE na czas tego przebiegu. Tok rozumowania nie jest subtelny: przy tej skali batcha niestabilność routingu to problem dynamiki treningu, którego można po prostu nie mieć, a router nie jest miejscem, w którym uczenie ze wzmocnieniem wykonuje swoją pracę. To, czy zamrożenie kosztuje coś w końcowej jakości, nie zostało rozstrzygnięte przez ablację w opublikowanym materiale, a to całkiem zrozumiałe, że chce się to wiedzieć.

To, czego odkrycie nie mówi, to nic na temat serwowania. Równoważenie obciążenia routera podczas przebiegu treningowego i wykorzystanie ekspertów w ruchu produkcyjnym to różne pytania, a raport odnosi się tylko do pierwszego.

Liczby wraz z dołączonymi do nich etykietami

Główne wyniki raportu są przejrzyste w zarysie, a chaotyczne w szczegółach, i ten chaos nie jest skandalem — to trzy różne pomiary trzech różnych obiektów, które noszą tę samą nazwę.

• DeepSWE v1.1, zbiór wydzielony — MiMo-V2.6-Pro wzrósł z 58,4 do 72,6 w trakcie przebiegu; MiMo-V2.6-Flash z 48,7 do 65,7. Benchmark obejmuje 113 długoterminowych zadań inżynierii repozytoriów ocenianych przez weryfikatory funkcjonalne w pięciu językach programowania, a metryką jest average@3 — średni wskaźnik zaliczeń weryfikatora w trzech pobranych próbach, co nie jest tym samym, co informacja, czy któraś z trzech prób zakończyła się sukcesem. Interpretowanie avg@3 jako pass@3 zawyży każdą liczbę na tej stronie.

• Ten sam benchmark, mierzony gdzie indziej — opublikowane karty modeli podają 71,9 dla Pro i 67,9 dla Flash. Publiczny panel treningowy Xiaomi podawał 72,57 i 65,68. Mamy więc trzy opublikowane wartości na model, dwie z nich od Xiaomi, a kierunek rozbieżności jest inny dla każdego z modeli z tej samej rodziny. Żadna z nich nie jest błędna; opisują one zrzut z panelu, wpis w karcie i wiersz raportu, z różnych momentów i prawdopodobnie w różnych środowiskach testowych.

• Destylacja — MiMo-V2.6-Distill-Qwen-9B, dostrojony na bazie Qwen3.5-9B na demonstracjach wygenerowanych przez MiMo, podniósł wynik SWE-bench Verified z 61,1 do 66,2. To najbardziej przenośna liczba w artykule, ponieważ student 9B to rozmiar, który większość zespołów faktycznie może uruchomić.

• Wewnętrzny mini-benchmark cyberbezpieczeństwa — od 31,3 do 47,0. Wewnętrzny znaczy wewnętrzny: zadania nie są publikowane, więc tej różnicy nie da się odtworzyć nawet w zasadzie.

• The Artificial Analysis Intelligence Index — 46 dla MiMo-V2.6-Pro. Ten jest innego rodzaju. Został wytworzony przez Artificial Analysis w wyniku uruchomienia własnego harnessu na opublikowanym checkpointcie, a nie przez Xiaomi, co czyni go jedyną główną liczbą w tym wydaniu, którą czytelnik może uznać za zmierzoną, a nie zaraportowaną. Jest to także liczba, z którą należy porównywać GLM-5.3, Kimi K3 i zamknięty frontier, i plasuje się pięć punktów poniżej Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

Raport jest uczciwy co do ograniczeń własnej tabeli, a to jest zdanie, które warto przytoczyć każdemu, kto taki nie jest: porównania mieszają publiczne i wewnętrzne benchmarki i nie izolują wkładu uczenia ze wzmocnieniem od architektury lub pretrenowania. Model, który jest lepszy po RL, nie jest dowodem, że to RL jest przyczyną.

Jest jeszcze drugie zastrzeżenie — i to właśnie ono przeczy przyjętemu ujęciu. Raportowane korzyści na ogół idą w parze z rosnącym zużyciem tokenów. Raport przedstawia to jako trwałą poprawę możliwości, a nie jako efektywność, i słusznie. Ale GAR został wyraźnie zaprojektowany, by skłaniać ku krótszym ścieżkom i mniejszej liczbie tokenów na zadanie, a wynik zbiorczy nie pokazuje, żeby obciążenie pracą taniało. Możliwości wzrosły; koszt na zadanie nie spadł. Jeśli czytasz „self-improvement” jako „model będzie potrzebował mniej moich pieniędzy w następnym kwartale”, artykuł nie wspiera takiej interpretacji.

Co raport pozostawia niezweryfikowane

Na dzień 23 września 2026 r. żadna strona trzecia nie opublikowała niezależnego powtórzenia kolumn DeepSWE, Terminal Bench lub CyberGym. Istotne rozróżnienie zachodzi między punktem indeksu a wszystkim innym: 46 to pomiar dokonany przez kogoś innego, a 72,6 to twierdzenie o przebiegu trenowania, którego nikt nie może ponownie wykonać, ponieważ ten przebieg kosztował według doniesień 2,6 mln USD dla Pro i 0,9 mln USD dla Flash i nie zdarzy się drugi raz.

To, co Xiaomi faktycznie opublikowało, a czego większość laboratoriów nie publikuje, to dynamika treningu, framework uczenia ze wzmocnieniem i środowiska zadaniowe — ponad 7000 stopniowanych środowisk obejmujących inżynierię oprogramowania, reprodukcję podatności, pracę wiedzową i projektowanie stron internetowych. To artefakt o najdłuższej trwałości. Wagi mówią, co dany przebieg wytworzył; środowiska mówią, jak samodzielnie przeprowadzić eksperyment — a to jedyny sposób, w jaki kiedykolwiek rozstrzyga się jakiekolwiek twierdzenia dotyczące uczenia ze wzmocnieniem.

Obrona przed hakowaniem nagrody zasługuje na konkretne zastrzeżenie. Opisuje się ją jako wielowarstwową — projektowanie nagród, ewaluacja adwersarialna, wykrywanie anomalii i wzajemne sprawdzanie między weryfikatorami — a opisuje ją w całości strona, którą porażka tej obrony wprawiłaby w zakłopotanie. Obrona przed tym, że model oszukuje oceniającego opartego na modelu, nie jest czymś, co samoopis może zamknąć. Mechanizm został nazwany, a tryb awarii przyznany, co jest więcej, niż robi większość prac, a mimo to wciąż pozostaje to kwestią otwartą.

Co tak naprawdę możesz z tym dzisiaj zrobić

Oba checkpointy można pobrać bez ograniczeń, oznaczone licencją MIT: Xiaomi MiMo-V2.6-Pro-RL i Xiaomi MiMo-V2.6-Flash-RL, omnimodalne, z kontekstem o długości miliona tokenów, przy czym indeks Flash podaje 172,9 GB danych wagowych w 65 shardach w FP8. Xiaomi nie opublikowało cennika stawek za token dla generacji V2.6, więc dzisiejszy wybór to samodzielny hosting kontra hostowany model, za który już płacisz.

To właśnie w tym porównaniu tkwi rzeczywista wartość artykułu i jest to niepochlebne dla artykułu w użyteczny sposób. Sprawdzana teza to nie „czy MiMo-V2.6-Pro jest dobry” — na to odpowiada 46 odpowiedzi. Chodzi o to, „czy uczenie ze wzmocnieniem na mieszanych zadaniach agentowych daje rozumowanie, które przenosi się na moje obciążenie”, a jedynym uczciwym sposobem, by na to odpowiedzieć, jest uruchomienie obu i porównanie, co jest problemem routingu, zanim staje się problemem badawczym. DeepSeek-V4.1-Flash dzieli od ciebie jeden klucz API, w cenie $0.15 i $0.60 za milion tokenów, Qwen3.8-Flash i GLM-5.3-Flash znajdują się pod tym samym kluczem, a jeśli chcesz umieścić samodzielnie hostowany checkpoint MiMo za tym samym endpointem na tydzień i zobaczyć, czy krzywa DeepSWE pojawi się w twoich własnych ewaluacjach, to zmiana konfiguracji, a nie migracja. OrcaRouter nie hostuje modeli Xiaomi i nic tutaj nie powinno być odczytywane jako twierdzenie inaczej — ale modele, z którymi chciałbyś je porównywać, są wszystkie osiągalne przez jeden klucz API OrcaRouter w cenie katalogowej dostawcy z 0% narzutu przekazywanego dalej, z automatycznym przełączaniem awaryjnym, jeśli testowany checkpoint okaże się niestabilny pod obciążeniem.

Przypadek nieudowodnionego modelu to ten, dla którego zbudowano failover. Checkpoint opublikowany dwa dni temu, z oceną przeprowadzoną przez dostawcę i bez niezależnego ponownego uruchomienia, jest dokładnie tym, co chcesz wypróbować, nie stawiając za nim ścieżki produkcyjnej.

Kto powinien przeczytać tę pracę

Jeśli prowadzisz post-training, przeczytaj to ze względu na odkrycie dotyczące routera i wartość kosztu graderu. Oba są przenośne, oba są tanie w przetestowaniu i żadne z nich nie wymaga wiary w cokolwiek na temat tabeli wyników MiMo-V2.6. Zwłaszcza wynik zamrożonego routera to coś, czego wypróbowanie kosztuje jedno popołudnie, a oszczędza cały przebieg.

Jeśli wybierasz model, przeczytaj punkt indeksowy i pomiń resztę. Artificial Analysis zmierzyło 46 na udostępnionym artefakcie; to jedyna liczba w tej publikacji, która nie pochodzi od dostawcy, i plasuje MiMo-V2.6-Pro na szczycie stawki modeli z otwartymi wagami oraz o pięć punktów za Claude Opus 5. Wszystko inne w raporcie opisuje, jak Xiaomi do tego doszło, a to, jak Xiaomi do tego doszło, nie jest czymś, co można kupić.

A jeśli czytasz omówienia, a nie sam artykuł, rzeczą, na którą warto uważać, jest słowo „self-improvement”. Same wyniki raportu pokazują, że zdolności rosną wraz ze zużyciem tokenów, co jest prawdziwym i powtarzalnym ustaleniem dotyczącym skalowania uczenia ze wzmocnieniem. Nie jest to twierdzenie, że uruchamianie modelu stało się tańsze, a kolejne artykuły po nim powiedzą ci, czy ostatecznie tak się stanie.