
Xiaomi MiMo-V2.6-Pro: wynik 72,57 w DeepSWE, przebieg, który się zatrzymał, i wciąż brak daty premiery
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro zakończył swój publicznie transmitowany przebieg uczenia ze wzmocnieniem 20 września, uzyskując wynik DeepSWE v1.1 wynoszący 72,57 widniejący na własnym panelu Xiaomi — 1,4 punktu poniżej 74%, które GPT-6 Astra, Gemini 3.8 Flash i Claude Opus 5 współdzielą na szczycie tego samego rankingu. Xiaomi MiMo-V2.6-Flash, mniejszy model trenowany obok niego, zatrzymał się 19 września na poziomie 65,68. Oba przebiegi zakończyły się na kroku 30, a łączny rachunek, który Xiaomi opublikowało razem z nimi, wynosił 3 474 715 USD, gdy przechwyciliśmy stronę dziś rano.
To wszystko, jeśli chodzi o dobre wieści, i są one naprawdę dobre. Reszta historii to luka między liczbą a produktem. Ani Xiaomi MiMo-V2.6-Pro, ani Xiaomi MiMo-V2.6-Flash nie mają daty premiery, karty modelu, identyfikatora API, opublikowanej ceny ani zestawu wag do pobrania. Nie ma punktu końcowego, który można wywołać. Istnieje natomiast panel treningowy, który każdy może oglądać, wynik benchmarku uzyskany przez własne narzędzie testowe Xiaomi oraz społeczność, która spędziła sześć dni, czytając stronę telemetryczną tak, jak dawniej czytano z liści herbaty.
To materiał typu „co wiemy do tej pory”, a jego uczciwa wersja rozdziela trzy rzeczy, które ostatni tydzień doniesień po cichu mieszał: to, co Xiaomi oficjalnie podało, to, co na ten temat przekazał pojedynczy obserwator, oraz to, co z tego wszystkiego wynika dla kogoś, kto dziś wybiera model do kodowania.
Co Xiaomi faktycznie opublikowało w internecie
16 września zespół MiMo, kierowany przez Luo Fuli, uruchomił na własnej domenie Xiaomi stronę na żywo, pokazującą w czasie rzeczywistym trening końcowy dwóch niepublikowanych modeli: liczbę kroków, krzywe nagród, przepustowość tokenów, liczbę sandboxów, komunikaty o awariach GPU oraz licznik kosztów, który rośnie na oczach widzów. Jak wynika z relacji, Xiaomi przedstawia to tak, że spędziło około sześciu miesięcy, pracując nad jednym pytaniem — jak daleko można skalować uczenie ze wzmocnieniem — i zdecydowało się przeprowadzić ten eksperyment publicznie, zamiast ogłaszać wynik.
Panel jest niezwykle szczery jak na materiał dostawcy. W kanale powiadomień wymienia własne awarie: restart Pro na kroku 17 spowodowany błędem braku pamięci GPU wynikającym z nierównowagi obciążenia ekspertów, który zespół — jak twierdzi — naprawił, dostosowując strategię równoległości trenowania; awarię łączności sieciowej między klastrem treningowym Pro a wdrożeniem oceniającym, która wymusiła restart i decyzję o usunięciu zbioru danych cyber z nadchodzącego uruchomienia Pro po „złych wzorcach w logach wdrożenia”; restart Flash od kroku 15 po tym, jak pewna klasa błędu infrastruktury pozostawała niewykryta przez około trzy godziny; oraz restart Pro z powodu awarii VRAM na pojedynczym węźle. Zauważa również, że zadania uznane za „stosunkowo łatwe dla obecnego modelu pro” zostały odfiltrowane — przyznanie, które większość raportów po treningu pomija.

Dwie karty przebiegu są tym, co ma znaczenie dla każdego, kto śledzi czasy. Oba modele są oznaczone jako zatrzymane: MiMo-V2.6-Pro po 5 dniach i 7 godzinach czasu rzeczywistego, MiMo-V2.6-Flash po 3 dniach i 11 godzinach, każdy na kroku 30, odpowiednio 20 września i 19 września. Pro zużył 75 mld tokenów i 753 tys. próbek za swoje 2,62 mln USD; Flash zużył 81,4 mld tokenów za 854 tys. USD. Każdy krok pobiera partię 1 568 promptów z 16 rolloutami na prompt — 25 088 trajektorii na krok, przeprowadzanych w pełni asynchronicznie.
Warto powiedzieć wprost: Xiaomi nie powiedziało, czy „stopped” oznacza, że przebieg został zakończony, wstrzymany czy zapisany w punkcie kontrolnym. Zatrzymana karta nie jest powiadomieniem o zakończeniu, a nikt spoza zespołu nie wie, o który z tych przypadków chodzi.
Co jest potwierdzone, a co nie
72,57 nie jest plotką. Widnieje na pulpicie Xiaomi, na wykresie oznaczonym DeepSWE v1.1, mini-swe-agent, avg@3, obok pomarańczowej krzywej przebiegu Pro. Wartość 65,68 modelu Flash znajduje się na tym samym wykresie. Liczba ta pojawia się również — jako 62,24, a później 65,97 — we wcześniejszych zrzutach tego samego panelu, co nadaje krzywej jej kształt: stały wzrost przez 30 kroków, a nie pojedyncza szczęśliwa ewaluacja.
To, co ma charakter wyłącznie raportowy, jest punktem wyjścia. Twierdzenie krążące na X 21 września, z konta @nrehiew_, głosi, że model Pro przeszedł „z 58,41 do 72,57” w DeepSWE i że przebiegi zostały ukończone. Punkt końcowy dokładnie zgadza się z panelem dostawcy. Wartość bazowa 58,41 to odczyt tego konta dotyczący miejsca, w którym zaczyna się krzywa — najbardziej wysunięty na lewo punkt Pro na wykresie rzeczywiście znajduje się w górnej części przedziału 50 — a Xiaomi nie opublikowało wartości dla kroku 1. Twierdzenie o ukończeniu jest również interpretacją dwóch kart oznaczonych jako zatrzymane, co jest uzasadnionym odczytem, a nie stwierdzeniem Xiaomi. Poprawę o 14 punktów traktuj jako solidną kierunkowo, ale przybliżoną liczbowo.

Jest jeszcze jedno rozróżnienie, które omówienie pominęło, i to właśnie ono decyduje, ile ta liczba jest warta. Panele benchmarkowe na dashboardzie to własne ewaluacje Xiaomi: firma uruchomiła harness na własnych checkpointach i opublikowała wyniki. Harness jest tym samym, którego używa publiczny leaderboard — mini-swe-agent, DeepSWE v1.1 — co czyni tę liczbę bardziej porównywalną, niż gdyby pochodziła z własnego benchmarku dostawcy. Ale samodzielnie przeprowadzona ewaluacja nie jest pozycją w leaderboardzie, a 72.57 nie pojawia się na tablicy Datacurve, ponieważ nikt jej nie zgłosił.
Pułap 74% jest ciaśniejszy, niż sugeruje nagłówek
Co pozwala wyraźniej skupić się na tym porównaniu. Ranking DeepSWE v1.1 firmy Datacurve, ostatnio zaktualizowany 3 września 2026 r., obejmuje 113 zadań w 91 repozytoriach w pięciu językach, a jego trzy najlepsze konfiguracje zajmują ex aequo pierwsze miejsce z wynikiem 74% Pass@1: GPT-6 Astra przy xhigh wysiłku rozumowania, Gemini 3.8 Flash przy high i Claude Opus 5 przy max. Interesujące są liczby, które widnieją obok tych wyników.
• Pewność — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. W tym samym rankingu GPT-5.6 Sol plasuje się na poziomie 73% ±3, a GLM-5.3 i Kimi K3 na 69%. Przedziały te nakładają się na siebie jeszcze długo po drugim miejscu po przecinku.
• Koszt na zadanie — Gemini 3.8 Flash średnio 2,36 USD, GPT-6 Astra 6,52 USD, Claude Opus 5 11,84 USD. Wykres samej tablicy wyników wskazuje Gemini 3.8 Flash jako najefektywniejszą konfigurację w tym zestawieniu, a różnica między tymi trzema wynosi około pięć do jednego w przypadku wskaźnika zaliczeń, którego benchmark nie potrafi rozróżnić.
• Kroki — Gemini 3.8 Flash potrzebował średnio 166 kroków agenta na zadanie, Claude Opus 5 — 99, GPT-6 Astra — 29. Remisowy wynik ukrywa trzy bardzo różne style pracy, a ten tani pracuje najciężej.

Więc kiedy zgłoszone 72,57 opisuje się jako „zbliżanie się do szczytu tabeli”, dokładniejsza wersja jest węższa i mniej dramatyczna. Mieści się w granicach około półtora punktu od remisu trzech modeli, których nie da się od siebie oddzielić za pomocą własnych słupków błędów benchmarku. To mocny wynik dla modelu wciąż znajdującego się na etapie post-trainingu, uzyskany przez dostawcę, a nie przez opiekunów benchmarku, na tablicy, do której model nie został zgłoszony. Ostatnia aktualizacja rankingu poprzedza w całości test Xiaomi, dlatego żaden wpis MiMo jeszcze się na niej nie pojawił.
Dlaczego Xiaomi szkoli się publicznie
Transparentność nie jest przypadkowa. Ostatnim wydaniem Xiaomi z otwartymi wagami były Xiaomi MiMo-V2.5 i Xiaomi MiMo-V2.5-Pro pod koniec kwietnia, oba na licencji MIT — komercyjnie użyteczne, możliwe do dostrojenia i redystrybucji. MiMo-V2.5-Pro to model mieszaniny ekspertów o 1,02 biliona parametrów i 42 mld aktywnych parametrów, z architekturą hybrydowej uwagi i oknem kontekstu 1 mln tokenów, a jego materiały premierowe wprost formułowały twierdzenia o możliwościach agentowych: kompilator napisany od zera w Ruście w setkach wywołań narzędzi, aplikacja desktopowa o ośmiu tysiącach linii kodu zbudowana w ciągu jedenastu godzin pracy agenta.
Strumieniowanie post-trainingu następnej generacji to twierdzenie innego rodzaju. Laboratorium, które publikuje w czasie rzeczywistym swoje krzywe nagród, liczby sandboxów i awarie GPU, prosi o ocenianie go po procesie, a nie po prezentacji premiery, i sygnalizuje harmonogram. Luo Fuli powiedziała, że szczegóły techniczne prac nad RL będą udostępniane jako open source kawałek po kawałku w nadchodzących tygodniach. To najbliższa rzecz do harmonogramu, jaką ktokolwiek zaproponował: najpierw metodologia, model później.
To również wpisuje się w schemat, który Xiaomi stosowało już wcześniej: model pojawia się publicznie pod inną nazwą, zanim firma się do niego przyzna. Firma ma w zwyczaju trenować po cichu, testować jawnie, a następnie udostępniać wraz z wagami.
Co możesz uruchomić już dziś
W rodzinie MiMo-V2.6 nie ma nic. Jeśli chcesz teraz model Xiaomi MiMo, istnieje generacja V2.5 — otwarte wagi dostępne przez własne kanały Xiaomi i kilka platform zewnętrznych, z opublikowanymi kartami modeli i cennikiem. Nie ma API MiMo-V2.6, nie ma identyfikatora modelu ani cennika, a każda strona podająca identyfikator MiMo-V2.6 lub stawkę za token wypełnia lukę, którą Xiaomi pozostawiło pustą. Ciągi `mimo-v2.6-pro` i `mimo-v2.6-flash` na pulpicie to nazwy zadań treningowych, a nie opublikowane punkty końcowe.
Inną praktyczną konsekwencją jest to, co robić w międzyczasie. Jeśli MiMo-V2.6-Pro interesuje Cię, bo może być tańszym sposobem osiągnięcia wydajności kodowania na poziomie frontier, konfiguracje, z którymi jest porównywany, już można wywoływać, a ranking mówi, że ta tania opcja jest konkurencyjna: Gemini 3.8 Flash dorównuje najwyższemu wskaźnikowi zaliczeń przy 2,36 USD za zadanie i jest oznaczony jako najwydajniejsza konfiguracja w rankingu. Gemini 3.8 Flash, Claude Opus 5 i GPT-6 Astra są dostępne przez jeden klucz API OrcaRouter w cenie katalogowej dostawcy, z marżą przekazywaną dalej na poziomie 0% — więc zmiana ceny dostawcy obowiązuje po naszej stronie tego samego dnia, a nie w następnym cyklu rozliczeniowym — z przełączaniem awaryjnym skonfigurowanym dla modelu, a nie dla dostawcy. A gdy laboratorium udostępni taki model, skierowanie go przez ten sam klucz to niskozobowiązujący sposób, by go ocenić: możesz wystawić go na rzeczywisty ruch, nie stawiając ścieżki produkcyjnej na checkpointcie, którego nikt nie scharakteryzował.
Co tak naprawdę zmieniłoby tę historię
Cztery sygnały, z grubsza w kolejności od tego, jak wiele by rozstrzygnęły:
Wagi na Hugging Face na określonej licencji, co tłumaczy pojawienie się generacji V2.5 i stanowi najsilniejszy dowód, że przebieg RL dał model gotowy do wydania, a nie eksperyment, który dobiegł końca.
• Karta modelu z liczbą parametrów, długością kontekstu i architekturą — żadne liczby dla V2.6 nie są publiczne, a panel ich nie pokazuje. Założenie, że V2.6-Pro dziedziczy po V2.5-Pro kształt 1,02T/42B, byłoby zgadywaniem.
• Identyfikator API i cennik — to moment, w którym wynik DeepSWE staje się decyzją zakupową, a nie sportem dla kibiców.
• Zgłoszenie do tablicy DeepSWE Datacurve, które umieściłoby MiMo-V2.6-Pro w tej samej tabeli i z tymi samymi słupkami błędów co modele, z którymi jest porównywany. Ewaluacja prowadzona przez dostawcę i zgłoszenie do tablicy wyników to nie to samo twierdzenie, a różnica między nimi to dokładnie jeden wiersz tej tabeli.
Do tego czasu uczciwym podsumowaniem jest to, że Xiaomi pokazało najbardziej przejrzysty przebieg treningu po szkoleniu wstępnym, jaki opublikowało jakiekolwiek duże laboratorium, na dwóch modelach, których nie wypuściło, z jednym samodzielnie zgłoszonym wynikiem benchmarku, który plasuje się blisko — ale nie dołącza do — szczytu tabeli. Opis metodologii obiecano w nadchodzących tygodniach. Data wydania nie została obiecana wcale.
