Wygenerowana karta tytułowa z nagłówkiem „GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed”, podtytułem „Ten sam manewr, dwie różne oferty” oraz dwiema kartami o treści „Mnożnik ceny: 6x vs 10x” i „Deklarowana prędkość: 8x vs 20x”, a także stopką „Dane podane przez dostawcę, wrzesień–październik 2026”.
Guides & Insights

GPT-6 Astra Ultrafast kontra Xiaomi MiMo v2.6 Pro Ultraspeed: ten sam manewr, dwie różne oferty

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa laboratoria przeprowadziły ten sam manewr w tym samym dwutygodniowym okresie, a ciekawe jest to, że zrobiły to w oparciu o przeciwstawne założenia co do tego, co kupuje klient. GPT-6 Astra Ultrafast to flagowy produkt dostawcy sprzedawany w ramach warstwy serwowania Ultrafast — model wydany 3 września 2026 r., warstwa powszechnie dostępna od 29 września 2026 r., a sam model wymieniony w wpisie NVIDIA z 1 października jako działający na GPU Blackwell. Xiaomi MiMo v2.6 Pro Ultraspeed to wersja Xiaomi wydana 22 września 2026 r.: ten sam checkpoint o 1,02 biliona parametrów co MiMo-V2.6-Pro, serwowany szybciej, z szybkością około dziesięć razy wyższą od standardowej.

Jedna z nich to najszybszy sposób wywołania modelu frontierowego. Druga to najtańsza istniejąca szybka warstwa. Nie są konkurentami w zwykłym sensie — trzeba by napisać bardzo dziwną aplikację, aby wybierać między zamkniętym flagowcem za 300 dolarów za milion tokenów a modelem o otwartych wagach za 8,70 dolara za milion tokenów. To, co sprawia, że to zestawienie zasługuje na stronę, to fakt, że obie są warstwami szybkości, a nie modelami, więc ich porównanie izoluje jedno pytanie, które stawia warstwa szybkości: za co dokładnie płacisz tę wielokrotność?

Oba poziomy sprzedają tę samą nie-rzecz

Żadna z tych nazw nie jest punktem kontrolnym. To jest ta część, którą relacje z premiery zwykle rozmywają, więc warto podejść do tego mechanicznie.

• Na co wskazuje nazwa — GPT-6 Astra Ultrafast to GPT-6 Astra z ustawionym polem żądania service_tier: "ultrafast"; identyfikator modelu w żądaniu to nadal gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed to punkt kontrolny MiMo-V2.6-Pro udostępniany na szybszej ścieżce, rozliczany jako osobna pozycja.

• Co się zmienia — grupowanie, dekodowanie spekulatywne, alokacja sprzętu, limity współbieżności, obsługa połączeń. Wszystko między wagami a Twoim żądaniem HTTP, i nic wewnątrz wag.

• Co się nie zmienia — odpowiedzi. Ten sam punkt kontrolny przy tych samych ustawieniach powinien generować tę samą treść w innym tempie. Jeśli dwie ścieżki tego samego modelu rozchodzą się przy identycznym wejściu, to defekt do zgłoszenia, a nie nabyta przez ciebie możliwość.

• Dlaczego ma to znaczenie w tym porównaniu — ponieważ żaden z poziomów nie deklaruje poprawy wyników benchmarku względem własnej standardowej ścieżki, cała decyzja zakupowa sprowadza się do ceny za token w zestawieniu z zaoszczędzonymi sekundami. Co oznacza, że o obu ofertach rozstrzyga arytmetyka, a nie ocena.

Jest jednak pewna asymetria w tym ujęciu i nie dotyczy ona poziomów. UltraSpeed Xiaomi opiera się na modelu z otwartą licencją — wagi MiMo-V2.6 objęte są licencją MIT, zgodnie z kartami modeli samego Xiaomi, a rodzina została udostępniona wraz ze swoim środowiskiem treningowym RL. Ultrafast OpenAI opiera się na zamkniętym flagowcu, do którego można dotrzeć wyłącznie przez API. Płacenie wielokrotności za szybkość w przypadku otwartych wag jest decyzją odwracalną; zawsze możesz samodzielnie serwować checkpoint. Płacenie jej za zamknięty flagowiec już nie.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

Dwa mnożniki ceny i to, co kupują

Tu właśnie ta para przestaje być symetryczna, a liczby są wyjątkowo czyste po obu stronach, ponieważ każdy dostawca wycenił wielokrotność, a nie wartość absolutną.

• GPT-6 Astra Ultrafast — 60,00 USD za milion tokenów wejściowych, 6,00 USD za wejście z pamięci podręcznej, 75,00 USD za zapis do pamięci podręcznej i 300,00 USD za wyjście, w porównaniu z 10,00 USD i 50,00 USD w warstwie standardowej. Jednolicie 6,00x w każdej kolumnie, rosnąc do 120,00 USD i 450,00 USD powyżej 272 000 tokenów wejściowych. Warstwa standardowa jest dostępna w naszym katalogu w cenie katalogowej OpenAI, co jest najtańszym sposobem na dotarcie do flagowego modelu.

• Xiaomi MiMo v2.6 Pro Ultraspeed — 4,35 USD za milion tokenów wejściowych i 8,70 USD za milion tokenów wyjściowych, w porównaniu ze standardową ścieżką Pro po 0,44 USD i 0,87 USD. To około 9,9x na wejściu i dokładnie 10x na wyjściu.

• Twierdzenia dotyczące szybkości powiązane z tymi mnożnikami — zarówno OpenAI, jak i NVIDIA ustalają maksymalną szybkość generowania tokenów w Astra Ultrafast na „do 8 razy” wyższą niż w standardowym trybie Astra. Własne materiały Xiaomi twierdzą, że szybkość wyjściowa jest do 20 razy wyższa niż w standardowej usłudze Pro; wpisy w katalogach podmiotów trzecich opisujące ten sam model tego samego dnia podają około 10 razy. Nie opublikowano żadnego pomiaru uzgadniającego te dwie wartości.

• Stosunek wielokrotności do szybkości — cena OpenAI wynosząca 6x daje deklarowany pułap 8x, więc ten poziom jest wyceniony poniżej własnego najlepszego scenariusza. W zależności od tego, czyim liczbom wierzysz, cena Xiaomi wynosząca 10x daje deklarowany pułap od 10x do 20x, więc przy pułapie producenta transakcja jest korzystna, a przy niższej wartości to zwykłe wyjście na zero.

To ta jedna różnica, która najbardziej liczy się przy decyzji między nimi, i jest węższa, niż sugerują ceny z nagłówków. W przeliczeniu na jednostkę usuniętego opóźnienia — według deklaracji samych dostawców — Astra Ultrafast jest lepszą z tych dwóch ofert. W przeliczeniu na token pracy Xiaomi UltraSpeed jest około czternaście razy tańszy na wejściu i trzydzieści cztery razy tańszy na wyjściu względem stawek Ultrafast, a od dwóch do sześciu razy tańszy niż standardowa ścieżka Astra — ale to inny model, i to o znacznie mniejszych możliwościach, czyli kompromis, na który w rzeczywistości się godzisz. Własne karty modeli Xiaomi dla tej rodziny podają informacje o architekturze i treningu, a nie niezależny zbiorczy wynik, a dla niego nie opublikowano w ogóle żadnego wyniku z indeksu, na którym mierzy się flagowy model OpenAI.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

Co zdecydowali się ujawnić dwaj dostawcy

Poziomy szybkości to bardziej test ujawniania informacji niż test wydajności, ponieważ to, czego potrzebowałbyś do zweryfikowania twierdzenia — rozkład opóźnień przy podanej współbieżności — jest całkowicie w rękach dostawcy.

Wpis NVIDII z 1 października to najbardziej szczegółowe publiczne oświadczenie stojące za poziomem Astra, a to, co wnosi, to raczej atrybucja niż pomiar: układy GPU Blackwell, dostępność w OpenAI API oraz dla uprawnionych użytkowników ChatGPT Work i Codex, a także dwóch inżynierów OpenAI opisujących tę pętlę. Philippe Tillet, szef ds. inferencji w OpenAI, mówi, że Astra potrafi „przekształcić tę wiedzę w wysokowydajne kernele, które czynią sprzęt NVIDIA atrakcyjnym”; Uday Ruddarraju, dyrektor ds. technologii obliczeniowych w OpenAI, mówi: „wykorzystaliśmy nasze wewnętrzne modele do optymalizacji inferencji na układach GPU NVIDIA”. Żadne z tych zdań nie podaje wartości przepustowości dla tego poziomu. Wartość 8x stoi sama, bez żadnych zastrzeżeń poza „do”.

Ujawnienie Xiaomi poszło w przeciwnym kierunku — firma opublikowała ekonomikę treningu, w tym środowisko uczenia ze wzmocnieniem i kod, a jej karty modeli zawierają fakty o architekturze, a nie fakty o serwowaniu. Sam poziom UltraSpeed wiązał się z twierdzeniem o 20-krotnym przyspieszeniu i brakiem opublikowanej krzywej opóźnień. Co oznacza, że w kwestii, na którą poziom szybkości ma odpowiadać, obaj dostawcy są równie nieprzydatni, a remis w tym zakresie to uczciwe ustalenie.

Wybieranie, jeśli naprawdę musisz

Te dwa poziomy w niewielkim stopniu się pokrywają, więc decyzja to mniej wybór zwycięzcy, a bardziej rozpoznanie, którym z tych dwóch zakupów jest twój.

Wybierz Astra Ultrafast, jeśli praca ma charakter agentowy, a wybór modelu został już dokonany. Koszt zadania z 40 000 tokenów wyjściowych rośnie z 2,00 USD do 12,00 USD, a ten poziom to jedyny sposób, by uzyskać jakość modeli klasy frontier w szybszym tempie. Sama dokumentacja OpenAI jasno określa warunek operacyjny: zaleca WebSockets „zwłaszcza w przypadku aplikacji agentowych, które wykonują wiele wywołań narzędzi w szybkim następstwie”, ostrzegając, że „bez trwałego połączenia narzut sieciowy może ograniczyć korzyści w zakresie opóźnień”. Włącz ten poziom i pozostaw pod nim HTTP dla pojedynczych żądań, a zapłacisz 6 razy więcej za ułamek przyspieszenia. Warto też wiedzieć przed podłączeniem: ten poziom obsługuje wyłącznie rezydencję danych w USA i przetwarzanie globalne, bez punktów końcowych przetwarzania regionalnego w UE ani w innych regionach poza USA, a na start został uruchomiony z niskimi początkowymi limitami szybkości, nawet dla kont, które w przeciwnym razie kwalifikowałyby się do wyższych.

Wybierz MiMo v2.6 Pro Ultraspeed, jeśli model jest towarem wejściowym do potoku, który mógłbyś hostować samodzielnie. Licencja MIT oznacza, że standardowa ścieżka Pro nie jest jedynym rozwiązaniem awaryjnym — samodzielny hosting jest. W cenie $4.35 i $8.70 jest wystarczająco tani, by szybszy poziom warto było włączyć spekulacyjnie, a nie uzasadniać zadanie po zadaniu, a jego kontekst 1 mln tokenów dorównuje flagowcowi. Zrozum jednak, co kupujesz: około dziesięciokrotnie niższą stawkę za model, który ustępuje czołówce — to właściwy wybór przy ekstrakcji dużych wolumenów i zły przy wszystkim, gdzie jakość odpowiedzi warunkuje przepływ pracy.

Na OrcaRouter nie ma żadnego z szybkich poziomów i warto powiedzieć to wprost, zamiast mówić o tym półsłówkami. To, co jest na OrcaRouter, to openai/gpt-6-astra — flagowy model poziomu standardowego, w cenie 10,00 i 50,00 USD za milion tokenów, z progiem dla długiego kontekstu na poziomie 20,00 i 75,00 USD, kontekstem 1 050 000 tokenów i maksymalnym wyjściem 128 000 tokenów, przez endpoint zgodny z OpenAI. Nie hostuje się tu żadnego modelu Xiaomi, więc MiMo-V2.6-Pro i jego tor UltraSpeed są osiągalne wyłącznie przez własne API Xiaomi i kilka platform zewnętrznych. Praktyczne zastosowanie endpointu z ponad 200 modelami w tym porównaniu to nie dostęp do szybkich poziomów. Chodzi o to, że gdy chcesz się dowiedzieć, czy drogi tor zwraca swoją wielokrotność, możesz wysłać ten sam prompt do tańszego modelu przy tych samych poświadczeniach i tym samym kluczu, w następnym żądaniu, i się przekonać. To najtańszy dostępny eksperyment i to on odpowiada na to pytanie — bo żaden dostawca nie opublikował krzywej opóźnień, która pozwoliłaby odpowiedzieć na nie bez pomiarów.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Uczciwe odczytanie

Obaj dostawcy w ciągu ostatnich trzech tygodni opublikowali cennik opóźnień, a żaden nie opublikował pomiaru. Ta symetria jest sednem historii i ma praktyczną konsekwencję: jedyne liczby, na których możesz dziś działać, to ceny, a te są wyjątkowo wiele mówiące, ponieważ obie strony wyceniły czysty mnożnik, a nie liczbę szytą na miarę.

Szybki poziom OpenAI kosztuje sześciokrotność własnej standardowej stawki i deklaruje pułap ośmiokrotny. Poziom Xiaomi kosztuje dziesięciokrotność własnej standardowej stawki i deklaruje pułap gdzieś między dziesięciokrotnym a dwudziestokrotnym, zależnie od tego, czyim liczbom wierzysz. Jeśli potraktować to jako arytmetykę na własnych liczbach dostawców, oba wypadają niemal na jedno: poziom OpenAI daje deklarowany pułap wart 1,33 jednostki szybkości na jednostkę ceny, poziom Xiaomi — między 1,0 a 2,0 według tego samego rachunku — a powodem, dla którego oba można obronić, jest to, że te dwa poziomy sprzedają się różnym nabywcom, którzy nigdy poważnie nie rozważą opcji tego drugiego. Ceny są też jedyną częścią każdej z tych ofert, którą dziś można poddać audytowi, ponieważ cennik jest faktem publikowanym, a deklaracja opóźnienia nie.