
Utopai X debiutuje na 2. miejscu w generowaniu wideo z tekstu: Kulisy post-treningu MiniMax H3 w studiu filmowym
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 121 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1124 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Utopai X to model wideo, który nie istniał jeszcze w zeszłym tygodniu, nie został wytrenowany od zera przez wiodące laboratorium i nie jest sprzedawany przez API — a obecnie zajmuje drugie miejsce na świecie w generowaniu wideo z tekstu. Model pochodzi od Utopai Studios, opartego na AI studia filmowo-telewizyjnego z siedzibą w Mountain View, i jest post-treningiemMiniMax H3, omni-modalnego modelu wideo MiniMax. Na tablicy liderów Artificial Analysis dla text-to-video z dźwiękiem (tablicy, którą Artificial Analysis określa obecnie jako AA-Video-T2V v2.0, wyniki z 29 września 2026 r.) Utopai X plasuje się na poziomie Elo 1 150 — ustępując jedynie modelowi firmy Alibasba Wan 3.0 z wynikiem 1 157, a wyprzedzając ByteDance i jego Dreamina Seedance 2.5 z wynikiem 1 143 oraz MiniMax H3 (768p) — model bazowy, z którego go dostrojono — z wynikiem 1 138. Pojawił się 30 września 2026 r., tego samego dnia, w którym odświeżono tablicę liderów, i jest dostępny dokładnie w jednym miejscu: w PAI, własnej platformie produkcyjnej studia Utopai. Nie ma publicznego API, a sama kolumna z cenami Artificial Analysis dla tego wiersza głosi: „Brak dostępnego API”.
Ta kombinacja — drugie miejsce na świecie, jeden kanał dystrybucji, brak cennika za sekundę w zwykłym sensie — to cała historia. Studio produkujące filmy wzięło cudzy model bazowy, dostroiło go według własnego osądu produkcyjnego i przeskoczyło kolejkę. Czy to trwały wynik, czy tylko migawka zupełnie nowej areny — to pytanie warte postawienia, a odpowiedź zależy od czytania rankingu, a nie komunikatu prasowego.
Co tak naprawdę pokazuje tablica
Artificial Analysis klasyfikuje modele wideo na podstawie rankingu Elo wyliczanego z anonimowego, pairwise'owego głosowania opartego na preferencjach ludzi. Głosujący widzą dwa klipy wygenerowane na podstawie tego samego promptu i wybierają ten, który bardziej im się podoba, nie wiedząc, który model wygenerował który. Ranking zmienia się wraz z napływem głosów, a każdy wiersz zawiera przedział ufności, który mówi, jak bardzo dana pozycja może się przesunąć. Zarejestrowany 2026-10-01 ranking text-to-video z dźwiękiem przedstawia się następująco:

• #1 Wan 3.0 — Elo 1 157 (±10), 6 391 próbek, wydany w sierpniu 2026 r., 12,00 USD/min.
• #2 Utopai X (oparty na MiniMax H3) — Elo 1 150 (±11), 5 455 próbek, wydany we wrześniu 2026, brak dostępnego API.
• #3 Dreamina Seedance 2.5 — Elo 1 143 (±10), 6 375 próbek, wydano lip 2026, $34,12/min.
• #4 MiniMax H3 (768p) — Elo 1138 (±10), 6343 próbki, wydany w lipcu 2026, 4,80 USD/min.
• #5 FLUX 3 — Elo 1 129 (±10), 5 628 próbek, wydany lip 2026, 17,40 USD/min.
Dwa szczegóły mają większe znaczenie niż kolejność. Po pierwsze, różnica między pierwszym a drugim miejscem wynosi siedem punktów Elo, a dwa przedziały wyraźnie się nakładają — Artificial Analysis podaje zakres Utopai X jako od 1 139 do 1 161, który zawiera oszacowanie punktowe Wan 3.0 wynoszące 1 157. Tablica oznacza ranking Utopai X jako zakres #1–3, a nie stałą pozycję. Po drugie, różnica między Utopai X a modelem, z którego powstał w wyniku post-trainingu, wynosi dwanaście punktów i ma ten sam problem z nakładaniem się, więc stwierdzenie „model po post-treningu przewyższa swój model macierzysty” jest kierunkowo prawdziwe, ale statystycznie niepewne. Własny opis Utopai jest ostrożniejszy niż większość wpisów o premierze na ten temat: mówi, że wynik Elo „zapewnia niezależną ocenę tego, jak ludzie reagują na wygenerowany przez niego materiał wideo”, co jest uczciwym odczytaniem tego, co mierzy arena preferencji ludzkich, a nie twierdzeniem o tworzeniu filmów.
Warstwa raportowana przez dostawcę jest natomiast pewna siebie. Utopai opisuje mocne strony w odbiciach i kaustykach — skoncentrowanych wzorcach powstających, gdy światło odbija się lub załamuje — oraz w spójności przestrzennej w obrębie klipu; oba te obszary to cele rozwojowe, a nie wyniki benchmarków. To słowa dostawcy, a nie pomiary Artificial Analysis.
Studio zamiast laboratorium
Utopai Studios rozwija, finansuje i produkuje własne projekty filmowe i telewizyjne, a swoje modele buduje wewnątrz tego biznesu, a nie obok niego. Podanym mechanizmem jest informacja zwrotna: produkcje generują scenariusze, zatwierdzone projekty postaci i lokacji, plany ujęć oraz kolejne duble, a reżyserzy, operatorzy zdjęć i artyści studia zapisują nie tylko to, które duble zachowano, lecz także dlaczego pozostałe odrzucono. Ten zapis staje się sygnałem treningowym i ewaluacyjnym. Zespół badawczy prowadzi również wewnętrzny system Elo, który łączy ocenę preferencji ludzi z automatycznym głosowaniem modeli wizyjno-językowych, a artyści uczestniczą w części ludzkiej.
To prawdopodobna przewaga, której nie da się zweryfikować z zewnątrz. Dostrajanie po treningu wstępnym może przesunąć ogólny model wideo w stronę preferencji użytkowników kina i reklamy bez zastępowania modelu bazowego — to akurat zgadza się z rankingiem. Jaka część dwunastopunktowej poprawy względem MiniMax H3 wynika z danych treningowych, optymalizacji preferencji, obsługi promptów, ustawień inferencji czy zmian w czasie serwowania, tego materiały premierowe nie mówią. Utopai nie opublikowała ujawnienia danych z dostrajania, metody optymalizacji, budżetu obliczeniowego ani oceny bezpieczeństwa. Niezależni badacze nie mogą odtworzyć tego wzrostu, a nie ma raportu technicznego, z którym można by się spierać.
Warstwa dystrybucji to miejsce, w którym teza studia nabiera konkretu. PAI — Production Assistive Intelligence — to platforma uruchomiona przez Utopai wraz z modelem; przechowuje ona kontekst projektu: podział scenariusza na sceny i ujęcia, bibliotekę produkcyjną postaci, lokacji i obiektów, historię wersji, wspólne zatwierdzenia dla zespołów korporacyjnych oraz oś czasu z eksportem do Premiere Pro lub DaVinci Resolve. Argument sprzedażowy jest taki, że wygenerowanie klipu to tania część, a utrzymanie ujęcia spójnego z resztą filmu to część droga. Utopai X generuje materiał filmowy w tym środowisku pracy „gdy zostanie wybrany przez filmowca”, jak to ujmuje sama firma — model jest jedną z kilku opcji wśród dostępnych w PAI modeli obrazu, wideo i audio, a nie jedyną.
Ile kosztuje Utopai X i jak to odczytać

PAI jest sprzedawany w ramach subskrypcji z kredytami, a nie jako API rozliczane za sekundę. Opublikowane poziomy cenowe to 15 USD miesięcznie za 1000 kredytów, 49 USD miesięcznie za 3500 kredytów, 129 USD miesięcznie za 10 000 kredytów i 379 USD miesięcznie za 35 000 kredytów, przy rozliczeniu rocznym rabat wynosi około 8 do 10 procent, plus doładowania po 15 USD za 1000 kredytów. Utopai X ma własny wiersz w tabeli kredytów PAI: 93 kredyty na sekundę wideo przy 1080p. Inne modele wideo platformy plasują się niżej — 50 kredytów na sekundę przy 1080p w planie standardowym i 76 w planie pro.
Przeliczenie tego na stawkę za minutę to arytmetyka, którą każdy może wykonać, ale prawie nikt nie powinien podawać jej jako ceny. Przy 93 kredytach na sekundę jedna minuta materiału generowanego przez Utopai X kosztuje 5 580 kredytów. Podstawowy plan za 15 dolarów daje 1 000 kredytów miesięcznie, co odpowiada mniej więcej 10,8 sekundy materiału, gdyby każdy kredyt został przeznaczony na ten model. Skalując podstawową stawkę kredytową liniowo, wynikający z tego koszt wynosi rzędu ponad 80 dolarów za minutę wygenerowanego wideo. Ta liczba jest warta podania tylko z zastrzeżeniami: zakłada ściśle liniowe przeliczenie kredytów na dolary, pomija fakt, że kredyty są łączone we wszystkich modelach w PAI oraz wygasają lub pozostają niewykorzystane, pomija roczne zniżki i pakiety doładowań, a także nie mówi nic o limitach rozdzielczości ani długości, których Utopai nie określił osobno dla Utopai X. To przydatny rząd wielkości, a nie cennik.
Dla porównania, w tym samym zestawieniu Artificial Analysis MiniMax H3 (768p) figuruje z ceną 4,80 USD za minutę, a Wan 3.0 z ceną 12,00 USD, podczas gdy Dreamina Seedance 2.5 jest wyceniona na 34,12 USD. To zautomatyzowane źródła cenowe z własnych API dostawców, a nie szacunki oparte na subskrypcjach, więc porównanie jest co najwyżej orientacyjne — ale kierunek jest jasny: na poziomie wejściowym generowanie w opartej na kredytach platformie studyjnej nie konkuruje z cenami API rozliczanymi za sekundę. Nabywca płaci za środowisko pracy wokół modelu, a nie za marginalną sekundę samego modelu.
Część, która nie jest publiczna
Warto nazwać trzy luki, ponieważ każda z nich blokuje inną decyzję.
• Brak API i brak ścieżki integracji. Utopai X obecnie nie ma bezpośredniej ścieżki integracji. Zespół produktowy, który chciałby wywołać go w potoku, nie może tego zrobić. Artificial Analysis wymienia go jako „No API available”, a materiały premierowe nie opisują dostępu dla deweloperów.
• Brak osobnej specyfikacji. MiniMax H2 generuje klipy trwające od 4 do 15 sekund w rozdzielczości do 2K z natywnym dźwiękiem stereofonicznym. Utopai nie opublikowało własnego maksymalnego czasu trwania dla Utopai X, co oznacza, że wartość 1080p w tabeli kredytów jest jedyną dostępną rozdzielczością, a długość klipu pozostaje nieznana.
• Żadnej oceny poza areną. Wynik Elo jest niezależnym pomiarem preferencji ludzi na krótkich klipach. Nie jest miarą tego, czy materiał nadaje się do zamierzonego ujęcia, czy wkomponowuje się w montaż albo przetrwa poprawkę. Własny wpis Utopai wprost to przyznaje — „ocena trwa również po wygenerowaniu klipu” — co jest nietypowo szczerym ujęciem jak na premierę, a zarazem ostrzeżeniem, jak daleko sięga ten ranking.
Po stronie studia można wskazać więcej historii. Utopai uruchomiło PAI 2.0 2026-06-02 i oświadczyło wówczas, że platforma osiągnęła 11 mln dolarów rocznego przychodu powtarzalnego, napędzanego sprzedażą licencji komercyjnych firmom produkcyjnym, w mniej niż dwa miesiące po kwietniowym debiucie. Firma twierdzi, że ma trzy filmy kinowe i dwa seriale zaplanowane na 2027 rok, i stosuje PAI oraz Utopai X we własnych produkcjach, w tym The Most Serious Fart, film animowany napisany i wyreżyserowany przez Mike’a Bendera. To są dane studia i harmonogram studia, i właśnie dlatego post-train bez API jest w ogóle wart tego, by o nim pisać: model jest wykorzystywany do tworzenia filmów, które firma zamierza wydać, co jest trudniejszym testem niż ranking.
Gdzie model bazowy wciąż jest praktycznym wyborem

Dla każdego, kto w tym tygodniu faktycznie potrzebuje generować wideo, routowalną połową tej rodziny jest model bazowy. MiniMax H3 jest dostępny w OrcaRouter w cenie katalogowej dostawcy — 0,08 USD za sekundę przy 768p, co daje 4,80 USD za minutę, ta sama kwota, którą podaje Artificial Analysis — z 0% marży, więc każda obniżka ceny przez dostawcę wchodzi w życie tego samego dnia, a nie po cyklu ponownego ustalania cen, oraz automatyczne przełączanie awaryjne między dostawcami, dzięki czemu awaria pojedynczego punktu końcowego nie wyłączy Twojego potoku. Przyjmuje odwołania do tekstu, obrazu, wideo i dźwięku jako jeden ujednolicony kontekst i zwraca klipy od 4 do 15 sekund w 768P lub 2K z natywnym dźwiękiem stereo, rozliczane za sekundę wygenerowanego materiału.
Utopai X nie jest routowane, a nic w tym artykule nie powinno być odczytywane jako twierdzenie, że tak jest. Model bazowy daje ci możliwość przetestowania cech estetycznych i ruchowych rodziny H3 — tego samego fundamentu, od którego zaczynał Utopai, zanim zastosowano jakikolwiek trening końcowy — za pomocą jednego klucza API obok ponad 200 innych modeli, bez subskrypcji PAI. Gdyby Utopai X kiedykolwiek trafił do dostawcy obsługującego routing, pojawiłby się w cenie katalogowej tego samego dnia, a stawka dostawcy zostałaby przekazana dalej, a nie powiększona o marżę. Do tego czasu uczciwy podział wygląda tak: Utopai X dla studiów w PAI, MiniMax H3 dla każdego, kto buduje pipeline.
Co decyduje o tym, czy to był debiut, czy moment
Trzy rzeczy są warte obserwacji w nadchodzącym kwartale. Po pierwsze, czy siedmiopunktowa różnica na szczycie przetrwa kolejne kilka tysięcy głosów — przedziały nakładają się dzisiaj, a ranking, który przetasowuje się, gdy pojawi się nowa partia porównań, niczego nie rozstrzygnął. Po drugie, czy Utopai w ogóle udostępni jakikolwiek dostęp dla deweloperów; model zajmujący drugie miejsce na świecie, do którego może wywołać tylko subskrybent PAI, to decyzja produktowa i można ją odwrócić. Po trzecie, czy konkurencja pójdzie w drugą stronę. Wan 3.0 generuje już do 30 sekund 1080p z natywnym dźwiękiem i przyjmuje tekst, obrazy, wideo, dźwięk, dokumenty oraz strony internetowe jako odniesienia, a ponadto prowadzi w rankingu pod względem oświetlenia, materiałów i kontroli kamery w podziale na przypadki użycia. Dwunastopunktowy zysk po treningu względem modelu bazowego daje do myślenia; utrzymanie drugiego miejsca przeciwko modelowi fundamentowemu o szerszym zakresie danych wejściowych to zupełnie inne zadanie.
Tym, co jest tu naprawdę nowe, nie jest Elo. Jest nim kształt tej tezy: studio dysponujące pipeline’em produkcyjnym przekonuje, że posiadanie decyzji stojących za materiałem filmowym — które ujęcie, która referencja, która wersja — jest warte więcej niż posiadanie przebiegu wstępnego trenowania. Tę tezę można przetestować, a wyniki box office’u produkcji zaplanowanych na 2027 rok to jeden z testów.
