Karta tytułowa dla Odyssey-3 vs Grok Imagine Video, z lewym panelem z nagłówkiem Odyssey-3 i treścią: interaktywne środowisko, brak opublikowanej ceny, 832x480 lub 1280x720 Pro, bez dźwięku; oraz prawym panelem z nagłówkiem Grok Imagine Video i treścią: xAI Imagine API, rozliczane za sekundę, klip, którego jesteś autorem, natywne 1080p w wersji 1.5, Physics-IQ -4.04 pp, miejsce 13.
Guides & Insights

Odyssey-1 vs Grok Imagine Video: API wideo z licznikiem kontra niewyceniony symulator

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Grok Imagine Video ma cennik i nie ma żadnego sposobu, by nim sterować. Odyssey-3, które firma Odyssey udostępniła jako publiczny podgląd badawczy 8 października 2026 r., ma sposób, by nim sterować, i w ogóle nie ma cennika. To ta asymetria, a nie jakikolwiek wiersz benchmarku, jest prawdziwym kształtem tego starcia: xAI sprzedaje generowane wideo na sekundy, z opublikowaną stawką dla każdej rozdzielczości, podczas gdy Odyssey-3 jest dostarczany jako interaktywny model świata, którym można sterować w przeglądarce, ale którego nie można jeszcze kupić. Jedno z nich możesz wprowadzić do produktu jeszcze dziś po południu. Drugie możesz tylko ocenić.

Oni również nie zgadzają się co do tego, do czego służy generowanie wideo, a różnica zdań uwidacznia się na stronach dostawców. Dokumentacja Grok Imagine Video na pierwszym miejscu stawia obrazy referencyjne, przypięte klatki, mowę zsynchronizowaną z ruchem ust i odniesienia głosowe — słownictwo kontroli produkcji. U Odyssey-3 na pierwszym miejscu jest środowisko, które przewiduje, co wydarzy się dalej, gdy się po nim poruszasz lub wywołujesz zdarzenie. Oba są generatorami opartymi na dyfuzji, które emitują wideo. Poza tym zdaniem prawie nic ich nie łączy.

Czym jest każdy z nich

Odyssey-3 to autoregresyjny transformer dyfuzyjny. Odyssey opisuje go jako wieloetapowy model dyfuzji wideo rozszerzony autoregresyjnie o teacher forcing i maskowanie przyczynowe, dzięki czemu kontynuuje od poprzednich obserwacji i przewiduje przyszłe stany warunkowane danymi wejściowymi akcji, a następnie jest destylowany poprzez dopasowywanie rozkładów i destylację adwersarialną do wariantu o kilku krokach, zdolnego do interakcji w czasie rzeczywistym. Działa w rozdzielczości 832×480, a Odyssey-3 Pro w 1280×720; publiczny podgląd udostępnia nawigację pierwszoosobową, nawigację trzecioosobową i niezależny ruch kamery. Nie ma dźwięku.

G​rok Imagine Video to model wideo x​AI w Imagine API. Obecna generacja to G​rok Imagine Video 1.5, którą — jak odnotowują informacje o wydaniu x​AI — obsługuje tekst-na-wideo, obraz-na-wideo i referencję-na-wideo z opcjonalnymi gotowymi głosami i natywnym 1080p w przypadku dwóch pierwszych, przy czym tekst-na-wideo jest zaimplementowany jako tekst-na-obraz, po którym następuje obraz-na-wideo pod maską. Przyjmuje do czternastu obrazów referencyjnych i trzy referencje głosowe, obsługuje przypięte klatki i mowę zsynchronizowaną z ruchem warg, a rozliczanie odbywa się za sekundę wygenerowanego materiału. Wcześniejszy grok-imagine-video, wciąż udokumentowany i wciąż wyceniony, kosztuje 0,05 USD za sekundę przy 480p i 0,07 USD przy 720p, przy czym wideo wejściowe jest rozliczane po 0,01 USD za sekundę, a obrazy wejściowe po 0,002 USD.

Karta stawek, czyli ta część, na której faktycznie można oprzeć planowanie.

xAI's Grok API documentation page for grok-imagine-video, read 9 October 2026, showing the model header with a “Latest” badge, an at-a-glance table listing modalities as text, image and video under the heading “Text > Video”, a pricing heading, and release notes tabs, with the navigation marked “APIs / Grok / Build”.

• Cena — G​rok Imagine Video jest rozliczany za sekundę: 0,05 USD/s przy 480p i 0,07 USD/s przy 720p w oryginalnym modelu, a G​rok Imagine Video 1.5 od 0,08 USD/s w jakościach 480p, 720p i 1080p. G​rok Imagine Video 1.5 Lite zaczyna się od 0,02 USD/s dla rozdzielczości do 1080p i do piętnastu sekund. Odyssey-3 nie ma żadnej opublikowanej ceny; jego jedyne publiczne dane kosztowe to znormalizowane szacunki z rankingu: 0,139 USD za wygenerowane wideo dla Odyssey-3 i 0,267 USD dla Odyssey-3 Pro.

• Dziesięciosekundowy klip, po przeliczeniu — 0,50 USD przy 480p lub 0,70 USD przy 720p w G​rok Imagine Video; 0,80 USD w G​rok Imagine Video 1.5; 0,20 USD w wariancie Lite. Odyssey-3 nie można wycenić w ten sposób, ponieważ nie można kupić dziesięciu sekund Odyssey-3.

• Rozdzielczość — G​rok Imagine Video 1.5 oferuje natywne 1080p w trybie tekst-na-wideo i obraz-na-wideo. Odyssey-3 osiąga maksymalnie 1280×720 w planie Pro.

• Czas trwania — G​rok Imagine Video 1.5 Lite osiąga piętnaście sekund. Jednostka Odyssey-3 nie jest klipem; to sesja, ograniczona tym, jak długo podgląd utrzymuje spójność swoich przewidywań.

• Audio — Grok Imagine Video generuje mowę zsynchronizowaną z ruchem ust i przyjmuje referencje głosowe. Odyssey-3 nie generuje żadnych.

• Kontrola — obrazy referencyjne, przypięte klatki, pierwsza i ostatnia klatka oraz referencje głosowe, wszystko określone przed generowaniem. W przeciwieństwie do nawigacji na żywo i zdarzeń zachodzących w trakcie generowania. G​rok's to autorstwo; Odyssey-3's to interakcja.

• Dostępność — samoobsługowy klucz API już dziś dla G​rok Imagine Video. Formularz kontaktowy i podgląd w przeglądarce dla Odyssey-3.

Gdzie umieszcza je tablica fizyki

Physics-IQ Verified, benchmark Anates Labs i DeepMind, który ocenia kontynuacje rzeczywistych eksperymentów fizycznych, obecnie klasyfikuje 41 modeli, a oba z nich znajdują się na nim — co czyni go jedyną niezależną platformą, na której można je w ogóle porównać.

• G​rok Imagine Video — pozycja 13, poprawa netto −4,04 p.p. względem średniej dla ścieżki, na własnych promptach benchmarku, 24 fps, znormalizowany koszt 0,352 USD za wideo.

• Odyssey-3 — 8. miejsce w tym samym zestawie promptów przy +2,15 p.p. i 0,129 USD, a 3. miejsce w przypadku promptów niestandardowych przy +9,99 p.p.

Luka nie jest mała i nie jest artefaktem rozdzielczości: tablica normalizuje koszt do 24 fps i wyjścia o szerokości 1280, tam gdzie pozwalają na to dane wejściowe, oraz podaje tryb promptu dla każdego wiersza. Ujemny wynik poprawy netto nie jest stwierdzeniem, że G​rok Imagine Video generuje złe wideo — wyraźnie nie generuje, a jest w produkcji w cenie, która sprawia, że łatwo go używać. Jest to stwierdzenie, że w konkretnym zadaniu poprawnego kontynuowania eksperymentu fizycznego wypada gorzej niż przeciętny model na tej tablicy, podczas gdy Odyssey-3 wypada lepiej niż przeciętny model na tej tablicy, i to dwukrotnie, w dwóch różnych trybach promptu.

Kluczowe twierdzenie samego Odyssey-3 jest jeszcze mocniejsze: 66,1 w ścieżce wideo-do-wideo dla Odyssey-3 Pro — najwyższy wynik, jaki Odyssey podaje — oraz 54,7 dla tego samego wariantu w kategorii obraz-do-wideo. Pochodzą one z publikacji Odyssey, a nie z niezależnego testu, i tak należy je odczytywać.

Two-column scoreboard headed “Odyssey-3 vs Grok Imagine Video — the scoreboard” with six shared dimension labels. Odyssey-3: published price none; 832x480, 1280x720 Pro; a session, not a clip; no audio; Physics-IQ board prompts +2.15 pp rank 08; custom prompts +9.99 pp rank 03. Grok Imagine Video: $0.05/sec at 480p and $0.07/sec at 720p; native 1080p on version 1.5; up to 15 seconds on the Lite tier; lip-synced speech and voice references; Physics-IQ -4.04 pp rank 13; no custom-prompt entry. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Grok Imagine Video rates per xAI documentation; Physics-IQ Verified board read Oct 9 2026”.

Rzecz, której nie obejmuje cennik

Za stawkami za sekundę kryje się różnica kategorii, którą warto nazwać, bo to ona decyduje o tym, którego z nich chcesz.

Model rozliczeń Grok Imagine Video — dolary za sekundę materiału wyjściowego — to obietnica dotycząca przepustowości. Każdy dolar kupuje stałą ilość gotowego wideo, a jedyne pytanie brzmi, czy piętnaście sekund w 1080p z synchronizacją ust jest warte $1.20. W przypadku jednostki reklamowej, szablonu społecznościowego czy pipeline'u marketingowego to znakomite pytanie z prostą odpowiedzią, a poziom Lite w cenie $0.02/sec sprawia, że odpowiedź w większości przypadków jest łatwa.

Odyssey-3 nie jest rozliczany w ten sposób i nie może być, ponieważ jego wynik nie jest stałą wielkością. Interaktywne środowisko jest konsumowane przez to, jak długo ktoś w nim przebywa i ile razy zmienia zdanie, co sprawia, że model rozliczania za sekundę jest bez znaczenia. Kiedy Odyssey opublikuje cenę — a nie ma żadnego sygnału, kiedy to nastąpi — będzie to musiała być cena sesji, cena obliczeń albo coś innego, czego jeszcze nie wymyślono dla tej kategorii. To nie jest argument przeciwko Odyssey-3. To powód, dla którego porównania deweloperskiego między tymi dwoma nie da się obecnie dokończyć.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Osiągnięcie licznika dziś

Grok Imagine Video to własne API xAI, a OrcaRouter go nie hostuje. Odyssey-3 nie znajduje się na żadnej platformie hostingowej, którą możemy zweryfikować, a nawet gdyby tak było, nie ma opublikowanej stawki, według której ktokolwiek mógłby kierować ruch.

To, do czego faktycznie daje dostęp jeden klucz OrcaRouter, to reszta stosu wideo i modeli, wokół której zbudowałbyś to porównanie: MiniMax-H3 za 0,08 USD za sekundę wyniku w 768P, linia wideo K​ling i ponad 200 modeli za jednym punktem końcowym w cenie katalogowej dostawcy z 0% marży — więc gdy laboratorium obniży stawkę za sekundę, zmiana jest widoczna w Twoim zużyciu jeszcze tego samego dnia, a nie przy kolejnym odnowieniu umowy. Automatyczne przełączanie awaryjne między dostawcami sprawia, że partia mieszająca kilka modeli wideo nie zawiedzie z powodu złej godziny u jednego dostawcy upstream, a DSL routingu pozwala umieścić hostowany model wideo oraz model tekstowy lub wizyjny za jednym interfejsem, czego właśnie potrzebuje potok, który najpierw generuje, a potem ocenia. Ani Odyssey-3, ani G​rok Imagine Video nie ma dziś w tym katalogu.

Który chcesz

Jeśli potrzebujesz wideo z dźwiękiem, w 1080p, w cenie, którą możesz wpisać do arkusza kalkulacyjnego, i potrzebujesz tego w tym tygodniu, G​rok Imagine Video jest działającym rozwiązaniem, a Odyssey-3 nie jest brany pod uwagę — nie ma dźwięku, ma niższy pułap rozdzielczości i nie można go kupić.

Jeśli budujesz cokolwiek, co musi przewidywać, co się stanie po działaniu — politykę, pętlę sterowania, środowisko treningowe — cennik nie ma znaczenia, a tablica wyników fizyki tak. Odyssey-3 jest oceniany dokładnie pod kątem tej właśnie zdolności i znajduje się blisko czoła tablicy; G​rok Imagine Video, doskonały w tworzeniu gotowego ujęcia, wypada poniżej średniej dla toru w tym samym teście. To inne pytania, a odpowiedzi się nie pokrywają.