Karta tytułowa dla Odyssey-3 vs Kandinsky 6.0 Video, z lewym panelem zatytułowanym Odyssey-3, informującym o interaktywnym środowisku, badawczej wersji podglądowej udostępnionej 8 października 2026, 832x480 lub 1280x720 Pro, bez wag i bez ceny; oraz prawym panelem zatytułowanym Kandinsky 6.0 Video, informującym o otwartych wagach 6 października 2026 na licencji MIT, klipach 5-sekundowych z dźwiękiem 44 kHz, Full HD 1920x1080, Physics-IQ nie przesłano.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: otwarte wagi i audio kontra zamknięta interaktywna wersja zapoznawcza

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kandinsky 6.0 Video pojawił się 6 października 2026 roku z czymś, co przy premierach otwartych modeli rzadko zdarza się już pierwszego dnia: wsparciem w Diffusers, ComfyUI, vLLM-Omni, SGLang i FastVideo, wszystko udokumentowane we własnym dzienniku aktualizacji repozytorium, wraz z raportem arXiv przesłanym 4 października i checkpointami na licencji MIT na Hugging Face. Odyssey-3 pojawił się dwa dni później, 8 października, jako publiczny podgląd badawczy autoregresyjnego transformera dyfuzyjnego, który buduje środowisko na podstawie promptu i przewiduje zmiany w czasie rzeczywistym, gdy się po nim poruszasz. Jeden to model o 29 miliardach parametrów, który możesz dziś wieczorem pobrać i uruchomić na własnym GPU. Drugi to interaktywny system, do którego dotrzesz wyłącznie poprzez podgląd w przeglądarce Odyssey i formularz kontaktowy. To dwa bieguny tego, co w tym samym tygodniu października 2026 roku oznaczał „model wideo”, a wybór między nimi dotyczy mniej benchmarków, a bardziej tego, kto trzyma wagi.

One oczekują od ciebie również czegoś innego. Kandinsky 6.0 Video to model generatywny: wprowadzasz prompt, a otrzymujesz pięciosekundowy klip ze zsynchronizowanym dźwiękiem. Odyssey-3 to model predykcyjny: działasz i obserwujesz, jak świat reaguje. Żaden nie zastępuje drugiego, a fakt, że zostały wydane w odstępie 48 godzin, jest najcenniejszym kontekstem, jaki każde z nich ma.

Dwie architektury, w terminologii samych dostawców

Kandinsky 6.0 Video to rodzina bazowych modeli dyfuzyjnych do generowania zsynchronizowanego dźwięku i wideo, obejmująca Kandinsky 6.0 Video Lite z 3 mld parametrów oraz Kandinsky 6.0 Video Pro z 29 mld. Oba generują pięciosekundowe klipy ze zsynchronizowanym dźwiękiem 44 kHz, w tym synchronizację ruchu ust, w trybach tekst-na-audio-wideo i obraz-na-audio-wideo, a wtyczkowy model superrozdzielczości podnosi wynik do Full HD 1920×1080. Zastosowana technika to dwustrumieniowy CrossDiT, który łączy wstępnie wytrenowany strumień wideo z nowo wytrenowanym strumieniem audio za pomocą dwukierunkowej uwagi krzyżowej, dzięki czemu obie modalności są zgodne w czasie i semantyce, zamiast być generowane osobno i multipleksowane. Przepis treningowy jest ciągły: strumień audio jest trenowany od zera na dużych korpusach audio, następnie oba strumienie są trenowane łącznie na sparowanych danych audio-wideo z zachowaniem wierności jednomodalnej, a po tym następuje nadzorowane dostrajanie, douczanie metodą uczenia ze wzmocnieniem i destylacja.

Odyssey-3 to autoregresyjny transformer dyfuzyjny opisywany przez Odyssey jako wieloetapowy model dyfuzji wideo rozszerzony poprzez teacher forcing i maskowanie przyczynowe, trenowany do kontynuowania na podstawie poprzedzających obserwacji i przewidywania przyszłych stanów warunkowanych danymi wejściowymi działań, a następnie destylowany za pomocą dopasowywania rozkładów i destylacji adversarialnej do wariantu kilkukrokowego, wystarczająco szybkiego, by można było z nim wchodzić w interakcję. Działa w rozdzielczości 832×480, a Odyssey-3 Pro w 1280×720, nie generuje dźwięku, a jego całym celem jest to, że jego wynik zależy od tego, co zrobiłeś chwilę wcześniej.

Wsparcie od pierwszego dnia to różnica, której nikt nie mierzy.

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Przeczytaj ponownie dziennik aktualizacji Kandinsky 6.0, ponieważ jest to najbardziej konkretny fakt w tym porównaniu. 6 października projekt odnotował dostępność w Diffusers, rejestrze węzłów ComfyUI, vLLM-Omni, SGLang i FastVideo oraz Hugging Face Space dla destylowanego modelu Pro. To pięć niezależnych stosów inferencji w ciągu jednego dnia. Dla każdego, kto czekał miesiącami, aż checkpoint trafi do frameworka serwującego, to jest liczba, która decyduje, czy model nadaje się do użycia.

Teraz postaw to obok historii dostępu Odyssey-3. Podgląd działa pod adresem experience.odyssey.systems, oferując nawigację pierwszoosobową, nawigację trzecioosobową i niezależny ruch kamery. Dostęp do API odbywa się przez formularz kontaktowy. Nie ma strony z cennikiem, dokumentacji limitów zapytań ani klucza samoobsługowego. Warunki korzystania z API tej witryny zostały ostatnio zaktualizowane 2026-01-22 i nadal regulują „prototyp API Odyssey-2” — warstwa komercyjna nie została przepisana pod model, który ukazał się w tym miesiącu.

• Gdzie to działa — Twoje własne GPU, z wagami i kodem na licencji MIT, a nie wyłącznie serwery Odyssey.

• Jak go integrujesz — pipeline Diffusers, węzły ComfyUI, vLLM-Omni, SGLang, FastVideo, względem podglądu w przeglądarce i formularza kontaktowego.

• Co możesz sprawdzić — architekturę, przepis treningowy i rozmiary checkpointów w publicznym raporcie, w zestawieniu z opisem potoku treningowego od dostawcy bez wag i bez artykułu.

• Co możesz modyfikować — fine-tuny, LoRA-y, kwantyzację i destylację, a wszystko to społeczność już publikowała na Hugging Face dzień po premierze, wobec zupełnie niczego.

Dimension by dimension

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Wynik — pięciosekundowe klipy ze zsynchronizowanym dźwiękiem 44 kHz dla obu poziomów Kandinsky, w zestawieniu z interaktywnym środowiskiem bez dźwięku dla Odyssey-3.

• Rozdzielczość — Full HD 1920×1080 dzięki wtyczkowemu modelowi superrozdzielczości dla Kandinsky 6.0 Video, w porównaniu z 832×480 dla Odyssey-3 i 1280×720 dla Odyssey-3 Pro.

• Modalności wejściowe — tekst i obraz dla Kandinsky'ego, w trybach tekst-na-audio-wideo i obraz-na-audio-wideo; prompt oraz wejście sterujące w czasie rzeczywistym dla Odyssey-3.

• Parametry — 3B i 29B opublikowane dla poziomów Lite i Pro, w przeciwieństwie do nieujawnionych dla obu poziomów Odyssey-3.

• Sprzęt — karta NVIDIA GPU oraz Python 3.13 lub 3.14, z gotowymi presetami dla Kandinsky’ego, dostarczanymi dla kart od H100/H200 po klasę RTX 5090; przeglądarka dla Odyssey-3.

• Cena — 0 USD za klip dla Kandinsky 6.0 Video, jeśli masz GPU, wobec braku jakiejkolwiek publikowanej ceny dla Odyssey-3. Znormalizowane szacunki kosztów z tablicy dla Odyssey-3 i Odyssey-3 Pro wynoszą 0,139 USD i 0,267 USD za wygenerowane wideo, z wyłączeniem obsługi promptu.

• Ocena przez strony trzecie — własne generacje żadnego z modeli nie są częścią niezależnego bezpośredniego porównania. Raport Kandinsky’ego opiera się na porównawczej ocenie ludzkiej względem jego poprzednika; wyniki Odyssey-3 pochodzą ze zgłoszenia do benchmarku oraz z oceny przeprowadzonej przez dostawcę.

• Licencja — MIT dla Kandinsky 6.0 Video, w przeciwieństwie do braku opublikowanej licencji, ponieważ nie ma wag, które można by licencjonować.

Co mówią, a czego nie mówią benchmarki

Kandinsky 6.0 Video nie pojawia się na Physics-IQ Verified, tablicy Anates Labs i DeepMind, która ocenia kontynuacje rzeczywistych eksperymentów fizycznych w 41 modelach. Nie pojawia się tam również partner Odyssey-3 w bezpośrednim starciu, ponieważ tablica ocenia modele generujące klipy, a oba te modele je generują. Na tablicy widnieje natomiast wcześniejsza linia modeli świata Kandinsky'ego, Kandinsky-WM 1.0, na 20. miejscu z wynikiem −8,02 pp względem średniej dla ścieżki — inna rodzina, inny cel i jedyny wpis Kandinsky'ego na tablicy.

Wiersze Odyssey-3, dla kontrastu: 8. miejsce przy +2,15 p.p. na własnych promptach benchmarku i 0,129 USD za film, oraz 3. miejsce przy +9,99 p.p. na niestandardowych promptach, a Odyssey-3 Pro zajmuje drugie miejsce w klasyfikacji ogólnej z +11,15 p.p. Są to lepsze wyniki niż cokolwiek, co seria Kandinsky ma w tym konkretnym teście, a przy tym mierzą one inną zdolność — Odyssey-3 jest oceniany na podstawie tego, co przewiduje po zakłóceniu, co jest tym samym, co sprzedaje jego zapowiedź.

Dowodem samego Kandinsky'ego jest ocena ludzka w raporcie technicznym: Kandinsky 6.0 Video Pro wyraźnie przewyższa swojego poprzednika, Kandinsky 5.0 Video Pro, i pozostaje konkurencyjny wobec wiodących modeli generowania audio-wideo, szczególnie pod względem jakości mowy. To porównanie side-by-side przeprowadzone przez dostawcę i jest to tego rodzaju twierdzenie, które każdy, kto ma 5090 i wolne popołudnie, może zweryfikować na podstawie wydanego checkpointu. Równoważnego twierdzenia Odyssey-3 nie może zweryfikować nikt bez klucza API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Docieranie do nich

OrcaRouter nie hostuje żadnego z tych modeli i nigdy nie będzie sugerować czegoś przeciwnego: Odyssey-3 nie ma opublikowanej stawki, na podstawie której ktokolwiek mógłby go routować, a Kandinsky 6.0 Video ma otwarte wagi, co oznacza, że właściwym sposobem jego uruchomienia jest konfiguracja z repozytorium na własnym GPU, a nie hostowany endpoint.

Miejsce, w którym pasuje jeden klucz OrcaRouter, to warstwa wokół eksperymentu. Repozytorium Kandinsky'ego zakłada, że GPU, środowisko i porównanie dostarczasz sam; nie dostarcza natomiast sposobu wywoływania modeli, względem których chcesz je benchmarkować. Ponad 200 modeli kryje się za jednym kluczem OrcaRouter w cenie katalogowej dostawcy z 0% narzutu — w tym minimax/minimax-h3, otwarty model wideo (open-weight), który MiniMax udostępnił 31 lipca 2026 r., w cenie 0,08 USD za sekundę wyjścia 768P — więc zmiana ceny u dostawcy trafia na Twoją fakturę tego samego dnia, automatyczny failover nie pozwala, by seria ewaluacji padła z powodu jednej złej godziny u dostawcy upstream, a routing DSL pozwala umieścić hostowany model wideo i model wizyjny za jednym interfejsem, gdy zadanie polega na generowaniu, a następnie ocenianiu. Repozytorium nadal klonujesz i konfigurację uruchamiasz samodzielnie. Po prostu nie musisz budować drugiej połowy zestawu.

Którego właściwie chcesz

Jeśli potrzebujesz wyników, które możesz mieć na własność — czytelnych warunków komercyjnych, wag, które możesz dostrajać, pipeline’u działającego bez zależności od tego, czy czyjeś API jest aktywne — Kandinsky 6.0 Video jest odpowiedzią, a wsparcie od pierwszego dnia oznacza, że nie obstawiasz artefaktu badawczego. Jeśli potrzebujesz dźwięku w filmie, to jedyny z tych dwóch, który w ogóle go generuje.

Jeśli problemem jest przewidywanie, a nie wytwarzanie — polityka, która musi reagować, środowisko treningowe, cokolwiek, gdzie następny stan zależy od ostatniej akcji — Odyssey-3 jest jedynym z tych dwóch, który to robi, a zarazem jest tym, którego nie można kupić. Taki jest uczciwy kształt tego starcia w tygodniu, w którym oba zadebiutowały: otwarty model, który można pobrać, i interaktywny model, którego można tylko spróbować, przy czym dowody z benchmarków przemawiają za zamkniętym, a dowody praktyczne za otwartym.