Titelkort för Odyssey-3 vs Kandinsky 6.0 Video, med en vänsterpanel med rubriken Odyssey-3 som anger en interaktiv miljö, en forskningsförhandsvisning öppnad 8 oktober 2026, 832x480 eller 1280x720 Pro, inga vikter och inget pris; och en högerpanel med rubriken Kandinsky 6.0 Video som anger öppna vikter den 6 oktober 2026 under en MIT-licens, 5 s-klipp med 44 kHz-ljud, Full HD 1920x1080, Physics-IQ inte inlämnad.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: Öppna vikter och ljud mot en stängd interaktiv förhandsvisning

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Kandinsky 6.0 Video kom den 6 oktober 2026 med det som öppna modellsläpp sällan har på dag ett: stöd i Diffusers, ComfyUI, vLLM-Omni, SGLang och FastVideo, allt dokumenterat i repots egen uppdateringslogg, tillsammans med en arXiv-rapport som lämnades in den 4 oktober och MIT-licensierade checkpoints på Hugging Face. Odyssey-3 kom två dagar senare, den 8 oktober, som en offentlig forskningsförhandsvisning av en autoregressiv diffusionstransformer som bygger en miljö från en prompt och förutsäger förändringar i realtid när du rör dig genom den. Den ena är en modell med 29 miljarder parametrar som du kan ladda ner och köra på din egen GPU i kväll. Den andra är ett interaktivt system som du bara kan nå via Odysseys webbläsarförhandsvisning och ett kontaktformulär. De är de två polerna av vad "videomodell" betydde under samma vecka i oktober 2026, och valet mellan dem handlar mindre om benchmarks än om vem som har vikterna.

De vill också olika saker av dig. Kandinsky 6.0 Video är en genereringsmodell: en prompt in, ett fem sekunder långt klipp med synkroniserat ljud ut. Odyssey-3 är en prediktionsmodell: agera och se världen svara. Ingen av dem ersätter den andra, och att de släpptes med 48 timmars mellanrum är det mest användbara sammanhanget någon av dem har.

De två arkitekturerna, i leverantörernas egna ordalag

Kandinsky 6.0 Video är en familj av fundamentala diffusionsmodeller för synkroniserad ljud- och videogenerering, bestående av Kandinsky 6.0 Video Lite med 3B parametrar och Kandinsky 6.0 Video Pro med 29B. Båda genererar femsekundersklipp med synkroniserat 44 kHz-ljud, inklusive läppsynk, i lägena text-till-ljud-video och bild-till-ljud-video, och en plug-in-superupplösningsmodell höjer utdata till Full HD 1920×1080. Tekniken är en dual-stream-CrossDiT som kopplar en förtränad videoström till en nyligen tränad ljudström via dubbelriktad korsuppmärksamhet, så att de två modaliteterna samordnas i tid och semantik i stället för att genereras separat och muxas. Träningsreceptet är kontinuerligt: ljudströmmen tränas från grunden på stora ljudkorpusar, sedan tränas båda strömmarna gemensamt på parade ljud-videodata samtidigt som unimodal trohet bevaras, följt av övervakad finjustering, efterträning med förstärkningsinlärning och destillering.

Odyssey-3 är en autoregressiv diffusionstransformer som av Odyssey beskrivs som en videodiffusionsmodell i flera steg, utökad genom teacher forcing och kausal maskning, tränad att fortsätta från föregående observationer och förutsäga framtida tillstånd betingat på aktionsindata, för att sedan destilleras med distributionsmatchning och adversariell destillering till en fåstegsvariant som är tillräckligt snabb för att kunna interagera med. Den körs i 832×480, med Odyssey-3 Pro i 1280×720, producerar inget ljud, och dess hela syfte är att dess utdata beror på vad du gjorde för en stund sedan.

Support från dag ett är skillnaden som ingen benchmarkar

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Läs igenom uppdateringsloggen för Kandinsky 6.0 igen, för den är det mest konkreta faktumet i den här jämförelsen. Den 6 oktober registrerade projektet tillgänglighet i Diffusers, ComfyUI-nodregistret, vLLM-Omni, SGLang och FastVideo, samt ett Hugging Face Space för den destillerade Pro-modellen. Det är fem oberoende inferensstackar på en dag. För alla som har väntat i månader på att en checkpoint ska nå ett serveringsramverk är det siffran som avgör om modellen är användbar.

Håll nu det bredvid Odyssey-3:s åtkomstberättelse. Förhandsversionen körs på experience.odyssey.systems med förstapersonsnavigering, tredjepersonsnavigering och oberoende kamerarörelse. API-åtkomst sker via ett kontaktformulär. Det finns ingen prissättningssida, ingen dokumentation om hastighetsbegränsningar och ingen självbetjäningsnyckel. Webbplatsens API-villkor uppdaterades senast 2026-01-22 och gäller fortfarande "prototypen av Odyssey-2 API" — den kommersiella ytan har inte skrivits om för modellen som släpptes den här månaden.

• Var den körs — dina egna GPU:er, med vikter och kod under MIT, mot enbart Odysseys servrar.

• Hur du integrerar det – Diffusers-pipeline, ComfyUI-noder, vLLM-Omni, SGLang, FastVideo, mot en webbläsarförhandsvisning och ett kontaktformulär.

• Vad du kan granska — arkitektur, träningsrecept och checkpointstorlekar i en offentlig rapport, mot en leverantörsbeskrivning av träningspipelinen utan vikter och utan någon artikel.

• Vad du kan ändra – finjusteringar, LoRA:er, kvantisering och destillation, allt som communityn redan publicerade på Hugging Face dagen efter släppet, mot ingenting alls.

Dimension för dimension

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Utdata — femsekundersklipp med synkroniserat 44 kHz-ljud för båda Kandinsky-nivåerna, mot en interaktiv miljö utan ljud för Odyssey-3.

• Upplösning — Full HD 1920×1080 via den plug-in-baserade superupplösningsmodellen för Kandinsky 6.0 Video, mot 832×480 för Odyssey-3 och 1280×720 för Odyssey-3 Pro.

• Ingående modaliteter — text och bild för Kandinsky, i lägena text-till-ljudvideo och bild-till-ljudvideo; en prompt plus live-styrinmatning för Odyssey-3.

• Parametrar — 3B och 29B publicerade för Lite- och Pro-nivåerna, medan de är hemlighållna för båda Odyssey-3-nivåerna.

• Maskinvara — ett NVIDIA-grafikkort och Python 3.13 eller 3.14, med förinställningar som medföljer för H100/H200 upp till grafikkort i RTX 5090-klassen för Kandinsky; en webbläsare för Odyssey-3.

• Pris — $0 per klipp för Kandinsky 6.0 Video om du har GPU:n, mot inget offentliggjort pris av något slag för Odyssey-3. Tavlans normaliserade kostnadsuppskattningar för Odyssey-3 och Odyssey-3 Pro är $0.139 respektive $0.267 per genererad video, exklusive prompthantering.

• Tredjepartsbedömning — ingendera modellens egen generering ingår i en oberoende head-to-head-jämförelse. Kandinskys rapport bygger på mänsklig sida-vid-sida-utvärdering mot sin föregångare; Odyssey-3:s siffror kommer från en benchmark-inlämning plus en utvärdering utförd av leverantören.

• Licens — MIT för Kandinsky 6.0 Video, mot ingen publicerad licens eftersom det inte finns några vikter att licensiera.

Vad riktmärkena säger och inte säger

Kandinsky 6.0 Video finns inte med på Physics-IQ Verified, Anates Labs- och DeepMind-tavlan som poängsätter fortsättningar av verkliga fysikexperiment över 41 modeller. Inte heller Odyssey-3:s head-to-head-partner finns med här, eftersom tavlan poängsätter modeller som genererar klipp och båda dessa gör det. Det tavlan däremot har med är Kandinskys tidigare världsmodellinje, Kandinsky-WM 1.0, på plats 20 och −8,02 pp mot spårets medelvärde — en annan familj, ett annat syfte och den enda Kandinsky-posten på tavlan.

Odyssey-3:s rader, som kontrast: plats 8 med +2,15 pp på benchmarkens egna prompter och 0,129 USD per video, samt plats 3 med +9,99 pp på anpassade prompter, med Odyssey-3 Pro på andra plats totalt med +11,15 pp. Det är bättre siffror än vad Kandinsky-serien har på just det testet, och de mäter dessutom en annan förmåga – Odyssey-3 poängsätts utifrån vad den förutser efter en störning, vilket är samma sak som dess preview säljer.

Kandinskys eget bevis är den mänskliga utvärderingen i den tekniska rapporten: Kandinsky 6.0 Video Pro överträffar tydligt sin föregångare Kandinsky 5.0 Video Pro och är fortsatt konkurrenskraftig gentemot ledande modeller för ljud- och videogenerering, särskilt vad gäller talskvalitet. Det är en sida-vid-sida-jämförelse utförd av leverantören, och det är den typ av påstående som en släppt checkpoint kan kontrolleras mot av vem som helst med en 5090 och en eftermiddag. Odyssey-3:s motsvarande påstående kan inte kontrolleras av någon utan en API-nyckel.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Att nå dem

OrcaRouter hostar inte någon av modellerna och kommer aldrig att antyda något annat: Odyssey-3 har ingen publicerad taxa för någon att routa, och Kandinsky 6.0 Video har öppna vikter, vilket innebär att det korrekta sättet att köra den är repots egen uppsättning på din egen GPU, inte en hostad slutpunkt.

Där en enda OrcaRouter-nyckel passar in är lagret runt experimentet. Kandinskys repository förutsätter att du tillhandahåller GPU:n, miljön och jämförelsen; det som det inte tillhandahåller är ett sätt att anropa de modeller du vill benchmarka det mot. Mer än 200 modeller ligger bakom en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag — inklusive minimax/minimax-h3, den öppna videomodellen med öppna vikter som MiniMax släppte den 31 juli 2026, för 0,08 USD per sekund av 768P-utdata — så en prisändring från en leverantör landar på din faktura samma dag, automatisk redundansväxling gör att en utvärderingsomgång inte dör under en dålig timme hos en uppströmsleverantör, och routnings-DSL:en låter dig sätta en hostad videomodell och en bildtolkningsmodell bakom ett enda gränssnitt när jobbet går ut på att först generera och sedan poängsätta. Du klonar fortfarande repot och kör installationen själv. Du behöver bara inte bygga den andra halvan av riggen.

Vilken av dem du faktiskt vill ha

Om du behöver utdata som du kan äga – kommersiella villkor du kan läsa, vikter du kan finjustera, en pipeline som körs utan att någon annans API är uppe – är Kandinsky 6.0 Video svaret, och ramverksstödet från dag ett innebär att du inte satsar på en forskningsartefakt. Om du behöver ljud på videon är den den enda av de två som genererar något.

Om problemet är prediktion snarare än produktion — en policy som måste reagera, en träningsmiljö, vad som helst där nästa tillstånd beror på den senaste åtgärden — är Odyssey-3 den enda av de två som gör det, och det är också den du inte kan köpa. Det är den ärliga bilden av den här matchningen under veckan då båda lanserades: en öppen modell som du kan ladda ner och en interaktiv modell som du bara kan prova, där benchmarkbevisen talar för den slutna och de praktiska bevisen talar för den öppna.