
Odyssey-3 vs Kandinsky 6.0 Video: Öppna vikter och ljud mot en stängd interaktiv förhandsvisning
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Kandinsky 6.0 Video kom den 6 oktober 2026 med det som öppna modellsläpp sällan har på dag ett: stöd i Diffusers, ComfyUI, vLLM-Omni, SGLang och FastVideo, allt dokumenterat i repots egen uppdateringslogg, tillsammans med en arXiv-rapport som lämnades in den 4 oktober och MIT-licensierade checkpoints på Hugging Face. Odyssey-3 kom två dagar senare, den 8 oktober, som en offentlig forskningsförhandsvisning av en autoregressiv diffusionstransformer som bygger en miljö från en prompt och förutsäger förändringar i realtid när du rör dig genom den. Den ena är en modell med 29 miljarder parametrar som du kan ladda ner och köra på din egen GPU i kväll. Den andra är ett interaktivt system som du bara kan nå via Odysseys webbläsarförhandsvisning och ett kontaktformulär. De är de två polerna av vad "videomodell" betydde under samma vecka i oktober 2026, och valet mellan dem handlar mindre om benchmarks än om vem som har vikterna.
De vill också olika saker av dig. Kandinsky 6.0 Video är en genereringsmodell: en prompt in, ett fem sekunder långt klipp med synkroniserat ljud ut. Odyssey-3 är en prediktionsmodell: agera och se världen svara. Ingen av dem ersätter den andra, och att de släpptes med 48 timmars mellanrum är det mest användbara sammanhanget någon av dem har.
De två arkitekturerna, i leverantörernas egna ordalag
Kandinsky 6.0 Video är en familj av fundamentala diffusionsmodeller för synkroniserad ljud- och videogenerering, bestående av Kandinsky 6.0 Video Lite med 3B parametrar och Kandinsky 6.0 Video Pro med 29B. Båda genererar femsekundersklipp med synkroniserat 44 kHz-ljud, inklusive läppsynk, i lägena text-till-ljud-video och bild-till-ljud-video, och en plug-in-superupplösningsmodell höjer utdata till Full HD 1920×1080. Tekniken är en dual-stream-CrossDiT som kopplar en förtränad videoström till en nyligen tränad ljudström via dubbelriktad korsuppmärksamhet, så att de två modaliteterna samordnas i tid och semantik i stället för att genereras separat och muxas. Träningsreceptet är kontinuerligt: ljudströmmen tränas från grunden på stora ljudkorpusar, sedan tränas båda strömmarna gemensamt på parade ljud-videodata samtidigt som unimodal trohet bevaras, följt av övervakad finjustering, efterträning med förstärkningsinlärning och destillering.
Odyssey-3 är en autoregressiv diffusionstransformer som av Odyssey beskrivs som en videodiffusionsmodell i flera steg, utökad genom teacher forcing och kausal maskning, tränad att fortsätta från föregående observationer och förutsäga framtida tillstånd betingat på aktionsindata, för att sedan destilleras med distributionsmatchning och adversariell destillering till en fåstegsvariant som är tillräckligt snabb för att kunna interagera med. Den körs i 832×480, med Odyssey-3 Pro i 1280×720, producerar inget ljud, och dess hela syfte är att dess utdata beror på vad du gjorde för en stund sedan.
Support från dag ett är skillnaden som ingen benchmarkar

Läs igenom uppdateringsloggen för Kandinsky 6.0 igen, för den är det mest konkreta faktumet i den här jämförelsen. Den 6 oktober registrerade projektet tillgänglighet i Diffusers, ComfyUI-nodregistret, vLLM-Omni, SGLang och FastVideo, samt ett Hugging Face Space för den destillerade Pro-modellen. Det är fem oberoende inferensstackar på en dag. För alla som har väntat i månader på att en checkpoint ska nå ett serveringsramverk är det siffran som avgör om modellen är användbar.
Håll nu det bredvid Odyssey-3:s åtkomstberättelse. Förhandsversionen körs på experience.odyssey.systems med förstapersonsnavigering, tredjepersonsnavigering och oberoende kamerarörelse. API-åtkomst sker via ett kontaktformulär. Det finns ingen prissättningssida, ingen dokumentation om hastighetsbegränsningar och ingen självbetjäningsnyckel. Webbplatsens API-villkor uppdaterades senast 2026-01-22 och gäller fortfarande "prototypen av Odyssey-2 API" — den kommersiella ytan har inte skrivits om för modellen som släpptes den här månaden.
• Var den körs — dina egna GPU:er, med vikter och kod under MIT, mot enbart Odysseys servrar.
• Hur du integrerar det – Diffusers-pipeline, ComfyUI-noder, vLLM-Omni, SGLang, FastVideo, mot en webbläsarförhandsvisning och ett kontaktformulär.
• Vad du kan granska — arkitektur, träningsrecept och checkpointstorlekar i en offentlig rapport, mot en leverantörsbeskrivning av träningspipelinen utan vikter och utan någon artikel.
• Vad du kan ändra – finjusteringar, LoRA:er, kvantisering och destillation, allt som communityn redan publicerade på Hugging Face dagen efter släppet, mot ingenting alls.
Dimension för dimension

• Utdata — femsekundersklipp med synkroniserat 44 kHz-ljud för båda Kandinsky-nivåerna, mot en interaktiv miljö utan ljud för Odyssey-3.
• Upplösning — Full HD 1920×1080 via den plug-in-baserade superupplösningsmodellen för Kandinsky 6.0 Video, mot 832×480 för Odyssey-3 och 1280×720 för Odyssey-3 Pro.
• Ingående modaliteter — text och bild för Kandinsky, i lägena text-till-ljudvideo och bild-till-ljudvideo; en prompt plus live-styrinmatning för Odyssey-3.
• Parametrar — 3B och 29B publicerade för Lite- och Pro-nivåerna, medan de är hemlighållna för båda Odyssey-3-nivåerna.
• Maskinvara — ett NVIDIA-grafikkort och Python 3.13 eller 3.14, med förinställningar som medföljer för H100/H200 upp till grafikkort i RTX 5090-klassen för Kandinsky; en webbläsare för Odyssey-3.
• Pris — $0 per klipp för Kandinsky 6.0 Video om du har GPU:n, mot inget offentliggjort pris av något slag för Odyssey-3. Tavlans normaliserade kostnadsuppskattningar för Odyssey-3 och Odyssey-3 Pro är $0.139 respektive $0.267 per genererad video, exklusive prompthantering.
• Tredjepartsbedömning — ingendera modellens egen generering ingår i en oberoende head-to-head-jämförelse. Kandinskys rapport bygger på mänsklig sida-vid-sida-utvärdering mot sin föregångare; Odyssey-3:s siffror kommer från en benchmark-inlämning plus en utvärdering utförd av leverantören.
• Licens — MIT för Kandinsky 6.0 Video, mot ingen publicerad licens eftersom det inte finns några vikter att licensiera.
Vad riktmärkena säger och inte säger
Kandinsky 6.0 Video finns inte med på Physics-IQ Verified, Anates Labs- och DeepMind-tavlan som poängsätter fortsättningar av verkliga fysikexperiment över 41 modeller. Inte heller Odyssey-3:s head-to-head-partner finns med här, eftersom tavlan poängsätter modeller som genererar klipp och båda dessa gör det. Det tavlan däremot har med är Kandinskys tidigare världsmodellinje, Kandinsky-WM 1.0, på plats 20 och −8,02 pp mot spårets medelvärde — en annan familj, ett annat syfte och den enda Kandinsky-posten på tavlan.
Odyssey-3:s rader, som kontrast: plats 8 med +2,15 pp på benchmarkens egna prompter och 0,129 USD per video, samt plats 3 med +9,99 pp på anpassade prompter, med Odyssey-3 Pro på andra plats totalt med +11,15 pp. Det är bättre siffror än vad Kandinsky-serien har på just det testet, och de mäter dessutom en annan förmåga – Odyssey-3 poängsätts utifrån vad den förutser efter en störning, vilket är samma sak som dess preview säljer.
Kandinskys eget bevis är den mänskliga utvärderingen i den tekniska rapporten: Kandinsky 6.0 Video Pro överträffar tydligt sin föregångare Kandinsky 5.0 Video Pro och är fortsatt konkurrenskraftig gentemot ledande modeller för ljud- och videogenerering, särskilt vad gäller talskvalitet. Det är en sida-vid-sida-jämförelse utförd av leverantören, och det är den typ av påstående som en släppt checkpoint kan kontrolleras mot av vem som helst med en 5090 och en eftermiddag. Odyssey-3:s motsvarande påstående kan inte kontrolleras av någon utan en API-nyckel.

Att nå dem
OrcaRouter hostar inte någon av modellerna och kommer aldrig att antyda något annat: Odyssey-3 har ingen publicerad taxa för någon att routa, och Kandinsky 6.0 Video har öppna vikter, vilket innebär att det korrekta sättet att köra den är repots egen uppsättning på din egen GPU, inte en hostad slutpunkt.
Där en enda OrcaRouter-nyckel passar in är lagret runt experimentet. Kandinskys repository förutsätter att du tillhandahåller GPU:n, miljön och jämförelsen; det som det inte tillhandahåller är ett sätt att anropa de modeller du vill benchmarka det mot. Mer än 200 modeller ligger bakom en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag — inklusive minimax/minimax-h3, den öppna videomodellen med öppna vikter som MiniMax släppte den 31 juli 2026, för 0,08 USD per sekund av 768P-utdata — så en prisändring från en leverantör landar på din faktura samma dag, automatisk redundansväxling gör att en utvärderingsomgång inte dör under en dålig timme hos en uppströmsleverantör, och routnings-DSL:en låter dig sätta en hostad videomodell och en bildtolkningsmodell bakom ett enda gränssnitt när jobbet går ut på att först generera och sedan poängsätta. Du klonar fortfarande repot och kör installationen själv. Du behöver bara inte bygga den andra halvan av riggen.
Vilken av dem du faktiskt vill ha
Om du behöver utdata som du kan äga – kommersiella villkor du kan läsa, vikter du kan finjustera, en pipeline som körs utan att någon annans API är uppe – är Kandinsky 6.0 Video svaret, och ramverksstödet från dag ett innebär att du inte satsar på en forskningsartefakt. Om du behöver ljud på videon är den den enda av de två som genererar något.
Om problemet är prediktion snarare än produktion — en policy som måste reagera, en träningsmiljö, vad som helst där nästa tillstånd beror på den senaste åtgärden — är Odyssey-3 den enda av de två som gör det, och det är också den du inte kan köpa. Det är den ärliga bilden av den här matchningen under veckan då båda lanserades: en öppen modell som du kan ladda ner och en interaktiv modell som du bara kan prova, där benchmarkbevisen talar för den slutna och de praktiska bevisen talar för den öppna.
