
Odyssey-3 vs Kandinsky 6.0 Video: Open gewichten en audio tegenover een gesloten interactieve preview
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Kandinsky 6.0 Video verscheen op 6 oktober 2026 met iets wat releases van open modellen zelden op dag één hebben: ondersteuning in Diffusers, ComfyUI, vLLM-Omni, SGLang en FastVideo, allemaal gedocumenteerd in het eigen updatelog van de repository, naast een arXiv-rapport dat op 4 oktober werd ingediend en checkpoints onder MIT-licentie op Hugging Face. Odyssey-3 verscheen twee dagen later, op 8 oktober, als een publieke onderzoekspreview van een autoregressieve diffusietransformer die een omgeving opbouwt vanuit een prompt en veranderingen in realtime voorspelt terwijl je je erdoorheen beweegt. De een is een model met 29 miljard parameters dat je vanavond kunt downloaden en op je eigen GPU kunt draaien. De ander is een interactief systeem dat je alleen kunt bereiken via Odyssey's browservoorbeeld en een contactformulier. Het zijn de twee polen van wat "videomodel" betekende in dezelfde week van oktober 2026, en de keuze tussen hen gaat minder over benchmarks dan over wie de gewichten bezit.
Ze willen ook verschillende dingen van je. Kandinsky 6.0 Video is een generatiemodel: prompt erin, een clip van vijf seconden met gesynchroniseerde audio eruit. Odyssey-3 is een voorspellingsmodel: handel, en zie hoe de wereld reageert. Geen van beide vervangt de andere, en het feit dat ze binnen 48 uur na elkaar zijn uitgekomen, is de nuttigste context die elk van hen heeft.
De twee architecturen, in de eigen bewoordingen van de leveranciers
Kandinsky 6.0 Video is een familie van foundation-diffusiemodellen voor gesynchroniseerde audio-videogeneratie, bestaande uit Kandinsky 6.0 Video Lite met 3B parameters en Kandinsky 6.0 Video Pro met 29B. Beide genereren clips van vijf seconden met gesynchroniseerde audio van 44 kHz, inclusief lip-sync, in tekst-naar-audio-video- en afbeelding-naar-audio-video-modus, en een plug-in-superresolutiemodel verhoogt de uitvoer naar Full HD 1920×1080. De techniek is een dual-stream CrossDiT die een vooraf getrainde videostream via bidirectionele cross-attentie verbindt met een nieuw getrainde audiostream, zodat de twee modaliteiten in tijd en semantiek op elkaar aansluiten in plaats van afzonderlijk te worden gegenereerd en vervolgens gemuxt. Het trainingsrecept is continu: de audiostream wordt vanaf nul getraind op grote audiocorpora, daarna worden beide streams gezamenlijk getraind op gepaarde audio-videodata met behoud van unimodale getrouwheid, gevolgd door gesuperviseerde fine-tuning, post-training met reinforcement learning en distillatie.
Odyssey-3 is een autoregressieve diffusietransformer die door Odyssey wordt beschreven als een meerstaps videodiffusiemodel dat is uitgebreid met teacher forcing en causale masking, getraind om verder te gaan vanaf voorgaande observaties en toekomstige toestanden te voorspellen op basis van actie-inputs, en vervolgens via distributiematching en adversariële distillatie is gedistilleerd tot een variant met weinig stappen die snel genoeg is om mee te interacteren. Het draait op 832×480, met Odyssey-3 Pro op 1280×720, produceert geen audio, en het hele doel ervan is dat de uitvoer afhangt van wat je een moment geleden deed.
Ondersteuning vanaf dag één is het verschil dat niemand benchmarkt.

Lees het update-log van Kandinsky 6.0 nog eens, want het is het meest concrete feit in deze vergelijking. Op 6 oktober noteerde het project beschikbaarheid in Diffusers, het ComfyUI-node-register, vLLM-Omni, SGLang en FastVideo, en een Hugging Face Space voor het gedistilleerde Pro-model. Dat zijn vijf onafhankelijke inferentiestacks op één dag. Voor iedereen die maanden heeft gewacht tot een checkpoint een servingframework bereikte, is dat het getal dat bepaalt of het model bruikbaar is.
Houd het nu naast het toegangsverhaal van Odyssey-3. De preview draait op experience.odyssey.systems met eerstepersoonsnavigatie, derdepersoonsnavigatie en onafhankelijke camerabeweging. API-toegang is een contactformulier. Er is geen prijzenpagina, geen documentatie over snelheidslimieten en geen selfservice-sleutel. De API-voorwaarden van de site zijn voor het laatst bijgewerkt op 2026-01-22 en hebben nog steeds betrekking op "het prototype van Odyssey-2 API" — het commerciële oppervlak is niet herschreven voor het model dat deze maand is uitgebracht.
• Waar het draait — je eigen GPU's, met gewichten en code onder MIT, uitsluitend tegen Odyssey's servers.
• Hoe je het integreert — Diffusers-pipeline, ComfyUI-nodes, vLLM-Omni, SGLang, FastVideo, afgezet tegen een browserpreview en een contactformulier.
• Wat je kunt inspecteren — architectuur, trainingsrecept en checkpointgroottes in een openbaar rapport, tegenover een leveranciersbeschrijving van de trainingspijplijn zonder gewichten en zonder paper.
• Wat je kunt aanpassen — fine-tunes, LoRA's, kwantisatie en distillatie, die de community de dag na de release al op Hugging Face publiceerde, tegenover helemaal niets.
Dimensie voor dimensie

Uitvoer — clips van vijf seconden met gesynchroniseerde audio van 44 kHz voor beide Kandinsky-niveaus, tegenover een interactieve omgeving zonder audio voor Odyssey-3.
• Resolutie — Full HD 1920×1080 via het plug-in-superresolutiemodel voor Kandinsky 6.0 Video, tegenover 832×480 voor Odyssey-3 en 1280×720 voor Odyssey-3 Pro.
• Modaliteiten in — tekst en afbeelding voor Kandinsky, in tekst-naar-audio-video- en afbeelding-naar-audio-video-modi; een prompt plus live besturingsinvoer voor Odyssey-3.
• Parameters — 3B en 29B gepubliceerd voor de Lite- en Pro-tiers, tegenover niet bekendgemaakt voor beide Odyssey-3-tiers.
• Hardware — een NVIDIA-GPU en Python 3.13 of 3.14, met presets die worden meegeleverd voor H100/H200 tot en met kaarten in de RTX 5090-klasse voor Kandinsky; een browser voor Odyssey-3.
• Prijs — $0 per clip voor Kandinsky 6.0 Video als je de GPU hebt, tegenover geen enkele gepubliceerde prijs van welke aard dan ook voor Odyssey-3. De genormaliseerde kostenramingen van het scorebord voor Odyssey-3 en Odyssey-3 Pro zijn $0,139 en $0,267 per gegenereerde video, exclusief promptverwerking.
• Scoring door derden — geen van beide modellen is met zijn eigen generatie opgenomen in een onafhankelijke head-to-head. Het rapport van Kandinsky steunt op een side-by-side menselijke evaluatie tegenover zijn voorganger; de cijfers van Odyssey-3 komen uit een benchmarkinzending plus een door de leverancier uitgevoerde evaluatie.
• Licentie — MIT voor Kandinsky 6.0 Video, tegenover geen gepubliceerde licentie omdat er geen weights zijn om te licenseren.
Wat de benchmarks wel en niet zeggen
Kandinsky 6.0 Video staat niet op Physics-IQ Verified, het leaderboard van Anates Labs en DeepMind dat de voortzettingen van echte natuurkundige experimenten over 41 modellen beoordeelt. Ook de head-to-head-partner van Odyssey-3 hier staat er niet op, omdat het leaderboard modellen beoordeelt die clips genereren, en dat doen beide. Wat het leaderboard wel bevat, is de eerdere wereldmodellijn van Kandinsky, Kandinsky-WM 1.0, op rang 20 met −8,02 pp ten opzichte van het trackgemiddelde — een andere familie, een ander doel, en de enige Kandinsky-vermelding op het leaderboard.
De rijen van Odyssey-3 daarentegen: rang 8 met +2,15 pp op de eigen prompts van de benchmark en $0,129 per video, en rang 3 met +9,99 pp op aangepaste prompts, met Odyssey-3 Pro als tweede overall met +11,15 pp. Dat zijn betere cijfers dan alles wat de Kandinsky-lijn op die specifieke test heeft, en ze meten ook een ander vermogen — Odyssey-3 wordt beoordeeld op wat het voorspelt na een verstoring, wat hetzelfde is als wat de preview ervan verkoopt.
Kandinsky's eigen bewijsmateriaal is de menselijke evaluatie in het technische rapport: Kandinsky 6.0 Video Pro presteert duidelijk beter dan zijn voorganger Kandinsky 5.0 Video Pro, en blijft concurrerend met toonaangevende audio-video-generatiemodellen, met name op spraakkwaliteit. Dat is een door de leverancier uitgevoerde rechtstreekse vergelijking, en het is het soort bewering dat door iedereen met een 5090 en een middag kan worden gecontroleerd aan de hand van een vrijgegeven checkpoint. De gelijkwaardige bewering van Odyssey-3 kan door niemand zonder API-sleutel worden gecontroleerd.

Ze bereiken
OrcaRouter host geen van beide modellen, en zal nooit het tegendeel suggereren: Odyssey-3 heeft geen gepubliceerd tarief dat iemand kan routeren, en Kandinsky 6.0 Video heeft open gewichten, wat betekent dat de juiste manier om het te draaien de eigen setup van de repository op je eigen GPU is, en niet een gehoste endpoint.
Waar één OrcaRouter-sleutel past, is de laag rond het experiment. De repository van Kandinsky gaat ervan uit dat jij de GPU, de omgeving en de vergelijking levert; wat er niet wordt geleverd, is een manier om de modellen aan te roepen waarmee je wilt benchmarken. Meer dan 200 modellen zitten achter één OrcaRouter-sleutel tegen de lijstprijs van de provider met 0% opslag — waaronder minimax/minimax-h3, het open-weight videomodel dat MiniMax op 31 juli 2026 uitbracht, voor $0,08 per seconde 768P-output — dus een prijswijziging van een leverancier staat dezelfde dag op je factuur, automatische failover voorkomt dat een evaluatiesweep sneuvelt door één slecht uur bij een upstream, en de routing-DSL laat je een gehost videomodel en een visiemodel achter één interface zetten wanneer de taak eerst genereren en dan beoordelen is. Je kloont de repo nog steeds zelf en voert de setup zelf uit. Je hoeft alleen de andere helft van de opstelling niet te bouwen.
Welke je eigenlijk wilt
Als je output nodig hebt die je zelf kunt bezitten — commerciële voorwaarden die je kunt lezen, gewichten die je kunt fine-tunen, een pipeline die draait zonder dat de API van iemand anders in de lucht hoeft te zijn — dan is Kandinsky 6.0 Video het antwoord, en de frameworkondersteuning vanaf dag één betekent dat je niet gokt op een onderzoeksartefact. Als je geluid bij de video nodig hebt, is het de enige van de twee die überhaupt geluid genereert.
Als het probleem voorspelling is in plaats van productie — een beleid dat moet reageren, een trainingsomgeving, alles waarbij de volgende toestand afhangt van de laatste actie — dan is Odyssey-3 de enige van de twee die dat doet, en het is ook degene die je niet kunt kopen. Dat is de eerlijke vorm van deze confrontatie in de week dat beide uitkwamen: een open model dat je kunt downloaden en een interactief model dat je alleen kunt uitproberen, waarbij het benchmarkbewijs in het voordeel van het gesloten model pleit en het praktijkbewijs in het voordeel van het open model.
