
Odyssey-3 vs. Kandinsky 6.0 Video: Offene Gewichte und Audio gegen eine geschlossene interaktive Vorschau
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Kandinsky 6.0 Video erschien am 6. Oktober 2026 mit dem, was Open-Model-Veröffentlichungen selten schon am ersten Tag bieten: Unterstützung in Diffusers, ComfyUI, vLLM-Omni, SGLang und FastVideo, alles dokumentiert im eigenen Update-Log des Repositories, zusammen mit einem am 4. Oktober eingereichten arXiv-Bericht und MIT-lizenzierten Checkpoints auf Hugging Face. Odyssey-3 erschien zwei Tage später, am 8. Oktober, als öffentliche Forschungsvorschau eines autoregressiven Diffusions-Transformers, der aus einem Prompt eine Umgebung erstellt und Änderungen in Echtzeit vorhersagt, während man sich durch sie bewegt. Das eine ist ein Modell mit 29 Milliarden Parametern, das man heute Abend herunterladen und auf der eigenen GPU ausführen kann. Das andere ist ein interaktives System, das man nur über die Browser-Vorschau von Odyssey und ein Kontaktformular erreicht. Sie sind die beiden Pole dessen, was „Video-Modell“ in derselben Woche im Oktober 2026 bedeutete, und die Wahl zwischen ihnen dreht sich weniger um Benchmarks als darum, wer die Gewichte hält.
Sie wollen außerdem unterschiedliche Dinge von dir. Kandinsky 6.0 Video ist ein Generierungsmodell: Prompt rein, ein fünfsekündiger Clip mit synchronisiertem Audio raus. Odyssey-3 ist ein Vorhersagemodell: Handle, und beobachte, wie die Welt reagiert. Keines ersetzt das andere, und die Tatsache, dass sie mit 48 Stunden Abstand veröffentlicht wurden, ist der nützlichste Kontext, den eines von beiden hat.
Die beiden Architekturen, in den eigenen Worten der Anbieter
Kandinsky 6.0 Video ist eine Familie von Foundation-Diffusionsmodellen für die synchronisierte Audio-Video-Generierung, bestehend aus Kandinsky 6.0 Video Lite mit 3B Parametern und Kandinsky 6.0 Video Pro mit 29B. Beide erzeugen Fünf-Sekunden-Clips mit synchronisiertem 44-kHz-Audio, einschließlich Lip-Sync, in den Modi Text-zu-Audio-Video und Bild-zu-Audio-Video, und ein Plug-in-Superauflösungsmodell hebt die Ausgabe auf Full HD 1920×1080 an. Die Technik ist ein Dual-Stream-CrossDiT, der einen vortrainierten Videostream über bidirektionale Cross-Attention mit einem neu trainierten Audiostream verbindet, sodass die beiden Modalitäten zeitlich und semantisch ausgerichtet werden, anstatt getrennt erzeugt und gemuxt zu werden. Das Trainingsrezept ist kontinuierlich: Der Audiostream wird von Grund auf auf großen Audiokorpora trainiert, dann werden beide Streams gemeinsam auf gepaarten Audio-Video-Daten trainiert, wobei die unimodale Wiedergabetreue erhalten bleibt, gefolgt von überwachtem Feintuning, Reinforcement-Learning-Nachtraining und Destillation.
Odyssey-3 ist ein autoregressiver Diffusionstransformer, der von Odyssey als mehrstufiges Video-Diffusionsmodell beschrieben wird, erweitert durch Teacher Forcing und kausale Maskierung, trainiert, um von vorhergehenden Beobachtungen fortzufahren und zukünftige Zustände vorherzusagen, konditioniert auf Aktionsinputs, und dann mit Distribution Matching und adversarischer Destillation in eine Few-Step-Variante destilliert, die schnell genug ist, um mit ihr zu interagieren. Er läuft mit 832×480, wobei Odyssey-3 Pro bei 1280×720 läuft, erzeugt keinen Ton, und sein ganzer Zweck ist, dass seine Ausgabe davon abhängt, was Sie vor einem Moment getan haben.
Support ab Tag eins ist der Unterschied, den niemand benchmarkt.

Lies das Kandinsky-6.0-Update-Log noch einmal, denn es ist die konkreteste Tatsache in diesem Vergleich. Am 6. Oktober verzeichnete das Projekt Verfügbarkeit in Diffusers, der ComfyUI-Node-Registry, vLLM-Omni, SGLang und FastVideo sowie einen Hugging Face Space für das destillierte Pro-Modell. Das sind fünf unabhängige Inferenz-Stacks an einem Tag. Für alle, die monatelang darauf gewartet haben, dass ein Checkpoint ein Serving-Framework erreicht, ist das die Zahl, die darüber entscheidet, ob das Modell nutzbar ist.
Halten Sie es nun neben die Zugangsgeschichte von Odyssey-3. Die Vorschau läuft unter experience.odyssey.systems mit First-Person-Navigation, Third-Person-Navigation und unabhängiger Kamerabewegung. Der API-Zugang erfolgt über ein Kontaktformular. Es gibt keine Preisseite, keine Dokumentation zu Rate-Limits und keinen Self-Service-Schlüssel. Die API-Bedingungen der Website wurden zuletzt am 2026-01-22 aktualisiert und regeln weiterhin „den Prototyp der Odyssey-2-API“ – die kommerzielle Oberfläche wurde nicht für das in diesem Monat veröffentlichte Modell neu geschrieben.
• Wo es läuft — auf deinen eigenen GPUs, mit Gewichten und Code unter MIT, statt nur auf Odysseys Servern.
• Wie Sie es integrieren – Diffusers-Pipeline, ComfyUI-Nodes, vLLM-Omni, SGLang, FastVideo, gegenüber einer Browser-Vorschau und einem Kontaktformular.
• Was Sie einsehen können — Architektur, Trainingsrezept und Checkpoint-Größen in einem öffentlichen Bericht, gegenüber einer Anbieterbeschreibung der Trainingspipeline ohne Gewichte und ohne Paper.
• Was Sie ändern können – Fine-Tunes, LoRAs, Quantisierung und Destillation, die die Community bereits am Tag nach dem Release auf Hugging Face veröffentlichte – gegenüber gar nichts.
Dimension für Dimension

• Ausgabe — Fünf-Sekunden-Clips mit synchronisiertem 44-kHz-Audio für beide Kandinsky-Stufen, gegenüber einer interaktiven Umgebung ohne Audio für Odyssey-3.
• Auflösung — Full HD 1920×1080 über das Plug-in-Superauflösungsmodell für Kandinsky 6.0 Video, gegenüber 832×480 bei Odyssey-3 und 1280×720 bei Odyssey-3 Pro.
• Eingabemodalitäten — Text und Bild für Kandinsky, in Text-zu-Audio-Video- und Bild-zu-Audio-Video-Modi; ein Prompt plus Live-Steuerungseingabe für Odyssey-3.
• Parameter — 3B und 29B für die Lite- und Pro-Stufen veröffentlicht, während sie für beide Odyssey-3-Stufen nicht offengelegt sind.
• Hardware — eine NVIDIA-GPU und Python 3.13 oder 3.14, mit Presets, die für K100/H200 bis hin zu Karten der RTX-5090-Klasse für Kandinsky mitgeliefert werden; ein Browser für Odyssey-3.
• Preis — 0 $ pro Clip für Kandinsky 6.0 Video, wenn Sie über die GPU verfügen, gegenüber keinerlei veröffentlichtem Preis für Odyssey-3. Die normalisierten Kostenschätzungen des Boards für Odyssey-3 und Odyssey-3 Pro liegen bei 0,139 $ bzw. 0,267 $ pro generiertem Video, ohne Prompt-Verarbeitung.
• Bewertung durch Dritte – die eigene Generierung keines der Modelle wird in einem unabhängigen Direktvergleich bewertet. Kandinskys Bericht stützt sich auf eine menschliche Side-by-Side-Bewertung im Vergleich zu seinem Vorgänger; die Zahlen von Odyssey-3 stammen aus einer Benchmark-Einreichung plus einer vom Anbieter durchgeführten Bewertung.
• Lizenz — MIT für Kandinsky 6.0 Video, im Gegensatz zu keiner veröffentlichten Lizenz, da es keine Gewichte zu lizenzieren gibt.
Was die Benchmarks aussagen und was nicht
Kandinsky 6.0 Video erscheint nicht auf Physics-IQ Verified, dem Board von Anates Labs und DeepMind, das Fortsetzungen realer physikalischer Experimente über 41 Modelle hinweg bewertet. Ebenso wenig erscheint hier Odyssey-3s Head-to-head-Partner, weil das Board Modelle bewertet, die Clips generieren, und beide tun dies. Was das Board jedoch führt, ist Kandinskys frühere Weltmodell-Linie, Kandinsky-WM 1.0, auf Rang 20 und −8,02 pp gegenüber dem Track-Mittelwert — eine andere Familie, ein anderer Zweck und der einzige Kandinsky-Eintrag auf dem Board.
Die Zeilen von Odyssey-3 zum Vergleich: Rang 8 bei +2,15 pp für die eigenen Prompts des Benchmarks und 0,129 $ pro Video, und Rang 3 bei +9,99 pp für benutzerdefinierte Prompts, wobei Odyssey-3 Pro mit +11,15 pp insgesamt auf dem zweiten Platz liegt. Das sind bessere Werte, als die Kandinsky-Reihe bei diesem speziellen Test vorzuweisen hat, und sie messen außerdem eine andere Fähigkeit — Odyssey-3 wird danach bewertet, was es nach einer Störung vorhersagt, was genau das ist, womit seine Vorschau wirbt.
Kandinskys eigener Beleg ist die menschliche Bewertung im technischen Bericht: Kandinsky 6.0 Video Pro übertrifft seinen Vorgänger Kandinsky 5.0 Video Pro deutlich und bleibt konkurrenzfähig gegenüber führenden Audio-Video-Generierungsmodellen, insbesondere bei der Sprachqualität. Das ist ein vom Anbieter durchgeführter Direktvergleich, und es ist die Art von Behauptung, die jeder mit einer 5090 und einem Nachmittag anhand eines veröffentlichten Checkpoints überprüfen kann. Die entsprechende Behauptung von Odyssey-3 kann niemand ohne einen API-Schlüssel überprüfen.

Sie erreichen
OrcaRouter hostet weder das eine noch das andere Modell und wird auch nie etwas anderes suggerieren: Für Odyssey-3 gibt es keinen veröffentlichten Tarif, den irgendjemand routen könnte, und Kandinsky 6.0 Video ist Open Weights, was bedeutet, dass der richtige Weg, es auszuführen, das Setup des Repositories auf der eigenen GPU ist – nicht ein gehosteter Endpunkt.
Wo ein einzelner OrcaRouter-Schlüssel passt, ist die Ebene rund um das Experiment. Kandinskys Repository setzt voraus, dass du die GPU, die Umgebung und den Vergleich bereitstellst; was es nicht bereitstellt, ist eine Möglichkeit, die Modelle aufzurufen, gegen die du es benchmarken willst. Mehr als 200 Modelle stehen hinter einem einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag — darunter minimax/minimax-h3, das Open-Weight-Videomodell, das MiniMax am 31. Juli 2026 veröffentlicht hat, für 0,08 $ pro Sekunde 768P-Ausgabe — sodass eine Preisänderung eines Anbieters noch am selben Tag auf deiner Rechnung landet, automatisches Failover verhindert, dass ein Evaluationsdurchlauf an einer schlechten Stunde eines Upstreams stirbt, und die Routing-DSL lässt dich ein gehostetes Videomodell und ein Vision-Modell hinter einer Schnittstelle bündeln, wenn die Aufgabe darin besteht, zu generieren und dann zu bewerten. Du klonst das Repo weiterhin selbst und führst das Setup selbst aus. Du musst nur nicht die andere Hälfte des Rigs bauen.
Welche willst du eigentlich?
Wenn Sie Output brauchen, der Ihnen gehören kann – kommerzielle Bedingungen, die Sie lesen können, Gewichte, die Sie feinabstimmen können, eine Pipeline, die läuft, ohne dass die API von jemand anderem online sein muss –, dann ist Kandinsky 6.0 Video die Antwort, und die Framework-Unterstützung ab dem ersten Tag bedeutet, dass Sie nicht auf ein Forschungsartefakt setzen. Wenn Sie Ton zum Video brauchen, ist es das einzige, das überhaupt welchen erzeugt.
Wenn das Problem die Vorhersage statt der Produktion ist – eine Policy, die reagieren muss, eine Trainingsumgebung, irgendetwas, bei dem der nächste Zustand von der letzten Aktion abhängt –, dann ist Odyssey-3 von den beiden das einzige, das es tut, und zugleich dasjenige, das man nicht kaufen kann. Das ist die ehrliche Gestalt dieses Duells in der Woche, in der beide erschienen sind: ein offenes Modell, das man herunterladen kann, und ein interaktives Modell, das man nur ausprobieren kann, wobei die Benchmark-Evidenz für das geschlossene und die praktische Evidenz für das offene spricht.
