Scheda del titolo per Odyssey-3 vs Kandinsky 6.0 Video, con un pannello sinistro con intestazione Odyssey-3 che riporta un ambiente interattivo, un'anteprima di ricerca aperta l'8 ottobre 2026, 832x480 o 1280x720 Pro, nessun peso e nessun prezzo; e un pannello destro con intestazione Kandinsky 6.0 Video che riporta pesi aperti il 6 ottobre 2026 sotto licenza MIT, clip di 5 s con audio a 44 kHz, Full HD 1920x1080, Physics-IQ non inviato.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: pesi aperti e audio contro un'anteprima interattiva chiusa

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Kandinsky 6.0 Video è arrivato il 6 ottobre 2026 con quella cosa che i rilasci di modelli aperti raramente hanno al day one: il supporto in Diffusers, ComfyUI, vLLM-Omni, SGLang e FastVideo, tutto documentato nel log di aggiornamento del repository stesso, insieme a un report arXiv inviato il 4 ottobre e a checkpoint con licenza MIT su Hugging Face. Odyssey-3 è arrivato due giorni dopo, l'8 ottobre, come anteprima pubblica di ricerca di un transformer di diffusione autoregressivo che costruisce un ambiente a partire da un prompt e ne prevede i cambiamenti in tempo reale mentre lo si attraversa. Uno è un modello da 29 miliardi di parametri che puoi scaricare ed eseguire sulla tua GPU già stasera. L'altro è un sistema interattivo a cui puoi accedere solo tramite l'anteprima nel browser di Odyssey e un modulo di contatto. Sono i due poli di ciò che significava «modello video» nella stessa settimana dell'ottobre 2026, e la scelta tra loro riguarda meno i benchmark che chi detiene i pesi.

Anche loro vogliono cose diverse da te. Kandinsky 6.0 Video è un modello generativo: inserisci un prompt, ottieni una clip di cinque secondi con audio sincronizzato. Odyssey-3 è un modello predittivo: agisci e osserva il mondo reagire. Nessuno dei due sostituisce l'altro, e il fatto che siano stati rilasciati a 48 ore di distanza è il contesto più utile che entrambi abbiano.

Le due architetture, secondo la terminologia dei fornitori stessi

Kandinsky 6.0 Video è una famiglia di modelli di diffusione foundation per la generazione sincronizzata di audio e video, che comprende Kandinsky 6.0 Video Lite da 3B parametri e Kandinsky 6.0 Video Pro da 29B. Entrambi generano clip di cinque secondi con audio sincronizzato a 44 kHz, incluso il lip-sync, nelle modalità text-to-audio-video e image-to-audio-video, e un modello plug-in di super-risoluzione porta l'output a Full HD 1920×1080. La tecnica è un CrossDiT a doppio stream che collega uno stream video preaddestrato a uno stream audio addestrato da zero tramite cross-attention bidirezionale, così le due modalità si allineano nel tempo e nella semantica invece di essere generate separatamente e multiplexate. La ricetta di addestramento è continua: lo stream audio viene addestrato da zero su grandi corpora audio, poi entrambi gli stream vengono addestrati congiuntamente su dati audio-video appaiati preservando la fedeltà unimodale, seguiti da fine-tuning supervisionato, post-addestramento con reinforcement learning e distillazione.

Odyssey-3 è un diffusion transformer autoregressivo descritto da Odyssey come un modello di diffusione video multi-step esteso tramite teacher forcing e mascheramento causale, addestrato a continuare dalle osservazioni precedenti e a predire stati futuri condizionati sugli input di azione, poi distillato con distribution matching e distillazione avversariale in una variante a pochi passi abbastanza veloce da poterci interagire. Gira a 832×480, con Odyssey-3 Pro a 1280×720, non produce audio, e il suo intero scopo è che il suo output dipende da ciò che hai fatto un attimo prima.

Il supporto dal primo giorno è la differenza che nessuno misura.

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Leggi di nuovo il log di aggiornamento di Kandinsky 6.0, perché è il fatto più concreto in questo confronto. Il 6 ottobre il progetto ha registrato la disponibilità in Diffusers, nel registro dei nodi di ComfyUI, in vLLM-Omni, SGLang e FastVideo, e uno Space di Hugging Face per il modello Pro distillato. Sono cinque stack di inferenza indipendenti in un solo giorno. Per chiunque abbia aspettato mesi che un checkpoint arrivasse a un framework di serving, questo è il numero che decide se il modello è utilizzabile.

Ora mettilo accanto alla storia di accesso di Odyssey-3. L'anteprima gira su experience.odyssey.systems con navigazione in prima persona, navigazione in terza persona e movimento indipendente della telecamera. L'accesso API avviene tramite un modulo di contatto. Non c'è una pagina dei prezzi, nessuna documentazione sui limiti di frequenza e nessuna chiave self-service. I termini API del sito sono stati aggiornati l'ultima volta il 2026-01-22 e disciplinano ancora "il prototipo di Odyssey-2 API" — la superficie commerciale non è stata riscritta per il modello rilasciato questo mese.

• Dove viene eseguito — sulle tue GPU, con pesi e codice con licenza MIT, contro i server di Odyssey soltanto.

Come integri la pipeline Diffusers, i nodi ComfyUI, vLLM-Omni, SGLang, FastAPI, lo streaming WebSocket, un'anteprima nel browser e un modulo di contatto.

• Cosa puoi esaminare — architettura, ricetta di addestramento e dimensioni dei checkpoint in un rapporto pubblico, rispetto a una descrizione del fornitore della pipeline di addestramento senza pesi e senza paper.

• Cosa puoi modificare — fine-tuning, LoRA, quantizzazione e distillazione, tutte cose che la community stava già pubblicando su Hugging Face il giorno dopo il rilascio, a fronte di assolutamente nulla.

Dimensione per dimensione

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Output — clip di cinque secondi con audio sincronizzato a 44 kHz per entrambi i livelli di Kandinsky, a fronte di un ambiente interattivo senza audio per Odyssey-3.

• Risoluzione — Full HD 1920×1080 tramite il modello plug-in di super-risoluzione per Kandinsky 6.0 Video, rispetto a 832×480 per Odyssey-3 e 1280×720 per Odyssey-3 Pro.

• Modalità in ingresso — testo e immagine per Kandinsky, nelle modalità testo-ad-audio-video e immagine-ad-audio-video; un prompt più input di controllo live per Odyssey-3.

• Parametri — 3B e 29B pubblicati per le fasce Lite e Pro, mentre non sono divulgati per entrambe le fasce Odyssey-3.

• Hardware — una GPU NVIDIA e Python 3.13 o 3.14, con preset forniti per schede da H100/H200 fino alla classe RTX 5090 per Kandinsky; un browser per Odyssey-3.

• Prezzo — 0 $ per clip per Kandinsky 6.0 Video se disponi della GPU, mentre per Odyssey-3 non è pubblicato alcun prezzo di alcun tipo. Le stime di costo normalizzate della board per Odyssey-3 e Odyssey-3 Pro sono 0,139 $ e 0,267 $ per video generato, esclusa la gestione del prompt.

• Valutazione di terze parti — la generazione di nessuno dei due modelli compare in un confronto testa a testa indipendente. Il rapporto di Kandinsky si basa su una valutazione umana side-by-side rispetto al suo predecessore; i dati di Odyssey-3 provengono da una sottomissione a un benchmark più una valutazione condotta dal fornitore.

• Licenza — MIT per Kandinsky 6.0 Video, a fronte dell'assenza di una licenza pubblicata perché non ci sono pesi da concedere in licenza.

Cosa dicono e cosa non dicono i benchmark

Kandinsky 6.0 Video non compare su Physics-IQ Verified, la classifica di Anates Labs e DeepMind che valuta le continuazioni di esperimenti fisici reali su 41 modelli. Neppure vi compare il partner di Odyssey-3 nel confronto diretto qui presente, perché la classifica valuta modelli che generano clip ed entrambi questi lo fanno. Ciò che invece la classifica contiene è la precedente linea di world model di Kandinsky, Kandinsky-WM 1.0, al rango 20 e con −8,02 pp rispetto alla media del track — una famiglia diversa, uno scopo diverso, e l'unica voce Kandinsky presente nella classifica.

Le righe di Odyssey-3, per confronto: 8° posto a +2,15 pp sui prompt propri del benchmark e $0,129 per video, e 3° posto a +9,99 pp sui prompt personalizzati, con Odyssey-3 Pro secondo nel complesso a +11,15 pp. Sono numeri migliori di qualsiasi cosa la linea Kandinsky abbia su quel particolare test, e misurano anche una capacità diversa — Odyssey-3 viene valutato su ciò che prevede dopo una perturbazione, che è la stessa cosa che vende la sua anteprima.

La prova addotta da Kandinsky stesso è la valutazione umana nel rapporto tecnico: Kandinsky 6.0 Video Pro supera nettamente il suo predecessore Kandinsky 5.0 Video Pro e resta competitivo con i principali modelli di generazione audio-video, in particolare sulla qualità del parlato. Si tratta di un confronto affiancato condotto dal fornitore, ed è il tipo di affermazione che chiunque abbia una 5090 e un pomeriggio può verificare su un checkpoint rilasciato. L'affermazione equivalente di Odyssey-3 non può essere verificata da nessuno senza una chiave API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Raggiungerli

OrcaRouter non ospita nessuno dei due modelli e non insinuerà mai il contrario: Odyssey-3 non ha una tariffa pubblicata che permetta a chiunque di instradarlo, e Kandinsky 6.0 Video è distribuito a pesi aperti, il che significa che il modo corretto per eseguirlo è la configurazione propria del repository sulla propria GPU, non un endpoint ospitato.

Il punto in cui si inserisce una chiave OrcaRouter è lo strato attorno all'esperimento. Il repository di Kandinsky presuppone che tu fornisca la GPU, l'ambiente e il confronto; ciò che non fornisce è un modo per chiamare i modelli con cui vuoi confrontarlo. Più di 200 modelli sono dietro una singola chiave OrcaRouter al prezzo di listino del provider con 0% di markup — incluso minimax/minimax-h3, il modello video open-weight rilasciato da M​iniMax il 31 luglio 2026, a 0,08 $ al secondo di output 768P — quindi una variazione di prezzo del fornitore arriva sulla tua fattura lo stesso giorno, il failover automatico impedisce che una sweep di valutazione muoia sull'ora storta di un upstream, e il DSL di routing ti permette di mettere un modello video hosted e un modello di visione dietro un'unica interfaccia quando il lavoro consiste nel generare e poi valutare. Cloni comunque il repository ed esegui il setup da solo. Semplicemente non devi costruire l'altra metà dell'attrezzatura.

Quale vuoi davvero

Se hai bisogno di un output che puoi possedere — termini commerciali che puoi leggere, pesi che puoi mettere a punto, una pipeline che funziona senza che l'API di qualcun altro sia attiva — Kandinsky 6.0 Video è la risposta, e il supporto al framework dal primo giorno significa che non stai scommettendo su un artefatto di ricerca. Se hai bisogno dell'audio sul video, è l'unico dei due a generarne.

Se il problema è la previsione piuttosto che la produzione — una politica che deve reagire, un ambiente di addestramento, qualsiasi cosa in cui lo stato successivo dipende dall'azione precedente — Odyssey-3 è l'unico dei due che lo fa, ed è anche quello che non puoi comprare. Questa è la forma onesta di questo confronto nella settimana in cui entrambi sono arrivati: un modello aperto che puoi scaricare e un modello interattivo che puoi solo provare, con le prove del benchmark a favore di quello chiuso e le prove pratiche a favore di quello aperto.