Scheda titolo per Odyssey-3 vs ByteDance Seedance 2, con un pannello sinistro intitolato Odyssey-3 che recita “un mondo che guidi in diretta”, 832x480 o 1280x720 Pro, Physics-IQ +9,99 pp posizione 03; e un pannello destro intitolato ByteDance Seedance 2 che recita GA dal 12 febbraio 2026, piattaforma a consumo, una clip finita fino a 15 s, risoluzione non pubblicata, Physics-IQ non presentato.
Guides & Insights

Odyssey-3 vs ByteDance Seedance 2: un ambiente in cui agisci dall'interno contro una clip che guardi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Odyssey-3 e ByteDance Seedance 2 fianco a fianco e la prima cosa che si nota è che non competono per la stessa richiesta. Odyssey-3, rilasciato da Odyssey l'8 ottobre 2026, genera un ambiente a partire da un prompt e poi continua a predirlo in tempo reale mentre ti muovi al suo interno o attivi un evento — è un simulatore con una telecamera che guidi tu. ByteDance Seedance 2 è un generatore di clip con la sedia del regista: riferimenti testuali, di immagini, audio e video in ingresso, un video finito in uscita, fino a quindici secondi, generato in un'unica passata e consegnato come oggetto fisso. Uno dei due ha un input di controllo; l'altro ha una timeline. Il confronto vale comunque la pena, perché i due stanno convergendo sullo stesso acquirente, e perché scommettono in direzioni opposte su dove risieda il valore di un modello di video generativo.

C'è un unico tabellone condiviso ed è più esile di quanto sembri. Seedance 2 stesso non compare su Physics-IQ Verified, il tabellone di Anates Labs e DeepMind che valuta quanto bene un modello prevede esperimenti fisici reali. Seedance 2.5, il successore del 31 luglio 2026, sì. Quindi l'unico numero di terze parti che mette qualcosa di questa famiglia accanto a Odyssey-3 è un confronto tra due generazioni di modelli da un lato, cosa che vale la pena dichiarare prima che qualcuno lo citi come una sfida leale.

I due meccanismi

Odyssey-3 è un transformer di diffusione autoregressivo. La descrizione di Odyssey stessa: un modello di diffusione video multi-step esteso in modo autoregressivo con teacher forcing e mascheramento causale, così continua dalle osservazioni precedenti e predice stati futuri condizionati da input di azione, poi una fase di post-addestramento di corrispondenza di distribuzione e distillazione avversariale produce una variante a pochi passi abbastanza veloce da poterci interagire. L'output non è una scena che si riproduce; è una scena che risponde. L'anteprima espone navigazione in prima persona, navigazione in terza persona e movimento indipendente della telecamera — tre modi diversi di mettere alla prova la stessa predizione e osservare cosa fa.

B​yteDance Seedance 2 è un modello unificato multimodale di generazione congiunta audio-video. Accetta testo, immagini, audio e video come riferimenti e genera la clip in un solo passaggio, fino a quindici secondi, con l'audio generato congiuntamente anziché doppiato successivamente. La pagina di B​yteDance descrive come i riferimenti di immagini, audio e video offrano controllo su performance, illuminazione, ombra e movimento della camera, che è il linguaggio della produzione più che della simulazione: stai specificando un'inquadratura, non pilotando un mondo. Rilasciato il 12 febbraio 2026, è diventato virale nel giro di pochi giorni con clip di attori reali e film esistenti — e questo è anche ciò che ha scatenato la tempesta sul copyright, con lettere di diffida da Disney e Netflix, la condanna della Motion Picture Association e della SAG-AFTRA, e una lettera di marzo 2026 da due senatori statunitensi che chiedeva a B​yteDance di chiuderlo. B​yteDance ha dichiarato nel febbraio 2026 che stava rafforzando le salvaguardie. Questa storia fa parte delle specifiche del modello se stai distribuendo qualcosa di commerciale.

Dimensione per dimensione

ByteDance's BytePlus ModelArk developer documentation in English, showing the Ark SDK quick-start with a Python client using model seed-2-0-lite-260228 against base_url https://ark.ap-southeast.bytepluses.com/api/v3, a sidebar covering Models, video generation, image generation and the Model list, and three endpoint cards for Dola Seed 2.0, Dreamina Seedance 2.5 (described as the mainline video generation model with 30s extended storytelling, multimodal references and improved generation quality) and Dola Seedream 5.0.

• Ciò che produce — un ambiente interattivo in cui agisci, su una clip fissa di massimo quindici secondi. Tutto ciò che sta a valle di questa riga cambia.

• Superficie di controllo — navigazione dal vivo ed eventi a metà generazione, rispetto a prompt più riferimenti immagine, audio e video specificati in anticipo. Uno viene pilotato durante la generazione; l'altro viene indirizzato prima di essa.

• Audio — Seedance 2 lo genera insieme al video, nello stesso modello. Il materiale di lancio di Odyssey-3 non menziona affatto l'audio.

• Risoluzione — Odyssey-3 gira a 832×480, con Odyssey-3 Pro a 1280×720. La pagina di B​yteDance per Seedance 2 non pubblica una risoluzione di output, e il dato 1080p che circola appartiene alla precedente linea Seedance 1.0.

• Costo — Odyssey-3 è indicato a $0,139 per video generato nella colonna dei costi normalizzati di Physics-IQ e Odyssey-3 Pro a $0,267, entrambi esclusa la gestione dei prompt. Seedance 2 non pubblica alcun prezzo di listino al secondo o per clip che abbiamo potuto verificare; il suo successore Seedance 2.5 è indicato sulla stessa tabella a $2,838 per video.

• Punteggio indipendente — la generazione di nessuno dei due modelli ha un confronto testa a testa di terze parti. I risultati pubblicati di Seedance 2.0 provengono dal SeedVideoBench-2.0 interno di B​yteDance; quelli di Odyssey-3 consistono in una sottomissione a un benchmark più una valutazione eseguita dal fornitore sul dataset di qualcun altro.

• Pesi — chiusi da entrambe le parti. Odyssey non ha rilasciato alcun checkpoint e Seedance non è mai stato aperto.

• Posizionamento commerciale — Odyssey-3 è un'anteprima di ricerca con un modulo di contatto per l'accesso API e nessun listino prezzi. Seedance 2 viene venduto tramite le piattaforme di ByteDance e, al di fuori della Cina, tramite CapCut come Dreamina Seedance 2.0.

L'unico numero che li mette davvero a confronto

Physics-IQ Verified valuta i modelli in base al miglioramento netto della plausibilità fisica rispetto alla media del track, in punti percentuali, e registra quale set di prompt è stato utilizzato. Sui prompt propri del benchmark, Seedance 2.5 si colloca al settimo posto con +3,59 pp, con un costo normalizzato di 2,838 $ per video. Odyssey-3, sullo stesso set di prompt, si colloca all'ottavo posto con +2,15 pp, a 0,129 $ per video. Leggete con attenzione: si tratta di un divario di 1,44 punti a favore di Seedance e di una differenza di costo di circa ventidue volte a suo svantaggio.

Le righe principali di Odyssey-3 usano una colonna diversa. Se inviato con prompt personalizzati, Odyssey-3 ottiene +9,99 pp e Odyssey-3 Pro +11,15 pp — terzo e secondo in classifica, dietro FLUX 3 [large] a +12,27 pp. La stessa famiglia di modelli compare due volte nella stessa classifica sotto due regimi di prompt diversi con punteggi molto diversi, ed è la cosa più utile da capire su come leggere questa classifica: il numero è in parte una proprietà del modello e in parte una proprietà di chi ha scritto il prompt.

Odyssey riporta anche 66,1 nella categoria video-to-video per Odyssey-3 Pro, il punteggio più alto che dichiara, e 54,7 per Odyssey-3 Pro su image-to-video. Entrambi sono una rilevazione del fornitore stesso su una classifica a cui ha inviato i risultati, non un'esecuzione indipendente.

Two-column scoreboard headed “Odyssey-3 vs ByteDance Seedance 2 — the scoreboard” with six shared dimension labels. Odyssey-3: an environment you act inside; live navigation and mid-run events; no audio; 832x480, 1280x720 Pro; /bin/bash.139 a video, Pro /bin/bash.267; no independent scoring yet. ByteDance Seedance 2: a fixed clip up to 15 seconds; text, image, audio and video references upfront; audio generated jointly with the video; resolution not published; no per-second list price published; not on Physics-IQ. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Seedance 2 has no third-party score; Seedance 2.5, a later model, is on Physics-IQ at +3.59 pp”.

Dove ciascuno vince davvero

Se il tuo problema è "mi serve un'inquadratura", il design di Seedance 2 risponde esattamente a questo: i riferimenti multimodali significano che puoi fornirgli la somiglianza dell'attore, la base audio e il movimento della camera, e ottenere una clip finita con l'audio. Niente nell'anteprima di Odyssey-3 fa questo, e niente nel suo materiale di lancio suggerisce che lo farà. Il limite dei quindici secondi è un vincolo reale, ma lo è anche un rollout di un world model da cinque secondi senza audio.

Se il tuo problema è "devo sapere cosa succede dopo", il trade-off va nella direzione opposta. A Seedance 2 non si può chiedere un controfattuale: ottieni una clip, e per vedere un altro esito devi rilanciare il prompt e ne ottieni una non correlata. L'intera premessa di Odyssey-3 è che lo stato successivo dipende dall'azione che hai appena compiuto, ed è ciò che lo rende utilizzabile per una policy di guida, un braccio robotico o un ambiente di addestramento in cui la sequenza conta più dell'inquadratura.

L'evidenza sull'accuratezza fisica favorisce Odyssey-3 sul meccanismo anche laddove la colonna del punteggio non lo fa: il modello viene valutato su continuazioni dopo una perturbazione, che è la stessa capacità che l'anteprima interattiva sta vendendo. Il +3,59 pp di Seedance 2.5 sulla stessa classifica è un risultato forte per un generatore di clip e, notevolmente, migliore di quello di Odyssey-3 sul set di prompt abbinato — ed è per questo che il riassunto onesto è che il modello video di B​yteDance è più plausibile fisicamente di quanto un modello video abbia alcun diritto di essere, non che Odyssey-3 sia stato battuto sul suo stesso terreno.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Arrivare a uno dei due

Nessuno dei due modelli è richiamabile da qui oggi. OrcaRouter non ospita Odyssey-3 né B​yteDance Seedance 2 — Odyssey-3 non ha un prezzo pubblicato che permetta a chiunque di instradarlo, e Seedance è venduto tramite le piattaforme proprietarie di B​yteDance.

Ciò che una singola chiave OrcaRouter riesce effettivamente a raggiungere è il resto dello stack video: MiniMax-H3 a 0,08 $ al secondo di output 768P, la linea video K​ling da 0,084 $ a 0,28 $ per richiesta, e oltre 200 modelli in totale, tutti al prezzo di listino del fornitore con 0% di ricarico, così una variazione di prezzo di un fornitore compare in fattura lo stesso giorno anziché al rinnovo. Il failover automatico mantiene attiva una sessione di valutazione quando un upstream si degrada, e il DSL di routing mette diversi modelli video dietro un'unica interfaccia, così testare un nuovo generatore è una modifica di configurazione anziché un'integrazione. Quando una di queste due apre un endpoint self-serve, ecco la forma in cui inserirlo.

Cosa guardare

Due cose cambierebbero questo confronto più di qualsiasi aggiornamento dei benchmark. La prima è l'audio: se la prossima generazione di Odyssey-3 genera il suono congiuntamente come fa Seedance, l'"ambiente in cui agisci" smette di essere una categoria più ristretta. La seconda è un harness indipendente — una terza parte che mette Seedance 2.0 e Odyssey-3 fianco a fianco sulle stesse clip, invece di vederne uno comparire su una classifica a cui l'altro non è mai stato sottoposto. Fino ad allora, la lettura corretta di Odyssey-3 rispetto a B​yteDance Seedance 2 è che non sono due candidati per lo stesso lavoro. Sono due risposte a domande diverse, e la domanda che poni sceglie il modello per te.