Scheda del titolo per un articolo che confronta Odyssey-3 e Seedance 2.5, sottotitolato “Secondi di filmato contro ore di simulazione”, con tre chip statistici che riportano “generazione in singolo passaggio da 30 s”, “~$1,16 per clip di 5 s a 720p” e “Odyssey-3: nessuna unità di vendita”.
Guides & Insights

Odyssey-3 vs Seedance 2.5: secondi di filmato contro ore di simulazione

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Chiedi quanto Seedance 2.5 costa e ottieni una risposta in dollari al secondo. Chiedi quanto costa Odyssey-3 e non ottieni assolutamente nulla — nessun listino prezzi, nessun endpoint, nessuna licenza, perché il modello annunciato il 15 settembre 2026 non è ancora stato rilasciato e il suo produttore ha solo promesso pubblicamente che arriverà "nelle prossime settimane". Quel divario sembra una differenza di maturità ed è in gran parte una differenza di categoria. Seedance 2.5, rilasciato dal team Seed di ByteDance il 31 luglio 2026, è un motore di produzione venduto al secondo di filmato finito a chi ha bisogno di filmati. Odyssey-3 è un modello del mondo con un'interfaccia d'azione, e l'acquirente a cui è destinato non vuole affatto filmati — vuole un ambiente che risponda correttamente quando qualcosa agisce al suo interno. I due vengono indirizzati verso alcuni degli stessi problemi, inclusi i dati su robot e guida, ed è proprio per questo che vale la pena tracciare con attenzione la distinzione.

Seedance 2.5 è un motore di produzione, e i partner del lancio lo dimostrano

La capacità di punta è la durata. Seedance 2.5 genera trenta secondi in un'unica passata, il doppio dei quindici del suo predecessore, con estensione multi-round per sequenze più lunghe e una modalità beta ultra-long segnalata che arriva ancora più lontano. Già questo cambia lo scopo del modello: trenta secondi sono una scena anziché un'inquadratura, e il marketing di ByteDance punta sulla frase "one-take" proprio per questo motivo.

Attorno alla durata si collocano le funzionalità che rendono una generazione utilizzabile in un montaggio reale. Il modello accetta un pesante riferimento multimodale — secondo le segnalazioni, arriva fino a trenta immagini, dieci clip video e dieci clip audio per generazione, con video e audio di riferimento ciascuno limitato a circa trenta secondi, e i riferimenti solo audio sono nuovi in questa versione. Ci sono nuove modalità di riferimento per render in white-model o clay, plate su green screen, riferimento di movimento e creativo. Il controllo è a livello di timestamp, consentendo a un prompt di indirizzare narrazione, camera o movimento all'interno di un intervallo di tempo specifico, e la modifica a livello di regione dopo la generazione preserva la continuità invece di forzare un re-roll. Audio e video vengono generati congiuntamente in un'unica passata, così il lip sync segue il dialogo citato, e più di dieci lingue sono supportate nativamente.

L'elenco degli adottanti è l'indizio rivelatore. Il giorno del lancio XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei e Qiongche Intelligence hanno confermato le partnership, e i casi d'uso dichiarati spaziano dai dati di addestramento per l'IA incarnata e i casi limite della guida autonoma ai video di formazione sulle SOP industriali, all'istruzione e alla pubblicità e-commerce. Una parte di questo è lavoro creativo. Una parte è generazione di dati per sistemi che in seguito agiranno sul mondo — ed è la parte che si sovrappone a Odyssey-3.

Quanto costa un secondo di Seedance 2.5

I prezzi sono pubblicati e vengono misurati in token anziché in secondi, il che comporta un passaggio di conversione che vale la pena fare prima di impegnarsi. Le cifre riportate per l'endpoint ModelArk sono $10,70 per milione di token senza input video e $6,40 per milione di token quando è incluso l'input video. In pratica, ciò equivale a circa $0,51 per una clip 16:9 di cinque secondi a 480p e a circa $1,16 per la stessa clip a 720p. Quelle sono le tariffe pubblicate dal fornitore come riportate al lancio; considerale come listino corrente anziché come costo misurato per deliverable, poiché sia la risoluzione che la durata lo fanno variare.

La disponibilità presenta differenze reali. L'accesso per i consumatori passa attraverso le app proprietarie di ByteDance, mentre l'accesso tramite API si divide tra Volcano Engine Ark in Cina e BytePlus ModelArk a livello internazionale. Almeno un distributore dichiara che il modello non è disponibile negli Stati Uniti, e le fonti non concordano sul fatto che le risoluzioni supportate arrivino al massimo a 720p o si estendano fino a 1080p — una discrepanza che vale la pena risolvere consultando la documentazione ufficiale del fornitore prima di progettare in funzione di una determinata risoluzione.

Questo è il tipo di modello in cui uno strato di routing si guadagna il suo posto per un motivo preciso: le tariffe si muovono. Un prezzo video per token che è cambiato una volta al lancio cambierà di nuovo, e la differenza tra un modello di costo costruito sul numero di oggi e uno costruito su quello del trimestre scorso è la differenza tra un margine e una sorpresa. OrcaRouter trasmette il prezzo di listino del fornitore con 0% di ricarico, così un taglio del fornitore è attivo dalla nostra parte lo stesso giorno anziché al rinnovo contrattuale successivo, e il failover automatico mantiene in movimento una coda di generazione quando l'endpoint di un fornitore si degrada — una questione di pianificazione più che teorica sui carichi di lavoro video. Seedance 2.5 stesso non è instradato da OrcaRouter; viene servito tramite le piattaforme proprietarie di ByteDance e i suoi endpoint ModelArk.

Two-column scoreboard for Odyssey-3 and Seedance 2.5 across six shared dimensions — unit of sale, what you get, inputs, editing control, availability and partners. Seedance 2.5 reads tokens at roughly $0.51 per 5s at 480p, finished footage up to 30s, shipping since 31 Jul 2026; Odyssey-3 reads not published, next world state plus actions, announced 15 Sep 2026, Flexion on humanoids.

Odyssey-3 non viene venduto al secondo

Odyssey-3 non ha ancora un'unità di vendita, e questo è il punto. È descritto come un modello mondiale di base in grado di alimentare robot, guidare auto, addestrare IA, pilotare droni e giocare ai videogiochi — un transformer diffusion autoregressivo addestrato su una vasta raccolta di osservazioni visive, che, secondo il suo creatore, produce una comprensione appresa della fisica, delle dinamiche, del rapporto causa-effetto e del comportamento umano. L'adattamento a un nuovo compito avviene addestrando un decoder di azioni su coppie osservazione-azione e mantenendo congelato il modello mondiale preaddestrato, così una piccola policy legge la rappresentazione congelata ed emette comandi motori.

Le dimostrazioni, tutte riferite dal fornitore e nessuna riprodotta in modo indipendente, coprono sei implementazioni: bracci robotici a partire da decine di ore di dimostrazioni, compresi comportamenti di recupero che non erano presenti nei dati; policy per umanoidi sviluppate con Flexion a partire da decine di ore di teleoperazione, che secondo Odyssey generalizzano meglio rispetto ai baseline VLA con cui sono state testate, senza pubblicare una cifra; guida a ciclo chiuso in India a partire da venti ore di dati simulati; volo di droni al chiuso a partire da dati simulati; policy di Grand Theft Auto V trasferite a Red Dead Redemption 2 e Sleeping Dogs senza addestramento aggiuntivo, con circa due ore di filmati di GTA che hanno prodotto il movimento a cavallo in RDR2; e generazione di ambienti per addestrare altre IA attraverso il lavoro PROWL.

L'unico dato numerico concreto è il 77%: le politiche di guida addestrate tramite simulazione hanno percorso, tra un intervento del conducente di sicurezza e l'altro, circa quella frazione della distanza percorsa dalle politiche addestrate su filmati reali. Si tratta di un dato dichiarato dal fornitore, senza alcun rapporto tecnico né alcuna verifica esterna a supporto.

Screenshot of Odyssey's “Introducing Odyssey-3: A General-Purpose Physical Intelligence” page, dated September 15th, 2026, showing the model subtitle “Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games” and the authors Oliver Cameron and Jeff Hawke.

L'unità di vendita decide ciò che viene ottimizzato

Una volta che vedi i due modelli come metri di misura invece che come capacità, le loro differenze non sembrano più indicare che uno sia avanti all'altro.

Un modello fatturato al secondo di output è ottimizzato per un output che soddisfi uno spettatore. Non è un'ambizione inferiore; è un obiettivo diverso, con i suoi problemi difficili. Seedance 2.5 che produce trenta secondi coerenti con dialogo sincronizzato e controllo a livello di timestamp è un risultato davvero difficile, e le modalità di errore in base alle quali viene giudicato — il volto di un personaggio che si deforma, un taglio che non funziona, una battuta di dialogo fuori sincrono — sono quelle che una persona in una sala di montaggio noterebbe.

Un modello a cui viene chiesto di predire cosa succede dopo quando un controllore agisce è ottimizzato per qualcosa che uno spettatore non verificherà mai: se la dinamica regge lungo una sequenza di decisioni, incluse decisioni che nessuno ha dimostrato. Ecco perché Odyssey riporta un comportamento di recupero che emerge da decine di ore di dati anziché riportare la fedeltà, e perché la sua unica affermazione quantitativa è misurata in interventi del conducente di sicurezza invece che in qualità visiva. Un renderer può sbagliare in modi che il pubblico perdona. Un simulatore può sbagliare in modi su cui un controllore agisce, e il secondo tipo di errore si accumula lungo un rollout.

La sovrapposizione nei casi d'uso dichiarati — dati di addestramento per robot, casi limite della guida autonoma — è il punto in cui questi due si incontrano, ed è una vera competizione per il budget più che per la posizione nei benchmark. La domanda che un team di robotica si trova davvero ad affrontare è se acquistare secondi renderizzati di un mondo plausibile o acquistare un modello dinamico con un'interfaccia di azione, e la risposta dipende dal fatto che il consumatore a valle sia un revisore umano o un ciclo di addestramento.

Fianco a fianco

Unità di vendita — Seedance 2.5: token, che si convertono in circa 0,51 $ per clip di 5 s a 480p e 1,16 $ a 720p. Odyssey-3: nessuna pubblicata.

Cosa ottieni per unità — Seedance 2.5: filmato finito, fino a 30 s in un'unica passata, con audio e dialogo sincronizzati. Odyssey-3: uno stato futuro previsto del mondo più azioni motorie per l'hardware collegato.

Input — Seedance 2.5: testo più fino a ~30 immagini, 10 video e 10 clip audio. Odyssey-3: un decoder di azioni addestrato su coppie osservazione-azione, su un backbone congelato.

Controllo di modifica — Seedance 2.5: targeting a livello di timestamp e modifiche post-generazione a livello di regione. Odyssey-3: non applicabile; non esiste una superficie di modifica.

Partner dichiarati — Seedance 2.5: XCMG, XPeng e altri tre al lancio. Odyssey-3: Flexion sulle policy per gli umanoidi; nessun cliente commerciale annunciato.

Disponibilità — Seedance 2.5: in distribuzione dal 31 luglio 2026, soggetto a limitazioni regionali. Odyssey-3: annunciato il 15 settembre 2026, rilascio pubblico "nelle prossime settimane", senza data e senza prezzo.

Quale appartiene al tuo stack?

Se il deliverable è un video che una persona guarderà, Seedance 2.5 è un prodotto già sul mercato con un prezzo pubblicato e un ampio set di funzionalità, e la decisione è una normale scelta tra sviluppare internamente e acquistare — con due avvertenze da verificare prima: se le risoluzioni di cui hai bisogno sono effettivamente disponibili sull'endpoint che puoi raggiungere, e se la tua regione è servita. La sua durata maggiore in singolo passaggio e il controllo dei timestamp sono le funzionalità che cambiano maggiormente il flusso di lavoro, perché eliminano passaggi di stitching invece di migliorare un fotogramma.

Se il risultato finale è una policy addestrata o un controllore, Seedance 2.5 non è un sostituto, per quanto bene possano apparire i filmati, e Odyssey-3 è puntato sul tuo problema senza nulla da comprare. L'affermazione che vale la pena seguire è il backbone congelato: un unico modello preaddestrato che raggiunge bracci, umanoidi, un'auto, un drone e tre giochi tramite un piccolo decoder è una dichiarazione su quanto la comprensione fisica si trasferisca tra incarnazioni diverse, e se regge cambia ciò che un team di robotica deve raccogliere. Non è stato testato da nessuno al di fuori di Odyssey, e non esiste un rapporto tecnico, né una licenza, né un prezzo.

Cosa tenere d'occhio è poco glamour: per Seedance 2.5, un prezzo stabilizzato e una chiara dichiarazione di disponibilità regionale; per Odyssey-3, un repository, una licenza e una terza parte che riproduce il 77%. Finché non esiste il secondo elenco, la differenza tra questi due modelli non è la qualità. È che uno di essi è un prodotto, e l'altro è un'argomentazione.

Infographic titled “What One Unit Buys” contrasting Seedance 2.5, billed per token, with a 5s clip costing about $0.51 at 480p and about $1.16 at 720p and up to 30s in a single pass, against Odyssey-3, which has no published price and reaches robot arms, humanoids, a car and a drone through a frozen backbone plus action decoder across six embodiments with no third-party runs.

OrcaRouter tiene oltre 200 modelli dietro un'unica chiave API, quindi il modello video che scegli non è l'unico che puoi chiamare.