Scheda del titolo per Odyssey-3, sottotitolata “Il modello di mondo interattivo di Odyssey, anteprima di ricerca pubblica aperta l'8 ottobre 2026”, con due pannelli statistici: Odyssey-3 a 832x480 e 16 fps sul livello base, Physics-IQ +9.99 pp, posizione 03 su prompt personalizzati, costo normalizzato $0.139 a video; e Odyssey-3 Pro a 1280x720 sul livello Pro, Physics-IQ +11.15 pp, posizione 02, e 66.1 sulla traccia video-to-video, costo normalizzato $0.267 a video.
Guides & Insights

Odyssey-3: il nuovo modello del mondo di Odyssey conquista la corona di Physics-IQ e apre un'anteprima pubblica

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Odyssey-3 Pro ha ottenuto 66,1 nel tracciato video-to-video di Physics-IQ Verified, e Odyssey ha pubblicato quel numero l'8 ottobre 2026 accanto alla cosa che conta davvero per uno sviluppatore: un'anteprima di ricerca pubblica di Odyssey-3, un transformer di diffusione autoregressivo progettato per generare un ambiente da un prompt e poi continuare a prevederlo in tempo reale mentre qualcuno lo attraversa, muove una telecamera o attiva un evento. Odyssey-3 è il modello; Odyssey-3 Pro è il livello 720p, in esecuzione a 1280×720 contro gli 832×480 del modello base. Entrambi vengono pubblicati lo stesso giorno, in un'anteprima che puoi pilotare tu stesso su experience.odyssey.systems, con un canale di contatto separato per l'accesso API.

Quell'abbinamento è ciò che rende questo qualcosa di più di un post di benchmark. I modelli del mondo interattivi sono demo-ware da due anni; quelli che generano qualche fotogramma di movimento plausibile su una traiettoria fissa non sono lo stesso artefatto di un modello che mantiene coerenti le proprie previsioni dopo che dai un colpo ai comandi. Odyssey rivendica la seconda cosa, e sta permettendo a chiunque di mettere alla prova l'affermazione.

Cosa è stato rilasciato, esattamente

Due checkpoint, un'architettura, nessun peso.

• Odyssey-3 — il livello 480p, output 832×480, 16 fps sull'harness di benchmark, indicato a $0,139 per video generato nella colonna dei costi normalizzati della classifica.

• Odyssey-3 Pro — la fascia 720p, 1280×720, con un prezzo di $0,267 per video sulla stessa base.

• Accesso — un'anteprima di ricerca nel browser con navigazione in prima persona, navigazione in terza persona e movimento indipendente della telecamera. L'accesso API è un modulo di contatto, non una chiave self-service.

• Apertura — nessuna. Nessun peso, nessuna licenza, nessun prezzo per token pubblicato. La pagina dei termini API sullo stesso sito è stata aggiornata l'ultima volta il 2026-01-22 e disciplina ancora "il prototipo di Odyssey-2 API", il che ti dice quanto sia recente la superficie commerciale.

L'architettura è descritta nella documentazione di Odyssey stessa come un transformer di diffusione video multi-step esteso in modo autoregressivo tramite teacher forcing e mascheramento causale, con una pipeline di post-training che combina distribution matching e distillazione adversariale in una variante distillata a pochi step — la parte che rende possibile, in primo luogo, l'interazione in tempo reale. La diffusione ti dà la fedeltà; l'autoregressione ti dà un modello che sopravvive a una sequenza di azioni; la distillazione ti dà la velocità di clock. Tutte e tre sono portanti, e tutte e tre sono il resoconto del fornitore del proprio sistema, non uno indipendente.

Il benchmark, letto nel modo in cui il board lo legge effettivamente

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified è gestito da Anates Labs con DeepMind, ed è un benchmark davvero scomodo da manipolare: mostra ai modelli video di veri esperimenti fisici — dinamica dei fluidi, ottica, meccanica dei solidi, magnetismo, termodinamica — e valuta la continuazione rispetto a ciò che è effettivamente accaduto. Attualmente classifica 41 modelli provenienti da 16 laboratori. Il 66,1 di Odyssey-3 Pro è il punteggio grezzo più alto sulla traccia video-to-video che Odyssey riporta, e la colonna del miglioramento netto della stessa classifica, che misura il guadagno rispetto alla media della traccia in punti percentuali, racconta una storia sottilmente diversa:

• Miglioramento netto rispetto alla media della traccia — FLUX 3 [large] è in testa con +12,27 pp; Odyssey-3 Pro è secondo con +11,15 pp; Odyssey-3 è terzo con +9,99 pp.

• Costo per video generato — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, rispetto a FLUX 3 [large] a $0.868 e Seedance 2.5 a $2.838. (I costi sono normalizzati a 24 fps e a un output largo 1280 dove la classifica lo consente, così sono confrontabili tra modelli che non condividono un frame rate.)

• Leadership nelle sottometriche — Odyssey-3 conquista il primo posto nella sottometrica spaziotemporale con 44.70, davanti a Odyssey-3 Pro con 42.97; FLUX 3 [large] conquista la metrica spaziale con 64.36 e quella spaziale ponderata con 53.25, con le due voci Odyssey al secondo e quarto posto nella spaziale.

Quindi la lettura onesta non è "Odyssey-3 è il miglior modello video al mondo". È questa: un modello del mondo costruito per l'interazione è arrivato vicino alla cima di una classifica di plausibilità fisica che prima era appannaggio dei generatori cinematografici, e ci è riuscito a circa un terzo del costo normalizzato di FLUX 3. L'affermazione separata di Odyssey — 54,7 per Odyssey-3 Pro nella categoria image-to-video, best-of-8 — è sulla stessa classifica, e vale lo stesso avvertimento: si tratta di configurazioni autoinviate, e la classifica mescola voci inviate con prompt personalizzati e voci eseguite sui prompt propri del benchmark. Odyssey compare in entrambe le colonne, cosa insolitamente trasparente, e significa anche che le sue due righe non stanno misurando la stessa cosa.

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

Perché "modello del mondo" non è sinonimo di "modello video"

La distinzione è l'intero argomento a favore del prodotto, quindi vale la pena affermarla chiaramente. Un generatore di clip prende un prompt e restituisce un oggetto fisso; l'output è identico per chiunque lo richieda. Odyssey-3 prende un prompt e restituisce un sistema in cui agisci — le modalità di telecamera in prima persona e in terza persona dell'anteprima e la sua capacità di accettare un evento a metà generazione sono il meccanismo con cui prevede ciò che accade dopo in base a ciò che hai appena fatto, non a ciò che diceva il prompt.

È quella proprietà che fa sì che i risultati dei sistemi fisici nel materiale di lancio di Odyssey appaiano come appaiono. L'azienda riferisce che un decodificatore di azioni collegato al modello del mondo congelato, addestrato su decine di ore di dimostrazioni robotiche, ha prodotto comportamenti di recupero che non erano mai stati presenti nelle dimostrazioni — riorientare una pinza dopo una presa mancata, recuperare un oggetto caduto in un orientamento insolito. Riferisce di una policy per umanoidi costruita da Flexion sopra Odyssey-3 con decine di ore di dati di teleoperazione che ha continuato a eseguire sotto cambiamenti di illuminazione che hanno compromesso le baseline VLA con cui è stata confrontata. Riferisce di una policy di guida addestrata su 20 ore di dati simulati che ha guidato in anello chiuso su strade reali, percorrendo, tra un intervento e l'altro del conducente di sicurezza, circa il 77% della distanza percorsa da una policy addestrata su filmati reali. Riferisce di navigazione di droni da dati di volo simulati e gameplay in GTA V che ha trasferito il movimento a Red Dead Redemption 2 e la guida di motociclette a Sleeping Dogs senza ulteriore addestramento.

Ognuno di questi è un risultato riportato dal fornitore, senza replicazione indipendente, e due di essi sono esplicitamente inquadrati da Odyssey come osservazioni qualitative anziché misurazioni. Ma sono il tipo giusto di prove per l'affermazione: la parte interessante non è che il modello sappia svolgere un compito per cui è stato addestrato. È che un backbone congelato più un piccolo adapter riesce a ottenere un comportamento significativo da qualche decina di ore di dati, e occasionalmente generalizza al di là di essi.

Cosa non è ancora dimostrato

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

Tre cose, e non sono piccole.

Innanzitutto, nessun valutatore indipendente ha eseguito Odyssey-3. La voce Physics-IQ è una submission, e la seconda fonte di punteggio nel resoconto di Odyssey stesso — WorldMark, in cui Odyssey-3 si classifica prima in tre delle quattro suddivisioni — è una valutazione del fornitore che utilizza le didascalie del benchmark stesso e, secondo la formulazione di Odyssey, "la media dei suoi 13 punteggi metrici riportati". Si tratta dell'azienda che valuta se stessa sul dataset di qualcun altro. È più di quanto offra la maggior parte dei lanci. Non è una terza parte.

In secondo luogo, l'unica suddivisione in cui Odyssey-3 non vince in quella valutazione è quella più vicina alla dichiarazione di marketing. Negli ambienti reali in prima persona si classifica terzo con 80,6, dietro Lyra 2.0 con 84,4 e AlayaWorld con 83,0. Il vantaggio del modello nella stessa valutazione è concentrato negli ambienti stilizzati e in terza persona: 77,2 in prima persona stilizzato, 79,0 in terza persona reale, 76,3 in terza persona stilizzato. Se stai sviluppando per un'incorporazione fotorealistica in prima persona, la classifica che dovrebbe interessarti è quella in cui Odyssey-3 non è in testa.

Terzo, la disponibilità. "Anteprima di ricerca" sta facendo un lavoro concreto in quella frase. Non c'è una pagina dei prezzi, né documentazione sui limiti di frequenza, né una chiave self-serve. Se vuoi inserirlo in un prodotto, sei in coda.

Confrontandolo senza un secondo contratto

Ecco il problema pratico con un lancio come questo: Odyssey-3 è la cosa più interessante nel campo della generazione video questa settimana, e non puoi ancora chiamarlo. I modelli con cui lo confronteresti davvero sono tutta un'altra storia.

OrcaRouter non ospita Odyssey-3, e non esiste un prezzo pubblicato da trasferire anche se lo facesse. Ciò che una chiave raggiunge è il resto del set di confronto — minimax/minimax-h3 a $0,08 al secondo di video generato a 768P, la linea video K​ling, e oltre 200 modelli dietro un unico endpoint — al prezzo di listino del provider con 0% di markup, così una variazione di prezzo di un fornitore compare sulla tua fattura lo stesso giorno anziché al rinnovo successivo. Failover automatico tra provider significa che una batteria di valutazioni non muore perché un upstream sta avendo una giornata storta, e il DSL di routing ti consente di mettere diversi modelli dietro un'unica interfaccia, così un confronto testa a testa è una modifica di configurazione anziché una seconda integrazione. Se Odyssey apre un'API self-serve, quella è la forma in cui vuoi inserirla.

Cosa lo risolverebbe

Un'esecuzione indipendente di Odyssey-3 su un harness che non ha scelto. Una dozzina di professionisti con accesso in anteprima che descrivono dove l'ambiente regge dopo un minuto di riprese aggressive e dove no. Un prezzo. Uno qualsiasi di questi trasforma questo da un lancio solido in un punto di riferimento.

Ciò che è già vero è più ristretto e comunque degno di nota: sull'unica classifica pubblica che misura se un modello generativo comprende la fisica piuttosto che se sa fare belle fotografie, un modello il cui scopo è l'interazione si trova al secondo e al terzo posto, con un costo normalizzato inferiore a quello del modello in prima posizione.