Una scheda del titolo generata per Odyssey-3 con il sottotitolo "Un modello del mondo che agisce, non solo renderizza" e sei schede etichettate — Bracci robotici, Umanoidi, Guida, Droni, Giochi, Addestramento — ciascuna collegata a un singolo nodo contrassegnato "un unico backbone", con una nota a piè di pagina che recita "Anteprima 2026-09-15; dichiarato dal fornitore, non sottoposto a benchmark indipendenti."
Engineering & Research

Anteprima di Odyssey-3: il modello del mondo di Odyssey passa dall'osservare il mondo all'agire in esso

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Odyssey-3 è il più recente modello fondazionale del mondo di Odyssey, presentato in anteprima dall'azienda il 15 settembre 2026 e descritto nel suo stesso annuncio come un modello destinato ad alimentare «robot, guidare auto, addestrare IA, pilotare droni e persino giocare ai videogiochi». Ciò che rende l'anteprima degna di una lettura attenta non è l'elenco dei corpi — è il meccanismo. Odyssey-3 è un transformer diffusion autoregressivo addestrato a simulare scenari diversi dall'osservazione visiva, e l'azienda collega un appreso decodificatore di azioni ad esso, un componente che traduce la rappresentazione interna di una scena del modello nei comandi motori di cui uno specifico dispositivo hardware ha bisogno. Questa è la differenza tra un modello che genera una clip plausibile di un braccio robotico e un modello a cui viene chiesto di muoverne uno. Odyssey chiama la classe di sistemi che questo rende possibile «agenti fisici» — modelli che, secondo la formulazione dell'azienda, «parlano la lingua del mondo». Se l'impostazione suona vicina all'etichetta «physics agent» che circola nella copertura dell'anteprima, si tratta di una lettura ragionevole della stessa affermazione, anche se non è la frase di Odyssey e, in questa fase, è una descrizione di intenti più che un risultato misurato.

Cosa ha davvero annunciato Odyssey

Il post è un'anteprima, non un lancio. Odyssey afferma di essere "entusiasta di rilasciarlo pubblicamente nelle prossime settimane" e non indica né una data, né un prezzo, né un canale di accesso. Non c'è alcun rapporto tecnico su Odyssey-3 collegato dall'annuncio — l'unico documento a cui la pagina rimanda è PROWL-1, il lavoro di apprendimento per rinforzo dell'azienda, e l'unico PDF è quello di Starchild-1. Vale la pena dichiarare chiaramente questa assenza, perché condiziona tutto ciò che segue: ogni affermazione sulle capacità in questo articolo è di Odyssey, non replicata, e non esiste ancora una terza parte che abbia pubblicato un numero per Odyssey-3 che non sia stato fornito da Odyssey.

Ciò che il post specifica è l'architettura e una filosofia di addestramento. Il modello è un transformer diffusivo autoregressivo. È addestrato sull'osservazione visiva del mondo anziché su etichette specifiche per il compito, il che, secondo Odyssey, gli conferisce una comprensione appresa di "fisica, dinamica, causa-effetto, comportamenti umani" — e, a suo dire, un fabbisogno di dati inferiore rispetto a sistemi che non sono stati preaddestrati in questo modo. La scommessa alla base è quella che sta facendo l'intero campo dei world model: prevedere il prossimo stato di una scena su larga scala costringe un modello a interiorizzare come si comportano realmente gli oggetti fisici, perché un modello che sbaglia la fisica scivola nell'incoerenza nel corso di un rollout prolungato e non riesce a recuperare.

A generated single-column scoreboard for Odyssey-3 listing: what it is, foundation world model; output, world state plus motor actions; embodiments, arms, humanoid, car, drone, games; price, not published; availability, preview in the coming weeks; independent benchmarks, none yet. The footer reads "All figures Odyssey-reported; no independent evaluation published."

Una spina dorsale, sei corpi

La prova più concreta nell'annuncio è la diffusione di embodiment guidati dallo stesso modello di fondazione. Odyssey riporta:

Bracci robotici — hanno imparato a controllare una varietà di bracci e a completare compiti complessi partendo da "solo decine di ore di dimostrazioni robotiche", inclusi comportamenti di recupero che non erano affatto presenti nelle dimostrazioni, come il riorientamento di una pinza dopo una presa mancata.

Umanoidi — lavoro svolto con Flexion, con policy costruite su decine di ore di dati di teleoperazione di umanoidi eseguite in tempo reale, che secondo Odyssey si sono generalizzate ai cambiamenti di illuminazione meglio delle baseline vision-language-action con cui sono state confrontate.

Guida — un backbone congelato che produce waypoint in tempo reale per la guida a ciclo chiuso, addestrato su «soli 20 ore di dati di guida simulata».

Droni — volo indoor con evitamento degli ostacoli a partire da decine di ore di dati di volo simulato, più rollout qualitativi con il backbone congelato.

Videogiochi — sessioni prolungate di Grand Theft Auto V, con trasferimento a Red Dead Redemption 2 e Sleeping Dogs senza alcun addestramento aggiuntivo della policy in quei titoli.

Ambienti di addestramento per l'IA — mondi generati usati come terreni di addestramento per altri agenti, legati al lavoro su PROWL-1.

Lo schema che emerge da quelle righe è la vera affermazione: non che Odyssey-3 sia eccellente in una qualsiasi di esse, ma che un unico insieme di pesi, con un piccolo adattatore di output appreso, le raggiunga tutte. Un modello generalista di come si muove il mondo è un asset molto diverso da una policy per singolo robot, ed è il motivo per cui l'anteprima è arrivata dove è arrivata.

L'unico numero, e ciò che non dimostra

Odyssey pubblica esattamente un dato comparativo per Odyssey-3: le politiche di guida addestrate puramente in simulazione percorrevano, tra un intervento e l'altro del conducente di sicurezza, circa il 77% della distanza percorsa dalle politiche addestrate su filmati reali, utilizzando le stesse 20 ore di dati simulati. È un numero sim-to-real, ed è davvero interessante — colmare anche solo in parte il divario tra guida addestrata in simulazione e guida addestrata su dati reali è la parte difficile del problema. È anche l'unico numero nel post.

Non esiste alcuna tabella di accuratezza, alcun tasso di successo, alcun benchmark cross-body e alcun confronto con un altro modello del mondo esplicitamente nominato su una valutazione condivisa. La scheda nel piè di pagina della pagina afferma che Odyssey-3 fa progredire «lo stato dell'arte nell'accuratezza fisica dei modelli del mondo», ma nulla nella pagina lo supporta con un dato numerico. Odyssey annuncia anche una partnership di valutazione con Poke & Wiggle che copre «corpi, punti di vista e controlli diversi» — e non ne ha ancora pubblicato alcun risultato. Tutto quello che c'è qui è un'affermazione del fornitore, e il dato del 77% va letto esattamente come tale finché una parte esterna non lo replica.

Cosa significa la tabella di benchmark mancante

Sarebbe facile leggere l'assenza di benchmark come un campanello d'allarme. È meglio leggerla come lo stato del settore. I modelli del mondo non hanno ancora l'equivalente di un MMLU o di un GPQA — una valutazione condivisa, economica e ampiamente affidabile su cui tutti riportano. La stessa impostazione di Odyssey riconosce il problema di scala dall'altra direzione: il post afferma che i modelli del mondo all'avanguardia restano "circa due ordini di grandezza indietro rispetto ai modelli linguistici". Quando lo standard di valutazione è esso stesso incerto, un post di anteprima che mette in primo piano l'architettura e la diffusione dell'incarnazione invece di un tabellone dei punteggi descrive onestamente la frontiera, e un lettore dovrebbe trattare le affermazioni qualitative come indicative piuttosto che consolidate. La partnership Poke & Wiggle è la cosa da tenere d'occhio: una valutazione che incrocia corpi e punti di vista con numeri pubblicati sarebbe la prima lettura indipendente su tutto questo.

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

"Nelle prossime settimane" è il vero titolo

Per chiunque debba prendere una decisione in questo trimestre, la frase operativa nell'annuncio è quella sulla disponibilità. Odyssey-3 non è disponibile in generale, non ha un prezzo pubblicato, non ha documentazione API e non ha una data annunciata: solo "nelle prossime settimane". Questo lo colloca in una categoria diversa rispetto a un modello che puoi valutare oggi. Significa anche che le pagine di confronto che inevitabilmente verranno scritte al riguardo sono, per ora, confronti tra un prodotto già distribuito e un'anteprima di ricerca, il che è una distinzione reale e non un tecnicismo: un'anteprima può essere eccellente e comunque non essere qualcosa che puoi mettere in una pipeline di lunedì.

C'è una seconda ragione per cui la tempistica conta. Odyssey ha raccolto un round Series B da 310 milioni di dollari a una valutazione di 1,45 miliardi di dollari, con AWS che diventa il suo provider cloud preferito — l'azienda ha la potenza di calcolo per portare avanti un world model di frontiera, e un'anteprima che arriva mesi prima di un rilascio pubblico è il modo in cui quel lavoro viene mostrato. Leggi l'annuncio come una dichiarazione di traiettoria più che di capacità.

Cosa fare con questo se fai la build oggi

Odyssey-3 in sé non è qualcosa che puoi chiamare, e OrcaRouter non lo fornisce — nessun livello di routing lo fa, perché non c'è ancora nulla a cui instradare. Quello che vale la pena fare ora è scomporre la decisione in due parti. La prima parte è il modello del mondo, e per quella la risposta onesta è aspettare il rilascio pubblico e la prima valutazione indipendente. La seconda parte è tutto ciò che gli sta intorno: il modello linguistico che trasforma un compito in qualcosa che una policy può consumare, il modello di visione che legge una scena, il modello di trascrizione che etichetta una dimostrazione registrata. Quello stack circostante è normale lavoro instradato, ed è disponibile oggi su un'unica API su oltre 200 modelli al prezzo di listino del provider con 0% di markup, con failover automatico quando un provider si degrada. Il motivo per instradare quel livello ora invece che più tardi è che è il livello che starai ancora eseguendo quando Odyssey-3 sarà rilasciato, e cambiare un modello di prompt è una modifica di configurazione, mentre riscrivere un'integrazione non lo è.

Vale anche la pena tenere aperta la questione del modello del mondo nel modo più economico possibile. Quando un modello come Odyssey-3 raggiunge effettivamente un provider instradato, compare al prezzo di listino del provider lo stesso giorno, quindi provarlo costa una chiamata API anziché un contratto. Costruire la pipeline circostante in modo che un nuovo modello possa esservi inserito è la preparazione pratica per una frontiera che si muove ancora.

Cosa cambierebbe la lettura

Tre cose trasformerebbero questa anteprima in un fatto consolidato. Un rapporto tecnico pubblicato con i dettagli sull'architettura e sull'addestramento permetterebbe a gruppi esterni di riprodurre qualsiasi cosa. Un primo benchmark indipendente — idealmente il lavoro cross-body di Poke & Wiggle — sostituirebbe l'affermazione del fornitore con un numero misurato da qualcun altro. E un rilascio pubblico con data e prezzo renderebbe ogni confronto con Odyssey-3 un confronto tra due cose che un lettore può effettivamente eseguire.

Fino ad allora, il riassunto difendibile è questo: Odyssey-3 è un'affermazione credibile su una cosa davvero difficile — un unico modello del mondo, molti corpi, controllo invece che rendering — da un laboratorio ben finanziato con un track record nel settore, presentata con quasi nessun numero e nessuna data di disponibilità. Ecco che aspetto ha un'anteprima di frontiera. Considera le affermazioni sulle capacità come indicative, l'architettura come la parte interessante e la data di rilascio come l'unica riga che cambia i tuoi piani.

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.