
Odyssey-3 vs Runway Gen-4.5: due scommesse sulle stesse due parole
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
La cosa interessante nel mettere a confronto Odyssey-3 con Runway Gen-4.5 è che le due aziende concordano sulla destinazione e non concordano sulla strada. Entrambe dicono che l'obiettivo è un modello generale del mondo — un sistema appreso che simula la realtà abbastanza bene da essere utile. La posizione di Runway, dichiarata apertamente dal suo CTO, è che ci si arriva costruendo prima un ottimo modello video, perché insegnare a una rete a predire direttamente i pixel è il percorso più promettente verso la simulazione generale. La posizione di Odyssey, visibile in ogni scelta architetturale che ha pubblicato su Odyssey-3, è che i pixel sono il sottoprodotto e le dinamiche sono il punto. Gen-4.5 è la più forte espressione attuale della prima scommessa. Odyssey-3, annunciato il 15 settembre 2026 e promesso per il rilascio pubblico «nelle prossime settimane», è la seconda scommessa dichiarata come modello completo. Letti fianco a fianco, non sono davvero concorrenti — sono due risposte alla stessa domanda, e la domanda è se la strada verso un modello del mondo passi attraverso il rendering.
La scommessa di Runway: guadagnarsi il modello del mondo tramite il rendering
Runway non è arrivata tardi o per caso alla cornice del world model. Distribuisce un modello che etichetta come world model generale — GWM-1, descritto come costruito per la simulazione in tempo reale della realtà, interattivo e controllabile — e lo considera il livello al di sopra dei suoi modelli video, non un loro sostituto. L'argomento è una scala: lo stesso segnale di addestramento che rende un modello bravo a mantenere coesa una scena per dieci secondi è il segnale che gli insegna come persistono gli oggetti, come si comporta la luce, come continua il movimento. Se diventi abbastanza bravo sui pixel, la simulazione generale viene da sé.
Gen-4.5 è il gradino attuale. Annunciato il 1° dicembre 2025 e distribuito agli abbonati paganti dal 12 dicembre, è un modello text-to-video e image-to-video con le qualità su cui Runway ha costruito la propria reputazione: qualità del movimento, aderenza al prompt, coerenza di personaggi e soggetti e controllo della camera. I suoi limiti sono dichiarati con la stessa chiarezza dei suoi punti di forza. Le clip durano da due a dieci secondi — dieci è il tetto massimo, non l'impostazione predefinita. L'output è 720p a 24 o 25 fotogrammi al secondo su sei formati. Non c'è traccia audio né storyboard multi-inquadratura; una sequenza è qualcosa che si assembla da generazioni separate. È un renderer, e molto buono, che è esattamente l'affermazione che la sua società madre ha bisogno che sia.
Quanto costa Gen-4.5 e come è strutturata la tariffazione
Runway fissa Gen-4.5 a 12 crediti per secondo di video generato. I crediti si vendono a un centesimo l'uno, quindi il numero operativo è $0,12 al secondo: una clip di cinque secondi costa $0,60, una di dieci secondi $1,20. Le opzioni di output comportano sovrapprezzi sull'API: ProRes o sequenze PNG aggiungono cinque crediti al secondo, e HDR aggiunge venti al secondo, salendo a quaranta oltre circa quattro megapixel. Quelli sono i prezzi di listino del fornitore, e la differenza conta più del dato principale: una clip HDR di dieci secondi costa più del triplo di una semplice, quindi un modello di costo basato su $0,12/secondo è sbagliato nel momento in cui HDR entra nelle specifiche di consegna.
Vale la pena conoscere due dettagli strutturali prima di preventivare. I crediti API e i crediti dell'abbonamento all'app sono saldi separati — un piano Standard, Pro o Max non paga le generazioni API — e l'API è asincrona, quindi un'attività viene inviata e richiede polling, invece di essere restituita immediatamente. Nessuno dei due è una critica; entrambi sono cose che i team scoprono dopo essersi impegnati in un'integrazione. L'API mette inoltre a disposizione modelli video di terze parti oltre a quelli di Runway, il che significa che una singola chiave Runway può accedere a più del catalogo di Runway, se lo si desidera.

La scommessa di Odyssey: l'importante non è la foto
Odyssey-3 è descritto dal suo creatore come un modello fondazionale del mondo in grado di alimentare robot, guidare auto, addestrare IA, pilotare droni e giocare ai videogiochi. Dal punto di vista architetturale è un transformer di diffusione autoregressivo addestrato su una vasta raccolta di osservazioni visive, e Odyssey afferma che il risultato porta con sé una comprensione appresa della fisica, delle dinamiche, del rapporto causa-effetto e del comportamento umano. Il dettaglio che rivela la scommessa è come vengono adattati i compiti: invece di eseguire il fine-tuning del modello, Odyssey collega un decoder di azioni addestrato su coppie osservazione-azione e mantiene congelato il modello del mondo preaddestrato per tutto il tempo. Una piccola politica legge la rappresentazione interna del modello congelato e la trasforma in comandi motori.
Quel design ha senso solo se si crede che l’asset sia la rappresentazione — non il fotogramma renderizzato. Le dimostrazioni lo confermano su sei embodiment, tutti dichiarati dal fornitore. Bracci robotici da decine di ore di dimostrazioni, compresi comportamenti di recupero che nessuno ha inserito nei dati, come riorientare una pinza dopo una presa mancata. Policy per umanoidi costruite con Flexion a partire da decine di ore di dati di teleoperazione, che secondo Odyssey generalizzano meglio rispetto ai baseline VLA testati, senza pubblicare cifre. Guida in circuito chiuso in India da venti ore di dati simulati. Volo indoor di droni da dati simulati. Policy di Grand Theft Auto V trasferite a Red Dead Redemption 2 e Sleeping Dogs senza addestramento aggiuntivo in quei titoli — circa due ore di filmato di GTA sono bastate per il movimento a cavallo in RDR2. E generazione di ambienti per addestrare altre AI, legata al lavoro di reinforcement learning PROWL di Odyssey.
Un numero è pubblicato. Odyssey riferisce che le politiche di guida addestrate in simulazione hanno percorso circa il 77% della distanza tra interventi del conducente di sicurezza rispetto alle politiche addestrate su filmati reali. Ogni affermazione nel paragrafo precedente non è stata riprodotta, non esiste alcun rapporto tecnico e nessuna terza parte ha eseguito il modello. L'ampiezza su sei incarnazioni è l'affermazione interessante; l'assenza di una tabella di benchmark è il motivo per considerarla con cautela.

Dove le due scommesse diventano verificabili
Un disaccordo sulla strategia è utile solo se produce una previsione, e questo lo fa. Se Runway ha ragione — se la fedeltà di rendering è la strada — allora la qualità fisica di un modello video dovrebbe migliorare in funzione di quanto è bravo nei video, e le due classifiche dovrebbero muoversi insieme. Se Odyssey ha ragione, dovrebbero esserci casi in cui un modello che renderizza meravigliosamente è inutile e un modello che renderizza grossolanamente è utile, perché la proprietà utile è se lo stato successivo è abbastanza prevedibile da permettere a un controllore di agire.
C'è già un indizio di quale direzione prenda la cosa, e non lusinga nessuna delle due parti. L'elenco stesso fatto da Runway dei punti deboli di Gen-4.5 — tra cui la fisica — ricorda che un renderer è ottimizzato per risultare convincente a uno spettatore, e uno spettatore è indulgente in modi in cui un ciclo di controllo non lo è. Nel frattempo, l'unico numero pubblicato da Odyssey, il 77% delle prestazioni di guida su filmati reali, è una perdita rispetto ai dati reali, non una vittoria. Nessuna delle due aziende sostiene che la strada sia finita. La differenza sta in ciò che ciascuna delle due misura.
Il punto in cui le scommesse divergono davvero è l'incarnazione. Niente nel design o nel prezzo di Gen-4.5 contempla uno spazio d'azione; è una funzione da un testo o un'immagine a una clip. Niente nel materiale di Odyssey-3 contempla un file consegnabile; è una funzione da uno stato del mondo e un'azione allo stato del mondo successivo. Quelli sono prodotti diversi con acquirenti diversi, e nessuna quantità di progresso da una parte o dall'altra converte l'uno nell'altro, perché l'interfaccia è ciò che differisce.
Fianco a fianco
• Che cos'è — Runway Gen-4.5: un renderer da testo a video e da immagine a video. Odyssey-3: un modello del mondo che predice gli stati successivi ed emette azioni motorie.
• Come lo si guida — Runway Gen-4.5: un prompt o un'immagine statica, tramite un'API asincrona. Odyssey-3: un decoder di azioni più una piccola policy che legge un backbone congelato.
• Output — Runway Gen-4.5: clip da 2–10s, 720p, 24/25 fps, sei rapporti d'aspetto, senza audio. Odyssey-3: nessun deliverable renderizzato; stati simulati su sei incorporazioni.
• Prezzo — Runway Gen-4.5: 12 crediti al secondo, 0,12 $/secondo, più 5 crediti/secondo per ProRes o PNG e 20 per HDR (elenco del fornitore). Odyssey-3: non pubblicato, senza termini commerciali annunciati.
• Maturità — Runway Gen-4.5: sul mercato da dicembre 2025, con un'API consolidata e copertura di terze parti. Odyssey-3: annunciato il 15 settembre 2026, rilascio pubblico «nelle prossime settimane».
• Prove — Runway Gen-4.5: otto mesi di output pubblici. Odyssey-3: un dato del fornitore, nessuna esecuzione indipendente.
Nessuno dei due è sulla nostra chiave, e questa è la versione onesta.
OrcaRouter non instrada nessuno dei due modelli, e questo articolo non fingerà il contrario: Runway Gen-4.5 viene servito tramite l'API di Runway stessa, e Odyssey-3 non ha alcun endpoint. Ciò per cui l'angolazione del routing è davvero utile in un confronto come questo è la pipeline che li circonda. Un flusso di lavoro realistico con Gen-4.5 non è un solo modello — è un modello di prompt che espande un brief, un modello di immagini che produce il primo frame, il modello video stesso, e qualcosa a valle per valutare o didascalizzare l'output. Comporli in un'unica chiamata attraverso il DSL di routing, su un'unica chiave, al prezzo di listino del provider con 0% di markup, è la parte dello stack che OrcaRouter può davvero toglierti dalle spalle oggi. Il failover automatico qui conta per una ragione banale: le API video asincrone fanno polling, le code si accumulano, e una pipeline che si blocca su un endpoint degradato si blocca fino al risultato finale.
Quando Odyssey-3 sarà effettivamente rilasciato, la questione del routing sarà diversa e più difficile. Un modello il cui punto di forza è che gira su hardware di tua proprietà non è affatto un candidato ovvio per il routing, e la domanda interessante per un router sarà ciò che lo circonda — gli strumenti sim-to-real, l'addestramento delle policy, la valutazione — piuttosto che la chiamata al modello in sé.
Chi ha ragione è una questione del 2027
Se hai bisogno di video questo trimestre, Gen-4.5 è la risposta e non c'è nulla da soppesare: ha un prezzo, è documentato e sono otto mesi che è in uso pubblico, e a $0,12 al secondo il costo per scoprire se è adatto al tuo lavoro è contenuto. Metti in budget i supplementi e il saldo separato dei crediti API, e considera il tetto dei dieci secondi un vincolo di progettazione rigido, non un numero che aggirerai.
Se stai costruendo un controller — qualsiasi cosa in cui un modello addestrato debba dire all'hardware cosa fare dopo — Gen-4.5 non è nemmeno in discussione, a nessun prezzo, e Odyssey-3 è quello mirato al tuo problema, senza alcun modo di ottenerlo. La ragione concreta per interessarsi è il risultato del backbone congelato: se un singolo modello preaddestrato può azionare braccia, umanoidi, un'auto, un drone e tre giochi attraverso un piccolo decoder, questa è un'affermazione su quanta comprensione fisica si trasferisca, ed è la tesi che renderebbe i world models un livello fondazionale anziché una policy specifica per compito. La ragione concreta per aspettare è che nessuno al di fuori di Odyssey l'ha eseguito.
Cosa tenere d'occhio, nell'ordine: un rapporto tecnico, poi una licenza, poi una terza parte che riproduce il dato del 77% sul proprio hardware. La strada di Runway e quella di Odyssey finiscono entrambe in un modello generale del mondo. Solo una delle due, al momento, ha un casello a cui puoi avvicinarti.

Instrada il modello di prompt, il modello di immagini e il modello di video attraverso un unico endpoint con failover automatico anziché tre integrazioni.
