
Odyssey-3 vs Google Veo 3.1: Fisica di frontiera contro dieci mesi di produzione
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il confronto tra Odyssey-3 e Veo 3.1 è in realtà un confronto tra due date. Veo 3.1 è disponibile in generale dal 17 novembre 2025: dieci mesi di utilizzo in produzione, prezzi al secondo pubblicati, 4K nativo e uno stack di serving che è passato almeno una volta attraverso una revisione aziendale. Odyssey-3 è stato presentato in anteprima da Odyssey il 15 settembre 2026, non ha un prezzo pubblicato, né documentazione API, né benchmark indipendenti, e ha una finestra di rilascio di "nelle prossime settimane". Metterli a confronto fianco a fianco vale comunque la pena, perché il motivo per cui vengono citati insieme è reale: Veo 3.1 genera video bellissimi, mentre Odyssey-3 cerca di simulare un mondo che si comporta correttamente sotto controllo. Questi sono i due prodotti diversi che i team continuano a confondere sotto la parola "video", e il divario tra loro è esattamente il punto in cui vive la decisione d'acquisto.
Cosa ti dà dieci mesi di shipping
Il vantaggio di Veo 3.1 non è una funzionalità: è il tempo trascorso. Il modello è nelle mani dei clienti paganti da ottobre 2025 come anteprima e dal 17 novembre come prodotto GA, con un tier Lite aggiunto il 31 marzo 2026 e un tier gratuito il 2 aprile. Questa storia produce cose che un'anteprima non può: una superficie API documentata, un insieme consolidato di modalità di errore che i professionisti hanno già mappato e una curva dei costi che un team finanziario può modellare.
La scheda tecnica riflette la stessa maturità. Veo 3.1 genera a 720p, 1080p e 4K nativo, a 24 fotogrammi al secondo, con durate native di 4, 6 o 8 secondi, mentre output più lunghi sono dichiarati a 1080p e con concatenamento per l'estensione delle scene oltre tale limite. Accetta fino a tre immagini di riferimento per la coerenza di personaggi e scene, oltre a controlli per seed e negative prompt. L'output include metadati di provenienza SynthID e C2PA. Per lavori destinati a brand, broadcast o grandi schermi, il percorso 4K nativo è l'unica capacità che gran parte del campo concorrente semplicemente non ha — ed è la ragione per cui Veo 3.1 continua ad aggiudicarsi progetti che non vince in base al prezzo.

L'impostazione audio predefinita che distorce silenziosamente ogni confronto
Veo 3.1 genera audio stereo nativo a 48 kHz — dialoghi, suoni ambientali, foley — congiuntamente all'immagine, il che è davvero una delle sue caratteristiche più forti. Tramite l'API, però, il parametro audio è disattivato per impostazione predefinita, e la generazione silenziosa costa meno di quella con audio. Sul livello Standard pubblicato da Google, questo corrisponde a circa $0,20 al secondo in modalità silenziosa contro circa $0,40 al secondo con l'audio. Ne derivano due conseguenze. Primo, il prezzo effettivo di una clip Veo dipende interamente da un flag che la maggior parte delle persone non cambia mai, quindi una cifra di "$0,20 al secondo" e una di "$0,40 al secondo" possono essere entrambe corrette per lo stesso modello. Secondo, e in modo più sottile, significa che moltissimi confronti testa a testa che hai letto hanno messo un Veo 3.1 silenzioso contro concorrenti il cui audio è sempre attivo, per poi valutarli su una classifica che tiene conto dell'audio. Se il tuo output ha bisogno del suono, il numero onesto su cui pianificare è quello con l'audio abilitato.
Cosa sta effettivamente sostenendo Odyssey-3
Odyssey-3 non è un generatore video migliore e non pretende di esserlo. È un transformer diffusione autoregressivo addestrato sull'osservazione visiva del mondo, e la capacità al centro dell'annuncio è un decodificatore di azioni — «un componente di output appreso collegato al modello del mondo» che trasforma la rappresentazione interna della scena del modello in comandi motori per hardware specifico. Odyssey riferisce di controllare bracci robotici a partire da decine di ore di dimostrazioni, di guidare policy umanoidi costruite con Flexion in tempo reale, di produrre waypoint di guida in anello chiuso da un backbone congelato addestrato su 20 ore di dati simulati, di far volare droni al chiuso aggirando ostacoli e di giocare a Grand Theft Auto V con trasferimento a Red Dead Redemption 2 e Sleeping Dogs senza ulteriore addestramento delle policy in quei giochi. L'unico numero comparativo diffuso è che le policy di guida addestrate in simulazione hanno percorso circa il 77% della distanza tra un intervento del conducente di sicurezza e l'altro rispetto alle policy addestrate su filmati reali.
Nota che tipo di affermazioni sono. Nessuna riguarda l’aspetto dell’output. Ognuna riguarda ciò che un programma a valle del modello può farci.
Le dimensioni che non si sovrappongono
• Output — Google Veo 3.1: una clip renderizzata, fino a 4K nativo, con audio stereo opzionale a 48 kHz. Odyssey-3: uno stato del mondo simulato, più azioni motorie tramite il decodificatore di azioni.
• Consumatore — Google Veo 3.1: un visualizzatore o un editor. Odyssey-3: un controller robotico, una policy di guida o un ciclo di addestramento.
• Durata clip — Google Veo 3.1: 4/6/8s nativi, più lunghi a 1080p, oltre con catene di estensione. Odyssey-3: rollout continuo, nessun concetto di clip.
• Prezzo — Google Veo 3.1: ~0,20 $/s senza audio, ~0,40 $/s con audio a livello Standard; i livelli Fast e Lite al di sotto. Odyssey-3: nessuno pubblicato.
• Disponibilità — Google Veo 3.1: disponibilità generale dal 2025-11-17. Odyssey-3: presentato in anteprima il 2026-09-15, pubblico «nelle prossime settimane».
• Prove — Google Veo 3.1: dieci mesi di utilizzo in produzione e posizionamento indipendente nelle classifiche. Odyssey-3: dimostrazioni del fornitore, nessuna tabella di benchmark, nessun rapporto tecnico.
Dove la rivendicazione della fisica dà effettivamente i suoi frutti — e dove no
È allettante supporre che un modello con una fisica migliore produca video migliori, e non è questo che vende Odyssey. Il problema di un team video quasi mai è che il mondo nel clip sia fisicamente incoerente — è che la ripresa deve essere in 4K, o che il personaggio deve apparire identico in tre setup diversi, o che il deliverable debba avere metadati di provenienza allegati prima che il reparto legale dia il via libera. Veo 3.1 risponde già oggi a queste domande. Un simulatore fisicamente accurato risponde a una domanda diversa: posso addestrare qualcosa qui dentro che funzionerà là fuori. Se non stai addestrando nulla, l'accuratezza fisica di Odyssey-3 è una funzionalità senza acquirenti nel tuo workflow.
Dove i due convergono davvero è nella previsualizzazione. Un regista che vuole esplorare uno spazio in modo interattivo — far camminare una camera attraverso un set, cambiare una scelta di blocking, vedere la conseguenza — vuole esattamente ciò che un modello del mondo fornisce e ciò che una clip renderizzata non può, perché la clip è fissa nel momento in cui viene generata. Questo è un caso d'uso reale, ed è anche uno in cui un'anteprima non rilasciata non è ancora un'opzione.
Eseguire questo in produzione senza puntare su un unico endpoint
Il motivo per cui i team di produzione si interessano all'architettura attorno al modello è che una pipeline video raramente si riduce a una sola chiamata. Un modello di prompt redige la shot list, un modello di immagini produce il fotogramma iniziale, un modello di visione verifica il risultato rispetto al brief, un modello di trascrizione gestisce la voce fuori campo. Ognuno di questi è una dipendenza che può fallire alle 2 del mattino, e ognuno è un'integrazione separata se li acquisti separatamente. Collocare quello strato su un'unica API su oltre 200 modelli al prezzo di listino del provider con 0% di markup riduce le integrazioni, e il failover automatico significa che un'interruzione del modello di prompt viene reindirizzata invece di bloccare la coda di rendering. Il DSL di routing conta più qui che in un flusso di lavoro con un solo modello, perché comporre diversi modelli in un'unica chiamata è ciò che consente a una pipeline a più stadi di fallire in modo controllato stadio per stadio anziché nel suo complesso. Per essere chiari sull'ambito: OrcaRouter non serve Google Veo 3.1 né Odyssey-3, e nessuno dei due modelli è raggiungibile tramite esso.

Chi dovrebbe agire ora, e chi dovrebbe aspettare
Se la tua scadenza è questo trimestre e il tuo deliverable è un file, Google Veo 3.1 è la scelta difendibile, e il prezzo — circa $0,40 al secondo a 1080p con audio, meno sui tier Fast e Lite — è il costo di un modello che è in produzione da abbastanza tempo da essere noioso. Metti in budget il flag audio deliberatamente invece di scoprirlo più tardi.
Se il tuo problema è una policy che deve funzionare su hardware, Odyssey-3 è pensato per te e non c'è ancora nulla da comprare. Aspetta tre cose: un prezzo pubblicato, una data di uscita che sia una data e non una finestra, e un numero indipendente. Il dato del 77% sim-to-real è di Odyssey stessa, e finché qualcuno esterno all'azienda non lo riproduce, la postura corretta è interesse piuttosto che pianificazione. Nel frattempo lo stack circostante è la parte che puoi costruire, e costruirlo in modo che un nuovo modello possa essere inserito in seguito è la posizione più economica da mantenere.

