Een gegenereerde tijdlijn-infographic met de titel "Grensverleggend onderzoek vs productie", met een markering voor Google Veo 3.1 bij GA 2025-11-17 met als bijschrift "tien maanden in productie" en een markering voor Odyssey-3 bij preview op 2026-09-15 met als bijschrift "geen prijs, geen datum", plus samenvattingsrijen voor Veo 3.1 (native 4K, 48kHz-audio optioneel, ~$0,20-$0,40 per seconde) en Odyssey-3 (simuleert toestand, stuurt hardware aan, prijs niet gepubliceerd).
Guides & Insights

Odyssey-3 vs Google Veo 3.1: Grensverleggende Fysica tegen Tien Maanden Productie

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De vergelijking tussen Odyssey-3 en Veo 3.1 is eigenlijk een vergelijking tussen twee datums. Veo 3.1 is algemeen beschikbaar sinds 17 november 2025 — tien maanden productiegebruik, gepubliceerde prijsstelling per seconde, native 4K, en een servingstack die minstens één keer een enterprise-review heeft doorstaan. Odyssey-3 werd op 15 september 2026 door Odyssey gepreviewd, heeft geen gepubliceerde prijs, geen API-documentatie, geen onafhankelijke benchmark, en een releasevenster van "de komende weken". Ze naast elkaar zetten is nog steeds de moeite waard, want de reden dat ze samen worden genoemd is reëel: Veo 3.1 rendert prachtige video, en Odyssey-3 probeert een wereld te simuleren die zich onder besturing correct gedraagt. Dat zijn de twee verschillende producten die teams onder het woord "video" blijven door elkaar halen, en de kloof ertussen is precies waar de aankoopbeslissing ligt.

What ten months of shipping buys you

Het voordeel van Veo 3.1 is geen functie, het is verstreken tijd. Het model is sinds oktober 2025 als preview in handen van betalende klanten en sinds 17 november als GA-product, met een Lite-tier toegevoegd op 31 maart 2026 en een gratis tier op 2 april. Die geschiedenis levert dingen op die een preview niet kan: een gedocumenteerd API-oppervlak, een gevestigde set storingsmodi die praktijkmensen al in kaart hebben gebracht, en een kostencurve die een financieel team kan modelleren.

Het specificatieblad weerspiegelt dezelfde volwassenheid. Veo 3.1 genereert in 720p, 1080p en native 4K, met 24 frames per seconde, in native duur van 4, 6 of 8 seconden, waarbij langere outputs worden gerapporteerd op 1080p en daarbuiten via het aaneenschakelen van scène-extensies. Het accepteert tot drie referentieafbeeldingen voor consistentie van personages en scènes, plus bedieningselementen voor seed en negative prompt. De output bevat SynthID- en C2PA-herkomstmetadata. Voor werk voor merken, broadcast of grote schermen is het native 4K-pad de enige capaciteit die het grootste deel van het concurrerende veld simpelweg niet heeft — en het is de reden dat Veo 3.1 projecten blijft winnen die het niet op prijs wint.

A generated two-column scoreboard for Odyssey-3 vs Google Veo 3.1 sharing six dimension labels: output, max resolution, clip length, audio, price, availability. Odyssey-3 reads world state + actions, not a renderer, continuous rollout, none, not published, preview only. Google Veo 3.1 reads rendered clip, native 4K, 4/6/8s native, 48kHz stereo off by default, ~$0.20/s silent and ~$0.40/s with audio, GA 2025-11-17. Footer: "Odyssey-3 vendor-reported and unreleased; Veo 3.1 figures per Google's published rates."

De audio-standaard die stilletjes elke vergelijking vertekent

Veo 3.1 genereert native 48kHz stereo-audio — dialoog, omgevingsgeluid, foley — samen met het beeld, wat echt een van de sterkste eigenschappen is. Op de API staat de audio-parameter echter standaard uit, en stille generatie is goedkoper dan generatie met audio. Op de door Google gepubliceerde Standard tier komt dat neer op ongeveer $0,20 per seconde voor stille generatie tegenover ongeveer $0,40 per seconde met audio. Daaruit volgen twee consequenties. Ten eerste hangt de effectieve prijs van een Veo-clip volledig af van een flag die de meeste mensen nooit wijzigen, dus een bedrag van '$0,20 per seconde' en een bedrag van '$0,40 per seconde' kunnen beide correct zijn voor hetzelfde model. Ten tweede, en subtieler, betekent het dat heel veel head-to-head-tests die je hebt gelezen een stille Veo 3.1 tegenover concurrenten plaatsten waarvan de audio altijd aanstaat, en ze vervolgens beoordeelden op een leaderboard dat audio meeweegt. Als je output geluid nodig heeft, is het eerlijke getal om mee te plannen dat met audio ingeschakeld.

Wat Odyssey-3 eigenlijk beweert

Odyssey-3 is geen betere videogenerator en beweert dat ook niet te zijn. Het is een autoregressieve diffusietransformer die is getraind op visuele observatie van de wereld, en de capaciteit die centraal staat in de aankondiging is een actiedecoder — "een geleerde outputcomponent die aan het wereldmodel is gekoppeld" die de interne scènerepresentatie van het model omzet in motorcommando's voor specifieke hardware. Odyssey meldt dat het robotarmen aanstuurt op basis van tientallen uren aan demonstraties, humanoïde policies die met Flexion zijn gebouwd in realtime aanstuurt, closed-loop rij-waypoints produceert vanuit een bevroren backbone die op 20 uur gesimuleerde data is getraind, drones binnenshuis rond obstakels laat vliegen, en Grand Theft Auto V speelt met overdracht naar Red Dead Redemption 2 en Sleeping Dogs zonder daar extra policy-training. Het enige vergelijkende cijfer dat is vrijgegeven, is dat met simulatie getrainde rij-policies tussen interventies door de veiligheidschauffeur ongeveer 77% zo ver aflegden als policies die op echte beelden zijn getraind.

Let op wat voor soort beweringen dit zijn. Geen enkele gaat erover hoe de output eruitziet. Ze gaan allemaal over wat een programma downstream van het model ermee kan doen.

De dimensies die niet overlappen

Uitvoer — Google Veo 3.1: een gerenderde clip, tot native 4K, met optionele 48kHz stereo-audio. Odyssey-3: een gesimuleerde wereldtoestand, plus motoracties via de actiedecoder.

Consument — Google Veo 3.1: een viewer of een editor. Odyssey-3: een robotcontroller, een rijbeleid of een trainingsloop.

Cliplengte — Google Veo 3.1: 4/6/8s native, langer bij 1080p, met verlengingsketens daarbuiten. Odyssey-3: doorlopende generatie, geen clipconcept.

Prijs — Google Veo 3.1: ~$0,20/s stil, ~$0,40/s met audio bij Standard; Fast- en Lite-tiers daaronder. Odyssey-3: niets gepubliceerd.

Beschikbaarheid — Google Veo 3.1: algemeen beschikbaar sinds 2025-11-17. Odyssey-3: preview op 2026-09-15, publiekelijk "in de komende weken."

Bewijs — Google Veo 3.1: tien maanden productiegebruik en een onafhankelijke positie op de ranglijst. Odyssey-3: demonstraties van de leverancier, geen benchmarktabel, geen technisch rapport.

Waar de natuurkundige claim daadwerkelijk loont — en waar niet

Het is verleidelijk om aan te nemen dat een model met betere fysica betere video maakt, en dat is niet wat Odyssey verkoopt. Het probleem van een videoteam is bijna nooit dat de wereld in de clip fysiek inconsistent is — het is dat de shot 4K moet zijn, of dat het personage er in drie verschillende setups hetzelfde uit moet zien, of dat er aan het eindproduct herkomstmetadata gekoppeld moet worden voordat de juridische afdeling akkoord gaat. Veo 3.1 beantwoordt die vragen vandaag. Een simulator met nauwkeurige fysica beantwoordt een andere vraag: kan ik hier iets trainen dat daarbuiten werkt. Als je niets traint, is de nauwkeurigheid van de fysica van Odyssey-3 een functie zonder afnemer in je workflow.

Waar de twee echt samenkomen, is previsualisatie. Een regisseur die een ruimte interactief wil verkennen — een camera door een decor laten lopen, een blockingkeuze wijzigen, het gevolg zien — wil precies wat een wereldmodel biedt en wat een gerenderde clip niet kan, omdat de clip vastligt op het moment dat hij wordt gegenereerd. Dat is een echte use case, en het is er ook een waarbij een niet-uitgebrachte preview nog geen optie is.

Dit in productie draaien zonder op één endpoint in te zetten

De reden dat productieteams zich bekommeren om de architectuur rond het model is dat een videopijplijn zelden uit één aanroep bestaat. Een promptmodel stelt de shotlijst op, een beeldmodel produceert het startframe, een visionmodel controleert het resultaat aan de hand van de briefing, een transcriptiemodel verzorgt de voice-over. Elk daarvan is een afhankelijkheid die om 2 uur 's nachts kan uitvallen, en elk is een afzonderlijke integratie als je ze apart afneemt. Die laag op één API voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag zetten, voegt de integraties samen, en automatische failover betekent dat een storing van het promptmodel omleidt in plaats van de renderwachtrij te laten vastlopen. De routing-DSL is hier belangrijker dan in een workflow met één model, omdat het samenstellen van meerdere modellen in één aanroep ervoor zorgt dat een meerfasige pijplijn stap voor stap op een nette manier kan falen in plaats van als geheel. Om duidelijk te zijn over de scope: OrcaRouter biedt Google Veo 3.1 en Odyssey-3 niet aan, en geen van beide modellen is er via bereikbaar.

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

Wie moet nu handelen, en wie moet wachten?

Als je deadline dit kwartaal is en je oplevering een bestand is, is Google Veo 3.1 de verdedigbare keuze, en de prijs — ongeveer $0,40 per seconde bij 1080p met audio, minder op de Fast- en Lite-niveaus — is de kostenpost van een model dat al lang genoeg in productie is om saai te zijn. Begroot de audio-flag bewust, in plaats van die later te ontdekken.

Als je probleem een policy is die op hardware moet werken, dan is Odyssey-3 op jou gericht en er is nog steeds niets te koop. Wacht op drie dingen: een gepubliceerde prijs, een releasedatum die een datum is en geen tijdvenster, en één onafhankelijk cijfer. Het sim-to-real-cijfer van 77% is van Odyssey zelf, en totdat iemand buiten het bedrijf het opnieuw uitvoert, is de juiste houding interesse in plaats van planning. Intussen is de stack eromheen het deel dat je kunt bouwen, en die zo bouwen dat je er later een nieuw model in kunt schuiven, is de goedkoopste positie om in te nemen.

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.