
Odyssey-3: Odyssey's nieuwe wereldmodel verovert de Physics-IQ-kroon en opent een openbare preview
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Odyssey-3 Pro scoorde 66,1 op de video-naar-video-track van Physics-IQ Verified, en Odyssey publiceerde dat cijfer op 8 oktober 2026 naast hetgeen dat er voor een ontwikkelaar echt toe doet: een publieke onderzoekspreview van Odyssey-3, een autoregressieve diffusietransformer die is gebouwd om vanuit een prompt een omgeving te genereren en die vervolgens in realtime te blijven voorspellen terwijl iemand erdoorheen loopt, een camera verplaatst of een gebeurtenis activeert. Odyssey-3 is het model; Odyssey-3 Pro is de 720p-variant ervan, draaiend op 1280×720 tegenover 832×480 van het basismodel. Beide verschijnen op dezelfde dag, in een preview die je zelf kunt bedienen op experience.odyssey.systems, met een aparte contactroute voor API-toegang.
Die combinatie is wat dit meer maakt dan een benchmarkpost. Interactieve wereldmodellen zijn al twee jaar demo-ware; de modellen die een paar frames plausibele beweging op een vast traject genereren, zijn niet hetzelfde artefact als een model dat zijn voorspellingen coherent houdt nadat je de bediening een por hebt gegeven. Odyssey claimt het tweede, en laat iedereen die bewering testen.
Wat er precies is uitgebracht
Twee checkpoints, één architectuur, geen gewichten.
• Odyssey-3 — het 480p-niveau, 832×480-uitvoer, 16 fps op de benchmark-harness, vermeld voor $0,139 per gegenereerde video in de genormaliseerde kostenkolom van de ranglijst.
• Odyssey-3 Pro — de 720p-tier, 1280×720, met een prijs van $0,267 per video op dezelfde basis.
Toegang — een onderzoekspreview in de browser met eerstepersoonsnavigatie, derdepersoonsnavigatie en onafhankelijke camerabeweging. API-toegang gaat via een contactformulier, niet via een selfservice-sleutel.
• Openheid — geen. Geen gewichten, geen licentie, geen prijs per token gepubliceerd. De pagina met API-voorwaarden op dezelfde site is voor het laatst bijgewerkt op 2026-01-22 en is nog steeds van toepassing op "het prototype van Odyssey-2 API", wat aangeeft hoe nieuw het commerciële oppervlak is.
De architectuur wordt in Odyssey's eigen beschrijving omschreven als een meerstaps video-diffusietransformer die autoregressief wordt uitgebreid via teacher forcing en causale masking, met een post-trainingpijplijn die distributiematching en adversariële distillatie combineert tot een gedistilleerde variant met enkele stappen — het onderdeel dat realtime-interactie überhaupt mogelijk maakt. Diffusie geeft je getrouwheid; autoregressie geeft je een model dat een actiereeks overleeft; de distillatie geeft je de kloksnelheid. Alle drie zijn onmisbaar, en alle drie zijn het de weergave van de leverancier van zijn eigen systeem, niet een onafhankelijke.
De benchmark, gelezen zoals het bestuur hem daadwerkelijk leest
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified wordt gerund door Anates Labs samen met DeepMind, en het is een werkelijk lastige benchmark om te manipuleren: het toont modellen video's van echte natuurkundige experimenten — vloeistofdynamica, optica, vastestofmechanica, magnetisme, thermodynamica — en beoordeelt het vervolg aan de hand van wat er werkelijk is gebeurd. Momenteel rangschikt het 41 modellen van 16 laboratoria. De 66,1 van Odyssey-3 Pro is de hoogste ruwe score op de video-naar-video-track die Odyssey rapporteert, en de kolom netto-verbetering van hetzelfde scorebord, die de winst ten opzichte van het trackgemiddelde in procentpunten meet, vertelt een subtiel ander verhaal:
• Netto verbetering ten opzichte van het trackgemiddelde — FLUX 3 [large] leidt met +12,27 pp; Odyssey-3 Pro staat tweede met +11,15 pp; Odyssey-3 staat derde met +9,99 pp.
• Kosten per gegenereerde video — Odyssey-3 Pro $0,267, Odyssey-3 $0,139, tegenover FLUX 3 [large] op $0,868 en Seedance 2.5 op $2,838. (De kosten zijn genormaliseerd naar 24 fps en 1280 brede output waar de ranglijst dat kan, zodat ze vergelijkbaar zijn tussen modellen die geen gemeenschappelijke framesnelheid hebben.)
• Leiderschap op submetrieken — Odyssey-3 neemt de eerste plaats in op de spumetric-submetriek met 44,70, vóór Odyssey-3 Pro met 42,97; FLUX 3 [large] behaalt spatial met 64,36 en gewogen spatial met 53,25, waarbij de twee Odyssey-inzendingen tweede en vierde staan op spatial.
Dus de eerlijke lezing is niet: "Odyssey-3 is het beste videomodel ter wereld." Het is: een wereldmodel dat voor interactie is gebouwd, is hoog terechtgekomen op een ranglijst voor fysieke plausibiliteit die voorheen toebehoorde aan cinematografische generators, en dat deed het tegen ongeveer een derde van de genormaliseerde kosten van FLUX 3. De afzonderlijke claim van Odyssey — 54,7 voor Odyssey-3 Pro op de image-to-video-track, best-of-8 — staat op dezelfde ranglijst, en dezelfde kanttekening geldt: dit zijn zelf ingediende configuraties, en de ranglijst mengt inzendingen die met aangepaste prompts zijn ingediend met inzendingen die zijn uitgevoerd met de eigen prompts van de benchmark. Odyssey komt in beide kolommen voor, wat ongewoon transparant is en ook betekent dat de twee rijen niet hetzelfde meten.

Waarom "wereldmodel" geen synoniem is voor "videomodel"
Het onderscheid is het hele productargument, dus het is de moeite waard om het ronduit te stellen. Een clipgenerator neemt een prompt en retourneert een vast object; de output is hetzelfde voor iedereen die erom vraagt. Odyssey-3 neemt een prompt en retourneert een systeem waarin je handelt — de eerstepersoons- en derdepersoonscameramodi van de preview en het vermogen om een gebeurtenis tijdens de generatie te accepteren, zijn het mechanisme waarmee het voorspelt wat er vervolgens gebeurt op basis van wat je zojuist hebt gedaan, niet op basis van wat de prompt zei.
Die eigenschap is de reden dat de resultaten voor fysieke systemen in het lanceringsmateriaal van Odyssey eruitzien zoals ze eruitzien. Het bedrijf meldt dat een actiedecoder die aan het bevroren wereldmodel is gekoppeld, getraind op tientallen uren robotdemonstraties, herstelgedragingen voortbracht die nooit in de demonstraties voorkwamen — het opnieuw oriënteren van een grijper na een gemiste greep, het terugvinden van een object dat in een ongebruikelijke oriëntatie is gevallen. Het meldt een humanoïde beleid dat door Flexion bovenop Odyssey-3 is gebouwd met tientallen uren teleoperatiegegevens, dat onder veranderingen in de verlichting bleef uitvoeren die de VLA-baselines waarmee het werd vergeleken, deden falen. Het meldt een rijbeleid dat op 20 uur gesimuleerde data is getraind en dat in gesloten lus op echte wegen reed, waarbij het tussen ingrepen van de veiligheidschauffeur ongeveer 77% van de afstand aflegde die een op echte beelden getraind beleid aflegde. Het meldt dronenavigatie op basis van gesimuleerde vluchtgegevens en gameplay in GTA V die beweging overdroeg naar Red Dead Redemption 2 en motorrijden naar Sleeping Dogs zonder verdere training.
Elk van die resultaten is door de leverancier gerapporteerd, zonder onafhankelijke replicatie, en twee ervan worden door Odyssey expliciet gepresenteerd als kwalitatieve observaties in plaats van metingen. Maar ze vormen wel het juiste soort bewijs voor de bewering: het interessante deel is niet dat het model een taak kan uitvoeren waarvoor het is getraind. Het is dat een bevroren backbone plus een kleine adapter betekenisvol gedrag weet te halen uit enkele tientallen uren aan data, en af en toe voorbij die data generaliseert.
Wat is nog steeds onbewezen?

Drie dingen, en ze zijn niet klein.
Ten eerste heeft geen enkele onafhankelijke evaluator Odyssey-3 gedraaid. De Physics-IQ-inzending is een inzending, en de tweede scorebron in Odyssey's eigen verslag — WorldMark, waarop Odyssey-3 eerste staat in drie van de vier splits — is een leveranciersevaluatie die de eigen captions van de benchmark gebruikt en, in Odyssey's bewoordingen, "het gemiddelde van de 13 gerapporteerde metrische scores." Dat is het bedrijf dat zichzelf op andermans dataset beoordeelt. Het is meer dan de meeste lanceringen bieden. Het is geen derde partij.
Ten tweede, de enige split die Odyssey-3 in die evaluatie niet wint, is degene die het dichtst bij de marketingclaim ligt. In realistische first-person-omgevingen eindigt het als derde met 80,6, achter Lyra 2.0 met 84,4 en AlayaWorld met 83,0. De voorsprong van het model in dezelfde evaluatie is geconcentreerd in gestileerde en third-person-omgevingen — 77,2 in first-person gestileerd, 79,0 in third-person realistisch, 76,3 in third-person gestileerd. Als je bouwt voor fotorealistische first-person-embodiment, is de ranglijst waar je om zou moeten geven degene waarin Odyssey-3 niet bovenaan staat.
Ten derde, beschikbaarheid. "Research preview" doet echt werk in die zin. Er is geen prijzenpagina, geen documentatie over limieten en geen selfservice-sleutel. Als je dit in een product wilt, sta je in de wachtrij.
Het vergelijken zonder een tweede contract
Hier is het praktische probleem met een lancering als deze: Odyssey-3 is deze week het interessantste in videogeneratie, en toch kun je het niet aanroepen. De modellen waartegen je het daadwerkelijk zou benchmarken zijn een ander verhaal.
OrcaRouter host Odyssey-3 niet, en er is geen gepubliceerde prijs om door te geven, zelfs als we dat wel deden. Wat één key wel bereikt, is de rest van de vergelijkingsset — minimax/minimax-h3 tegen $0,08 per seconde gegenereerde video op 768P, de Kling-videolijn, en meer dan 200 modellen achter één endpoint — tegen de lijstprijs van de provider met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag op je factuur verschijnt in plaats van bij de volgende verlenging. Automatische failover tussen providers betekent dat een evaluatieronde niet vastloopt omdat één upstream een slechte middag heeft, en de routing-DSL laat je meerdere modellen achter één interface plaatsen, zodat een head-to-head een configuratiewijziging is in plaats van een tweede integratie. Als Odyssey een selfservice-API opent, is dat de vorm waarin je het wilt onderbrengen.
Wat zou het beslechten?
Een onafhankelijke run van Odyssey-3 op een testharnas dat het niet zelf heeft gekozen. Een dozijn professionals met previewtoegang die beschrijven waar de omgeving na een minuut agressief camerawerk standhoudt en waar niet. Een prijs. Elk daarvan verandert dit van een sterke lancering in een referentiepunt.
Wat al waar is, is beperkter en nog steeds opmerkelijk: op het enige openbare leaderboard dat meet of een generatief model natuurkunde begrijpt in plaats van of het goed fotografeert, staat een model met interactie als doel op de tweede en derde plek, tegen een genormaliseerde kostenpost die lager is dan die van het model op de eerste plaats.
