
Odyssey-3 Preview: Odyssey's wereldmodel gaat van het observeren van de wereld naar het handelen erin
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Odyssey-3 is het nieuwste foundation-wereldmodel van Odyssey, op 15 september 2026 in preview getoond door het bedrijf en in zijn eigen aankondiging beschreven als een model dat bedoeld is om "robots aan te sturen, auto's te besturen, AI's te trainen, drones te besturen en zelfs videogames te spelen." Wat de preview de moeite waard maakt om aandachtig te lezen, is niet de lijst van verschijningsvormen — het is het mechanisme. Odyssey-3 is een autoregressieve diffusietransformer die is getraind om diverse scenario's te simuleren op basis van visuele waarneming, en het bedrijf koppelt er een geleerde actiedecoder aan vast, een component die de interne representatie die het model van een scène heeft, vertaalt naar de motorcommando's die een specifiek stuk hardware nodig heeft. Dat is het verschil tussen een model dat een plausibele clip van een robotarm genereert en een model dat wordt gevraagd er een te bewegen. Odyssey noemt de klasse van systemen die dit mogelijk maakt "fysieke agenten" — modellen die, in de formulering van het bedrijf, "de taal van de wereld spreken." Als de framing dicht in de buurt komt van het label "physics agent" dat in de berichtgeving over de preview circuleert, is dat een redelijke interpretatie van dezelfde claim, hoewel het niet de eigen term van Odyssey is en het in dit stadium een beschrijving van intentie is in plaats van een gemeten resultaat.
Wat Odyssey werkelijk aankondigde
De post is een voorproefje, geen lancering. Odyssey zegt "verheugd te zijn het de komende weken publiekelijk uit te brengen" en noemt geen datum, geen prijs en geen toegangskanaal. Er is geen technisch rapport over Odyssey-3 gelinkt vanuit de aankondiging — het enige paper waarnaar de pagina verwijst is PROWL-1, het reinforcement learning-werk van het bedrijf, en de enige PDF is die van Starchild-1. Dat ontbreken is het waard om ronduit te zeggen, want het bepaalt alles hieronder: elke bewering over capaciteiten in dit artikel is afkomstig van Odyssey, niet gereproduceerd, en er is geen derde partij die tot nu toe een cijfer voor Odyssey-3 heeft gepubliceerd dat niet door Odyssey is aangeleverd.
Wat de post wel specificeert, is de architectuur en een trainingsfilosofie. Het model is een autoregressieve diffusietransformer. Het wordt getraind op visuele observatie van de wereld in plaats van op taakspecifieke labels, wat volgens Odyssey zorgt voor een aangeleerd begrip van "natuurkunde, dynamica, oorzaak en gevolg, menselijk gedrag" — en, in zijn eigen weergave, een lagere datavereiste dan systemen die niet op deze manier zijn voorgetraind. De onderliggende gok is dezelfde die het hele vakgebied van wereldmodellen doet: dat het voorspellen van de volgende toestand van een scène op schaal een model dwingt te internaliseren hoe fysieke objecten zich werkelijk gedragen, omdat een model dat de natuurkunde verkeerd heeft, bij een lange rollout in incoherentie vervalt en niet meer kan herstellen.

Eén ruggengraat, zes lichamen
Het meest concrete bewijs in de aankondiging is de verspreiding van embodiments die door hetzelfde basismodel worden aangedreven. Odyssey meldt:
• Robotarmen — leerde een verscheidenheid aan armen aan te sturen en complexe taken te voltooien op basis van "slechts tientallen uren aan robotdemonstraties", waaronder herstelgedrag dat helemaal niet in de demonstraties voorkwam, zoals het opnieuw richten van een grijper na een gemiste greep.
• Humanoïden — werk uitgevoerd met Flexion, met beleid gebouwd op tientallen uren aan teleoperatiegegevens van humanoïden die in realtime draaien, waarvan Odyssey beweert dat het beter generaliseerde naar veranderingen in belichting dan de vision-language-action-baselines waartegen het werd getest.
• Rijden — een bevroren backbone die real-time waypoints produceert voor closed-loop rijden, getraind op "slechts 20 uur gesimuleerde rijdata."
• Drones — obstakelvermijdende binnenhuisvlucht op basis van tientallen uren gesimuleerde vluchtgegevens, plus kwalitatieve rollouts met de backbone bevroren.
• Videogames — langdurige Grand Theft Auto V-sessies, met overdracht naar Red Dead Redemption 2 en Sleeping Dogs zonder enige extra beleidstraining in die titels.
• AI-trainingsomgevingen — gegenereerde werelden die als trainingsgrond voor andere agents worden gebruikt, gekoppeld aan het PROWL-1-werk.
Het patroon over die rijen is de eigenlijke claim: niet dat Odyssey-3 uitblinkt in een van hen, maar dat één set gewichten, met een kleine aangeleerde uitvoeradapter, ze allemaal bereikt. Een algemeen model van hoe de wereld beweegt is een heel ander bezit dan een per-robotbeleid, en het is de reden dat de preview landde waar die landde.
Het ene getal, en wat het niet bewijst
Odyssey publiceert precies één vergelijkend cijfer voor Odyssey-3: rijbeleid dat puur in simulatie is getraind, legde tussen interventies van veiligheidschauffeurs ongeveer 77% af van de afstand die beleid dat op echte beelden is getraind aflegde, met dezelfde 20 uur gesimuleerde data. Dat is een sim-to-real-getal, en het is een werkelijk interessant getal — het dichten van zelfs maar een deel van de kloof tussen rijden dat op simulatie is getraind en rijden dat op echte data is getraind, is het moeilijke deel van het probleem. Het is ook het enige cijfer in het bericht.
Er is geen nauwkeurigheidstabel, geen succespercentage, geen cross-bodybenchmark en geen vergelijking met een ander genoemd wereldmodel in een gedeelde evaluatie. De kaart in de voettekst van de pagina beweert dat Odyssey-3 "de state-of-the-art op het gebied van fysieke nauwkeurigheid van wereldmodellen" vooruitbrengt, maar niets op de pagina onderbouwt dat met een cijfer. Odyssey noemt ook een evaluatiepartnerschap met Poke & Wiggle dat "verschillende lichamen, gezichtspunten en besturingselementen" omvat — en publiceert daar nog geen resultaten van. Alles hier is een leveranciersclaim, en het cijfer van 77% moet precies als zodanig worden gelezen totdat een externe partij het opnieuw uitvoert.
Wat de ontbrekende benchmarktabel betekent
Het zou gemakkelijk zijn om het ontbreken van benchmarks als een rode vlag te lezen. Beter is het om het te lezen als de stand van het vakgebied. Wereldmodellen hebben nog niet het equivalent van een MMLU of een GPQA — een gedeelde, goedkope, breed vertrouwde evaluatie waar iedereen tegen rapporteert. Odysseys eigen kader erkent het schaalprobleem vanuit de andere richting: de post zegt dat frontier-wereldmodellen "ruwweg twee ordes van grootte achterblijven bij taalmodellen." Wanneer de evaluatiestandaard zelf nog niet is uitgekristalliseerd, beschrijft een previewpost die begint met architectuur en embodiment-spreiding in plaats van een scorebord de frontier eerlijk, en een lezer moet de kwalitatieve beweringen als richtinggevend beschouwen in plaats van als vaststaand. Het Poke & Wiggle-partnerschap is het ding om in de gaten te houden: een cross-body-, cross-viewpoint-evaluatie met gepubliceerde cijfers zou de eerste onafhankelijke lezing van dit alles zijn.

"In de komende weken" is de echte kop.
Voor iedereen die dit kwartaal een beslissing moet nemen, is de bepalende zin in de aankondiging de zin over beschikbaarheid. Odyssey-3 is niet algemeen beschikbaar, heeft geen gepubliceerde prijs, geen API-documentatie en geen genoemde datum — alleen "de komende weken". Dat plaatst het in een andere categorie dan een model dat je vandaag kunt evalueren. Het betekent ook dat de vergelijkingspagina's die onvermijdelijk tegen Odyssey-3 zullen worden geschreven, voorlopig vergelijkingen zijn tussen een uitgebracht product en een onderzoekspreview, wat een wezenlijk onderscheid is en geen technisch detail: een preview kan uitstekend zijn en toch niet iets zijn dat je maandag in een pipeline kunt zetten.
Er is een tweede reden waarom de timing ertoe doet. Odyssey haalde een Serie B van $310 miljoen op bij een waardering van $1,45 miljard, waarbij AWS zijn voorkeursaanbieder voor clouddiensten werd — het bedrijf heeft de rekenkracht om een frontier-wereldmodel vooruit te stuwen, en een preview die maanden voor een publieke release uitkomt, is de manier waarop dat werk wordt getoond. Lees de aankondiging als een uitspraak over de koers, niet over het kunnen.
Wat te doen met dit als je vandaag bouwt
Odyssey-3 zelf is iets dat je niet kunt aanroepen, en OrcaRouter serveert het niet — geen enkele routeringslaag doet dat, want er is nog niets om naartoe te routeren. Wat nu de moeite waard is, is de beslissing in twee delen splitsen. Het eerste deel is het wereldmodel, en daarvoor is het eerlijke antwoord: wacht op de publieke release en de eerste onafhankelijke evaluatie. Het tweede deel is alles eromheen: het taalmodel dat een taak omzet in iets waarmee een policy kan werken, het visiemodel dat een scène leest, het transcriptiemodel dat een opgenomen demonstratie labelt. Die omliggende stack is gewoon routeringswerk, en het is vandaag beschikbaar op één API voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, met automatische failover wanneer een provider degradeert. De reden om die laag nu te routeren in plaats van later, is dat het de laag is die je nog steeds zult draaien wanneer Odyssey-3 uitkomt, en het wisselen van een promptmodel is een configuratiewijziging, terwijl het herschrijven van een integratie dat niet is.
Het is ook de moeite waard om de wereldmodelvraag op de goedkoopst mogelijke manier open te houden. Wanneer een model zoals Odyssey-3 een gerouteerde provider bereikt, verschijnt het dezelfde dag tegen de lijstprijs van de provider, dus het uitproberen kost een API-aanroep in plaats van een contract. De omliggende pipeline zo bouwen dat een nieuw model eenvoudig kan worden ingepast, is de praktische voorbereiding op een frontier die nog steeds in beweging is.
Wat zou de lezing veranderen
Drie dingen zouden van deze preview een vaststaand feit maken. Een gepubliceerd technisch rapport met de architectuur- en trainingsdetails zou externe groepen in staat stellen alles te reproduceren. Een eerste onafhankelijke benchmark — idealiter het cross-bodywerk van Poke & Wiggle — zou de bewering van de leverancier vervangen door een getal dat iemand anders heeft gemeten. En een publieke release met datum en prijs zou elke vergelijking met Odyssey-3 veranderen in een vergelijking tussen twee dingen die een lezer daadwerkelijk kan draaien.
Tot die tijd is dit de verdedigbare samenvatting: Odyssey-3 is een geloofwaardige claim op iets werkelijk moeilijks — één wereldmodel, vele lichamen, controle in plaats van rendering — van een goed gefinancierd lab met een bewezen staat van dienst op dit gebied, gepresenteerd met bijna geen cijfers en geen beschikbaarheidsdatum. Zo ziet een frontier-preview eruit. Behandel de capaciteitsclaims als richtinggevend, de architectuur als het interessante deel, en de releasedatum als de enige regel die je plannen verandert.

