Titelkort för Odyssey-3, med undertexten ”Odysseys interaktiva världsmodell, offentlig forskningsförhandsvisning öppnade 8 oktober 2026”, med två statistikpaneler: Odyssey-3 vid 832x480 och 16 fps på basnivån, Physics-IQ +9,99 pp rang 03 på anpassade prompter, normaliserad kostnad $0,139 per video; och Odyssey-3 Pro vid 1280x720 på Pro-nivån, Physics-IQ +11,15 pp rang 02, och 66,1 på video-till-video-spåret, normaliserad kostnad $0,267 per video.
Guides & Insights

Odyssey-3: Odysseys nya världsmodell tar hem Physics-IQ-kronan och öppnar en offentlig förhandsvisning

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Odyssey-3 Pro fick 66,1 på Physics-IQ Verifieds video-till-video-spår, och Odyssey publicerade den siffran den 8 oktober 2026 bredvid det som faktiskt spelar roll för en utvecklare: en offentlig forskningsförhandsvisning av Odyssey-3, en autoregressiv diffusionstransformer byggd för att generera en miljö från en prompt och sedan fortsätta förutsäga den i realtid medan någon går genom den, flyttar en kamera eller utlöser en händelse. Odyssey-3 är modellen; Odyssey-3 Pro är dess 720p-nivå, som körs i 1280×720 mot basmodellens 832×480. Båda släpps samma dag, i en förhandsvisning som du själv kan styra på experience.odyssey.systems, med en separat kontaktväg för API-åtkomst.

Det är den kombinationen som gör detta till mer än ett benchmarkinlägg. Interaktiva världsmodeller har varit demoprogramvara i två år; de som genererar några bildrutor av rimlig rörelse på en fast bana är inte samma slags artefakt som en modell som håller sina förutsägelser sammanhängande efter att du petar till reglagen. Odyssey hävdar det senare, och låter vem som helst testa påståendet.

Vad som levererades, exakt

Två checkpoints, en arkitektur, inga vikter.

• Odyssey-3 — 480p-nivån, 832×480-utdata, 16 fps i benchmark-harnesset, listad till $0.139 per genererad video i resultattavlans normaliserade kostnadskolumn.

• Odyssey-3 Pro — 720p-nivån, 1280×720, med ett listpris på 0,267 USD per video enligt samma beräkningsgrund.

• Åtkomst — en forskningsförhandsvisning i webbläsaren med förstapersonsnavigering, tredjepersonsnavigering och oberoende kamerarörelse. API-åtkomst är ett kontaktformulär, inte en självbetjäningsnyckel.

• Öppenhet — ingen. Inga vikter, ingen licens, inget pris per token publicerat. API-villkorssidan på samma webbplats uppdaterades senast 2026-01-22 och styr fortfarande "prototypen av Odyssey-2 API", vilket säger dig hur ny den kommersiella ytan är.

Arkitekturen beskrivs i Odysseys egen redogörelse som en flerstegs videodiffusionstransformator som utvidgas autoregressivt genom teacher forcing och kausal maskning, med en efterträningspipeline som kombinerar fördelningsmatchning och adversariell destillation till en fåstegs destillerad variant – den del som gör realtidsinteraktion möjlig överhuvudtaget. Diffusion ger dig trohet; autoregression ger dig en modell som överlever en handlingssekvens; destillationen ger dig klockfrekvensen. Alla tre är bärande, och alla tre är leverantörens redogörelse för sitt eget system, inte en oberoende.

Benchmarken, läst så som styrelsen faktiskt läser den

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified drivs av Anates Labs tillsammans med DeepMind, och det är ett verkligt knepigt benchmark att manipulera: det visar modeller video av verkliga fysikexperiment – fluiddynamik, optik, hållfasthetslära, magnetism, termodynamik – och poängsätter fortsättningen mot vad som faktiskt hände. Det rankar för närvarande 41 modeller från 16 labb. Odyssey-3 Pro:s 66,1 är den högsta råpoängen på video-till-video-spåret som Odyssey rapporterar, och samma resultattavlas kolumn för nettoförbättring, som mäter vinsten över spårets medelvärde i procentenheter, berättar en subtilt annorlunda historia:

• Nettoförbättring jämfört med banans medelvärde – FLUX 3 [large] leder med +12,27 pp; Odyssey-3 Pro är tvåa med +11,15 pp; Odyssey-3 är trea med +9,99 pp.

• Kostnad per genererad video — Odyssey-3 Pro 0,267 $, Odyssey-3 0,139 $, jämfört med FLUX 3 [large] på 0,868 $ och Seedance 2.5 på 2,838 $. (Kostnaderna är normaliserade till 24 fps och utdata med 1280 px bredd i den mån resultattavlan kan, så att de är jämförbara mellan modeller som inte har samma bildfrekvens.)

• Ledarskap på delmått — Odyssey-3 tar förstaplatsen på det spatiotemporala delmåttet med 44,70, före Odyssey-3 Pro med 42,97; FLUX 3 [large] tar spatial med 64,36 och viktad spatial med 53,25, med de två Odyssey-posterna på andra och fjärde plats i spatial.

Så den ärliga tolkningen är inte "Odyssey-3 är världens bästa videomodell". Den är: en världsmodell byggd för interaktion har landat nära toppen av en lista för fysikalisk trovärdighet som tidigare tillhörde cinematiska generatorer, och den gjorde det till ungefär en tredjedel av FLUX 3:s normaliserade kostnad. Odysseys separata påstående – 54,7 för Odyssey-3 Pro på spåret för bild-till-video, bäst av 8 – finns på samma lista, och samma förbehåll gäller: detta är självinlämnade konfigurationer, och resultattavlan blandar poster som lämnats in med anpassade prompter och poster som körts med benchmarkens egna prompter. Odyssey förekommer i båda kolumnerna, vilket är ovanligt transparent och också innebär att dess två rader inte mäter samma sak.

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

Varför "världsmodell" inte är en synonym till "videomodell"

Distinktionen är hela produktargumentet, så den är värd att säga rakt ut. En klippgenerator tar en prompt och returnerar ett fast objekt; utdata är densamma för alla som frågar. Odyssey-3 tar en prompt och returnerar ett system som du agerar inuti – förhandsvisningens kamerlägen för första och tredje person samt dess förmåga att ta emot en händelse mitt i genereringen är mekanismen genom vilken den förutsäger vad som händer härnäst utifrån vad du just gjorde, inte utifrån vad prompten sade.

Den egenskapen är det som får resultaten för fysiska system i Odysseys lanseringsmaterial att se ut som de gör. Företaget rapporterar att en aktionsavkodare kopplad till den frysta världsmodellen, tränad på tiotals timmar av robotdemonstrationer, producerade återhämtningsbeteenden som aldrig fanns i demonstrationerna — att rikta om ett gripdon efter ett missat grepp, att hämta ett föremål som tappats i en ovanlig orientering. Företaget rapporterar en humanoid policy byggd av Flexion ovanpå Odyssey-3 med tiotals timmar av teleoperationsdata som fortsatte att exekvera under ljusförändringar som slog ut VLA-baslinjerna som den jämfördes mot. Företaget rapporterar en körpolicy tränad på 20 timmars simulerad data som körde i sluten loop på riktiga vägar och färdades cirka 77 % så långt mellan säkerhetsförarens ingripanden som en policy tränad på riktigt filmmaterial. Företaget rapporterar drönarnavigering från simulerad flygdata och spelande i GTA V som överförde rörelse till Red Dead Redemption 2 och motorcykelkörning till Sleeping Dogs utan ytterligare träning.

Vart och ett av dessa är ett leverantörsrapporterat resultat utan oberoende replikering, och två av dem beskrivs uttryckligen av Odyssey som kvalitativa observationer snarare än mätningar. Men de är rätt sorts bevis för påståendet: det intressanta är inte att modellen kan utföra en uppgift som den har tränats för. Det är att en fryst stomme plus en liten adapter får fram meningsfullt beteende ur några tiotals timmar data, och ibland generaliserar bortom den.

Vad är fortfarande obevisat?

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

Tre saker, och de är inte små.

För det första har ingen oberoende utvärderare kört Odyssey-3. Physics-IQ-posten är en inlämning, och den andra poängkällan i Odysseys egen redogörelse — WorldMark, där Odyssey-3 rankas först i tre av fyra delningar — är en utvärdering gjord av leverantören som använder benchmarkens egna bildtexter och, med Odysseys formulering, "medelvärdet av dess 13 rapporterade metrikmått". Det är företaget som betygsätter sig självt på någon annans dataset. Det är mer än vad de flesta lanseringar erbjuder. Det är inte en tredje part.

För det andra: den enda delmätning som Odyssey-3 inte vinner i den utvärderingen är den som ligger närmast marknadsföringspåståendet. I verkliga förstapersonsmiljöer placerar den sig trea med 80,6, efter Lyra 2.0 med 84,4 och AlayaWorld med 83,0. Modellens försprång i samma utvärdering är koncentrerat till stiliserade miljöer och tredjepersonsmiljöer – 77,2 i stiliserad förstaperson, 79,0 i verklig tredjeperson, 76,3 i stiliserad tredjeperson. Om du bygger för fotorealistisk förstapersonsförkroppsligande är rankningen du bör bry dig om den där Odyssey-3 inte ligger högst.

För det tredje, tillgänglighet. "Research preview" gör ett verkligt arbete i den meningen. Det finns ingen prissättningssida, ingen dokumentation om hastighetsbegränsningar och ingen självbetjäningsnyckel. Om du vill ha det här i en produkt står du i kö.

Att jämföra det utan ett andra kontrakt

Här är det praktiska problemet med en lansering som den här: Odyssey-3 är det mest intressanta inom videogenerering den här veckan, och du kan fortfarande inte anropa det. De modeller som du faktiskt skulle benchmarka det mot är en annan historia.

OrcaRouter är inte värd för Odyssey-3, och det finns inget publicerat pris att föra vidare ens om vi vore det. Det en enda nyckel når är resten av jämförelsegruppen – minimax/minimax-h3 till $0,08 per sekund genererad video vid 768P, K​ling-videolinjen och fler än 200 modeller bakom en enda slutpunkt – till leverantörens listpris med 0 % påslag, så en leverantörs prisändring syns på din faktura samma dag i stället för vid nästa förnyelse. Automatisk redundansväxling mellan leverantörer innebär att en utvärderingsomgång inte dör för att en uppströmsleverantör har en dålig eftermiddag, och routnings-DSL:en låter dig lägga flera modeller bakom ett enda gränssnitt så att en direkt jämförelse blir en konfigurationsändring i stället för en andra integration. Om Odyssey öppnar ett självbetjänings-API är det formen du vill placera in det i.

Vad skulle avgöra det?

En oberoende körning av Odyssey-3 på en testrigg som den inte själv valt. Ett dussin yrkesverksamma med förhandsåtkomst som beskriver var miljön håller ihop efter en minut av aggressivt kameraarbete och var den inte gör det. Ett pris. Vilket som helst av dessa förvandlar detta från en stark lansering till en referenspunkt.

Det som redan är sant är snävare och fortfarande anmärkningsvärt: på den enda offentliga resultattavlan som mäter huruvida en generativ modell förstår fysik snarare än hur väl den presterar, ligger en modell vars syfte är interaktion på andra och tredje plats, till en normaliserad kostnad under modellen på första plats.