
Odyssey-3: Odysseys neues Weltmodell erobert die Physics-IQ-Krone und startet eine öffentliche Vorschau
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Odyssey-3 Pro erzielte 66,1 im Video-zu-Video-Track von Physics-IQ Verified, und Odyssey veröffentlichte diese Zahl am 8. Oktober 2026 neben dem, was für Entwickler wirklich zählt: einer öffentlichen Research-Preview von Odyssey-3, einem autoregressiven Diffusion-Transformer, der darauf ausgelegt ist, aus einem Prompt eine Umgebung zu erzeugen und sie dann in Echtzeit weiter vorherzusagen, während jemand sie durchquert, eine Kamera bewegt oder ein Ereignis auslöst. Odyssey-3 ist das Modell; Odyssey-3 Pro ist die 720p-Variante davon und läuft mit 1280×720 gegenüber den 832×480 des Basismodells. Beide gehen am selben Tag live, in einer Preview, die man unter experience.odyssey.systems selbst ausprobieren kann, mit einem separaten Kontaktweg für den API-Zugang.
Diese Kombination ist es, die daraus mehr als einen Benchmark-Beitrag macht. Interaktive Weltmodelle sind seit zwei Jahren Demo-Ware; diejenigen, die ein paar Frames plausibler Bewegung auf einer festen Trajektorie erzeugen, sind nicht dasselbe Artefakt wie ein Modell, dessen Vorhersagen kohärent bleiben, nachdem man an den Steuerungen rüttelt. Odyssey beansprucht das Zweite und lässt jeden diese Behauptung testen.
Was genau ausgeliefert wurde
Zwei Checkpoints, eine Architektur, keine Gewichte.
• Odyssey-3 — die 480p-Stufe, 832×480 Ausgabe, 16 fps auf dem Benchmark-Harness, gelistet mit $0.139 pro generiertem Video in der normalisierten Kostenspalte des Leaderboards.
• Odyssey-3 Pro — die 720p-Stufe, 1280×720, auf derselben Basis mit 0,267 $ pro Video ausgewiesen.
• Zugang — eine Forschungsvorschau im Browser mit First-Person-Navigation, Third-Person-Navigation und unabhängiger Kamerabewegung. Der API-Zugang erfolgt über ein Kontaktformular, nicht über einen Self-Service-Schlüssel.
• Offenheit — keine. Keine Gewichte, keine Lizenz, kein Preis pro Token veröffentlicht. Die Seite mit den API-Bedingungen auf derselben Website wurde zuletzt am 2026-01-22 aktualisiert und regelt weiterhin „den Prototyp der Odyssey-2 API“, was zeigt, wie neu die kommerzielle Oberfläche ist.
Die Architektur wird in einer eigenen Beschreibung von Odyssey als mehrstufiger Video-Diffusions-Transformer beschrieben, der autoregressiv durch Teacher Forcing und kausale Maskierung erweitert wird, mit einer Post-Training-Pipeline, die Distribution Matching und adversarische Destillation zu einer auf wenige Schritte destillierten Variante kombiniert – der Teil, der Echtzeitinteraktion überhaupt erst möglich macht. Diffusion liefert Treue; Autoregression liefert ein Modell, das eine Aktionssequenz übersteht; die Destillation liefert die Taktfrequenz. Alle drei sind tragend, und alle drei sind die Darstellung des eigenen Systems durch den Anbieter, keine unabhängige.
Der Benchmark, so gelesen, wie der Vorstand ihn tatsächlich liest
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified wird von Anates Labs mit DeepMind betrieben, und es ist ein wirklich schwer zu manipulierender Benchmark: Er zeigt Modellen Videos echter physikalischer Experimente — Fluiddynamik, Optik, Festkörpermechanik, Magnetismus, Thermodynamik — und bewertet die Fortsetzung gegen das, was tatsächlich passiert ist. Derzeit werden 41 Modelle aus 16 Labors gelistet. Die 66,1 von Odyssey-3 Pro sind der höchste Rohwert auf der Video-zu-Video-Spur, die Odyssey ausweist, und die Spalte „Netto-Verbesserung“ desselben Boards, die den Zugewinn gegenüber dem Mittelwert der Spur in Prozentpunkten misst, erzählt eine subtil andere Geschichte:
• Nettoverbesserung gegenüber dem Track-Mittelwert — FLUX 3 [large] führt mit +12,27 pp; Odyssey-3 Pro liegt mit +11,15 pp auf dem zweiten Platz; Odyssey-3 liegt mit +9,99 pp auf dem dritten Platz.
• Kosten pro generiertem Video — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, gegenüber FLUX 3 [large] mit $0.868 und Seedance 2.5 mit $2.838. (Die Kosten sind, sofern das Leaderboard dazu in der Lage ist, auf 24 fps und eine 1280 Pixel breite Ausgabe normalisiert, sodass sie über Modelle hinweg vergleichbar sind, die nicht dieselbe Bildrate verwenden.)
• Submetrik-Führerschaft — Odyssey-3 belegt mit 44,70 den ersten Platz in der raumzeitlichen Submetrik, vor Odyssey-3 Pro mit 42,97; FLUX 3 [large] führt bei der räumlichen Submetrik mit 64,36 und bei der gewichteten räumlichen Submetrik mit 53,25, während die beiden Odyssey-Einträge in der räumlichen Submetrik den zweiten und vierten Platz belegen.
Die ehrliche Lesart ist also nicht „Odyssey-3 ist das beste Videomodell der Welt.“ Sie lautet: Ein Weltmodell, das für Interaktion gebaut wurde, ist nahe an die Spitze einer Rangliste für physische Plausibilität gelangt, die zuvor filmischen Generatoren vorbehalten war, und das zu ungefähr einem Drittel der normalisierten Kosten von FLUX 3. Odysseys separate Behauptung — 54,7 für Odyssey-3 Pro auf dem Image-to-Video-Track, Best-of-8 — steht auf derselben Rangliste, und derselbe Vorbehalt gilt: Dies sind selbst eingereichte Konfigurationen, und das Leaderboard mischt Einträge, die mit benutzerdefinierten Prompts eingereicht wurden, mit Einträgen, die mit den eigenen Prompts des Benchmarks ausgeführt wurden. Odyssey erscheint in beiden Spalten, was ungewöhnlich transparent ist und zugleich bedeutet, dass seine beiden Zeilen nicht dasselbe messen.

Warum „Weltmodell“ kein Synonym für „Videomodell“ ist
Der Unterschied ist das ganze Produktargument, deshalb lohnt es sich, ihn klar auszusprechen. Ein Clip-Generator nimmt einen Prompt entgegen und liefert ein festes Objekt zurück; die Ausgabe ist für alle, die danach fragen, dieselbe. Odyssey-3 nimmt einen Prompt entgegen und liefert ein System zurück, in dem man agiert – die First-Person- und Third-Person-Kameramodi der Vorschau und die Fähigkeit, ein Ereignis mitten in der Generierung anzunehmen, sind der Mechanismus, mit dem es vorhersagt, was als Nächstes passiert – ausgehend davon, was man gerade getan hat, nicht davon, was der Prompt gesagt hat.
Diese Eigenschaft ist der Grund, warum die Ergebnisse für physische Systeme im Launch-Material von Odyssey so aussehen, wie sie aussehen. Das Unternehmen berichtet, dass ein an das eingefrorene Weltmodell angeschlossener Aktionsdecoder, der mit Dutzenden Stunden Roboter-Demonstrationen trainiert wurde, Wiederherstellungsverhalten erzeugte, das nie in den Demonstrationen vorkam – das Neuausrichten eines Greifers nach einem misslungenen Griff, das Zurückholen eines Objekts, das in einer ungewöhnlichen Ausrichtung fallengelassen wurde. Es berichtet von einer humanoiden Policy, die Flexion auf Odyssey-3 aufsetzte und mit Dutzenden Stunden Teleoperationsdaten trainierte, die unter Lichtveränderungen weiter ausgeführt wurde, welche die VLA-Baselines, gegen die sie verglichen wurde, zum Scheitern brachten. Es berichtet von einer Fahr-Policy, die mit 20 Stunden simulierten Daten trainiert wurde und im geschlossenen Regelkreis auf echten Straßen fuhr, wobei sie zwischen Eingriffen des Sicherheitsfahrers etwa 77 % so weit kam wie eine mit echtem Filmmaterial trainierte Policy. Es berichtet von Drohnennavigation aus simulierten Flugdaten und von Gameplay in GTA V, das Fortbewegung auf Red Dead Redemption 2 und Motorradfahren auf Sleeping Dogs ohne weiteres Training übertrug.
Jedes Einzelne davon ist ein vom Anbieter gemeldetes Ergebnis ohne unabhängige Replikation, und zwei davon werden von Odyssey ausdrücklich als qualitative Beobachtungen und nicht als Messungen dargestellt. Aber sie sind die richtige Art von Belegen für die Behauptung: Das Interessante daran ist nicht, dass das Modell eine Aufgabe bewältigen kann, für die es trainiert wurde. Sondern dass ein eingefrorenes Backbone plus ein kleiner Adapter aus einigen Dutzend Stunden Daten sinnvolles Verhalten herausholt und gelegentlich über sie hinaus generalisiert.
Was ist noch unbewiesen

Drei Dinge, und sie sind nicht klein.
Erstens hat kein unabhängiger Evaluator Odyssey-3 ausgeführt. Der Physics-IQ-Eintrag ist eine Einreichung, und die zweite Bewertungsquelle in Odysseys eigenem Bericht — WorldMark, bei dem Odyssey-3 in drei von vier Splits auf dem ersten Platz liegt — ist eine Bewertung durch den Anbieter, die die eigenen Bildbeschreibungen des Benchmarks und, in Odysseys Formulierung, „den Mittelwert seiner 13 berichteten Metrikwerte“ verwendet. Das bedeutet, das Unternehmen bewertet sich selbst anhand des Datensatzes eines anderen. Das ist mehr, als die meisten Markteinführungen bieten. Es ist keine unabhängige dritte Partei.
Zweitens ist der eine Split, den Odyssey-3 in dieser Evaluation nicht gewinnt, genau derjenige, der dem Marketingversprechen am nächsten kommt. In realen First-Person-Umgebungen belegt es mit 80,6 den dritten Platz, hinter Lyra 2.0 mit 84,4 und AlayaWorld mit 83,0. Der Vorsprung des Modells in derselben Evaluation konzentriert sich auf stilisierte und Third-Person-Umgebungen — 77,2 in stilisierter First-Person-Umgebung, 79,0 in realer Third-Person-Umgebung, 76,3 in stilisierter Third-Person-Umgebung. Wenn Sie für fotorealistisches First-Person-Embodiment entwickeln, ist das Ranking, das Sie beachten sollten, dasjenige, in dem Odyssey-3 nicht an der Spitze steht.
Drittens, Verfügbarkeit. „Research preview“ leistet in diesem Satz echte Arbeit. Es gibt keine Preisseite, keine Dokumentation zu Rate Limits und keinen Self-Serve-Key. Wenn Sie das in einem Produkt haben möchten, stehen Sie in einer Warteschlange.
Es ohne einen zweiten Vertrag vergleichen
Hier ist das praktische Problem bei einem Launch wie diesem: Odyssey-3 ist diese Woche das interessanteste in der Videogenerierung, und man kann es immer noch nicht aufrufen. Die Modelle, gegen die man es tatsächlich benchmarken würde, sind eine ganz andere Geschichte.
OrcaRouter hostet Odyssey-3 nicht, und es gibt keinen veröffentlichten Preis, den wir weitergeben könnten, selbst wenn wir es täten. Was ein einziger Schlüssel erreicht, ist der Rest des Vergleichssets — minimax/minimax-h3 zu $0.08 pro Sekunde generierten Videos bei 768P, die Kling-Videoreihe und mehr als 200 Modelle hinter einem einzigen Endpunkt — zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters noch am selben Tag auf Ihrer Rechnung erscheint statt erst bei der nächsten Verlängerung. Automatisches Failover über Anbieter hinweg bedeutet, dass ein Evaluierungsdurchlauf nicht daran scheitert, dass ein Upstream gerade einen schlechten Nachmittag hat, und die Routing-DSL lässt Sie mehrere Modelle hinter einer Schnittstelle bündeln, sodass ein direkter Vergleich eine Konfigurationsänderung ist statt einer zweiten Integration. Wenn Odyssey eine Self-Serve-API öffnet, ist das die Form, in die Sie es einfügen möchten.
Was würde es klären
Ein unabhängiger Durchlauf von Odyssey-3 in einer Testumgebung, die es sich nicht selbst ausgesucht hat. Ein Dutzend Praktiker mit Preview-Zugang, die beschreiben, wo die Umgebung nach einer Minute aggressiver Kameraführung zusammenhält und wo nicht. Ein Preis. Jedes davon verwandelt dies von einem starken Launch in einen Referenzpunkt.
Was bereits zutrifft, ist enger gefasst und dennoch bemerkenswert: Auf dem einen öffentlichen Leaderboard, das misst, ob ein generatives Modell Physik versteht, statt ob es gut fotografiert, belegt ein Modell, dessen Zweck Interaktion ist, Platz zwei und drei – bei normalisierten Kosten, die unter denen des Modells auf Platz eins liegen.
