
Odyssey-3 : le nouveau modèle du monde d’Odyssey décroche la couronne Physics-IQ et ouvre une préversion publique
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Odyssey-3 Pro a obtenu un score de 66,1 sur la piste vidéo-vers-vidéo de Physics-IQ Verified, et Odyssey a publié ce chiffre le 8 octobre 2026 à côté de ce qui compte vraiment pour un développeur : un aperçu de recherche public d’Odyssey-3, un transformeur de diffusion autorégressif conçu pour générer un environnement à partir d’une invite, puis continuer à le prédire en temps réel pendant que quelqu’un le parcourt, déplace une caméra ou déclenche un événement. Odyssey-3 est le modèle ; Odyssey-3 Pro en est la déclinaison 720p, fonctionnant en 1280×720, contre 832×480 pour le modèle de base. Les deux sont mis en ligne le même jour, dans un aperçu que vous pouvez piloter vous-même sur experience.odyssey.systems, avec un canal de contact distinct pour l’accès à l’API.
C'est cet appariement qui fait que ceci est plus qu'un article de benchmark. Les modèles de monde interactifs sont des logiciels de démonstration depuis deux ans ; ceux qui génèrent quelques images d'un mouvement plausible sur une trajectoire fixe ne sont pas le même artefact qu'un modèle qui garde ses prédictions cohérentes après qu'on a manipulé les commandes. Odyssey revendique la seconde chose, et laisse n'importe qui tester cette affirmation.
Qu'est-ce qui a été livré, précisément
Deux points de contrôle, une architecture, aucun poids.
• Odyssey-3 — le palier 480p, sortie 832×480, 16 fps sur le harnais de benchmark, répertorié à 0,139 $ par vidéo générée dans la colonne de coût normalisé du classement.
• Odyssey-3 Pro — le palier 720p, 1280×720, affiché à 0,267 $ par vidéo sur la même base.
• Accès — un aperçu de recherche dans le navigateur avec navigation à la première personne, navigation à la troisième personne et mouvement de caméra indépendant. L'accès à l'API passe par un formulaire de contact, et non par une clé en libre-service.
• Ouverture — aucune. Aucun poids, aucune licence, aucun prix par token publié. La page des conditions d’utilisation de l’API sur le même site a été mise à jour pour la dernière fois le 2026-01-22 et régit toujours « le prototype de l’API Odyssey-2 », ce qui vous indique à quel point la surface commerciale est récente.
L’architecture est décrite, dans le propre compte rendu d’Odyssey, comme un transformateur de diffusion vidéo multi-étapes étendu de manière autorégressive par forçage par l’enseignant et masquage causal, avec un pipeline de post-entraînement qui combine appariement de distribution et distillation adversariale en une variante distillée en quelques étapes — celle qui rend tout simplement possible l’interaction en temps réel. La diffusion vous donne la fidélité ; l’autorégression vous donne un modèle qui survit à une séquence d’actions ; la distillation vous donne la vitesse d’horloge. Toutes les trois sont structurantes, et toutes les trois relèvent du récit du fournisseur sur son propre système, pas d’un récit indépendant.
Le benchmark, lu de la façon dont le conseil le lit réellement
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified est géré par Anates Labs avec DeepMind, et c'est un benchmark vraiment difficile à manipuler : il montre aux modèles des vidéos d'expériences physiques réelles — dynamique des fluides, optique, mécanique des solides, magnétisme, thermodynamique — et évalue la continuation par rapport à ce qui s'est réellement produit. Il classe actuellement 41 modèles issus de 16 laboratoires. Le 66,1 d'Odyssey-3 Pro est le score brut le plus élevé sur la piste vidéo-vers-vidéo que rapporte Odyssey, et la colonne d'amélioration nette du même tableau, qui mesure le gain par rapport à la moyenne de la piste en points de pourcentage, raconte une histoire subtilement différente :
• Amélioration nette par rapport à la moyenne de la piste — FLUX 3 [large] est en tête à +12,27 pp ; Odyssey-3 Pro est deuxième à +11,15 pp ; Odyssey-3 est troisième à +9,99 pp.
• Coût par vidéo générée — Odyssey-3 Pro 0,267 $, Odyssey-3 0,139 $, contre FLUX 3 [large] à 0,868 $ et Seedance 2.5 à 2,838 $. (Les coûts sont normalisés à 24 ips et à une sortie de 1280 pixels de large dans la mesure où le classement le permet, afin qu'ils soient comparables entre des modèles qui n'ont pas la même fréquence d'images.)
• Leadership sur les sous-métriques — Odyssey-3 se classe premier sur la sous-métrique spatio-temporelle avec 44,70, devant Odyssey-3 Pro à 42,97 ; FLUX 3 [large] se classe premier sur la sous-métrique spatiale avec 64,36 et sur la sous-métrique spatiale pondérée avec 53,25, les deux entrées Odyssey se classant deuxième et quatrième sur la sous-métrique spatiale.
Donc, la lecture honnête n'est pas « Odyssey-3 est le meilleur modèle vidéo au monde ». C'est : un modèle du monde conçu pour l'interaction a atterri près du sommet d'un classement de plausibilité physique qui était auparavant la propriété des générateurs cinématographiques, et il y est parvenu pour environ un tiers du coût normalisé de FLUX 3. La revendication distincte d'Odyssey — 54,7 pour Odyssey-3 Pro sur la piste image-vers-vidéo, best-of-8 — figure sur le même classement, et la même mise en garde s'applique : il s'agit de configurations soumises par les participants eux-mêmes, et le classement mélange des entrées soumises avec des invites personnalisées et des entrées exécutées avec les invites propres du benchmark. Odyssey apparaît dans les deux colonnes, ce qui est d'une transparence inhabituelle et signifie aussi que ses deux lignes ne mesurent pas la même chose.

Pourquoi « modèle du monde » n'est pas un synonyme de « modèle vidéo »
Cette distinction constitue tout l’argument du produit, et il vaut donc la peine de l’énoncer clairement. Un générateur de clips prend un prompt et renvoie un objet figé ; le résultat est le même pour quiconque le sollicite. Odyssey-3 prend un prompt et renvoie un système dans lequel vous agissez — les modes de caméra à la première personne et à la troisième personne de l’aperçu et sa capacité à accepter un événement en cours de génération sont le mécanisme par lequel il prédit ce qui se produira ensuite compte tenu de ce que vous venez de faire, et non de ce que disait le prompt.
C’est cette propriété qui fait que les résultats sur systèmes physiques présentés dans les supports de lancement d’Odyssey sont ce qu’ils sont. La société rapporte qu’un décodeur d’actions attaché au modèle du monde gelé, entraîné sur des dizaines d’heures de démonstrations robotiques, a produit des comportements de récupération qui n’étaient pas dans les démonstrations — réorienter une pince après une prise manquée, récupérer un objet tombé dans une orientation inhabituelle. Elle rapporte qu’une politique humanoïde construite par Flexion au-dessus d’Odyssey-3 avec des dizaines d’heures de données de téléopération a continué à s’exécuter sous des changements d’éclairage qui ont mis en échec les références VLA auxquelles elle était comparée. Elle rapporte qu’une politique de conduite entraînée sur 20 heures de données simulées a conduit en boucle fermée sur des routes réelles, parcourant entre les interventions du conducteur de sécurité environ 77 % de la distance d’une politique entraînée sur des images réelles. Elle rapporte une navigation de drone à partir de données de vol simulées et un gameplay dans GTA V qui a transféré le déplacement vers Red Dead Redemption 2 et la conduite de moto vers Sleeping Dogs sans entraînement supplémentaire.
Chacun de ceux-ci est un résultat rapporté par un fournisseur, sans réplication indépendante, et deux d’entre eux sont explicitement présentés par Odyssey comme des observations qualitatives plutôt que des mesures. Mais ils constituent le bon type de preuves à l’appui de cette affirmation : ce qui est intéressant n’est pas que le modèle puisse réaliser une tâche pour laquelle il a été entraîné. C’est qu’un backbone gelé accompagné d’un petit adaptateur tire un comportement significatif de quelques dizaines d’heures de données, et parfois généralise au-delà.
Qu’est-ce qui n’est pas encore prouvé ?

Trois choses, et elles ne sont pas anodines.
Premièrement, aucun évaluateur indépendant n'a exécuté Odyssey-3. L'entrée Physics-IQ est une soumission, et la deuxième source de notation dans le propre compte rendu d'Odyssey — WorldMark, sur lequel Odyssey-3 se classe premier dans trois des quatre splits — est une évaluation par le fournisseur utilisant les légendes du benchmark lui-même et, selon les termes d'Odyssey, « la moyenne de ses 13 scores métriques rapportés ». C'est l'entreprise qui s'auto-évalue sur le jeu de données de quelqu'un d'autre. C'est plus que ce que la plupart des lancements proposent. Ce n'est pas un tiers.
Deuxièmement, le seul segment qu'Odyssey-3 ne remporte pas dans cette évaluation est celui qui est le plus proche de l'allégation marketing. Dans les environnements réels à la première personne, il se classe troisième avec 80,6, derrière Lyra 2.0 à 84,4 et AlayaWorld à 83,0. L'avantage du modèle dans la même évaluation se concentre dans les environnements stylisés et à la troisième personne — 77,2 en stylisé à la première personne, 79,0 en réel à la troisième personne, 76,3 en stylisé à la troisième personne. Si vous développez pour une incarnation photoréaliste à la première personne, le classement qui devrait vous importer est celui où Odyssey-3 n'est pas en tête.
Troisièmement, la disponibilité. « Research preview » porte vraiment tout le poids dans cette phrase. Il n’y a pas de page de tarifs, pas de documentation sur les limites de débit, ni de clé en libre-service. Si vous voulez intégrer cela dans un produit, vous êtes dans une file d’attente.
En le comparant sans second contrat
Voici le problème pratique avec un lancement comme celui-ci : Odyssey-3 est la chose la plus intéressante en matière de génération vidéo cette semaine, et vous ne pouvez toujours pas l'appeler. Les modèles par rapport auxquels vous l'évalueriez vraiment, c'est une autre histoire.
OrcaRouter n'héberge pas Odyssey-3, et il n'existe aucun prix public à répercuter, même si c'était le cas. Ce qu'une clé permet d'atteindre, c'est le reste de l'ensemble de comparaison — minimax/minimax-h3 à 0,08 $ par seconde de vidéo générée en 768P, la gamme vidéo Kling, et plus de 200 modèles derrière un seul point de terminaison — au prix catalogue du fournisseur avec 0 % de majoration, de sorte qu'un changement de prix d'un fournisseur apparaît sur votre facture le jour même plutôt qu'au prochain renouvellement. Le basculement automatique entre fournisseurs signifie qu'une campagne d'évaluation ne s'arrête pas parce qu'un amont connaît une mauvaise après-midi, et le DSL de routage vous permet de placer plusieurs modèles derrière une seule interface, de sorte qu'un comparatif direct relève d'un changement de configuration plutôt que d'une seconde intégration. Si Odyssey ouvre une API en libre-service, c'est la forme dans laquelle vous voudrez l'insérer.
Qu'est-ce qui le réglerait
Une exécution indépendante d'Odyssey-3 sur un harnais qu'il n'a pas choisi. Une douzaine de praticiens disposant d'un accès en avant-première décrivant où l'environnement tient bon après une minute de mouvements de caméra agressifs et où il ne tient pas. Un prix. N'importe lequel de ces éléments fait passer ceci d'un lancement solide au rang de point de référence.
Ce qui est déjà vrai est plus étroit et reste néanmoins notable : sur le seul tableau public qui mesure si un modèle génératif comprend la physique plutôt que s’il produit de belles images, un modèle dont la vocation est l’interaction occupe les deuxième et troisième places, à un coût normalisé inférieur à celui du modèle classé premier.
