
Aperçu d’Odyssey-3 : le World Model d’Odyssey passe de l’observation du monde à l’action en son sein
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Odyssey-3 est le plus récent modèle de monde de fondation d'Odyssey, présenté en avant-première par l'entreprise le 15 septembre 2026 et décrit dans sa propre annonce comme un modèle destiné à faire fonctionner « des robots, conduire des voitures, entraîner des IA, piloter des drones et même jouer à des jeux vidéo ». Ce qui rend cet aperçu digne d'une lecture attentive n'est pas la liste des corps — c'est le mécanisme. Odyssey-3 est un transformer de diffusion autorégressif entraîné à simuler divers scénarios à partir d'observations visuelles, et l'entreprise y attache un décodeur d'action appris, un composant qui traduit la représentation interne qu'a le modèle d'une scène en commandes motrices dont un matériel spécifique a besoin. C'est la différence entre un modèle qui génère un clip plausible d'un bras robotique et un modèle auquel on demande d'en déplacer un. Odyssey appelle la classe de systèmes que cela permet « agents physiques » — des modèles qui, selon la formule de l'entreprise, « parlent la langue du monde ». Si cette formulation semble proche de l'étiquette « physics agent » qui circule dans la couverture de l'aperçu, c'est une lecture raisonnable de la même affirmation, bien que ce ne soit pas la formule d'Odyssey et qu'à ce stade, il s'agisse d'une description d'intention plutôt que d'un résultat mesuré.
Ce qu’Odyssey a réellement annoncé
Le post est un aperçu, pas un lancement. Odyssey dit qu’elle « a hâte de le publier publiquement dans les semaines à venir » et ne cite aucune date, aucun prix ni aucun canal d’accès. Aucun rapport technique Odyssey-3 n’est lié depuis l’annonce — le seul article vers lequel la page renvoie est PROWL-1, les travaux d’apprentissage par renforcement de l’entreprise, et le seul PDF est celui de Starchild-1. Cette absence mérite d’être signalée clairement, car elle conditionne tout ce qui suit : chaque affirmation de capacité dans cet article est celle d’Odyssey, non reproduite, et aucun tiers n’a encore publié de chiffre pour Odyssey-3 qui n’ait pas été fourni par Odyssey.
Ce que le post précise bel et bien, c’est l’architecture et une philosophie d’entraînement. Le modèle est un transformer de diffusion autorégressif. Il est entraîné sur l’observation visuelle du monde plutôt que sur des étiquettes spécifiques à une tâche, ce qui, selon Odyssey, lui confère une compréhension apprise de « la physique, la dynamique, les relations de cause à effet, les comportements humains » — et, dans sa présentation, une exigence de données inférieure à celle des systèmes qui n’ont pas été préentraînés de cette façon. Le pari sous-jacent est celui que fait tout le domaine des modèles du monde : prédire à grande échelle l’état suivant d’une scène force un modèle à intérioriser le comportement réel des objets physiques, car un modèle qui se trompe sur la physique sombre dans l’incohérence au fil d’un long déroulé et ne peut pas se rattraper.

Une colonne vertébrale, six carrosseries
La preuve la plus concrète dans l’annonce est la prolifération d’incarnations pilotées par le même modèle de fondation. Odyssey rapporte :
• Bras robotisés — ont appris à contrôler une variété de bras et à accomplir des tâches complexes à partir de « seulement quelques dizaines d’heures de démonstrations robotiques », y compris des comportements de récupération qui n’étaient pas du tout dans les démonstrations, comme réorienter une pince après une prise manquée.
• Humanoïdes — travail réalisé avec Flexion, avec des politiques reposant sur des dizaines d'heures de données de téléopération humanoïde exécutées en temps réel, qu'Odyssey affirme s'être généralisées aux changements d'éclairage mieux que les références vision-langage-action sur lesquelles elle s'est testée.
• Conduite — un backbone gelé produisant des waypoints en temps réel pour la conduite en boucle fermée, entraîné sur « seulement 20 heures de données de conduite simulée ».
• Drones — vol intérieur avec évitement d’obstacles à partir de dizaines d’heures de données de vol simulé, ainsi que des rollouts qualitatifs avec le backbone gelé.
• Jeux vidéo — sessions prolongées sur Grand Theft Auto V, avec transfert vers Red Dead Redemption 2 et Sleeping Dogs sans aucun entraînement de politique supplémentaire dans ces titres.
• Environnements d'entraînement pour l'IA — mondes générés servant de terrains d'entraînement à d'autres agents, liés aux travaux sur PROWL-1.
Le schéma que dessinent ces lignes est la véritable affirmation : non pas qu’Odyssey-3 excelle sur l’une d’entre elles, mais qu’un seul ensemble de poids, avec un petit adaptateur de sortie appris, les atteint toutes. Un modèle généraliste de la dynamique du monde est un atout très différent d’une politique propre à chaque robot, et c’est la raison pour laquelle la preview a fini là où elle a fini.
Le seul chiffre, et ce qu’il ne prouve pas
Odyssey publie exactement un chiffre comparatif pour Odyssey-3 : les politiques de conduite entraînées purement en simulation, en utilisant les mêmes 20 heures de données simulées, ont parcouru, entre les interventions du conducteur de sécurité, environ 77 % de la distance parcourue par les politiques entraînées sur des séquences réelles. C'est un chiffre sim-to-real, et c'est un chiffre vraiment intéressant — combler ne serait-ce qu'une partie de l'écart entre une conduite entraînée en simulation et une conduite entraînée sur des données réelles est la partie difficile du problème. C'est aussi le seul chiffre de l'article.
Il n’y a aucun tableau de précision, aucun taux de réussite, aucun benchmark intercorps, ni aucune comparaison avec un autre modèle du monde nommé sur une évaluation commune. La carte de pied de page de cette page affirme qu’Odyssey-3 fait progresser « l’état de l’art en matière de précision physique des modèles du monde », mais rien sur la page ne l’étaye par un chiffre. Odyssey mentionne aussi un partenariat d’évaluation avec Poke & Wiggle couvrant « différents corps, points de vue et contrôles » — et ne publie encore aucun résultat issu de celui-ci. Tout ici est une affirmation de fournisseur, et le chiffre de 77 % doit être lu exactement comme telle jusqu’à ce qu’un tiers le reproduise.
Ce que signifie le tableau de benchmark manquant
Il serait facile de voir dans l'absence de benchmarks un signal d'alarme. Il est plus juste d'y voir l'état du domaine. Les modèles du monde n'ont pas encore l'équivalent d'un MMLU ou d'un GPQA — une évaluation partagée, peu coûteuse et largement reconnue, sur laquelle tout le monde s'aligne. La façon dont Odyssey présente les choses reconnaît elle-même le problème d'échelle par l'autre bout : l'article indique que les modèles du monde de pointe restent « environ deux ordres de grandeur derrière les modèles de langage ». Quand la norme d'évaluation n'est pas elle-même stabilisée, un article de présentation qui met en avant l'architecture et l'éventail des incarnations plutôt qu'un tableau de scores décrit honnêtement la frontière, et le lecteur devrait considérer les affirmations qualitatives comme indicatives plutôt que définitives. Le partenariat Poke & Wiggle est ce qu'il faut surveiller : une évaluation croisant différents corps et points de vue, avec des chiffres publiés, constituerait la première lecture indépendante de tout cela.

« Dans les semaines à venir » est le véritable titre.
Pour quiconque doit prendre une décision ce trimestre, la phrase déterminante dans l’annonce est celle sur la disponibilité. Odyssey-3 n’est pas en disponibilité générale, n’a pas de prix publié, n’a pas de documentation d’API et n’a pas de date annoncée — juste « les semaines à venir ». Cela le place dans une catégorie différente de celle d’un modèle que vous pouvez évaluer aujourd’hui. Cela signifie aussi que les pages de comparaison qui seront inévitablement écrites à son sujet sont, pour l’instant, des comparaisons entre un produit commercialisé et un aperçu de recherche, ce qui est une véritable distinction, et non un détail technique : un aperçu peut être excellent et ne pas pour autant être quelque chose que l’on peut mettre dans un pipeline dès lundi.
Il y a une deuxième raison pour laquelle le moment choisi compte. Odyssey a levé une série B de 310 M$ sur une valorisation de 1,45 Md$, AWS devenant son fournisseur cloud préféré — l’entreprise dispose de la puissance de calcul nécessaire pour faire progresser un modèle du monde à la pointe, et un aperçu qui arrive des mois avant une version publique, c’est ainsi que ce travail est dévoilé. Lisez l’annonce comme une déclaration de trajectoire plutôt que de capacité.
Que faire avec ceci si vous construisez aujourd’hui
Odyssey-3 lui-même n'est pas quelque chose que vous pouvez appeler, et OrcaRouter ne le sert pas — aucune couche de routage ne le fait, car il n'y a encore rien vers quoi router. Ce qui vaut la peine d'être fait maintenant, c'est de séparer la décision en deux parties. La première partie est le modèle du monde, et pour cela la réponse honnête est d'attendre la sortie publique et la première évaluation indépendante. La deuxième partie est tout ce qui l'entoure : le modèle de langage qui transforme une tâche en quelque chose qu'une politique peut consommer, le modèle de vision qui lit une scène, le modèle de transcription qui étiquette une démonstration enregistrée. Cette pile environnante relève du travail routé ordinaire, et elle est disponible dès aujourd'hui sur une seule API couvrant plus de 200 modèles au prix catalogue du fournisseur, avec 0 % de marge, avec un basculement automatique lorsqu'un fournisseur se dégrade. La raison de router cette couche maintenant plutôt que plus tard, c'est qu'il s'agit de la couche que vous ferez encore tourner lorsque Odyssey-3 sortira, et changer de modèle d'invite est une modification de configuration, alors que réécrire une intégration ne l'est pas.
Il vaut également la peine de garder la question du modèle du monde ouverte de la manière la plus économique possible. Lorsqu’un modèle comme Odyssey-3 atteint un fournisseur routé, il apparaît au prix catalogue du fournisseur le jour même, donc l’essayer coûte un appel API plutôt qu’un contrat. Construire le pipeline environnant afin qu’un nouveau modèle puisse y être intégré est la préparation pratique pour une frontière encore mouvante.
Qu'est-ce qui changerait la lecture ?
Trois choses transformeraient cet aperçu en un fait établi. Un rapport technique publié avec l’architecture et les détails d’entraînement permettrait à des groupes extérieurs de reproduire quoi que ce soit. Un premier benchmark indépendant — idéalement les travaux cross-body de Poke & Wiggle — remplacerait l’affirmation du fournisseur par un chiffre mesuré par quelqu’un d’autre. Et une version publique datée et tarifée ferait de toute comparaison avec Odyssey-3 une comparaison entre deux choses qu’un lecteur peut réellement exécuter.
Jusque-là, le résumé défendable est le suivant : Odyssey-3 est une prétention crédible à une chose véritablement difficile — un seul modèle du monde, de nombreux corps, le contrôle plutôt que le rendu — de la part d’un laboratoire bien financé avec des antécédents dans le domaine, présenté avec presque aucun chiffre et aucune date de disponibilité. Voilà à quoi ressemble un aperçu de pointe. Considérez les affirmations de capacités comme indicatives, l’architecture comme la partie intéressante, et la date de sortie comme la seule ligne qui modifie vos plans.

