
Odyssey-3 contre Runway Gen-4.5 : deux paris sur les deux mêmes mots
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Ce qui est intéressant, quand on met en regard Odyssey-3 et Runway Gen-4.5, c'est que les deux entreprises s'accordent sur la destination et divergent sur le chemin. Toutes deux affirment que l'objectif est un modèle du monde général — un système appris qui simule la réalité assez bien pour être utile. La position de Runway, énoncée sans détour par son directeur technique, est qu'on y parvient en construisant d'abord un très bon modèle vidéo, parce qu'apprendre à un réseau à prédire directement les pixels est la voie la plus prometteuse vers la simulation générale. La position d'Odyssey, visible dans chaque choix d'architecture qu'elle a publié à propos d'Odyssey-3, est que les pixels sont le sous-produit et que la dynamique est l'essentiel. Gen-4.5 est l'expression actuelle la plus forte du premier pari. Odyssey-3, annoncé le 15 septembre 2026 et promis pour une sortie publique « dans les semaines à venir », est le second pari, formulé sous la forme d'un modèle complet. Lus côte à côte, ce ne sont pas vraiment des concurrents — ce sont deux réponses à la même question, et cette question est de savoir si la route vers un modèle du monde passe par le rendu.
Le pari de Runway : gagner le modèle du monde par le rendu
Runway n'a pas adopté tardivement ou par accident le prisme du modèle du monde. Runway propose un modèle qualifié de modèle général du monde — GWM-1, décrit comme conçu pour la simulation de la réalité en temps réel, interactif et contrôlable — et le traite comme la couche située au-dessus de ses modèles vidéo plutôt que comme leur remplacement. Le raisonnement suit une échelle : le même signal d'entraînement qui rend un modèle capable de maintenir une scène cohérente pendant dix secondes est celui qui lui apprend comment les objets persistent, comment la lumière se comporte, comment le mouvement se poursuit. Une fois suffisamment bon sur les pixels, la simulation générale en découle.
Gen-4.5 est l’échelon actuel. Annoncé le 1er décembre 2025 et déployé auprès des abonnés payants à partir du 12 décembre, c’est un modèle texte-vers-vidéo et image-vers-vidéo doté des qualités sur lesquelles Runway a bâti sa réputation : qualité du mouvement, fidélité au prompt, cohérence des personnages et des sujets, et contrôle de la caméra. Ses limites sont énoncées aussi clairement que ses atouts. Les clips durent de deux à dix secondes — dix est le plafond, pas la valeur par défaut. La sortie est en 720p à 24 ou 25 images par seconde sur six formats d’image. Il n’y a pas de piste audio ni de storyboard multi-plans ; une séquence est quelque chose que l’on assemble à partir de générations distinctes. C’est un moteur de rendu, et c’est un très bon, ce qui est exactement la promesse que sa société mère a besoin qu’il soit.
Quel est le coût de Gen-4.5 et comment la tarification est-elle structurée ?
Runway fixe le prix de Gen-4.5 à 12 crédits par seconde de vidéo générée. Les crédits se vendent à un cent pièce, donc le chiffre à retenir est de 0,12 $ par seconde : un clip de cinq secondes coûte 0,60 $, un clip de dix secondes, 1,20 $. Les options de sortie entraînent des suppléments sur l’API — les séquences ProRes ou PNG ajoutent cinq crédits par seconde, et le HDR ajoute vingt par seconde, passant à quarante au-delà d’environ quatre mégapixels. Il s’agit de tarifs catalogue du fournisseur, et l’écart compte plus que le prix d’appel : un clip HDR de dix secondes coûte plus de trois fois le prix d’un clip ordinaire, donc un modèle de coûts fondé sur 0,12 $/seconde est faux dès que le HDR entre dans les spécifications du livrable.
Deux détails structurels méritent d'être connus avant d'établir votre budget. Les crédits API et les crédits d'abonnement à l'application sont des soldes distincts — un forfait Standard, Pro ou Max ne couvre pas les générations via l'API — et l'API est asynchrone : une tâche est soumise puis interrogée par polling, plutôt que renvoyée directement dans la réponse. Ni l'un ni l'autre n'est une critique ; ce sont deux choses que les équipes découvrent après s'être engagées dans une intégration. L'API donne aussi accès à des modèles vidéo tiers aux côtés de ceux de Runway, ce qui signifie qu'une seule clé Runway peut atteindre bien plus que le catalogue de Runway si vous le souhaitez.

Le pari d'Odyssey : l'important n'est pas l'image
Odyssey-3 est décrit par son créateur comme un modèle de monde fondationnel capable d'animer des robots, de conduire des voitures, d'entraîner des IA, de piloter des drones et de jouer à des jeux vidéo. Sur le plan architectural, il s'agit d'un transformer de diffusion autorégressif entraîné sur une vaste collection d'observations visuelles, et Odyssey affirme que le résultat porte une compréhension apprise de la physique, de la dynamique, de la causalité et du comportement humain. Le détail qui révèle le pari, c'est la manière dont les tâches sont adaptées : plutôt que d'affiner le modèle, Odyssey y attache un décodeur d'actions entraîné sur des paires observation-action et maintient le modèle de monde préentraîné figé de bout en bout. Une petite politique lit la représentation interne du modèle figé et la transforme en commandes motrices.
Cette conception n’a de sens que si vous croyez que la représentation — et non l’image rendue — est l’atout. Les démonstrations le confirment à travers six incarnations, toutes rapportées par le fournisseur. Des bras robotiques à partir de dizaines d’heures de démonstrations, y compris des comportements de récupération que personne n’a mis dans les données, comme réorienter un préhenseur après une prise manquée. Des politiques humanoïdes construites avec Flexion à partir de dizaines d’heures de données de téléopération, qui, selon Odyssey, généralisent mieux que les références VLA qu’elle a testées, sans publier de chiffres. Conduite en boucle fermée en Inde à partir de vingt heures de données simulées. Vol de drone en intérieur à partir de données simulées. Des politiques Grand Theft Auto V qui ont été transférées à Red Dead Redemption 2 et Sleeping Dogs sans entraînement supplémentaire dans ces titres — environ deux heures de séquences de GTA ont suffi pour les déplacements à cheval dans RDR2. Et la génération d’environnements pour entraîner d’autres IA, liée aux travaux d’apprentissage par renforcement PROWL d’Odyssey.
Un chiffre est publié. Odyssey rapporte que les politiques de conduite entraînées en simulation parcouraient, entre les interventions du conducteur de sécurité, environ 77 % de la distance parcourue par les politiques entraînées sur des séquences réelles. Aucune affirmation du paragraphe ci-dessus n’a été reproduite, il n’existe aucun rapport technique et aucun tiers n’a fait tourner le modèle. L’étendue sur six incarnations est l’affirmation intéressante ; l’absence de tableau de référence est la raison de la prendre avec prudence.

Là où les deux paris deviennent testables
Un désaccord sur la stratégie n’est utile que s’il produit une prédiction, et celui-ci en produit une. Si Runway a raison — si la fidélité de rendu est la voie — alors la qualité de la physique d’un modèle vidéo devrait s’améliorer en fonction de sa performance en vidéo, et les deux classements devraient évoluer ensemble. Si Odyssey a raison, il devrait y avoir des cas où un modèle qui produit de magnifiques rendus est inutile et où un modèle qui produit des rendus grossiers est utile, car la propriété utile est de savoir si l’état suivant est suffisamment prévisible pour qu’un contrôleur puisse agir dessus.
Il y a déjà un indice de quel côté cela penche, et cela ne flatte aucun des deux camps. La liste que Runway dresse elle-même des faiblesses de Gen-4.5 — dont la physique — rappelle qu'un moteur de rendu est optimisé pour convaincre un spectateur, et qu'un spectateur est indulgent là où une boucle de contrôle ne l'est pas. Pendant ce temps, le seul chiffre publié par Odyssey, 77 % de la performance de conduite sur séquences réelles, est une perte par rapport aux données réelles, pas une victoire. Aucune des deux entreprises ne prétend que le chemin est terminé. Ce qui diffère, c'est ce que chacune d'elles mesure.
Là où les paris divergent véritablement, c'est l'incarnation. Rien dans la conception ou la tarification de Gen-4.5 n'envisage un espace d'action ; c'est une fonction du texte ou d'une image vers un clip. Rien dans les éléments d'Odyssey-3 n'envisage un fichier livrable ; c'est une fonction d'un état du monde et d'une action vers l'état du monde suivant. Ce sont des produits différents avec des acheteurs différents, et aucun progrès d'un côté ou de l'autre ne convertit l'un en l'autre, parce que c'est l'interface qui diffère.
Côte à côte
• De quoi il s'agit — Runway Gen-4.5 : un moteur de rendu texte-vers-vidéo et image-vers-vidéo. Odyssey-3 : un modèle du monde qui prédit les états suivants et émet des actions motrices.
• Comment vous le pilotez — Runway Gen-4.5 : un prompt ou une image fixe, via une API asynchrone. Odyssey-3 : un décodeur d'action plus une petite politique qui lit un backbone figé.
• Sortie — Runway Gen-4.5 : clips de 2 à 10 s, 720p, 24/25 ips, six formats d'image, pas d'audio. Odyssey-3 : aucun livrable rendu ; états simulés à travers six incarnations.
• Prix — Runway Gen-4.5 : 12 crédits par seconde, 0,12 $/seconde, plus 5 crédits/seconde pour ProRes ou PNG et 20 pour HDR (liste du fournisseur). Odyssey-3 : non publié, sans conditions commerciales annoncées.
• Maturité — Runway Gen-4.5 : présent sur le marché depuis décembre 2025, avec une API établie et une couverture par des tiers. Odyssey-3 : annoncé le 15 septembre 2026, sortie publique « dans les semaines à venir ».
• Preuves — Runway Gen-4.5 : huit mois de productions publiques. Odyssey-3 : un seul chiffre fourni par l'éditeur, aucune exécution indépendante.
Aucun de ces deux n’est sur notre clé, et c’est la version honnête.
OrcaRouter ne route ni l'un ni l'autre de ces modèles, et cet article ne prétendra pas le contraire : Runway Gen-4.5 est servi via l'API propre à Runway, et Odyssey-3 n'a pas d'endpoint du tout. Ce à quoi l'angle du routage est réellement utile dans une comparaison comme celle-ci, c'est le pipeline qui les entoure. Un workflow Gen-4.5 réaliste n'est pas un seul modèle — c'est un modèle de prompt qui développe un brief, un modèle d'image qui produit la première image, le modèle vidéo lui-même, et un élément en aval pour noter ou légender la sortie. Composer tout cela en un seul appel via le DSL de routage, avec une seule clé, au prix catalogue du fournisseur, avec 0 % de marge, c'est la partie de la stack dont OrcaRouter peut réellement vous décharger aujourd'hui. Le basculement automatique compte ici pour une raison banale : les API vidéo asynchrones interrogent en boucle, les files d'attente s'accumulent, et un pipeline qui se bloque sur un endpoint dégradé se bloque jusqu'au livrable.
Lorsqu’Odyssey-3 sera enfin commercialisé, la question du routage sera différente et plus difficile. Un modèle dont l’argument de vente est qu’il s’exécute sur du matériel que vous possédez n’est pas vraiment, a priori, un candidat au routage, et la question intéressante pour un routeur sera ce qui l’entoure — l’outillage sim-to-real, l’entraînement des politiques, l’évaluation — plutôt que l’appel au modèle lui-même.
Savoir qui a raison est une question de 2027
Si vous avez besoin de vidéo ce trimestre, Gen-4.5 est la réponse et il n’y a rien à peser : son prix est établi, il est documenté et utilisé publiquement depuis huit mois, et à 0,12 $ par seconde, le coût pour savoir s’il convient à votre travail est faible. Prévoyez un budget pour les frais supplémentaires et pour le solde de crédits API distinct, et considérez le plafond de dix secondes comme une contrainte de conception ferme plutôt que comme un chiffre que vous contournerez.
Si vous construisez un contrôleur — tout ce où un modèle appris doit indiquer au matériel quoi faire ensuite —, Gen-4.5 n’entre pas dans la conversation, à aucun prix, et Odyssey-3 est celui qui vise votre problème sans qu’il soit possible de l’obtenir. La raison concrète de s’y intéresser est le résultat du squelette gelé : si un seul modèle pré-entraîné peut piloter des bras, des humanoïdes, une voiture, un drone et trois jeux via un petit décodeur, cela dit quelque chose sur la quantité de compréhension physique qui se transfère, et c’est l’affirmation qui ferait des modèles du monde une couche de fondation plutôt qu’une politique par tâche. La raison concrète d’attendre est que personne en dehors d’Odyssey ne l’a exécuté.
Quoi surveiller, dans l'ordre : un rapport technique, puis une licence, puis un tiers qui reproduit le chiffre de 77 % sur son propre matériel. La route de Runway et celle d'Odyssey aboutissent toutes deux à un modèle général du monde. Une seule d'entre elles possède actuellement un péage devant lequel on peut se présenter.

Acheminez le modèle de prompt, le modèle d'image et le modèle vidéo via un point de terminaison unique avec basculement automatique plutôt que trois intégrations distinctes.
