
Odyssey-3 vs Seedance 2.5 : des secondes de séquences contre des heures de simulation
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Demandez combien coûte Seedance 2.5, et vous obtenez une réponse en dollars par seconde. Demandez combien coûte Odyssey-3, et vous n'obtenez rien du tout — pas de grille tarifaire, pas d'endpoint, pas de licence, car le modèle annoncé le 15 septembre 2026 n'a pas encore été publié et son créateur a seulement promis publiquement qu'il arriverait « dans les semaines à venir ». Cet écart ressemble à une différence de maturité et relève surtout d'une différence de catégorie. Seedance 2.5, publié par l'équipe Seed de ByteDance le 31 juillet 2026, est un moteur de production vendu à la seconde de séquences finies à ceux qui ont besoin de séquences. Odyssey-3 est un modèle du monde doté d'une interface d'action, et l'acheteur auquel il s'adresse ne veut pas du tout de séquences — il veut un environnement qui réagit correctement quand quelque chose agit en son sein. Les deux sont dirigés vers certains des mêmes problèmes, notamment les données de robots et de conduite, ce qui est précisément pourquoi la distinction mérite d'être établie avec soin.
Seedance 2.5 est un moteur de production, et les partenaires du lancement le montrent
La capacité phare, c'est la durée. Seedance 2.5 génère trente secondes en une seule passe, soit le double des quinze secondes de son prédécesseur, avec une extension multi-tours pour des séquences plus longues et un mode bêta ultra-long rapporté qui va encore plus loin. Cela change à lui seul ce à quoi le modèle sert : trente secondes, c'est une scène plutôt qu'un plan, et le marketing de ByteDance s'appuie sur l'expression « one-take » précisément pour cette raison.
Autour de la durée gravitent les fonctionnalités qui rendent une génération exploitable dans un montage réel. Le modèle accepte un référençage multimodal intensif — les rapports l'estiment à jusqu'à trente images, dix clips vidéo et dix clips audio par génération, les références vidéo et audio étant chacune plafonnées à environ trente secondes, et les références audio seules sont nouvelles dans cette version. De nouveaux modes de référence existent pour les rendus en modèle blanc ou en argile, les plaques sur fond vert, le référençage de mouvement et créatif. Le contrôle s'effectue au niveau de l'horodatage, ce qui permet à un prompt de cibler la narration, la caméra ou le mouvement dans une plage temporelle précise, et l'édition au niveau des régions après génération préserve la continuité au lieu de forcer une nouvelle génération. L'audio et la vidéo sont générés conjointement en une seule passe, de sorte que la synchronisation labiale suit les dialogues cités, et plus de dix langues sont prises en charge nativement.
La liste des adoptants est révélatrice. Le jour du lancement, XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei et Qiongche Intelligence ont confirmé des partenariats, et les cas d’usage annoncés vont des données d’entraînement pour l’IA incarnée et des cas limites de la conduite autonome aux vidéos de formation aux SOP industrielles, à l’éducation et à la publicité e-commerce. Une partie de cela relève du travail créatif. Une autre partie est de la génération de données pour des systèmes qui agiront plus tard sur le monde — c’est la partie qui recoupe Odyssey-3.
Combien coûte une seconde de Seedance 2.5
La tarification est publiée, et elle est facturée en tokens plutôt qu’en secondes, ce qui implique une étape de conversion qu’il vaut la peine d’effectuer avant de s’engager. Les chiffres rapportés pour le point de terminaison ModelArk sont de 10,70 $ par million de tokens sans entrée vidéo et de 6,40 $ par million de tokens lorsque l’entrée vidéo est incluse. En pratique, cela revient à environ 0,51 $ pour un clip de cinq secondes en 16:9 à 480p et à environ 1,16 $ pour le même clip à 720p. Il s’agit des tarifs publiés par le fournisseur tels que rapportés au lancement ; considérez-les comme des tarifs catalogue actuels plutôt que comme un coût mesuré par livrable, car la résolution et la durée le font tous deux varier.
La disponibilité a de vrais atouts. L’accès grand public passe par les applications de ByteDance, tandis que l’accès API se répartit entre Volcano Engine Ark en Chine et BytePlus ModelArk à l’international. Au moins un distributeur indique que le modèle n’est pas disponible aux États-Unis, et les sources divergent quant à savoir si les résolutions prises en charge plafonnent à 720p ou s’étendent jusqu’à 1080p — une divergence qu’il vaut la peine de résoudre en se référant à la documentation du fournisseur lui-même avant de concevoir autour d’une résolution.
C'est le genre de modèle où une couche de routage justifie sa place pour une raison précise : les tarifs évoluent. Un prix vidéo par token qui a changé une fois au lancement changera encore, et la différence entre un modèle de coûts fondé sur le chiffre du jour et un modèle fondé sur celui du trimestre dernier, c'est la différence entre une marge et une surprise. OrcaRouter répercute le prix catalogue des fournisseurs avec 0 % de marge, de sorte qu'une baisse consentie par un fournisseur est effective de notre côté le jour même plutôt qu'à la prochaine renégociation de contrat, et le basculement automatique maintient l'avancement d'une file de génération lorsqu'un point de terminaison de fournisseur se dégrade — une préoccupation d'ordonnancement plutôt que théorique sur les charges de travail vidéo. Seedance 2.5 lui-même n'est pas routé par OrcaRouter ; il est servi via les plateformes propres de ByteDance et ses points de terminaison ModelArk.

L'Odyssey-3 ne se vend pas à la seconde
Odyssey-3 n’a pas encore d’unité de vente, et c’est là tout l’intérêt. Il est décrit comme un modèle du monde de fondation capable d’animer des robots, de conduire des voitures, d’entraîner des IA, de piloter des drones et de jouer à des jeux vidéo — un transformer de diffusion autorégressif entraîné sur une vaste collection d’observations visuelles, dont son créateur affirme qu’il produit une compréhension apprise de la physique, de la dynamique, de la causalité et du comportement humain. L’adaptation à une nouvelle tâche se fait en entraînant un décodeur d’actions sur des paires observation-action et en gardant le modèle du monde pré-entraîné figé, de sorte qu’une petite politique lit la représentation figée et émet des commandes motrices.
Les démonstrations, toutes rapportées par les fournisseurs et aucune reproduite de manière indépendante, couvrent six incarnations : des bras robotisés à partir de dizaines d’heures de démonstrations, y compris des comportements de récupération qui ne figuraient pas dans les données ; des politiques humanoïdes construites avec Flexion à partir de dizaines d’heures de téléopération, dont Odyssey affirme qu’elles généralisent mieux que les références VLA testées, sans publier de chiffre ; la conduite en boucle fermée en Inde à partir de vingt heures de données simulées ; le vol de drone en intérieur à partir de données simulées ; des politiques Grand Theft Auto V qui ont été transférées à Red Dead Redemption 2 et Sleeping Dogs sans entraînement supplémentaire, environ deux heures de séquences GTA produisant un mouvement à cheval dans RDR2 ; et la génération d’environnements pour entraîner d’autres IA via les travaux PROWL.
Le seul chiffre concret est 77 % — les politiques de conduite entraînées en simulation parcouraient, entre deux interventions du conducteur de sécurité, une distance représentant environ cette fraction de celle des politiques entraînées sur des images réelles. C’est un chiffre de fournisseur, sans rapport technique ni vérification externe à l’appui.

L'unité de vente détermine ce qui est optimisé
Dès que l’on considère les deux modèles comme des instruments de mesure plutôt que comme des capacités, leurs différences cessent de donner l’impression que l’un est en avance sur l’autre.
Un modèle facturé à la seconde de sortie est optimisé pour une sortie qui satisfait un spectateur. Ce n’est pas une ambition moindre ; c’est une cible différente, avec ses propres problèmes difficiles. Que Seedance 2.5 produise trente secondes cohérentes avec des dialogues synchronisés et un contrôle au niveau de l’horodatage est un résultat véritablement difficile, et les modes de défaillance sur lesquels il est jugé — le visage d’un personnage qui dérive, un raccord qui ne fonctionne pas, une réplique de dialogue désynchronisée — sont ceux qu’une personne dans une salle de montage remarquerait.
Un modèle chargé de prédire ce qui se produit ensuite lorsqu'un contrôleur agit est optimisé pour quelque chose qu'un spectateur ne vérifiera jamais : la capacité de la dynamique à tenir le coup face à une séquence de décisions, y compris des décisions que personne n'a démontrées. C'est pourquoi Odyssey fait état d'un comportement de récupération émergeant de dizaines d'heures de données plutôt que de rendre compte d'une fidélité, et pourquoi sa seule affirmation quantitative est mesurée en interventions de conducteur de sécurité plutôt qu'en qualité visuelle. Un moteur de rendu peut se tromper de manières qu'un public pardonne. Un simulateur peut se tromper de manières sur lesquelles un contrôleur agit, et le second type d'erreur s'accumule au fil d'un rollout.
Le chevauchement des cas d’usage déclarés — données d’entraînement pour robots, cas limites de conduite autonome — est le lieu où ces deux se rencontrent, et c’est une véritable concurrence pour le budget plutôt que pour la position dans les benchmarks. La question à laquelle une équipe de robotique est réellement confrontée est de savoir s’il faut acheter des secondes rendues d’un monde plausible ou acheter un modèle de dynamique avec une interface d’action, et la réponse dépend de si le consommateur en aval est un évaluateur humain ou une boucle d’entraînement.
Côte à côte
• Unité de vente — Seedance 2.5 : jetons, ce qui équivaut à environ 0,51 $ par clip de 5 s en 480p et 1,16 $ en 720p. Odyssey-3 : aucun tarif publié.
• Ce que vous obtenez par unité — Seedance 2.5 : séquences finalisées, jusqu'à 30 s en une seule passe, avec audio et dialogue synchronisés. Odyssey-3 : un état futur prédit du monde ainsi que des actions motrices pour le matériel associé.
• Entrées — Seedance 2.5 : texte plus jusqu'à ~30 images, 10 vidéos et 10 clips audio. Odyssey-3 : un décodeur d'actions entraîné sur des paires observation-action, au-dessus d'un backbone gelé.
• Contrôle de l'édition — Seedance 2.5 : ciblage au niveau des horodatages et retouches post-génération au niveau des régions. Odyssey-3 : non applicable ; il n'existe aucune surface d'édition.
• Partenaires déclarés — Seedance 2.5 : XCMG, XPeng et trois autres au lancement. Odyssey-3 : Flexion sur les politiques en matière d'humanoïdes ; aucun client commercial annoncé.
• Disponibilité — Seedance 2.5 : déployé depuis le 31 juillet 2026, sous réserve de restrictions régionales. Odyssey-3 : annoncé le 15 septembre 2026, sortie publique « dans les prochaines semaines », sans date ni prix.
Lequel appartient à votre stack
Si le livrable est une vidéo qu’une personne regardera, Seedance 2.5 est un produit commercialisé avec un prix publié et un large éventail de fonctionnalités, et la décision est une décision classique entre construire et acheter — avec deux réserves à vérifier au préalable : si les résolutions dont vous avez besoin sont réellement disponibles sur le point de terminaison auquel vous pouvez accéder, et si votre région est desservie tout court. Sa durée plus longue en un seul passage et son contrôle des horodatages sont les fonctionnalités qui modifient le plus le flux de travail, car elles suppriment des étapes d’assemblage plutôt que d’améliorer une image.
Si le livrable est une politique entraînée ou un contrôleur, Seedance 2.5 ne constitue pas un substitut, quelle que soit la qualité des images, et Odyssey-3 cible votre problème sans rien à acheter. L’affirmation qui mérite d’être suivie, c’est le backbone gelé : un seul modèle pré-entraîné pilotant des bras, des humanoïdes, une voiture, un drone et trois jeux via un petit décodeur est une déclaration sur la quantité de compréhension physique qui se transfère entre incarnations, et si elle tient, elle change ce qu’une équipe de robotique doit collecter. Personne en dehors d’Odyssey ne l’a testée, et il n’existe ni rapport technique, ni licence, ni prix.
Ce qu'il faut surveiller n'a rien de glamour : pour Seedance 2.5, un prix stabilisé et une communication claire sur la disponibilité régionale ; pour Odyssey-3, un dépôt, une licence et un tiers qui reproduit les 77 %. Tant que la seconde liste n'existe pas, la différence entre ces deux modèles n'est pas la qualité. C'est que l'un est un produit, et l'autre un argument.

OrcaRouter garde plus de 200 modèles derrière une seule clé API, donc le modèle vidéo que vous choisissez n'est pas le seul que vous pouvez appeler.
