
Odyssey-3 vs Wan 3.0 : un modèle du monde rencontre une usine à vidéos
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Odyssey-3 et Wan 3.0 sont tous deux classés sous « modèle vidéo », et cette étiquette commune porte plus de poids qu’elle ne peut en supporter. Odyssey-3 est un système dynamique appris — un simulateur qui construit un environnement à partir d’un prompt et prédit comment cet environnement évolue lorsqu’on s’y déplace ou déclenche un événement — publié par Odyssey le 8 octobre 2026 en tant qu’aperçu de recherche. Wan 3.0 est un générateur vidéo de production d’Alibaba Cloud, en disponibilité générale depuis son lancement le 24 août 2026, facturé à la seconde, et déjà évalué sur deux classements indépendants. L’un de ces deux veut être un endroit où l’on place une caméra. L’autre veut être ce qui effectue le rendu des séquences que vous publiez.
Mettez les deux pages de lancement côte à côte et la fracture saute aux yeux. Odyssey mise d'abord sur la précision physique — la capacité de son modèle à comprendre ce que font les objets lorsqu'ils entrent en contact. Alibaba mise d'abord sur le débit, la durée et le contrôle des références : des prises de 30 secondes, un son natif, jusqu'à dix images et cinq vidéos fournies par génération. Ni l'un ni l'autre n'est une version dégradée de son concurrent. Ce sont des réponses à des questions différentes, et ces réponses changent ce qu'une équipe devrait faire cette semaine.
Une note de cadrage avant les chiffres. La plupart des chiffres de cet article proviennent des documents de lancement des fournisseurs eux-mêmes et n’ont été reproduits par personne en dehors de ces laboratoires. Lorsqu’un chiffre provient d’une instance indépendante plutôt que d’une page de presse, le texte le précise. Cette distinction compte plus que d’habitude ici, car les deux modèles publient des quantités radicalement différentes d’informations vérifiables — l’un est vendu à la seconde sur une API ouverte, l’autre n’a pas publié de prix du tout.
Ce que chacun est réellement
La propre description d'Odyssey-3 par Odyssey est inhabituellement précise pour un billet de lancement, et mérite d'être citée plutôt que résumée : il s'agit d'« un système dynamique appris, implémenté sous la forme d'un transformer de diffusion autorégressif, qui prédit comment les objets se déplacent et interagissent dans l'espace et comment les situations évoluent au fil du temps ». Ce qu'il renvoie n'est pas un clip au sens ordinaire. C'est un état qui ne cesse d'évoluer tant qu'il est piloté. Le modèle est proposé en deux tailles — Odyssey-3 en 832×480 et Odyssey-3 Pro en 1280×720 — et Odyssey indique que sa préversion prend en charge la navigation à la première et à la troisième personne ainsi qu'un mouvement de caméra indépendant. Cette version inclut également une variante distillée à quelques étapes, produite par une combinaison de correspondance de distribution et de distillation adversariale, que le fournisseur décrit comme interactive en temps réel.
Wan 3.0 est un générateur sur le modèle établi : une invite et une ou plusieurs références en entrée, une vidéo finie en sortie. Les capacités phares d'Alibaba sont une génération de 30 secondes en un seul passage, un audio natif et des entrées de référence couvrant le texte, l'image, la vidéo et l'audio — ainsi que des documents aux formats doc, xls, ppt, pdf, md, txt, key, pages et numbers, jusqu'à 100 Mo et 50 pages. Le montage est piloté par des instructions, ce qui signifie qu'une génération peut être modifiée au niveau des visuels, du scénario ou des dialogues sans être régénérée à partir de zéro. Alibaba déclare aussi clairement que la qualité audio et l'exactitude des textes à l'écran demandent encore du travail, un aveu plus rare qu'il ne le devrait dans une publication de lancement, et qu'il est utile d'avoir officiellement consigné.
• Ce qu’est la sortie — un environnement simulé dans lequel vous agissez (Odyssey-3), contre un clip rendu que vous publiez (Wan 3.0) • Tailles annoncées — 832×480, ou 1280×720 sur Odyssey-3 Pro, contre 480p, 720p et 1080p • Durée d’une exécution unique — aussi longtemps que l’environnement continue d’être piloté, contre 30 secondes par génération • Audio — pas une capacité phare pour l’une ou l’autre taille, contre un audio natif avec des limites de qualité signalées par le fournisseur • Entrées — un prompt qui définit l’environnement, contre du texte, des images, des vidéos, de l’audio et des documents jusqu’à 100 Mo et 50 pages • Modèle d’édition — modifier l’état et relancer la simulation, contre des modifications par instructions apportées à une génération terminée • API documentée — aucune publiée, contre une API ouverte et facturée à l’usage depuis le 24 août 2026 • Prix publié — aucun, contre 0,3 / 0,6 / 1,2 yuan par seconde en 480p / 720p / 1080p
Ce que coûte une seconde de sortie, et pourquoi les unités ne concordent pas
Wan 3.0 est facturé dans l'unité la plus lisible pour un acheteur : le temps. Les tarifs d'Alibaba sont de 0,3 yuan (environ 0,05 $) par seconde de vidéo générée en 480p, 0,6 yuan (environ 0,10 $) en 720p, et 1,2 yuan (environ 0,20 $) en 1080p. Une séquence complète de 30 secondes revient donc à près de 9 yuan (1,50 $) en 480p, 18 yuan (3,00 $) en 720p, ou 36 yuan (6,00 $) en 1080p. Il s'agit des tarifs de lancement d'août ; la promotion de lancement qui les réduisait de 30 % n'a couru que jusqu'au 23 septembre, de sorte que les chiffres ci-dessus sont ceux qu'un acheteur rencontre aujourd'hui. Les fournisseurs qui revendent Wan 3.0 indiquent généralement des tarifs à la minute, qu'il vaut la peine de comparer au calcul à la seconde avant de valider un budget.
Odyssey-3 n'a pas de chiffre comparable, car Odyssey n'a publié ni prix, ni grille tarifaire, ni licence, ni documentation d'API. Ce qui existe à la place, c'est un chiffre de coût à l'intérieur d'un benchmark tiers, calculé sur une hypothèse que le fournisseur énonce ouvertement : 1 $ par heure-GPU MI355X. Sur cette base, Physics-IQ Verified indique Odyssey-3 Pro à 0,267 $ par vidéo générée et Odyssey-3 à 0,139 $, tous deux normalisés à 24 FPS et à une sortie de 1280 de large. Le même tableau note séparément que la réécriture de prompt via l'API d'Odyssey est estimée à 0,01 $ par vidéo soumise. Lisez bien cela — c'est une base de modélisation, pas un prix. Cela vous indique ce que coûterait une simulation au tarif matériel supposé du fournisseur, pas ce qu'Odyssey facturera.
Ces deux faits pointent dans des directions opposées pour un acheteur. Wan 3.0 est un poste facturé à l’usage dont le pire scénario peut être calculé avant même que quoi que ce soit ne soit rendu. Odyssey-3 a un coût modélisé par vidéo inférieur et aucune facture à laquelle l’attacher — ce qui est précisément l’étape où une conversation d’achat s’arrête. Pour qu’une comparaison soit équitable, le lecteur doit tenir les deux moitiés : un tarif réel avec une facture réelle, et un tarif estimé sans rien derrière lui pour l’instant.

Le seul tableau de scores qu'ils partagent, et le nom qui y manque
Physics-IQ Verified, un classement dynamique d'Anates Labs et DeepMind sur la capacité des modèles vidéo à appréhender les principes physiques, est le seul tableau indépendant que ce duo ait en commun — et c'est là que la comparaison devient vraiment intéressante, car c'est aussi là qu'elle s'effondre.
Le post de lancement d'Odyssey indique qu'Odyssey-3 Pro « établit un nouvel état de l'art sur le benchmark de Physics-IQ Verified, et se classe 1er dans 3 des 4 catégories de WorldMark ». Le volet WorldMark de cette affirmation se vérifie dans les chiffres publiés par Odyssey : première place en First-Person Stylized (77,2), Third-Person Real (79,0) et Third-Person Stylized (76,3), First-Person Real étant deuxième à 80,6 derrière les 83,0 d'AlayaWorld et les 84,4 de Lyra 2.0. Chacun de ces chiffres est une donnée rapportée par le fournisseur, issue de la propre campagne d'évaluation d'Odyssey.
La moitié « état de l'art » est celle où le lecteur devrait ralentir. Sur la version du tableau Physics-IQ Verified disponible actuellement, classée par amélioration nette en points de pourcentage au-dessus de la moyenne du track, FLUX 3 [large] de Black Forest Labs occupe le rang 01 avec +12,27 pp. Odyssey-3 Pro est au rang 02 avec +11,15 pp, et Odyssey-3 est au rang 03 avec +9,99 pp. Ainsi, le « nouvel état de l'art » du fournisseur se trouve, sur le tableau que le fournisseur lui-même cite, à la deuxième place — soit parce que l'affirmation précède une mise à jour du tableau, soit parce qu'elle est circonscrite plus étroitement que ne le suggère la phrase. Dans tous les cas, la lecture honnête est qu'Odyssey-3 Pro est un modèle physique parmi les trois premiers, et non un leader incontesté. FLUX 3 [large] affiche également un coût par vidéo bien plus élevé, de 0,868 $, contre 0,267 $ pour Odyssey-3 Pro, ce qui est le compromis que la vue des coûts du tableau a pour fonction d'exposer.
Odyssey occupe bel et bien une première place incontestée dans la décomposition par sous-métriques : Spatiotemporal, à 44,70, devant Odyssey-3 Pro à 42,97 et Physis-Lang (Cosmos3 Super) à 41,57. Sur Spatial, il est quatrième (59,17), derrière FLUX 3 (64,36), Odyssey-3 Pro (61,78) et Physis-Lang (59,87) ; sur Weighted Spatial et MSE, il est respectivement quatrième et troisième. Ce schéma — une position de leader incontestée pour la cohérence du mouvement dans le temps, et un second rang pour la fidélité spatiale sur une image unique — est la signature cohérente d’un modèle conçu pour simuler une évolution plutôt que pour produire une belle image fixe.
Maintenant, le nom manquant. Wan 3.0 n'apparaît pas du tout sur Physics-IQ Verified. Les seules entrées Wan sont Wan 2.2 14B au rang 17, −6,64 pp, et Wan 2.2 5B au rang 22, −11,13 pp — toutes deux en dessous de la moyenne de la catégorie, toutes deux open source, toutes deux une génération en retard. La note de périmètre du tableau de bord lui-même indique que le classement « inclut les modèles évalués et les modèles connus d'après des préprints ou des annonces, même si l'accès public est indisponible ou si aucune date de sortie n'est confirmée », donc l'absence de Wan 3.0 n'est pas la preuve qu'il obtient de mauvais scores. C'est la preuve que personne ne l'a mesuré sur cet axe. La conséquence pratique est sans appel : toute affirmation selon laquelle Odyssey-3 surpasse Wan 3.0 en plausibilité physique n'est vérifiée dans aucun sens, et toute affirmation selon laquelle ce n'est pas le cas l'est tout autant. Le palmarès indépendant de Wan 3.0 se trouve ailleurs — il s'est classé n° 2 au général sur OpenArt Arena et n° 1 en montage vidéo avec audio sur Artificial Analysis — sur des classements qui mesurent la qualité perçue et la qualité du montage, pas la physique.
Ce que vous pouvez appeler aujourd'hui, et ce sur quoi vous ne pouvez que poser des questions
Wan 3.0 est appelable depuis le 24 août 2026, lorsque le lancement d'Alibaba Cloud a fait passer la bêta facturée à l'usage et à accès restreint par candidature à une API entièrement ouverte. Le modèle est accessible via l'API propre du fournisseur et plusieurs plateformes tierces, toutes facturées à l'usage, aux tarifs à la seconde indiqués ci-dessus. Si une équipe a besoin d'une vidéo générée cet après-midi, c'est une option bien réelle, et elle s'accompagne d'une facture.
Odyssey-3 n'offre pas cela. La page d'Odyssey indique que l'aperçu de recherche est « disponible dès maintenant » et invite les développeurs en IA physique à prendre contact — ce qui décrit une démo et un échange, pas un point de terminaison derrière une clé. Il n'existe aucun prix publié, aucune licence, aucune documentation d'API et, comme le montre la section ci-dessus, aucune évaluation indépendante. Un développeur qui lit l'annonce de lancement ne peut aujourd'hui ni calculer ce que coûterait une version de production sur Odyssey-3, ni vérifier si les affirmations physiques tiennent en dehors du banc d'essai du fournisseur lui-même. C'est normal pour un modèle du monde au jour de son lancement, et c'est aussi le fait le plus important de cette comparaison.
Comme aucun des deux modèles ne figure dans notre catalogue — la liste de modèles d'OrcaRouter ne comprend ni Odyssey-3 ni Wan 3.0 —, le point de routage utile se situe à la couche qui se trouve au-dessus d'eux. Il y a fort à parier qu'une production vidéo ne fasse pas appel à un seul modèle. Elle fait appel à un modèle de réécriture de prompt, à un modèle vidéo, parfois à un modèle audio, et elle les rappelle tous chaque fois qu'un fournisseur modifie un prix ou une limite de débit. Sur OrcaRouter, ceux-ci se trouvent derrière une API unique couvrant plus de 200 modèles au prix catalogue des fournisseurs, avec 0 % de marge, de sorte qu'une baisse du prix à la seconde consentie par un fournisseur vidéo est appliquée ici le jour même, sans attendre une modification de configuration, et le basculement automatique garantit qu'une panne d'un seul modèle ne bloque pas une file de rendu. Les modèles vidéo que nous servons bel et bien — MiniMax H3, Kling 3.0, Kling Video O1 et d'autres — sont accessibles avec cette même clé, ce qui rend la substitution peu coûteuse lorsqu'un aperçu de Wan 3.0 ou un essai d'Odyssey-3 finit enfin par être disponible.

Lequel appartient à votre stack
Le choix n'est pas serré, car ce que les deux produisent ne se recoupe pas. La règle de décision honnête porte sur l'artefact dont vous avez besoin à la fin.
Choisissez Wan 3.0 si le livrable est une séquence vidéo qu’une personne regarde : une publicité, un plan d’insertion, une version pour les réseaux sociaux, un segment pédagogique. Trente secondes par exécution avec audio natif, contrôle de référence sur les images, la vidéo et l’audio, montage guidé par instructions et documents en entrée : voilà une liste de fonctionnalités de production, et l’API à facturation à l’usage signifie que le coût d’un test peut être connu à l’avance. C’est une génération, pas une simulation — le travail du modèle se termine avec le clip. Établissez le budget d’après les tarifs à la seconde du fournisseur, et traitez ses propres mises en garde concernant l’audio et le texte à l’écran comme des contraintes de conception plutôt que comme des notes de bas de page.
Choisissez Odyssey-3, quand vous pouvez l'obtenir, si le livrable est un comportement plutôt qu'un fichier : un environnement dans lequel une politique apprend, une scène dont la réponse à une action doit rester cohérente sur un long rollout, une tâche de navigation ou de manipulation où la caméra fait partie du problème. C'est là que la première place incontestée en plausibilité spatiotemporelle et le coût modélisé de 0,139 $ à 0,267 $ par vidéo comptent vraiment. Ce qui manque, c'est tout ce dont une équipe de production a besoin pour s'engager — un prix, une licence, un point de terminaison et une mesure externe — et aucune de ces choses ne peut être remplacée par une démo.
La chose à surveiller est précise et proche. Si Wan 3.0 apparaît sur Physics-IQ Verified, la question de la physique devient résoluble dans un sens. Si Odyssey publie une grille tarifaire ou une API, la question du coût se résout dans l'autre. Tant que l'un de ces événements ne s'est pas produit, cette comparaison a une forme étrange : un système de production avec un prix publié et aucune note en physique, à côté d'un simulateur avec des notes en physique publiées et aucun prix. Quiconque vous dit lequel est meilleur aujourd'hui fait des suppositions sur au moins l'un de ces deux chiffres.
![Capture of the Physics-IQ Verified leaderboard from Anates Labs and DeepMind, ranked by net improvement in percentage points above the track mean, showing FLUX 3 [large] first at +12.27 pp, Odyssey-3 Pro second at +11.15 pp and Odyssey-3 third at +9.99 pp, with Wan 2.2 14B at rank 17 and Wan 2.2 5B at rank 22 and no entry for Wan 3.0.](https://cms.orcarouter.ai/api/media/file/4-1741.png)
