
Muse Realtime Avatar vs Realtime-Venus : sortie vidéo contre entrée vidéo
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 180 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Deux systèmes annoncés à neuf jours d'intervalle se disent tous deux temps réel et revendiquent tous deux l'étiquette audiovisuelle, et ils pointent dans des directions opposées le long du même axe. Muse Realtime Avatar, annoncé par Meta le 23 septembre 2026, prend une photographie et génère une vidéo de celle-ci en train de parler — sa vidéo est une sortie, des images portrait 448×768 à 25 par seconde, produites par un Diffusion Transformer piloté par l'audio qui partage un flux de tokens avec Muse Realtime Voice. Realtime-Venus, mis en ligne sur arXiv le 12 septembre 2026 par l'équipe Venus d'Ant Group avec l'université Tsinghua, consomme de la vidéo : le checkpoint Realtime-Venus-Omni transmet des images de caméra à travers un encodeur SigLIP2 et parle de ce qu'il voit, tandis que le checkpoint Realtime-Venus-Audio est la même architecture de base avec la vision désactivée au chargement. L'un génère un visage. L'autre en regarde un. Aucun n'est appelable, et un seul est téléchargeable — ce qui s'avère être la différence la plus lourde de conséquences.
L’inversion de disponibilité mérite d’être énoncée sans détour avant tout le reste, parce qu’elle va à l’encontre de toutes les attentes concernant un produit Meta et une publication de laboratoire de recherche. Le système de Meta est fermé : annoncé lors de Connect, démontré dans un article de recherche, intégré à l’agent Muse, sans API, sans poids, sans prix et sans date. Le système d’Ant Group est ouvert : deux checkpoints 9B en safetensors BF16 sous Apache-2.0 à l’adresse inclusionAI/Realtime-Venus sur Hugging Face, avec du code Transformers personnalisé, un fichier requirements, une voix de référence, une page de projet et un dépôt GitHub associé. L’entreprise derrière le produit grand public n’a rien livré que l’on puisse tenir. L’équipe de recherche a livré l’ensemble.
Ce que chacun fait avec un cadre
Le sens de la vidéo constitue à lui seul toute la différence architecturale, et il ne s'agit pas d'une question d'emphase.
• Vidéo — Muse Realtime Avatar le génère, conditionné sur des tokens de parole, une image de référence et une fenêtre glissante de latents vidéo récents ; Realtime-Venus-Omni le perçoit, avec un encodeur visuel SigLIP2 qui diffuse des images dans le modèle parallèlement à l’audio.
• Audio — Muse Realtime Avatar pilote la génération à partir des tokens de parole de Muse Realtime Voice, qui portent ensemble le contenu et la prosodie ; Realtime-Venus génère la parole sous forme de tokens S3 discrets décodés par un décodeur de flow matching en continu, plutôt que de greffer un modèle de synthèse vocale distinct à la fin.
• Backbone — L'architecture de Meta est un Diffusion Transformer piloté par l'audio, de taille non divulguée ; Realtime-Venus repose sur un socle linguistique Qwen3-8B avec un encodeur audio Whisper-Medium, et sa fiche modèle indique que le checkpoint Omni est adapté de MiniCPM-o 4.5.
• Poids — Les Muse Realtime Avatar ne sont pas publiés et rien n'indique qu'ils le seront ; Realtime-Venus fournit deux checkpoints 9B, en BF16, avec un contexte de 40 960 tokens pour les deux, sous licence Apache-2.0.
• Accès — Muse Realtime Avatar n'a pas d'API ni de date ; Realtime-Venus n'a pas d'API non plus, et sa fiche indique clairement qu'il n'est déployé par aucun fournisseur d'inférence.
• Où cela tourne — Muse Realtime Avatar tourne dans l'application Muse pour les utilisateurs que Meta n'a pas recensés, selon des conditions 18+ ; Realtime-Venus tourne sur vos propres GPU, dès aujourd'hui, si vous avez le matériel et l'appétit.
Lisez les deux dernières lignes ensemble et la différence pratique apparaît. Aucun des deux systèmes ne peut être appelé. L’un d’eux peut être exécuté.
Le téléchargement 9B est bien réel, et ce qu'il vous coûte l'est aussi
Realtime-Venus n’est pas un dépôt factice. Les poids sont là, le code de chargement personnalisé est là, et la licence au niveau racine est Apache-2.0. Deux choses à son sujet méritent d’être connues avant de bâtir vos plans autour de lui.
Le premier, c'est ce qui n'est pas dans les poids. Le runtime à double boucle qui rend l'architecture distinctive — la boucle d'interaction d'une seconde plus un ordonnanceur d'arrière-plan que l'article appelle Realtime-Venus-Harness, qui exécute les tâches déléguées sur un instantané isolé de l'état de la conversation afin qu'une tâche de longue durée ne puisse pas être corrompue par la conversation qui avance — vit dans le dépôt GitHub en tant que composant séparé. La conception de la délégation, qui est l'idée véritablement nouvelle du rapport, est la partie que vous assemblez et à laquelle vous faites confiance vous-même.
Le second est la lignée. La fiche indique que le checkpoint Omni est adapté de MiniCPM-o 4.5, le modèle omni-modal 9B qu'OpenBMB a publié en open source plus tôt en 2026. Ce n'est pas un détail. Cela signifie que la contribution d'Ant Group réside dans le post-entraînement, le runtime et la conception de la délégation, superposés à l'architecture de streaming de quelqu'un d'autre, ce qui est une affirmation plus étroite et plus précise que « un nouveau modèle omni 9B » — et plus utile, car elle vous dit où chercher si quelque chose déraille dans l'encodeur visuel.
Les chiffres, et exactement à qui ils appartiennent
C'est ici que les deux systèmes convergent d'une manière peu utile : aucun des deux ne fait l'objet de la moindre évaluation indépendante. Les quatre chiffres de Meta sont déclarés par l'entreprise et mesurés par rapport à des références sélectionnées par Meta. Ceux de Realtime-Venus sont rapportés par les auteurs dans un rapport technique, sans qu'aucun tiers n'ait publié d'exécution et sans entrée de classement pour vérifier. Il n'existe aucune mesure publique de l'un ou l'autre système par quiconque ne l'a pas construit.
Les quatre chiffres de Meta, tels que publiés : 870 ms entre la fin de votre tour de parole et le premier octet d'une réponse synchronisée voix et vidéo ; vidéo portrait en 448×768 à 25 images par seconde ; 60× moins d'évaluations de modèle que sa propre référence ; et 12 sessions en temps réel simultanées sur un seul NVIDIA GB200, soit un gain de capacité de 8× par rapport à la référence BF16 à deux étapes de Meta. Meta divulgue aussi des résultats de préférence face à deux systèmes d'avatars commerciaux, dont l'un est indiqué comme non statistiquement distinguable de la parité en matière de maniérismes — une divulgation à saluer, car c'est le genre de résultat que la plupart des publications de lancement omettent.
Ceux d'Ant Group, tels que publiés : meilleur score sur six des huit benchmarks vidéo utilisés par le rapport, notamment StreamingBench 70,2, OVO-Bench 64,7 et Daily-Omni 81,3 pour le checkpoint Omni ; et, pour le checkpoint Audio, MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 et un score VoiceBench AlpacaEval de 4,81 que le rapport décrit comme égalant le meilleur chiffre de comparaison.
Une asymétrie dans les éléments de preuve mérite d'être signalée. Les chiffres d'Ant Group sont des scores de référence obtenus sur des jeux de tests nommés — reproductibles en principe, par quiconque accepte de télécharger les poids et d'exécuter la suite. Le chiffre phare de Meta est une mesure de latence réalisée sur la propre pile de service de Meta, que personne en dehors de Meta ne peut reproduire, car personne en dehors de Meta ne dispose du système. La publication ouverte, autrement dit, est aussi la plus vérifiable.


Pourquoi ces deux-là sont un problème de routage déguisé
Aucun des deux systèmes n’est un agent complet, et cela vaut de la même manière pour les deux. Muse Realtime Avatar est une couche de rendu greffée sur Muse Realtime Voice, qui est la couche conversationnelle d’un agent dont le raisonnement tourne sur Muse Spark. Realtime-Venus délègue tout ce qui dépasse ce qu’il peut faire directement — récupération, appels d’outils, raisonnement complexe — à un harnais qui exécute le travail en arrière-plan à partir d’un instantané de la conversation. Dans les deux conceptions, ce à quoi l’utilisateur s’adresse est une interface frontale, et la réflexion a lieu dans un modèle textuel distinct.
Ce modèle de texte distinct est la partie que vous pouvez router. Sur OrcaRouter, il s'agit d'un seul point de terminaison pour 196 modèles répartis sur 15 fournisseurs, au prix catalogue du fournisseur, répercuté sans aucune marge, avec un basculement automatique lorsqu'un modèle renvoie une erreur ou dépasse le délai d'attente — ce qui compte plus que d'habitude lorsque ce qui se trouve de l'autre côté est un checkpoint auto-hébergé que personne n'a évalué de manière indépendante. Nous n'hébergeons pas Realtime-Venus : c'est un téléchargement, et nous ne le servons pas. Nous n'hébergeons pas non plus Muse Realtime Avatar, parce que personne ne le fait. Ce que nous fournissons, c'est la couche à laquelle les deux architectures délèguent leur travail difficile, afin qu'un composant non éprouvé de part et d'autre de la conversation ne soit qu'une ligne de configuration plutôt qu'un pari de production.
Lequel de ceux-ci est réellement plus avancé ?
Le réflexe est de dire celui de Meta, parce que Meta a le produit et la vidéo de démonstration. Les preuves disent quelque chose de plus intéressant. Le système de Meta a une meilleure ingénierie de production — 12 sessions simultanées sur un GB200 est un résultat de serving, et les tests de préférence divulgués face à des produits d'avatars commercialisés sont les seuls chiffres de comparaison directe dont dispose l'un ou l'autre système. Le système d'Ant Group a une meilleure vérifiabilité : des benchmarks nommés, des poids publiés, une licence Apache-2.0 et un rapport que n'importe qui peut tenter de reproduire.
Ce dont ni l’un ni l’autre ne dispose, c’est un moyen de payer pour cela. Et celui qui est le plus près d’être utilisable n’est pas celui qui a l’application grand public — c’est celui que vous pouvez télécharger ce soir et découvrir par vous-même, sur votre propre matériel, avec vos propres données, et sans aucune annonce nécessaire.
Si vous devez choisir, la question n’est pas de savoir quel modèle est meilleur. C’est de savoir si vous voulez un visage que vous ne pouvez pas appeler ou une caméra que vous pouvez faire tourner.

