
Realtime-Venus vs Sesame Preview : ce que l’on peut obtenir n’est pas ce qui est bon
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus et Sesame Preview sont développés par des laboratoires qui ont des idées complètement différentes sur la finalité d'un modèle vocal, et ils sont tombés dans le même piège en partant de directions opposées. Sesame Preview est une application grand public gratuite — sur iOS depuis mai 2026, sur Android depuis début août — avec quatre agents conversationnels, une recherche web en direct pendant les appels et une voix que les critiques ont qualifiée de meilleure de sa catégorie. Les poids ouverts publiés par Sesame correspondent à un autre modèle, plus petit, que l'entreprise elle-même ne présente pas comme la voix que vous avez entendue dans la démo. Realtime-Venus, le système full-duplex de 9B de l'équipe Venus d'Ant Group et de l'Université Tsinghua, a fait l'inverse : les artefacts téléchargeables sont le vrai modèle, et il n'existe aucun produit. Dans les deux cas, l'écart entre ce qui est disponible et ce qui est impressionnant est la chose la plus utile à comprendre avant de planifier quoi que ce soit autour de l'un ou de l'autre.
Ce que chacun est réellement

Sesame Preview est un produit. Sesame est un laboratoire de San Francisco fondé en 2023 par Brendan Iribe, Ankit Kumar et Ryan Brown, soutenu par a16z, Sequoia, Spark et Matrix, et son assistant vocal grand public propose quatre personnalités — Maya, Miles, Simone et Charlie — chacune avec un tempérament et une voix distincts. L’agent peut effectuer une recherche sur le web en pleine conversation, prendre des notes et des rappels, et envoyer un résumé après un appel. La mémoire est propre à chaque agent et se synchronise entre le web et le mobile lorsque vous êtes connecté, avec un mode incognito qui lit les souvenirs passés sans en écrire de nouveaux. Il est gratuit, ne diffuse aucune publicité, et l’entreprise affirme qu’elle ne vend pas de données.
Realtime-Venus est une version de recherche. Deux checkpoints de 9B sous licence Apache-2.0 sur Hugging Face — Realtime-Venus-Omni pour l’interaction audio-visuelle et Realtime-Venus-Audio pour l’interaction vocale — ainsi qu’un rapport technique soumis à arXiv le 12 septembre 2026, une page de projet et un dépôt associé contenant le composant Realtime-Venus-Harness. Il n’existe ni application, ni API, ni tarif, ni annonce de la part du fournisseur. Le dépôt n’est déployé par aucun fournisseur d’inférence, et les téléchargements ne sont pas suivis.
Le piège, dans les deux sens
La version de Sesame est la forme classique de l’open-washing, et Sesame fait preuve de plus d’honnêteté à ce sujet que la plupart. Le checkpoint CSM que le laboratoire a publié sous Apache-2.0 est un modèle de génération de parole de base — un backbone Llama alimentant un décodeur Mimi-codec — et la documentation précise explicitement qu’il ne s’agit ni de la voix de l’application ni d’un système parole-à-parole de bout en bout. Il ne peut pas générer de texte, et il est entraîné principalement sur des données en anglais, avec une capacité limitée en dehors de cela. Ce qui propulse Sesame Preview est un modèle de production plus grand qui n’a pas été publié. Donc si vous cherchiez la voix de la démo, vous en avez trouvé la lignée de recherche et non la chose elle-même. Lorsque l’un des quatre agents répond à votre appel, vous entendez quelque chose que vous ne pouvez pas télécharger.
La version de Realtime-Venus est l’image miroir, et sans doute la plus étrange. Tout ce qui est publié est authentique : de vrais poids, du vrai code, un vrai rapport, une licence permissive. Ce qui manque, c’est toute manière de l’utiliser qui n’implique pas de posséder un GPU. Deux checkpoints 9B en BF16 représentent environ dix-huit gigaoctets de poids chacun avant la mémoire d’activation, et les deux sont conçus pour exécuter une boucle de streaming continue d’une seconde avec une entrée audio et vidéo en direct. C’est un déploiement de classe serveur. Une application grand public qui livre la même capacité sur un téléphone fait quelque chose que cette version ne tente pas, et l’écart entre un modèle téléchargeable et un modèle exécutable est exactement là où la plupart des personnes qui le veulent vont se retrouver bloquées.
La mesurabilité est la différence la plus nette
Aucun des deux modèles ne dispose d’un score indépendant de qualité vocale, mais les raisons diffèrent.
• Sesame Preview — aucune entrée dans l’arène, aucune évaluation publiée de la voix de production. Sa réputation repose sur les critiques et sur l’effet de la démo originale sur les auditeurs, qui est une preuve réelle d’un certain type, et totalement non quantifiée.
• CSM-1B — le checkpoint ouvert est un modèle de génération de base ; il n'est pas évalué par rapport aux systèmes conversationnels, car il n'en est pas un.
• Realtime-Venus — une seule donnée vocale autodéclarée, un score VoiceBench AlpacaEval de 4,81 que son rapport décrit comme correspondant au meilleur chiffre de comparaison. Aucun tiers ne l’a évalué.
• Ce que ni l’un ni l’autre ne vous donne — un chiffre produit par quelqu’un qui n’a aucun intérêt au résultat. Si la qualité vocale est votre critère d’achat, toute la comparaison est impossible à noter, et la démarche honnête consiste à écouter les deux et à décider par vous-même plutôt que de vous en remettre à un tableau.
Prise de parole à tour de rôle, où les deux ont quelque chose à prouver.
La réputation de Sesame s’est construite exactement sur cela. La démo qui a rendu le laboratoire célèbre était une voix dont le souffle, les hésitations et le timing des interruptions étaient assez convaincants pour que les auditeurs croient qu’une personne était au bout du fil. C’est une affirmation sur la dynamique conversationnelle, et c’est précisément ce sur quoi le produit est vendu.
Realtime-Venus avance la même affirmation, chiffres à l’appui. Sur Full-Duplex-Bench v1.5, son point de contrôle audio indique qu’il répond à 75 % des interruptions des utilisateurs, avec des taux de continuation de 97 % en présence de backchannels, de 88 % en présence de paroles adressées à autrui et de 86 % en présence de paroles de fond — ce qui, selon ses dires, dépasse Gemini 3.1 Live et GPT-4o sur les trois métriques de continuation. Ces chiffres proviennent de son propre rapport et personne ne les a reproduits.
Donc la comparaison oppose une démo sans chiffre à un chiffre sans démo, ce qui est une position vraiment inconfortable et une description juste de la façon dont toute cette catégorie rend compte d'elle-même en ce moment. La seule chose qu'on puisse affirmer avec certitude, c'est qu'aucune des deux affirmations n'a résisté à l'examen d'un tiers extérieur, et qu'un taux de continuation de 97 % dans les backchannels est suffisamment élevé pour mériter cet examen avant d'être cité comme acquis.

Ce que vous pouvez réellement construire
Sesame Preview n'apporte rien à un développeur. Il n'y a pas d'API, pas d'identifiant de modèle, pas de grille tarifaire, et aucun plan annoncé pour en fournir une. Les appels sont plafonnés à trente minutes lorsque vous êtes connecté, et à cinq minutes sinon ; l'anglais est la seule langue officiellement prise en charge ; et l'agent effectuera des recherches et gardera en mémoire, mais n'exécutera pas de tâches — il ne réservera pas le vol. L'offre gratuite est le produit. C'est une offre grand public parfaitement valable, et une impasse pour l'intégration.
Realtime-Venus donne à un développeur tout sauf un endroit où l'exécuter. Les poids sont sous licence permissive, le code se charge avec des appels standard à Transformers, le streaming full-duplex s'active avec un simple basculement de méthode, et la boucle documentée consiste en une seconde de préremplissage en streaming suivie d'une génération en streaming, répétée. La mémoire pour vidéos longues est activée avec un paramètre memory-minutes et est décrite comme sans entraînement, ce qui est inhabituel pour une capacité qui nécessite normalement un fine-tuning. Deux mises en garde sont documentées plutôt que laissées à découvrir : un plafond de frames qui tronque silencieusement les vidéos longues à moins qu'une constante ne soit augmentée avant l'import de l'utilitaire, et une exigence de police CJK pour les sous-titres non latins rendus dans une vidéo duplex.
Ce que rien de tout cela ne change, c'est que le harness — le composant qui exécute les délégations asynchrones, la partie la plus distinctive de l'architecture — vit dans un dépôt GitHub séparé, est bien moins documenté que le modèle, et c'est la partie dont la maturité de production est la plus difficile à juger. Dans un déploiement réel, le volet de la délégation n'est que de l'inférence de texte ordinaire derrière une interface conversationnelle. OrcaRouter ne propose ni Realtime-Venus ni Sesame Preview ; les deux couches vocales sont en dehors de ce que nous servons, et nous le disons clairement plutôt que de laisser entendre une relation d'hébergement qui n'existe pas. Près de 200 modèles de texte derrière une seule clé, au prix catalogue du fournisseur, sans margec'est la moitié de cette architecture que nous couvrons, avec un basculement automatique pour qu'une tâche déléguée survive à une panne en amont, un DSL de routage qui compose plusieurs modèles en un seul appel, et la fusion de modèles quand le jugement d'un seul modèle ne suffit pas. C'est la partie achetable d'une conception dont la partie intéressante n'est pas à vendre.

La recommandation honnête
Si vous êtes un consommateur qui veut la voix conversationnelle la plus agréable à écouter disponible aujourd’hui et qui n’a pas besoin de l’intégrer, Sesame Preview est gratuit, il est disponible sur les deux plateformes mobiles, et sa réputation est suffisamment méritée pour que les critiques ne cessent de le dire. Utilisez-le et profitez-en.
Si vous êtes un chercheur ou une équipe d’ingénierie bien dotée en ressources ayant besoin d’une pile audiovisuelle full-duplex ouverte que vous pouvez inspecter et affiner, Realtime-Venus est l’une des très rares véritables options, et le fait que ses benchmarks soient autodéclarés ne change rien au fait que les poids sont réellement ouverts et que l’architecture est réellement documentée.
Si vous êtes une équipe produit à la recherche d’une couche vocale à livrer ce trimestre, aucune de ces deux solutions n’est votre réponse, et l’enseignement utile de cette mise en regard, c’est pourquoi. Un laboratoire a construit quelque chose d’excellent et a gardé fermée la bonne partie ; l’autre a tout publié et vous a laissé fournir l’infrastructure. La catégorie a prouvé qu’elle pouvait créer une voix qui vaut la peine d’être écoutée et n’a pas encore décidé si cette voix devait être achetable sous une autre forme qu’une application.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
