« Carton-titre pour « Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B » : grand titre, sous-titre « La voix que vous ne pouvez pas mettre sous licence, et la voix que vous ne pouvez pas livrer », et deux cartes à icônes plates — « Sesame Preview » avec une icône au trait téléphone-et-personne et un badge indiquant « Application gratuite · sans API · coup de cœur des testeurs », et « NVIDIA NemotronLabs VoiceChat 11B » avec une icône au trait téléchargement-et-serveur et un badge indiquant « Poids ouverts · recherche uniquement · auto-hébergement ». Pied de page : « Les deux meilleures voix impossibles à livrer — IA vocale, août 2026. » Logo OrcaRouter incrusté en bas à droite. »
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B : La voix que vous ne pouvez pas licencier, et la voix que vous ne pouvez pas livrer

Auteur

Jim Song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux des modèles vocaux les plus discutés de 2026 ont un point commun qu'aucune couverture de lancement ne vous dira : vous ne pouvez intégrer ni l'un ni l'autre dans un produit. Sesame Preview est l'assistant grand public gratuit dont la voix conversationnelle a poussé TestingCatalog à le qualifier de « l'un des meilleurs modes vocaux disponibles sur le marché », et le modèle de production sous-jacent n'a ni API, ni identifiant de modèle, ni licence que vous puissiez acheter — la société ne l'a tout simplement pas publié. NVIDIA NemotronLabs VoiceChat 11B est l'image miroir : les poids sont publics, la conception full-duplex est une véritable première, et la licence restreint l'usage à des fins de recherche uniquement, donc personne ne peut légalement le commercialiser non plus. L'un est une voix que l'on peut entendre mais pas louer. L'autre est une voix que l'on peut tenir mais pas vendre. C'est une comparaison entre deux portes verrouillées, et la question utile est de savoir devant quelle serrure vous vous trouvez.

Deux portes verrouillées, avec des serrures différentes

Commencez par la forme de chacun, car les noms cachent à quel point les deux produits sont différents. Sesame Preview est une application, pas une API. Elle propose quatre agents avec des personnalités distinctes — Maya (chaleureuse et créative), Miles (décontracté et perspicace), Simone (curieuse et intellectuelle), Charlie (spirituel et chaleureux) — chacun avec sa propre voix et sa propre mémoire qui se synchronisent sur le web et le mobile lorsque vous êtes connecté. Elle effectue des recherches sur le web, plonge en profondeur, prend des notes et des rappels, et envoie un résumé après chaque appel. L’aperçu est gratuit, sans offre payante, uniquement en anglais, plafonné à 30 minutes par appel lorsque vous êtes connecté (cinq sinon), et il s’abstient délibérément d’exécuter des tâches : il peut réfléchir et faire des recherches, mais il ne réservera pas votre vol. Il n’y a aucune clé API dans le produit — la voix de production est une fonctionnalité de l’application, pas un point de terminaison.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B est tout le contraire : un checkpoint, pas un produit. Il est arrivé sur Hugging Face le 3 août 2026 sans aucune annonce — pas de post de lancement, pas de rapport technique, pas de tweet ; la fiche du modèle est l'annonce. C'est un modèle de parole full-duplex de 11B paramètres (nous avons analysé l'en-tête safetensors et compté 11,095 milliards de paramètres répartis sur 1 626 tenseurs) conçu comme une pile unique : un encodeur Fast Conformer qui traite l'audio 16 kHz en trames de 80 ms avec zéro contexte droit, un backbone Nemotron Nano 9B v2 qui effectue le raisonnement, un décodeur NVIDIA T​TS qui écrit de l'audio 22,05 kHz, un décodeur RNN-T qui transcrit l'utilisateur, et un canal de sortie séparé qui émet des scripts d'appel d'outils sans contaminer la réponse parlée. Il écoute et parle en même temps, peut être interrompu en plein mot, et NVIDIA le présente comme le premier modèle full-duplex ouvert avec appel d'outils. Que cette affirmation survive au contact de la réalité fait l'objet de sa propre section ci-dessous.

Le benchmark où ils divergent — deux candidats pour la « meilleure conversation », deux normes de preuve brisées.

Les deux modèles mettent en jeu toute leur réputation sur la même chose : la qualité conversationnelle — l'alternance des tours de parole, l'interruption, le timing naturel, la sensation d'un véritable échange. C'est pourquoi ils se retrouvent dans un même titre. C'est aussi là que la comparaison devient étrange, car aucun des deux candidats ne peut être évalué correctement.

Sesame Preview n'a aucun chiffre où que ce soit. Le modèle de production n'est ni publié ni répertorié — pas d'identifiant de modèle, aucune entrée au classement parole-à-parole d'Artificial Analysis, aucun objectif de latence, aucun benchmark d'aucune sorte. Quand TestingCatalog évoque « l'un des meilleurs modes vocaux disponibles sur le marché », c'est un consensus de testeurs, pas une mesure, et il n'existe aucun moyen de le soumettre à un test A/B en aveugle contre quoi que ce soit. Le seul modèle Sesame que quiconque peut exécuter de manière indépendante est la base CSM-1B à poids ouverts, et il s'agit d'un checkpoint de synthèse vocale, pas de la voix de l'application.

NVIDIA NemotronLabs VoiceChat 11B a le problème inverse : il a des chiffres, mais ces chiffres sont répartis entre deux normes de mesure qui ne concordent pas. NVIDIA rapporte 448 ms pour prendre un tour de parole fluide, 480 ms pour céder la parole en cas d'interruption, et un taux de reprise parfait de 1,0 lors d'une interruption de l'utilisateur — le tout mesuré par le fournisseur sur son propre Full-Duplex-Bench 1.0, sans reproduction indépendante. Les mesures indépendantes de cette famille sont classées sous un nom et un nombre de paramètres différents — « Nemotron 3 VoiceChat (V1) » à 12B, une étiquette que NVIDIA n'a jamais réconciliée avec le checkpoint 11B sur Hugging Face — et elles sont peu flatteuses du côté de la compréhension : 29,2 % sur Big Bench Audio selon Artificial Analysis, contre 37,0 % sur la propre fiche de NVIDIA. Sur VoiceBench, la famille obtient un score de 58,10, le meilleur résultat open full-duplex du classement. Ainsi, le même modèle est à la fois un leader parmi les checkpoints open full-duplex et environ trois fois moins performant que les leaders hébergés en temps réel pour comprendre ce qu'il entend.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

La divergence ne porte donc pas sur lequel est le meilleur. Elle tient au fait que les deux candidats à la meilleure conversation de 2026 sont évalués sur des preuves opposées et tout aussi incomplètes. La voix qui, selon les testeurs, semble la plus humaine ne dispose d'aucune mesure, et la voix qui apparaît réellement dans les classements est celle dont les faiblesses sont publiques. On ne peut pas comparer une réputation à un chiffre, et ici il n'y a qu'un seul chiffre — et ce n'est pas le plus flatteur.

Accès — un téléchargement depuis l’App Store, ou une version de 80 Go

Si vous voulez essayer l'un ou l'autre, le point de départ diffère d'une manière qui compte plus que n'importe quelle spécification.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

Le NVIDIA NemotronLabs VoiceChat 11B n'est pas non plus un téléchargement que l'on peut simplement exécuter — c'est une build qu'il faut monter soi-même. Hugging Face indique que le modèle « n'est déployé par aucun fournisseur d'inférence » ; NVIDIA ne l'a pas hébergé ; et le config.json du dépôt est une config d'entraînement NeMo, donc il n'y a pas de checkpoint Transformers vers lequel on peut pointer AutoModel. Le chemin pris en charge est un environnement conda épinglé à Python 3.12, PyTorch 2.10 et Transformers 4.56, avec causal-conv1d et mamba-ssm compilés depuis les sources, sur un GPU de 80 Go (A100, H100, H200, B200 ou RTX 6000) exécutant vLLM — ou le conteneur NGC NIM de NVIDIA, qui expose un WebSocket compatible OpenAI Realtime à /v1/realtime une fois que l'on est sur ce matériel. Le compteur de téléchargements raconte l'histoire de l'accès : environ 80 téléchargements au cours du premier mois du modèle, contre 107 likes. Les gens l'ont mis en favori ; presque personne ne l'a exécuté. Une note honnête pour le chercheur qui le fera : le socle de raisonnement sur lequel ce checkpoint s'appuie, Nemotron Nano 9B v2, est lui-même un modèle hébergé que l'on peut appeler dès aujourd'hui — le modèle full-duplex qui l'entoure ne l'est pas, et c'est là tout l'intérêt.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Price — une application gratuite, des poids gratuits et la facture de 80 Go

Les deux modèles sont "gratuits", et le mot induit tout autant en erreur dans les deux cas.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

L'étalon honnête pour le jour où l'un ou l'autre deviendra achetable : quel que soit le modèle vocal hébergé que vous retenez, le prix catalogue du fournisseur est ce que vous devez payer, sans aucune majoration de routage par-dessus — la répercussion directe qui fait qu'une baisse de prix du fournisseur apparaît sur votre facture le jour même plutôt qu'après un cycle contractuel. Aucun des deux modèles de cet article n'est appelable via OrcaRouter : la voix de production de Sesame n'a aucune API du tout, et NVIDIA NemotronLabs VoiceChat 11B n'est appelable par aucun moyen. L'étalon vaut pour la voix que vous pouvez réellement acheter, et c'est exactement la norme qui rend une base TTS à 7 $ par million de caractères ou une future API de qualité Sesame facile à tarifer honnêtement.

Memory — l'application qui se souvient vs le modèle qui oublie

Ici, le fossé est un canyon, et c'est la raison la plus concrète pour laquelle les deux ne sont pas substituables. Sesame Preview, l'application, se souvient : chaque agent dispose d'une mémoire par agent qui se synchronise entre le web et le mobile lorsque vous êtes connecté, les appels peuvent durer jusqu'à 30 minutes, et le mode Incognito lit les mémoires passées sans en créer de nouvelles. Le CSM-1B open source, en revanche, a une fenêtre de contexte de 4K — environ trois à quatre minutes de texte — et n'a de toute façon pas d'oreilles pour vous entendre.

NVIDIA NemotronLabs VoiceChat 11B conserve au maximum environ deux minutes de contexte audio — le chargeur de données d’entraînement plafonne les énoncés à 142,39 secondes, et la fiche avertit que la conversation au-delà d’une fenêtre de deux minutes peut ne pas être conservée. Pour un appel d’assistance qui doit se rappeler de ce qui a été convenu il y a quatre minutes, ce plafond est rédhibitoire à lui seul. Ajoutez une seule voix fixe (Aria) sans clonage dans le point de contrôle publié, et le modèle transparent sur son architecture est aussi celui qui ne peut ni se souvenir d’un client ni changer sa propre voix.

Ce dans quoi chacun est véritablement mauvais.

Mesuré, parce qu'une comparaison qui s'arrête aux points forts est du marketing :

Sesame Preview: aucune API — vous ne pouvez pas intégrer cette voix dans un produit, et le modèle de production n'est ni publié ni évalué. Uniquement en anglais, aucune exécution de tâches, une limite de 30 minutes par appel, et aucun benchmark indépendant de quelque nature que ce soit. Le seul modèle ouvert, CSM-1B, dispose d'une fenêtre de contexte de 4K, pas d'appel d'outils, pas d'écoute, et n'est pas la voix de l'application.

NVIDIA NemotronLabs VoiceChat 11B:une licence de recherche uniquement (OpenMDW v1.1) — vous pouvez le télécharger, l'étudier et l'affiner, mais vous ne pouvez pas le commercialiser, et quiconque construit dessus ne le peut pas non plus. Pas de point de terminaison hébergé, donc « l'essayer » signifie une carte graphique de 80 Go et une compilation à partir des sources. Anglais uniquement, une mémoire plafonnée à ~2 minutes, une seule voix fixe. NVIDIA déclare qu'il peut sous-performer son propre backbone en matière de connaissances et de suivi d'instructions, le raisonnement multi-étapes et l'arithmétique étant signalés comme faibles. Il peut vous couper au milieu d'une phrase, dégénérer en charabia irrécupérable ou en auto-conversation après plusieurs tours, omettre des mots dans la transcription, et il est explicitement inadapté aux pièces bruyantes ou réverbérantes. L'appel d'outils ne fonctionne qu'avec des invites et des réponses exclusivement ASCII, plafonne à cinq outils par session, et sa précision d'arguments (44,2 %) et son taux de réussite au premier essai (33 %) signifient qu'il est plus fiable pour choisir le bon outil que pour en remplir les paramètres.

Qui devrait choisir quoi

Parce qu'aucun des deux n'est appelable, la réponse honnête part de ce que vous essayez de faire.

Découvrez la voix la mieux notée de 2026 : Sesame Preview, gratuit, aujourd'hui — sous forme d'application. Les quatre agents, la gestion des interruptions, l'ergonomie du mode conduite que les testeurs ne cessent de citer : c'est un produit grand public, et sa valeur réside précisément dans ce que vous ne pouvez pas mesurer.

Étudiez la modélisation de la parole en full-duplex : NVIDIA NemotronLabs VoiceChat 11B est le téléchargement le plus intéressant de sa catégorie — un checkpoint ouvert 11B avec un canal d'appel d'outils fonctionnel, environ 550 000 heures d'audio d'entraînement mixte, et le meilleur résultat open sur VoiceBench full-duplex à ce jour, le tout pour un coût de zéro dollar pour les poids. La licence de recherche uniquement n'est pas une contrainte pour ce travail.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Lancez un produit vocal ce trimestre :ni l'un ni l'autre. Vous avez besoin d'un modèle hébergé de parole-à-parole en temps réel avec une licence commerciale, et la façon sûre d'adopter un modèle sur lequel vous n'avez pas misé votre production est de l'utiliser en parallèle d'un modèle éprouvé avec basculement automatique, afin qu'une voix non éprouvée ne fasse jamais échouer un appel en direct. C'est une seule API couvrant plus de 200 modèles hébergés au prix catalogue du fournisseur, sans marge, qui fait d'essayer une voix nouvellement disponible un changement de configuration plutôt qu'une réécriture.

Ce modèle vaut la peine d'être nommé car il va se reproduire. Ces deux modèles sont à un événement de devenir appelables — Sesame le jour où il publiera un identifiant de modèle ou une API, NVIDIA NemotronLabs VoiceChat 11B le jour où NVIDIA publiera une licence commerciale ou que quelqu'un l'hébergera. Quand cela arrivera, la bonne décision n'est pas de démonter votre pile vocale actuelle. Il s'agit d'ajouter la nouvelle voix à côté de l'ancienne et de router avec basculement, exactement comme vous le feriez pour tout nouveau modèle non éprouvé. Ce sont les deux meilleures voix non livrables de 2026 ; l'infrastructure pour livrer la troisième existe déjà.

Qu'est-ce qui changerait cette comparaison

Quatre événements réécriraient cet article. Une API ou un identifiant de modèle pour la voix de production de Sesame — dès que cela se produira, Sesame cessera d'être une application et deviendra le candidat que le marché des API vocales hébergées attendait. Une licence commerciale ou un point de terminaison hébergé pour NVIDIA NemotronLabs VoiceChat 11B, ce qui transformerait du jour au lendemain un artefact de recherche en une véritable option produit. Un score indépendant pour la voix de Sesame — une inscription au tableau speech-to-speech d'Artificial Analysis donnerait à l'affirmation de « meilleure voix » une référence à confronter. Et un rapport technique de NVIDIA réconciliant le checkpoint 11B avec les entrées « Nemotron 3 VoiceChat (V1) » 12B que mesurent les classements, ce qui est la condition préalable pour se fier aux chiffres de cette famille. Jusqu'à ce que l'un de ces éléments se concrétise, le résumé exact est simple : les deux voix conversationnelles les plus intéressantes de 2026 sont toutes deux verrouillées — l'une par une entreprise qui ne veut pas vendre, l'autre par une licence qui ne sera pas livrée.

FAQ

Puis-je utiliser la voix de l'un ou l'autre modèle dans ma propre application ?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Lequel des deux sonne en fait plus humain ?

Inconnu, pour des raisons différentes dans chaque cas. Sesame Preview n'a aucun score indépendant — la mention « l'un des meilleurs modes vocaux disponibles sur le marché » de TestingCatalog est un consensus d'évaluateurs, pas une mesure. Le timing conversationnel du VoiceChat 11B de NVIDIA NemotronLabs (448 ms pour prendre la parole, 480 ms pour céder la parole en cas d'interruption) est rapporté par NVIDIA et non reproduit, et son score indépendant Big Bench Audio (29,2 %, selon Artificial Analysis, classé sous « Nemotron 3 VoiceChat (V1) ») mesure la compréhension, pas l'agrément de la voix. L'une a une réputation que l'on peut entendre ; l'autre a des chiffres qui répondent à une autre question.

Le NVIDIA NemotronLabs VoiceChat 11B est-il vraiment gratuit ?

Les poids sont gratuits ; le modèle n'est pas bon marché. Le faire tourner implique un GPU de 80 Go (environ 2 à 3 dollars de l'heure à la demande, 1 500 à 2 200 dollars par mois s'il reste allumé en continu) et une compilation à partir des sources, et la licence OpenMDW v1.1 le restreint à des fins de recherche uniquement — même après une telle dépense, vous ne pouvez pas légalement le proposer à des clients.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube