Titelkaart voor 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': grote titel, ondertitel 'De stem die je niet kunt licentiëren, en de stem die je niet kunt uitbrengen', en twee platte icoonkaarten — 'Sesame Preview' met een telefoon-en-persoon lijnicoon en een badge met 'Gratis app · geen API · keuze van recensenten', en 'NVIDIA NemotronLabs VoiceChat 11B' met een download-en-server lijnicoon en een badge met 'Open gewichten · alleen onderzoek · zelf-hostend'. Voettekst: 'Twee beste niet-uitbrengbare stemmen — stem-AI, augustus 2026.' OrcaRouter-logo rechtsonder samengesteld.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: De stem die je niet kunt licentiëren, en de stem die je niet kunt uitbrengen

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee van de meest besproken stemmodellen van 2026 hebben iets gemeen dat geen enkele berichtgeving over de lancering je zult vertellen: je kunt geen van beide in een product stoppen. Sesame Preview is de gratis consumentenassistent wiens conversationele stem TestingCatalog deed zeggen dat het "een van de beste stemmodi op de markt" is, en het productiemodel erachter heeft geen API, geen model-ID en geen licentie die je kunt kopen — het bedrijf heeft het simpelweg niet uitgebracht. NVIDIA NemotronLabs VoiceChat 11B is het spiegelbeeld: de gewichten zijn openbaar, het full-duplex ontwerp is een echte primeur, en de licentie vermeldt uitsluitend onderzoeksdoeleinden, dus kan ook niemand het legaal uitbrengen. De ene is een stem die je kunt horen maar niet huren. De andere is een stem die je kunt vasthouden maar niet verkopen. Dit is een vergelijking van twee afgesloten deuren, en de nuttige vraag is voor welk slot je staat.

Twee vergrendelde deuren, met verschillende sloten

Begin met de vorm van elk product, want de namen verbergen hoe verschillend de twee producten zijn. Sesame Preview is een app, geen API. Het wordt geleverd met vier agents met elk een eigen persoonlijkheid: Maya (warm en creatief), Miles (ontspannen en scherp), Simone (nieuwsgierig en intellectueel), Charlie (geestig en warm) — elk met een eigen stem en een eigen geheugen dat synchroniseert tussen web en mobiel wanneer je bent ingelogd. Het doorzoekt het web, duikt diep in onderwerpen, maakt aantekeningen en herinneringen, en stuurt na elk gesprek een samenvatting. De preview is gratis zonder betaalde laag, alleen in het Engels, beperkt tot 30 minuten per gesprek wanneer je bent ingelogd (anders vijf minuten), en voert bewust geen taken uit: het kan brainstormen en onderzoeken, maar het boekt je vlucht niet. Er zit nergens in het product een API-sleutel — de productiestem is een functie van de app, geen endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B is de tegenovergestelde vorm: een checkpoint, geen product. Het verscheen op 3 augustus 2026 op Hugging Face zonder aankondiging — geen lanceringsbericht, geen technisch rapport, geen tweet; de modelkaart is de aankondiging. Het is een full-duplex spraakmodel met 11B-parameters (we hebben de safetensors-header geparseerd en 11,095 miljard parameters over 1.626 tensoren geteld) gebouwd als één stack: een Fast Conformer-encoder die 16 kHz-audio verwerkt in frames van 80 ms met nul rechtercontext, een Nemotron Nano 9B v2-backbone die de redenering doet, een NVIDIA T​TS-decoder die 22,05 kHz-audio schrijft, een RNN-T-decoder die de gebruiker transcribeert, en een apart uitvoerkanaal dat tool-callingscripts uitzendt zonder het gesproken antwoord te verontreinigen. Het luistert en spreekt tegelijkertijd, kan midden in een woord worden onderbroken, en NVIDIA presenteert het als het eerste open full-duplex model met tool calling. Of die bewering de confrontatie met de werkelijkheid overleeft, is het onderwerp van een eigen sectie hieronder.

De benchmark waar ze uiteenlopen — twee kandidaten voor "beste gesprek", twee gebroken bewijsnormen.

Beide modellen zetten hun hele reputatie in op hetzelfde: gesprekskwaliteit — beurtwisseling, onderbreking, natuurlijke timing, het gevoel van een echt gesprek. Daarom horen ze überhaupt in één kop thuis. Het is ook waar de vergelijking vreemd wordt, omdat geen van beide kandidaten goed kan worden beoordeeld.

Sesame Preview bevat nergens een getal. Het productiemodel is niet uitgebracht en niet vermeld — geen model-ID, geen vermelding op de spraak-naar-spraak-ranglijst van Artificial Analysis, geen latentiedoelstelling, geen enkele benchmark. De kwalificatie van TestingCatalog — 'een van de beste spraakmodi op de markt' — is de consensus van recensenten, geen meting, en er is geen manier om het blind tegen wat dan ook te A/B-testen. Het enige Sesame-model dat iemand onafhankelijk kan draaien, is het open-weight-basismodel CSM-1B, en dat is een tekst-naar-spraak-checkpoint, niet de stem van de app.

NVIDIA NemotronLabs VoiceChat 11B {{1}}heeft het tegenovergestelde probleem{{/1}}: {{2}}het heeft cijfers, maar die cijfers zijn verdeeld over twee bewijsstandaarden die niet met elkaar overeenkomen{{/2}}. NVIDIA rapporteert {{3}}448 ms{{/3}} om een soepele beurt te nemen, {{4}}480 ms{{/4}} om de beurt af te staan bij onderbreking, en {{5}}een perfecte overnamerate van 1,0 bij gebruikersonderbrekingen{{/5}} — allemaal door de leverancier gemeten op NVIDIA's eigen Full-Duplex-Bench 1.0, {{6}}geen enkele onafhankelijk gereproduceerd{{/6}}. De onafhankelijke metingen van deze familie staan geregistreerd onder een andere naam en een ander aantal parameters — "Nemotron 3 VoiceChat (V1)" bij 12B, een label dat NVIDIA nooit heeft verzoend met de 11B-checkpoint op Hugging Face — en ze zijn onflatteus op het gebied van begrip: {{7}}29,2% op Big Bench Audio volgens Artificial Analysis{{/7}}, tegen {{8}}37,0% op NVIDIA's eigen kaart{{/8}}. Op VoiceBench scoort de familie 58,10, het beste open full-duplex resultaat op de ranglijst. Hetzelfde model is dus tegelijkertijd een koploper onder open full-duplex checkpoints en blijft ruwweg een factor drie achter op de gehoste realtime koplopers wat betreft het begrijpen van wat het hoort.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

De divergentie is dan ook niet welke beter is. Het is dat de twee kandidaten voor het beste gesprek van 2026 worden beoordeeld op tegengesteld en even onvolledig bewijs. De stem waarvan recensenten zeggen dat die het meest menselijk klinkt, heeft helemaal geen meting, en de stem met daadwerkelijke leaderboard-noteringen is degene waarvan de zwakke punten publiekelijk bekend zijn. Je kunt een reputatie niet vergelijken met een getal, en hier is er slechts één getal — en dat is niet het vleiende.

Toegang — een app-store download, of een 80 GB build

Als je een van beide wilt proberen, verschilt het startpunt op een manier die belangrijker is dan elke specificatie.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B is ook niet zomaar een download die je kunt draaien — het is een build die je zelf moet opzetten. Hugging Face stelt dat het model "niet door een Inference Provider wordt ingezet"; NVIDIA heeft het niet gehost; en de config.json in de repository is een NeMo-trainingsconfiguratie, dus er is geen Transformers-checkpoint waar je AutoModel op kunt richten. Het ondersteunde pad is een conda-omgeving vastgezet op Python 3.12, PyTorch 2.10 en Transformers 4.56, met causal-conv1d en mamba-ssm gecompileerd uit broncode, op een 80 GB GPU (A100, H100, H200, B200, of RTX 6000) met vLLM — of NVIDIA's NGC NIM-container, die een O​penAI Realtime-compatibele WebSocket aanbiedt op /v1/realtime zodra je op die hardware zit. De downloadteller vertelt het toegangsverhaal: ongeveer 80 downloads in de eerste maand van het model tegenover 107 likes. Mensen hebben het gebookmarkt; bijna niemand heeft het gedraaid. Een eerlijke opmerking voor de onderzoeker die dat wel doet: de redeneerruggengraat waarop dit checkpoint voortbouwt, Nemotron Nano 9B v2, is zelf een gehost model dat je vandaag kunt aanroepen — het full-duplex model eromheen is dat niet, en die kloof is precies het punt.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Prijs — een gratis app, gratis gewichten en de rekening van 80 GB

Beide modellen zijn "gratis," en het woord doet in beide gevallen evenveel misleidend werk.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

De eerlijke maatstaf voor de dag dat een van deze aanschafbaar wordt: welk gehost spraakmodel je ook kiest, de lijstprijs van de aanbieder is wat je betaalt, zonder routeringsopslag bovenop — de doorberekening die ervoor zorgt dat een prijsverlaging van de leverancier dezelfde dag in je factuur verschijnt in plaats van na een contractcyclus. Geen van beide modellen in dit stuk is aanroepbaar via OrcaRouter: Sesame's productiespraak heeft helemaal geen API, en NVIDIA NemotronLabs VoiceChat 11B is via niets aan te roepen. De maatstaf geldt voor de spraak die je daadwerkelijk kunt kopen, en het is precies de norm die een basisprijs van $7 per miljoen tekens T​TS of een toekomstige API met Sesame-kwaliteit gemakkelijk eerlijk te prijzen maakt.

Memory — de app die onthoudt versus het model dat vergeet

Hier is de kloof een canyon, en het is de meest concrete reden waarom de twee geen substituten zijn. De Sesame Preview-app onthoudt: elke agent beschikt over per-agent geheugen dat synchroniseert tussen web en mobiel wanneer je ingelogd bent, gesprekken kunnen tot 30 minuten duren, en Incognito-modus leest eerdere herinneringen zonder nieuwe te creëren. De open CSM-1B daarentegen heeft een 4K-contextvenster — ruwweg drie tot vier minuten tekst — en heeft toch geen oren om je te horen.

NVIDIA NemotronLabs VoiceChat 11B biedt maximaal ongeveer twee minuten audiocontext — de trainings-dataloader begrenst uitingen op 142,39 seconden, en de kaart waarschuwt dat gesprekken buiten een venster van twee minuten mogelijk niet worden bewaard. Voor een supportgesprek dat moet onthouden wat vier minuten geleden is afgesproken, is dat plafond op zichzelf al diskwalificerend. Voeg daarbij een enkele vaste stem (Aria) zonder klonen in het uitgebrachte checkpoint, en het model dat open is over zijn architectuur is ook het model dat geen klant kan onthouden of zijn eigen stem kan veranderen.

Waar elk van hen echt slecht in is

Verzameld, omdat een vergelijking die stopt bij sterke punten marketing is:

Sesame Preview: geen API — je kunt deze stem niet in een product gebruiken, en het productiemodel is niet uitgebracht en niet gescoord. Alleen Engels, geen taakuitvoering, een gesprekslimiet van 30 minuten, en geen enkele onafhankelijke benchmark. Het enige open model, CSM-1B, heeft een 4K-contextvenster, geen tool-aanroeping, geen luisterkant, en is niet de stem van de app.

NVIDIA NemotronLabs VoiceChat 11B: een uitsluitend onderzoekslicentie (OpenMDW v1.1) — je kunt het downloaden, bestuderen en finetunen, en je mag het niet uitbrengen, en dat geldt ook voor iedereen die erop voortbouwt. Er is geen gehost endpoint, dus 'uitproberen' betekent een 80 GB GPU en een build vanuit de broncode. Alleen Engels, een geheugenlimiet van ~2 minuten, één vaste stem. NVIDIA stelt dat het mogelijk slechter presteert dan zijn eigen backbone op het gebied van kennis en het opvolgen van instructies, waarbij meerstapsredeneren en rekenen als zwak worden aangemerkt. Het kan je midden in een zin onderbreken, na enkele beurten degraderen tot onherstelbare onzin of zelfpraat, woorden weglaten bij transcriptie, en het is uitdrukkelijk ongeschikt voor lawaaierige of galmende ruimtes. Het aanroepen van tools werkt alleen met uitsluitend ASCII-prompts en -responsen, maximaal vijf tools per sessie, en de nauwkeurigheid van de argumenten (44,2%) en het slagingspercentage bij de eerste poging (33%) betekenen dat het vaker de juiste tool kiest dan dat het de tool correct invult.

Wie moet welke kiezen

Omdat geen van beide aanroepbaar is, begint het eerlijke antwoord bij wat je probeert te doen.

Ervaar de best beoordeelde stem van 2026: Sesame Preview, gratis, vandaag — als een app. De vier agents, de onderbrekingsafhandeling, de drive-mode-bruikbaarheid die recensenten steeds aanhalen: dat is een consumentenproduct, en de waarde ervan is precies datgene wat je niet kunt meten.

Bestudeer full-duplex spraakmodellering: NVIDIA NemotronLabs VoiceChat 11B is de interessantere download in zijn categorie — een open 11B-checkpoint met een werkend tool-calling-kanaal, ongeveer 550.000 uur gemengde trainingsaudio, en het beste open full-duplex VoiceBench-resultaat tot nu toe, allemaal tegen een kostprijs van nul dollar voor de gewichten. De onderzoekslicentie is geen beperking voor dat werk.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Breng dit kwartaal een spraakproduct uit:geen van beide. Je hebt een gehost realtime spraak-naar-spraakmodel nodig met een commerciële licentie, en de veilige manier om een model te adopteren waarop je geen productiepad hebt ingezet, is om ernaartoe te routeren naast een bewezen model met automatische failover, zodat een onbewezen stem nooit een live gesprek platlegt. Eén API voor 200+ gehoste modellen tegen de lijstprijs van de provider, zonder opslag, zorgt ervoor dat het uitproberen van een nieuw beschikbare stem een configuratiewijziging is in plaats van een herschrijving.

Het patroon is het benoemen waard, omdat het zal terugkeren. Beide modellen zijn nog maar één gebeurtenis verwijderd van het aanroepbaar worden — Sesame op de dag dat het een model-ID of API uitbrengt, NVIDIA NemotronLabs VoiceChat 11B op de dag dat NVIDIA een commerciële licentie publiceert of iemand het host. Wanneer dat gebeurt, is de juiste zet niet om je huidige voice-stack eruit te trekken. Het is om de nieuwe stem naast de oude toe te voegen en te routeren met failover, precies zoals je zou doen voor elk nieuw, onbewezen model. Dit zijn de twee beste nog niet uit te brengen stemmen van 2026; de infrastructuur om de derde uit te brengen bestaat al.

Wat zou deze vergelijking veranderen?

Vier gebeurtenissen zouden dit stuk herschrijven. Een API of model-ID voor de productiestem van Sesame — op het moment dat dat gebeurt, houdt Sesame op een app te zijn en wordt het de nieuwkomer waar de gehoste voice-API-markt op heeft gewacht. Een commerciële licentie of een gehost endpoint voor NVIDIA NemotronLabs VoiceChat 11B zou een onderzoeksartefact van de ene op de andere dag in een echte productoptie veranderen. Een onafhankelijke score voor de Sesame-stem — een vermelding op het speech-to-speech-board van Artificial Analysis zou de claim van "beste stem" iets geven waartegen hij getoetst kan worden. En een technisch rapport van NVIDIA dat de 11B-checkpoint verzoent met de 12B-"Nemotron 3 VoiceChat (V1)"-vermeldingen die de ranglijsten meten, wat de voorwaarde is om de cijfers van de familie te vertrouwen. Totdat een van die dingen er is, is de accurate samenvatting simpel: de twee meest interessante conversationele stemmen van 2026 zijn beide op slot — de ene door een bedrijf dat niet wil verkopen, de andere door een licentie die niet wordt uitgebracht.

Veelgestelde vragen

Kan ik de stem van een van beide modellen gebruiken in mijn eigen app?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Welke van de twee klinkt eigenlijk menselijker?

Onbekend, om verschillende redenen voor elk. Sesame Preview heeft helemaal geen onafhankelijke score — TestingCatalog's "een van de beste spraakmodi die op de markt beschikbaar zijn" is consensus onder recensenten, geen meting. De conversatietiming van NVIDIA NemotronLabs VoiceChat 11B (448 ms beurtwisseling, 480 ms barge-in-reactietijd) is door NVIDIA gerapporteerd en niet onafhankelijk gereproduceerd, en diens onafhankelijke Big Bench Audio-cijfer (29,2%, volgens Artificial Analysis, vermeld onder "Nemotron 3 VoiceChat (V1)") meet begrip, niet hoe prettig de stem is. De ene heeft een reputatie die je kunt horen; de andere heeft cijfers die een andere vraag beantwoorden.

Is NVIDIA NemotronLabs VoiceChat 11B echt gratis?

De gewichten zijn gratis; het model is niet goedkoop. Het draaien ervan betekent een GPU van 80 GB (ruwweg $2–3 per uur op aanvraag, $1.500–2.200 per maand als je hem continu warm houdt) en een build vanuit de broncode, en de OpenMDW v1.1-licentie beperkt het gebruik tot uitsluitend onderzoeksdoeleinden — dus zelfs na die uitgave kun je het niet legaal aan klanten aanbieden.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube