Titelkort för 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': stor titel, underrubrik 'Rösten du inte kan licensiera, och rösten du inte kan släppa', och två platta ikonkort — 'Sesame Preview' med en telefon-och-person-linjeikon och en märkning 'Gratis app · inget API · recensenternas val', och 'NVIDIA NemotronLabs VoiceChat 11B' med en nedladdnings-och-server-linjeikon och en märkning 'Öppna vikter · endast forskning · självhostad'. Sidfot: 'Två bästa osläppbara röster — röst-AI, augusti 2026.' OrcaRouter-logotyp sammansatt längst ner till höger.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: Rösten du inte kan licensiera, och rösten du inte kan leverera

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två av de mest omtalade röstmodellerna från 2026 har något gemensamt som ingen lanseringsbevakning kommer att berätta för dig: du kan inte stoppa in någon av dem i en produkt. Sesame Preview är den kostnadsfria konsumentassistenten vars konversationsröst fick TestingCatalog att kalla den "en av de bästa röstlägena som finns på marknaden", och produktionsmodellen bakom den har inget API, inget modell-ID och ingen licens du kan köpa — företaget har helt enkelt inte släppt den. NVIDIA NemotronLabs VoiceChat 11B är spegelbilden: vikterna är offentliga, full-duplex-designen är en verklig första, och licensen tillåter endast forskningsändamål, så ingen kan lagligt distribuera den heller. Den ena är en röst du kan höra men inte hyra. Den andra är en röst du kan hålla men inte sälja. Detta är en jämförelse av två låsta dörrar, och den användbara frågan är vilket lås du står framför.

Två låsta dörrar, med olika lås

Börja med formen på var och en, eftersom namnen döljer hur olika de två produkterna är. Sesame Preview är en app, inte ett API. Den levereras med fyra agenter med distinkta personligheter – Maya (varm och kreativ), Miles (avslappnad och skarp), Simone (nyfiken och intellektuell), Charlie (kvick och varm) – var och en med sin egen röst och sitt eget minne som synkroniseras mellan webb och mobil när du är inloggad. Den söker på webben, gör djupdykningar, tar anteckningar och påminnelser och skickar en sammanfattning efter varje samtal. Förhandsvisningen är gratis utan betald nivå, endast på engelska, max 30 minuter per samtal när du är inloggad (annars fem), och den utför medvetet inte uppgifter: den kan brainstorma och forska, men den bokar inte din flygresa. Det finns ingen API-nyckel någonstans i produkten – produktionsrösten är en appfunktion, inte en endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B är den motsatta formen: en checkpoint, inte en produkt. Den anlände till Hugging Face den 3 augusti 2026 utan tillkännagivande – inget lanseringsinlägg, ingen teknisk rapport, ingen tweet; modellkortet är tillkännagivandet. Det är en full-duplex talmodell med 11B parametrar (vi tolkade safetensors-huvudet och räknade 11,095 miljarder parametrar över 1 626 tensorer) byggd som en enda stack: en Fast Conformer-kodare som bearbetar 16 kHz-ljud i 80 ms-ramar med noll högerkontext, en Nemotron Nano 9B v2-stomme som gör resonerandet, en NVIDIA TTS-avkodare som skriver 22,05 kHz-ljud, en RNN-T-avkodare som transkriberar användaren, och en separat utgångskanal som sänder ut verktygsanrops-skript utan att förorena det talade svaret. Den lyssnar och talar samtidigt, kan avbrytas mitt i ett ord, och NVIDIA marknadsför den som den första öppna full-duplex-modellen med verktygsanrop. Huruvida den marknadsföringen överlever kontakt med verkligheten är ämnet för ett eget avsnitt nedan.

Riktmärket där de skiljer sig åt — två kandidater för "bästa konversationen," två bristfälliga evidensstandarder

Båda modellerna satsar hela sitt rykte på samma sak: samtalskvalitet – turtagning, avbrott, naturlig tajming, känslan av ett äkta utbyte. Det är därför de överhuvudtaget hör hemma i samma rubrik. Det är också där jämförelsen blir märklig, eftersom ingen av kandidaterna kan bedömas på rätt sätt.

Sesame Preview har inget nummer någonstans. Produktionsmodellen är outgiven och olistad — ingen modell-ID, ingen post på Artificial Analysis' tal-till-tal-ledartavla, inget latensmål, inget riktmärke av något slag. TestingCatalogs "en av de bästa röstlägena som finns på marknaden" är recensentkonsensus, inte en mätning, och det finns inget sätt att blint A/B-testa den mot något. Den enda Sesame-modell som någon kan köra oberoende är open-weight CSM-1B bas, och det är en text-till-tal-checkpoint, inte appens röst.

NVIDIA NemotronLabs VoiceChat 11B har det motsatta problemet: den har siffror, men siffrorna är splittrade mellan två bevisstandarder som inte överensstämmer. NVIDIA rapporterar 448 ms för att ta en smidig tur, 480 ms för att lämna ordet när den avbryts, och en perfekt 1,0 övertagningsgrad vid användaravbrott — allt leverantörsuppmätt på NVIDIAs egen Full-Duplex-Bench 1.0, inget oberoende reproducerat. De oberoende mätningarna av denna familj är registrerade under ett annat namn och parameterantal — "Nemotron 3 VoiceChat (V1)" på 12B, en etikett som NVIDIA aldrig har stämt samman med 11B-checkpointen på Hugging Face — och de är föga smickrande på förståelsesidan: 29,2 % på Big Bench Audio enligt Artificial Analysis, mot 37,0 % på NVIDIAs eget modellkort. På VoiceBench får familjen 58,10, det bästa öppna full-duplexresultatet på listan. Så samma modell är samtidigt en ledare bland öppna full-duplex-checkpoints och ungefär tre gånger sämre än de värdbaserade realtidsledarna på att förstå vad den hör.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

Skillnaden handlar alltså inte om vilken som är bättre. Det handlar om att de två kandidaterna till 2026 års bästa konversation bedöms utifrån motsatta och lika ofullständiga bevis. Rösten som recensenterna säger känns mest mänsklig har ingen mätning alls, medan rösten med faktiska listplaceringar är den vars svagheter är offentliga. Man kan inte jämföra ett rykte med en siffra, och här finns bara en siffra – och det är inte den smickrande.

Access — en nedladdning från app store, eller en 80 GB-version

Om du vill prova någon av dem så skiljer sig startlinjen på ett sätt som betyder mer än någon spec.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B är inte heller en nedladdning du bara kan köra – det är en build du måste sätta upp. Hugging Face uppger att modellen "inte driftsätts av någon inferensleverantör"; NVIDIA har inte hostat den; och config.json i repot är en NeMo-träningskonfiguration, så det finns ingen Transformers-checkpoint som du kan peka AutoModel på. Den supportade vägen är en conda-miljö låst till Python 3.12, PyTorch 2.10 och Transformers 4.56, med causal-conv1d och mamba-ssm kompilerade från källkod, på en GPU med 80 GB (A100, H100, H200, B200 eller RTX 6000) som kör vLLM – eller NVIDIAs NGC NIM-container, som exponerar en O​penAI Realtime-kompatibel WebSocket på /v1/realtime när du väl är på den hårdvaran. Nedladdningsräknaren berättar historien om tillgången: ungefär 80 nedladdningar under modellens första månad mot 107 likes. Folk bokmärkte den; nästan ingen körde den. En ärlig notering för den forskare som gör det: resonemangsgrunden som denna checkpoint bygger på, Nemotron Nano 9B v2, är i sig en hostad modell du kan anropa idag – den full-duplexa modellen runt den är det inte, och det gapet är hela poängen.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Pris — en gratis app, fria vikter och 80 GB-räkningen

Båda modellerna är "gratis", och ordet är lika vilseledande i båda fallen.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

Den ärliga måttstocken för den dag då någon av dessa blir köpbar: vilken värdbaserad röstmodell du än hamnar på, är leverantörens listpris vad du ska betala, utan routingpåslag — genomsläppet som gör att en prissänkning från leverantören syns i din faktura samma dag snarare än efter en kontraktsperiod. Ingen av modellerna i den här texten är anropsbar via OrcaRouter: Sesames produktionsröst har inget API alls, och NVIDIA NemotronLabs VoiceChat 11B är inte anropsbar via någonting. Måttstocken gäller för rösten du faktiskt kan köpa, och det är exakt den standard som gör en T​TS-bas på $7 per miljon tecken eller ett framtida API av Sesame-kvalitet lätt att prissätta ärligt.

Memory — appen som minns vs modellen som glömmer

Här är gapet en kanjon, och det är den mest konkreta anledningen till att de två inte är substitut. Sesame Preview-appen kommer ihåg: varje agent bär på ett agentspecifikt minne som synkroniseras mellan webb och mobil när du är inloggad, samtal kan pågå i upp till 30 minuter, och Incognito Mode läser tidigare minnen utan att skapa nya. Den öppna CSM-1B har däremot ett 4K-kontextfönster — ungefär tre till fyra minuters text — och inga öron att höra dig med i alla fall.

NVIDIA NemotronLabs VoiceChat 11B rymmer som mest ungefär två minuters ljudkontext — träningsdataloadern begränsar yttranden till 142,39 sekunder, och kortet varnar för att konversationer som sträcker sig längre än ett tvåminutersfönster kanske inte behålls. För ett support-samtal som behöver komma ihåg vad man kom överens om för fyra minuter sedan, är detta tak diskvalificerande i sig. Lägg till en enda fast röst (Aria) utan kloning i den släppta checkpointen, och modellen som är öppen med sin arkitektur är också modellen som inte kan komma ihåg en kund eller ändra sin egen röst.

Vad var och en verkligen är dålig på

Samlat, eftersom en jämförelse som stannar vid styrkor är marknadsföring:

Sesame Preview: inget API — du kan inte använda den här rösten i en produkt, och produktionsmodellen är varken släppt eller poängsatt. Endast engelska, inget uppgiftsutförande, en samtalsgräns på 30 minuter och inget oberoende riktmärke av något slag. Den enda öppna modellen, CSM-1B, har ett 4K-kontextfönster, inget verktygsanrop, ingen lyssningssida och är inte appens röst.

NVIDIA NemotronLabs VoiceChat 11B: en forskningslicens (OpenMDW v1.1) — du kan ladda ner, studera och finjustera den, men du kan inte distribuera den, och inte heller någon som bygger vidare på den. Ingen värdbaserad slutpunkt, så "att prova den" innebär en 80 GB GPU och en kompilering från källkod. Endast engelska, ett minnestak på ~2 minuter, en fast röst. NVIDIA uppger att den kan underprestera i förhållande till sin egen grundmodell när det gäller kunskap och instruktionsföljning, med flerstegsresonemang och aritmetik utpekade som svaga. Den kan avbryta dig mitt i en mening, försämras till icke-återställbart dravel eller självprat efter flera vändor, tappa ord i transkriptionen, och den är uttryckligen olämplig för bullriga eller efterklangsrika rum. Verktygsanrop fungerar endast med ASCII-baserade uppmaningar och svar, max fem verktyg per session, och dess argumentnoggrannhet (44,2 %) och frekvens för lyckade första försök (33 %) innebär att den väljer rätt verktyg mer tillförlitligt än den fyller i verktyget.

Vem ska välja vilken

Eftersom ingen av dem är anropsbar, utgår det ärliga svaret från vad du försöker göra.

Upplev den bäst recenserade rösten 2026: Sesame Preview, gratis, idag — som en app. De fyra agenterna, avbrottshanteringen, användbarheten i körläge som recensenterna lyfter fram: det är en konsumentprodukt, och dess värde är precis det du inte kan mäta.

Studera full-duplex talmodellering:NVIDIA NemotronLabs VoiceChat 11B är den mer intressanta nedladdningen i sin kategori — en öppen 11B-checkpoint med en fungerande verktygsanropskanal, ungefär 550 000 timmar av blandat träningsljud och det bästa öppna full-duplex VoiceBench-resultatet hittills, allt till en kostnad av noll dollar för vikterna. Forskningslicensen är inte en begränsning för det arbetet.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Lansera en röstprodukt detta kvartal:Inget av dessa. Du behöver en värdbaserad realtidsmodell för tal-till-tal med kommersiell licens, och det säkra sättet att ta en sådan i bruk när du inte har baserat din produktion på den är att dirigera trafiken till den vid sidan av en beprövad modell med automatisk omkoppling, så att en oprövad röst aldrig tar ner ett pågående samtal. Ett enda API för 200+ värdbaserade modeller till leverantörens listpris, utan påslag, är det som gör att en nyutgiven röst blir en konfigurationsändring snarare än en omskrivning.

Mönstret är värt att namnge eftersom det kommer att återkomma. Båda dessa modeller är bara en händelse ifrån att bli anropsbara — {{1}}Sesame den dag det släpper ett modell-ID eller API{{/1}}, {{2}}NVIDIA NemotronLabs VoiceChat 11B den dag NVIDIA publicerar en kommersiell licens eller någon hostar den{{/2}}. När det händer är det rätta draget inte att riva ut din nuvarande röststack. Det är att lägga till den nya rösten bredvid den gamla och dirigera med failover, precis som du skulle göra med vilken ny, oprövad modell som helst. Dessa är de två bästa osläppbara rösterna under 2026; infrastrukturen för att släppa den tredje finns redan.

Vad skulle ändra denna jämförelse

Fyra händelser skulle skriva om den här texten. Ett API eller modell-ID för Sesames produktionsröst – i det ögonblick det sker slutar Sesame vara en app och blir den aktör som den värdbaserade röst-API-marknaden har väntat på. En kommersiell licens eller en värdbaserad slutpunkt för NVIDIA NemotronLabs VoiceChat 11B, vilket över en natt skulle förvandla en forskningsartefakt till ett verkligt produktalternativ. Ett oberoende betyg för Sesames röst – en notering på Artificial Analysis speech-to-speech-ledartavla skulle ge påståendet om ”bästa rösten” något att ställas mot. Och en teknikrapport från NVIDIA som stämmer av 11B-checkpointen mot de 12B-poster med ”Nemotron 3 VoiceChat (V1)” som ledartavlorna mäter, vilket är förutsättningen för att lita på någon av familjens siffror. Tills något av detta inträffar är den korrekta sammanfattningen enkel: de två mest intressanta konversationsrösterna under 2026 är båda låsta – den ena av ett företag som inte vill sälja, den andra av en licens som inte kommer att levereras.

FAQ

Kan jag använda någon av modellernas röst i min egen app?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Vilken av de två låter egentligen mer mänsklig?

Okänt, av olika skäl för varje. Sesame Preview har ingen oberoende poäng alls – TestingCatalogs "en av de bästa röstlägena på marknaden" är recensentkonsensus, inte en mätning. NVIDIA NemotronLabs VoiceChat 11B:s konversationstajming (448 ms turbyte, 480 ms barge-in-överlämning) är NVIDIA-rapporterad och inte oberoende reproducerad, och dess oberoende Big Bench Audio-siffra (29,2 %, enligt Artificial Analysis, klassificerad under "Nemotron 3 VoiceChat (V1)") mäter förståelse, inte hur behaglig rösten är. Den ena har ett rykte du kan höra; den andra har siffror som svarar på en annan fråga.

Är NVIDIA NemotronLabs VoiceChat 11B verkligen gratis?

Vikterna är gratis; modellen är inte billig. Att köra den innebär en 80 GB GPU (ungefär $2–3 i timmen vid behov, $1 500–2 200 i månaden om den hålls kontinuerligt varm) och att bygga från källkod, och OpenMDW v1.1-licensen begränsar den till endast forskningsändamål — så även efter den kostnaden kan du inte lagligen ställa den framför kunder.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube