Card del titolo per 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': titolo grande, sottotitolo 'La voce che non puoi ottenere in licenza e la voce che non puoi rilasciare', e due card con icone piatte — 'Sesame Preview' con un'icona lineare telefono-e-persona e un badge con scritto 'App gratuita · senza API · scelta dei recensori', e 'NVIDIA NemotronLabs VoiceChat 11B' con un'icona lineare download-e-server e un badge con scritto 'Pesi aperti · solo ricerca · self-host'. Piè di pagina: 'Le due migliori voci non distribuibili — voce AI, agosto 2026.' Logo OrcaRouter composito in basso a destra.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: la voce che non puoi ottenere in licenza, e la voce che non puoi distribuire

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due dei modelli vocali più discussi del 2026 hanno qualcosa in comune che nessuna copertura del lancio vi dirà: non potete integrare nessuno dei due in un prodotto. Sesame Preview è l'assistente consumer gratuito la cui voce conversazionale ha portato TestingCatalog a definirlo "una delle migliori modalità vocali disponibili sul mercato", e il modello di produzione sottostante non ha API, né ID del modello, né una licenza acquistabile — l'azienda semplicemente non lo ha rilasciato. NVIDIA NemotronLabs VoiceChat 11B è l'immagine speculare: i pesi sono pubblici, il design full-duplex è un'autentica novità, e la licenza consente solo uso a scopo di ricerca, quindi nessuno può legalmente distribuirlo. Uno è una voce che puoi ascoltare ma non noleggiare. L'altro è una voce che puoi tenere ma non vendere. Questo è un confronto tra due porte chiuse a chiave, e la domanda utile è davanti a quale serratura ti trovi.

Due porte chiuse a chiave, con serrature diverse.

Iniziate dalla forma di ciascuno, perché i nomi nascondono quanto diversi siano i due prodotti. Sesame Preview è un'app, non un'API. Include quattro agenti con personalità distinte — Maya (calda e creativa), Miles (rilassato e acuto), Simone (curiosa e intellettuale), Charlie (spiritoso e caloroso) — ciascuno con la propria voce e la propria memoria che si sincronizza tra web e mobile quando si è connessi. Cerca sul web, fa ricerche approfondite, prende appunti e promemoria, e invia un riepilogo dopo ogni chiamata. L'anteprima è gratuita senza piani a pagamento, solo in inglese, con un limite di 30 minuti per chiamata quando si è connessi (cinque altrimenti), e deliberatamente non esegue compiti: farà brainstorming e ricerche, ma non prenoterà il tuo volo. Non c'è alcuna chiave API nel prodotto — la voce di produzione è una funzionalità dell'app, non un endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B è l'esatto opposto: un checkpoint, non un prodotto. È arrivato su Hugging Face il 3 agosto 2026 senza alcun annuncio — nessun post di lancio, nessun report tecnico, nessun tweet; la scheda del modello è l'annuncio. È un modello vocale full-duplex da 11B parametri (abbiamo analizzato l'intestazione dei safetensors e contato 11,095 miliardi di parametri distribuiti su 1.626 tensori) costruito come un unico stack: un encoder Fast Conformer che elabora audio a 16 kHz in frame da 80 ms con zero contesto a destra, un backbone Nemotron Nano 9B v2 che si occupa del ragionamento, un decoder TTS NVIDIA che genera audio a 22,05 kHz, un decoder RNN-T che trascrive l'utente e un canale di output separato che emette script di tool calling senza contaminare la risposta parlata. Ascolta e parla allo stesso tempo, può essere interrotto a metà parola e NVIDIA lo presenta come il primo modello open full-duplex con tool calling. Se questa definizione regga al contatto con la realtà è oggetto della sezione a essa dedicata qui sotto.

Il benchmark dove divergono — due candidati per la "migliore conversazione," due standard di prova difettosi

Entrambi i modelli basano la loro intera reputazione sulla stessa cosa: la qualità conversazionale — alternanza dei turni, interruzioni, tempismo naturale, la sensazione di un vero scambio. È per questo che meritano di comparire nello stesso titolo. Ed è anche qui che il confronto diventa strano, perché nessuno dei due contendenti può essere valutato correttamente.

Sesame Preview non ha alcun numero da nessuna parte. Il modello di produzione non è stato rilasciato né elencato — nessun ID del modello, nessuna voce nella classifica speech-to-speech di Artificial Analysis, nessun obiettivo di latenza, nessun benchmark di alcun tipo. La frase di TestingCatalog "una delle migliori modalità vocali disponibili sul mercato" è un consenso dei recensori, non una misurazione, e non c'è modo di sottoporla a un test A/B alla cieca contro qualsiasi altra cosa. L'unico modello Sesame che chiunque può eseguire in modo indipendente è il modello base CSM-1B a peso aperto, e quello è un checkpoint di text-to-speech, non la voce dell'app.

NVIDIA NemotronLabs VoiceChat 11B ha il problema opposto: ha dei numeri, ma i numeri sono divisi tra due standard di prova che non concordano. NVIDIA riporta 448 ms per prendere un turno in modo fluido, 480 ms per cedere quando viene interrotta, e un perfetto tasso di takeover di 1.0 sull'interruzione dell'utente — tutti misurati dal fornitore sul proprio Full-Duplex-Bench 1.0, nessuno riprodotto in modo indipendente. Le misurazioni indipendenti di questa famiglia sono registrate sotto un nome e un numero di parametri diversi — "Nemotron 3 VoiceChat (V1)" a 12B, un'etichetta che NVIDIA non ha mai riconciliato con il checkpoint 11B su Hugging Face — e sono poco lusinghiere sul lato della comprensione: 29.2% su Big Bench Audio secondo Artificial Analysis, contro il 37.0% sulla propria scheda NVIDIA. Su VoiceBench la famiglia ottiene 58.10, il miglior risultato open full-duplex in classifica. Quindi lo stesso modello è contemporaneamente un leader tra i checkpoint open full-duplex e circa tre volte indietro rispetto ai leader realtime ospitati nel capire ciò che sente.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

La divergenza, quindi, non è su quale sia migliore. È che i due candidati per la migliore conversazione del 2026 vengono giudicati sulla base di prove opposte e ugualmente incomplete. La voce che i recensori dicono sembrare la più umana non ha alcuna misurazione, e la voce con posizioni reali in classifica è quella i cui punti deboli sono pubblici. Non si può paragonare una reputazione a un numero, e qui c'è un solo numero — e non è quello lusinghiero.

Accesso — un download dall'app store o una build da 80 GB

Se vuoi provare uno dei due, la linea di partenza differisce in un modo che conta più di qualsiasi specifica.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B non è un download che puoi semplicemente eseguire: è una build che devi mettere in piedi. Hugging Face afferma che il modello "non è distribuito da alcun Inference Provider"; NVIDIA non lo ha ospitato; e il config.json nel repository è una configurazione di addestramento NeMo, quindi non esiste un checkpoint Transformers a cui puoi puntare AutoModel. Il percorso supportato è un ambiente conda ancorato a Python 3.12, PyTorch 2.10 e Transformers 4.56, con causal-conv1d e mamba-ssm compilati dal sorgente, su una GPU da 80 GB (A100, H100, H200, B200 o RTX 6000) con vLLM — oppure il container NGC NIM di NVIDIA, che espone un WebSocket compatibile con OpenAI Realtime su /v1/realtime una volta che sei su quell'hardware. Il contatore dei download racconta la storia dell'accesso: circa 80 download nel primo mese del modello contro 107 like. Le persone lo hanno aggiunto ai segnalibri; quasi nessuno lo ha eseguito. Una nota onesta per il ricercatore che lo fa: il backbone di reasoning su cui si basa questo checkpoint, Nemotron Nano 9B v2, è esso stesso un modello ospitato che puoi chiamare oggi — il modello full-duplex che lo circonda non lo è, e questo divario è il punto centrale.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Prezzo — un'app gratuita, pesi gratuiti e la bolletta da 80 GB.

Entrambi i modelli sono "gratuiti", e la parola fa la stessa quantità di lavoro fuorviante in entrambi i casi.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

Il metro di giudizio onesto per il giorno in cui uno di questi diventa acquistabile: qualunque modello vocale hosted tu scelga, il prezzo di listino del fornitore è ciò che dovresti pagare, senza alcun ricarico di instradamento — il pass-through che fa sì che un taglio di prezzo del fornitore compaia in fattura lo stesso giorno, piuttosto che dopo un ciclo contrattuale. Nessuno dei due modelli citati è chiamabile tramite OrcaRouter: la voce di produzione di Sesame non ha alcuna API, e NVIDIA NemotronLabs VoiceChat 11B non è chiamabile tramite nulla. Il metro di giudizio vale per la voce che puoi effettivamente acquistare, ed è esattamente lo standard che rende facile valutare onestamente una base TTS a 7 dollari per milione di caratteri o una futura API di qualità Sesame.

Memory — l'app che ricorda vs il modello che dimentica

Qui il divario è un canyon, ed è la ragione più concreta per cui i due non sono sostituti. Sesame Preview, l'app, ricorda: ogni agente possiede una memoria per agente che si sincronizza tra web e mobile quando sei connesso, le chiamate possono durare fino a 30 minuti e Incognito Mode legge i ricordi passati senza crearne di nuovi. Il CSM-1B open, al contrario, ha una finestra di contesto 4K — circa tre o quattro minuti di testo — e non ha comunque orecchie per sentirti.

NVIDIA NemotronLabs VoiceChat 11B mantiene al massimo circa due minuti di contesto audio — il dataloader di addestramento limita gli enunciati a 142,39 secondi, e la scheda avverte che la conversazione oltre una finestra di due minuti potrebbe non essere conservata. Per una chiamata di supporto che deve ricordare ciò che è stato concordato quattro minuti fa, quel tetto è di per sé disqualificante. Aggiungete una singola voce fissa (Aria) senza clonazione nel checkpoint rilasciato, e il modello che è trasparente sulla propria architettura è anche il modello che non può ricordare un cliente o cambiare la propria voce.

Ciò in cui ciascuno è davvero scarso

Raccolto, perché un confronto che si ferma ai punti di forza è marketing:

Sesame Preview: nessuna API — non puoi mettere questa voce in un prodotto, e il modello di produzione non è rilasciato né valutato. Solo inglese, nessuna esecuzione di task, un limite di 30 minuti per chiamata, e nessun benchmark indipendente di alcun tipo. L'unico modello aperto, CSM-1B, ha una finestra di contesto di 4K, nessuna chiamata di strumenti, nessuna capacità di ascolto, e non è la voce dell'app.

NVIDIA NemotronLabs VoiceChat 11B: una licenza solo per la ricerca (OpenMDW v1.1) — puoi scaricarlo, studiarlo e farne il fine-tuning, ma non puoi distribuirlo, e nemmeno chi lo usa come base può farlo. Nessun endpoint ospitato, quindi "provarlo" significa una GPU da 80 GB e una build dai sorgenti. Solo inglese, un limite di memoria di circa 2 minuti, una sola voce fissa. NVIDIA dichiara che potrebbe avere prestazioni inferiori al proprio backbone su conoscenza e capacità di seguire le istruzioni, con il ragionamento multi-step e l'aritmetica segnalati come deboli. Può interromperti a metà frase, degenerare in discorsi incoerenti irrecuperabili o in un dialogo con sé stesso dopo diversi turni, omettere parole nella trascrizione, ed è esplicitamente inadatto ad ambienti rumorosi o riverberanti. Il tool calling funziona solo con prompt e risposte esclusivamente ASCII, arriva al massimo a cinque strumenti per sessione, e la sua accuratezza sugli argomenti (44.2%) e il tasso di successo al primo tentativo (33%) significano che sceglie lo strumento giusto in modo più affidabile di quanto non riesca a fornirne gli argomenti.

Chi dovrebbe scegliere cosa

Poiché nessuno dei due è chiamabile, la risposta onesta parte da ciò che stai cercando di fare.

Prova la voce meglio recensita del 2026: Sesame Preview, gratis, oggi — come app. I quattro agenti, la gestione delle interruzioni, l'usabilità in modalità guida che i recensori continuano a citare: questo è un prodotto di consumo, e il suo valore è proprio ciò che non puoi misurare.

Studia la modellazione del parlato full-duplex: NVIDIA NemotronLabs VoiceChat 11B è il download più interessante nella sua categoria — un checkpoint open da 11B con un canale di tool-calling funzionante, circa 550.000 ore di audio di addestramento misto, e il miglior risultato open full-duplex su VoiceBench finora, il tutto al costo di zero dollari per i pesi. La licenza di sola ricerca non è un vincolo per quel lavoro.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Rilascia un prodotto vocale entro questo trimestre: nessuna di queste. Ti serve un modello da parlato a parlato in tempo reale, ospitato e con licenza commerciale, e il modo sicuro per adottare un modello su cui non hai puntato la produzione è instradare il traffico verso di esso affiancandolo a un modello collaudato con failover automatico, così una voce non collaudata non farà mai cadere una chiamata attiva. Un'unica API su oltre 200 modelli ospitati al prezzo di listino del fornitore, senza ricarichi, è ciò che rende provare una voce appena disponibile un cambio di configurazione piuttosto che una riscrittura.

Il pattern merita un nome perché si ripeterà. Entrambi questi modelli sono a un solo evento dal diventare chiamabili: Sesame il giorno in cui rilascerà un model ID o un'API, NVIDIA NemotronLabs VoiceChat 11B il giorno in cui NVIDIA pubblicherà una licenza commerciale o qualcuno lo ospiterà. Quando ciò accadrà, la mossa giusta non è smantellare lo stack vocale attuale, ma aggiungere la nuova voce accanto a quella vecchia e instradare con failover, esattamente come faresti per qualsiasi nuovo modello non collaudato. Queste sono le due migliori voci non distribuibili del 2026; l'infrastruttura per distribuire la terza esiste già.

Cosa cambierebbe questo confronto

Quattro eventi riscriverebbero questo pezzo. Un'API o un ID di modello per la voce di produzione di Sesame — nel momento in cui ciò accade, Sesame smette di essere un'app e diventa il nuovo concorrente che il mercato delle API vocali ospitate stava aspettando. Una licenza commerciale o un endpoint ospitato per NVIDIA NemotronLabs VoiceChat 11B, che trasformerebbe un artefatto di ricerca in una vera opzione di prodotto da un giorno all'altro. Un punteggio indipendente per la voce di Sesame — una presenza nella classifica speech-to-speech di Artificial Analysis darebbe all'affermazione di "miglior voce" un parametro di confronto. E un report tecnico di NVIDIA che concili il checkpoint 11B con le voci "Nemotron 3 VoiceChat (V1)" da 12B misurate dalle leaderboard, precondizione per potersi fidare dei numeri dell'intera famiglia. Finché nessuna di queste cose si concretizza, il riassunto accurato è semplice: le due voci conversazionali più interessanti del 2026 sono entrambe bloccate — una da un'azienda che non vuole vendere, l'altra da una licenza che non verrà rilasciata.

Domande frequenti

Posso usare la voce di uno dei due modelli all'interno della mia app?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Quale dei due suona effettivamente più umano?

Ignoto, per ragioni diverse in ciascun caso. Sesame Preview non ha alcun punteggio indipendente: il giudizio di TestingCatalog — "una delle migliori modalità vocali disponibili sul mercato" — è consenso dei recensori, non una misurazione. I tempi conversazionali di NVIDIA NemotronLabs VoiceChat 11B (448 ms per il cambio di turno, 480 ms di resa al barge-in) sono dichiarati da NVIDIA e non replicati, e il suo risultato indipendente su Big Bench Audio (29,2%, secondo Artificial Analysis, archiviato sotto "Nemotron 3 VoiceChat (V1)") misura la comprensione, non quanto sia piacevole la voce. Uno ha una reputazione che puoi sentire; l'altro ha numeri che rispondono a una domanda diversa.

NVIDIA NemotronLabs VoiceChat 11B è davvero gratuito?

I pesi sono gratuiti; il modello non è economico. Eseguirlo significa una GPU da 80 GB (circa 2–3 dollari l'ora on demand, 1.500–2.200 dollari al mese se mantenuta costantemente attiva) e una build dal sorgente, e la licenza OpenMDW v1.1 lo limita a soli scopi di ricerca — quindi anche dopo quella spesa, non puoi legalmente metterlo davanti ai clienti.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube