
Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: Die Stimme, die man nicht lizenzieren kann, und die Stimme, die man nicht ausliefern kann
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenNEUQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekNEUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenz69Coding60Mathe
Zwei der meistbesprochenen Sprachmodelle des Jahres 2026 haben etwas gemeinsam, das in keiner der Startberichte erwähnt wird: Man kann keines von beiden in ein Produkt einbauen. Sesame Preview ist der kostenlose Verbraucher-Assistent, dessen Gesprächsstimme TestingCatalog dazu brachte, es als "eine der besten Sprachmodi auf dem Markt" zu bezeichnen, und das Produktionsmodell dahinter hat keine API, keine Modell-ID und keine Lizenz, die man kaufen kann – das Unternehmen hat es schlicht nicht veröffentlicht. NVIDIA NemotronLabs VoiceChat 11B ist das Spiegelbild: Die Gewichte sind öffentlich, das Full-Duplex-Design ist eine echte Premiere, und die Lizenz besagt, dass es nur für Forschungszwecke ist, sodass es auch niemand legal vertreiben kann. Das eine ist eine Stimme, die man hören, aber nicht mieten kann. Das andere ist eine Stimme, die man in Händen halten, aber nicht verkaufen kann. Dies ist ein Vergleich zweier verschlossener Türen, und die nützliche Frage ist, vor welchem Schloss man steht.
Zwei verschlossene Türen, mit unterschiedlichen Schlössern.
Beginnen Sie mit der Form der einzelnen Produkte, denn die Namen verbergen, wie unterschiedlich die beiden Produkte sind. Sesame Preview ist eine App, keine API. Es enthält vier Agents mit unterschiedlichen Persönlichkeiten – Maya (warm und kreativ), Miles (locker und scharfsinnig), Simone (neugierig und intellektuell), Charlie (witzig und warmherzig) – jeder mit eigener Stimme und eigenem Gedächtnis, das sich über Web und Mobilgeräte synchronisiert, wenn Sie angemeldet sind. Es durchsucht das Web, geht auf tiefe Recherchen, macht Notizen und Erinnerungen und sendet nach jedem Anruf eine Zusammenfassung. Die Vorschau ist kostenlos, ohne kostenpflichtige Stufe, nur auf Englisch, auf 30 Minuten pro Anruf begrenzt, wenn Sie angemeldet sind (andernfalls fünf), und sie führt bewusst keine Aufgaben aus: Sie kann Ideen entwickeln und recherchieren, aber sie wird Ihnen keinen Flug buchen. In dem gesamten Produkt gibt es keinen API-Schlüssel – die Produktionsstimme ist eine App-Funktion, kein Endpunkt.

NVIDIA NemotronLabs VoiceChat 11B ist die gegenteilige Form: ein Checkpoint, kein Produkt. Es erschien am 3. August 2026 auf Hugging Face ohne Ankündigung – kein Launch-Beitrag, kein Tech-Report, kein Tweet; die Modellkarte ist die Ankündigung. Es ist ein Full-Duplex-Sprachmodell mit 11B Parametern (wir haben den Safetensors-Header geparst und 11,095 Milliarden Parameter über 1.626 Tensoren gezählt), das als ein Stack aufgebaut ist: ein Fast-Conformer-Encoder, der 16-kHz-Audio in 80-ms-Frames mit null Rechtskontext verarbeitet, ein Nemotron-Nano-9B-v2-Backbone, das die Schlussfolgerungen übernimmt, ein NVIDIA-TTS-Decoder, der 22,05-kHz-Audio erzeugt, ein RNN-T-Decoder, der den Benutzer transkribiert, und ein separater Ausgabekanal, der Tool-Calling-Skripte ausgibt, ohne die gesprochene Antwort zu kontaminieren. Es hört und spricht gleichzeitig, kann mitten im Wort unterbrochen werden, und NVIDIA bezeichnet es als das erste offene Full-Duplex-Modell mit Tool-Calling. Ob diese Behauptung dem Kontakt mit der Realität standhält, ist Gegenstand eines eigenen Abschnitts weiter unten.
Der Maßstab, an dem sie sich scheiden — zwei Kandidaten für das „beste Gespräch“, zwei kaputte Beweisstandards.
Beide Modelle setzen ihren gesamten Ruf auf dieselbe Sache: Gesprächsqualität — Sprecherwechsel, Unterbrechungen, natürliches Timing, das Gefühl eines echten Austauschs. Genau deshalb gehören sie überhaupt in eine gemeinsame Schlagzeile. Und genau hier wird der Vergleich seltsam, denn keiner der beiden Kandidaten kann wirklich bewertet werden.
Sesame Preview hat keinerlei Zahlen. Das Produktionsmodell ist unveröffentlicht und nicht gelistet – keine Modell-ID, kein Eintrag auf der Speech-to-Speech-Bestenliste von Artificial Analysis, kein Latenzziel, keinerlei Benchmark. TestingCatalogs „einer der besten Sprachmodi auf dem Markt“ ist der Konsens der Rezensenten, keine Messung, und es gibt keine Möglichkeit, einen Blind-A/B-Test gegen irgendetwas durchzuführen. Das einzige Sesame-Modell, das jemand unabhängig ausführen kann, ist das Open-Weight-Basismodell CSM-1B, und das ist ein Text-to-Speech-Checkpoint, nicht die Stimme der App.
NVIDIA NemotronLabs VoiceChat 11B hat das gegenteilige Problem: Es hat Zahlen, aber die Zahlen verteilen sich auf zwei Beweisstandards, die nicht übereinstimmen. NVIDIA berichtet 448 ms für einen flüssigen Turn, 480 ms, um bei Unterbrechung das Wort abzugeben, und eine perfekte Übernahmerate von 1,0 bei Nutzerunterbrechungen – alles vom Anbieter auf NVIDIAs eigenem Full-Duplex-Bench 1.0 gemessen, nichts davon unabhängig reproduziert. Die unabhängigen Messungen dieser Familie sind unter einem anderen Namen und einer anderen Parameteranzahl abgelegt – „Nemotron 3 VoiceChat (V1)" mit 12B, eine Bezeichnung, die NVIDIA nie mit dem 11B-Checkpoint auf Hugging Face abgeglichen hat – und sie fallen auf der Verständnisseite wenig schmeichelhaft aus: 29,2 % bei Big Bench Audio laut Artificial Analysis, gegenüber 37,0 % auf NVIDIAs eigener Karte. Bei VoiceBench erreicht die Familie 58,10, das beste offene Vollduplex-Ergebnis auf dem Leaderboard. Dasselbe Modell ist also gleichzeitig ein Spitzenreiter unter den offenen Vollduplex-Checkpoints und liegt beim Verstehen des Gehörten etwa um den Faktor drei hinter den gehosteten Echtzeit-Spitzenreitern.

Die Divergenz ist also nicht, welche besser ist. Es ist so, dass die beiden Kandidaten für das beste Gespräch 2026 anhand gegensätzlicher und gleichermaßen unvollständiger Belege beurteilt werden. Die Stimme, von der die Rezensenten sagen, dass sie sich am menschlichsten anfühlt, hat überhaupt keine Messung, und die Stimme mit tatsächlichen Leaderboard-Einträgen ist diejenige, deren Schwächen öffentlich sind. Man kann einen Ruf nicht mit einer Zahl vergleichen, und hier gibt es nur eine Zahl – und die ist nicht die schmeichelhafte.
Access — ein App-Store-Download oder ein 80-GB-Build
Wenn Sie eines davon ausprobieren möchten, unterscheidet sich die Startlinie in einer Weise, die mehr zählt als jede Spezifikation.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B ist auch kein Download, den man einfach ausführen kann – es ist ein Build, den man aufsetzen muss. Hugging Face gibt an, dass das Modell „von keinem Inference-Provider bereitgestellt wird"; NVIDIA hat es nicht gehostet; und die config.json im Repository ist eine NeMo-Trainingskonfiguration, es gibt also keinen Transformers-Checkpoint, den man AutoModel übergeben kann. Der unterstützte Weg ist eine Conda-Umgebung, gepinnt auf Python 3.12, PyTorch 2.10 und Transformers 4.56, mit aus dem Quellcode kompilierten causal-conv1d- und mamba-ssm-Paketen, auf einer 80-GB-GPU (A100, H100, H200, B200 oder RTX 6000) mit vLLM – oder dem NGC-NIM-Container von NVIDIA, der einen OpenAI-Realtime-kompatiblen WebSocket unter /v1/realtime bereitstellt, sobald man diese Hardware nutzt. Der Download-Zähler erzählt die Geschichte des Zugriffs: rund 80 Downloads im ersten Monat des Modells gegenüber 107 Likes. Viele haben es mit einem Lesezeichen versehen; fast niemand hat es ausgeführt. Eine ehrliche Anmerkung für den Forscher, der es tatsächlich ausführt: Das Reasoning-Backbone, auf dem dieser Checkpoint aufbaut, Nemotron Nano 9B v2, ist selbst ein gehostetes Modell, das man heute aufrufen kann – das Vollduplex-Modell darum herum ist es nicht, und genau diese Lücke ist der springende Punkt.

Preis — eine kostenlose App, kostenlose Gewichte und die 80-GB-Rechnung.
Beide Modelle sind „kostenlos", und das Wort leistet in beiden Fällen dieselbe irreführende Arbeit.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
Der ehrliche Maßstab für den Tag, an dem eines dieser Modelle kaufbar wird: Welches gehostete Sprachmodell Sie auch wählen, Sie sollten den Listenpreis des Anbieters zahlen, ohne Routing-Aufschlag obendrauf — die Durchreichung, die eine Preissenkung des Anbieters noch am selben Tag in Ihrer Rechnung erscheinen lässt und nicht erst nach einem Vertragszyklus. Keines der Modelle in diesem Artikel ist über OrcaRouter aufrufbar: Sesames Produktionssprache hat überhaupt keine API, und NVIDIA NemotronLabs VoiceChat 11B ist über nichts aufrufbar. Der Maßstab gilt für die Stimme, die Sie tatsächlich kaufen können, und genau das ist der Standard, der es leicht macht, eine TTS-Basis von 7 $ pro Million Zeichen oder eine zukünftige API in Sesame-Qualität ehrlich zu bepreisen.
Memory – die App, die sich erinnert, vs. das Modell, das vergisst
Hier ist die Kluft eine Schlucht, und sie ist der konkreteste Grund, warum die beiden kein Ersatz füreinander sind. Die App Sesame Preview merkt sich: Jeder Agent verfügt über einen eigenen Speicher, der sich über Web und Mobilgeräte synchronisiert, wenn du angemeldet bist; Anrufe können bis zu 30 Minuten dauern; und der Inkognito-Modus liest frühere Erinnerungen, ohne neue zu erstellen. Das quelloffene CSM-1B hingegen hat ein 4K-Kontextfenster – etwa drei bis vier Minuten Text – und ohnehin keine Ohren, um dich zu hören.
NVIDIA NemotronLabs VoiceChat 11B verfügt über höchstens etwa zwei Minuten Audiokontext – der Trainings-Dataloader begrenzt Äußerungen auf 142,39 Sekunden, und die Modellkarte warnt, dass Gespräche über ein Zwei-Minuten-Fenster hinaus möglicherweise nicht gespeichert werden. Für einen Support-Anruf, der sich merken muss, was vor vier Minuten vereinbart wurde, ist diese Obergrenze allein schon disqualifizierend. Kommt eine einzige feste Stimme (Aria) ohne Klonen im veröffentlichten Checkpoint hinzu, ist das Modell, das seine Architektur offenlegt, auch das Modell, das sich weder einen Kunden merken noch seine eigene Stimme ändern kann.
Worin jedes einzelne wirklich schlecht ist
Gesammelt, denn ein Vergleich, der bei Stärken haltmacht, ist Marketing:
• Sesame Preview: keine API — man kann diese Stimme nicht in ein Produkt integrieren, und das Produktionsmodell ist unveröffentlicht und unbewertet. Nur Englisch, keine Aufgabenausführung, ein Anruflimit von 30 Minuten und keinerlei unabhängige Benchmarks. Das einzige offene Modell, CSM-1B, hat ein 4K-Kontextfenster, kein Tool-Calling, keine Hörfunktion und ist nicht die Stimme der App.
• NVIDIA NemotronLabs VoiceChat 11B: eine reine Forschungslizenz (OpenMDW v1.1) — Sie können das Modell herunterladen, studieren und feinabstimmen, dürfen es aber nicht ausliefern — und das gilt auch für alle, die darauf aufbauen. Kein gehosteter Endpunkt, „Ausprobieren“ bedeutet also eine 80-GB-GPU und einen Build aus dem Quellcode. Nur Englisch, ein Gedächtnislimit von etwa zwei Minuten, eine feste Stimme. NVIDIA gibt an, dass es bei Wissen und Anweisungsbefolgung hinter dem eigenen Backbone zurückbleiben kann; mehrschrittiges Reasoning und Arithmetik werden als schwach bezeichnet. Es kann Sie mitten im Satz unterbrechen, nach mehreren Gesprächsrunden in nicht behebbares Kauderwelsch oder Selbstgespräche verfallen, Wörter in der Transkription verschlucken, und es ist ausdrücklich ungeeignet für laute oder hallende Räume. Tool-Aufrufe funktionieren nur mit reinen ASCII-Eingabeaufforderungen und -Antworten, sind auf fünf Tools pro Sitzung begrenzt. Die Argumentgenauigkeit (44,2 %) und die Erfolgsquote beim ersten Versuch (33 %) bedeuten, dass es das richtige Tool zuverlässiger auswählt, als es die Tool-Argumente ausfüllt.
Wer sollte welche auswählen?
Da keiner von beiden aufrufbar ist, geht die ehrliche Antwort von dem aus, was du zu tun versuchst.
• Erleben Sie die bestbewertete Stimme des Jahres 2026: Sesame Preview, kostenlos, heute — als App. Die vier Agenten, die Unterbrechungsverwaltung, die Drive-Mode-Usability, die die Rezensenten immer wieder anführen: Das ist ein Verbraucherprodukt, und sein Wert ist genau das, was man nicht messen kann.
• Full-Duplex-Sprachmodellierung untersuchen:NVIDIA NemotronLabs VoiceChat 11B ist der interessantere Download in seiner Kategorie — ein offener 11B-Checkpoint mit einem funktionierenden Tool-Calling-Kanal, rund 550.000 Stunden gemischten Trainingsaudios und dem bisher besten offenen Full-Duplex-VoiceBench-Ergebnis, alles bei Kosten von null Dollar für die Gewichte. Die Nur-für-Forschung-Lizenz stellt keine Einschränkung für diese Arbeit dar.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• Bringen Sie in diesem Quartal ein Sprachprodukt auf den Markt: Keines von beiden. Sie benötigen ein gehostetes Echtzeit-Sprach-zu-Sprach-Modell mit einer kommerziellen Lizenz, und der sichere Weg, ein solches Modell zu übernehmen, ohne sich bereits auf einen Produktionspfad festgelegt zu haben, besteht darin, es neben einem bewährten Modell mit automatischem Failover anzubinden, sodass eine unerprobte Stimme niemals einen Live-Anruf zum Absturz bringt. Eine API für 200+ gehostete Modelle zum Listenpreis des Anbieters, ohne Aufschlag, macht das Ausprobieren einer neu verfügbaren Stimme zu einer Konfigurationsänderung statt zu einer Neuimplementierung.
Das Muster verdient einen Namen, denn es wird sich wiederholen. Beide Modelle sind nur ein Ereignis davon entfernt, abrufbar zu werden — Sesame an dem Tag, an dem es eine Modell-ID oder API herausbringt, NVIDIA NemotronLabs VoiceChat 11B an dem Tag, an dem NVIDIA eine kommerzielle Lizenz veröffentlicht oder jemand es hostet. Wenn es so weit ist, ist der richtige Schritt nicht, deinen aktuellen Voice-Stack herauszureißen. Es geht darum, die neue Stimme neben der alten zu ergänzen und mit Failover zu routen, genau wie du es bei jedem neuen, unerprobten Modell tun würdest. Das sind die beiden besten noch nicht lieferbaren Stimmen des Jahres 2026; die Infrastruktur, um die dritte auszuliefern, existiert bereits.
Was würde diesen Vergleich ändern?
Vier Ereignisse würden diesen Artikel neu schreiben. Eine API oder Modell-ID für Sesames Produktionsstimme – in dem Moment, in dem das passiert, ist Sesame keine App mehr, sondern wird zum Bewerber, auf den der Markt für gehostete Sprach-APIs gewartet hat. Eine kommerzielle Lizenz oder ein gehosteter Endpunkt für NVIDIA NemotronLabs VoiceChat 11B, der ein Forschungsartefakt über Nacht in eine echte Produktoption verwandeln würde. Eine unabhängige Bewertung der Sesame-Stimme – eine Auflistung auf Artificial Analysis' Speech-to-Speech-Board würde der Behauptung der „besten Stimme“ etwas geben, wogegen sie geprüft werden kann. Und ein technischer Bericht von NVIDIA, der den 11B-Checkpoint mit den 12B-„Nemotron 3 VoiceChat (V1)“-Einträgen abgleicht, die die Leaderboards messen, was die Voraussetzung dafür ist, irgendwelchen Zahlen der Familie zu vertrauen. Bis irgendetwas davon eintrifft, ist die zutreffende Zusammenfassung einfach: Die beiden interessantesten Konversationsstimmen von 2026 sind beide verschlossen – eine von einem Unternehmen, das nicht verkauft, die andere von einer Lizenz, die nicht ausgeliefert wird.
FAQ
Kann ich die Stimme eines der Modelle in meiner eigenen App verwenden?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
Welches der beiden klingt tatsächlich menschlicher?
Unbekannt, aus jeweils unterschiedlichen Gründen. Sesame Preview hat überhaupt keine unabhängige Bewertung — TestingCatalogs „einer der besten Sprachmodi auf dem Markt“ ist Rezensentenkonsens, keine Messung. Die Gesprächs-Timing-Werte von NVIDIA NemotronLabs VoiceChat 11B (448 ms Sprecherwechsel, 480 ms Barge-in-Latenz) werden von NVIDIA angegeben und wurden nicht unabhängig reproduziert; sein unabhängiger Big Bench Audio-Wert (29,2 %, laut Artificial Analysis, geführt unter „Nemotron 3 VoiceChat (V1)“) misst das Verständnis, nicht wie angenehm die Stimme ist. Das eine hat einen Ruf, den man hören kann; das andere hat Zahlen, die eine andere Frage beantworten.
Ist NVIDIA NemotronLabs VoiceChat 11B wirklich kostenlos?
Die Gewichte sind kostenlos; das Modell ist nicht billig. Der Betrieb bedeutet eine 80-GB-GPU (etwa 2–3 Dollar pro Stunde bei Bedarf, 1.500–2.200 Dollar pro Monat, wenn sie durchgehend warm gehalten wird) und ein Build aus dem Quellcode, und die OpenMDW-v1.1-Lizenz beschränkt die Nutzung auf reine Forschungszwecke — selbst nach diesen Ausgaben darf man es also nicht legal Kunden zugänglich machen.
