Karta tytułowa dla 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': duży tytuł, podtytuł 'Głos, którego nie możesz licencjonować, i głos, którego nie możesz udostępnić', oraz dwie płaskie karty z ikonami — 'Sesame Preview' z ikoną liniową telefonu i osoby oraz plakietką o treści 'Darmowa aplikacja · brak API · wybór recenzentów', oraz 'NVIDIA NemotronLabs VoiceChat 11B' z ikoną liniową pobierania i serwera oraz plakietką o treści 'Otwarte wagi · tylko do badań · self-host'. Stopka: 'Dwa najlepsze głosy, których nie można wydać — AI głosowe, sierpień 2026.' Logo OrcaRouter umieszczone w prawym dolnym rogu.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: Głos, którego nie możesz licencjonować, i głos, którego nie możesz wydać

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa z najbardziej komentowanych modeli głosowych 2026 roku mają coś wspólnego, o czym żadne materiały premierowe nie wspomną: żadnego z nich nie można umieścić w produkcie.Sesame Previewto darmowy asystent konsumencki, którego konwersacyjny głos sprawił, że TestingCatalog nazwał go „jednym z najlepszych trybów głosowych dostępnych na rynku”, a model produkcyjny stojący za nim nie ma API, identyfikatora modelu ani licencji, którą można kupić — firma po prostu go nie wydała.NVIDIA NemotronLabs VoiceChat 11Bto lustrzane odbicie: wagi są publiczne, konstrukcja full-duplex jest prawdziwym przełomem, a licencja mówi wyłącznie o celach badawczych, więc nikt nie może go legalnie wdrożyć. Jeden to głos, który można usłyszeć, ale nie wynająć. Drugi to głos, który można mieć, ale nie sprzedać. To porównanie dwóch zamkniętych drzwi, a właściwe pytanie brzmi: przed którymi zamkami stoisz.

Dwoje drzwi, zamkniętych na różne zamki

Zacznij od kształtu każdego z nich, bo nazwy ukrywają, jak bardzo te dwa produkty się różnią. Sesame Preview to aplikacja, a nie API. Zawiera czterech agentów o wyrazistych osobowościach — Mayę (ciepłą i kreatywną), Milesa (wyluzowanego i bystrego), Simone (dociekliwą i intelektualną), Charliego (błyskotliwego i ciepłego) — a każdy z nich ma własny głos i własną pamięć, która synchronizuje się między wersją webową a mobilną, gdy jesteś zalogowany. Przeszukuje internet, prowadzi dogłębne badania, robi notatki i ustawia przypomnienia oraz wysyła podsumowanie po każdej rozmowie. Wersja zapoznawcza jest darmowa, bez płatnego planu, tylko po angielsku, z limitem 30 minut na rozmowę po zalogowaniu (a pięć bez logowania) i celowo nie wykonuje zadań: przeprowadzi burzę mózgów i badania, ale nie zarezerwuje ci lotu. W produkcie nie ma żadnego klucza API — głos produkcyjny to funkcja aplikacji, a nie endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B jest odwrotną formą: checkpointem, a nie produktem. Pojawił się na Hugging Face 3 sierpnia 2026 roku bez żadnego ogłoszenia — bez postu z premierą, bez raportu technicznego, bez tweeta; karta modelu jest ogłoszeniem. To model mowy pełnego dupleksu z 11 miliardami parametrów (przeanalizowaliśmy nagłówek safetensors i naliczyliśmy 11,095 miliarda parametrów w 1626 tensorach) zbudowany jako jeden stos: enkoder Fast Conformer przetwarzający dźwięk 16 kHz w ramkach 80 ms z zerowym prawym kontekstem, rdzeń Nemotron Nano 9B v2 wykonujący rozumowanie, dekoder NVIDIA T​TS zapisujący dźwięk 22,05 kHz, dekoder RNN-T transkrybujący użytkownika oraz osobny kanał wyjściowy emitujący skrypty wywołujące narzędzia bez zanieczyszczania mówionej odpowiedzi. Słucha i mówi jednocześnie, można mu przerwać w środku słowa, a NVIDIA reklamuje go jako pierwszy otwarty model pełnego dupleksu z wywoływaniem narzędzi. Czy ta reklama przetrwa kontakt z rzeczywistością, jest tematem osobnej sekcji poniżej.

Punkt odniesienia, w którym się rozchodzą — dwóch kandydatów do miana „najlepszej rozmowy”, dwa wadliwe standardy dowodowe.

Oba modele stawiają całą swoją reputację na jednym i tym samym: jakości konwersacji — naprzemienności w rozmowie, przerywaniu, naturalnym tempie, poczuciu prawdziwej wymiany. Dlatego w ogóle trafiają do jednego nagłówka. To również punkt, w którym porównanie staje się dziwne, bo żadnego z kandydatów nie da się właściwie ocenić.

Sesame Preview nie ma nigdzie żadnej liczby. Model produkcyjny jest niewydany i nieuwzględniony na listach — brak ID modelu, brak wpisu na liście liderów speech-to-speech Artificial Analysis, brak docelowego opóźnienia, brak jakiegokolwiek benchmarku. „Jeden z najlepszych trybów głosowych dostępnych na rynku” od TestingCatalog to konsensus recenzentów, a nie pomiar, i nie ma sposobu, aby przeprowadzić ślepy test A/B z czymkolwiek. Jedynym modelem Sesame, który każdy może uruchomić niezależnie, jest bazowy model CSM-1B o otwartych wagach, a to jest checkpoint text-to-speech, a nie głos aplikacji.

NVIDIA NemotronLabs VoiceChat 11B ma odwrotny problem: ma liczby, ale liczby są podzielone między dwa standardy dowodowe, które się nie zgadzają. NVIDIA raportuje 448 ms na płynne przejęcie głosu, 480 ms na ustąpienie w razie przerwania oraz idealny współczynnik przejęcia 1,0 przy przerwaniu przez użytkownika — wszystko mierzone przez producenta we własnym teście Full-Duplex-Bench 1.0 firmy NVIDIA, a żadne z tych wyników nie zostało niezależnie odtworzone. Niezależne pomiary tej rodziny są zarejestrowane pod inną nazwą i liczbą parametrów — „Nemotron 3 VoiceChat (V1)" przy 12B, co jest etykietą, której NVIDIA nigdy nie uzgodniła z checkpointem 11B na Hugging Face — i są one niepochlebne po stronie rozumienia: 29,2% na Big Bench Audio według Artificial Analysis, wobec 37,0% na karcie wyników samej NVIDIA. Na VoiceBench rodzina osiąga 58,10, co jest najlepszym otwartym wynikiem full-duplex na liście. Tak więc ten sam model jest jednocześnie liderem wśród otwartych checkpointów full-duplex i około trzykrotnie za hostowanymi liderami czasu rzeczywistego w rozumieniu tego, co słyszy.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

Rozbieżność nie polega więc na tym, który jest lepszy. Chodzi o to, że dwaj kandydaci do najlepszej rozmowy 2026 roku są oceniani na podstawie przeciwstawnych i równie niekompletnych dowodów. Głos, który według recenzentów brzmi najbardziej ludzko, nie ma żadnych pomiarów, a głos z rzeczywistymi pozycjami w rankingu to ten, którego słabości są publiczne. Nie można porównać reputacji z liczbą, a tutaj jest tylko jedna liczba — i nie jest to ta pochlebna.

Dostęp — pobranie ze sklepu z aplikacjami lub kompilacja 80 GB

Jeśli chcesz wypróbować którekolwiek z nich, linia startowa różni się w sposób, który ma większe znaczenie niż jakakolwiek specyfikacja.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B to nie jest po prostu plik do pobrania, który można uruchomić — to wersja, którą trzeba samemu postawić. Hugging Face informuje, że model „nie jest wdrożony przez żadnego dostawcę inferencji”; NVIDIA go nie udostępniła; a config.json w repozytorium to konfiguracja treningowa NeMo, więc nie ma punktu kontrolnego Transformers, na który można wskazać AutoModel. Obsługiwana ścieżka to środowisko conda przypięte do Pythona 3.12, PyTorch 2.10 i Transformers 4.56, z causal-conv1d i mamba-ssm skompilowanymi ze źródeł, na GPU o pojemności 80 GB (A100, H100, H200, B200 lub RTX 6000) z uruchomionym vLLM — albo kontener NGC NIM od NVIDIA, który udostępnia WebSocket zgodny z O​penAI Realtime pod adresem /v1/realtime, gdy znajdziesz się na tym sprzęcie. Licznik pobrań opowiada historię dostępu: około 80 pobrań w pierwszym miesiącu modelu wobec 107 polubień. Ludzie dodawali go do zakładek; prawie nikt go nie uruchomił. Jedna szczera uwaga dla badacza, który to zrobi: szkielet rozumowania, na którym opiera się ten punkt kontrolny, Nemotron Nano 9B v2, jest sam w sobie modelem hostowanym, który możesz wywołać już dziś — pełnodupleksowy model wokół niego już nie, i ta luka jest sednem sprawy.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Cena — darmowa aplikacja, darmowe ciężary i rachunek za 80 GB.

Oba modele są „darmowe”, a słowo to w obu przypadkach wprowadza w błąd w takim samym stopniu.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

Uczciwym miernikiem na dzień, w którym którykolwiek z nich będzie można kupić: niezależnie od tego, na jaki hostowany model głosowy się zdecydujesz, powinieneś zapłacić dokładnie tyle, ile wynosi cena katalogowa dostawcy, bez żadnej marży za routing — czyli przeniesienie, dzięki któremu obniżka ceny dostawcy pojawia się na Twoim rachunku tego samego dnia, a nie po zakończeniu cyklu umowy. Żaden z modeli opisanych w tym tekście nie jest wywoływalny przez OrcaRouter: produkcyjny głos Sesame nie ma w ogóle API, a NVIDIA NemotronLabs VoiceChat 11B nie jest wywoływalny przez nic. Ten miernik dotyczy głosu, który faktycznie można kupić, i jest dokładnie tym standardem, który sprawia, że bazę T​TS po 7 dolarów za milion znaków albo przyszłe API klasy Sesame łatwo wycenić uczciwie.

Memory — aplikacja, która pamięta vs model, który zapomina

Tutaj przepaść to kanion i to jest najbardziej konkretny powód, dla którego te dwa nie są substytutami. Aplikacja Sesame Preview pamięta: każdy agent ma pamięć per-agent, która synchronizuje się między wersją webową a mobilną, gdy jesteś zalogowany, rozmowy mogą trwać do 30 minut, a Incognito Mode odczytuje wcześniejsze wspomnienia bez tworzenia nowych. Otwarty model CSM-1B ma natomiast okno kontekstu 4K — mniej więcej trzy do czterech minut tekstu — i tak nie ma uszu, żeby cię usłyszeć.

NVIDIA NemotronLabs VoiceChat 11B utrzymuje co najwyżej około dwóch minut kontekstu audio — treningowy dataloader ogranicza wypowiedzi do 142,39 sekund, a karta modelu ostrzega, że rozmowa wykraczająca poza dwuminutowe okno może nie zostać zachowana. W przypadku rozmowy wsparcia, która musi pamiętać, co zostało ustalone cztery minuty temu, ten limit sam w sobie jest dyskwalifikujący. Dodaj pojedynczy stały głos (Aria) bez możliwości klonowania w wydanym punkcie kontrolnym, a model, który jest otwarty co do swojej architektury, jest również modelem, który nie pamięta klienta ani nie może zmienić własnego głosu.

W czym każdy z nich jest naprawdę słaby

Zebrane, ponieważ porównanie, które zatrzymuje się na mocnych stronach, to marketing:

Sesame Preview: brak API — nie można umieścić tego głosu w produkcie, a model produkcyjny jest niewydany i nieoceniony. Wyłącznie po angielsku, bez wykonywania zadań, z limitem rozmów do 30 minut i bez jakiegokolwiek niezależnego benchmarku. Jedyny otwarty model, CSM-1B, ma okno kontekstu 4K, nie obsługuje wywoływania narzędzi, nie ma trybu nasłuchiwania i nie jest głosem aplikacji.

NVIDIA NemotronLabs VoiceChat 11B: licencja wyłącznie do celów badawczych (OpenMDW v1.1) — można go pobrać, studiować i dostroić, ale nie można go udostępnić; nie może tego również nikt, kto na nim bazuje. Brak hostowanego punktu końcowego, więc „wypróbowanie go” oznacza GPU o 80 GB pamięci i kompilację ze źródeł. Tylko język angielski, limit pamięci około 2 minut, jeden stały głos. Firma NVIDIA przyznaje, że może on osiągać gorsze wyniki niż jego własny model bazowy w zakresie wiedzy i podążania za instrukcjami, a wieloetapowe rozumowanie i arytmetyka zostały wskazane jako słabe strony. Może przerywać Ci w połowie zdania, po kilku turach degradować do nieodwracalnego bełkotu lub mówienia do siebie, gubić słowa w transkrypcji i jest wyraźnie nienadający się do hałaśliwych lub pogłosowych pomieszczeń. Wywoływanie narzędzi działa wyłącznie z promptami i odpowiedziami w ASCII, ogranicza się do pięciu narzędzi na sesję, a jego dokładność argumentów (44,2%) i odsetek powodzenia za pierwszym razem (33%) oznaczają, że wybiera właściwe narzędzie bardziej niezawodnie, niż wypełnia jego argumenty.

Kto powinien wybrać, które

Ponieważ żadne z nich nie jest wywoływalne, uczciwa odpowiedź zaczyna się od tego, co próbujesz zrobić.

Poznaj najlepiej oceniany głos roku 2026: Sesame Preview, za darmo, już dziś — jako aplikacja. Cztery agenty, obsługa przerywania, użyteczność trybu jazdy, które recenzenci wciąż przywołują: to produkt konsumencki, a jego wartość jest dokładnie tym, czego nie da się zmierzyć.

Zbadaj modelowanie mowy w trybie full-duplex:NVIDIA NemotronLabs VoiceChat 11B jest bardziej interesującą pozycją do pobrania w swojej kategorii — otwarty checkpoint 11B z działającym kanałem wywoływania narzędzi, około 550 000 godzin mieszanego audio treningowego oraz najlepszy dotychczas otwarty wynik VoiceBench w trybie full-duplex, a wszystko to za zero dolarów za wagi. Licencja wyłącznie do celów badawczych nie jest ograniczeniem dla tej pracy.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Wprowadź produkt głosowy w tym kwartale: żadna z tych opcji. Potrzebujesz hostowanego modelu przetwarzania mowy na mowę w czasie rzeczywistym z licencją komercyjną, a bezpieczny sposób na wdrożenie modelu, na którym nie oparłeś jeszcze swojej ścieżki produkcyjnej, to kierować do niego ruch równolegle ze sprawdzonym modelem z automatycznym przełączaniem awaryjnym, aby nieprzetestowany głos nigdy nie przerwał rozmowy na żywo. Jedno API obejmujące ponad 200 hostowanych modeli w cenie katalogowej dostawcy, bez narzutów, sprawia, że wypróbowanie nowo dostępnego głosu to zmiana konfiguracji, a nie przepisywanie kodu.

Ten wzorzec warto nazwać, ponieważ będzie się powtarzał. Oba te modele są tylko o jedno wydarzenie od tego, by stać się wywoływalnymi — Sesame w dniu, w którym wypuści ID modelu lub API, oraz NVIDIA NemotronLabs VoiceChat 11B w dniu, w którym NVIDIA opublikuje licencję komercyjną lub ktokolwiek go udostępni. Kiedy to nastąpi, właściwym posunięciem nie jest wyrywanie obecnego stacku głosowego. Należy dodać nowy głos obok starego i kierować ruchem z mechanizmem failover, dokładnie tak, jak w przypadku każdego nowego, niesprawdzonego modelu. To dwa najlepsze niewydane głosy 2026 roku; infrastruktura do wydania trzeciego już istnieje.

Co zmieniłoby to porównanie

Cztery wydarzenia mogłyby odmienić ten artykuł. API lub identyfikator modelu dla produkcyjnego głosu Sesame — w momencie, gdy to nastąpi, Sesame przestaje być aplikacją i staje się graczem, na którego czeka rynek hostowanych API głosowych. Komercyjna licencja lub hostowany endpoint dla NVIDIA NemotronLabs VoiceChat 11B, co z dnia na dzień zamieniłoby artefakt badawczy w realną opcję produktową. Niezależna ocena głosu Sesame — umieszczenie go na tablicy speech-to-speech w Artificial Analysis dałoby twierdzeniu o „najlepszym głosie” punkt odniesienia do weryfikacji. Oraz raport techniczny od NVIDIA, który godzi punkt kontrolny 11B z wpisami 12B „Nemotron 3 VoiceChat (V1)” mierzonymi przez rankingi, co jest warunkiem wstępnym, by zaufać jakimkolwiek liczbom z tej rodziny. Dopóki którekolwiek z tych wydarzeń nie nastąpi, trafne podsumowanie jest proste: dwa najciekawsze konwersacyjne głosy 2026 roku są zablokowane — jeden przez firmę, która nie sprzeda, drugi przez licencję, która nie zostanie wydana.

Często zadawane pytania

Czy mogę używać głosu któregokolwiek z modeli w mojej własnej aplikacji?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Które z tych dwóch tak naprawdę brzmi bardziej jak człowiek?

Nieznane, z różnych powodów dla każdego z nich. Sesame Preview nie ma żadnego niezależnego wyniku — określenie TestingCatalog „jeden z najlepszych trybów głosowych dostępnych na rynku" to konsensus recenzentów, a nie pomiar. Parametry czasowe konwersacji NVIDIA NemotronLabs VoiceChat 11B (448 ms przejmowania głosu, 480 ms ustępowania przy przerwaniu) pochodzą z raportu NVIDIA i nie zostały niezależnie potwierdzone, a jego niezależny wynik Big Bench Audio (29,2%, według Artificial Analysis, sklasyfikowany pod „Nemotron 3 VoiceChat (V1)") mierzy zrozumienie, a nie to, jak przyjemny jest głos. Jeden ma reputację, którą można usłyszeć; drugi ma liczby, które odpowiadają na inne pytanie.

Czy NVIDIA NemotronLabs VoiceChat 11B jest naprawdę darmowy?

Wagi są darmowe, ale sam model nie jest tani. Uruchomienie go oznacza GPU z 80 GB pamięci (mniej więcej 2–3 dolary za godzinę na żądanie, 1500–2200 dolarów miesięcznie, jeśli jest utrzymywany w ciągłej gotowości) oraz kompilację ze źródeł, a licencja OpenMDW v1.1 ogranicza go wyłącznie do celów badawczych — więc nawet po tych wydatkach nie możesz legalnie udostępnić go klientom.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube