NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B: Pełnodupleksowy model głosowy, który NVIDIA wydała bez zapowiedzi

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwie karty modelu znajdują się w tym samym repozytorium Hugging Face i są ze sobą sprzeczne. Ta widoczna na stronie nazywa model NVIDIA NemotronLabs VoiceChat 11B, podaje datę wydania jako 3 sierpnia 2026 r. i wymienia 11B parametrów. Druga, plik o nazwie overview.md, którego nikt nie widzi, dopóki nie otworzy zakładki Pliki, nazywa ten sam model 12B, datuje wydanie na 16 lipca, zawiera sekcję benchmarków pominiętą w publicznej karcie, i nadal ma słowo TODO znajdujące się tam, gdzie powinien być opis wyników. Żadnej z kart nie towarzyszył post premierowy, notatka prasowa, raport techniczny ani tweet od NVIDIA.

To, co się tam znajduje, nie jest jednak symbolem zastępczym. To punkt kontrolny o rozmiarze 44 GB, który jednocześnie słucha i mówi: pojedynczy stos, który przyjmuje dźwięk z mikrofonu i wyprowadza zsyntetyzowaną mowę, bez typowego łańcucha rozpoznawania mowy przez model językowy i syntezę mowy. Jest zbudowany na Nemotron Nano 9B v2 jako bazie, potrafi wywoływać narzędzia w środku zdania, nie przerywając mówienia, a NVIDIA twierdzi, że to pierwszy otwarty model pełnego dupleksu, który to potrafi.

Wszystko poniżej jest odczytywane bezpośrednio z tego repozytorium — te dwie karty, config.jsonoraz indeks tensorów w pliku wag, który sami sparsowaliśmy, aby rozstrzygnąć kwestię 11B kontra 12B. Każdy wynik wydajności, jaki NVIDIA publikuje dla tego modelu, pochodzi od samej NVIDIA, został zmierzony przez NVIDIA i nie został niezależnie odtworzony. W przestrzeni publicznej istnieje dokładnie jeden niezależny pomiar tej linii, pochodzący od Artificial Analysis, i figuruje on pod inną nazwą i inną liczbą parametrów — co okazuje się najciekawszym aspektem tej premiery.

Co tak naprawdę znajduje się w repozytorium

Repozytorium utworzono 29 lipca 2026 roku, a ostatnia modyfikacja miała miejsce 4 sierpnia. Zawiera siedemnaście plików: dwie konkurujące karty modeli, licencję, config.json, jeden plik o rozmiarze 44,4 GB model.safetensors, schemat architektury, katalog tokenizera RNN-T, cztery krótkie noty polityczne dotyczące stronniczości, bezpieczeństwa, prywatności i wyjaśnialności oraz trzy pliki .wav — demo przełączania mówców, demo przerywania oraz demo wywoływania narzędzi — osadzone jako odtwarzacze audio na górze karty, abyś usłyszał model, zanim o nim przeczytasz.

Brakuje kilku rzeczy, a są one ważniejsze niż lista plików.

Nie ma artykułu dla tego modelu. Karta wymienia pięć: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, plus własny preprint PersonaPlex firmy NVIDIA. Żaden z nich nie jest raportem technicznym NemotronLabs VoiceChat. Architektura jest opisana w około trzech akapitach i na diagramie, i to jest cały publiczny opis tego, jak go zbudowano.

Nie ma sposobu, aby go wywołać. Strona Hugging Face stwierdza wprost, że model „nie jest wdrożony przez żadnego dostawcę inferencji”. Nie ma hostowanego punktu końcowego — ani od NVIDIA, ani od nikogo innego. Jedyny otwarty wątek społecznościowy w repozytorium to użytkownik proszący NVIDIA o dodanie handler.py aby punkt kontrolny można było wdrożyć do Hugging Face Inference Endpoints — czyli ktoś, kto próbował uruchomić to w prosty sposób i odkrył, że takiego nie ma.

Nie ma pipeline_tag ani library_name. Dlatego strona nie ma widżetu wnioskowania ani etykiety zadania, a to jest objawem głębszego problemu: config.json nie jest konfiguracją Transformers. To 32 KB NeMo, czyli treningowa konfiguracja, zawierająca blok AdamW, harmonogram tempa uczenia się, przedziały wiader dataloadera i podział walidacyjny. Nie możesz skierować AutoModel.from_pretrained na to. Klonujesz konkretną gałąź repozytorium Speech firmy NVIDIA — nemotron-labs-voicechat — budujesz środowisko conda z przypiętymi wersjami Pythona 3.12, PyTorch 2.10 i Transformers 4.56, kompilujesz causal-conv1d i mamba-ssm bez izolacji budowania i uruchamiasz ich skrypt.

Licznik pobrań odzwierciedla to wszystko. 107 polubień przy 80 pobraniach w pierwszym miesiącu modelu to sygnał wydania, które ludzie zapisali, ale nie uruchomili.

NVIDIA NemotronLabs VoiceChat 11B-2

Policzyliśmy parametry i 11B wygrywa.

Plik safetensors zawiera nagłówek JSON wymieniający każdy tensor, jego kształt i dtype, więc liczba parametrów nie jest kwestią opinii. Pobraliśmy nagłówek i zsumowaliśmy to: 11 095 milionów parametrów w 1 626 tensorach float32, zajmując 44,38 GB. Zatem wyrenderowana karta jest prawidłowa, a overview.md jest nieaktualny — to model 11B, a wartość 12B to pozostałość.

Drzewo modeli Hugging Face wyjaśnia, skąd mógł się wziąć 12B. Przedstawiona przez nie linia rodowa prowadzi od Nemotron Nano 12B v2 Base, przez Nemotron Nano 12B v2, następnie Nemotron Nano 9B v2, i dopiero potem do tego modelu. Rodzina tekstowych szkieletów NVIDIA obejmuje zarówno 12B, jak i 9B, przy czym 9B jest przyciętym potomkiem 12B, a VoiceChat zbudowano na 9B. Karta modelu sporządzona wcześniej w tym łańcuchu naturalnie zawierałaby większą liczbę.

Nagłówek również dzieli się wyraźnie na dwie połowy architektury:

Strona rozumienia — 10.098B. Z tego 7.714B to stos transformatorów Nemotron Nano v2, 0.609B to enkoder mowy, a trzy osobne macierze 131,072 × 4,480 zajmują po 0.587B każda.

Strona mówiąca — 0,997B. 28-warstwowy szkielet tekst-mowa o szerokości 1152 i 0,595B parametrów, głowica wyjściowa mieszaniny rozkładów Gaussa o 0,159B oraz neuronowy kodek audio, którego enkoder i dekoder mają po 0,092B.

Z dtype wynikają dwie praktyczne konsekwencje. Po pierwsze, plik do pobrania o rozmiarze 44 GB nie jest dużym modelem — to zwykły model dostarczany w float32; po konwersji na bfloat16 wagi zajmą około 22 GB. Po drugie, deklarowane przez NVIDIA minimum w postaci GPU z 80 GB pamięci wynika z tego wyboru, a nie z rozmiaru modelu, a każdy, kto ma kartę z 48 GB pamięci i jest gotów samodzielnie przekonwertować checkpoint, nie jest w oczywisty sposób wykluczony — choć nikt nie opublikował potwierdzonego uruchomienia przy takim zapotrzebowaniu na pamięć, więc traktuj to jako arytmetykę, nie obietnicę.

Jak jednocześnie słucha i mówi

"Full duplex" to sedno tego wydania, a konfiguracja pokazuje, jak go uzyskać. Trzy wybory projektowe wykonują całą pracę.

Enkoder mowy nie może wybiegać w przyszłość. To 24-warstwowy Conformer z 8 głowami, którego kontekst uwagi jest ustawiony na [70, 0] — siedemdziesiąt ramek lewego kontekstu i zero ramek prawego kontekstu. Konwencjonalny rozpoznawca podgląda dźwięk po bieżącym momencie, aby rozstrzygnąć to, co właśnie usłyszał; ten natomiast nie może tego robić, co kosztuje dokładność, ale daje możliwość wydania decyzji w chwili, gdy pojawia się ramka.

Wszystko jest kwantowane do 80 ms. Długość ramki w konfiguracji wynosi 0,08 sekundy, co odpowiada rozmiarowi porcji 80 ms, który NVIDIA opisała w innych miejscach dla tego obszaru prac. Model co 80 ms decyduje, czy nadal słuchać, czy zacząć mówić. Ten rytm sprawia, że przerywanie wydaje się natychmiastowe, a nie grzeczne.

Wywołania narzędzi wychodzą z własnych ust. Pamiętaj o tych trzech identycznie ukształtowanych macierzach ze słownikiem 131 072 tokenów. Jedna to embedding wejściowy, druga to zwykła głowa modelu językowego — a trzecia nazywa się function_head. „Oddzielny kanał wyjściowy dla skryptów wywołujących narzędzia” w opisie karty to dosłownie trzecia projekcja wyjściowa, o szerokości 587 milionów parametrów, działająca równolegle z generowaniem mowy. To architektoniczny powód, dla którego model może wysłać wywołanie narzędzia bez przerywania rozmowy — i to realna decyzja projektowa, a nie konwencja promptowa.

Na dalszym etapie dekoder zamiany tekstu na mowę przewiduje kody dla kodera z resztkową kwantyzacją wektorową z 31 kwantyzatorami i współczynnikami zmniejszania próbkowania 7, 7 i 9 — redukcja 441×, która ustawia częstotliwość tokenów audio na 50 klatek na sekundę, przy 22,05 kHz na wyjściu. Wejście ma 16 kHz. W punkcie kontrolnym znajduje się również dekoder RNN-T i wspólna sieć, dlatego zadeklarowane wyjścia modelu obejmują transkrypt użytkownika obok własnego tekstu i audio: transkrypcja jest prawdziwą głową rozpoznawczą, a nie produktem ubocznym. Domyślny głos nazywa się Aria, a trzysekundowy klip referencyjny warunkuje mówcę.

Jeszcze jeden szczegół z konfiguracji warto wskazać, ponieważ potwierdza deklarowane ograniczenie: ładowarka danych treningowych ogranicza wypowiedzi do 142,39 sekundy. Ostrzeżenie na karcie, że model utrzymuje kontekst audio nie dłuższy niż dwie minuty, jest widoczne w potoku danych, który go wygenerował.

Wyniki i kto faktycznie je zmierzył

Najważniejsze twierdzenia NVIDIA dotyczą opóźnienia i pozycji w rankingu. W Full-Duplex-Bench 1.0 raportuje 448 ms na płynne przejęcie głosu i 480 ms na ustąpienie w przypadku przerwania, ze wskaźnikiem przejęcia wynoszącym 0,82 przy płynnej wymianie zdań i 1,0 przy przerwaniu przez użytkownika, oraz wynikiem sędziego GPT-4o wynoszącym 4,33 w obsłudze przerwań. Twierdzi, że zajmuje #2 wśród otwartych modeli full-duplex w VoiceBench i #2 wśród otwartych modeli w Full-Duplex-Bench. Wszystkie te wyniki pochodzą z własnych testów NVIDIA.

Zestaw je ze światem zewnętrznym, a otworzą się dwie luki.

W rozumowaniu mowy, wynik producenta jest zawyżony o około osiem punktów. Niewyrenderowany overview.md raportuje 37.0% w Big Bench Audio. Artificial Analysis niezależnie zmierzyła tę linię modeli na 29.2%. Ten sam benchmark, ta sama rodzina, różnica wystarczająco duża, aby zmienić miejsce modelu w rankingu.

W VoiceBench liczba podana przez producenta jest zbyt skromna. Karta twierdzi, że zajmuje 2. miejsce wśród otwartych modeli pełnego dupleksu; publiczny leaderboard VoiceBench plasuje ten model na 58.10, co jest najlepszym wynikiem w kategorii otwartych modeli pełnego dupleksu, przed Freeze-Omni z wynikiem 55.20 i Moshi z 29.51. Własna karta NVIDIA podaje 55.1 dla siebie — poniżej liczby, którą obecnie podaje leaderboard.

Jest też mniejsza osobliwość: tabela porównawcza samego NVIDIA ocenia swoich rywali hojniej niż Artificial Analysis. Wstępna karta przypisuje Freeze-Omni 33,4% i PersonaPlex 7B 19,1% w Big Bench Audio; Artificial Analysis mierzy 33,9% i 12,6%. Kolejność rywali pozostaje taka sama w obu przypadkach, co jest uspokajające, ale przypomina, że środowisko testowe producenta i niezależne nie zwracają tych samych liczb nawet dla podmiotów trzecich.

NVIDIA NemotronLabs VoiceChat 11B-3

Wykres czyni uczciwy nagłówek nieuniknionym. Wśród otwartych modeli full-duplex to prawdziwy krok naprzód — ponad dwukrotnie przewyższa PersonaPlex w rozumowaniu mowy i pozostawia Moshi w zupełnie innej kategorii. W porównaniu z tym, co można kupić, jest jednak daleko w tyle: Step-Audio R1.1 osiąga 96%, Voice Agent Grok 4.5 oraz Gemini 2.5 Flash (Thinking) — 92%, a Nova 2.0 Sonic — 87%. To mniej więcej trzykrotna różnica w rozumowaniu na podstawie mowy.

Najczystszym sposobem, aby zobaczyć, ile obecnie kosztuje pełny dupleks, jest własny katalog NVIDIA. W VoiceBench NVIDIA Nemotron 3 Nano Omni 30B A3B — większy model, który nie jest pełnym dupleksem — uzyskuje 89,39, wobec 58,10 dla VoiceChat. Około trzydzieści punktów jakości asystenta to cena obsługi przerwań i przełączania mówienia poniżej 500 ms, przynajmniej w tej generacji. Jeśli Twój produkt nie potrzebuje modelu, który można przerwać w środku słowa, płacisz dużo za funkcję, której nie użyjesz.

Wywoływanie narzędzi to główna atrakcja, a zarazem najsłabsza część.

"Pierwszy otwarty model pełnego dupleksu obsługujący wywoływanie narzędzi" – to twierdzenie, na którym opiera się ta wersja, a liczby pod nim są nierówne. W przypadku konwersacji mówionej w BFCL-v3 NVIDIA raportuje średnią 56,1%: 58,5% dla prostych, 62,5% dla wielokrotnych, 42,5% dla równoległych, 27,5% dla równoległych wielokrotnych oraz 89,6% dla prawidłowego odrzucania nieistotnych wywołań. W Full-Duplex-Bench v3 rozbieżność jest jeszcze większa.

Wybór narzędzia — 82,5%. Wybieranie właściwej funkcji z listy, które NVIDIA słusznie opisuje jako konkurencyjne względem czołowych modeli.

Dokładność argumentów — 44,2%. Poprawne wypełnienie parametrów tej funkcji na podstawie tego, co powiedział użytkownik.

Pass@1 — 33%. Poprawne wykonanie całego wywołania za pierwszym razem.

Model, który dwie trzecie pewniej wie, którego narzędzia chce, niż potrafi wypełnić jego argumenty, to model, który z pełnym przekonaniem sprawdzi pogodę dla niewłaściwego miasta. W agencie tekstowym wyłapałbyś to warstwą walidacji i ponowieniem próby; podczas połączenia głosowego na żywo ponowienie próby jest słyszalne, a karta notuje, że model nie powinien w ogóle ponawiać nieudanego połączenia — ma poinformować użytkownika, że API ma problem.

Ograniczenia operacyjne wokół tego są ścisłe, a NVIDIA wymienia je bez owijania w bawełnę: maksymalnie pięć narzędzi na sesję, zanim jakość spadnie, brak niezawodnych równoczesnych wywołań wielu narzędzi, brak możliwości przerwania przez użytkownika podczas wykonywania narzędzia oraz tendencja w mieszanych rozmowach do odpowiadania z własnej wiedzy zamiast wywoływania narzędzia, które powinna. Długie odpowiedzi narzędzi blokują agenta, a właśnie do zamaskowania tego służy funkcja „on-hold message” — z góry piszesz frazę, którą agent wypowiada w momencie uruchomienia wywołania, żeby w ciszy coś było.

Jedno dziwactwo, które będzie kosztować kogoś popołudnie: prompty systemowe i odpowiedzi narzędzi muszą być tylko ASCII. Bez myślników, bez cudzysłowów typograficznych, bez symboli stopnia, bez emoji. Dane wyjściowe z narzędzi muszą zostać spłaszczone do zwykłych, przyjaznych mowie zdań ASCII, zanim trafią do modelu, co oznacza, że odpowiedź JSON API nie może być przekazana na surowo.

Ile kosztuje uruchomienie i licencja, która cię powstrzymuje

Zacznij od sprzętu. Dokumentacja gałęzi NVIDIA wymaga GPU z co najmniej 80 GB pamięci, co wskazuje na H100 lub H200, a testowana konfiguracja to H100 z vLLM. Wydajność H100 na żądanie kosztuje mniej więcej 2–3 dolary za godzinę w typowych chmurach GPU, więc ciągle działająca instancja to koszt rzędu 1500–2200 dolarów miesięcznie, zanim napiszesz jakikolwiek kod aplikacji, zatrudnisz kogoś do jej utrzymania lub obsłużysz drugą równoczesną rozmowę.

Teraz porównanie. Artificial Analysis normalizuje ceny hostowanej usługi zamiany mowy na mowę do kosztu za godzinę wejściowego audio, a obecna rozpiętość cen wynosi od około 1,42 USD za godzinę na najtańszym końcu do 10,75 USD za godzinę w najdroższej klasie premium, przy czym dobrze oceniana opcja ze średniej półki, taka jak Grok Voice Think Fast 2.0, plasuje się na poziomie 4,80 USD za godzinę — czyli 0,08 USD za minutę audio.

NVIDIA NemotronLabs VoiceChat 11B-4

Przeczytaj te dwa akapity razem, a argument za self-hostingiem jest słabszy, niż się wydaje. Dedykowany H100 jest tańszy tylko od hostowanego endpointu ze średniej półki cenowej, jeśli naprawdę jest w pełni wykorzystywany, a i tak jest droższy od taniej końcówki rynku hostowanego niemal niezależnie od wykorzystania — podczas gdy dodatkowo bierzesz na siebie inżynierię, dyżury i model, który osiąga 29,2% tam, gdzie opcje hostowane osiągają 87–96%.

A potem jest ściana. Licencja to OpenMDW License Agreement v1.1, a karta stwierdza we własnym cytacie blokowym, że model „jest przeznaczony wyłącznie do celów badawczych.” Kod na gałęzi GitHub jest na licencji Apache-2.0; wagi już nie. Możesz to pobrać, studiować, dostroić, testować porównawczo i pisać o tym. Nie możesz udostępnić tego klientom. Każdy powyższy argument ekonomiczny jest zatem akademicki dla firmy próbującej wprowadzić produkt głosowy — pytanie nigdy nie dotyczyło tego, czy matematyka GPU się zgadza.

Dlatego też powiemy oczywistą rzecz wprost: {{1}}NemotronLabs VoiceChat 11B nie jest wywoływalny przez OrcaRouter, ponieważ nie jest wywoływalny przez cokolwiek.{{/1}} To, co daje klucz, to punkt odniesienia, względem którego należy go mierzyć — {{2}}hostowane modele głosowe i audio znajdują się za jednym API z 0% narzutu, co oznacza, że przekazujemy cenę z listy dostawcy bezpośrednio dalej, więc gdy dostawca obniży stawkę za audio, niższa liczba to kwota, którą płacisz tego dnia, a nie po cyklu kontraktowym.{{/2}} Jeśli wyceniasz agenta głosowego, {{3}}ta stawka za minutę to liczba, którą karta GPU o 80 GB musi pobić{{/3}}, i warto wiedzieć to dokładnie, zanim zdecydujesz się na zakup szafy rack.

Problem z nazwą: 11B, 12B, NemotronLabs, Nemotron 3

To właśnie w tym miejscu większość wczesnych doniesień poszła w złym kierunku, więc warto zachować ostrożność co do tego, co jest ustalone, a co nie.

Cztery własne platformy NVIDIA opisują ten projekt pod trzema różnymi etykietami. Hugging Face publikuje „NVIDIA NemotronLabs VoiceChat 11B" z otwartymi wagami i licencją wyłącznie do celów badawczych. Na blogu deweloperskim NVIDIA, w marcu 2026, opisano „Nemotron 3 VoiceChat" jako pełnodupleksowy model z 12 miliardami parametrów we wczesnym dostępie, celujący w poniżej 300 ms latencję end-to-end na 80-milisekundowych fragmentach, z programem wczesnego dostępu oferującym kontenery referencyjne, wyniki benchmarków i ścieżkę dostrajania oraz obiecującym „otwarte, podlegające inspekcji wagi do wdrożeń korporacyjnych". Publiczny leaderboard VoiceBench oraz Artificial Analysis klasyfikują swoje wpisy jako „Nemotron 3 VoiceChat (V1)", 12B.

Co wiadomo: opisy architektury są zgodne element po elemencie — enkoder Fast Conformer, rdzeń Nemotron Nano v2 9B, dekoder NVIDIA do zamiany tekstu na mowę, oddzielny kanał wywoływania narzędzi, ramki 80 ms, jeden spójny stos. Niewyrenderowana karta w repozytorium Hugging Face używa tej samej wartości 12B, której używają inne interfejsy. To ten sam kierunek prac, a wpisy podmiotów trzecich prawie na pewno mierzą tę rodzinę.

Coniejest potwierdzone: to, że punkt kontrolny, który możesz dziś pobrać, jest bit po bicie tym, co oceniły Artificial Analysis i VoiceBench, albo tym, co rozdaje program wczesnego dostępu. Dwa szczegóły przemawiają przeciwko temu założeniu. Liczby parametrów różnią się: 11,095B zmierzone wobec 12B w zgłoszeniu. A cele dotyczące opóźnień różnią się wyraźnie — korporacyjna propozycja z bloga to mniej niż 300 ms end-to-end, podczas gdy opublikowana karta mierzy 448 ms i 480 ms w Full-Duplex-Bench. To mogą być różne punkty pomiarowe na tym samym modelu albo różne modele. NVIDIA nie powiedziała, ponieważ NVIDIA nie powiedziała niczego o tym wydaniu.

Praktyczny wniosek: jeśli przytaczasz liczbę dotyczącą tego modelu, wskaż też jej źródło. Doniesienia, które przypisują 29,2% Artificial Analysis karcie modelu na Hugging Face, albo 37,0% NVIDIA niezależnemu testowi, łączą dwie rzeczy, które sama NVIDIA trzyma w osobnych dokumentach z różną liczbą parametrów.

Gdzie to się psuje

Sekcja ograniczeń na karcie roboczej jest niezwykle szczera, a gałąź GitHub dodaje więcej. Zebrane:

Tylko angielski, brak wielojęzycznej mapy drogowej w repo.

Pamięć dwuminutowa. Rozmowa wykraczająca poza dwuminutowe okno audio może nie zostać zachowana — twardy limit dla rozmów z pomocą techniczną lub czegokolwiek, co musi pamiętać, co ustalono cztery minuty temu.

Głupszy niż własny kręgosłup. NVIDIA twierdzi, że może wypaść gorzej niż Nemotron Nano 9B v2 pod względem wiedzy, wykonywania instrukcji i bezpieczeństwa, ponieważ został dostrojony pod kątem naturalności konwersacyjnej. Nie był specjalnie trenowany do rozumowania ani alignmentu; rozumowanie wieloetapowe i arytmetyka są wskazywane jako słabe strony.

Brak niezawodnego potwierdzania słuchania. „Mm-hm”, które sygnalizuje, że człowiek nadal słucha, nie jest systematycznie obsługiwane.

Ucina Ci wypowiedź w pół zdania. Notatki gałęzi wymieniają przerywanie użytkownikowi w trakcie pauzy w pół zdania oraz „niekontrolowaną kontynuację / mówienie do siebie” wśród znanych trybów awarii — bezpośredni koszt enkodera z zerowym prawym kontekstem.

Tylko ciche pomieszczenia. Wyraźnie nieprzeznaczone do hałaśliwych lub pogłosowych środowisk, zwłaszcza tam, gdzie występuje mowa w tle. To wyklucza większość hal call-center i większość samochodów.

Kto właściwie powinien to pobrać

Naukowcy pracujący nad modelowaniem mowy dupleksowej zyskają tu najwięcej i powinni przejść dalej: otwarty checkpoint 11B z działającym kanałem wywoływania narzędzi, wytrenowany na około 550 000 godzin połączonego rzeczywistego i syntetycznego audio, jest znacznie lepszym punktem wyjścia niż ponowne implementowanie z artykułu SALM-Duplex. Licencja badawcza nie stanowi ograniczenia dla tej pracy.

Zespoły budujące agentów głosowych powinny przeczytać kartę i pominąć pobieranie. Nic, czego nauczysz się z 44 GB punktu kontrolnego float32, którego nie możesz wdrożyć, nie zmieni Twojej architektury, a uczciwa lekcja płynąca z benchmarków jest taka, że pełny dupleks end-to-end nie jest jeszcze konkurencyjny w porównaniu z dobrym modelem hostowanym w kwestii, którą użytkownicy zauważają najbardziej: czy asystent ich zrozumiał. W międzyczasie rozsądnym posunięciem jest budowanie w oparciu o hostowany endpoint i utrzymanie niskiego kosztu zamiany — jeden klucz dla ponad 200 modeli z automatycznym przełączaniem awaryjnym oznacza, że incydent u dostawcy nie przerwie Twojej linii telefonicznej w trakcie rozmowy, a przejście na otwarty model pełnego dupleksu w przyszłości będzie zmianą konfiguracji, a nie przepisaniem kodu.

Przedsiębiorstwa, które szczególnie zwracają na to uwagę, powinny ubiegać się o wcześniejszy dostęp do Nemotron 3 VoiceChat, zamiast budować rozwiązania na wagach Hugging Face. To właśnie w tym programie dostępna jest licencja wdrożeniowa, kontenery referencyjne oraz deklaracja czasu odpowiedzi poniżej 300 ms. Publiczny checkpoint to jedynie badawcza zapowiedź tego samego pomysłu, opublikowana bez formalnej dokumentacji, która umożliwiłaby jego wykorzystanie komercyjne.

Trzy pytania, które to repo będzie wciąż dostawać

Czy mogę używać go komercyjnie, jeśli mocno go dostroję? Nie. OpenMDW v1.1 oraz oświadczenie na karcie o „przeznaczeniu wyłącznie do celów badawczych” regulują wagi i wszystko, co z nich pochodzi; licencja Apache-2.0 na gałęzi GitHub obejmuje kod wnioskowania, a nie checkpoint. Dostrajanie nie „pierze” licencji. Jeśli potrzebujesz praw komercyjnych, program wczesnego dostępu to ścieżka, którą NVIDIA faktycznie w tym celu przygotowała.

Czy to ten sam model co ten na listach liderów? Ta sama rodzina, niemal na pewno; identyczny plik — niepotwierdzone. Wpisy na liście liderów i w Artificial Analysis figurują jako „Nemotron 3 VoiceChat (V1)" w rozmiarze 12B, dostępny do pobrania checkpoint ma 11.095B, a NVIDIA nie opublikowała niczego, co by je pogodziło. Potraktuj liczby z listy liderów jako najlepsze dostępne niezależne źródło informacji o pochodzeniu modelu, a nie jako zweryfikowany pomiar pliku na Hugging Face.

Czy będzie działać na czymś mniejszym niż karta 80 GB?Prawdopodobnie, przy odrobinie pracy, ale nikt nie opublikował dowodu. Wagi są w float32, więc konwersja na bfloat16 powinna zmniejszyć około 44 GB parametrów do około 22 GB, co zostawia realny zapas na karcie 48 GB, zanim uwzględnimy pamięć podręczną KV, kodek i bufory strumieniowe. Ale wspierana ścieżka to vLLM na H100 z 80 GB, kontener wdrożeniowy jest pod to zbudowany, a jedyną przetestowaną konfiguracją, którą podaje NVIDIA, jest właśnie ta. Zarezerwuj czas, nie tylko VRAM.

Co obejrzeć

Trzy rzeczy mogłyby zmienić odbiór tej premiery. Raport techniczny, a nawet karta, która przestaje sobie zaprzeczać, powiedziałaby nam, czy punkt kontrolny 11B jest artefaktem mierzonym przez listy liderów. Niezależne odwzorowanie opóźnienia — ktoś spoza NVIDIA potwierdzający 448 ms przejmowania głosu na własnym sprzęcie — zamieniłoby najbardziej atrakcyjne twierdzenie tej premiery z marketingu w fakt. A licencja komercyjna albo hostowany endpoint od kogokolwiek przesunęłoby to z ciekawostki okołopublikacyjnej do realnej opcji dla wielu zespołów, które chętnie wymieniłyby część jakości rozumowania na agenta głosowego, którego można przerwać.

Dopóki jedno z nich nie wyląduje, trafny opis jest wąski, ale autentycznie godny uwagi: NVIDIA opublikowała najmocniejszy dotychczas zmierzony otwarty checkpoint pełnodupleksowego głosu, wyposażyła go w pierwszy działający kanał wywoływania narzędzi w tej kategorii, licencjonowała go tak, że nikt nie może go udostępnić, i nie raczyła wspomnieć, że cokolwiek z tego miało miejsce.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube