
NVIDIA NemotronLabs VoiceChat 11B: Het full-duplex stemmodel dat NVIDIA uitbracht zonder het aan te kondigen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Twee modelkaarten staan in dezelfde Hugging Face-repository, en ze spreken elkaar tegen. Degene die op de pagina wordt weergegeven, noemt het model NVIDIA NemotronLabs VoiceChat 11B, geeft als releasedatum 3 augustus 2026 en vermeldt 11B parameters. De tweede, een bestand met de naam overview.md dat niemand ziet tenzij men het tabblad Files opent, noemt hetzelfde model 12B, dateert de release op 16 juli, bevat een benchmarkgedeelte dat de openbare kaart weglaat, en heeft nog steeds het woord TODO op de plek waar een resultaatbeschrijving hoort te staan. Geen van beide kaarten ging vergezeld van een lanceringsbericht, een persbericht, een technisch rapport of een tweet van NVIDIA.
Wat daar in zit is echter geen placeholder. Het is een checkpoint van 44 GB dat tegelijkertijd luistert en spreekt: een enkele stack die microfoonaudio binnenkrijgt en gesynthetiseerde spraak naar buiten stuurt, zonder de gebruikelijke doorgifte van spraakherkenning via een taalmodel naar tekst-naar-spraak. Het is gebouwd op de Nemotron Nano 9B v2 backbone, kan tools aanroepen midden in een zin terwijl het blijft praten, en NVIDIA beweert dat het het eerste open full-duplex model is dat dat kan.
Alles hieronder wordt direct van die repository gelezen — de twee kaarten, config.json, en de tensor-index in het weights-bestand, die we zelf hebben geparsed om de 11B-versus-12B-kwestie te beslechten. Elk prestatienummer dat NVIDIA voor dit model publiceert, is van NVIDIA zelf, gemeten door NVIDIA, en niet onafhankelijk gereproduceerd. Er bestaat in het openbaar precies één onafhankelijke meting van deze lijn, van Artificial Analysis, en die staat geregistreerd onder een andere naam en een ander aantal parameters — wat achteraf het interessantste aan de release blijkt te zijn.
Wat zit er eigenlijk in de repository?
De repo is op 29 juli 2026 aangemaakt en op 4 augustus voor het laatst gewijzigd. Het bevat zeventien bestanden: de twee concurrerende modelkaarten, een licentie, een config.json, één 44,4 GB model.safetensors, een architectuurdiagram, een RNN-T-tokenizermap, vier korte beleidsnotities over bias, veiligheid, privacy en uitlegbaarheid, en drie .wav-bestanden — een beurtwisselingsdemo, een barge-in-demo en een tool-calling-demo — ingebed als audiospelers bovenaan de kaart, zodat je het model hoort voordat je erover leest.
Verschillende dingen ontbreken, en ze zijn belangrijker dan de bestandslijst.
• Er is geen paper voor dit model.De kaart citeert vijf: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, plus NVIDIA's eigen PersonaPlex-preprint. Geen daarvan is een NemotronLabs VoiceChat-technisch rapport. De architectuur wordt beschreven in ongeveer drie alinea's en een diagram, en dat is het gehele openbare verslag van hoe het is gebouwd.
• Er is geen manier om het aan te roepen. De Hugging Face-pagina stelt ronduit dat het model "door geen enkele Inference Provider wordt ingezet." Er is geen gehost endpoint, van NVIDIA of wie dan ook. De enige open community-thread in de repository is een gebruiker die NVIDIA vraagt om een handler.py toe te voegen, zodat het checkpoint kan worden ingezet op Hugging Face Inference Endpoints — iemand die het op de makkelijke manier probeerde te draaien en erachter kwam dat die er niet is.
• Er is geen pipeline_tag en geen library_name. Daarom heeft de pagina geen inferentie-widget en geen taaklabel, en het is een symptoom van het diepere probleem: config.json is geen Transformers-config. Het is een 32 KB NeMo-trainingsconfig, compleet met een AdamW-blok, een learning-rate-schema, dataloader-bucketbins en een validatiesplit. Je kunt AutoModel.from_pretrained hier niet op loslaten. Je cloneert een specifieke branch van de Speech-repository van NVIDIA — nemotron-labs-voicechat — bouwt een conda-omgeving waarin Python 3.12, PyTorch 2.10 en Transformers 4.56 zijn vastgezet, compileert causal-conv1d en mamba-ssm zonder build-isolatie, en voert hun script uit.
De downloadteller weerspiegelt dat allemaal. 107 likes tegenover 80 downloads in de eerste maand van het model is de signatuur van een release die mensen hadden opgeslagen en niet hebben gedraaid.

We hebben de parameters geteld, en 11B wint
Een safetensors-bestand bevat een JSON-header die elke tensor, zijn vorm en zijn dtype vermeldt, dus het aantal parameters is geen kwestie van mening. We hebben de header opgehaald en opgeteld: 11.095 miljoen parameters verspreid over 1.626 float32-tensors, die 44,38 GB in beslag nemen. Dus de weergegeven kaart klopt en overview.md is verouderd — dit is een 11B-model, en het 12B-cijfer is een overblijfsel.
De modelboom van Hugging Face verklaart waar een 12B vandaan had kunnen komen. De afstammingslijn die wordt getekend loopt van Nemotron Nano 12B v2 Base, naar Nemotron Nano 12B v2, vervolgens Nemotron Nano 9B v2, en pas daarna dit model. NVIDIA's eigen tekstbackbone-familie bevat zowel een 12B als een 9B, waarbij de 9B de gesnoeide afstammeling van de 12B is, en VoiceChat is op de 9B gebouwd. Een kaart die eerder in die keten was opgesteld, zou vanzelfsprekend het grotere getal hebben gedragen.
De header splitst zich ook netjes langs de twee helften van de architectuur:
• Begripszijde — 10,098B. Daarvan is 7,714B de Nemotron Nano v2 transformer stack, 0,609B is de spraakencoder, en drie afzonderlijke matrices van 131.072 × 4.480 nemen elk 0,587B in beslag.
• Spreekzijde — 0.997B.Een 28-laags, 1,152 breed tekst-naar-spraak-backbone met 0.595B, een mixture-of-Gaussians-uitvoerkop van 0.159B, en een neurale audiocodec waarvan de encoder en decoder elk 0.092B zijn.
Uit de dtype vloeien twee praktische gevolgen voort. Het eerste is dat de download van 44 GB geen groot model is, maar een gewoon model dat in float32 wordt geleverd; converteer je het naar bfloat16, dan zijn de gewichten ongeveer 22 GB. Het tweede is dat de door NVIDIA aangegeven ondergrens van een 80 GB-GPU een gevolg is van die keuze, niet van de grootte van het model, en dat iedereen met een 48 GB-kaart die bereid is de checkpoint zelf om te zetten, niet vanzelfsprekend buitengesloten is — hoewel niemand een bevestigde run met die voetafdruk heeft gepubliceerd, dus beschouw het als rekenkunde, niet als een belofte.
Hoe het tegelijkertijd luistert en praat
"Full duplex" is het hele punt van de release, en de config laat zien hoe het wordt gekocht. Drie ontwerpkeuzes doen het werk.
• De spraakencoder kan niet vooruitkijken. Het is een Conformer met 24 lagen en 8 koppen, waarvan de aandachtscontext is ingesteld op [70, 0] — zeventig frames linkercontext en nul frames rechtercontext. Een conventionele herkenner gluurt naar audio na het huidige moment om te ontwarren wat hij zojuist hoorde; deze mag dat niet doen, wat nauwkeurigheid kost en het vermogen oplevert om op het moment dat een frame binnenkomt een beslissing te nemen.
• Alles is gekwantiseerd tot 80 ms. De framelengte in de config is 0,08 seconden, wat overeenkomt met de chunkgrootte van 80 ms die NVIDIA elders voor deze onderzoekslijn heeft beschreven. Het model beslist elke 80 ms of het blijft luisteren of begint te spreken. Die cadans zorgt ervoor dat barge-in direct aanvoelt in plaats van beleefd.
• Toolcalls komen uit hun eigen mond. Denk aan die drie identiek gevormde matrices met een vocabulaire van 131.072. De ene is de input-embedding, de andere is de gewone taalmodel-head — en de derde heet function_head. Het 'afzonderlijke uitvoerkanaal voor tool-aanroepscripts' in de tekst van de kaart is een letterlijke derde uitvoerprojectie, 587 miljoen parameters breed, die parallel loopt met spraakgeneratie. Dat is de architecturale reden waarom het model een toolcall kan verzenden zonder het gesprek te onderbreken, en het is een echte ontwerpbeslissing in plaats van een promptconventie.
Stroomafwaarts voorspelt de tekst-naar-spraak-decoder codes voor een residuele vectorgekwantiseerde codec met 31 kwantisatoren en downsample-snelheden van 7, 7 en 9 — een 441× reductie die de audio-tokensnelheid op 50 frames per seconde brengt, bij 22,05 kHz. De invoer is 16 kHz. Er is ook een RNN-T-decoder en een joint netwerk in het checkpoint; daarom omvatten de gedeclareerde outputs van het model een transcript van de gebruiker naast de eigen tekst en audio: de transcriptie is een echte herkenningstak, geen bijproduct. De standaardstem heet Aria, en een referentieclip van drie seconden conditioneert de spreker.
Nog een detail uit de config is het vermelden waard, omdat het een eerder genoemde beperking bevestigt: de trainingsdataloader begrenst uitingen op 142.39 seconden. De waarschuwing op de modelkaart dat het model niet meer dan twee minuten audiocontext bevat, is zichtbaar in de datapipeline die het heeft geproduceerd.
De scores, en wie ze daadwerkelijk heeft gemeten
De belangrijkste claims van NVIDIA gaan over latentie en rangschikking. Op Full-Duplex-Bench 1.0 meldt het 448 ms om een soepele beurt te nemen en 480 ms om bij onderbreking de beurt af te staan, met een overnamegraad van 0,82 bij soepele beurtwisseling en 1,0 bij gebruikersonderbreking, en een GPT-4o-beoordelingsscore van 4,33 voor het omgaan met onderbrekingen. Het claimt #2 bij open full-duplex-modellen op VoiceBench en #2 bij open modellen op Full-Duplex-Bench. Al deze resultaten zijn afkomstig van NVIDIA's eigen runs.
Lijn ze uit tegen de buitenwereld en er gaan twee gaten open.
• Bij spraakredenering ligt het cijfer van de leverancier ongeveer acht punten hoger. Het niet-weergegeven overview.md rapporteert 37.0% op Big Bench Audio. Artificial Analysis heeft deze lijn onafhankelijk gemeten op 29.2%. Dezelfde benchmark, dezelfde familie, een verschil groot genoeg om de positie van het model in de ranglijst te veranderen.
• Op VoiceBench is het door de leverancier opgegeven getal te bescheiden. De kaart claimt #2 onder open full-duplex-modellen; de openbare VoiceBench-ranglijst plaatst dit model op 58.10, en dat is de top van de categorie open full-duplex, vóór Freeze-Omni op 55.20 en Moshi op 29.51. NVIDIA's eigen conceptkaart rapporteert 55.1 voor zichzelf — lager dan het getal dat de ranglijst nu vermeldt.
Er is ook een kleinere eigenaardigheid: NVIDIA's eigen vergelijkingstabel beoordeelt zijn rivalen royaler dan Artificial Analysis. De conceptkaart plaatst Freeze-Omni op 33,4% en PersonaPlex 7B op 19,1% op Big Bench Audio; Artificial Analysis meet 33,9% en 12,6%. De onderlinge rangschikking blijft in beide gevallen overeind, wat geruststellend is, maar het herinnert eraan dat de testomgeving van een leverancier en een onafhankelijke testomgeving niet dezelfde cijfers opleveren, zelfs niet voor derden.

De grafiek maakt de eerlijke kop onvermijdelijk. Onder open full-duplex modellen is dit een echte stap vooruit — het presteert meer dan twee keer zo goed als PersonaPlex op gesproken redenering en laat Moshi in een heel andere categorie achter. Gemeten naar wat je kunt kopen, komt het er niet eens in de buurt: Step-Audio R1.1 op 96%, Grok 4.5's Voice Agent en Gemini 2.5 Flash (Thinking) op 92%, Nova 2.0 Sonic op 87%. Dat is ongeveer een drie-tegen-een-kloof op het gebied van redeneren vanuit gesproken input.
De meest heldere manier om te zien wat full duplex momenteel kost, is in NVIDIA's eigen catalogus. Op VoiceBench scoort NVIDIA Nemotron 3 Nano Omni 30B A3B — een groter model dat geen full duplex is — 89,39, tegenover 58,10 voor VoiceChat. Ongeveer dertig punten assistentkwaliteit is de prijs voor het omgaan met onderbrekingen en de beurtwisseling van minder dan 500 ms, althans in deze generatie. Als uw product geen model nodig heeft dat halverwege een woord onderbroken kan worden, betaalt u veel voor een functie die u niet zult gebruiken.
Tool calling is de hoofdzaak, maar ook het zwakste onderdeel.
"First open full-duplex model to support tool calling" is de claim waar de release op rust, en de cijfers eronder zijn ongelijkmatig. Op een gesproken conversatie van BFCL-v3 rapporteert NVIDIA een gemiddelde van 56,1%: 58,5% eenvoudig, 62,5% meervoudig, 42,5% parallel, 27,5% parallel-meervoudig, en 89,6% op het correct afwijzen van irrelevante aanroepen. Op Full-Duplex-Bench v3 is de spreiding nog scherper.
• Toolselectie — 82,5%.Het kiezen van de juiste functie uit de lijst, wat NVIDIA terecht omschrijft als concurrerend met frontiermodellen.
• Argumentnauwkeurigheid — 44,2%. Het correct invullen van de parameters van die functie op basis van wat de gebruiker zei.
• Pass@1 — 33%. De hele aanroep in één keer goed krijgen.
Een model dat twee derde betrouwbaarder weet welk hulpmiddel het wil gebruiken dan dat het de argumenten van het hulpmiddel kan invullen, is een model dat vol vertrouwen het weer voor de verkeerde stad zal opzoeken. Bij een tekstagent zou je dat opvangen met een validatielaag en een nieuwe poging; bij een live telefoongesprek is die nieuwe poging hoorbaar, en de kaart vermeldt dat het model een mislukte oproep helemaal niet opnieuw mag proberen — het krijgt de instructie om de gebruiker te vertellen dat de API een probleem heeft.
De operationele beperkingen eromheen zijn strikt, en NVIDIA zet ze neer zonder veel opsmuk: maximaal vijf tools per sessie voordat de kwaliteit afneemt, geen betrouwbare gelijktijdige aanroepen van meerdere tools, geen manier voor de gebruiker om te onderbreken terwijl een tool wordt uitgevoerd, en een neiging om in gemengde gesprekken uit eigen kennis te antwoorden in plaats van de tool aan te roepen die eigenlijk gebruikt had moeten worden. Lange toolreacties laten de agent stagneren, en dat is precies wat de functie voor het 'wachtbericht' moet verdoezelen — je schrijft vooraf een zin die de agent uitspreekt op het moment dat een aanroep wordt geactiveerd, zodat de stilte iets te bieden heeft.
Een eigenaardigheid die iemand een middag zal kosten: systeemprompts en toolreacties moeten ASCII-only zijn. Geen em-dashes, geen gekrulde aanhalingstekens, geen gradentekens, geen emoji. De tooluitvoer moet worden afgevlakt tot eenvoudige, spraakvriendelijke ASCII-zinnen voordat het het model bereikt, wat betekent dat een JSON API-antwoord niet rauw kan worden doorgegeven.
Wat het kost om te draaien, en de licentie die je tegenhoudt.
Begin met de hardware. De branchdocumentatie van NVIDIA vraagt om een GPU met minimaal 80 GB geheugen, wat wijst op een H100 of H200, en de geteste configuratie is een H100 met vLLM. On-demand H100-capaciteit kost ruwweg $2–3 per uur bij de gangbare GPU-clouds, dus een continu draaiende instantie kost ergens tussen de $1,500–2,200 per maand, voordat je ook maar enige applicatiecode hebt geschreven, iemand hebt ingehuurd om het draaiende te houden, of een tweede gelijktijdig gesprek hebt bediend.
Nu de vergelijking. Artificial Analysis normaliseert de prijzen van gehoste spraak-naar-spraak naar kosten per uur invoeraudio, en de huidige spreiding loopt van ongeveer $1.42/uur aan de goedkope kant tot $10.75/uur voor de duurste premiumlaag, met een goed aangeschreven middenmarktoptie zoals Grok Voice Think Fast 2.0 op $4.80/uur — dat is $0.08 per audiominuut.

Lees die twee alinea's samen en de zelf-hostende zaak is zwakker dan het lijkt. Een toegewijde H100 is alleen goedkoper dan een middelduur gehost eindpunt als je hem echt druk bezig houdt, en hij is duurder dan het goedkope segment van de gehoste markt, vrijwel ongeacht het gebruik — terwijl je ook nog eens de engineering, de piketdienst en een model voor je rekening neemt dat 29,2% scoort, terwijl de gehoste opties 87–96% scoren.
En dan is er nog de muur. De licentie is de OpenMDW License Agreement v1.1, en de kaart stelt in het eigen blokcitaat dat het model "alleen bedoeld is voor onderzoeksdoeleinden." De code op de GitHub-branch is Apache-2.0; de gewichten niet. Je kunt dit downloaden, bestuderen, finetunen, benchmarken en erover schrijven. Je kunt het niet aan klanten laten zien. Elk economisch argument hierboven is daarom academisch voor een bedrijf dat een stemproduct probeert uit te brengen — de vraag was nooit of de GPU-rekenkunde werkte.
Dat is ook waarom we het voor de hand liggende ronduit zullen zeggen: NemotronLabs VoiceChat 11B is niet aanroepbaar via OrcaRouter, omdat het via niets aanroepbaar is. Wat één sleutel je wél oplevert, is de baseline waartegen het zou moeten worden gemeten — de gehoste spraak- en audiomodellen zitten achter één enkele API met 0% opslag, wat betekent dat we de lijstprijs van de provider rechtstreeks doorberekenen. Dus wanneer een leverancier zijn audiotarief verlaagt, is het lagere bedrag wat je die dag betaalt, in plaats van pas na een contractcyclus. Als je een voice-agent aan het prijzen bent, is dat bedrag per minuut het getal dat een 80 GB GPU moet verslaan, en het is de moeite waard om dit precies te weten voordat je je vastlegt op een rack.
Het naamprobleem: 11B, 12B, NemotronLabs, Nemotron 3
Dit is waar het grootste deel van de vroege berichtgeving de fout in is gegaan, dus het is de moeite waard om zorgvuldig te zijn over wat vaststaat en wat niet.
Vier van NVIDIA's eigen kanalen beschrijven dit werk onder drie verschillende labels. Hugging Face publiceert "NVIDIA NemotronLabs VoiceChat 11B" met open gewichten en een onderzoekslicentie. NVIDIA's ontwikkelaarsblog beschreef in maart 2026 "Nemotron 3 VoiceChat" als een 12B-parameter full-duplex model in early access, gericht op sub-300 ms end-to-end latentie bij 80 ms chunks, met een early-accessprogramma dat referentiecontainers, benchmarkresultaten en een fine-tuningpad biedt, en "open, inspecteerbare gewichten voor enterprise-implementatie" belooft. De openbare VoiceBench-ranglijst en Artificial Analysis registreren beide hun vermeldingen als "Nemotron 3 VoiceChat (V1)," 12B.
Wat er bekend is: de architectuurbeschrijvingen komen component voor component overeen — Fast Conformer-encoder, Nemotron Nano v2 9B-backbone, NVIDIA-tekst-naar-spraak-decoder, apart kanaal voor tool-aanroepen, frames van 80 ms, één verenigde stack. De niet-gerenderde kaart in de Hugging Face-repository gebruikt het 12B-getal dat de andere weergaven gebruiken. Het is dezelfde lijn van werk, en de externe vermeldingen meten vrijwel zeker deze familie.
Wat is niet bevestigd: dat het checkpoint dat je vandaag kunt downloaden bit-voor-bit is wat Artificial Analysis en VoiceBench hebben geëvalueerd, of wat het early-access-programma uitreikt. Twee details pleiten tegen die aanname. De parameteraantallen verschillen: 11,095B gemeten tegenover 12B zoals ingediend. En de latentiedoelen verschillen sterk — de enterprise-pitch van de blog is sub-300 ms end-to-end, terwijl de geleverde kaart 448 ms en 480 ms meet op Full-Duplex-Bench. Dat kunnen verschillende meetpunten op hetzelfde model zijn, of verschillende modellen. NVIDIA heeft het niet gezegd, want NVIDIA heeft over deze release helemaal niets gezegd.
De praktische conclusie: als je een getal voor dit model aanhaalt, vermeld dan van welk platform het afkomstig is. Berichtgeving die de 29,2% van Artificial Analysis toeschrijft aan de Hugging Face-modelkaart, of de 37,0% van NVIDIA aan een onafhankelijke test, heeft twee dingen vermengd die NVIDIA zelf in afzonderlijke documenten met verschillende parameteraantallen bewaart.
Waar het breekt
Het gedeelte over beperkingen van de conceptkaart is ongewoon openhartig, en de GitHub-branch voegt meer toe. Verzameld:
• Alleen Engels, en geen meertalige roadmap in de repo.
• Twee minuten geheugen. Een gesprek dat een audio-venster van twee minuten overschrijdt, wordt mogelijk niet bewaard — een harde limiet voor ondersteuningsgesprekken of alles wat moet onthouden wat vier minuten geleden is afgesproken.
• Dommer dan zijn eigen ruggengraat. NVIDIA stelt dat het mogelijk onderpresteert ten opzichte van Nemotron Nano 9B v2 op het gebied van kennis en het volgen van instructies en veiligheid, omdat het is afgestemd op natuurlijke gespreksvoering. Het is niet expliciet getraind voor redeneren of afstemming; meerstapsredenering en rekenkundige taken worden als zwak aangemerkt.
• Geen betrouwbare backchanneling. De "mm-hm" die aangeeft dat een mens nog steeds luistert, wordt niet systematisch verwerkt.
• Het zal je midden in een zin onderbreken. De branch-notities vermelden het onderbreken van de gebruiker bij een pauze midden in een zin, en "ongecontroleerde voortzetting / zelfpraat," onder de bekende faalwijzen — de directe kosten van een encoder zonder rechtercontext.
• Alleen stille kamers. Uitdrukkelijk ongeschikt voor lawaaierige of galmende omgevingen, vooral waar achtergrondspraak voorkomt. Dat sluit de meeste callcentervloeren en de meeste auto's uit.
Wie zou dit eigenlijk moeten downloaden
Onderzoekers die aan duplex-spraakmodellering werken, profiteren hier het meest en zouden moeten overstappen: een open 11B-checkpoint met een werkend tool-calling-kanaal, getraind op ongeveer 550.000 uur aan gemengde echte en synthetische audio, is een veel beter startpunt dan het opnieuw implementeren op basis van het SALM-Duplex-artikel. De onderzoekslicentie vormt geen beperking voor dat werk.
Teams die voice agents bouwen, zouden de kaart moeten lezen en de download moeten overslaan. Niets wat je leert van een 44 GB float32-checkpoint dat je toch niet kunt uitrollen, zal je architectuur veranderen, en de eerlijke les van de benchmarks is dat end-to-end full duplex nog niet concurrerend is met een goed gehost model op het punt dat gebruikers het meest opvalt: of de assistent hen heeft begrepen. In de tussentijd is de verstandige zet om te bouwen tegen een gehost endpoint en de wissel goedkoop te houden — één key voor 200+ modellen met automatische failover betekent dat een incident bij een provider je telefoonlijn niet midden in een gesprek platlegt, en het betekent dat later overstappen naar een open full-duplex model een configuratiewijziging is in plaats van een herschrijving.
Bedrijven die hier specifiek belang bij hebben, moeten zich aanmelden voor de vroege toegang tot Nemotron 3 VoiceChat in plaats van voort te bouwen op de Hugging Face-gewichten. Dat programma is waar de inzetbare licentie, de referentiecontainers en de claim van onder de 300 ms thuishoren. Het openbare checkpoint is een onderzoeksvoorbeeld van hetzelfde idee, gepubliceerd zonder het papierwerk dat u in staat zou stellen het te gebruiken.
Drie vragen die deze repo blijft krijgen
Kan ik het commercieel gebruiken als ik het zwaar fine-tune? Nee. OpenMDW v1.1 en de verklaring 'uitsluitend voor onderzoeksdoeleinden' op de kaart zijn van toepassing op de gewichten en alles wat daarvan is afgeleid; de Apache-2.0-licentie op de GitHub-branch dekt de inferentiecode, niet de checkpoint. Fine-tuning wast een licentie niet schoon. Als je commerciële rechten nodig hebt, is het early-accessprogramma de route die NVIDIA daadwerkelijk daarvoor heeft opgezet.
Is dit hetzelfde model als dat op de ranglijsten?Zelfde familie, vrijwel zeker; identiek artefact, onbevestigd. De vermeldingen op de ranglijst en bij Artificial Analysis staan geregistreerd als "Nemotron 3 VoiceChat (V1)" op 12B, het downloadbare checkpoint meet 11,095B, en NVIDIA heeft niets gepubliceerd om ze met elkaar in overeenstemming te brengen. Gebruik de ranglijstnummers als de best beschikbare onafhankelijke indicatie van de afstamming, niet als een geverifieerde meting van het bestand op Hugging Face.
Zal het draaien op iets kleiner dan een 80 GB-kaart?Waarschijnlijk wel, met wat werk, en niemand heeft bewijs gepubliceerd. De gewichten zijn float32, dus een conversie naar bfloat16 zou de ruwweg 44 GB aan parameters moeten terugbrengen tot ongeveer 22 GB, wat echte ruimte overlaat op een 48 GB-kaart voordat je rekening houdt met de KV-cache, de codec en de streamingbuffers. Maar het ondersteunde pad is vLLM op een H100 met 80 GB, de deploymentcontainer is daarvoor gebouwd, en de enige geteste configuratie die NVIDIA rapporteert is die ene. Budgetteer tijd, niet alleen VRAM.
Wat te kijken
Drie dingen zouden ieder de interpretatie van deze release veranderen. Een technisch rapport, of zelfs een kaart die ophoudt zichzelf tegen te spreken, zou ons vertellen of het 11B-checkpoint het artefact is dat de leaderboards hebben gemeten. Een onafhankelijke reproductie van de latentie — iemand buiten NVIDIA die de beurtwisseling van 448 ms op eigen hardware bevestigt — zou de meest aantrekkelijke claim van de release veranderen van marketing naar feit. En een commerciële licentie, of een gehost endpoint van wie dan ook, zou dit verplaatsen van een aan een paper grenzende curiositeit naar een echte optie voor de vele teams die graag wat redeneerkwaliteit zouden inruilen voor een spraakagent die zich laat onderbreken.
Totdat een daarvan landt, is de nauwkeurige beschrijving smal maar werkelijk opmerkelijk: NVIDIA heeft het sterkste open full-duplex stem-checkpoint gepubliceerd dat tot nu toe is gemeten, het het eerste werkende tool-calling-kanaal in die categorie gegeven, het zo gelicenseerd dat niemand het kan uitbrengen, en geweigerd te vermelden dat dit allemaal is gebeurd.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
