NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B: Den full-duplexa röstmodellen som NVIDIA släppte utan att tillkännage

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två modellkort ligger i samma Hugging Face-repository, och de säger emot varandra. Det kort som renderas på sidan kallar modellen NVIDIA NemotronLabs VoiceChat 11B, anger releasedatumet till 3 augusti 2026 och listar 11B parametrar. Det andra, en fil med namnet overview.md som ingen ser om de inte öppnar fliken Files, kallar samma modell 12B, daterar releasen till 16 juli, innehåller en benchmarksektion som det publika kortet utelämnar, och har fortfarande ordet TODO där en resultatbeskrivning borde stå. Inget av korten åtföljdes av ett lanseringsinlägg, ett pressmeddelande, en teknisk rapport eller en tweet från NVIDIA.

Det som finns där är dock ingen platshållare. Det är en 44 GB-checkpoint som lyssnar och talar samtidigt: en enda stack som tar in mikrofonljud och skickar ut syntetiskt tal, utan den vanliga kedjan från taligenkänning via språkmodell till text-till-tal. Den är byggd på Nemotron Nano 9B v2-stommen och kan anropa verktyg mitt i en mening medan den fortsätter prata, och NVIDIA hävdar att det är den första öppna full-duplexmodellen som kan göra det.

Allt nedan läses direkt från det repository — de två korten, config.json, och tensorindexet i viktfilen, som vi parsade själva för att avgöra frågan om 11B kontra 12B. Varje prestandasiffra som NVIDIA publicerar för den här modellen är NVIDIAs egen, uppmätt av NVIDIA, och inte reproducerad. Exakt en oberoende mätning av denna modellfamilj finns offentligt tillgänglig, från Artificial Analysis, och den är registrerad under ett annat namn och ett annat parameterantal — vilket visar sig vara det mest intressanta med releasen.

Vad finns egentligen i arkivet?

Repositoriet skapades den 29 juli 2026 och senast ändrat den 4 augusti. Det innehåller sjutton filer: de två konkurrerande modellkorten, en licens, en config.json, en 44,4 GB model.safetensors, ett arkitekturdiagram, en RNN-T-tokenizerkatalog, fyra korta policyanteckningar om bias, säkerhet, integritet och förklaringsbarhet, och tre .wav filer — en demo av turordning, en barge-in-demo och en demo av verktygsanrop — inbäddade som ljudspelare överst på kortet så att du hör modellen innan du läser om den.

Flera saker saknas, och de betyder mer än fillistan.

Det finns inget paper för den här modellen.Kortet citerar fem: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, plus NVIDIAs eget PersonaPlex-preprint. Ingen av dem är en NemotronLabs VoiceChat-teknisk rapport. Arkitekturen beskrivs i ungefär tre stycken och ett diagram, och det är hela den offentliga redogörelsen för hur den byggdes.

Det finns inget sätt att anropa den. Hugging Face-sidan anger tydligt att modellen "inte är distribuerad av någon inferensleverantör." Det finns ingen värdbaserad slutpunkt, varken från NVIDIA eller någon annan. Den enda öppna communitytråden i repot är en användare som ber NVIDIA att lägga till en handler.py så att checkpointen kan distribueras till Hugging Face Inference Endpoints — någon som försökte köra den på det enkla sättet och upptäckte att det inte finns någon.

Det finns varken pipeline_tag eller library_name. Det är därför sidan varken har någon inferenswidget eller någon uppgiftsetikett, och det är ett symptom på det djupare problemet: config.json är inte en Transformers-konfiguration. Det är en 32 KB NeMo-träningskonfiguration, komplett med ett AdamW-block, ett inlärningstaktsschema, dataloader-bucketintervall och en valideringsdel. Du kan inte använda AutoModel.from_pretrained på detta. Du klonar en specifik gren av NVIDIAs Speech-repository — nemotron-labs-voicechat — bygger en conda-miljö låst till Python 3.12, PyTorch 2.10 och Transformers 4.56, kompilerar causal-conv1d och mamba-ssm utan build isolation och kör deras skript.

Nedladdningsräknaren speglar allt det. 107 gillningar mot 80 nedladdningar under modellens första månad är kännetecknet på en utgåva som människor bokmärkte men inte körde.

NVIDIA NemotronLabs VoiceChat 11B-2

Vi räknade parametrarna, och 11B vinner

En safetensors-fil innehåller en JSON-header som listar varje tensor, dess form och dess dtype, så parameterantalet är inte en åsiktsfråga. Vi hämtade headern och räknade ihop: 11 095 miljoner parametrar fördelade på 1 626 float32-tensorer, vilket upptar 44,38 GB. Så det renderade kortet stämmer, och overview.md är föråldrad — detta är en 11B-modell, och 12B-siffran är en kvarleva.

Hugging Faces modellträd förklarar var en 12B kan ha smugit sig in. Den släktlinje som ritas upp går Nemotron Nano 12B v2 Base, sedan Nemotron Nano 12B v2, sedan Nemotron Nano 9B v2, och först därefter denna modell. NVIDIAs egen textryggradsfamilj innehåller både en 12B och en 9B, där 9B är den beskurna ättlingen till 12B, och VoiceChat är byggd på 9B. Ett kort som utformats tidigare i den kedjan skulle naturligt ha burit det större numret.

Rubriken delas också tydligt längs arkitekturens två halvor:

Förståelsesidan — 10,098B. Av detta är 7,714B Nemotron Nano v2-transformatorstacken, 0,609B är talenkodern, och tre separata 131 072 × 4 480-matriser tar 0,587B vardera.

Talsidan — 0,997B.En text-till-tal-stomme med 28 lager och 1 152 bredd på 0,595B, ett utdatahuvud med gaussisk blandning på 0,159B, och en neural ljudcodec vars enkodare och avkodare är 0,092B vardera.

Två praktiska konsekvenser följer av dtype. Den första är att nedladdningen på 44 GB inte är en stor modell, utan en vanlig modell som levereras i float32; omvandla den till bfloat16 så blir vikterna ungefär 22 GB. Den andra är att NVIDIAs angivna golv på 80 GB GPU är en följd av det valet snarare än av modellens storlek, och den som har ett 48 GB-kort och är villig att konvertera checkpointen själv är inte uppenbart utestängd — även om ingen har publicerat en bekräftad körning med det minnesfotavtrycket, så betrakta det som aritmetik, inte ett löfte.

Hur den lyssnar och pratar samtidigt

"Full duplex" är hela poängen med releasen, och konfigurationen visar hur den köps in. Tre designval gör jobbet.

Talenkodaren kan inte se framåt. Den är en Conformer med 24 lager och 8 huvuden vars uppmärksamhetskontext är satt till [70, 0] — sjuttio ramar av vänsterkontext och noll ramar av högerkontext. En konventionell igenkännare tjuvtittar på ljudet efter det aktuella ögonblicket för att disambiguera det den nyss hörde; denna är förbjuden att göra det, vilket kostar noggrannhet och ger förmågan att fatta ett beslut i samma stund som en ram anländer.

Allt är kvantiserat till 80 ms. Ramlängden i konfigurationen är 0,08 sekunder, vilket matchar den 80 ms-blockstorlek som NVIDIA har beskrivit på annat håll för denna typ av arbete. Modellen beslutar var 80:e ms om den ska fortsätta lyssna eller börja tala. Den kadensen är vad som gör att barge-in upplevs som omedelbar snarare än artig.

Verktygsanrop kommer ur dess egen mun. Kom ihåg de tre identiskt formade matriserna med 131 072 vokabulärposter. En är inbäddningen av indata, en är det vanliga språkmodellshuvudet — och den tredje heter function_head. "Den separata utgångskanalen för verktygsanropsskript" i kortets text är en bokstavlig tredje utdataprojektion, 587 miljoner parametrar bred, som körs parallellt med talgenerering. Det är den arkitektoniska orsaken till att modellen kan skicka iväg ett verktygsanrop utan att avbryta konversationen, och det är ett verkligt designåtagande snarare än en promptkonvention.

Nedströms förutsäger text-till-tal-avkodaren koder för en restvektorkvantiserad codec med 31 kvantiserare och nedsamplingsfaktorer på 7, 7 och 9 — en 441× reduktion som ger en ljudtokenhastighet på 50 frames per sekund, ut vid 22,05 kHz. Ingången är 16 kHz. Det finns också en RNN-T-avkodare och ett gemensamt nätverk i checkpointen, vilket är anledningen till att modellens deklarerade utdata innehåller en transkription av användaren tillsammans med sin egen text och ljud: transkriptionen är ett verkligt igenkänningshuvud, inte en biprodukt. Standardrösten heter Aria, och ett tre sekunders referensklipp betingar talaren.

Ytterligare en detalj från konfigurationen är värd att flagga eftersom den bekräftar en angiven begränsning: träningsdataloadern begränsar yttranden till 142,39 sekunder. Modellkortets varning om att modellen inte rymmer mer än två minuters ljudkontext är synlig i datapipelinen som producerade den.

Poängen, och vem som faktiskt mätte dem

NVIDIA:s främsta påståenden gäller latens och rankning. På Full-Duplex-Bench 1.0 rapporterar man 448 ms för att smidigt ta ordet och 480 ms för att lämna över ordet vid avbrott, med en övertagningsgrad på 0,82 för smidigt turtagande och 1,0 för användaravbrott, samt ett GPT-4o-domarbetyg på 4,33 för avbrottshantering. Man hävdar #2 bland öppna full-duplexmodeller på VoiceBench och #2 bland öppna modeller på Full-Duplex-Bench. Alla dessa är NVIDIA:s egna körningar.

Ställ upp dem mot omvärlden och två luckor öppnar sig.

När det gäller talresonemang är leverantörens siffra ungefär åtta poäng för hög. Den orenderade overview.md rapporterar 37,0% på Big Bench Audio. Artificial Analysis mätte oberoende denna modellinje till 29,2%. Samma benchmark, samma familj, en skillnad som är tillräckligt stor för att ändra var modellen placeras i rankningen.

På VoiceBench är tillverkarens siffra för blygsam. Kortet gör anspråk på #2 bland öppna full-duplex-modeller; den offentliga VoiceBench-ledartavlan har denna modell på 58.10, vilket är toppen av den öppna full-duplex-gruppen, före Freeze-Omni på 55.20 och Moshi på 29.51. NVIDIAs eget utkast till modellkort rapporterar 55.1 för sig själv — under den siffra som ledartavlan nu listar.

Det finns också en mindre märklighet: NVIDIAs egen jämförelsetabell bedömer dess rivaler generösare än vad Artificial Analysis gör. Utkastkortet placerar Freeze-Omni på 33.4% och PersonaPlex 7B på 19.1% på Big Bench Audio; Artificial Analysis mäter 33.9% och 12.6%. Rivalernas inbördes ordning överlever i båda fallen, vilket är betryggande, men det påminner om att en leverantörs testmiljö och en oberoende sådan inte ger samma siffror ens för tredje parter.

NVIDIA NemotronLabs VoiceChat 11B-3

Diagrammet gör den ärliga rubriken oundviklig. Bland öppna full-duplexmodeller är detta ett verkligt steg framåt — det mer än fördubblar PersonaPlex på talat resonemang och lämnar Moshi i en helt annan kategori. Mätt mot vad du kan köpa är det inte i närheten: Step-Audio R1.1 på 96 %, Grok 4.5:s Voice Agent och Gemini 2.5 Flash (Thinking) på 92 %, Nova 2.0 Sonic på 87 %. Det är ett gap på ungefär tre mot ett i resonemang från talad input.

Det tydligaste sättet att se vad full duplex för närvarande kostar finns i NVIDIAs egen katalog. På VoiceBench får NVIDIA Nemotron 3 Nano Omni 30B A3B — en större modell som inte är full duplex — 89,39, mot 58,10 för VoiceChat. Ungefär trettio poäng i assistentkvalitet är priset för avbrottshanteringen och turtagningen på under 500 ms, åtminstone i den här generationen. Om din produkt inte behöver en modell som kan avbrytas mitt i ett ord, betalar du mycket för en funktion du inte kommer att använda.

Verktygsanrop är huvudnumret, och också den svagaste delen.

"Första öppna full-duplex-modellen som stödjer verktygsanrop" är påståendet som releasen vilar på, och siffrorna under det är ojämna. På en talad version av BFCL-v3 rapporterar NVIDIA ett genomsnitt på 56,1 %: 58,5 % enkla, 62,5 % multipla, 42,5 % parallella, 27,5 % parallell-multipla och 89,6 % för korrekt avböjande av irrelevanta anrop. På Full-Duplex-Bench v3 är uppdelningen ännu skarpare.

Verktygsval — 82,5%. Att välja rätt funktion från listan, vilket NVIDIA med rätta beskriver som konkurrenskraftigt med frontmodeller.

Argumentnoggrannhet — 44.2%. Att fylla i funktionens parametrar korrekt utifrån vad användaren sa.

Pass@1 — 33%. Att få hela samtalet rätt på första försöket.

En modell som vet vilket verktyg den vill använda med två tredjedelar högre tillförlitlighet än den kan fylla i verktygets argument är en modell som självsäkert slår upp vädret för fel stad. I en textagent skulle man fånga upp det med ett valideringslager och ett nytt försök; i ett live-röstsamtal är det nya försöket hörbart, och kortet anger att modellen inte alls ska göra om ett misslyckat samtal — den är instruerad att tala om för användaren att API:et har ett problem.

De operativa begränsningarna kring det är snäva, och NVIDIA listar dem utan skönmålning: max fem verktyg per session innan kvaliteten försämras, inga tillförlitliga samtidiga anrop av flera verktyg, ingen möjlighet för användaren att avbryta medan ett verktyg körs, och en tendens i blandade konversationer att svara utifrån sin egen kunskap istället för att anropa det verktyg den borde ha anropat. Långa verktygssvar får agenten att stanna av, vilket är vad funktionen "väntelägesmeddelande" finns till för att dölja — du skriver i förväg en fras som agenten säger i samma stund som ett anrop skickas iväg, så att tystnaden får något i sig.

En egenhet som kommer att kosta någon en eftermiddag: systemprompter och verktygssvar måste vara endast ASCII. Inga tankstreck, inga typografiska citattecken, inga gradtecken, ingen emoji. Verktygsutdata måste plattas ut till enkla, talvänliga ASCII-meningar innan det når modellen, vilket innebär att ett JSON API-svar inte kan skickas vidare i rå form.

Vad det kostar att köra, och licensen som stoppar dig

Börja med hårdvaran. NVIDIAs gren-dokumentation kräver ett GPU med minst 80 GB minne, vilket pekar mot en H100 eller H200, och den testade konfigurationen är en H100 med vLLM. On-demand H100-kapacitet kostar ungefär 2–3 dollar per timme hos de vanliga GPU-molnen, så en kontinuerligt körande instans ligger någonstans runt 1 500–2 200 dollar i månaden innan du har skrivit någon applikationskod, anställt någon för att underhålla den eller betjänat en andra samtidig konversation.

Nu till jämförelsen. Artificial Analysis normaliserar prissättningen för värdbaserad tal-till-tal till kostnad per timme för inmatat ljud, och det nuvarande spannet sträcker sig från cirka 1,42 dollar/timme i den billigare änden till 10,75 dollar/timme för den dyraste premiumnivån, med ett välrenommerat alternativ i mellansegmentet som Grok Voice Think Fast 2.0 som landar på 4,80 dollar/timme — det vill säga 0,08 dollar per ljudminut.

NVIDIA NemotronLabs VoiceChat 11B-4

Läs de där två styckena tillsammans och fallet för självhostning är svagare än det verkar. En dedikerad H100 är bara billigare än en mellanprisklassad hostad slutpunkt om du verkligen håller den sysselsatt, och den är dyrare än den billiga änden av den hostade marknaden nästan oavsett utnyttjandegrad – samtidigt som du också tar på dig ingenjörsarbetet, jouren och en modell som får 29,2 % där de hostade alternativen får 87–96 %.

Och så är det väggen. Licensen är OpenMDW License Agreement v1.1, och kortet anger i sitt eget blockcitat att modellen ”är endast avsedd för forskningsändamål.” Koden på GitHub-grenen är Apache-2.0; vikterna är det inte. Du kan ladda ner detta, studera det, finjustera det, benchmarka det och skriva om det. Du kan inte erbjuda det till kunder. Alla ekonomiska argument ovan är därför akademiska för ett företag som försöker lansera en röstprodukt — frågan var aldrig om GPU-beräkningarna fungerade.

Vilket också är varför vi kommer att säga det uppenbara rakt ut: NemotronLabs VoiceChat 11B går inte att anropa via OrcaRouter, eftersom den inte går att anropa via någonting. Vad en nyckel faktiskt ger dig är baslinjen som den bör mätas mot – de värdbaserade röst- och ljudmodellerna ligger bakom ett enda API med 0 % påslag, vilket innebär att vi skickar vidare leverantörens listpris direkt, så när en leverantör sänker sitt ljudpris är det lägre beloppet du betalar den dagen snarare än efter en kontraktsperiod. Om du prissätter en röstagent är den per-minut-siffran det nummer som en 80 GB GPU måste slå, och det är värt att veta exakt innan du binder dig till ett rack.

Namnproblemet: 11B, 12B, NemotronLabs, Nemotron 3

Det är här som det mesta av den tidiga rapporteringen har gått fel, så det är värt att vara försiktig med vad som är fastställt och vad som inte är det.

Fyra av NVIDIAs egna kanaler beskriver detta arbete under tre olika etiketter. Hugging Face publicerar "NVIDIA NemotronLabs VoiceChat 11B" med öppna vikter och en licens enbart för forskning. NVIDIAs utvecklarblogg beskrev i mars 2026 "Nemotron 3 VoiceChat" som en 12B-parameter full-duplexmodell i tidig åtkomst, med sikte på under 300 ms end-to-end-latens på 80 ms segment, med ett program för tidig åtkomst som erbjuder referenscontainrar, benchmarkresultat och en finjusteringsväg, och lovar "öppna, inspekterbara vikter för företagsdistribution." Den offentliga VoiceBench-topplistan och Artificial Analysis anger båda sina bidrag som "Nemotron 3 VoiceChat (V1)," 12B.

Vad som går att veta: arkitekturbeskrivningarna stämmer överens komponent för komponent — Fast Conformer-kodare, Nemotron Nano v2 9B-stomme, NVIDIA text-till-tal-avkodare, separat kanal för verktygsanrop, 80 ms-ramar, en enhetlig stack. Det orenderade kortet i Hugging Face-repot använder 12B-siffran som de övriga ytorna använder. Det är samma forskningslinje, och tredjepartsposterna mäter nästan säkert denna familj.

Vad som inteär bekräftat: att den checkpoint som du kan ladda ner idag är bit-för-bit vad Artificial Analysis och VoiceBench utvärderade, eller vad early-access-programmet delar ut. Två detaljer talar emot att anta det. Antalet parametrar skiljer sig, 11,095B uppmätt mot 12B enligt anmälan. Och latensmålen skiljer sig kraftigt — bloggens företagspitch är under 300 ms end-to-end, medan det lanserade kortet mäter 448 ms och 480 ms på Full-Duplex-Bench. Det kan vara olika mätpunkter på samma modell, eller olika modeller. NVIDIA har inte sagt det, eftersom NVIDIA inte har sagt något om den här releasen överhuvudtaget.

Den praktiska slutsatsen: om du citerar en siffra för den här modellen, ange vilken källa den kommer från. Rapportering som tillskriver Artificial Analysis 29,2 % till Hugging Face-modellkortet, eller NVIDIAs 37,0 % till ett oberoende test, har slagit samman två saker som NVIDIA själv håller isär i separata dokument med olika parametrarantal.

Där det går sönder

Utkastkortets begränsningsavsnitt är ovanligt uppriktigt, och GitHub-grenen lägger till fler. Samlat:

Endast engelska, och ingen flerspråkig färdplan i repot.

Två minuters minne. Konversation utöver ett ljudfönster på två minuter kanske inte behålls — en hård begränsning för supportsamtal eller allt som behöver komma ihåg vad som avtalades för fyra minuter sedan.

Dummare än sin egen ryggrad. NVIDIA uppger att den kan prestera sämre än Nemotron Nano 9B v2 när det gäller kunskap, instruktionsföljning och säkerhet, eftersom den var finjusterad för konversationell naturlighet. Den tränades inte uttryckligen för resonemang eller anpassning; flerstegsresonemang och aritmetik pekas ut som svaga.

Ingen tillförlitlig backchanneling. "Mm-hm"-ljudet som signalerar att en människa fortfarande lyssnar hanteras inte systematiskt.

Den kommer att avbryta dig mitt i en mening. Grenanteckningarna listar avbrott av användaren vid en paus mitt i meningen, och "okontrollerad fortsättning / självprat," bland kända felfall — den direkta kostnaden för en enkodare med noll högerkontext.

Endast tysta rum.Uttryckligen olämplig för bullriga eller efterklangsrika miljöer, särskilt där bakgrundstal förekommer. Det utesluter de flesta callcenter-golv och de flesta bilar.

Vem borde egentligen ladda ner detta

Forskare som arbetar med duplex talmodellering får ut mest här, och bör gå vidare: en öppen 11B-checkpoint med en fungerande verktygsanropskanal, tränad på ungefär 550 000 timmar av blandat verkligt och syntetiskt ljud, är en betydligt bättre utgångspunkt än att återimplementera från SALM-Duplex-artikeln. Forskningslicensen är inte en begränsning för det arbetet.

Team som bygger röstagenter bör läsa modellkortet och hoppa över nedladdningen. Ingenting du lär dig från en 44 GB float32-checkpoint som du inte kan leverera kommer att förändra din arkitektur, och den ärliga lärdomen från benchmarktesterna är att end-to-end full duplex ännu inte är konkurrenskraftigt mot en bra hostad modell på det användarna märker mest, nämligen om assistenten förstod dem. Under tiden är det förnuftiga draget att bygga mot en hostad endpoint och hålla bytet billigt — en nyckel för 200+ modeller med automatisk redundans innebär att en incident hos leverantören inte tar ner din telefonlinje mitt i ett samtal, och det innebär att byta till en öppen full-duplex-modell senare är en konfigurationsändring snarare än en omskrivning.

Företag som specifikt bryr sig om detta bör ansöka om tidig åtkomst till Nemotron 3 VoiceChat snarare än att bygga vidare på Hugging Face-vikterna. Det programmet är där den distribuerbara licensen, referenscontainrarna och sub-300 ms-påståendet finns. Den offentliga checkpointen är en forskningsförhandsvisning av samma idé, publicerad utan det pappersarbete som skulle låta dig använda den.

Tre frågor som det här repot kommer att fortsätta få

Kan jag använda den kommersiellt om jag finjusterar den kraftigt? Nej. OpenMDW v1.1 plus kortets uttalande "endast för forskningsändamål" styr vikterna och allt som härrör från dem; Apache-2.0-licensen på GitHub-grenen täcker inferenskoden, inte kontrollpunkten. Finjustering tvättar inte en licens. Om du behöver kommersiella rättigheter är early-access-programmet den väg NVIDIA faktiskt har skapat för det.

Är detta samma modell som den på topplistorna? Samma familj, nästan säkert; identisk artefakt, obekräftat. Topplistan och Artificial Analysis-posterna är registrerade som "Nemotron 3 VoiceChat (V1)" på 12B, den nedladdningsbara checkpointen mäter 11.095B, och NVIDIA har inte publicerat något som förenar dem. Använd topplistsiffrorna som den bästa tillgängliga oberoende indikationen på härstamningen, inte som en verifierad mätning av filen på Hugging Face.

Kommer den att köras på något mindre än ett 80 GB-kort? Förmodligen, med arbete, och ingen har publicerat bevis. Vikterna är float32, så en bfloat16-konvertering borde minska ungefär 44 GB parametrar till ungefär 22 GB, vilket lämnar rejält med utrymme på ett 48 GB-kort innan du räknar in KV-cachen, codec och de strömmande buffertarna. Men den supportade vägen är vLLM på en H100 med 80 GB, distributionscontainern är byggd för det, och den enda testade konfigurationen NVIDIA rapporterar är den. Budgetera tid, inte bara VRAM.

Vad du ska titta på

Tre saker skulle var och en förändra uppfattningen om denna release. En teknisk rapport, eller till och med ett modellkort som slutar motsäga sig självt, skulle tala om för oss om 11B-checkpointen är den artefakt som ledartavlorna mätte. En oberoende latensreproduktion – någon utanför NVIDIA som bekräftar 448 ms turtagning på egen hårdvara – skulle förvandla releaseens mest attraktiva påstående från marknadsföring till fakta. Och en kommersiell licens, eller en värdbaserad slutpunkt från vem som helst, skulle flytta detta från en pappersnära kuriositet till ett verkligt alternativ för många team som gärna skulle byta lite resonemangskvalitet mot en röstagent som kan avbrytas.

Tills någon av dessa landar är den korrekta beskrivningen snäv men genuint anmärkningsvärd: NVIDIA har publicerat den starkaste öppna full-duplex-röstcheckpoint som hittills uppmätts, försett den med den första fungerande verktygsanropskanalen i den kategorin, licensierat den så att ingen kan leverera den, och avstått från att nämna att något av detta har hänt.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube