NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B: el modelo de voz full-duplex que NVIDIA lanzó sin anunciarlo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos tarjetas de modelo están en el mismo repositorio de Hugging Face y no coinciden entre sí. La que se muestra en la página llama al modelo NVIDIA NemotronLabs VoiceChat 11B, indica que su fecha de lanzamiento es el 3 de agosto de 2026 y lista 11B de parámetros. La segunda, un archivo llamado overview.md que nadie ve a menos que abra la pestaña Files, llama al mismo modelo 12B, fecha el lanzamiento el 16 de julio, incluye una sección de puntos de referencia que la tarjeta pública omite, y aún tiene la palabra TODO donde debería ir una descripción de los resultados. Ninguna de las dos tarjetas venía acompañada de una publicación de lanzamiento, una nota de prensa, un informe técnico o un tweet de NVIDIA.

Lo que hay ahí dentro no es un marcador de posición, sin embargo. Es un punto de control de 44 GB que escucha y habla al mismo tiempo: una única pila que recibe audio de micrófono y emite voz sintetizada, sin el relevo habitual de reconocimiento de voz a un modelo de lenguaje y de ahí a texto a voz. Está construido sobre la base Nemotron Nano 9B v2, puede invocar herramientas a mitad de frase mientras sigue hablando, y NVIDIA afirma que es el primer modelo full-duplex abierto capaz de hacerlo.

Todo lo siguiente se lee directamente de ese repositorio: las dos tarjetas, config.json, y el índice de tensores dentro del archivo de pesos, que analizamos nosotros mismos para resolver la cuestión de 11B frente a 12B. Cada cifra de rendimiento que NVIDIA publica para este modelo es de NVIDIA, medida por NVIDIA, y no ha sido reproducida. Exactamente una medición independiente de este linaje existe públicamente, de Artificial Analysis, y está registrada con un nombre diferente y un recuento de parámetros diferente, lo que resulta ser lo más interesante del lanzamiento.

¿Qué hay realmente en el repositorio?

El repositorio se creó el 29 de julio de 2026 y se modificó por última vez el 4 de agosto. Contiene diecisiete archivos: las dos tarjetas de modelo en competencia, una licencia, un config.json, un model.safetensors de 44,4 GB, un diagrama de arquitectura, un directorio de tokenizador RNN-T, cuatro breves notas de política sobre sesgo, seguridad, privacidad y explicabilidad, y tres archivos .wav — una demo de toma de turnos, una demo de interrupción y una demo de llamada de herramientas — integrados como reproductores de audio en la parte superior de la tarjeta para que escuches el modelo antes de leer sobre él.

Faltan varias cosas, y son más importantes que la lista de archivos.

No hay ningún artículo para este modelo. La tarjeta cita cinco: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, más el preprint de PersonaPlex de NVIDIA. Ninguno de ellos es un informe técnico de NemotronLabs VoiceChat. La arquitectura se describe en unos tres párrafos y un diagrama, y eso es todo el relato público de cómo se construyó.

No hay forma de invocarlo. La página de Hugging Face indica claramente que el modelo «no está desplegado por ningún proveedor de inferencia». No hay ningún endpoint alojado, ni de NVIDIA ni de nadie más. El único hilo abierto de la comunidad en el repositorio es un usuario que le pide a NVIDIA que añada un handler.py para que el checkpoint pueda desplegarse en Hugging Face Inference Endpoints: alguien que intentó ejecutarlo de la manera fácil y descubrió que no existe.

No hay pipeline_tag ni library_name. Por eso la página no tiene widget de inferencia ni etiqueta de tarea, y es un síntoma del problema de fondo: config.json no es una configuración de Transformers. Es una configuración de NeMo de 32 KB para entrenamiento, completa con un bloque AdamW, un programa de tasa de aprendizaje, los bucket bins del dataloader y una división de validación. No puedes apuntar AutoModel.from_pretrained a esto. Clonas una rama específica del repositorio de voz de NVIDIA — nemotron-labs-voicechat — creas un entorno de conda fijado a Python 3.12, PyTorch 2.10 y Transformers 4.56, compilas causal-conv1d y mamba-ssm sin aislamiento de compilación, y ejecutas su script.

El contador de descargas refleja todo eso. 107 me gusta frente a 80 descargas en el primer mes del modelo es la firma de un lanzamiento que la gente marcó como favorito y no ejecutó.

NVIDIA NemotronLabs VoiceChat 11B-2

Contamos los parámetros, y 11B gana

Un archivo safetensors incluye un encabezado JSON que enumera cada tensor, su forma y su dtype, por lo que el recuento de parámetros no es una cuestión de opinión. Extrajimos el encabezado y lo sumamos: 11 095 millones de parámetros repartidos en 1626 tensores float32, que ocupan 44,38 GB. Por lo tanto, la tarjeta renderizada es correcta y overview.md está desactualizado — este es un modelo de 11B, y la cifra de 12B es un resto.

El árbol de modelos de Hugging Face explica dónde podría haberse colado un 12B. El linaje que traza va de Nemotron Nano 12B v2 Base, luego Nemotron Nano 12B v2, luego Nemotron Nano 9B v2, y solo después este modelo. La propia familia de backbones de texto de NVIDIA contiene tanto un 12B como un 9B, siendo el 9B el descendiente podado del 12B, y VoiceChat está construido sobre el 9B. Una ficha redactada antes en esa cadena habría llevado naturalmente el número mayor.

El encabezado también se divide limpiamente a lo largo de las dos mitades de la arquitectura:

Lado de comprensión — 10.098B. De eso, 7.714B son el stack de transformadores Nemotron Nano v2, 0.609B son el codificador de voz, y tres matrices separadas de 131,072 × 4,480 ocupan 0.587B cada una.

Lado del habla — 0.997B. Un backbone de texto a voz de 28 capas y 1,152 de ancho con 0.595B, una cabeza de salida de mezcla de gaussianas de 0.159B, y un codec de audio neuronal cuyo codificador y decodificador tienen 0.092B cada uno.

Dos consecuencias prácticas se derivan del dtype. La primera es que la descarga de 44 GB no es un modelo grande, es un modelo normal enviado en float32; si lo conviertes a bfloat16, los pesos son aproximadamente 22 GB. La segunda es que el mínimo declarado por NVIDIA de una GPU de 80 GB es una consecuencia de esa elección y no del tamaño del modelo, y cualquiera con una tarjeta de 48 GB que esté dispuesto a convertir el checkpoint por sí mismo no está claramente excluido — aunque nadie ha publicado una ejecución confirmada con ese requisito de memoria, así que trátalo como aritmética, no como una promesa.

Cómo escucha y habla al mismo tiempo

"Full duplex" es el objetivo principal de la versión, y la configuración muestra cómo se compra. Tres decisiones de diseño hacen el trabajo.

El codificador de voz no puede mirar hacia adelante. Es un Conformer de 24 capas y 8 cabezas cuya atención está configurada con un contexto de [70, 0] — setenta marcos de contexto izquierdo y cero marcos de contexto derecho. Un reconocedor convencional mira el audio después del momento actual para desambiguar lo que acaba de oír; a este se le prohíbe hacerlo, lo que cuesta precisión y otorga la capacidad de emitir una decisión en el instante en que llega un marco.

Todo está cuantizado a 80 ms. La duración de trama en la configuración es de 0,08 segundos, lo que coincide con el tamaño de fragmento de 80 ms que NVIDIA ha descrito en otros lugares para esta línea de trabajo. El modelo decide, cada 80 ms, si seguir escuchando o comenzar a hablar. Ese ritmo es lo que hace que la interrupción se sienta inmediata en lugar de cortés.

Las llamadas a herramientas salen de su propia boca. Recuerda esas tres matrices de forma idéntica con vocabulario de 131,072. Una es el embedding de entrada, otra es la cabeza ordinaria del modelo de lenguaje — y la tercera se llama function_head. El "canal de salida separado para los scripts de llamada a herramientas" en la prosa de la tarjeta es una tercera proyección de salida literal, de 587 millones de parámetros de ancho, que se ejecuta en paralelo con la generación de voz. Esa es la razón arquitectónica por la que el modelo puede enviar una llamada a herramientas sin detener la conversación, y es un compromiso de diseño real en lugar de una convención de prompt.

Más adelante, el decodificador de texto a voz predice códigos para un códec de cuantización vectorial residual con 31 cuantizadores y tasas de submuestreo de 7, 7 y 9 — una reducción de 441× que sitúa la tasa de tokens de audio en 50 tramas por segundo, a 22.05 kHz de salida. La entrada es de 16 kHz. También hay un decodificador RNN-T y una red conjunta en el checkpoint, por lo que las salidas declaradas del modelo incluyen una transcripción del usuario junto con su propio texto y audio: la transcripción es una cabeza de reconocimiento real, no un subproducto. La voz predeterminada se llama Aria, y un clip de referencia de tres segundos condiciona al hablante.

Un detalle más de la configuración merece señalarse porque corrobora una limitación declarada: el dataloader de entrenamiento limita los enunciados a un máximo de 142,39 segundos. La advertencia de la tarjeta de que el modelo no admite más de dos minutos de contexto de audio es visible en el pipeline de datos que lo produjo.

Las puntuaciones, y quién las midió realmente

Las afirmaciones principales de NVIDIA son la latencia y el ranking. En Full-Duplex-Bench 1.0 reporta 448 ms para tomar un turno con fluidez y 480 ms para ceder el turno al ser interrumpido, con una tasa de toma de turno de 0.82 en la toma de turnos fluida y 1.0 en la interrupción del usuario, y una puntuación del juez GPT-4o de 4.33 en el manejo de interrupciones. Afirma el puesto #2 entre los modelos full-duplex abiertos en VoiceBench y el #2 entre los modelos abiertos en Full-Duplex-Bench. Todos esos resultados provienen de las ejecuciones de la propia NVIDIA.

Alinéalos contra el mundo exterior y dos espacios se abren.

En razonamiento del habla, la cifra del proveedor es unos ocho puntos más alta. El no renderizado overview.md reporta un 37,0% en Big Bench Audio. Artificial Analysis midió de forma independiente esta línea en un 29,2%. Mismo benchmark, misma familia, una brecha lo suficientemente grande como para cambiar la posición del modelo en el ranking.

En VoiceBench, el número del proveedor es demasiado modesto. La tarjeta afirma el puesto #2 entre los modelos open full-duplex; la tabla de clasificación pública de VoiceBench sitúa a este modelo en 58.10, que es el primero de la categoría open full-duplex, por delante de Freeze-Omni con 55.20 y Moshi con 29.51. El propio borrador de la tarjeta de NVIDIA reporta 55.1 para su modelo, por debajo del número que ahora figura en la tabla.

También hay una rareza menor: la propia tabla comparativa de NVIDIA puntúa a sus rivales de forma más generosa que Artificial Analysis. La tarjeta preliminar sitúa a Freeze-Omni en 33,4% y a PersonaPlex 7B en 19,1% en Big Bench Audio; Artificial Analysis mide 33,9% y 12,6%. El orden entre pares se mantiene en ambos casos, lo cual es tranquilizador, pero es un recordatorio de que el banco de pruebas de un proveedor y uno independiente no devuelven los mismos números ni siquiera para terceros.

NVIDIA NemotronLabs VoiceChat 11B-3

El gráfico hace inevitable el titular honesto. Entre los modelos full-duplex abiertos, esto es un paso genuino hacia adelante: más que duplica a PersonaPlex en razonamiento hablado y deja a Moshi en una categoría completamente distinta. Medido contra lo que se puede comprar, no se le acerca ni de lejos: Step-Audio R1.1 con 96%, el Voice Agent de Grok 4.5 y Gemini 2.5 Flash (Thinking) con 92%, Nova 2.0 Sonic con 87%. Eso es una brecha de aproximadamente tres a uno en el razonamiento a partir de entrada hablada.

La forma más clara de ver cuánto cuesta actualmente el full duplex es en el propio catálogo de NVIDIA. En VoiceBench, NVIDIA Nemotron 3 Nano Omni 30B A3B —un modelo más grande que no es full duplex— obtiene 89,39, frente a los 58,10 de VoiceChat. El precio son aproximadamente treinta puntos de calidad del asistente por la gestión de interrupciones y la toma de turnos inferior a 500 ms, al menos en esta generación. Si tu producto no necesita un modelo que pueda ser interrumpido a media palabra, estás pagando mucho por una función que no vas a utilizar.

La llamada a herramientas es el titular, y también la parte más débil.

"Primer modelo full-duplex de código abierto que admite llamadas a herramientas" es la afirmación sobre la que se sustenta el lanzamiento, y las cifras subyacentes son desiguales. En una conversión hablada de BFCL-v3, NVIDIA reporta un promedio del 56,1%: 58,5% simples, 62,5% múltiples, 42,5% paralelas, 27,5% paralelas-múltiples y 89,6% en el rechazo correcto de llamadas irrelevantes. En Full-Duplex-Bench v3, la división es aún más pronunciada.

Selección de herramientas — 82.5%. Elegir la función correcta de la lista, lo cual NVIDIA describe acertadamente como competitivo con los modelos de vanguardia.

Precisión de los argumentos — 44,2%. Completar correctamente los parámetros de esa función a partir de lo que dijo el usuario.

Pass@1 — 33 %.Acertar toda la llamada al primer intento.

Un modelo que sabe qué herramienta quiere con una fiabilidad dos tercios mayor que la que tiene para completar los argumentos de la herramienta es un modelo que buscará con confianza el clima de la ciudad equivocada. En un agente de texto, lo detectarías con una capa de validación y un reintento; en una llamada de voz en vivo, el reintento es audible, y la tarjeta indica que el modelo no debe reintentar una llamada fallida en absoluto: se le instruye para que le diga al usuario que la API tiene un problema.

Las restricciones operativas a su alrededor son estrictas, y NVIDIA las enumera sin muchos rodeos: un máximo de cinco herramientas por sesión antes de que la calidad se deteriore, sin llamadas simultáneas fiables de múltiples herramientas, sin forma de que el usuario interrumpa mientras se ejecuta una herramienta, y una tendencia en conversación mixta a responder desde su propio conocimiento en lugar de llamar a la herramienta que debía. Las respuestas largas de las herramientas detienen al agente, que es lo que la función de "mensaje en espera" existe para tapar — escribes de antemano una frase que el agente dice en el momento en que se dispara una llamada, para que el silencio tenga algo.

Una peculiaridad que le costará una tarde a alguien: las indicaciones del sistema y las respuestas de las herramientas deben ser solo ASCII. Nada de rayas, ni comillas curvas, ni símbolos de grado, ni emojis. La salida de las herramientas debe simplificarse en frases ASCII sencillas y aptas para el habla antes de llegar al modelo, lo que significa que una respuesta de API JSON no puede pasarse sin procesar.

Lo que cuesta ejecutarlo y la licencia que te lo impide

Comenzamos con el hardware. La documentación de la rama de NVIDIA pide una GPU con al menos 80 GB de memoria, lo que apunta a una H100 o H200, y la configuración probada es una H100 con vLLM. La capacidad de H100 bajo demanda cuesta aproximadamente 2 a 3 dólares por hora en las nubes de GPU más comunes, por lo que una instancia en funcionamiento continuo ronda los 1,500 a 2,200 dólares al mes antes de que hayas escrito código de aplicación, contratado a alguien para mantenerla o atendido una segunda conversación concurrente.

Ahora la comparación. Artificial Analysis normaliza el precio del habla a habla alojado al costo por hora de audio de entrada, y el rango actual va desde aproximadamente $1.42/hora en el extremo económico hasta $10.75/hora para el nivel premium más caro, con una opción de mercado medio bien considerada, como Grok Voice Think Fast 2.0, situándose en $4.80/hora — es decir, $0.08 por minuto de audio.

NVIDIA NemotronLabs VoiceChat 11B-4

Lee esos dos párrafos juntos y el caso del autoalojamiento es más débil de lo que parece. Una H100 dedicada solo es más barata que un endpoint alojado de precio medio si la mantienes genuinamente ocupada, y es más cara que el extremo barato del mercado alojado casi independientemente de la utilización — mientras que también asumes la ingeniería, la guardia, y un modelo que obtiene un 29.2% donde las opciones alojadas obtienen un 87–96%.

Y luego está el muro. La licencia es el OpenMDW License Agreement v1.1, y la tarjeta indica en su propio bloque de cita que el modelo «está listo únicamente para fines de investigación». El código en la rama de GitHub es Apache-2.0; los pesos no. Puedes descargarlo, estudiarlo, afinarlo, evaluarlo y escribir sobre él. No puedes ponerlo delante de los clientes. Por lo tanto, todo argumento económico anterior es académico para una empresa que intenta lanzar un producto de voz — la cuestión nunca fue si los cálculos de la GPU funcionaban.

Por eso también diremos lo obvio sin rodeos: NemotronLabs VoiceChat 11B no se puede invocar a través de OrcaRouter, porque no se puede invocar a través de nada. Lo que una sola clave te ofrece es la referencia con la que debería medirse: los modelos de voz y audio alojados están detrás de una única API con un margen del 0 %, lo que significa que aplicamos el precio de lista del proveedor tal cual, de modo que cuando un proveedor reduce su tarifa de audio, el número más bajo es lo que pagas ese mismo día, en lugar de después de un ciclo de contrato. Si estás fijando el precio de un agente de voz, esa cifra por minuto es el número que una GPU de 80 GB tiene que superar, y vale la pena saberlo con precisión antes de comprometerte con un rack.

El problema del nombre: 11B, 12B, NemotronLabs, Nemotron 3.

Aquí es donde la mayor parte de la cobertura inicial ha fallado, por lo que vale la pena tener cuidado sobre lo que está establecido y lo que no.

Cuatro de las propias plataformas de NVIDIA describen este trabajo bajo tres etiquetas distintas. Hugging Face publica "NVIDIA NemotronLabs VoiceChat 11B" con pesos abiertos y una licencia solo para investigación. El blog de desarrolladores de NVIDIA, en marzo de 2026, describió "Nemotron 3 VoiceChat" como un modelo full-duplex de 12B parámetros en acceso anticipado, con el objetivo de lograr sub-300 ms de latencia de extremo a extremo en fragmentos de 80 ms, con un programa de acceso anticipado que ofrece contenedores de referencia, resultados de evaluaciones comparativas y una ruta de ajuste fino, y que promete "pesos abiertos e inspeccionables para despliegue empresarial". El ranking público VoiceBench y Artificial Analysis registran sus entradas como "Nemotron 3 VoiceChat (V1)", 12B.

Lo que se sabe: las descripciones de arquitectura coinciden componente por componente — codificador Fast Conformer, backbone Nemotron Nano v2 9B, decodificador de texto a voz de NVIDIA, canal separado de llamada a herramientas, frames de 80 ms, una pila unificada. La tarjeta sin renderizar en el repositorio de Hugging Face usa la cifra de 12B que usan las otras superficies. Es la misma línea de trabajo, y las entradas de terceros casi con seguridad están midiendo esta familia.

Lo que no está confirmado: que el checkpoint que puedes descargar hoy sea idéntico, bit a bit, a lo que Artificial Analysis y VoiceBench evaluaron, o a lo que entrega el programa de acceso temprano. Dos detalles desaconsejan asumirlo. Los conteos de parámetros difieren: 11.095B medidos, frente a 12B declarados. Y los objetivos de latencia difieren drásticamente: la propuesta para empresas del blog es de menos de 300 ms de extremo a extremo, mientras que la ficha del modelo enviada mide 448 ms y 480 ms en Full-Duplex-Bench. Esos podrían ser puntos de medición diferentes en el mismo modelo, o modelos diferentes. NVIDIA no lo ha dicho, porque NVIDIA no ha dicho nada en absoluto sobre este lanzamiento.

La conclusión práctica: si citas una cifra para este modelo, cita de qué superficie proviene. La cobertura que atribuye el 29,2% de Artificial Analysis a la tarjeta del modelo de Hugging Face, o el 37,0% de NVIDIA a una prueba independiente, ha fusionado dos cosas que NVIDIA misma mantiene en documentos separados con diferentes recuentos de parámetros.

Dónde se rompe

La sección de limitaciones de la tarjeta de borrador es inusualmente sincera, y la rama de GitHub añade más. Recopilado:

Solo inglés, y no hay hoja de ruta multilingüe en el repositorio.

Memoria de dos minutos. La conversación más allá de una ventana de audio de dos minutos puede no conservarse — un límite estricto para llamadas de soporte o cualquier cosa que necesite recordar lo que se acordó hace cuatro minutos.

Más tonto que su propia columna vertebral. NVIDIA afirma que puede rendir por debajo de Nemotron Nano 9B v2 en conocimiento, seguimiento de instrucciones y seguridad, porque fue ajustado para la naturalidad conversacional. No fue entrenado explícitamente para razonamiento o alineación; el razonamiento de múltiples pasos y la aritmética se señalan como débiles.

Sin retroalimentación confiable. El "mm-hm" que indica que un humano sigue escuchando no se maneja sistemáticamente.

Te interrumpirá a mitad de frase. Las notas de la rama enumeran la interrupción del usuario en una pausa a mitad de frase y la "continuación descontrolada / autodiálogo" entre los modos de fallo conocidos — el costo directo de un codificador sin contexto derecho.

Solo habitaciones silenciosas. Explícitamente inadecuado para entornos ruidosos o reverberantes, especialmente donde se produce habla de fondo. Eso descarta la mayoría de las plantas de centros de llamadas y la mayoría de los coches.

¿Quién debería realmente descargar esto?

Los investigadores que trabajan en modelado de habla dúplex son los que más se benefician aquí, y deberían dar el paso: un checkpoint abierto de 11B con un canal funcional de llamada a herramientas, entrenado con aproximadamente 550.000 horas de audio real y sintético combinado, es un punto de partida mucho mejor que reimplementar a partir del artículo de SALM-Duplex. La licencia de investigación no es una restricción para ese trabajo.

Los equipos que crean agentes de voz deberían leer la tarjeta y omitir la descarga. Nada de lo que aprendas de un checkpoint float32 de 44 GB que no puedes enviar cambiará tu arquitectura, y la lección honesta de los benchmarks es que el dúplex completo de extremo a extremo todavía no es competitivo con un buen modelo alojado en lo que los usuarios más notan: si el asistente los entendió. Mientras tanto, lo sensato es desarrollar contra un endpoint alojado y mantener barato el cambio: una sola clave para más de 200 modelos con conmutación automática por error significa que un incidente del proveedor no tumba tu línea telefónica a mitad de llamada, y que migrar después a un modelo de dúplex completo abierto es un cambio de configuración, no una reescritura.

Las empresas que se preocupan por esto específicamente deberían solicitar el acceso anticipado a Nemotron 3 VoiceChat en lugar de basarse en los pesos de Hugging Face. Ese programa es donde se encuentran la licencia de implementación, los contenedores de referencia y la afirmación de menos de 300 ms. El checkpoint público es una vista previa de investigación de la misma idea, publicada sin el papeleo que le permitiría usarla.

Tres preguntas que este repo seguirá recibiendo

¿Puedo usarlo comercialmente si lo ajusto finamente en gran medida? No. OpenMDW v1.1 junto con la declaración de la tarjeta de "solo con fines de investigación" rige los pesos y cualquier derivado de ellos; la licencia Apache-2.0 en la rama de GitHub cubre el código de inferencia, no el checkpoint. El ajuste fino no blanquea una licencia. Si lo que necesitas son derechos comerciales, el programa de acceso anticipado es la vía que NVIDIA ha establecido para eso.

¿Es este el mismo modelo que el de las tablas de clasificación? Misma familia, casi con certeza; artefacto idéntico, sin confirmar. Las entradas de la tabla de clasificación y de Artificial Analysis están registradas como "Nemotron 3 VoiceChat (V1)" con 12B, el checkpoint descargable mide 11.095B, y NVIDIA no ha publicado nada que los concilie. Usa los números de la tabla de clasificación como la mejor lectura independiente disponible sobre el linaje, no como una medición verificada del archivo en Hugging Face.

¿Funcionará en algo más pequeño que una tarjeta de 80 GB?Probablemente, con trabajo, y nadie ha publicado pruebas. Los pesos son float32, así que una conversión a bfloat16 debería reducir los aproximadamente 44 GB de parámetros a aproximadamente 22 GB, lo que deja un margen real en una tarjeta de 48 GB antes de tener en cuenta la caché KV, el códec y los búferes de streaming. Pero la ruta compatible es vLLM en un H100 de 80 GB, el contenedor de implementación está construido para eso, y la única configuración probada que NVIDIA reporta es esa. Reserva tiempo, no solo VRAM.

Qué ver

Hay tres cosas que cambiarían la lectura de este lanzamiento. Un informe técnico, o incluso una ficha que deje de contradecirse, nos diría si el checkpoint de 11B es el artefacto que midieron los leaderboards. Una reproducción independiente de la latencia —alguien fuera de NVIDIA confirmando el turn-taking de 448 ms en su propio hardware— convertiría la afirmación más atractiva del lanzamiento de marketing en un hecho. Y una licencia comercial, o un endpoint alojado de cualquiera, llevaría esto de una curiosidad adyacente al paper a una opción real para los muchos equipos que cambiarían con gusto algo de calidad de razonamiento por un agente de voz que pueda ser interrumpido.

Hasta que una de esas llegue, la descripción precisa es limitada pero genuinamente notable: NVIDIA ha publicado el checkpoint de voz full-duplex abierto más potente jamás medido, le ha dado el primer canal funcional de invocación de herramientas en esa categoría, lo ha licenciado de modo que nadie pueda distribuirlo, y ha decidido no mencionar que todo esto ha ocurrido.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube