NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B: NVIDIA가 발표 없이 출시한 전이중 음성 모델

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 개의 모델 카드가 같은 Hugging Face 저장소 안에 있으며, 서로 일치하지 않습니다. 페이지에 렌더링되는 카드는 모델을 NVIDIA NemotronLabs VoiceChat 11B라고 하며, 출시일은 2026년 8월 3일이고, 매개변수는 11B로 나열합니다. 두 번째 카드는 overview.md라는 파일로, 파일 탭을 열지 않으면 아무도 보지 못합니다. 이 카드는 같은 모델을 12B로 부르고, 출시일을 7월 16일로 표시하며, 공개 카드에는 없는 벤치마크 섹션을 포함하고, 여전히 TODO라는 단어가 결과 설명이 있어야 할 자리에 있습니다. 두 카드 모두 NVIDIA의 출시 게시물, 보도 자료, 기술 보고서, 또는 트윗이 동반되지 않았습니다.

하지만 거기 있는 것은 자리 표시자가 아닙니다. 그것은 동시에 듣고 말하는 44 GB 체크포인트입니다. 마이크 오디오를 입력받아 합성 음성을 내보내는 단일 스택으로, 음성 인식에서 언어 모델을 거쳐 음성 합성으로 이어지는 일반적인 중계 없이 작동합니다. 그것은 Nemotron Nano 9B v2 백본을 기반으로 하며, 말을 멈추지 않고 문장 중간에 도구를 호출할 수 있고, NVIDIA는 이것이 그렇게 할 수 있는 최초의 오픈 풀듀플렉스 모델이라고 주장합니다.

아래의 모든 내용은 해당 리포지토리에서 직접 읽은 것입니다 — 두 개의 카드, config.json, 그리고 11B 대 12B 문제를 해결하기 위해 우리가 직접 파싱한 가중치 파일 내부의 텐서 인덱스. NVIDIA가 이 모델에 대해 공개하는 모든 성능 수치는 NVIDIA 자체의 것이며, NVIDIA가 측정한 것이며, 재현된 적이 없는 것입니다. 이 모델 계열에 대한 독립적인 측정은 공개적으로 정확히 하나만 존재하는데, 바로 Artificial Analysis의 것으로, 다른 이름과 다른 파라미터 수로 등록되어 있습니다 — 이것이 이번 릴리스에서 가장 흥미로운 점으로 밝혀졌습니다.

저장소에 실제로 무엇이 들어 있나요?

이 저장소는 2026년 7월 29일에 생성되었고, 마지막 수정은 8월 4일에 이루어졌습니다. 여기에는 17개의 파일이 들어 있습니다: 경쟁 관계에 있는 두 개의 모델 카드, 라이선스 하나, config.json, 용량 44.4GB인 model.safetensors, 아키텍처 다이어그램, RNN-T 토크나이저 디렉터리, 편향·안전·개인정보 보호·설명 가능성에 대한 짧은 정책 노트 네 개, 그리고 세 개의 .wav 파일 — 턴테이킹 데모, 바지인 데모, 도구 호출 데모 — 카드 상단에 오디오 플레이어로 삽입되어 있어서, 모델에 대해 읽기 전에 먼저 들어볼 수 있습니다.

누락된 몇 가지가 있는데, 그것들은 파일 목록보다 더 중요합니다.

이 모델에 대한 논문은 없습니다.카드에는 다섯 개를 인용하고 있습니다: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, 그리고 NVIDIA 자체의 PersonaPlex preprint입니다. 그 중 어느 것도 NemotronLabs VoiceChat 기술 보고서가 아닙니다. 아키텍처는 약 세 개의 문단과 다이어그램 하나로 설명되어 있으며, 그것이 어떻게 구축되었는지에 대한 공개된 설명의 전부입니다.

호출할 방법이 없습니다. Hugging Face 페이지에는 이 모델이 "어떤 Inference Provider에도 배포되지 않았다"고 명확히 명시되어 있습니다. NVIDIA든 다른 어느 업체든 호스팅된 엔드포인트는 존재하지 않습니다. 저장소의 유일한 공개 커뮤니티 스레드는 사용자가 NVIDIA에 handler.py를 추가해 달라고 요청하는 게시물입니다 — 체크포인트를 Hugging Face Inference Endpoints에 배포할 수 있도록 하기 위해서입니다. 간편한 방법으로 실행해 보려던 작성자는 그런 방법이 없다는 것을 발견했습니다.

pipeline_tag와 library_name이 없습니다. 그렇기 때문에 페이지에는 inference widget과 task label이 없으며, 이는 더 근본적인 문제의 증상입니다: config.json은 Transformers config가 아닙니다. 이는 32 KB NeMo 학습 config이며, AdamW 블록, 학습률 스케줄, 데이터로더 버킷 빈, 검증 분할이 포함되어 있습니다. 이 config에 AutoModel.from_pretrained을 사용할 수 없습니다. NVIDIA의 Speech 저장소의 특정 브랜치를 클론합니다 — nemotron-labs-voicechat — Python 3.12, PyTorch 2.10 및 Transformers 4.56에 고정된 conda 환경을 구축하고, causal-conv1dmamba-ssm을 빌드 격리 없이 컴파일하고, 그들의 스크립트를 실행합니다.

다운로드 카운터는 그 모든 것을 반영합니다. 모델 출시 첫 달의 다운로드 80회 대비 좋아요 107개는 사람들이 북마크만 해 두고 실행하지 않은 릴리스의 특징입니다.

NVIDIA NemotronLabs VoiceChat 11B-2

파라미터 수를 세어 봤는데, 11B가 이깁니다.

safetensors 파일은 모든 텐서와 그 형태(shape) 및 dtype을 나열하는 JSON 헤더를 포함하므로, 파라미터 수는 의견의 문제가 아닙니다. 우리는 헤더를 가져와 합산했습니다: 110억 9,500만 개의 파라미터가 1,626개의 float32 텐서에 걸쳐 있으며, 44.38 GB를 차지합니다. 따라서 렌더링된 카드는 맞고 overview.md는 오래되었습니다 — 이것은 11B 모델이며, 12B 수치는 잔재입니다.

Hugging Face의 모델 트리는 12B가 어디서 끼어들 수 있었는지 설명해 줍니다. 그 계보는 Nemotron Nano 12B v2 Base, 그다음 Nemotron Nano 12B v2, 그다음 Nemotron Nano 9B v2, 그리고 마지막으로 이 모델로 이어집니다. NVIDIA 자체 텍스트 백본 패밀리에는 12B와 9B가 모두 포함되어 있으며, 9B는 12B에서 프루닝된 후속 모델이고, VoiceChat은 9B를 기반으로 구축되었습니다. 해당 체인에서 더 일찍 작성된 카드라면 자연스럽게 더 큰 숫자가 포함되었을 것입니다.

헤더는 또한 아키텍처의 두 절반을 따라 깔끔하게 분할됩니다:

이해 측면 — 10.098B. 그중에서 7.714B는 Nemotron Nano v2 트랜스포머 스택이고, 0.609B는 음성 인코더이며, 세 개의 별도 131,072 × 4,480 행렬은 각각 0.587B를 차지합니다.

음성 생성 측 — 0.997B. 0.595B 규모의 28레이어·폭 1,152 텍스트 음성 변환 백본, 0.159B 가우시안 혼합 출력 헤드, 그리고 인코더와 디코더가 각각 0.092B인 신경 오디오 코덱.

dtype에서 비롯되는 실질적인 결과가 두 가지 있다. 첫째, 44GB 다운로드는 거대한 모델이 아니라 float32로 제공되는 평범한 모델이라는 점이다. bfloat16으로 변환하면 가중치는 약 22GB가 된다. 둘째, NVIDIA가 명시한 80GB GPU 최소 요구 사항은 모델의 크기 때문이 아니라 그 선택 때문이다. 48GB 카드를 보유하고 체크포인트를 직접 변환할 의향이 있는 사람이라면 명백히 배제된 것은 아니다. 다만 그 용량에서 확인된 실행을 공개한 사람은 아무도 없으므로, 이를 약속이 아닌 계산으로 취급해야 한다.

그것이 동시에 듣고 말하는 방법

"Full duplex"가 이번 릴리스의 핵심이며, 설정(config)은 그것이 어떻게 구입되는지 보여줍니다. 세 가지 설계 선택이 그 역할을 합니다.

음성 인코더는 앞을 내다볼 수 없습니다.이 인코더는 24층, 8헤드의 Conformer로서, 어텐션 컨텍스트는 [70, 0] — 왼쪽 컨텍스트 70프레임과 0 프레임의 오른쪽 컨텍스트입니다. 기존의 음성 인식기는 현재 순간 이후의 오디오를 참고하여 방금 들은 내용을 명확히 하지만, 이 인코더는 그렇게 할 수 없어 정확도가 희생되는 대신 프레임이 도착하는 즉시 결정을 내릴 수 있는 능력을 얻습니다.

모든 것이 80ms 단위로 양자화됩니다. config의 프레임 길이는 0.08초로, NVIDIA가 이 작업 라인에 대해 다른 곳에서 설명한 80ms 청크 크기와 일치합니다. 모델은 80ms마다 계속 들을지, 아니면 말하기를 시작할지를 결정합니다. 바로 그 주기 덕분에 끼어들기가 예의 바르게 느껴지기보다는 즉각적으로 느껴집니다.

도구 호출은 그 자체의 입에서 나온다. 131,072개 어휘를 가진 똑같은 형태의 행렬 세 개를 기억하라. 하나는 입력 임베딩, 하나는 일반적인 언어 모델 헤드, 그리고 세 번째는 function_head라고 불린다. 카드의 설명에 나오는 "도구 호출 스크립트용 별도 출력 채널"은 문자 그대로 세 번째 출력 프로젝션이며, 폭이 5억 8700만 파라미터이고 음성 생성과 병렬로 실행된다. 이것이 모델이 대화를 멈추지 않고 도구 호출을 전송할 수 있는 구조적 이유이며, 프롬프트 규약이 아닌 실제 설계상의 결정이다.

다운스트림에서 텍스트 음성 합성 디코더는 31개의 양자화기와 7, 7, 9의 다운샘플링 비율을 가진 잔차 벡터 양자화 코덱의 코드를 예측한다. 이는 441배 축소로, 오디오 토큰 비율이 초당 50프레임이 되며 22.05kHz로 출력된다. 입력은 16kHz이다. 체크포인트에는 RNN-T 디코더와 조인트 네트워크도 포함되어 있는데, 이것이 모델의 선언된 출력에 사용자의 전사가 자체 텍스트 및 오디오와 함께 포함되는 이유이다. 이 전사는 부산물이 아닌 실제 인식 헤드이다. 기본 음성은 Aria라고 하며, 3초 길이의 기준 클립이 화자를 조건화한다.

구성(config)에서 한 가지 더 언급할 가치가 있는 세부 사항은 명시된 제한을 뒷받침한다는 점입니다. 학습 데이터로더(dataloader)는 발화(utterance)를 142.39초로 제한합니다. 모델이 2분 이하의 오디오 컨텍스트만 보유한다는 카드의 경고는 이를 생성한 데이터 파이프라인에서 확인할 수 있습니다.

점수와, 실제로 그것을 측정한 사람

NVIDIA의 핵심 주장은 지연 시간과 순위입니다. Full-Duplex-Bench 1.0에서 부드러운 턴 수행에 448ms, 중단 시 양보에 480ms를 기록했으며, 부드러운 턴 테이킹에서 인계율 0.82, 사용자 중단 시 1.0을 기록했습니다. 또한 GPT-4o 평가자 점수는 중단 처리에서 4.33입니다. VoiceBench에서 오픈 풀듀플렉스 모델 중 2위, Full-Duplex-Bench에서 오픈 모델 중 2위를 주장합니다. 이 모든 것은 NVIDIA 자체 실행 결과입니다.

그것들을 외부 세계와 나란히 놓으면 두 개의 간극이 드러난다.

음성 추론에서 벤더 수치는 약 8포인트 높습니다. 렌더링되지 않은 overview.md는 Big Bench Audio에서 37.0%를 보고합니다. Artificial Analysis는 이 계열을 독립적으로 측정했으며, 그 결과는 29.2%였습니다. 같은 벤치마크, 같은 계열, 모델이 순위에서 차지하는 위치를 바꿀 만큼 큰 격차입니다.

VoiceBench에서 벤더가 제시한 수치는 너무 낮습니다. 이 카드는 오픈 풀듀플렉스 모델 중 2위를 주장하지만, 공개 VoiceBench 리더보드에는 이 모델이 58.10이며, 이는 오픈 풀듀플렉스 부문에서 최고이며, Freeze-Omni의 55.20 및 Moshi의 29.51보다 앞섭니다. NVIDIA 자체 초안 카드에는 55.1로 보고되어 있는데, 이는 현재 리더보드가 제시하는 수치보다 낮습니다.

작은 특이점도 하나 있습니다: NVIDIA 자체 비교표는 경쟁사들을 Artificial Analysis보다 후하게 평가합니다. 초안 카드는 Freeze-Omni를 Big Bench Audio에서 33.4%, PersonaPlex 7B를 19.1%로 매기지만, Artificial Analysis는 각각 33.9%와 12.6%로 측정합니다. 어느 쪽이든 동료 순위는 유지되므로 안심되지만, 이는 공급업체의 측정 환경과 독립적인 측정 환경이 제3자에게조차 동일한 수치를 돌려주지 않는다는 사실을 상기시켜 줍니다.

NVIDIA NemotronLabs VoiceChat 11B-3

이 차트는 정직한 헤드라인을 피할 수 없게 만든다. 오픈 풀듀플렉스 모델 중에서 이것은 확실한 진전이다. 음성 추론에서 PersonaPlex의 두 배 이상 성능을 내며 Moshi와는 완전히 다른 범주에 머물게 한다. 상용 제품과 비교하면 전혀 근접하지 못한다. Step-Audio R1.1은 96%, Grok 4.5의 Voice Agent와 Gemini 2.5 Flash(Thinking)는 92%, Nova 2.0 Sonic은 87%다. 이는 음성 입력 기반 추론에서 대략 3:1의 격차다.

풀 듀플렉스가 현재 얼마나 비용이 드는지 가장 확실하게 확인할 수 있는 방법은 NVIDIA 자체 카탈로그를 보는 것입니다. VoiceBench에서, 풀 듀플렉스가 아닌 더 큰 모델인 NVIDIA Nemotron 3 Nano Omni 30B A3B는 89.39점을 기록한 반면, VoiceChat은 58.10점을 기록했습니다. 약 30포인트의 어시스턴트 품질 저하는 중단 처리와 500ms 미만의 턴테이킹에 대한 대가입니다. 적어도 이번 세대에서는 말이죠. 만약 제품이 단어 중간에 끊길 수 있는 모델을 필요로 하지 않는다면, 사용하지 않을 기능에 대해 많은 비용을 지불하고 있는 셈입니다.

Tool calling이 핵심이면서 동시에 가장 취약한 부분이다.

"도구 호출을 지원하는 최초의 오픈 풀듀플렉스 모델"이라는 주장이 이번 릴리스의 근간이며, 그 뒤에 깔린 수치는 들쭉날쭉하다. BFCL-v3의 음성 대화에서 NVIDIA는 평균 56.1%를 보고했다: 단순 58.5%, 다중 62.5%, 병렬 42.5%, 병렬-다중 27.5%, 그리고 관련 없는 호출을 올바르게 거부한 경우 89.6%이다. Full-Duplex-Bench v3에서는 그 격차가 더욱 두드러진다.

도구 선택 — 82.5%.NVIDIA가 최첨단 모델과 경쟁력이 있다고 공정하게 평가하는 함수를 목록에서 선택하는 것.

인자 정확성 — 44.2%. 사용자가 말한 내용을 바탕으로 해당 함수의 매개변수를 올바르게 채우는 것.

Pass@1 — 33%.첫 번째 시도에서 전체 호출을 올바르게 수행하는 것입니다.

자신이 원하는 도구를, 그 도구의 인수를 채우는 것보다 3분의 2 더 확실하게 아는 모델은 엉뚱한 도시의 날씨를 자신 있게 조회하게 됩니다. 텍스트 에이전트에서는 유효성 검사 계층과 재시도를 통해 그런 문제를 잡아낼 수 있지만, 실시간 음성 통화에서는 재시도가 사용자에게 들리며, 카드에는 모델이 실패한 통화를 전혀 재시도해서는 안 된다고 명시되어 있고, API에 문제가 있다고 사용자에게 알리도록 지시되어 있습니다.

그것을 둘러싼 운영 제약은 엄격하며, NVIDIA는 이를 별다른 미화 없이 나열한다: 세션당 최대 5개의 도구, 그 이상은 품질이 저하되고, 신뢰할 수 없는 동시 다중 도구 호출, 도구 실행 중 사용자가 중단할 방법이 없으며, 혼합 대화에서는 호출해야 할 도구를 부르는 대신 자체 지식으로 답하는 경향이 있다. 긴 도구 응답은 에이전트를 멈추게 하는데, 이 문제를 덮어 두려는 것이 '대기 메시지' 기능이다. 호출이 실행되는 순간 에이전트가 말할 문구를 미리 작성해 두면, 침묵 속에 무언가가 채워진다.

누군가의 오후를 날려버릴 한 가지 특이점: 시스템 프롬프트와 도구 응답은 반드시 ASCII만이어야 합니다. 엠 대시, 둥근 따옴표, 도 기호, 이모지가 없어야 합니다. 도구 출력은 모델에 도달하기 전에 평이하고 음성 친화적인 ASCII 문장으로 평탄화되어야 하므로, JSON API 응답을 원시 상태로 그대로 통과시킬 수 없습니다.

실행 비용과 사용을 막는 라이선스

하드웨어부터 시작해 보자. {{1}}NVIDIA의 브랜치 문서에서는 최소 80GB 메모리의 GPU를 요구하는데, 이는 H100 또는 H200을 가리키며, 테스트된 구성은 vLLM이 탑재된 H100이다.{{/1}} {{2}}일반적인 GPU 클라우드에서 온디맨드 H100 용량은 시간당 약 2~3달러이므로, 연속 실행 인스턴스는 애플리케이션 코드를 작성하거나, 이를 유지할 인력을 고용하거나, 두 번째 동시 대화를 제공하기 전에 월 약 1,500~2,200달러에 달한다.{{/2}}

이제 비교를 해보겠습니다. Artificial Analysis는 호스팅된 음성-대-음성 가격을 입력 오디오 시간당 비용으로 정규화하며, 현재 가격대는 저렴한 쪽의 시간당 약 $1.42에서 가장 비싼 프리미엄 등급의 시간당 $10.75까지입니다. 평판이 좋은 중간 시장 옵션인 Grok Voice Think Fast 2.0은 시간당 $4.80, 즉 오디오 분당 $0.08에 책정됩니다.

NVIDIA NemotronLabs VoiceChat 11B-4

그 두 문단을 함께 읽으면 자체 호스팅의 주장은 보기보다 약합니다. 전용 H100은 진짜로 계속 바쁘게 가동할 때만 중간 가격대의 호스팅 엔드포인트보다 저렴하며, 이용률과 거의 무관하게 호스팅 시장의 저가 옵션보다 비쌉니다. 게다가 엔지니어링, 온콜, 그리고 호스팅 옵션이 87~96%를 기록하는 데 비해 29.2%에 그치는 모델까지 감수해야 합니다.

그리고 벽이 있다. 라이선스는 OpenMDW License Agreement v1.1이며, 해당 카드는 자체 인용구에서 모델이 "연구 목적으로만 사용할 수 있다"고 명시한다. GitHub 브랜치의 코드는 Apache-2.0이지만 가중치는 그렇지 않다. 이를 다운로드하고, 연구하고, 미세 조정하고, 벤치마킹하고, 이에 대해 글을 쓸 수 있다. 그러나 고객 앞에 내놓을 수는 없다. 따라서 위의 모든 경제적 논거는 음성 제품을 출시하려는 회사에게는 학문적 논의에 불과하다 — 핵심 질문은 결코 GPU 수학이 성립하는지가 아니었다.

그래서 우리는 당연한 사실을 분명히 말할 것입니다: NemotronLabs VoiceChat 11B는 OrcaRouter를 통해 호출할 수 없습니다. 어떤 것을 통해서도 호출할 수 없기 때문입니다. 하나의 키가 실제로 가져다주는 것은 그것이 비교 기준으로 삼아야 할 베이스라인입니다. 호스팅된 음성 및 오디오 모델은 단일 API 뒤에 있으며 0% 마크업으로 제공됩니다. 즉, 우리는 공급업체의 정가를 그대로 전달하므로, 판매처가 오디오 요율을 인하하면 계약 주기가 끝난 후가 아니라 바로 그날 더 낮은 금액을 지불하게 됩니다. 음성 에이전트의 가격을 책정하는 경우, 그 분당 수치는 80GB GPU가 이겨야 할 숫자이며, 랙을 도입하기 전에 정확히 알아둘 가치가 있습니다.

이름 문제: 11B, 12B, NemotronLabs, Nemotron 3

초기 보도 대부분이 잘못된 부분이 바로 여기이므로, 무엇이 확립된 사실이고 무엇이 아닌지 주의를 기울일 가치가 있습니다.

NVIDIA 자체의 4개 채널은 이 작업을 세 가지 다른 이름으로 설명합니다. Hugging Face는 공개 가중치와 연구 전용 라이선스로 "NVIDIA NemotronLabs VoiceChat 11B"를 게시합니다. NVIDIA 개발자 블로그는 2026년 3월에 "Nemotron 3 VoiceChat"을 조기 액세스 단계의 12B 파라미터 전이중 모델로 설명했으며, 목표는 300ms 미만의 종단 간 지연 시간(80ms 청크 기준)입니다. 조기 액세스 프로그램은 참조 컨테이너, 벤치마크 결과, 파인튜닝 경로를 제공하며 "기업 배포를 위한 개방형이고 검사 가능한 가중치"를 약속합니다. 공개 VoiceBench 리더보드와 Artificial Analysis는 모두 이 항목을 "Nemotron 3 VoiceChat (V1)" 12B로 등재합니다.

알 수 있는 사실: 아키텍처 설명이 구성 요소별로 정확히 일치한다 — Fast Conformer 인코더, Nemotron Nano v2 9B 백본, NVIDIA 텍스트 음성 변환 디코더, 별도의 도구 호출 채널, 80ms 프레임, 하나의 통합 스택. Hugging Face 저장소의 렌더링되지 않은 카드는 다른 경로에서 사용하는 12B 수치를 사용한다. 이는 동일한 연구 계열이며, 타사 항목들은 거의 확실히 이 제품군을 측정하고 있다.

확인되지않은 것은: 오늘 다운로드할 수 있는 체크포인트가 Artificial Analysis와 VoiceBench가 평가한 것과 비트 단위로 일치하는지, 아니면 얼리 액세스 프로그램이 제공하는 것인지 여부입니다. 두 가지 세부 사항이 그러한 추정을 반박합니다. 파라미터 수가 다릅니다. 측정된 11.095B와 신고된 12B입니다. 또한 지연 시간 목표도 크게 다릅니다. 블로그의 기업용 제안은 종단 간 300ms 미만인 반면, 출시된 카드는 Full-Duplex-Bench에서 448ms와 480ms로 측정됩니다. 이는 동일한 모델의 서로 다른 측정 지점일 수도 있고, 서로 다른 모델일 수도 있습니다. NVIDIA는 말하지 않았습니다. NVIDIA가 이번 릴리스에 대해 전혀 언급하지 않았기 때문입니다.

실질적인 결론은, 이 모델에 대해 숫자를 인용할 때는 그 숫자가 어떤 출처에서 나온 것인지도 함께 인용하라는 것입니다. Artificial Analysis의 29.2%를 Hugging Face 모델 카드에 귀속시키거나 NVIDIA의 37.0%를 독립적인 테스트에 귀속시키는 보도는, NVIDIA가 서로 다른 매개변수 수치로 별도의 문서에 유지하고 있는 두 가지를 합쳐버린 것입니다.

어디서 부러지는가

초안 카드의 제한 사항 섹션은 유난히 솔직하며, GitHub 브랜치에는 더 많은 내용이 추가되어 있습니다. 수집됨:

영어만 지원하며, 저장소에는 다국어 로드맵이 없습니다.

2분 기억. 2분 오디오 창을 넘어서는 대화는 보존되지 않을 수 있습니다 — 지원 통화나 4분 전에 합의된 내용을 기억해야 하는 모든 것에 있어 절대적인 상한선입니다.

자체 백본보다 더 멍청하다.NVIDIA는 지식, 지시 수행및 안전성 측면에서 Nemotron Nano 9B v2보다 성능이 떨어질 수 있다고 밝혔다. 대화의 자연스러움에 맞춰 튜닝되었기 때문이다. 추론이나 정렬을 위해 명시적으로 훈련되지 않았으며, 다단계 추론과 산술이 약점으로 지적된다.

신뢰할 수 있는 백채널링(backchanneling)이 없습니다. 사람이 여전히 듣고 있다는 신호인 "mm-hm"이 체계적으로 처리되지 않습니다.

그것은 문장 중간에 말을 끊을 것입니다. 브랜치 노트는 알려진 실패 모드 중에서 문장 중간의 일시정지에서 사용자를 끊는 것과 "폭주하는 연속 생성 / 자기 대화"를 나열합니다 — 이는 오른쪽 컨텍스트가 전혀 없는 인코더의 직접적인 비용입니다.

조용한 방에서만. 시끄럽거나 울림이 있는 환경, 특히 주변 대화 소리가 들리는 곳에는 명백히 부적합합니다. 따라서 대부분의 콜센터 사무실과 대부분의 자동차는 제외됩니다.

실제로 이걸 다운로드해야 하는 사람은 누구인가요?

{{1}}이중 음성 모델링{{/1}}을 연구하는 연구자들은 여기서 가장 큰 이점을 얻을 수 있으며, 전환해야 합니다: {{2}}작동하는 도구 호출 채널을 갖춘 11B 오픈 체크포인트는 약 55만 시간의 실제 및 합성 오디오를 혼합하여 학습한 것으로, SALM-Duplex 논문에서 다시 구현하는 것보다 훨씬 더 나은 출발점입니다{{/2}}. {{3}}연구 라이선스는 해당 작업에 제약이 되지 않습니다.{{/3}}

음성 에이전트를 구축하는 팀은 카드를 읽고 다운로드는 건너뛰어야 합니다. 출시할 수 없는 {{1}}44GB float32 체크포인트{{/1}}에서 배우는 것은 아키텍처를 바꾸지 않을 것이며, 벤치마크가 주는 솔직한 교훈은 엔드투엔드 전이중 방식이 사용자가 가장 중요하게 여기는 부분, 즉 어시스턴트가 사용자를 이해했는지 여부에서 좋은 호스팅 모델과 아직 경쟁력이 없다는 것입니다. 그동안 현명한 선택은 호스팅 엔드포인트에 맞춰 구축하고 교체 비용을 낮게 유지하는 것입니다. {{2}}200개 이상의 모델{{/2}}에 걸쳐 하나의 키와 자동 장애 조치를 사용하면 공급자 장애가 통화 중간에 전화선을 끊지 않으며, 나중에 오픈 전이중 모델로 전환하는 것이 재작성이 아니라 구성 변경이 됩니다.

이것에 특히 관심이 있는 기업은 Hugging Face 가중치를 기반으로 구축하는 대신 Nemotron 3 VoiceChat 조기 액세스에 신청해야 합니다. 배포 가능한 라이선스, 참조 컨테이너, 그리고 300ms 미만 지연 시간 주장은 모두 그 프로그램에 포함되어 있습니다. 공개 체크포인트는 동일한 아이디어의 연구용 미리보기로, 사용을 허용하는 서류 없이 게시된 것입니다.

이 저장소가 계속 받게 될 세 가지 질문

많이 파인튜닝하면 상업적으로 사용할 수 있나요? 아니요. OpenMDW v1.1과 카드의 '연구 목적 전용' 명시는 가중치와 그로부터 파생된 모든 것에 적용됩니다. GitHub 브랜치의 Apache-2.0 라이선스는 추론 코드를 다루며, 체크포인트는 다루지 않습니다. 파인튜닝을 한다고 해서 라이선스가 바뀌지는 않습니다. 상업적 권한이 필요하다면, NVIDIA가 실제로 마련한 경로는 얼리 액세스 프로그램입니다.

이것이 리더보드에 등재된 모델과 동일한 모델인가요? 같은 계열인 것은 거의 확실하지만, 동일한 산출물(artifact)인지는 확인되지 않았습니다. 리더보드와 Artificial Analysis의 항목은 12B 규모의 "Nemotron 3 VoiceChat (V1)"으로 등재되어 있지만, 다운로드 가능한 체크포인트는 11.095B로 측정되며, NVIDIA는 이 둘 사이의 차이를 설명하는 어떤 내용도 발표하지 않았습니다. 리더보드 수치를 계열(lineage)에 대한 이용 가능한 최선의 독립적 지표로 사용하되, Hugging Face의 파일에 대한 검증된 측정치로는 사용하지 마십시오.

80GB 카드보다 작은 용량에서 실행될 수 있을까요? 아마 가능하겠지만, 작업이 필요하고, 아직 이를 입증한 사례는 공개되지 않았습니다. 가중치가 float32이므로 bfloat16으로 변환하면 약 44GB의 파라미터가 약 22GB로 줄어듭니다. KV 캐시, 코덱, 스트리밍 버퍼를 고려하기 전에는 48GB 카드에서도 충분한 여유가 확보됩니다. 하지만 지원되는 경로는 80GB H100에서의 vLLM이고, 배포 컨테이너도 이를 위해 빌드되었으며, NVIDIA가 보고한 유일한 테스트 구성도 바로 그것입니다. VRAM만이 아니라 시간도 예산에 포함하세요.

볼 것

이번 릴리스에 대한 평가를 바꿀 세 가지가 있다. 기술 보고서, 아니면 그나마 자기모순이 없는 모델 카드만 있어도 11B 체크포인트가 리더보드가 측정한 산출물인지 알 수 있을 것이다. 독립적인 지연 시간 재현 — NVIDIA 외부의 누군가가 자체 하드웨어에서 448ms 턴테이킹을 확인하는 것 — 은 이번 릴리스의 가장 매력적인 주장을 마케팅에서 사실로 바꿔줄 것이다. 그리고 상업용 라이선스나 누구라도 제공하는 호스팅 엔드포인트가 있다면, 이는 논문에 가까운 호기심에서, 추론 품질 일부를 기꺼이 희생하더라도 중단할 수 있는 음성 에이전트를 원하는 많은 팀에게 실제 선택지가 될 것이다.

그중 하나가 현실화되기 전까지, 정확한 설명은 좁지만 진정으로 주목할 만하다: NVIDIA는 지금까지 측정된 가장 강력한 오픈 풀듀플렉스 음성 체크포인트를 공개하고, 해당 범주에서 최초로 작동하는 도구 호출 채널을 제공했으며, 누구도 출시할 수 없도록 라이선스를 제한한 채, 이런 일이 있었다는 사실을 언급조차 하지 않았다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube