
Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: 라이선스를 취득할 수 없는 음성, 그리고 출시할 수 없는 음성
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
2026년 가장 많이 회자되는 두 음성 모델은 어떤 출시 보도도 알려주지 않는 공통점이 있습니다. 바로 둘 중 어느 것도 제품에 넣을 수 없다는 것입니다.Sesame Preview는 대화형 음성 덕분에 TestingCatalog가 "시장에서 사용 가능한 최고의 음성 모드 중 하나"라고 평가한 무료 소비자용 어시스턴트이며, 그 뒤에 있는 프로덕션 모델은 API도, 모델 ID도, 구매할 수 있는 라이선스도 없습니다. 회사가 단순히 공개하지 않은 것입니다.NVIDIA NemotronLabs VoiceChat 11B는 정확히 그 반대입니다. 가중치는 공개되어 있고, 전이중(full-duplex) 설계는 진정한 최초이며, 라이선스는 연구 목적으로만 허용하므로 누구도 법적으로 출시할 수 없습니다. 하나는 들을 수 있지만 빌릴 수 없는 음성입니다. 다른 하나는 가질 수 있지만 팔 수 없는 음성입니다. 이것은 잠긴 두 개의 문을 비교하는 것이며, 유용한 질문은 여러분이 어떤 자물쇠 앞에 서 있는가입니다.
잠긴 두 개의 문, 서로 다른 자물쇠가 달린
각각의 형태부터 보겠습니다. 이름은 두 제품이 얼마나 다른지 숨기고 있으니까요. Sesame Preview는 API가 아니라 앱입니다. 각기 다른 개성을 지닌 네 명의 에이전트를 제공합니다 — Maya(따뜻하고 창의적), Miles(느긋하고 날카로움), Simone(호기심 많고 지적임), Charlie(재치 있고 따뜻함) — 각자 고유한 목소리와 기억을 가지며, 로그인 상태에서는 웹과 모바일 간에 동기화됩니다. 웹 검색, 심층 탐구, 메모 및 알림 작성, 통화 후 요약 전송 기능을 수행합니다. 프리뷰는 유료 등급 없이 무료이며, 영어 전용이고, 로그인 시 통화당 30분(비로그인 시 5분)으로 제한되며, 의도적으로 작업을 실행하지 않습니다: 아이디어를 브레인스토밍하고 조사할 수는 있지만 비행기 예약은 해주지 않습니다. 제품 어디에도 API 키가 없습니다 — 프로덕션 음성은 엔드포인트가 아니라 앱 기능입니다.

{{1}}NVIDIA NemotronLabs VoiceChat 11B{{/1}}{{2}}는 정반대의 형태입니다: 체크포인트이지 제품이 아닙니다.{{/2}} {{3}}2026년 8월 3일, 아무런 발표도 없이 허깅페이스에 등장했습니다. 출시 포스트도, 기술 보고서도, 트윗도 없었고, 모델 카드가 곧 발표였습니다.{{/3}} {{4}}11B 파라미터의 전이중(full-duplex) 음성 모델이며,{{/4}} {{5}}(저희는 safetensors 헤더를 분석해 1,626개 텐서에 걸쳐 총 110억 9,500만 개의 파라미터를 확인했습니다){{/5}} {{6}}하나의 스택으로 구축되었습니다: 오른쪽 컨텍스트 없이 80ms 프레임으로 16kHz 오디오를 처리하는 Fast Conformer 인코더, 추론을 담당하는 Nemotron Nano 9B v2 백본, 22.05kHz 오디오를 생성하는 NVIDIA TTS 디코더, 사용자의 음성을 전사하는 RNN-T 디코더, 그리고 음성 응답을 오염시키지 않으면서 도구 호출 스크립트를 내보내는 별도의 출력 채널로 구성됩니다.{{/6}} {{7}}동시에 듣고 말할 수 있고, 말하는 도중에 끊길 수 있으며, NVIDIA는 이를 도구 호출이 가능한 최초의 오픈 전이중 모델이라고 주장합니다.{{/7}} {{8}}그러한 주장이 현실과 부딪혀도 유지되는지는 아래의 별도 섹션에서 다룹니다.{{/8}}
그들이 갈라지는 벤치마크 — '최고의 대화'를 위한 두 후보, 두 가지 무너진 증거 기준
두 모델 모두 평판의 전부를 동일한 것에 걸고 있습니다: 대화 품질 — 말차례 주고받기, 끼어들기, 자연스러운 타이밍, 실제 대화의 느낌. 그것이 바로 두 모델이 하나의 헤드라인에 함께 등장하는 이유입니다. 또한 바로 이 지점에서 비교가 이상해지는데, 어느 쪽도 제대로 평가할 수 없기 때문입니다.
Sesame Preview에는 어디에도 번호가 없습니다. 프로덕션 모델은 출시되지 않았고 목록에도 없습니다. 모델 ID도 없고, Artificial Analysis의 음성-음성 리더보드에도 등재되어 있지 않으며, 지연 시간 목표치도 없고, 어떤 종류의 벤치마크도 없습니다. TestingCatalog의 "시장에서 가장 좋은 음성 모드 중 하나"라는 평가는 측정값이 아니라 리뷰어들의 합의이며, 그 무엇과도 블라인드 A/B 테스트를 할 방법이 없습니다. 누구나 독립적으로 실행할 수 있는 유일한 Sesame 모델은 오픈 가중치 CSM-1B 베이스이고, 그것은 앱의 음성이 아니라 텍스트-음성 체크포인트입니다.
NVIDIA NemotronLabs VoiceChat 11B는 정반대의 문제를 안고 있습니다. 수치는 있지만, 그 수치가 서로 일치하지 않는 두 가지 증거 표준에 걸쳐 나뉘어 있습니다. NVIDIA는 매끄러운 발언 차례를 잡는 데 448ms, 인터럽트 시 양보하는 데 480ms, 사용자 인터럽트에 대한 완벽한 1.0 테이크오버율을 보고합니다. 모두 NVIDIA 자체 Full-Duplex-Bench 1.0에서 공급업체가 측정한 것이며, 독립적으로 재현된 것은 없습니다. 이 제품군의 독립 측정 결과는 다른 이름과 파라미터 수로 분류되어 있습니다. 12B의 "Nemotron 3 VoiceChat (V1)"으로, NVIDIA가 Hugging Face의 11B 체크포인트와 조정한 적이 없는 라벨입니다. 그리고 이해 측면에서는 그리 좋지 않습니다. Artificial Analysis에 따르면 Big Bench Audio에서 29.2%, NVIDIA 자체 카드에서는 37.0%입니다. VoiceBench에서 이 제품군은 58.10점을 받아 공개된 Full-Duplex 결과 중 최고입니다. 따라서 이 동일한 모델은 공개된 Full-Duplex 체크포인트 중 선두주자인 동시에, 듣는 내용을 이해하는 데 있어 호스팅 실시간 선두주자들보다 대략 3:1 비율로 뒤처져 있습니다.

그렇다면 쟁점은 어느 쪽이 더 나은가가 아니다. 문제는 2026년 최고의 대화 후보 두 개가 정반대이면서도 똑같이 불완전한 증거를 바탕으로 평가받고 있다는 점이다. 리뷰어들이 가장 인간적이라고 말하는 음성에는 측정값이 전혀 없고, 실제 리더보드에 이름을 올린 음성은 그 약점이 공개되어 있는 쪽이다. 평판과 숫자는 비교할 수 없다. 그리고 여기에는 숫자가 하나뿐인데, 그 숫자는 결코 호의적이지 않다.
Access — 앱 스토어 다운로드 또는 80GB 빌드
둘 중 하나를 시도해 보고 싶다면, 출발선의 차이가 어떤 사양보다 더 중요하다.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B는 단순히 실행할 수 있는 다운로드가 아닙니다. 직접 구축해야 하는 빌드입니다. Hugging Face는 이 모델이 "어떤 추론 제공업체(Inference Provider)로도 배포되지 않았다"고 밝히고 있으며, NVIDIA도 이를 호스팅하지 않았습니다. 저장소의 config.json은 NeMo 훈련 구성이므로 AutoModel이 가리킬 Transformers 체크포인트가 없습니다. 지원되는 방법은 두 가지입니다. 하나는 Python 3.12, PyTorch 2.10, Transformers 4.56으로 고정된 conda 환경에서 causal-conv1d와 mamba-ssm을 소스에서 컴파일하고, vLLM을 실행하는 80 GB GPU(A100, H100, H200, B200 또는 RTX 6000)에서 구동하는 것입니다. 다른 하나는 NVIDIA의 NGC NIM 컨테이너를 사용하는 것으로, 해당 하드웨어를 갖추면 /v1/realtime에서 OpenAI Realtime 호환 WebSocket을 노출합니다. 다운로드 카운터가 접근성의 현실을 보여줍니다. 출시 첫 달에 좋아요가 107개였던 반면 다운로드는 약 80회에 그쳤습니다. 사람들은 북마크만 했지, 거의 아무도 실행하지 않았습니다. 실행하려는 연구자에게 솔직한 참고 사항 하나: 이 체크포인트가 기반으로 하는 추론 백본인 Nemotron Nano 9B v2는 오늘 바로 호출할 수 있는 호스팅 모델이지만, 그 주변의 전이중(full-duplex) 모델은 그렇지 않습니다. 바로 그 격차가 핵심입니다.

가격 — 무료 앱, 무료 웨이트, 그리고 80GB 청구서
두 모델 모두 "무료"이며, 그 단어는 두 경우 모두에서 동일한 정도로 오해를 불러일으키는 역할을 한다.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
이 중 하나라도 구매 가능해지는 날을 위한 정직한 기준: 어떤 호스팅 음성 모델을 선택하든, 공급업체의 정가를 지불해야 하며, 그 위에 라우팅 마크업이 없어야 한다. 즉, 공급업체의 가격 인하가 계약 주기가 끝난 후가 아니라 같은 날 청구서에 반영되게 하는 패스스루다. 이 글의 두 모델 모두 OrcaRouter를 통해 호출할 수 없다. Sesame의 프로덕션 음성에는 API가 전혀 없으며, NVIDIA NemotronLabs VoiceChat 11B는 어떤 경로로도 호출할 수 없다. 그 기준은 실제로 구매할 수 있는 음성에 대한 것이고, 문자 100만 개당 7달러인 TTS 베이스나 미래의 Sesame 수준 API를 정직하게 가격을 책정하기 쉽게 만드는 바로 그 표준이다.
Memory — 기억하는 앱 vs 잊어버리는 모델
여기서 그 격차는 협곡이며, 이는 두 가지가 대체재가 아닌 가장 구체적인 이유입니다. Sesame Preview 앱은 기억합니다: 각 에이전트는 로그인 시 웹과 모바일에서 동기화되는 에이전트별 메모리를 가지며, 통화는 최대 30분까지 가능하고, 시크릿 모드는 새 메모리를 생성하지 않고 과거 메모리를 읽습니다. 대조적으로 오픈 CSM-1B는 4K 컨텍스트 창(대략 3~4분 분량의 텍스트)을 가지고 있으며, 어차피 당신의 말을 들을 귀도 없습니다.
{{1}}NVIDIA NemotronLabs VoiceChat 11B는 오디오 컨텍스트를 최대 약 2분까지만 보유합니다. 훈련 데이터로더는 발화를 142.39초로 제한하며, 모델 카드는 2분을 초과하는 대화는 유지되지 않을 수 있다고 경고합니다.{{/1}} {{2}}4분 전에 합의된 내용을 기억해야 하는 지원 통화의 경우, 그 한계는 그 자체로 탈락 사유입니다.{{/2}} {{3}}거기에 릴리스된 체크포인트에 복제 기능이 없는 단일 고정 음성(Aria)을 더하면, 아키텍처에 대해 개방적인 이 모델은 고객을 기억하지도 못하고 자신의 음성을 변경하지도 못하는 모델이기도 합니다.{{/3}}
각각이 진짜 못하는 것
차분함은, 강점에서 멈추는 비교는 마케팅이기 때문이다:
• Sesame Preview: API가 없습니다 — 이 음성을 제품에 넣을 수 없고, 프로덕션 모델은 출시되지 않았으며 평가되지도 않았습니다. 영어 전용이며, 작업 실행이 불가능하고, 30분 통화 제한이 있으며, 어떤 독립 벤치마크도 없습니다. 유일한 오픈 모델인 CSM-1B는 4K 컨텍스트 창을 가지지만, 도구 호출 기능이 없고, 듣기 기능도 없으며, 앱의 음성이 아닙니다.
• NVIDIA NemotronLabs VoiceChat 11B:연구 전용 라이선스(OpenMDW v1.1)로, 다운로드하고 연구하고 미세 조정할 수 있지만, 배포할 수는 없으며, 이를 기반으로 빌드하는 사람도 배포할 수 없습니다. 호스팅된 엔드포인트가 없으므로 '사용해 보기'는 80 GB GPU와 소스에서 빌드하는 것을 의미합니다. 영어 전용이고, 약 2분의 메모리 상한이 있으며, 고정된 음성이 하나입니다. NVIDIA는 지식 및 지시 수행에 있어 자체 백본보다 성능이 낮을 수 있다고 밝혔으며, 다단계 추론과 산술이 약점으로 지적되었습니다. 문장 중간에 말을 끊을 수 있고, 여러 차례 대화 후에는 복구할 수 없는 횡설수설이나 혼잣말로 변질될 수 있으며, 전사 시 단어를 누락할 수 있습니다. 또한 시끄럽거나 잔향이 많은 공간에는 명시적으로 부적합합니다. 도구 호출은 ASCII 전용 프롬프트와 응답에서만 작동하며, 세션당 최대 5개의 도구로 제한됩니다. 인수 정확도(44.2%)와 첫 시도 성공률(33%)은 도구의 인자를 올바르게 채우는 것보다 올바른 도구를 선택하는 데 더 신뢰할 수 있음을 의미합니다.
누가 어떤 것을 골라야 하나요
둘 다 호출할 수 없기 때문에, 솔직한 답변은 당신이 무엇을 하려는지에서 시작합니다.
• 2026년 가장 호평받은 음성을 경험하세요: Sesame Preview, 무료, 오늘 — 앱으로 출시. 리뷰어들이 계속 인용하는 네 에이전트, 인터럽션 처리, 드라이브 모드 사용성: 그것은 소비자 제품이며, 그 가치는 바로 측정할 수 없는 것입니다.
• 전이중 음성 모델링 연구:NVIDIA NemotronLabs VoiceChat 11B는 해당 카테고리에서 더 흥미로운 다운로드입니다 — 11B 오픈 체크포인트로, 작동하는 도구 호출 채널, 약 550,000시간의 혼합 훈련 오디오, 그리고 현재까지 가장 우수한 오픈 전이중 VoiceBench 결과를 갖추고 있으며, 가중치에 드는 비용은 0달러입니다. 연구 전용 라이선스는 그 작업에 제약이 되지 않습니다.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• 이번 분기에 음성 제품을 출시하세요:그중 어느 것도 아닙니다. 상업용 라이선스를 갖춘 호스팅 방식의 실시간 음성-음성 모델이 필요합니다. 아직 운영 경로로 확정하지 않은 모델을 도입하는 안전한 방법은, 자동 장애 조치가 있는 검증된 모델과 함께 해당 모델로 라우팅하는 것입니다. 그래야 검증되지 않은 음성이 실시간 통화를 중단시키는 일이 없습니다. 200개 이상의 호스팅 모델을 공급업체 정가에 마크업 없이 사용할 수 있게 해주는 단일 API는, 새로 등장한 음성을 시도하는 것을 재작성이 아닌 구성 변경으로 만들어 줍니다.
이 패턴은 반복될 것이므로 이름을 붙일 가치가 있습니다. 이 두 모델 모두 호출 가능해지기까지 단 한 가지 이벤트만 남아 있습니다 — Sesame는 모델 ID나 API를 출시하는 날, NVIDIA NemotronLabs VoiceChat 11B는 NVIDIA가 상업용 라이선스를 발표하거나 누군가 이를 호스팅하는 날입니다. 그렇게 되면, 현재 음성 스택을 뜯어내는 것이 올바른 선택이 아닙니다. 새 음성을 기존 음성 옆에 추가하고 장애 조치(failover)로 라우팅하는 것입니다, 검증되지 않은 새 모델에 대해 하듯이. 이들은 2026년의 가장 뛰어난 미출시 음성 두 가지입니다; 세 번째 음성을 출시할 인프라는 이미 존재합니다.
이 비교를 바꾸는 것은 무엇일까?
네 가지 사건이 이 글을 다시 쓰게 될 것이다. Sesame의 프로덕션 음성용 API 또는 모델 ID — 그 순간이 오면 Sesame는 앱이 아니라 호스팅 음성 API 시장이 기다려온 참가자가 된다. NVIDIA NemotronLabs VoiceChat 11B의 상업용 라이선스 또는 호스팅 엔드포인트 — 그러면 연구 산출물이 하룻밤 사이에 실제 제품 옵션으로 바뀐다. Sesame 음성에 대한 독립적인 점수 — Artificial Analysis의 음성-대-음성 게시판에 등재되면 "최고의 음성"이라는 주장이 검증받을 근거가 생긴다. 그리고 NVIDIA가 리더보드가 측정하는 12B "Nemotron 3 VoiceChat (V1)" 항목과 11B 체크포인트를 조화시키는 기술 보고서 — 이것이 이 제품군의 어떤 수치든 신뢰하기 위한 전제 조건이다. 그중 어떤 것도 나오기 전까지, 정확한 요약은 단순하다. 2026년의 가장 흥미로운 대화형 음성 두 가지는 모두 잠겨 있다. 하나는 팔지 않겠다는 회사에 의해, 다른 하나는 출시되지 않을 라이선스에 의해.
자주 묻는 질문
제 앱 안에서 두 모델 중 하나의 음성을 사용할 수 있나요?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
둘 중 어느 것이 실제로 더 인간처럼 들리나요?
알 수 없음, 각각 다른 근거로. Sesame Preview에는 독립적인 점수가 전혀 없다 — TestingCatalog의 "시장에서 가장 좋은 음성 모드 중 하나"라는 평가는 리뷰어들의 합의일 뿐, 측정값이 아니다. NVIDIA NemotronLabs VoiceChat 11B의 대화 타이밍(턴 넘김 448ms, 바지인 양보 480ms)은 NVIDIA가 보고한 값이며 재현되지 않았고, 독립적인 Big Bench Audio 수치(Artificial Analysis 기준 29.2%, "Nemotron 3 VoiceChat (V1)"으로 분류됨)는 음성이 얼마나 듣기 좋은지가 아니라 이해도를 측정한 것이다. 하나는 귀로 들을 수 있는 평판이고, 다른 하나는 다른 질문에 답하는 숫자다.
NVIDIA NemotronLabs VoiceChat 11B는 정말 무료인가요?
가중치는 무료이지만 모델 자체는 저렴하지 않습니다. 실행하려면 80GB GPU(주문형으로 시간당 약 2~3달러, 계속 켜 두면 월 1,500~2,200달러)와 소스에서 빌드하는 작업이 필요하며, OpenMDW v1.1 라이선스는 연구 목적으로만 사용을 제한합니다. 따라서 그 비용을 지출한 후에도 합법적으로 고객에게 제공할 수 없습니다.
