
GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: 분당 청구서인가, 아니면 80GB GPU인가
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 100만 토큰당
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
GPT-Live-1과 NVIDIA Nemotron VoiceChat 11B 중에서 고르는 것은 두 음성 모델 중에서 고르는 것이 아니다. 그것은 음성 모델을 의상처럼 걸친 두 비즈니스 모델 중에서 고르는 것이다. GPT-Live-1은 OpenAI가 2026년 9월 10일에 개발자 액세스로 전환한 호스팅 API로, 오디오 1분당 $0.05가 청구되며 사용자의 하드웨어는 전혀 관여하지 않는다. NVIDIA-NemotronLabs-VoiceChat-11B로 공개되었고, 2026년 7월 21일자 NGC 컨테이너와 Hugging Face 체크포인트가 함께 제공되는 NVIDIA Nemotron VoiceChat 11B는 110억 매개변수의 오픈 가중치 전이중 음성 모델로, 80GB GPU 미만에서는 실행되지 않는다. 이들 중 하나는 대화 1분당 비용이 들고, 다른 하나는 누군가 전화를 하든 하지 않든 비용이 든다.
손익분기점은 벤더 측 자료가 시사하는 것보다 더 단순하다
양측이 모두 동의하는 단 하나의 숫자부터 시작하겠습니다. 분당 $0.05인 GPT-Live-1은 1시간 동안 끊김 없이 연결된 통화에 $3.00입니다. 그것이 항상 켜져 있는 음성 대화 하나의 가격입니다.
이제 대안의 비용을 따져 보자. Nemotron VoiceChat 11B에는 최소 80GB VRAM을 갖춘 GPU가 필요하다 — Linux에서 A100, H100, H200, B100, B200 또는 RTX 6000급 카드다. 이런 카드 중 하나를 공개 시장에서 임대하면 시간당 한 자릿수 달러대 초반이고, 직접 소유하면 가동률을 감안할 때 비슷한 금액으로 상각된다. 따라서 상시 켜져 있는 단일 음성 회선은 대략 본전이다: 임대 GPU 비용이 API 비용과 거의 비슷한데, 그 위에서 돌릴 무엇인가에 대한 비용을 지불하기도 전이다.
그것은 잘못된 비교이며, 대부분의 build-vs-buy 글이 멈추는 바로 그 지점이다. 올바른 비교는 라인당이 아니라 GPU당이고, 이는 NVIDIA가 아직 공개하지 않은 숫자에 달려 있다.
• Tier 1 계정의 GPT-Live-1 — 25개 동시 세션, 25개 라인이 모두 활성화된 경우 분당 $1.25, 시간당 $75입니다
• 80GB GPU 한 장에서 Nemotron VoiceChat 11B — 11B 하이브리드 Mamba/Transformer 모델이 80GB에 수용할 수 있는 만큼의 동시 세션을, 대략 그 카드의 임대 비용으로
11B 모델을 80 GB 가속기에 올리면 여유가 상당히 많고, 80 GB라는 요구 사항은 실제로 막대한 배칭 용량을 확보해 줍니다. 카드 한 장이 동시 대화를 여섯 개만 처리하더라도 최대 부하에서는 자체 호스팅이 API보다 훨씬 저렴합니다. 한 장이 1.5개를 처리한다면 그렇지 않습니다. 실제 트래픽에서 동시성을 벤치마크하기 전까지 정직한 입장은, 손익분기점이 대규모에서는 자체 호스팅에 유리할 가능성이 크며 어느 벤더도 이를 입증할 수치를 제시하지 않았다는 것입니다.

오픈 모델이 단지 더 저렴한 것이 아니라 진정으로 더 나은 경우
지연 시간 비교는 가격 비교보다 더 신중하게 다룰 필요가 있습니다. 이 축에서는 오픈 모델이 더 나은 근거를 가지고 있기 때문입니다.
• 턴테이킹 지연 시간 — Nemotron VoiceChat 11B는 Full-Duplex-Bench 1.0에서 원활한 턴테이킹에 448ms를 보고하며, 인터럽트 후 양보 지연 시간은 480ms이고 사용자 인터럽트 발화권 인수율은 1.00입니다. GPT-Live-1의 수치는 1.4초에서 0.8초로 감소했으며, 이는 OpenAI가 보고했습니다.
출처를 함께 놓고 그 두 숫자를 나란히 읽어 보면 그림이 뒤집힌다. NVIDIA의 수치는 공개적으로 명세된 벤치마크 스위트에서 나온다. OpenAI의 수치는 OpenAI가 자사의 새 모델을 자사의 이전 세대와 비교한 데서 나온 것이며, 독립적으로 재현된 적이 없다. 입수 가능한 증거로 볼 때, 오픈 웨이트 모델은 음성 에이전트를 사람처럼 느껴지게 만드는 부분에서 측정 가능하게 더 빠르고, 호스팅 모델이 더 빠르다는 것은 오직 자사 홍보 자료에 따른 것일 뿐이다.
NVIDIA는 또한 최초를 주장한다. Nemotron VoiceChat 11B는 대화 중 실시간 도구 호출을 지원하는 최초의 오픈 풀듀플렉스 모델로 설명되며, 별도의 출력 채널과 미리 설정된 대기 문구를 사용해 에이전트가 외부 API를 기다리는 동안에도 계속 말할 수 있다. 모델 카드에는 바로 그 점을 들어보라고 권하는 세 개의 오디오 샘플이 포함되어 있다. 약 450ms 응답으로 설명되는 자연스러운 발화 순서 교대, 모델이 즉시 양보하는 끼어들기, 대화 도중 실시간으로 호출되는 도구가 그것이다. 그 샘플들은 벤더의 것이며 448ms 수치를 독립적으로 검증하기보다는 이를 뒷받침한다. 하지만 적어도 출시 게시물 속 숫자가 아니라 다운로드 가능한 체크포인트에 첨부된 들을 수 있는 증거이다. 이는 GPT-Live-1이 위임으로 해결하는 동일한 아키텍처 문제를 다르게 답한 것이다. 오픈 모델은 스스로 회선을 유지하고, 호스티드 모델은 작업을 별도의 추론 모델에 넘기고 음성 레이어가 대화를 계속 이어가게 한다.
유사점은 차이점만큼이나 시사하는 바가 크다. 둘 다 전이중 방식으로 작동한다. 즉, 번갈아 말하는 대신 말하면서 동시에 듣는다. 둘 다 중단과 끼어들기(barge-in)를 지원한다. 둘 다 음성으로 학습되었는데, 그 규모는 기존의 ASR→LLM→TTS 식 계단형 파이프라인을 마치 볼트로 묶어 놓은 세 개의 별도 제품처럼 보이게 할 정도다. NVIDIA의 체크포인트는 약 55만 시간 분량의 음성을 학습했다.

당신이 포기하는 것, 그리고 그것은 돈만이 아니다
오픈 모델에서 가장 먼저 포기하게 되는 것은 음성입니다. 공개된 체크포인트는 Aria라는 단일 고정 음성을 사용하며, 음성 복제나 음성 라이브러리를 지원하지 않습니다. GPT-Live-1은 서로 다른 억양, 방언, 언어를 아우르는 12개의 음성을 제공하며, OpenAI는 이 모델을 위해 그것들을 특별히 리마스터했습니다. 제품의 음성이 정체성의 일부라면, 또는 하나의 배포로 서로 다른 음성을 가진 에이전트를 여러 시장에 제공해야 한다면, 이는 그 자체로 거의 결정적 탈락 사유에 가깝습니다. 그리고 이는 스펙 비교에서 가장 눈에 덜 띄는 한계입니다. 제품 결정이라기보다 기능 개수처럼 보이기 때문입니다.
두 번째로 포기해야 하는 것은 컨텍스트의 상한입니다. 이 모델은 약 142초라는 학습 시점의 발화 제한을 가지며, 대략 2분이 넘는 오디오 컨텍스트를 유지하는 데에도 실질적인 한계가 있습니다. 20분 동안 이어지는 통화는 이 체크포인트에게 하나의 연속된 컨텍스트가 아닙니다. 주변 시스템이 관리해야 하는 일련의 세그먼트일 뿐입니다. 호스팅 모델은 일반적으로 이런 관리를 대신 처리해 줍니다.
세 번째는 그것으로 무엇을 할 수 있도록 허용되는지입니다. Hugging Face 모델 카드에는 openmdw-1.1 라이선스가 명시되어 있는데, 해당 릴리스에 대한 일부 보도는 이를 연구용 전용이라고 설명했고 NGC 컨테이너 페이지는 구성 요소를 상업적 또는 비상업적 사용이 가능한 것으로 규정합니다. 세 개의 출처, 세 가지 다른 해석, 그리고 구속력을 갖는 것은 오직 라이선스 텍스트뿐입니다. 이러한 불일치는 출시 3주 전 법률 검토에서 드러나는 유형의 문제입니다. 구축하기 전에 해결하세요. 나중이 아니라.
네 번째는 운영입니다. 80 GB GPU는 한적한 일요일에 꺼버릴 수 있는 비용 항목이 아닙니다. 트래픽이 0이어도 카드 비용은 계속 나가며, 연결 끊김이 곧 고객 이탈인 실시간 오디오 경로의 스케일링 곡선, 드라이버 업그레이드, 용량 계획, 온콜 순번까지 직접 책임져야 합니다. 그 경지에 도달할 때까지 기댈 수 있는 호스팅 폴백도 없습니다. Hugging Face 카드의 추론 제공자 행에는 이 모델이 어떤 추론 제공자에 의해서도 배포되지 않았다고 분명히 적혀 있으므로, 이 체크포인트로 프로토타이핑해 볼 수 있는 분당 과금 버전은 없습니다. 직접 셀프 호스팅하거나, 아니면 사용하지 않아야 합니다. 그 작업은 분당 비교에서는 보이지 않지만 채용 계획에서는 아주 선명하게 드러납니다.
대부분의 팀이 실제로 고려해야 할 하이브리드
이 결정을 실행 가능하게 만드는 관점은 두 모델이 반드시 이분법일 필요는 없다는 것입니다. 음성 에이전트에는 일반적으로 음성 계층과 추론 계층이 있으며, 유연성은 바로 추론 계층에 있습니다.
GPT-Live-1은 설계상 이런 방식으로 만들어졌습니다. 음성 계층은 대화를 계속 살아 있게 유지하고, 사고는 Responses API를 통해 일반 텍스트 모델로 위임됩니다. OpenAI가 공개한 자체 WebRTC 예제는 그 백엔드를 GPT-5.6 Terra에 연결합니다. 스택의 그 절반은 토큰당 가격이 책정되는 평범한 API 호출이며, 공급업체를 실제로 선택할 수 있습니다. GPT-5.6 Terra는 OrcaRouter를 통해 다음 가격에 제공됩니다: 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $12.00,과 나란히 있으며, 100만 토큰 컨텍스트와 /v1/chat/completions 및 /v1/responses가 모두 노출되어 있습니다단일 키로 접근할 수 있는 약 190개의 다른 모델.
이 점은 특히 셀프 호스팅 프로젝트에서 중요한데, 위험 프로필을 바꾸기 때문입니다. Nemotron VoiceChat 11B를 구축했는데 트래픽을 감당하지 못한다면, 음성 절반은 매몰된 GPU 비용이 됩니다. 하지만 추론 절반은 오디오 경로를 전혀 건드리지 않고도 옮기거나, 장애 조치하거나, 일상적인 턴에는 저렴한 모델을, 에스컬레이션에는 강력한 모델을 쓰도록 나눌 수 있습니다. 업스트림 공급자 전반에 걸친 자동 장애 조치는 단일 소스 의존성이 다운될 때 나쁜 오후와 나쁜 분기를 가르는 차이입니다.
어디에서 무엇이 제공되고 제공되지 않는지 분명히 밝히세요: GPT-Live-1도 Nemotron VoiceChat 11B도 OrcaRouter가 제공하지 않습니다. 둘 다 각자의 출처에서 옵니다 — 하나는 OpenAI의 Live Sessions 엔드포인트에서, 다른 하나는 사용자의 자체 GPU에서. 라우팅 레버리지는 전적으로 오디오의 다운스트림에 있습니다.

어느 것을 기반으로 해야 할까?
• 이번 분기에 출시하려면, 둘 이상의 음성이 필요하면, 대화가 보통 2분 넘게 연속 컨텍스트로 이어지면, 또는 유휴 상태에서도 비용이 청구되는 GPU를 정당화할 만큼 사용량이 아직 충분히 많지 않다면 GPT-Live-1을 선택하세요.
• 이미 80GB GPU를 운영 중이고, 단언이 아니라 증거를 바탕으로 한 500ms 미만의 턴테이킹이 필요하며, 데이터 상주(data residency) 이유로 오디오가 자체 인프라 안에 있어야 하거나, API의 분당 과금이 청구서에서 가장 큰 항목일 정도의 통화량을 처리하고 있다면 NVIDIA Nemotron VoiceChat 11B를 선택하세요.
• API로 프로토타입을 만들고 체크포인트를 벤치마크하세요. 이 결정은 아직 공개되지 않은 단 하나의 숫자, 즉 80GB 카드당 동시 세션 수에 달려 있으며, 그 숫자를 확보하는 유일한 방법은 자체 트래픽 형태에서 직접 측정하는 것입니다. 이는 일주일이 걸리는 작업이며, 방어 가능한 인프라 결정과 결정인 척 포장한 추측 사이의 차이입니다.
