'GPT-Live-1 vs VoxCPM2'의 히어로 타이틀 카드, 부제 '임대한 대화인가, 당신이 소유한 GPU인가', 배지 '하나는 풀 듀플렉스, 하나는 텍스트 음성 변환 — 서로 다른 작업' 그리고 세 장의 카드: 'GPT-Live-1 — 음성 분당 $0.05, API 전용, 설치할 것 없음', 'VoxCPM2 — Apache-2.0, 2B 파라미터, ~8GB VRAM, 이를 배포하는 추론 제공자 없음', '셀프 호스팅 처리량 — RTF 0.13에서 GPU 시간당 약 7.7시간 분량의 오디오, 지난 30일 동안 393,079회 다운로드', 그 아래 푸터 스트립에는 'VoxCPM2 벤치마크는 OpenBMB가 보고함; GPT-Live-1 음성 수치는 OpenAI가 보고했으며 재현되지 않음.'이라고 적혀 있다. OrcaRouter 로고가 오른쪽 하단에 합성되어 있다.
Engineering & Research

GPT-Live-1 vs VoxCPM2: 하나는 분당 $0.05, 다른 하나는 24GB GPU가 필요하다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-Live-1과 VoxCPM2를 비교하는 가장 깔끔한 방법은, 하드웨어에 숫자를 대입해 보기 전까지는 둘이 경쟁자처럼 보일 뿐이라는 점을 알아차리는 것이다. GPT-Live-1은 OpenAI의 풀듀플렉스 음성 모델로, 2026년 9월 10일부터 API에 제공되며 설치할 필요 없이 음성 1분당 $0.05이다. VoxCPM2는 OpenBMB의 20억 매개변수 오픈 가중치 텍스트 음성 변환 모델로, 2026년 4월 Apache 2.0에 따라 공개되었으며 약 8GB의 VRAM에서 실행되고 어떤 추론 제공업체도 배포하지 않는다. 따라서 원한다면 여러분이 그 장비를 소유해야 한다. 하나는 초 단위로 임대하는 대화이고, 다른 하나는 직접 운영하는 합성기다. 문제는 어느 것이 더 나은지가 아니라, 여러분의 워크로드가 실제로 어느 쪽을 흡수할 수 있는지이다.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

두 모델, 두 가지 역할, 각각 한 줄의 솔직한 스펙

• 기능 — GPT-Live-1은 대화를 나눕니다: 동시에 듣고 말하며, 순서를 주고받고, 끼어들기와 추임새를 처리하며, 대화 기록을 반환합니다. VoxCPM2는 텍스트를 음성으로 변환합니다. 그것은 아무것도 듣지 않습니다.

• 접근 방식 — GPT-Live-1은 호스팅되고 클로즈드된 모델로, Live Sessions 엔드포인트 뒤에 있는 단일 모델 ID이며, 공개된 통합 예제는 WebRTC를 통해 실행됩니다. VoxCPM2는 Hugging Face와 ModelScope에서 다운로드할 수 있는 체크포인트로, Apache 2.0이며 상업적 사용이 무료입니다.

• 가격 — GPT-Live-1은 음성 분당 $0.05이며 초 단위로 청구되고, 위임 백엔드는 별도로 계량됩니다. VoxCPM2는 호출당 $0에 GPU가 추가되며, 오픈 소스 호스팅이 전체 비용 모델입니다.

• 풋프린트 — GPT-Live-1은 귀하의 하드웨어가 전혀 필요하지 않습니다. VoxCPM2는 약 8GB의 VRAM(Q4에서 6–8GB), Python 3.10+, PyTorch 2.5+, CUDA 12+가 필요합니다.

• 벤치마크 — GPT-Live-1의 모든 음성 수치는 OpenAI의 것이며, 재현되지 않았다; 유일한 독립 리더보드에서는 이를 11개 중 7위로 평가한다. VoxCPM2의 공개된 수치는 OpenBMB의 것이고, 그 다국어 주장에 관해 존재하는 독립적 측정 결과는 반대 방향을 가리킨다.

가격이 매겨진 24 GB 문제

VoxCPM2의 서빙 수치는 셀프 호스팅이 취미인지 아키텍처인지를 결정하는 수치다. 단일 RTX 4090에서 이 모델은 일반 PyTorch에서는 약 0.30, Nano-VLLM 경로에서는 약 0.13의 실시간 계수로 실행된다 — 즉 더 빠른 구성에서는 GPU 시간 1시간당 약 7.7시간의 생성 오디오를 의미한다. 이는 외부 측정치가 아니라 모델 카드 자체의 수치이며, CUDA 12.9가 설치된 4090에서 검증된 독립적인 서빙 레시피는 제로샷 합성의 경우 약 0.120, 클로닝의 경우 0.139의 정상 상태 실시간 계수를 보고하고, 최대 GPU 메모리는 24GB 중 약 22GB에 근접한다. 두 수치 모두 콜드 스타트가 아닌 정상 상태 기준이다 — 새 프로세스에서의 첫 요청은 훨씬 느리며, 사람들이 이 모델을 사용할 수 없다고 말할 때 인용하는 수치가 바로 그것이다.

그걸 API와 나란히 놓고 보자. 분당 $0.05인 GPT-Live-1은 한 시간 연속 대화에 $3.00이다. 공개 시장에서 임대하는 24 GB 카드는 시간당 한 자릿수 달러대 초반에 머물고, 하나를 소유하는 비용은 이용률을 감안하면 비슷한 수준으로 상각된다. 그래서 이 비교는 이런 비교들이 으레 그렇듯 결론에 도달하는데, 불편한 비대칭이 하나 있다: GPU 청구서는 누군가 당신의 제품에 말을 걸든 말든 날아오지만, API 청구서는 한산한 날에는 0까지 내려가고 바쁜 날에는 다섯 자릿수까지 올라간다. 고정된 카탈로그의 배치 합성은 GPU에 안성맞춤이다. 상시 연결된 전화선은 종량제에 안성맞춤이다.

다른 어떤 오픈 소스도 하지 못하는 VoxCPM2의 기능

VoxCPM2가 이만큼 주목받을 가치가 있는 이유는 벤치마크에서 이기기 때문이 아니라 — 대체로 이기지도 않는다 — 참조 오디오 없이 텍스트 설명만으로 목소리를 설계한다는 점이다. 이는 오픈 웨이트에서 진정으로 새로운 기능이며, 아직 존재하지 않는 목소리가 필요한 모든 사람의 워크플로를 바꾼다: 글로 오디션하고, 글로 반복해 다듬은 뒤에야 복제할지 결정하는 것이다. 그 주변으로 30개 언어와 9개 중국어 방언, 내장 초해상도 단계를 통한 48 kHz 출력, 그리고 최소 5~10분의 오디오로 가능한 파인튜닝을 갖췄다.

근거 기반은 기능 목록보다 빈약하다. OpenBMB 자체 보고서에 따르면 영어 단어 오류율은 1.84%, 중국어 문자 오류율은 0.97%이며, 자체적으로 언어당 500개 발화로 구성한 세트에서 다른 업체의 모델로 채점한 30개 언어 평균 오류율은 1.68%다. 독립 테스트가 존재하는 경우 격차는 크다: Whisper-large-v3로 채점한 MiniMax의 다국어 테스트 세트에서 힌디어는 19.70, 아랍어는 13.05로, 자체 보고 수치보다 몇 배나 나쁘다. OpenBMB는 또한 음성 디자인과 스타일 제어가 실행마다 가변적인 결과를 낸다고 경고하며, 원하는 출력을 얻으려면 한 번에서 세 번 생성해 보라고 권장하는데, 이는 사용 가능한 결과를 얻는 데 드는 호출 비용이 한 번의 호출이 아니라는 것을 에둘러 말하는 셈이다.

아무도 비교에 넣지 않는 통합 비용

화려하지 않은 한 가지 세부 사항이 VoxCPM2가 일주일짜리 작업이 될지 한 달짜리 작업이 될지를 결정합니다. VoxCPM2의 Hugging Face 저장소에는 voxcpm이 아니라 transformers 태그가 붙어 있습니다. 즉, 그 사이트의 거의 모든 다른 것들이 로드되는 데 사용하는 라이브러리로는 이 모델을 로드할 수 없습니다. 이를 수정하기 위한 풀 리퀘스트는 2026년 8월 4일에 열렸고, 마지막으로 확인했을 당시에도 병합되지 않았습니다. 다른 서빙 스택에 이를 추가하는 풀 리퀘스트는 병합되었으며, 채택은 의문의 여지가 없습니다. 이 캡처 시점 기준 지난 30일 동안 393,079회 다운로드되었고, 체크포인트를 기반으로 구축된 27개의 어댑터, 30개의 파인튜닝, 12개의 양자화, 100개의 Spaces가 있습니다.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

GPT-Live-1의 상응하는 비용은 전송 계층 재작성이다. 이 모델의 세션은 요청-응답 방식의 오디오 엔드포인트가 아니라 실시간 연결을 중심으로 구축되며, 이중 계량 과금 체계 때문에 위임된 모든 추론 호출, 도구 호출, 웹 검색이 음성 사용 시간에 더해 백엔드 모델 자체의 요율로 청구된다. 토큰 계량 방식의 실시간 통합에서 이전하는 팀은 이 작업을 모델 ID 교체가 아니라 엔지니어링 작업으로 예산에 반영해야 한다.

라우팅 레이어가 실제로 도움이 되는 경우

OrcaRouter는 GPT-Live-1도 VoxCPM2도 제공하지 않으며, 이 섹션의 나머지 내용이 그와 반대로 암시하도록 두기보다는 그 점을 분명히 말할 가치가 있습니다. GPT-Live-1의 음성 계층은 OpenAI 자체 엔드포인트 뒤에 있습니다. VoxCPM2는 호스팅 제공업체가 전혀 없습니다. 둘 다 우리 키로 호출할 수 있는 것이 아닙니다.

라우팅 문제가 여전히 제기되는 이유는 두 모델 모두 중간이 텍스트인 파이프라인의 가장자리에 자리하기 때문입니다. VoxCPM2 배포는 보통 무언가에 응답합니다 — 스크립트 생성기, 번역 단계, 텍스트 정규화기, 다음에 무엇을 말할지 결정하는 대화 모델 — 그리고 이들은 평범한 모델 호출입니다. GPT-Live-1 세션은 세션 구성에 명시된 백엔드 모델에 사고를 위임하는데, Ope​nAI 자체 문서에서 그 백엔드는 GPT-5.6 Terra이며, OrcaRouter를 통해 Ope​nAI의 정가로 이용할 수 있습니다. 클라이언트 위임은 한 단계 더 나아가 자체 애플리케이션이 백엔드를 제공할 수 있게 해주므로, 음성 뒤에 있는 모델은 여러분이 제어하는 어떤 엔드포인트든 될 수 있습니다. 열한 개 업스트림 제공자의 약 190개 모델이 정가 그대로, 마크업 없는 하나의 키 뒤에 있습니다 — 그래서 제공자가 가격을 인하하면 갱신 시점이 아니라 같은 날 바로 여기에 반영됩니다 — 제공자 간 자동 장애 조치와 여러 모델을 하나의 호출로 조합하는 라우팅 DSL도 함께 제공됩니다. 가장 자주 바뀌는 스택의 절반을 위한 저렴한 보험입니다.

이 절에는 한 가지 주의점을 묻어두기보다 여기에 두는 것이 맞습니다. 왜냐하면 그것이 이 비교의 GPT-Live-1 쪽을 공급업체 벤치마크가 시사하는 것보다 덜 확정적으로 만드는 세부 사항이기 때문입니다. 독립적인 Artificial Analysis Speech to Speech Index에서 GPT-Live-1은 69.8%를 기록했습니다. 11개 중 7위로, 73.9%의 GPT-Realtime-2.1과 79.0%의 Grok Voice Think Fast 2.0에 뒤처집니다. 이 모델은 입력 오디오 1시간당 4.42달러로 해당 순위표에서 가장 저렴하지만, 최고는 아닙니다. 표준으로 삼는 음성 레이어가 끝까지 유지하게 될 레이어가 아닐 가능성에 대비하십시오.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

어느 것, 무엇을 위해

텍스트가 오디오보다 먼저 존재한다면 VoxCPM2를 선택하세요. 내레이션, 오디오북, 더빙, 접근성, 게임 음성 대사, 아직 아무도 녹음하지 않은 목소리가 필요한 제품 — 특히 볼륨이 크고 예측 가능하며 고정 자본 비용을 지출할 가치가 있는 모든 작업에 적합합니다. 직접 실행하게 된다는 점, 이를 둘러싼 툴링이 아직 정착 중이라는 점, 그리고 다국어 품질 주장은 고객에게 전달되기 전에 직접 청취 테스트를 해볼 가치가 있다는 점을 받아들이세요.

상대방이 사람이라면 GPT-Live-1을 선택하세요. 음성 에이전트, 전화 지원, 접수 흐름, 사람이 말을 끝냈는지 모델이 실시간으로 판단해야 하는 모든 상황이 여기에 해당합니다. 문제를 직접 떠안지 않을 수 있는 특권에 대해 분당 요금을 지불하고, 위임된 백엔드는 별도 항목으로 예산에 잡으세요. 통화가 저렴해지거나 비싸지는 곳이 바로 거기이기 때문입니다.

실수는 이 둘을 맞대결에서 대안으로 취급하는 것이다. 둘 다 필요한 대부분의 팀에게 이들은 같은 제품의 두 계층이며, 정말로 잘못된 유일한 답은 라이선스가 무료라고 하니까 그 말을 사실로 만들어 주는 GPU 비용을 계산하지도 않은 채 자체 호스팅 방식을 선택하는 것이다.