VoxCPM2-1
Engineering & Research

VoxCPM2: 월 90만 건 다운로드, 그런데 Transformers는 여전히 로드할 수 없다

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Hugging Face의 VoxCPM2 메타데이터는 해당 라이브러리를 voxcpm으로 나열합니다 — transformers가 아닙니다. 이 단일 필드는 현재 오픈소스 음성 세계의 이상한 공백을 설명합니다: OpenBMB의 2B 파라미터 규모 text-to-speech 모델은 지난 30일 동안 900,282회 다운로드를 기록했고, 25개의 공개 파인튠, 10개의 양자화 버전, 7개의 어댑터, 100개 이상의 Spaces를 파생시켰지만, 해당 사이트의 거의 모든 다른 모델이 로드할 때 사용하는 라이브러리로는 여전히 로드할 수 없습니다. 이 문제를 해결하기 위한 풀 리퀘스트는 2026년 8월 4일에 열렸으며 오늘 현재까지도 열려 있습니다.

그 격차는 수정이 적용되기 전에 이해해 둘 가치가 있다. 이는 그 격차가 이번 주에 이 모델을 통합하는 비용과 다음 분기에 통합하는 비용의 차이를 결정하기 때문이다. 그리고 그 이면에는 더 흥미로운 질문이 자리한다. 즉, VoxCPM2가 실제로 보도가 시사하는 만큼 앞서 있는가 하는 것이다. 아래의 모든 내용은 다음 세 가지 주요 출처에서 읽어낸 것이다: openbmb/VoxCPM2 모델 카드 및 저장소 메타데이터, OpenBMB/VoxCPM GitHub README, 그리고 VoxCPM2 기술 보고서(arXiv:2606.06928, 2026년 6월 5일 제출). 이 글의 모든 벤치마크 수치는 OpenBMB가 자체적으로 실행한 수치다. 그리고 논문 자체가 주요 비교 표에 대해 명시하듯이, 그 표에 실린 경쟁 모델 수치들은 동일한 조건에서 재실행된 것이 아니라 다른 논문에서 복사된 것이다. 우리가 확인한 바로는, 어떤 독립 연구소도 이 결과들 중 어느 것에 대한 재현도 발표하지 않았다.

한 화면에 담은 사양 시트

VoxCPM2는 2026년 4월에 출시된 VoxCPM 라인의 3세대 제품입니다 (Hugging Face 저장소는 4월 3일에 생성되었고, 마지막 수정은 4월 16일에 이루어졌습니다). 직전 세대와 비교하면:

크기 — VoxCPM1.5의 0.8B 및 VoxCPM-0.5B의 0.6B 백본 대비 2B 파라미터.

언어 — 30개 언어와 중국어 방언 9개 (이전 두 버전에서는 중국어와 영어만 지원).

오디오 — 16kHz 참조 입력을 받아 48kHz를 출력하며, VoxCPM1.5의 대칭적인 44.1kHz 입출력과 대비됩니다.

백본 — 텍스트 의미 언어 모델로 MiniCPM-4-1B(28개 레이어, 너비 2048)를 사용하며, 기존 MiniCPM-4-0.5B(24개 레이어, 너비 1024)에서 업그레이드되었습니다.

시퀀스 예산 — 언어 모델 측 토큰 속도 6.25Hz 기준 8192개 토큰으로, 한 컨텍스트에서 약 20분 분량의 오디오에 해당합니다.

음성 1초당 비용 — 순수 PyTorch에서는 실시간 계수 0.30, Nano-vLLM을 통해서는 RTX 4090 하나에서 약 8GB VRAM으로 0.13입니다. VoxCPM1.5는 0.8B 및 6GB에서 0.15를 달성했습니다.

라이선스 — 가중치, 파인튜닝 코드, 추론 도구에 Apache-2.0이 적용됩니다. 사용 게이트나 허용 사용 정책 부가 조항이 없으며, 상업적 이용이 허용됩니다.

훈련 데이터 — 다국어 음성 "2백만 시간 이상"이지만, 명명된 말뭉치가 없고 출처 설명도 없다.

RTF 라인을 두 번 읽으세요. 반대 방향으로 실행되기 때문입니다. VoxCPM2는 대체하는 0.8B 모델보다 생성된 오디오 1초당 약 두 배 느리며, VRAM이 1/3 더 필요합니다. 2B 모델은 처리량을 얻지 못했습니다. 언어와 제어를 얻는 대신 지연 시간을 청구했습니다. 실시간 에이전트를 실행 중이라면, 그 트레이드오프가 가장 먼저 비용을 따져야 할 부분입니다.

PR #47756이 실제로 변경하는 내용

오늘날 VoxCPM2를 실행한다는 것은 OpenBMB의 자체 패키지를 설치하는 것을 의미합니다 — pip install voxcpm, Python 3.10~3.12, PyTorch 2.5 이상, CUDA 12 이상 — 그리고 모델을 VoxCPM.from_pretrained 호출을 통해 로딩하는데, 이 호출은 Transformers API와는 전혀 무관합니다. 그 결정 이후의 모든 것은 맞춤형입니다: 자체 배칭, 자체 서빙 글루, 5가지 생성 모드의 자체 처리.

진행 중인 작업이 그 상황을 바꿀 것입니다. 7월 31일에 "#47695, 'OpenBMB VoxCPM2 네이티브 지원 추가'" 이슈가 등록되었습니다. 8월 4일에는 "#47756, 'VoxCPM2 지원'" PR이 이어졌고, 마지막 업데이트는 8월 5일에 이루어졌습니다. 이 PR은 "New model" 라벨을 달고 있으며, 모듈형 config 및 모델링 구현, 커스텀 토크나이저와 프로세서, 스트리밍을 포함한 AudioVAE 인코드/디코드, 참조 음성 컨디셔닝, 프롬프트 오디오 연속 생성, 자동 클래스 등록, 텍스트-파형 파이프라인 엔트리를 추가하며——64개의 모델 테스트가 통과한 것으로 보고되었습니다. 이 PR은 MiniCPM4 자체를 추가하는 PR #47736 위에 쌓여 있습니다. {{1}}텍스트 백본이 먼저{{/1}} 병합되어야 {{2}}그 위에 얹히는 음성 모델{{/2}}도 병합될 수 있습니다.

VoxCPM2-2

주목할 만한 세부 사항이 두 가지 있으며, 둘 다 낙관론에 반한다. 첫째, 세 가지 항목(이슈 하나와 풀 리퀘스트 두 개)은 모두 동일한 개인 커뮤니티 기여자가 개설한 것이지 OpenBMB도, Hugging Face 유지보수자도 아니다. 그 뒤에는 공급업체의 약속이 없으므로 계획 기준으로 삼을 타임라인도 없다. 둘째, 새로운 모달리티를 다루는 203개의 커밋이 포함된 두 개의 PR 스택은 빠른 검토가 아니다. Transformers의 새 모델 PR은 일반적으로 유지보수자와의 왕복 과정에 수 주가 걸리며, 이 PR은 현재까지 댓글이 네 개뿐이다.

실용적으로 해석하면: 네이티브 Transformers 클래스가 아키텍처의 핵심 요소라면 — AutoModel로 표준화했기 때문이든, 서빙 레이어가 Transformers만 지원하기 때문이든 — VoxCPM2는 아직 준비되지 않았고, 출시일도 정해지지 않았습니다. 만약 voxcpm 패키지 안에서 해결할 수 있다면, 이 모델은 현재 완전히 사용할 수 있으며, 생태계가 이를 감수할 만한 것으로 분명히 판단했습니다: 네이티브 지원이 전혀 없었는데도 900,282건의 다운로드가 발생했습니다. 대부분의 보도가 간과하는 중간 경로도 있습니다. OpenBMB는 OpenAI 호환 /v1/audio/speech 엔드포인트를 노출하는 vLLM-Omni 통합과, Python 의존성이 전혀 없이 CPU, Metal, CUDA 또는 Vulkan에서 실행되는 GGUF 가중치를 갖춘 llama.cpp-omni 빌드를 제공합니다. Transformers에서 실제로 원했던 것이 클래스 자체가 아니라 표준 서빙 인터페이스였다면, 그것은 이미 존재합니다.

토크나이저가 없다는 것은 양자화되지 않았다는 뜻이 아니다.

이 모델에 관한 모든 헤드라인에 등장하는 문구는 가장 흔히 오독되는 문구다. VoxCPM2는 외부의 개별 오디오 코덱을 사용하지 않는다. 즉 CosyVoice나 Moshi 계열에서처럼 언어 모델과 파형 사이에 학습된 음성 토큰 어휘가 존재하지 않는다. 이것이 바로 그 주장이며, 사실이다.

모델 내부에는 여전히 양자화가 존재한다. 백본(backbone)은 FSQ(Finite Scalar Quantization) 기반의 미분 가능한 반이산(semi-discrete) 병목 계층을 실행하며, 논문은 그 역할을 명확히 밝힌다. 텍스트 의미 언어 모델이 은닉 상태를 생성하면, FSQ가 이를 차원별로 스칼라 양자화하여 "의미 골격(semantic skeleton)"을 만들고, 잔차 음향 언어 모델이 FSQ가 버린 미세한 디테일을 복원하며, 로컬 확산 트랜스포머가 플로우 매칭을 통해 두 조건화 스트림을 다음 연속 잠재 패치로 변환한다. LocEnc, TSLM, RALM, LocDiT로 축약 표기된 네 단계가 바로 이 체인이다.

실제로 중요한 차이는 '양자화 여부'가 아니다. 핵심은 병목(Bottleneck)이 주변의 모든 것과 함께 종단 간(end-to-end)으로 훈련된다는 점이지, 자체 손실(Loss)을 가진 별도의 코덱으로 사전에 고정되는 것이 아니라는 데 있다. 이것이 언어 모델이 코덱이 충실히 디코딩할 수 없는 토큰을 예측하도록 학습되는 일반적인 실패 모드를 제거한다. VoxCPM2는 해당 FSQ 병목을 256차원에서 512차원으로 확장했고, 잔차 모델에 공급되던 기존의 요소별 합(Element-wise Sum)을 학습 가능한 결합-투영(Concatenation-Projection)으로 대체했다. 이는 작은 변경이지만, 보고서에서 벤치마크 델타가 아닌 명시된 메커니즘으로 뒷받침되는 몇 안 되는 변경 중 하나다.

48kHz 출력은 부분적으로 창작된 것이며, 그것이 설계입니다.

"48 kHz 스튜디오 품질 출력"은 이 모델의 사양 중 가장 많이 인용되면서도 가장 널리 오해받는 항목이다. AudioVAE V2는 비대칭 구조로, 인코더는 16 kHz에서 작동하고 디코더는 48 kHz에서 재구성한다. 논문에서는 이를 "암시적 초해상도(implicit super-resolution)"라고 부르는데, 이는 그 본질을 정직하게 드러내는 명칭이다.

결과를 따라가 보자. 16kHz 인코더는 8kHz 나이퀴스트 상한선을 가지므로, 기준 오디오에서 8kHz 이상의 어떤 것도 모델에 도달하지 않는다. 출력의 상위 두 옥타브에 있는 모든 에너지 — 목소리의 공기감, 치찰음, 심벌 가장자리의 밝기 — 는 디코더가 그럴듯한 사전 정보(prior)에서 생성한 것이지, 복제한 화자로부터 이어받은 것이 아니다. 대부분의 내레이션 및 에이전트 작업에서는 이것이 드러나지 않거나 오히려 개선으로 작용하는데, 잘 학습된 사전 정보가 고정된 8kHz 셸프보다 낫기 때문이다. 특정 녹음된 목소리에 대한 충실도가 핵심인 업무를 하는 사람에게는, 이것은 설계 시 감안해야 할 사실이며, 노트북 스피커로 하는 청취 테스트로는 드러나지 않는 사실이다.

이 논문의 근거는 이 보고서에서 가장 설득력 있는 엔지니어링 논거이며, 마케팅이 아니므로 다시 언급할 가치가 있다. 인코더를 16kHz로 유지하면 OpenBMB가 원래 VoxCPM 16kHz 훈련 코퍼스를 통째로 재사용할 수 있고, 서로 다른 샘플 레이트로 녹음된 소스 간의 잠재적 불일치를 제거하며, 더 높은 입력 레이트가 자기회귀 루프에 강제했을 시퀀스 길이 폭증을 피할 수 있다. 디코더만 끌어올리면 모델에서 비용이 많이 드는 부분에 비용을 지불하지 않고 출력 충실도를 얻는다. 이는 의도적으로 이루어진 좋은 트레이드오프다. 또한 이는 VoxCPM1.5 사용자가 44.1kHz 인코더에서 16kHz 인코더로 이동한다는 뜻이기도 하다. 출력 측 업그레이드에 끼워 팔리는 입력 측 다운그레이드인 셈이다. OpenBMB 자체의 재구성 표가 그 형태를 보여준다. VoxCPM1.5의 코덱은 세 세대 중 최고의 풀밴드 멜 거리인 1.139(AudioVAE V2의 1.335 대비)를 여전히 기록하는데, 이는 높은 샘플 레이트로 재구성하는 대신 기본적으로 높은 샘플 레이트에서 작동하기 때문이다.

OpenBMB의 스코어보드를 OpenBMB가 작성한 방식으로 읽기

경쟁적이지만 최고는 아니다

표준 제로샷 음성 복제 벤치마크인 Seed-TTS-Eval에서 VoxCPM2는 영어 세트에서 75.3%의 화자 유사도와 함께 1.84%의 단어 오류율을, 중국어에서는 79.5%의 유사도와 함께 0.97%의 문자 오류율을, 그리고 고난도 중국어 하위 집합에서는 75.3%의 유사도와 함께 8.13%의 CER을 보고했습니다. 논문이 이를 두고 직접 사용한 표현은 '경쟁력 있는(competitive)'이며, 표는 회자되는 더 강한 표현들보다 논문의 표현을 뒷받침합니다.

VoxCPM2-3

같은 표의 오픈소스 시스템 중에서 Fish Audio S2는 세 하위 집합 모두에서 더 나은 오류율(0.99 / 0.54 / 5.99)을 보인다. Qwen3-TTS는 영어 WER에서 1.23으로 이를 능가한다. 그리고 LongCat-Audio-DiT는 6개 셀 중 5개에서 완전히 압도한다 — 영어에서 WER 1.50 및 유사도 78.6, 중국어에서 유사도 81.8, 어려운 중국어에서 CER 6.04 및 유사도 79.7. VoxCPM2가 두드러지는 부분은 균형이다: 유사도에서 최상위권이면서 명료성도 준수한 몇 안 되는 시스템 중 하나이며, 목록에서 자연어 음성 설계를 지원하는 유일한 시스템이기도 하다. 하지만 "최첨단"이라는 표현은 자체 헤드라인 표가 보여주는 바가 아니며, 솔직히 말하자면 이는 벤치마크 선두주자가 아니라 강력한 범용 시스템이다.

파라미터가 3.3배가 되었지만 명료도는 거의 향상되지 않았다.

그 표에서 가장 유용한 행은 아무도 인용하지 않는 행이다. VoxCPM-0.5B, 2025년 9월의 0.6B 1세대는 영어 WER 1.85%, 중국어 CER 0.93%를 기록한다. VoxCPM2는 2B에서 1.84%와 0.97%를 기록한다. 영어에서는 노이즈 범위 내이고, 중국어에서는 약간 더 나쁘다.

추가 매개변수가 실제로 가져다준 결과는 유사도 열에서만 볼 수 있고 그 외에는 어디에도 나타나지 않는다. 영어 SIM은 72.9에서 75.3으로, 중국어는 77.2에서 79.5로 상승했다. 2B가 가져온 그 밖의 모든 것은 이 벤치마크와 완전히 무관하다. 언어 28개 추가, 텍스트 설명으로부터의 음성 디자인, 스타일 제어 가능한 복제, 48kHz 출력 등이다. 이는 많은 것이며 업그레이드의 정직한 근거다. 하지만 작업 부하가 영어 또는 중국어 복제이고 오류율로 선택한다면, VoxCPM2는 0.6B 모델이 이미 제공하던 것을 넘어서는 아무것도 주지 않으면서 가중치는 3배, 지연 시간은 2배다. 흥미롭게도 VoxCPM1.5는 이 벤치마크에서 세 모델 중 최악(2.12 / 1.18)이다. 그 때문에 이 제품군의 발전은 사다리 같기보다는 서로 다른 세 제품처럼 보인다.

하나의 모델, 두 가지 평가, 열 배의 차이

바로 여기서 주의가 필요한데, 그 이유는 이 보고서의 두 다국어 결과가 격렬하게 상충하고, 둘 다 마치 그 문제를 해결하는 것처럼 인용되기 때문이다.

핵심 수치는 30개 언어에 걸친 평균 오류율 1.68%입니다. 이는 OpenBMB가 자체 구축한 테스트 세트(언어당 500개 발화)를 Gemini 3.1 Flash Lite를 인식기로 사용하여 평가한 결과입니다. 해당 테스트 세트에서 VoxCPM2는 영어 0.42, 중국어 0.92, 힌디어 0.79, 아랍어 1.23을 기록했습니다.

이 보고서는 또한 MiniMax-MLS-Test를 실행하는데, 이는 Whisper-large-v3로 평가된 제3자 24개 언어 세트입니다. 동일한 모델입니다. 거기서 VoxCPM2는 힌디어 19.70, 아랍어 13.05를 기록했습니다 — 공식적으로 지원하는 언어에서 자체 벤치마크가 제시하는 수치보다 각각 25배, 10배 더 나쁜 결과입니다. 또한 해당 열에는 광둥어 38.58, 체코어 24.13, 루마니아어 21.58, 우크라이나어 6.32가 있습니다.

이 중 대부분을 조정해 주는 세 가지가 있는데, 이를 구분해서 볼 가치가 있는 이유는 널리 공유된 이 이야기의 버전이 그것들을 잘못 알고 있기 때문입니다:

체코어, 루마니아어, 우크라이나어는 지원 언어가 아닙니다. 저장소의 자체 언어 태그를 확인해 보세요. 30개의 코드가 있는데 그중 어느 것도 cs, ro, uk가 아닙니다. VoxCPM2의 체코어 WER 24%를 비판하는 것은, 이 모델이 결코 지원한다고 주장한 적 없는 언어를 비판하는 것입니다. 광둥어는 "9개 중국어 방언"에 속할 가능성이 있지만, 해당 열의 모든 시스템이 광둥어에서 30% 이상의 WER을 기록하고 있는데, 이는 어떤 모델의 문제라기보다 인식기 자체의 문제를 가리킵니다.

아랍어와 힌디어가 지원되며, 이것이 실제 발견입니다.이 두 언어는 OpenBMB가 지원을 주장하는 언어들이며, 이에 대한 두 평가 결과는 약 10배가량 차이가 납니다. 논문 자체의 설명은 이 언어들이 학습 코퍼스에서 "상대적으로 제한된 데이터 양"을 가지며 "더 높은 WER의 일부는 인식기의 제한된 정확도에서 비롯될 수 있다"는 것입니다. 타당한 가설이지만 검증되지 않은 가설입니다. 아랍어나 힌디어 음성 인식을 출시할 예정이라면, 이 모델의 공개된 수치 범위는 0.79%~19.70%이며 어느 끝값도 독립적으로 검증되지 않았습니다. 직접 측정하는 데 하루를 투자하세요. 어느 숫자에도 기대지 마십시오.

지표는 단위조차 동일하지 않습니다.힌디어는 내부 세트에서는 문자 오류율로, MiniMax-MLS에서는 단어 오류율로 평가됩니다. 이는 비교 가능한 수치가 아니므로, 25배 차이가 명확한 비판 근거가 될 수 없는 또 하나의 이유이며, 1.68% 평균을 동등 조건의 점수로 읽어서는 안 되는 또 하나의 이유이기도 합니다.

이 모델을 다루는 보도에서 가장 많은 수치적 역할을 하는 주장에도 동일한 주의가 적용된다: VoxCPM2가 화자 유사도에서 ElevenLabs를 능가하며, 영어에서 85.4% 대 61.3%를 기록하고 24개 언어 중 22개 언어에서 이겼다는 주장 말이다. 그것은 실제로 표가 말하는 바다. 또한 이 표는 논문이 이전에 보고된 결과를 부분적으로 조합한 것이며, ElevenLabs의 명료도 열에는 태국어 73.94%, 베트남어 73.42%, 중국어 16.03%의 WER이 포함되어 있다. 그것은 제대로 작동하는 상용 제품의 수치가 아니라, 채점 또는 구성 불일치의 특징이다. 한 열에서 그렇게 손상된 표가 다른 열에서 신뢰할 만해지지 않는다. 그 결과가 당신이 읽고 있는 모델에 유리하다는 이유만으로는.

하나의 백본에서 나오는 다섯 가지 모드 — 그리고 당신의 수치를 움직이는 레시피

아키텍처에서 가장 깔끔한 아이디어는 VoxCPM2가 기능별로 별도의 모델이나 헤드를 갖지 않는다는 점입니다. 다섯 가지 모드는 모두 동일한 파라미터를 공유하며 입력 시퀀스만 다르게 배열됩니다. 그래서 단일 2B 체크포인트 하나로 평소에는 소규모 모델 군단이 필요한 작업을 처리할 수 있습니다:

Basic TTS — 텍스트 입력, 오디오 출력.

음성 디자인 — 괄호로 묶인 설명이 텍스트 앞에 덧붙여질 뿐이므로, "(피곤한 중년 남성, 쉰 목소리, 천천히 말함)"과 대사 자체가 추가 모듈 없이 동일한 언어 모델을 통과합니다. 참조 오디오가 전혀 필요 없습니다.

레퍼런스 클로닝 — 단일 레퍼런스 클립이 화자 정체성을 결정하며, 전사가 필요하지 않습니다.

제어 가능한 복제 — 기준 클립과 스타일 설명을 사용해 음성을 복제한 다음, 다급하거나 즐거운 말투로 말하도록 요청할 수 있습니다.

연속 복제 — 트랜스크립트와 짝을 이루는 참조 클립으로, 모델이 이어서 생성하는 오디오 프리픽스로 처리되며 가장 높은 충실도를 제공하는 모드입니다.

보고서에 묻혀 있는, 대부분의 리뷰가 건너뛰는 조절 장치가 하나 있다. 그리고 바로 그것이 결과를 가장 크게 바꿀 가능성이 높다. 두 가지 조건화 경로, 즉 isolated reference와 continuation prefix는 개별적으로 또는 함께 사용할 수 있으며, 서로 상충 관계에 있다. OpenBMB의 자체 ablation 실험에서 둘을 함께 사용하면 모든 하위 집합에서 최상의 화자 유사도를 얻을 수 있었다. continuation prefix를 제거하고 isolated reference만 전달하면 어려운 중국어 텍스트에서 최상의 명료도를 보였는데, CER이 7.44% 대신 6.85%로 나타나는 대신 유사도는 약 5포인트 낮아졌다. 논문의 설명은 타당하다. 운율을 고정하는 시간적 오디오 접두사가 없으면, 모델은 어려운 텍스트를 소화할 수 있는 전달 방식을 선택할 자유가 더 커지기 때문이다.

그러므로 기본값은 선택이지 상한선이 아닙니다. 음성 매칭 작업에는 두 경로가 모두 필요하고, 어렵거나 특이한 텍스트에는 참조 전용이 필요합니다. 솔직히 인정해야 할 옥에 티가 하나 있습니다. 그 절제 표의 절대 수치들은, 논문이 전체 과정에서 사용했다고 밝힌 레시피에 대한 주요 표의 수치와 맞아떨어지지 않습니다. 프리프린트에서 이는 불순한 의도라기보다는 기록상의 실수일 가능성이 높지만, 그렇다고 해도 여기 있는 모든 숫자를 인용할 값이 아니라 검증할 방향으로 봐야 한다는 세 번째 이유가 됩니다.

음성 디자인: 자연스럽기보다 순종적이다.

음성 설계는 이번 릴리스를 단순한 점진적 개선이 아닌 흥미로운 버전으로 만드는 기능이며, 공급업체의 자체 수치가 실제 트레이드오프를 가장 잘 보여주는 부분이기도 하다.

InstructTTSEval에서 VoxCPM2는 영어 기준 음향 매개변수 지정 84.2점, 서술형 스타일 지시 83.2점, 롤플레이 71.4점을 기록했는데, 마지막 수치는 표에서 가장 높은 점수로 Qwen3-TTS-1.7B-VD의 68.4점과 Gemini-TTS-Pro의 67.2점을 앞섭니다. 중국어에서는 성적이 더 약하며 순서가 뒤바뀝니다: 85.2 / 71.5 / 60.8로, Gemini-TTS-Pro의 89.0 / 90.1 / 75.5에 대비됩니다. 따라서 내세울 수 있는 가장 강력한 주장은 VoxCPM2가 영어 롤플레이에서 선두를 차지하지만, 지시 따르기 측면에서는 거의 모든 다른 부문에서 폐쇄형 최첨단 시스템에 뒤처진다는 것입니다.

인간 청취 패널 — 보고서에 따르면 50명의 청취자, 무작위 배정 및 이중 맹검 — 그것을 더욱 선명하게 한다. 제어 가능한 생성에서 VoxCPM2는 지시 따르기에서 4.50을 기록해 Qwen3-TTS-VD의 4.41을 앞서고, 자연스러움에서는 4.48 대 4.61로 뒤진다. 일반적인 제로샷 복제에서는 화자 유사성에서 승리하며(4.74 대 4.69), 자연스러움에서는 비기거나 다소 뒤진다(4.78 대 Qwen3-TTS의 4.80, 신뢰 구간 중첩).

계획을 세우기에 충분히 일관된 패턴이 있습니다: VoxCPM2는 시키는 대로 수행하며 그 과정에서 다소 인간미가 덜 느껴지고, Qwen3-TTS는 소리는 약간 더 좋지만 지시를 따르는 정도는 약간 떨어집니다. 어느 쪽이 옳은지는 전적으로 제품의 가치가 정밀한 제어에 있는지, 아니면 수월한 전달에 있는지에 달려 있습니다. OpenBMB는 자체 제한 사항에서 그 귀결을 명시하는데, 이는 공급업체들이 보통 빼놓는 종류의 것입니다: 음성 디자인과 제어 가능한 클로닝은 "실행 간에 변동되는 결과를 생성할 수 있으며," 원하는 음성을 얻으려면 여러 번의 시도가 필요할 수 있습니다. 파이프라인에 재시도 로직을 구축하고, 음성이 중요하다면 사람의 청취 검수 단계를 추가하세요.

운영하는 데 드는 비용, 그리고 언제 임대하는 것이 올바른 선택인지

어디에도 호스팅된 VoxCPM2는 없습니다. Hugging Face 자체 사이드바에도 분명히 나와 있습니다 — "이 모델은 어떤 Inference Provider로도 배포되어 있지 않습니다" — 그리고 여기에는 우리도 포함됩니다. OrcaRouter는 VoxCPM2를 서비스하지 않으며, 아무리 바란다고 해서 달라지지 않습니다. 추론 파트너가 없는 2B TTS 모델은 직접 호스팅해야 하는 가중치이거나 아무것도 아닙니다.

이는 비용 문제를 GPU 문제로 만들며, 계산은 깔끔합니다. 단일 RTX 4090에서 Nano-vLLM의 실시간 계수(RTF)가 0.13일 때, GPU 1시간당 약 7.7시간 분량의 오디오가 생성되므로, 오디오 1시간당 비용은 24GB 카드 한 개의 시간당 요금을 약 7.7로 나눈 값입니다. 일반 PyTorch에서는 RTF 0.30에서 GPU 1시간당 약 3.3시간 분량의 오디오로 줄어듭니다. 두 수치 모두 OpenBMB의 것으로, 자사 하드웨어와 자사 텍스트로 측정된 값이며, 여러분의 환경에서는 달라질 수 있습니다. 배치 크기, 텍스트 난이도, 품질 게이트가 강제하는 재시도 횟수는 모두 RTF 수치에 포함되지 않는 배수 요인입니다. 사람들이 잊는 것은 재시도 비율입니다. 벤더가 목표 음성을 얻기 위해 여러 번 시도가 필요할 수 있다고 말하는 모델은 RTF가 암시하는 수준의 비용이 들지 않습니다.

VoxCPM2-4

이 시점에서 사람들이 원하는 비교는 임대형 API와의 비교이며, 솔직한 답은 둘 사이에 깔끔한 변환이 존재하지 않는다는 것입니다.openai/tts-1-hd는 입력 및 출력 토큰 100만 개당 30달러로 청구됩니다. 즉, OrcaRouter는 공급업체 정가를 그대로 전달하며, 저희는 마크업을 0% 적용하므로 모델 페이지에 표시된 숫자는 OpenAI가 청구하는 숫자와 같습니다. 하지만 토큰은 초가 아니며, 게시된 어떤 요율도 토큰과 초를 서로 변환할 만큼 신뢰할 수 없어 스프레드시트를 만들 수 없습니다. 자체 호스팅 오픈 웨이트 TTS 모델과 토큰 과금 API 사이의 깔끔한 시간당 비교를 보여 주는 사람은, 자신이 보여 주지 않은 가정을 한 것입니다.

말할 가치가 있는 것은 아키텍처상 그 경계선이 어디에 그어지느냐이다. VoxCPM2를 자체 호스팅하는 것이 합리적인 경우는 {{1}}특정 복제 음성이 필요하거나, 오디오 처리량이 GPU를 계속 바쁘게 유지할 만큼 꾸준하거나, 데이터가 인프라 밖으로 나갈 수 없거나, 그것을 LoRA 파인튜닝하려는 때{{/1}}이다 — 그리고 그것은 5~10분 분량의 대상 오디오만으로도 지원되는데, 이는 정말 저렴하다. 렌탈이 합리적인 경우는 {{2}}처리량이 들쭉날쭉하거나, GPU를 운영할 인력을 둘 수 없거나, 음성이 대체 가능할 때{{/2}}이다. 대부분의 실제 음성 제품은 하나가 아니라 두 개의 시스템이다: 합성 레이어와 머릿속에서 추론을 수행하는 언어 모델. 추론 절반은 공급업체 간 자동 장애 조치와 함께 하나의 키 뒤에 두는 것이 가치 있는 부분이며, 그래서 모델 교체가 조달 사이클이 아니라 문자열 변경이 된다; 그것이 바로 OrcaRouter가 200개 이상의 모델을 대상으로 설계된 형태다. 합성 절반은, 당신이 소유하고 파인튜닝하는 특정 음성이라면, 당신의 자체 하드웨어에 속한다. VoxCPM2는 바로 그 두 번째 범주에 속하며, 아무도 그것을 서비스하지 않는다는 사실은 그것이 무엇인지의 결과이지 간과가 아니다.

OpenBMB가 기대하지 말라고 말하는 것

제한 사항 섹션은 이토록 큰 반향을 일으키는 릴리스치고는 이례적으로 솔직하며, 진지하게 받아들일 수 있을 만큼 짧습니다:

복제 품질은 오용 표면입니다. 카드에 직접 명시되어 있습니다: 이 모델은 사칭과 사기에 사용될 만큼 현실적인 음성을 생성하며, AI 생성 오디오에는 라벨을 붙여야 합니다. Apache-2.0은 이에 대해 전혀 제한을 두지 않습니다 — 경쟁하는 여러 오픈 가중치 음성 모델의 라이선스와 달리, 숨을 수 있는 허용 사용 조항이 없습니다. 동의 및 공개 정책은 스스로 작성해야 할 몫입니다.

실행 간 변동성은 예상됩니다 (두 제어 기능에서 발생하는 것으로, 버그로 보고할 사항이 아닙니다).

30개 언어가 실제 경계입니다. 그 외의 것은 작동할 수도 있지만 테스트되지 않았습니다. 미세 조정이 필요할 것으로 예상하세요.

스타일 제어의 일관성은 아직 개발 중인 것으로 설명됩니다, 이를 구축한 사람들에 따르면.

그리고 카드가 명명하지 않는 격차들: 훈련 코퍼스 공개가 전혀 없어서, 가중치에 대한 Apache-2.0 라이선스는 코드 문제를 해결할 뿐 데이터 출처에 대해서는 아무것도 해결하지 못한다. 이 글에 있는 어떤 수치에 대한 독립적 평가도 없다. 밀리초 단위로 게시된 지연 시간이 없다 — RTF는 처리량 비율일 뿐이며, 음성 에이전트는 첫 오디오까지의 시간에 따라 성패가 갈리는데, 그 시간은 보고서 어디에도 나타나지 않는다.

모델 카드가 해결하지 못하는 세 가지 질문

VoxCPM1.5 또는 VoxCPM-0.5B에서 옮겨야 할까요?

새로운 기능을 위해서만, 그리고 측정을 거친 후에만. 중국어와 영어 외의 언어, 음성 디자인, 또는 스타일 제어 가능한 복제가 필요하다면, 업그레이드가 바로 핵심이며 이 제품군 내에는 대안이 없습니다. 현재 영어 또는 중국어 복제를 실행 중이고 만족하고 있다면, 그 명분은 표면상 약합니다. 동일한 벤치마크에서 VoxCPM-0.5B가 오류율에서 VoxCPM2와 일치하는 것으로 나타나며, 약 2.4포인트의 화자 유사도를 위해 두 배의 지연 시간과 1/3 더 많은 VRAM을 지불하게 되기 때문입니다. 또한 놓치기 쉬운 마이그레이션 세부 사항이 있습니다. VoxCPM1.5에 44.1kHz 참조 오디오를 공급하고 있었다면, VoxCPM2의 인코더는 16kHz를 사용하므로 참조 파이프라인이 변경되고 소스 자료의 상위 부분은 더 이상 중요하지 않게 됩니다.

실제로 이걸로 상용 음성 제품을 출시할 수 있나요?

법적으로 이 라이선스는 {{1}}이보다 더 허용적일 수 없을 정도다: Apache-2.0, 게이트 없음, 사용 제한 없음, 상업적 사용 명시적 허용, 가중치와 파인튜닝 코드 모두 포함{{/1}}. 핵심 질문은 라이선스 문구가 아니라 그 뒤에 빠져 있는 것이다. OpenBMB는 훈련 코퍼스를 공개하지 않으므로, 200만 시간 안에 누구의 목소리가 들어 있는지 아무도 말해 줄 수 없다. 특정 인물의 목소리를 재현하는 것을 대표 기능으로 하는 모델에게 이는 모델 카드가 아니라 변호사에게 물어야 할 문제이며, 현재 모든 오픈 가중치 음성 모델이 회피하는 바로 그 질문이다. 실질적으로 더 큰 걸림돌은 운영상의 문제다: {{2}}아직 네이티브 Transformers 클래스가 없고, 어디에도 호스팅 엔드포인트가 없으며, 제어 기능의 실행 간 변동성이 있고, 대화형 서비스를 구축한다면 첫 오디오까지의 시간 수치도 없다{{/2}}.

유료 TTS 공급업체를 대체할 만큼 충분히 좋은가요?

영어와 중국어 내레이션, 사전 녹음된 콘텐츠, 그리고 특정 음성을 지정하고 작업을 일괄 처리할 수 있는 모든 워크로드라면: 이용 가능한 증거에 따르면 그렇습니다. 게다가 라이선스 덕분에 시도해 보는 것이 거의 무료입니다. 실시간 대화형 에이전트의 경우: 결정을 내리기 전에 직접 time-to-first-audio를 측정하세요. 아직 아무도 그 수치를 공개하지 않았으며 RTF는 그것을 알려주지 않기 때문입니다. 아랍어, 힌디어, 또는 롱테일에 속한 모든 언어의 경우: 공급업체 자체의 두 평가가 한 자릿수(열 배) 수준으로 차이가 나므로, 어떤 숫자가 인용된 것을 봤든 해당 언어에서는 그 모델을 검증되지 않은 것으로 취급하세요. 그리고 오발음이 단순한 짜증이 아니라 비즈니스 사고가 되는 모든 경우에는, VoxCPM2가 자체 표에서조차 명료도 부문 선두가 아니라는 점에 유의하세요. Fish Audio S2와 LongCat-Audio-DiT가 그 부문에서 앞서 있으며, 이들 역시 오픈 가중치 모델입니다.

볼 것

서로 다른 시점에 있는 두 가지가 있습니다. 가까운 쪽은 PR #47756과 그 아래의 MiniCPM4 PR입니다. 이것들이 병합된다면 VoxCPM2는 AutoModel 호출이 되어, Transformers에 표준화된 모든 이의 통합 비용은 하룻밤 사이에 거의 0으로 떨어집니다. 매달 900,282건의 다운로드가 이미 어려운 방식으로 이루어지고 있다는 점을 고려하면, 이는 의미 있는 돌파구입니다. 만약 이것들이 지연된다면, 그 팀들에게 주어지는 답은 여전히 "OpenBMB의 패키지나 vLLM-Omni 엔드포인트를 사용하라"는 것이며, 두 PR을 모두 진행 중인 커뮤니티 기여자가 이를 바꿀 수 있는 영향력은 없습니다.

더 느린 쪽은 OpenBMB 밖에서 누구라도 수치를 발표하는지 여부다. 출시 4개월 후, 월 90만 건의 다운로드와 25개의 파인튠, 그리고 그 위에 구축된 100개 이상의 Spaces가 있는데도, 유통되는 모든 성능 수치는 여전히 모델을 훈련시킨 사람들이 작성한 단 하나의 기술 보고서로 거슬러 올라간다. 이것은 OpenBMB에 대한 비난이 아니다. 그들은 대부분보다 더 철저하고 정직하게 작업을 문서화했으며, 그 보고서는 자체적으로 인식기 선택, 데이터 규모의 약점, 그리고 자신의 불안정성을 자진해서 공개한다. 이것은 우리 나머지에 대한 비난이다. 오픈소스 음성 커뮤니티의 누군가가 이번 달에 발표할 수 있는 가장 가치 있는 단 하나의 것은 동일한 조건에서 VoxCPM2, Qwen3-TTS, Fish Audio S2, LongCat-Audio-DiT를 Whisper로 채점한 Seed-TTS-Eval 및 MiniMax-MLS 실행이다. 그것이 존재하기 전까지, VoxCPM2에 대한 공정한 요약은 그것이 누군가가 출시한 체크포인트당 가장 뛰어난 오픈 가중치 음성 모델이며, 가장 정확한 모델은 아니며, 그 문장의 양쪽 절반 모두 공급업체의 말에 의존한다는 것이다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube