
Eleven v4 vs VoxCPM2: 순위가 매겨진 모델 대 임대할 수 없는 체크포인트
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 982 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 197 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
이 매치업에서 가장 유용한 사실은 존재하지 않는 행입니다. ElevenLabs Eleven v4는 Artificial Analysis의 Provider Voice Arena에서 1,674회 등장 기준 Elo 1,319로 1위를 차지하고 있으며, 가격은 백만 문자당 $80.00입니다. VoxCPM2는 2026년 4월에 공개된 OpenBMB 체크포인트로, 두 음성 보드 어디에도 나타나지 않습니다 — 순위에 오르지도, 순위 밖으로도, 프리뷰 항목으로도. 그것은 품질에 대한 판정이 아닙니다. 이는 1,319와 비교하고 싶었던 숫자가 무엇이든, 아무도 그것을 산출하지 않았다는 뜻이며, 비교는 선호도가 아닌 다른 무언가를 기준으로 이루어져야 합니다. 남는 것은 소유권, 파인튜닝, 그리고 호스팅된 엔드포인트로는 물어볼 수 없는 라이선스 질문입니다.
각 진영이 실제로 당신에게 건네는 것
이들은 서로 다른 부류의 제품이며, 그 차이는 겉모습에 그치는 것이 아닙니다.
• 접근 방식 — Eleven v4는 ElevenLabs 자체 API를 통해 접속하는 호스팅 엔드포인트이며, 문자당 과금됩니다. VoxCPM2는 Hugging Face의 openbmb/VoxCPM2 체크포인트로, 직접 다운로드해 실행해야 하며 호출할 수 있는 자사 엔드포인트가 없습니다.
• 라이선스 — VoxCPM2는 Apache 2.0으로 제공되며 상업적 사용이 명시적으로 무료입니다. Eleven v4는 상용 API이며 그 약관은 ElevenLabs의 것입니다. 이 차이는 법무 검토에서 파인튜닝, 재배포 또는 가중치 배포가 가능한지 묻는 경우 중요합니다. 체크포인트가 있으면 답은 문서로 적혀 있고 고정되어 있습니다.
• 크기 및 하드웨어 — VoxCPM2는 MiniCPM-4 백본 기반의 2B 파라미터 모델이며, 모델 카드에는 bfloat16 기준 대략 8GB의 VRAM이 필요하다고 명시되어 있고, 최대 시퀀스 길이는 8,192토큰입니다. ElevenLabs는 Eleven v4의 파라미터 수를 공개하지 않으며, 호스팅 모델의 하드웨어 풋프린트는 사용자가 관리할 사항이 아닙니다.
• 출력 체인 — VoxCPM2는 16kHz 기준 오디오를 입력받아 AudioVAE V2의 내장 초해상도를 통해 48kHz로 출력하며, 경로에 외부 업샘플러가 없습니다. 호스티드 TTS는 벤더가 선택한 속도로 스트림을 제공합니다.
• 독립 점수 — Eleven v4에는 그것이 있고, 1위입니다. VoxCPM2에는 없습니다. 부재는 낮은 점수가 아닙니다. 그것은 점수가 매겨지지 않은 모델이며, 두 모델은 마치 두 번째가 숫자인 것처럼 같은 문장에서 언급되어서는 안 됩니다.

누락된 Elo를 대체하는 숫자
선호도를 비교할 수 없다면, 계산할 수 있는 것을 비교하라. 그리고 자체 호스팅 모델의 경우 그것은 처리량이다. VoxCPM2의 모델 카드에는 RTX 4090에서 표준 PyTorch 기준 실시간 계수(real-time factor)가 약 0.30이고, Nano-VLLM에서는 약 0.13으로 낮아진다고 나와 있다. 실시간 계수는 오디오 1초당 계산 시간(초)을 의미하므로, 이 두 수치는 첫 번째 경우 GPU 1시간으로 약 3.3시간의 완성된 음성을 얻고, 두 번째 경우 약 7.7시간을 얻는다는 뜻이다.

두 가지 결과가 곧바로 뒤따른다. 서빙 스택은 모델보다 더 중요하다. 추론 엔진을 바꾸기만 하면 동일한 카드의 동일한 체크포인트가 출력을 두 배 이상으로 늘리므로, 0.30이라는 수치를 사용하는 모든 비용 모델은 자체 호스팅 비용을 약 2.3배 과대평가하고 있는 셈이다. 그리고 활용률이 전부다. 유휴 상태로 놀고 있는 카드는 어떤 가격에서도 문자당 과금 API를 이기지 못한다. API 청구서는 당신이 말하는 양에 따라 커지지만, 카드 청구서는 당신이 언제 구매했는지에 따라 커지기 때문이다.
그래서 이 결정에 대한 정직한 버전은 "어느 쪽이 더 좋게 들리는가"가 아니다. "한 달에 몇 시간 분량의 오디오를 만들며, 하드웨어가 바쁜가"이다. 카드가 계속 로드된 상태로 유지되는 볼륨 아래에서는 API가 이기며, 그 차이는 근소하지 않다. 그 위에서는, 이미 보유한 하드웨어에서, 체크포인트의 천 분의 일 시간당 한계 비용은 첫 시간당 비용과 같다. 그리고 그것은 어떤 요금표도 따라올 수 없는 구조적 이점이다.
호스팅 엔드포인트가 결코 팔지 않는 역량
여기서부터 비교는 더 이상 거울상이 아니다. VoxCPM2가 Eleven v4가 근본적으로 할 수 없는 한 가지를 하기 때문이다: 바로 재학습이 가능하다는 점이다. 모델 카드에는 최소 5~10분의 오디오만으로도 전체 SFT와 LoRA 파인튜닝을 모두 수행할 수 있다고 문서화되어 있으며, 각각에 대한 학습 스크립트와 설정도 제공된다.
그것은 보이스 프로그램의 형태를 바꿉니다. 호스팅 API는 고정된 모델과 벤더가 제공하는 클로닝 기능을 함께 줍니다 — Eleven v4의 경우 즉석 클론을 위한 10초의 참조 오디오이며, 그 위에 프로페셔널 티어가 있습니다. LoRA로 튜닝 가능한 체크포인트는 다른 누구의 데이터도 본 적이 없고 버전별로 동작을 고정할 수 있는 모델을 줍니다. 브랜드 보이스, 규제 도메인, 또는 벤더의 보이스 캐스트가 제대로 다루지 못하는 언어의 경우, 그것은 더 저렴한 해결책이 아니라 다른 범주의 해결책입니다.
그 트레이드오프는 명확하며 짚고 넘어갈 가치가 있습니다: VoxCPM2를 사용하면 제3자가 이 모델을 평가한 적이 없다는 점, 품질 보증은 직접 구축하고 측정해야 하는 것이라는 점, 그리고 8,192토큰 시퀀스 제한과 모델 카드 자체의 경고 — 음성 설계와 스타일 제어는 실행마다 달라지며 1~3회 생성이 권장된다는 — 를 이제 당신의 QA 문제로 받아들이게 됩니다.
Eleven v4가 제공하지만 체크포인트는 할 수 없는 것
반대로, 호스티드 모델의 장점은 스펙 시트가 아니라 릴리스 캘린더에서 드러나는 것들이다.
• 측정된 순위 — 추정치의 근거가 되는 1,674개 표본이 있는 보드에서 1위이며, 그 주위로 대략 ±19포인트의 구간이 있습니다. 그 보드가 무엇을 측정하든, 그것은 두 공급업체 어느 쪽과도 독립적이며 이 비교에서 유일한 제3자 품질 신호입니다.
• 텍스트 내 연기 지시 — 다음과 같은 인라인 오디오 태그: [laughs], [whispers] 및 [said angrily in French accent], 그리고 자연어 전달 프롬프트와 개선된 국제 음성 기호 지원. 자체 호스팅 모델에서 감정 변화를 얻으려면 재생성이나 미세 조정이 필요하지만, 여기서는 대본에 토큰 하나면 됩니다.
• 검증하지 않아도 되는 커버리지 — VoxCPM2의 30개에 맞선 90개 이상의 언어. 단, 해당 체크포인트의 목록은 명시적이고 이름이 붙어 있으며(중국어 방언 포함) 벤더의 "90개 이상"은 목록 없는 숫자에 불과하다는 전제가 따른다.
• 운영할 대상이 없습니다 — GPU도, 서빙 스택도, 버전 드리프트도 없으며, 10월 12일까지는 1,000자당 $0.022의 프로모션 요금이고, 이후 정가는 $0.08입니다.

이들 중 어느 것도 우리 것이 아니며, 바로 그 점이 이 섹션의 핵심입니다.
OrcaRouter는 두 모델 중 어느 것도 호스팅하지 않습니다. 우리 카탈로그에는 ElevenLabs 엔드포인트도, VoxCPM2 엔드포인트도 없습니다. 솔직한 라우팅 답변은 Eleven v4는 ElevenLabs 자체 API를 통해 접근되며, VoxCPM2는 사용자가 자체 하드웨어에 배포하는 것이라는 점입니다. 우리는 비교를 더 깔끔하게 만들기 위해 그렇지 않은 듯이 암시하지 않겠습니다.
단일 키가 실제로 도움이 되는 지점은 결정에 앞선 결정이다. 셀프 호스팅 논의가 제자리걸음하는 이유는 대안이 끝내 평가되지 않기 때문이다. API는 호출 한 번이지만 체크포인트는 서빙 스택이므로, API는 계산이 아니라 기본값으로 이긴다. OrcaRouter의 기여는 그 비교에서 호스팅 쪽을 저렴하게 테스트할 수 있다는 점이다 — 200개 이상의 모델이 하나의 API 키 뒤에 있으며 제공업체 정가를 0% 마크업으로 그대로 전달하므로, 호스팅 옵션은 추정 요율이 아니라 실제 요율로 평가되며, 자동 장애 조치 덕분에 결정을 다 내리기 전에 후보를 라이브 경로에 올려둘 수 있다.
한 번에 결정하는 방법
첫 테이크에서 음성이 좋아야 하고 이번 주 안에 끝내고 싶다면 Eleven v4를 선택하세요. 독립 리더보드 최상위, 문서화된 연출 구문, 이 비교에서 문서화된 언어 수가 가장 많음, 그리고 인프라 제로를 얻습니다. 10월 13일부터 1,000자당 $0.08을 지불하며, 재학습할 수 없고, 버전을 고정할 수 없고, 오디오를 자체 하드웨어에 보관할 수 없다는 점을 받아들여야 합니다.
모델을 반드시 직접 보유해야 한다면 {{1}}VoxCPM2{{/1}}를 선택하세요. {{2}}Apache 2.0{{/2}}, 약 8GB VRAM에서 2B 파라미터, 체인에 업샘플러가 없는 48kHz 출력, 그리고 5~10분 분량의 오디오로 실행되는 파인튜닝 경로 — 이런 것들은 호스팅 엔드포인트가 어떤 가격에도 제공하지 않는 기능이며, 아레나 행이 없다는 점이 그에 대한 대가입니다. 커밋하기 전에 본인 GPU에서 처리량 수치를 직접 돌려보세요. 0.30과 0.13이라는 실시간 계수는 모델 카드 자체의 측정값이며, 당신의 서빙 스택이 이를 정확히 재현하지는 못할 것이기 때문입니다.
그리고 솔직한 답이 월간 오디오 볼륨을 모른다는 것이라면, 바로 그 숫자를 찾아 나서야 합니다. 그 숫자가 이 비교를 좌우합니다. 어느 보드도 알려주지 않습니다.
