'Gemini 3.8 TTS vs VoxCPM2'용으로 생성된 히어로 카드로, 흰색 배경에 부드러운 파란색과 청록색 그라데이션 악센트가 들어가 있다. 왼쪽 카드 'Gemini 3.8 Flash TTS'에는 API 엔드포인트, Elo 1,260(2위), 정규화 기준 100만 자당 $16.50이 나열되어 있다. 오른쪽 카드 'VoxCPM2'에는 Apache 2.0, 20억 개 파라미터, 실행에 약 8GB VRAM, 일반 PyTorch에서 실시간 계수 0.30, 호스팅된 엔드포인트 없음이 나열되어 있다. 하단 문구는 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026; VoxCPM2 figures per its model card.'라고 적혀 있다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2: 목소리를 빌릴 것인가, 직접 운영할 것인가 — 실제 수치로 보기

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

리더보드에는 Gemini 3.8 Flash TTSVoxCPM2를 나란히 배치한 행이 없으며, 그 부재가 이 비교에서 가장 유용한 사실입니다. Gemini 3.8 Flash TTS는 Artificial Analysis Provider Voice Arena에서 Elo 1,260으로 2위인 호스팅 엔드포인트이며, 토큰 단위의 공개 요금표가 있습니다. VoxCPM2는 OpenBMB 체크포인트로, 20억 개 파라미터, Apache 2.0, 2026년 4월에 출시되었으며, 어떤 추론 제공업체도 호스팅하지 않습니다. 대여할 수 없습니다. 직접 실행해야 합니다.

그러니까 문제는 어느 모델이 더 좋게 들리는가가 아니다. 문제는 당신의 워크로드에 더 적합한 것이 다른 사람의 GPU를 문자당 비용을 내고 쓰는 것인지, 아니면 GPU를 소유하고 작동 여부와 상관없이 비용을 내는 것인지이다. 그것은 산수 문제이며, 대부분의 모델 비교와 달리 결정을 내리기 전에 계산해 볼 수 있는 답이 있다.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

이 중 하나는 임대하고, 다른 하나는 직접 운영합니다.

각각이 실제로 당신에게 건네주는 것부터 시작하세요.

• 접근 — Gemini 3.8 Flash TTS는 API 전용이며, Gemini API와 2026년 9월 23일 발표에서 명시된 Google 접점을 통해 호출됩니다. VoxCPM2는 프로덕션에서 사용되는 자사 엔드포인트가 없고, 이를 서빙하는 추론 제공자도 없습니다. 체크포인트가 곧 제품입니다.

• 라이선스 — VoxCPM2는 Apache 2.0으로 배포되며, 별도의 계약 없이 상업적 사용을 허용합니다. 이는 진정으로 관대한 라이선스이며, 오픈 음성 가중치의 기본값이 아닙니다. 그러한 가중치 중 여럿은 연구 전용 조건으로 배포되어 상업적 사용을 호스팅 API를 거치도록 되돌려 놓습니다.

• 크기 — VoxCPM2는 20억 개 파라미터이며, 개발용으로는 정밀도를 낮춘 상태에서 약 8GB의 VRAM에 들어가고, 24GB 카드에서는 서빙 시 최대 약 22GB를 사용합니다. Google은 Gemini 3.8 TTS 모델 두 가지 중 어느 것에 대해서도 파라미터 수를 공개하지 않았습니다.

• 음성 생성 — Gemini 3.8 Flash TTS는 작성된 설명으로 음성 디자인을 하고, 30초 샘플로 음성 복제를 하며, 한 번의 호출로 두 화자 대화를 수행합니다. VoxCPM2는 단일 음성 텍스트 음성 변환 모델이며, 대화는 두 번의 실행을 이어 붙인 것입니다.

• 독립 점수 — Flash TTS에는 있습니다. VoxCPM2는 2026년 9월 24일에 캡처된 Provider Voice Arena의 순위가 매겨진 행들 가운데 나타나지 않습니다. 보드에 없다고 해서 품질에 대한 평결은 아닙니다 — 보통 아무도 그 모델을 등록하지 않았다는 뜻이지만 — 고려할 제3자 선호도 수치가 없다는 뜻이기는 합니다.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

그 마지막 요점은 양쪽 모두에 해당하며, 얼버무리기보다 분명히 말할 가치가 있습니다: 커밋하기 전에 독립적인 품질 신호가 필요하다면, 이 둘 중 하나만이 그런 신호를 제공합니다.

결정하는 숫자: 실시간 팩터

음성 모델을 자체 호스팅하면 문자당 청구서가 GPU 시간당 청구서로 바뀌는데, 이 두 단위 사이의 환율은 모델의 실시간 팩터, 즉 1초의 오디오를 생성하는 데 몇 초의 연산이 필요한지를 나타냅니다.

VoxCPM2의 공개 수치는 일반 PyTorch에서 0.30이고 Nano-VLLM에서는 0.13입니다. 이는 레이턴시가 아니라 처리량으로 읽어야 합니다. 0.13에서는 실제 시간 기준 GPU 1시간이면 약 7.7시간 분량의 완성된 오디오가 나옵니다. 0.30에서는 동일한 GPU 1시간으로 3.3시간에 더 가까운 분량이 나옵니다. 이는 OpenBMB가 측정한 모델 카드 자체의 수치이며, 여기서 자체 구축 대 구매를 결정할 때 가장 중요한 단일 입력값입니다.

그것들로부터 세 가지가 따른다.

• 서빙 스택이 모델보다 더 중요합니다. 일반 PyTorch에서 Nano-VLLM으로 전환하면 동일한 하드웨어에서 처리량이 두 배 이상 증가합니다. 0.30 수치를 기반으로 구축된 모든 비용 모델은 자체 호스팅 비용을 약 2.3배 과대평가합니다.

• 가동률이 전부다. 시간의 90% 동안 유휴 상태인 임대 GPU는 어떤 가격이라도 API보다 저렴하지 않다. 손익분기점은 카드를 계속 바쁘게 유지할 때에만 나타난다.

• 배치 처리는 계산 구도를 다시 바꿔 놓는다. 실시간 계수는 스트림 단위로 측정되는데, 동시 요청을 처리하는 서버는 고정 비용을 여러 요청에 분산시키며, 이는 바로 셀프 호스팅이 승리하기 시작하는 영역이다.

오디오 1시간의 비용은 양방향 모두 얼마인가

두 가지 과금 모델을 같은 축에 놓아 보자. 완성된 오디오 1시간은 출력 3,600초에 해당한다.

임대 측에서는 Google이 문자 대신 토큰으로 청구합니다: 2026년 12월 31일까지 입력 텍스트 토큰 백만 개당 $0.50, 출력 오디오 토큰 백만 개당 $9.00, 이후 $18.00; Flash-Lite TTS는 $0.50 및 $6.00, 이후 $12.00입니다. Batch와 Flex는 Flash TTS의 경우 $0.25와 $4.50, Flash-Lite TTS의 경우 $0.25와 $3.00이며, Priority는 $0.90와 $16.00입니다. Artificial Analysis는 표준 요금을 백만 문자당 $16.50 및 $11.00으로 정규화하는데, 이는 Google의 견적이 아닌 보드의 변환이며, 문자로 청구하는 모델과 비교할 때 사용해야 하는 수치입니다.

자체 운영 측면에서는 문자당 요율이 전혀 없습니다. 비용은 GPU-시간에 위 처리량으로 필요한 시간을 곱한 값, 서빙 스택, 그리고 이를 계속 운영하는 인력 비용을 더한 것입니다. VoxCPM2의 장점은 1000번째 시간의 한계 비용이 첫 시간과 같다는 점이고, 단점은 첫 시간의 한계 비용이 GPU 하나라는 점입니다.

그렇기 때문에 그 결정은 유난히 명쾌하다:

• 일정 사용량 이하에서는 API가 압도적으로 이깁니다. 자본 비용 대비 오디오 1시간당 한 자릿수 달러를 지불하고 있으며, 2027년 1월 1일까지는 Google 프로모션 요금이 그 격차를 더 벌립니다.

• 그 규모를 넘어서면, 이미 보유했고 계속 바쁘게 돌릴 수 있는 하드웨어에서 Apache 2.0 체크포인트가 결정적으로 우세합니다. 그리고 연구용 라이선스가 적용된 체크포인트와 달리, 그 라이선스 때문에 이를 출시하는 데 막히는 것은 전혀 없습니다.

• 그 사이에서 솔직히 말하면, 당신이 사는 것은 절감이 아니라 선택권입니다. 셀프 호스팅은 버전을 고정하고, 오디오를 자체 인프라에 보관하며, 공급업체의 요금 변경에 신경 쓰지 않을 수 있는 능력을 사는 것입니다.

각각이 정답인 경우

더 잘 문서화된 제품을 원한다면 Gemini 3.8 Flash TTS를 선택하세요. 이 제품은 독립적인 점수, 공개된 가격, 단일 호출에서의 2인 대화, 음성 디자인 및 복제 기능을 갖추고 있으며, API 키 외에는 운영상의 표면이 없습니다. 자매 모델인 Flash-Lite TTS는 동일한 인터페이스 안에서 정규화된 백만 문자당 $11.00라는 두 번째 가격대를 제공합니다. 그 대가로 받아들이는 것은 2027년 1월 1일에 두 배가 되는 요금과 어디에서든 모델을 실행할 수 없다는 점입니다.

운영 작업 자체가 핵심일 때는 VoxCPM2를 선택하세요. Apache 2.0은 상업적 사용을 곧바로 허용한다는 뜻이고, 2B 크기는 가속기 한 대면 충분하다는 뜻이며, Nano-VLLM에서의 0.13 실시간 계수는 보급형 카드로도 실제 시간 1시간당 몇 시간 분량의 오디오를 만들어낸다는 뜻입니다. 감수해야 할 점은 아무도 대신 이것을 운영해 주지 않는다는 것입니다. 호스팅 엔드포인트도, 아레나 순위표 항목도, 공급업체 요금표도 없으며, 얻게 되는 모든 품질 보증은 직접 구축하고 측정해야 하는 것입니다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

두 모델 모두 OrcaRouter가 호스팅하지 않으며, 그렇지 않은 듯 암시하기보다 이를 분명히 말하는 것이 마땅합니다. Gemini 3.8 Flash TTS를 호출할 곳은 Google 자체 API와 Google이 명시한 표면들입니다. VoxCPM2는 직접 배포하는 체크포인트입니다. OrcaRouter가 담당하는 것은 그 결정 위의 계층입니다 — 200개 이상의 모델을 하나의 키로 공급자 정가에 마크업 없이 이용할 수 있으므로, 벤더 가격 변경이 다음 청구 주기가 아니라 같은 날 우리 쪽에 반영되며, 자동 장애 조치 덕분에 평가 중인 모델이 프로덕션 의존성이 될 필요가 없고, 하나의 음성이 전체 작업을 감당하지 못할 때 여러 모델을 하나의 호출로 구성하는 라우팅 DSL도 제공합니다.

다음에 볼 콘텐츠

이 비교를 실질적으로 바꿀 두 가지가 있는데, 둘 다 아직 일어나지 않았습니다.

첫 번째는 누군가 VoxCPM2를 호스팅하는 경우입니다. 이것이 추론 시장에 없다는 점이 두 모델이 품질이 아니라 경제성으로 비교되는 주된 이유입니다 — 한 제공업체가 이를 채택하면 임대 대 소유 계산은 더 이상 결정적 요인이 아니게 되고, 아레나에서 빠진 행이 바로 채워지기를 바라는 항목이 됩니다.

두 번째는 Google 측의 1월 요금 변경입니다. 프로모션 요금에서는 대부분의 워크로드가 무엇이든 자체 호스팅하지 않는 편이 좋을 만큼 API가 저렴합니다; 프로모션 이후 요금에서는 격차가 좁아져, 기존 GPU 용량과 꾸준한 볼륨을 갖춘 팀이라면 API가 여전히 우세하다고 가정하기보다 다시 계산을 해봐야 할 정도가 됩니다.

저 중 하나가 바뀌기 전까지, 결정적인 입력값은 리더보드가 아니다. 그것은 한 달에 몇 시간 분량의 오디오를 제작하는지, 그리고 그 카드가 사용 중인지 여부다.