
HeyGen Voice, Controlled Voice TTS Arena에서 1위로 데뷔 — 클론 음성에서 Qwen과 ElevenLabs를 제치다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
2026년 10월 9일, Artificial Analysis는 HeyGen Voice를 자사의 Controlled Voice 아레나에 추가했고, 그 모델은 곧바로 그 아레나의 1위에 올랐다. HeyGen Voice는 — HeyGen이 보드에서 평가받은 첫 번째 텍스트 음성 변환 모델로서 — 1,202 Elo를 기록하여, 1,186의 Qwen-Audio-3.1-TTS-Plus와 1,167의 ElevenLabs의 Eleven v4 Turbo를 앞섰다. 사이트의 공개 Provider Voices 보드를 선도하는 Cartesia Sonic 3.6은 여기서 1,143으로 5위에 자리한다. 이는 음성 평가에서 단일 최대 교란 요인을 제거하기 위해 구축된 리더보드에서 나온 진정한 결과이며, 또한 쉽게 과대 해석될 수 있는 매우 특정한 의미를 지닌 결과이기도 하다: HeyGen Voice는 여덟 개의 복제된 참조 음성으로 평가되는 이 아레나에서 최고의 음성이지만, 아직 96개 모델이 있는 보드의 측정된 챔피언은 아니다.
Controlled Voice board가 측정하는 것과 그것이 중요한 이유
Artificial Analysis는 두 개의 음성 보드를 운영하며, 이들은 서로 다른 질문에 답합니다. Provider Voices 아레나는 각 벤더가 자체 네이티브 보이스를 제공할 수 있게 합니다. 즉, 기업이 자신을 대표하기 위해 고르는 세련된 데모 보이스이며, 그 보이스가 얼마나 좋게 들리는지로 모델 순위를 매깁니다. 이 리더보드는 범위가 넓고 성숙합니다. 96개 항목이 있으며, Eleven v4 Turbo가 1,328 Elo로 1위, Cartesia Sonic 3.6이 1,280으로 4위입니다.
Controlled Voice 아레나는 더 좁은, 그리고 제품을 출시하는 누구에게나 더 유용한 일을 합니다. 이곳의 모든 모델은 동일한 여덟 개의 복제 음성 — 미국 4개, 영국 4개 — 으로 음성을 생성하므로, 비교는 "누구의 마케팅용 음성이 더 듣기 좋은가"가 아니라 "각 엔진이 동일한 음성, 동일한 텍스트, 동일한 녹음 조건을 어떻게 처리하는가"입니다. 이는 업계에서 데모 릴이 아니라 엔진 자체를 동등 조건에서 비교하는 테스트에 가장 가까운 것이며, 음성을 복제해 TTS 모델에 넘길 계획이라면 중요한 평가표입니다.
HeyGen Voice가 이제 선두입니다. 격차는 Qwen-Audio-3.1-TTS-Plus보다 16 Elo, Eleven v4 Turbo보다 35 Elo이며, HeyGen 수치에 대해 보고된 95% 신뢰구간은 대략 1,185에서 1,219입니다. 16 Elo는 실질적인 차이지만 거대한 낙차는 아닙니다. 이렇게 밀집한 리더보드에서는 사용 가능과 사용 불가의 차이가 아니라 1위와 2위의 차이입니다.

HeyGen Voice가 아직 순위에 오르지 않은 곳
이 결과에서 정직하게 짚어야 할 점은 HeyGen Voice가 Provider Voices 보드에 전혀 나타나지 않으며, 그 부재가 품질에 대한 신호는 아니라는 것입니다. Artificial Analysis는 모델이 아직 충분한 투표를 확보하지 못해 제외될 수 있다고 언급합니다. 며칠밖에 되지 않은 모델이, 채점 방식이 다른 단일 아레나만을 배경으로 두고 있다면, 더 큰 보드가 요구하는 블라인드 리스너 볼륨을 아직 축적하지 못했을 뿐입니다.
그러니까 2026년 10월 10일 기준으로 올바른 해석은 이렇다: HeyGen Voice는 통제된 복제 음성 비교에서 최상위 음성이지만, 더 넓은 영역과 비교하면 미지수다. 이 수치를 근거로 "세계 최고의 TTS 모델"을 인용하는 사람은, 그 문장이 함축하는 것보다 더 작은 순위표를 인용하고 있는 것이다.

Elo 뒤에 있는 두 숫자
• 통제 음성 Elo — HeyGen Voice: 1,202 (95% CI 대략 1,185–1,219). Qwen-Audio-3.1-TTS-Plus: 1,186. Eleven v4 Turbo: 1,167.
• 프로바이더 보이스 Elo — HeyGen Voice: 목록에 없음(투표 수 부족). Eleven v4 Turbo: 1,328, #1. Sonic 3.6: 1,280, #4.
• 통제된 비교군 내 순위 — HeyGen Voice: 순위가 매겨진 42개 항목 중 1위 (#42는 812점의 OpenVoice v2).
• 아레나 기준 가격 — HeyGen Voice: 100만 자당 $30.00, 아레나가 HeyGen의 크레딧 가격을 자체적으로 환산한 금액. Qwen-Audio-3.1-TTS-Plus: 100만 자당 $19.30. Eleven v4 Turbo: 100만 자당 $40.00.
• Elo 앵커 — OpenAudio S1은 1,000에 고정된 기준점이므로, HeyGen Voice는 앵커보다 202점 높습니다.
• 상위 5위에는 또 누가 있을까 — 1,160점의 Eleven v4와 1,143점의 Sonic 3.6이 선두 주자들 뒤를 이어 상위 5위를 완성합니다.

HeyGen이 실제로 출시한 것
이 항목 뒤에 있는 엔진은 HeyGen의 자체 TTS로, 회사의 v3 API에 노출되어 있습니다. GET /v3/voices 호출은 engine 필터를 받으며, 그 값에는 orca — HeyGen의 자체 음성 엔진 — 와 함께 starfish 그리고 ElevenLabs 음성에 대한 패스스루도 포함됩니다. 음성 렌더링은 POST /v3/voices/speech를 통해 실행됩니다; 요청별 튜닝은 speed는 0.5에서 1.5까지, 그리고 pitch는 −50에서 +50 반음까지이며, BCP-47 locale 힌트를 제공합니다.
카탈로그에는 수십 개 언어에 걸쳐 300개 이상의 사전 제작된 음성이 나열되어 있습니다. 맞춤 음성은 세 가지 형태로 제공됩니다. 최대 1,000자로 제한된 설명에서 최대 세 가지의 순위가 매겨진 옵션을 생성하는 텍스트-투-보이스 디자인, 단일 녹음에서 만드는 즉석 복제, 그리고 20분 이상의 오디오로 훈련된 전문가용 복제입니다. 마지막 것이 바로 Controlled Voice 리더보드가 사실상 스트레스 테스트하고 있는 부분입니다 — 그 여덟 개의 참조 음성은 복제음이며, 복제 품질이야말로 TTS 엔진들이 갈리는 지점입니다.
문서에서는 엔진 역시 보이스별로 선택할 수 있다고 명시되어 있습니다. 즉, HeyGen이 자사 모델만 사용하도록 강제하지 않으며, 원하는 경우 API를 통해 서드파티 보이스 엔진으로 라우팅할 수 있습니다. 이는 벤더가 자사 모델을 헤지하는 것이며, HeyGen에 관한 "#1 voice"라는 주장을 읽을 때 알아 둘 만한 점입니다.
음성을 선택하는 모든 사람에게 이것이 가져오는 변화
컨트롤드 보이스 결과가 도착하면 세 가지 실질적인 귀결이 뒤따르며, 그중 어느 것도 "모든 것을 전환하라"가 아니다.
먼저, 여러분의 사용 사례가 복제된 브랜드 보이스 — 한 명의 화자, 여러 개의 대사 — 라면, 이제 이것이 읽어야 할 리더보드이며, HeyGen Voice가 가장 먼저 테스트해야 할 모델입니다. 보이스를 일정하게 고정한 리더보드는 여러분이 실제로 하게 될 일을 측정하는 것입니다.
둘째, 클론이 지원하지 않는 언어에서 원어민처럼 들리는 다양한 캐릭터를 폭넓게 구성하는 것이 사용 사례라면, Provider Voices 보드와 그 96개 항목이 여전히 관련 기준이며, HeyGen Voice는 아직 그곳에서 순위가 없습니다. 클론 음성 결과만으로는 엔진이 100개의 서로 다른 음성을 어떻게 처리하는지 알 수 없습니다.
셋째, 이제 가격에는 숫자가 붙었지만, 그것은 벤더가 공개한 숫자는 아니다. 아레나는 HeyGen Voice를 100만 자당 $30.00로 올려 두는데, 이는 HeyGen 자체 페이지에서는 결코 음성 요율로 환산하지 않는 크레딧 시스템을 Artificial Analysis가 변환한 값이다. 그렇게 하면 새로운 선두는 Eleven v4 Turbo의 $40.00 아래이자 Qwen 등급의 $19.30 위에 놓인다 — 1위 점수에 붙은 중간권 가격이며, 인용된 것이 아니라 도출된 가격이다.
라우팅 질문
음성 선택에는 대부분의 모델 선택에는 없는 특성이 있다. 실패가 한 음절 안에 최종 사용자에게 들린다는 점이다. 그래서 마이그레이션은 테스트하기는 저렴하지만, 프로덕션에서 잘못되면 비용이 크다. 기존 엔진과 동일한 인터페이스 뒤에서 새 엔진을 실행하는 것 — 하나의 API 표면, 하나의 키, 공급자 정가를 마크업하지 않고 그대로 전달하며, 요청이 실패하면 두 번째 음성 공급자로 자동 페일오버하는 것 — 이 바로 8개 참조 음성에 대한 Elo 차트의 답이 아니라 자신의 오디오에 대한 실제 답을 얻는 방법이다. OrcaRouter의 라우팅 레이어는 바로 그런 형태의 결정을 위해 존재한다. 도전자를 트래픽의 일부에 배치하고, 기존 모델은 계속 가동해 두고, 새 모델이 검증되지 않은 기간을 페일오버가 커버하게 하라. 리더보드는 어디를 봐야 하는지 알려준다. 하지만 당신의 스크립트가 어떻게 들리는지는 알려주지 못한다.
다음에 볼 콘텐츠
두 개의 숫자가 이 이야기를 판가름할 것이다. 첫 번째는 HeyGen Voice가 충분한 투표를 모아 Provider Voices 보드에 진입할 수 있는지, 그리고 Eleven v4 Turbo의 1,328과 비교해 어디에 자리 잡는지다. Eleven v4 Turbo는 해당 보드에서는 선두이지만 통제된 아레나에서는 뒤처지는데, 이는 바로 두 보드가 드러내기 위해 존재하는 격차다. 두 번째는 HeyGen이 자체 음성 요금을 공개하는지다. 그래야 아레나가 산출한 $30.00을 크레딧에서 추론한 값이 아니라 공급업체 숫자와 대조해 확인할 수 있다. 둘 다 존재하기 전까지, 통제된 보드에서의 #1 데뷔는 복제 음성 품질에 대한 강력한 주장이자 그 밖의 모든 것에 대한 미해결 질문이다.
