'HeyGen Voice vs Qwen-Audio-3.0-TTS'라는 제목의 생성된 히어로 카드는 두 가지 백만 글자당 가격과 비교한 79점의 통제 음성 Elo 격차를 보여주며, 한 가격은 공급업체가 공개한 가격이고 다른 하나는 아레나가 크레딧 가격을 환산해 도출한 값이라는 주석이 있습니다. Artificial Analysis 기준, 2026년 10월 9일. OrcaRouter 로고는 우측 하단 모서리에 나타납니다.
Engineering & Research

HeyGen Voice 대 Qwen-Audio-3.0-TTS: Elo를 위해 무엇을 지불하는가, 그리고 실제로 벤치마크한 Qwen 티어는 어느 것인가

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

먼저 계산을 해보자. 점수판이 시사하는 것보다 덜 치우쳐 있기 때문이다. Qwen-Audio-3.0-TTS-Plus는 Model Studio 플랫폼에서 100만 자당 $19.30이 든다 — 공급업체가 공개한 요율이다. HeyGen Voice는 Artificial Analysis 자체 가격표에서 100만 자당 $30.00에 위치하는데, 이는 해당 사이트가 HeyGen의 크레딧 가격에서 도출한 수치다. HeyGen의 공개 가격 페이지는 음성 생성에 크레딧이 얼마나 소모되는지 밝히지 않은 채 크레딧을 판매하기 때문이다. 한편 둘 사이의 통제된 음성 격차는 79 Elo다. HeyGen Voice는 8개의 참조 음성을 모두 고정한 아레나에서 1,202점을 받았고, Qwen-Audio-3.0-TTS-Plus는 1,123점을 받았다. 그러므로 더 저렴한 모델이 더 나은 모델보다 훨씬 뒤처져 있고, 둘 사이의 비율은 대략 1.55×이며, 그 두 가격 중 하나만이 그것을 파는 공급업체가 자기 이름을 걸고 내놓은 숫자다.

이름 속의 함정

그 전에 티어를 제대로 맞추세요. 이 계열은 잘못된 모델을 벤치마크하도록 기꺼이 내버려두는 계열이니까요. 여기서 중요한 Alibaba 항목은 두 가지이며, 서로 바꿔 쓸 수 없습니다.

Qwen-Audio-3.0-TTS-Plus는 이 글에서 비교 대상으로 삼는 모델입니다. 이 모델은 통제 보드에서 1,123점으로 42개 중 7위를 기록했고, Provider Voices 보드에서는 1,264점으로 96개 중 6위입니다. 이 모델은 실제로 현존하는 스트리밍 TTS 제품이며, 백만 자당 19.30달러의 공개 요금이 책정되어 있습니다.

Qwen-Audio-3.1-TTS-Plus는 후속 등급이며, 통제 보드에서 1,186점으로 2위에 올라 있는 모델입니다. 데뷔 당시 HeyGen Voice를 가장 근접하게 앞지를 뻔한 모델이기도 합니다. 요금은 동일한 $19.30로 표시되어 있지만, 알리바바 문서에서는 모델 버전이 다르면 그에 맞는 음성을 사용해야 한다고 경고하므로, "같은 가격, 더 새로운 등급"이 "바로 대체 가능"을 뜻하지는 않습니다.

“Qwen보다 앞선 #1”이라는 문구를 읽고 Qwen-Audio-3.0-TTS를 벤치마크하는 사람은, 그 헤드라인이 다룬 모델보다 63 Elo 더 약한 모델을 테스트하게 된다. 티어에 대한 이견은 63점의 가치가 있는데, 이는 HeyGen Voice와 3위 사이의 격차보다 크다.

점수판

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• 통제된 음성 Elo(동일한 복제 음성 8개) — HeyGen Voice: 1,202, 42개 중 1위. Qwen-Audio-3.0-TTS-Plus: 1,123, 7위.

• 제공자 음성 Elo(네이티브 음성) — Qwen-Audio-3.0-TTS-Plus: 1,264, 96개 중 6위. HeyGen Voice: 순위 없음.

• 100만 자당 가격 — Qwen-Audio-3.0-TTS-Plus: $19.30, Alibaba Cloud에 벤더가 게시한 가격. HeyGen Voice: 아레나가 자체적으로 환산한 크레딧 가격 기준 $30.00; HeyGen은 음성 요금을 공개하지 않음.

• 100시간 분량 나레이션 비용 — Qwen-Audio-3.0-TTS-Plus: 발화 1시간당 약 480,000자 기준 대략 $926. HeyGen Voice: 아레나의 $30.00 환산 기준 대략 $1,440 — 인용된 값이 아니라 추정치.

• 음성 제어 — Qwen-Audio-3.0-TTS-Plus: 명령 매개변수, 감정 및 언어 태그, 음성 복제 및 음성 디자인. HeyGen Voice: 최대 1,000자 설명으로 텍스트-투-보이스 디자인, 즉석 복제, 20분 이상으로 학습된 전문가용 복제.

• 출력 — Qwen-Audio-3.0-TTS-Plus: 최대 48kHz의 PCM, WAV, MP3, Opus를 지원하며 속도, 피치, 볼륨, 비트레이트를 조정할 수 있습니다. HeyGen Voice: 요청당 속도 0.5–1.5, 피치 ±50반음.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

알리바바의 엔지니어링이 실제로 당신에게 주는 것

Qwen-Audio-3.0-TTS 제품군은 스트리밍 제품이며 문서도 그에 맞게 작성되어 있습니다. 요청은 CosyVoice와 공유되는 WebSocket 프로토콜을 통해 전송되며, run-task, continue-task 및 finish-task 이벤트 흐름과 task-started, result-generated, task-finished 및 task-failed 응답을 함께 사용합니다. 취소는 베이징과 싱가포르 두 리전 모두에서 모든 Qwen-Audio-TTS 모델에 대해 다음을 통해 지원됩니다: streaming_cancel(). 출력은 48kHz에 도달하며, 포맷에는 Opus가 포함되는데, 이는 오디오를 WAV 파일이 아닌 브라우저나 전화 통화로 옮길 때 중요합니다.

그 문서에 있는 두 가지 세부 사항은 놓치기 쉽고, 뒤늦게 발견하면 큰 대가를 치르게 된다. 감정 및 풍부한 언어 태그는 Plus와 Flash 티어에만 적용되며 — 전체 제품군이 아니라 — 단방향 스트리밍 모드에서만 작동한다. 또한 API 키는 싱가포르와 베이징 리전 간에 서로 다르며, 워크스페이스는 다음과 같은 형식의 URL로 지정된다. wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. 리전별 키는 장애가 발생하는 그날까지는 그저 프로비저닝 세부 사항일 뿐이다.

HeyGen 쪽은 제품의 형태가 다릅니다: REST 스타일 v3 API에서는 POST /v3/voices/speech는 음성을 렌더링하고, GET /v3/voices는 engine 필터 뒤에 있는 카탈로그를 나열하며, 음성 디자인은 재현성을 위한 시드와 함께 텍스트 프롬프트로부터 순위가 매겨진 최대 세 가지 옵션을 반환합니다. 문서는 또한 engine 필터가 HeyGen 자체의 것 외의 값도 받아들인다는 점도 드러냅니다. 따라서 HeyGen은 자사 API를 통해 기꺼이 타사 음성 엔진으로 라우팅해 줄 것입니다. 경쟁사의 모델을 선택 가능한 옵션으로 제공하는 공급업체는 자신의 강점이 어디에 있다고 생각하는지에 대해 뭔가를 말해 주고 있습니다.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

79 Elo는 어디로 가는가

통제된 리더보드에서 79점 격차는 상당합니다 — HeyGen Voice와 2위를 가르는 16점 차이보다 크고, 해당 분야에서 3위와 8위 사이의 거리와 대략 비슷합니다. 또한 이는 단일 축에서 측정된 것입니다.

통제된 아레나는 8개의 음성을 복제하고 이를 고정한다. 그것은 Qwen이 노출하는 명령 기반 제어 표면에 대해서도, 취소 가능한 WebSocket을 통한 48kHz Opus 출력에 대해서도, 지역별 배포에 대해서도 아무것도 말하지 않는다. 이는 엔지니어링 속성이며, 만다린어 콘택트 센터를 구축하는 팀이 8개의 영어 참조 음성에서 79점 더 높은 점수를 받는 모델로 전환하지 않는 이유다.

통제된 테스트가 실제로 말해 주는 바는 더 좁지만 여전히 유용합니다: 두 엔진 모두에 동일한 복제 음성을 제공했을 때, 청취자들은 HeyGen Voice의 렌더링을 더 선호했습니다. 여러분의 제품이 음성을 복제한다면, 그것이 여러분의 축입니다. 여러분의 제품이 카탈로그에서 음성을 골라 통화로 스트리밍한다면, 제공업체 순위표가 여러분의 현실에 더 가깝습니다 — 그리고 그곳에서 HeyGen Voice는 전혀 순위가 없는 반면, Qwen-Audio-3.0-TTS-Plus는 96개 중 6위에 올라 있습니다.

가격 논거, 진지하게 받아들일 때

백만 자당 $19.30으로, Qwen-Audio-3.0-TTS-Plus는 ElevenLabs의 $40 티어 비용의 약 절반이고 Cartesia Sonic 3.6의 $49의 약 40%입니다. 100시간 분량의 내레이션—일반적인 발화 속도 기준 약 4,800만 자—작업량이라면 그 비용은 약 $926 수준입니다. 동일한 작업량을 Eleven v4 Turbo에서 처리하면 약 $1,920, Sonic 3.6에서는 약 $2,600입니다. 아레나 기준 $30.00인 HeyGen Voice는 약 $1,440에 해당합니다. 저가 티어와 두 기존 업체 사이에 위치하며, 상단보다는 중간에 더 가깝습니다.

그 계산에는 다른 것들에는 필요 없는 단서가 하나 붙는다. $19.30은 Alibaba가 자체적으로 공개한 요금이다. $30.00은 HeyGen이 한 번도 문자 수로 환산한 적 없는 크레딧 시스템을 Artificial Analysis가 환산한 값이므로, 견적이라기보다는 선의의 추정치다. 실제 크레딧당 문자 수 비율이 차트가 가정한 것보다 나쁘면, 79-Elo 우위는 그것이 시사하는 1.55×보다 더 많은 비용이 든다; 더 좋으면 덜 든다. 가격을 추론해야 하는 모델은 표준으로 삼을 모델이라기보다는 측정된 트래픽 일부에서 파일럿으로 운용할 모델이다. 그것은 이 엔진에 대한 비판이 아니다 — 2026년 10월 10일 기준으로 입수 가능한 정보에 대한 설명이다.

결정하기

비용과 스트리밍 인프라가 결정을 좌우할 때는 Qwen-Audio-3.0-TTS-Plus를 선택하세요. 100만 자당 20달러 미만, 48kHz Opus 출력을 지원하는 취소 가능한 WebSocket, instruction 파라미터와 감정 태그, 그리고 제공업체 보드 6위라는 점이 이 비교에서 가장 경제적이면서 높은 점수를 받은 음성으로 만들어 줍니다. 통제된 보드에서 실제로 2위를 차지한 모델을 원한다면 대신 3.1 티어를 선택하고, 교체가 무료라고 가정하기 전에 음성 목록을 확인하세요.

복제 충실도가 제품일 때 HeyGen Voice를 테스트하세요. 한 명의 화자, 많은 대사, 매번 *바로 그* 목소리여야 하는 목소리 — 그것이 통제된 평가 보드가 측정하는 축이며, 이 분야 전체에서 앞서는 축입니다. 측정 기간을 예산에 넣으세요. 크레딧 모델에서는 요금표를 읽는 것이 아니라 자신의 텍스트를 실행해 봐야 실제 비용을 알게 되기 때문입니다.

그리고 워크로드가 중국어를 사용하고 실시간이라면 그 비교는 완전히 무시하세요. 어느 Elo 수치도 여러분의 음성, 여러분의 언어, 여러분의 지연 시간 예산에서 측정된 것이 아닙니다.

둘 다 접근 가능하게 유지

이것은 라우팅 계층이 단순한 애드온이 아니라 제 역할을 해내는 조합 중 하나입니다. 두 공급자를 모두 아우르는 단일 API 키 — 공급자 정가를 마크업 없이 그대로 전달하므로 Alibaba가 공시한 $19.30이 곧 지불 가격이고 Qwen 가격 변동은 같은 날 반영됩니다 — 는 증거가 확보되기 전에 승자를 골라야 할 필요를 없애줍니다. 자동 페일오버는 멈춘 스트림이 청취자에게 들리는 음성 파이프라인의 뻔한 위험을 처리하며, 라우팅 DSL을 사용하면 대량 내레이션은 저렴한 엔진으로, 클론에 중요한 대사는 79점 더 높은 점수를 받은 엔진으로 보낼 수 있습니다. 두 개의 클라이언트 라이브러리와 두 개의 청구 관계 없이 말이죠. 여기서 OrcaRouter의 가치는 음성 모델을 호스팅한다는 데 있지 않습니다. 어떤 것을 원하는지 알아내는 비용을 거의 0에 가깝게 만든다는 데 있습니다.

미해결 질문들

세 가지가 이 문제를 해결할 것입니다. HeyGen 자체 가격 페이지에 있는 음성 요금은 아레나가 산출하는 $30.00을 검증할 수 있는 숫자로 바꿔 줄 것입니다. Provider Voices 보드에 있는 HeyGen 항목은 복제 음성 우위가 네이티브 음성에서도 살아남는지 알려줄 것입니다 — Qwen-Audio-3.0-TTS-Plus가 96개 중 6위로 통과하는 테스트입니다. 그리고 더 많은 투표 후 HeyGen Voice에 대항한 Qwen-Audio-3.1-TTS-Plus의 통제된 음성 결과는 16 Elo가 안정적인 순위인지 알려줄 것입니다. 그때까지는: Qwen은 가격이 책정되고 스트리밍 가능하며 순위가 좋은 옵션입니다; HeyGen Voice는 더 높은 점수를 받았지만 가격을 매길 수 없는 옵션입니다; 그리고 여러분이 벤치마크하는 티어가 여러분이 읽는 헤드라인보다 더 중요합니다.