
Eleven v4 vs Qwen Audio 3.1: 리더보드에서 가장 저렴한 음성이 이겼다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 982 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 197 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
모든 참가자에게 동일한 8개의 복제 음성이 주어지는 리더보드에서, Alibaba Qwen-Audio-3.1-TTS-Plus는 Elo 1,178로 1위를 차지했고 ElevenLabs Eleven v4는 1,157로 2위를 차지했다. 해당 리더보드에서 우승한 모델은 백만 문자당 $19.30이다. 2위를 차지한 모델은 $80.00이다. 이는 서로 반대 방향을 가리키는 21점의 품질 격차와 4배의 가격 격차이며, 이번 출시 주간 전체에서 가장 흥미로운 결과다 — 다른 아레나에서 ElevenLabs가 차지한 1위보다 더 흥미로운데, 그쪽에서는 순위가 관례적이고 우승자가 상위 10개 중 가장 비싼 음성이기 때문이다.
두 보드는 서로 대체할 수 없으며, 이 맞대결이 이런 결과로 읽히는 이유는 전적으로 어느 보드를 보느냐에 달려 있습니다. Provider Voice에서는 청취자들이 각 벤더 자체의 음성을 평가합니다. Controlled Voice는 모든 모델에 대해 동일한 여덟 개의 음성 — 미국식 네 개, 영국식 네 개 — 을 복제하므로, 누구도 기본 음성 라인업으로 이길 수 없습니다. ElevenLabs가 첫 번째 보드에서 61점 차로 이깁니다. Alibaba가 두 번째 보드에서 21점 차로 이깁니다. 어느 보드도 틀리지 않았으며, 클론된 브랜드 음성을 탑재해 출시되는 제품을 예측하는 것은 두 번째 보드입니다.

제어된 보이스 스코어보드 전체
• 블라인드 선호도, 매칭된 클론 — Qwen-Audio-3.1-TTS-Plus 1위, Elo 1,178, 백만 문자당 $19.30 vs Eleven v4 2위, Elo 1,157, $80.00.
• 블라인드 선호도, 각 벤더의 자체 음성 — Eleven v4 1위, Elo 1,319 대 Qwen-Audio-3.0-TTS-Plus 4위, Elo 1,258. 반대 방향으로 61점 격차.
• 가격, 아레나 정규화 — Qwen $19.30 vs Eleven v4 $80.00. Qwen이 76% 더 저렴합니다.
가격, 공급업체 요율표 — Eleven v4는 1,000자당 $0.022 프로모션 가격이며 10월 12일 이후에는 $0.08입니다. Qwen Audio 3.1의 자체 요율표는 우리가 확인할 수 없었으므로, 아레나 정규화가 우리가 비교할 수 있는 유일한 가격입니다.
• 각 보드의 버전 — Controlled Voice는 3.1, Provider Voice는 3.0입니다. 서로 다른 모델이며 보드는 호환되지 않습니다.
• Controlled Voice의 3.0 항목 — 순위 5위, Elo 1,124, 동일한 $19.30 가격. 3.1 릴리스는 동일한 가격에서 자체 전작보다 Elo 54만큼의 가치가 있습니다.
• Provider Voice에서의 Qwen의 이전 세대 — Qwen3 TTS Flash 79위, Elo 944; Qwen3 TTS 82위, Elo 930.
• Controlled Voice 부문에서 ElevenLabs 자체의 이전 플래그십 — Eleven v3 7위, Elo 1,073.
• 그룹형 막대 정합성 점검 — Controlled Voice에서 랭크 1부터 랭크 10까지의 8-way 격차는 121 Elo다. Eleven v4를 상대로 한 Qwen의 21점 우위는 전체 필드 범위의 5분의 1 미만이며, 이는 그 우위를 그 규모로 유지하는 것이 적절하다는 뜻이다.

그 표에서 두 행이 거의 모든 일을 합니다. 첫 번째는 3.0 대 3.1 비교입니다. Alibaba는 가격을 전혀 바꾸지 않고 한 번의 버전 업그레이드로 Elo 54점을 움직였습니다. 이는 ElevenLabs의 v3에서 v4로의 84점 이동보다 더 빠른 주기이며, 이 글의 구체적인 순위 배열은 두 벤더가 활발하게 뒤흔들고 있는 스냅샷이라는 뜻입니다.
두 번째는 121점 총 격차입니다. 유효 범위가 약 120점인 평가표에서 21점 차이는 실재하지만 크지 않은 차이입니다 — 대략 Qwen 자체의 3.1과 3.0 사이의 격차와 비슷한 규모입니다. 사용 사례가 두 모델 모두 튜닝되지 않은 언어에 속한다면, 그 차이는 몇 가지 까다로운 테스트 스크립트로도 뒤집힐 수 있는 범위 안에 충분히 들어옵니다.
아무도 지적하지 않는 버전 문제
"Eleven v4가 Controlled Voice에서 2위"라는 이름으로 돌고 있는 결과는 정확하지만 불완전하며, 그 누락은 이를 기준으로 계획하는 사람 누구에게나 중요하다. 그 보드에서 Eleven v4 위에 자리한 모델은 Alibaba의 3.1 릴리스다. 한편 Provider Voice 보드의 Qwen 항목은 3.0 릴리스다. 우리가 읽은 바로는 3.1 모델은 그 보드의 상위 행에는 나타나지 않는다. 따라서 두 헤드라인, 즉 "Eleven v4가 1위"와 "Eleven v4가 2위"는 서로 다른 두 작업에서 서로 다른 두 Qwen 모델에 관한 진술이며, 한 보드에서 Eleven v4를 이긴 Qwen 버전은 다른 보드에서 Eleven v4가 이긴 Qwen 버전이 아니다.
이것은 두 업체 중 어느 쪽을 겨냥한 함정도 아닙니다. 그보다는 이와 같은 한 주를 한 문장으로 요약한 어떤 요약도 믿지 말아야 할 이유입니다. 이 두 시스템 중에서 선택하고 있다면, 당신이 원하는 비교는 당신이 직접 복제한 목소리로, 당신의 언어로 3.1과 v4를 맞붙이는 것입니다. 그리고 어느 업체도 그러한 비교를 공개하지 않았습니다.
Qwen Audio 3.1에 관해 우리가 말할 수 있는 것과 말할 수 없는 것
증거에 대한 정직함은 여기서 완전한 사양 표보다 더 가치가 있습니다. 그래서 이 글의 근거가 되는 경계는 다음과 같습니다. 아레나 보드에서 확보한 내용에 따르면, Qwen-Audio-3.1-TTS-Plus의 경우: 통제된 음성 Elo 1,178, 백만 자당 $19.30의 가격 정규화, 그리고 동일한 가격에서 이전 버전이 54점 더 낮은 점수를 기록한 제품 라인의 현재 릴리스라는 사실입니다.
우리에게는 다음에 대한 정보가 없고, 추측하지도 않을 것입니다: 언어 지원 범위, 지연 시간, 요청당 입력 한도, 인라인 전달 지시문 지원 여부, 아레나의 여덟 목소리 외에 음성 복제를 제공하는지, 그리고 자체 요율표에서 무엇을 청구하는지. 그것들은 모두 Eleven v4에 대해 문서화되어 있습니다 — 90개 이상 언어, 10,000자 한도, 오디오 태그, 10초 즉석 복제, IPA 음소 지원 — 그리고 Qwen 쪽에서 그것들이 없다는 것은 공개적으로 읽을 수 있는 정보의 공백이지, 그 모델에 대한 약점이 아닙니다. 이 글만으로 내린 구매 결정은 두 개의 숫자만으로 내린 결정이 될 것입니다.

그 한계에도 불구하고 한 가지 대비는 살아남는다. 양쪽 모두 벤더가 밝힌 것이거나 양쪽 모두 보드가 밝힌 것이기 때문이다. 가격에서는 보드 정규화가 공통분모이며, 이는 Qwen에 76% 유리하다. 화자가 매칭된 조건의 품질에서는 같은 보드가 Qwen에 21 Elo만큼 유리하다. 그 두 행은 비교 가능하다. 여기 있는 다른 모든 것은 그렇지 않으며, 이 기사는 그렇지 않은 척하지 않을 것이다.
통제된 이사회가 평소보다 더 큰 비중을 지녀야 하는 이유
대부분의 음성 비교는 이미 마음에 들어 하는 모델을 1위로 올려놓은 리더보드를 기본값으로 삼는다. 이번 맞대결에서는 Controlled Voice를 선호할 만한 원칙적인 이유가 있는데, 그것은 일반적이기보다 구체적이다.
Alibaba와 ElevenLabs는 전혀 다른 자산으로 경쟁하고 있다. ElevenLabs의 강점은 수년간 엄선된 캐스팅으로 구축한 음성 라이브러리이고, Alibaba의 강점은 빠른 주기로 모델 버전을 출시하는 연구 조직이다. 각 참가자가 자체 음성을 가져올 수 있게 하는 평가판은 합성기만큼이나 라이브러리도 측정하며, 그 평가판에서 ElevenLabs가 61점 차로 이긴다. 라이브러리를 걷어내고 모두에게 동일한 8명의 복제 화자를 제공하면, 우위는 주인이 바뀐다. 사용자가 듣는 음성이 특정 인물의 복제음이라면, 당신은 ElevenLabs의 라이브러리를 사는 것이 아니므로 통제된 평가판이 당신의 구매를 설명하는 셈이다. 기성 음성 메뉴에서 고르는 경우에는 그 반대이며, Eleven v4의 61점 차이가 바로 그 값을 하는 숫자다.
통제된 결과에 가중치를 두어야 하는 두 번째이자 덜 편안한 이유가 있다. 벤더 음성 보드는 독특한 기본 구성을 보상하는데, 독특한 구성은 평균 Elo가 감추는 방식으로 양극화를 불러올 수 있다. 한 청취자에게 개성 있는 목소리가 다른 청취자에게는 인위적으로 들리기 마련이다. 화자가 매칭된 클론 음성 보드는 그 변수를 완전히 제거하므로, 둘 중 더 재현 가능한 측정이 된다.
둘 중 하나를 실행하는 것, 그리고 우리가 실제로 라우팅하는 것
OrcaRouter는 ElevenLabs의 음성 모델도, Alibaba의 음성 모델도 호스팅하지 않습니다. 두 공급업체 모두 우리 카탈로그에 없으므로 우리를 통해 둘 중 어느 것도 호출할 방법이 없으며, 이 글에서도 달리 제안하지 않습니다 — 두 모델 모두 해당 공급업체 자체 API와 여러 서드파티 플랫폼에서 이용할 수 있습니다.
저희가 실제로 커버하는 것은 그 위의 계층입니다. 귀하의 음성 스택이 더 큰 파이프라인 안의 한 노드라면, 저희는 단일 API 키 하나로 200개 이상의 모델을 제공하며, 공급자 정가를 0% 마크업으로 그대로 전달합니다. 따라서 업스트림 어디에서든 가격이 재조정되면 — ElevenLabs의 프로모션 기간과 10월 12일에 그 뒤를 잇는 훨씬 더 큰 정가까지 포함해 — 다음 청구 주기가 아니라 그 일이 발생한 당일 저희 쪽에 반영됩니다. 4배 가격 비율에 좌우되는 결정에서 그 타이밍은 시간이 지나도 잘 견디는 비교와 3주 뒤에는 틀린 것으로 읽히는 비교를 가르는 차이입니다.
그리고 음성 경로가 다운될 수 없는 경우에는, 자동 페일오버가 요청을 실패시키는 대신 트래픽을 정상 업스트림으로 이동시킵니다. 품질에서 이렇게 박빙이고 가격에서 이렇게 한쪽으로 치우친 맞대결에서는, 라우팅이 분할을 결정하도록 두 모델을 하나의 엔드포인트 뒤에 두는 것이 합리적인 아키텍처입니다 — 두 공급업체가 분기 안에 무효화할 리더보드 스냅샷으로 내린 영구적인 선택이 아니라.
평결, 그리고 그 만료일
음성 복제를 하면서 비용을 따진다면 Qwen-Audio-3.1-TTS-Plus를 선택하세요. 화자를 고정한 리더보드에서 1위이고, 가격은 대략 4분의 1이며, 그 추세선은 더 빠르게 움직이고 있습니다 — 가격이 그대로인 상태에서 한 버전 만에 54 Elo라는 점은 다음 버전이 서류상으로는 현재 버전보다 더 나은 선택임을 시사합니다.
사용자들이 스톡 음성을 듣고 있다면, 출시 전에 검증할 수 있는 언어 지원이 필요하다면, 또는 문서화된 기능 세트 — 오디오 태그, 음소 제어, 10,000자 요청, 10초 클론 — 가 아레나 리더보드가 측정하지 않는 일을 제품에서 하고 있다면 Eleven v4를 선택하세요. 벤더 음성 리더보드에서의 61점 차 리드는 결코 사소한 일이 아니며, 스크립트에 써 넣을 수 있는 두 기능은 점수가 아니라 역량입니다.
검토 날짜를 정하세요. Alibaba는 이번 주기 버전 업데이트에서 Elo가 54점 올랐고, ElevenLabs는 전체 세대에 걸쳐 84점 올랐으며, Eleven v4의 프로모션 요금은 10월 12일에 만료됩니다. 이 비교가 오늘 무엇을 말하든, 그것을 뒤집을 가능성이 가장 높은 두 가지 사실 — 3.2 출시와 가격 원상복구 — 은 모두 이번 분기가 끝나기 전에 발생합니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
