Qwen-Audio-3.1-TTS를 ElevenLabs Eleven v3와 비교하는 히어로 카드로, Qwen의 16개 언어와 20개 방언, 70% 가격 인하, 아레나 점수 부재를 나열하고, ElevenLabs의 74개 언어, 백만 문자당 약 100달러, Elo 1,168을 제시하며, 그 위에는 'Apsara에서 2026년 9월 23일 발표'라고 적힌 리본이 있습니다.
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs: 70% 가격 인하가 기존 강자를 만나다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

업체는 2026년 9월 23일 자사 Qwen-Audio-3.1-TTS API 가격을 약 70% 인하했으며, 이는 항저우에서 열린 Apsara Conference 무대에서 다른 네 개의 음성 모델과 함께 발표되었습니다. 바로 이 하나의 숫자 때문에 이 비교 글을 쓸 가치가 있습니다. ElevenLabs Eleven v3는 그동안 대부분의 서구 팀에게 사실상 백만 자당 약 100달러에 달하는 비용으로 기본 프로덕션 음성이 되어 왔는데, 이제 신뢰할 만한 도전자가 같은 작업의 가격을 그 일부로 재설정하면서 동시에 언어 지원 범위까지 넓혔습니다. 두 시스템이 동등한 것은 아닙니다. Qwen-Audio-3.1-TTS는 업체의 Tongyi Lab에서 제공하는 호스팅 전용 API로 음성 생태계가 더 작은 반면, ElevenLabs는 업계에서 가장 깊은 음성 라이브러리를 갖춘 완전한 콘텐츠 플랫폼입니다. 하지만 여러분의 결정이 청구서에 의해 좌우된 적이 있다면, 이번 주에 그 계산이 달라졌습니다.

9월 23일에 실제로 출시된 것은 무엇이었나요?

Qwen-Audio-3.1은 단일 모델이 아니다. 알리바바의 전체 음성 스택을 5개 모델로 새롭게 구성한 것이며, 각 티어는 가격과 역할이 다르기 때문에 중요하다:

Qwen-Audio-3.1-TTS — 대부분의 팀이 사용하는 합성 모델의 직접적인 후속 모델입니다. 7개 언어를 추가해 총 16개 언어를 지원하고, 20개의 중국어 방언 지역을 유지하며, 자연스러운 언어 간 음색 전이(하나의 음성이 만다린, 광둥어, 영어, 일본어를 넘나듦)를 추가합니다. 또한 명령 기반으로 감정, 속도, 전달 스타일을 제어하고, 노이즈가 많거나 에코가 있거나 기타 품질이 낮은 참조 오디오를 별도의 노이즈 제거 모드 없이 처리합니다.

Qwen-Audio-3.1-TTS-Next — 새로운 등급이자, 다른 제품입니다. 알리바바는 이를 "Audiogen" 모델이라고 부릅니다. 텍스트, 타임스탬프, 참조 오디오로부터 음성, 음향 효과, 배경 앰비언스를 한 번에 생성합니다. 다중 화자 대화, 팟캐스트, 영화 및 TV 사운드스케이프, 48 kHz 출력을 지원합니다. 알리바바 클라우드의 Model Studio 문서에 따르면, 최대 3,000자까지 입력할 수 있고, 생성되는 오디오는 팟캐스트의 경우 240초, 그 외의 경우 120초로 제한되며, 초당 3회 요청으로 실행되고, WAV, MP3 또는 PCM을 반환합니다.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next 그리고 Qwen-Audio-3.1-Realtime — 각각 인식, 오디오 이해(감정, 음악, 환경음, 이벤트 위치 파악), 그리고 전이중 대화를 담당합니다. Realtime은 알리바바가 하드웨어에 밀어붙이고 있는 것으로, Qwen Office, Qoder, QwenNote A2, QwenNote Eva 데스크톱 로봇, Qwen AI 안경이 있습니다.

가격 인하는 TTS뿐 아니라 전 제품군에 걸쳐 단행됐습니다: 합성은 약 70%, 실시간은 약 85%, 인식은 최대 95% 인하됐습니다. 알리바바는 또한 실시간 음성 에이전트를 구축하기 위한 프레임워크인 Qwen-Audio-Agent를 오픈소스로 공개했고, 지연 시간을 2.5초 미만으로 낮춘 Qwen3.8-LiveTranslate를 선보였습니다.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

점수판

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

가격 — Qwen-Audio-3.1-TTS: 이전 Qwen-Audio 세대보다 약 70% 낮은 수준으로, 이전 세대는 3.0 Plus 등급이 100만 자당 약 $27.60, Flash 등급이 약 $15였습니다. ElevenLabs Eleven v3: Artificial Analysis가 집계한 기준 100만 자당 약 $100이며, Flash는 약 $50입니다.

언어 — Qwen-Audio-3.1-TTS: 16개 언어 및 20개 중국어 방언 지역. ElevenLabs Eleven v3: 74개 언어.

가중치 — Qwen-Audio-3.1-TTS: 비공개, Alibaba Cloud Model Studio에서만 호스팅됩니다. ElevenLabs Eleven v3: 비공개, 호스팅 방식으로만 제공됩니다.

음성 라이브러리 — Qwen-Audio-3.1-TTS: 네이티브 복제와 언어 간 음색 전이 지원, 이에 필적할 만한 공개 마켓플레이스는 없음. ElevenLabs: 업계 최대 규모의 공유 음성 라이브러리, 약 30초 분량의 오디오로 즉시 복제 가능.

전달 제어 — Qwen-Audio-3.1-TTS: 명령 기반 감정, 속도 및 스타일로, 3.0과 함께 도입된 86개의 인라인 전달 태그를 계승합니다. ElevenLabs Eleven v3: 오디오 태그와 함께 이를 둘러싼 플랫폼(더빙, 에이전트, 스튜디오).

독립 벤치마크 — Qwen-Audio-3.1-TTS: 아직 없음. ElevenLabs Eleven v3: 2026년 8월 기준 Artificial Analysis의 Provider Voice Arena 리더보드에서 1,168 Elo.

도전자가 진정으로 승리하는 곳

세 가지가 있습니다. 그중 오직 하나만 가격입니다.

가격은, 당연히. 백만 글자당 100달러를 받는 기존 업체 대비 70% 인하는 반올림 차이가 아니다. 그것은 프로토타입을 만드는 데 쓰는 제품과 모든 사용자에게 출시하는 제품 사이의 차이다. 내레이션을 대량으로 생성하고 있다면, 연간 절감액은 내부에서 설득해야 하는 예산 항목이 아니라 그 자체로 설득력을 갖는다.

중국어, 의심의 여지가 없습니다. 스무 개의 중국어 방언 권역은 ElevenLabs가 제공하는 그 어떤 것도 근접할 수 없는 해자입니다. 귀하의 제품이 중국 본토 사용자나 광둥어 사용자, 또는 문장 중간에 언어를 전환하는 디아스포라 청중을 대상으로 한다면, 비교는 시작하기도 전에 끝난 것입니다.

교차 언어 음색 전이. Qwen-Audio-3.1-TTS는 하나의 목소리를 만다린 중국어, 광둥어, 영어, 일본어 전반에 걸쳐 자연스럽게 이어갑니다. 이는 특정 사용 사례를 위한 특정 기능입니다 — 언어 전환이 이루어져도 유지되는 단일 브랜드 보이스 — 그리고 시장마다 새로운 성우를 캐스팅하는 대신 단일 발표자를 현지화하는 모든 이에게 실질적인 차별점입니다.

ElevenLabs가 여전히 앞서는 분야, 그리고 그 격차는 크다

언어의 폭이 첫 번째이자 가장 큰 요소입니다. 74개 언어 대 16개 언어는 가격 발표로 좁힐 수 있는 격차가 아닙니다. 폴란드어, 터키어, 베트남어, 포르투갈어로 출시한다면, ElevenLabs는 오늘날 지원하지만 Qwen-Audio-3.1-TTS는 지원하지 않습니다.

두 번째는 생태계입니다. ElevenLabs는 단순한 합성 엔드포인트가 아니라 콘텐츠 플랫폼입니다. 복제하는 대신 라이선스를 부여할 수 있는 공유 음성 라이브러리, 더빙 워크플로, 에이전트 인프라, 스튜디오 제품, 그리고 수년간의 클라이언트 라이브러리가 뒷받침하는 문서화된 API 표면까지 갖추고 있습니다. 그곳에서 벗어나는 것은 설정 변경이 아니라 하나의 프로젝트이며, 그 위에 구축해 온 팀들은 자신들이 무엇을 포기하게 되는지 정확히 알고 있습니다.

세 번째는 이름 붙이기가 더 어렵지만, 그럼에도 이름 붙일 가치가 있는 것입니다: 하나의 영어 음성에서 느껴지는 자연스러움에 대한 인식입니다. Qwen의 합성은 역사적으로 중국어에서는 탁월했고 영어에서는 그저 아주 좋은 정도였으며, 3.1 릴리스가 다국어 전달력을 개선했다고 주장하지만 새 모델에 대한 독립적인 청취 테스트는 아직 없습니다. 새 Qwen 음성이 영어로 어떻게 들리는지 안다고 말하는 사람은 누구든 짐작하는 것입니다.

아직 아무도 인용해서는 안 되는 숫자

이 부분은 보도에서 왜곡되기 쉬운 이야기이므로, 여기에 분명히 밝혀 둔다. Qwen-Audio-3.1-TTS에는 독립적인 벤치마크 점수가 없다. 그 전신인 Qwen-Audio-3.0-TTS-Plus는 2026년 8월 중순 기준 Artificial Analysis의 Provider Voice Arena 리더보드에서 Elo 1,234를 기록하며 해당 리더보드에서 2위에서 5위 사이에 올랐다. Qwen-Audio-3.1-TTS는 아직 어떤 아레나에도 추가되지 않았다. 알리바바의 출시 자료에 담긴 모든 품질 주장은 벤더가 보고한 것이며 재현된 바 없다.

그렇다고 해서 그 주장들이 거짓이 되는 것은 아니다. 그것은 그 주장들을 검증되지 않은 것으로 만들 뿐이며, 지금 이 맞대결을 정직하게 표현하자면 이렇다는 뜻이다: 가격은 있지만 점수는 없는 한 모델 대 점수는 있지만 가격이 훨씬 더 높은 한 모델. 그보다 더 강한 것은 벤치마크의 옷을 입은 추측일 뿐이다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

지연 시간에도 같은 원칙이 적용됩니다. 이 제품군의 ASR 측면에 대해 알리바바가 대표 수치로 내세운 첫 토큰 값인 92밀리초는 0.6B 사양에 대한 회사 자체의 고동시성 벤치마크에서 나온 것이지 제3자 테스트에서 나온 것이 아니며, 출시 이후 공개된 분석에서는 ASR과 TTS가 하나의 엔드투엔드 모델이 아니라 파이프라인 내 별개 제품이라고 지적하고, 커뮤니티 보고에서는 의사 스트리밍 패턴에서 긴 대화 중 지연이 누적된다고 설명합니다. 이 전체 제품군에 걸친 벤더의 지연 시간 수치는 측정된 실제 경험이 아니라 상한선으로 간주하십시오.

가격 인하가 실제로 얼마나 가치가 있는지

현실적인 워크로드를 가정해 보자: 한 제품이 매달 영어와 중국어로 총 2,000만 자의 내레이션을 합성한다. ElevenLabs Eleven v3의 100만 자당 약 $100 요율이라면 이는 월 약 $2,000, 연 $24,000이다. Qwen-Audio-3.0-TTS-Plus의 100만 자당 약 $27.60 요율이라면 같은 볼륨은 이미 월 약 $552였다. 알리바바가 9월 23일에 발표한 약 70% 인하를 적용하면 같은 워크로드는 월 수백 달러 초반대로 내려간다.

그 수치들 중 어느 것도 계약 기준으로 삼을 수 있는 정가가 아니다 — ElevenLabs는 구독 등급을 통해 크레딧으로 청구하고, Alibaba의 인하는 지역과 등급에 따라 달라지는 요율에 대한 비율 할인이다. 하지만 비교의 윤곽은 명백하며, 예산을 세울 때 기준이 되는 것은 바로 그 윤곽이다.

이것을 신중하게 모델링하려는 분이라면 반드시 짚고 넘어가야 할 단서가 하나 있습니다: Alibaba Cloud는 싱가포르 노드의 실시간 전사 청구를 사용 시간 기반 과금에서 토큰 기반 과금으로 전환했으며, 입력 토큰 100만 개당 $0.93, 출력 토큰 100만 개당 $0.70입니다. 토큰 청구는 주어진 오디오 조각이 몇 개의 토큰이 되는지 통제할 수 없을 때 사용 시간 기반 청구보다 예측 가능성이 떨어지며, 노이즈, 무음, 다중 턴 문맥 모두 토큰 소비를 증가시킵니다. 70%라는 표면적 인하가 귀하의 특정 트래픽에서 자동으로 70% 절감을 의미하지는 않습니다.

실제로 스위치를 실행하는 방법

이걸 평가 중이라면, 알아두면 유용한 점은 마이그레이션에 엔지니어링 시간이 얼마나 드는가입니다. 두 모델 모두 폐쇄형 호스팅 API이므로 어느 쪽이든 HTTP 엔드포인트에 통합하게 되며, 작업은 클라이언트, 재시도 정책, 보이스 인벤토리이지 아키텍처를 다시 설계하는 일이 아닙니다.

바로 그 지점에서 OrcaRouter의 구조가 힘을 발휘합니다. 다만 먼저 솔직하게 밝힐 단서가 하나 있습니다. 우리는 Qwen-Audio-3.1-TTS나 여타 Qwen-Audio 모델을 라우팅하지 않습니다. 알리바바의 음성 엔드포인트는 우리의 적용 범위 밖이며, ElevenLabs도 마찬가지입니다. 우리가 담당하는 것은 그 주변의 추론 계층입니다 — 200개가 넘는 텍스트 모델 전반을 0% 마크업으로 이용할 수 있는 API 키 하나, 즉 제공업체의 정가가 그대로 전달되므로, 공급업체가 가격을 내리면 재가격 주기를 거친 뒤가 아니라 같은 날 우리 쪽에서 곧바로 반영됩니다. 애플리케이션을 만드는 팀에게는구동하는음성 파이프라인을 — 요약기, 스크립트 생성기, 콘텐츠 플래너 — 이는 여러 건의 계약 대신 하나의 계약을 뜻하며, 업스트림 성능이 저하될 때의 자동 장애 조치, 그리고 모델들을 하나의 호출로 조합하기 위한 라우팅 DSL을 뜻합니다. 그렇다고 해서 우리를 통해 Qwen의 음성을 호출할 수 있다는 뜻은 아닙니다. 그렇지 않다고 말하는 사람은 카탈로그를 읽지 않은 것입니다.

누가 움직여야 하고, 누가 기다려야 할까요?

지금 움직이세요 워크로드가 중국어 우선이라면, 방언 지원이 요구 사항 목록에 있다면, 볼륨 비용이 더 저렴하지만 품질은 더 나쁜 음성에 머물게 만든 제약이라면, 또는 언어를 전환해도 하나의 브랜드 음성이 유지되어야 한다면. 9월 23일 가격 책정은 경제성에 이의를 제기하기 어렵게 만들고, 중국어 품질은 그전부터 이미 경쟁력이 있었습니다.

잠깐, 약 16개가 넘는 언어로 출시한다면, 제품이 음성 복제가 아니라 라이선스 가능한 음성 라이브러리에 의존한다면, 플랫폼의 더빙 또는 에이전트 툴링에 깊이 관여하고 있다면, 또는 조달 프로세스가 최종 승인 전에 독립적인 품질 점수를 요구한다면. 그중 어느 것도 영구적인 장애물은 아니지만, 가격 인하로 해결된 것은 하나도 없습니다.

그리고 특히 한 가지를 지켜보세요: Qwen-Audio-3.1-TTS가 블라인드 리스닝 아레나에 등장하는지 여부입니다. 등장하는 순간, 이 비교는 더 이상 가격과 언어 수에 관한 것이 아니게 되고, 더 저렴한 음성이 실제로 그만큼 좋은지에 관한 것이 되기 시작합니다. 그것이 이번 출시가 답하지 않은 질문입니다.