Qwen-Audio-3.0-TTS와 Qwen-Audio-3.1-TTS를 비교하는 히어로 카드로, 구형 모델의 2026년 7월 20일 출시, Elo 1,238, 86개의 인라인 전달 태그를 신형 모델의 2026년 9월 23일 발표, 70% 가격 인하, 지시 기반 제어와 대비해 나열하며, 두 모델 사이에 '9주'라고 표시된 화살표가 있다.
Guides & Insights

Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: 두 달이 가져온 것

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen-Audio-3.0-TTS는 2026년 7월 20일 출시되어 독립 음성 리더보드 정상에 곧바로 올랐습니다. Plus 티어는 Artificial Analysis의 Provider Voice Arena 리더보드에서 1,238 Elo를 기록해 보드 2위에 올랐습니다. 9주 후인 2026년 9월 23일, 벤더는 항저우 Apsara Conference에서 약 70% 인하를 함께 내건 Qwen-Audio-3.1-TTS를 발표했습니다. 이러한 시점 때문에 이는 이례적인 비교가 됩니다. 대체되는 모델은 구식이 아니라, 벤치마크되었고 검증되었으며 여전히 정상 근처에 있습니다. 따라서 진짜 질문은 어느 쪽이 더 나은가가 아닙니다. 구체적으로 무엇이 바뀌었는지, 그중 무엇이든 여러분의 워크로드에 중요한지, 그리고 후속 모델이 전혀 평가되지 않았을 때 이미 신뢰하는 점수는 어떻게 되는지입니다.

두 달, 다섯 개의 엔드포인트, 하나의 가족

알리바바가 출시한 모델은 하나가 아니다. 3.1 릴리스는 다섯 종을 아우른다: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next, Qwen-Audio-3.1-Realtime. 현재 Qwen-Audio-3.0-TTS를 호출하는 사람이라면, 그중 단 하나만 그대로 대체 가능한 드롭인 모델이며 — 일반 TTS 등급 — 하나는 업그레이드가 아니라 진정한 신제품이다.

두 번째 것은 실제로 호출할 일이 없더라도 이해해 둘 가치가 있습니다. Qwen-Audio-3.1-TTS-Next는 Alibaba가 "Audiogen" 모델이라고 부르는 것으로, 텍스트, 타임스탬프, 참조 오디오로부터 음성, 음향 효과, 배경 앰비언스를 한 번에 생성하는 단일 패스입니다. 다중 화자 대화, 팟캐스트 구성, 장면 사운드스케이프, 48 kHz 출력을 지원합니다. Alibaba Cloud의 Model Studio 문서에는 제한 사항이 명확히 나와 있습니다 — 입력 3,000자, 팟캐스트의 경우 생성 오디오 240초, 그 외에는 120초, 초당 3회 요청, WAV, MP3 또는 PCM 출력, 그리고 각 30초짜리 WAV, MP3 또는 OGG Opus 참조 클립을 최대 3개까지 받습니다. 원시 PCM 참조 입력은 지원되지 않습니다. 베이징 노드 기준 입력 토큰 100만 개당 $0.848, 출력 토큰 100만 개당 $1.696의 가격이 책정되어 있으며(프로모션 요금 제외), 중국어와 영어만 처리합니다.

3.0-TTS를 사용 중이고 당신의 일이 "이 스크립트를 음성으로 바꾸는 것"이라면, 그중 어떤 것도 당신의 통합 방식을 바꾸지 않습니다. 당신의 일이 "음악 베드가 있는 두 진행자 팟캐스트를 구성하는 것"이라면, 3.1-TTS-Next는 다른 제품 범주이며, 어쩌면 이 릴리스를 살펴볼 이유 자체일 수도 있습니다.

업그레이드, 한 줄씩

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• 언어 — Qwen-Audio-3.1-TTS: 공급업체가 보고한 16개 언어로, 이전 세대보다 7개가 추가되었습니다. Qwen-Audio-3.0-TTS: 7월 릴리스에 대한 공개 보도에 명시된 대로 16개 언어.

• 중국어 방언 — Qwen-Audio-3.1-TTS: 20개 방언 지역, 그대로 이어짐. Qwen-Audio-3.0-TTS: 20개 방언 지역.

• 언어 간 음색 전환 — Qwen-Audio-3.1-TTS: 예, 하나의 음성이 중국어, 광둥어, 영어, 일본어 전반에 걸쳐 유지됩니다. Qwen-Audio-3.0-TTS: 제공되지 않음.

• 전달 제어 — Qwen-Audio-3.1-TTS: 감정, 속도, 스타일을 명령 기반으로 제어. Qwen-Audio-3.0-TTS: 86개의 인라인 전달 태그.

• 잡음이 있는 참조 입력 — Qwen-Audio-3.1-TTS: 잡음이 있거나 에코가 있는 참조 오디오를 별도의 노이즈 제거 모드 없이 직접 처리합니다. Qwen-Audio-3.0-TTS: 깨끗한 참조 오디오가 필요합니다.

• 독립 점수 — Qwen-Audio-3.1-TTS: 아직 없음. Qwen-Audio-3.0-TTS-Plus: 2026년 8월 기준 Artificial Analysis의 Provider Voice Arena 리더보드에서 1,238 Elo.

언어 개수가 맞지 않으며, 그것은 중요한 문제입니다.

이건 다른 모든 곳에서는 대충 넘어가게 될 사소한 일이라서, 그래도 짚고 넘어갈 가치가 있습니다. Alibaba의 출시 자료에는 3.1 TTS 티어가 7개 언어를 추가한다고 되어 있습니다. 7월 3.0 세대에 대한 공개 보도 — 그달의 우리 자체 비교 기사들을 포함해 — 에서는 3.0 티어에 16개 언어를 나열했습니다. 16에 7을 더하면 23이지 16이 아니며, Alibaba는 두 수치를 조정한 설명을 공개하지 않았습니다.

가능한 설명들은 매력적이지 않습니다. 3.1 숫자는 다른 집합을 셀 수 있고, 3.0 수치는 출시 당시 과장되었을 수 있으며, “7개 추가”는 TTS가 아니라 ASR 등급을 설명하는 것일 수 있습니다. 어느 것인지는 알 수 없습니다. 우리가 아는 것은 이 비교의 양쪽에 있는 언어 수가 독립적으로 감사된 적 없는 공급업체 보고 숫자라는 점, 그리고 두 모델 중 어느 것에 대해서든 “16개 언어”를 확고한 사실로 인용하는 사람은 마케팅 슬라이드를 인용하는 것이라는 점입니다. 언어 수를 기준으로 계획하기 전에 Model Studio 문서와 대조하여 필요한 특정 언어를 확인하세요.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

명령 제어는 실제로 코드에 나타나는 변화입니다

3.1 TTS 릴리스의 모든 것 중에서도, 이것은 프롬프트 작성 방식을 바꾸는 요소입니다. 3.0 세대는 86개의 인라인 태그를 통해 전달을 제어했습니다. 이는 배워야 하고, 올바른 위치에 삽입해야 하며, 말한 그대로만 정확히 수행하고 그 이상은 하지 않는 고정된 어휘였습니다. 3.1 티어는 이를 자연어 지시로 대체합니다. 원하는 감정, 속도, 스타일을 설명하면 모델이 이를 해석합니다.

실질적인 차이는 표현력 대 예측 가능성이다. 태그 어휘는 계약이다 — 같은 태그는 매번 동일한 전달을 만들어내며, 이는 1만 개의 클립 전반에서 목소리가 일관돼야 하는 프로덕션 파이프라인에서 바라는 바로 그 특성이다. 자유 형식 지시는 더 넓지만 더 느슨하고, 늘 있는 프롬프트 민감성 문제를 물려받는다: "따뜻하지만 감상적이지 않게"의 두 가지 표현 방식은 동일하게 전달되지 않을 것이고, 같은 표현을 다른 날 두 번 호출해도 마찬가지다.

현재 파이프라인이 그 86개 태그 위에 구축되어 있다면, 업그레이드는 공짜가 아닙니다. 결정론적 제어 표면을 확률적 제어 표면과 맞바꾸는 셈이며, 이식 작업은 API 호출이 아니라 새 모델의 해석 방식에 맞춰 보유한 모든 프롬프트 템플릿을 다시 검증하는 일입니다. 절감분을 예산에 반영하기 전에 그 비용부터 예산에 잡으세요.

언어 간 음색 전이, 그리고 그것이 실제로 무엇을 위한 것인지

하나의 레퍼런스 보이스가 중국어, 광둥어, 영어, 일본어를 넘나들며 언어가 바뀌어도 그 정체성을 유지합니다. 서류상으로는 기능 항목 하나처럼 읽힙니다. 실제로는 구체적이고 비용이 큰 문제를 해결합니다. 바로 한 명의 프레젠터가 각 언어에서 다른 사람처럼 들리지 않으면서 둘 이상의 언어로 존재해야 하는 문제입니다.

전통적인 우회 방식은 언어별로 별도의 성우를 캐스팅하고, 이제 브랜드 보이스가 하나의 대본을 공유하는 네 개의 목소리가 되었다는 점을 받아들이는 것입니다. 대안은 한 명의 화자를 각 언어로 복제하는 것이었는데, 이는 바로 복제된 목소리가 흐트러지기 쉬운 워크플로입니다 — 악센트가 그대로 남고, 음색이 얇아지며, 청취자는 한 문장 안에서도 이를 알아차립니다. 언어 간 음색 전이는 두 가지 타협 중 어느 것도 필요하지 않다는 주장입니다.

또한 이것은 현재로서는 전적으로 검증되지 않은 상태입니다. Qwen-Audio-3.1-TTS에 대해 어떤 언어로도 제3자 청취 테스트는 없으며, 그 전이가 유지된다는 유일한 증거는 알리바바 자체의 데모뿐입니다. 이 기능이 업그레이드를 고려하는 이유라면, 결정하기 전에 자신의 참조 오디오로 테스트해 보세요 — 그것은 5분짜리 실험이며, 그 질문에 답해 주는 유일한 실험입니다.

가격 인하가 3.0 법안에 미치는 영향

Alibaba는 음성 가격을 전면 인하했습니다: 합성은 약 70%, 실시간은 약 85%, 인식은 최대 95% 인하했습니다. 이번 조정은 2026년 9월 22일 베이징 시간 00:00에 Alibaba Cloud Model Studio에서 시행되었으며, 베이징과 싱가포르 리전을 대상으로 하고 3.1 TTS 및 3.0 실시간 엔드포인트에 적용됩니다. 조정 후 TTS Flash 티어의 가격은 100만 입력 토큰당 1.5위안, 100만 출력 토큰당 12위안입니다. 실시간 Flash 티어의 가격은 100만 토큰당 텍스트 입력 1.5, 오디오 입력 6, 텍스트 출력 4.5, 텍스트·오디오 결합 출력 12입니다.

이미 3.0-TTS를 실행 중이라면 중요한 부분은 이것입니다. 3.0 Plus 티어는 8월까지 Artificial Analysis에서 백만 자당 약 $27.60 수준이었고, Flash 티어는 약 $15였습니다. 약 70% 인하가 사용 중인 티어에 적용된다면, 동일한 워크로드에 대한 청구액은 코드 한 줄도 바꾸지 않고도 기존의 약 3분의 1로 떨어집니다. 이번 릴리스의 특이한 점은 바로 이것입니다. 3.0 고객에게는 가격 인하가 모델 업그레이드보다 더 가치가 크며, 마이그레이션 여부와 관계없이 적용됩니다.

기억해 둘 만한 두 가지 주의사항이 있습니다. 퍼센트 인하는 지역과 티어에 따라 서로 다른 요율을 기준으로 제시되므로, 대표 수치인 70%가 여러분의 특정 트래픽에 대한 약속은 아닙니다. 또한 Alibaba Cloud는 싱가포르 노드의 실시간 전사 과금을 사용 시간 기반 계량에서 토큰 기반 계량으로 전환했습니다 — 입력 토큰 100만 개당 $0.93, 출력 토큰 100만 개당 $0.70 — 이는 침묵, 노이즈, 멀티턴 컨텍스트가 모두 토큰 소비를 늘리는 상황에서 예측 가능성이 더 낮은 기준입니다. 새 요금표는 보도자료가 아니라 여러분의 실제 오디오와 대조해 확인하세요.

Qwen-Audio-3.0-TTS가 여전히 최선의 선택인 경우

세 가지 경우가 있는데, 이들은 엣지 케이스가 아닙니다.

당신이 방어할 수 있는 숫자가 필요할 때. Qwen-Audio-3.0-TTS-Plus는 독립적인 Elo가 1,238입니다 — 같은 리더보드에서 해당 모델은 9월에 1,259를 기록하며 여전히 2위이므로, 점수는 퇴보한 것이 아니라 오히려 위로 이동한 것입니다 — 수천 개의 투표가 뒷받침하는 블라인드 청취 아레나에서 나온 결과입니다. Qwen-Audio-3.1-TTS는 아레나 점수가 전혀 없습니다. 승인 절차에 제3자 증거가 필요하다면, 그것을 갖춘 쪽은 더 오래된 모델이며, 가격 인하가 그 사실을 바꾸지는 않습니다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

결정성이 표현력을 이길 때. 프로덕션 파이프라인이 86개 태그 제어 인터페이스 위에 구축되어 있다면, 출력을 추론할 수 있는 시스템을 갖춘 셈입니다. 지시문 기반 제어는 더 강력하지만 예측 가능성은 떨어지며, 마이그레이션 비용도 실제로 발생합니다.

업그레이드가 당신의 워크로드에 전혀 영향을 주지 않을 때. 깨끗한 참조 음성과 고정된 전달 태그 세트를 사용해 적당한 분량으로 중국어와 영어를 합성한다면, 언어 간 음색 전이, 노이즈 입력에 대한 견고성, 그리고 일곱 개의 추가 언어는 모두 당신에게 없는 문제를 해결하는 것들입니다. 가격 인하는 받아들이고, 모델은 그대로 유지하세요.

두 통합을 실행하지 않고 둘 다 실행하기

세대 간 전환의 곤란한 점은 두 모델을 동시에 라이브로 유지하고 싶을 때가 많다는 것입니다 — 그 뒤에 점수가 있는 프로덕션 경로에는 3.0을, 새로운 언어와 전이 기능에는 3.1을, 그리고 재배포 없이 둘 사이에서 트래픽을 이동할 방법을요. 둘 다 Alibaba Cloud Model Studio의 폐쇄형 호스팅 API이므로, 하나의 기능 뒤에 두 개의 엔드포인트, 두 개의 속도 제한, 두 개의 장애 모드가 있는 셈입니다.

우리의 입장에 대한 솔직한 메모: OrcaRouter는 Qwen-Audio-3.1-TTS나 어떤 Qwen-Audio 모델도 라우팅하지 않으며, Alibaba의 음성 엔드포인트를 전혀 라우팅하지 않습니다. 우리가 제공하는 것은 다음과 같은 파이프라인 주변의 텍스트 추론 계층입니다 — 0% 마크업으로 200개 이상의 모델에 걸친 하나의 API 키, 제공업체 정가가 그대로 전달되어, 공급업체의 가격 인하가 재가격 주기 후가 아니라 같은 날 우리 쪽에 반영됩니다. 음성 파이프라인을 구동하는 서비스가 스크립트 생성기, 요약기 또는 콘텐츠 플래너라면, 이는 여러 개 대신 하나의 계약을 의미합니다, 업스트림이 성능 저하될 때 자동 장애 조치, 그리고 모델을 단일 호출로 구성하기 위한 라우팅 DSL. 이는 여러분이 우리를 통해 Qwen의 음성을 호출한다는 의미가 아니며, 그렇지 않다고 암시하는 모든 페이지는 우리 자체 카탈로그에 대해 잘못된 정보를 제공하는 것입니다.

솔직한 요약

Qwen-Audio-3.1-TTS는 중요한 세 가지 추가 사항이 포함된 진정한 업그레이드입니다. 지시 기반 전달 제어, 언어 간 음색 전이, 열악한 참조 오디오에 대한 강건성, 그리고 이들 중 어느 것보다 더 가치 있는 가격 인하까지 갖췄습니다. Qwen-Audio-3.0-TTS는 두 달 된 모델이 보통 그렇듯이 대체된 것은 아닙니다. 여전히 후속 모델이 얻지 못한 독립 벤치마크 점수를 보유하고 있으며, 이 제품군의 차별화 대부분이 기대고 있는 중국어 방언 범위를 여전히 포괄합니다.

따라서 결정은 마케팅이 시사하는 것보다 더 좁다. 대량으로 생성하고 있다면, 가격 변경은 이미 당신에게 이득이다. 새로운 언어나 음색 변환이 필요하다면, 먼저 마이그레이션하고 자신의 오디오에서 그 기능을 검증하라. 방어 가능한 품질 수치가 필요하다면, Qwen-Audio-3.1-TTS가 블라인드 청취 아레나에 등장할 때까지 기다려라. 그것이 이 문제를 결판낼 단 하나의 사건이며, 그 일이 일어나기 전까지 솔직한 입장은 최신 모델이 더 저렴한 쪽이고 구형 모델이 검증된 쪽이라는 것이다.