
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: 둘 중 하나는 아레나 점수를 가지고 있는데, 그건 새로운 쪽이 아니다
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
전체 비교를 한 줄로 정리하면 이렇습니다. Qwen-Audio-3.0-TTS는 Text-to-Speech Arena에서 Plus 티어 기준 Elo 1,234를 기록했으며, 이 점수는 2,502표의 블라인드 청취 투표로 얻은 것입니다. StepAudio 3 TTS는 StepFun이 2026년 9월 15일에 출시했지만, 그 리더보드에는 아예 없습니다. 그 전작은 이렇습니다: StepAudio 2.5 TTS는 1,306표에서 Elo 1,209를 보유하고 있습니다.
그러므로 솔직한 질문은 “어느 쪽이 더 좋게 들리는가”가 아니다. 그것은 이전 세대에서 측정된 25점 Elo 격차가, StepFun이 운율을 개선하고 가격을 절반 이상 낮췄다고 말하는 릴리스에서도 살아남는지 여부다. 아직 아무도 그 투표를 실시하지 않았으며, 아래의 모든 내용은 그 증거의 공백을 모른 척하지 않고 그 공백을 중심으로 구성되어 있다.
오늘 실제로 적혀 있는 그대로의 보드
실제 순위를 확인해 볼 만합니다. 여러 곳에 돌고 있는 글들이 오래된 버전의 순위를 인용하고 있기 때문입니다. 블라인드 리스닝 아레나는 투표자들이 어느 샘플을 선호했는지를 기준으로 합성 모델의 순위를 매깁니다. 제공사 보이스 보드 상단을 가로로 읽어 보세요:
• Cartesia Sonic 3.6 — Elo 1,277, 2026년 8월, 백만 자당 $49.0
• Inworld Realtime TTS-2 — Elo 1,243, 2026년 8월, 100만 자당 $20.8
• {{1}}SpeechifyAI Simba 3.2{{/1}} — {{2}}Elo 1,238{{/2}}, {{3}}2026년 7월{{/3}}, {{4}}백만 자당 $6.6{{/4}}
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234, 2026년 7월, 백만 문자당 $27.6, 아레나 음성 8개
• VUI Labs Luna TTS — Elo 1,229, 2026년 6월, 100만 자당 $80.0
• Inworld Realtime TTS-2 Flash — Elo 1,213, 2026년 8월, 100만 자당 $10.4
• StepFun StepAudio 2.5 TTS — Elo 1,209, 2026년 8월, 100만 자당 $85.0, 아레나 음성 8개
• Google Gemini 3.1 Flash TTS — Elo 1,204, 2026년 4월, 100만 문자당 $18.3

그 목록에서 즉시 두 가지가 드러난다. 첫째, Qwen의 Plus 등급은 선두가 아니다. Cartesia, Inworld, Speechify에 이어 4위이며, 왕관처럼 인용되는 1,234라는 수치는 그 이후로 판도가 바뀐 순위표에서 중위권 점수에 불과하다. 둘째, StepAudio 2.5 TTS는 2026년 8월에 다시 실행되어 Qwen보다 25 Elo 뒤진 7위를 차지했으며, 그 가격은 세 배가 넘는다.
그리고 그 무엇보다 중요한 세 번째: 신뢰구간을 보라. Qwen의 Plus 등급은 2,502개 표본에서 −14/+14로 표시된다. StepAudio 2.5 TTS는 1,306개 표본에서 −16/+16으로 표시된다. 이 구간들은 겹친다. 오차 범위가 양방향으로 14점과 16점에 걸쳐 있는 두 모델 사이의 25점 차이는 입증된 품질 차이가 아니다 — 이는 현재 아레나가 구분할 수 없는 두 모델이, 몇백 표만 더 투표되면 뒤집힐 수 있는 순서로 순위가 매겨진 것뿐이다.

누락된 데이터 포인트가 당신에게 치르게 하는 대가
StepAudio 3 TTS는 StepFun이 StepAudio 2.5 TTS를 대체한 모델로, 음색, 억양, 리듬, 호흡 쉼은 물론 웃음, 망설임, 말더듬, 반복, 자기 수정과 같은 준언어적 행동까지 제어할 수 있다고 출시 당시 발표했으며, 이는 생성과 재생이 겹쳐지는 스트리밍 아키텍처를 통해 구현됩니다.
그것은 바로 아레나가 측정하는 특성 집합과 정확히 일치한다. 또한 점수의 부재가 치명적이라기보다 답답하게 느껴지는 이유도 정확히 여기에 있다: 그 질문에 답해 줄 벤치마크는 존재하고, 공개적으로 운영되며, 단지 새 모델이 출시된 이후 다시 실행되지 않았을 뿐이다. StepAudio 3 TTS가 Qwen-Audio-3.0-TTS보다 더 좋게 들린다고 말하는 사람은 누구든, 자기 오차 범위 안의 격차로 패배한 전임 모델로부터 외삽하고 있는 것이다.
가격은 충분히 문서화된 부분이며, 많이 움직였다
StepAudio 3 TTS는 StepFun 자체 플랫폼에서 1만 자당 2.5위안으로 청구됩니다. StepAudio 2.5 TTS는 5.8위안이었습니다. 아레나 자체의 문자 기준 가격 열에서는 이전 모델이 100만 자당 $85.00였고, 1만 자당 2.5위안은 최근 환율로 대략 100만 자당 약 $35에 해당합니다 — 이는 공개된 수치가 아니라 우리가 환산한 것이며, 자신의 지역과 환율에 맞춰 다시 계산해 볼 가치가 있습니다. 이는 동일 항목에서 거의 60%에 가까운 인하입니다.
여전히 Qwen보다 높습니다. Qwen-Audio-3.0-TTS-Plus는 백만 자당 $27.6로 책정되어 있고, Flash 티어는 더 저렴합니다. Alibaba Cloud Model Studio는 생성된 오디오가 아니라 입력 문자를 기준으로 합성 요금을 청구하므로 출력은 별도로 청구되지 않습니다. Flash 티어를 표시하는 제3자 플랫폼들은 백만 자당 10대 후반의 요금을 제시하지만, 지역별 차이로 인해 단일 대표 수치는 신뢰할 수 없습니다.
그래서 이 구도의 핵심은 이렇다: StepFun은 합성 비용을 대략 절반으로 줄였고, Qwen과의 격차를 대부분 좁혔지만, 그 격차를 넘어서지는 못했다. 문자당 가격이 당신의 결정적 제약이라면, 논거는 좁아지지만 답은 달라지지 않는다. 그렇지 않다면, 가격은 더 이상 두 모델 중 어느 쪽을 고를 이유가 되지 못한다.
음성 인벤토리와 언어 지원 범위는 비슷하지 않습니다.
이 지점에서 비교는 더 이상 주관적 판단의 문제가 아니라 명세의 문제가 된다.
• 음성 인벤토리 — Qwen-Audio-3.0-TTS는 등급 전반에서 1,000개 이상의 음성을 제공하는 반면, StepAudio 3 TTS는 비교 가능한 공개 수치가 없음
• 언어 — Qwen-Audio-3.0-TTS는 16개 언어와 20개 중국어 방언을 지원하며, Flash 티어는 저자원 언어와 방언 진정성에 맞춰 조정된 반면, StepAudio 3 TTS는 중국어 우선으로 이에 상응하는 커버리지 주장은 없음
• 요청 크기 — Qwen-Audio-3.0-TTS는 요청당 20,000자 vs StepAudio 3 TTS는 미공개
• 지연 시간 — Qwen-Audio-3.0-TTS Flash는 알리바바 자체 문서 기준 첫 패킷 지연 시간 200ms 이내를 목표로 하는 반면, StepAudio 3 TTS 스트리밍은 공개된 수치가 없음
• 티어링 — 표현력을 위한 Qwen-Audio-3.0-TTS Plus와 실시간을 위한 Flash, 여섯 개의 플래그십 보이스는 둘 중 한 티어에 고정 vs 단일 티어인 StepAudio 3 TTS
• 제어 인터페이스 — Qwen-Audio-3.0-TTS의 자연어 전달 지시와 입력 텍스트에 포함된 [excited], [laughing], [whispers] 같은 인라인 표현 태그 대 StepAudio 3 TTS 모델이 문맥에서 추론하는 운율
• 음성 복제 — StepAudio 3 TTS는 자체 TTS 티어 전반에서 복제 음성당 9.9위안의 균일 요금인 반면, Qwen-Audio-3.0-TTS는 Alibaba Cloud Model Studio를 통해 복제
• 출력 — Qwen-Audio-3.0-TTS 24 kHz 기본 샘플 레이트 vs StepAudio 3 TTS 미공개
그 제어 표면 행이 진짜 설계 차이이며, 이는 품질 문제가 아닙니다. Qwen의 표현 태그는 명시적이고 동기적입니다. 감정을 텍스트에 쓰면 모델이 이를 렌더링하므로 테스트 가능하고 회귀 친화적입니다. StepFun의 설명은 맥락에서 적절한 망설임이나 웃음을 추론하는 모델에 관한 것으로, 맞을 때는 더 좋게 들리지만 틀릴 때는 훨씬 잡아내기 어렵습니다. 연기를 직접 작성하고 싶은지, 아니면 위임하고 싶은지에 따라 선택하세요.

측정 없이 결정하는 방법
공개된 수치만으로는 답을 추론할 수 없습니다. 결정적인 수치가 존재하지 않기 때문입니다. 그렇다면 남는 것은 테스트이며, 이 둘을 테스트하는 일에는 계획해 볼 만한 특정한 형태가 있습니다.
둘 다 호스팅 전용 상용 API입니다 — Qwen-Audio-3.0-TTS는 Alibaba Cloud Model Studio를 통해, StepAudio 3 TTS는 StepFun의 오픈 플랫폼을 통해 제공됩니다. 둘 다 오픈 웨이트가 아니므로 평가할 수 있는 자체 호스팅 경로가 없습니다. 여기서 OrcaRouter가 무엇을 커버하는지 정확히 말하자면, 현재 저희 카탈로그에 있는 텍스트 음성 변환 모델은 OpenAI tts-1 패밀리, gpt-4o-mini-tts, 그리고 Google의 Gemini TTS 프리뷰입니다. 이 글에 나오는 모델 중 어느 것도 여기에 없으며, Qwen-Audio-3.0-TTS도 마찬가지입니다 — 여기의 어떤 내용도 저희가 이들을 제공한다는 주장으로 읽혀서는 안 됩니다.
OrcaRouter가 실제로 담당하는 부분은 파이프라인의 텍스트 절반입니다. 여러분의 합성 레이어가 읽는 스크립트는 언어 모델이 생성하는데, 바로 이 구성 요소가 가장 자주 바뀌고, 재계약 비용이 가장 많이 들며, 고정하지 않고 방치하기 가장 쉽습니다. 하나의 API 뒤에 거의 200개의 텍스트 모델, 자동 페일오버, 여러 모델을 하나의 호출로 조합하는 라우팅 DSL, 그리고 한 모델의 판단만으로는 충분하지 않을 때의 모델 퓨전이 있으며, 공급자 정가는 마크업 없이 그대로 전달됩니다. 이 두 합성 모델을 블라인드 평가한다면, 두 후보가 동일한 입력을 읽도록 하나의 엔드포인트를 통해 코퍼스를 생성하고, 합성 레이어는 교체할 수 있는 인터페이스 뒤에 두십시오.
이것이 결정을 어디에 두는가
폭넓은 범위가 필요하다면 오늘 Qwen-Audio-3.0-TTS를 선택하세요. 1,000개 이상의 음성, 16개 언어와 20개 방언, 문서화된 20,000자 요청 상한, 지연 시간 등급과 표현력 등급, 200ms 첫 패킷 목표, 그리고 StepFun보다 낮은 요금을 갖추고 있습니다. 이 모델은 이를 뒷받침하는 측정치와 더 넓은 지원 범위를 갖춘 모델이며, 4위 Elo는 사람들이 인용하듯 왕관은 아니라 해도 실제 결과입니다.
중국어 우선으로 구축 중이고, 티어 선택 결정 대신 하나의 티어를 원하며, 공개된 정액 요금으로 클로닝을 원하고, 블라인드 테스트를 거치지 않은 모델에 일찍 올라타도 괜찮다면 StepAudio 3 TTS를 선택하세요. 당신은 오차 막대가 겹치는 상태에서 25 Elo 뒤처졌던 모델보다 주장된 운율 개선 한 세대를 얻는 대가로 Qwen의 Plus 티어보다 문자당 약 27% 더 지불하는 것입니다.
이를 확정지을 것은 StepAudio 3 TTS를 풀에 넣고 아레나를 한 번 다시 실행하는 것이다. 그 투표가 이루어지기 전까지 이것은 측정된 모델과 측정되지 않은 모델을 비교하는 것이며, 두 전임 모델을 가르는 25점은 노이즈 범위 안에 있다. 이는 순위가 아니며, 순위인 것처럼 팔려서도 안 된다.
