'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS'를 위한 생성된 히어로 카드로, 흰색 배경에 부드러운 파란색-청록색 그라데이션 액센트가 있습니다. 왼쪽 카드 'Qwen-Audio-3.0-TTS-Plus'에는 Elo 1,259, 15개의 아레나 보이스, 16개 언어 + 20개 방언, 그리고 100만 문자당 $27.6이 나열되어 있습니다; 오른쪽 카드 'Gemini 3.8 Flash TTS'에는 Elo 1,260, 8개의 아레나 보이스, 130개 언어, 그리고 100만 문자당 $33.0이 나열되어 있습니다. 하단 푸터에는 'Artificial Analysis Provider Voice Arena 기준 Elo, 2026년 9월.'이라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: '제대로 된 소리'를 만드는 두 가지 다른 해법

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Artificial Analysis Provider Voice Arena에서 이 두 모델을 갈라놓는 것은 단 1 Elo 점이며, 두 모델은 완전히 다른 문제를 해결함으로써 그 지점에 도달했습니다. Qwen-Audio-3.0-TTS-Plus는 1,447개 샘플과 15개 아레나 음성에서 Elo 1,259로 3위에 올랐으며, 2026년 9월에 출시되어 100만 자당 $27.60에 책정되었습니다. Gemini 3.8 Flash TTS는 1,999개 샘플과 8개 아레나 음성에서 1,260으로 2위에 올랐으며, 2026년 9월 23일에 출시되어 100만 자당 $33.00에 책정되었습니다. 통계적으로는 구분할 수 없지만 가격은 20퍼센트 차이가 나며, 합성 음성을 무엇이 좋게 만드는가에 대한 정반대의 이론 위에 세워져 있습니다.

이론이야말로 흥미로운 부분이다. Qwen의 답은 인라인 제어다. 텍스트 전반에 뿌려 넣는 86개의 전달 태그를 통해 모델이 어디에서 숨을 쉬고, 어디에 강세를 두고, 어디에서 레지스터를 전환해야 하는지 알 수 있다. Google의 답은 연출 계층이다. 줄 단위 지시, 두 화자 스테이징, 그리고 소수의 비언어적 큐로 구성된다. 이미 SSML 유사 주석을 출력하는 파이프라인을 구축해 두었다면, 이 중 하나는 잘 맞고 다른 하나는 맞지 않을 것이며, 그 호환성은 단일 Elo 점수보다 더 중요하다.

둘이 실제로 보드에서 어디에 앉아 있는지

Provider Voice Arena를 정직하게 읽으려면 순위가 아니라 구간을 봐야 합니다.

• Qwen-Audio-3.0-TTS-Plus — 3위, Elo 1,259, 샘플 1,447개, 아레나 음성 15개, 2026년 9월, 100만 자당 $27.6.

• Gemini 3.8 Flash TTS — 2위, Elo 1,260, 1,999개 샘플, 8개 아레나 보이스, 2026년 9월, 100만 문자당 $33.0.

• Cartesia Sonic 3.6 — 1위, Elo 1,273, 1,757개 샘플, 8개 아레나 음성, 2026년 8월, 100만 자당 $49.0.

상위 세 곳은 하나의 묶음이다. 상위 두 곳의 공표된 구간은 양쪽으로 17포인트씩 이어지는데, 이는 1위와 3위 사이의 전체 격차보다 넓다. 따라서 그들 사이의 순서는 안정적인 증거가 아니다. 이 순위표가 분명히 보여주는 것은 세 곳 모두 선두 그룹에 속하며 그 아래에는 아무것도 가까이 있지 않다는 점이다 — 10위인 Gemini 3.1 Flash TTS는 1,199에 있다.

주목할 만한 한 가지 비대칭성은 아레나 음성 수다. Qwen은 Gemini의 8개에 비해 15개 음성을 내세우므로, Qwen 점수는 해당 벤더 자체 제품의 더 넓은 표본에 대한 평균이다. 이는 양쪽으로 작용한다. Qwen 카탈로그 전반이 어떤 소리를 내는지에 대한 더 공정한 추정치이면서, 동시에 Qwen이 평균을 끌어내리는 약한 음성을 내놓을 기회를 더 많이 준다. 어느 해석이든 두 제품이 동률이라는 결론은 달라지지 않는다.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

방향 레이어에 대한 86개의 전달 태그

이것이 실질적인 차이이며, 대부분의 통합을 결정합니다.

Qwen-Audio-3.0-TTS는 86개의 인라인 전달 태그를 제공합니다 — 텍스트에 내장되어 특정 구간이 어떻게 발음될지 제어하는 주석입니다. 이는 마크업 방식입니다: 여러분의 스크립트가 연출을 담당합니다. SSML을 다뤄 본 사람이라면 익숙할 것이며, 제어 표면이 API 호출이 아니라 문자열 변환이기 때문에 텍스트를 프로그래밍 방식으로 생성하는 도구와도 잘 어울립니다.

Gemini 3.8 Flash TTS는 다른 방식을 택합니다. 배우를 연출하듯이 대사를 연출합니다 — 속도, 강조, 감정적 톤을 — 인라인 마크업이 아니라 별도의 지시로 말이죠. 두 화자가 나오는 장면은 한 번의 호출 안에서 연출할 수 있습니다. 그리고 소수의 비언어적 신호가 대본에 적혀 있습니다: <laughs>, <sigh>, <gasp>가 인라인 신호로, 그리고 |mhm||yeah|는 맞장구 소리로 쓰입니다.

두 모델 모두 텍스트 내 주석을 허용합니다. 차이는 어휘의 크기와 나머지 제어가 어디에 있는지입니다. Qwen의 방식은 더 넓고 평평합니다 — 86개 태그가 모두 텍스트 안에 있습니다. Google의 방식은 텍스트 안에서는 더 좁고 텍스트 밖에서는 더 넓으며, 전달 방향과 화자 배치를 호출 수준 매개변수로 둡니다. 이미 풍부한 인라인 마크업을 출력하는 시스템을 포팅한다면 Qwen이 포팅하기 더 짧습니다. 어차피 애플리케이션 코드에서 방향 로직을 만든다면 Google의 분리가 더 깔끔합니다.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

언어 범위 대 방언 범위

커버리지 수치는 비교할 수 없으며, 이를 단순하게 비교하는 것은 실수입니다.

Gemini 3.8 Flash TTS는 텍스트에서 자동 감지되는 130개 언어를 지원하고, Flash-Lite TTS는 101개 언어를 지원합니다. 이는 여러 어족을 아우르는 폭넓은 범위로, 롱테일 시장까지 도달해야 하는 현지화 작업에 꼭 필요한 것입니다.

Qwen-Audio-3.0-TTS는 16개 언어와 20개 중국 방언 지역을 지원합니다. 이는 하나의 어족 내부에서의 깊이입니다. 20개 방언 지역은 겉보기처럼 130개 언어보다 작은 숫자가 아닙니다. 그것은 다른 종류의 주장이며, 중국 본토 지역 전역의 중국어 사용자를 대상으로 하는 제품에는 더 유용한 주장입니다. 130개 언어를 지원하지만 만다린 음성 하나만 제공하는 모델은, 20개 방언 지역을 지원하는 모델처럼 쓰촨의 사용자에게 서비스를 제공하지는 못합니다.

무엇이 중요한지는 전적으로 여러분의 대상 독자에 달려 있습니다. 요구 사항이 "스무 개 시장에서 최소한 그럭저럭 통할 정도"라면 Gemini입니다. "중국 시장에서 실제로 제대로 맞는 것"이라면 Qwen입니다.

가격, 그리고 문자당 수치가 숨기는 것

• Qwen-Audio-3.0-TTS-Plus — 리더보드의 정규화 기준으로 100만 문자당 $27.60; Flash 변형은 100만 문자당 약 $15이며, 첫 패킷 지연 시간은 약 300ms라고 주장됩니다.

• Gemini 3.8 Flash TTS — 정규화된 문자 100만 개당 $33.00; Google은 2026년 12월 31일까지 입력 텍스트 토큰 100만 개당 $0.50, 출력 오디오 토큰 100만 개당 $9.00로 청구하며, 이후에는 $1.00 및 $18.00입니다.

• Gemini 3.8 Flash-Lite TTS — 정규화된 100만 문자당 $22.10, 6위, Elo 1,235; 2026년 12월 31일까지 100만 오디오 토큰당 $6.00 청구됨.

두 문자당 수치 모두 Artificial Analysis의 정규화 값이며, 공급업체 정가가 아닙니다 — Qwen은 Alibaba Cloud Model Studio를 통해 청구하고 Google은 토큰 단위로 청구하며, 두 곳 모두 이 모델들에 대한 문자당 요금을 공개하지 않습니다. 이 수치는 Qwen에 대략 1.2배 유리한 비율을 확인하는 용도로 사용하고, 견적으로 사용하지 마세요.

티어들은 그 형태가 서로 다르게 갈라진다. Qwen은 Plus와 Flash로 나뉘는데, Flash 티어는 품질을 희생하는 대신 약 300ms의 첫 패킷(first-packet)을 내세운다. Google은 Flash와 Flash-Lite로 나뉘고, 다시 Standard, Batch, Flex, Priority로 더 세분화된다 — Flash TTS에서 백만 오디오 토큰당 $4.50, $9.00, $16.20. Google의 모델은 워크로드를 분류하는 데 보상을 주고, Qwen의 모델은 처음부터 품질 티어를 선택하는 데 보상을 준다.

가용성은 또 다른 실질적인 차이입니다. Gemini 3.8 Flash TTS는 Gemini Developer API에서 정식 제공됩니다. Qwen-Audio-3.0-TTS는 폐쇄형이며 호스팅 전용으로, 오픈 가중치 없이 Alibaba Cloud Model Studio를 통해 제공됩니다. 모델을 직접 실행해야 한다면 이 둘 중 어느 것도 적합하지 않습니다. 하지만 인프라가 이미 Alibaba Cloud에 있다면, Qwen 모델은 이그레스 관련해 따져볼 것이 없는 쪽입니다.

양측 벤더의 주장

Neither model has an independent benchmark beyond the arena, and both vendors have published claims that should be labelled as such. → 어느 모델도 아레나 외에 독립적인 벤치마크를 갖추고 있지 않으며, 두 업체 모두 그렇게 표시되어야 할 주장을 공개했습니다.

구글의 Gemini 3.8 Flash TTS 관련: Hume AI Voice Design Benchmark에서 71.4로 1위, 악센트 모델링에서 60.8로 1위, Flash와 Flash-Lite의 Hume Overall Quality Index에서 1위와 2위, 그리고 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어에서 최상위 블라인드 선호 순위를 주장했다. 해당 실행들은 공개되지 않았다.

Alibaba의 Qwen-Audio-3.0-TTS의 경우: 86개 태그 전달 시스템, 20개 방언 지역, 그리고 Flash 변형에서의 ~300ms 첫 패킷 수치. 또한 재현되지 않음.

아레나 Elo는 이 글에서 독립적으로 수집된 유일한 품질 수치이며, 둘이 순위표 최상단에서 동점임을 보여준다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Gemini가 추가하지만 Qwen은 추가하지 않는 것

음성 생성이 가장 뚜렷한 격차다. Gemini 3.8 Flash TTS는 자연어 설명을 통한 음성 디자인과 30초 샘플로부터의 음성 복제를 지원하며, 동의 확인과 SynthID 워터마크 및 출력물에 대한 C2PA 자격 증명이 함께 제공된다. 사용자 지정 음성은 두 가지 형태로 제공된다. 프로젝트당 1년의 수명을 가진 200개의 상태 저장(stateful) 음성, 또는 voicekey_... 핸들로 지정되며 7일 후 만료되는 상태 비저장(stateless) 음성이다. 음성 리믹싱은 곧 제공될 예정으로 기재되어 있다.

출력 형식 제어가 두 번째입니다. 단일 엔드포인트에서는 WAV 24 kHz 모노 16비트 부호 있는 PCM, 스트리밍 엔드포인트에서는 헤더 없는 PCM(audio/l16), 그리고 audio/mulaw와 audio/alaw 및 설정 가능한 샘플 레이트를 지원합니다. 텔레포니와 인접한 작업의 경우 mulaw 지원은 트랜스코딩 단계를 하나 없애 줍니다.

어느 것을 불러야 하나요

사용자가 중국어권이고 방언 지원이 요구 사항이라면, 생성기가 직접 출력할 수 있는 풍부한 인라인 마크업 어휘를 원한다면, 또는 이미 Alibaba Cloud를 사용 중이고 작동하는 엔드포인트까지 가장 짧은 경로를 원한다면 Qwen-Audio-3.0-TTS를 선택하세요. 또한 정규화 기준으로 둘 중 더 저렴하며, 약 300ms의 첫 패킷이 허용된다면 Flash 변형이 더 저렴합니다.

한 언어에서의 깊이보다 여러 언어에 걸친 폭넓은 지원이 필요하거나, 특정 음성을 만들거나 복제해야 하거나, mulaw 또는 alaw 출력이 필요하거나, "호스팅 전용이 아닌 일반 제공"이 조달 요건인 경우에는 Gemini 3.8 Flash TTS를 선택하세요.

어느 쪽도 나쁜 선택이 아니며, 어느 쪽이 확실히 더 낫지도 않습니다 — 그것이 바로 Elo 1점 차이의 핵심입니다. 결정은 품질이 아니라 호환성의 문제입니다.

그것이 또한 아직 어느 쪽에도 확고히 전념하지 않는 이유이기도 합니다. OrcaRouter는 단 하나의 키로 200개 이상의 모델을 공급사 정가에 마크업 없이 제공하므로, 어느 연구소에서 요금이 변경되든 갱신 시점이 아니라 그날 바로 청구서에 반영되며, 자동 장애 조치 덕분에 부하 상황에서 흔들리는 합성 엔드포인트가 요청을 드롭하는 대신 다른 곳으로 넘어갑니다. 저희는 Qwen-Audio-3.0-TTS를 호스팅하지 않습니다 — 그것은 Alibaba Cloud Model Studio를 통해 제공됩니다 — 그리고 Google의 API에서 제공되는 Gemini 3.8 TTS 엔드포인트도 호스팅하지 않습니다. 저희가 담당하는 것은 텍스트 계층과 그 위의 라우팅이며, 이것이 바로 선택하기 전에 한 달 동안 실제 트래픽으로 둘 다를 운영할 수 있게 해주는 것입니다.

주목해야 할 숫자는 다음 아레나 개정판이다. Qwen에서 1,447개, Gemini에서 1,999개의 샘플이 있지만, 두 구간은 여전히 충분히 넓어서 한 달치 투표만으로도 둘을 갈라놓을 수 있고 — 아니면 동점이 답임을 확인해 줄 수도 있다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트