
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: 8일 간격으로 가격이 재조정된 보이스 스택의 두 반쪽
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Gemini 3.8 Live는 2026년 9월 15일 gemini-3.8-live 및 gemini-3.8-live-extended-thinking로 Live API에 출시된 구글의 음성 대 음성(speech-to-speech) 모델입니다. Qwen-Audio-3.1-TTS는 8일 뒤인 2026년 9월 23일 항저우에서 열린 Apsara Conference에서 발표된 알리바바의 텍스트 음성 변환 모델로, 음성 합성 요금을 약 70% 인하한다는 내용이 함께 발표되었습니다. 이 8일의 격차가 바로 이 비교를 7월이 아니라 지금 읽을 가치가 있게 만드는 이유입니다. 두 제품의 역할은 전혀 달라지지 않았습니다. 하나는 듣고 말하고, 다른 하나는 텍스트를 소리 내어 읽습니다. 그러나 프로덕션 음성 파이프라인의 양쪽 절반이 단 2주 만에 재구축되거나 가격이 다시 매겨졌고, 이 맞대결의 승부를 가르던 계산법도 조용히 달라졌습니다.
8일 간격으로 새로 고침되는 두 개의 절반
이 페어링을 남다르게 만드는 것부터 짚어보자: 두 모델은 경쟁하지 않는다. 음성 제품에는 입과 귀가 있고, 이 둘은 각각 그중 하나씩을 맡는다. Gemini 3.8 Live는 루프를 닫는다 — 오디오와 비디오 입력, 오디오 출력, 끼어들기 처리, 대화 밑에서 실행되는 도구 호출까지. Qwen-Audio-3.1-TTS는 문자열과 참조 음성을 받아 하나의 연기를 돌려준다. 그것은 다른 무엇보다 뛰어난 입이며, 귀가 되려고 하지 않는다.
9월이라는 시점이 흥미로운 이유는 두 발표가 같은 예산 항목의 양쪽 끝을 겨냥하고 있다는 점이다. Google의 9월 15일 출시는 가격 변동이 따르지 않은 기능 이야기였고, Alibaba의 9월 23일 발표는 새로운 기능이 곁들여진, 대부분 마진 이야기였다. 8월에 하이브리드 파이프라인을 구축한 팀은 불과 8일 만에 두 축을 모두 재검토할 이유를 떠안게 됐다. 그리고 그중 한 축만 더 저렴해졌다.
3.1 릴리스가 Qwen 쪽에서 실제로 바꾼 것
알리바바가 9월 23일에 내놓은 것은 모델 하나가 아니었다. 3.1 세대는 Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next, Qwen-Audio-3.1-Realtime이라는 다섯 개 엔드포인트를 아우르며, 그중 오직 하나인 일반 TTS 티어만이 이미 3.0 TTS 모델을 호출하고 있는 사용자에게 바로 대체 가능한 드롭인이다.
해당 티어에서는 세 가지가 바뀌었고, 그중 하나는 실질적인 마이그레이션 비용이다. 전달 제어가 86개의 인라인 태그로 이루어진 고정 어휘에서 자연어 지시로 옮겨갔다. 올바른 위치에 올바른 대괄호를 삽입하는 대신, 원하는 감정과 속도, 스타일을 설명하면 된다. 언어 간 음색 전이도 도입되어, 하나의 참조 음성이 만다린, 광둥어, 영어, 일본어에 걸쳐 고유한 정체성을 유지할 수 있게 되었다. 그리고 이제 모델은 별도의 노이즈 제거 단계 없이 잡음이 많거나 에코가 있는 참조 오디오를 직접 견딜 수 있다. 언어 지원 범위는 벤더 보고 기준으로 16개 언어와 20개 중국 방언 지역에서 변함없으며, — 다른 곳에서는 이 부분이 얼버무려지기 때문에 짚고 넘어갈 가치가 있다 — Alibaba 자체 자료에서는 3.1 티어가 7개 언어를 추가한다고 하지만, 이는 7월 세대의 공개된 지원 범위에 나열된 16개와 일치하지 않는다. 필요한 특정 언어를 Model Studio와 대조해 확인할 때까지는 두 수치 모두 벤더 보고 기준으로 취급하세요.
이번 릴리스에서 진정으로 새로운 제품은 Qwen-Audio-3.1-TTS-Next로, Alibaba는 이를 "Audiogen" 모델이라고 부릅니다. 한 번의 패스로 음성, 음향 효과, 배경 앰비언스를 함께 생성하며, 다중 화자 대화, 팟캐스트 구성, 장면 작업에 사용됩니다. 베이징 노드에서 입력 토큰 100만 개당 $0.848, 출력 토큰 100만 개당 $1.696에 책정되어 있고, 입력은 최대 3,000자, 생성 오디오는 팟캐스트의 경우 240초, 그 외의 경우 120초, 초당 요청 수는 3회, 각 30초짜리 참조 클립은 최대 3개까지 받습니다. 중국어와 영어만 처리합니다. 파이프라인이 대본을 읽는 단일 내레이터라면 그 제품은 여러분과 무관하고, 두 진행자와 음악 베드라면 이번 릴리스를 살펴볼 이유가 바로 그것입니다.
이음새야말로 당신이 실제로 선택하고 있는 것이다.
두 모델은 같은 일을 하지 않기 때문에, 이 결정은 맞대결이 아니다. 그것은 핸드오프를 어디에 둘 것인지, 그리고 그 이음새가 보이지 않게 하는 데 얼마를 기꺼이 지불할 의향이 있는지에 관한 문제다.
두 가지 정직한 아키텍처가 있습니다. 첫 번째는 단일 네트워크입니다: Gemini 3.8 Live가 전체 턴을 처리하며, 발신자의 말을 듣고, 무엇을 말할지 결정하고 말합니다. 그리고 여러분은 그것이 제공하는 목소리를 받아들입니다 — 복제할 수도, 브랜딩할 수도 없는 목소리입니다. 두 번째는 캐스케이드입니다: 인식, 그다음 추론, 그다음 입 역할을 하는 Qwen-Audio-3.1-TTS입니다. 여러분의 자체 성우가 녹음한 목소리 하나를 포함해 천 개의 목소리를 제공하지만, 두세 개 벤더 경계를 넘나드는 지연과 문장이 API 호출에 걸쳐 분할될 때 잃게 되는 운율이라는 대가를 치릅니다.
대부분의 팀은 결국 둘 다 갖추게 되는데, 그것은 배짱이 부족한 게 아니다. 지연 시간이 체감되는 곳에는 실시간 모델을 사용하라 — 끼어들기, 확인 응답, 발신자에게 당신이 아직 거기 있다고 알려주는 "음-흠" — 그리고 품질이 들리는 곳에는 합성 모델을 사용하라: 정책을 길게 다시 읽어주기, 확인 번호를 신중한 속도로 읽기, 모든 단일 통화에서 똑같아야 하는 브랜드 음성. 하이브리드는 많은 제품군에서 올바른 답이다. 또한 비용 모델이 어려워지는 지점이기도 한데, 이제 서로 다른 두 단위를 계량하고 있기 때문이다.

오디오 시간당으로 가격이 책정되며, 이는 둘 모두에게 맞는 유일한 단위입니다.
Google은 Live API에 대해 분 단위로 과금하고, Alibaba는 Qwen TTS 티어에 대해 문자당 및 토큰당 과금한다. 둘을 비교하려면 정규화 기준을 하나 골라야 하는데, 음성에 대해 정당화할 수 있는 유일한 기준은 완성된 오디오 1시간이다.
• 입력 과금 — Gemini 3.8 Live는 오디오 1분당 입력 $0.005, 출력 $0.018인 반면, Qwen-Audio-3.1-TTS는 백만 자당 과금이며, 3.0 Plus 티어는 약 $27.60, Flash 티어는 인하 전 약 $15, TTS Flash 티어는 인하 후 입력 토큰 백만 개당 1.5위안, 출력 토큰 백만 개당 12위안
• 출력 과금 — Gemini 3.8 Live의 양방향 대화는 정가 기준 실제 통화 1시간당 약 $1.38(캐싱 적용 전)인 반면, Qwen-Audio-3.1-TTS는 단방향 스트림이며, 3.1-Next 티어는 베이징 노드에서 입력 토큰 백만 개당 $0.848, 출력 토큰 백만 개당 $1.696
• 발신자 청취 — Gemini 3.8 Live 예, 네이티브 오디오 및 비디오 입력 지원 vs Qwen-Audio-3.1-TTS 아니요, 텍스트 입력 및 오디오 출력
• 음성 — Gemini 3.8 Live 음성 1개, 복제 불가, 브랜딩 불가 vs Qwen-Audio-3.1-TTS 1,000개 이상, 잡음 섞인 참조 오디오에서 제로샷 복제 지원
• 언어 — Gemini 3.8 Live는 벤더 보고 기준 97개, 대화 중 전환 가능 vs Qwen-Audio-3.1-TTS는 벤더 보고 기준 16개에 중국 방언 20개 지역 추가, 만다린, 광둥어, 영어, 일본어 간 음색 전이 지원
• 전달 제어 — Gemini 3.8 Live는 프롬프트 및 대화 맥락 vs Qwen-Audio-3.1-TTS는 자연어 지시, 3.0 세대의 86개 인라인 태그를 대체
• 독립 점수 — Gemini 3.8 Live는 Artificial Analysis Speech to Speech Index에서 Extended Thinking 변형 82.6점, 표준 변형 76.0점 vs Qwen-Audio-3.1-TTS는 없음; 가장 근접한 Qwen 수치는 Provider Voice Arena에서 이전 세대 3.0 Plus 티어의 Elo 1,259로, 이는 전신 모델에 대한 점수이며 이 모델에 대한 점수가 아님
비율 할인은 지역과 등급에 따라 달라지는 요금을 기준으로 제시되므로, 대표 문구의 70%는 귀하의 트래픽에 대한 약속이 아닙니다. 또한 Alibaba Cloud는 싱가포르 노드의 실시간 전사를 길이 기반에서 토큰 기반 과금으로 전환했는데, 이는 침묵과 다중 턴 문맥 모두 토큰 소비를 증가시키기 때문에 예측하기 더 어려운 기준입니다. 새 요금표를 귀하의 오디오와 대조해 보십시오.

3.1 업그레이드가 해결하지 못하는 것
다음은 양방향 모두에서 잘못 짚기 쉬운 부분입니다. 3.1 개선 사항은 Qwen-Audio-3.1-TTS를 Gemini 3.8 Live가 하는 일을 맡을 후보로 만들어 주지 않습니다 — 지시 기반 제어, 음색 전이, 잡음 입력 허용성은 모두 그것을 더 나은 입으로 만들어 주지만, 그중 어느 것도 그것에 귀를 달아 주지는 않습니다. 마찬가지로 Gemini 3.8 Live의 벤치마크상 위치는 여러분의 브랜드 음성이 광둥어 문장 하나를 견뎌 내는지에 대해 아무것도 알려 주지 않습니다.
가격 인하가 더 매력적으로 느껴져 무시하게 만드는 증거에는 구멍도 있습니다. Qwen-Audio-3.1-TTS에는 독립적인 점수가 없습니다. Provider Voice Arena에서 Qwen 이름 옆에 표시되는 1,259 Elo는 대체되는 모델인 Qwen-Audio-3.0-TTS-Plus의 것이며, 1,447개 샘플에서 측정된 값입니다. 후속 모델 자체의 Arena 행은 아직 존재하지 않습니다. 귀하의 승인 절차에 제3자 숫자가 필요하다면 — 그리고 브랜드 보이스라면 아마 그래야 할 것입니다 — 숫자가 없는 쪽이 더 새로운 모델이고, 아직 방어할 수 없는 쪽이 더 저렴한 등급입니다. 이를 해소할 단 하나의 사건은 Qwen-Audio-3.1-TTS가 블라인드 청취 평가 보드에 등장하는 것입니다.
하나의 키가 도움이 되는 경우와 그렇지 않은 경우
3.1 릴리스의 한 가지 결과는 인프라 세부 사항이 아니라 프롬프트 엔지니어링 세부 사항처럼 보이기 때문에 놓치기 쉽습니다. 86개의 하드코딩된 태그를 자유 형식 지시로 대체하면 전달 지침이 텍스트 산출물이 됩니다. 이제 이를 생성하고, 버전을 관리하며, 새 모델의 해석에 비추어 그것들 모두를 다시 검증해야 합니다. 그리고 실패 모드는 오류가 아니라 드리프트입니다. '따뜻하지만 감상적이지 않은'이라는 같은 뜻의 두 표현이 똑같이 받아들여지지는 않을 테니까요.
이것은 음성 파이프라인을 감싸고 있는 텍스트 추론 문제이며, 바로 여기에서 우리가 쓸모가 있습니다. OrcaRouter는 Qwen-Audio-3.1-TTS나 그 어떤 Qwen-Audio 모델도 라우팅하지 않으며, Gemini 3.8 Live 엔드포인트도 라우팅하지 않습니다 — 이 스택의 어느 쪽도 우리를 통해 호출할 수 없고, 여기에서 그것이 가능하다는 주장으로 읽혀서는 안 됩니다. 우리가 제공하는 것은 지시 텍스트를 작성하고 검사하는 계층입니다: qwen/qwen3.8-flash 그리고 google/gemini-3.8-flash를 포함해 200개 이상의 모델 가운데, 마크업 없이 제공사 정가로 단일 키에서, 여러 모델을 하나의 호출로 구성하는 라우팅 DSL과 자동 페일오버를 제공합니다 — 업스트림이 저하될 때 말이죠. 방금 프롬프트를 읽는 방식을 바꾼 모델을 대상으로 1만 개의 배송 프롬프트를 다시 검증하려 할 때, 변형을 생성하고 일관성을 채점하는 일은 하나의 계약이어야 하는 부분이지, 네 개여서는 안 됩니다.
선택하기 전에 무엇을 측정해야 할까
세 가지 실험이 어떤 이사회보다 더 많은 답을 준다. 참조 음성 하나와 직접 작성한 대본 한 문단을 Qwen-Audio-3.1-TTS에 넣고, 지시 기반 제어가 두 번 모두 동일한 발화를 만들어 내는지 들어 보라 — 그것이 마이그레이션 위험이며, 이를 감안해 계획하는 것보다 측정하는 편이 더 저렴하다. 자신의 배경 소음이 담긴 실제 통화 녹음을 Gemini 3.8 Live에 넣고, 발신자가 단어 중간에 끼어들 때 턴테이킹이 유지되는지 확인하라 — 그것이 음성 대 음성 지수가 정량화하려는 것이며, 실제 전화선과 맞닥뜨렸을 때 믿고 받아들일 만큼 안정적으로 버티지 못한다. 그리고 두 공급업체가 청구서에 쓰는 단위가 아니라 오디오 시간 기준으로 자신의 사용량을 계산하라, 왜냐하면 이 특정 조합에서 "저렴한 중국산 TTS"와 "Google 플래그십" 사이의 예상 가격 차이는 보이는 것만큼 크지 않았고, 9월 23일 이후에는 더욱 작기 때문이다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
