
Realtime-Venus vs Qwen-Audio-3.0-TTS: 하나는 대본을 읽고, 다른 하나는 당신의 말을 들어야 한다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
The tempting comparison between Realtime-Venus and Qwen-Audio-3.0-TTS is price per hour of audio, and it produces a clean answer that is entirely wrong. Qwen-Audio-3.0-TTS-Plus renders speech at roughly $27.6 per million characters, which works out near $1.66 for an hour of finished audio. Realtime-Venus, the 9B full-duplex system Ant Group's Venus Team built with Tsinghua University, has no price at all because it has no hosted service — but self-hosted it would cost you a GPU node running continuously, which is at least an order of magnitude more per hour. The renderer wins on the arithmetic. The arithmetic is measuring two different products: Qwen-Audio-3.0-TTS takes text and returns audio, and Realtime-Venus takes audio and video and returns a conversation. The question that actually separates them is not what they output. It is whether anything has to talk back.
차이는 전적으로 입력에 달려 있습니다
Qwen-Audio-3.0-TTS는 2026년 7월 20일 알리바바 클라우드의 통이 랩(Tongyi Lab)이 공개한 텍스트 음성 변환 모델로, 오픈 웨이트 없이 호스팅형 API로 제공됩니다. 텍스트는 HTTP 엔드포인트를 통해 들어가고 오디오가 나옵니다. 오디오 입력 경로도, 주고받을 차례도, 반환할 전사도, 중단된다는 개념도 없습니다 — 이 모델은 어떤 것도 들어본 적이 없습니다. 이 모델의 전체 비용 모델은 인쇄기입니다: 문자가 들어가고, 오디오가 나옵니다.
이와 대조적으로 Realtime-Venus는 항상 청취하고 있습니다. 오디오-비주얼 체크포인트는 스트리밍 프레임을 위한 SigLIP2 시각 인코더와 Qwen3-8B 백본에 입력을 공급하는 Whisper-Medium 오디오 인코더를 갖추고 있으며, 두 체크포인트 모두 대화 상태를 지속적으로 업데이트하고 말할지 조용히 있을지 결정하는 1초 상호작용 루프를 실행합니다. 이것은 별도의 합성 단계 대신 이산 S3 토큰과 스트리밍 플로우 매칭 디코더를 통해 음성을 생성하며, 파형과 함께 텍스트를 반환할 수도 있습니다.
그것은 기능 차이가 아니다. 그것은 컴포넌트와 시스템의 차이다. 둘을 나란히 놓고 보면, 그중 하나는 앞단에 음성 인식기와 언어 모델이 이미 있는 파이프라인에 그대로 넣을 수 있다. 다른 하나는 그 세 가지를 모두 대체한다.
구체적인 사례를 하나 들면 내용이 구체화된다.
고객 지원 전화 한 통을 예로 들어 보세요. 한 고객이 전화를 걸어 문제를 엉망으로 설명하고, 계좌 번호를 찾느라 문장 중간에 말을 멈추고, 배경 안내 방송 때문에 방해를 받은 뒤, 상담원이 답변을 끝내기도 전에 추가 질문을 합니다.
Qwen-Audio-3.0-TTS를 기반으로 구축된 시스템은 이를 세 개의 벤더와 세 개의 청구서로 처리한다: 인식기가 발신자의 음성을 텍스트로 변환하고, 언어 모델이 무엇을 말할지 결정하며, Qwen-Audio-3.0-TTS가 그것을 말한다. 각 홉은 지연을 더하고, 각 경계는 운율이 죽는 지점이다. 결정적 실패는 구조적이다 — TTS 구간은 이미 말하고 있는 문장 중간의 멈춤을 들을 수 없으므로, 끼어들기는 그 앞에 있는 무언가가 처리해야 한다.
Realtime-Venus는 동일한 통화를 하나의 모델로 처리하며, 외부 음성 활동 감지기도, 핸드오프도 필요로 하지 않는다. Full-Duplex-Bench v1.5 수치 — 끼어들기에 대한 응답률 75%, 백채널 상황에서의 지속률 97%, 타인 대상 발화 상황에서 88%, 배경 발화 상황에서 86% — 는 바로 이 시나리오를 설명하는 지표들이다. 이 수치들은 또한 외부 재현 없이 모델 자체의 기술 보고서에서 자기 보고된 것이다. 이것들을 측정값이 아니라 설계 주장으로 읽어라.
음성 품질: 하나는 Elo가 있고, 다른 하나는 아무것도 없습니다
이것은 비교에서 가장 불균형한 부분이며, 알리바바에게 큰 차이로 유리하게 작용한다.
• 독립 점수 — Qwen-Audio-3.0-TTS-Plus는 2026년 9월 18일 기준 1,544개 샘플에서 Elo 1,259로 Artificial Analysis의 Provider Voice Arena에서 2위에 올랐으며, 1,277의 Cartesia Sonic 3.6에 뒤지고 1,247의 Inworld Realtime TTS-2와 1,241의 Speechify Simba 3.2보다 앞선다.
• 시작점 — 아레나 자체의 출시 항목 열에는 이 모델이 2026년 9월 항목으로 기재되어 있는데, 이는 2026년 7월 20일 출시일이 아니라 현재 채점된 그대로의 등급이다. 순위가 바뀔 때마다 그것은 줄곧 상위 두 자리를 지켜 왔다.
• Realtime-Venus — 아레나 등록도, 제3자 음성 평가도, 아무것도 없습니다. 음성 관련 수치는 자체 보고된 VoiceBench AlpacaEval 점수 4.81뿐이며, 보고서는 이 점수가 최고 비교 수치와 일치한다고 설명합니다.
• 그것이 의미하는 바는 — 저자들 외에는 아무도 Realtime-Venus의 소리가 좋은지 판단하지 않았다는 것입니다. 그것은 이 모델에 대한 흠이 아닙니다. 단지 알려지지 않았을 뿐이며, 알려지지 않은 것과 나쁜 것은 다릅니다. 하지만 음성 품질이 결과물이라면, Elo 등급이 매겨진 모델을 사는 것이 등급 없는 모델을 믿음으로 선택하는 것보다 낫습니다.


언어, 음성 및 표현 제어
Alibaba의 모델은 폭넓은 전달을 위해 설계되었습니다. 1,000개 이상의 음성을 제공하고, 20개 중국 방언 지역을 포함한 16개 언어를 지원하며, 감정과 전달을 위한 86개의 인라인 태그 — 텍스트 자체에 작성하는 제어 인터페이스 — 와 자연어 전달 지침을 노출합니다. 출력은 최대 48kHz까지 지원하며, 이전 세대의 24kHz에서 향상되었고, 단일 합성은 최대 3분까지 실행될 수 있습니다. Flash 티어는 실시간 재생을 위해 첫 패킷까지 약 300밀리초를 목표로 합니다. Plus 티어는 품질 티어로 초당 약 16자를 생성하는데, 이는 라이브 제품에서는 문제가 될 만큼 느리지만 배치 렌더링에서는 눈에 띄지 않습니다.
Realtime-Venus는 영어와 중국어 문서를 제공하고, 가중치와 함께 하나의 참조 음성을 배포하며, 음성 라이브러리가 아니라 토큰→파형 디코더를 제공합니다. Qwen이 말하는 표현력—태그, 지시문, 수천 개의 프리셋—은 여기에는 상응하는 것이 없습니다. 대신 이 모델이 가진 것은 자신이 듣고 있는 것에 반응해 말하는 방식을 바꾸는 능력인데, 이는 다른 종류의 표현 제어이며 사양서에 적어 넣기가 훨씬 어렵습니다.
솔직히, 각 경로의 비용
Alibaba 수치에는 누구든 그것으로 예산을 책정하기 전에 알아야 할 실제 주의사항이 있습니다. 널리 인용되는 백만 문자당 $27.6는 모든 스냅샷에서 Alibaba 자체 가격 페이지와 일치하는 것은 아니며, 티어는 별도로 가격이 책정됩니다. 이 표를 포함한 비교표를 믿기보다는 계정 수준에서 그 수치를 확인하세요.
Realtime-Venus에는 정가가 없다. 살 것이 없기 때문이다. 비용은 BF16으로 된 9B 체크포인트 두 개 — 활성화 메모리를 제외하고도 각각 약 18기가바이트에 달하는 가중치 — 에 더해 연속 스트리밍 루프, 즉 누가 호출하든 말든 월 단위로 과금되는 GPU 노드를 의미한다. 꾸준한 사용량에서는 대화당 비용이 종량제 음성 API보다 저렴하다. 간헐적인 사용량에서는 훨씬 더 나쁘며, 재무적으로 중요한 유일한 질문은 그 교차점뿐이다.
많은 팀이 결국 도달하게 되는 세 번째 경로가 있는데, 이는 결정의 형태를 바꾸기 때문에 이름을 붙여둘 가치가 있습니다. 캐스케이드를 유지한다면, 호스티드 모델이어야 하는 유일한 구간은 가운데 하나, 즉 추론입니다. OrcaRouter는 Qwen-Audio-3.0-TTS도 Realtime-Venus도 취급하지 않습니다. 두 음성 레이어 모두 우리가 제공하는 범위 밖이며, 그렇지 않은 듯이 암시하느니 차라리 그렇게 말하는 편이 낫습니다. 우리가 실제로 담당하는 구간은 바로 추론입니다: 하나의 키로 제공업체 정가 그대로, 마크업 없이 약 200개의 텍스트 모델, 한 제공업체의 안 좋은 하루 때문에 진행 중인 통화가 끊기지 않도록 하는 업스트림 전반의 자동 페일오버, 여러 모델을 하나의 호출로 조합하는 라우팅 DSL, 그리고 하나의 결정에 하나 이상의 의견이 필요할 때 쓰는 모델 퓨전입니다. 캐스케이드에서 계약 협상 없이 교체하고 싶어지는 구간이 바로 이곳이며, 벤더의 가격 인하가 갱신 시점이 아니라 같은 날 반영되는 곳이기도 합니다.

클로닝은 양날의 검이다
Qwen-Audio-3.0-TTS는 짧은 참조 샘플만으로 목소리를 복제할 수 있으며, 언어를 넘나들어서도 가능하고, 잡음이 많거나 잔향이 있는 입력에도 강건하다고 문서화되어 있습니다. 이는 이 비교에서 상업적으로 가장 유용한 단일 기능이며, 가장 큰 컴플라이언스 영역입니다. 10초 분량의 오디오로 어떤 화자든 재현할 수 있는 제품은 공급업체의 프리셋으로만 말하는 제품보다 "그 목소리는 누구의 것이며, 누가 동의했는가"라는 질문에 훨씬 더 긴 답을 내놓아야 합니다.
Realtime-Venus는 가중치와 함께 레퍼런스 보이스를 제공합니다. 오디오와 학습 실행이 있다면 이를 사용해 복제할 수 있지만, 릴리스의 그 어떤 부분도 그 과정을 쉽게 만들도록 설계되어 있지 않습니다. 이는 규정 준수 경계 내에서 자체 호스팅하는 배포 환경에서는 어쩌면 더 안전한 기본값이라고 할 수 있습니다.
당신이 실제로 구매하는 것은 어느 것인가요?
오디오가 출력물일 때 Qwen-Audio-3.0-TTS를 구매하세요. 내레이션, 현지화, 접근성, 더빙, 즉 텍스트가 사운드보다 먼저 존재하고 렌더링된 시간당 품질이 지표인 모든 워크플로입니다. 재생이 라이브라면 Flash로 시작하고, 음성 자체가 제품이라면 Plus로 이동하며, 클로닝 워크플로는 프리셋 라이브러리와 별도로 가격을 책정하세요.
입력이 사람이고 시스템이 청자처럼 행동해야 할 때는 Realtime-Venus를 선택하세요. 카메라 인식 지원, 핸즈프리 상호작용, 사람이 문장 중간에 끼어들고 시스템이 이를 처리해주기를 기대하는 모든 상황이 여기에 해당합니다. 그 대가는 극명합니다. Elo 등급의 음성, 수천 개의 프리셋, 그리고 모든 호스팅 옵션을 포기하는 대신, 둘 중 유일하게 당신의 말을 들을 수 있는 쪽을 얻습니다.
대부분의 제품은 둘 다를 원하지만, 그것도 각기 다른 위치에서 원한다. 이 둘이 공유해서는 안 되는 것은 비용 모델이다 — 오디오 시간당 가격은 이 두 모델 중 정확히 하나에만 맞는 지표이며, 그것도 대화를 나누고 있는 쪽은 아니다.
