'GPT-Live-1 vs Qwen-Audio-3.0-TTS'의 히어로 타이틀 카드. 부제는 '하나는 대화를 나누고, 하나는 대본을 렌더링한다', 배지에는 '대체재가 아님 — 하는 일도, 청구서도 다름'라고 적혀 있으며 세 장의 카드가 있다: 'Qwen-Audio-3.0-TTS Plus — Elo 1,232, AA Provider Voice Arena 4위, 100만 문자당 $27.6', 'GPT-Live-1 — 음성 1분당 $0.05, 전이중 통신, 열린 회선 1시간당 $3.00' 그리고 '주의점 — 내레이터 쪽에서 초당 약 16자, 텍스트 입력 및 오디오 출력'. 그 아래에는 'Qwen 수치는 Artificial Analysis 기준; GPT-Live-1 수치는 OpenAI 보고.'라고 적힌 푸터 스트립이 있다. OrcaRouter 로고는 오른쪽 아래에 합성되어 있다.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: 대화와 내레이터는 같은 항목이 아니다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

GPT-Live-1과 Qwen-Audio-3.0-TTS를 오디오 시간당 가격으로 나란히 비교해 보면 격차는 결정적으로 보인다: Alibaba의 Qwen-Audio-3.0-TTS-Plus는 백만 자당 $27.6, 즉 시간당 약 $1.66의 오디오를 생성하는 반면, OpenAI의 GPT-Live-1은 연속적인 오픈 라인 1시간에 $3.00을 청구한다. 내레이터가 더 저렴하니 내레이터가 이긴다 — 하지만 이것은 잘못된 비교이며, 그것이 잘못된 이유는 누구든 이 대결에서 얻을 수 있는 가장 유용한 점이다. Qwen-Audio-3.0-TTS는 텍스트 음성 변환 모델이다. GPT-Live-1은 전이중 대화형 모델이다. 둘 중 하나는 당신이 쓴 것을 읽는다. 다른 하나는 당신이 말을 끝냈는지 초당 여러 번 판단해야 한다.

하나는 렌더링하고, 하나는 대화한다

텍스트 음성 변환은 텍스트를 받아 오디오를 반환한다. 입력 오디오도 없고, 순서를 넘겨받을 일도 없고, 방해받는다는 개념도 없고, 반환할 전사본도 없다. 모델이 아무것도 듣지 않았기 때문이다. 이의 비용 모델은 인쇄기와 같다. 페이지를 넣고 오디오를 내보내며, 품질과 처리량이 중요한 유일한 두 수치이고, 출시하기 전에 둘 다 측정할 수 있다.

전이중 대화 모델은 나가는 오디오를 생성하는 동시에 들어오는 오디오를 처리한다. 그 역할에는 말과는 전혀 관련 없는 대화의 요소들도 포함된다 — 사용자가 멈추면 함께 멈추고, "yeah" 같은 맞장구를 끼어들기로 취급하지 않고 계속 이어가며, 문장 중간에 발언권을 넘기고, 대화 흐름을 놓치지 않은 채 도구 호출을 실행하는 것. GPT-Live-1은 이 모든 것을 해내며 세션과 함께 음성 인식 전사본을 반환하는데, 이는 처음부터 계속 듣고 있었기에 가능한 일이다.

제품이 기사를 소리 내어 읽거나, 문서를 오디오로 변환하거나, 비디오를 내레이션한다면, GPT-Live-1은 시간당 가격이 네 배나 되는 잘못된 도구입니다. 제품이 전화 통화를 받는다면, Qwen-Audio-3.0-TTS는 대화가 되기 위해 여전히 ASR 모델과 언어 모델이 필요한 파이프라인의 3분의 1에 불과합니다.

Qwen-Audio-3.0-TTS가 진정으로 최선의 답이 되는 경우

Alibaba의 모델에 대한 근거는 마케팅이 아니다. 2026년 7월 20일 Alibaba의 Tongyi Lab에서 출시되었고 Alibaba Cloud Model Studio를 통해 호스팅되는 폐쇄형 API로 공개된 Plus 티어는 출시 당시 Artificial Analysis의 텍스트 음성 변환 아레나에서 1위를 차지했다. 하지만 리더보드는 움직이는 표적이고, 이 리더보드도 움직였다: 2026년 9월 기준 Qwen-Audio-3.0-TTS-Plus는 Provider Voice Arena에서 2,306개 샘플에 걸쳐 Elo 1,232로 4위에 머물러 있으며, Cartesia Sonic 3.6(1,275), Inworld Realtime TTS-2(1,244), Speechify의 Simba 3.2(1,233) 뒤에 있다 — 이 세 모델은 그보다 나중에 출시된 8월과 7월의 모델이다. 20개가 넘는 모델 중 4위는 선두 자리를 잃었지만 가격 우위는 그대로인 상태에서도 여전히 강력한 위치다. 다만 출시 당시 보도가 묘사한 위치는 아니다.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

지원하는 16개 언어 중 10개 언어에서 앞서 있고, 20개의 중국어 방언 지역을 추가하며, 언어 간 복제를 포함해 짧은 샘플로부터의 음성 복제를 지원하고, 86개의 인라인 감정 및 전달 태그를 갖추고 있습니다.

주의사항이 계획을 세울 수 있을 만큼 구체적입니다.

• 처리량 — Plus는 초당 약 16글자를 생성하는 반면, Simba 3.2는 30.2글자, Gemini 3.1 Flash TTS는 27글자, Sonic 3.5는 약 120글자를 생성합니다. 배치 렌더링에서는 이는 눈에 띄지 않지만, 실시간 제품에서는 버퍼를 결정하는 숫자입니다.

• 가격 문서 — 널리 인용되는 백만 자당 $27.6은 Aliba​ba 자체 가격 페이지의 모든 스냅샷과 일치하지 않으며, 해당 페이지에는 시점에 따라 두 티어 모두에 대해 더 낮은 수치가 기재된 적도 있습니다. 예측하기 전에 리더보드의 수치가 아니라 계정 수준에서 현재 수치를 확인하세요.

• 음성 라이브러리 — 지원되는 언어가 16개임에도 불구하고, 공개 프리셋 음성은 거의 전부 중국어와 영어입니다. 나머지 열네 개 언어는 바로 사용할 수 있는 것이 아니라 클로닝 워크플로를 통해 존재합니다.

• 기능 게이팅 — 86개의 인라인 감정 태그는 단방향 스트리밍 모드에서만 작동하므로, 표현 제어 기능이 모든 통합 경로에서 유지되지는 않습니다.

• 티어 — Flash는 실시간 사용을 위해 약 300ms의 첫 패킷 지연 시간을 목표로 합니다. Plus는 품질 티어입니다. 이 둘은 같은 이름을 가진 서로 다른 제품이며, 잘못된 쪽을 고르는 것은 흔한 첫 실수입니다.

캐스케이드 법안의 솔직한 버전

시간당 비교가 빠뜨린 것이 있습니다. TTS 모델을 기반으로 구축된 대화형 제품은 캐스케이드입니다. ASR 모델이 발신자의 음성을 텍스트로 바꾸고, 언어 모델이 무엇을 말할지 결정하며, TTS 모델이 그것을 소리 내어 말합니다. 세 공급업체, 세 청구서, 합산되는 세 지연 예산, 그리고 운율이 죽는 각 경계에서의 인계가 있습니다. TTS 구간은 오디오 한 시간당 $1.66가 들 수 있습니다. 나머지 두 구간이야말로 돈과 실수가 실제로 있는 곳입니다 — 그리고 캐스케이드 모델은 이미 말하고 있는 문장 중간의 멈춤을 들을 수 없습니다.

GPT-Live-1은 세 가지 축을 하나의 세션과 하나의 미터로 통합하며, 음성 분당 $0.05에 추론 백엔드는 별도로 청구됩니다. 이 청구서를 정직하게 유지하는 두 가지 세부 사항이 있습니다. 세션 초기화는 음성 15초를 선불로 청구하되, 나중 사용 시간에 더해지는 것이 아니라 그에 대한 크레딧으로 처리합니다. 그리고 백엔드는 두 번째 미터입니다: 위임된 모든 추론 호출, 도구 호출, 웹 검색은 해당 모델의 일반 요금으로 청구되므로, 매 턴마다 검색하는 프런티어 추론 모델로 위임을 돌리면 값싼 음성 계층 뒤에서 값비싼 호출이 발생합니다.

독립적인 평가 기관들이 두 모델에 대해 하는 말은, 서로 다른 것을 측정하며 어느 쪽도 자기 대상 모델을 미화하지 않는다는 바로 그 점에서 교훈적이다. Qwen-Audio-3.0-TTS-Plus는 품질에서 4위이고 처리량에서는 거의 최하위다. GPT-Live-1은 Artificial Analysis의 Speech to Speech Index에서 11개 중 7위인 69.8%로 — 자신이 대체하는 GPT-Realtime-2.1의 73.9%보다 뒤처지면서 — 해당 지수의 입력 오디오 1시간당 비용 범위에서 최저 구간인 $4.42에 책정되는 반면, GPT-Realtime-2.1은 $10.75다. 어느 모델도 자기 범주에서 1위를 차지하지 못한다. 둘 다 자신들이 능가하기 위해 만들어진 상대보다 저렴하다.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

그 두 번째 미터기가 바로 라우팅 계층이 최적화가 아니라 설계 결정이 되는 지점이다. OrcaRouter는 GPT-Live-1도 Qwen-Audio-3.0-TTS도 취급하지 않는다. 두 경우 모두 음성 계층은 우리 손이 닿지 않는 영역이고, 우리는 그중 어느 것도 라우팅하지 않는다. 추론 구간은 다르다. 11개 업스트림 제공업체의 약 190개 모델이 마크업 없이 제공업체 정가로 하나의 키 뒤에 자리하고 있으며, 제공업체의 가격 인하는 다음 계약 갱신 때가 아니라 같은 날 반영된다. 캐스케이드라면 이것만으로 중간 구간을 온전히 커버한다. 두 개의 ASR 옵션과 세 개의 추론 모델을 하나의 엔드포인트 뒤에 두고, 실제 트래픽에서 서로 A/B 테스트하고, 자동 장애 조치가 통화를 끊지 않은 채 업스트림의 좋지 않은 오후를 흡수하게 하라.

음성 복제는 Qwen-Audio-3.0-TTS의 가장 상업적으로 유용한 기능이자 컴플라이언스 측면에서 가장 큰 노출 영역입니다. 10초의 참조 오디오만으로 화자를 언어에 관계없이 재현할 수 있는데, 이는 현지화에는 혁신적이고 신원이 중요한 곳에서는 어디든 부담이 됩니다. OpenAI는 GPT-Live-1을 클로닝도, 커스텀 보이스도 전혀 없이 출시했습니다 — 선택할 수 있는 API 보이스는 12개뿐이고, 그게 전부입니다.

그 비대칭성은 기능 비교에서는 쉽게 지나치기 쉽고, 리스크 검토에서는 지나치기 어렵다. 열두 가지 벤더 목소리 중 하나로만 말하는 제품은 "저 목소리는 누구의 것이며, 누가 이에 동의했는가"에 대해 샘플로부터 어떤 목소리든 재현할 수 있는 제품보다 훨씬 짧은 답을 내놓는다. 클로닝이 필요하다면 파이프라인 결정은 이미 내려진 것이고, 문제는 무엇이 그것을 통제하는가가 된다. 필요하지 않다면, GPT-Live-1의 한계는 직접 구축하지 않아도 되는 통제 수단으로서 읽어볼 가치가 있다.

어느 것을 사야 할까요

Qwen-Audio-3.0-TTS는 결과물이 콘텐츠—내레이션, 현지화, 접근성 오디오, 더빙—이거나, 오디오보다 텍스트가 먼저 존재하고 렌더링된 시간당 품질이 지표인 모든 워크플로라면 구매하세요. 실시간 재생이 필요하면 Flash로 시작하고, 음성 자체가 최종 결과물이라면 Plus로 이동하며, 클로닝 워크플로는 프리셋 음성과 별도로 가격을 책정하세요.

입력이 사람이라면 GPT-Live-1을 구매하세요. 지원 상담 라인, 예약 플로우, 초기 접수 면담, 사용자의 첫 음절이 모델이 문장을 말하는 도중에 들어오고 시스템이 말하는 쪽이 아니라 듣는 쪽처럼 행동해야 하는 모든 상황에 적합합니다. 오디오 1시간당 비용이 더 높고, 둘 중 유일하게 사용자가 중간에 끼어들 수 있는 모델입니다.

이 둘은 경쟁자라기보다 보완재인 경우가 훨씬 많습니다. 많은 제품이 Qwen-Audio-3.0-TTS가 문서를 읽고, 이어지는 통화는 듀플렉스 모델이 처리하기를 원합니다. 이 둘이 공유해서는 안 되는 것은 비용 모델입니다. 오디오 시간당 비용은 둘 중 정확히 하나에만 적합한 지표입니다.