
GPT-Live-1 vs Inworld Realtime TTS-2: 음성에는 가격 전쟁, 듣기에는 프리미엄
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Inworld Realtime TTS-2가 정식 출시되면서 음성 시장에 없던 무언가를 내놓았다. 바로 공개된 요금표다. 플래그십 모델은 온디맨드 기준 100만 자당 25달러이며, 더 빠른 형제 모델인 Inworld Realtime TTS-2 Flash는 15달러다. 두 모델 모두 볼륨 티어에 따라 각각 12.50달러와 7달러까지 내려간다. Artificial Analysis의 음성 아레나에서 Elo 1,244로 2위에 올라 있는 만큼, 이 플래그십은 현재 아레나 선두 모델의 약 절반 가격이며, 상위 5위권 음성을 구매하는 가장 저렴한 방법 중 하나다. GPT-Live-1은 이 비교의 다른 모델이자 정반대의 제안이다. 음성 1분당 0.05달러이고, 문자는 전혀 개입되지 않으며, 딸려 오는 듣기와 발화 순서 조정, 끼어들기 처리를 함께 사지 않고서는 구매할 방법이 없다.
흥미로운 점은 이 둘을 비교해 보면 가격 차이가 엄청나 보이다가 대부분 사라진다는 것입니다. 합성은 가격 전쟁 중입니다. 대화는 그렇지 않습니다.
Inworld가 실제로 출시한 것
TTS-2 라인은 2026년 5월에 구체적인 주장을 내세우며 연구 프리뷰로 시작했다: 이것은 음성을 단독으로 생성하지 않는 모델이라는 것이다. 그것은 대화의 이전 턴들을 오디오 입력으로 받아들이고, 어조와 속도에 대해 추론하며, 응답 방식을 조정한다. 더 깨끗한 오디오보다는 대화적 인식이라는 그 포지셔닝이, 2025년까지 텍스트 음성 변환을 지배했던 내레이션 엔진들과 TTS-2를 구분지은 점이었다.
정식 출시로 프리뷰는 제품군이 되었고 가격표가 붙었다. Flash는 처리량을 겨냥한 선택지로, Inworld는 90번째 백분위에서 서버 측 첫 바이트까지 걸리는 시간이 약 20밀리초라고 제시한다. 이는 플래그십의 100밀리초와 대비되며, 첫 오디오까지의 중앙값은 200밀리초 미만이다. 이는 Inworld 자체 문서에 나온 공급업체 수치다. 유통되는 유일한 제3자 측정치인 Coval의 자료는 Flash를 약 25밀리초로, 플래그십을 100밀리초대 초반으로 본다. 어느 쪽도 처음부터 끝까지 독립적으로 감사된 적은 없다.
가장 주목할 만한 기능은 지연 시간과는 아무 관련이 없습니다. Inworld는 축어 모드를 추가해 주문 번호, 확인 코드, 주소, 일련번호가 자연스럽게 들리지만 틀린 무언가로 정규화되는 대신 글자 하나하나 그대로 다시 읽히도록 했습니다. 방금 예약을 받은 음성 에이전트에게 그 태그 하나는 제대로 작동하는 제품과 사람에게 에스컬레이션되는 데모를 가르는 차이입니다.

차원별로
• 종류 — GPT-Live-1: 단일 모델에서 전이중 음성 대 음성 vs Inworld Realtime TTS-2: 텍스트 음성 변환 모델이며, 전이중은 Inworld의 Realtime API를 통해 별도로 사용 가능
• 가격 단위 — GPT-Live-1: 음성 분당 $0.05, 초 단위로 청구, 추론 백엔드는 별도 계량 vs Inworld Realtime TTS-2: 온디맨드 기준 백만 자당 $25, 크리에이터 플랜 $20, 최상위 티어 $12.50, Flash는 $15, $10, $7
• 독립적 품질 — GPT-Live-1: Speech to Speech Index에서 70.3%, 14개 중 공동 6위 vs Inworld Realtime TTS-2: 1,091개 샘플에서 Elo 1,244, Artificial Analysis Provider Voice 아레나에서 2위, Flash는 1,626개 샘플에서 Elo 1,211로 6위
• 중단 — GPT-Live-1: 네이티브, 초당 여러 번 모델 내부에서 결정됨 vs Inworld Realtime TTS-2: TTS 모델의 속성이 아님; Inworld의 Realtime API는 약 100밀리초의 중단 지연 시간으로 바지인을 지원하며, OpenAI Realtime 프로토콜을 사용하는 단일 소켓을 통해 이루어집니다.
• 지연 시간 — GPT-Live-1: OpenAI 자체 테스트에서 0.798초의 턴테이킹 지연 시간, 첫 오디오까지의 시간은 공개되지 않음 vs Inworld Realtime TTS-2: 90번째 백분위수에서 서버 측 100밀리초, Flash는 20, 전체 Realtime API 파이프라인에서 첫 오디오 청크까지의 중앙값 1초 미만
• 언어 — GPT-Live-1: 주요 언어는 잘 지원되지만 그 외 언어는 고르지 않음 vs Inworld Realtime TTS-2: 200개 이상의 로케일, 15개는 티어 1 품질, 79개는 티어 2, 그리고 하나의 음성 정체성이 모든 로케일에서 유지됨
• 음성 및 복제 — GPT-Live-1: 12개 프리셋, 복제 없음 vs Inworld Realtime TTS-2: 282개 내장 음성, 5~15초의 권한이 부여된 오디오로 즉석 제로샷 복제, 전문가용 복제 및 전체 전달 스티어링은 플래그십에서만 지원
• 배포 — GPT-Live-1: 호스팅 전용, 단일 엔드포인트, 무료 티어 없음, 동시성은 25~500 세션으로 제한됨 vs Inworld Realtime TTS-2: 호스팅 API와 H100이 필요한 제한된 온프레미스 컨테이너, 그리고 최대 약 70분의 합성을 포함하는 무료 온디맨드 티어

듀플렉스 질문, 정확하게 답하다
이 비교를 "하나는 듣고, 다른 하나는 말만 한다"라고 쓰기는 쉽겠지만, 그것은 중요한 부분에서 틀릴 것이다. Inworld의 텍스트 음성 변환 모델은 텍스트 입력, 오디오 출력이다. 하지만 Inworld는 단일 WebSocket, WebRTC 또는 SIP 연결을 통해 실행되며 빌더가 신경 쓰는 의미의 전이중(full-duplex)인 Realtime API도 판매한다. 이 API는 조정 가능한 eagerness 설정을 갖춘 의미 기반 음성 활동 감지(semantic voice-activity detection)를 사용하고, 수동 턴 제어를 지원하며, 약 100밀리초 만에 barge-in 시 중단한다. OpenAI Realtime 인터페이스와 프로토콜 호환되므로, 마이그레이션은 재작성이 아니라 구성 작업이 된다.
Inworld의 Realtime API는 네이티브 음성-대-음성 모델이 아니다. 그것은 하나의 연결 안에서 오케스트레이션되는 캐스케이드, 즉 교체 가능한 음성 인식 모델과 원하는 언어 모델, 그리고 합성기다. 이는 타당한 아키텍처 선택이며, 대부분의 프로덕션 음성 에이전트가 하는 것과 동일한 선택이다. 그것은 단지 GPT-Live-1과는 다른 선택일 뿐이며, GPT-Live-1에서는 단일 모델이 언제 턴을 넘길지 결정한다.
실질적인 차이는 호출자가 절 중간에 끼어들 때 드러난다. 캐스케이드에서는 끼어들기가 감지되고, 생성이 취소되며, 새 턴이 시작된다 — 잘 작동하지만 왕복 한 번의 비용이 드는 순서다. 종단 간 모델에서는 결정이 이미 지속적으로 내려지고 있었다. 전자는 빠르게 반응하는 시스템이다. 후자는 결코 듣기를 멈추지 않은 시스템이다.

숫자를 계산해 보는 것, 단위가 답을 숨기고 있기 때문이다
말하기는 분당 약 150단어로 진행되고, 영어는 단어당 평균 약 5.5자이므로, 1분 분량의 음성 출력은 약 800~900자입니다. 백만 자당 25달러인 Inworld Realtime TTS-2는 약 2센트에 1분 분량의 음성을 생성합니다. Flash의 15달러 기준으로는 1.5센트 미만입니다.
GPT-Live-1의 음성 분당 $0.05와 비교하면, 그것은 압승처럼 보인다 — GPT-Live-1이 나머지 부분에서 무엇을 하는지 가격을 매기기 전까지는. Inworld의 Realtime API는 여전히 음성 인식과 언어 모델이 필요하고, 둘 다 별도로 청구되며, 각자 지연 시간을 동반한다. 그것들을 포함하면, 실제 질문이 포함된 통화라면 캐스케이드의 분당 비용은 5센트를 넘어선다. 엔드투엔드 모델의 프리미엄은 음성에 대한 것이 아니다. 그것은 턴 테이킹에 대한 것이며, 대략 더 이상 구매하지 않아도 되는 음성 인식 단계의 비용과 맞먹는다.
cascade가 결정적으로 우위를 점하는 영역은 대화가 없는 대량 처리입니다. 알림 통화, 배송 확인, 예약 리마인더, 스크립트 기반 IVR — 통화가 시작되기 전에 텍스트가 이미 정해져 있고 아무도 끼어들지 않는 모든 경우죠. 여기서는 백만 자당 7~15달러의 문자 단위 과금이 분당 과금 방식의 듀플렉스보다 그냥 더 저렴하며, 한 번도 쓰지 않는 턴테이킹에 돈을 내는 것은 낭비일 뿐입니다.
두 모델 구도가 가려버리는 중간 경로도 있습니다. 어차피 캐스케이드를 구성하고 있다면, 음성 계층이 반드시 전용 보이스 벤더에서 와야 할 필요는 없습니다. OpenAI 자체 TTS 모델과 Google의 Gemini TTS 프리뷰 모델도 평범한 API 엔드포인트이며, 라우팅됩니다. 11개 업스트림 제공업체의 약 190개 모델이 하나의 OrcaRouter 키 뒤에서 제공업체 정가 그대로, 마크업 없이 제공됩니다 — 따라서 합성 모델이 자기가 공급하는 추론 모델과 같은 카탈로그, 같은 키, 같은 청구서 안에 있을 수 있으며, 배포 도중 특정 엔드포인트의 성능이 저하되면 자동 페일오버가 작동합니다. 이는 음성 스택에서 가장 눈에 띄지 않는 단계이자 통합하기 가장 쉬운 단계입니다. Inworld의 Realtime TTS-2도, GPT-Live-1의 Live Sessions 엔드포인트도 그런 방식으로는 사용할 수 없습니다. 그 둘은 각자의 벤더에 속해 있습니다.
어느 걸 고를까?
볼륨이 핵심이고 대화가 스크립트화되어 있다면 Inworld Realtime TTS-2를 선택하세요. 고처리량 에이전트, 알림, 200개 로케일과 하나의 보존된 음성 정체성이 중요한 다국어 제품, 또는 온프레미스 컨테이너가 필요한 모든 배포에 적합합니다. 선두 제품 가격의 약 절반에 아레나 상위 2위권 음성을 얻을 수 있고, 프로토타이핑할 수 있는 무료 티어, GPT-Live-1이 전혀 제공하지 않는 클로닝, 그리고 아마 이미 운영 중인 캐스케이드 패턴에서 인터럽션을 능숙하게 처리하는 Realtime API를 제공합니다.
끼어들기가 제품 그 자체라면 GPT-Live-1을 선택하세요. 대본에서 벗어나는 통화, 에이전트의 말을 덮고 들어오는 발신자, 말 주고받기가 대화와 메뉴를 가르는 워크플로우. 음성이 저렴해져도 떨어지지 않는 분당 요금을 지불하고, 복제와 200개 언어를 포기하는 대신, 이음새를 되찾습니다.
음성 합성 분야의 가격 전쟁은 실재하며, 보이스 에이전트를 만드는 누구에게나 좋은 소식입니다 — 상위 5위권 음성은 이제 18개월 전 가격의 5분의 1입니다. 다만 이것만으로는 이 비교가 해결되지 않습니다. GPT-Live-1이 과금하는 대상은 Inworld가 할인하는 대상과 다르기 때문입니다.
