
Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: 듣는 목소리 vs 아레나의 왕
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
합성 음성이 사람처럼 느껴지는 이유에 관해서는 두 가지 경쟁 이론이 있으며, 현재 각 이론의 가장 뛰어난 상용 사례는 Inworld Realtime TTS-2와 Cartesia Sonic 3.6입니다. Cartesia의 이론은 인간다움이 오디오에 있다는 것입니다. 음색과 운율, 타이밍을 실제 사람과 구별할 수 없게 만들면 청취자들이 당신을 1위로 꼽게 될 것이라는 이론이며, Sonic 3.6이 8월에 Elo 1,282점으로 Artificial Analysis의 Provider Voice 아레나 정상에 오른 것이 바로 그 사례입니다. Inworld의 이론은 인간다움이 듣기에 있다는 것입니다. TTS-2는 직전 대화의 실제 오디오를 바탕으로 발화를 조절하므로, 사람처럼 들릴 뿐 아니라 사람처럼 반응합니다. 이번 주 두 이론은 스코어보드에서 충돌했습니다. Inworld Realtime TTS-2를 Elo 1,252점으로 프로바이더 보드 2위에 올린 그 재채점은, Cartesia가 이끌던 보드인 Controlled Voice 아레나에서도 Inworld Realtime TTS-2를 1,123점으로 1위에 올렸고 Sonic 3.6은 1,119점이었습니다. 한 모델은 프로바이더 부문 왕좌를 지켰고, 다른 모델은 이제 막 컨트롤드(Controlled) 부문 왕좌를 차지했습니다.
이 비교는 어느 한쪽이 명백히 틀렸다고 할 수 없는 대결입니다. 두 모델은 용도가 겹치지만 완전히 동일하지는 않은 작업을 위해 만들어졌으며, 가격 차이 — Sonic 3.6이 문자 100만 개당 $49.0인 반면 Inworld Realtime TTS-2는 온디맨드 기준 $25 — 는 충분히 실질적이어서 결정에는 품질 요소뿐만 아니라 예산 요소도 포함됩니다.
인간의 목소리에 관한 두 가지 이론
Cartesia는 2026년 8월 Sonic 3.6을 조용히 출시했다. 가격이나 아키텍처 스토리를 바꾸지 않으면서 Sonic 3.5를 개선한 포인트 릴리스였다. 그 개선은 Cartesia가 필요로 했던 부분에서 드러났다. 이 모델은 모든 모델이 자체 네이티브 음성을 사용하는 Artificial Analysis의 Provider Voice 아레나에서 Elo 1,282로 도약했고, 8월 내내 Controlled Voice 아레나 1위 자리를 지켰다. controlled 보드에서는 모든 모델이 동일한 8명의 기준 화자로 클로닝되므로, 그 1위 타이틀은 보이스 탤런트와 무관하게 합성 엔진 자체에 대한 평가라고 할 수 있다. 이번 주 Inworld의 GA(일반 공급) 재평가 이후에도 Cartesia는 여전히 provider 보드 선두를 유지하고 있지만, Sonic 3.6은 이제 controlled 보드에서 Elo 1,119로 2위를 기록하며, 1,123점의 Inworld Realtime TTS-2에 4점 뒤처져 있다.
Inworld Realtime TTS-2는 다른 전통에서 비롯되었다. 전신 라인인 TTS 1.5는 2026년 초반 같은 분야의 상위권을 지켰고, TTS-2의 연구 프리뷰는 6월 프로바이더 보드에서 Elo 1,209를 기록했다. GA(정식 출시) 모델은 이후 더욱 상승했다. 현재 보드에서는 Provider Voice 부문에서 1,252점(2위, Sonic 3.6의 1,282에 이어), Controlled Voice 부문에서 1,123점(1위)을 기록하고 있다. 하지만 이 플래그십 모델의 진짜 차별점은 Elo가 아니다. 바로 이 모델이 대화의 이전 차례들을 오디오 입력으로 받아, 그것이 다음 대사를 전달하는 방식을 결정하게 한다는 점이다. Cartesia는 대화록에서 감정을 보정한다. Inworld는 마지막 말이 어떻게 말해졌는지를 듣는다.
정직하게 표시된 스코어보드
Elo 수치는 2026년 9월 라이브 보드에서 확인한 Artificial Analysis의 스피치 아레나 기준입니다. 지연 시간 수치는 별도 표기가 없는 한 공급업체 보고 값이며, 두 모델 모두 독립적인 지연 시간 감사가 공개된 바는 없습니다.
독립적 품질 — Cartesia Sonic 3.6: Elo 1,282(1위, 제공자 음성) 및 1,119(2위, 통제 음성) vs Inworld Realtime TTS-2: Elo 1,252(2위, 제공자 음성) 및 1,123(1위, 통제 음성)
• 1M 문자당 가격 — $49.0 (Artificial Analysis 추적 기준) vs 온디맨드 $25, Artificial Analysis 추적 기준 혼합 $20.8, 대량 사용 시 $12.50까지 인하(공급업체)
• 첫 번째 오디오까지의 시간 — 90ms 미만(벤더 제공) vs Inworld 출시 테스트 기준 중앙값 200ms 미만, p99에서 100ms 미만(벤더 제공). Inworld가 Sonic에 대응하는 저지연 솔루션은 별도의 TTS-2 Flash 등급으로, 첫 바이트 도달까지 약 25ms입니다.
• 언어 — 전달 조정을 위한 42개 현지화 vs 100개 이상 언어, Inworld의 단일 음성 정체성(one-voice-identity) 주장은 200개 이상 로케일로 확장(공급업체 주장)
인스턴트 음성 복제 — 약 10초의 오디오 대비 5~15초, 그리고 약 10분의 오디오로 더 높은 충실도의 복제본을 생성하는 프로페셔널 클로닝 베타 버전 제공
• 전달 제어 — [laughter] 같은 인라인 트랜스크립트 태그, 볼륨/속도 조절 또는 "[calm, reassuring]"이나 [whisper] 같은 일반 영어 명령(스티어링), 요청 수준 지시, 그리고 Stable부터 Expressive까지의 세 가지 안정성 모드

왜 "대화를 듣는 것"이 다른 축인가
위의 점수판은 음성이 단독으로 들릴 때의 특성을 측정합니다. 두 모델이 진정으로 갈리는 차원은 어떤 리더보드에도 표시되지 않는데, 그 이유는 그 차이가 여러 턴에 걸쳐서만 존재하기 때문입니다.
Inworld Realtime TTS-2는 사람이 방금 그 모델에게 무언가 말한 상황을 위해 설계되었습니다. 이 모델은 이전 차례의 오디오를 입력받습니다. 단순한 대화 기록이 아니라, 말투와 속도, 감정 상태를 추론하고, 말을 꺼내기 전에 응답 상태를 선택합니다. 발신자가 답답해하면 전달 방식이 달라지고, 편안해하면 다시 원래대로 돌아옵니다. 이것이 Inworld가 이 모델을 내레이션보다는 에이전트, 컴패니언, 게임용으로 마케팅하는 이유입니다. 그 기능은 일회성 텍스트-오디오 호출에서는 의미가 없고, 대화에서만 의미가 있습니다.
Cartesia Sonic 3.6은 다르게 작동합니다. 빠르고 고품질의 스트리밍 엔진이며, Cartesia 자체 주장은 대본에서 자동으로 감정을 보정한다는 것입니다. 즉, 단어를 읽고 그에 따라 변조합니다. 그것이 하지 않는 일은 이전 턴들의 오디오를 듣는 것입니다. 단일 발화 내에서는 둘이 비슷하게 들릴 수 있습니다. 그러나 대화 전체에 걸쳐 Inworld는 Sonic이 시도하지 않는 모델링을 수행합니다. 제품이 단일 턴 보이스오버라면 그 모델링은 오버헤드입니다. 실시간 에이전트라면 그것이 곧 제품입니다.

속도, 가격, 그리고 Flash 주의사항
{{1}}순수 지연 시간만 놓고 보면 Cartesia가 줄곧 최고의 자리를 지켜 왔다.{{/1}} {{2}}첫 오디오까지의 시간(time-to-first-audio)이 90ms 미만이라는 것은 업체가 밝힌 수치이지만, Sonic 3 세대부터 이 회사가 실제로 제공해 온 수치이며, 이를 반박하는 검증 결과를 발표한 곳은 없다.{{/2}} {{3}}Inworld의 주력 모델 역시 200ms 미만으로 응답하며 비슷한 수준의 대화 품질을 제공하므로, 실시간 에이전트에는 충분하다.{{/3}} {{4}}Inworld가 지연 시간 부문에서 내세우는 진짜 승부수는 GA 모델과 함께 출시된 Flash 등급이다.{{/4}} — {{5}}이는 첫 바이트까지의 시간(time-to-first-byte)이 약 25ms인 별도 모델로, 표현력보다 Sonic급 비용과 지연 시간이 더 중요한 대용량 워크로드를 겨냥한다.{{/5}} {{6}}단, Flash는 제품군에서 기능이 축소된 모델이라는 점을 유의해야 한다.{{/6}} {{7}}즉시 음성 복제와 인라인 비언어적 표현은 지원하지만, 프로페셔널 음성 복제와 완전한 자연어 제어는 지원하지 않는다.{{/7}}
가격은 그 반대 방향으로 움직인다. Sonic 3.6은 백만 자당 $49.0으로, Inworld의 온디맨드 요금 $25의 약 두 배, 최상위 티어 $12.50의 거의 네 배에 달한다. 둘 다 포함된 리더보드에서 드러나는 품질 격차는 대량 구매자에게 그 배수를 정당화해 주지 않는다. 대화당 수천 자를 생성하는 실시간 음성 에이전트의 경우, 자당 비용 차이는 건전한 유닛 이코노믹스와 빈약한 유닛 이코노믹스 사이의 차이다.
어느 것을 고를까?
• Cartesia Sonic 3.6을 선택하세요.제공자 보드의 왕관을 원한다면, 이 음성은 자체 네이티브 음성을 사용하는 음성 중 최고 점수(Elo 1,282)를 받은 음성으로, 어시스턴트 응답, 게임 대사, 상태 안내와 같은 짧은 독립 발화에 적합합니다. 문자 100만 개당 $49로 이 왕관을 위해 비용을 지불하며, 그 보드에서 여전히 이겨야 할 모델입니다.
• Inworld Realtime TTS-2를 선택하세요. 제품이 지원 통화, 컴패니언, 인터뷰, 튜터링 세션처럼 상대방의 말에 응답해야 하는 다중 턴 대화라면 이 옵션이 적합합니다. 이 모델은 현재 모든 모델이 동일한 8개의 기준 음성으로 말하는 통제 평가 리더보드에서 선두를 달리고 있으며, 대화 오디오를 들으면서도 약 절반의 가격으로 이러한 성능을 제공합니다.
• 라우팅에 스위치를 구축하세요 — 미리 통화에 어떤 종류의 음성이 필요한지 알 수 없다면. 이 글을 쓰는 현재 두 모델 모두 OrcaRouter에는 없습니다. Sonic은 Cartesia 자체 API와 여러 타사 플랫폼을 통해 접속되고, Inworld는 자체 API를 통해 접속됩니다. 하지만 라우팅 계층은 대화가 한 음성에서 시작해 다른 음성으로 페일오버할 수 있게 하는 구조이며, 각 제공업체의 정가는 0% 마크업으로 그대로 전달됩니다. 이 중 하나가 다시 뒤집히는 날 — 이번 주에 실제로 그랬습니다 — 선택은 재작성이 아니라 구성 변경이 됩니다.
간략 버전
이것은 진짜 갈림길이며, 솔직한 답은 그 갈림길이 오디오 품질이 아니라 턴테이킹(누가 언제 말할지)에 관한 것이라는 점입니다. 자체 음성을 사용하는 독립형 음성 중 가장 높은 점수를 받은 음성이 필요하다면, {{1}}Cartesia Sonic 3.6{{/1}}은 Elo 1,282로 공급사 부문 1위를 차지하고 있으며 문자 100만 자당 49달러를 청구합니다. 말을 건네는 방식에 반응하는 음성이 필요하다면, {{2}}Inworld Realtime TTS-2{{/2}}는 이번 주 온디맨드 기준 25달러로 정식 출시(GA)됐고, 두 모델이 동일한 음성으로 겨루는 통제된 리더보드에서 선두를 달리며, 어떤 아레나도 온전히 측정하지 못하는 대화 인식 기능을 갖추고 있습니다. 스코어보드는 이제 두 모델 사이로 나뉘어 있습니다. {{3}}이것이 시장을 가장 정직하게 보여주는 그림입니다{{/3}}. 그런 시장에서 "최고"는 테스트에 따라 달라집니다.

