Kartu judul hero untuk 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — suara yang mendengarkan vs raja arena', dengan kartu kiri 'Cartesia Sonic 3.6 — Provider #1 · Elo 1,282 · $49 / 1 juta karakter' dan kartu kanan 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1,123 · $25 / 1 juta karakter', chip statistik 'Mahkota terbagi — Arena Provider vs Controlled', dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: Suara yang Mendengarkan vs Raja Arena

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada dua teori yang saling bersaing tentang mengapa suara sintetis terasa manusiawi, dan saat ini dua contoh komersial terbaik dari masing-masing teori adalah Inworld Realtime TTS-2 dan Cartesia Sonic 3.6. Teori Cartesia adalah bahwa sisi manusiawi hidup di dalam audio: buat timbre, prosodi, dan timing-nya tidak dapat dibedakan dari milik seseorang, dan pendengar akan menempatkan Anda di peringkat pertama — itulah yang dilakukan Sonic 3.6 pada bulan Agustus, melonjak ke puncak arena Provider Voice milik Artificial Analysis dengan Elo 1,282. Teori Inworld adalah bahwa sisi manusiawi hidup di dalam proses mendengarkan: TTS-2 mengondisikan penyampaiannya pada audio aktual percakapan yang mendahuluinya, sehingga ia tidak hanya terdengar seperti manusia, tetapi juga merespons seperti manusia. Pekan ini kedua teori itu bertabrakan di papan skor: penghitungan ulang yang menempatkan Inworld Realtime TTS-2 di #2 pada papan provider, dengan Elo 1,252, juga menempatkannya di #1 pada arena Controlled Voice — papan yang sebelumnya dipimpin Cartesia — dengan skor 1,123 melawan 1,119 milik Sonic 3.6. Satu model memegang mahkota provider. Model yang lain baru saja mengambil mahkota yang terkontrol.

Ini bukanlah pertarungan di mana salah satu pihak jelas-jelas salah. Kedua model dibuat untuk pekerjaan yang tumpang tindih, tetapi tidak identik, dan perbedaan harga — Sonic 3.6 seharga $49.0 per juta karakter dibandingkan $25 sesuai permintaan untuk Inworld Realtime TTS-2 — cukup nyata sehingga keputusan ini memiliki komponen anggaran sekaligus kualitas.

Dua teori tentang suara yang terdengar manusiawi

Cartesia meluncurkan Sonic 3.6 secara senyap pada Agustus 2026, sebuah rilis titik yang menyempurnakan Sonic 3.5 tanpa mengubah harga atau narasi arsitekturnya. Peningkatan itu terlihat di tempat yang dibutuhkan Cartesia: modelnya melompat ke Elo 1.282 di arena Provider Voice milik Artificial Analysis — tempat setiap model menggunakan suara asli mereka sendiri — dan bertahan di puncak arena Controlled Voice sepanjang Agustus. Di papan terkontrol, setiap model dikloning ke delapan speaker referensi yang sama, sehingga mahkota tersebut menjadi penilaian terhadap mesin sintesis itu sendiri, terlepas dari bakat suara. Setelah skor ulang ketersediaan umum Inworld minggu ini, Cartesia masih memimpin papan penyedia, tetapi Sonic 3.6 kini duduk di #2 di papan terkontrol dengan Elo 1.119, tertinggal empat poin dari Inworld Realtime TTS-2 yang berada di 1.123.

Inworld Realtime TTS-2 berasal dari tradisi yang berbeda. Lini pendahulunya, TTS 1.5, menghabiskan awal 2026 di dekat puncak arena yang sama, dan pratinjau riset TTS-2 mengukur Elo 1.209 di papan penyedia pada bulan Juni. Model GA telah meningkat sejak itu: pada papan saat ini ia berada di 1.252 pada Provider Voice (#2, di belakang Sonic 3.6 yang mencapai 1.282) dan di 1.123 pada Controlled Voice (#1). Pembeda utama produk unggulan ini, bagaimanapun, bukanlah Elo-nya; melainkan bahwa model tersebut mengambil giliran-giliran percakapan sebelumnya sebagai input audio dan membiarkannya membentuk cara ia menyampaikan kalimat berikutnya. Cartesia mengalibrasi emosi dari transkrip. Inworld mendengarkan bagaimana kalimat terakhir diucapkan.

Papan skor, yang diberi label dengan jujur.

Angka Elo berasal dari arena bicara Artificial Analysis, yang dibaca dari papan langsung pada September 2026. Angka latensi dilaporkan oleh vendor kecuali disebutkan lain, dan belum ada audit latensi independen yang dipublikasikan untuk kedua model tersebut.

• Kualitas independen — Cartesia Sonic 3.6: Elo 1.282 (#1, Suara Provider) dan 1.119 (#2, Suara Terkontrol) vs Inworld Realtime TTS-2: Elo 1.252 (#2, Suara Provider) dan 1.123 (#1, Suara Terkontrol)

• Harga per 1 juta karakter — $49,0 (terlacak Artificial Analysis) vs $25 sesuai permintaan, $20,8 rata-rata gabungan sebagaimana terlacak oleh Artificial Analysis, turun hingga $12,50 untuk volume (vendor)

• Waktu hingga audio pertama — di bawah 90 ms (klaim vendor) vs. median di bawah 200 ms, di bawah 100 ms pada p99 dalam pengujian peluncuran Inworld (klaim vendor); jawaban berlatensi rendah Inworld untuk Sonic adalah tingkatan TTS-2 Flash yang terpisah dengan waktu hingga byte pertama sekitar 25 ms.

• Bahasa — 42 bahasa yang dilokalkan vs 100+ bahasa untuk pengarahan pengiriman, dengan klaim identitas satu suara Inworld yang mencakup 200+ lokal (dinyatakan vendor)

• Kloning suara instan — sekitar 10 detik audio dibanding 5–15 detik, plus beta kloning profesional yang membutuhkan sekitar 10 menit audio untuk klon dengan fidelitas lebih tinggi

• Kontrol penyampaian — tag transkrip inline seperti [laughter], modulasi volume dan kecepatan vs arahan bahasa Inggris sederhana seperti "[calm, reassuring]" atau [whisper], instruksi tingkat permintaan, dan tiga mode stabilitas dari Stable hingga Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Mengapa "mendengarkan percakapan" adalah sumbu yang berbeda

Papan skor di atas mengukur bagaimana suara terdengar secara terpisah. Dimensi di mana kedua model benar-benar berbeda tidak muncul di papan peringkat mana pun, karena dimensi itu hanya ada di berbagai giliran percakapan.

Inworld Realtime TTS-2 dirancang untuk situasi ketika seseorang baru saja mengatakan sesuatu kepadanya. Model ini memproses audio dari giliran-giliran sebelumnya — bukan hanya transkripnya — memahami nada, tempo, dan keadaan emosional, lalu memilih respons sebelum berbicara. Jika penelepon frustrasi, cara penyampaiannya berubah; jika mereka santai, berubah kembali. Itulah sebabnya Inworld memasarkan model ini untuk agen, teman virtual, dan game, bukan untuk narasi: fitur ini tidak bermakna dalam panggilan teks-ke-audio sekali jalan, tetapi bermakna dalam percakapan.

Cartesia Sonic 3.6 bekerja dengan cara yang berbeda. Ia adalah mesin streaming yang cepat dan berkualitas tinggi, dan klaim Cartesia sendiri adalah kalibrasi emosi otomatis dari transkrip — ia membaca kata-kata dan menyesuaikan modulasinya. Yang tidak ia lakukan adalah mendengarkan audio dari giliran-giliran sebelumnya. Dalam satu ujaran, keduanya bisa terdengar sebanding; dalam sebuah percakapan, Inworld memodelkan sesuatu yang tidak dicoba oleh Sonic. Jika produk Anda adalah sulih suara satu giliran, pemodelan itu hanyalah beban tambahan. Jika itu adalah agen langsung, itulah produknya.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Kecepatan, harga, dan peringatan Flash.

Dalam hal latensi murni, Cartesia-lah yang selama ini berhak menyombongkan diri: waktu hingga audio pertama di bawah 90 ms memang klaim vendor, tetapi sejak generasi Sonic 3 produk yang dikirim perusahaan benar-benar mencapai angka itu, dan belum ada pihak yang menerbitkan audit yang membantahnya. Produk unggulan Inworld merespons dalam kelas percakapan serupa pada latensi di bawah 200 ms, yang sudah memadai untuk agen langsung. Strategi latensi Inworld yang sesungguhnya adalah tingkatan Flash yang dirilis bersamaan dengan model GA — model terpisah dengan waktu hingga byte pertama sekitar 25 ms, yang ditujukan untuk beban kerja bervolume tinggi yang lebih mengutamakan biaya dan latensi kelas Sonic daripada ekspresivitas. Catatannya, Flash adalah anggota keluarga yang fiturnya dipangkas: kloning instan dan non-verbal inline, tetapi tanpa kloning profesional dan tanpa kendali bahasa alami secara penuh.

Dari sisi harga, justru sebaliknya. Sonic 3.6 berharga $49.0 per juta karakter — kira-kira dua kali lipat tarif on-demand Inworld yang $25, dan hampir empat kali lipat tier tertinggi yang $12.50. Kesenjangan kualitas di antara keduanya, pada papan peringkat di mana keduanya muncul, tidak membenarkan kelipatan tersebut bagi pembeli bervolume tinggi. Untuk agen suara real-time yang menghasilkan ribuan karakter per percakapan, selisih per karakter adalah perbedaan antara ekonomi unit yang sehat dan yang tipis.

Mana yang harus dipilih

Pilih Cartesia Sonic 3.6 jika mahkota papan penyedia itulah yang Anda inginkan — suara dengan skor tertinggi yang menggunakan suara asli miliknya sendiri, Elo 1.282, untuk ucapan pendek yang mandiri seperti jawaban asisten, baris permainan, dan pembacaan status. Dengan $49 per juta karakter, Anda membayar untuk mahkota tersebut, dan model itu tetap menjadi model yang harus dikalahkan di papan tersebut.

Pilih Inworld Realtime TTS-2 jika produknya berupa percakapan multi-giliran yang ucapannya harus menanggapi orang di seberang — panggilan dukungan, pendamping, wawancara, sesi bimbingan belajar. Kini model ini memuncaki papan peringkat terkontrol, di mana setiap model menggunakan delapan suara referensi yang sama, dan melakukannya dengan harga kira-kira setengahnya sambil mendengarkan audio percakapan.

Bangun pengalihan ke dalam routingjika Anda tidak dapat mengetahui sebelumnya jenis suara seperti apa yang dibutuhkan sebuah panggilan. Pada tulisan ini dibuat, tidak satu pun dari kedua model tersebut tersedia di OrcaRouter — Sonic dapat diakses melalui API milik Cartesia sendiri dan beberapa platform pihak ketiga, sedangkan Inworld melalui API miliknya sendiri — tetapi lapisan routing justru merupakan struktur yang memungkinkan sebuah percakapan dimulai dengan satu suara dan beralih ke suara lain saat terjadi kegagalan, dengan harga daftar masing-masing penyedia diteruskan dengan markup 0%. Ketika salah satu dewan direksi ini berbalik lagi — dan minggu ini mereka memang melakukannya — pilihan tersebut menjadi perubahan konfigurasi, bukan penulisan ulang.

Versi singkatnya

Ini adalah percabangan yang nyata, dan jawaban jujurnya adalah percabangan tersebut berkaitan dengan giliran bicara, bukan kualitas audio. Jika Anda membutuhkan suara mandiri dengan skor terbaik yang menggunakan suara aslinya sendiri, Cartesia Sonic 3.6 menduduki peringkat teratas di antara para penyedia dengan Elo 1.282 dan membebankan biaya $49 per juta karakter untuk itu. Jika Anda membutuhkan suara yang merespons cara diajak bicara, Inworld Realtime TTS-2 resmi GA minggu ini dengan harga $25 sesuai permintaan, memimpin papan peringkat terkendali di mana keduanya diadu dengan suara setara, serta membawa fitur kesadaran percakapan yang tidak diukur penuh oleh arena mana pun. Papan skor kini terbagi di antara kedua model — yang merupakan gambaran paling jujur tentang pasar di mana "terbaik" bergantung pada pengujiannya.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.