
GPT-Live-1 vs Inworld Realtime TTS-2: Perang Harga pada Suara, Premium pada Pendengaran
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Inworld Realtime TTS-2 mencapai ketersediaan umum dengan sesuatu yang selama ini hilang dari pasar suara: daftar tarif yang dipublikasikan. Model unggulannya dibanderol $25 per juta karakter secara on-demand, saudaranya yang lebih cepat, Inworld Realtime TTS-2 Flash, $15, dan keduanya turun melalui tingkatan volume hingga $12.50 dan $7. Berada di Elo 1.244 dan peringkat kedua di arena ucapan Artificial Analysis, itu membuat model unggulan tersebut sekitar setengah harga pemimpin arena saat ini dan salah satu cara termurah untuk membeli suara peringkat lima besar. GPT-Live-1 adalah model lain dalam perbandingan ini dan proposisi yang berlawanan — $0.05 per menit suara, tanpa karakter, dan tidak ada cara untuk membelinya tanpa juga membeli kemampuan mendengarkan, pergantian giliran bicara, dan penanganan interupsi yang menyertainya.
Yang menarik dari membandingkan keduanya adalah kesenjangan harganya terlihat sangat besar, lalu hampir seluruhnya menghilang. Sintesis sedang dalam perang harga. Percakapan tidak.
Apa yang sebenarnya dirilis Inworld
Lini TTS-2 dimulai sebagai pratinjau riset pada Mei 2026 dengan klaim spesifik: bahwa ini adalah model yang tidak menghasilkan ucapan secara terpisah. Model ini menerima giliran-giliran sebelumnya dalam suatu percakapan sebagai masukan audio, menalar tentang nada dan tempo, lalu menyesuaikan cara model tersebut merespons. Positioning itu — kesadaran percakapan alih-alih audio yang lebih bersih — adalah yang membedakannya dari mesin narasi yang mendominasi text-to-speech sepanjang 2025.
Ketersediaan umum mengubah pratinjau itu menjadi sebuah keluarga dan menyertakan daftar harga. Flash adalah pilihan untuk throughput, dengan Inworld melaporkan sekitar 20 milidetik waktu-ke-byte-pertama di sisi server pada persentil ke-90, dibandingkan 100 milidetik untuk produk unggulan dan median di bawah 200 milidetik hingga audio pertama. Itu adalah angka vendor dari dokumentasi Inworld sendiri; satu-satunya pengukuran pihak ketiga yang beredar, dari Coval, menempatkan Flash pada sekitar 25 milidetik dan produk unggulan di kisaran ratusan rendah. Tidak satu pun dari keduanya telah diaudit secara independen secara menyeluruh.
Fitur yang paling patut diperhatikan tidak ada hubungannya dengan latensi. Inworld menambahkan mode verbatim agar nomor pesanan, kode konfirmasi, alamat, dan nomor seri dibacakan kembali karakter demi karakter alih-alih dinormalisasi menjadi sesuatu yang terdengar alami tetapi salah. Bagi agen suara yang baru saja menerima pemesanan, tag tunggal itu adalah pembeda antara produk yang berfungsi dan demo yang akhirnya dieskalasi ke manusia.

Dimensi demi dimensi
• Jenis — GPT-Live-1: speech-to-speech dupleks penuh dalam satu model vs Inworld Realtime TTS-2: model text-to-speech, dengan dupleks tersedia secara terpisah melalui Realtime API Inworld
• Satuan harga — GPT-Live-1: $0.05 per menit suara, ditagih per detik, backend penalaran dihitung terpisah vs Inworld Realtime TTS-2: $25 per juta karakter sesuai permintaan, $20 pada paket Creator dan $12.50 di tingkat teratas, dengan Flash seharga $15, $10, dan $7
• Kualitas independen — GPT-Live-1: 70.3% pada Speech to Speech Index, keenam bersama dari empat belas vs Inworld Realtime TTS-2: Elo 1,244 dari 1,091 sampel dan kedua di Artificial Analysis Provider Voice arena, dengan Flash pada Elo 1,211 dari 1,626 sampel dan keenam
• Interupsi — GPT-Live-1: native, diputuskan di dalam model berkali-kali per detik vs Inworld Realtime TTS-2: bukan properti dari model TTS; Realtime API milik Inworld mendukung barge-in dengan latensi interupsi sekitar 100 milidetik, melalui satu soket yang menggunakan protokol OpenAI Realtime
• Latensi — GPT-Live-1: latensi pergantian giliran 0,798 detik dalam pengujian OpenAI sendiri, tidak ada waktu-ke-audio-pertama yang dipublikasikan vs Inworld Realtime TTS-2: 100 milidetik di sisi server pada persentil ke-90, Flash pada 20, dengan median di bawah satu detik ke potongan audio pertama di seluruh pipeline Realtime API lengkap
• Bahasa — GPT-Live-1: bahasa-bahasa utama terlayani dengan baik, tetapi tidak merata di luarnya vs Inworld Realtime TTS-2: 200+ lokal, dengan 15 pada kualitas Tier 1 dan 79 lagi pada Tier 2, serta satu identitas suara yang dipertahankan di semua lokal tersebut
• Suara dan kloning — GPT-Live-1: dua belas preset, tanpa kloning vs Inworld Realtime TTS-2: 282 suara bawaan, kloning zero-shot instan dari 5 hingga 15 detik audio yang diizinkan, kloning profesional dan kendali penyampaian penuh hanya pada varian unggulan
• Penyebaran — GPT-Live-1: hanya hosted, satu endpoint, tanpa tier gratis, konkurensi dibatasi pada 25 hingga 500 sesi vs Inworld Realtime TTS-2: API hosted plus kontainer on-premises dengan akses terbatas yang memerlukan H100, dan tier on-demand gratis yang mencakup hingga sekitar 70 menit sintesis

Pertanyaan dupleks, dijawab dengan tepat
Akan mudah untuk menulis perbandingan ini sebagai "yang satu mendengarkan, yang lain hanya berbicara," dan itu akan keliru dengan cara yang penting. Model text-to-speech Inworld bersifat text-in, audio-out. Namun, Inworld juga menjual Realtime API yang berjalan melalui satu koneksi WebSocket, WebRTC, atau SIP dan bersifat full-duplex dalam arti yang penting bagi pengembang: API ini menerapkan deteksi aktivitas suara semantik dengan pengaturan eagerness yang dapat disesuaikan, mendukung kontrol giliran manual, dan melakukan interupsi saat barge-in dalam waktu sekitar 100 milidetik. API ini kompatibel secara protokol dengan antarmuka OpenAI Realtime, sehingga migrasi menjadi sekadar latihan konfigurasi, bukan penulisan ulang.
Realtime API milik Inworld bukanlah model ucapan-ke-ucapan native. Ini adalah kaskade — model pengenalan ucapan yang dapat ditukar, model bahasa pilihan Anda, dan sintesiser — yang diorkestrasi di dalam satu koneksi. Itu adalah pilihan arsitektur yang sah dan merupakan pilihan yang sama dengan yang dibuat sebagian besar agen suara produksi. Ini hanyalah pilihan yang berbeda dari GPT-Live-1, di mana satu model memutuskan kapan harus menyerahkan giliran.
Perbedaan praktisnya muncul ketika penelepon menyela di tengah klausa. Dalam kaskade, interupsi terdeteksi, generasi dibatalkan, dan giliran baru dimulai — urutan yang bekerja dengan baik dan memakan satu round trip. Dalam model end-to-end, keputusan sudah dibuat secara berkelanjutan. Yang pertama adalah sistem yang merespons dengan cepat. Yang kedua adalah sistem yang tidak pernah berhenti mendengarkan.

Menghitungnya, karena satuannya menyembunyikan jawabannya.
Ucapan berjalan pada sekitar 150 kata per menit, dan bahasa Inggris rata-rata sekitar lima setengah karakter per kata, sehingga satu menit keluaran yang diucapkan sekitar 800 hingga 900 karakter. Dengan tarif $25 per juta, Inworld Realtime TTS-2 menghasilkan satu menit ucapan dengan biaya kira-kira dua sen. Pada tarif Flash sebesar $15, biayanya di bawah satu setengah sen.
Dibandingkan dengan $0,05 per menit suara milik GPT-Live-1, itu tampak seperti kemenangan telak — sampai Anda memperhitungkan biaya dari komponen lain yang dikerjakan GPT-Live-1. Realtime API milik Inworld masih memerlukan pengenalan suara dan model bahasa, keduanya ditagih secara terpisah, dan keduanya membawa latensi masing-masing. Jika itu dimasukkan, biaya per menit kaskade tersebut melonjak melewati 5 sen untuk setiap panggilan yang melibatkan pertanyaan sungguhan. Premi model end-to-end bukan untuk suaranya. Premi itu untuk pengambilan giliran, dan besarnya kira-kira sebesar biaya tahap pengenalan suara yang tidak lagi Anda beli.
Yang membuat cascade menang secara meyakinkan adalah volume tanpa percakapan. Panggilan notifikasi, konfirmasi pengiriman, pengingat janji temu, IVR berskrip — apa pun yang teksnya sudah diketahui sebelum panggilan dimulai dan tidak akan ada yang menyela. Di sana, penetapan harga per karakter pada $7 hingga $15 per juta jelas lebih murah daripada dupleks per menit, dan membayar untuk giliran bicara yang tidak pernah digunakan adalah pemborosan.
Ada juga jalur tengah yang disembunyikan oleh kerangka dua model. Jika Anda tetap menyusun kaskade, lapisan ucapan tidak harus berasal dari vendor suara khusus: model TTS milik OpenAI sendiri dan model pratinjau Gemini TTS milik Google adalah endpoint API biasa, dan keduanya sudah dirutekan. Sekitar 190 model dari sebelas penyedia huluberada di balik satu kunci OrcaRouter dengan harga daftar penyedia tanpa markup — sehingga model sintesis dapat berada dalam katalog yang sama, pada kunci yang sama dan tagihan yang sama, dengan model penalaran yang disuplainya, dengan failover otomatis jika salah satu endpoint menurun di tengah penerapan. Ini adalah tahap paling tidak menarik dari sebuah tumpukan suara dan yang paling mudah dikonsolidasikan. Baik Realtime TTS-2 milik Inworld maupun endpoint Live Sessions milik GPT-Live-1 tidak tersedia dengan cara itu; keduanya milik vendor masing-masing.
Mana yang harus dipilih
Pilih Inworld Realtime TTS-2 jika volume adalah intinya dan percakapannya berskrip. Agen dengan throughput tinggi, notifikasi, produk multibahasa yang mengutamakan 200 locale dan satu identitas suara yang dipertahankan, atau penerapan apa pun yang membutuhkan kontainer on-premises. Anda mendapatkan suara arena dua teratas dengan harga sekitar setengah dari pemimpin, tier gratis untuk melakukan prototipe, kloning yang sama sekali tidak ditawarkan GPT-Live-1, dan Realtime API yang menangani interupsi secara kompeten dalam pola kaskade yang mungkin sudah Anda jalankan.
Pilih GPT-Live-1 jika interupsi adalah produknya. Panggilan yang keluar dari naskah, penelepon yang menyela agen, alur kerja di mana giliran bicara adalah pembeda antara percakapan dan menu. Anda membayar tarif per menit yang tidak turun ketika ucapan menjadi murah, Anda melepaskan kloning dan 200 bahasa, dan Anda membeli kembali sambungan-sambungannya.
Perang harga dalam sintesis itu nyata dan merupakan kabar baik bagi siapa pun yang membangun agen suara — suara peringkat lima teratas kini berbiaya seperlima dari delapan belas bulan lalu. Namun itu tidak menyelesaikan perbandingan ini, karena hal yang dibebankan oleh GPT-Live-1 bukanlah hal yang didiskon oleh Inworld.
