
GPT-Live-1 Kini Hadir di API: Suara Full-Duplex dengan $0,05 per Menit, Tanpa Jalur Drop-In dari GPT-Realtime-2.1
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
GPT-Live-1 sudah ada di API per 10 September, dan angka yang benar-benar akan mengubah anggaran bukanlah tolok ukur — melainkan unit penagihannya. Model suara dupleks penuh OpenAIOpenAI kini menagih tarif tetap $0,05 per menit suara, ditagih per detik, sedangkan model yang menjadi pembandingnya, GPT-Realtime-2.1, diukur dalam token audio sebesar $32 per juta untuk masukan dan $64 per juta untuk keluaran. Modelnya sendiri bukan hal baru: GPT-Live-1 dirilis di dalam ChatGPT pada 8 Juli 2026, sebagai pengganti Advanced Voice Mode. Yang baru adalah bahwa para pengembang akhirnya dapat memanggilnya — dan bahwa cara memanggilnya hampir tidak mirip sama sekali dengan integrasi Realtime yang sudah dimiliki sebagian besar tim. Dokumentasi OpenAIOpenAI sendiri memasangkan lapisan suara dengan backend penalaran terpisah, dan dalam contoh WebRTC yang dipublikasikan, backend tersebut adalah GPT-5.6 Terra.
Apa yang dirilis pada 10 September, dan apa yang tidak
Permukaan API sengaja dibuat sempit. Hanya ada satu ID model, gpt-live-1, yang juga merupakan snapshot default-nya sendiri — tidak ada varian bertanggal untuk disematkan. Hanya ada satu endpoint, yaitu endpoint Live Sessions di v1/live/sessions. Semua hal lain di platform OpenAI dinonaktifkan untuk model ini: tidak ada Chat Completions, tidak ada Responses, tidak ada Realtime (termasuk varian terjemahan dan transkripsi), tidak ada Assistants, tidak ada Batch, tidak ada fine-tuning, tidak ada embeddings, tidak ada pembuatan gambar atau video, tidak ada endpoint audio speech atau transkripsi, tidak ada moderation.
Input dan output berupa audio dan teks. Streaming dan pemanggilan fungsi didukung; output terstruktur, fine-tuning, dan output terprediksi tidak didukung. Input gambar dan video secara eksplisit tidak didukung — jadi permukaan "voice with video" yang telah diisyaratkan OpenAIOpenAI bukan bagian dari rilis ini. Tier Gratis sama sekali tidak dapat memanggilnya, dan batas laju diukur dalam sesi bersamaan, bukan permintaan per menit: 25 pada Tier 1, meningkat menjadi 50, 200, 300, dan 500 di Tier 2 hingga 5.

Pembingkaian konkurensi itu adalah petunjuk pertama bahwa ini bukan pengganti plug-in. Batas laju yang dinyatakan dalam percakapan langsung simultan memberi tahu Anda apa yang OpenAIOpenAI harapkan sebagai unit skala: saluran telepon, bukan permintaan.
Perubahan harga adalah cerita yang lebih senyap namun lebih besar
Penagihan tarif tetap per menit adalah perubahan yang nyata. Dalam sistem penghitungan token, Anda harus memodelkan konsumsi audio — berapa token yang dihabiskan oleh satu detik keheningan, bagaimana penelepon yang terus berbicara saat agen berbicara mengubah panjang keluaran — sebelum Anda dapat memperkirakan satu panggilan pun. Dengan $0.05 per menit, aritmetikanya menyusut menjadi sekadar perkalian:
• Panggilan dukungan 5 menit — $0,25 untuk waktu suara
• Panggilan 10 menit — $0,50
• Rata-rata 4 menit untuk 1.000 panggilan sehari — $200 sehari, sekitar $6.000 sebulan
• Satu jam saluran terbuka terus-menerus — $3.00
Tiga detail memperjelas hal itu. Pertama, durasi tidak dibulatkan ke atas ke menit penuh berikutnya, jadi panggilan 40 detik dikenai biaya sekitar 3,3 sen, bukan satu nikel penuh. Kedua, inisialisasi sesi menagih 15 detik durasi suara di muka — tetapi itu dikreditkan terhadap biaya durasi berikutnya, bukan ditambahkan di atasnya, jadi panggilan yang lebih pendek dari 15 detik tetap dikenai harga 15 detik. Ketiga, suara hanya separuh dari tagihan. Model penalaran backend, panggilan alatnya, dan pencarian web apa pun ditagih secara terpisah dengan tarif normal model tersebut, yang berarti "model suara murah" tetap dapat menghasilkan panggilan mahal jika Anda mengarahkan delegasi ke penalar terdepan dan membiarkannya mencari di setiap giliran.
Struktur dua meter itulah tempat routing berhenti sekadar menjadi nilai tambah. Di OrcaRouter, separuh backend dari sesi GPT-Live-1 hanyalah panggilan model biasa — kira-kira 190 model dari sebelas penyedia hulu di balik satu kunci, dengan harga daftar penyedia yang diteruskan tanpa markup, dan failover otomatis jika backend pilihan Anda error atau timeout. Anda tidak bisa merutekan lapisan suara itu sendiri; endpoint Live Sessions hanya milik OpenAIOpenAI. Anda sama sekali bisa merutekan semua yang didelegasikan oleh lapisan suara, yakni separuh bagian yang skalanya bergantung pada seberapa keras pemanggil Anda berpikir.
Hanya WebRTC — mengapa kode Realtime Anda tidak akan bisa di-port
Inilah biaya praktis untuk beralih, dan sebagian besar liputan peluncuran melewatkannya. Sesi GPT-Live-1 berjalan melalui WebRTC, bukan transport WebSocket yang menjadi fondasi banyak integrasi Realtime yang sudah ada. Menyelidiki jalur lama dengan ID model GPT-Live akan mengembalikan error yang secara gamblang memberi tahu bahwa sesi memerlukan WebRTC.
Handshake, menurut panduan WebRTC OpenAIOpenAI: browser Anda membuka RTCPeerConnection, melampirkan track mikrofon, membuka data channel dan mendaftarkan listener sebelum menawarkan, menetapkan deskripsi lokal, menunggu pengumpulan ICE, dan mengirim offer ke server Anda sendiri. Server Anda kemudian memanggil POST /v1/live/sessions dengan konfigurasi sesi plus transport: { type: "webrtc", sdp: ... }. Jika berhasil, akan mengembalikan HTTP 201 yang membawa session.id dan transport.sdp, yang diterapkan browser sebagai deskripsi remote. Media mengalir melalui track yang dinegosiasikan; data channel — dengan label oai-events — membawa transkrip, pembaruan sesi dan pekerjaan yang didelegasikan. Untuk menutup panggilan, Anda mengirim session.close dan terus membaca sampai session.closed diterima.
Dua jebakan yang layak ditempel di monitor. Panggilan HTTP itu sendiri memulai sesi, jadi Anda juga tidak boleh mengirim session.start di kanal data. Dan Anda tidak boleh menambahkan audio masukan atau menunggu delta audio keluaran melalui kanal itu — biarkan audio.format di luar konfigurasi dan biarkan SDP menanganinya. Contoh-contoh server membatasi isi permintaan pada 64 KB, menetapkan batas waktu pengumpulan ICE setelah 10 detik dan finalisasi sesi setelah 15.
Tidak ada dari itu yang sulit. Semuanya adalah kode baru. Jika produk Anda adalah agen realtime berbasis giliran, bermigrasi ke GPT-Live-1 adalah penulisan ulang transportasi ditambah penulisan ulang delegasi, bukan sekadar penukaran ID model — layak dianggarkan sebagai sprint, bukan pekerjaan satu sore.
Benchmark, dan siapa yang menjalankan semuanya
Setiap angka di bawah ini adalah milik OpenAIOpenAI sendiri, diterbitkan bersama rilis API dan tidak direproduksi secara independen oleh siapa pun pada saat penulisan. Kaveat itu lebih penting daripada biasanya di sini, karena selisihnya cukup besar sehingga mengundang untuk dikutip sebagai fakta yang sudah mapan.

• Interaktivitas dupleks penuh — GPT-Live-1 80,1% vs 45,4% untuk GPT-Realtime-2.1
• Latensi pergantian giliran — 0,8 dtk vs 1,4 dtk
• Akurasi pemanggilan alat — 87% vs 60%
• Tolok ukur dukungan suara perbankan, tingkat kelulusan — 32% vs 12,4%
Baca baris terakhir dua kali. Tingkat kelulusan 32% adalah peningkatan besar dibandingkan 12,4% dan tetap berarti sistem gagal pada sekitar dua pertiga tugas dalam evaluasi itu. Lonjakan interaktivitas dan pemanggilan alat adalah yang menggambarkan produk yang benar-benar berbeda; angka perbankan adalah yang jujur tentang seberapa jauh agen suara masih dari menangani alur kerja teregulasi tanpa pengawasan.
Bukti pelanggan lebih tipis daripada tabel benchmark dan menunjuk ke arah yang sama. Yelp menggunakan GPT-Live-1 untuk reservasi berbasis telepon, dengan CTO Alex Levy dikutip tentang penanganan panggilan yang lebih baik. Platform pembelajaran bahasa Speak melaporkan hampir 80% lebih sedikit interupsi dibandingkan sistem berbasis giliran sebelumnya — angka yang dilaporkan sendiri dari perusahaan yang memiliki kepentingan dalam hasil tersebut, dan masih merupakan angka penerapan paling konkret yang tersedia.
Lapisan suara adalah front end; Anda memilih otaknya.
Taruhan arsitekturalnya adalah delegasi, dan itulah bagian dari rilis ini yang menjadi tempat lapisan perutean menyatu secara alami. GPT-Live-1 tidak melakukan pemikiran mendalam. Ketika penelepon menanyakan sesuatu yang memerlukan penalaran, pengambilan informasi, atau alat, model menyerahkan tugas tersebut melintasi batas asinkron ke backend terpisah yang terus bekerja sementara percakapan lisan berlanjut, lalu memasukkan kembali jawabannya saat sudah siap.
Konfigurasinya eksplisit, dan ada baiknya membaca contoh dokumentasi itu dengan saksama. Di samping model: "gpt-live-1" dan instruksinya, sesi tersebut membawa sebuah delegation objek bertipe responses, yang di dalamnya terdapat blok responses yang menyebutkan model backend, instruksinya sendiri, serta alat-alatnya — contohnya menggunakan web_search — dan sebuah tool_choice. Dalam contoh WebRTC yang dipublikasikan OpenAIOpenAI, model backend tersebut adalah GPT-5.6 Terra.

Itulah klaim sesungguhnya dari desain ini: ganti backend-nya dan pengalaman suara menjadi lebih pintar tanpa melatih ulang model ucapannya. Ini juga berarti backend delegasi bersifat portabel dengan cara yang tidak dimiliki lapisan suara. OrcaRouter tidak membawa gpt-live-1 — endpoint Live Sessions hanya milik OpenAI, dan kami tidak merutekan satu pun darinya. Namun separuh bagian delegasi berbicara dalam Responses API, dan separuh itu sepenuhnya menjadi pilihanmu. GPT-5.6 Terra sudah aktif di OrcaRouter dengan harga daftar OpenAIOpenAI — $2,00 per juta token input dan $12,00 per juta output, dengan endpoint Responses yang diekspos — jadi model persis seperti dalam contoh milik OpenAIOpenAI sendiri hanya berjarak satu panggilan tanpa perlu kontrak atau SDK kedua.
Secara praktis, itu mengubah pilihan backend menjadi konfigurasi. Anda dapat melakukan A/B antara model penalar murah dengan model terdepan pada lalu lintas panggilan langsung dengan mengedit satu baris dan memantau tagihan per panggilan, atau menahan model delegasi di balik failover otomatis sehingga gangguan upstream pada suatu sore tidak ikut menjatuhkan saluran telepon Anda. Lapisan suara yang Anda bayar $0,05 per menit tetap di tempatnya; semua yang didelegasikannya berjalan melalui satu kunci di sekitar 190 model dari sebelas penyedia upstream, pada harga daftar penyedia tanpa markup.
Apa yang masih kurang?
• Tidak ada input gambar atau video — gambar statis dan berbagi layar tidak ada dalam rilis ini, sehingga permukaan suara multimodal yang masih dimiliki mode ChatGPT lama tetap belum ditangani
• Tidak ada structured outputs — jika agent Anda membutuhkan argumen tool yang tervalidasi skema, validasi tersebut harus berada di model backend Anda, bukan di lapisan suara
• Tidak ada akses tingkat Gratis dan tidak ada fine-tuning — biaya dan kustomisasi keduanya dimulai pada tingkat berbayar
• Tidak ada evaluasi independen terhadap angka utama apa pun — setiap angka di atas dijalankan oleh vendor
• Batas maksimum konkurensi 25 sesi simultan di Tier 1 — longgar untuk pilot, ketat untuk pusat panggilan pada hari pertama
Siapa yang harus bergerak, dan siapa yang harus menunggu.
Segera beralih sekarang jika Anda sedang membangun teleponi — saluran reservasi, pemesanan janji temu, dukungan lini pertama — dan stack Anda saat ini adalah kaskade klasik ASR-to-LLM-to-TTS. Latensi dan penanganan interupsi justru merupakan hal yang hilang dari pipeline itu, harga per menitnya cukup dapat diprediksi untuk dimasukkan ke spreadsheet, dan dokumentasi OpenAI sendiri kini menyertakan contoh server bergaya Twilio untuk disalin. Segera beralih juga jika Anda sudah menggunakan model Realtime dan produk Anda benar-benar bersifat percakapan, bukan berbasis giliran, karena penanganan interupsi adalah bagian yang paling lemah pada GPT-Realtime-2.1.
Tunggu jika integrasi Anda berbasis giliran dan berfungsi. Penulisan ulang transportasi adalah pekerjaan nyata, endpoint tidak mendukung hal lain, dan tidak ada jalur migrasi yang mempertahankan kode WebSocket Anda yang ada. Tunggu juga jika kasus penggunaan Anda bergantung pada keluaran alat terstruktur atau masukan video, yang keduanya tidak ada di sini.
Yang perlu diperhatikan dalam beberapa minggu ke depan: reproduksi independen pertama atas angka interaktivitas 80,1%, apakah tarif $0,05 bersifat perkenalan, apakah GPT-Live-1 mini yang lebih kecil masuk ke API seperti yang terjadi di sisi konsumen, dan apakah input gambar serta layar menutup kesenjangan itu. Sampai laboratorium eksternal menjalankan evaluasi tersebut, ringkasan yang jujur adalah bahwa ini adalah model suara paling mumpuni yang pernah dirilis kepada pengembang, dengan bukti atas klaim itu ditulis oleh orang-orang yang menjualnya.
