Kartu judul hero bertuliskan 'GPT-Live-1 Mencapai API' dengan subjudul '$0,05 per menit untuk suara dupleks penuh' dan baris 'Model ini berasal dari 8 Juli 2026; API pengembang dirilis 10 September 2026', bersama dua bentuk gelombang audio yang tumpang tindih dengan panah melengkung ke kedua arah, dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

GPT-Live-1 Kini Hadir di API: Suara Full-Duplex dengan $0,05 per Menit, Tanpa Jalur Drop-In dari GPT-Realtime-2.1

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GPT-Live-1 sudah ada di API per 10 September, dan angka yang benar-benar akan mengubah anggaran bukanlah tolok ukur — melainkan unit penagihannya. Model suara dupleks penuh OpenAIOpe​nAI kini menagih tarif tetap $0,05 per menit suara, ditagih per detik, sedangkan model yang menjadi pembandingnya, GPT-Realtime-2.1, diukur dalam token audio sebesar $32 per juta untuk masukan dan $64 per juta untuk keluaran. Modelnya sendiri bukan hal baru: GPT-Live-1 dirilis di dalam ChatGPT pada 8 Juli 2026, sebagai pengganti Advanced Voice Mode. Yang baru adalah bahwa para pengembang akhirnya dapat memanggilnya — dan bahwa cara memanggilnya hampir tidak mirip sama sekali dengan integrasi Realtime yang sudah dimiliki sebagian besar tim. Dokumentasi OpenAIOpe​nAI sendiri memasangkan lapisan suara dengan backend penalaran terpisah, dan dalam contoh WebRTC yang dipublikasikan, backend tersebut adalah GPT-5.6 Terra.

Apa yang dirilis pada 10 September, dan apa yang tidak

Permukaan API sengaja dibuat sempit. Hanya ada satu ID model, gpt-live-1, yang juga merupakan snapshot default-nya sendiri — tidak ada varian bertanggal untuk disematkan. Hanya ada satu endpoint, yaitu endpoint Live Sessions di v1/live/sessions. Semua hal lain di platform OpenAI dinonaktifkan untuk model ini: tidak ada Chat Completions, tidak ada Responses, tidak ada Realtime (termasuk varian terjemahan dan transkripsi), tidak ada Assistants, tidak ada Batch, tidak ada fine-tuning, tidak ada embeddings, tidak ada pembuatan gambar atau video, tidak ada endpoint audio speech atau transkripsi, tidak ada moderation.

Input dan output berupa audio dan teks. Streaming dan pemanggilan fungsi didukung; output terstruktur, fine-tuning, dan output terprediksi tidak didukung. Input gambar dan video secara eksplisit tidak didukung — jadi permukaan "voice with video" yang telah diisyaratkan OpenAIOpe​nAI bukan bagian dari rilis ini. Tier Gratis sama sekali tidak dapat memanggilnya, dan batas laju diukur dalam sesi bersamaan, bukan permintaan per menit: 25 pada Tier 1, meningkat menjadi 50, 200, 300, dan 500 di Tier 2 hingga 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Pembingkaian konkurensi itu adalah petunjuk pertama bahwa ini bukan pengganti plug-in. Batas laju yang dinyatakan dalam percakapan langsung simultan memberi tahu Anda apa yang OpenAIOpe​nAI harapkan sebagai unit skala: saluran telepon, bukan permintaan.

Perubahan harga adalah cerita yang lebih senyap namun lebih besar

Penagihan tarif tetap per menit adalah perubahan yang nyata. Dalam sistem penghitungan token, Anda harus memodelkan konsumsi audio — berapa token yang dihabiskan oleh satu detik keheningan, bagaimana penelepon yang terus berbicara saat agen berbicara mengubah panjang keluaran — sebelum Anda dapat memperkirakan satu panggilan pun. Dengan $0.05 per menit, aritmetikanya menyusut menjadi sekadar perkalian:

• Panggilan dukungan 5 menit — $0,25 untuk waktu suara

• Panggilan 10 menit — $0,50

• Rata-rata 4 menit untuk 1.000 panggilan sehari — $200 sehari, sekitar $6.000 sebulan

• Satu jam saluran terbuka terus-menerus — $3.00

Tiga detail memperjelas hal itu. Pertama, durasi tidak dibulatkan ke atas ke menit penuh berikutnya, jadi panggilan 40 detik dikenai biaya sekitar 3,3 sen, bukan satu nikel penuh. Kedua, inisialisasi sesi menagih 15 detik durasi suara di muka — tetapi itu dikreditkan terhadap biaya durasi berikutnya, bukan ditambahkan di atasnya, jadi panggilan yang lebih pendek dari 15 detik tetap dikenai harga 15 detik. Ketiga, suara hanya separuh dari tagihan. Model penalaran backend, panggilan alatnya, dan pencarian web apa pun ditagih secara terpisah dengan tarif normal model tersebut, yang berarti "model suara murah" tetap dapat menghasilkan panggilan mahal jika Anda mengarahkan delegasi ke penalar terdepan dan membiarkannya mencari di setiap giliran.

Struktur dua meter itulah tempat routing berhenti sekadar menjadi nilai tambah. Di OrcaRouter, separuh backend dari sesi GPT-Live-1 hanyalah panggilan model biasa — kira-kira 190 model dari sebelas penyedia hulu di balik satu kunci, dengan harga daftar penyedia yang diteruskan tanpa markup, dan failover otomatis jika backend pilihan Anda error atau timeout. Anda tidak bisa merutekan lapisan suara itu sendiri; endpoint Live Sessions hanya milik OpenAIOpe​nAI. Anda sama sekali bisa merutekan semua yang didelegasikan oleh lapisan suara, yakni separuh bagian yang skalanya bergantung pada seberapa keras pemanggil Anda berpikir.

Hanya WebRTC — mengapa kode Realtime Anda tidak akan bisa di-port

Inilah biaya praktis untuk beralih, dan sebagian besar liputan peluncuran melewatkannya. Sesi GPT-Live-1 berjalan melalui WebRTC, bukan transport WebSocket yang menjadi fondasi banyak integrasi Realtime yang sudah ada. Menyelidiki jalur lama dengan ID model GPT-Live akan mengembalikan error yang secara gamblang memberi tahu bahwa sesi memerlukan WebRTC.

Handshake, menurut panduan WebRTC OpenAIOpe​nAI: browser Anda membuka RTCPeerConnection, melampirkan track mikrofon, membuka data channel dan mendaftarkan listener sebelum menawarkan, menetapkan deskripsi lokal, menunggu pengumpulan ICE, dan mengirim offer ke server Anda sendiri. Server Anda kemudian memanggil POST /v1/live/sessions dengan konfigurasi sesi plus transport: { type: "webrtc", sdp: ... }. Jika berhasil, akan mengembalikan HTTP 201 yang membawa session.id dan transport.sdp, yang diterapkan browser sebagai deskripsi remote. Media mengalir melalui track yang dinegosiasikan; data channel — dengan label oai-events — membawa transkrip, pembaruan sesi dan pekerjaan yang didelegasikan. Untuk menutup panggilan, Anda mengirim session.close dan terus membaca sampai session.closed diterima.

Dua jebakan yang layak ditempel di monitor. Panggilan HTTP itu sendiri memulai sesi, jadi Anda juga tidak boleh mengirim session.start di kanal data. Dan Anda tidak boleh menambahkan audio masukan atau menunggu delta audio keluaran melalui kanal itu — biarkan audio.format di luar konfigurasi dan biarkan SDP menanganinya. Contoh-contoh server membatasi isi permintaan pada 64 KB, menetapkan batas waktu pengumpulan ICE setelah 10 detik dan finalisasi sesi setelah 15.

Tidak ada dari itu yang sulit. Semuanya adalah kode baru. Jika produk Anda adalah agen realtime berbasis giliran, bermigrasi ke GPT-Live-1 adalah penulisan ulang transportasi ditambah penulisan ulang delegasi, bukan sekadar penukaran ID model — layak dianggarkan sebagai sprint, bukan pekerjaan satu sore.

Benchmark, dan siapa yang menjalankan semuanya

Setiap angka di bawah ini adalah milik OpenAIOpe​nAI sendiri, diterbitkan bersama rilis API dan tidak direproduksi secara independen oleh siapa pun pada saat penulisan. Kaveat itu lebih penting daripada biasanya di sini, karena selisihnya cukup besar sehingga mengundang untuk dikutip sebagai fakta yang sudah mapan.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Interaktivitas dupleks penuh — GPT-Live-1 80,1% vs 45,4% untuk GPT-Realtime-2.1

• Latensi pergantian giliran — 0,8 dtk vs 1,4 dtk

• Akurasi pemanggilan alat — 87% vs 60%

• Tolok ukur dukungan suara perbankan, tingkat kelulusan — 32% vs 12,4%

Baca baris terakhir dua kali. Tingkat kelulusan 32% adalah peningkatan besar dibandingkan 12,4% dan tetap berarti sistem gagal pada sekitar dua pertiga tugas dalam evaluasi itu. Lonjakan interaktivitas dan pemanggilan alat adalah yang menggambarkan produk yang benar-benar berbeda; angka perbankan adalah yang jujur tentang seberapa jauh agen suara masih dari menangani alur kerja teregulasi tanpa pengawasan.

Bukti pelanggan lebih tipis daripada tabel benchmark dan menunjuk ke arah yang sama. Yelp menggunakan GPT-Live-1 untuk reservasi berbasis telepon, dengan CTO Alex Levy dikutip tentang penanganan panggilan yang lebih baik. Platform pembelajaran bahasa Speak melaporkan hampir 80% lebih sedikit interupsi dibandingkan sistem berbasis giliran sebelumnya — angka yang dilaporkan sendiri dari perusahaan yang memiliki kepentingan dalam hasil tersebut, dan masih merupakan angka penerapan paling konkret yang tersedia.

Lapisan suara adalah front end; Anda memilih otaknya.

Taruhan arsitekturalnya adalah delegasi, dan itulah bagian dari rilis ini yang menjadi tempat lapisan perutean menyatu secara alami. GPT-Live-1 tidak melakukan pemikiran mendalam. Ketika penelepon menanyakan sesuatu yang memerlukan penalaran, pengambilan informasi, atau alat, model menyerahkan tugas tersebut melintasi batas asinkron ke backend terpisah yang terus bekerja sementara percakapan lisan berlanjut, lalu memasukkan kembali jawabannya saat sudah siap.

Konfigurasinya eksplisit, dan ada baiknya membaca contoh dokumentasi itu dengan saksama. Di samping model: "gpt-live-1" dan instruksinya, sesi tersebut membawa sebuah delegation objek bertipe responses, yang di dalamnya terdapat blok responses yang menyebutkan model backend, instruksinya sendiri, serta alat-alatnya — contohnya menggunakan web_search — dan sebuah tool_choice. Dalam contoh WebRTC yang dipublikasikan OpenAIOpe​nAI, model backend tersebut adalah GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

Itulah klaim sesungguhnya dari desain ini: ganti backend-nya dan pengalaman suara menjadi lebih pintar tanpa melatih ulang model ucapannya. Ini juga berarti backend delegasi bersifat portabel dengan cara yang tidak dimiliki lapisan suara. OrcaRouter tidak membawa gpt-live-1 — endpoint Live Sessions hanya milik OpenAI, dan kami tidak merutekan satu pun darinya. Namun separuh bagian delegasi berbicara dalam Responses API, dan separuh itu sepenuhnya menjadi pilihanmu. GPT-5.6 Terra sudah aktif di OrcaRouter dengan harga daftar OpenAIOpe​nAI — $2,00 per juta token input dan $12,00 per juta output, dengan endpoint Responses yang diekspos — jadi model persis seperti dalam contoh milik OpenAIOpe​nAI sendiri hanya berjarak satu panggilan tanpa perlu kontrak atau SDK kedua.

Secara praktis, itu mengubah pilihan backend menjadi konfigurasi. Anda dapat melakukan A/B antara model penalar murah dengan model terdepan pada lalu lintas panggilan langsung dengan mengedit satu baris dan memantau tagihan per panggilan, atau menahan model delegasi di balik failover otomatis sehingga gangguan upstream pada suatu sore tidak ikut menjatuhkan saluran telepon Anda. Lapisan suara yang Anda bayar $0,05 per menit tetap di tempatnya; semua yang didelegasikannya berjalan melalui satu kunci di sekitar 190 model dari sebelas penyedia upstream, pada harga daftar penyedia tanpa markup.

Apa yang masih kurang?

• Tidak ada input gambar atau video — gambar statis dan berbagi layar tidak ada dalam rilis ini, sehingga permukaan suara multimodal yang masih dimiliki mode ChatGPT lama tetap belum ditangani

• Tidak ada structured outputs — jika agent Anda membutuhkan argumen tool yang tervalidasi skema, validasi tersebut harus berada di model backend Anda, bukan di lapisan suara

• Tidak ada akses tingkat Gratis dan tidak ada fine-tuning — biaya dan kustomisasi keduanya dimulai pada tingkat berbayar

• Tidak ada evaluasi independen terhadap angka utama apa pun — setiap angka di atas dijalankan oleh vendor

• Batas maksimum konkurensi 25 sesi simultan di Tier 1 — longgar untuk pilot, ketat untuk pusat panggilan pada hari pertama

Siapa yang harus bergerak, dan siapa yang harus menunggu.

Segera beralih sekarang jika Anda sedang membangun teleponi — saluran reservasi, pemesanan janji temu, dukungan lini pertama — dan stack Anda saat ini adalah kaskade klasik ASR-to-LLM-to-TTS. Latensi dan penanganan interupsi justru merupakan hal yang hilang dari pipeline itu, harga per menitnya cukup dapat diprediksi untuk dimasukkan ke spreadsheet, dan dokumentasi OpenAI sendiri kini menyertakan contoh server bergaya Twilio untuk disalin. Segera beralih juga jika Anda sudah menggunakan model Realtime dan produk Anda benar-benar bersifat percakapan, bukan berbasis giliran, karena penanganan interupsi adalah bagian yang paling lemah pada GPT-Realtime-2.1.

Tunggu jika integrasi Anda berbasis giliran dan berfungsi. Penulisan ulang transportasi adalah pekerjaan nyata, endpoint tidak mendukung hal lain, dan tidak ada jalur migrasi yang mempertahankan kode WebSocket Anda yang ada. Tunggu juga jika kasus penggunaan Anda bergantung pada keluaran alat terstruktur atau masukan video, yang keduanya tidak ada di sini.

Yang perlu diperhatikan dalam beberapa minggu ke depan: reproduksi independen pertama atas angka interaktivitas 80,1%, apakah tarif $0,05 bersifat perkenalan, apakah GPT-Live-1 mini yang lebih kecil masuk ke API seperti yang terjadi di sisi konsumen, dan apakah input gambar serta layar menutup kesenjangan itu. Sampai laboratorium eksternal menjalankan evaluasi tersebut, ringkasan yang jujur adalah bahwa ini adalah model suara paling mumpuni yang pernah dirilis kepada pengembang, dengan bukti atas klaim itu ditulis oleh orang-orang yang menjualnya.