
GPT-Live-1 Memuncaki Speech to Speech Index dengan 81,5 — tetapi Peringkatnya Milik Backend-nya
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, model suara dupleks penuh yang pertama kali hadir di dalam ChatGPT pada 8 Juli 2026, kini berada di peringkat pertama pada Artificial Analysis Speech to Speech Index dengan skor 81,5 — sebuah baris yang ada hanya karena model itu diarahkan ke GPT-6 Astra untuk melakukan pemikirannya. Jalankan front end suara yang sama dengan GPT-5.6 Sol sebagai backend yang didelegasikan pada upaya penalaran rendah, dan skornya menjadi 80,1, yang merupakan peringkat ketiga. Peringkat kedua, dengan skor 81,3, dimiliki oleh Grok Voice Think Fast 2.0 High.
Dua hal jujur sebelum angka-angka. Model ini bukan hal baru: GPT-Live-1 tiba di API pengembang pada 10 September 2026, setelah dua bulan menjadi suara default ChatGPT. Yang baru, diukur pada 15 September, adalah bahwa evaluator luar telah menilainya — satu hal yang hilang dari setiap tulisan tentang model ini sejauh ini, termasuk tulisan kami sendiri, yang di dalamnya satu-satunya angka yang tersedia adalah angka yang diterbitkan OpenAI tentang dirinya sendiri. Dan margin 0,2 poin atas peringkat kedua lebih kecil daripada selisih 1,4 poin antara dua konfigurasi GPT-Live-1 sendiri, yang merupakan angka paling berguna di papan skor.
Jadi judul "GPT-Live-1 adalah model suara terbaik" tidak sepenuhnya seperti yang dikatakan indeks itu. Indeks tersebut menyatakan bahwa GPT-Live-1 dengan GPT-6 Astra pada tingkat upaya sedang adalah yang terbaik, dengan selisih seperlima poin, dan bahwa pilihan backend mengubah hasil lebih besar daripada yang dilakukan model pesaing mana pun.
Apa yang sebenarnya diukur oleh indeks
Artificial Analysis menyusun Speech to Speech Index sebagai komposit berbobot sama dari empat bagian: Penalaran Ucapan, diukur oleh Big Bench Audio; Kinerja Agentik, diukur oleh τ-Voice; Preferensi Arena, Elo preferensi manusia secara berpasangan; dan Tingkat Keberhasilan Tugas. Hanya model yang keempat komponennya tersedia yang mendapatkan nilai indeks — semua lainnya menampilkan tanda pisah, itulah sebabnya tabel ini memiliki jauh lebih banyak baris daripada skor. Indeks ini sendiri diluncurkan pada 23 Juni 2026 dan telah direvisi dua kali sejak saat itu, yang terbaru dengan mengganti Dinamika Percakapan dengan Keberhasilan Tugas, sehingga skor dari satu revisi tidak dapat dibandingkan secara ketat dengan skor dari revisi lain.
Dua detail metodologi lebih lanjut penting saat Anda membaca peringkat ini. Arena Elo dibekukan pada nilai apa pun saat sebuah model pertama kali menjadi layak dipublikasikan, sehingga komponen preferensi memberi imbalan pada yang datang lebih awal, bukan pada yang terbaik saat ini. Dan indeks ini menilai keseluruhan sistem, bukan satu model saja: untuk GPT-Live-1, angka tersebut mencakup front end suara plus model backend mana pun yang menerima pekerjaan darinya. Itu adalah pilihan desain yang disengaja, dan itulah alasan model yang sama muncul dua kali dengan skor berbeda.
Bagian atas bidang, seperti yang diterbitkan:
• GPT-Live-1 (Astra, medium) — indeks 81,5, pertama
• Grok Voice Think Fast 2.0 High — indeks 81,3, kedua
• GPT-Live-1 (Sol, low) — indeks 80.1, ketiga
• GPT-Realtime-2.1 High — indeks 73.9, keempat
• GPT-Realtime-2 High — indeks 73,6, kelima
• Grok Voice Think Fast 1.0 — indeks 72,3, keenam
• Gemini 3.1 Flash Live High — indeks 71,5, ketujuh

Sebagai gambaran, model yang digantikan GPT-Live-1 berada 7,6 poin di bawahnya. Itu adalah kesenjangan generasi yang nyata, dan hal itu tidak diperdebatkan.
Kemenangan 0,2 poin berasal dari tepat satu komponen
Bongkar kompositnya, dan dua pemimpin itu tidak lagi tampak seperti model sejenis. Pada komponen-komponennya, menurut Artificial Analysis:
• Performa agentik (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%
• Penalaran ucapan (Big Bench Audio) — 90% vs 97%
• Tingkat keberhasilan tugas — 87,4% vs 94,6%
• Arena Elo — 1048 vs 1011
• Waktu hingga audio pertama — 1,34 dtk vs 0,70 dtk
• Biaya per jam, termasuk backend — $5,83 vs $4,80

GPT-Live-1 menang di dua dari enam lini dan kalah di empat, tetapi tetap memuncaki indeks. Aritmetikanya bukan misteri: selisih τ-Voice adalah 11,4 poin, jauh lebih besar daripada selisih lain mana pun dalam tabel, dan dengan pembobotan yang setara, itu menyeret nilai komposit melewati garis. Dengan kata sederhana, GPT-Live-1 adalah agen yang lebih baik dan Grok Voice Think Fast 2.0 High adalah pendengar yang lebih baik sekaligus yang lebih cepat — dan indeks kebetulan memberi bobot yang cukup besar pada hal yang dikuasai GPT-Live-1 sehingga menjadikannya pertama.
Jika produk Anda adalah agen suara yang memesan, menyelesaikan, atau bertransaksi, keunggulan 11,4 poin τ-Voice adalah angka yang memprediksi pengalaman Anda. Jika produk Anda adalah percakapan yang harus terasa instan dan tidak pernah memotong pembicaraan pengguna, waktu 0,70 detik menuju audio pertama adalah angka yang memprediksi pengalaman Anda, dan Grok memenangkannya sekitar dua kali lipat. Pada eksekusi tugas yang diatur, ada peringatan kedua: tingkat keberhasilan tugas Grok sebesar 94,6% adalah yang tertinggi dalam tabel yang terlihat, dan 87,4% milik GPT-Live-1 berarti kira-kira satu dari delapan tugas tidak selesai. Keduanya merupakan peningkatan dari generasi sebelumnya. Keduanya belum menjadi masalah yang tuntas.
Baris #1 adalah konfigurasi routing, bukan model
Inilah bagian yang lebih patut diperhatikan daripada posisi di papan peringkat. GPT-Live-1 adalah lapisan suara dupleks penuh yang menangani pendengaran, berbicara, interupsi, dan pengambilan giliran sendiri, serta mendelegasikan penalaran, pemanggilan alat, dan pencarian ke model backend terpisah sementara percakapan berlanjut. Artificial Analysis menilai dua dari pasangan tersebut sebagai entri terpisah. Astra pada upaya sedang menghasilkan 81.5. Sol pada upaya rendah menghasilkan 80.1.
Rentang 1,4 poin itulah intinya. Jarak antara peringkat pertama dan kedua adalah 0,2 poin. Jarak antara dua konfigurasi bernilai GPT-Live-1 tujuh kali lebih besar. Tidak ada yang berubah pada model suara di antara baris-baris itu — hanya model mana yang melakukan pemikiran, dan pada tingkat upaya berapa. Papan peringkat yang memeringkat sistem memberi tahu Anda, secara akurat, bahwa konfigurasinya adalah produknya.
Ini juga merevisi pelaporan kami sendiri. Pada 11 September 2026 kami mencatat GPT-Live-1 pada 69,8% dalam indeks ini, di bawah GPT-Realtime-2.1 dan Grok. Itu adalah bacaan yang tersedia saat itu, dan mendukung kesimpulan yang wajar — bahwa OpenAI telah membangun mekanika percakapan terbaik dan bukan agen suara terbaik. Indeks sekarang memuat dua konfigurasi GPT-Live-1 yang didelegasikan pada 81,5 dan 80,1. Artificial Analysis tidak menerbitkan changelog, dan merevisi komponen indeks pada Agustus, jadi kami tidak dapat mengatakan dengan pasti apakah angka sebelumnya adalah konfigurasi tanpa skor atau berskor sebagian atau sebuah run di bawah pembobotan lama; yang dapat diamati adalah bahwa pasangan yang didelegasikan kini muncul sebagai baris lengkapnya sendiri, dan bahwa jawabannya berubah ketika itu terjadi.
Konsekuensi praktisnya adalah bahwa "model suara mana" adalah pertanyaan yang salah dan "model suara mana plus backend mana, pada tingkat upaya berapa" adalah pertanyaan yang benar. Itu adalah pertanyaan perutean, dan itulah yang produk kami sendiri hadir untuk menjawabnya. OrcaRouter mengekspos backend delegasi GPT-Live-1, GPT-6 Astra, melalui endpoint yang kompatibel dengan OpenAI yang sama seperti 200+ model lainnya, sehingga menukar lapisan pemikiran hanyalah perubahan ID model, bukan integrasi. DSL perutean menggabungkan beberapa model menjadi satu panggilan, dan failover otomatis berarti pasangan yang belum terbukti bukanlah taruhan produksi — jika backend menurun, permintaan akan mendarat di tempat lain alih-alih gagal. Untuk lebih tepat mengenai apa yang tidak kami lakukan: GPT-Live-1 sendiri tidak ada dalam katalog kami dan kami tidak melayaninya. Backend tempat ia mendelegasikan adalah hal yang berbeda.
Berapa biaya satu jam untuk ini
Front end GPT-Live-1 ditagih $0,05 per menit suara, dihitung per detik, yaitu $3,00 untuk satu jam saluran terbuka. Itu bukan keseluruhan tagihan: penalaran yang didelegasikan, pemanggilan alat, dan penelusuran web dihitung secara terpisah dengan tarif yang dikenakan model backend. Artificial Analysis mengukur angka total keseluruhan, itulah sebabnya kolom biayanya adalah yang harus digunakan:
• GPT-Live-1 (Sol, rendah) — $4,47 per jam
• Grok Voice Think Fast 2.0 High — $4,80 per jam
• GPT-Live-1 (Astra, medium) — $5,83 per jam
• GPT-Realtime-2.1 High — $10,75 per jam
Pemenang peringkat adalah yang termahal dari tiga opsi saat ini, dan konfigurasi yang menang 30% lebih mahal per jam daripada konfigurasi yang menempati peringkat ketiga. Dibaca dari sisi lain, pembagiannya informatif: $3.00 dari setiap jam adalah lapisan suara, dan sisanya — $1.47 pada Sol, $2.83 pada Astra — adalah token backend. Lapisan pemikiran berada di suatu tempat antara sepertiga dan setengah dari tagihan Anda, yang merupakan porsi besar untuk komponen yang oleh papan peringkat dianggap sebagai catatan kaki.

Dibandingkan dengan model yang digantikannya, seluruh keluarga ini harganya kira-kira setengah — front end $0.05 per menit adalah potongan harga yang sesungguhnya, bukan pengemasan ulang. Karena token backend ditagih dengan tarif backend, biaya penerapan GPT-Live-1 sebagian besar bergantung pada model penalaran mana yang Anda arahkan, dan backendnya bisa berupa model milik OpenAI sendiri atau pihak ketiga. Di OrcaRouter, backend tersebut diteruskan pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor pada lapisan thinking berlaku pada hari yang sama, bukan pada siklus penagihan berikutnya.
Apa yang tidak diselesaikan oleh indeks
Tiga catatan, yang dinyatakan oleh sumber alih-alih disimpulkan. Baik entri-entri GPT-Live-1 maupun Grok Voice Think Fast 2.0 High ditandai sebagai didasarkan pada satu uji coba saja, yang terlalu tipis untuk keputusan selisih 0,2 poin — pengujian ulang dapat menukar urutan pertama dan kedua tanpa ada perubahan apa pun pada kedua model. Arena Elo, sebagaimana dicatat, dibekukan pada pengukuran pertama yang dapat dipublikasikan untuk tiap model. Dan indeks tidak memiliki entri tentang bagaimana sistem ini berperilaku dalam panggilan panjang: komponen-komponennya berhorizon pendek secara konstruksi, sedangkan mode kegagalan yang benar-benar mematikan agen suara di produksi adalah drift selama percakapan dua puluh menit.
Secara terpisah, dan dari vendor, bukan dari indeks: API GPT-Live-1 dirilis tanpa input gambar atau video, tanpa output terstruktur, dan tanpa tier gratis, serta batas lajunya dihitung dalam sesi bersamaan, bukan permintaan per menit. Itu adalah batasan saat peluncuran yang mungkin sudah berubah; periksa batasan-batasan itu sebelum Anda merancang dengan mempertimbangkannya.
Apa yang harus dilakukan dengan ini
Jika minggu ini Anda memilih arsitektur, bukan model, indeks ini memberi keunggulan pada pola delegasi untuk pekerjaan agentik dan pola kaskade untuk latensi. GPT-Live-1 pada 81,5 adalah bukti terkuat sejauh ini bahwa memisahkan percakapan dari penalaran adalah bentuk yang tepat untuk agen suara yang menyelesaikan tugas. Grok Voice Think Fast 2.0 High pada 81,3, dengan 0,70 detik ke audio pertama dan tingkat keberhasilan tugas 94,6%, adalah bukti terkuat bahwa bentuk delegasi bukan satu-satunya yang berhasil — dan bahwa ia belum menjadi yang tercepat.
Keputusan yang mengikuti angka-angka itu lebih murah daripada kelihatannya. Kedua konfigurasi GPT-Live-1, dan model yang mengalahkannya pada empat dari enam komponen, berada dalam selisih $1.36 per jam satu sama lain. Pada selisih sebesar itu, langkah yang tepat adalah berhenti membaca papan peringkat dan menjalankan transkrip Anda sendiri melalui keduanya. Indeks memberi tahu Anda bentuk trade-off-nya; ia tidak dapat memberi tahu Anda di sisi mana pengguna Anda berada dalam trade-off tersebut.
Pertanyaan yang ditimbulkan oleh angka itu
Apakah GPT-Live-1 model suara terbaik saat ini?
Berdasarkan skor komposit, ya — dengan selisih 0,2 poin dan hanya didukung oleh satu uji coba. Berdasarkan komponennya, semuanya bergantung pada apa yang Anda bangun: ini unggul dalam performa agentik dan preferensi arena, tetapi tertinggal dalam penalaran ucapan, tingkat keberhasilan tugas, dan waktu hingga audio pertama. Keunggulan komposit 0,2 poin yang bertumpu pada satu keunggulan komponen 11,4 poin adalah peringkat pertama yang bisa dipertahankan, bukan peringkat pertama yang menentukan.
Apakah Anda harus menggunakan GPT-6 Astra untuk mendapatkan 81,5?
Untuk baris itu tepatnya, ya — 81,5 milik GPT-Live-1 yang dikonfigurasi dengan Astra pada upaya penalaran sedang. Sol pada upaya rendah adalah alternatif yang terdokumentasi pada 80,1 dan $1,36 per jam lebih murah, dan OpenAI mendukung menghadirkan model pihak ketiga sebagai backend, jadi entri papan peringkat adalah dua titik pada sebuah kurva, bukan satu-satunya opsi. Pasangan mana yang terbaik untuk beban kerja Anda bukanlah hal yang dapat dijawab oleh indeks publik untuk Anda.
Mengapa model yang sama mendapat skor 69.8 dalam liputan kami sebelumnya dan 81.5 sekarang?
Kedua angka tersebut mencakup hal yang berbeda. Pembacaan sebelumnya menempatkan GPT-Live-1 pada indeks sebagai satu entri tunggal; tabel saat ini memuat dua konfigurasi yang didelegasikan sebagai baris terpisah yang dinilai sepenuhnya, dengan pasangan Astra pada 81,5 dan pasangan Sol pada 80,1. Artificial Analysis merevisi komponen indeks pada Agustus dan tidak menerbitkan changelog, jadi perlakukan delta tersebut sebagai perubahan pada apa yang diukur, bukan sebagai bukti bahwa model menjadi lebih baik — dan perlakukan skor komposit tunggal apa pun untuk model yang mendelegasikan sebagai pernyataan tentang sebuah konfigurasi.
