
Gemini 3.8 Live vs GPT-Live-1: Full-Duplex vs Model yang Berpikir Sambil Berbicara
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Selama sekitar dua bulan, perdebatan itu diselesaikan oleh arsitektur. GPT-Live-1 benar-benar dupleks penuh — ia mendengarkan sambil berbicara, menghasilkan sinyal balik seperti "mhmm" dan "mengerti", serta memutuskan beberapa kali per detik apakah akan berbicara atau memberi giliran. Gemini 3.8 Live, yang diumumkan pada 15 September 2026, adalah model berbasis giliran. Dalam kerangka lama, hal itu membuat perbandingannya mudah, dan sekarang itu cara yang salah untuk menafsirkannya.
Yang berubah bukanlah bahwa Google menyamai full-duplex. Yang berubah adalah bahwa Google merilis hal yang selama ini dikompensasi oleh full-duplex: model suara yang dapat melakukan percakapan sementara tugas multi-langkah berjalan di latar belakang, dan varian kedua yang mengutarakan penalaran secara lisan saat bekerja. Perbedaan arsitekturnya nyata. Hanya saja, itu bukan lagi poros yang menentukan keputusan pembelian.
Dua cara untuk menjaga percakapan tetap hidup
Pertaruhan dupleks penuh adalah bahwa kualitas percakapan adalah produknya. GPT-Live-1 memproses audio masukan dan keluaran secara terus-menerus dan sinkron di dalam satu model, bukan merangkai ucapan-ke-teks ke model bahasa lalu ke teks-ke-ucapan. Hal itu menghilangkan kehilangan informasi antartahap, dan menghasilkan perilaku yang benar-benar diperhatikan orang: Anda dapat menyela di tengah jawaban dan ia menyesuaikan diri; ia tidak salah mengira jeda atau suara latar sebagai akhir giliran Anda; ia tetap diam sampai dipanggil.
Taruhan berbasis giliran yang dipasang Gemini 3.8 Live adalah bahwa percakapan merupakan perancah untuk pekerjaan. Fitur-fiturnya berfokus pada menjaga sesi tetap produktif, bukan menjaga ritme tetap alami: pemrosesan masukan visual hampir waktu nyata, peralihan otomatis antara 97 bahasa yang didukung di tengah percakapan, dan eksekusi alat serta API di latar belakang yang mengonfirmasi permintaan dan terus berbicara selagi panggilan diselesaikan.
Kedua model menolak menutup telepon saat mereka berpikir. Mereka hanya menolaknya dengan cara yang berbeda. GPT-Live-1 melakukannya dengan tidak pernah menghentikan aliran audio. Google melakukannya dengan terus berbicara selama proses kerja berlangsung.

Apa yang sebenarnya dikatakan indeks
Artificial Analysis memelihara Speech to Speech Index — komposit berbobot dari penalaran ucapan, performa agentik, preferensi arena, dan tingkat keberhasilan tugas. Bacalah papan yang diambil pada 16 September 2026 dengan cermat, karena judul utamanya menyembunyikan struktur:
• Gemini 3.8 Live Extended Thinking — 82,6 (pertama)
• GPT-Live-1 (backend Astra, upaya sedang) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, upaya rendah) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 Tinggi — 73.9
• Gemini 3.1 Flash Live High — 71.5
Tiga hal muncul dari pengurutan itu. Pertama, Google menempati posisi teratas, tetapi dengan varian yang mahal, bukan varian yang akan paling banyak digunakan orang. Kedua, GPT-Live-1 muncul dua kali, karena Artificial Analysis menilai keseluruhan sistem, bukan front-end suaranya — dan selisih 1,4 poin antara kedua konfigurasinya tujuh kali lebih besar daripada selisih 0,2 poin antara posisi pertama dan kedua. Ketiga, model dalam judul pertandingan ini, Gemini 3.8 Live, berada di posisi kelima, di bawah kedua konfigurasi GPT-Live-1.
Jika Anda membandingkan hal yang setara — tier standar dengan tier standar — GPT-Live-1 memenangkan pertarungan ini pada indeks komposit, dan selisihnya tidak tipis. Angka 82,6 milik Gemini 3.8 Live Extended Thinking, yang merupakan produk berbeda dengan harga berbeda dan peluncuran berbeda.

Di mana GPT-Live-1 masih unggul
Full-duplex bukanlah pembeda pemasaran, dan pemisahan benchmark menunjukkan di mana hal itu berubah menjadi keunggulan nyata:
• Performa agentik — GPT-Live-1 memimpin secara meyakinkan pada τ-Voice dengan 67,9% melawan 56,5% milik Grok. Google belum menerbitkan angka τ-Voice yang sebanding untuk Gemini 3.8 Live, hanya 68,6% untuk varian Extended Thinking.
• Dinamika percakapan — pengambilan giliran dupleks penuh tetap menjadi tolok ukur kealamian, dan model berbasis giliran secara historis tertinggal dalam hal ini.
• Kedalaman delegasi — GPT-Live-1 menyerahkan kueri sulit ke model teks terdepan, dengan GPT-5.5 dan GPT-6 Astra keduanya terdokumentasi sebagai backend, serta menyediakan pemilih upaya penalaran.
• Sumber — transkrip suara dari ChatGPT membawa tautan kutipan, yang masih jarang terjadi dalam interaksi suara pada umumnya.
Penyeimbangnya adalah bahwa GPT-Live-1 tertinggal dalam penalaran ucapan mentah: 90,1% pada Big Bench Audio versus 97,2% milik Grok. Dan angka latensi utamanya sebesar 0,798 detik pada Full Duplex Bench adalah pengukuran yang berbeda dari waktu API hingga audio pertama, yang berkisar 1,24–1,34 detik.
Di mana Gemini 3.8 Live unggul
Keunggulan Google bukanlah soal percakapan, melainkan lebih pada apa yang dapat dilakukan sesi:
• Visi, saat ini — Gemini sudah mendukung input kamera dan berbagi layar sejak beberapa waktu lalu. GPT-Live-1 diluncurkan tanpa video atau berbagi layar, dan OpenAI mengatakan fitur-fitur itu akan segera hadir serta menunjuk Advanced Voice Mode yang lebih lama sebagai solusi sementara. Gemini 3.8 Live menambahkan pemrosesan input visual yang hampir real-time di atasnya.
• Cakupan bahasa — 97 bahasa yang didukung dengan pengalihan otomatis di tengah percakapan, dibandingkan pilihan yang jauh lebih sempit di sisi OpenAI.
• Biaya — tarif yang diumumkan adalah $0,005 per menit input audio dan $0,018 per menit output audio. GPT-Live-1 ditagih $0,05 per menit suara hanya untuk front-end, dengan biaya terukur secara keseluruhan sekitar $4,47–$5,83 per jam setelah token backend dihitung.
• Tingkat kedua yang bernalar dengan lantang — Gemini 3.8 Live Extended Thinking menarasikan kemajuan dengan isyarat seperti "Coba saya periksa…", yang merupakan jawaban berbeda terhadap masalah keheningan dibandingkan dupleks penuh.
Perbandingan biaya yang penting
Tarif front-end tampak seperti kemenangan telak — $0,018 versus $0,05 per menit — dan angka per jamnya bahkan lebih mencolok. Bagan biaya per jam input audio Artificial Analysis menempatkan Gemini 3.8 Live pada $1,50 per jam, dibandingkan $4,14 untuk GPT-Realtime-2 High dan $10,75 untuk GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 berada di $4,80.
Masalahnya adalah tidak ada satu pun dari angka-angka itu yang merupakan tagihan sebenarnya. $0.05 per menit milik GPT-Live-1 hanya mencakup front-end suara; model teks backend yang melakukan penalaran sesungguhnya ditagih secara terpisah, itulah sebabnya angka utama $0.05 menjadi $4.47–$5.83 per jam secara keseluruhan. Gemini 3.8 Live memiliki bentuk struktural yang sama — eksekusi tool di latar belakang adalah pekerjaan model teks — dan Google belum mempublikasikan berapa biayanya.
Jadi pembacaan yang jujur adalah bahwa Gemini 3.8 Live lebih murah di awal dengan selisih yang besar, dan perbandingan secara keseluruhan tidak diketahui untuk keduanya sampai Anda mengukur beban kerja Anda sendiri. Itu bukan menghindar; itulah keadaan informasi yang sebenarnya.
Lapisan yang menjadi tujuan delegasi keduanya
Inilah fakta struktural yang membuat perbandingan ini bukan sekadar keputusan lock-in seperti yang terlihat. Kedua model mendelegasikan. GPT-Live-1 secara desain menyerahkan kueri-kueri sulit ke model teks backend, dan eksekusi alat di latar belakang pada sisi Gemini bermuara pada pemanggilan model biasa. Dalam kedua kasus, front-end suara hanyalah lapisan tipis di atas model teks yang melakukan penalaran — dan lapisan teks itulah tempat variasi biaya Anda berada dan tempat beralih menjadi murah.
OrcaRouter membawa 190 model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga penurunan harga dari sisi hulu sampai ke sisi kami pada hari yang sama, bukan pada pembaruan kontrak berikutnya. Untuk stack suara, dua properti yang penting adalah bahwa target delegasi dapat ditukar pada lalu lintas live tanpa menyentuh integrasi suara, dan bahwa failover otomatis menjaga panggilan tetap hidup saat backend mengalami error atau timeout. Satu klarifikasi, karena mudah untuk menyiratkan sebaliknya: kami tidak menghosting endpoint suara Gemini 3.8 Live atau GPT-Live-1 — endpoint tersebut berasal dari API vendor masing-masing. Model teks yang mereka serahi pekerjaan umumnya ada di router.

Cara memilih
Pilih GPT-Live-1 jika kualitas percakapan adalah produknya — penanganan interupsi yang natural, backchannel, dan kesan bahwa Anda sedang berbicara dengan sesuatu alih-alih mengoperasikannya — dan jika Anda mampu menanggung seluruh biayanya, yang jauh lebih tinggi daripada yang terlihat dari tarif utamanya. Perhatikan bahwa API-nya baru tersedia pada September 2026, sehingga perkakas pihak ketiga di sekitarnya masih muda.
Ambil Gemini 3.8 Livejika Anda membutuhkan visi sekarang, jika Anda membutuhkan lebih dari beberapa lusin bahasa, atau jika ekonomi per menit lebih dominan dalam model Anda. Terimalah bahwa Anda membeli tier standar, yang menempati peringkat kelima pada indeks komposit, bukan pertama, dan bahwa angka 82,6 yang akan dikutip semua orang adalah milik varian Extended Thinking.
Pilih Gemini 3.8 Live Extended Thinking jika penalaran adalah intinya dan Anda menginginkan pemimpin indeks saat ini — tetapi periksa peluncurannya terlebih dahulu, karena jalur distribusinya melalui Gemini Live, Docs, Gmail, dan Keep lebih luas daripada model standar dan ketersediaan perusahaannya masih dalam pratinjau privat.
Hal yang perlu diperhatikan sepanjang kuartal berikutnya adalah apakah full-duplex tetap menjadi parit pertahanan. Model berbasis giliran menutup celah percakapan melalui jalur berbeda — menjaga audio tetap sibuk dengan narasi selagi pekerjaan berlangsung — dan jika itu bertahan di bawah trafik nyata, pembedaan arsitektural yang telah mendefinisikan kategori ini selama setahun akan berhenti menjadi hal yang ditanyakan pembeli.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
