Kartu judul hero untuk Gemini 3.8 Live Extended Thinking vs GPT-Live-1, yang menunjukkan kedua model suara tersebut terpaut 1,1 poin indeks dengan model penagihan yang berbeda.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs GPT-Live-1: Seri 1,1 Poin dan Dua Tagihan yang Berbeda

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada skor komposit, ini seri. Gemini 3.8 Live Extended Thinking berada di 82,6 pada Indeks Speech to Speech milik Artificial Analysis; GPT-Live-1, di backend Astra-nya dengan upaya penalaran sedang, berada di 81,5. Pada komponen agentik di bawahnya — penyelesaian tugas τ-Voice — selisihnya 0,7 poin, 68,6% berbanding 67,9%. Pada komponen penalaran, selisihnya lebih lebar dan bergerak ke arah sebaliknya: 97,7% pada Big Bench Audio untuk model Gemini, 90,1% untuk GPT-Live-1. Tidak ada apa pun dalam sebaran itu yang bertahan pada proses benchmark kedua, dan tidak ada satu pun dari itu yang seharusnya menjadi dasar keputusan Anda.

Yang membedakan keduanya bukanlah kualitas. Yang membedakan adalah ketidaksepakatan mereka tentang apa itu agen suara, siapa yang melakukan pemikiran, dan — bagian yang pertama kali memengaruhi anggaran — bagaimana sesi ditagih. Gemini 3.8 Live Extended Thinking menagih berdasarkan token audio dan bernalar di model yang sama yang berbicara. GPT-Live-1 menagih tarif tetap untuk durasi sesi, terlepas dari ada yang berbicara atau tidak, dan menyerahkan pemikiran sebenarnya kepada model teks terpisah yang Anda pilih dan bayar secara terpisah. Itu adalah dua produk berbeda yang memakai skor benchmark yang sama, dan mana yang cocok bergantung pada pertanyaan yang tidak pernah diajukan papan peringkat: seperti apa panggilan rata-rata di saluran Anda?

Seri 1,1 poin, dan di mana ia sebenarnya patah

Mulailah dengan angka-angkanya, karena ketipisan judul utamanya itulah intinya:

Indeks Speech to Speech — Gemini 3.8 Live Extended Thinking (Tinggi) 82,6 vs GPT-Live-1 (backend Astra, upaya sedang) 81,5

Performa agentik (penyelesaian tugas τ-Voice) — 68,6% vs 67,9%, dengan GPT-Live-1 pada 59,3% saat menjalankan backend Sol dengan upaya rendah

Penalaran ucapan (Big Bench Audio) — 97,7% vs 90,1%, satu-satunya komponen yang selisihnya bukan sekadar noise

Alur kerja perbankan yang kompleks (Sierra τ³-Banking, dilaporkan vendor) — 35,1% vs 32,0%

Waktu hingga audio pertama — 1,35 dtk vs 1,24–1,34 dtk melalui API

Biaya terukur per jam — $3.50 vs $5.83 untuk konfigurasi Astra, keduanya berdasarkan pengukuran audio input dari Artificial Analysis

Pembacaan yang jujur adalah bahwa kedua model tidak dapat dibedakan pada skor komposit, dapat dibedakan pada penalaran ucapan di mana model Gemini unggul hampir delapan poin, dan dapat dibedakan pada biaya di mana model tersebut unggul sekitar 40%. Keunggulan GPT-Live-1 terletak pada bagian-bagian pengalaman yang sulit dinilai oleh tolok ukur: ia benar-benar dupleks penuh, mendengarkan sambil berbicara, mengeluarkan backchannel, memutuskan beberapa kali per detik apakah akan berbicara atau menyerahkan giliran. Gemini 3.8 Live Extended Thinking berbasis giliran. Ia memecahkan masalah mendasar yang sama — penelepon dibiarkan dalam keheningan saat agen bekerja — dengan menarasikan sebagai gantinya, menalar dan berbicara sekaligus dengan isyarat seperti "Biar saya periksa dulu…" selagi tugas berjalan.

Kedua pendekatan itu membuat jalur ini tetap hidup. Keduanya terasa berbeda. Hanya salah satunya yang muncul di sebuah indeks.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Dua model penagihan, dan mengapa daftar tarif menyesatkan

Inilah bagian yang menentukan sebagian besar penerapan, dan justru inilah yang dilewatkan oleh cakupan.

Gemini 3.8 Live Extended Thinking ditagih dengan cara yang sama seperti model token ditagih. Melalui Live API, tarif yang dipublikasikan adalah $3,00 per juta token input audio — sekitar $0,005 per menit input audio — dan $12,00 per juta token output audio, sekitar $0,018 per menit, dengan token pemikiran dihitung dalam output tersebut. Anda membayar untuk audio yang bergerak. Penelepon yang berhenti sejenak, berpikir, atau ditahan tidak memakan biaya apa pun bagi Anda selama mereka diam.

GPT-Live-1 ditagih dengan cara yang sama seperti saluran telepon ditagih. Tarifnya tetap $0.05 per menit waktu sesi, dihitung per detik, terlepas dari siapa yang berbicara atau apakah ada yang berbicara. Backend penalaran tidak termasuk: model teks yang melakukan pemikiran, dan alat apa pun yang dipanggilnya, ditagih secara terpisah di atasnya. Itulah bagaimana angka utama $0.05 menjadi angka keseluruhan sekitar $4.47 per jam pada backend Sol dan $5.83 per jam pada Astra medium, yang diukur oleh Artificial Analysis.

Jika keduanya diletakkan berdampingan, perbandingan naif — $0,018 versus $0,05 per menit, selisih 2,8× — salah ke dua arah. Angka per jam yang terukur menempatkan selisih sebenarnya pada $3,50 versus $5,83, lebih dekat ke 1,7×. Tetapi model jam sesi juga mengubah bentuk tagihan Anda, bukan hanya besarnya: pada GPT-Live-1, biaya Anda mengikuti durasi panggilan, sehingga saluran dengan panggilan panjang, sepi, dan berisi sedikit — antrean dukungan, langkah verifikasi, pengalihan IVR — membayar sama seperti saluran yang padat. Di sisi Gemini, biaya mengikuti audio, jadi keheningan gratis dan banyak bicara tidak. Lakukan perhitungan dengan panjang panggilan rata-rata Anda sendiri sebelum menghitung dengan tarif per menit, karena angka itulah yang menentukan mana dari keduanya yang lebih murah bagi Anda, dan jawabannya tidak sama untuk saluran pemesanan dan saluran triase.

Di mana pemikiran terjadi

Perbedaan struktural yang kedua adalah delegasi, dan inilah yang menentukan seberapa banyak dari stack ini yang benar-benar dapat Anda tukar.

GPT-Live-1 adalah front-end. Ia menangani audio dupleks, dan ketika sebuah kueri membutuhkan penalaran sungguhan, ia menyerahkan pekerjaan itu ke model backend terpisah — GPT-5.5 dan GPT-6 Astra keduanya didokumentasikan sebagai backend — dengan pemilih upaya penalaran yang memungkinkan Anda memilih seberapa banyak backend tersebut yang ingin Anda beli. Inilah sebabnya papan ini mencantumkan GPT-Live-1 dua kali dengan skor berbeda: 81,5 pada Astra dengan upaya sedang, 80,1 pada Sol dengan upaya rendah. Selisih 1,4 poin antara dua konfigurasinya sendiri lebih besar daripada celah 1,1 poin antara kedua model dalam pertandingan ini, yang memberi tahu Anda bahwa di sisi OpenAI, konfigurasi yang Anda pilih lebih penting daripada vendor yang Anda pilih.

Gemini 3.8 Live Extended Thinking bernalar di model yang sama yang berbicara. Tidak ada backend terpisah yang perlu dipilih dan tidak ada tagihan terpisah untuk itu; trade-off-nya adalah Anda mengatur kedalaman dengan tingkat pemikiran — rendah, sedang, dan tinggi — pada model yang sama, dan angka 82,6 dan 68,6 adalah (Tinggi) konfigurasi. Eksekusi alat dan API latar belakang berjalan secara asinkron di kedua sisi, sehingga tidak ada model yang macet saat bekerja.

Satu konsekuensi praktis: karena kecerdasan GPT-Live-1 adalah model teks yang dibeli di balik front-end suara, plafon kualitasnya bergeser saat OpenAI merilis model teks, bukan saat merilis model suara. Plafon Gemini 3.8 Live Extended Thinking bergeser saat Google melatih ulang model audio. Jika Anda memasang taruhan dua tahun pada platform suara, perbedaan tempo peningkatan itu lebih layak dipikirkan daripada 1,1 poin indeks.

Berapa biaya peralihan, apa pun arah yang Anda pilih

Tidak satu pun dari keduanya merupakan sekadar penukaran ID model, dan tim yang menganggapnya demikian akan mengetahuinya saat sudah di produksi. Berpindah ke Gemini 3.8 Live Extended Thinking berarti menerima kontrak giliran yang berbeda: pemanggilan fungsi selalu asinkron, sehingga deklarasi alat yang bersifat memblokir mengembalikan error keras alih-alih mengantre, dan klien harus membaca field interaction_statusIN_PROGRESS selama penalaran atau sebuah alat masih berjalan, IDLE hanya ketika seluruh tugas selesai — alih-alih memercayai turnComplete sebagai tanda bahwa pekerjaannya sudah selesai. Berpindah ke GPT-Live-1 berarti mengadopsi saluran pemilihan backend-nya dan permukaan penagihan kedua, serta hidup dengan API yang baru tersedia secara umum bagi pengembang pada 10 September 2026, setelah debutnya di ChatGPT pada 8 Juli — sehingga perkakas pihak ketiga, SDK, dan observabilitas di sekitarnya baru berumur beberapa bulan, bukan bertahun-tahun. Ke arah mana pun Anda berpindah, anggarkan pekerjaan integrasi di samping tagihan token. Pada tumpukan suara yang matang, refaktor biasanya menjadi yang lebih besar dari keduanya.

Cara menjalankan perbandingan seperti ini tanpa bertaruh padanya

Cara masuk akal untuk menyelesaikan pertanyaan selisih 1,1 poin adalah menjalankan keduanya pada trafik Anda sendiri, dan bagian yang merepotkan adalah bahwa biasanya hal itu berarti dua integrasi, dua kontrak, dan dua set kredensial. Itu tidak harus berarti dua arsitektur. Pada kedua sistem ini, front-end suara hanyalah lapisan tipis di atas panggilan model teks biasa — untuk GPT-Live-1 itu eksplisit, dan untuk sisi Gemini, eksekusi tool latar belakang diselesaikan dengan cara yang sama — dan lapisan teks itulah tempat variasi biaya Anda berada dan tempat beralih benar-benar murah.

OrcaRouter menyediakan 190 model dari satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan harga di hulu langsung berlaku di sisi kami pada hari yang sama, bukan saat pembaruan kontrak berikutnya. Untuk stack suara, dua properti yang penting adalah bahwa target delegasi dapat ditukar pada trafik langsung tanpa menyentuh integrasi suara, dan bahwa failover otomatis menjaga panggilan tetap aktif saat backend mengalami error atau timeout — itulah yang memungkinkan Anda mencoba konfigurasi yang belum terbukti pada trafik nyata tanpa menempatkan lini produksi di belakangnya. Agar tepat mengenai apa yang kami host dan tidak kami host: baik endpoint Gemini 3.8 Live Extended Thinking maupun endpoint GPT-Live-1 tidak ada di router kami — keduanya berasal dari API Google dan OpenAI sendiri. Model teks yang menjadi tujuan delegasi mereka sangat sering ada di router kami, termasuk Gemini 3.8 Flash.

Puncak papan, dan betapa jarangnya ia menetap

Tangkapan di bawah ini diambil pada 16 September 2026:

Gemini 3.8 Live Extended Thinking (High) — 82.6, peringkat pertama

GPT-Live-1 (backend Astra, upaya sedang) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, upaya rendah) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 Tinggi — 73.9

• Gemini 3.1 Flash Live High — 71.5

Tiga hal yang patut diperhatikan. Pertama, peringkat pertama dan ketiga terpaut 1,3 poin dan peringkat pertama dan kelima terpaut 6,6, jadi puncak papan ini adalah pertarungan ketat, bukan peringkat. Kedua, model dalam judul perbandingan ini bukan entri Gemini peringkat kelima — itu adalah Gemini 3.8 Live standar, produk yang berbeda dan jauh lebih murah yang tidak boleh disamakan dengan varian penalaran yang dibandingkan di sini. Ketiga, ada preseden untuk memperlakukan angka indeks tunggal apa pun sebagai sementara: xAI melaporkan 82,9 untuk Grok Voice Think Fast 2.0 pada Juli, dan model itu tercatat 81,3 di papan ini. Skor indeks yang dilaporkan vendor tidak selalu bertahan ketika bersentuhan dengan papan peringkat langsung. Angka τ-Voice 68,6% dan 67,9% kini berada di papan publik yang dijalankan di bawah harness milik Artificial Analysis sendiri, sehingga angka-angka itu dikuatkan, bukan sekadar diklaim — tetapi perbedaan 0,7 poin antara dua model pada harness yang sama bukanlah suatu perbedaan. Verifikasi pada trafik Anda atau abaikan saja.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Satu angka lagi yang layak diperhitungkan ke dalam keputusan ini, karena ini adalah angka yang paling tidak nyaman dalam perbandingan ini: Google melaporkan 35,1% untuk Gemini 3.8 Live Extended Thinking pada papan peringkat τ³-Banking milik Sierra, dibandingkan 32,0% untuk GPT-Live-1 Astra. Angka-angka itu dilaporkan vendor, belum direproduksi, dan menggambarkan dunia di mana agen suara terdepan di papan itu gagal pada kira-kira dua dari setiap tiga upaya tugas perbankan yang realistis. Jika agen Anda harus menyelesaikan pekerjaan multi-langkah yang diatur regulasi, tidak ada satu pun dari model ini yang sudah selesai — dan keunggulan 3,1 poin pada tolok ukur itu bukan alasan untuk memilih vendor, melainkan alasan untuk tetap melibatkan manusia dalam prosesnya.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Jadi: jika kealamian percakapan adalah produknya dan panggilan Anda singkat serta padat, perilaku dupleks penuh GPT-Live-1 adalah keunggulan nyata yang tidak bisa dilihat oleh indeks, dan penagihan berbasis jam sesi masih dapat ditoleransi pada durasi panggilan sepanjang itu. Jika panggilan panjang, sunyi, atau bervariasi, atau jika penalaran ucapan dan biaya per jam mendominasi, Gemini 3.8 Live Extended Thinking unggul pada komponen-komponen yang penting dan sekitar 40% lebih murah per jam saat melakukannya — dengan catatan bahwa sistem itu berbasis giliran, masih dalam pratinjau untuk perusahaan, dan memerlukan refaktor klien sebelum dapat menjalankan alat Anda. Tidak ada dari semua ini yang membenarkan memilih salah satunya berdasarkan kekuatan 1,1 poin indeks. Berdasarkan bukti yang tersedia, alasan jujur untuk memilih di antara keduanya adalah model penagihan dan arsitektur di baliknya, dan keduanya adalah hal yang dapat Anda ukur pada lalu lintas Anda sendiri minggu ini.

Di OrcaRouter, failover otomatis menjaga panggilan tetap aktif ketika backend mengalami error atau timeout.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari