
Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: Membayar 4x untuk 38 Poin yang Penting
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dua model, satu peluncuran, satu daftar tarif, dan sebuah keputusan yang salah dibaca oleh sebagian besar tulisan ke arah yang sama. Gemini 3.8 Live Extended Thinking dan Gemini 3.8 Live dirilis bersamaan pada 15 September 2026, keduanya dibangun di atas Gemini 3 Pro, keduanya menangani 97 bahasa dengan peralihan otomatis di tengah percakapan, keduanya menerima input visual hampir real-time, keduanya memberi watermark pada audio yang dihasilkan dengan SynthID. Pada Speech to Speech Index komposit yang diterbitkan Artificial Analysis, keduanya terpaut 6,6 poin — 82,6 berbanding 76,0. Pada biaya audio per jam yang diukur oleh papan yang sama, keduanya terpaut sedikit lebih dari empat kali.
Tak satu pun dari keduanya adalah angka yang seharusnya menentukan arsitektur Anda. Angka yang seharusnya adalah 38: selisih antara keduanya pada τ-Voice, komponen penyelesaian tugas agentik, di mana varian penalaran menyelesaikan 68,6% skenario layanan pelanggan replika dan varian standar menyelesaikan 30,1%. Anda tidak sedang memilih antara model yang bagus dan model yang lebih baik. Anda sedang memilih antara antarmuka percakapan dan sistem penalaran yang kebetulan berbicara, dan perbedaan harganya adalah hal yang paling tidak menarik dari pilihan itu.
Percabangan harga, dalam satuan yang sebenarnya Anda ditagihkan.
Mulailah dari tagihan, karena itu bagian yang orang pahami dengan benar lalu diberi bobot berlebihan. Kedua model memiliki tarif sama yang dipublikasikan melalui Live API: $0.005 per menit untuk input audio dan $0.018 per menit untuk output audio, dan pada sisi Extended Thinking, token output tersebut mencakup proses berpikirnya. Kartu yang sama, tarif yang sama, tidak ada tier premium terpisah untuk penalaran.
Perbedaannya baru terlihat ketika Anda mengukur pekerjaan, bukan menit. Kolom biaya per jam audio masukan milik Artificial Analysis — biaya untuk menyelesaikan subset Big Bench Audio tetap berisi 40 pertanyaan, yang dinormalisasi menjadi angka per jam — menempatkan kedua model itu di kategori yang sama sekali berbeda:
• Gemini 3.8 Live Extended Thinking (High) — $3,50 per jam audio masukan, menurut pengukuran Artificial Analysis sendiri
• Gemini 3.8 Live — $0,84 per jam, tarif bayaran terendah di papan itu
• GPT-Live-1 (backend Astra, tingkat upaya sedang) — $5,83 per jam, jadi varian penalaran ini tetap sekitar 40% lebih murah daripada model yang dikalahkannya
• Grok Voice Think Fast 2.0 High — $4,80 per jam
• GPT-Realtime-2.1 High — $10,75 per jam
Itu adalah percabangannya: empat kali biaya audio per jam, pada tarif per menit yang dipublikasikan sama, karena varian penalaran menghabiskan lebih banyak token untuk durasi mendengarkan yang sama. $0.84 milik model standar bukanlah diskon, melainkan batas bawah dari seluruh papan.
Apa yang bisa didapat dengan 38 poin
Bongkar komposit itu, dan kedua model tersebut tidak lagi tampak seperti sepasang:
• Indeks Speech to Speech — Gemini 3.8 Live Extended Thinking (High) 82,6 vs Gemini 3.8 Live 76,0
• Performa agentik (penyelesaian tugas τ-Voice) — 68,6% vs 30,1%
• Penalaran bicara (Big Bench Audio) — 98% vs 92%
• Dinamika percakapan — 91,9% vs 96,1%
• Preferensi Arena (Elo) — 990 vs 1083
• Tingkat keberhasilan tugas — 89,1% vs 93,2%
• Waktu hingga audio pertama — 1,35 detik vs 1,18 detik
• Biaya per jam audio masukan — $3,50 vs $0,84
Bacalah itu secara jujur dan model yang lebih murah menang di empat dari delapan baris. Model itu lebih cepat mencapai audio pertama, lebih disukai arena, lebih mungkin menyelesaikan tugas yang dangkal, dan dinilai lebih baik dalam dinamika percakapan — yang terakhir bukanlah hadiah hiburan, karena dinamika percakapan adalah yang diperhatikan oleh penelepon. Yang tidak dapat dilakukannya adalah menyelesaikan pekerjaan yang memiliki tahapan. Tiga puluh satu koma satu persen berbanding 68,6% adalah kesenjangan tunggal terbesar di mana pun dalam rilis ini, dan itu jatuh pada satu sumbu yang membedakan agen dari antarmuka.
Dua catatan penting tentang baris-baris itu. Angka preferensi arena di dalam indeks dibekukan pada titik ketika sebuah model memenuhi syarat untuk dipublikasikan, jadi ini adalah snapshot, bukan Elo yang terus berjalan — bacalah sebagai rating pada titik waktu tertentu dan bukan sebagai bagan Speech Agent Arena langsung. Dan puncak papan τ-Voice sangat ketat: varian reasoning dengan 68,6% memimpin GPT-Live-1 pada 67,9% (backend Astra, upaya sedang) dengan selisih 0,7 poin, dengan GPT-Live-1 (Sol, upaya rendah) di 59,3% dan Grok Voice Think Fast 2.0 High di 56,5% tertinggal. Keunggulan 0,7 poin atas GPT-Live-1 masih dalam kisaran noise. Selisih 38 poin di dalam pasangan ini tidak demikian.

4x lainnya: apa biaya tier penalaran bagi Anda dalam kode
Ada fork kedua dalam rilis ini, dan itu tidak muncul di papan peringkat mana pun. Kedua model tersebut tidak dapat langsung saling dipertukarkan, karena varian penalaran mengubah kontrak yang harus dipatuhi klien Anda.
Pada model standar, Gemini 3.8 Liveberperilaku seperti yang diharapkan klien API Live: panggilan alat dan API latar belakang berjalan sementara model terus berbicara, dan turnComplete: truetetap menandai akhir giliran. Tidak ada pengaturan tingkat pemikiran untuk dipilih, karena tidak ada yang terpisah untuk dikonfigurasi — model menjawab, dan ketika sudah menjawab, giliran pun selesai.
Pada Gemini 3.8 Live Extended Thinking, tiga hal berubah sekaligus:
• Pemanggilan fungsi selalu asinkron. Deklarasi tool yang memblokir tidak mengantre dengan sopan — ia mengembalikan hard error. Skema tool apa pun yang Anda tulis untuk model standar harus dideklarasikan ulang sebagai non-blocking.
• Bidang status baru membawa keadaan sebenarnya. Klien harus membaca interaction_status alih-alih mempercayai turnComplete: bidang ini bernilai IN_PROGRESS selama model masih bernalar atau alat masih berjalan, dan baru menetap ke IDLE ketika seluruh tugas selesai. Satu giliran dapat berakhir sementara tugasnya belum.
• Kedalaman berpikir adalah tombol pengatur. Model ini menyediakan tingkat penalaran yang dapat dikonfigurasi — rendah, sedang, dan tinggi — dan angka 82.6 dan 68.6 di papan adalah (High) konfigurasi. Menurunkan ke rendah mengubah kualitas sekaligus tagihan token, dan tidak ada apa pun di indeks yang memberi tahu Anda apa yang harus Anda korbankan dalam penyelesaian tugas.
Poin ketiga itu adalah jebakan migrasi. Karena Extended Thinking merespons dengan cara yang sama di jalur komunikasi seperti model standar sampai ada pemanggilan tool, sebuah tim dapat menukar ID model, melihat demo yang berfungsi, dan baru menemukan kontrak asinkron di produksi ketika tool pemesanan mengembalikan error alih-alih hasil. Anggarkan refaktor klien bersama tarif audio 4×; pada integrasi yang sudah matang, biaya itu lebih besar di antara kedua biaya tersebut.
Yang mana yang sebenarnya diminta oleh beban kerja Anda
Cara yang bersih untuk memutuskan adalah dengan bertanya untuk apa sesi itu, bukan seberapa pintar Anda ingin sesi itu.
Ambil Gemini 3.8 Liveketika percakapan itu sendiri adalah hasil yang harus disampaikan. Menjawab, menjaga alur percakapan, menerima pesan, menyaring penelepon, bersikap menyenangkan serta cepat dan murah. Dengan $0,84 per jam audio masukan, ini adalah model suara kompeten termurah yang saat ini dipublikasikan oleh siapa pun, lebih disukai oleh arena, lebih andal pada tugas-tugas dangkal, dan 170 milidetik lebih cepat hingga audio pertama — perbedaan yang bisa dirasakan penelepon. Satu hal yang harus diterima adalah batas atasnya: 30,1% pada penyelesaian tugas multi-langkah berarti model ini tidak akan menyelesaikan pekerjaan yang memiliki langkah-langkah, dan sebanyak apa pun rekayasa prompt tidak akan mengubah angka itu.
Gunakan Gemini 3.8 Live Extended Thinking saat sesi memiliki tugas. Pemesanan, perubahan, pembatalan, penyelesaian masalah akun, menuntun penelepon melalui proses banyak langkah sambil mereka menunggu. Itulah garis 38 poin, dan nilainya $3.50 per jam — yang, perhatikan, masih lebih murah daripada kedua model yang skornya dikalahkannya pada komposit. Anda juga mendapatkan perilaku narasi yang membuat penantian dapat ditoleransi: model ini bernalar dan berbicara pada saat yang sama, jadi alih-alih hening saat mencari sesuatu, penelepon mendengar "Biar saya periksa…" dan kemajuan seiring berjalannya. Itu masalah yang sama yang dipecahkan oleh arsitektur dupleks penuh dengan tidak pernah menghentikan audio; jawaban Google adalah terus berbicara selama pekerjaan berlangsung.
Dua baris lagi yang perlu dipertimbangkan. Google juga melaporkan 35,1% untuk model Extended Thinking pada papan peringkat τ³-Banking milik Sierra, dibandingkan dengan 32,0% untuk GPT-Live-1 Astra — angka yang dilaporkan vendor tanpa pembacaan independen di belakangnya, dan angka yang menyadarkan secara absolut, karena 35,1% berarti model terbaik di papan itu gagal pada kira-kira dua dari setiap tiga upaya tugas perbankan yang realistis. Dan posisi kedua model standar di Speech Agent Arena, yang dikutip Google dalam materinya sendiri, adalah hasil nyata pada papan berbeda yang mengukur preferensi, bukan penyelesaian tugas. Kedua pernyataan itu berlaku. Gabungan keduanya menunjukkan bahwa model murah sangat baik untuk diajak bicara dan model mahal adalah satu-satunya dari keduanya yang dapat diberi pekerjaan.
Menjalankan keduanya, tanpa dua integrasi
Keberatan praktis terhadap semua ini adalah bahwa memilih per beban kerja berarti memelihara dua jalur. Tidak harus demikian. Kedua varian berada di depan kelas backend yang sama — eksekusi alat latar belakang dan perencanaan multi-langkah bermuara pada panggilan model teks biasa — dan lapisan itulah tempat variasi biaya Anda berada dan tempat pergantiannya murah.
OrcaRouter menyediakan 190 model dari satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Untuk stack yang merutekan antara tier percakapan murah dan tier penalaran mahal, dua properti yang penting adalah bahwa target delegasi dapat ditukar pada lalu lintas langsung tanpa menyentuh integrasi suara, dan bahwa failover otomatis menjaga sesi tetap hidup saat backend mengalami error atau timeout. Agar jelas tentang apa yang kami host dan tidak kami host: endpoint Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking tidak ada di router kami — keduanya berasal dari API Google sendiri, yaitu Gemini API, Live API, dan Google AI Studio. Model teks yang menjadi tujuan penyerahan pekerjaan agen-agen ini justru sering ada di sana, dan Gemini 3.8 Flash termasuk di antaranya.
Di mana setiap model berada di papan
Tangkapan di bawah ini diambil pada 16 September 2026, dan bagian atas Speech to Speech Index berbunyi sebagai berikut:
• Gemini 3.8 Live Extended Thinking (High) — 82.6, peringkat pertama
• GPT-Live-1 (backend Astra, upaya sedang) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, upaya rendah) — 80.1
• Gemini 3.8 Live — 76.0, peringkat kelima
• GPT-Realtime-2.1 Tinggi — 73.9
• Gemini 3.1 Flash Live High — 71.5
Satu catatan penamaan saat Anda membaca daftar itu: (High) sufiks yang dilekatkan pada model ini dalam cakupan adalah label konfigurasi upaya penalaran, bukan rilis terpisah. Ini konvensi yang sama yang digunakan dewan untuk Grok Voice Think Fast 2.0 High dan GPT-Realtime-2.1 High.

Apa yang masih belum di-commit?
Satu hal tentang pasangan ini mudah salah dibaca, jadi perlu dinyatakan secara gamblang: tidak ada satu pun model yang tersedia secara umum dalam pengertian kontraktual, meskipun keduanya sudah diberi harga dan didokumentasikan.
Pengembang mendapatkan Gemini 3.8 Live di Gemini API, Live API, dan Google AI Studio dengan ID gemini-3.8-live; perusahaan mendapatkan pratinjau privat di Gemini Enterprise, dengan Gemini Enterprise for Customer Experience tercantum sebagai akan segera hadir; konsumen mendapatkannya di Search Live. Gemini 3.8 Live Extended Thinking memiliki permukaan pengembang yang sama dengan gemini-3.8-live-extended-thinking, plus jalur konsumen yang lebih luas — Gemini Live, Docs Live untuk pelanggan Google AI Pro dan Ultra, serta Gmail Live dan Keep Live untuk semua pelanggan Google AI. Pelanggan bisnis Workspace tercantum sebagai akan segera hadir.
Yang hilang adalah hal yang dibutuhkan perusahaan sebelum menaruh lini pendapatan pada ini: komitmen ketersediaan umum, angka uptime yang dipublikasikan, dan tarif yang dijanjikan Google untuk dipertahankan. Harga-harganya sudah dipublikasikan, dan harga pratinjau cenderung berubah. Lakukan prototipe sekarang, rencanakan migrasi, dan jangan menandatangani target ketersediaan yang belum diberikan kepada Anda.

Keputusan yang sebenarnya disajikan oleh pasangan ini lebih sempit daripada yang terlihat dari indeks, dan ini bukan tangga kualitas. Jika tugas agen Anda adalah berbicara, model murah bukanlah kompromi — model itu adalah produk yang lebih baik dengan harga yang lebih rendah, dan tarif empat kali lebih murah adalah bonus, bukan argumennya. Jika tugas agen Anda adalah menyelesaikan sesuatu, varian penalaran adalah satu-satunya dari keduanya yang bahkan bisa diberi tugas itu, dan $3.50 per jam hanyalah kesalahan pembulatan dibandingkan pemesanan yang jika tidak demikian akan gagal. Kesalahan yang harus dihindari adalah mencari jalan tengah: membayar kedalaman penalaran untuk beban kerja yang selama ini hanya membutuhkan percakapan yang baik, yang merupakan hal yang terjadi ketika sebuah tim membaca selisih komposit 6,6 poin dan tidak pernah menggulir ke bawah ke angka 38.
