Kartu hero yang dihasilkan untuk artikel 'Gemini 3.8 Live vs ElevenLabs', menampilkan dua kartu membulat di kedua sisi judul. Kartu kiri bertuliskan 'Gemini 3.8 Live' di atas ikon awan dan bentuk gelombang suara serta baris 'ucapan ke ucapan, satu proses, per menit'; kartu kanan bertuliskan 'ElevenLabs Agents' di atas ikon pipeline tiga blok berlabel 'STT - LLM - TTS' dan baris 'dirakit, per menit agen'. Subjudulnya berbunyi 'Komponen yang Anda sewa vs sistem yang menyewa komponen'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: Sebuah Model Melawan Pipeline

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Buka dokumentasi ElevenLabs untuk platform agennya dan ada model Gemini di tengah-tengahnya. ElevenLabs Agents adalah kaskade — front end pengenalan suara, model bahasa, dan back end text-to-speech — dan model bahasa dalam stack yang dipublikasikan adalah model Gemini. Itulah tempat yang tepat untuk memulai perbandingan Gemini 3.8 Live vs ElevenLabs, karena dua hal yang dibandingkan bukan jenis objek yang sama. Gemini 3.8 Live adalah model speech-to-speech, dirilis di Live API pada 15 September 2026, dengan harga per menit audio. ElevenLabs Eleven v3 adalah model sintesis unggulan dari platform suara yang juga menjual ElevenLabs Agents, dan harganya dihitung per karakter, bukan per percakapan. Yang satu adalah komponen yang bisa Anda sewa. Yang lainnya adalah sistem yang menyewa komponen — termasuk, dalam setidaknya satu konfigurasi yang dipublikasikan, komponen milik model Gemini.

Asimetri itu menjawab sebagian besar pertanyaan yang sebenarnya dibawa orang ke perbandingan ini. Jika Anda bertanya mana yang harus dipilih, jawaban jujurnya adalah keduanya bukan pengganti satu sama lain: yang satu adalah model dengan daftar tarif dan tanpa telefoni, yang lain adalah produk dengan telefoni, batas konkurensi, dan tiga meteran yang berjalan serentak. Mana yang lebih murah, lebih baik, atau lebih cepat sepenuhnya bergantung pada bentuk mana dari kedua wujud itu yang sudah menjadi wujud aplikasi Anda.

Satu model, atau tiga model secara berurutan

Gemini 3.8 Live adalah sistem speech-to-speech native. Audio masuk, audio keluar, dan penalaran terjadi dalam forward pass yang sama yang menghasilkan ucapan — satu model, satu anggaran latensi, satu tagihan. Google merilisnya dalam dua varian pada 15 September 2026: gemini-3.8-live untuk pekerjaan percakapan dalam skala besar, dan gemini-3.8-live-extended-thinking untuk antarmuka yang sama dengan penalaran multi-langkah di belakangnya. Keduanya menangani 97 bahasa dengan pengalihan di tengah percakapan, keduanya memproses input visual dalam waktu hampir real-time, keduanya menjalankan panggilan alat dan API di latar belakang saat percakapan berlanjut, dan keduanya memberi watermark pada setiap detik audio yang dihasilkan dengan SynthID. Tarif yang dipublikasikan adalah $0.005 per menit untuk input audio dan $0.018 per menit untuk output audio.

ElevenLabs Agents bukan itu. Itu adalah pipeline, dan pipeline itulah produknya. Model pengenalan ucapan real-time mentranskripsikan penelepon, model bahasa memutuskan apa yang harus dikatakan, dan model sintesis — Eleven Flash v2 dalam konfigurasi yang didokumentasikan ElevenLabs — mengucapkan jawabannya. Setiap tahap diukur secara terpisah, setiap tahap dapat ditukar, dan keseluruhannya berada di balik lapisan terkelola yang menangani telefoni, deteksi giliran bicara, dan konkurensi. ElevenLabs Eleven v3, model sintesis andalan perusahaan, adalah produk yang berbeda lagi: model text-to-speech dengan harga $100 per juta karakter, dijual untuk narasi, dubbing, dan desain suara, bukan untuk mengadakan percakapan.

Jadi hal pertama yang perlu diluruskan adalah bahwa "Gemini 3.8 Live vs ElevenLabs Eleven v3" bukanlah adu langsung antara dua model ucapan. Eleven v3 tidak menerima masukan audio dan tidak melakukan percakapan. Perbandingan yang bermakna adalah Gemini 3.8 Live versus ElevenLabs Agents, dengan Eleven v3 hanya hadir sebagai plafon kualitas sintesis yang menjadi dasar platform itu dibangun.

Di mana masing-masing sebenarnya berada di papan

Tidak ada papan peringkat yang memeringkatkan keduanya secara berhadapan, dan alasannya instruktif: keduanya terus muncul di papan yang berbeda yang mengukur hal-hal yang berbeda.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

Pada Speech to Speech Index milik Artificial Analysis — yang menggabungkan penalaran ucapan, penyelesaian tugas agentik, preferensi arena, dan keberhasilan tugas menjadi satu angka — Gemini 3.8 Live mendapat skor 76,0, dengan varian Extended Thinking pada 82,6 di posisi pertama. Itu adalah pengukuran yang dijalankan Artificial Analysis dengan harness-nya sendiri, bukan angka yang diterbitkan Google, meskipun pengumuman Google sendiri mengutip angka dari komponen yang sama.

ElevenLabs sama sekali tidak muncul di papan itu, karena mereka tidak merilis model speech-to-speech untuk diukur. Tempat ia muncul adalah Speech Agent Arena, yang mengevaluasi agen yang sudah dirakit alih-alih model, dan gambaran di sana benar-benar beragam: ElevenLabs Agents tercatat pada 937 Elo dengan tingkat keberhasilan tugas 90,5%, dibandingkan dengan 1.046 Elo dan keberhasilan tugas 74,6% untuk agen yang dibangun di atas generasi Gemini Live sebelumnya, dengan agen Gemini mencapai audio pertama dalam 0,96 detik. Cermati pasangan itu dengan saksama. Agen yang didukung Gemini menang dalam hal preferensi dan kecepatan; agen ElevenLabs menang dalam menyelesaikan tugas. Itu adalah cascade yang mengalahkan model native dalam hal keandalan, yang bukan hasil yang akan diprediksi oleh diagram arsitektur.

Ada dua catatan penting soal angka-angka itu, dan keduanya sama-sama relevan. Sisi Gemini dalam perbandingan tersebut menggunakan generasi Gemini Live awal 2026, bukan 3.8 Live, jadi itu bukan pembacaan atas model yang dibahas artikel ini. Dan papan ketiga yang ikut bermain — arena tutur Provider Voices milik Artificial Analysis, yang memeringkat model sintesis — menempatkan ElevenLabs Eleven v3 pada 1,177 Elo dan varian percakapannya, ElevenLabs v3 Conversational, pada 1,219 Elo, berbanding 1,283 untuk sang pemimpin, Cartesia Sonic 3.6. Papan itu mengukur seberapa bagus suara terdengar, bukan seberapa baik agen berperforma, dan mencampuradukkan keduanya adalah cara orang akhirnya mengutip skor sintesis sebagai bukti tentang sistem percakapan.

Kontras spesifikasi

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Arsitektur — Gemini 3.8 Live adalah satu model speech-to-speech native, sedangkan ElevenLabs Agents adalah kaskade pengenalan ucapan, model bahasa, dan sintesis

• Input dan output — Gemini 3.8 Live menerima audio dan mengembalikan audio dalam satu proses vs ElevenLabs menerima audio melalui Scribe v2 Realtime dan mengembalikannya melalui Eleven Flash v2, dengan transkrip teks di antaranya

• Apa yang dapat Anda tukar — Gemini 3.8 Live tidak ada, modelnya adalah model itu vs ElevenLabs setiap tahap secara independen, termasuk model bahasa, yang dalam stack yang didokumentasikan adalah milik Google

• Bahasa — Gemini 3.8 Live 97 dengan peralihan di tengah percakapan vs ElevenLabs Eleven v3 74

• Harga audio — Gemini 3.8 Live $0,005 per menit masuk dan $0,018 per menit keluar vs ElevenLabs yang dihargai berdasarkan menit agen dengan token model bahasa dihitung secara terpisah sebagai tambahan

• Telefoni — Gemini 3.8 Live tidak memiliki pihak pertama, Anda membawa operator dan manajemen sesi sendiri vs ElevenLabs yang terkelola, pihak pertama

• Konkurensi — Gemini 3.8 Live sebanyak yang diizinkan kuota Live API Anda vs ElevenLabs yang dijual dalam tingkatan konkurensi

• Perkakas agen — Gemini 3.8 Live alat latar belakang dan eksekusi API di dalam model vs ElevenLabs lapisan agen terkelola dengan deteksi giliran, alur kerja, dan pustaka suara

• Artefak terbuka — tidak ada. Keduanya tertutup, hanya cloud, dan proprietari.

• Latensi — Gemini 3.8 Live 1,18 detik ke audio pertama untuk model standar dan 1,35 untuk Extended Thinking, menurut Artificial Analysis, sedangkan ElevenLabs tidak dipublikasikan sebagai satu angka, karena latensi kaskade adalah jumlah dari tiga tahap

Baris terakhir adalah baris yang menjelaskan pilihan arsitektur lebih baik daripada baris lainnya. Model native memiliki satu anggaran latensi. Cascade memiliki tiga, dan alasan tim masih memilih cascade adalah semua yang ada di atasnya: transkrip yang dapat Anda catat, tahap yang dapat Anda tukar, dan nomor telepon yang langsung berfungsi.

Berapa biaya satu menit, di kedua arah

Aritmetika Gemini 3.8 Live luar biasa mudah karena hanya ada satu meteran. Satu menit percakapan kira-kira satu menit audio pemanggil ditambah satu menit audio model: $0,005 ditambah $0,018, jadi sekitar 2,3 sen per menit pada tarif yang dipublikasikan. Kolom biaya per jam milik Artificial Analysis, yang menormalkan biaya penyelesaian set penalaran audio tetap menjadi angka per jam, menempatkan model standar pada $0,84 per jam audio masukan — tarif berbayar termurah di papan itu — dan varian Extended Thinking pada $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

Hitungan ElevenLabs lebih rumit, dan itulah intinya, bukan sebuah kritik. Satu menit agen bukanlah satu harga: ada biaya platform untuk menit agen itu sendiri, token model bahasa yang dikonsumsi pada bagian tengah, dan menit operator di bawahnya — tiga meteran, tiga vendor dalam skenario terburuk, dan tagihan yang berubah ketika salah satunya berubah. Sisi sintesisnya lebih mudah dibaca: ElevenLabs Eleven v3 dengan $100 per juta karakterkira-kira $8 per jam untuk narasi berkelanjutan pada kecepatan bicara normal, dibandingkan sekitar $2,70 untuk pesaing open-weights termurah di arena yang sama. ElevenLabs mengenakan harga premium untuk suaranya, dan di papan itu premi tersebut nyata — ia berada di peringkat keempat secara keseluruhan.

Yang dimaksud kedua struktur biaya itu dalam praktik adalah bahwa Gemini 3.8 Live lebih murah per menit percakapan dan jauh lebih murah per jam audio, sementara ElevenLabs lebih mahal dan jauh lebih dapat diprediksi untuk dioperasikan. Tim tanpa insinyur ML dan dengan nomor telepon yang harus segera diaktifkan akan mengeluarkan lebih sedikit untuk ElevenLabs pada bulan pertama, karena alternatifnya adalah membangun apa yang sudah dibangun ElevenLabs. Tim yang sudah menjalankan manajemen sesi sendiri dan operator sendiri akan mengeluarkan lebih sedikit untuk model mentahnya, karena mereka tidak membayar untuk pipeline yang sudah mereka miliki.

Dalam hal apa ElevenLabs benar-benar lebih unggul

Akan mudah menafsirkan selisih harga sebagai vonis. Tidak demikian, dan alasannya adalah hal-hal yang tidak pernah ditunjukkan oleh kartu tarif.

• Telefoni. ElevenLabs menjual nomor telepon, SIP trunking, dan konkurensi untuk menjawab panggilan. Google menjual model yang berbicara. Jika produk Anda adalah saluran telepon, kesenjangan antara kedua kalimat itu adalah berbulan-bulan rekayasa.

• Identitas suara. Voice Library, alur kloning, dan studio dubbing adalah bidang produk yang matang. Gemini 3.8 Live memberi Anda sebuah model; ia tidak memberi Anda katalog suara berlisensi atau alur kerja untuk melokalkan rekaman yang ada ke dalam sembilan bahasa.

• Transkrip secara default. Karena cascade mentranskripsikan sebelum bernalar, Anda mendapatkan log teks dari setiap panggilan secara gratis — berguna untuk kepatuhan, untuk evaluasi, dan untuk pekerjaan yang tidak glamor untuk mencari tahu mengapa agen melakukan kesalahan. Model speech-to-speech native tidak memiliki artefak semacam itu kecuali Anda membangunnya.

• Komponen yang dapat ditukar. Ketika model bahasa yang lebih baik dirilis, kaskade ElevenLabs dapat mengadopsinya tanpa melatih ulang apa pun. Itulah tepatnya alasan stack yang didokumentasikan memiliki model Google di tengahnya — dan itu adalah argumen tunggal terkuat untuk arsitektur kaskade.

Apa yang Anda dapatkan dari model mentah

Argumen tandingannya bukan soal harga. Argumennya adalah tentang apa yang dapat dilakukan satu forward pass yang tidak dapat dilakukan tiga tahap.

Gemini 3.8 Live mendengar prosodi, nada, dan keraguan secara langsung, bukan melalui transkrip yang sudah membuang semua itu, itulah sebabnya model ini dapat berganti bahasa di tengah kalimat dan mengapa skor dinamika percakapannya — 96,1% untuk model standar, menurut Artificial Analysis — adalah satu-satunya komponen di mana ia mengalahkan saudara kandungnya sendiri yang mengutamakan penalaran. Model ini juga menjalankan panggilan alat dan API di latar belakang sambil tetap berbicara, sehingga pencarian tidak menimbulkan keheningan. Dan varian Extended Thinking adalah kemampuan yang benar-benar berbeda, bukan versi yang lebih besar dari kemampuan yang sama: varian ini menyelesaikan 68,6% skenario layanan pelanggan τ-Voice, dibandingkan 30,1% untuk model standar, selisih 38 poin yang merupakan angka tunggal terbesar dalam rilis ini dan alasan Google membagi lini tersebut menjadi dua.

Jika tugas agen Anda adalah menyelesaikan tugas multi-langkah, bukan melakukan percakapan yang menyenangkan, selisih 38 poin itulah yang menentukan segalanya, dan biayanya $3.50 per jam, bukan $0.84 — masih lebih murah daripada setiap model yang dikalahkannya di papan itu.

Kaki tengah adalah kaki yang benar-benar dapat Anda gerakkan.

Inilah sambungan yang layak disebut, karena di sinilah pertanyaan arsitektur berubah menjadi pertanyaan pengadaan. Dalam sebuah kaskade, tahap tengah — bagian yang memutuskan apa yang harus dikatakan, memanggil alat, dan melakukan penalaran — adalah inferensi teks biasa. Tahap ini juga merupakan tahap dengan variasi biaya paling besar, keterikatan vendor paling kuat, dan alasan paling sedikit untuk terikat pada satu vendor tertentu. Stack yang didokumentasikan ElevenLabs kebetulan menggunakan model Gemini di posisi itu. Tidak harus begitu.

OrcaRouter mencakup bagian itu dan bukan dua bagian terluar. Kami tidak menghosting endpoint suara Gemini 3.8 Live — itu berasal dari Live API milik Google sendiri — dan kami tidak menghosting ElevenLabs, yang lapisan sintesis dan agent-nya adalah produknya sendiri. Yang kami sediakan adalah lapisan teks di bawahnya: 200+ model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga penurunan harga dari lab hulu sampai ke tagihan Anda di hari yang sama, bukan pada perpanjangan berikutnya. Khusus untuk tumpukan suara, tiga dari properti tersebut membuktikan kegunaannya. Failover otomatis menjaga panggilan tetap hidup saat backend mengalami error atau timeout di tengah kalimat, kegagalan yang langsung disadari oleh penelepon. DSL routing menyusun beberapa model menjadi satu panggilan, sehingga model murah dapat menangani giliran pengakuan dan model yang lebih kuat dapat mengambil transaksi. Dan fusi model memungkinkan panel menjawab bersama pada giliran-giliran ketika penilaian satu model saja tidak cukup baik untuk dipercaya sendirian. Mengubah model mana yang berada di tengah kaskade adalah perubahan konfigurasi, bukan pembangunan ulang — itulah alasan utama arsitektur kaskade ini ada.

Mana yang harus dipilih

Pilih ElevenLabs jika Anda merilis saluran telepon dan tidak ingin membangun stack suara. Anda membeli teleponi, katalog suara, transkrip, konkurensi, dan kontrak dukungan, dan premi per menit adalah biaya untuk semua itu. Anda juga membeli kemampuan untuk mengganti model di tengah jalan tanpa mengubah apa pun yang lain, yang nilainya lebih besar daripada kedengarannya.

Pilih Gemini 3.8 Live jika suara merupakan fitur dari sesuatu yang sudah Anda operasikan. Anda mendapatkan tarif speech-to-speech kompeten termurah yang saat ini dipublikasikan siapa pun, 97 bahasa dengan pengalihan di tengah percakapan, eksekusi alat yang berjalan saat model terus berbicara, dan — jika agen Anda harus menyelesaikan tugas alih-alih sekadar berbicara — kesenjangan agentik 38 poin yang diperoleh varian Extended Thinking dengan biaya sekitar empat kali biaya audio per jam. Anda menyediakan carrier, siklus hidup sesi, dan log.

Yang perlu diperhatikan: apakah ElevenLabs menerbitkan satu angka latensi untuk satu menit agen terkelola, karena itulah angka yang akan membuat perbandingan ini kuantitatif alih-alih struktural; dan apakah hasil Speech Agent Arena tetap bertahan ketika agen yang dibangun di atas 3.8 Live diukur pada arena itu, karena kaskade yang saat ini mengalahkan model native dalam keberhasilan tugas adalah hal yang paling menarik dalam pertandingan ini sekaligus paling tidak terjelaskan.