
Gemini 3.8 Live vs GLM-4-Voice: Apa yang Sebenarnya Didapat dari 21 Bulan AI Suara
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 459 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 183 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
GLM-4-Voice dirilis pada 3 Desember 2024. Gemini 3.8 Live diumumkan pada 15 September 2026. Itu 21 bulan, dan itu adalah fakta terpenting dalam perbandingan ini — lebih penting daripada tolok ukur apa pun, karena itu menentukan jenis pertanyaan apa yang sebenarnya Anda ajukan.
Kedua model ini bukanlah rival. Tidak seorang pun yang menerapkan suara dalam skala besar pada 2026 memilih di antara keduanya berdasarkan kualitas. Pertanyaan sebenarnya adalah pertanyaan yang diajukan GLM-4-Voice dan tidak dapat dijawab oleh Gemini 3.8 Live: apa yang diperlukan untuk memiliki ini alih-alih menyewanya? Pertanyaan itu memiliki jawaban yang nyata, dan jawaban itu telah berubah lebih sedikit dalam 21 bulan daripada yang mungkin Anda perkirakan.
Apa yang dirilis Google, dan apa yang dirilis Zhipu
Gemini 3.8 Live adalah model dialog live dengan bobot tertutup yang dihosting. Model ini menangani masukan visual hampir real-time, secara otomatis mendeteksi dan beralih di antara 97 bahasa yang didukung di tengah percakapan, serta menjalankan alat dan panggilan API di latar belakang saat percakapan terus berlangsung. Model ini tersedia bagi pengembang melalui Gemini API dan Google AI Studio, dalam pratinjau privat di Gemini Enterprise, dan di Search Live. Harga yang diumumkan adalah $0,005 per menit untuk masukan audio dan $0,018 per menit untuk keluaran audio melalui Live API; bagan biaya per jam audio masukan milik Artificial Analysis secara independen menempatkannya pada $1,50 per jam. Saudaranya, Gemini 3.8 Live Extended Thinking, saat ini memuncaki indeks yang sama pada 82,6, sedangkan Gemini 3.8 Live sendiri berada pada 76,0.
GLM-4-Voice adalah model ucapan end-to-end pertama Zhipu AI, dan ini adalah checkpoint yang dapat diunduh. Ini adalah rakitan tiga bagian: tokenizer ucapan yang dibangun di atas encoder Whisper-large-v3 dengan bottleneck terkuantisasi vektor pada sekitar 0,4B parameter, model bahasa autoregresif (GLM-4-Voice-9B, diinisialisasi dari GLM-4-9B) pada sekitar 9B parameter, dan decoder flow-matching yang dilatih ulang dari CosyVoice. Model ini berbicara dalam bahasa Tionghoa dan Inggris, mendukung emosi, nada, kecepatan bicara, dan dialek yang dikendalikan instruksi — termasuk di antaranya Kanton, Mandarin Chongqing, dan tutur Beijing — dan melakukan tokenisasi ucapan pada 12,5 Hz menjadi satu aliran codebook pada sekitar 175 bps, satu orde besaran lebih rendah daripada codec audio neural pada umumnya.
Dimensinya, berdampingan:
• Rilis — Gemini 3.8 Live: 15 September 2026. GLM-4-Voice: 3 Desember 2024.
• Bobot — tertutup, hanya dihosting vs dapat diunduh, kode Apache-2.0 dengan lisensi bobot khusus.
• Bahasa — 97 dengan peralihan di tengah percakapan vs bahasa Mandarin dan Inggris.
• Vision — input visual hampir real-time vs tidak ada.
• Pemanggilan alat — eksekusi alat dan API di latar belakang di tengah percakapan vs tidak ada saluran alat sama sekali.
• Konteks — tidak dipublikasikan oleh Google vs konteks 8K, output maksimum 4K.
• Batas minimum self-hosting — tidak berlaku vs 32 GB RAM plus GPU CUDA secara resmi; sekitar 12 GB VRAM pada int4.
• Pemberian tanda air — SynthID pada semua audio yang dihasilkan vs tidak ada yang dijelaskan.

21 bulan membeli kapabilitas, bukan sekadar kualitas
Cerita mudahnya adalah bahwa model frontier 2026 mengalahkan checkpoint terbuka 2024. Memang demikian, dan selisihnya besar — tetapi pengamatan yang lebih berguna adalah bahwa kategori tersebut berubah bentuk, bukan bergerak di sepanjang satu sumbu.
Menurut laporan teknis Zhipu sendiri, GLM-4-Voice memperoleh akurasi ucapan-ke-teks 93,6% pada Topic-StoryCloze, 82,9% untuk ucapan-ke-ucapan, kealamian UTMOS 4,45, dan QA lisan 5,40/10 untuk umum serta 5,20/10 untuk pengetahuan — semuanya dilaporkan sendiri dan belum direproduksi. Evaluasi independen lebih jarang dan kurang menggembirakan: pada VoiceBench, model ini mencatat nilai keseluruhan 56,48, menempatkannya di sekitar peringkat ke-29 dari 42 dalam satu tabulasi dan ke-30 dari 40 dalam tabulasi lain, dengan pemahaman multi-giliran yang digambarkan lemah dalam kedua bahasa. Pada tolok ukur pemahaman dialog multi-giliran C³, model ini berada pada 11,09% dalam bahasa Mandarin dan 33,22% dalam bahasa Inggris. VCB Bench menemukan bahwa model ini unggul dalam kontrol emosi dengan 93,0 pada submetrik SIF bahasa Mandarin, serta keselarasan teks–ucapan yang kuat, tetapi penanganan dialek TELEVAL hanya mencapai 4,57% tanpa instruksi eksplisit.
Angka-angka itu menggambarkan sebuah model yang bagus dalam ekspresi vokal dan buruk dalam pemahaman yang bertahan lama. Itu adalah model ucapan tahun 2024 dalam satu kalimat.
Gemini 3.8 Live's 76.0 pada Speech to Speech Index Artificial Analysis adalah komposit atas penalaran ucapan, performa agentik, preferensi arena, dan tingkat keberhasilan tugas. Bukan berarti model yang lebih baru lebih baik pada tugas yang sama dengan kelipatan yang lebih besar. Yang terjadi adalah komposit tersebut kini bahkan mencakup performa agentik dan keberhasilan tugas — kategori yang tidak dapat diikuti GLM-4-Voice karena tidak memiliki saluran alat. Model 2024 dinilai dalam permainan yang memang tidak pernah dirancang untuk dimainkannya.

Lisensi adalah bagian yang orang lewatkan
Jika Anda melihat GLM-4-Voice karena model ini terbuka, baca ketentuannya sebelum bobotnya selesai diunduh. Pemisahannya nyata dan mudah salah dibaca:
• Code — Apache-2.0. Benar-benar permisif.
• Bobot — lisensi khusus yang mewajibkan atribusi dan pendaftaran dengan Zhipu untuk penggunaan komersial.
"Bobot terbuka" dan "Apache-2.0" bukanlah klaim yang sama, dan banyak liputan sekunder tentang model ini mencampuradukkannya. Jika Anda berniat meluncurkan produk komersial dengan GLM-4-Voice, persyaratan pendaftaran adalah langkah hukum, bukan formalitas, dan itu harus ada di jalur kritis. Satu pelacak melangkah lebih jauh dan menggambarkan model tersebut sebagai proprieter dengan penggunaan komersial bersyarat. Bagaimanapun juga, tidak adanya tagihan per menit bukan berarti tidak adanya hubungan komersial.
Aritmetika biaya, dihitung dengan jujur
Argumen untuk hosting mandiri adalah bahwa biaya bulanan tetap lebih unggul daripada biaya per menit pada volume tinggi. Argumen itu nyata, tetapi lebih kecil daripada yang terlihat begitu Anda menghitung apa yang Anda operasikan.
GLM-4-Voice secara resmi menginginkan RAM 32 GB dan GPU CUDA. Kuantisasi int4 komunitas berjalan pada sekitar 12 GB VRAM, dalam praktiknya sekitar 10–11 GB, yang masuk wilayah RTX 3060, dengan batas praktis sekitar 30 detik ucapan per giliran. A10 di cloud dengan biaya sekitar $0,50–$1,00 per jam setara dengan antara $350 dan $700 per bulan untuk instans yang berjalan terus-menerus — sebelum Anda melayani satu pengguna pun, dan tanpa failover, tanpa kapasitas burst, serta tanpa siapa pun yang bisa dipanggil saat dekoder menghasilkan noise pada pukul 3 pagi.
Sebaliknya, Gemini 3.8 Live dengan $1,50 per jam audio masukan berarti $350 memberi Anda sekitar 233 jam suara. Itu tidak jelas lebih buruk, dan disertai kapasitas yang tidak Anda sediakan. Titik persilangannya ada; nilainya lebih tinggi daripada yang disiratkan oleh perbandingan utamanya, dan berubah tergantung apakah lalu lintas Anda stabil atau meledak-ledak. Lalu lintas yang meledak-ledak adalah kasus ketika penetapan harga per menit menang secara meyakinkan, karena GPU yang menganggur ditagih persis sama seperti GPU yang sibuk.
Ada juga perbedaan dalam apa yang Anda dapatkan sesuai biaya yang dikeluarkan. Laporan komunitas tentang penerapan GLM-4-Voice terkuantisasi menempatkan latensi dialog berkelanjutan pada 38–120 ms, meskipun angka tersebut berasal dari tulisan, bukan dari Zhipu. Latensi Gemini 3.8 Live sama sekali belum dipublikasikan oleh Google. Jika latensi rendah adalah persyaratan mutlak Anda, tidak satu pun dari keduanya memiliki angka yang dapat Anda jadikan acuan perencanaan — yang satu memiliki pengukuran komunitas pihak ketiga, yang lain memiliki testimoni mitra dan tanpa angka.

Opsi tengah: miliki logikanya, sewa kemampuannya
Membingkai ini sebagai self-host versus hosted tidak menangkap tatanan yang sebenarnya akhirnya diadopsi sebagian besar tim. GLM-4-Voice tidak memiliki kanal tool, jadi produk apa pun yang dibangun di atasnya memerlukan model teks terpisah untuk melakukan pencarian — yang berarti model ucapan self-hosted berada di depan model teks hosted, dalam kedua kasus itu. Keputusan deployment dan keputusan kapabilitas dapat dipisahkan.
Pemisahan itulah tempat router benar-benar bekerja. OrcaRouter membawa 190 model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga target delegasi di balik front-end suara Anda dapat ditukar pada lalu lintas langsung tanpa membangun ulang apa pun, dan penurunan harga dari hulu sampai ke Anda pada hari yang sama alih-alih pada perpanjangan berikutnya. Failover otomatis lebih penting daripada biasanya dalam penyiapan yang dihosting sendiri, karena ketika instans GPU Anda sendiri yang tumbang, model backend tetap dapat dijangkau dan sesi tidak harus ikut mati. Dua klarifikasi, karena perbandingan ini mengundang kebingungan: kami tidak menghosting GLM-4-Voice, dan endpoint Gemini 3.8 Live juga tidak ada di router kami — itu berasal dari vendor masing-masing. Yang ada di router adalah lapisan teks yang keduanya serahkan pekerjaannya.
Keputusan itu, dan pelajaran di baliknya
Pilih GLM-4-Voice jika Anda memerlukan model tersebut di perangkat keras Anda sendiri, jika trafik Anda benar-benar stabil pada volume tinggi, jika Anda hanya membangun dalam bahasa Tionghoa atau Inggris, dan jika Anda perlu memodifikasi model tersebut alih-alih memanggilnya. Perhitungkan pendaftaran lisensi sebagai tugas nyata, dan bersiaplah untuk mengatasi sendiri pemahaman multi-turn — ini adalah titik lemah model yang terdokumentasi dan sebanyak apa pun fine-tuning di sekitar batas output 4K tidak akan sepenuhnya menyembunyikannya.
Pilih Gemini 3.8 Livejika kebutuhan Anda mencakup visi, pemanggilan alat, lebih dari dua bahasa, atau pola lalu lintas apa pun yang akan Anda sebut melonjak-lonjak. Ini adalah model pratinjau dengan angka konteks dan latensi yang belum dipublikasikan, yang merupakan risiko perencanaan nyata, tetapi ini juga satu-satunya dari kedua model tersebut yang dapat mencari sesuatu di tengah kalimat.
Pelajaran umumnya lebih berharga daripada putusan mana pun di antara keduanya. Dua puluh satu bulan pengembangan AI suara menghasilkan sebuah model yang utamanya bukan model suara yang lebih baik — melainkan antarmuka suara menuju sebuah agen. Jika alasan Anda menginginkan bobot terbuka adalah biaya, hitungannya lebih dekat daripada yang disiratkan oleh pembingkaian bebas lisensi. Jika alasan Anda adalah kendali, hal itu belum dikomoditisasi sama sekali, dan GLM-4-Voice tetap menjadi jawaban yang sah untuk pertanyaan yang tidak dijawab oleh Gemini 3.8 Live.
