
Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: Satu Merilis Angka, yang Lain Merilis Peta
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dua model terjemahan ucapan real-time terkemuka tidak sepakat tentang apa yang bersedia mereka diukur, dan ketidaksepakatan itu lebih berguna daripada perbandingan spesifikasi mana pun. Qwen3.8-LiveTranslate, yang dirilis pada 19 September 2026, memimpin dengan satu angka keras: rata-rata lagging 2,3 detik, turun dari 2,8 pada generasi sebelumnya. Gemini 3.5 Live Translate, model ucapan-ke-ucapan dari vendor tersebut yang diumumkan pada Juni 2026 dan masih menyandang ID model pratinjau, memimpin dengan jangkauan — 70 lebih bahasa, deteksi otomatis, peralihan di tengah percakapan, dan integrasi ke dalam aplikasi Translate dan Meet milik vendor tersebut. Satu perusahaan menerbitkan angka latensi yang bisa dijadikan patokan. Perusahaan lainnya menerbitkan jumlah bahasa. Jika Anda memilih di antara keduanya, memahami mengapa keduanya merupakan jenis janji yang berbeda lebih penting daripada daftar mana yang lebih panjang.
Dua arsitektur yang sepakat pada tujuannya dan tidak pada hal lain
Kedua model ada untuk membunuh perilaku yang sama: penerjemah berbasis giliran yang menunggu Anda menyelesaikan kalimat sebelum mengatakan apa pun. Jeda itulah yang membuat interpretasi mesin terasa seperti interpretasi mesin.
Qwen3.8-LiveTranslate mencapainya dengan arsitektur Interleave pada tulang punggung MoE Hibrida, yang terbagi menjadi modul Thinker yang melipat audio, video, teks sumber, dan terjemahan ke dalam satu urutan kausal, serta modul Talker yang menyintesis ulang terjemahan dalam timbre penutur asli. Klaimnya adalah bahwa menggabungkan pengenalan, penerjemahan, dan sintesis ke dalam satu urutan menghilangkan latensi dan kehilangan semantik yang dibayarkan oleh pipeline tiga tahap di setiap batas modul.
Gemini 3.5 Live Translate mengambil posisi end-to-end yang sama dari arah sebaliknya: ia dibangun di atas Gemini 3 Pro sebagai model audio-ke-audio native, yang melakukan streaming secara terus-menerus melalui Gemini Live API alih-alih menjalankan kaskade ASR → MT → TTS yang terpisah. Dalam praktiknya, Anda memegang WebSocket dua arah yang persisten, mendorong potongan audio 100 ms ke atas, dan menarik potongan audio terjemahan ke bawah. Tidak satu pun model melakukan cara lama. Keduanya kini melakukan cara baru. Semua perbedaannya terletak pada detail tingkat kedua.
Perbandingan latensi bukanlah hasil seri seperti yang terlihat.
Google mendeskripsikan Gemini 3.5 Live Translate sebagai tetap "beberapa detik di belakang" pembicara. Google belum menerbitkan angka LAAL, atau metrik latensi lain yang diberi nama dan dapat direproduksi, untuk model tersebut. Qwen telah menerbitkan 2,3 detik dan mendefinisikan apa artinya.
Asimetri ini secara rutin disederhanakan menjadi "keduanya sekitar dua hingga tiga detik." Tafsiran itu tidak didukung oleh apa pun yang dikatakan kedua perusahaan. Frasa Google cocok dengan 2 detik dan cocok dengan 4; perusahaan itu sekadar menolak untuk dipastikan. Perbandingan yang benar-benar dapat dilakukan hari ini adalah:
• Metrik latensi yang dipublikasikan — Qwen3.8-LiveTranslate: LAAL 2,3 dtk, dilaporkan vendor. Gemini 3.5 Live Translate: tidak ada yang dipublikasikan.
• Pengukuran latensi independen — tidak ada, untuk model mana pun. Tidak ada pihak ketiga yang telah menerbitkan perbandingan langsung.
Kesimpulan jujurnya adalah bahwa soal latensi, Qwen membuat klaim yang dapat difalsifikasi dan Google membuat klaim yang samar. Itu menjadi satu nilai plus bagi Qwen dalam hal transparansi dan nol poin bagi Qwen dalam hal performa sampai seseorang mengukur keduanya. Jika latensi adalah faktor penentu untuk deployment Anda, kondisi bukti saat ini tidak mendukung keputusan pembelian ke arah mana pun.

60 bahasa versus 70 lebih adalah papan skor yang salah
Jumlah bahasa terus-menerus dikutip dan menyesatkan di kedua arah.
Qwen3.8-LiveTranslate mengenali 60 bahasa sumber dan menghasilkan keluaran lisan dalam 29 di antaranya. Gemini 3.5 Live Translate mendukung lebih dari 70 bahasa dengan deteksi otomatis, dan di Google Meet hal itu berkembang menjadi lebih dari 2.000 kombinasi bahasa, sedangkan batas sebelumnya adalah terjemahan berbasis bahasa Inggris untuk lima bahasa.
Baca angka kedua dengan saksama sebelum menganggapnya sebagai kemenangan tiga kali lipat. Angka lebih dari 2.000 milik Google menghitung pasangan berurutan — setiap bahasa sumber dipasangkan dengan setiap bahasa target — yang merupakan ukuran cakupan yang sah dan benar-benar berguna, tetapi tidak sebanding dengan penghitungan bahasa tunggal. Dan daftar Google, meskipun lebih luas, sangat condong ke bahasa dengan populasi penutur besar: Afrikaans, Arab, Bengali, Belanda, Inggris, Prancis, Jerman, Hindi, Indonesia, Italia, Jepang, Korea, Melayu, Persia, Polandia, Portugis, Rusia, Spanyol, Swahili, Tamil, Telugu, Thai, Turki, Ukraina, Urdu, Vietnam, Zulu. 29 bahasa keluaran lisan Qwen bahkan lebih terbatas lagi, dan tidak ada daftar vendor mana pun yang merupakan jawaban serius untuk long tail — dialek regional dan bahasa dengan sumber daya rendah, tempat alat interpretasi secara historis mengalami kegagalan paling parah. Kedua perusahaan mengatakan sedang mengerjakannya. Tidak satu pun telah merilisnya.
Di mana keduanya sebenarnya berbeda: ruangan yang penuh orang
Satu-satunya hal di mana model-model tersebut membuat janji yang benar-benar berbeda adalah penanganan multi-pembicara, dan itulah perbedaan yang paling mungkin menentukan penerapan yang nyata.
Qwen3.8-LiveTranslate menghadirkan diarisasi pembicara secara real-time: setiap kalimat dikaitkan ke seorang pembicara begitu kalimat itu tiba, dan replikasi suara digambarkan stabil di sepanjang pergantian giliran. Qwen melaporkan sendiri tingkat kesalahan diarisasi sebesar 9,7% pada set pengujian multi-pembicara panjang miliknya sendiri, dibandingkan dengan 30,6% untuk Seed LiveInterpret 2.0 — perbandingan vendor pada evaluasi yang dijalankan vendor, jadi anggaplah itu sebagai klaim dengan angka yang menempel, bukan sebagai hasil. Model ini juga mengeluarkan teks sumber dan terjemahan pada linimasa yang sama, yang memungkinkan takarir bilingual tersinkronisasi tanpa proses penyelarasan terpisah.
Gemini 3.5 Live Translate mengambil penekanan yang berlawanan. Kekuatan terdokumentasinya adalah pelestarian prosodi — mempertahankan tinggi nada, tempo, intonasi, dan register emosional penutur, sehingga suara hasil terjemahan membawa nuansa aslinya. Kelemahan terdokumentasinya justru terletak pada hal-hal yang dapat dibantu oleh diarisasi: kloning suara yang tidak konsisten yang dapat bergeser setelah jeda panjang atau jatuh pada gender yang salah, giliran bicara yang lemah tanpa sinyal akhir kalimat yang jelas, kesulitan dengan aksen kuat dan dengan pasangan bahasa yang berkerabat dekat seperti Spanyol dan Portugis, serta penanganan kebisingan latar yang tidak sempurna. Google juga membatasi sesi audio murni hingga 15 menit kecuali diperpanjang, dan menandai setiap aliran audio yang dihasilkan dengan watermark SynthID yang saat ini tidak dapat dihapus.
• Atribusi multi-pembicara — Qwen: diarisasi waktu nyata, klaim 9.7% DER. Gemini: pergantian giliran yang lemah terdokumentasi, tanpa klaim diarisasi.
• Kesetiaan suara — Qwen: reproduksi timbre sumber melalui modul Talker. Gemini: pelestarian prosodi, pitch, dan tempo; penyimpangan kloning yang terdokumentasi.
• Output bilingual — Qwen: sumber dan terjemahan dihasilkan pada linimasa yang sama. Gemini: transkripsi input dan output opsional, dikonfigurasi per sesi.
• Pemberian watermark — Qwen: tidak disebutkan. Gemini: SynthID pada semua audio yang dihasilkan, tidak ada jalur penghapusan.
• Durasi sesi — Qwen: tidak disebutkan. Gemini: batas 15 menit untuk sesi audio murni.
• Jenis masukan — Qwen: audio dan gambar. Gemini: hanya audio, tanpa masukan teks.

Berapa biaya untuk benar-benar menjalankan masing-masing
Qwen3.8-LiveTranslate dihargai per juta token melalui WebSocket Realtime API. Di wilayah Singapura: input audio $7,50, input gambar $0,55, output teks $20,00, output audio $30,00. Di Beijing: ¥40 / ¥3,3 / ¥100 / ¥160 per juta — sekitar $5,65 / $0,47 / $14,13 / $22,61. Konteksnya adalah 53.248 token, dan batas lajunya adalah 10 permintaan per menit dan 100.000 token per menit di kedua wilayah.
Batas 10 RPM itu adalah angka paling penting di kartu tarif. Ketentuan komersial Gemini 3.5 Live Translate tidak dipublikasikan dengan cara yang sama, yang dengan sendirinya merupakan sinyal tentang kematangan: Google mendistribusikannya melalui Live API dan AI Studio dalam pratinjau publik, Google Meet dalam pratinjau privat untuk pelanggan Workspace terpilih, dan aplikasi Translate di Android dan iOS. Harga pratinjau dan batas laju pratinjau dapat berubah tanpa pemberitahuan, dan Google belum menetapkan tanggal GA.
Jadi, perbandingan biaya saat ini adalah antara model dengan harga yang dipublikasikan dan batas konkurensi yang ketat, dengan model yang tidak memiliki harga yang dipublikasikan dan batas yang tidak ditentukan. Jika Anda perlu memodelkan ekonomi unit kuartal ini, hanya satu dari keduanya yang dapat dianggarkan.

Apa yang harus ditunjukkan oleh sebuah tes independen
Semua hal di atas dibangun dari pengumuman kedua vendor itu sendiri, karena belum ada yang mengadu model-model ini satu sama lain. Hasil yang benar-benar dapat memutuskan pertarungan ini membutuhkan empat hal, dan tidak satu pun dari hal-hal itu yang ada saat ini:
• LAAL diukur dengan cara yang sama pada kedua model, pada audio yang sama, dalam pasangan bahasa yang sama — angka 2,3 s milik Qwen tidak dapat dibandingkan dengan apa pun yang Google menolak untuk menyatakan.
• Tingkat kesalahan diarisasi pada korpus multi-pembicara bersama, bukan pada set Omnilingua-MSpeaker milik Qwen sendiri.
• Stabilitas pengkloningan suara selama sesi panjang, yang merupakan area di mana dokumentasi Gemini sendiri menandai adanya drift dan Qwen menyampaikan klaim terkuatnya.
• Perilaku pada batas konkurensi — apakah 10 RPM Qwen tetap bertahan di bawah beban rapat nyata dan apakah kuota pratinjau Gemini tetap bertahan saat berhadapan dengan produksi.
Sampai uji itu ada, posisi yang dapat dipertahankan itu sempit: Qwen telah menerbitkan lebih banyak dan menjanjikan hal-hal yang lebih spesifik; Google memiliki cakupan bahasa yang lebih luas dan jejak distribusi yang tidak dapat ditandingi oleh model yang hanya berbasis API.
Mana yang harus dipilih
Fokuslah pada bentuk masalahmu, bukan pada papan skor, karena papan skor belum bisa dipercaya.
Jika beban kerja Anda multipihak dan atribusi itu penting — transkripsi rapat, panel, ruang sidang, apa pun yang mengharuskan mengetahui siapa yang mengatakan kalimat terjemahan merupakan bagian dari nilainya — Qwen3.8-LiveTranslate adalah satu-satunya di antara keduanya yang mengklaim kemampuan tersebut, dan kelemahan pengambilan giliran Gemini yang terdokumentasi mengarah pada hal yang sama. Jika beban kerja Anda mencakup banyak bahasa, berorientasi konsumen, dan sudah berada di dalam ekosistem Google, keunggulan lebih dari 70 bahasa Gemini 3.5 Live Translate serta kehadirannya di aplikasi Translate dan Meet adalah keunggulan yang tidak dapat ditandingi oleh pesaing yang hanya berbasis API dalam hal distribusi.
Jika Anda membangun produk, bukan membeli demo, perhatikan bahwa keduanya adalah spesialis yang sempit. Keduanya tidak menjalankan loop agen, tidak meringkas, dan Qwen3.8-LiveTranslate secara eksplisit tidak mendukung pemanggilan fungsi, output terstruktur, cache konteks, maupun fine-tuning. Penerjemah adalah bagian depan pipeline Anda, bukan keseluruhannya. OrcaRouter bukan tempat untuk memanggil salah satu dari model terjemahan itu saat ini — keduanya tidak ada di katalog kami, dan kami lebih memilih mengatakan demikian daripada menyiratkan sebaliknya. Yang kami sediakan adalah separuh stack yang mengonsumsi transkrip: satu kunci untuk 200+ model dengan harga daftar penyedia tanpa markup yang diteruskan, sehingga peringkas, penegak glosarium, atau agen hilir yang membaca transkrip itu dapat ditukar atau dialihkan saat gagal tanpa harus menyentuh kontrak vendor kedua.
Bagian bawahnya
Qwen3.8-LiveTranslate dan Gemini 3.5 Live Translate cukup berdekatan dalam hal-hal mendasar sehingga pemasaran menjadi pembedanya: yang satu menerbitkan angka latensi dan kartu tarif, yang lain menerbitkan peta bahasa dan ekosistem. Tidak satu pun telah menjalani pengujian independen. Versi perbandingan ini yang layak dibaca adalah versi yang ditulis setelah seseorang menjalankan keduanya pada audio yang sama — dan mengingat betapa cepatnya kategori ini bergerak, itu mungkin tidak akan lama lagi.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
