
Perkenalkan Qwen3.8-LiveTranslate: Setengah Detik yang Menempatkan Interpretasi AI pada Tempo Manusia
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate diluncurkan pada 19 September 2026, dan seluruh pengumumannya cukup diringkas menjadi satu pengurangan. Lagging rata-rata — LAAL, selisih rata-rata antara sebuah kata keluar dari mulut pembicara dan terjemahannya sampai ke telinga pendengar — turun dari 2,8 detik pada generasi sebelumnya menjadi 2,3 detik. Penerjemah manusia profesional bekerja pada rentang telinga-ke-suara sekitar 2 hingga 3 detik. Itulah keseluruhan ceritanya: bukan bahwa mesin menjadi lebih cepat, melainkan bahwa keterlambatannya kini berada di dalam rentang yang membuat pendengar berhenti menyadari adanya mesin sama sekali. Angka peluncuran menempatkan kualitas terjemahan FLEURS generasi sebelumnya pada 83,0 xCOMET-XXL; yang ini diklaim 85,7. Kedua angka itu milik vendor, dihasilkan pada penyiapan evaluasi milik vendor sendiri, dan belum ada pihak independen yang mereproduksinya — yang merupakan catatan paling penting dalam artikel ini.
Yang membuat rilis ini layak dibaca lebih dari sekadar judulnya adalah mekanismenya. Qwen tidak memangkas latensi dengan membuat pengenal yang lebih cepat atau penyintesis yang lebih ringan. Ia menghapus sambungan di antara keduanya.
Apa yang sebenarnya berubah: sambungannya sudah hilang
Interpretasi simultan klasik adalah pipeline tiga tahap yang telah disusun dengan cara yang sama selama satu dekade: pengenalan ucapan otomatis mentranskripsikan aliran, terjemahan mesin mengonversi transkrip, dan text-to-speech membacakan hasilnya dengan lantang. Setiap tahap adalah model terpisah dengan anggaran latensinya sendiri, dan setiap serah-terima kehilangan sesuatu — prosodi pada tahap pertama, identitas pembicara pada tahap ketiga, dan beberapa ratus milidetik tetap pada setiap batas tempat sebuah modul harus menunggu cukup token agar yakin.
Qwen3.8-LiveTranslate menggantikan kaskade itu dengan apa yang oleh vendor disebut arsitektur Interleave yang dibangun di atas tulang punggung Hybrid MoE, terbagi menjadi dua modul yang saling bekerja sama:
• Thinker — menyusun video, audio, teks sumber, dan terjemahan ke dalam satu urutan kausal, diselang-seling berdasarkan urutan waktu, dan menghasilkan pemahaman serta terjemahan secara end-to-end dalam satu kali proses alih-alih tiga.
• Talker — mengambil teks terjemahan bersama asli audio dan menyintesis ucapan yang mempertahankan timbre penutur sumber, sehingga suara yang di-dubbing dapat dikenali sebagai orang yang berbicara.
Klaim arsitekturalnya adalah bahwa karena pengenalan, penerjemahan, dan sintesis berbagi satu kerangka pemodelan urutan alih-alih mengirimkan pesan melintasi batas modul, sistem berhenti membayar pajak antar-modul dua kali per ujaran. Itu adalah penjelasan yang masuk akal tentang dari mana 0,5 detik itu berasal, dan itu juga persis jenis klaim yang murah untuk dinyatakan dan mahal untuk diverifikasi. Perlakukan itu sebagai penjelasan vendor, bukan sebagai hasil yang mapan.
Tiga kemampuan yang benar-benar baru
Cakupan bahasa tidak berubah: 60 bahasa sumber dikenali, 29 tersedia untuk keluaran lisan — jumlah yang sama seperti Qwen3.5-LiveTranslate. Penambahan yang menarik semuanya berkaitan dengan apa yang terjadi saat lebih dari satu orang berbicara.
• Diarisasi pembicara secara real-time — setiap kalimat diatribusikan kepada seorang pembicara saat diucapkan, dan replikasi timbre suara digambarkan lebih stabil di seluruh pergantian giliran bicara. Qwen melaporkan sendiri tingkat kesalahan diarisasi sebesar 9,7% pada set pengujian multi-pembicara panjang miliknya sendiri, dibandingkan dengan 30,6% untuk Seed LiveInterpret 2.0. Kedua angka tersebut berasal dari Qwen.
• Sumber dan terjemahan dalam bingkai yang sama — model menghasilkan transkrip asli dan teks terjemahan pada satu linimasa, yang memungkinkan adanya pasangan takarir dwibahasa di layar tanpa proses penyelarasan kedua.
• Disambiguasi konteks panjang — konteks sebelumnya dibawa terus ke depan agar nama, gelar kehormatan, dan istilah domain tetap konsisten. Inilah yang paling penting dalam praktik: kegagalan klasik dalam interpretasi simultan bukanlah kata yang salah, melainkan orang yang sama diterjemahkan dengan tiga cara berbeda dalam satu rapat.
Diarisasi adalah hal yang benar-benar membedakan di sini. Gemini 3.5 Live Translate, model terjemahan ucapan-ke-ucapan real-time milik Google yang menjadi pesaingnya, memiliki masalah yang terdokumentasi dengan pergantian giliran bicara — model ini bisa kesulitan mengetahui kapan seorang pembicara benar-benar sudah berhenti. Qwen justru mengklaim sifat sebaliknya sebagai fitur. Kedua perusahaan belum menerbitkan uji head-to-head yang dapat memutuskan hal itu.

Membaca klaim benchmark secara jujur
Qwen diuji pada dua set, dan keduanya layak dipisahkan karena mengukur hal yang berbeda.
• FLEURS, 70 arah bahasa — tolok ukur audio multibahasa publik yang digunakan secara luas. Qwen mengklaim keunggulan atas pendahulunya dan apa yang disebutnya sebagai sistem interpretasi waktu nyata arus utama saat ini dalam hal kualitas terjemahan, keterlambatan rata-rata, akurasi pengenalan ucapan, dan kualitas sintesis ucapan. Perbandingan xCOMET-XXL 85,7 vs 83,0 ada di sini.
• Omnilingua-MSpeaker, 14 arah bahasa — set evaluasi audio panjang multi-pembicara milik Qwen sendiri. Perusahaan mengklaim kesetiaan, kelancaran, dan keringkasan yang lebih baik serta tingkat kesalahan diarisasi yang lebih rendah. Tolok ukur buatan vendor memang tidak sepenuhnya tanpa nilai, tetapi itu juga bukan bukti: tolok ukur tersebut dirancang oleh pihak yang modelnya sedang dinilai dengannya.
Ringkasan jujurnya adalah bahwa FLEURS nyata dan publik, jadi angka 85.7 setidaknya dapat diperiksa secara prinsip; Omnilingua-MSpeaker tidak, jadi keunggulan diarisasinya hanyalah klaim sampai seseorang menjalankannya ulang. Belum ada pihak ketiga yang menerbitkan angka Qwen3.8-LiveTranslate pada saat penulisan ini, dan model itu baru berusia beberapa jam.
Berapa biaya API, dan satu angka yang akan merugikan Anda
Qwen3.8-LiveTranslate berbobot tertutup dan hanya tersedia melalui API. Ia berjalan melalui WebSocket Realtime API dengan ID model qwen3.8-livetranslate-flash-realtime, bukan melalui endpoint HTTP biasa. Penetapan harganya per juta token, dan karena token audio padat, tarif yang ditonjolkan tampak mengejutkan jika dibandingkan dengan model teks sampai Anda mengingat apa itu token audio:
• Wilayah Singapura — input audio $7,50, input gambar $0,55, output teks $20,00, output audio $30,00 per juta token.
• Wilayah Beijing — masukan audio ¥40, masukan gambar ¥3,3, keluaran teks ¥100, keluaran audio ¥160 per juta token, yang setara dengan sekitar $5,65 / $0,47 / $14,13 / $22,61 pada kurs saat ini.
• Konteks — 53.248 token total, terbagi menjadi 49.152 input maksimum dan 4.096 output maksimum.
• Batas laju — 10 permintaan per menit dan 100.000 token per menit, identik di kedua wilayah.
Batas laju itu adalah angka yang perlu digarisbawahi. Sepuluh permintaan per menit cukup besar untuk beberapa ruang rapat dan jauh dari cukup untuk penerapan pusat kontak atau siaran langsung dengan ribuan stream bersamaan. Qwen mempertahankan harga antarmuka ini agar praktis tidak berubah dibandingkan generasi sebelumnya — tarif Beijing tidak berubah dan Singapura sedikit lebih murah — tetapi model yang secara arsitektur siap untuk skala justru disediakan seperti versi pratinjau. Siapa pun yang merencanakan trafik produksi harus membaca plafon 10 RPM sebagai kendala yang mengikat, bukan harga per token.

Memanggilnya tidak seperti memanggil model chat
Realtime API digerakkan oleh peristiwa, yang merupakan model mental yang berbeda dari endpoint completion. Anda membuka socket, menerima session.created, lalu mengirim peristiwa session.update untuk mengonfigurasi sesi sebelum ada audio yang bergerak.
• target_language wajib diisi dan harus ditetapkan sebelum potongan audio pertama — tidak ada target default implisit.
• source_language bersifat opsional dan secara default menggunakan deteksi otomatis.
• output_modalities memilih ["text"] untuk transkrip saja atau ["text","audio"] untuk ucapan terjemahan.
• input_audio_buffer.append membawa potongan PCM berenkode base64 ke atas; response.text.delta dan response.audio.delta turun kembali, dengan response.done menandai akhir giliran.
Dua catatan praktis. Pertama, browser tidak dapat menetapkan Authorization header pada handshake WebSocket, sehingga koneksi harus dibuka di sisi server dan audio direlai ke klien melalui socket Anda sendiri — ini bukan sesuatu yang Anda pasang langsung ke front-end. Kedua, Qwen secara eksplisit memperingatkan bahwa kumpulan parameter dan event berbeda dari generasi LiveTranslate sebelumnya, sehingga kode apa pun yang ditulis untuk Qwen3.5-LiveTranslate perlu diperiksa ulang, bukan sekadar diarahkan ulang. Endpoint uji coba gratis sedang berjalan di omni.qwen.ai/live-translate jika Anda ingin mendengar lag-nya sebelum menginvestasikan waktu engineering.
Apa yang sengaja tidak dilakukannya
Qwen mencantumkan serangkaian kemampuan sebagai tidak tersedia, dan daftar itu memperjelas. Tidak ada pemanggilan fungsi. Tidak ada keluaran terstruktur. Tidak ada penelusuran web. Tidak ada kelanjutan prefiks, cache konteks, atau inferensi batch. Tidak ada fine-tuning.
Ini adalah spesialis, bukan generalis yang memakai topi juru bahasa. Ini tidak akan menjalankan loop agen Anda, dan ini tidak akan menjadi model yang merangkum rapat tersebut. Rancanglah dengan mempertimbangkan hal itu: juru bahasa menghasilkan transkrip dan aliran audio terjemahan, dan segala sesuatu yang berada di hilir dari itu — ekstraktor item tindakan, penegak glosarium, penulisan balik CRM — adalah tugas model teks terpisah.
Pembagian itulah tempat sebuah router membuktikan nilainya. Qwen3.8-LiveTranslate sendiri tersedia melalui API milik vendor dan beberapa platform pihak ketiga; saat ini layanan itu tidak ada di katalog OrcaRouter, dan kami tidak akan berpura-pura sebaliknya. Yang memang disediakan OrcaRouter adalah tumpukan di sekitarnya — termasuk model unggulan Qwen3.8-Max milik Alibaba sendiri, model sparse mixture-of-experts dengan 2,4 triliun parameter dan konteks 1M token dengan harga $2.00 per juta input dan $6.00 per juta output, ditagih pada harga daftar penyedia tanpa markup yang diteruskan. Menempatkan interpreter dan model-model yang mengonsumsi keluarannya di balik satu endpoint dan satu kunci berarti pipeline transkrip tidak memerlukan kontrak kedua saat Anda menukar summarizer, dan failover otomatis menjaga separuh hilir sistem tetap hidup ketika satu penyedia goyah — yang, pada 10 permintaan per menit, adalah skenario yang layak direncanakan alih-alih baru ditemukan.

Tontonan Berikutnya
Dua hal akan mengubah rilis ini dari klaim yang berargumen kuat menjadi fakta yang mapan. Yang pertama adalah pengukuran latensi independen: LAAL adalah metrik yang terdefinisi dengan baik, dan siapa pun yang memiliki endpoint uji coba serta perangkat stopwatch dapat menghasilkan angka yang tidak dibuat oleh Qwen. Yang kedua adalah peta jalan yang dinyatakan Qwen sendiri — mendorong lebih dekat ke batas bawah latensi, memori jangka panjang lintas sesi, dan cakupan bahasa ekor panjang serta dialek regional. Item ekor panjang itulah yang harus mereka penuhi, karena 60 bahasa sumber adalah jumlah yang terhormat yang diam-diam mengecualikan sebagian besar penutur di dunia, dan kesenjangan antara demo yang berfungsi dalam bahasa Mandarin dan Inggris dengan demo yang berfungsi dalam bahasa Yoruba atau Quechua adalah tempat produk interpretasi waktu nyata secara historis mandek.
Untuk saat ini, posisi yang masuk akal adalah bahwa Qwen3.8-LiveTranslate adalah model interpretasi simultan pertama yang angka utamanya dibingkai terhadap juru bahasa manusia, bukan terhadap pendahulunya sendiri — dan pembingkaian itu adalah ujian yang jauh lebih sulit untuk dilalui daripada ujian yang digantikannya. Model ini belum lulus ujian itu. Ia baru sekadar menawarkan diri untuk mengikutinya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
