
Transkripsi cerdas dengan Gemini 3.5 Transcribe
- 智谱BARUZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 per 1 juta token
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
Gemini 3.5 Transcribe memasuki pratinjau publik pada 26 Agustus 2026, dan ini adalah model speech-to-text pertama dari Google yang benar-benar dijual sebagai model Gemini: Anda memanggilnya melalui API Gemini dengan model ID, audio dihargai dalam token, dan Google menyebutkan biaya per menit audio di halaman harganya. Detail terakhir itulah yang dilewatkan begitu saja oleh liputan konsumen. Kisah-kisah hari peluncuran berkisar pada penghapusan kata pengisi dan pengeditan suara di Gboard, tetapi yang sebenarnya berubah bagi pengembang adalah bahwa transkripsi kini berada di permukaan API yang sama dengan lini Gemini lainnya, dengan atribusi pembicara dan stempel waktu tingkat kata dalam model dasar, bukan pada add-on terpisah. Tulisan ini terasa seperti referensi API, karena itulah celah yang ditinggalkan oleh gelombang pertama liputan.
Dua catatan penting di awal agar angka-angka di bawah ini tidak menyesatkan. Google tidak menyebut Gemini 3.5 Transcribe sebagai "model speech-to-text paling akurat yang kami miliki" — klaim tersebut adalah model paling presisi untuk interaksi suara cerdas, yang merupakan klaim berbeda, dan perbedaan itu penting saat Anda membaca angka WER. Dan semua yang ada di sini menggambarkan pratinjau publik: dua ID model, harga, dan angka benchmark adalah yang Google rilis hari ini, dan semuanya dapat berubah sebelum GA.
Dua jalur API — dan ID model yang perlu diingat.
Gemini 3.5 Transcribe hadir sebagai dua endpoint, dan memilih yang tepat adalah keputusan arsitektur pertama yang dibuat tim:
• gemini-3-5-transcribe — jalur pra-rekam melalui Interactions API. Kirim file, dapatkan transkripnya kembali dengan atribusi pembicara (hingga tiga pembicara; tiga atau lebih masih eksperimental) dan stempel waktu tingkat kata. Ini adalah kuda kerja untuk pemrosesan batch dan asinkron.
• gemini-3-5-transcribe-live — jalur real-time melalui Live API. Streaming dua arah dengan latensi sub-detik, ditujukan untuk percakapan langsung, pembuatan teks, dan antarmuka berbasis suara.
Perpisahan ini mencerminkan bagaimana keluarga Gemini Audio lainnya disusun, dan hal ini penting karena 'live' adalah SKU tersendiri dengan harga sendiri. Beberapa pembacaan awal atas peluncuran ini mengasumsikan satu model melakukan keduanya; padahal tidak.

Apa yang sebenarnya dimaksud dengan "transkripsi cerdas"
Posting peluncuran Google membingkai ini sebagai bergerak melampaui akurasi fonetik menuju pemahaman. Fitur-fitur yang mengikuti dari pembingkaian itulah yang harus dievaluasi, bukan pembingkaiannya itu sendiri:
• Penanganan disfluensi — "um" dan "ah" dihilangkan, dan koreksi diri diselesaikan. "Mari bertemu Selasa — bukan, Rabu" ditranskripsikan sebagai hari yang telah dikoreksi, bukan sebagai transkrip dari awal yang keliru. Itu adalah keputusan yang dibuat model, dan dalam pengertian itulah Google menyebutnya cerdas.
• Pemformatan otomatis — keluaran yang dihasilkan berupa teks yang dirapikan: tanda baca, huruf kapital, dan struktur paragraf diterapkan, bukan aliran token mentah.
• Identifikasi multi-pembicara — hingga tiga pembicara yang diidentifikasi dalam audio pra-rekaman dengan stempel waktu tingkat kata; tiga pembicara atau lebih bersifat eksperimental. Fitur ini berada dalam model dasar, bukan layanan diarisasi terpisah.
• Kosakata khusus — Anda dapat mengarahkan pengenalan ke jargon, nama produk, dan ejaan yang tidak biasa dengan menyediakan kosakata, yang merupakan mekanisme untuk domain vertikal.
• 85+ bahasa — deteksi otomatis, dengan aksen regional dan dialek yang disebutkan secara eksplisit.
• Function calling — model dapat mendelegasikan tugas seperti pembuatan gambar atau analisis file ke model Gemini lainnya, yang mengubah transkripsi menjadi komponen dari agen yang lebih besar, bukan sekadar langkah akhir.
• Penangkapan entitas — Google mengklaim kinerja yang kuat pada audio dunia nyata yang bising dan pada entitas alfanumerik seperti kode pos dan ID pesanan.
Liputan pers juga melaporkan jendela konteks 96.000 token (kira-kira satu jam audio rapat tanpa pemisahan) dan deteksi emosi. Keduanya konsisten dengan kerangka peluncuran, tetapi kartu model yang diterbitkan Google tidak menonjolkannya, jadi perlakukan hal tersebut sebagai laporan, bukan konfirmasi, sampai lembar spesifikasi GA muncul.

Angka akurasi, yang diberi label
Angka WER yang dikutip Google berasal dari Artificial Analysis: tingkat kesalahan kata rata-rata sebesar 4.0% untuk transkripsi streaming dan 2.6% untuk transkripsi non-streaming. Pada benchmark multibahasa FLEURS, Google melaporkan WER sebesar 5.50% untuk streaming dan 5.04% untuk non-streaming. Google juga mengklaim peningkatan sebesar 70% dalam waktu hingga transkripsi akhir dibandingkan pendahulunya, Chirp 3.
Pembacaan yang jujur: ini adalah pengukuran independen dalam arti Artificial Analysis bukan Google, tetapi ini adalah pengukuran yang dipilih Google, diterbitkan dalam pengumuman Google sendiri, tentang model yang baru dapat dipanggil selama sehari. Belum ada orang di luar Google yang menjalankan adu langsung secara adversarial terhadap model open-weight yang sering dibandingkan oleh sebagian besar tim, dan materi peluncuran tidak memuat perbandingan langsung dengan keluarga Whisper atau lini Parakeet milik NVIDIA. Angka 70% lebih cepat daripada Chirp-3 adalah klaim vendor, titik. Anggap 2,6% dan 4,0% sebagai sinyal awal yang kuat, bukan fakta yang sudah pasti.
Berapa biayanya
Halaman harga Google menampilkan setiap model dalam token dan perkiraan menit audio. Untuk gemini-3-5-transcribe, estimasi gabungannya sekitar $0,005 per menit audio dengan harga daftar — input sekitar $0,003/menit, output sekitar $0,002/menit. Untuk gemini-3-5-transcribe-live, estimasi gabungannya sekitar $0,009 per menit. Keduanya memiliki paket gratis saat ini.
Angka per menit tersebut adalah perkiraan yang diturunkan dari asumsi tingkat token (25 token audio per detik masuk, 175 token teks per menit keluar), sehingga angka-angka itu berubah jika Google mengubah penghitungan token. Yang pasti adalah prinsipnya: harga daftar adalah harganya. Tepat itulah prinsip yang dijalankan oleh router pass-through seperti OrcaRouter — markup 0%, harga daftar penyedia diteruskan — jadi jika Google memotong harga transkripsi selama jendela pratinjau-ke-GA, pemotongan itu berlaku langsung di sisi kami pada hari yang sama, bukan setelah reseller memperbarui kartu tarif.
Di mana peluncurannya
Bagi pengembang, pratinjau publik saat ini berarti dua hal: API Gemini di Google AI Studio, dan Platform Agen Enterprise Gemini untuk beban kerja perusahaan. Di sisi konsumen, Gemini 3.5 Transcribe sudah mendukung fitur dikte Rambler di Gboard di Android dan aplikasi Gemini di macOS. Chrome adalah berikutnya — bicara-untuk-mengetik di bidang web mana pun — disusul oleh Search Live, Gemini Live, Docs, Keep, dan Gmail. Bagi tim yang mengevaluasinya, jawaban praktisnya lebih sederhana: ia dapat dipanggil dari kode saat ini, dalam bahasa Inggris, di wilayah-wilayah yang API Gemini-nya tersedia.

Apa artinya ini bagi pipeline Anda
Hal yang benar-benar baru bukanlah angka WER, melainkan bahwa Google kini menjual transkripsi dengan dua fitur yang sebelumnya harus dirakit sendiri oleh tim — label pembicara dan stempel waktu tingkat kata — dalam model dasarnya, pada permukaan API Gemini yang mendukung pemanggilan fungsi. Jika Anda membangun pipeline catatan rapat terdiarisasi dari transkriber biasa ditambah diarizer terpisah ditambah proses pemformatan, ini adalah model Google pertama yang merampingkan langkah-langkah tersebut. Pertanyaan terbukanya adalah bagaimana WER non-streaming 2.6% bertahan pada audio Anda sendiri, dan sampai ada reproduksi independen, langkah yang bertanggung jawab bagi tim produksi adalah menjalankan sampel nyata melalui API daripada menganggarkan berdasarkan tolok ukur pilihan Google. Untuk pekerjaan LLM yang berjalan di atas transkrip — peringkasan, ekstraksi terstruktur, item tindakan — itulah lapisan tempat routing membuktikan manfaatnya, dan itulah lapisan yang dicakup OrcaRouter: satu API di lebih dari 200 model, failover otomatis antar penyedia, dan DSL routing yang menggabungkan beberapa model menjadi satu panggilan. Langkah transkripsi itu sendiri harus Anda uji dengan audio Anda sendiri sebelum mempercayai angka utama siapa pun.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
