Kartu judul hero untuk 'Transkripsi cerdas dengan Gemini 3.5 Transcribe' yang menampilkan gelombang suara yang berubah menjadi teks terformat, globe yang ditandai dengan 85+ bahasa, chip label pembicara, angka utama 2,6% WER non-streaming dan ~$0,005/menit gabungan, serta logo OrcaRouter di pojok kanan bawah.
Engineering & Research

Transkripsi cerdas dengan Gemini 3.5 Transcribe

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.​5 Transcribe memasuki pratinjau publik pada 26 Agustus 2026, dan ini adalah model speech-to-text pertama dari Go​ogle yang benar-benar dijual sebagai model G​emini: Anda memanggilnya melalui API G​emini dengan model ID, audio dihargai dalam token, dan Go​ogle menyebutkan biaya per menit audio di halaman harganya. Detail terakhir itulah yang dilewatkan begitu saja oleh liputan konsumen. Kisah-kisah hari peluncuran berkisar pada penghapusan kata pengisi dan pengeditan suara di Gboard, tetapi yang sebenarnya berubah bagi pengembang adalah bahwa transkripsi kini berada di permukaan API yang sama dengan lini G​emini lainnya, dengan atribusi pembicara dan stempel waktu tingkat kata dalam model dasar, bukan pada add-on terpisah. Tulisan ini terasa seperti referensi API, karena itulah celah yang ditinggalkan oleh gelombang pertama liputan.

Dua catatan penting di awal agar angka-angka di bawah ini tidak menyesatkan. Go​ogle tidak menyebut Gemini 3.​5 Transcribe sebagai "model speech-to-text paling akurat yang kami miliki" — klaim tersebut adalah model paling presisi untuk interaksi suara cerdas, yang merupakan klaim berbeda, dan perbedaan itu penting saat Anda membaca angka WER. Dan semua yang ada di sini menggambarkan pratinjau publik: dua ID model, harga, dan angka benchmark adalah yang Go​ogle rilis hari ini, dan semuanya dapat berubah sebelum GA.

Dua jalur API — dan ID model yang perlu diingat.

Gemini 3.5 Transcribe hadir sebagai dua endpoint, dan memilih yang tepat adalah keputusan arsitektur pertama yang dibuat tim:

• gemini-3-5-transcribe — jalur pra-rekam melalui Interactions API. Kirim file, dapatkan transkripnya kembali dengan atribusi pembicara (hingga tiga pembicara; tiga atau lebih masih eksperimental) dan stempel waktu tingkat kata. Ini adalah kuda kerja untuk pemrosesan batch dan asinkron.

• gemini-3-5-transcribe-live — jalur real-time melalui Live API. Streaming dua arah dengan latensi sub-detik, ditujukan untuk percakapan langsung, pembuatan teks, dan antarmuka berbasis suara.

Perpisahan ini mencerminkan bagaimana keluarga G​emini Audio lainnya disusun, dan hal ini penting karena 'live' adalah SKU tersendiri dengan harga sendiri. Beberapa pembacaan awal atas peluncuran ini mengasumsikan satu model melakukan keduanya; padahal tidak.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Apa yang sebenarnya dimaksud dengan "transkripsi cerdas"

Posting peluncuran Google membingkai ini sebagai bergerak melampaui akurasi fonetik menuju pemahaman. Fitur-fitur yang mengikuti dari pembingkaian itulah yang harus dievaluasi, bukan pembingkaiannya itu sendiri:

• Penanganan disfluensi — "um" dan "ah" dihilangkan, dan koreksi diri diselesaikan. "Mari bertemu Selasa — bukan, Rabu" ditranskripsikan sebagai hari yang telah dikoreksi, bukan sebagai transkrip dari awal yang keliru. Itu adalah keputusan yang dibuat model, dan dalam pengertian itulah Google menyebutnya cerdas.

• Pemformatan otomatis — keluaran yang dihasilkan berupa teks yang dirapikan: tanda baca, huruf kapital, dan struktur paragraf diterapkan, bukan aliran token mentah.

• Identifikasi multi-pembicara — hingga tiga pembicara yang diidentifikasi dalam audio pra-rekaman dengan stempel waktu tingkat kata; tiga pembicara atau lebih bersifat eksperimental. Fitur ini berada dalam model dasar, bukan layanan diarisasi terpisah.

• Kosakata khusus — Anda dapat mengarahkan pengenalan ke jargon, nama produk, dan ejaan yang tidak biasa dengan menyediakan kosakata, yang merupakan mekanisme untuk domain vertikal.

• 85+ bahasa — deteksi otomatis, dengan aksen regional dan dialek yang disebutkan secara eksplisit.

• Function calling — model dapat mendelegasikan tugas seperti pembuatan gambar atau analisis file ke model G​emini lainnya, yang mengubah transkripsi menjadi komponen dari agen yang lebih besar, bukan sekadar langkah akhir.

• Penangkapan entitas — Go​ogle mengklaim kinerja yang kuat pada audio dunia nyata yang bising dan pada entitas alfanumerik seperti kode pos dan ID pesanan.

Liputan pers juga melaporkan jendela konteks 96.000 token (kira-kira satu jam audio rapat tanpa pemisahan) dan deteksi emosi. Keduanya konsisten dengan kerangka peluncuran, tetapi kartu model yang diterbitkan Go​ogle tidak menonjolkannya, jadi perlakukan hal tersebut sebagai laporan, bukan konfirmasi, sampai lembar spesifikasi GA muncul.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Angka akurasi, yang diberi label

Angka WER yang dikutip Go​ogle berasal dari Artificial Analysis: tingkat kesalahan kata rata-rata sebesar 4.0% untuk transkripsi streaming dan 2.6% untuk transkripsi non-streaming. Pada benchmark multibahasa FLEURS, Go​ogle melaporkan WER sebesar 5.50% untuk streaming dan 5.04% untuk non-streaming. Go​ogle juga mengklaim peningkatan sebesar 70% dalam waktu hingga transkripsi akhir dibandingkan pendahulunya, Chirp 3.

Pembacaan yang jujur: ini adalah pengukuran independen dalam arti Artificial Analysis bukan Google, tetapi ini adalah pengukuran yang dipilih Google, diterbitkan dalam pengumuman Google sendiri, tentang model yang baru dapat dipanggil selama sehari. Belum ada orang di luar Google yang menjalankan adu langsung secara adversarial terhadap model open-weight yang sering dibandingkan oleh sebagian besar tim, dan materi peluncuran tidak memuat perbandingan langsung dengan keluarga Whisper atau lini Parakeet milik NVIDIA. Angka 70% lebih cepat daripada Chirp-3 adalah klaim vendor, titik. Anggap 2,6% dan 4,0% sebagai sinyal awal yang kuat, bukan fakta yang sudah pasti.

Berapa biayanya

Halaman harga Go​ogle menampilkan setiap model dalam token dan perkiraan menit audio. Untuk gemini-3-5-transcribe, estimasi gabungannya sekitar $0,005 per menit audio dengan harga daftar — input sekitar $0,003/menit, output sekitar $0,002/menit. Untuk gemini-3-5-transcribe-live, estimasi gabungannya sekitar $0,009 per menit. Keduanya memiliki paket gratis saat ini.

Angka per menit tersebut adalah perkiraan yang diturunkan dari asumsi tingkat token (25 token audio per detik masuk, 175 token teks per menit keluar), sehingga angka-angka itu berubah jika Google mengubah penghitungan token. Yang pasti adalah prinsipnya: harga daftar adalah harganya. Tepat itulah prinsip yang dijalankan oleh router pass-through seperti OrcaRouter — markup 0%, harga daftar penyedia diteruskan — jadi jika Google memotong harga transkripsi selama jendela pratinjau-ke-GA, pemotongan itu berlaku langsung di sisi kami pada hari yang sama, bukan setelah reseller memperbarui kartu tarif.

Di mana peluncurannya

Bagi pengembang, pratinjau publik saat ini berarti dua hal: API Gemini di Google AI Studio, dan Platform Agen Enterprise Gemini untuk beban kerja perusahaan. Di sisi konsumen, Gemini 3.5 Transcribe sudah mendukung fitur dikte Rambler di Gboard di Android dan aplikasi Gemini di macOS. Chrome adalah berikutnya — bicara-untuk-mengetik di bidang web mana pun — disusul oleh Search Live, Gemini Live, Docs, Keep, dan Gmail. Bagi tim yang mengevaluasinya, jawaban praktisnya lebih sederhana: ia dapat dipanggil dari kode saat ini, dalam bahasa Inggris, di wilayah-wilayah yang API Gemini-nya tersedia.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Apa artinya ini bagi pipeline Anda

Hal yang benar-benar baru bukanlah angka WER, melainkan bahwa Go​ogle kini menjual transkripsi dengan dua fitur yang sebelumnya harus dirakit sendiri oleh tim — label pembicara dan stempel waktu tingkat kata — dalam model dasarnya, pada permukaan API G​emini yang mendukung pemanggilan fungsi. Jika Anda membangun pipeline catatan rapat terdiarisasi dari transkriber biasa ditambah diarizer terpisah ditambah proses pemformatan, ini adalah model Go​ogle pertama yang merampingkan langkah-langkah tersebut. Pertanyaan terbukanya adalah bagaimana WER non-streaming 2.6% bertahan pada audio Anda sendiri, dan sampai ada reproduksi independen, langkah yang bertanggung jawab bagi tim produksi adalah menjalankan sampel nyata melalui API daripada menganggarkan berdasarkan tolok ukur pilihan Go​ogle. Untuk pekerjaan LLM yang berjalan di atas transkrip — peringkasan, ekstraksi terstruktur, item tindakan — itulah lapisan tempat routing membuktikan manfaatnya, dan itulah lapisan yang dicakup OrcaRouter: satu API di lebih dari 200 model, failover otomatis antar penyedia, dan DSL routing yang menggabungkan beberapa model menjadi satu panggilan. Langkah transkripsi itu sendiri harus Anda uji dengan audio Anda sendiri sebelum mempercayai angka utama siapa pun.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube