Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — endpoint mana yang harus dipanggil aplikasi Anda. Ilustrasi yang dibuat ulang.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: endpoint mana yang harus dipanggil aplikasi Anda

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ketika Go​ogle meluncurkan keluarga Ge​mini 3.5 Transcribe pada 26 Agustus 2026, mereka mengirimkan dua model yang berbagi nama dan misi tetapi dibuat untuk tahap percakapan yang berbeda: Ge​mini 3.5 Transcribe Live, endpoint streaming yang dilayani melalui Live API, dan Ge​mini 3.5 Transcribe, endpoint pra-rekaman yang dilayani melalui Interactions API. Kesalahan yang dilakukan sebagian besar tim di minggu pertama adalah memperlakukan ini sebagai satu model dengan dua tombol. Ini adalah dua SKU — API berbeda, harga berbeda, batas keras berbeda — dan perbandingan akurasi di antara keduanya bukan pertarungan yang adil, karena keduanya diukur dengan aturan yang berbeda. Tulisan ini menempatkan keduanya berdampingan agar keputusan bergantung pada beban kerja Anda, bukan pada papan peringkat.

Keduanya sekilas

• API — Ge​mini 3.5 Transcribe Live berjalan di Live API (WebSocket, streaming dua arah) vs Ge​mini 3.5 Transcribe di Interactions API (file masuk, transkrip keluar).

• Pekerjaan — percakapan langsung, pembuatan teks, agen suara vs rapat, log panggilan, audio arsip.

• Akurasi — 4,0% WER streaming vs 2,6% WER non-streaming, menurut Artificial Analysis, dikutip oleh Google; rezim pengukuran yang berbeda, tidak dapat dibandingkan secara langsung.

• Latensi — transkrip akhir 0,40 detik setelah ucapan berakhir vs pemrosesan batch dari file lengkap.

• Sesi — Batas 10 menit per sesi langsung vs file hingga 60 menit (30 menit dengan diarization dan timestamp diaktifkan).

• Speaker — tidak ada di sisi streaming vs hingga tiga speaker dengan stempel waktu tingkat kata di sisi pra-rekaman.

• Harga — sekitar $0,009 per menit rata-rata dibandingkan sekitar $0,005 per menit rata-rata.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

Keputusan arsitektur: Interactions API atau Live API

Kedua model berada di bawah keluarga Audio Ge​mini milik Go​ogle, dan keduanya sedang dalam pratinjau publik. Perbedaannya dimulai dari transport. gemini-3-5-transcribe-live membuka WebSocket dan menjaganya tetap terbuka: audio mentah mengalir masuk secara terus-menerus — pembingkaian yang umum adalah potongan PCM 16-bit pada 16 kHz atau 24 kHz — dan model mengembalikan transkrip parsial saat Anda berbicara, lalu transkrip akhir untuk setiap ujaran saat pembicaraan berakhir. gemini-3-5-transcribe mengambil file lengkap, memprosesnya, dan mengembalikan transkrip akhir dengan atribusi pembicara dan stempel waktu per kata.

Keputusan transportasi menentukan segalanya. Jika produk Anda menampilkan kata-kata saat diucapkan — teks langsung, agen suara yang membaca maksud di tengah kalimat, asisten panggilan yang bertindak saat panggilan berlangsung — Anda berada di jalur Live. Jika produk Anda menghasilkan rekaman — catatan rapat, log panggilan, arsip — Anda berada di jalur Interactions. Kebingungannya adalah keduanya menghasilkan teks; perbedaannya adalah apakah teks tersebut merupakan kondisi waktu nyata atau artefak akhir.

Akurasi: pajak streaming itu memang nyata.

Artificial Analysis, lembaga benchmark independen yang angka-angkanya dikutip oleh {{1}}Go​ogle{{/1}} dalam pos peluncurannya, mengukur rata-rata tingkat kesalahan kata sebesar 4.0% untuk endpoint streaming dan 2.6% untuk endpoint non-streaming. Pada benchmark multibahasa FLEURS, {{2}}Go​ogle{{/2}} melaporkan 5.50% untuk streaming dibandingkan 5.04% untuk non-streaming. Angka 2.6% tersebut menempatkan {{3}}Ge​mini{{/3}} 3.5 Transcribe di peringkat #5 pada papan peringkat WER AA saat peluncuran, di belakang ElevenLabs Scribe v2 dengan 2.2% dan MAI-Transcribe-1.5 milik Microsoft dengan 2.4% — itu adalah hasil pengukuran AA, bukan klaim {{4}}Go​ogle{{/4}}.

Angka streaming bukanlah versi yang lebih buruk dari pengujian yang sama. Ini adalah rezim yang berbeda: model berkomitmen pada kata-kata sebelum mendengar akhir kalimat, dan ia menanggung akibatnya. Jangan memilih di antara keduanya hanya berdasarkan akurasi, karena pada beban kerja apa pun, selisihnya bisa berbalik. Pilih berdasarkan kendala: endpoint streaming memiliki batas sesi 10 menit, tanpa diarisasi pembicara, dan tanpa cap waktu; endpoint pra-rekaman menangani file berdurasi satu jam, menetapkan hingga tiga pembicara, dan mengembalikan cap waktu tingkat kata. Jika aplikasi Anda membutuhkan label pembicara, model streaming sama sekali tidak dapat melakukan tugasnya, apa pun WER-nya.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Apa yang mereka bagikan

Kedua titik akhir berbagi mesin 'transkripsi cerdas', dan pada fitur bersama, pilihan di antara keduanya netral:

• 85+ bahasa dengan deteksi otomatis, termasuk peralihan bahasa di tengah aliran pada jalur Live.

• Pembersihan disfluensi — kata pengisi dihilangkan, koreksi diri diselesaikan ("Selasa — bukan, Rabu" menjadi hari yang dikoreksi).

• Pemformatan otomatis — tanda baca, kapitalisasi, dan struktur paragraf yang diterapkan pada keluaran.

• Kosakata khusus — hingga 1.000 istilah untuk jargon dan nama produk, dengan dokumentasi Google yang merekomendasikan sekitar 100 untuk hasil terbaik.

Satu peringatan yang berlaku untuk keduanya: pembersihan "pintar" yang membuat keluaran mudah dibaca adalah keputusan desain yang menukar kesetiaan harfiah. Frasa yang canggung dihaluskan; teks adalah pembacaan maksud oleh model, bukan catatan pengadilan. Untuk transkrip yang persis, Anda akan menginginkan opsi verbatim jika tersedia, dan Anda akan ingin memverifikasi perilaku pada audio Anda sendiri bagaimanapun juga.

Biaya per menit: premium langsung

Google menetapkan harga audio dalam token sebesar 25 token audio per detik, dengan output sekitar 175 token teks per menit transkrip. Pada harga daftar, biaya gabungan per menit audio sekitar $0,005 untuk gemini-3-5-transcribe dan sekitar $0,009 untuk gemini-3-5-transcribe-live — input sebesar $2 versus $3,50 per juta token, output sebesar $12 versus $21 per juta token. Keduanya memiliki tingkat gratis saat ini.

Premi membeli jalur real-time, bukan akurasi yang lebih baik: Anda membayar sekitar 80% lebih banyak per menit untuk endpoint streaming, dan transkripsinya memiliki WER yang lebih tinggi. Itulah kerangka yang jujur. Model pra-rekaman lebih murah dan lebih akurat; model streaming ada karena beberapa produk tidak bisa menunggu file selesai.

Endpoint mana yang sebaiknya Anda bangun

• Caption langsung dan subtitle — Gemini 3.5 Transcribe Live, dan periksa batas tanpa cap waktu jika Anda membutuhkan keluaran yang selaras dengan waktu.

• Agen suara — Ge​mini 3.5 Transcribe Live untuk deteksi niat di tengah kalimat; perhitungkan batas 10 menit untuk sesi panjang.

• Rapat, wawancara, arsip — Ge​mini 3.5 Transcribe, dengan WER 2.6%, atribusi pembicara, dan stempel waktu tingkat kata.

• Analitik pasca-panggilan — Ge​mini 3.5 Transcribe untuk rekaman yang telah selesai; Ge​mini 3.5 Transcribe Live hanya jika analisis harus dijalankan selama panggilan.

• Audio panjang berkesinambungan — Ge​mini 3.5 Transcribe, karena file 60 menit lebih baik daripada menyatukan sesi langsung sepuluh menit secara manual.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

Lapisan di atas transkrip

Tidak satu pun dari kedua model tersebut yang dihosting OrcaRouter — saat ini kami tidak merutekan ucapan-ke-teks, dan Anda akan memanggil API Google secara langsung untuk endpoint mana pun. Yang dilakukan lapisan perutean untuk pipa suara adalah berada di atas transkrip: perangkum, pengekstrak entitas, model item tindakan yang mengubah aliran menjadi keputusan. Di lapisan itulah OrcaRouter menunjukkan nilainya — satu API untuk 200+ model dengan harga daftar penyedia tanpa markup, failover otomatis antar penyedia, dan DSL perutean yang menggabungkan beberapa model menjadi satu panggilan. Pilih endpoint transkripsi berdasarkan beban kerja, lalu jalankan model yang membaca transkrip di balik satu kunci.

Intinya

Ge​mini 3.5 Transcribe Live dan Ge​mini 3.5 Transcribe berasal dari keluarga yang sama tetapi merupakan produk yang berbeda. Pilih Live ketika transkrip harus sudah ada sebelum percakapan berakhir dan Anda dapat menerima sesi 10 menit, tanpa label pembicara, dan tanpa cap waktu. Pilih Transcribe ketika keluarannya adalah sebuah catatan dan akurasi serta atribusi lebih penting daripada kecepatan — lebih murah, lebih akurat, dan jauh lebih sedikit batasannya. Satu-satunya jawaban yang salah adalah menganggap satu endpoint dapat menangani keduanya.