
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: endpoint mana yang harus dipanggil aplikasi Anda
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Kecerdasan49Koding
Ketika Google meluncurkan keluarga Gemini 3.5 Transcribe pada 26 Agustus 2026, mereka mengirimkan dua model yang berbagi nama dan misi tetapi dibuat untuk tahap percakapan yang berbeda: Gemini 3.5 Transcribe Live, endpoint streaming yang dilayani melalui Live API, dan Gemini 3.5 Transcribe, endpoint pra-rekaman yang dilayani melalui Interactions API. Kesalahan yang dilakukan sebagian besar tim di minggu pertama adalah memperlakukan ini sebagai satu model dengan dua tombol. Ini adalah dua SKU — API berbeda, harga berbeda, batas keras berbeda — dan perbandingan akurasi di antara keduanya bukan pertarungan yang adil, karena keduanya diukur dengan aturan yang berbeda. Tulisan ini menempatkan keduanya berdampingan agar keputusan bergantung pada beban kerja Anda, bukan pada papan peringkat.
Keduanya sekilas
• API — Gemini 3.5 Transcribe Live berjalan di Live API (WebSocket, streaming dua arah) vs Gemini 3.5 Transcribe di Interactions API (file masuk, transkrip keluar).
• Pekerjaan — percakapan langsung, pembuatan teks, agen suara vs rapat, log panggilan, audio arsip.
• Akurasi — 4,0% WER streaming vs 2,6% WER non-streaming, menurut Artificial Analysis, dikutip oleh Google; rezim pengukuran yang berbeda, tidak dapat dibandingkan secara langsung.
• Latensi — transkrip akhir 0,40 detik setelah ucapan berakhir vs pemrosesan batch dari file lengkap.
• Sesi — Batas 10 menit per sesi langsung vs file hingga 60 menit (30 menit dengan diarization dan timestamp diaktifkan).
• Speaker — tidak ada di sisi streaming vs hingga tiga speaker dengan stempel waktu tingkat kata di sisi pra-rekaman.
• Harga — sekitar $0,009 per menit rata-rata dibandingkan sekitar $0,005 per menit rata-rata.

Keputusan arsitektur: Interactions API atau Live API
Kedua model berada di bawah keluarga Audio Gemini milik Google, dan keduanya sedang dalam pratinjau publik. Perbedaannya dimulai dari transport. gemini-3-5-transcribe-live membuka WebSocket dan menjaganya tetap terbuka: audio mentah mengalir masuk secara terus-menerus — pembingkaian yang umum adalah potongan PCM 16-bit pada 16 kHz atau 24 kHz — dan model mengembalikan transkrip parsial saat Anda berbicara, lalu transkrip akhir untuk setiap ujaran saat pembicaraan berakhir. gemini-3-5-transcribe mengambil file lengkap, memprosesnya, dan mengembalikan transkrip akhir dengan atribusi pembicara dan stempel waktu per kata.
Keputusan transportasi menentukan segalanya. Jika produk Anda menampilkan kata-kata saat diucapkan — teks langsung, agen suara yang membaca maksud di tengah kalimat, asisten panggilan yang bertindak saat panggilan berlangsung — Anda berada di jalur Live. Jika produk Anda menghasilkan rekaman — catatan rapat, log panggilan, arsip — Anda berada di jalur Interactions. Kebingungannya adalah keduanya menghasilkan teks; perbedaannya adalah apakah teks tersebut merupakan kondisi waktu nyata atau artefak akhir.
Akurasi: pajak streaming itu memang nyata.
Artificial Analysis, lembaga benchmark independen yang angka-angkanya dikutip oleh {{1}}Google{{/1}} dalam pos peluncurannya, mengukur rata-rata tingkat kesalahan kata sebesar 4.0% untuk endpoint streaming dan 2.6% untuk endpoint non-streaming. Pada benchmark multibahasa FLEURS, {{2}}Google{{/2}} melaporkan 5.50% untuk streaming dibandingkan 5.04% untuk non-streaming. Angka 2.6% tersebut menempatkan {{3}}Gemini{{/3}} 3.5 Transcribe di peringkat #5 pada papan peringkat WER AA saat peluncuran, di belakang ElevenLabs Scribe v2 dengan 2.2% dan MAI-Transcribe-1.5 milik Microsoft dengan 2.4% — itu adalah hasil pengukuran AA, bukan klaim {{4}}Google{{/4}}.
Angka streaming bukanlah versi yang lebih buruk dari pengujian yang sama. Ini adalah rezim yang berbeda: model berkomitmen pada kata-kata sebelum mendengar akhir kalimat, dan ia menanggung akibatnya. Jangan memilih di antara keduanya hanya berdasarkan akurasi, karena pada beban kerja apa pun, selisihnya bisa berbalik. Pilih berdasarkan kendala: endpoint streaming memiliki batas sesi 10 menit, tanpa diarisasi pembicara, dan tanpa cap waktu; endpoint pra-rekaman menangani file berdurasi satu jam, menetapkan hingga tiga pembicara, dan mengembalikan cap waktu tingkat kata. Jika aplikasi Anda membutuhkan label pembicara, model streaming sama sekali tidak dapat melakukan tugasnya, apa pun WER-nya.

Apa yang mereka bagikan
Kedua titik akhir berbagi mesin 'transkripsi cerdas', dan pada fitur bersama, pilihan di antara keduanya netral:
• 85+ bahasa dengan deteksi otomatis, termasuk peralihan bahasa di tengah aliran pada jalur Live.
• Pembersihan disfluensi — kata pengisi dihilangkan, koreksi diri diselesaikan ("Selasa — bukan, Rabu" menjadi hari yang dikoreksi).
• Pemformatan otomatis — tanda baca, kapitalisasi, dan struktur paragraf yang diterapkan pada keluaran.
• Kosakata khusus — hingga 1.000 istilah untuk jargon dan nama produk, dengan dokumentasi Google yang merekomendasikan sekitar 100 untuk hasil terbaik.
Satu peringatan yang berlaku untuk keduanya: pembersihan "pintar" yang membuat keluaran mudah dibaca adalah keputusan desain yang menukar kesetiaan harfiah. Frasa yang canggung dihaluskan; teks adalah pembacaan maksud oleh model, bukan catatan pengadilan. Untuk transkrip yang persis, Anda akan menginginkan opsi verbatim jika tersedia, dan Anda akan ingin memverifikasi perilaku pada audio Anda sendiri bagaimanapun juga.
Biaya per menit: premium langsung
Google menetapkan harga audio dalam token sebesar 25 token audio per detik, dengan output sekitar 175 token teks per menit transkrip. Pada harga daftar, biaya gabungan per menit audio sekitar $0,005 untuk gemini-3-5-transcribe dan sekitar $0,009 untuk gemini-3-5-transcribe-live — input sebesar $2 versus $3,50 per juta token, output sebesar $12 versus $21 per juta token. Keduanya memiliki tingkat gratis saat ini.
Premi membeli jalur real-time, bukan akurasi yang lebih baik: Anda membayar sekitar 80% lebih banyak per menit untuk endpoint streaming, dan transkripsinya memiliki WER yang lebih tinggi. Itulah kerangka yang jujur. Model pra-rekaman lebih murah dan lebih akurat; model streaming ada karena beberapa produk tidak bisa menunggu file selesai.
Endpoint mana yang sebaiknya Anda bangun
• Caption langsung dan subtitle — Gemini 3.5 Transcribe Live, dan periksa batas tanpa cap waktu jika Anda membutuhkan keluaran yang selaras dengan waktu.
• Agen suara — Gemini 3.5 Transcribe Live untuk deteksi niat di tengah kalimat; perhitungkan batas 10 menit untuk sesi panjang.
• Rapat, wawancara, arsip — Gemini 3.5 Transcribe, dengan WER 2.6%, atribusi pembicara, dan stempel waktu tingkat kata.
• Analitik pasca-panggilan — Gemini 3.5 Transcribe untuk rekaman yang telah selesai; Gemini 3.5 Transcribe Live hanya jika analisis harus dijalankan selama panggilan.
• Audio panjang berkesinambungan — Gemini 3.5 Transcribe, karena file 60 menit lebih baik daripada menyatukan sesi langsung sepuluh menit secara manual.

Lapisan di atas transkrip
Tidak satu pun dari kedua model tersebut yang dihosting OrcaRouter — saat ini kami tidak merutekan ucapan-ke-teks, dan Anda akan memanggil API Google secara langsung untuk endpoint mana pun. Yang dilakukan lapisan perutean untuk pipa suara adalah berada di atas transkrip: perangkum, pengekstrak entitas, model item tindakan yang mengubah aliran menjadi keputusan. Di lapisan itulah OrcaRouter menunjukkan nilainya — satu API untuk 200+ model dengan harga daftar penyedia tanpa markup, failover otomatis antar penyedia, dan DSL perutean yang menggabungkan beberapa model menjadi satu panggilan. Pilih endpoint transkripsi berdasarkan beban kerja, lalu jalankan model yang membaca transkrip di balik satu kunci.
Intinya
Gemini 3.5 Transcribe Live dan Gemini 3.5 Transcribe berasal dari keluarga yang sama tetapi merupakan produk yang berbeda. Pilih Live ketika transkrip harus sudah ada sebelum percakapan berakhir dan Anda dapat menerima sesi 10 menit, tanpa label pembicara, dan tanpa cap waktu. Pilih Transcribe ketika keluarannya adalah sebuah catatan dan akurasi serta atribusi lebih penting daripada kecepatan — lebih murah, lebih akurat, dan jauh lebih sedikit batasannya. Satu-satunya jawaban yang salah adalah menganggap satu endpoint dapat menangani keduanya.
