
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: Jalur Streaming Milik Salah Satunya
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 dan Gemini 3.5 Transcribe adalah dua model speech-to-text terdepan terbaru dari laboratorium saingan, dan cara jujur untuk membandingkannya adalah mengakui di awal bahwa keduanya tidak dibangun untuk tugas yang sama. Grok Voice Transcribe 2.0 milik SpaceXAI, yang dirilis pada 18 September 2026, adalah model yang mengutamakan streaming dengan mode batch yang disertakan: model ini memuncaki papan AA-WER Streaming dengan tingkat kesalahan kata 2,7% untuk transkrip akhir dan 3,4% untuk parsial pertama, keduanya muncul 0,49 detik setelah akhir ucapan. Gemini 3.5 Transcribe, yang dirilis pada 26 Agustus 2026, adalah model yang mengutamakan batch dengan SKU streaming yang disertakan, dan kedua bagiannya berperilaku sangat berbeda — jalur pra-rekaman mengukur 2,6% AA-WER pada papan non-streaming Artificial Analysis, sementara yang terpisah gemini-3.5-transcribe-live endpoint mengukur 4,0% pada papan streaming pada 0,40 detik. Letakkan keempat angka itu berdampingan dan bentuk pertarungan ini jelas: keduanya berdekatan dalam akurasi di mana Gemini 3.5 Transcribe kuat, dan keduanya tidak berdekatan di mana Grok Voice Transcribe 2.0 unggul.
Satu-satunya lane tempat mereka berdua bertarung.
Kedua model dapat mentranskripsikan audio langsung, jadi streaming adalah satu-satunya arena tempat perbandingan langsung menjadi bermakna. Di sana, Grok Voice Transcribe 2.0 unggul 1,3 poin atas Gemini 3.5 Transcribe Live dalam akurasi transkrip akhir — 2,7% versus 4,0% WER pada perangkat uji yang sama, sekitar delapan jam audio yang sama, dan pembobotan 50/25/25 yang sama di seluruh AA-AgentTalk, VoxPopuli, dan Earnings22. Itu bukan perbedaan pembulatan; pada tingkat kesalahan tersebut, itu kira-kira satu kata salah tambahan dari setiap tujuh puluh lima kata yang ditranskripsikan oleh model Google. Pada transkrip parsial pertama, kesenjangannya bahkan lebih lebar, 3,4% versus 5,8%, dan transkrip parsial adalah transkrip yang harus ditindaklanjuti oleh agen suara langsung sebelum pembicara selesai.
Latensi justru berbalik arah, dan inilah bagian dari perbandingan yang sering terlewat. Gemini 3.5 Transcribe Live mengembalikan transkrip akhirnya 0,40 detik setelah akhir ucapan, dibandingkan 0,49 milik Grok, dan parsial pertamanya dalam 0,25 detik, dibandingkan 0,49 milik Grok — sekitar dua kali lebih cepat mencapai kata pertama yang dapat digunakan. Tidak ada dari kedua model ini yang bersaing dengan ujung papan peringkat yang benar-benar cepat, tempat Deepgram Flux mencatat 0,02 detik dan Soniox v5 0,05 detik, tetapi di antara keduanya trade-off-nya eksplisit: Google lebih cepat berbicara, SpaceXAI lebih mungkin benar saat berbicara. Bagi agen yang mengambil giliran bicara dan tidak boleh memotong pembicaraan penelepon, tambahan latensi parsial 0,24 detik adalah biaya nyata yang harus dibenarkan oleh keunggulan akurasi.

Di mana Gemini 3.5 Transcribe sebenarnya unggul
Cakupan bahasa adalah yang paling jelas, dan tidak ada yang mendekati. Model Google menangani 85+ bahasa; Grok Voice Transcribe 2.0 mendukung puluhan bahasa, dengan pemformatan bentuk tertulis — normalisasi teks invers yang mengubah angka, tanggal, mata uang, dan alamat email yang diucapkan menjadi bentuk tertulisnya — yang didokumentasikan dalam 25 bahasa. Jika audio Anda berbahasa Portugis, Vietnam, atau campuran alih kode dua bahasa dalam satu kalimat, pertanyaan tentang model mana yang lebih akurat di papan Artificial Analysis sebagian besar bersifat akademis, karena papan itu berbobot bahasa Inggris dan banyak berisi obrolan agen. Google melaporkan WER streaming 5,50% dan non-streaming 5,04% pada FLEURS di seluruh rangkaian multibahasa miliknya sendiri, angka-angka yang dilaporkan vendor dan tidak direproduksi secara independen tetapi setidaknya memang menggambarkan kasus multibahasa.
Keunggulan kedua adalah tier gratis. Gemini 3.5 Transcribe menyediakan token input dan output gratis di API Google, dengan catatan bahwa konten tier gratis digunakan untuk meningkatkan produk Google, sedangkan konten tier berbayar tidak. Untuk prototipe, proyek sampingan, atau alat internal yang memproses audio yang tidak akan Anda bayar untuk ditranskripsikan, itu adalah opsi nyata yang tidak dapat ditandingi oleh vendor per jam mana pun. Grok Voice Transcribe 2.0 berbayar sejak jam audio pertama.
Dan yang ketiga adalah bahwa Gemini 3.5 Transcribe adalah model multimodal umum dengan mode transkripsi, bukan layanan ASR yang dirancang khusus. Model ini dapat diberi prompt, dapat menerima teks sebagai konteks, dan berada di permukaan API yang sama dengan semua yang dirilis Google. Jika transkripsi adalah salah satu langkah dalam pipeline yang juga memerlukan penalaran atas transkrip, mempertahankan keduanya dalam satu panggilan model memiliki nilai yang tidak dapat ditangkap oleh tingkat kesalahan per kata.
Perhitungan harga, per seribu menit
Artificial Analysis menormalisasi kedua model ke biaya per 1.000 menit audio, yang merupakan satu-satunya cara untuk membandingkan tarif per jam tetap dengan penagihan berbasis token:
• Batch, telah direkam sebelumnya — Grok Voice Transcribe 2.0 seharga $1,67 per 1.000 menit ($0,10/jam) vs Gemini 3.5 Transcribe seharga $5,00 per 1.000 menit ($0,30/jam, mulai dari $2,00 per 1 juta token input dan $12,00 per 1 juta token output)
• Streaming — Grok Voice Transcribe 2.0 seharga $3,33 per 1.000 menit ($0,20/jam) vs Gemini 3.5 Transcribe Live sekitar $5,40 per 1.000 menit, gabungan dari $3,50 per 1 juta token input audio dan $21,00 per 1 juta token output teks
• Throughput batch — Grok Voice Transcribe 2.0 pada sekitar 162× waktu nyata vs Gemini 3.5 Transcribe pada sekitar 88× di board yang sama, jadi model yang lebih murah juga yang lebih cepat untuk pekerjaan file
• Batas sesi langsung — Grok Voice Transcribe 2.0 melakukan streaming melalui WebSocket tanpa batas sesi yang dipublikasikan selain 100 sesi bersamaan per tim vs Gemini 3.5 Transcribe Live dibatasi 10 menit per sesi
Baris terakhir itu adalah detail operasional yang lebih banyak menentukan arsitektur daripada angka akurasi. Batas 10 menit pada sesi langsung berarti panggilan panjang, rapat panjang, dan streaming panjang harus dipotong dan dibangun ulang, dan setiap pembangunan ulang adalah sambungan tempat konteks hilang. Endpoint streaming Grok memiliki batas ukuran file 500 MB pada jalur batch dan batas konkurensi per tim sebanyak 100 sesi pada jalur streaming, yang merupakan jenis kendala berbeda — throughput alih-alih durasi.
Penagihan token patut dipahami sebelum Anda berkomitmen pada sisi Google, karena hal itu membuat tagihan Anda menjadi fungsi dari dua variabel, bukan satu. Gemini menagih input audio dan output teks secara terpisah, sehingga model yang menghasilkan format bertele-tele atau mengulang-ulang dirinya sendiri lebih mahal daripada model yang tidak, dan bahasa dengan kata-kata yang lebih panjang lebih mahal daripada bahasa dengan kata-kata yang lebih pendek. Tarif tetap per jam milik Grok tidak terpengaruh oleh semua itu. Untuk beban kerja bervolume tinggi, tarif tetap lebih mudah diprediksi, dan karena OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, perubahan di sisi vendor mana pun akan sampai ke tagihan Anda pada hari terjadinya, bukan pada pembaruan kontrak berikutnya.

Bentuk fitur: apa yang masing-masing menolak untuk dilakukan
Daftar kemampuan berbeda lebih jauh daripada yang disiratkan oleh angka akurasi, dan celah-celahnya berada di tempat-tempat yang penting bagi aplikasi tertentu:
• Diarisasi pembicara — disertakan tanpa biaya tambahan pada Grok Voice Transcribe 2.0; tidak didukung pada Gemini 3.5 Transcribe Live, sehingga transkrip langsung dengan atribusi pembicara sama sekali tidak tersedia di endpoint tersebut
• Stempel waktu tingkat kata — Grok Voice Transcribe 2.0 mengembalikannya dengan skor keyakinan per kata; Gemini 3.5 Transcribe Live tidak mengembalikan satu pun, yang menghilangkan kemungkinan penetapan ambang batas keyakinan dan penyelarasan takarir yang presisi
• Audio multikanal — Grok Voice Transcribe 2.0 mentranskripsikan hingga 8 kanal independen dalam satu kali proses; Gemini 3.5 Transcribe Live tidak memiliki padanan, sehingga rekaman panggilan multikanal memerlukan sesi per kanal
• Pembobotan istilah kunci — Grok Voice Transcribe 2.0 menerima hingga 100 istilah domain per permintaan; Gemini 3.5 Transcribe menerima kosakata khusus dan petunjuk bahasa opsional
Plumbing agen suara — Grok Voice Transcribe 2.0 menghadirkan penghapusan kata pengisi dan deteksi akhir giliran Smart Turn; Gemini 3.5 Transcribe Live mencakup kasus streaming tetapi menyerahkan logika giliran ke aplikasi
• Penanganan input — Grok Voice Transcribe 2.0 menerima unggahan file langsung hingga 500 MB dalam 12 format audio; jalur pra-rekaman Gemini 3.5 Transcribe mengharapkan URL HTTPS publik dengan batas 15 menit dan 300 MB, serta tidak dapat menggabungkan mode Smart formatting-nya dengan stempel waktu kata atau label pembicara
Pola dalam daftar itu adalah bahwa SpaceXAI membangun produk transkripsi dan Google membangun kemampuan transkripsi. Diarisasi, stempel waktu, pemisahan kanal, dan deteksi giliran adalah fitur yang Anda butuhkan ketika transkripsi adalah keseluruhan aplikasi; kemampuan diberi prompt, keluasan bahasa, dan satu API untuk segala hal adalah yang Anda inginkan ketika transkripsi hanyalah satu langkah di dalam aplikasi yang lebih besar. Tidak ada daftar yang lebih baik secara abstrak, dan tim yang memilih hanya berdasarkan akurasi akan pada akhirnya melewatkan kumpulan fitur mana pun yang tidak dibutuhkannya.

Memilih di antara keduanya, dan apa yang mengubah jawabannya
Pilih Grok Voice Transcribe 2.0 ketika transkrip harus tepat saat audio masih diputar: pergantian giliran agen live, takarir waktu nyata yang tidak boleh salah, aliran pusat kontak di mana atribusi pembicara dan pemisahan saluran menjadi bagian dari persyaratan, atau pipeline batch apa pun di mana $1,67 per 1.000 menit dan throughput 162× sama-sama penting. Pilih Gemini 3.5 Transcribe ketika audionya multibahasa dalam bahasa di luar set terdokumentasi Grok, ketika transkrip menjadi masukan bagi model yang juga harus bernalar tentangnya, ketika Anda menginginkan tier gratis untuk membuat prototipe, atau ketika 2,6% AA-WER pada jalur batch sudah cukup untuk apa yang Anda lakukan dan cakupan bahasa tambahannya lebih bernilai daripada selisih harganya.
Yang sebenarnya dilakukan sebagian besar tim di sini bukanlah memilih. Kedua model dapat diakses melalui satu kunci API OrcaRouter bersama 200+ model lainnya, yang berarti Anda dapat merutekan lalu lintas agen langsung ke Grok Voice Transcribe 2.0 dan arsip multibahasa yang panjang ke Gemini 3.5 Transcribe tanpa harus memelihara dua kontrak vendor, dua hubungan penagihan, dan dua set kredensial. Itu juga cara Anda menyelesaikan pertanyaan akurasi untuk audio Anda sendiri: jalankan keduanya pada rekaman yang sama, bandingkan transkrip yang benar-benar Anda dapatkan, dan biarkan DSL perutean mengirim lalu lintas ke tempat yang seharusnya. Papan peringkat memberi tahu Anda model mana yang menang pada delapan jam pembicaraan agen berbahasa Inggris milik orang lain; hanya audio Anda sendiri yang memberi tahu model mana yang menang pada audio Anda.
Pertanyaan terbukanya adalah apa yang terjadi pada celah streaming itu ketika Google nanti merevisi endpoint Live. Gemini 3.5 Transcribe Live diluncurkan dalam pratinjau publik dan angka 4,0%-nya diukur sekitar sehari setelah dapat dipanggil — sinyal awal yang kuat, tetapi sinyal yang memiliki lebih sedikit waktu untuk stabil dibandingkan angka Grok yang kini berada di atasnya. Jika Google menutup celah streaming 1,3 poin sambil mempertahankan latensi parsial 0,25 detik, trade-off itu tidak lagi menjadi trade-off dan keunggulan Grok menyempit menjadi harga dan fitur. Sampai saat itu, pembagiannya jelas: hasil parsial tercepat milik Google, yang paling akurat milik SpaceXAI, dan tidak ada model di papan peringkat yang memiliki keduanya.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
