Kartu hero artikel bertuliskan 'Grok Voice Transcribe 2.0 vs GPT Transcribe' dengan badge 'PERBANDINGAN MODEL' dan subjudul 'Harga streaming sama, akurasi berbeda', dengan chip bertuliskan 2,7% vs 3,9% WER streaming, 3,4% vs 6,3% parsial pertama, $1,67 vs $4,50 per 1.000 menit dan 162x vs 41x waktu nyata, di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

Grok Voice Transcribe 2.0 vs GPT Transcribe: Harga Streaming Sama, Akurasi Berbeda

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kebetulannya hampir terlalu rapi. Di papan AA-WER Streaming milik Artificial Analysis, Grok Voice Transcribe 2.0 dan GPT Live Transcribe — endpoint transkripsi streaming — keduanya tercantum tepat $3,33 per 1.000 menit audio. Grok Voice Transcribe 2.0 milik SpaceXAI, yang dirilis pada 18 September 2026, menghasilkan transkrip akhir dengan tingkat kesalahan kata 2,7%, 0,49 detik setelah akhir ucapan, dan parsial pertama pada 3,4%. GPT Live Transcribe, yang diluncurkan bersamaan dengan GPT Transcribe pada 28 Juli 2026, menghasilkan transkrip akhirnya pada 3,9% dan parsial pertamanya pada 6,3%. Harga sama, dan dengan keunggulan sekitar 1,2 poin akurasi transkrip akhir plus 2,9 poin akurasi transkrip parsial di pihak SpaceXAI. Sisi batch dari perbandingan yang sama sama sekali bukan kebetulan: GPT Transcribe berbiaya $4,50 per 1.000 menit versus $1,67 milik Grok Voice Transcribe 2.0, selisih 63% pada jalur berkas rekaman.

Dua taruhan berbeda tentang bagaimana transkripsi menjadi lebih baik

Jawaban OpenAI untuk akurasi adalah konteks. GPT Transcribe dan GPT Live Transcribe keduanya menerima prompt bebas, daftar kata kunci, dan daftar bahasa yang diharapkan, dan dalam sesi Realtime, giliran-giliran yang ditranskripsikan sebelumnya dimasukkan kembali sebagai konteks untuk giliran berikutnya. Pada benchmark Context Aware ASR milik OpenAI sendiri, pengondisian itu meningkatkan akurasi semantik GPT Live Transcribe dari 38,5% menjadi 44,6% — angka yang dilaporkan vendor, dan yang mengukur apakah maknanya bertahan, bukan apakah kata-katanya benar. Pertukaran yang ditawarkan OpenAI bersifat eksplisit: beri model informasi tentang apa yang akan didengarnya, dan model itu akan mentranskripsikan domain Anda lebih baik daripada model umum dengan akurasi mentah yang sama.

Jawaban SpaceXAI adalah model itu sendiri. Grok Voice Transcribe 2.0 memang memiliki mekanisme bias — hingga 100 istilah kunci per permintaan, masing-masing hingga 50 karakter — tetapi itu adalah daftar kosakata, bukan prompt. Anda dapat memberi tahu bahwa "OrcaRouter" dan "Kubernetes" adalah kata yang nyata; Anda tidak dapat menyerahkan kepadanya sebuah paragraf yang menjelaskan bahwa ini adalah panggilan dukungan tentang pengembalian dana. Peningkatan akurasi di 2.0 justru berasal dari pelatihan ulang: pada kumpulan evaluasi milik SpaceXAI yang diturunkan dari produksi, tingkat kesalahan kata turun dari 8,7% menjadi 3,3% pada audio percakapan, 10,6% menjadi 7,1% pada teleponi 8 kHz, 7,2% menjadi 3,2% pada kredensial lisan, dan 20,6% menjadi 6,8% pada perintah pendek dalam 19 bahasa. Itu adalah angka perusahaan pada audio perusahaan, tidak direproduksi oleh siapa pun di luar perusahaan itu, dan angka-angka itu menggambarkan model yang menjadi lebih baik dalam masalah akustik, bukan model yang menjadi lebih baik karena diberi tahu apa yang harus diharapkan.

Perbedaan praktisnya baru terlihat pada jam kedua kerja. Model yang dikondisikan oleh konteks bisa jauh lebih baik daripada yang ditunjukkan oleh tolok ukur mentahnya, karena Anda sendiri yang menyediakan kosakata dan domainnya. Model itu juga bisa berhalusinasi terhadap kata kunci yang Anda berikan: masukkan "OrcaRouter" ke dalam prompt, dan model yang tidak dapat mendengar kata itu dengan jelas mungkin tetap menghasilkannya. Model yang berbias pada istilah kunci mengalami penurunan kualitas dengan lebih baik, karena pembiasan menggeser probabilitas suatu istilah alih-alih menegaskan bahwa istilah itu ada. Tidak ada dari kedua mode kegagalan itu yang muncul di papan peringkat, dan keduanya akan muncul di log Anda.

Angka-angkanya, berdampingan

• Akurasi transkrip akhir (streaming) — Grok Voice Transcribe 2.0 pada 2,7% WER vs GPT Live Transcribe pada 3,9% pada AA-WER Streaming, keduanya menurut Artificial Analysis

• Akurasi parsial pertama (streaming) — 3,4% vs 6,3%, selisih terlebar dalam perbandingan ini dan yang menentukan perilaku agen suara

• Waktu hingga transkrip final — 0,49 detik vs 0,81 detik setelah akhir ucapan, jadi model yang lebih akurat juga lebih cepat untuk menetapkan hasil final

• Waktu ke parsial pertama — 0,49 dtk vs 0,26 dtk, satu-satunya kolom latensi yang dimenangkan OpenAI secara mutlak

• Harga streaming — $3,33 per 1.000 menit untuk keduanya, dinormalisasi oleh Artificial Analysis dari Grok $0,20/jam dan OpenAI $0,017/menit

• Akurasi batch (non-streaming) — Grok Voice Transcribe 2.0 pada 2,3% AA-WER vs GPT Transcribe pada 3,31%

• Harga batch — $1,67 per 1.000 menit vs $4,50 per 1.000 menit, mulai dari $0,10/jam dibandingkan dengan $0,0045/menit

• Throughput batch — sekitar 162× waktu nyata vs sekitar 41× pada board yang sama

Bacalah daftar itu sebagai dua kolom, bukan satu putusan. OpenAI menang dalam latensi parsial pertama dengan selisih yang jelas dan menawarkan mekanisme konteks yang tidak dimiliki Grok. SpaceXAI menang dalam akurasi akhir pada kedua mode, akurasi parsial dalam streaming, throughput, dan harga batch dengan selisih yang lebar. Tidak ada kolom di mana GPT Live Transcribe lebih cepat sekaligus lebih akurat daripada Grok Voice Transcribe 2.0; ada satu kolom di mana ia lebih cepat, dan itulah kolom paling awal.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

Di jalur batch mana Anda sebenarnya berada

Kesenjangan $1,67 versus $4,50 adalah angka yang paling tidak ambigu di sini, dan penting untuk menjelaskan secara tepat mengapa kesenjangan itu ada. OpenAI menurunkan harga lini produk ini sebesar 25% saat meluncurkan GPT Transcribe, dari era GPT-4o Transcribe, dan hasilnya adalah $0,0045 per menit. SpaceXAI membiarkan tarif batch-nya tidak berubah di $0,10 per jam saat beralih dari versi 1.0 ke 2.0 — mereka meningkatkan modelnya dan mengenakan tarif yang sama, yang merupakan hal yang lebih sulit dilakukan dan sinyal yang lebih baik tentang ke arah mana pasar bergerak. MAI-Transcribe-2 milik Microsoft hadir pada harga identik $0,10 per jam sebagai penawaran waktu terbatas, sehingga angka $1,67 per 1.000 menit telah menjadi batas bawah lab terdepan untuk transkripsi batch, bukan sekadar angka promosi satu vendor.

Pada sepuluh ribu jam audio per bulan, selisih itu kira-kira $2.830 versus $450. Bagi arsip podcast, tumpukan rekaman panggilan, atau pustaka media yang ditranskripsikan ulang, perbedaan harga jauh mengalahkan perbedaan akurasi apa pun antara 2,3% dan 3,31% WER. Bagi agen streaming, ketika kedua produk berbiaya sama, akurasi dan latensi adalah satu-satunya hal yang tersisa untuk diperdebatkan.

Ada perbedaan struktural di balik tarif-tarif itu yang layak disebut: Grok Voice Transcribe 2.0 menagih tarif tetap per jam audio, dan GPT Live Transcribe menagih per menit, tetapi Gemini 3.5 Transcribe Live menagih per token untuk input audio maupun output teks. Hanya satu dari ketiganya yang membuat tagihan Anda menjadi fungsi dari apa yang dipilih model untuk diucapkan. Jika volume Anda cukup besar sehingga peramalan menjadi penting, tarif tetap lebih mudah dipertahankan kepada siapa pun yang menandatangani faktur — dan karena OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, penurunan harga di sisi vendor seperti 25% dari OpenAI akan langsung berlaku di sisi kami pada hari yang sama saat diumumkan, bukan pada perpanjangan berikutnya.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

Apa yang tidak dimiliki oleh kedua model

GPT Transcribe dan GPT Live Transcribe adalah dua produk, bukan satu produk dengan tombol pengalih. Model batch menangani file yang sudah selesai, transkrip file yang dialirkan, dan giliran yang telah dikomit dalam sesi Realtime, serta memproses audio sekitar 34 kali lebih cepat daripada waktu nyata menurut angka OpenAI sendiri — Artificial Analysis mengukur 41× pada harness-nya. Model streaming adalah yang lebih mahal pada $0,017 per menit dan yang memiliki tingkat kesalahan 10× lebih besar pada hasil parsial. Memilih OpenAI berarti memilih masalah mana dari kedua itu yang Anda miliki, karena endpoint yang lebih murah tidak dapat melakukan pekerjaan yang lain.

Grok Voice Transcribe 2.0 adalah satu model dengan dua transport: bobot yang sama melayani /v1/stt melalui REST untuk file hingga 500 MB dan wss://api.x.ai/v1/stt melalui WebSocket untuk audio langsung, dengan hasil sementara yang dikeluarkan kira-kira setiap 500 ms. Laju streaming persis dua kali laju batch, bukan produk yang direkayasa secara terpisah, yang berarti akurasi yang Anda ukur pada audio yang diarsipkan adalah akurasi yang seharusnya Anda harapkan saat live. Ini juga berarti tidak ada model kedua untuk dievaluasi — satu set prompt, satu set istilah kunci, satu set ekspektasi.

Kesetaraan fitur hampir tercapai tetapi tidak identik. Keduanya mengembalikan stempel waktu tingkat kata; Grok Voice Transcribe 2.0 menyertakan skor keyakinan pada setiap kata, yang memungkinkan Anda menetapkan ambang batas pada rentang berkeyakinan rendah alih-alih mempercayai seluruh transkrip secara setara. Keduanya melakukan diarisasi pembicara, dan milik Grok disertakan tanpa biaya tambahan. Keduanya menangani normalisasi teks invers untuk angka, tanggal, mata uang, dan detail kontak. Grok Voice Transcribe 2.0 menambahkan transkripsi multisaluran hingga 8 saluran independen, penghapusan kata pengisi, dan deteksi akhir giliran Smart Turn; tambahan khas GPT Transcribe adalah pengondisian konteks tingkat prompt dan, di sisi Realtime, penerusan otomatis giliran sebelumnya. OpenAI belum menerbitkan jumlah bahasa yang didukung untuk kedua model; Grok Voice Transcribe 2.0 mendokumentasikan lusinan bahasa dengan pengalihan saat perekaman dan pemformatan bentuk tertulis di 25 bahasa.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

Cara memutuskan, dan cara mengujinya

Jika Anda membangun agen suara yang harus merespons sebelum penelepon selesai berbicara, kolom transkrip parsial adalah variabel keputusan Anda, dan itu membedakan kedua model secara jelas: Grok Voice Transcribe 2.0 lebih akurat 2,9 poin pada transkrip parsial tetapi 0,23 detik lebih lambat menghasilkannya. Pilih SpaceXAI jika transkrip parsial yang salah lebih buruk daripada yang terlambat — perutean, eskalasi, respons yang dipicu oleh kepatuhan. Pilih OpenAI jika transkrip parsial yang terlambat lebih buruk daripada yang salah, dan jika Anda memiliki kosakata domain untuk memberi masukan ke mekanisme konteks sehingga kesenjangan akurasi menyempit. Lalu ukur keduanya, karena perilaku transkrip parsial dari kedua vendor pada delapan jam percakapan agen berbahasa Inggris tidak memprediksi apa yang akan dilakukan keduanya pada aksen, codec, dan jargon Anda.

Jika Anda mentranskripsikan file, keputusannya jauh lebih mudah: $1,67 versus $4,50 per 1.000 menit dan 2,3% versus 3,31% WER, keduanya menunjuk ke arah yang sama. Satu-satunya alasan untuk tetap menggunakan GPT Transcribe untuk pekerjaan batch adalah jika mekanisme pengondisian konteks melakukan sesuatu untuk audio Anda yang tidak dapat diimbangi oleh selisih akurasi mentah — yang merupakan kemungkinan nyata pada rekaman yang sangat spesifik domain, dan dapat diuji.

Tidak ada satu pun model transkripsi yang ada dalam katalog OrcaRouter saat ini, jadi panggilan itu sendiri masuk ke API milik vendor. Yang justru berada di balik satu kunci OrcaRouter adalah semua hal yang menerima masukan dari transkrip: model agen, peringkas, pengklasifikasi, kode yang menentukan apa yang harus dilakukan dengan teks itu. Di situlah kontrak kedua biasanya muncul — satu vendor untuk ucapan, vendor lain untuk model yang melakukan penalaran atasnya — dan sebenarnya tidak harus demikian. Satu kunci untuk 200+ model, failover otomatis jika penyedia mengalami degradasi, dan DSL perutean jika Anda ingin mengirim permintaan melalui beberapa model dan membandingkannya sebelum memutuskan. Ini klaim yang lebih kecil daripada "kami merutekan transkripsi Anda," dan itulah klaim yang benar.

Yang perlu diperhatikan adalah apakah OpenAI menjawab soal akurasi, bukan konteks. Perusahaan kini telah merilis dua generasi transkripsi dalam setahun dan sekali menurunkan harga; mekanisme konteksnya benar-benar menjadi pembeda, tetapi pada papan yang mengukur transkripsi mentah, saat ini ia berada di belakang SpaceXAI dan Microsoft. Jika GPT Transcribe 2 hadir dengan mekanisme konteks tetap utuh dan tingkat kesalahan diturunkan ke kisaran 2%, perbandingan ini berbalik di sisi batch dalam semalam — dan harga streaming, yang sudah identik, menjadikannya perlombaan yang layak diperhatikan.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari