Kartu hero artikel bertuliskan 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC' dengan lencana 'PERBANDINGAN MODEL' dan subjudul 'throughput terhadap latensi', dengan chip bertuliskan 12.600 RTFx, WER streaming 2,7%, 470M parameter, dan $0,20 per jam streaming, di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC: 12.600× Waktu Nyata Bertemu Setengah Detik

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Granite Speech 5.0 470M TurboCTC mentranskripsikan sekitar 3,5 jam audio setiap detik pada satu H200, dan Grok Voice Transcribe 2.0 mengembalikan transkrip parsial pertama 0,49 detik setelah Anda berhenti berbicara. Kedua angka itu ditempatkan berdampingan dalam postingan perbandingan seolah-olah keduanya adalah jenis pengukuran yang sama, padahal keduanya sama sekali bukan jenis pengukuran yang sama — yang satu adalah angka throughput pusat data secara batch tanpa latensi yang disertakan, yang lain adalah angka latensi pada model yang throughput-nya belum dipublikasikan oleh siapa pun. IBM merilis Granite Speech 5.0 470M TurboCTC pada 25 Agustus 2026 di bawah Apache 2.0, sama sekali menghilangkan dekoder model bahasa dan melakukan dekode dengan satu pass CTC non-autoregresif. SpaceXAI merilis Grok Voice Transcribe 2.0 pada 18 September 2026 sebagai API terkelola dengan harga $0.10 per jam audio untuk batch dan $0.20 per jam untuk streaming. Keduanya adalah model transkripsi yang sangat baik yang menyelesaikan dua separuh berlawanan dari masalah yang sama, dan memilih di antara keduanya menjadi lebih mudah setelah Anda berhenti membandingkan angkanya secara langsung.

12,600× waktu nyata, dan kata-kata yang memodifikasinya

Angka Granite adalah 12.600 RTFx yang diukur pada satu NVIDIA H200 dengan inferensi batch — angka IBM, dilaporkan saat peluncuran dan belum direproduksi secara independen sejak saat itu. RTFx adalah rasio durasi audio terhadap waktu pemrosesan, jadi 12.600 berarti sekitar 3,5 jam audio per detik waktu nyata. Kerangka IBM sendiri adalah bahwa ini lebih dari 20 kali throughput rilis Granite Speech sebelumnya, dan itulah klaim yang benar-benar penting di sini: percepatan itu berasal dari menghilangkan pekerjaan, bukan dari menambah perangkat keras.

Yang bukan merupakan hal itu adalah angka latensi. Pekerjaan yang dibatch dan menyelesaikan 3,5 jam audio per detik tetap bisa butuh waktu lama untuk mengembalikan token pertama dari file individual mana pun, tergantung pada bagaimana batch disusun dan berapa banyak audio yang Anda masukkan sebelum proses dimulai. IBM sama sekali tidak menerbitkan angka latensi untuk TurboCTC. Di papan peringkat far-field, kedua checkpoint tersebut adalah dua entri tercepat, tetapi throughput di sana diukur pada satu NVIDIA L4, yang merupakan akselerator yang dekat dengan pusat data dan bukan ponsel.

Alasannya penting adalah bahwa model ini secara eksplisit diposisikan untuk laptop, ponsel, dan perangkat edge — sebagaimana dibingkai IBM sendiri — dan belum ada yang menerbitkan performa single-stream pada salah satu perangkat tersebut. Sampai ada yang melakukannya, anggap "12.600×" sebagai pernyataan tentang seberapa murah Anda dapat menuntaskan backfill di GPU sewaan, yang merupakan klaim yang benar-benar bernilai dan didukung bukti dengan baik, dan bukan sebagai pernyataan tentang seberapa cepat satu pengguna menerima balasan satu kalimat.

Apa yang dihapus IBM, dan apa dampaknya bagi Anda

TurboCTC adalah desain yang hanya berbasis encoder: encoder akustik Conformer 16 lapis yang dilatih dengan CTC, didekode secara greedy dalam satu lintasan non-autoregresif, dengan lapisan keluaran subkata berukuran 16.384 unit. Tidak ada model bahasa dalam prosesnya. Dari situlah kecepatannya berasal dan dari situ pula pengurangan kemampuannya berasal, dan pengurangan itu tidak kecil. Dibandingkan dengan model Granite Speech sebelumnya, TurboCTC menghilangkan terjemahan ucapan, menghilangkan pembobotan kata kunci, dan tidak menyertakan perkakas stempel waktu atau tanda baca.

Bandingkan itu dengan apa yang disertakan model terkelola pada harga daftarnya, dan bentuk transaksinya menjadi konkret:

• Pembobotan istilah kunci — Granite Speech 5.0 470M TurboCTC tidak memilikinya, sedangkan Grok Voice Transcribe 2.0 mendukung hingga 100 istilah kunci per permintaan

• Stempel waktu tingkat kata — tidak disertakan dengan TurboCTC vs disertakan dengan skor keyakinan

• Terjemahan ucapan — tersedia di model Granite Speech sebelumnya, dihapus di sini vs tidak ditawarkan sama sekali

• Cakupan bahasa — hanya bahasa Inggris vs deteksi otomatis di seluruh kumpulan input yang sangat multibahasa dengan dukungan pemformatan dalam 25 bahasa

• Diarisasi — masalah terpisah yang Anda selesaikan sendiri vs termasuk dalam harga yang diminta

• Saluran — satu stream per proses vs hingga delapan saluran audio dalam satu permintaan

• Normalisasi teks — tidak ada vs normalisasi teks invers yang mengubah tanggal, mata uang, dan nomor telepon yang diucapkan menjadi bentuk tertulis

• Penyebaran — bobot yang Anda unduh dan jalankan vs endpoint terkelola di us-east-1

Bacalah daftar itu sebagai deskripsi dua produk yang berbeda, bukan sebagai kartu skor. Menghilangkan diarisasi, pembiasan, dan normalisasi itulah yang membuat throughput bisa diperoleh. Backfill batch berisi 40.000 rekaman panggilan ke dalam indeks pencarian tidak memerlukan stempel waktu atau giliran pembicara — yang dibutuhkannya adalah murah dan harus selesai — dan untuk pekerjaan itu, fitur yang hilang bukanlah hilang, melainkan bobot yang dihapus.

Kebalikannya berlaku untuk apa pun yang live. Jika Anda membangun agen suara, daftar istilah kunci adalah cara Anda membuat "Kubernetes" dan "Granola" serta nama pelanggan dieja dengan benar, dan transkriber tanpa mekanisme biasing akan selalu salah menuliskannya tanpa cara untuk memperbaikinya selain fine-tuning, yang merupakan proyek berbeda dengan anggaran berbeda. Satu fitur yang hilang itu mendiskualifikasi TurboCTC dari sebagian workload dan tidak relevan bagi yang lain, itulah sebabnya perbandingan model kurang berguna daripada perbandingan workload.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

Perbandingan akurasi yang tidak dapat dilakukan secara bersih

IBM melaporkan tingkat kesalahan kata agregat 5,00% untuk checkpoint Apache 2.0 dan 4,85% untuk versi non-komersialnya di Open ASR Leaderboard, pada set bentuk pendek bahasa Inggris publik. Itu adalah angka batch pada papan yang evaluasinya mencakup AMI dan Earnings22 serta set percakapan bentuk panjang, dan itu dilaporkan vendor — dijalankan melalui perkakas leaderboard tetapi belum diserap ke dalam tabel resmi, yang juga mencakup set uji privat. Rincian per-set yang dipublikasikan pada kartu model layak dibaca, karena rata-ratanya menyembunyikan banyak hal: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% dan Gigaspeech-Cleaned 8,67%, dengan rata-rata tepat 5,00%. Kartu yang sama mencantumkan RTFx rata-rata 13.042,98 yang diukur pada satu H200 — lebih tinggi daripada angka 12.600 yang digunakan dalam postingan peluncuran IBM, dan kedua angka itu sama-sama milik perusahaan, dari minggu yang sama, pada perangkat keras yang sama.

Angka transkrip akhir 2,7% dari Grok Voice Transcribe 2.0 bukanlah pengukuran yang sebanding. Angka itu berasal dari papan AA-WER Streaming milik Artificial Analysis, sebuah komposit berbobot dari AA-AgentTalk sebesar 50%, VoxPopuli 25%, dan Earnings22 25% — sekitar delapan jam audio percakapan bahasa Inggris yang diberi bobot agen, diukur melalui antarmuka streaming. Kumpulan berbeda, pembobotan berbeda, mode operasi berbeda. Menempatkan 2,7% di samping 5,00% dan menyimpulkan bahwa model terkelola kira-kira dua kali lebih akurat adalah kesalahan paling umum yang mungkin terjadi dalam perbandingan ini.

Apa yang dapat dikatakan secara jujur memang lebih sempit, tetapi tetap berguna. Kedua model sama-sama unggul pada audio yang menjadi dasar pengukurannya masing-masing. Grok Voice Transcribe 2.0 memimpin papan peringkat streaming yang dijalankan secara independen, yang juga menjadi tempat model lain diukur, sehingga peringkatnya dapat diperiksa meskipun nilai persisnya tidak dapat dibawa ke konteks lain. Granite Speech 5.0 470M TurboCTC memiliki WER agregat pada kumpulan data ASR terbuka standar dan, secara terpisah, hasil far-field dengan checkpoint non-komersial berada di peringkat kelima untuk akurasi dan checkpoint Apache di peringkat kesembilan — diukur pada ucapan berisik dan bergema, yang merupakan kondisi tersulit dalam kumpulan data tersebut dan bisa dibilang hal paling jujur dalam angka kedua model.

Jika audio Anda adalah ucapan bahasa Inggris yang bersih dan dibacakan, kesenjangan akurasi antara keduanya kemungkinan lebih kecil daripada yang disiratkan oleh posisi papan peringkat. Jika audio Anda berisik, beraksen, melalui telepon, atau bukan bahasa Inggris, tidak ada papan yang memberi tahu Anda banyak, dan set pengujian Anda sendiri adalah satu-satunya instrumen yang mampu melakukannya.

Beban bebas vs. $1,67 per jam

Perbandingan biaya adalah satu-satunya tempat di mana kedua model ini benar-benar mudah dibedakan, dan angka yang biasanya dikutip orang salah di kedua arah.

• Transkripsi batch — Grok Voice Transcribe 2.0 dengan $0,10 per jam audio, atau sekitar $1,67 per 1.000 menit vs Granite Speech 5.0 470M TurboCTC tanpa biaya lisensi, ditambah waktu GPU

• Streaming — $0,20 per jam audio, sekitar $3,33 per 1.000 menit vs tidak ada jalur streaming terhosting yang diterbitkan oleh IBM

• Lisensi — API komersial tanpa bobot vs Apache 2.0 untuk checkpoint utama dan CC-BY-NC-SA-4.0 untuk versi nonkomersial yang lebih akurat

Kata "Free" memainkan peran besar di baris pertama itu. Model encoder-only 470M cukup kecil untuk dijalankan di perangkat keras sederhana — itulah inti desainnya, dan alasan IBM melatihnya dalam sepuluh hari di delapan H100 dan merilisnya untuk `transformers>=5.16.0` dengan demo WebGPU — tetapi tetap ada pihak yang membayar GPU, stack penyajian, autoscaling, percobaan ulang, dan rotasi on-call. Pada volume kecil, harga terkelola biasanya lebih murah daripada waktu rekayasa. Pada volume stabil yang besar, jalur perangkat keras sewaan menang, dan titik peralihannya adalah fungsi dari utilisasi Anda, bukan volume audio Anda: GPU yang terus Anda sibukkan itu murah per jam, sedangkan GPU yang Anda biarkan tetap siap untuk lalu lintas puncak tidak.

Satu detail lisensi perlu diperhatikan sebelum siapa pun merancang arsitektur berdasarkan hal itu. Checkpoint yang lebih akurat di antara kedua checkpoint tersebut, yakni yang pada 4,85% WER, adalah checkpoint nonkomersial di bawah CC-BY-NC-SA-4.0. Checkpoint Apache 2.0 adalah yang 5,00%, dan itulah yang boleh Anda sertakan dalam sebuah produk. Itu adalah selisih akurasi 0,15 poin yang ditukar dengan hak untuk menggunakan model tersebut sama sekali, dan itu juga berarti setiap perbandingan yang mengutip 4,85% untuk "Granite Speech 5.0" lalu membahas deployment komersial sedang mengutip checkpoint yang salah.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

Aturan keputusan

Tiga pertanyaan membedakan kedua model ini lebih cepat daripada tabel tolok ukur mana pun.

Apakah transkrip dikonsumsi secara live, saat pembicara masih berbicara? Jika ya, TurboCTC bukan kandidatnya — bukan karena lambat, tetapi karena tidak memiliki antarmuka streaming dan tidak ada keluaran parsial, dan transkrip parsial adalah komitmen arsitektural yang berbeda dari dekode batch yang cepat. Jika tidak, keunggulan throughput menjadi inti persoalannya dan model IBM sangat sulit dikalahkan dalam hal biaya per jam audio yang diproses.

Apakah pekerjaan ini memerlukan kosakata domain? Jika ya, model dengan biasing menang secara default, dan tidak adanya key-term biasing di TurboCTC adalah hal yang mendiskualifikasi, bukan sekadar merepotkan. Jika tidak, Anda membayar untuk fitur yang tidak akan Anda gunakan di sisi terkelola.

Apakah audio tersebut berupa tuturan bahasa Inggris yang dibacakan pada perangkat keras yang memadai? Jika ya, keduanya kuat dan pilihannya bergantung pada aspek operasional. Jika tidak, kedua board tidak informatif dan hanya evaluasi Anda sendiri yang menentukan.

Apa pun hasilnya, lapisan operasional adalah tempat keputusan ini menjadi murah. OrcaRouter menempatkan 200+ model di balik satu kunci yang kompatibel dengan OpenAI dengan failover otomatis antar penyedia, sehingga endpoint ucapan terkelola satu wilayah yang sedang bermasalah tidak lagi menjadi gangguan Anda, dan harga daftar penyedia diteruskan dengan markup 0% — yang berarti perubahan harga vendor atau checkpoint baru aktif di sisi kami pada hari yang sama. Untuk beban kerja yang jawaban tepatnya benar-benar tidak jelas, ini menghilangkan biaya karena salah: benchmark keduanya terhadap audio Anda sendiri di balik satu endpoint, pertahankan yang menang, dan ubah string model saat model berikutnya dirilis.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

Versi singkatnya: Granite Speech 5.0 470M TurboCTC adalah jawaban yang lebih baik untuk "transkripsikan semua yang pernah kami rekam, dengan murah, pada perangkat keras yang kami kendalikan," dan Grok Voice Transcribe 2.0 adalah jawaban yang lebih baik untuk "transkripsikan ini saat terjadi, secara akurat, tanpa kami menjalankan stack penyajian." Angka utama 12.600× dan angka utama 0,49 detik keduanya benar dan tidak satu pun menjadi bukti tentang yang lain.