
Grok Voice Transcribe 2.0 Merebut Posisi #1 dalam Akurasi Streaming dengan Harga yang Tidak Berubah
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 adalah model speech-to-text yang dirilis SpaceXAI pada 18 September 2026, dan satu angka yang penting tentangnya bukanlah angka yang dijadikan andalan dalam pos peluncurannya. Angka itu adalah ini: transkrip parsial pertama — teks yang benar-benar dapat ditindaklanjuti oleh agen suara saat penelepon masih berbicara — turun dari tingkat kesalahan kata 18,3% pada Grok Voice Transcribe 1.0 menjadi 3,4%. Itu adalah pengukuran pada papan AA-WER Streaming milik Artificial Analysis, tempat model baru ini kini berada di peringkat pertama pada peringkat Final Transcript (WER 2,7%, 0,49 detik setelah akhir ucapan) dan peringkat First Partial Transcript (3,4%, 0,49 detik). Akurasi transkrip final juga meningkat, dari 3,9% menjadi 2,7%, yang nyata tetapi moderat. Lompatan pada transkrip parsial adalah yang mengubah apa yang dapat Anda bangun.
Apa yang sebenarnya berubah antara 1.0 dan 2.0
Kedua versi tersebut adalah produk yang sama di API yang sama, dan SpaceXAI tidak membuat perubahan pada antarmuka: Grok Voice Transcribe 2.0 dipilih dengan meneruskan grok-voice-transcribe-2.0 ke /v1/stt alih-alih grok-voice-transcribe-1.0, atau dengan memilihnya saat koneksi WebSocket dibuat untuk streaming. Integrasi yang ada yang menghilangkan parameter model akan terus mendapatkan 1.0 sampai SpaceXAI mengubah default, yang menurut perusahaan akan terjadi dalam beberapa minggu mendatang bersamaan dengan penghentian versi lama. Sampai saat itu, 2.0 bersifat opt-in dan 1.0 dapat dipatok secara sengaja, yang merupakan bentuk yang tepat untuk perubahan seperti ini: Anda dapat melakukan A/B pada audio Anda sendiri sebelum versi tersebut menjadi default produksi Anda, entah Anda memintanya atau tidak.
Angka-angka Artificial Analysis, jika dibaca berdampingan, mengungkap cerita yang lebih spesifik daripada "dua kali lebih akurat":
• Akurasi transkrip akhir — Grok Voice Transcribe 2.0 pada 2,7% WER vs Grok Voice Transcribe 1.0 pada 3,9% di AA-WER Streaming, keduanya diukur setelah akhir ucapan
• Akurasi transkrip parsial pertama — 3,4% WER vs 18,3%, selisih tunggal terbesar antara kedua versi
• Waktu hingga transkrip akhir — 0,49 dtk vs 0,37 dtk, jadi model baru lebih lambat dalam menetapkan hasil dibandingkan model yang digantikannya
• Waktu ke parsial pertama — 0,49 dtk vs 0,25 dtk, juga lebih lambat
• Akurasi Batch (non-streaming) — 2,3% AA-WER pada papan non-streaming Artificial Analysis, dibandingkan dengan 4,07% untuk Whisper Large v3 dan 3,31% untuk GPT Transcribe
• Throughput batch — sekitar 162× waktu nyata pada board yang sama, berada di bawah 333× milik MAI-Transcribe-2 dan di atas 88× milik Gemini 3.5 Transcribe
Baris keempat dan kelima itu adalah catatan jujur dalam rilis ini. SpaceXAI menukar latensi demi akurasi. Model baru ini sekitar sepertiga detik lebih lambat dalam mengembalikan parsial pertamanya dan transkrip akhirnya dibandingkan 1.0. Di papan peringkat tempat Deepgram Flux mengembalikan parsial dalam 0,02 detik dan Soniox v5 dalam 0,05 detik, Grok Voice Transcribe 2.0 sama sekali tidak bersaing soal kecepatan — ia bersaing soal ketepatan, dan ia memenangkan pertukaran itu dengan selisih yang lebar. Apakah itu pertukaran yang tepat sepenuhnya bergantung pada apakah aplikasi Anda adalah agen suara langsung yang perlu mulai berbicara balik, atau pipeline transkripsi yang setengah detiknya tidak terlihat.

Klaim "dua kali lebih akurat", diperiksa
Judul utama SpaceXAI adalah bahwa 2.0 dua kali lebih akurat daripada 1.0 dengan harga yang sama, dan tabel evaluasinya sendiri mendukung hal itu pada kumpulan data yang dipilihnya. Pada panggilan dukungan pelanggan berbahasa Inggris 8 kHz, tingkat kesalahan kata turun dari 10,6% menjadi 7,1%. Pada percakapan dengan Grok, dari 8,7% menjadi 3,3%. Pada kredensial yang diucapkan — kode akun, nomor telepon, alamat email — dari 7,2% menjadi 3,2%. Pada perintah pendek dalam 19 bahasa, dari 20,6% menjadi 6,8%, pengurangan kesalahan sekitar dua pertiga. Keempat kumpulan itu diambil dari lalu lintas produksi SpaceXAI dan perbandingannya adalah milik SpaceXAI sendiri; tidak ada pihak di luar perusahaan yang mereproduksinya. Anggap tabel itu sebagai peta di mana model disetel, bukan sebagai jaminan akurasi secara umum.
Hasil Artificial Analysis adalah bagian yang tidak dilaporkan vendor: sebuah harness independen yang dijalankan terhadap sekitar delapan jam audio dengan bobot 50% untuk set privat AA-AgentTalk dan masing-masing 25% untuk VoxPopuli dan Earnings22. Ini mendukung klaim yang lebih sempit namun lebih berguna daripada "dua kali lebih akurat" — bahwa pada campuran spesifik tersebut, model ini adalah transcriber streaming paling akurat yang terukur. Satu hal yang perlu disebut: unggahan SpaceXAI menggambarkan peringkat pertama "di antara 32 model streaming," sementara halaman papan peringkat itu sendiri menampilkan 27 dari 33 model. Peringkatnya nyata; jumlah peserta dalam materi pemasaran itu adalah hitungan perusahaan, bukan hitungan papan peringkat.
Ada baiknya juga bersikap tepat tentang apa yang dicakup dan tidak dicakup oleh posisi pertama di AA-WER Streaming. Papan peringkat ini berbobot bahasa Inggris dan banyak berisi pembicaraan agen. Papan ini tidak mengukur aksen Anda, codec Anda, kosakata domain Anda, atau audio pusat panggilan delapan kanal Anda. Model yang menduduki peringkat teratas masih bisa kalah telak pada rekaman Anda, dan itulah tepatnya mengapa jendela opt-in itu penting.

Harga tidak berubah, dan itu adalah fakta terbesar kedua di sini
Grok Voice Transcribe 2.0 biayanya sama dengan 1.0: $0,10 per jam audio untuk batch dan file rekaman melalui endpoint REST, $0,20 per jam audio untuk streaming melalui WebSocket. Di papan harga Artificial Analysis, SKU streaming tercatat sebesar $3,33 per 1.000 menit dan SKU batch sebesar $1,67 — tarif batch yang sama dengan yang dikenakan Microsoft untuk MAI-Transcribe-2, dan sekitar sepertiga dari biaya ElevenLabs Scribe v2 Realtime per menit streaming.
Diarisasi, stempel waktu tingkat kata dengan skor keyakinan, dan pembobotan istilah kunci semuanya disertakan pada tarif tersebut alih-alih diukur secara terpisah, yang tidak universal di pasar ini. Gemini 3.5 Transcribe Live menagih per token baik pada input audio maupun output teks, sehingga biaya Anda bergerak sesuai seberapa banyak yang dikatakan model, bukan hanya berapa lama audio berjalan. Tarif tetap per jam lebih mudah diperkirakan dan lebih mudah dibandingkan antar vendor — dan karena OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, perubahan dari sisi vendor pada tarif tersebut akan muncul di sisi kami pada hari yang sama alih-alih setelah siklus penetapan harga ulang.
Apa yang sebenarnya API berikan kepada Anda
Daftar kemampuannya luas dan sebagian besar merupakan warisan, bukan hal baru, yang perlu Anda ketahui jika menilai peningkatan ini hanya dari fiturnya:
• Batch dan streaming dalam satu model — REST untuk file rekaman hingga 500 MB, WebSocket di wss://api.x.ai/v1/stt dengan hasil sementara yang dikeluarkan kira-kira setiap 500 ms
• Diarisasi pembicara disertakan, ditambah transkripsi multikanal hingga 8 kanal independen
• Stempel waktu tingkat kata yang membawa skor keyakinan, sehingga Anda dapat menetapkan ambang batas pada rentang berkeyakinan rendah alih-alih mempercayai seluruh transkrip secara setara
• Pembobotan istilah kunci hingga 100 istilah domain per permintaan, masing-masing hingga 50 karakter
• Normalisasi teks invers untuk angka, tanggal, mata uang, nomor telepon, dan alamat email, dengan pemformatan bentuk tertulis yang didukung di 25 bahasa
• Penghapusan kata pengisi dan deteksi akhir giliran Smart Turn yang ditujukan tepat sasaran untuk agen suara
• Deteksi bahasa otomatis dengan pengalihan bahasa di tengah perekaman dalam satu proses, untuk 12 format audio dan laju sampel dari 8 kHz hingga 48 kHz
• Batas layanan 10 permintaan per detik pada REST dan streaming, serta 100 sesi streaming bersamaan per tim, dihosting di us-east-1
Catatan produksi yang tidak ada dalam daftar fitur: layanan ini berjalan di satu wilayah. Jika audio Anda berasal dari luar Amerika Serikat, segmen jaringan kini menjadi bagian dari anggaran latensi Anda, dan AA-WER Streaming secara eksplisit memasukkan penundaan jaringan ke dalam pengukuran waktunya. SpaceXAI menawarkan ketentuan tanpa retensi data dan menyebut SOC 2 Type II, BAAs, serta opsi residensi data UE, jadi cerita kepatuhannya lebih berkembang daripada cerita geografisnya.

Siapa yang harus bergerak, dan apa yang perlu diperhatikan
Jika Anda sudah menggunakan Grok Voice Transcribe 1.0 dan aplikasi Anda bertindak berdasarkan transkrip parsial — deteksi giliran, barge-in, respons agen langsung — selisih akurasi parsial dari 18,3% ke 3,4% cukup besar sehingga menguji 2.0 bukanlah pilihan. Angka itu yang berubah dari "biasanya salah" menjadi "biasanya benar" adalah perbedaan antara transkrip parsial yang bisa Anda rutekan dan yang hanya bisa Anda tampilkan. Jika aplikasi Anda menunggu transkrip final pada file rekaman, peningkatannya nyata tetapi lebih kecil, dan tambahan latensi commit 0,12 detik adalah harganya.
Jika Anda sama sekali menggunakan vendor yang berbeda, alasan untuk melihat rilis ini bukanlah peringkat papan peringkat — melainkan bahwa sebuah lab terdepan baru saja meningkatkan model transkripsinya dengan selisih yang besar tanpa menaikkan harga, itulah gambaran pasar ketika akurasi tidak lagi menjadi hal yang Anda kenakan biayanya. Jalur upgrade-nya juga jenis yang paling murah: satu parameter, tanpa perubahan kode, tanpa kontrak baru, dan pin tersedia jika terjadi masalah.
Yang perlu diperhatikan berikutnya adalah peralihan default. Ketika SpaceXAI menjadikan 2.0 sebagai default dan mulai mendeprekasi 1.0, setiap integrasi yang tidak pernah meneruskan parameter model akan langsung berpindah ke model baru, termasuk perubahan latensi. Tim yang bergantung pada timing parsial 0,25 detik yang lama sebaiknya pin sekarang daripada menemukan perubahan itu di produksi. Hal kedua yang perlu diperhatikan adalah reproduksi independen: entri Artificial Analysis adalah pengukuran nyata, tetapi itu hanya satu papan pada satu campuran audio, dan belum ada pihak ketiga yang menerbitkan pengujian 1.0-versus-2.0 yang setara pada audio produksi.
