
Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Dua Jalur, Bukan Dua Pesaing
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Kedua model ini dirilis terpisah lima belas hari dan harganya sama persis sampai ke sen, namun keduanya hampir tidak akan pernah berada dalam keputusan pengadaan yang sama. Grok Voice Transcribe 2.0, yang diluncurkan oleh SpaceXAI pada 18 September 2026, adalah model yang Anda panggil saat audio masih berdatangan — model ini melakukan streaming melalui WebSocket, mengeluarkan hasil sementara kira-kira setiap 500 ms, dan memuncaki papan AA-WER Streaming dari Artificial Analysis dengan tingkat kesalahan kata 2,7% untuk transkrip final dan 3,4% untuk hasil parsial pertama. MAI-Transcribe-2, yang dirilis oleh Microsoft AI pada 3 September 2026, adalah model yang Anda panggil saat audio sudah berupa file — model ini hanya untuk batch, dan pada papan non-streaming Artificial Analysis, model ini adalah model terkelola paling akurat yang diukur pada 2,04% AA-WER, mengungguli Grok Voice Transcribe 2.0 dengan 2,29% dan sekitar 2× lebih cepat dalam throughput. Keduanya memiliki harga daftar $0,10 per jam audio, sekitar $1,67 per 1.000 menit. Jika kebutuhan Anda adalah waktu nyata, tidak ada perbandingan yang perlu dibuat. Jika kebutuhan Anda adalah file, ada.
Garis yang tidak akan ditarik oleh vendor mana pun untuk Anda
Dukungan streaming bukanlah tombol on/off fitur. Grok Voice Transcribe 2.0 menyajikan model yang sama melalui REST untuk file rekaman dan melalui `wss://api.x.ai/v1/stt` untuk audio langsung, sehingga akurasi yang Anda ukur pada arsip Anda adalah akurasi yang Anda dapatkan pada panggilan langsung. MAI-Transcribe-2 tidak memiliki SKU streaming sama sekali: materi peluncuran Microsoft memposisikannya secara eksplisit untuk audio bentuk panjang dan batch, dan meskipun kartu model mencantumkan takarir waktu nyata di antara skenario aplikasinya, jalur menuju hal itu adalah menyegmentasi audio dan memasukkan setiap segmen melalui API batch — yang merupakan pipeline yang Anda bangun dan operasikan, bukan jaminan latensi yang Anda beli. Throughput unggulan Microsoft sekitar 411× waktu nyata adalah angka kecepatan pemrosesan, bukan angka waktu respons, dan keduanya terus-menerus dicampuradukkan dalam liputan tentang rilis ini.
Konsekuensi praktisnya: jika Anda membangun agen suara yang bergiliran bicara, takarir langsung, atau apa pun yang mengharuskan manusia atau model bereaksi terhadap ucapan yang sedang berlangsung, MAI-Transcribe-2 bukan kandidat, seberapa pun bagus akurasinya. Jika Anda mentranskripsikan rapat setelah selesai, rekaman pusat kontak sepanjang malam, arsip media, atau tumpukan pekerjaan kepatuhan, streaming tidak ada gunanya dan angka batch adalah segalanya.
Di mana MAI-Transcribe-2 benar-benar unggul
Akurasi pada file, pertama-tama. Selisih 2,04% versus 2,29% diukur pada perangkat uji independen yang sama — AA-WER v2 milik Artificial Analysis, 50% AA-AgentTalk dan masing-masing 25% VoxPopuli dan Earnings22 — yang menjadikannya fakta paling bersih dalam perbandingan ini. Ini adalah perbedaan 0,25 poin, sekitar dua setengah lebih sedikit kesalahan per seribu kata. Apakah itu penting bergantung pada apa yang Anda lakukan dengan transkrip; untuk arsip yang dapat dicari, tidak, dan untuk catatan hukum atau medis, mungkin.
Throughput, kedua, dan dengan margin yang lebih besar daripada selisih akurasi: 333× waktu nyata dibandingkan 162× milik Grok Voice Transcribe 2.0. Kedua angka tersebut adalah pengukuran Artificial Analysis atas detik audio masukan yang ditranskripsikan per detik, bukan klaim vendor. Pada laju itu, arsip seribu jam selesai dalam sekitar tiga jam komputasi pada model Microsoft dan sekitar enam jam pada model SpaceXAI. Untuk migrasi sekali jalan, itu tidak relevan; untuk pipeline yang menyerap secara terus-menerus, waktu wall-clock yang terpangkas separuh merupakan perbedaan kapasitas yang nyata.
Cakupan bahasa, ketiga. Microsoft menetapkan 60 bahasa dengan deteksi otomatis, peralihan kode di dalam satu rekaman, dan rata-rata tingkat kesalahan kata sebesar 5,2% di antara bahasa-bahasa tersebut pada FLEURS — angka yang dilaporkan vendor, tidak direproduksi secara independen, tetapi setidaknya angka itu menggambarkan kasus multibahasa pada daftar bahasa yang dinyatakan. SpaceXAI mendokumentasikan puluhan bahasa dengan peralihan di tengah rekaman dan pemformatan bentuk tertulis pada 25 bahasa. Jika audio Anda berada di luar himpunan bahasa Inggris dan Eropa utama yang tercakup dengan baik, angka FLEURS lebih informatif daripada papan peringkat yang berbobot bahasa Inggris dan banyak berisi obrolan agen.
Dua perbedaan lain yang penting secara operasional. MAI-Transcribe-2 menawarkan gaya transkripsi yang dapat dikonfigurasi — verbatim, mempertahankan ketidaklancaran, versus bersih, yang menghilangkannya — sementara Grok Voice Transcribe 2.0 menangani masalah yang sama dengan flag penghapusan kata pengisi. Dan model Microsoft berada dalam pratinjau publik di Microsoft Foundry, yang berarti tidak ada SLA dan rekomendasi tetap agar tidak digunakan untuk produksi hingga menjadi GA; model SpaceXAI tersedia secara umum dengan batas laju yang dipublikasikan sebesar 10 permintaan per detik dan 100 sesi streaming bersamaan per tim.

Di mana Grok Voice Transcribe 2.0 benar-benar unggul
• Streaming real-time — endpoint WebSocket dengan hasil sementara setiap ~500 ms, dibandingkan dengan hanya batch tanpa SKU real-time yang diumumkan
• Akurasi transkrip parsial pertama — 3,4% WER pada 0,49 dtk di AA-WER Streaming, kategori yang tidak diikuti oleh MAI-Transcribe-2
• Akurasi batch pada audio agent-talk — 2,29% secara keseluruhan, tetapi pada subset AA-AgentTalk dari papan non-streaming urutannya lebih rapat daripada yang disiratkan angka utamanya, dan pada campuran yang didominasi agen di papan streaming, Grok memimpin secara mutlak
• Infrastruktur agen suara — deteksi akhir giliran Smart Turn dan penghapusan kata pengisi sudah tersedia di dalam model, sementara MAI-Transcribe-2 menyerahkan logika giliran kepada pemanggil
• Audio multisaluran — hingga 8 kanal independen ditranskripsikan dalam satu proses, yang penting untuk rekaman panggilan stereo atau multipihak
• Keyakinan tingkat kata — stempel waktu membawa skor keyakinan per kata, sehingga rentang dengan keyakinan rendah dapat ditandai alih-alih dipercaya secara setara
• Ketentuan ketersediaan — tersedia secara umum dengan batas konkurensi yang dipublikasikan, dibandingkan dengan pratinjau publik tanpa SLA
• Ketahanan harga — $0,10 per jam adalah tarif tetap untuk batch dan dasar untuk tier streaming $0,20, sedangkan $0,10 yang identik dari Microsoft adalah penawaran peluncuran waktu terbatas tanpa tarif standar yang diumumkan untuk 2027
Itulah poin terakhir yang paling sering dilewatkan oleh kebanyakan perbandingan. Kedua model berbiaya sama hari ini, dan salah satu dari harga tersebut memiliki tanggal kedaluwarsa yang tidak dimiliki harga lainnya. Microsoft belum menerbitkan tarif setelah promosi, dan liputan tidak sepakat apakah penawaran ini berlaku hingga akhir 2026 atau sama sekali tidak menyebutkan kapan berakhir. Jika Anda memodelkan anggaran transkripsi tiga tahun berdasarkan $1,67 per 1.000 menit dari Microsoft, Anda memodelkan angka yang belum menjadi komitmen vendor.

Tumpang tindihnya nyata, dan itu mencakup sebagian besar daftar fitur.
Kesampingkan pertanyaan streaming dan kedua produk ini konvergen dengan kuat. Keduanya melakukan diarisasi pembicara. Keduanya mengembalikan stempel waktu tingkat kata. Keduanya menangani normalisasi teks invers — angka, tanggal, mata uang, detail kontak yang ditampilkan dalam bentuk tertulis. Keduanya menerima terminologi domain, Grok Voice Transcribe 2.0 berupa hingga 100 istilah kunci per permintaan dan MAI-Transcribe-2 berupa daftar terminologi domain dan singkatan. Keduanya mendeteksi bahasa secara otomatis dan mengikuti pembicara yang berganti bahasa di tengah rekaman. Keduanya menangani audio teleponi 8 kHz, yang merupakan kasus yang secara diam-diam paling sering gagal ditangani oleh model transkripsi dan yang paling gencar disetel oleh SpaceXAI untuk diatasi — set teleponi internalnya turun dari 10,6% menjadi 7,1% WER antar versi, angka yang dilaporkan perusahaan pada audio perusahaan.
Keduanya juga membawa batas input yang membentuk arsitektur, bukan sekadar anggaran. Grok Voice Transcribe 2.0 menerima file hingga 500 MB di 12 format audio dengan laju sampel dari 8 kHz hingga 48 kHz. Batas MAI-Transcribe-2 ditetapkan oleh jalur Foundry, bukan oleh modelnya, dan tim harus membaca dokumentasi Microsoft sendiri untuk batas atas saat ini daripada mengasumsikan paritas dengan layanan STT khusus.
Konvergensi itu berarti bahwa keputusan ini menyusut menjadi tiga pertanyaan secara berurutan: apakah perlu live, berapa banyak bahasa yang sebenarnya Anda miliki, dan berapa besar kerugian selisih akurasi bagi Anda. Pertanyaan pertama bersifat biner dan langsung mengeliminasi satu opsi. Pertanyaan kedua biasanya dapat dijawab dari sampel audio Anda sendiri. Pertanyaan ketiga cukup kecil sehingga untuk sebagian besar beban kerja berbasis file, ia tidak akan menentukan apa pun — selisih 0,25 poin itu nyata, tetapi demikian pula faktanya bahwa kedua model berada dalam selisih setengah poin dari angka terbaik yang pernah diukur siapa pun.

Apa yang harus dilakukan dengan ini
Anggap keduanya sebagai tumpukan dua jalur, bukan adu langsung. Pusat kontak yang menjalankan bantuan agen langsung dan arsip kepatuhan semalaman tidak sedang memilih antara Grok Voice Transcribe 2.0 dan MAI-Transcribe-2 — ia menjalankan keduanya, dan satu-satunya pertanyaan adalah apakah itu membuatnya menanggung dua hubungan vendor, dua set kredensial, dua faktur, dan dua batas laju. Tidak ada satu pun dari model ini yang ada di katalog OrcaRouter saat ini, jadi panggilan transkripsi itu sendiri diarahkan ke API masing-masing vendor. Yang dicakup satu kunci OrcaRouter adalah semua tahap hilir: perangkum, pengklasifikasi, agen yang menalar atas transkrip, dan tugas evaluasi yang membandingkan keluaran kedua vendor pada rekaman yang sama. Yang terakhir itulah yang membuat ini penting — Anda tidak dapat memutuskan antara model-model ini hanya dari papan peringkat, karena papan peringkat itu berisi delapan jam percakapan agen berbahasa Inggris, sedangkan audio Anda bukan.
Perhatikan dua hal. Pertama, apakah Microsoft menetapkan harga standar untuk MAI-Transcribe-2 saat penawaran peluncuran berakhir; harga permanen $1,67 per 1.000 menit akan menjadikannya pilihan batch default hanya berdasarkan biaya, dan kembalinya ke harga $0,36 per jam milik MAI-Transcribe-1 akan membuat percakapan ini jauh lebih singkat. Kedua, apakah Microsoft merilis SKU streaming. Kartu model sudah menyebut takarir waktu nyata sebagai skenario target, dan satu-satunya hal yang menghalangi MAI-Transcribe-2 masuk ke jalur streaming adalah endpoint — jika itu terwujud, keduanya berhenti menjadi jalur dan mulai menjadi rival.
