
MAI-Transcribe-2 vs Muse Voice Transcribe: Di Pekan yang Sama, Dua Taruhan Berlawanan soal Audio
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
Pekan tanggal 1 September 2026 melahirkan dua model wicara dari dua laboratorium terdepan, dan MAI-Transcribe-2 serta Muse Voice Transcribe paling tepat dipahami sebagai dua jawaban yang berlawanan atas pertanyaan tentang di mana kecerdasan audio seharusnya berada. Muse Voice Transcribe, yang dirilis oleh Meta Superintelligence Labs pada 1 September, adalah model persepsi audio real-time: ia mentranskripsi, memisahkan lebih dari dua puluh pembicara, dan mendeteksi kapan seorang pembicara selesai, semuanya dalam satu lintasan streaming atas potongan-potongan audio langsung berdurasi 80 milidetik, serta menempati peringkat teratas di papan ucapan-ke-teks streaming tempat ia diuji. MAI-Transcribe-2, yang dirilis oleh Microsoft dua hari kemudian, pada 3 September, adalah taruhan yang sebaliknya: mesin batch yang sama sekali tidak mengejar latensi langsung, melainkan mengerahkan segalanya untuk mentranskripsi file rekaman dengan tingkat kesalahan kata terbaik di papan non-streaming independen, kira-kira 411× real time, dengan biaya sekitar $1,67 per 1.000 menit. Membandingkan keduanya secara head-to-head sebagai "model transkripsi" menutupi keputusan sesungguhnya, yang berkisar pada momen dalam kehidupan audio ketika Anda membutuhkan kata-kata: saat audio masih berlangsung, atau setelah audio berakhir.
Dua produk yang ditunjuk pada momen yang berbeda.
Muse Voice Transcribe dibuat untuk momen ketika audio masih berlangsung. Ini adalah model multimodal autoregresif dalam keluarga Muse milik Meta yang menggabungkan tiga tugas dalam satu proses — pengenalan ucapan otomatis, diarisasi pembicara untuk lebih dari dua puluh pembicara, dan endpointing, yaitu deteksi bahwa seorang pembicara telah berhenti berbicara sehingga sistem dapat merespons. Meta melaporkan bahwa transkrip akhirnya tiba sekitar 0,16 detik setelah pembicara berhenti, dengan tingkat kesalahan kata sebesar 3,1% pada transkrip akhir tersebut dan 3,6% pada bagian pertama — angka yang dipublikasikan Meta pada hari peluncuran, mengutip papan peringkat streaming Artificial Analysis, dan yang belum direproduksi secara independen hingga tulisan ini dibuat. Model ini menangani audio lebih dari satu jam dalam satu aliran, mengganti bahasa di tengah kalimat, dan dilatih pada 70+ bahasa dengan 25 bahasa yang diverifikasi secara ekstensif saat peluncuran. Harganya adalah $3,00 per 1.000 menit audio, sekitar $0,18 per jam, melalui Meta Model API. Meta telah mengonfirmasi bahwa bobotnya tidak akan dibuka.
MAI-Transcribe-2 dirancang untuk situasi ketika audio sudah berupa berkas. Model Microsoft ini mencapai 2,0% AA-WER pada papan peringkat non-streaming Artificial Analysis — menempati posisi kedua, dan merupakan angka terbaik di antara API batch terkelola — serta berjalan sekitar 411× waktu nyata, yang merupakan angka throughput, bukan jaminan latensi. Model ini mentranskripsikan dalam 60 bahasa dengan identifikasi bahasa otomatis, mencakup diarisasi pembicara, stempel waktu tingkat kata, pembobotan kata kunci, dan gaya verbatim versus bersih, serta menangani alih kode seperti Hinglish dan Spanglish. Layanan ini tersedia melalui Microsoft Foundry dalam pratinjau publik dan MAI Playground dengan harga $0,10 per jam audio sebagai penawaran peluncuran terbatas hingga akhir tahun, dengan belum ada produk streaming yang diumumkan. Pos peluncuran Microsoft menempatkannya secara eksplisit untuk audio format panjang dan batch — yaitu beban kerja di mana latensi rendah model streaming tidak ada gunanya, tetapi biaya per menitnya tetap terasa.

Mengapa dua angka akurasi itu tidak saling bertentangan
Naluri alami adalah membandingkan 2.0% dengan 3.1% dan menyatakan pemenang, dan itu akan keliru dalam dua hal. Pertama, angka-angka tersebut mengukur tugas yang berbeda: 2.0% milik MAI-Transcribe-2 adalah akurasi non-streaming pada audio yang telah direkam sebelumnya, di mana model dapat melihat seluruh file; 3.1% milik Muse Voice Transcribe adalah akurasi streaming pada transkrip akhir, yang dihasilkan dengan batasan mentranskripsi saat audio tiba. Streaming adalah masalah yang lebih sulit, itulah sebabnya papan peringkat streaming dan papan peringkat non-streaming merupakan papan terpisah dengan skor terpisah. Kedua, label-label tersebut memiliki bobot yang berbeda: angka MAI-Transcribe-2 adalah pengukuran Artificial Analysis terhadap model tersebut, sedangkan angka Muse Voice Transcribe adalah laporan Meta pada hari peluncuran tentang apa yang diukur oleh Artificial Analysis — dilaporkan oleh vendor dan belum direproduksi. Pernyataan yang jujur adalah bahwa kedua model tersebut adalah klaim kredibel di puncak papan masing-masing, dan tak satu pun dari angka-angka itu memberi tahu Anda apa pun tentang jalur lainnya.
Justru pada diarisasi inilah perbandingan sesungguhnya berada, karena fitur ini adalah satu-satunya yang dimiliki kedua produk sekaligus titik di mana ambisi mereka terlihat berbeda. Muse Voice Transcribe memisahkan lebih dari dua puluh pembicara sebagai kapabilitas streaming inti, dengan Meta melaporkan tingkat kesalahan diarisasi pembicara rata-rata sebesar 17,5% dibandingkan rentang pesaing yang dikutipnya sebesar 21,1% hingga 28,6% — sekali lagi, dilaporkan oleh Meta dan belum terverifikasi. MAI-Transcribe-2 juga menyertakan fitur diarisasi, tetapi Microsoft sama sekali tidak memublikasikan batas maksimum pembicara maupun tingkat kesalahan diarisasi. Untuk panggilan dua pihak, kedua produk sama-sama baik dan perbedaannya tidak signifikan. Untuk grup fokus beranggotakan dua belas orang atau rekaman panel, Muse Voice Transcribe adalah satu-satunya dari keduanya yang bahkan mencantumkan batas maksimum multi-pembicara, dan diarisasi MAI-Transcribe-2 yang tidak terukur menjadi alasan terbesar untuk mengujinya sebelum memercayakannya pada audio yang lebih sulit.
Perbandingan harga yang masuk akal
Soal harga, keduanya lebih berdekatan daripada yang disiratkan oleh bingkai batch-versus-streaming, karena $1,67 per 1.000 menit (MAI-Transcribe-2, early-bird) dan $3,00 per 1.000 menit (Muse Voice Transcribe) sama-sama berada di sisi murah dari speech terkelola. Perbandingan hanya masuk akal dalam jalur yang sama. Untuk transkripsi batch pada file pra-rekaman, MAI-Transcribe-2 harganya kurang dari setengah harga model berbasis streaming sekaligus memiliki WER non-streaming yang lebih baik — tetapi Anda hanya akan mengarahkan file rekaman ke Muse Voice Transcribe jika secara khusus menginginkan pipeline streaming-nya, yang bukan cara efisien untuk memproses arsip. Untuk audio rapat langsung, Muse Voice Transcribe adalah satu-satunya produk dalam artikel ini yang benar-benar berfungsi, dan tarif $3,00-nya memangkas harga API transkripsi real-time lain yang menjadi pesaingnya saat diluncurkan — Gemini 3.5 Transcribe Live sekitar $9 per 1.000 menit, GPT Live Transcribe $17 — sekaligus menambahkan diarisasi lebih dari dua puluh pembicara yang tidak dapat ditandingi produk-produk tersebut. Kesimpulan harga yang jujur adalah Meta menetapkan harga streaming rendah dan Microsoft menetapkan harga batch lebih rendah lagi, dan kedua angka tersebut adalah harga era promosi yang akan bergeser begitu masing-masing vendor mengumumkan tarif standarnya.

Yang mana untuk audio yang mana
Jika audio Anda bersifat langsung — rapat yang ditranskripsikan secara real time, agen suara, teks langsung, apa pun yang membutuhkan kata-kata saat sedang diucapkan — Muse Voice Transcribe adalah pilihannya, dan itu bukan pilihan yang dekat. Ini satu-satunya model streaming di sini, ia memisahkan lebih dari dua puluh pembicara dalam satu proses yang sama, dan harganya memang dirancang untuk memenangkan jalur itu sejak hari pertama. Kelemahannya adalah hal-hal yang perlu dibawa ke uji coba: angka akurasi dan diarisasi dilaporkan oleh Meta, dan model streaming yang baru berumur satu minggu belum menunjukkan bagaimana perilakunya pada audio yang berantakan yang berada di luar tolok ukur peluncuran.
Jika audio Anda sudah berupa file — arsip, rekaman panggilan, pustaka media, atau apa pun yang diproses secara massal — MAI-Transcribe-2 adalah pilihan yang lebih baik dalam setiap aspek yang penting: WER terukur yang lebih rendah, throughput yang kira-kira satu orde magnitudo lebih tinggi, dan harga per 1.000 menit di bawah harga model streaming. Risikonya adalah kebalikan dari Muse: baru berumur empat hari, tidak ada SKU streaming, kualitas diarisasi belum terukur, serta tarif khusus pendaftar awal dengan harga standar yang tidak diungkapkan di baliknya.
Halaman peluncuran Microsoft yang memperkenalkan MAI-Transcribe-2 mencantumkan fitur-fitur yang dibundel Microsoft—yang tidak ditawarkan pesaing streaming tersebut secara sekaligus—dan halaman itulah dokumen yang perlu Anda periksa ketika memutuskan klaim mana yang merupakan cakupan produk yang sebenarnya dan mana yang masih berupa janji benchmark.

Dan jika transkrip hanyalah separuh pertama dari pipeline Anda, pilihan di antara keduanya tidak sepenting pilihan yang Anda buat di atasnya. Audio rapat langsung yang ditranskripsikan oleh Muse Voice Transcribe masih memerlukan peringkasan, ekstraksi butir tindakan, dan penyusunan tindak lanjut sebelum menjadi berguna; panggilan arsip yang ditranskripsikan oleh MAI-Transcribe-2 masih perlu dicari, direaksi, atau dirutekan ke sistem hilir yang tepat. Di lapisan itulah platform multi-model membuktikan nilainya — API tunggal OrcaRouter untuk 200+ model, dengan harga daftar penyedia diteruskan pada markup 0%, memungkinkan pekerjaan hilir tersebut memanggil model berbeda untuk setiap beban kerja melalui satu integrasi, sehingga model ucapan mana pun yang memenangkan uji coba Anda, tumpukan di atas transkrip tidak perlu dibangun ulang untuk berpindah. Baik Muse Voice Transcribe maupun MAI-Transcribe-2 saat ini tidak ada dalam daftar itu; keduanya berjalan di API vendor masing-masing. Taruhan yang sesungguhnya diputuskan minggu ini lebih sempit dan lebih berguna: transkripsi real-time dan batch baru saja menjadi cukup murah sehingga pembedanya bukan lagi kata-katanya — melainkan apa yang Anda lakukan dengan kata-kata tersebut.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
