
MAI-Transcribe-2 Is Live: Tawaran Microsoft seharga $0,10 per Jam untuk Menguasai Speech-to-Text
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 adalah model yang dipertaruhkan Microsoft AI untuk mengubah speech-to-text menjadi komoditas, bukan fitur premium, dan angka-angka yang dirilis bersamanya dirancang untuk memperkuat argumen tersebut. Dirilis pada 3 September 2026 dalam pratinjau publik di Microsoft Foundry, MAI Playground, dan permukaan API milik Microsoft sendiri, MAI-Transcribe-2 adalah model speech ketiga Microsoft dalam lima bulan—setelah MAI-Transcribe-1 pada April seharga $0,36 per jam audio dan MAI-Transcribe-1.5 pada Juni—serta model pertama yang mengungguli setiap pesaing terkelola yang disebutnya pada dua metrik yang benar-benar menjadi pertimbangan tim. Pada papan peringkat word-error-rate non-streaming milik Artificial Analysis, posisinya berada di 2,0% AA-WER, di urutan kedua, dan pada sekitar 411× real time, juga kedua, yang bersama-sama menempatkannya pada frontier Pareto akurasi-kecepatan: di papan tersebut, tidak ada model yang lebih akurat sekaligus lebih cepat. Harga peluncurannya memangkas sekitar 72% dibandingkan pendahulunya.
Model pengenalan suara "tercepat, paling akurat, dan termurah di dunia" adalah judul yang dibuat Microsoft sendiri untuk perilisan tersebut, dan judul itu perlu dibaca dengan tanda bintang yang melekat pada materi sumbernya. Inilah kisah perilisan sebagaimana yang sebenarnya terjadi, dengan klaim-klaim vendor yang diberi label dan bagian-bagian yang masih memerlukan pembuktian yang dipisahkan dengan jelas.
Apa yang sebenarnya dirilis Microsoft
MAI-Transcribe-2 adalah model transkripsi batch untuk audio yang telah direkam, yang dirancang khusus untuk audio berdurasi panjang — rapat, panggilan, arsip media, rekaman pusat kontak. Microsoft memposisikannya untuk beban kerja yang mengutamakan throughput dan biaya per menit. Model ini mentranskripsi dalam 60 bahasa dengan identifikasi bahasa otomatis, mencakup diarisasi pembicara yang menghubungkan kata-kata kepada orang yang tepat, mengembalikan stempel waktu tingkat kata, dan mendukung pembobotan kata kunci untuk nama, singkatan, dan terminologi domain. Dua gaya transkripsi yang dapat dikonfigurasi mencakup pembagian yang umum: "verbatim," yang mempertahankan kata pengisi dan permulaan yang salah untuk transkrip tingkat kepatuhan, dan "clean," yang menghilangkan disfluensi untuk teks takarir dan catatan. Microsoft juga menyoroti alih kode dalam ucapan bahasa campuran seperti Hinglish dan Spanglish, serta ketahanan dalam audio dunia nyata yang bising.

Narasi ketersediaan sama pentingnya dengan daftar fitur. Microsoft tidak mengunci ini di balik stack ucapan enterprise-nya: model ini dapat langsung didemokan hari ini dari MAI Playground dan disajikan melalui Microsoft Foundry dalam pratinjau publik, dengan dokumentasi Foundry berada di bawah layanan Azure AI Speech. Ini adalah pilihan distribusi yang disengaja — menempatkan model frontier di tempat pengembang dapat mengaksesnya cukup dengan sebuah kunci API, bukan di tempat siklus penjualan enterprise harus menyetujuinya lebih dulu. Microsoft belum memublikasikan bobot model, dan tidak ada apa pun dalam materi peluncuran yang mengindikasikan bahwa mereka akan melakukannya.
Membaca judulnya secara harfiah
"Tercepat, paling akurat, dan termurah di dunia" adalah tiga klaim dengan kekuatan yang berbeda, dan unggahan peluncurannya sendiri secara diam-diam menurunkan dua di antaranya. Versi jujur dari masing-masing:
• Akurasi — Di papan peringkat Artificial Analysis, MAI-Transcribe-2 menempati peringkat kedua dengan AA-WER 2,0%, bukan pertama; teks utama Microsoft sendiri menyebutkan kedua. Ungkapan "paling akurat" hanya bertahan jika Anda membacanya sebagai "di antara API batch terkelola yang melacak pada tingkat ini," dan itupun itu adalah klaim tentang model yang baru berumur empat hari, bukan gelar yang sudah mapan. Microsoft secara terpisah melaporkan bahwa model tersebut menempati peringkat pertama pada tolok ukur multibahasa FLEURS dengan rata-rata WER 5,2% di 60 bahasanya — angka itu berasal dari posting peluncuran Microsoft, belum diturunkan ulang secara independen per bahasa.
• Kecepatan — Menurut Artificial Analysis, MAI-Transcribe-2 bekerja pada kecepatan sekitar 411× real time, menempati posisi kedua di papan peringkat tersebut. Anehnya, Microsoft tidak pernah mencantumkan angka absolut dalam pengumumannya sendiri; mereka justru mengedepankan pengali relatif yang lebih ramah — “pemrosesan hingga 10× lebih cepat daripada pesaing terkemuka, terutama untuk audio berdurasi panjang,” dan secara spesifik 10× lebih cepat daripada GPT-Transcribe milik OpenAI, 7× lebih cepat daripada Scribe v2 milik ElevenLabs, dan 5× lebih cepat daripada Gemini 3.5 Transcribe. Rasio-rasio tersebut adalah cara Microsoft membingkai data Artificial Analysis yang sama, dan angka dasar itu penting: “5× lebih cepat daripada Gemini 3.5 Transcribe” terdengar seperti selisih yang kecil sampai Anda menerjemahkannya menjadi menit komputasi per jam audio.
• Paling murah — Hanya benar di dalam dua batasan yang dinyatakan Microsoft dengan jelas. Tarif $0.10 adalah "penawaran terbatas hingga akhir tahun," dan tidak ada harga standar pasca-promosi yang diungkapkan di mana pun dalam materi peluncuran. Dan tarif tersebut merupakan yang termurah di antara API terkelola dengan akurasi tinggi; model terbuka yang dihosting sendiri seperti Whisper Large v3 Turbo masih melakukan transkripsi dengan biaya yang efektif hanya sebesar biaya listrik. Argumen komoditas itu nyata — hanya saja lebih sempit daripada klaim utamanya.

Apa yang bisa dibeli dengan $1,67 per 1.000 menit
Dengan harga $0,10 per jam audio, MAI-Transcribe-2 setara dengan sekitar $1,67 per 1.000 menit audio. Perbandingan yang membuat angka ini benar-benar terasa adalah dengan API transkripsi terkelola lain yang bersaing dalam hal akurasi. GPT-Transcribe tercatat di harga $4,50 per 1.000 menit; paket pra-rekaman Gemini 3.5 Transcribe menghasilkan sekitar $5 per 1.000 menit jika dihitung dengan skema harga berbasis token Google; Scribe v2 dari ElevenLabs tercatat lebih tinggi lagi. Jika memproses 1.000 jam audio per bulan — beban kerja pusat kontak atau media yang signifikan, tetapi tidak masif — selisih antara MAI-Transcribe-2 pada tarif pendaftar awal dan GPT-Transcribe pada harga daftar berkisar $170 per bulan, setiap bulan, sebelum memperhitungkan perbedaan akurasi apa pun. Itulah kesenjangan harga yang membuat transkripsi berhenti menjadi pos yang dioptimalkan tim dan mulai menjadi pos yang mereka abaikan.
Dua peringatan perlu disampaikan sekaligus. Pertama, harga promosi adalah sebuah eksperimen penetapan harga sampai akhirnya tidak lagi: tim yang membangun produk dengan tarif $0,10 harus tahu bahwa tarif standar tidak diumumkan, dan angka perencanaan yang jujur untuk anggaran 2027 berada di antara penawaran peluncuran dan apa pun yang ditetapkan Microsoft saat penawaran berakhir. Kedua, "termurah di tingkat akurasi ini" tidak mengatakan apa pun tentang total biaya kepemilikan — model ini khusus API, jadi perbandingan yang penting bagi tim bervolume tinggi adalah $1,67 per 1.000 menit dibandingkan dengan biaya penuh untuk menjalankan tumpukan open-weights mereka sendiri, bukan hanya dibandingkan dengan API lain.
Diringkas menjadi papan skor, posisi peluncuran terlihat seperti ini — setiap angka di bawah ini membawa label sumber yang melekat padanya di badan teks di atas.

Apa yang belum terbukti
Terlepas dari spesifisitas klaim peluncuran tersebut, ada tiga hal yang benar-benar masih terbuka. Pertama, streaming: MAI-Transcribe-2 adalah model batch, narasi kecepatan Microsoft berkaitan dengan throughput file, dan belum ada SKU real-time yang diumumkan atau didemonstrasikan — "411×" bukanlah angka latensi transkripsi langsung. Kedua, kualitas diarisasi: atribusi pembicara disertakan, tetapi Microsoft tidak memublikasikan tingkat kesalahan diarisasi, dan fitur itulah yang paling mungkin terlihat lebih buruk dalam pengujian independen dibandingkan dengan WER. Ketiga, rincian multibahasa: satu rata-rata FLEURS 60-bahasa dapat menyembunyikan variasi antar-bahasa yang lebar, dan Microsoft belum memublikasikan tabel per-bahasa. Masing-masing adalah alasan mengapa cerita ini belum selesai pada hari keempat.
Tempat ia meninggalkan tumpukan transkripsi Anda.
Tidak ada satu pun dari hal ini yang mengharuskan pemilihan MAI-Transcribe-2 hari ini, dan justru itulah mengapa penetapan harganya layak menjadi perhatian bagi tim yang saat ini tidak sedang mencari vendor baru. Speech-to-text jarang menjadi titik akhir dari sebuah pipeline — transkrip harus diringkas, ditindaklanjuti, dicari, dan dirutekan, dan lapisan hilir itulah tempat pengaturan multi-model membuktikan nilainya. Platform seperti OrcaRouter hadir untuk separuh stack tersebut: satu API di lebih dari 200 model, harga daftar penyedia diteruskan tanpa markup 0%, failover otomatis, dan DSL routing yang memungkinkan sebuah transkrip mengalir ke model yang berbeda untuk setiap beban kerja — notulen rapat ke satu perangkum, tinjauan kepatuhan ke model lainnya — tanpa perlu integrasi kedua. MAI-Transcribe-2 sendiri saat ini belum ada dalam daftar platform tersebut; ia berada di API milik Microsoft sendiri dan platform pihak ketiga yang tercantum di Microsoft. Namun, harga komoditas yang baru saja ditetapkannya adalah argumen terbaik sejauh ini untuk membangun bagian di atas transkrip agar bersifat model-agnostik.
Harga peluncurannya adalah petunjuknya. Microsoft tidak mencoba memenangkan speech-to-text hanya berdasarkan fitur — mereka mencoba membuat akurasi tinggi menjadi sangat murah sehingga kategori ini tidak lagi menjadi pos anggaran tersendiri. MAI-Transcribe-2 layak mendapatkan perhatian yang diterimanya; bacalah saja "tercepat, paling akurat, dan termurah di dunia" dengan tiga tanda bintang yang menyertainya: peringkat kedua pada AA-WER, harga promosi hingga akhir tahun, dan kisah streaming yang belum sempat diceritakan.
