
Muse Voice Transcribe: Model Speech-to-Text Streaming Milik Meta, Dijelaskan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 1009 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Muse Voice Transcribe adalah model speech-to-text streaming milik Meta. Model ini berjalan di Meta Model API dengan $0,18 per jam audio, dengan id model muse-voice-transcribe-1.0, dan harganya sama baik Anda melakukan streaming audio langsung atau menyerahkan rekaman yang sudah jadi. Yang membuatnya layak mendapat halaman referensi alih-alih sekadar pengecekan harga satu baris adalah di mana pekerjaannya terjadi: atribusi pembicara untuk lebih dari dua puluh suara dan deteksi akhir ucapan berjalan di dalam model pengenalan, bukan dalam pemrosesan batch yang ditempelkan di akhir stream. Ini hanya speech-to-text — dokumen pengembang Meta menyatakannya secara eksplisit: model ini tidak menyintesis ucapan dan tidak menyediakan API percakapan speech-to-speech.
Ini adalah halaman yang dituju pembaca setelah mencari nama model itu sendiri, jadi halaman ini dirancang sebagai jawaban stabil untuk dua pertanyaan — apa model ini, dan berapa biaya satu jam audio — bukan sebagai pengumuman. Satu tanggal perlu tercatat sebelum hal lain, karena itu fakta tentang model ini dan bukan alasan halaman ini ada: Meta Superintelligence Labs memperkenalkan Muse Voice Transcribe pada 2026-09-01, dalam postingan pengumuman bertanggal Memperkenalkan Muse Voice Transcribe — postingan yang masih dapat dijangkau pembaca melalui indeks blog Meta, meskipun tidak lagi tersedia di URL-nya sendiri. Semua yang di bawah ini dibaca di halaman-halaman Meta sendiri pada 2026-09-29, terutama halaman model dan dokumentasi speech-to-text serta ikhtisar API. Jika Meta tidak menerbitkan angka, halaman ini menyatakannya alih-alih menggunakan proksi.
Apa itu, dalam istilah Meta
Dokumentasi Meta sendiri membuka deskripsinya secara lugas: "Muse Voice Transcribe adalah model speech-to-text Meta di Meta Model API. Transkripsikan audio langsung atau rekaman yang sudah ada, dengan deteksi giliran bicara, label pembicara, dan pembobotan kosakata." Halaman ringkasan memadatkan hal yang sama menjadi satu kalimat — diarisasi pembicara secara streaming, endpointing native dan deteksi aktivitas suara, pembobotan kontekstual dan kata kunci, serta 25 bahasa yang dievaluasi dengan peralihan kode. Jadi outputnya adalah satu aliran transkrip yang membawa tiga label sekaligus: kata-katanya, siapa yang berbicara, dan apakah ujaran itu sudah selesai. Itulah kombinasi yang saat ini biasanya disusun oleh sebagian besar stack produksi dari sebuah recognizer ditambah detektor aktivitas suara terpisah ditambah model diarisasi terpisah, masing-masing dengan anggaran latensinya sendiri.
Halaman model Meta menggambarkan ini sebagai "latensi kompetitif dan akurasi transkripsi streaming dengan atribusi langsung untuk 20+ pembicara", dan dokumentasi developer menjelaskan field keluaran sebagai "Teks transkrip dengan pengaturan waktu tingkat giliran dan label pembicara opsional". Dua hal mengikuti dari itu, dan keduanya lebih penting daripada pembingkaiannya:
• Ini adalah model dengan input audio dan output teks. Ini bukan model dengan input teks maupun output teks, dan Meta secara eksplisit menyatakan bahwa ini bukan generator ucapan.
• Ini mengutamakan model streaming. Jalur realtime bukanlah pembungkus di sekitar jalur file; ini adalah sesi WebSocket dengan peristiwa, mode, dan batasnya sendiri, yang dijelaskan di bawah.
Berapa biaya satu jam audio
Halaman model Meta untuk Muse Voice Transcribe menyatakan harganya sebagai "Build with a single model at $0.18/hour", dan tabel spesifikasinya mencantumkan muse-voice-transcribe-1.0 sebesar $0.18 per jam audio dan $3.00 per 1.000 menit. Keduanya merupakan dua kerangka satuan dari satu tarif, dan keduanya tercantum di halaman Meta sendiri sebagaimana dibaca pada 2026-09-29. Dokumentasi pengembang menyatakan tarif yang sama dengan cara ketiga: "Pricing adalah $0.18 per jam audio yang diproses." Tidak ada angka di halaman ini yang diambil dari halaman harga Meta, karena tidak ada halaman harga Meta yang dapat dibaca: dokumentasi menautkan tarif tersebut ke halaman "Pricing and rate limits" yang menampilkan Halaman ini tidak tersedia sebagaimana dibaca pada 2026-09-29, sehingga halaman model menjadi sumber acuan untuk tarif tersebut, dan hanya itu yang digunakan di sini.
Detail penagihan ada di dokumentasi developer dan penting untuk diketahui sebelum Anda memperkirakan ukuran beban kerja:
• Streaming dan non-streaming berbiaya sama. Tidak ada biaya tambahan untuk endpoint realtime.
• Pemrosesan tanpa retensi data dihargai setara dengan tier Standard, menurut dokumentasi — ini bukan item biaya tambahan.
• Penagihan dibulatkan ke bawah menjadi detik utuh, sehingga giliran dua detik ditagih sebagai dua detik, bukan tiga.
• Kegagalan yang terjadi sebelum transkrip dihasilkan tidak dikenakan biaya, dan juga tidak 429 respons pembatasan laju.
• Kredit gratis ada di tingkat platform, bukan di tingkat model. Dokumentasi ucapan-ke-teks Meta mengakhiri paragraf harganya dengan kalimat "Kredit tingkat gratis platform berlaku." Itulah satu-satunya kata-kata yang menyebutkan sesuatu yang gratis di halaman-halaman untuk model ini, dan sengaja tidak spesifik: kalimat itu menunjuk pada skema kredit platform alih-alih menjanjikan jatah gratis untuk transkripsi, dan tidak ada angka, aturan kelayakan, atau ketentuan yang dicetak untuk itu. Bacalah itu sebagai kredit yang mungkin mengurangi tagihan, bukan sebagai tingkat gratis untuk model tersebut. Pernyataan Meta yang ditujukan kepada konsumen bahwa agen pribadinya "gratis untuk sebagian besar dari apa yang dibutuhkan orang" adalah kalimat terpisah tentang aplikasi Muse dan tidak berlaku untuk Model API.
Contoh perhitungan, karena tarif per jam sulit untuk dirasakan: wawancara rekaman berdurasi dua jam memerlukan biaya transkripsi $0.36. Seribu jam audio panggilan — kira-kira volume bulanan sebuah pusat kontak ukuran menengah — adalah $180. Pada skala itu, tarifnya adalah seluruh argumennya, dan tarif juga satu-satunya hal yang bisa bergeser di bawah Anda: halaman Meta adalah otoritasnya, dan jika angkanya berubah di sana, angkanya berubah di sini.
Antarmuka streaming, titik akhir demi titik akhir
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Audio langsung — wss://api.meta.ai/v1/asr/realtime. Transportnya adalah WebSocket, dan detail autentikasinya adalah jebakan: Anda melakukan autentikasi di frame handshake, dan header Authorization diabaikan. Handshake harus menjadi frame teks JSON pertama dan harus tiba dalam 10 detik. Sesi berlangsung hingga 60 menit, WebSocket baru membuat sesi baru, dan tidak ada token resume.
• Rekaman — POST https://api.meta.ai/v1/asr/transcribe. Unggahan multipart, dan yang ini memang mengautentikasi dengan Authorization header. Inputnya sempit: hanya WAV PCM mono 16-bit pada 16 atau 24 kHz. Batasnya adalah 32 MB per body dan 10 menit audio per permintaan.
Di dalam sesi realtime, tiga mode mengubah apa yang diberikan kepada Anda. PUSH_TO_TALK adalah default dan melakukan transkripsi satu giliran. ENDPOINTING memberikan batas giliran yang dideteksi model, satu giliran per segmen ucapan yang terdeteksi, memancarkan speechStart, transcript berulang, speechEnd dan speechComplete peristiwa — dengan peringatan bahwa speechEnd bukan transkrip. DIARIZATION menambahkan deteksi dan atribusi pembicara otomatis, memancarkan speaker peristiwa dengan label seperti A dan B. Transkrip parsial hadir baik secara kumulatif, di mana setiap parsial menggantikan yang sebelumnya, atau sebagai delta.
Dua detail operasional dari dokumentasi yang sama mudah terlewatkan dan mahal saat baru ketahuan di lingkungan produksi:
• Diarisasi menandai kemungkinan pembicara baru, bukan titik akhir ucapan yang bersih, dan Meta menyatakan bahwa fitur ini tidak disetel untuk penggunaan perintah suara dengan latensi rendah. Perlakukan label sebagai pengenal yang bersifat khusus sesi — A dalam satu sesi bukan orang yang sama dengan A di sesi berikutnya.
• Giliran dapat saling tumpang tindih, sehingga status per giliran sebaiknya dijadikan kunci berdasarkan pengenal giliran, bukan berdasarkan urutan kedatangan.
• Batas maksimum per-tenant yang dipublikasikan adalah 128 stream bersamaan dan 16.000 stream per jam.
Apa yang berjalan di dalam model, dan apa yang digantikannya
Halaman model Meta membuat klaim spesifik tentang arsitektur, bukan tentang skor: "Atribusi pembicara untuk 20+ pembicara dan deteksi akhir ujaran terjadi di dalam model pengenalan" — dan secara eksplisit membandingkannya dengan pemrosesan batch di akhir aliran audio. Perbedaan praktisnya adalah tidak ada tahap kedua yang perlu ditunggu. Label pembicara dan batas giliran tiba pada aliran yang sama dengan kata-kata, sehingga agen suara hilir atau antarmuka takarir langsung mendapatkan giliran yang lengkap dan identitas tanpa perantara pascapemrosesan.
Kemampuan lain yang didokumentasikan Meta sebagai berada di dalam model:
• Endpointing native dan deteksi aktivitas suara, sehingga Anda tidak menjalankan VAD Anda sendiri di depan API. Dalam frasa dokumentasi, Anda mendapatkan satu transkrip utuh per ucapan tanpa menjalankan deteksi aktivitas suara sendiri, dan akhir ucapan yang terdeteksi tidak mengakhiri sesi.
• Bias kontekstual dan kata kunci, tanpa fine-tuning. Halaman model Meta menjelaskan bahwa akurasi dipertahankan "melalui bias kontekstual dan kata kunci, tanpa fine-tuning", yang merupakan fitur yang membuat ASR streaming dapat digunakan pada kosakata domain — nama obat, simbol ticker, SKU produk — alih-alih pada rata-rata bahasa umum. Dokumentasinya tepat mengenai batasannya: kata kunci memengaruhi pengenalan tetapi tidak menjamin ejaan yang persis, dan baik kata kunci maupun bias bahasa ditetapkan pada awal sesi.
• 25 bahasa yang dievaluasi dengan alih kode. Dokumentasi mencantumkannya: Arab, Bengali, Belanda, Inggris, Prancis, Jerman, Ibrani, Hindi, Indonesia, Italia, Jepang, Kannada, Korea, Melayu, Mandarin Tionghoa, Marathi, Polandia, Portugis, Spanyol, Tagalog, Tamil, Telugu, Thai, Turki, dan Vietnam. Alih kode — di tengah kalimat dan di tengah ujaran tanpa diberi tahu bahasa mana yang akan muncul — adalah kemampuan yang secara struktural tidak dapat ditawarkan oleh pengenal satu bahasa. Satu catatan yang perlu diingat: bias bahasa adalah daftar bahasa, bukan konteks bebas, dan itu tidak memaksa model untuk menggunakannya.
Posting pengumuman bertanggal itu melangkah lebih jauh: disebutkan bahwa model dilatih pada 70+ bahasa dengan 25 bahasa yang "terverifikasi secara ekstensif" — dilaporkan vendor, dan daftar 25 terverifikasi itu adalah subset yang dipertanggungjawabkan Meta. Itulah cakupan yang harus dijadikan acuan perencanaan, bukan angka 70.
Batas yang didokumentasikan
Halaman referensi hanya sebaik batasan yang dicetaknya, dan Meta mencetak beberapa.
• Timestamp tingkat giliran, bukan tingkat kata. Halaman model maupun dokumentasinya menyatakannya secara gamblang: "Ini mengembalikan timestamp tingkat giliran, tetapi bukan timestamp tingkat kata." Setiap giliran membawa waktu mulai dan selesai dalam milidetik. Jika produk Anda memerlukan klik-untuk-melompat per kata — penyorotan karaoke, perutean keyakinan per kata, penyelarasan paksa — ini model yang salah dan tidak ada rekayasa prompt yang bisa mengubahnya.
• Tidak ada skor keyakinan, tidak ada deteksi peristiwa suara, tidak ada deteksi emosi, tidak ada pemformatan ulang transkrip. Meta mencantumkan keempatnya sebagai tidak tersedia. Anda mendapatkan kata, giliran bicara, waktu, dan label pembicara, serta tidak ada apa pun tentang seberapa yakin model itu.
• Tidak ada sintesis suara dan tidak ada API percakapan suara-ke-suara. Ini hanya satu arah.
• Format audio yang didukung pada jalur file sangat terbatas. Mono 16-bit PCM WAV, 16 atau 24 kHz. Format lainnya harus dikonversi sebelum diunggah.
Bobot terbuka, dan kebingungan Muse Glimmer
Muse Voice Transcribe bersifat proprietari dan disediakan melalui API — ini bukan rilis berbobot terbuka, dan dokumentasi Meta tidak pernah mengklaim sebaliknya. Ini penting karena pembaca mengarahkan jalur berbobot terbuka keluarga Muse ke nama yang salah. Muse Glimmer adalah itu: dokumentasi Meta mendeskripsikannya sebagai model multimodal berbobot terbuka yang didestilasi dari Muse Spark, didistribusikan di bawah lisensi Apache 2.0 yang permisif, yang Anda unduh dan jalankan di perangkat keras Anda sendiri melalui runtime seperti vLLM, SGLang, llama.cpp, atau ExecuTorch. Muse Voice Transcribe dikelompokkan pada halaman yang sama dengan Muse Spark, Muse, dan SAM sebagai model yang Anda panggil alih-alih unduh.
Jadi: tidak ada bobot untuk Muse Voice Transcribe, tidak ada opsi self-hosted, tidak ada jalur untuk mengaudit atau melakukan fine-tune. Jika ada halaman yang mengatakan sebaliknya, halaman itu telah mencampuradukkannya dengan Muse Glimmer. Ketika bobot suatu model tidak dipublikasikan, platform penyajian adalah keseluruhan ceritanya — dan itulah yang akan dibahas di bagian berikutnya.
Bagaimana klien mengaksesnya
Model API milik Meta dirancang untuk langsung dimasukkan ke klien yang sudah Anda miliki. Klaim vendor, yang tercetak di halaman ikhtisar API, adalah bahwa Model API "kompatibel drop-in dengan pustaka klien yang kompatibel dengan OpenAI dan Anthropic, serta dengan CLI agen yang kompatibel dengan OpenAI. Tetapkan URL dasar klien Anda, tambahkan kunci Anda, dan pertahankan sisa kode Anda." Secara umum untuk Model API, ditawarkan tiga bentuk permintaan — Responses API, Chat Completions API, dan Messages API — sehingga integrasi yang sudah ada biasanya memiliki antarmuka yang sesuai tanpa perlu penulisan ulang. Satu peringatan tentang cakupan: kalimat kompatibilitas itu dan ketiga bentuk tersebut adalah kemampuan Model API secara keseluruhan, bukan baris yang tercetak di halaman model Muse Voice Transcribe sendiri. Panduan memulai cepat di halaman model itu sendiri lebih sempit — hanya menyatakan bahwa Anda "arahkan klien Anda yang kompatibel dengan OpenAI yang sudah ada ke Meta Model API", dan bahwa Anda akan mendapatkan permintaan pertama yang berfungsi dalam waktu kurang dari lima menit.
Satu celah jujur yang layak ditandai di halaman referensi: dokumentasi Meta untuk model ini tidak menyebutkan pustaka klien resmi untuk Muse Voice Transcribe, dan halaman "Client libraries"-nya berada di bawah bagian SAM, bukan bagian Voice. Sebagai gantinya, panduan speech-to-text memberi Anda daftar dependensi yang konkret — Python 3.9 atau lebih baru dengan websockets dan sounddevice paket — plus cookbook dasar-dasar voice API. Jadi klaim drop-in menggambarkan permukaan permintaan Model API secara umum; endpoint ASR realtime itu sendiri adalah WebSocket dengan aturan handshake-nya sendiri dan tanpa wrapper yang terdokumentasi.

Apa yang belum diterbitkan oleh Meta
Tidak adanya tolok ukur adalah fakta tentang dokumentasi, jadi di sini hal itu dinyatakan sebagai fakta. Halaman model Meta untuk Muse Voice Transcribe tidak memuat tabel akurasi tercetak: bukti akurasinya disampaikan sebagai tiga aset gambar — papan peringkat tingkat kesalahan kata streaming, perbandingan tingkat kesalahan diarisasi, dan indeks akurasi streaming — tanpa angka dalam teks yang dapat diekstrak. Halaman model itu sendiri tidak memberikan tingkat kesalahan kata, tidak memberikan tingkat kesalahan diarisasi, dan tidak memberikan rincian per bahasa.
Postingan pengumuman itu memang memuat angka yang dilaporkan vendor, termasuk tingkat kesalahan kata streaming dan tingkat kesalahan diarisasi rata-rata, dan itulah angka-angka yang kami tulis saat model diluncurkan; itu adalah pengukuran Meta sendiri dan tetap belum direproduksi oleh pihak ketiga. Halaman ini tidak menjalankan ulang perbandingan tersebut, karena menjalankan ulang benchmark vendor pada hari peluncuran di halaman referensi akan membuat angka yang belum direproduksi tampak seperti angka yang sudah mapan. Yang dapat dikatakan secara lugas lebih sempit: Meta tidak mempublikasikan evaluasi head-to-head terhadap pesaing yang disebutkan namanya dengan upaya yang setara dan perangkat pengujian yang setara untuk model ini, jadi perbandingan apa pun yang Anda baca di mana pun adalah perbandingan angka vendor yang dikumpulkan dalam kondisi yang berbeda.
Satu tanggal juga sengaja dibiarkan belum ditetapkan. Halaman model sama sekali tidak memuat tanggal rilis — penanda versinya hanya -1.0 di id model. Tanggal 2026-09-01 dalam tulisan ini berasal dari postingan pengumuman bertanggal tersebut, dan di sini tanggal itu digunakan untuk memberi tanggal pada model, bukan untuk melaporkan suatu peristiwa.


Siapa yang harus memilihnya, dan siapa yang tidak
Argumen untuk Muse Voice Transcribe memang sempit tetapi kuat: audio langsung ketika Anda membutuhkan kata, identitas pembicara, dan akhir giliran pada stream yang sama, dengan harga yang cukup rendah untuk dijalankan terus-menerus alih-alih sesuai permintaan. Agen suara, takarir langsung, intelijen rapat dan panggilan, dikte, serta transkripsi bervolume tinggi adalah beban kerja yang disebut Meta, dan itulah beban kerja yang sebenarnya menjadi sasaran bentuk antarmuka ini — WebSocket 60 menit dengan mode endpointing dan label pembicara dalam cakupan sesi.
Alasan yang menentangnya sama spesifiknya. Jika Anda memerlukan stempel waktu tingkat kata, keyakinan per kata, deteksi peristiwa suara atau emosi, atau pemformatan ulang transkrip, model ini tidak memilikinya, dan itu adalah ketiadaan yang terdokumentasi, bukan bug. Jika audio Anda datang dalam format selain WAV mono 16-bit pada 16 atau 24 kHz dan Anda menggunakan endpoint file, Anda harus menanggung langkah konversi yang tidak akan Anda tanggung di tempat lain. Dan jika kebutuhan Anda adalah transkripsi batch dari rekaman yang diarsipkan di mana akurasi adalah satu-satunya poros, tawaran streaming tidak memberi Anda apa pun — harganya sama di kedua jalur, jadi Anda membayar untuk kemampuan real-time yang tidak akan Anda gunakan.
Satu hal yang perlu diperiksa sebelum Anda memutuskan jalur produksi adalah angka yang menjadi tujuan halaman ini untuk dijawab, dan itulah satu-satunya angka yang bisa berubah tanpa model itu sendiri berubah sama sekali: $0,18 per jam komputasi, seperti yang tercetak di halaman model milik Meta sendiri hari ini. Halaman Meta adalah otoritasnya. Ketika angka itu berubah, semua yang diukur berdasarkan angka itu — bulan seribu jam, biaya per wawancara, aritmetika bangun-versus-beli — ikut berubah.
