Muse Voice Transcribe 的主視覺標題卡,這是 Meta Superintelligence Labs 首個即時音訊感知模型,顯示串流波形,並標註 ASR、20+ 講者分離(speaker diarization)與語音端點偵測(endpointing),以及一個標示每音訊小時 $0.18 的價格標籤。
Guides & Insights

Muse Voice Transcribe 正式上線:Meta 首款即時音訊感知模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Muse Voice Transcribe,Meta Superintelligence Labs 推出的首款即時音訊感知模型,於 2026 年 9 月 1 日正式上市,其定價就像劇透一樣:在 Meta Model API 上,每 1,000 分鐘音訊收費 $3.00 美元——約每小時 $0.18 美元。它透過單一串流處理,完成了大多數轉錄系統需拆分到三個系統才能做到的事:{{8}}自動語音辨識{{/8}}、跨越 {{10}}多達 20 位說話者{{/10}}的{{9}}說話者分離{{/9}},以及{{11}}語句終點偵測{{/11}}——判斷說話者是真的講完,還是只是思考間暫停。Meta 表示,該模型在 Artificial Analysis 串流語音轉文字排行榜上高居榜首,最終轉錄稿的{{14}}字錯誤率{{/14}}僅 3.1%,且在說話者停止說話後 {{15}}0.16 秒{{/15}}即可交付結果。

最後那個數字在發揮任何作用之前,需要先貼上誠實的標籤:這是 Meta 在發布當天提出的宣稱,指向一個獨立排行榜,而該模型在公告發出時,開放呼叫的時間還不到一天。實驗室以外還沒有任何人重現出那 3.1% 的結果;準確度宣稱是一回事,其餘的賣點——70+ 種受訓語言、原生語碼轉換、經強化學習的「自適應延遲」——則是同一條船上的另一組廠商說詞。這篇文章中的所有內容,都是該模型第一天的狀態,廠商數字也如實標示為廠商數字。

首日關鍵數字

• {{1}}價格{{/1}} — Meta Model API 每 1,000 音訊分鐘收費 $3.00(約每音訊小時 $0.18),低於我們追蹤的所有主要串流轉錄 API。

• 準確性宣稱 — 最終轉錄稿在語音結束後 0.16 秒的 WER 為 3.1%;首批部分轉錄稿在 0.13 秒的 WER 為 3.6%。供應商回報,引用自 Artificial Analysis 串流排行榜。

• 說話人分割 — 20+ 位說話人,以串流方式輸出,無需額外的後處理步驟(Meta 報告平均說話人分割錯誤率為 17.5%)。

• 語言 — 訓練涵蓋 70+ 種;發布時有 25 種經過「廣泛驗證」;句內和句間可無縫語碼轉換。

• 上下文 — 可處理超過一小時的音訊;針對術語密集型領域提供語言、關鍵字和上下文偏置。

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

這裡的「音訊感知模型」是什麼意思

架構即故事。Muse Voice Transcribe 以 80 毫秒的區塊攝取音訊,並在詞彙穩定時即時串流輸出文字——這就是「即時」在實際運作上的意義。有趣之處在於它如何決定何時提交一個詞。它並非採用固定的延遲預算——也就是辨識器要嘛提早提交而猜測、要嘛等待更久而保留餘地的標準取捨——而是使用 Meta 所稱的「自適應延遲」:在處理簡單的語音時快速推進,而對較不確定的詞彙則保留更多音訊上下文。延遲策略本身是透過強化學習學得的,因此模型實際上是在逐字層級上平衡速度與準確性,而非套用單一的全域設定。

正是這項區別,讓 Meta 稱 Muse Voice Transcribe 為「音訊感知模型」(audio perception model),而非 ASR 模型。輸出串流是一份單一的即時轉錄稿,同時也承載著說話者是誰,以及語句何時結束——這三個標籤,串流系統通常是靠把辨識器、語音活動偵測器和語者分離模型(diarization model)黏合在一起才拼湊得出來,而每個環節都各自增加延遲,也各自有其失效模式。

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

內建說話人分離與端點偵測

{{1}}說話者分離是最值得審視的部分,因為這是串流產品最常誇大其詞的功能。{{/1}} {{2}}Meta 表示,該模型能在單一錄音中區分 20+ 位說話者,並報告平均分離錯誤率為 17.5%,且將此與競爭對手系統的 21.1%–28.6% 區間進行對比。{{/2}} {{3}}這兩個數字都是廠商在發布當天自行公布的,目前尚無獨立評測證實 17.5%。{{/3}} {{4}}結構上屬實的是,分離與辨識在同一個串流處理流程中執行——沒有「上傳音訊、等待、取回說話者」的第二個步驟,而正是這項設計選擇,讓 20+ 說話者追蹤在即時情境中具有可行性。{{/4}}

端點偵測是較為低調的功能,但可以說是最實用的。暴露原始串流 ASR 的轉錄 API 迫使呼叫端自行實作語句結束偵測,這就是為什麼語音代理經常打斷使用者或留下靜默空檔。Muse Voice Transcribe 會判斷回合何時完成,並將該邊界作為串流的一部分輸出,讓應用程式無需建置 VAD 層即可獲得乾淨的「此說話者已結束」訊號。

多語言聲明,請仔細閱讀

Meta 以 70 多種語言訓練該模型,但推出時僅驗證了 25 種。這兩者是不同的事:「受過訓練」表示資料包含了這些語言;「經廣泛驗證」才是 Meta 以內部測試真正背書的子集。在生產環境使用時,經過驗證的 25 種語言清單才是實際覆蓋範圍,而 70 與 25 之間的落差,值得你在把 40 種語言送入模型之前先弄清楚。真正與眾不同之處在於語碼轉換:該模型無需事先告知,就能在句子中途與話語中途切換語言,這在多語言地區是實際的痛點,也是大多數單語言 ASR 產品根本做不到的。語言、關鍵字與情境偏置補齊了客製化功能的全貌:你可以將辨識結果偏向某個領域的字彙,而這正是讓串流 ASR 在醫療、法律與客服佇列中得以實用的關鍵功能。

三種表面,一個型號

Muse Voice Transcribe 一次登陸三個平台。付費版本是 Meta Model API,每 1,000 音訊分鐘收費 3.00 美元。消費端版本是 Meta AI for Mac,按住 Fn 鍵即可在任何應用程式中進行聽寫——這是 Meta 對 Apple 內建聽寫功能的回應,也是該模型在推出首日最引人注目的實際應用。開發者版本是 Muse Code,Meta 的程式設計代理,語音指令可驅動多代理會話與重構流程。一個模型同時驅動聽寫功能和程式設計代理,正是「單一串流模型,多種應用場景」的產品化體現。

價格所低於的對象

以每音頻小時 0.18 美元的價格,Muse Voice Transcribe 在標價上低於串流轉錄市場的競爭者。就我們追蹤的比較組而言:GoogleGemini 3.5 Transcribe Live 大約是每 1,000 分鐘 9 美元,ElevenLabs 的 Scribe v2 Realtime 定價為每 1,000 分鐘 6.50 美元,Cartesia 的 Ink-2 為 4.00 美元,OpenAIGPT Live Transcribe 為 17.00 美元。這些是廠商公佈的數字,而其中幾個模型擁有 Muse 尚不具備的獨立準確性證據——首日的價格領先並不等同於已定局的排行榜。但一個內建說話者區分與端點偵測的串流模型,以大約現有串流 API 價格的五分之一到十分之一進入市場,無論如何都是那種會重新設定期待的數字。

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

誠實的告誡

Muse Voice Transcribe 是專有軟體,權重並未公開——「自行執行」的選項並不存在,也沒有開放權重的途徑可供審計或微調。準確性宣稱僅為發布當日之數據,且未經複現。25 種已驗證語言在低資源涵蓋範圍上,可能與 70+ 種「訓練過」的數字不一致。而說話者分離(diarization)基準測試雖看似前景可期,但在獨立執行證實之前,僅屬廠商自行測量。對於唯一需求是準確批次轉錄預錄音訊的團隊,仍有更便宜且審計更完善的選項——串流轉錄的賣點在於即時互動,而非在每音訊小時成本上勝過批次轉錄。

接下來要看什麼

有四件事將決定這次發布是一時的熱潮還是長期的趨勢。首先,獨立驗證後,{{1}}Artificial Analysis 串流排行榜{{/1}}是否真的將 {{2}}Muse Voice Transcribe{{/2}} 列為第一名——發布當天的宣稱需要一個確定的榜單條目。其次,{{3}}20+ 說話者分離{{/3}}能否在真實且嘈雜的會議中經得起考驗。第三,{{4}}Meta 的 Mac 聽寫介面{{/4}}能否轉化為{{5}}開發者對 API 的採用{{/5}}。第四,{{6}}既有業者如何因應價格{{/6}},因為每小時 $0.18 的{{7}}具備說話者分離與端點偵測的串流模型{{/7}}會對所有價格更高的業者構成明顯壓力。當 Meta 將模型開放給更多服務合作夥伴時,像 {{8}}OrcaRouter{{/8}} 這樣的直通閘道——以{{9}}0% 加價{{/9}}轉發供應商列表價格——會在{{10}}上線當天{{/10}}呈現相同的每 1,000 分鐘 $3.00 的數字,且沒有任何經銷商加成。在那之前,{{11}}唯一能呼叫 Muse Voice Transcribe 的地方{{/11}}就是{{12}}Meta 自家的 API{{/12}}。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube