
Muse Voice Transcribe 正式上線:Meta 首款即時音訊感知模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
Muse Voice Transcribe,Meta Superintelligence Labs 推出的首款即時音訊感知模型,於 2026 年 9 月 1 日正式上市,其定價就像劇透一樣:在 Meta Model API 上,每 1,000 分鐘音訊收費 $3.00 美元——約每小時 $0.18 美元。它透過單一串流處理,完成了大多數轉錄系統需拆分到三個系統才能做到的事:{{8}}自動語音辨識{{/8}}、跨越 {{10}}多達 20 位說話者{{/10}}的{{9}}說話者分離{{/9}},以及{{11}}語句終點偵測{{/11}}——判斷說話者是真的講完,還是只是思考間暫停。Meta 表示,該模型在 Artificial Analysis 串流語音轉文字排行榜上高居榜首,最終轉錄稿的{{14}}字錯誤率{{/14}}僅 3.1%,且在說話者停止說話後 {{15}}0.16 秒{{/15}}即可交付結果。
最後那個數字在發揮任何作用之前,需要先貼上誠實的標籤:這是 Meta 在發布當天提出的宣稱,指向一個獨立排行榜,而該模型在公告發出時,開放呼叫的時間還不到一天。實驗室以外還沒有任何人重現出那 3.1% 的結果;準確度宣稱是一回事,其餘的賣點——70+ 種受訓語言、原生語碼轉換、經強化學習的「自適應延遲」——則是同一條船上的另一組廠商說詞。這篇文章中的所有內容,都是該模型第一天的狀態,廠商數字也如實標示為廠商數字。
首日關鍵數字
• {{1}}價格{{/1}} — Meta Model API 每 1,000 音訊分鐘收費 $3.00(約每音訊小時 $0.18),低於我們追蹤的所有主要串流轉錄 API。
• 準確性宣稱 — 最終轉錄稿在語音結束後 0.16 秒的 WER 為 3.1%;首批部分轉錄稿在 0.13 秒的 WER 為 3.6%。供應商回報,引用自 Artificial Analysis 串流排行榜。
• 說話人分割 — 20+ 位說話人,以串流方式輸出,無需額外的後處理步驟(Meta 報告平均說話人分割錯誤率為 17.5%)。
• 語言 — 訓練涵蓋 70+ 種;發布時有 25 種經過「廣泛驗證」;句內和句間可無縫語碼轉換。
• 上下文 — 可處理超過一小時的音訊;針對術語密集型領域提供語言、關鍵字和上下文偏置。

這裡的「音訊感知模型」是什麼意思
架構即故事。Muse Voice Transcribe 以 80 毫秒的區塊攝取音訊,並在詞彙穩定時即時串流輸出文字——這就是「即時」在實際運作上的意義。有趣之處在於它如何決定何時提交一個詞。它並非採用固定的延遲預算——也就是辨識器要嘛提早提交而猜測、要嘛等待更久而保留餘地的標準取捨——而是使用 Meta 所稱的「自適應延遲」:在處理簡單的語音時快速推進,而對較不確定的詞彙則保留更多音訊上下文。延遲策略本身是透過強化學習學得的,因此模型實際上是在逐字層級上平衡速度與準確性,而非套用單一的全域設定。
正是這項區別,讓 Meta 稱 Muse Voice Transcribe 為「音訊感知模型」(audio perception model),而非 ASR 模型。輸出串流是一份單一的即時轉錄稿,同時也承載著說話者是誰,以及語句何時結束——這三個標籤,串流系統通常是靠把辨識器、語音活動偵測器和語者分離模型(diarization model)黏合在一起才拼湊得出來,而每個環節都各自增加延遲,也各自有其失效模式。

內建說話人分離與端點偵測
{{1}}說話者分離是最值得審視的部分,因為這是串流產品最常誇大其詞的功能。{{/1}} {{2}}Meta 表示,該模型能在單一錄音中區分 20+ 位說話者,並報告平均分離錯誤率為 17.5%,且將此與競爭對手系統的 21.1%–28.6% 區間進行對比。{{/2}} {{3}}這兩個數字都是廠商在發布當天自行公布的,目前尚無獨立評測證實 17.5%。{{/3}} {{4}}結構上屬實的是,分離與辨識在同一個串流處理流程中執行——沒有「上傳音訊、等待、取回說話者」的第二個步驟,而正是這項設計選擇,讓 20+ 說話者追蹤在即時情境中具有可行性。{{/4}}
端點偵測是較為低調的功能,但可以說是最實用的。暴露原始串流 ASR 的轉錄 API 迫使呼叫端自行實作語句結束偵測,這就是為什麼語音代理經常打斷使用者或留下靜默空檔。Muse Voice Transcribe 會判斷回合何時完成,並將該邊界作為串流的一部分輸出,讓應用程式無需建置 VAD 層即可獲得乾淨的「此說話者已結束」訊號。
多語言聲明,請仔細閱讀
Meta 以 70 多種語言訓練該模型,但推出時僅驗證了 25 種。這兩者是不同的事:「受過訓練」表示資料包含了這些語言;「經廣泛驗證」才是 Meta 以內部測試真正背書的子集。在生產環境使用時,經過驗證的 25 種語言清單才是實際覆蓋範圍,而 70 與 25 之間的落差,值得你在把 40 種語言送入模型之前先弄清楚。真正與眾不同之處在於語碼轉換:該模型無需事先告知,就能在句子中途與話語中途切換語言,這在多語言地區是實際的痛點,也是大多數單語言 ASR 產品根本做不到的。語言、關鍵字與情境偏置補齊了客製化功能的全貌:你可以將辨識結果偏向某個領域的字彙,而這正是讓串流 ASR 在醫療、法律與客服佇列中得以實用的關鍵功能。
三種表面,一個型號
Muse Voice Transcribe 一次登陸三個平台。付費版本是 Meta Model API,每 1,000 音訊分鐘收費 3.00 美元。消費端版本是 Meta AI for Mac,按住 Fn 鍵即可在任何應用程式中進行聽寫——這是 Meta 對 Apple 內建聽寫功能的回應,也是該模型在推出首日最引人注目的實際應用。開發者版本是 Muse Code,Meta 的程式設計代理,語音指令可驅動多代理會話與重構流程。一個模型同時驅動聽寫功能和程式設計代理,正是「單一串流模型,多種應用場景」的產品化體現。
價格所低於的對象
以每音頻小時 0.18 美元的價格,Muse Voice Transcribe 在標價上低於串流轉錄市場的競爭者。就我們追蹤的比較組而言:Google 的 Gemini 3.5 Transcribe Live 大約是每 1,000 分鐘 9 美元,ElevenLabs 的 Scribe v2 Realtime 定價為每 1,000 分鐘 6.50 美元,Cartesia 的 Ink-2 為 4.00 美元,OpenAI 的 GPT Live Transcribe 為 17.00 美元。這些是廠商公佈的數字,而其中幾個模型擁有 Muse 尚不具備的獨立準確性證據——首日的價格領先並不等同於已定局的排行榜。但一個內建說話者區分與端點偵測的串流模型,以大約現有串流 API 價格的五分之一到十分之一進入市場,無論如何都是那種會重新設定期待的數字。

誠實的告誡
Muse Voice Transcribe 是專有軟體,權重並未公開——「自行執行」的選項並不存在,也沒有開放權重的途徑可供審計或微調。準確性宣稱僅為發布當日之數據,且未經複現。25 種已驗證語言在低資源涵蓋範圍上,可能與 70+ 種「訓練過」的數字不一致。而說話者分離(diarization)基準測試雖看似前景可期,但在獨立執行證實之前,僅屬廠商自行測量。對於唯一需求是準確批次轉錄預錄音訊的團隊,仍有更便宜且審計更完善的選項——串流轉錄的賣點在於即時互動,而非在每音訊小時成本上勝過批次轉錄。
接下來要看什麼
有四件事將決定這次發布是一時的熱潮還是長期的趨勢。首先,獨立驗證後,{{1}}Artificial Analysis 串流排行榜{{/1}}是否真的將 {{2}}Muse Voice Transcribe{{/2}} 列為第一名——發布當天的宣稱需要一個確定的榜單條目。其次,{{3}}20+ 說話者分離{{/3}}能否在真實且嘈雜的會議中經得起考驗。第三,{{4}}Meta 的 Mac 聽寫介面{{/4}}能否轉化為{{5}}開發者對 API 的採用{{/5}}。第四,{{6}}既有業者如何因應價格{{/6}},因為每小時 $0.18 的{{7}}具備說話者分離與端點偵測的串流模型{{/7}}會對所有價格更高的業者構成明顯壓力。當 Meta 將模型開放給更多服務合作夥伴時,像 {{8}}OrcaRouter{{/8}} 這樣的直通閘道——以{{9}}0% 加價{{/9}}轉發供應商列表價格——會在{{10}}上線當天{{/10}}呈現相同的每 1,000 分鐘 $3.00 的數字,且沒有任何經銷商加成。在那之前,{{11}}唯一能呼叫 Muse Voice Transcribe 的地方{{/11}}就是{{12}}Meta 自家的 API{{/12}}。
