
MAI-Transcribe-2 正式上線:微軟以每小時 0.10 美元的價格搶攻語音轉文字市場
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 是 Microsoft AI 押注的模型,它讓語音轉文字成為一項大宗商品而非高階功能,而隨之發布的數據正是為了佐證這一論點。該模型於 2026 年 9 月 3 日在 Microsoft Foundry、MAI Playground 及 Microsoft 自家的 API 介面上公開預覽。MAI-Transcribe-2 是微軟五個月內推出的第三款語音模型——繼 4 月以每音訊小時 0.36 美元推出的 MAI-Transcribe-1,以及 6 月推出的 MAI-Transcribe-1.5 之後——並且是首款在團隊實際選購時會參考的兩項指標上,領先它所列出的所有受管競爭對手的產品。在 Artificial Analysis 的非串流字錯誤率排行榜上,其 AA-WER 為 2.0%,名列第二;速度約為 411 倍實時,同樣位居第二,兩者合起來使其落在準確度-速度的帕累托前沿上:在該榜單上,沒有其他模型同時具備更高的準確度與更快的速度。其發布價格比自家前代產品低了約 72%。
被微軟自己冠以「全球最快、最準確、最便宜的語音識別模型」之名的這款產品{{1}},其新聞稿標題理應連同原文中的星號註釋一起解讀。以下是這次發布的真實經過,其中廠商的說法已逐一標明,而仍有待驗證的部分也已分離出來{{2}}。
微軟實際發布的內容
MAI-Transcribe-2 是一款針對預錄、批次處理式轉錄模型,明確鎖定長篇幅音訊——例如會議、通話、媒體檔案庫及客服中心錄音。微軟將其定位在吞吐量與每分鐘成本為主導的工作負載上。它支援 60 種語言的轉錄,並具備自動語言識別功能,內建說話者分離(diarization),可將字詞歸屬於正確的發言者,回傳逐字時間戳記,並支援針對人名、縮寫及領域術語的關鍵字偏置(keyword biasing)。兩種可設定的轉錄風格涵蓋了一貫的區分方式:「逐字轉錄」(verbatim)模式會保留填充詞與虛起始,適用於需合規等級的逐字稿;而「淨化轉錄」(clean)模式則會移除不流暢的語句,適用於字幕與筆記。微軟也特別強調其在混合語言語音中(如 Hinglish 與 Spanglish)的語碼轉換能力,以及在高雜訊真實世界音訊中的穩健表現。

可用性與功能清單同等重要。微軟並未將此模型封鎖在企業語音堆疊之後:該模型現已在 MAI Playground 中可直接進行示範,並透過 Microsoft Foundry 以公開預覽形式提供服務,而 Foundry 的文件則歸於 Azure AI Speech 服務之下。這是刻意的發佈策略——讓前沿模型放在開發人員以一把金鑰即可取用的地方,而不是放在必須先經過企業銷售流程核准的位置。微軟尚未公佈權重,且發佈資料中也沒有任何跡象顯示未來會這麼做。
按字面意思解讀標題
「世界上最快、最準確且最便宜」是三個強度不同的宣稱,而發布貼文本身悄悄調降了其中兩者。每一項的誠實版本是:
• 準確度 — 在 Artificial Analysis 的排行榜上,MAI-Transcribe-2 以 2.0% 的 AA-WER 排名第二,而非第一;微軟自己的內文也說是第二。「最準確」的說法只有在解讀為「在有追蹤此等級指標的受管批次 API 之中」時才站得住腳,而且即便如此,那也只是針對一個推出僅四天的模型所作的宣稱,並非已然穩固的桂冠。微軟另外報告該模型在 FLEURS 多語言基準上名列第一,在其 60 種語言上的平均 WER 為 5.2%——該數據來自微軟的發布貼文,尚未獨立地按語言重新計算。
• 速度——根據 Artificial Analysis,MAI-Transcribe-2 約以 411 倍即時速度運作,在該排行榜上位居第二。有趣的是,微軟自家的公告從未寫出這個絕對數字;而是選擇以更友善的相對倍數開場:「運算速度比一線競爭對手最多快 10 倍,尤其是在長格式音訊上」,具體來說,就是比 OpenAI 的 GPT-Transcribe 快 10 倍、比 ElevenLabs 的 Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍。這些倍數是微軟對同一批 Artificial Analysis 數據的詮釋,而基準速率正是關鍵:「比 Gemini 3.5 Transcribe 快 5 倍」聽起來差距不大,直到你把每小時音訊換算成所需的計算分鐘數,才會明白實際差距。
— 最便宜 — 唯有在微軟明確指出的兩道界線內,此說法才成立。每 0.10 美元的費率是「限時優惠,至年底為止」,而發布資料中完全未揭露促銷結束後的標準價格。而在高精度受管 API 中,它也是最便宜的;自架開源模型如 Whisper Large v3 Turbo,其轉錄成本實際上就只等於電費。「商品化」的論點確實成立——只是範圍比標題所述更窄。

每1,000分鐘1.67美元能買到什麼
以每個音訊小時 0.10 美元計價,MAI-Transcribe-2 的價格約為每 1,000 分鐘音訊 1.67 美元。能讓這個數字更顯而易見的比較,是與其他在準確度上競爭的受管轉錄 API 相比。GPT-Transcribe 的牌價是每 1,000 分鐘 4.50 美元;Gemini 3.5 Transcribe 的預錄音訊層級在 Google 以 token 為基礎的計價下,大約是每 1,000 分鐘 5 美元;ElevenLabs 的 Scribe v2 定價更高。若以每月 1,000 小時音訊——這是個認真但不算龐大的客服中心或媒體工作量——而論,MAI-Transcribe-2 以早鳥價計算與 GPT-Transcribe 以牌價計算之間的差額,每月約為 170 美元,且月月如此,這還是在考量任何準確度差異之前。正是這個價格差距,讓轉錄不再是一個團隊會去最佳化的預算項目,而是變成一個他們會直接忽略的預算項目。
{{1}}有兩點需要注意,應一併說明。首先,促銷價格在尚未結束前,本質上就是一場定價實驗:以每千分鐘 0.10 美元費率建置產品的團隊,應了解標準費率並未公開,而 2027 年預算的務實規劃數字,應介於上市優惠價與微軟在優惠結束時公布的價格之間。其次,「在此精確度等級中最便宜」並未說明總體擁有成本——該模型僅提供 API,因此對高用量團隊而言,真正重要的比較是每千分鐘 1.67 美元對照其自行營運開源權重模型堆疊的完整成本,而不只是與其他 API 相比。{{/1}}
壓縮成記分板後,發射位置便呈現如下——下方的每一項數字,都附有其在正文上方連結的來源標籤。

什麼尚未被證明?
儘管發布宣稱看似具體,仍有三件事確實懸而未決。第一是串流:MAI-Transcribe-2 是批次模型,微軟的速度敘事講的是檔案吞吐量,且尚未宣布或展示任何即時 SKU——「411×」並非即時轉錄的延遲數字。第二是說話者分離品質:說話者歸屬雖為隨附功能,但微軟未公布任何說話者分離錯誤率,而該功能正是最可能在獨立測試中表現比 WER 更差的項目。第三是多語種細項表現:單一的 60 語言 FLEURS 平均值可能掩蓋各語言間的巨大差異,而微軟也未公布逐語言數據表。以上每一項都說明了為何這個故事到了第四天仍未完結。
它離開您的轉錄堆疊的位置。
這些都無需現在就選擇 MAI-Transcribe-2,正因如此,這個定價值得那些目前無意更換供應商的團隊關注。語音轉文字很少是流程的終點——轉錄稿會被摘要、執行、搜尋及分派,而在下游那一層,多模型架構才能真正發揮價值。像 OrcaRouter 這樣的平台正是為了該半邊技術棧而存在:單一 API 涵蓋 200 多個模型,供應商列表價格以 0% 加價直接轉傳,自動故障轉移,以及一套路由 DSL,讓同一份轉錄稿可依不同工作負載送往不同模型——會議紀錄交給某個摘要器、法遵審查交給另一個——且無需再做第二次整合。MAI-Transcribe-2 本身目前並不在那份名單上;它位於 Microsoft 自家的 API 以及 Microsoft 所列的第三方平台上。但它剛剛設定的商品化價格,正是迄今支持「將轉錄稿之上的部分建構成與模型無關」的最佳論據。
發表定價本身就已說明一切。微軟並非只想在功能面上贏得語音轉文字之戰——它是要把高準確率做到如此廉價,以致這個類別不再被列為獨立計價項目。MAI-Transcribe-2 確實值得當前獲得的關注;只要讀懂「全球最快、最準確且最便宜」這句話,連同後面附帶的三個星號註解:AA-WER 位居第二、年底前的促銷定價,以及一段尚未被述說的串流(streaming)故事。
