
MAI-Transcribe-2-Streaming 與 MAI-Transcribe-2 之比較:為詞級時間標記支付 5.4 倍費用
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
MAI-Transcribe-2-Streaming 與 MAI-Transcribe-2 是同一個模型家族,被拆分到兩個定價層級,而這個切分夠明確,足以據此規劃。MAI-Transcribe-2 於 2026 年 9 月 3 日推出,是批次模型:在 Artificial Analysis 的非串流排行榜上達到 2.0% 詞錯誤率,約為即時的 411 倍,每音訊小時 0.10 美元——每 1,000 分鐘約 1.67 美元。MAI-Transcribe-2-Streaming 於 2026 年 10 月 1 日推出,是即時版本:宣稱串流詞錯誤率為 2.5%,並可在 0.13 秒內產出最終逐字稿;微軟稱其在最終與部分逐字稿的準確度上均居第一,這項數據是依 Artificial Analysis 的串流方法論衡量,尚未在該追蹤網站的排行榜上以列呈現。每音訊小時 0.54 美元——每 1,000 分鐘約 9.00 美元。同樣支援 60 種語言,同樣僅以 API 形式提供,未公開權重。串流的成本是批次費率的 5.4 倍,而且依微軟自家數據,準確度低了 0.5 個百分點。這到底是撿到便宜還是被課稅,完全取決於一個問題:你的流程中是否有任何環節需要在句子結束前就拿到逐字稿?
由於這兩個模型來自同一家供應商、同一個文件介面,這項比較顯得格外乾淨——不必猜測功能對等性,不會有基準版本不一致,也沒有「他們的數字對上我們的數字」的問題。這是單一供應商為同一種能力的兩種速度定價,而有趣的工作在於弄清楚便宜的那一層實際上涵蓋哪些工作負載。
一家人,排成兩排
• MAI-Transcribe-2 — 批次處理、預錄音訊,於 2026 年 9 月 3 日發布。AA-WER 為 2.0%,在 Artificial Analysis 的非串流排行榜上排名第二。約為即時速度的 411 倍,同樣排名第二。每音訊小時 0.10 美元,約每 1,000 分鐘 1.67 美元,為限時優惠、持續至年底,未公布標準價格。內含語者分離功能,並回傳詞級時間戳記。支援 60 種語言,並具備自動語言識別。
• MAI-Transcribe-2-Streaming — 即時、WebSocket 風格的連續轉錄,於 2026 年 10 月 1 日發布。Microsoft 報告指出,語音結束後 0.13 秒的最終轉錄稿 WER 為 2.5%,而第一個部分結果在 0.12 秒時也達到相同的 2.5%,該公司形容這是在兩者上首次達成如此準確度——這是一項根據 Artificial Analysis 串流方法論測量的供應商宣稱,不過截至撰寫本文時,該追蹤器自家的排行榜(37 個模型)尚未標繪該模型,而其現任領先者是 Grok Voice Transcribe 2.0,為 2.73% 與 0.49 秒。每音訊小時 $0.54,約每 1,000 分鐘 $9.00,優惠價至年底。60 種語言,具備自動連續語言偵測。未發布任何說話者分離的宣稱,也未發布任何詞時間戳記的宣稱。
唯一不在於速度或價格的不對稱,是能力:批次模型的語者分離與詞級時間戳是有文件記載的功能,而串流模型則不然。這比 0.5 個百分點的準確率差距更重要,也是許多團隊最終會同時運行兩者的原因。

5.4× 實際上能換來什麼
以每千分鐘 1.67 美元計算,在這個準確度等級下,批次轉錄在邊際上近乎免費。以每千分鐘 9.00 美元計算,串流則是一筆實實在在的支出項目——大約是同一段音訊轉錄五次的成本,並多出半個百分點的準確度。所以,問題不是即時轉錄是否值得更高成本;而是哪些特定的分鐘真正需要它。
在這些工作負載上,答案顯而易見:講者說話時、人員同步閱讀的即時字幕,其中 0.13 秒與等到檔案結束之間的差距,就是整個產品的價值所在;即時座席輔助與合規評分,其中通話結束後才姍姍來遲的介入毫無價值;以及互動式語音應用,其中逐字稿沒完成,對話回合就無法完成。在這三種情境下,批次模型並不是更便宜的選項,而是根本不可行——沒有任何價格能讓事後轉錄變成即時。
那些顯然不適用的工作負載則是:事後才處理的會議與通話錄音、媒體存檔、客服中心批次品管、已完成通話的合規審查、播客與影片字幕製作。這些正是批次模型的 411 倍即時處理速度與 1.67 美元費率天生要拿下的流程,而為了讓一份明天之前根本沒人會看的逐字稿省下幾百毫秒,卻得多付 5.4 倍的費用,根本是明目張膽的浪費。再加上語者分離與字詞時間戳功能——批次模型有這些功能的文件說明,串流模型則沒有——事後處理方案的立論只會更強,不會更弱。
有趣的中間地帶,在於兩者真正互補的地方:即時介面採用串流,紀錄則採用批次。一通支援通話即時轉錄以驅動客服輔助面板,接著在夜間以批次重新轉錄,產出帶有說話者分離與時間戳記的存檔逐字稿,這麼做只比單純批次處理多一點費用,卻能同時得到兩種行為。這種模式直到九月才成為可能,而十月的發行版本正是讓它完備的最後一塊拼圖。
在二分結構顯現之處
這個家族有兩件事值得注意,因為它們是結構性的,而非偶然的。
首先,準確度的層級關係與一般模式相反。串流模型通常會為即時輸出付出可觀的準確度代價;在這裡,代價是 0.5 個百分點,從批次排行榜上的 2.0% 到串流排行榜上宣稱的 2.5%。根據 Microsoft 自家數據,其即時模型與自家批次旗艦模型的差距落在半個百分點內;若這一點成立,這才是十月發布版本真正的工程成就——而不是榜首位置,因為一次順利的重跑就可能使其變動,而且追蹤器尚未確認該位置。
其次,定價也與常見模式相反。廠商通常會為更高用量的級別提供折扣;微軟卻將串流定價為批次處理的 5.4 倍,並讓兩者都採用同時到期的導入期價格。這與其說是有意對串流收取溢價,不如說更像是兩次各自附帶上市折扣的獨立發布,且兩者都沒有公布標準價格。正在規劃 2027 年預算的團隊應將這兩個數字都視為暫定值——$1.67 和 $9.00 都標示為限時價格,而且兩者都沒有公布後續價格。

什麼尚未被證明?
九月以來,批次模型的未解問題依然未解:沒有公布語者分離錯誤率、60 種語言宣稱背後沒有逐語言的細分數據,還有一個未指名後續方案的促銷價格。串流模型則多了一個專屬於即時作業的問題——串流 WER 是在乾淨音訊上測得,而在嘈雜的遠場串流中,部分轉錄的品質是最影響部署、卻在發表資料中著墨最少的失效模式。它也承襲了串流排行榜的膠著程度:該追蹤網站 37 個模型的排行榜上,前三名差距不到零點幾分,因此「第一」是一種可能因重新測試而改變的狀態——而微軟的第一是一項宣稱,而非榜上的一列。
家族層級的問題倒是值得留意。微軟現在以相差五倍的兩種價格販售同樣的能力,而昂貴層級還少了兩項便宜層級已載明的功能。如果語者分離與詞時間戳記登上串流 SKU,差距就會縮小為單純的延遲與價格取捨,這會是簡單得多的決策。如果沒有,這種雙分結構就會是永久性的,架構也應圍繞它來打造。
這對轉錄技術堆疊意味著什麼

實際結果是,轉錄在九月不再只是一項單獨的項目,到了十月卻變成了一項路由決策。過去以單一 API 為標準的管線,現在既要為即時介面採用串流,也要為紀錄採用批次處理,還得有一套規則來決定哪段音訊走哪條路徑——而那套規則本身就是個路由問題,這種複雜度竟落在單一廠商的發布週期裡,實在怪異得可以。
衝擊最大的,是逐字稿之上的那一層。無論是哪一層產出文字,這些文字接著都會被摘要、分類、遮蔽與路由,而這些步驟跑在各自有不同延遲與成本特性的語言模型上——即時逐字稿要的是又快又便宜的模型,封存用的逐字稿則負擔得起更強的模型。OrcaRouter 涵蓋的正是這一層:單一 API 串接 200 多個模型、供應商定價以 0% 加成原價轉嫁、自動容錯移轉,以及一套路由 DSL,能依工作負載而非依流程來挑選模型。MAI-Transcribe-2-Streaming 與 MAI-Transcribe-2 都不在那份名單上——兩者都透過 Microsoft 自家的語音堆疊提供服務——但一個雙部門的轉錄層,正是迄今支持「讓其下游的一切保持可攜」最強而有力的論據。
誠實的總結:串流並不是更好的 MAI-Transcribe-2,而是另一款產品、另一種價格。只為真正需要即時性的那些分鐘數購買它,其餘的留在便宜方案,並為兩種費率在優惠期結束後重新定價做好預算準備。
