文章主視覺卡片寫著「MAI-Transcribe-2-Streaming 正式上線」,徽章為「新模型 · MICROSOFT AI」,副標題為「Microsoft 以 2.5% WER 奪下串流轉錄冠軍」,並有統計列顯示語音結束後 0.13 秒的 2.5% 串流詞錯誤率,卡片上標註為 Microsoft 的說法,且在最終與部分逐字稿上皆為第一;支援 60 種語言並可自動連續偵測語言;以及每 1,000 分鐘 $9.00,並說明為 2026 年前每音訊小時 $0.54 的優惠價;置於白至藍的漸層背景上,OrcaRouter 標誌位於右下角。
Guides & Insights

MAI-Transcribe-2-Streaming 正式上線:Microsoft 以 2.5% WER 奪下串流轉錄王冠

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

MAI-Transcribe-2-Streaming 是 Microsoft AI 對其 9 月發布所留下的一個未解問題給出的答案,而它在 28 天內就給出了答案。MAI-Transcribe-2-Streaming 於 2026 年 10 月 1 日發布,是一款即時語音轉文字模型,會在話語到來時即時轉錄,而不是等檔案完成後才轉錄。微軟表示,在 Artificial Analysis 的 AA-WER Streaming 評估中,它無論是最終或部分轉錄稿的準確度都排名第一,詞錯誤率為 2.5%,最終轉錄稿在語音結束後 0.13 秒即可就緒。那是供應商根據追蹤機構方法論所做的宣稱,而非該追蹤機構發布的一筆資料——截至撰稿時,該排行榜的 37 個模型並未包含它,而它將取代的模型是 Gro​k Voice Transcribe 2.0 (Streaming),成績為 2.73% 與 0.49 秒。它所立基的模型 MAI-Transcribe-2 於 9 月 3 日以批次模型形式推出,WER 為 2.0%,且沒有即時 SKU;串流版本彌補了那個缺口,同時沒有放棄太多讓批次版本脫穎而出的準確度。它真正讓步的是價格:串流版推出時的費率是批次版的 5.4 倍。

微軟想要的定調,是橫掃串流排行榜。但數字所支撐的定調更狹窄,也更有趣——一個宣稱能同時在準確度與延遲上領先的模型,位於這樣一個前沿:排行榜上最準確的項目,其穩定所需的時間是最快項目的四倍,而那些最快項目中,沒有一個的詞錯誤率低於 3%;其定價與現任者持平,而非低於現任者。以下是發布當時的實況,並標註了廠商說法。

Microsoft 於 10 月 1 日發布了什麼

MAI-Transcribe-2-Streaming 透過 Microsoft 的語音技術堆疊,在 Azure AI Speech 服務中提供,文件以該模型自身名稱發布,並採用與批次版本相同的僅 API、不提供權重的散布模式。它能轉錄 60 種語言,並具備自動連續語言偵測,因此一場在串流中途切換語言的作業階段不需要事先宣告。Microsoft 將其定位在 Artificial Analysis 串流圖表的準確度與延遲 Pareto 前沿上——這是該廠商自身對這份追蹤器資料的解讀,也是該追蹤器自家圖表所支持的解讀。

串流模型並非這次發布的全部。Microsoft 同時推出了兩款語音模型:MAI-Voice-2.1,涵蓋 26 個地區設定中的 23 種語言;以及 MAI-Voice-2.1-Flash,可在約 150 毫秒延遲下處理長達 45 秒的音訊。整體來看,10 月 1 日這波發布是一套完整的即時對話堆疊——聽取、理解、說話——而不只是單一模型的推出。

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

正在讀取串流排行榜

AA-WER Streaming 針對每個模型衡量兩件事:完稿轉錄稿錯得有多離譜,以及講者停口後要多久才會完成。Microsoft 的說法是,MAI-Transcribe-2-Streaming 在兩者上都領先:語音結束後 0.13 秒,最終轉錄稿的詞錯誤率為 2.5%,而在 0.12 秒時,首份部分轉錄稿同樣是 2.5%;Microsoft 表示,這在兩項準確度上都是首見。請把這當成廠商自報數字來讀——截至撰稿時,該追蹤平台的自家串流排行榜尚未把這個模型繪入圖中,因此並沒有獨立的 MAI-Transcribe-2-Streaming 資料列可讀。排行榜倒是清楚顯示了它聲稱要擊敗的這個競爭群體,而這個群體比「稱王」這種說法所暗示的更為接近:

• Grok Voice Transcribe 2.0 — 根據 Artificial Analysis,在語音結束後 0.49 秒時,最終轉錄稿 WER 為 2.73%,且是目前排行榜上的榜首。這比 Microsoft 宣稱的 2.5% 落後 0.23 個百分點,而且大約要四倍時間才能穩定下來——這正是跟得上的字幕與會落後的字幕之間的差別。

• Muse Voice Transcribe — 根據 Artificial Analysis,在 0.16 秒下為 3.06%。延遲方面最接近的競爭對手:約落後 30 毫秒,且在準確度上比 Microsoft 所宣稱的差 0.5 個百分點。

ElevenLabs Scribe v2 Realtime — 根據 Artificial Analysis,以 0.14 秒達到 3.59%。速度上基本上並駕齊驅,準確度則落後超過一個百分點。

• Gemini 3.5 Transcribe Live — 0.40 秒延遲下達到 4.00% 串流 WER,這是由 Artificial Analysis 公布、且 Google 為自家 Live API 模型引用的數字。這代表 1.5 個百分點的差距,而這正是本次發布所瞄準的比較。

「首個部分結果」欄位,正是這項說法與排行榜其餘資料最不相符的地方。在同一個追蹤表上,Grok Voice Transcribe 2.0 的首個部分結果為 3.36%,而 Gemini 3.5 Transcribe Live 則為 5.77%——部分結果理應比最終轉錄稿更差,通常會差一個百分點以上,因為模型在句子結束前就已經先輸出內容。首個部分結果竟與最終數字相符,正是 Microsoft 這次發布真正不尋常之處,而這也是追蹤表自身資料尚無法證實的部分。在有資料列出現之前,請將其視為一項未經證實的說法來引用。

老實說,但書在於:對閱讀字幕的人來說,0.13 秒和 0.16 秒是同樣的產品體驗,而 2.5% 對上目前領先排行榜的 2.73%,相當於每 1,000 字約 2 個錯誤。這樣的領先幅度確實存在,但很小,而這是否是任何人感受得到的領先,取決於工作負載。真正會造成痛點的是尾端:客服中心每天運作八小時的串流,錯誤率 2.73% 對比 2.5%,一年下來就多出數萬個錯誤字詞;而轉錄稿中的字詞錯誤並非平均分布——它們正好集中在讓轉錄稿有用的專有名詞與數字上。

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

每 1,000 分鐘 9.00 美元能買到什麼

串流比批次更貴,而 Microsoft 將其定在即時層級的頂端,而非其下。MAI-Transcribe-2-Streaming 的標價為每音訊小時 0.54 美元,換算下來是每 1,000 分鐘串流音訊 9.00 美元,並被描述為適用到年底的導入期優惠費率。相較之下,批次版 MAI-Transcribe-2 為每音訊小時 0.10 美元——每 1,000 分鐘 1.67 美元——因此即時轉錄的費用約為同一底層系列檔案式費率的 5.4 倍,且詞錯誤率高出 0.5 個百分點。這不是 Microsoft 藏起來的加價;而是持久連線,以及必須在句子結束前就正確的部分轉錄,所對應的誠實價格。

相對於串流層級的其他產品,整體情況好壞參半。MAI-Transcribe-2-Streaming 與 Gemini 3.5 Transcribe Live 打成平手,價格約為每 1,000 分鐘 9 美元——更準確,價格相同。它高於約每 1,000 分鐘 6.50 美元的 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux,高於約 4 美元的 Cartesia Ink-2,並且大約是約 3 美元的 Muse Voice Transcribe 的三倍。因此,這次發布是在同價位下主打準確度與延遲,而非價格戰;已經採用較便宜串流模型的團隊,將以金錢換取 WER 的百分點。

那個取捨值得精確命名,因為它正是批次推出所反轉的同一個取捨。九月,Microsoft 讓準確度變便宜。十月,它讓即時準確度的成本變得和所有人一樣。如果你的管線最終只需要逐字稿,10 月 1 日沒有任何事會改變你的帳單。如果它需要在通話仍在進行時就拿到逐字稿,那盤算就轉向品質了。

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

在逐字稿之上建構,是那個決策的另一半,也是多模型層能真正發揮價值的地方。即時逐字稿很少是流程的終點——它會被摘要、評分、搜尋、路由與升級,而這些步驟會依不同成本需求選用不同模型。OrcaRouter 正是為這一層而存在:單一 API 串接 200 多種模型、以 0% 加成直接傳遞供應商定價、自動容錯移轉,以及一套路由 DSL,能將即時逐字稿送往一個模型進行合規審查、送往另一個模型產生會議記錄,而無需第二次整合。MAI-Transcribe-2-Streaming 本身並不在那份名單上——它是透過 Microsoft 自家的語音堆疊提供服務——但它所產生的串流逐字稿,正是那種高流量、對延遲敏感的輸入,足以證明在其上方的這一層應保持模型中立。

什麼尚未被證明?

有三件事確實還沒有定論。第一,語者分離:批次模型把說話者歸屬一起打包,卻沒有公布語者分離錯誤率,而 Microsoft 的串流資料完全沒有提出語者分離的主張——對於要餵給即時客服輔助或字幕的即時模型來說,誰說了什麼往往是比原始 WER 更重要的功能。第二,多語言細分:支援 60 種語言並具備自動連續語言偵測是一項涵蓋範圍很廣的主張,而串流模型的各語言延遲可能比批次模型變動大得多,因為部分轉錄品質取決於模型多快確定語言。Microsoft 沒有公布任何各語言串流表。第三,串流 WER 是在乾淨的基準測試音訊上測量的;真正傷害實際部署的失效模式是吵雜的遠場串流,而發布當天並不存在獨立的遠場串流比較。

它會把你的技術棧留在什麼狀態

這次推出有趣的地方,不在於 Microsoft 擁有最準確的串流轉錄,而在於它的節奏:九月推出批次、十月推出串流,屬於同一系列,放在同一個文件平台上,且定價結構如今涵蓋每 1,000 分鐘 $1.67 到 $9.00,對應的卻是同一項底層能力。這讓團隊首次擁有真正的選擇——只在即時性重要的地方為即時付費,其餘全部走批次——但這也意味著,轉錄層現在成了要依工作負載逐項調校的東西,而不是標準化一次就定案。

字面解讀這則頭條宣稱,它作為廠商說法是站得住腳的:微軟表示 MAI-Transcribe-2-Streaming 在最終轉錄稿與首次部分結果的準確度上都名列第一,而且座落於帕雷托前緣之上。那些星號註記在於:追蹤排行榜還沒把這個模型標繪上去、它宣稱對現任領先者的領先幅度小到可能在一場重跑中就消失、價格優勢為零,而且語者分離這一段故事根本還沒說。這些才是該盯緊的事,而不是那頂王冠。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新