文章主圖卡片標題為「MAI-Transcribe-2 vs GPT Transcribe」,附有「模型比較」徽章與副標題「微軟在每一項數據上都勝過 OpenAI 的轉錄服務」;卡片上的比較標籤顯示:AA-WER 2.0% 對 3.31%、每 1,000 分鐘 $1.67 對 $4.50、約 411 倍對約 34 倍即時速度。背景為白至藍漸層,右下角為 OrcaRouter 標誌。
Guides & Insights

MAI-Transcribe-2 對決 GPT Transcribe:微軟在每一項數字上都壓過 OpenAI 的轉錄

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

有三個數字讓 MAI-Transcribe-2 與 GPT Transcribe 畫出界線,而每一個都指向相同的方向。在 Artificial Analysis 的非串流字錯誤率排行榜上,Microsoft 於 2026 年 9 月 3 日發布的 MAI-Transcribe-2 的 AA-WER 為 2.0%,而 OpenAI 於五週前的 2026 年 7 月 28 日推出的預錄轉錄 API GPT Transcribe 則為 3.31%。在同一排行榜的速度係數上,MAI-Transcribe-2 的執行速度約為即時的 411 倍,而 GPT Transcribe 則約為 34 倍。在價格上,MAI-Transcribe-2 標價為每音訊小時 0.10 美元——作為限時上市優惠,約每 1,000 分鐘 1.67 美元——而 GPT Transcribe 為每 1,000 分鐘 4.50 美元。最後這項差距是 63% 的削價,而且落在 OpenAI 幾週前才剛調降 25% 的產品上。這就是當第二個前沿實驗室決定在價格上競爭時,商品化市場所呈現的面貌。

差距,一次一個數字

準確度第一,因為這項數據是兩家廠商都無法靠行銷話術迴避的。2.0% 與 3.31% 出自同一個獨立測試架構 Artificial Analysis,並同時套用於兩個模型——這使得 1.3 個百分點的差距成為整場比較中最乾淨的事實:在相同的 WER 水準上,每千字大約少了十三個錯誤。GPT Transcribe 的 3.31% 本身已比上一代 GPT-4o Transcribe 進步約 0.7 個百分點,而 OpenAI 自家的多語言測試也顯示,它讓 Whisper 時代的錯誤率大致減半。Microsoft 如今已明確奪下同一份榜單的第二名,而在多語言 FLEURS 上,它宣稱在 60 種語言中平均 WER 為 5.2%——這個數字來自 Microsoft 的發表文章,尚未按語言獨立重新驗證。

接著談速度。GPT Transcribe 約 34 倍的即時速度,對非同步轉錄端點來說是典型表現:一小時的檔案約需兩分鐘的計算時間。MAI-Transcribe-2 約 411 倍的即時速度,則能在不到九秒的計算時間內轉錄同一小時的內容。根據 Artificial Analysis 的數據,真正的差距其實接近 12 倍;微軟以「比 OpenAI 的 GPT-Transcribe 快 10 倍」來行銷,這是廠商把自身優勢向下取整而非向上取整——一個不尋常的訊號。誠實而言,需有所保留:MAI-Transcribe-2 的數據是四天前的,且屬於批次檔案的吞吐量,而非即時延遲;GPT Transcribe 的數據背後則已有五週的實際生產流量。但就兩款產品的架構來看,沒有任何跡象顯示這速度差距會縮小;它們是為相同的批次任務而生,但效率卻截然不同。

價格之所以放在最後,是因為價格才是改變決策的數字。GPT Transcribe 的牌價為每分鐘 $0.0045——也就是每 1,000 分鐘 $4.50,約每個音頻小時 $0.27——這是 OpenAI 在七月將 GPT-4o Transcribe 的每分鐘 $0.006 調降之後的價格。MAI-Transcribe-2 的牌價在年底前為每個音頻小時 $0.10,促銷期之後的標準價格則未公布。以每月 1,000 小時的音頻來算,價差約為 $170:以 MAI-Transcribe-2 的早鳥費率計算約為 $100,而以 GPT Transcribe 的牌價計算則約為 $270。OpenAI 在七月降價 25% 看似激進;微軟以比降價後價格再低 63% 的價格切入,是另一個等級的動作,而這正是這篇比較之所以存在的原因。

A two-column scoreboard titled 'MAI-Transcribe-2 vs GPT Transcribe — the scoreboard': left column MAI-Transcribe-2 lists 2.0% AA-WER, ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages, bundled diarization and verbatim/clean styles; right column GPT Transcribe lists 3.31% AA-WER, ~34x real time, $4.50 per 1,000 minutes, languages not published, no diarization and caller-side post-processing; footer notes AA-WER and speed per Artificial Analysis and vendor list prices.

為什麼 OpenAI 的數字才是可信的

GPT Transcribe 的 3.31% AA-WER 之所以比大多數發布數字更有分量,是有原因的:它經過獨立審計,而這項審計在面對困難音訊時依然站得住腳。同一輪產生這項頭條數字的 Artificial Analysis 測試,也暴露了 GPT Transcribe 的弱點——在 Earnings22 財報電話會議集上達到 6.10% 的 WER,這是該類別中最難的公開基準——這正好讓買家確切知道不該把它用在何處。接下來是五週的實際生產流量,OpenAI 的降價顯示它是在成本上競爭,而非防禦性地保護利潤率。GPT Transcribe 也繼承了其 API 的實際限制:它是一個僅批次處理的產品,每次請求的檔案上限為 25 MB,以 $4.50 的價格並未提供串流層級,沒有說話人分離、沒有詞彙偏向,也不支援 OpenAI 未公布的語言。它只管轉錄;在字詞之上的所有處理,都是呼叫方的責任。

正是這種清晰度,讓 GPT Transcribe 容易贏得信任;而這也正是「才發布四天的模型」尚未贏得的清晰度。微軟至今未公布 MAI-Transcribe-2 的說話者分離錯誤率,也未提供其 60 種語言 FLEURS 平均值背後的分語言準確度表格,更沒有推出串流 SKU。這些闕漏並不代表該模型能力不足——內建說話者分離與 60 種語言的覆蓋範圍,是 GPT Transcribe 甚至不提供的實質產品功能面——但每一項闕漏,都是一個讓獨立複測可能改寫敘事的環節。那個準確度數字是經 AA 實測、真實可信的;但環繞著它的產品本身,尚未在那些只有實際生產流量才能驗證的層面上得到證明。

特徵集的形狀不相同

• 語者分離 — MAI-Transcribe-2 提供說話者歸屬功能,但未公布錯誤率;GPT Transcribe 完全沒有這項功能,因此轉錄稿是未經區分的單一文字串流。

• 控制——MAI-Transcribe-2 提供針對人名和術語的關鍵字偏置,以及逐字與潔淨轉錄風格;GPT Transcribe 兩者皆無,僅回傳原始文字與無標點內容,由呼叫端自行後處理。

• 時間戳記 — 兩者皆回傳時間對齊的輸出;MAI-Transcribe-2 則開箱即提供詞級的時間戳記。

• 語言 — MAI-Transcribe-2 公布支援 60 種語言並具備自動識別功能;GPT Transcribe 並未公布其語言清單,這對於多語言工作負載而言本身就是一項規劃問題。

• 串流功能 — GPT Transcribe 的 $4.50 方案僅提供批次處理,而其串流版本 GPT Live Transcribe 則為獨立產品,價格為每 1,000 分鐘 $17;MAI-Transcribe-2 則完全沒有串流產品,無論是已公布的還是已展示的皆無。

• Shape — 兩者都是針對預錄檔案的受管理 API,因此這場競爭是公平的;差別在於 Microsoft 將更多實用的後期處理功能放進基本產品,而價格只要三分之一。

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

誰應該搬家,以及何時?

如果你要轉錄大量批次音訊,而且早鳥費率經得起你自己檔案的考驗,{{1}}MAI-Transcribe-2{{/1}} 就是目前理性的預設選擇:實測 WER 更低、吞吐量約為現有方案的十二倍、每千分鐘價格便宜 63%——而且還內建了 OpenAI 未提供的說話人分離與風格控制;沒有提供的功能,自然不會額外收費。轉換成本很低:用一小段你自己最難處理的音訊測一測,就能消除大半不確定性;而每千分鐘 $1.67 的費率更讓這項實驗在年底前幾乎免費。

如果你的工作負載屬於生產環境關鍵任務、受法規監管,或已經以 OpenAI 為核心來整合,那麼五週的領先優勢,以及已公開的 Earnings22 弱點,都比價差更有價值。GPT Transcribe 是你能具體說出失敗模式的模型;MAI-Transcribe-2 的失敗模式則仍在被發掘。穩健的做法,正是路由層存在所要支援的:讓經過驗證的模型繼續擔任預設,把一小部分受控流量導給挑戰者,先在你自己的資料上比較轉錄結果,再考慮全面升級。這種「先試驗、再升級」的紀律,正是 OrcaRouter 自動容錯轉移與路由 DSL 的核心意義——新模式以百分比逐步贏得正式流量,而非靠一紙命令;同一套一鍵設定即可連上 200 多種模型,也讓轉錄供應商之上的其餘技術堆疊,在 STT 競爭塵埃落定之前始終與供應商無關。

MAI-Transcribe-2 數字背後的發布文章,把一切框定為與指名競爭者的比較,而非絕對數值——這對任何閱讀者來說都是一項有用的紀律檢查:將相對宣稱拿去對照獨立排行榜上的絕對數字,其餘則標記為廠商話術。

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

「1.67美元的費率有到期日,而2.0%的聲譽只能維持四天,OpenAI最終會對兩者作出回應。但這個市場的樣貌剛剛改變:第一次,最便宜的高準確度受管轉錄API,同時也是最準確、最快的,而且它不是OpenAI的。即使MAI-Transcribe-2的標準價格遠高於上市優惠價,受管轉錄中「每美元準確度」的門檻已經被抬高——而且是以微軟的條件抬高的。」

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新