
Voxtral Mini 4B Realtime Arabic 對比 MAI-Transcribe-2-Streaming:兩個十月登場的產品,兩個證據問題
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
這兩款即時語音模型相隔七天問世,而且登場方式截然相反。MAI-Transcribe-2-Streaming 是 Microsoft AI 首款串流轉錄模型,於 2026 年 10 月 1 日發布,伴隨一篇發布文章、一則 Azure 預覽版刊登資訊、每音訊小時 0.54 美元的優惠價(至年底),並宣稱在 Artificial Analysis 的串流排行榜上,於最終與部分轉錄準確度雙雙位居第一,詞錯誤率為 2.5%,最終文字在語音結束後 0.13 秒即可備妥。Voxtral Mini 4B Realtime Arabic 是 Mistral AI 的阿拉伯方言串流模型,於 2026 年 10 月 8 日發布到 Hugging Face,完全沒有任何公告——沒有部落格文章、沒有價格、沒有服務,只有 Apache 2.0 權重,以及一張模型卡,報告在七項阿拉伯語基準測試中,於 480 毫秒延遲下平均字元錯誤率為 8.82%。Microsoft 模型是完成品,卻帶著無法驗證的頭條宣稱。Mistral 模型是可驗證的產物,卻沒有圍繞它的產品。兩者都值得深入了解,正因為兩者都讓核心問題——它處理阿拉伯語的效果如何——僅由供應商來回答。
這個比較無論如何都值得做,因為這兩個模型從相反的兩端界定同一個工程決策。Microsoft 賣的是廣度與受管服務:六十種語言,具備自動連續語言偵測,在 Azure AI Speech 內運行,按小時計價,目前為預覽版。Mistral 則免費提供深度:十六種具名阿拉伯語變體,小到可在單一加速器上運行,並附上正規化指令碼,讓你可以自行稽核評分。如果你這個月要建立一條阿拉伯語轉錄管線,你就是在這兩個立場之間做選擇,而這個選擇取決於你目前無論在哪一邊都還沒有的證據。
各供應商實際上說了什麼,以及董事會怎麼說
證據落差是這場對決最重要的特徵,所以先講。
• MAI-Transcribe-2-Streaming — 在語音結束後 0.13 秒達到 2.5% 的最終轉錄稿字錯誤率,而首次部分結果在 0.12 秒時也有相同的 2.5%,兩者都在 Artificial Analysis 的 AA-WER Streaming 方法論上被列為準確度第一名。Microsoft 自己的說法。截至本文撰稿時,該追蹤器的串流排行榜尚未為該模型繪製任何一列,因此這項說法僅建立在該追蹤器的方法論上,背後並沒有追蹤器公布的數字。
• Voxtral Mini 4B Realtime Arabic — 在 480 毫秒的配置延遲下,於七項阿拉伯語基準測試中取得 8.82% 的平均字元錯誤率。Mistral 自家的模型卡,並附上評估程式碼。尚未有第三方重現此結果,而且該模型才推出兩天。
所以,本文的兩個頭條數字分別是:一個是依附在別人尺規上的廠商宣稱,另一個是附帶自家尺規的廠商宣稱。兩者都不是獨立測量。差別在於,Mistral 的數字附有你重新推導它所需的正規化腳本,而 Microsoft 的數字附帶的則是一個尚未把它放上圖表的排行榜。如果你正在做採購決策,這個差別比 2.5 對上 8.82 的差距更重要——而那個差距本來就毫無意義:詞錯誤率與字元錯誤率無法換算,阿拉伯文正字法還會大幅拉大兩者的差距。
Mistral 模型卡裡唯一真正站得住腳的比較,是拿它跟自家離線版本相比:Voxtral Transcribe Arabic 在相同七項基準、相同正規化下達到 7.91% CER,因此串流讓這個模型付出 0.91 個百分點的代價。Microsoft 在 2026 年 9 月 3 日推出批次版 MAI-Transcribe-2 時,也為自家系列公布了對應數字:2.0% 詞錯誤率——串流版本相較批次模型讓出半個百分點,同時增添即時傳遞能力。把這兩個廠商內部的落差並排來看,你就會得到本文唯一能真正同基準相比的陳述:在各自自家的基準上,每一家實驗室的串流 SKU 都落後自家的批次版本,一個案例約差一個百分點,另一個則差半個百分點,而且兩者量測的還是不同語言。

語言涵蓋範圍:60 對 16,而雙方都有同樣未命名的落差
• MAI-Transcribe-2-Streaming — 支援 60 種語言,並具備自動連續語言偵測功能,因此工作階段若在串流中途切換語言,也不必事先宣告語言。Microsoft 的發布資料提供了數量,但未列出清單;MAI-Transcribe 系列的 Azure 語言支援文件才是逐項列出涵蓋範圍之處,且該文件將阿拉伯語列為此系列支援的語言之一。
• Voxtral Mini 4B Realtime Arabic — 十六種阿拉伯語變體,逐一列出:現代標準阿拉伯語、摩洛哥、利比亞、突尼西亞、阿爾及利亞與哈桑尼亞阿拉伯語,海灣、納吉迪、阿曼與薩那阿拉伯語,埃及與蘇丹阿拉伯語,美索不達米亞以及南、北黎凡特阿拉伯語,還有查德阿拉伯語。在該集合之外,該模型在文件中標示為不在適用範圍內,並附有指向通用版 Voxtral Mini 4B Realtime 的指引。
這兩個數字都沒告訴你真正需要的資訊。Microsoft 的 60 是一個廣度計數,涵蓋阿拉伯語,卻未描述阿拉伯語的表現;發布文章只提了一次語言總數,接著就帶過。Mistral 的 16 是訓練目標的列舉,搭配橫跨七個基準測試集的單一彙總錯誤率,這表示方言層級的細分資料——也就是真正決定你的摩洛哥通話音訊能否轉錄的那項資訊——同樣沒有公開。兩個模型、兩家廠商,而在這兩種情況下,對於「它具體在波斯灣阿拉伯語上有多好」這個問題,誠實的答案都是:未說明。
列舉能給你的,是一種先驗。一個以查德阿拉伯語和哈桑尼亞阿拉伯語為具名目標的模型,是針對北非分佈進行調校的;Mistral 與摩洛哥的 Ministère de la Transition Numérique et de la Réforme Administrative 共同開發了它,並與該部會一起打造了七項基準中的兩項——ISMA 和 Darija in the Wild——專門用來衡量困難案例。通用的 60 語言模型會先改善現代標準阿拉伯語,因為訓練訊號的量能就在那裡。如果你的音訊是達里賈或海灣阿拉伯語,那些是不同問題,而這兩家供應商中,只有一家曾對其中任一個提出數字。
延遲與延遲的形態
• MAI-Transcribe-2-Streaming — 從語音結束到最終轉錄稿為 0.13 秒,而首批部分結果在 0.12 秒出現,這樣的速度快到讓部分結果與最終結果的延遲實際上相同。這是 Microsoft 的宣稱,並依追蹤器的方法論進行測量。
• Voxtral Mini 4B Realtime Arabic — 在已公佈的準確度點上,設定延遲為 480 毫秒,且延遲可調整。這大約是 Microsoft 數據的三倍半,而且是操作員可選擇的參數,而非固定屬性。
零點三秒對一個需要在話語中途做出回應的語音代理來說是真實的差別,但對閱讀字幕的人類來說則幾乎不可見。這同時也是可調旋鈕與固定數字之間的差別。Mistral 的延遲參數意味著你可以調得更緊並接受更多錯誤,或調得更鬆並把準確度換回來——這個檢查點所微調自的基礎模型,宣稱的範圍從 240 毫秒到 2.4 秒——而微軟的操作點則是 Azure 實際出貨的設定。這讓微軟的數字更容易推敲,而 Mistral 的數字更容易調校,也意味著任何對這兩個準確率數字的比較,實際上都是在比較一條曲線上的兩個選定點,以及另一條曲線上的一個固定點。
功能介面的差異同樣鮮明,而且在準確度討論變得有趣之前,值得先對照你的管線需求檢查一下。
• MAI-Transcribe-2-Streaming — 透過 Azure AI Speech 提供,具備該系列記載的功能集:說話者分離、字詞層級時間戳記、關鍵字與片語加權、逐字與乾淨輸出樣式,以及自動語言識別。串流 SKU 本身關於說話者分離與時間戳記的文件比批次模型更簡略,因此請依各端點確認這些功能,不要假設兩者一致。

Voxtral Mini 4B Realtime Arabic — 此模型卡記載了使用因果音訊編碼器進行轉錄、透過 WebSocket 在 /v1/realtime 上提供 vLLM 服務、自 5.2.0 版起支援原生 Transformers,以及一個正規化模組。它並未記載此檢查點的說話者分離或詞級時間戳記。
交付模式:以預覽服務形式提供,而非可下載的權重
• MAI-Transcribe-2-Streaming — Azure 預覽版,這表示沒有 SLA,且供應商建議不要依賴於生產環境。定價為每音訊小時 0.54 美元,作為持續至 2026 年底的導入優惠價,標準費率則未公佈;批次版 MAI-Transcribe-2 以同樣的限時方案推出,價格為每音訊小時 0.10 美元。串流版費用是批次版費率的 5.4 倍。
• Voxtral Mini 4B Realtime Arabic — Apache 2.0,BF16 格式約有 44 億個參數,可下載、可微調,並可在單一加速器上提供服務。沒有價格、沒有 SLA,也沒有支援承諾,因為背後沒有支援。
那兩句話包含了決定。一個提供 introductory 費率且未公開標準價格的預覽服務,是一項會到期的承諾;5.4× 串流溢價以及到 2026 年的窗口,都是 Microsoft 可以改變的,而當標準費率出爐時,批次對串流的比率就是值得關注的數字。沒有公告的 Apache 2.0 權重則相反:那是沒有人能收回的產物,與一段沒有人描述過的供應商關係綁在一起。該檢查點是否會持續維護無從得知,但無論如何,你今天擁有的檔案仍會繼續運作。
產業特定限制往往才是實務上決定這類問題的關鍵。在受監管機構內部署的阿拉伯語客服中心,可能根本無法將音訊傳送到預覽版雲端端點;而已經標準化採用 Azure AI Speech 的團隊,也可能不想為了單一語系再建置第二套地端堆疊。這兩項限制都合理,而且兩者都與那兩次發布所主打、作為頭條的 2.5% 與 8.82% 數字毫無關係。
在轉錄層之上,同一點對兩者都適用。OrcaRouter 並不路由這兩個語音模型——這是對我們不提供服務的兩套系統的比較——但摘要器、分類器或取用轉錄稿的代理程式是可路由的:用一把 API 金鑰即可使用超過 200 個模型,按供應商定價、0% 加成,因此供應商價格若有變動,當天就會反映到我們這邊;供應商效能下降時也會自動容錯移轉。這在此處特別有幫助的地方是試用階段:把兩個轉錄候選方案指向同一條下游管線、放在同一把金鑰之後,就是你進行正面對決、而不必架設兩套整合的方式。
能解決這件事的測試
兩家供應商都未發布針對阿拉伯語的效能數據,也均未在方言音訊上接受獨立評估。因此,這項比較歸結為三項事實與一項建議。
事實如下:Microsoft 的串流模型速度更快,達 0.13 秒,並宣稱在一個尚未將它繪入的排行榜上具有更好的總體準確率;Mistral 的模型則公布了方言清單、阿拉伯語錯誤率,以及可重新推導該錯誤率的正規化程式碼,耗時 480 毫秒;而這兩個準確率數字無法互相比較,因為一個是詞錯誤率,另一個是在不同語料庫上的字元錯誤率。
建議:負責做這個決定的人,應該用自家的音訊把兩者都跑一遍,因為那是兩家廠商唯一都還沒提供數據的衡量方式。用真實錄音建立評估集——你實際收到的方言組成、你實際使用的編解碼器、你實際需要的領域詞彙——並以 Mistral 的正規化,對照你信任的參考答案來為兩者評分。用你自己的錄音做兩小時的測試,會比兩篇發布文章加起來告訴你更多,而且這是唯一能弄清楚以下事情的方法:那 0.13 秒的優勢,是否值得換來對預覽版的依賴以及 5.4 倍的串流溢價;或者一個可下載的 4.4B 模型、480 毫秒的表現,是否已經足以勝任這項工作。

OrcaRouter 並未提供這兩款語音模型,本文也沒有暗示它會——本文談的是讀取逐字稿的語言層:超過 200 款模型,共用一把金鑰,以供應商表定價格、0% 加成提供,因此下游模型的供應商價格若有變動,在公告當天就會反映到你身上。
自動容錯移轉讓兩個轉錄候選項目饋入單一下游管線,而非建立兩套整合,這也是進行正面對決最經濟實惠的做法。
