為 Voxtral Mini 4B Realtime Arabic 與 Grok Voice Transcribe 2.0 的比較所生成的主視覺標題卡,副標題為「一位標籤排行榜領先者遇上一位專精 16 種方言的阿拉伯語專家」,徽章為「Mistral 儲存庫,2026 年 10 月 8 日」,並有三個數據標籤,分別顯示 480 毫秒下 8.82% 的阿拉伯文字元錯誤率對比 0.49 秒下 2.7% 的詞錯誤率、16 種具名方言對比 38+ 種未記載語言,以及 Apache 2.0 權重對比每音訊小時 $0.20,右下角的白色橫條中還合成有 OrcaRouter 標誌。
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0:排行榜領先者遇上方言專家

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個比較誠實的起點是:Voxtral Mini 4B Realtime Arabic 和 Grok Voice Transcribe 2.0 並不是在爭奪同一項任務,而要看穿這點,最快的方法就是檢視兩家廠商各自願意公開哪些資訊。Mistral AI 於 2026 年 10 月 8 日把 Voxtral Mini 4B Realtime Arabic 放上 Hugging Face,卻沒有任何公告——Apache 2.0 權重、一張列出十六種阿拉伯語變體的模型卡,以及一項單一準確度數字:在 480 毫秒延遲下,七項阿拉伯語基準測試的平均字元錯誤率為 8.82%。xAI 的 Grok Voice Transcribe 2.0 於 2026 年 9 月 18 日推出,伴隨一篇發布貼文、一個價格,以及一項第三方排行榜結果:最終轉錄稿的詞錯誤率為 2.7%,文字會在講者停止說話後 0.49 秒定稿,推出時在 Artificial Analysis 的串流語音轉文字排行榜上名列第一。其中一個模型會明確告訴你它處理哪些方言,並拒絕在這些方言之外妄加猜測。另一個則告訴你它涵蓋 38 種以上語言,卻連一種都沒逐一列出。

這種不對稱就是整個比較的重點。如果你是要為混合語言音訊大量購買轉錄量能,xAI 模型是完整度遠勝的產品。如果你的音訊是阿拉伯語——尤其是方言阿拉伯語,而非廣播的現代標準阿拉伯語——Mistral 檢查點所針對的問題,是 xAI 模型居冠的那個排行榜並不衡量的;而若因為它在該榜上排名第二而非第一,就把它解讀為定論,那就錯了。

價格計算,因為這裡異常地簡潔。

xAI 公佈費率。Mistral 公佈下載。這個差異驅動了所有下游環節,所以從實際存在的數字開始。

• Grok Voice Transcribe 2.0 — 針對錄音檔案,透過 REST 每音訊小時 $0.10;透過串流 WebSocket 每音訊小時 $0.20。也就是批次處理每千分鐘約 $1.67,串流每千分鐘約 $3.33,與 Grok Voice Transcribe 1.0 在相同價格點維持不變。

• Voxtral Mini 4B Realtime Arabic — 沒有公開定價,因為沒有公開的服務。權重採用 Apache 2.0,且以 BF16 計約有 44 億個參數,這表示成本取決於你搭配的 GPU,以及你能從中獲得的利用率。在持續有量的情況下,這很便宜;在零用量的情況下,這是本文中最昂貴的選項,因為你是在為閒置的硬體付費。

這個損益平衡點並不細微。每小時 0.20 美元的串流費率,大約是每分鐘三分之一美分。任何你用來跑 4.4B 模型的加速器,每小時成本都高於這個數字,除非你讓它持續處理穩定流量;這意味著開放權重路線只有在你的阿拉伯語流量足以讓一台機器保持忙碌之後,才會在成本上勝出——而在你達到那個規模的過程中,它在其他每個面向都處於劣勢,因為 API 沒有資本支出、沒有容量規劃,也沒有營運負擔。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

最早讓盤算翻轉的一點,就是合規。Mistral 檢查點在你掌控的硬體上處理音訊,因此沒有任何東西會離開你的網路,而且該卡隨附一個正規化模組,所以阿拉伯語評分流程可由你自行稽核。Grok Voice Transcribe 2.0 在 xAI 的區域中運行,且根據其文件,會即時處理音訊,不會保留音訊或將其用於訓練,並以 SOC 2 Type II 與 HIPAA 適用資格為後盾。兩種說法都站得住腳;但只有其中一種能讓監管機關檢查程式碼路徑。

每小時 $0.20 究竟能買到什麼,以及 Mistral 模型並未推出

這裡的功能差距比準確度差距更大,而且被討論得少得多。Grok Voice Transcribe 2.0 是一款具備介面的產品;Voxtral Mini 4B Realtime Arabic 則是一個會輸出文字的檢查點。

• 語者分段 — Grok Voice Transcribe 2.0 已內建此功能,並支援最多八個獨立聲道的多聲道轉錄。Mistral 的產品卡未列出語者分段功能;該模型產出的是逐字稿,而非標註講者的逐字稿。

• 詞級時間戳記 — Grok 會附帶信心分數一併提供,因此你可以對低信心的片段設定閾值,而不是對整份轉錄稿一視同仁地信任。Mistral 的說明卡並未聲稱此檢查點支援時間戳記。

• 關鍵詞偏誤引導(Key-term biasing)——在 Grok 端點上,每個請求最多可設定 100 個領域詞彙,這正是讓模型不必微調就能正確辨識產品名稱、帳號代碼與地名的方法。Mistral 要達成相同結果的途徑,是用你自己的資料進行微調——Apache 2.0 允許這麼做,而託管端點則不允許。

• 反向文字正規化 — Grok 能將數字、日期、貨幣、電話號碼和電子郵件地址轉換為書寫形式,涵蓋 25 種語言。Mistral 的說明卡包含一個正規化指令碼,但其所述用途是為阿拉伯語基準評分,而非將輸出格式化以供顯示。

• 介面範圍 —— 檔案最大 500 MB 時使用 REST,WebSocket 串流位於 wss://api.x.ai/v1/stt,約每 500 毫秒提供一次暫時結果,官方文件載明每秒 10 次請求與 100 個並行串流工作階段,目前僅支援單一區域。Mistral 方面,採用 vLLM 提供服務,WebSocket 位於 /v1/realtime,或使用 5.2.0 版起的原生 Transformers,除了你的硬體之外沒有任何速率限制。

如果你需要語者分離與時間戳記,那麼在準確度被納入考量之前,這場比較就已經結束了。這並不是在貶低 Mistral 模型——一個受過訓練、以產出準確方言文本為目標的 4B 阿拉伯語專門模型,與一般轉錄服務屬於不同的工程目標——但這確實意味著,唯有你的管線把轉錄稿當成自身後處理的原料,兩者才會變得可以互換。

語言清單問題

兩家廠商從相反方向描述語言支援,卻同樣讓同一個問題懸而未答。

• Grok Voice Transcribe 2.0 — 支援 38 種以上語言,具備自動語言偵測,並能在單次處理中於錄音期間切換語言,涵蓋 12 種從 8 kHz 到 48 kHz 的音訊格式。文件提供的是數量,而非清單。資料中沒有任何地方個別提及阿拉伯語,這意味著阿拉伯語支援是從數量推斷而來,而非由廠商確認。

• Voxtral Mini 4B Realtime Arabic — 明確列出十六種阿拉伯語變體:現代標準阿拉伯語;來自馬格里布的摩洛哥、利比亞、突尼西亞、阿爾及利亞與哈桑尼亞阿拉伯語;來自波斯灣地區的海灣、納吉迪、阿曼與薩那阿拉伯語;來自尼羅河流域的埃及與蘇丹阿拉伯語;美索不達米亞阿拉伯語,以及南黎凡特與北黎凡特阿拉伯語;還有查德阿拉伯語。該集合之外的一切都不在範圍內,且卡片上說明應改用通用即時模型。

所以,「這兩者中哪一個更能處理阿拉伯語」這個問題有著奇怪的結構。Mistral 模型是有紀錄可查的阿拉伯語專家,具有已發表的阿拉伯語錯誤率,卻沒有獨立驗證。xAI 模型是有紀錄可查的排行榜領先者,但其供應商甚至完全未確認阿拉伯語是否在涵蓋範圍內。一份包含阿拉伯語的 38 種語言計數,以及一份只包含阿拉伯語的 16 種方言清單,兩者都在回答「它處理阿拉伯語嗎」這個問題——但只有其中一個是在回答「它處理 Darija 嗎」。

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

排行榜在這裡幫不上忙。Artificial Analysis 的語音轉文字評估是一個固定的混合體,權重偏向代理對話,這對一般轉錄而言是正確的取捨,但要讓某種阿拉伯語方言的勝出浮現出來,卻是不對的。一個模型可能在海灣阿拉伯語和摩洛哥阿拉伯語上確實更出色,卻在那個排行榜上只顯得表現不錯。這不是對該排行榜的批評;而是不該將它當作唯一依據的理由。

準確度,以不換算的單位

• Grok Voice Transcribe 2.0 —— 最終轉錄稿的詞錯誤率為 2.7%,達到最終結果的時間為 0.49 秒,而首次部分轉錄結果的詞錯誤率為 3.4%;兩者皆以 Artificial Analysis 的 AA-WER v2 指數衡量,該指數混合了私有的 agent-talk 資料集與 VoxPopuli 和 Earnings22。首次部分轉錄結果的數字才是值得注意的一點:它從 Grok Voice Transcribe 1.0 的 18.3% 降了下來,而這正是可據以路由的部分轉錄稿,與只能顯示的部分轉錄稿之間的差別。

• Voxtral Mini 4B Realtime Arabic — 在延遲 480 毫秒下,於七項阿拉伯語基準測試中的平均字元錯誤率為 8.82%,此數據來自該廠商自身的評估,並搭配其隨附的正規化腳本。Mistral 報告指出,這與 CER 為 7.91% 的 Voxtral Transcribe Arabic 僅相差 0.91 個百分點;後者是來自同一實驗室的離線阿拉伯語模型——這項比較比跨廠商的比較更具參考價值,因為雙方的基準、正規化與量測方式完全相同。

把 2.7% 和 8.82% 並列,並不是比較;那是範疇錯誤。詞錯誤率是將錯誤的詞與參考答案比對計算,字元錯誤率則是計算錯誤的字元;而阿拉伯文正字法——同一個詞可以容忍多種合法拼寫,且附著詞可自由附接——會使這兩項指標之間的差距,遠大於拉丁字母語言所顯現的程度。語料庫不同,正規化不同,而且只有一個數字來自第三方。這兩個數字能合理告訴你的是:xAI 模型是一個經實測、排名良好的通用轉錄器,而 Mistral 模型則是一個號稱阿拉伯文專用的轉錄器。它們無法告訴你,哪一個更能轉錄你的音訊。

真正有說服力的比較,是 Mistral 自家模型卡裡的那一個:串流 8.82%,離線 7.91%,同樣七項基準測試、同樣的正規化、同一個實驗室。相對於批次模型,串流在阿拉伯語上大約要犧牲一個百分點的準確率。這是否划算由你決定,而現在這是個有充分資訊的決定。

小模型勝出之處,並不在計分板上

關於 Mistral 檢查點的三件事,其價值遠超過數字所顯示的,而且它們沒有一項出現在任何排行榜上。

首先是方言分類體系本身。將十六種變體列為不同的訓練目標,包括哈桑尼亞阿拉伯語和查德阿拉伯語,這是在表明模型的錯誤是在哪裡被測量的。一個將阿拉伯語列為 38 種語言之一的通用多語言模型,會先從現代標準阿拉伯語上改進,因為大部分的訓練訊號與基準權重都集中在那裡。一個為摩洛哥合作夥伴關係、與北非某個部會共同打造的模型,則是針對不同的分布進行最佳化,而且它是與兩個基準——ISMA 和 Darija in the Wild——共同開發的,這兩個基準是專門為了衡量這一點而建立。

第二個是可配置的延遲。8.82% 這個數字是在 480 毫秒的條件下提出的,而且延遲是可調整而非固定的,這讓準確率數字變成操作者可自行挑選的曲線上的一個點。對於即時字幕工作,你可以縮短延遲並接受更多錯誤;對於通話錄音流程,你可以拉長延遲並把準確率換回來。Grok Voice Transcribe 2.0 呈現的是固定的操作點,而供應商自家的升級路徑說明了這為何會帶來後果——從 1.0 升到 2.0,首次部分結果與最終結果的延遲都多出約三分之一秒,而你能採取的補救方式是鎖定舊模型,而不是調整旋鈕。

第三點是,Apache 2.0 授權對你手上的權重是無條件授予的。無論上游的檢查點發生什麼事——無論它被公告、定價、棄用,還是從此不再被提及——該產物依然可供下載、微調,並能放進你自己的產品中出貨。託管端點的費率表與其模型退役時程,兩者都由供應商決定變更;而 xAI 已經表明打算讓 Grok Voice Transcribe 2.0 成為預設版本並淘汰 1.0,這將使所有從未傳入模型參數的整合,立刻一併移轉到新的延遲特性。

在逐字稿之上的路由層,有一個實務提醒:這兩個模型都不是我們代管的語音轉文字模型,本文也沒有這樣主張。OrcaRouter 涵蓋的是取用該串流的語言模型層——摘要器、分類器、代理——透過單一 API 金鑰串接超過 200 個模型,以供應商定價、0% 加成提供,因此供應商的價格變動當天就會反映在這裡。為了語言涵蓋範圍而使用兩家語音供應商的團隊,早已背著兩份合約與兩條驗證路徑;把下游那一半收攏到單一金鑰,是最划算的一步。

這該怎麼處理?

如果你的音訊是多語內容、如果你需要開箱即用的說話者分離、時間戳記或關鍵術語偏置,或者如果你想要一項今天就有公開費率與支援途徑的服務,就採用 Grok Voice Transcribe 2.0 來開發。它是更完整的產品,由第三方進行評測,而且每音訊小時 $0.20 的串流費率夠低,以至於開放權重的成本論點在你達到可觀用量之前都不具說服力。

如果你的音訊是阿拉伯語,而且特別是方言,如果你因為合規理由需要把模型放在自己的網路內,或者你打算進行微調,那就以 Voxtral Mini 4B Realtime Arabic 為基礎來開發——因為這其中只有一項允許這麼做。首先要接受三件事:沒有語者分離、沒有時間戳記,也沒有任何人發表獨立評估。在權重出現兩天後,最後這點並不是警訊;它只是證據目前所處的狀態。

最快能改變這項比較的,是針對阿拉伯語、以真實方言音訊進行的評估,由兩家廠商之外的第三方執行,並對兩個系統套用相同的正規化。在這種評估出現之前,決策只能依據某家廠商自己列出的方言清單,對照另一家廠商自己未公開的清單,而唯一可靠的測試就是你的錄音。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

這兩個端點都不是我們提供的服務——這是一份針對我們型錄之外兩套系統的比較——但取用逐字稿的模型是可路由的:單一 API 金鑰即可使用超過 200 個模型,以供應商定價、0% 加成計費,因此摘要器或分類器的價格若有變動,公告當天就同步生效。

自動容錯移轉能讓雙供應商語音設定不至於把兩個單點故障帶進依賴它運作的語言層。