文章主視覺卡片標題為「Voxtral Mini 4B Realtime Arabic 對上 Gemini 3.5 Transcribe Live」,副標題為「15 種阿拉伯語方言的開放權重,對上 85+ 個語言地區的封閉 API」,並有一枚標章標示 Mistral 模型為 2026 年 10 月 8 日未經宣布的儲存庫發布,另有三個數據標籤:16 種阿拉伯語變體對上 85+ 個語言地區;480 毫秒下 8.82% 的字元錯誤率,對上 0.40 秒下 4.0% 的串流詞錯誤率;Apache 2.0 開放權重對上僅提供 API。OrcaRouter 標誌位於右下角的白色區塊中。
Guides & Insights

Voxtral Mini 4B Realtime Arabic 對比 Gemini 3.5 Transcribe Live:方言與廣度

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個串流語音轉文字模型,對轉錄的難點究竟在哪裡,下了兩種截然不同的賭注。Voxtral Mini 4B Realtime Arabic 是一個 44 億參數的微調模型,Mistral AI 在 2026 年 10 月 8 日把它推上公開儲存庫,沒有發布貼文、沒有部落格文章,也沒有在公司新聞索引中留下一行;它專門以現代標準阿拉伯語及十五種具名方言訓練,以 Apache 2.0 釋出,並提供可下載的 BF16 權重。Gemini 3.5 Transcribe Live 是 Google 的 Gemini 3.5 Transcribe 串流端點,於 2026 年 8 月發布,帶著平台級發布的完整陣仗,涵蓋 85 個以上的地區設定,而且是封閉的——一個沒有權重、工作階段上限十分鐘的預覽 API。一個模型在單一語系上往深處鑽,並在自己的限制說明中坦言此事;另一個則往廣處鋪開,卻未說明口音層級的保證。你想要哪一個,取決於一個兩家廠商的行銷都不會擺在第一位的軸線:你的音訊聽起來究竟是什麼樣子。

這不是對稱的比較,而且值得一開始就說清楚,而不是把它藏起來。Mistral 模型在撰寫本文時才問世 48 小時,沒有廠商公告、沒有獨立評估,也沒有公布價格。Google 模型自八月底以來一直處於公開預覽階段,並且是在第三方追蹤器上進行衡量。把 Mistral 那一邊視為一組來自模型卡的說法,並把 Google 那一邊視為一組量測結果加上一組說法,這樣比較才能保持誠實。

在數字之前,每個模型是什麼

• Voxtral Mini 4B Realtime Arabic — 一款串流 ASR 模型,微調自 Voxtral-Mini-4B-Realtime-2602,BF16 格式下約有 44 億個參數,透過因果式音訊編碼器與語言解碼器接收 16 kHz 音訊。它會在音訊抵達時輸出文字,並具備可設定的轉錄延遲;採用 Apache 2.0 授權,權重已發布於 Hugging Face。Mistral 與摩洛哥數位轉型與行政改革部(Ministère de la Transition Numérique et de la Réforme Administrative)依據 2026 年 1 月簽署的合作協議共同開發,並將該模型描述為主權 AI 資產。

• Gemini 3.5 Transcribe Live — 這款雙模型發佈中的串流部分。Live API 端點透過 WebSocket 傳送連續的麥克風音訊,在講者仍在說話時回傳部分轉錄結果,並在每段話結束後不久確定最終轉錄內容。其批次版本 gemini-3.5-transcribe 則可處理長達一小時的預錄檔案。兩者皆處於公開預覽階段,皆僅提供 API,且均未公開模型權重。

第一個結構性差異不是準確度。而是,其中一個是你今晚就能下載的檔案,另一個則是你必須獲准才能使用的服務。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

語言涵蓋範圍:16 對上 85 以上,而差距不是重點

計算語言數量會讓 Mistral 模型顯得狹隘,而 Google 模型顯得龐大。這些計數衡量的是不同的東西,而將它們並列解讀卻不帶這個但書,是這種比較最容易引發的常見錯誤。

• Voxtral Mini 4B Realtime Arabic——16 種阿拉伯語變體,在模型卡上按方言家族逐一具名:現代標準阿拉伯語,加上來自馬格里布的摩洛哥、利比亞、突尼西亞、阿爾及利亞與哈桑尼亞阿拉伯語;來自海灣地區的海灣、內志、阿曼與薩那阿拉伯語;來自尼羅河谷的埃及與蘇丹阿拉伯語;美索不達米亞阿拉伯語,以及南黎凡特與北黎凡特阿拉伯語;還有查德阿拉伯語。這張模型卡自身的定位是:該模型以阿拉伯語轉錄為目標,而語碼轉換——說話者在對話中途交替使用不同語言——是它打造時就要做對的能力,而非副作用。

• Gemini 3.5 Transcribe Live — 自動語言偵測,涵蓋 85 個以上地區設定,並支援句內與跨句的語碼轉換。Google 的文件將阿拉伯語列入該範圍;地區設定表將阿拉伯語(埃及)列為阿拉伯語項目,而更廣泛的阿拉伯語地區設定涵蓋範圍並未在模型自身的文件中逐項列出。

誠實讀過之後,這筆取捨的輪廓就浮現了。Google 的 85 分以上是一種廣度主張:如果你的音訊不是阿拉伯語,Google 端點都能涵蓋,而 Mistral 模型會拒絕處理——卡片上明白寫著,其他語言應使用原始的 Voxtral Mini 4B Realtime,而不是這個檢查點。Mistral 的 16 則是一種深度主張。它並非聲稱能轉錄阿拉伯語;它聲稱能將摩洛哥達里賈語、海灣阿拉伯語、埃及阿拉伯語與查德阿拉伯語作為各自獨立的目標來轉錄,而這比轉錄現代標準阿拉伯語、再指望方言從中自然浮現,是實質上更難的問題。一個以英語為權重、廣度優先的基準測試永遠不會讓你看到這個差異,因為那些方言資料集並不在它上面。

對摩洛哥的客服中心或波斯灣地區的客戶支援專線而言,一個只處理 16 種方言、其他都不管的模型,可能勝過一個能處理 85 種地區設定、但未說明各方言準確率的模型。對一間以五種語言轉錄會議的歐洲公司來說,這個等式會立刻反轉。兩家供應商都沒有錯;他們只是選擇了不同的客戶。

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

你能比較的數字,以及你無法比較的數字

這裡正是不對稱性造成影響的地方。這兩個模型回報不同的單位、基於不同的語料庫、背後的證據也不同,而且沒有第三方曾讓它們彼此對測。

• Voxtral Mini 4B Realtime Arabic — 在七項阿拉伯文基準測試中,平均字元錯誤率為 8.82%,設定轉錄延遲為 480 毫秒。根據 Mistral 自家的模型卡所述,且未經獨立重現。

• 它正在追趕的模型——Voxtral Transcribe Arabic 在相同七項基準測試、相同測量方式下達到 7.91% CER,因此這個即時模型落後同一供應商的離線阿拉伯語模型 0.91 個百分點。這個差距是 Mistral 自己做的比較,因此格外具有參考價值:供應商等於在告訴你,串流在這個語系上得付出多少準確度代價。

• Gemini 3.5 Transcribe Live — 串流詞錯誤率為 4.0%,該數據由 Artificial Analysis 測量並經 Google 引用,最終轉錄稿在語音結束後 0.40 秒送達。另經測得:同一追蹤機構的非串流排行榜上為 2.6%,而根據 Google 自家報告,在 FLEURS 上的串流表現為 5.50%。

不要直接把 8.82% 的 CER 擺在 4.0% 的 WER 旁邊,然後得出任何結論。字元錯誤率和詞錯誤率的分母不同——阿拉伯文正字法讓兩者之間的差距比拉丁字母語言更大——而且語料庫不一樣,正規化方式也不一樣,其中一個數字附有可重現的腳本,另一個則來自某個追蹤器的固定混合資料,而那個混合偏重英語客服人員對話。

更有用的比較是 Mistral 自家模型卡裡的那一個:在相同基準測試與相同正規化下,串流 8.82% 對比離線 7.91%。那是一項乾淨的測量,具體呈現低延遲在阿拉伯語上換來了什麼、又付出了什麼代價,而且比任何跨廠商的百分比都更有價值。沒有人發表過的是,在相同音訊上對 Google 和 Mistral 模型進行同條件的阿拉伯語測試。在有人這麼做之前,「哪個在阿拉伯語上更準確」仍是未解的問題,而唯一站得住腳的答案是:在你的錄音上把兩者都試一試。

Mistral 的模型卡中有一個細節值得一提,因為它違背了該供應商自身的利益。它指出,Gemini 的安全過濾器會阻擋某些 FLEURS 音訊樣本的轉錄。這是對競爭對手流程一項真實且可查證的觀察,而且這正是那種永遠不會出現在排行榜上的事情——一個拒絕轉錄某個樣本的模型,會被計為失敗或從缺,而這兩種判讀都不公平。如果你的音訊包含內容過濾器可能攔截的素材,那是一種任何 WER 數字都不會揭示的部署風險。

延遲:旋鈕對比固定數值

串流模型通常以單一延遲數值來比較。這兩者並沒有共通的單一延遲數值。

• Voxtral Mini 4B Realtime Arabic — 可設定的轉錄延遲。8.82% 的 CER 數字是在 480 毫秒的條件下測得的,而延遲可調整,這意味著該準確率數字只是操作者所選曲線上的一個點,而非模型本身的固有屬性。其基礎模型標示的範圍從 240 毫秒到 2.4 秒。

• Gemini 3.5 Transcribe Live — 從說話結束到產生最終轉錄稿只需 0.40 秒,由 Artificial Analysis 測得,且說話期間會持續出現部分轉錄結果。Google 另行聲稱,相較於 Chirp 3,完成最終轉錄的時間改善了 70%,但這是廠商提供的數據,且未經重現。

兩者都落在同一個範圍——大約半秒——但工程意義不同。Mistral 模型把延遲與準確度之間的取捨以參數形式交給你,因此當不到一秒的字幕比最後幾個準確度百分點更重要時,你可以以 240 毫秒運行;反之則把延遲拉長。Google 端點則呈現一個固定的運作點,並附帶 Google 自家的內容過濾行為。對語音代理而言,一個可調旋鈕比稍微更好的固定數值更有價值,因為正確的設定取決於你的音訊與你的使用者,而兩家供應商都無法替你選擇。

真正的分歧:開放權重對上預覽端點

授權與散布上的差異,比這項比較中的任何基準測試差距都來得大,而且在討論準確率之前,它就已決定大多數實際部署。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0 授權,BF16 權重發佈於 Hugging Face,可透過 vLLM 以 WebSocket 在 /v1/realtime 提供服務,且自 5.2.0 版起在 Transformers 中獲得原生支援。模型卡附有 Python 範例與正規化模組,讓你自行重現阿拉伯語 CER 的計算結果。這條推論流程完全不需要 Mistral 的伺服器,而且模型小到營運上的問題只在於該用哪張 GPU,而不是你負不負擔得起一張。

• Gemini 3.5 Transcribe Live — 僅限 API、公開預覽,除定價表費率外並未公布任何價格承諾,而且有十分鐘的工作階段上限,這表示任何更長的內容都必須由你自己的程式碼分塊、重新連線並拼接起來。發布時一併報導的三項限制,對阿拉伯語部署尤其重要:串流端點不會傳回講者分群,也沒有字詞層級時間戳記,而這兩者在批次端點都有,但這個端點沒有。如果你的阿拉伯語轉錄稿需要知道誰說了什麼,或需要與音訊進行時間對齊,那麼無論語言為何,Live 端點都無法產生這些資訊。

那兩項限制是小型開放模型在實際阿拉伯語部署中最強而有力的論據,而且它們與準確度毫無關係。客服中心流程需要講者歸因,合規流程需要時間戳記,而一個離線阿拉伯語模型搭配由你掌控的正規化腳本,就能兩者兼得,而不必與端點合約爭論。Mistral 的模型卡也將這一點列為限制而非功能——它以轉錄為目標,是通用即時模型的微調版本,並且誠實地表示若有需要,上游存在更廣泛的模型。

每一項各自要花多少成本,以及哪些部分仍是未知。

• Gemini 3.5 Transcribe Live — 音訊每分鐘約 $0.009(混合計算),此數字衍生自每百萬輸入 token $3.50 與每百萬輸出 token $21 的定價,其中音訊以每秒 25 個 token 計算,逐字稿則約為每分鐘 175 個 token。批次端點約為每分鐘 $0.005。這兩項數字都是根據 Google 假設的符元化方式所推估,因此若計算方式改變,數字也會隨之變動。目前有免費方案。

• Voxtral Mini 4B Realtime Arabic — 沒有公開價格,因為沒有公開服務。成本就是你硬體的成本。一個 44 億參數的 BF16 模型可裝在單一現代加速器上,因此每音訊小時的邊際成本是電力與使用率,而固定成本則是機器本身。用量大時,這比任何按分鐘計費的 API 都便宜;用量為零時,則比任何按分鐘計費的 API 都貴——而這正是開放權重取捨的常見形態。

對 Mistral 這邊來說,最關鍵的未知數並不是價格,而是這個儲存庫究竟是一條產品線的開端,還是為了摩洛哥合作案而交付的一次性成果。一個悄無聲息地發布、沒有公告、沒有定價、也沒有任何服務的模型,就是背後沒有任何支援承諾的模型。Apache 2.0 意味著對你已經拿到的權重而言,授權無法被撤回,但這完全沒說明該檢查點是否會持續維護,而模型卡本身的基礎模型指向也顯示,通用即時模型仍然是受支援的那條產品線。

對於逐字稿之上的那一層,路由層之所以有價值,與轉錄本身毫無關係。這兩個模型都不是我們自行代管的語音轉文字服務——OrcaRouter 兩者都不路由——但摘要器、意圖分類器,或取用該串流的代理,都是你可以路由的模型:一組 API key 就能以供應商定價、0% 加價使用超過 200 個模型,因此供應商一旦降價,當天就會反映在我們這邊,而且若供應商服務品質下滑,還會自動容錯移轉。如果你已經為了涵蓋不同方言而把兩家語音供應商拼湊在一起,那麼把下游的語言模型放在同一組 key 之後、而非簽兩份合約,就是這項整合中便宜的那一半。

該以哪一個為基礎

如果你的音訊是阿拉伯語——無論是單一方言、多種方言,或是在阿拉伯語與其他語言之間語碼轉換——Mistral 模型都是更值得認真考慮的候選者,而原因在於結構,而非數字。它明確列出自己是為哪些方言而打造,小到能在你自己的硬體上運行,回傳的是你可以用自己的正規化流程後處理的原始文字,而且它不會受制於十分鐘的工作階段上限,或你無法檢視的內容過濾器。代價是它只處理一個語系,其餘一概不受理,而且目前還沒有人發表對它的獨立評估。

如果你的音訊涵蓋多種語言,或者你現在就需要一項具備支援管道與公開價目表的服務,Gemini 3.5 Transcribe Live 現在已可呼叫、已由第三方追蹤器評測,並涵蓋 Mistral 檢查點會拒絕的語言。代價是工作階段上限、串流端點缺少語者分離與時間戳,以及阿拉伯語專屬準確度是一項你必須自行測試的說法——清單上點名埃及,而方言表現並未逐項列出。

真正該看的不是基準測試分數。而是 Mistral 究竟會不會發表這個模型,若會,又是以什麼價格、什麼語言藍圖推出。一個悄悄上架、掛著 Apache 2.0 授權的儲存庫,是有用的產物,卻是薄弱的承諾。如果接下來出現阿拉伯語方言藍圖——黎凡特、海灣、埃及各自成為獨立的檢查點——那麼小模型路線就成為該地區真正完整的答案,而「廣度」這項論點就更難站得住腳了。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

這兩個都不是我們自行託管的語音模型,但轉錄之上的那一層是可路由的——超過 200 個模型,只需一組 API 金鑰,以供應商牌價、0% 加價提供,因此你轉錄下游的推理模型若供應商降價,當天就能生效。

自動容錯移轉表示拼接式語音管線少了一個故障網域,因為取用逐字稿的摘要器或意圖分類器可以被重新路由,而不是隨著供應商一起中斷。