一張生成的 hero 標題卡,主標題為「StepAudio 3 ASR vs Whisper Large v3 Turbo」,副標題為「1.7% 對上 4.6%,而且並不存在正面對決的測試」,頁腳上方則寫著「StepAudio 數據來自 Artificial Analysis;Whisper 數據來自 Hugging Face。」
Guides & Insights

StepAudio 3 ASR 對上 Whisper Large v3 Turbo:1.7% 對比 4.6%,卻沒有人實際跑過這項測試

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

你想要的那種比較並不存在。 StepAudio 3 ASRWhisper Large v3 Turbo在非串流語音轉文字方面,位居 Artificial Analysis AA-WER 指標的同一位置——詞錯誤率為 1.7%,相較之下其他數字落在 4% 至 5.5% 區間——而截至 2026 年 9 月下旬,還沒有人針對相同音訊發表過正面對決。StepFun 沒有,Whisper 的維護者沒有,獨立實驗室也沒有。StepFun 自家的文件是以 Doubao ASR 2.0、Seed 2.0 Lite 和 HY3.0 ASR Preview 作為基準進行比較,這些全都是中文 ASR 產品。Whisper 這邊則完全沒有任何廠商發布比較,因為 Whisper Large v3 Turbo 多年來一直可供下載,而其數字取決於由誰提供服務。

所以,這個頁面採取的是誠實的做法:它閱讀那唯一同時衡量兩者的排行榜,把可比較的與不可比較的分開,並明白指出證據到哪裡就用盡了。簡短的答案是:準確度上的差距確實存在,大約有三個百分點;而在其他一切——價格、授權、可部署性——上的差距則朝相反方向發展,而且更大。

每一個實際上是什麼

StepAudio 3 ASR是 StepFun 於 2026 年 9 月 15 日發布的託管轉錄模型,屬於五模型 StepAudio 3 音訊系列的一部分。它透過單一串流端點存取,在解碼期間回傳增量文字,並在結束時提供最終轉錄稿。StepFun 將其描述為附帶語言模型以提供脈絡的轉錄功能,針對醫療、法律、金融、汽車與程式設計音訊,以及會讓傳統辨識器失效的輸入進行調校——包括耳語、快速語音、連音語音、歌唱,以及底層有音樂的音訊。任何方案層級都沒有開放權重、沒有地端部署途徑,也沒有自架選項。公布的定價為每小時 2.8 元人民幣,換算約為每 1,000 分鐘 6.67 美元(依排行榜自身的價格軸計算)。

Whisper Large v3 TurboOpenAI 以 MIT 授權條款發布的開放權重模型:8.09 億個參數、支援 99 種語言,是 Whisper large-v3 經剪枝與微調的衍生版本,解碼器層數經過精簡。它已被下載數百萬次,並由一長串平台提供商業服務,也能在你自己的硬體上執行。最後這項特性正是整段比較的關鍵,也是為何準確度差距並非唯一重要的數字。

唯一能同時測量兩者的板子

Artificial Analysis 的 AA-WER 指數會回報轉錄錯誤的字詞百分比,數值越低越好,其第 2 版混合了三個資料集:AA-AgentTalk 佔 50%、VoxPopuli-Cleaned-AA 佔 25%,以及 Earnings22-Cleaned-AA 佔 25%。非串流檢視顯示了它所追蹤的 71 個模型中的 36 個。這兩個模型都出現在其中,這是大多數比較都無法宣稱的一點。

請依董事會所列的順序閱讀:

• StepAudio 3 ASR — 1.7% AA-WER,每 1,000 分鐘音訊約 $6.67

• Whisper Large v3 Turbo,單一託管端點 — 4.6% AA-WER,每 1,000 分鐘約 $0.67

• Whisper Large v3 Turbo,第二個託管端點 —— 5.5% AA-WER,每 1,000 分鐘約 15.00 美元

• Whisper Large v3,另一個開放權重世代 —— 在某個端點上為 4.1%,在另一個端點上為 10.1%

• StepAudio 2.5 ASR,StepFun 的上一代 — 4.7%

排行榜上最後兩行最具啟發性,而且它們完全與 StepFun 無關。相同的開放 Whisper 權重,在一個端點上得分 4.1%,在另一個端點上卻是 10.1%。在相同參數下,這是 6 個百分點的差距,完全由服務方式的差異造成:分塊策略、硬體、解碼配置,以及各主機如何處理超過其內部限制的音訊。排行榜自己的註腳也這麼說,指出在其某個資料集中,有些模型的音訊被切成約九分鐘,其他則約三十秒,原因是時間限制。

這意味著「StepAudio 3 ASR 與 Whisper Large v3 Turbo」的比較,其實是兩個比較疊加在一起。一個是模型對上權重,另一個是模型對上你剛好拿來跑基準測試的那個端點。後者的變異幅度比前者更大。

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

準確度落差從何而來,以及該信任它到什麼程度

三個百分點的詞錯誤率差距,在一個前五名系統彼此差距都落在 0.6 個百分點以內的領域裡,是很大的落差。它也是這項比較中唯一由第三方實測的數字,而且伴隨著會朝兩個方向削減其實質意義的真實但書。

相對於 StepAudio 3 ASR:該數字是一個混合指數,其中 50% 來自 AA-AgentTalk——一個代理對話資料集。一個針對特定領域轉錄進行微調、並附帶 LLM 以提供上下文的模型,非常適合這種形狀的音訊。若將該指數的權重重新調整為偏向朗讀語音或廣播新聞,排名可能會更緊湊。此外,目前仍然沒有針對該 ASR 模型發布的技術報告、沒有發布的測試集、沒有解碼配置,也沒有來自 StepFun 之外任何人的可重現協議。

相較於 Whisper Large v3 Turbo:那個 4.6% 是某個託管端點的數字,不是這個模型本身的性質。權重是固定且公開的;分數則不然。一支謹慎執行同一組權重的團隊,搭配適合領域的切塊方式與良好的解碼器設定,可以取得明顯優於排行榜上那一列的成績;而一支粗心執行這些權重的團隊,則可能得到比另一個開放權重世代所公布的 10.1% 更差的結果。誠實的總結是:在這項比較中,開放權重這一邊有一個你可以測量的下限,以及一個你必須靠實力掙來的上限。

缺少的是能讓這件事定論的那個數字:兩個系統、同一組音訊、同一套解碼協定,並公開發表。沒有人做過這樣的測試;而在有人做到之前,「1.7% vs 4.6%」只是在不同條件下取得的兩項量測相比,而不是兩個系統彼此對照的量測。

其他四個維度,Whisper 在這些方面領先更多

準確度是 StepFun 勝出的維度。在清單其餘項目上,開放權重模型還差得遠,而這些正是決定部署究竟可不可行的關鍵:

• 授權條款與權重 —— 以 MIT 授權的開放權重、809M 參數,對比未在任何方案層級公開權重的託管 API。

• 部署 — 自架、地端、氣隙隔離,或透過數十個商業平台任選,對比僅限 StepFun API。

• 成本下限——在單一託管端點上,每 1,000 分鐘約 $0.67,若自行運行還會更低,相較之下,供應商公布的費率為每 1,000 分鐘約 $6.67。

• 資料存放位置 —— 音訊永遠不會離開您控制的基礎設施,對比音訊被傳送到第三方端點。

• 整合風險——模型不會在你使用期間被撤回、重新定價或淘汰,因為你握有權重,而託管費率可能隨價目表變動。

• 長音訊行為 —— 是否分塊由你決定,且可依個別檔案調整,有別於廠商端點在內部自行處理的方式,而後者並無文件說明。

那個價格差距相對於較便宜的 Whisper 端點大約是十比一,而它與 StepFun 自家產品線內部的情況恰好相反:這款模型所取代的 StepAudio 2.5 ASR,定價為每小時 0.15 元人民幣,而目前的層級則標價 2.8。StepFun 把轉錄費率調高約十九倍,以換取準確度,這使它處於與自架開放權重模型不同的市場,而不是後者更昂貴的版本。

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

你應該選哪一個

這個分野比大多數正面交鋒更清楚:

• 如果音訊很一般、用量很大、資料不能離開你的基礎架構,或你需要永久且價格穩定的部署,就採用 Whisper Large v3 Turbo。MIT 授權意味著這個決定由你逆轉,沒有人能把它收回。

• 如果音訊確實很難——帶有口音、低聲細語、歌唱,或背景有音樂——或者如果該領域是 StepFun 所調校的五個領域之一,就採用 StepAudio 3 ASR。這就是付費版所換來的價值,而在那樣的音訊上,三個百分點的準確率差距,就是可用轉錄稿與手動校正之間的差別。

• 若你不知道自己的音訊是哪一種,就不要獨選任一方。選錯的代價並不對稱:開放權重路線可以在自己的硬體上測試,代價只是一小時的 GPU 時間;而託管路線嘗試起來不花錢,卻會讓你綁定在無法掌控的費率上。

混合式方案在這裡比在大多數比較中都更有說服力,原因在於排行榜上的端點分數落差。由於同一組 Whisper 權重會因為由誰提供服務,而得到從 4.1% 到 10.1% 不等的分數,實務上的做法是讓開放權重路徑跨越多個主機,而不是只押注在單一主機上——這正是自動容錯移轉能帶來的效果,而它也是同一套機制,讓你能把託管模型放在正式環境路徑的前端,卻不必把整條路徑押在它身上。

這如何融入堆疊,以及我們提供與不提供哪些服務

無論你選擇哪種轉錄方式,轉錄稿總得有個去處。摘要工具、結構化擷取、合規檢查、搜尋索引——這些呼叫都會落到一般的文字模型上,而它們正是帳單中隨使用量而非音訊分鐘數成長的部分。StepFun 自家的即時模型標榜工具呼叫與長時間任務的非同步執行,這意味著就連音訊層也不斷把工作交給不是音訊模型的東西。

為了明確說明範圍,免得讓人輕易產生相反的暗示:StepAudio 3 ASR 和 Whisper Large v3 Turbo 都不在 OrcaRouter 上。StepAudio 是透過 StepFun 自家的 API 存取,而 Whisper 的權重則由你自行執行,或帶到代管平台上使用。OrcaRouter 所承載的,是這段逐字稿所饋入的委派層——一個 API 背後涵蓋近 200 個文字模型,並具備自動容錯移轉,因此下游呼叫不會因單一供應商而中斷;還有一套路由 DSL,能將多個模型組合成單一次呼叫;以及當單一模型的判斷力不足時可派上用場的模型融合。若供應商公布費率,該定價會原樣轉嫁、不加收任何費用,因此價格一經公告,當天就會反映到你的帳單上——有鑑於這份比較中有一家供應商在某次發行中把轉錄費率調漲了十九倍,這可不是假設性的好處。

如果你即將在準確度問題上投入真金白銀,低成本的順序是這樣:先在你自己的音訊上跑開放權重,因為你做得到,也因為你得到的數字會比任何排行榜的數字都更貼近你的情況。接著再決定剩下的差距是否值得十倍的費率。大多數團隊會發現,這對他們的一部分流量來說值得,對其餘流量則不值得,而這是路由問題,而非模型選擇。

什麼能讓它塵埃落定

一項已發表的測試。兩個系統、相同的音訊、相同的解碼協定,以及在朗讀語音、對話音訊與 StepFun 聲稱已針對其調校的困難案例之間,做出誠實的劃分。在那樣的測試出現之前,這項比較一邊是第三方指標,另一邊是一組帶有變動分數的開放權重;而唯一負責任的解讀方式,是把它當作起點,而非答案。

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.