一張生成的英雄標題卡,主標題為「StepAudio 3 ASR 對比 StepAudio 3」,副標題為「一個是模型。另一個是以同一個名字推出的五款產品」,頁尾則為「StepFun 數據,依 2026 年 9 月發布為準。」
Guides & Insights

StepAudio 3 ASR 與 StepAudio 3:沒有叫這個名字的模型

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

搜尋 StepAudio 3,你會找到的是一個系列,而非單一模型。StepFun 在 2026 年 9 月 15 日發布的音訊產品,將五款產品置於這個名稱之下——Realtime、ASR、文字轉語音、Gen 與 Music——而其中的轉錄產品 StepAudio 3 ASR,正是此後持續在排行榜上攀升的那一款。StepFun 自家文件稱之為迄今最大 ASR 模型的層級是 StepAudio 3 ASR Max,而與它共用骨幹的對話式同系列產品則是 StepAudio 3 Realtime。如果你想比較「StepAudio 3 ASR」與「StepAudio 3」,你是在把一項產品與一條產品線相比,而答案完全取決於你實際上指的是三者中的哪一個。

本頁解決了這一點。這不是行銷比較——而是你在能正確閱讀任何 StepAudio 3 規格表之前所需的釐清,因為上述三個名稱各自有不同的價格、不同的端點,以及不同的失效模式。

為什麼這個名稱會有歧義?

StepFun 在一天內就推出了整套音訊堆疊,而這套命名慣例讓家族名稱成了每個產品名稱的詞幹。這在發表投影片上看起來很整齊,放到其他任何地方卻都很彆扭。這表示搜尋家族名稱時,會得到五款不同產品混在一起的結果,而一列標示為「StepAudio 3」的基準測試資料,也可能是其中任何一款。

實際的後果是,你無法從標題看出究竟衡量的是哪個東西。一則寫著「StepAudio 3 稱霸轉錄排行榜」的貼文,描述的是 StepAudio 3 ASR。一則寫著「StepAudio 3 在對話動態上勝出」的貼文,描述的則是 StepAudio 3 Realtime。兩者都是真的,它們是不同的產品,而且不能互換。

具體來說,ASR 產品線內部還存在第二個模糊之處。StepFun 的文件將 ASR Max 層級稱為其迄今最大的 ASR 模型,擁有自己的定價與專屬端點,而公開排行榜上的列則使用較樸素的標籤。釐清這兩者究竟是同一個 SKU 的兩個名稱,還是兩個不同的 SKU,是本頁所能做到最有價值的事,而下一節正是要處理這件事。

這個名字可能代表的三件事

StepAudio 3 ASR — 這款轉錄產品。一個串流端點,會在解碼時逐步回傳文字,並在結束時提供最終轉錄稿。StepFun 將其描述為附帶語言模型以掌握上下文的轉錄,並針對醫療、法律、金融、汽車與程式設計音訊,以及耳語、快速語音、連貫語音、歌唱與背景音樂等困難輸入進行調校。在 Artificial Analysis 的非串流語音轉文字 AA-WER 指標上,這款模型的詞錯誤率為 1.7%。

StepAudio 3 ASR Max——StepFun 文件稱之為迄今規模最大的 ASR 模型。其公佈牌價為每小時 2.8 元。它不是更便宜的轉錄工具;它是 ASR 產品線中的頂級之作。

StepAudio 3 Realtime — 全雙工對話模型。它直接對語音進行推理,而不是執行「先轉錄、再推理」的串接流程,並且轉錄是這麼做的副產品。它不是 ASR 產品,而它在轉錄任務上的準確度也不是它當初調校所針對的目標。

家族中其他的一切——TTS、Gen、Music——完全是另一項工作,根本不該出現在轉錄比較中。

ASR 和 ASR Max 是同一個模型嗎?

證據指向「是」,而這項檢核是算術。StepFun 將 ASR Max 等級列為每小時 2.8 元。以約 7.1 元兌 1 美元換算,大約是每小時 0.39 美元,或每 1,000 分鐘約 6.6 美元。Artificial Analysis 在其排行榜上將該模型列為每 1,000 分鐘 6.67 美元。兩組各自獨立公布的數字,一組來自廠商價目表,一組來自第三方排行榜,彼此相差不到 1 美分。如果排行榜那一列和 ASR Max 的價目表費率描述的是同一個 SKU,這正是你會預期的結果。

值得精確說明這證明了什麼、又沒有證明什麼。它證明了排行榜的價格軸與廠商的價目表所描述的是同一款產品、同樣的價格。它沒有證明排行榜上的 1.7% 是在你實際會呼叫的那個確切端點上測得的,因為該排行榜並未公布其解碼設定,也沒有公布它所存取的端點。所以:同一款產品,極有可能;相同的量測條件,則尚未獲得驗證。

可以肯定的是,這條產品線內部的世代躍進。StepAudio 2.5 ASR 在同一份評測基準上為 4.7%,每小時 0.15 元。目前的級別則是 1.7%,每小時 2.8 元。這代表字錯誤率降低了 64%,代價是費率大約高出十九倍——這是該系列中最懸殊的取捨,也是決定這項升級是否值得的關鍵。

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

實際上不同的維度

一旦命名底定,比較就會收斂成一張簡短清單。以下是會改變決策的項目:

• 準確度 — StepAudio 3 ASR 在非串流模式下為 1.7% AA-WER,而 StepAudio 2.5 ASR 在同一排行榜上為 4.7%。由 Artificial Analysis 測量,而非 StepFun。

• 價格 —— 每小時 2.8 元 vs 每小時 0.15 元。兩者皆為廠商牌價,且均為現行價格。約 19 倍。

• 權重 — 兩者皆僅提供託管 API。整個系列中沒有任何開放權重,沒有地端部署途徑,任何方案層級都沒有自架選項。

• 端點形態——單一串流轉錄端點會回傳增量與最終文字,這與前一代的形態相同。整合模型沒有任何變更,因此移轉只是替換模型識別碼,而非改寫。

• 困難音訊調校 — StepAudio 3 ASR 明確針對耳語、快速、連貫與歌唱語音,以及底下帶有音樂的音訊進行調校。這項調校本身就是產品;前一代並非為此打造。

• 廠商聲稱的領域增益——StepFun 報告指出,相較上一代,中文下降 9.3%、英文下降 25.0%、方言下降 22.3%、垂直領域下降 42.1%,且語碼轉換下降 27.9%。此為廠商自行回報且未經重現,因此應視為方向性參考。

值得注意的是,那份清單中明顯缺少了:上下文長度、音訊格式支援、最大音訊時長,以及模型識別碼。StepFun 針對此模型的公開文件並未載明這些項目,任何引用那些數字的人,引用的其實是別的東西。

ASR 與 Realtime 的比較才是人們真正需要的

如果你是在轉錄產品之間做選擇,而不是在不同世代之間做選擇,那麼真正有趣的對決並非 ASR 對上 ASR Max,而是 ASR 對上 Realtime。StepFun 自家的技術資料指出,兩者共用預訓練與中訓練階段,僅在監督式微調時才分道揚鑣。相同的基礎,不同的微調,不同的產品。

那個單一事實有其實務上的解讀。1.7% 的詞錯誤率是 ASR 微調模型的屬性。它不是對即時模型的承諾;即時模型最佳化的是輪流發言、處理插話,以及對語音進行推理,而不是轉錄準確度。如果你的架構是在即時對話過程中順帶進行轉錄,你買到的就不是那 1.7%,而是一個恰好會輸出文字的對話模型。

反過來也同樣成立,而且比較不明顯:因為它們共用同一個骨幹,ASR 模型並不是硬外掛到這個家族上的小型專用模型。它是同一規模的系統,只是微調方式不同。這就是為什麼 ASR 的價格接近家族中其他成員,而不是接近市場上的廉價端。

如果你只選一個,這個該怎麼處理?

三個問題就能定案。你需要的是逐字稿,還是對話?如果是逐字稿,StepAudio 3 ASR 就是產品,系列名稱只是雜訊。如果是對話,你要的是 StepAudio 3 Realtime,而且根本不該看 ASR 基準測試。而如果你需要的是真正困難音訊的逐字稿——帶口音、低聲細語、歌唱,或背景有音樂——那 19 倍溢價就是為了替這類音訊調校過的等級所付的價格,而最誠實的測試是你自己的音訊,而不是混合指標。

容易做錯的決定,就是把轉錄層視為永久不變。無論你選了什麼,逐字稿都只是某個其他東西的輸入——摘要器、結構化擷取、合規檢查、搜尋索引——而那些呼叫最終都落在一般文字模型上。那才是隨使用量而非音訊分鐘數擴展的層,也是值得從一開始就保持可攜的層。OrcaRouter 把近 200 個文字模型放在單一 API 之後,具備跨供應商的自動容錯移轉、可將多個模型組合成單次呼叫的路由 DSL,以及當單一模型的判斷不足時可用的模型融合。當供應商公布費率時,該定價會不加價直接傳遞,因此文字端的價格變動在公布當天就會反映到你的帳單上。

先把範圍講清楚,因為這個頁面談的是我們並未提供服務的模型系列:OrcaRouter 上沒有任何 StepAudio 3 端點。轉錄與語音模型是透過 StepFun 自家的 API 存取的。OrcaRouter 承載的是轉錄之後的推理層,而在這個環節上,做出切換決策成本低廉,延後卻代價高昂。

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

沒有人解決的事

命名問題可以解決。效能宣稱則還不行。迄今仍沒有 ASR 模型的公開技術報告,沒有釋出的測試集,沒有解碼設定,也沒有任何來自 StepFun 之外、可重現的協定;而廠商自家的比較對象是其他中文 ASR 產品,而非開放權重的現任霸主。1.7% 是在三個資料集混合指標上真實的第三方量測;這個模型的其他一切,都是廠商的宣稱。

有兩件事會改變局面。一場在相同音訊上與 Whisper Large v3 Turbo 的正面對決,而這場對決沒有人發表過。以及家族其餘成員的費率——StepAudio 3 的五款模型中有四款在推出時仍採用限時免費預覽定價,而只有轉錄與語音合成有公開費率,這意味著你今天能看到的價目表只涵蓋五項產品中的兩項。

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

那是隨使用量而非音訊分鐘數擴展的那一層,也是從一開始就值得保持可攜性的那一層。跨供應商的自動容錯移轉、將數個供應商組成單一呼叫的路由 DSL,以及當單一模型的判斷不足時所採用的模型融合。