
Granite Speech 5.0 470M TurboCTC:IBM 的 Apache-2.0 ASR 宣稱達到 12,600 RTFx
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
Granite Speech 5.0 470M TurboCTC 是 IBM 最新語音發布中真正允許你部署的模型,而這是關於它的第一件要事。2026 年 8 月 25 日,IBM 在 Hugging Face 上發布了兩個英文語音辨識檢查點——Granite Speech 5.0 470M TurboCTC 採用 Apache 2.0 授權,Granite Speech 5.0 470M TurboCTC-NC 則採用非商業用途的 CC-BY-NC-SA-4.0 授權。兩者擁有相同的 4.7 億參數架構,但訓練資料不同,授權方式也正好相反。Apache 版本是 IBM 針對「其他使用情境」所指名的模型——所謂「其他使用情境」其實就是廠商說法中的商業生產——同時它也是搭載頭條數據的那一個:IBM 宣稱在單張 NVIDIA H200 上可達到超過 12,600 RTFx 的聚合吞吐量,換算下來,透過批次推論每秒可轉錄超過三個半小時的英文音訊。
這個速度數字是廠商一天前提出的宣稱,尚未經任何第三方重現驗證,所以請把它視為亮眼的紙上數據,而非經審計的事實。它之所以仍值得你關注,原因在於背後的設計:Granite Speech 5.0 TurboCTC 棄用了先前所有 Granite Speech 模型使用的語言模型解碼器,改以純 Conformer 編碼器搭配連接時序分類(CTC)訓練,並以非自迴歸方式解碼。正因沒有逐 token 生成的迴圈,一個 470M 參數的模型才能宣稱吞吐量超越數倍於其規模的模型——而這正是此次發佈對所有建構語音轉文字(speech-to-text)應用的人之所以重要的原因,而不僅止於效能基準表上的數字。
實際發佈的內容
兩個檢查點,均於2026年8月25日發布於 ibm-granite Hugging Face 組織,兩者皆為僅支援英文的ASR,且採用相同的僅編碼器(encoder-only)架構:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0 授權,允許商業使用,以約 60,000 小時的英語音訊訓練。
• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0,僅供研究與非商業用途使用,以約 75,000 小時的英語音訊訓練而成。
這篇文章討論的是 Apache 模型——也就是產品可以合法依賴的版本——並在授權敘事需要之處提及 -NC 孿生版本。兩個檢查點都以 safetensors 格式提供 F32 和 BF16 版本,並且兩者都透過 AutoModelForCTC 和 AutoProcessor 在 Hugging Face Transformers 中獲得原生支援。此功能將在下一版 Transformers 中推出;在此之前,你可以從原始碼安裝 Transformers、載入處理器與模型,然後執行貪婪解碼。IBM 也提供了一個基於瀏覽器的 WebGPU 串流示範,這是體驗實際延遲能低到何種程度的最快方式。
架構的賭注:一個編碼器,沒有解碼器,每秒 12.5 個 token
這項設計變更正是速度宣稱背後的原因。早期 Granite Speech 版本將聲學編碼器與投影器及語言模型解碼器搭配使用,而被捨棄的正是那個解碼器。Granite Speech 5.0 470M TurboCTC 是一個以 CTC 訓練的 16 層 Conformer 編碼器,推論僅需一次非自回歸貪婪解碼。沒有需要取樣的部分,因此也無需等待生成延遲。
三個設定細節讓它不僅只是小巧,而且速度飛快:
• 時間下採樣 8 倍。前端每秒運行 100 幀;模型每秒輸出 12.5 個 token。堆疊和跳過 log-mel 幀,接著在前兩個 Conformer 區塊中進行步長卷積和池化殘差連接,以三個 2 倍階段降低輸出率。
• 以子詞詞彙取代字元。早期的 Granite Speech 編碼器每秒輸出 50 個字元;5.0 從 16,384 個單元的 BPE 詞彙(-NC 變體為 SentencePiece)每秒輸出 12.5 個子詞詞元。每秒音訊的輸出單元越少,CTC 解碼器需要做出的決策就越少。
• 自我條件化 CTC。中間的 Conformer 層精煉模型自身的中間表徵,這正是讓小型編碼器在沒有解碼器的情況下仍能保持準確度的關鍵。
所有這些都寫在模型卡和 IBM 的技術說明文件中。總結來說,這是一個專為筆記型電腦、手機和串流管線打造的檢查點,在這些情境下,重量級自迴歸解碼器無法適用——邊緣定位在 IBM 自己的描述中已十分明確。
IBM 所聲稱的數字
此部分的所有內容皆由 IBM 自行回報,並截至 2026 年 8 月 25 日透過 Open ASR 排行榜在 Hugging Face 基礎設施上的公開測試工具執行,且未經獨立重現。請將其視為看似可信的廠商數據,而非既定事實:
• 吞吐量 — 在單一 NVIDIA H200 上進行批次推論時超過 12,600 RTFx,IBM 將其換算為每秒處理超過 3.5 小時的音訊。IBM 補充道,這比早期 Granite Speech 模型的吞吐量高出 20 倍以上。這是資料中心 GPU 搭配批次推論的數據,並非筆記型電腦所能達到的效能。
• 準確性 — Apache 模型在 Open ASR 排行榜的公開英語短句測試集上,總體詞錯誤率為 5.00%(-NC 變體在同一測試集上得分為 4.85%)。推論是透過 Hugging Face 的 jobs 基礎架構執行,並使用排行榜的工具進行評分,因此 IBM 預期一旦新模型被納入官方表格後,這些數據將與官方表格一致。
• 遠場 — 在 FFASR 噪音與混響排行榜上,Apache 模型在準確度方面排名第九,-NC 模型排名第五,且兩者是該排行榜上速度最快的條目(吞吐量以單張 NVIDIA L4 測量)。
• 訓練 — 約60,000小時的公開英語音訊,用於Apache模型,在IBM Blue Vela叢集上的八個NVIDIA H100上,十天內完成。

Apache 2.0 實際上能為你帶來什麼
這份授權正是本次發布與眾不同之處。開放權重的語音模型通常以研究授權發布,或附帶讓生產團隊法務部門皺眉的義務;而在此,商業可用版本恰是 IBM 在準確度上略低一籌的那一個。你用 0.15 個百分點的整體 WER(5.00% 對比 4.85%)換取在產品中部署、將輸出商業化、微調並保有衍生權重,以及在雲端基礎設施中使用的權利,且不受研究僅限條款阻礙。
這個交易若你追逐排行榜,很容易做錯方向。-NC 模型的 4.85% 來自大約 15,000 小時的額外訓練資料(GigaSpeech 和 SPGI Speech),而它正是 IBM 字面上標示「僅供研究和非商業用途」的版本。它是個不錯的基準模型,卻是糟糕的產品依賴。Apache 模型犧牲一點準確度,換來成為商業轉錄管線、客服中心 QA 系統或邊緣裝置基礎的能力。如果你正在評估這個系列,授權決策要先於基準測試決策。

你所放棄的
放棄語言模型並非沒有代價,而模型卡對於這些削減也如實說明:
• 無語音翻譯。早期的 Granite Speech 世代可在轉錄時透過語言模型進行翻譯;5.0 僅提供轉錄功能。
• 無關鍵字偏置。LM 也負責處理對領域術語和名稱的偏置;沒有它之後,你得到的就是子詞詞彙表自然產生的任何內容。
• 僅限英文。此版本中沒有多語言檢查點,且沒有跡象顯示即將推出。
• 5.00% 的 WER 是短句、乾淨音訊的數據。FFASR 的結果(在嘈雜的遠場語音中排名第九)才是會議室和免手持使用情境下更實際的指標,而且它是排名,不是宣傳用的數字。
就狹窄的轉錄任務而言——通話音訊、會議、語音備忘錄、字幕、聽寫——這些都不是障礙。但如果你原本期望一個小型模型也能順帶翻譯,或能開箱即用地可靠轉錄自訂詞彙,那麼它們就會變得重要。
今天如何執行它
你不需要一個尚未存在的雲端 API。模型在本地端運行:
• 從原始碼安裝 Transformers(CTC 功能集尚未包含在最新版本中),然後使用 AutoModelForCTC 加上 AutoProcessor 和貪婪解碼(greedy decoding)——這是標準流程。處理器可以在模型所在的裝置上計算 log-mel 特徵,省去一次從主機到裝置的資料複製。
• 模型卡範例是透過 pipeline 的兩行程式碼:使用模型「ibm-granite/granite-speech-5.0-470m-turboctc」進行 automatic-speech-recognition。
• WebGPU 串流示範可在瀏覽器分頁中執行,是在你花費整個下午建置基準測試框架之前,衡量延遲最快的方式。
• 在生產環境中,實際問題在於服務部署。此類開源 ASR 模型通常在 CPU 或小型 GPU 上執行,搭配類似批次串流推論的方式——12,600 RTFx 的標題數字是 H200 的批次數據;實際的單串流筆電數字會低得多,而且 IBM 尚未公布首次輸出 token 的延遲數據。
那個服務層才是開放式 ASR 真正成本與複雜度的所在,也是路由平台展現其價值之處。OrcaRouter 的模式是:一個 API 串接 200+ 個模型,供應商列表價格以 0% 加價直接轉嫁——所以當廠商降價時,當天就會生效——外加跨供應商的自動容錯移轉,以及一個可將多個模型組合成單一呼叫的路由 DSL。這些對 Granite Speech 5.0 470M TurboCTC 本身都不適用,因為目前兩個變體都還沒上 OrcaRouter:權重才剛釋出一天,也沒有任何商業供應商在提供服務。當這類開放式語音模型真的有了託管路徑——或者當你拿它和市面上既有的託管 ASR API 做比較時——路由層就是你嘗試它、並在不改寫整合程式碼的情況下退回其他方案的關鍵,而透明的成本轉嫁定價則是讓這份比較保持誠實的關鍵。
還有什麼仍未確認
一個僅有一天歷史的模型,其書面紀錄很短,值得明確列出目前尚不清楚的部分。
• 沒有第三方基準測試。12,600 RTFx、5.00% WER 以及 FFASR 排名,全都是 IBM 自己透過公開排行榜框架進行的測試。沒有任何獨立機構發表過數據。
• 沒有 IBM 代管的 API。沒有 watsonx 模型頁面、沒有代管端點、沒有定價,也沒有任何這些功能推出的日期。
• 沒有串流延遲數據。目前有串流支援和 WebGPU 示範,但沒有首個 Token 時間或區塊延遲的數據。
• {{1}}尚未在相同測試環境下與其他快速開源 ASR 模型進行比較。{{/1}}真正重要的對決——與 {{2}}Whisper large-v3、NVIDIA Parakeet TDT 0.6B 以及託管式轉錄 API{{/2}} 的較量——至今還沒有任何人在完全相同的資料上進行過測試。
接下來要看什麼
{{1}}近期的信號在於獨立重現的結果。Open ASR 排行榜是公開的,測試框架是標準的,權重也放在 Hugging Face 上,因此第三方運行應該在數日內就會出爐——請觀察 5.00% 是否能維持,以及 12,600 RTFx 在 IBM 自家批次環境之外的單顆 H200 上是否依然成立。{{/1}} {{2}}另一個值得觀察的重點是,IBM 是否會將 Apache 授權的雙生版本轉為受管服務,因為一旦出現 watsonx 端點,這款開放式 ASR 將立刻擁有最具可信度的商業化路徑。{{/2}} {{3}}Granite Speech 5.0 470M TurboCTC 在發布首日就是一款真正快速、真正寬鬆授權的英文 ASR,只是驗證紀錄確實相當單薄。{{/3}} 前兩者名副其實;第三項只是時間問題。

