
每日 AI 簡報,9 月 19 日:Grok Voice Transcribe 2.0 正式上線,Meta 向開發者開放 Muse
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 已於 2026 年 9 月 18 日在 Grok Voice API 上線,錄音轉錄每音訊小時 0.10 美元,串流每小時 0.20 美元——與 SpaceXAI 對 1.0 版收取的費率相同。同一週,Meta 向外部開發者開放 Muse 連接器平台,讓任何服務都能公開其現有 API,並由 Meta 的 Muse 代理代表使用者呼叫它。這些看起來像是來自兩家不同公司、關於兩款不同產品、彼此無關的新聞標題,而在過去兩年的大部分時間裡,它們也確實會是如此。把它們放在一起讀,它們就是同一個故事:轉錄正變成輸入,而爭鬥已轉向誰擁有消費它的那次呼叫。
先從價格談起,因為那是讀者今天就能據以行動的部分。接著談準確度,這點確實存在,但比發表時的說法所暗示的範圍要窄。然後是 Meta 那部分,那才是六個月後會真正重要的一環。
均一價,以及如果您已經付費使用轉錄服務,這對您意味著什麼
Grok Voice Transcribe 2.0 的價格與 1.0 相同。不是「起價」相同,也不是會到期的促銷價——而是完全相同:批次作業每小時音訊 $0.10,串流每小時 $0.20,換算下來每 1,000 分鐘分別為 $1.67 和 $3.33。講者分離、附信心分數的詞級時間戳記、反向文字正規化、填充詞移除和關鍵詞偏重全都包含在該價格內,而不是再當成加購項目販售,這在同類產品中並非常態。
實際效果是算術上的,而非戲劇性的。一個每月轉錄 5,000 小時聯絡中心音訊的團隊,不論走哪條路徑,批次路徑的費用都是 500 美元,而新模型能以明顯更低的錯誤率產出相同的處理量。這次遷移完全不會改變你支付的費用,這正是遷移很容易證明其合理性的原因:沒有成本決策要做,只有品質決策,而品質提升了。
現有的整合只要在 /v1/stt 上將 grok-voice-transcribe-2.0 作為 model 參數傳入,就能完成遷移;或者在開啟 WebSocket 工作階段進行串流時選用它。不需要變更結構定義、不需要新增端點,也不必重新編碼你的音訊管線。SpaceXAI 目前仍將 1.0 保留為預設值,因此從未碰觸 model 參數的整合會持續取得舊版本,直到該公司切換預設值為止——該公司表示這會在接下來幾週內發生,同時也會淘汰 1.0。這段空窗期值得刻意利用:將你正式環境音訊的影子副本指向 2.0,並將轉錄逐字稿與你目前實際交付的內容進行差異比對,因為一旦預設值切換,無論你有沒有測試,你都會開始執行它。
規格表的其餘部分在形式上維持不變,而且如果你是在為部署做規模規劃,而不只是評估準確度,這些內容值得了解:12 種輸入音訊格式,從 8 kHz 電話音訊到 48 kHz;單一請求最多可包含八個獨立音訊聲道;每個請求可提供 100 個關鍵詞彙作為領域詞彙;自動語言偵測,並可在錄音過程中切換語言;以及橫跨 25 種語言的逆向文字正規化,讓口說的日期、貨幣、電話號碼和電子郵件地址,都能以人類會書寫的方式回傳。服務限制是每個團隊每秒 10 個請求,以及 100 個並行串流工作階段,而且該服務僅在單一區域——us-east-1——運行,這是規格表上最該讓生產團隊停下來深思的一行,因為單一區域的語音 API 就是單一區域的服務中斷。
準確率實際上變動的地方
這項發布宣稱的是「準確度是兩倍」,但背後的數字比這個說法更具體,也更不一致。在 Artificial Analysis 的 AA-WER Streaming 排行榜上——這裡的獨立測量——兩個版本的分野如下:
• 最終轉錄稿準確度 — Grok Voice Transcribe 2.0 的詞錯誤率為 2.7%,相較於 Grok Voice Transcribe 1.0 的 3.9%;兩者皆是在說話者停止後測量
• 首次部分轉錄準確度——3.4% WER,相較於 18.3%,這是兩個版本之間最大的單一差距,而且差距懸殊
• 最終轉錄時間——0.49 秒對上 0.37 秒,所以在這項指標上,2.0 是比較慢,而不是比較快
• 首次部分成交時間——0.49 秒對 0.25 秒,同一筆交易的反向操作
最後那一組數據是整張表上最有趣的東西。Grok Voice Transcribe 2.0 以雙向各約四分之一秒的延遲換取準確度。對語音代理來說,這是實實在在的代價——差別在於那是自然的停頓,還是來電者會察覺的停頓——但對批次處理管線來說,它則完全看不見。首個部分轉錄稿的改善,才是改變你能打造什麼的關鍵,因為部分轉錄稿是來電者還在說話時,代理得以用來推理的文字。這個數字從 18.3% 降到 3.4%,正是部分轉錄稿究竟只是粗略提示,還是真正堪用的分水嶺。最終轉錄稿從 3.9% 降到 2.7%,是很好的改善,但不會有任何使用者察覺。

SpaceXAI 亦發布了四項內部評估,而這些評估值得在附有標籤的情況下閱讀——這些是該公司對自家音訊的自家數據,並非經獨立複現:
• 8 kHz 客戶支援通話 — 字錯率從 1.0 版的 10.6% 降至 2.0 版的 7.1%
• 與 Grok 的對話 — 從 8.7% 降至 3.3%
• 口述憑證,即大聲唸出姓名、電子郵件和帳戶資料——從 7.2% 降至 3.2%
• 跨 19 種語言的簡短詞句 — 從 20.6% 降至 6.8%
8 kHz 那一列才是該關注的重點。電話音訊是這個類別中最難處理的常見輸入,也是多數聯絡中心買家實際上會遇到的輸入;它在這一項上從 10.6% 降到 7.1%,對那些買家來說,比看板上最顯眼的整體數字更有意義。
排行榜的說法,誠實地解讀
SpaceXAI 表示,該模型在準確度上於 32 個串流模型中排名第一。Artificial Analysis 的排行榜確實將其列在最終轉錄稿與首次部分結果兩項排名的第一——但該排行榜頁面只繪製了 33 個模型中的 27 個,所以「32」是該公司自己的計數,而這項排名所涵蓋的集合,讀者應了解其組成樣貌。AA-WER Streaming 是三組英語資料集的加權複合指標:AA-AgentTalk 佔 50%、VoxPopuli 佔 25%、Earnings22 佔 25%,總計約八小時的音訊,而且權重嚴重偏向代理式對話語音。它並未以任何結構化方式衡量口音、電話編解碼器、領域詞彙或多聲道客服中心音訊。
這些都不代表那個數字是錯的。它代表那個數字是有特定條件限定的。一個在偏重代理對話的英語排行榜上居冠的模型,對於代理對話形態的英語音訊來說就是正確的選擇,而相信那個 8 kHz 結果是廠商內部評估、而非公開排行榜結果,才是誠實的理由。音訊樣態不同的買家應該用自己的音訊測試,而不是把這份排名當成一般的定論——這點在这次發布之前成立,在下一次發布之後也依然成立。

Meta 向開發者開放 Muse 連接器
本週的第二則消息是 Meta 的。Muse 是 Meta 於 9 月 8 日在 iOS、Android、muse.ai 與 WhatsApp 上推出的個人代理,如今開始接受第三方連接器:服務方公開自家的 API,而 Muse 則提供代理、瀏覽器與使用者脈絡,把那個 API 變成使用者只要開口要求就能叫用的東西。Meta 對此的定調是分工——你負責提供 API,我們負責提供意圖與使用者。首批點名的連接器是 Notion 與會議記錄工具 Granola,再加上 Meta 自己推出的那些。
值得精確地說明這是什麼、不是什麼。它不是一個開放的跨代理協議。建立一個連接器能讓你在 Muse 自身的使用者群體內獲得發佈,除此之外別無其他;針對開放協議進行開發則能讓你觸及所有相容的代理,但不特別針對任何使用者群體。Meta 也尚未公佈開發者需要據以規劃的部分——連接器審核流程、技術整合介面、Muse 如何在兩個重疊的連接器之間選擇,或者開發者如何衡量某個連接器是否真的帶動了任何使用量。
不容置疑的是方向。Muse 將每位使用者的 agent 各自運行於專屬的虛擬機中,配備自己的瀏覽器,並在對外動作之前設有一層獨立的審查機制;它持有的是代理權杖,而非真正的 API 金鑰。這樣的架構只有在計畫讓 agent 呼叫大量外部服務時才說得通。語音轉錄 API 正是 agent 會呼叫的服務之一,而 Meta 有自己的方案——Muse Voice Transcribe,這是 Meta 在九月初推出的即時模型,每音訊小時收費 0.18 美元。一個同時擁有 agent 與語音模型的平台,顯然有理由將自家流量導向自家模型;在連接器上開發的開發者應假定這就是預設做法,除非有什麼因素使它不再是預設。

本月出貨語音功能的團隊真正該做的事
兩個故事指向同一個方向。語音準確度正在收斂——三週內,三個模型在同一張排行榜上的差距在一個半百分點以內——而剩下的差異化因素在於價格、延遲、授權,以及由誰掌控路由。這使得你的轉錄呼叫該送往何處,比選擇由哪個模型來回應更具影響,因為在接下來的一年裡,你會想要好幾次改變那個答案。
這就是 OrcaRouter 所處的層級。一組 API 金鑰就能涵蓋 OpenAI 相容端點背後的 200 多個模型,並具備跨供應商的自動容錯移轉,因此單一區域的語音服務下午出狀況時,不再會變成你的服務中斷事件。我們以 0% 加成直接採用供應商的定價,這表示供應商降價或推出新模型版本時,我們這邊當天就會上線,而不必等待重新定價。而且因為每個模型都位於同一份合約之下,把轉錄工作負載從一個模型移到另一個模型,只是變更模型字串,而不是再跑一次採購流程。
本週的三個具體行動。如果你目前使用的是 Grok Voice Transcribe 1.0,趁 1.0 仍是預設版本、而你仍握有切換主導權時,現在就用你自己的音訊對 2.0 做影子測試。如果你正在為代理評估串流語音,請以自己的延遲預算來測量首次局部結果的耗時,而不是相信任何人的排行榜——這個模型為了換取準確度所花的那零點二五秒,究竟是微不足道還是致命,取決於你的代理如何處理這些文字。而如果你正在打造任何個人代理有朝一日可能會呼叫的東西,請密切關注 Muse 連接器計畫,因為它所提出的分發論點,比它出貨時所附帶的技術細節更為有力。
