
Grok Voice Think Fast 2.0:xAI 最快、最昂貴的語音代理,詳解
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百萬 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 201 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
xAI 發布了Grok Voice Think Fast 2.0,於 2026 年 7 月 29 日問世——這是 xAI 自稱「最強大的語音轉語音語音模型」,也是其語音代理產品線的新旗艦。它的回應速度比前五大競品都快(0.70 秒內輸出首段音訊),在代理型語音基準測試中居冠,且轉錄準確度優於前一代。不過,它每分鐘的價格比所取代的模型貴 60%,採用每分鐘計費、會悄悄墊高你的帳單,而且一週後會自動進行版本別名切換。本指南將說明 Think Fast 2.0 究竟是什麼、xAI 在底層做了哪些改動、基準測試成績如何拆分為獨立評分與廠商自述、實際成本(連計算都幫你做好),以及如何呼叫它——另外還有在將生產環境通話流程導向它之前,你最好先閱讀的注意事項。
準確性說明:發布細節、定價,以及標題所述的準確性與商業主張均來自 xAI 的公告與文件(2026-07-29)。Artificial Analysis 的綜合評分由第三方獨立測量。xAI 所報告的主張——Starlink A/B 測試結果、轉錄倍數、「推理 token 減少 60%」以及「速度快近 5 倍」的說法——尚未公布底層數據;請將其視為廠商的方向性數據,並自行進行評估。規格、價格與別名行為可能變更;開發前請先驗證。
TL;DR。Grok Voice Think Fast 2.0 是 xAI 專為語音代理打造的端對端語音轉語音模型:音訊輸入、透過 WebSocket 輸出音訊,沒有獨立的 ASR→LLM→TTS 管線。它確實很快(首次音訊輸出時間 0.70 秒,是前五名中唯一低於一秒的模型),在代理式語音工作上表現也確實出色,在 Artificial Analysis 的 τ-Voice 代理基準測試中排名第一(56.5%),同時在語音轉語音品質指數中總體排名第二(82.9%),僅次於 Qwen Audio 3.0 Realtime Plus(84.1%)。它邊說邊推理——將中位數推理 token 使用量降至舊模型的約 40%——且每分鐘費用為 $0.08,較先前的 $0.05 上漲。問題出在計費方式:語音按實際音訊的牆鐘時間每分鐘計費,因此一個伺服成本更低的模型漲價 60%,漲幅會直接反映在你的帳單上。此外,8 月 5 日起,grok-voice-latest 別名將自動路由至 2.0,因此仍在使用舊版本的團隊必須在此之前主動鎖定版本。
關鍵要點
• 原生語音到語音:從麥克風到揚聲器只需一個模型,沒有 ASR→LLM→TTS 鏈——這就是首個音頻在 0.70 秒內輸出的原因。
• Agentic 領先者:在 Artificial Analysis 的 τ-Voice 智能體基準測試中排名第一(56.5%),大幅領先 GPT-Realtime-2.1(45.7%)和 Gemini 3.1 Flash(37.7%)。
• 並非整體領先者:在語音轉語音品質指數中排名第 2(82.9%),落後於 Qwen Audio 3.0 Realtime Plus(84.1%);OpenAI 在對話動態方面仍勝出(95.7% 對 95.1%)。
• 貴了 60%:每分鐘 $0.08(約每小時 $4.80),對比 Think Fast 1.0 的每分鐘 $0.05——儘管據報導該模型使用的推理 token 減少了約 60%。
• 8 月 5 日別名切換:grok-voice-latest 會自動路由到 2.0;在此之前釘選 grok-voice-think-fast-1.0,即可繼續使用較便宜的版本。
為每一項說法標示來源:Artificial Analysis 的分數為獨立取得;Starlink A/B、轉錄倍數及速度框架則為 xAI 所報告且未經發表。
Grok Voice Think Fast 2.0 是什麼
Grok Voice 是 xAI 的即時語音對語音(speech-to-speech)模型系列。「Think Fast」是快速回應系列,最初於 2026 年 4 月與 Voice Agent Builder 一同推出;Think Fast 2.0 是該系列的第二代,於 2026 年 7 月 29 日發布。此模型是端到端(end-to-end)的:它直接接收原始音訊、進行推理並直接輸出音訊,而非執行「語音辨識模型 → 文字 LLM → 文字轉語音模型」的管線流程。這種架構選擇是其延遲優勢的根本所在——沒有序列跳躍,也沒有中間文字,因此模型可以在仍在聆聽時就開始回應。
xAI將其明確定位於語音AI代理:客服專線、電話銷售、接待、電話通訊,以及其他系統需即時與真人對話並實際完成任務的應用場景——預約通話、資格審核潛在客戶、更新紀錄、搜尋網路——而非僅止於聊天。本次發布所瞄準的戰場,在於代理式(agentic)能力的強調,而非單純的語音轉錄或合成。
與 Think Fast 1.0 相比有哪些新功能?
從 1.0 的升級不僅僅是版本號的跳升;xAI 描述了三個結構性的改變:
• 並行語音推理。模型在說話的同時對查詢進行推理,而不是先思考再說話。實務上,工具呼叫可以在代理(agent)講完第一句話之前就觸發——這對延遲敏感的語音流程來說意義重大。
• 推理 token 大幅減少。xAI 報告指出,中位數推理 token 使用量降至前代的約 0.4 倍(約減少 60%),這也是它表示儘管價格上漲、該模型服務成本反而更低的原因之一。
• 強化學習塑造的對話風格。RL重塑了它的說話方式:句子更短、一次只問一個問題、沒有廢話——一種更精簡、更「人性化」的通話風格,適合電話工作,因為在電話上囉嗦會耗掉分鐘數(而且在按分鐘計費時,也等於在燒錢)。
在可量測的速度方面,首次音訊輸出時間從 1.0 版的 1.25 秒降至 2.0 版的 0.70 秒。在轉錄方面,xAI 報告在 24 種語言中提升了約 1.4 倍(廠商通報數據,詳見下文)。

這些基準測試,一項一項地
這次發布以 Artificial Analysis 為基礎,這是一家獨立的第三方基準測試機構。這點很重要:與公告中大多數其他數字不同,這些數字由中立方測得,才是值得同類相比的數據。整體圖景勝過單一標題。
語音轉語音品質指數:82.9%(第二名)。這是整體語音轉語音的綜合分數,高於 Think Fast 1.0 的 75.7%。它超越了 GPT-Realtime-2.1(79.1%)和 Gemini 3.1 Flash(69.5%)——但並非第一名。Qwen Audio 3.0 Realtime Plus 以 84.1% 領先。因此,「最佳整體語音模型」是數據無法支持的誇大說法;「頂級層級中最快的代理型語音模型」才是準確的。
τ-Voice 智能體語音基準:56.5%(第一名)。 這是 xAI 最在意的指標,而且排名是真實的:56.5% 擊敗 Think Fast 1.0(52.1%)、GPT-Realtime-2.1(45.7%)和 Gemini 3.1 Flash(37.7%)。τ-Voice 衡量智能體語音表現——模型透過語音管道完成任務的能力,包括對話中途使用工具。在狹義的「能否完成任務」維度上,Grok 領先。馬斯克宣傳的正是這個排名。
Big Bench Audio:97.2%。這是一項語音推理基準;表現強勁,不過 Qwen 創下了 99.2% 的紀錄。
Full Duplex Bench:95.1%。 對話動態——插話處理、輪流發言、即時打斷。相較於 1.0 的 77.8% 是大幅躍進,但 OpenAI 仍以 95.7% 略勝一籌,Qwen 則以 98.4% 領先。
首次音訊輸出時間:0.70s。對真正語音產品而言,這是最關鍵的數字。它已從1.25s下降,且是前五名模型中唯一低於一秒的數據;獨立測試普遍佐證了亞秒級回應。串流TTS的首個token延遲約為285ms。對於電話與即時使用場景,延遲是用戶每一輪都會感受到的指標,而這正是2.0版明顯最佳之處。
橫向看各行,這個特徵很明確:說話最快、最擅長完成任務、整體第二、對話技巧第三。那是優秀的語音代理模型,但作為「最佳聊天機器人語音」的主張則平平。為第一行所對應的工作選擇它。
轉錄準確性
除了對話之外,xAI 聲稱其轉錄效果有顯著提升。其內部評估涵蓋 24 種語言和數千個短語,據報導顯示,其準確率約為 Think Fast 1.0 的 1.4 倍,以及 Deepgram Nova 3 和 ElevenLabs Scribe v2 等專用轉錄模型的 1.5 至 2 倍。在嘈雜的真實環境中——包括背景噪音、電話壓縮、低頻寬通話——據報導,與專用 STT 模型相比,其準確度差距會擴大到大約 10 倍。
這些正是需要謹慎看待的說法。它們是由 xAI 自行報告的;其評測框架、詞組集和噪聲設定並未公開。針對 2.0 在嘈雜電話語音轉錄上,與 Deepgram 或 ElevenLabs 進行獨立測試會很有價值,但截至本文撰寫時,這類測試尚未發布。就方向而言,端到端模型在訓練中吸收更多電話語音資料,是一項合理的真實改進——但「10x」應經過驗證,而非當作事實一再轉述。
定價:每分鐘 $0.08 以及 60% 的問題
這裡就是發布變得有爭議的地方。Think Fast 2.0 的音頻費用為每分鐘 0.08 美元——約每小時 4.80 美元——另加每條文字輸入訊息 0.004 美元。Think Fast 1.0 為每分鐘 0.05 美元(每小時 3.00 美元)。這是一個 60% 的漲幅,而且它與 OpenAI 將 GPT-5.6 Luna 降價 80% 和 Terra 降價 20% 發生在同一個月,OpenAI 引用了與 xAI 對這款模型所聲稱的相同的伺服器成本下降。
計費方式才是關鍵。文字模型按 token 計費,因此當模型變得更有效率時,客戶的帳單會自動縮減。語音模型按真實時間音訊的每分鐘計費,而對話的長短由說話者決定,而非模型。在按分鐘計費的產品中,效率提升的利益歸供應商所有,而非購買者。這就是為什麼據報導使用約 60% 更少推理 token 的模型——因此對 xAI 來說服務成本更低——租用費用卻反而貴 60% 的原因。
在真實的通話流程上算一筆帳。一通 4 分鐘的電話,在 1.0 上要花 $0.20;同一通電話在 2.0 上要花 $0.32。每個月一萬通這樣的電話,就是 40,000 分鐘:1.0 每月 $2,000,相較之下 2.0 每月 $3,200——每月多出 $1,200,也就是大約每年 $14,400 的差距,而這個差距單單來自路由調整,並非通話量。就算把速度優勢想得很寬鬆,也很難抵銷:每通電話省下整整 10 秒,大約只省 $0.013,但價格上漲卻多了 $0.12——你只能回收大約九分之一的上漲。任何把 2.0 說成更便宜方案的商業論點,都是把「更快」和「更便宜」搞混了。
作為參考,2.0 仍比 GPT-Realtime-2.1 High 便宜約 2.2 倍,約為每小時 10.75 美元。因此,以絕對價格而言它並不昂貴——它的昂貴是相對於其前代產品,以及相對於那個月其他所有模型供應商所走的定價方向。
八月五日的遷移陷阱
此事項附有截止日期。2026年8月5日,grok-voice-latest 別名將自動開始路由至 Think Fast 2.0。如果您透過該別名使用 Think Fast 1.0,「什麼都不做」將在該日期自動將您——以及您的帳單——升級至新版本。若要繼續使用 1.0,您必須在8月5日前明確釘選 grok-voice-think-fast-1.0 模型 ID。
兩個站得住腳的立場都要求在截止期限前採取行動:要嘛刻意釘住 1.0,因為你的腳本化流程在每小時 3.00 美元的成本下運作良好;要嘛刻意升級到 2.0,並以品質而非節省成本為由重新預測,價格為每小時 4.80 美元。真正站不住腳的是在九月的發票中才發現這個變更。一個好的原則:將任何以「latest」結尾的別名視為一項持續性的指示,接受廠商接下來出貨的任何內容——包括其價格。
如何存取及使用它
Think Fast 2.0 可透過 xAI 的 Speech-to-Speech API 使用,模型 ID 為 grok-voice-think-fast-2.0,並以 grok-voice-latest 作為滾動別名。它是一個透過 WebSocket 運作的即時全雙工模型:wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0,在交握時使用 Authorization: Bearer 標頭進行驗證。對於瀏覽器應用程式,請透過即時工作階段端點在伺服器端鑄造短期權杖,以免父層 API 金鑰暴露給用戶端。
此 API 與 OpenAI Realtime 相容,因此現有的即時語音程式碼通常只需更換 base URL 與金鑰。工作階段設定透過 session.update 事件進行:挑選預設語音(eve、ara、rex、sal、leo),設定輸入與輸出的音訊格式(預設為 24kHz 的 PCM16;電話應用則用 μ-law),啟用伺服器端的語音活動偵測,並註冊工具——包括內建的網路搜尋工具——讓代理程式能在對話中途採取行動。事件流程遵循標準模式:用戶端附加音訊緩衝幀,伺服器串流傳輸回應音訊增量,當模型決定採取行動時觸發工具呼叫引數事件,並將結果以函式呼叫輸出的形式推回。此模型支援超過 25 種語言,並可從約一分鐘的語音進行自訂語音克隆。
請注意它不是什麼:它是一個語音轉語音(speech-to-speech)的代理模型,而不是通用的轉錄或翻譯服務。如果你的產品核心工作是低成本地將音訊轉換為文字,那麼專門的 STT 模型是另一種工具——而且按每分鐘計費,你支付的是整個對話的費用,因此純轉錄的工作負載很快就會變得昂貴。

它如何融入語音代理技術棧
Think Fast 2.0 是專門的即時語音模型,透過 xAI 的專用 API 存取,而非由模型路由器託管的一般用途 LLM。語音通道直接運行在 xAI 的 WebSocket 上——次秒級延遲正是在這裡實現,且無法在中介跳點後存續。
語音產品周邊的一切其他部分——非即時性的自然語言邏輯、對話偏離腳本時的備援推理、摘要、分析、以及代理程式在通話後觸發的電子郵件跟進——都屬於通用文字與多模態工作。就這部分而言,像 OrcaRouter 這類與廠商無關的端點,能透過單一 OpenAI 相容 API 串接多種 LLM,讓你在不需要即時語音通道的堆疊部分不會被單一廠商綁定。明確的分工是:串流語音本身使用 xAI 的專用 API,而圍繞語音的文字與多模態推理則交給 OrcaRouter(或類似服務)。
競賽:智能體速度 vs 原始智能
Think Fast 2.0 正好落在目前 AI 領域競爭最激烈的戰場——即時語音代理市場——而基準測試表將其中取捨展露無遺。
Qwen Audio 3.0 Realtime Plus是智慧領導者:在語音對語音品質指數上獲得 84.1%(第一名)、Big Bench Audio 創紀錄的 99.2%,以及全雙工 98.4%。但其平均首次音訊時間約為 4.02 秒——比 Grok 的 0.70 秒慢約 5.7 倍。對於車載、穿戴裝置和手機通話來說,這個差異不是「快與慢」的問題,而是「可用與不可用」的問題。Qwen 也分為 Plus 等級(品質)和 Flash 等級(約 300 毫秒首個封包)以因應不同場景,這是對相同張力的一種深思熟慮的解答。
GPT-Realtime-2.1在多數指標上居中(品質 79.1%、代理能力 45.7%),並在對話動態上勝出(95.7%)。其 High 等級的每小時價格約為 Grok 的 2.2 倍。對於已深入 OpenAI 生態系的團隊而言,它仍是摩擦最低的預設選擇。
Gemini 3.1 Flash在品質與代理型綜合評分(69.5%、37.7%)上落後,但屬於更廣泛的 Gemini 語音技術棧與 Google 生態系的一部分,許多團隊基於其他原因偏好此方案。
實際評估重點:依工作負載來選。若你的語音代理必須即時回應,且必須可靠完成工具型任務(客服支援、資格審核、預約訂位),Think Fast 2.0 是目前量測到最強的選項。若你最重視的是深度推理,且能容忍數秒延遲,Qwen Plus 勝出。若對話流暢度與生態系整合最關鍵,GPT-Realtime-2.1 仍是被挑戰的現任王者。

三個適用的情境
1. 電話支援與電話技術
最關鍵的組合:亞秒級的首段音訊、強大的噪音電話轉錄能力(據供應商回報),以及全雙工打斷處理。一條讓客服專員幾乎能立即開口、並能在對話中途調出帳戶資訊的支援專線,正是 2.0 調校的目標。其更簡短、一次只問一個問題的強化學習(RL)說話風格,也非常適合電話通訊——無論在哪家供應商的計費標準下,通話分鐘數都是計費單位。
2. 潛在客戶資格確認與通話後跟進
代理語音是 2.0 真正領先的領域,而潛在客戶資格審核正是代理語音的典型任務:趁意圖仍新鮮時,完成資格判定、路由分派,並觸發後續跟進。其工具呼叫可以在第一句話結束前就觸發,因此代理可以在仍與潛在客戶交談的同時建立 CRM 紀錄。請規劃會話層級歸因與嚴格的工具權限——語音代理可能即時出錯,而善後清理得由你來處理。
3. 正在積極開發中的語音代理產品
對於自行推出語音代理的開發者——xAI 所引用的 Tradecraft 和 GrokTerm 整合正是這種形式——2.0 的速度和 OpenAI 相容的 API 使其成為 GPT-Realtime 程式碼的低摩擦即插即用方案。鎖定版本,進行一個範圍狹窄的試點,並設定明確的成功條件(例如:「篩選並引導定價頁面的訪客」),並衡量每次完成結果的成本,而不是每分鐘的成本。
限制與注意事項
撰寫本文時,Think Fast 2.0 才推出五天,這點在上述注意事項中顯而易見。Starlink 的 A/B 測試結果(更高的轉換率和支援案件收斂)僅由 xAI 自行宣稱,並未公布任何數據;轉錄倍數和「快近 5 倍」的說法同樣是廠商宣稱,而非獨立基準測試結果。你會看到那篇指控「效能衰退與捏造測試報告」的文章,所指的正是這種無法驗證的問題——xAI 發布的數字尚未被獨立重現,而對可靠性高度敏感的聲音社群,自然對未公開的廠商指標抱持懷疑。基準測試也無法衡量你最糟的情況:如果代理程式自信地把潛在客戶轉給錯誤的團隊,那麼 0.70 秒的回應時間也毫無價值。語音服務按分鐘計費,且漲價已內建於價格中,因此成本風險是真實存在的。此外,與任何全新即時模型一樣,請預期 API 會不斷變動。請自行用你的音訊驗證準確性宣稱、在生產環境鎖定版本,並在第一次上線通話前部署好升級流程和錄音機制。
常見問題
什麼是 Grok Voice Think Fast 2.0?
xAI 專為語音代理打造的旗艦級語音對語音模型,於 2026 年 7 月 29 日發布:透過 WebSocket 實現原生端對端音訊對音訊,首次音訊時間僅 0.70 秒,並在 τ-Voice 代理基準測試中奪得第一名。
Grok Voice Think Fast 2.0 多少錢?
每分鐘音頻 $0.08(約每小時 $4.80),另加每則文字輸入訊息 $0.004——比 Think Fast 1.0 的每分鐘 $0.05 上漲了 60%。
Think Fast 2.0 是最好的語音模型嗎?
它在代理式任務方面最快且表現最佳(τ-Voice 56.5%,居首),在語音對語音品質指數上整體排名第二(82.9%),僅次於 Qwen Audio 3.0 Realtime Plus(84.1%)。「最佳」取決於工作負載。
相較於 Think Fast 1.0,有什麼改變?
平行語音推理(邊想邊說),推理 token 數減少約 60%,RL 調校的簡短對話風格,轉錄改善 1.4 倍(廠商報告),首次音訊延遲從 1.25 秒縮短至 0.70 秒。
我的 Think Fast 1.0 流量會自動切換嗎?
是的,在2026年8月5日,如果您使用grok-voice-latest別名。在那之前,請固定grok-voice-think-fast-1.0以留在1.0版,或刻意採用2.0並重新預估成本。
我該如何呼叫 Grok Voice Think Fast 2.0?
透過 xAI 的 Speech-to-Speech API —— 一個與 OpenAI Realtime API 相容的即時 WebSocket(wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0),具備預設語音、伺服器端 VAD 與工具呼叫功能。
它與哪些語音模型競爭?
{{1}}Qwen Audio 3.0 Realtime Plus(更智慧,但首段音訊需 4.02 秒,明顯較慢),{{2}}GPT-Realtime-2.1(對話互動更自然,High 等級價格約貴 2.2 倍),{{3}}以及 Gemini 3.1 Flash。{{KEEP}}{{/KEEP}}
基準測試聲稱的結果可靠嗎?
Artificial Analysis 的分數是獨立且可靠的。Starlink A/B 結果、轉錄倍率和速度框架均為 xAI 自行報告,並無已發布的數據——請將其視為方向性參考,並在您自己的音訊上加以驗證。
Grok Voice 適合用於轉錄嗎?
它在對話中進行轉錄,而 xAI 聲稱在噪音環境下比專用 STT 模型有顯著提升——但它是按對話分鐘計費的,因此專用轉錄工作負載更適合由專用 STT 模型來處理。
底線
Grok Voice Think Fast 2.0 是迄今為止量測到最強大的代理式語音模型,也是頂級層級中速度最快、領先幅度極大的模型——0.70 秒的首段音訊是貨真價實、獨立驗證、面向使用者的勝利,而在 τ-Voice 奪冠也是真實的排名。誠實的總結很具體:它是即時、工具型語音代理這類別中最好的工具,但並非每一項指標都是最好的語音模型——Qwen 在智慧方面領先,OpenAI 在對話流暢度上勝出。爭議不在於速度,而在於計價方式:xAI 號稱更便宜的模型卻漲價 60%、帶有硬性截止期限的自動別名遷移,以及建立在未公開廠商數據上的頭條宣稱。用它來獲得代理式速度、鎖定你的版本、標示廠商宣稱,並在你自己的通話中驗證準確性——同時將語音產品周邊的通用文字與推理功能保留在像 OrcaRouter 這樣的中立廠商端點上。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
