
Realtime-Venus 對比 Grok Voice Think Fast 2.0:只有其中一個有標價
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Realtime-Venus 和 Grok Voice Think Fast 2.0 並排放在一起,第一個差異不是基準測試,而是一張採購單。Grok Voice Think Fast 2.0 是一個託管的語音轉語音模型,於 2026 年 7 月 29 日開賣,價格為每音訊分鐘 0.08 美元,並公布了 0.70 秒的首次音訊延遲,以及來自第三方的基準測試分數。Realtime-Venus 則是螞蟻集團 Venus 團隊與清華大學的 90 億參數全雙工系統,以 Apache-2.0 權重、一份日期為 2026 年 9 月 12 日的技術報告的形式存在,此外沒有什麼你可以呼叫的東西。其中一個你可以在這週結束前接進電話線。另一個你可以閱讀。這種不對稱結果證明是比計分板更有用的比較,因為這兩個模型幾乎做了相同的架構賭注,然後在如何運用它上完全分道揚鑣。
簡短的回答
如果你現在就需要一個可運作、可投入生產環境的語音代理,而且要有能編進預算的費率表,以及可實際測試的延遲保證,就選 Grok Voice Think Fast 2.0。如果你需要擁有整套技術堆疊——如果你的資料不能離開你的基礎架構、如果你需要微調前端,或者你是在評估架構而不是推出產品——就選 Realtime-Venus。沒有第三種會讓它們彼此競爭的情況,因為其中一個有 API,而另一個沒有。
他們對這個難題意見一致。
有趣的是,兩者的診斷有多麼相似。這兩個模型之所以存在,都是因為同一個矛盾:對話控制必須以毫秒級的精度運行,而推理卻要花上數秒。一個停下來思考的模型,就不再讓人感覺它在場。
Grok Voice Think Fast 2.0 透過邊說話邊推理來解決這個問題。Think Fast 系列建立於一個理念:模型不應先推論、再生成語音;而是串流語音並同步思考,因此工具呼叫可以在代理還沒說完第一句話之前就觸發。xAI 表示,2.0 版使用的推理 token 約為前代的 0.4 倍,這被定位為成本與延遲的改善,而非品質上的提升。
Realtime-Venus 的解法,是根本不在前端解決這個問題。它的雙迴圈執行環境會讓一個一秒的互動迴圈持續運作——感知、輪次控制、語音生成——並透過模型自身隱藏序列中發出的非同步委派標記,把任何耗費資源的工作交給一個名為 Realtime-Venus-Harness 的獨立元件。前景對話從不暫停。背景結果在送達時會被重新整合。
那些是針對同一個問題的不同工程解答,而它們各自有不同的失效模式。邊說邊推理會把重擔放在模型身上,要它維持兩條思路彼此連貫。委派則把重擔放在執行環境上,要它避免兩個迴圈互相破壞——這正是為什麼 Realtime-Venus 論文中的因果任務擷取,也就是每個委派任務各自獨立的狀態快照,是撐起這套設計的關鍵細節。
唯一一個能夠同時衡量他們兩者的指標
全雙工基準測試是這兩者唯一重疊的地方,而它們並非乾淨俐落地重疊。
• 打斷處理 — Realtime-Venus 回報在 Full-Duplex-Bench v1.5 上能回應 75% 的使用者打斷。根據 Artificial Analysis,Grok Voice Think Fast 2.0 在 Full Duplex Bench 上得分 95.1%,高於 1.0 版的 77.8%。
• 重疊下的延續 — Realtime-Venus 報告在回饋訊號下的延續率為 97%,在他人導向言語下為 88%,在背景言語下為 86%,並表示它在這三項上都超越了 Gemini 3.1 Live 和 GPT-4o。
• 不同的測量工具、不同的作者——Realtime-Venus 的數字來自其自家的技術報告,沒有外部重現。Grok 的數字則來自運行該模型的第三方。拿自我報告的數字和獨立測量出的數字相比,根本算不上比較,而上述差距出於方法論問題的可能性,和它是真實差距的可能性一樣大。
誠實的解讀:就現有證據而言,Grok Voice Think Fast 2.0 是兩者之中,唯一其全雙工行為已由與結果毫無利害關係的人實測過的那一個。
獨立數字把 Grok Voice Think Fast 2.0 放在哪裡
目前最清晰的參考數據來自 Artificial Analysis 的 Speech Agent Arena,該排行榜透過盲測偏好,針對預約牙醫門診、訂購外送等任務的即時語音對話為模型評分。截至 2026 年 9 月 18 日,Grok Voice Think Fast 2.0 High 在二十多個項目中名列第七,552 個樣本下的 Elo 為 1,011,落後於 Google 的 Gemini 3.1 Flash Live Minimal(1,096)、Gemini 3.8 Live(1,083)與 GPT-Live-1(1,053),並明顯領先自家前代版本 Grok Voice Think Fast 1.0(908)。
Elo 旁邊的那一欄更有意思。在任務成功率方面,Grok Voice Think Fast 2.0 達到 94.6%,是可見前二十名中最高的數字——高於 Gemini 3.8 Live 的 93.2%、GPT-Realtime-2.1 High 的 91.5%,以及 GPT-Live-1 的 90.9%。偏好度第七、任務完成度第一,這是一個不尋常且相當特定的側寫:聽眾不特別喜歡這個聲音,但它能把事情做完。如果你的產品是做事,而不是聊天,那一欄才是預測你成果的指標,而這也是這兩款模型各自最有力的獨立證據。

xAI 在發布時公布的數字是另一套不同的衡量工具,應分開解讀:在 Artificial Analysis 的語音對語音品質指數上為 82.9%,在 τ-Voice 代理基準測試中以 56.5% 拿下第一,Big Bench Audio 上為 97.2%,Full Duplex Bench 上為 95.1%。那些是該模型於 2026 年 7 月下旬推出時的排名,而這個類別的排行榜每個月都會變動——這正是為什麼上面那張競技場排行榜,以今天來看,比發布時的數字更有價值。

帳單,以及其中不在帳單上的部分
Grok Voice Think Fast 2.0 每分鐘音訊要價 0.08 美元,約等於每小時 4.80 美元,另外每則文字輸入訊息加收 0.004 美元。相較於 1.0 版本推出時每分鐘 0.05 美元的收費,漲幅達 60%,而 xAI 已在 2026 年 8 月 5 日自動把滾動式的 grok-voice-latest 別名移到 2.0,因此想繼續採用舊價格的團隊必須在該日期前鎖定明確版本。按分鐘計費的模式也意味著效率提升的好處歸於供應商:若模型變得更擅長更快結束通話,你每通話的帳單會降低,但每分鐘成本不會。
Realtime-Venus 沒有帳單,因為它沒有服務。它有的是硬體底線。兩個 9B 檢查點在 BF16 下,還沒算上活化記憶體,每份權重就大約十八 GB,而這張卡的文件記載了一個必須持續運行的每秒串流迴圈。能撐起這點的 GPU 節點有月費,而且是固定費用——不管有沒有人呼叫,你都得付。對於流量穩定的產品,這比每小時 4.80 美元便宜。對於流量間歇的產品,則貴得多,而交叉點是這裡唯一真正重要的財務問題。
權重、控制,以及每一個各自能讓你改變什麼
這就是這兩個模型完全無法再相提並論的地方。
• 微調 — Realtime-Venus 隨附權重。你可以微調它們、將它們量化、在氣隙環境中運行它們,並檢視每一層。Grok Voice Think Fast 2.0 是封閉的託管模型;你能改變的是提示詞、語音選擇,以及你註冊的工具。
• 語音 — Grok Voice Think Fast 2.0 隨附預設語音,並支援從大約一分鐘的語音進行自訂語音複製。Realtime-Venus 隨附一個參考語音與一個內建的 token 轉波形解碼器,而任何超出這些範圍的東西都是你自己的問題。
• 涵蓋範圍 — Grok Voice Think Fast 2.0 支援 25 種以上語言,預設透過與 OpenAI Realtime 相容的 WebSocket 工作階段,以 24 kHz 的 PCM16 進行語音傳輸,電話語音則使用 μ-law。這項相容性是一項實質的遷移優勢:大多數現有的即時語音程式碼只需要變更基礎 URL 和金鑰。Realtime-Venus 提供英文與中文文件。
• 影片——Realtime-Venus-Omni 透過 SigLIP2 編碼器接收串流影片與影像,並進行持續的視覺感知。Grok Voice Think Fast 2.0 則是音訊與文字;沒有攝影機路徑。
• 長上下文 — Realtime-Venus 擁有 40,960 個 token 的上下文,以及可在四十分鐘視窗上啟用的免訓練長影片記憶。Grok Voice Think Fast 2.0 是一種工作階段模型,沒有可相比的已發布記憶功能。

各自斷裂之處
值得預先規劃的失敗情況恰恰相反。Grok Voice Think Fast 2.0 的風險在於供應商集中,以及無法驗證的行銷宣傳:xAI 的 Starlink A/B 結果、其轉錄準確率倍數,還有它對速度的說法,全都是公司自行報告,沒有公布底層資料;而一個按分鐘計價、版本之間價格變動達 60% 的模型,已經證明它會改變價格。請鎖定你的版本,並在你自己的音訊上執行你自己的評測。
Realtime-Venus 的弱點在於,沒有人實際運行過它。它的基準測試是自我回報的,其測試框架相對於其重要性而言缺乏文件說明,而它在真實部署中的延遲也未知——報告描述的是一秒的互動節奏,那是設計參數,不是測量到的首次音訊時間。一個沒有 API、也無法重現的模型沒有實績紀錄,只有一份規格。
有一條中間路線值得直白說明,因為那正是多數團隊實際上會採行的做法。如果你正在打造一套以委派為基礎的系統——自己挑選前端,把昂貴的工作交給文字模型——前端與推理那一條腿不必來自同一個地方。OrcaRouter 既不提供 Realtime-Venus,也不提供 Grok Voice Think Fast 2.0;這兩層語音都落在我們所服務的範圍之外,我們直言這一點,而不是暗示相反。被委派的那一條腿則是另一回事。近 200 個文字模型藏在一把金鑰之後,以供應商定價提供、不加價,還具備自動容錯移轉,讓上游中斷不會導致進行中的通話斷線、一套能將數個模型組合成單次呼叫的路由 DSL,以及為值得聽取不只一種意見的決策而設的模型融合。那正是語音代理中受益於可替換性的一半,也是你能在不動到正在進行對話的那個模型的情況下更換的那一半。
該選哪一個
本季度選擇 Grok Voice Think Fast 2.0。它已經可用、經過獨立基準測試,在預測你的代理能否做出任何有用之事的代理式評估中排名第一,而 0.70 秒即可產生首批音訊,是你可以據以打造使用者體驗的數字。為相較 1.0 上漲 60% 的價格編列預算,並鎖定你的模型版本。
只有在限制條件是擁有權時,才選擇 Realtime-Venus。如果你的部署無法呼叫外部 API、如果你需要微調對話前端,或者如果你需要相機——這三種情況就是全部的理由,而當它們適用時,都是很強的理由。
不該由基準測試表來決定這件事,因為它的兩邊是由不同人在不同條件下產出的。Grok Voice Think Fast 2.0 的數字是別人測量的。Realtime-Venus 的數字則不是。在情況改變之前,實際上能進行的比較,是一個產品與一篇論文之間的比較。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
