「Realtime-Venus 對決 Grok Voice Think Fast 2.0」的主視覺標題卡,副標為「一個今天下午就買得到。一個是下載檔。」,搭配三張卡片,分別寫著「Grok Voice Think Fast 2.0:每音訊分鐘 $0.08,0.70 秒產生首段音訊」、「Realtime-Venus:Apache-2.0 權重,沒有 API,沒有費率表」,以及「共同的賭注:邊說邊推理,而不是先想好再說」,上方則是一條頁腳資訊欄,寫著「Grok 數據依據 Artificial Analysis 與 xAI 文件;Realtime-Venus 數據來自其技術報告,未經重現。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Realtime-Venus 對比 Grok Voice Think Fast 2.0:只有其中一個有標價

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Realtime-Venus 和 Grok Voice Think Fast 2.0 並排放在一起,第一個差異不是基準測試,而是一張採購單。Grok Voice Think Fast 2.0 是一個託管的語音轉語音模型,於 2026 年 7 月 29 日開賣,價格為每音訊分鐘 0.08 美元,並公布了 0.70 秒的首次音訊延遲,以及來自第三方的基準測試分數。Realtime-Venus 則是螞蟻集團 Venus 團隊與清華大學的 90 億參數全雙工系統,以 Apache-2.0 權重、一份日期為 2026 年 9 月 12 日的技術報告的形式存在,此外沒有什麼你可以呼叫的東西。其中一個你可以在這週結束前接進電話線。另一個你可以閱讀。這種不對稱結果證明是比計分板更有用的比較,因為這兩個模型幾乎做了相同的架構賭注,然後在如何運用它上完全分道揚鑣。

簡短的回答

如果你現在就需要一個可運作、可投入生產環境的語音代理,而且要有能編進預算的費率表,以及可實際測試的延遲保證,就選 Grok Voice Think Fast 2.0。如果你需要擁有整套技術堆疊——如果你的資料不能離開你的基礎架構、如果你需要微調前端,或者你是在評估架構而不是推出產品——就選 Realtime-Venus。沒有第三種會讓它們彼此競爭的情況,因為其中一個有 API,而另一個沒有。

他們對這個難題意見一致。

有趣的是,兩者的診斷有多麼相似。這兩個模型之所以存在,都是因為同一個矛盾:對話控制必須以毫秒級的精度運行,而推理卻要花上數秒。一個停下來思考的模型,就不再讓人感覺它在場。

Grok Voice Think Fast 2.0 透過邊說話邊推理來解決這個問題。Think Fast 系列建立於一個理念:模型不應先推論、再生成語音;而是串流語音並同步思考,因此工具呼叫可以在代理還沒說完第一句話之前就觸發。xAI 表示,2.0 版使用的推理 token 約為前代的 0.4 倍,這被定位為成本與延遲的改善,而非品質上的提升。

Realtime-Venus 的解法,是根本不在前端解決這個問題。它的雙迴圈執行環境會讓一個一秒的互動迴圈持續運作——感知、輪次控制、語音生成——並透過模型自身隱藏序列中發出的非同步委派標記,把任何耗費資源的工作交給一個名為 Realtime-Venus-Harness 的獨立元件。前景對話從不暫停。背景結果在送達時會被重新整合。

那些是針對同一個問題的不同工程解答,而它們各自有不同的失效模式。邊說邊推理會把重擔放在模型身上,要它維持兩條思路彼此連貫。委派則把重擔放在執行環境上,要它避免兩個迴圈互相破壞——這正是為什麼 Realtime-Venus 論文中的因果任務擷取,也就是每個委派任務各自獨立的狀態快照,是撐起這套設計的關鍵細節。

唯一一個能夠同時衡量他們兩者的指標

全雙工基準測試是這兩者唯一重疊的地方,而它們並非乾淨俐落地重疊。

• 打斷處理 — Realtime-Venus 回報在 Full-Duplex-Bench v1.5 上能回應 75% 的使用者打斷。根據 Artificial Analysis,Grok Voice Think Fast 2.0 在 Full Duplex Bench 上得分 95.1%,高於 1.0 版的 77.8%。

• 重疊下的延續 — Realtime-Venus 報告在回饋訊號下的延續率為 97%,在他人導向言語下為 88%,在背景言語下為 86%,並表示它在這三項上都超越了 Gemini 3.1 Live 和 GPT-4o

• 不同的測量工具、不同的作者——Realtime-Venus 的數字來自其自家的技術報告,沒有外部重現。Grok 的數字則來自運行該模型的第三方。拿自我報告的數字和獨立測量出的數字相比,根本算不上比較,而上述差距出於方法論問題的可能性,和它是真實差距的可能性一樣大。

誠實的解讀:就現有證據而言,Grok Voice Think Fast 2.0 是兩者之中,唯一其全雙工行為已由與結果毫無利害關係的人實測過的那一個。

獨立數字把 Grok Voice Think Fast 2.0 放在哪裡

目前最清晰的參考數據來自 Artificial Analysis 的 Speech Agent Arena,該排行榜透過盲測偏好,針對預約牙醫門診、訂購外送等任務的即時語音對話為模型評分。截至 2026 年 9 月 18 日,Grok Voice Think Fast 2.0 High 在二十多個項目中名列第七,552 個樣本下的 Elo 為 1,011,落後於 Google 的 Gemini 3.1 Flash Live Minimal(1,096)、Gemini 3.8 Live(1,083)與 GPT-Live-1(1,053),並明顯領先自家前代版本 Grok Voice Think Fast 1.0(908)。

Elo 旁邊的那一欄更有意思。在任務成功率方面,Grok Voice Think Fast 2.0 達到 94.6%,是可見前二十名中最高的數字——高於 Gemini 3.8 Live 的 93.2%、GPT-Realtime-2.1 High 的 91.5%,以及 GPT-Live-1 的 90.9%。偏好度第七、任務完成度第一,這是一個不尋常且相當特定的側寫:聽眾不特別喜歡這個聲音,但它能把事情做完。如果你的產品是做事,而不是聊天,那一欄才是預測你成果的指標,而這也是這兩款模型各自最有力的獨立證據。

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

xAI 在發布時公布的數字是另一套不同的衡量工具,應分開解讀:在 Artificial Analysis 的語音對語音品質指數上為 82.9%,在 τ-Voice 代理基準測試中以 56.5% 拿下第一,Big Bench Audio 上為 97.2%,Full Duplex Bench 上為 95.1%。那些是該模型於 2026 年 7 月下旬推出時的排名,而這個類別的排行榜每個月都會變動——這正是為什麼上面那張競技場排行榜,以今天來看,比發布時的數字更有價值。

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

帳單,以及其中不在帳單上的部分

Grok Voice Think Fast 2.0 每分鐘音訊要價 0.08 美元,約等於每小時 4.80 美元,另外每則文字輸入訊息加收 0.004 美元。相較於 1.0 版本推出時每分鐘 0.05 美元的收費,漲幅達 60%,而 xAI 已在 2026 年 8 月 5 日自動把滾動式的 grok-voice-latest 別名移到 2.0,因此想繼續採用舊價格的團隊必須在該日期前鎖定明確版本。按分鐘計費的模式也意味著效率提升的好處歸於供應商:若模型變得更擅長更快結束通話,你每通話的帳單會降低,但每分鐘成本不會。

Realtime-Venus 沒有帳單,因為它沒有服務。它有的是硬體底線。兩個 9B 檢查點在 BF16 下,還沒算上活化記憶體,每份權重就大約十八 GB,而這張卡的文件記載了一個必須持續運行的每秒串流迴圈。能撐起這點的 GPU 節點有月費,而且是固定費用——不管有沒有人呼叫,你都得付。對於流量穩定的產品,這比每小時 4.80 美元便宜。對於流量間歇的產品,則貴得多,而交叉點是這裡唯一真正重要的財務問題。

權重、控制,以及每一個各自能讓你改變什麼

這就是這兩個模型完全無法再相提並論的地方。

• 微調 — Realtime-Venus 隨附權重。你可以微調它們、將它們量化、在氣隙環境中運行它們,並檢視每一層。Grok Voice Think Fast 2.0 是封閉的託管模型;你能改變的是提示詞、語音選擇,以及你註冊的工具。

• 語音 — Grok Voice Think Fast 2.0 隨附預設語音,並支援從大約一分鐘的語音進行自訂語音複製。Realtime-Venus 隨附一個參考語音與一個內建的 token 轉波形解碼器,而任何超出這些範圍的東西都是你自己的問題。

• 涵蓋範圍 — Grok Voice Think Fast 2.0 支援 25 種以上語言,預設透過與 OpenAI Realtime 相容的 WebSocket 工作階段,以 24 kHz 的 PCM16 進行語音傳輸,電話語音則使用 μ-law。這項相容性是一項實質的遷移優勢:大多數現有的即時語音程式碼只需要變更基礎 URL 和金鑰。Realtime-Venus 提供英文與中文文件。

• 影片——Realtime-Venus-Omni 透過 SigLIP2 編碼器接收串流影片與影像,並進行持續的視覺感知。Grok Voice Think Fast 2.0 則是音訊與文字;沒有攝影機路徑。

• 長上下文 — Realtime-Venus 擁有 40,960 個 token 的上下文,以及可在四十分鐘視窗上啟用的免訓練長影片記憶。Grok Voice Think Fast 2.0 是一種工作階段模型,沒有可相比的已發布記憶功能。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

各自斷裂之處

值得預先規劃的失敗情況恰恰相反。Grok Voice Think Fast 2.0 的風險在於供應商集中,以及無法驗證的行銷宣傳:xAI 的 Starlink A/B 結果、其轉錄準確率倍數,還有它對速度的說法,全都是公司自行報告,沒有公布底層資料;而一個按分鐘計價、版本之間價格變動達 60% 的模型,已經證明它會改變價格。請鎖定你的版本,並在你自己的音訊上執行你自己的評測。

Realtime-Venus 的弱點在於,沒有人實際運行過它。它的基準測試是自我回報的,其測試框架相對於其重要性而言缺乏文件說明,而它在真實部署中的延遲也未知——報告描述的是一秒的互動節奏,那是設計參數,不是測量到的首次音訊時間。一個沒有 API、也無法重現的模型沒有實績紀錄,只有一份規格。

有一條中間路線值得直白說明,因為那正是多數團隊實際上會採行的做法。如果你正在打造一套以委派為基礎的系統——自己挑選前端,把昂貴的工作交給文字模型——前端與推理那一條腿不必來自同一個地方。OrcaRouter 既不提供 Realtime-Venus,也不提供 Grok Voice Think Fast 2.0;這兩層語音都落在我們所服務的範圍之外,我們直言這一點,而不是暗示相反。被委派的那一條腿則是另一回事。近 200 個文字模型藏在一把金鑰之後,以供應商定價提供、不加價,還具備自動容錯移轉,讓上游中斷不會導致進行中的通話斷線、一套能將數個模型組合成單次呼叫的路由 DSL,以及為值得聽取不只一種意見的決策而設的模型融合。那正是語音代理中受益於可替換性的一半,也是你能在不動到正在進行對話的那個模型的情況下更換的那一半。

該選哪一個

本季度選擇 Grok Voice Think Fast 2.0。它已經可用、經過獨立基準測試,在預測你的代理能否做出任何有用之事的代理式評估中排名第一,而 0.70 秒即可產生首批音訊,是你可以據以打造使用者體驗的數字。為相較 1.0 上漲 60% 的價格編列預算,並鎖定你的模型版本。

只有在限制條件是擁有權時,才選擇 Realtime-Venus。如果你的部署無法呼叫外部 API、如果你需要微調對話前端,或者如果你需要相機——這三種情況就是全部的理由,而當它們適用時,都是很強的理由。

不該由基準測試表來決定這件事,因為它的兩邊是由不同人在不同條件下產出的。Grok Voice Think Fast 2.0 的數字是別人測量的。Realtime-Venus 的數字則不是。在情況改變之前,實際上能進行的比較,是一個產品與一篇論文之間的比較。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新