“实时-Venus 对比 Grok Voice Think Fast 2.0”的主视觉标题卡,副标题为“一个今天下午就能买到。一个得靠下载。”,配三张卡片,分别写着“Grok Voice Think Fast 2.0:每分钟音频 0.08 美元,首段音频 0.70 秒”“实时-Venus:Apache-2.0 权重,无 API,无价目表”,以及“共同的赌注:边说话边推理,而不是先想好再说”,其下方是一条页脚横幅,写着“Grok 数据来自 Artificial Analysis 与 xAI 文档;实时-Venus 数据来自其技术报告,未经复现。”OrcaRouter 标志合成于右下角。
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0:两者中只有一个有定价

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Realtime-Venus 和 Grok Voice Think Fast 2.0 摆在一起,第一个差别不是基准测试,而是一张采购订单。Grok Voice Think Fast 2.0 是一个托管式语音到语音模型,于 2026 年 7 月 29 日开售,价格为每音频分钟 0.08 美元,公布的首个音频输出时间为 0.70 秒,并附有第三方基准测试分数。Realtime-Venus 是来自蚂蚁集团 Venus 团队和清华大学的 9B 全双工系统,它以 Apache-2.0 权重、一份日期为 2026 年 9 月 12 日的技术报告的形式存在,除此之外没有任何你能调用的东西。其中一个,你可以在本周结束前接进电话线。另一个,你只能读。这种不对称最终成了一种比记分牌有用得多的比较,因为这两个模型下了几乎相同的架构赌注,然后在如何利用这一点上彻底分道扬镳。

简短的回答

如果你现在就需要一个可用的语音代理投入生产,并且需要一份能写进预算的价目表和一项可测试的延迟保证,就选择 Grok Voice Think Fast 2.0。如果你需要掌控整套技术栈——如果你的数据不能离开你的基础设施,如果你需要微调前端,或者如果你是在评估架构而不是交付产品——就选择 Realtime-Venus。不存在它们相互竞争的第三种情况,因为一个有 API,而另一个没有。

他们在这个难题上达成了一致。

有趣的是,诊断竟如此相似。两个模型之所以存在,都是因为同一个矛盾:对话控制必须以亚秒级粒度运行,而推理却要花费数秒。一个停下来思考的模型,就不再让人感到它身处当下。

Grok Voice Think Fast 2.0 通过边说话边推理来解决这一问题。Think Fast 系列建立在这样一个理念之上:模型不应先推理、再生成语音;相反,它一边流式输出语音,一边并行思考,因此工具调用可以在智能体说完第一句话之前就触发。xAI 报告称,2.0 版使用的推理 token 约为其前代的 0.4 倍,这被宣传为成本与延迟方面的改进,而非质量上的提升。

Realtime-Venus 的解决之道,是根本不在前端解决这个问题。它的双循环运行时维持着一个一秒级的交互循环——感知、回合控制、语音生成——并通过模型自身隐藏序列中发出的异步委派标记,把任何高开销的任务交给一个名为 Realtime-Venus-Harness 的独立组件处理。前台对话永不暂停。后台结果在就绪后被重新整合回来。

这些是对同一个问题的不同工程解答,而它们有着不同的失效模式。“边说边推理”把负担压在模型身上,要求它让两条线索保持连贯。委派则把负担压在运行时上,要让两个循环不相互污染——这正是为什么 Realtime-Venus 论文中的因果任务捕获,即每个被委派任务一份隔离的状态快照,才是支撑整个设计的关键细节。

唯一能同时衡量两者的指标

全双工基准测试是这两者唯一重叠的地方,而且它们重叠得并不清晰。

• 打断处理——Realtime-Venus 报告称,在 Full-Duplex-Bench v1.5 上响应了 75% 的用户打断。根据 Artificial Analysis,Grok Voice Think Fast 2.0 在 Full Duplex Bench 上得分为 95.1%,相比 1.0 版本的 77.8% 有所提升。

• 重叠情况下的延续——Realtime-Venus 报告称,在附和语下延续率为 97%,在指向他人的言语下为 88%,在背景语音下为 86%,并表示在这三项上均超过 Gemini 3.1 Live 和 GPT-4o

• 不同的测量工具,不同的实施方——Realtime-Venus 的数据来自其自身的技术报告,未经任何外部复现。Grok 的数据则来自运行该模型的第三方。将自报数据与独立测得的数据相比较,根本算不上比较,上述差距更可能是方法论差异而非真实差距。

诚实的解读是:就现有证据而言,两者之中只有 Grok Voice Think Fast 2.0 的全双工行为是由与结果没有利害关系的人测量过的。

独立数据将 Grok Voice Think Fast 2.0 排在何处

目前最清晰的解读来自 Artificial Analysis 的 Speech Agent Arena,它通过盲测偏好在实时语音对话中对模型进行评分,任务包括预约牙医和订外卖等。截至 2026 年 9 月 18 日,Grok Voice Think Fast 2.0 High 在二十多个条目中位列第七,Elo 为 1,011,样本数为 552——落后于 Google 的 Gemini 3.1 Flash Live Minimal(1,096)、Gemini 3.8 Live(1,083)和 GPT-Live-1(1,053),并远远领先于其前代 Grok Voice Think Fast 1.0(908)。

紧挨着Elo的那一列才更有意思。在任务成功率上,Grok Voice Think Fast 2.0录得94.6%,是可见前二十名中最高的数字——高于Gemini 3.8 Live的93.2%、GPT-Realtime-2.1 High的91.5%和GPT-Live-1的90.9%。偏好排名第七,任务完成排名第一,这是一种不寻常且相当具体的画像:听众并不喜欢这个声音,但它能把活干完。如果你的产品是做事而不是聊天,那么这一列才预示你的结果,而这是这两个模型各自所拥有的最强独立证据。

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

xAI 在发布时公布的数据属于另一套评估体系,应分开解读:在 Artificial Analysis 的语音到语音质量指数上为 82.9%,在 τ-Voice 智能体基准测试中以 56.5% 位列第一,在 Big Bench Audio 上为 97.2%,在 Full Duplex Bench 上为 95.1%。这些是该模型于 2026 年 7 月下旬发布时的排名,而这一类别中的榜单每月都会变动——这正是为什么上面那张竞技场榜单,以今天来看,比发布时的数字更有价值。

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

该账单,以及其中不在该账单上的部分

Grok Voice Think Fast 2.0 的音频费用为每分钟 0.08 美元,约合每小时 4.80 美元,此外每条文本输入消息还需支付 0.004 美元。这比 1.0 版本发布时每分钟 0.05 美元的收费上涨了 60%,而且 xAI 已于 2026 年 8 月 5 日将滚动更新的 grok-voice-latest别名自动切换到了 2.0,因此希望沿用旧价格的团队必须在该日期之前固定一个明确的版本。按分钟计费的模式还意味着效率提升带来的收益归供应商所有:如果模型能更快地结束通话,你每次通话的账单金额会下降,但每分钟的成本不会降低。

Realtime-Venus 没有账单,因为它没有服务。它取而代之拥有的,是一条硬件成本底线。BF16 下的两个 9B 检查点,仅权重就各自约为十八 GB,还未计入激活内存,而卡片上说明了一个必须持续运行的逐秒流式循环。能胜任这一点的 GPU 节点每月都有成本,而且是固定成本——无论有没有人来调用,你都要支付。对于流量稳定的产品而言,这比每小时 4.80 美元更便宜。对于流量间歇性的产品而言,则要昂贵得多,而盈亏平衡点才是这里唯一重要的财务问题。

权重、控制项,以及每一项允许你更改的内容

这就是这两个模型完全失去可比性的地方。

• 微调——Realtime-Venus 提供权重。你可以对其进行微调、量化、在气隙环境中运行,并检查每一层。Grok Voice Think Fast 2.0 是一个封闭的托管模型;你能更改的是提示词、语音选择以及你注册的工具。

• 语音 — Grok Voice Think Fast 2.0 随附预设语音,并支持基于大约一分钟语音的自定义语音克隆。Realtime-Venus 随附一个参考语音和一个捆绑的 token 到波形解码器,而除此之外的一切就都是你的问题了。

• 覆盖范围 — Grok Voice Think Fast 2.0 支持 25 种以上语言,默认在 WebSocket 会话中以 24 kHz 输出 PCM16,并针对电话通信使用 μ-law,且该会话兼容 OpenAI Realtime。这种兼容性是一项实实在在的迁移优势:大多数现有的实时语音代码只需更改基础 URL 和密钥。Realtime-Venus 提供英语和中文文档。

• 视频 — Realtime-Venus-Omni 通过 SigLIP2 编码器接收流式视频和图像,并进行持续的视觉感知。Grok Voice Think Fast 2.0 仅支持音频与文本;不存在摄像头通路。

• 长上下文 — Realtime-Venus 具备 40,960 token 的上下文,以及一种免训练的长视频记忆,可在四十分钟窗口上启用。Grok Voice Think Fast 2.0 是一种会话模型,没有可比拟的已公开记忆功能。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

每一个在哪里失效

值得提前规划的故障恰恰相反。Grok Voice Think Fast 2.0 面临的风险敞口是供应商集中度和无法验证的营销宣传:xAI 的 Starlink A/B 测试结果、其转写准确率倍数以及其速度方面的说法,全都由公司自行报告,且没有公开的底层数据;而一个按分钟计费、不同版本之间价格变动达 60% 的模型,已经证明它是会变价的。固定你的版本,并在你自己的音频上运行你自己的评估。

Realtime-Venus 的软肋在于:没有人真正运行过它。它的基准测试是自report的,其测试框架相对于其重要性而言缺乏文档说明,而它在真实部署中的延迟也无从得知——报告中描述的一秒交互节奏只是一个设计参数,而非实测的首音频时间。一个既没有 API、也无法复现的模型没有可追溯的实绩,只有一份规格说明。

有一条中间路线值得直说,因为大多数团队实际上都会这么做。如果你正在构建一个基于委派的系统——自选前端,把昂贵的工作交给文本模型——那么前端和推理这条腿不必来自同一个地方。OrcaRouter 既不提供 Realtime-Venus,也不提供 Grok Voice Think Fast 2.0;这两个语音层都在我们服务范围之外,我们如实说明,而不是暗示并非如此。被委派的那条腿则是另一回事。近 200 个文本模型通过一个密钥即可调用,按供应商标价计费,不加价,还具备自动故障转移,因此上游宕机不会中断正在进行的通话,并配有路由 DSL,可将多个模型组合进一次调用,以及模型融合,用于那些值得听取不止一种意见的决策。这正是语音智能体中适合可替换的那一半,也是你无需触碰正在主持对话的模型就能更换的那一半。

该选哪一个

本季度就选 Grok Voice Think Fast 2.0。它已可用,经过独立基准测试,在用于预测你的智能体能否做任何有用之事的智能体评估中排名第一,而 0.70 秒的首音频延迟是一个你可以据此打造用户体验的数字。为相较 1.0 上涨 60% 的价格做好预算,并锁定你的模型版本。

只有当约束条件是所有权时,才选择 Realtime-Venus。如果你的部署无法调用外部 API,如果你需要微调对话前端,或者如果你需要使用摄像头——这三种情况就是全部理由,而且当它们适用时,都是强有力的理由。

不该由基准测试表来决定,因为表的两侧是由不同的人在不同条件下得出的。Grok Voice Think Fast 2.0 的数字是别人测的,Realtime-Venus 的不是。在这一点改变之前,真正能够进行的比较,是一个产品与一篇论文之间的比较。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新