Grok Voice Think Fast 2.0:xAI 最快、最贵的语音智能体,详解
Guides & Insights

Grok Voice Think Fast 2.0:xAI 最快、最贵的语音智能体,详解

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

xAI 发布了 Grok Voice Think Fast 2.0,发布时间为 2026 年 7 月 29 日——它自称是“能力最强的语音转语音模型”,也是其语音智能体产品线的新旗舰。它比前五名中的任何竞品响应都快(0.70 秒输出首段音频),在智能体语音基准测试中登顶,并且转录准确率高于上一代。但它每分钟的价格也比它所取代的模型贵 60%,采用按分钟计费的计价方式,会悄然推高你的账单,还附带一个会在一周后自动发生的版本别名切换。本指南将解释 Think Fast 2.0 实际上是什么、xAI 在底层做了哪些改变、基准测试的叙事如何拆分为独立评分与厂商报告的说法、算清账后它到底要花多少钱,以及如何调用它——此外还有一些注意事项,在你将生产呼叫流程接入它之前,最好先读一读。

准确性说明:发布细节、定价,以及主要的准确性声明和商业声明均来自 xAI 的公告和文档(2026-07-29)。Artificial Analysis 综合得分为独立第三方测量结果。xAI 自行报告的声明——Starlink A/B 结果、转录倍率、“推理 token 减少 60%”以及“快近 5 倍”的表述——未公布底层数据;请将其视为方向性的厂商数据,并自行运行评测。规格、价格和别名行为可能发生变化;在构建前请先核实。

简而言之。Grok Voice Think Fast 2.0 是 xAI 面向语音智能体的端到端语音到语音模型:音频输入、音频输出,全程走 WebSocket,无需单独的 ASR→LLM→TTS 流水线。它确实快(首音频延迟 0.70 秒,是前五名中唯一低于一秒的模型),在智能体语音任务上也确实强:在 Artificial Analysis 的 τ-Voice 智能体基准测试中排名第一(56.5%),同时在语音到语音质量指数上位列总榜第二(82.9%),仅次于 Qwen Audio 3.0 Realtime Plus(84.1%)。它边说话边推理——将中位推理 token 消耗削减到旧模型的约 40%——价格为每分钟 0.08 美元,高于此前的 0.05 美元。问题出在计费方式上:语音按音频的挂钟时间每分钟计费,因此对于一款服务成本更低的模型而言,60% 的涨价会直接落到你的账单上。另外,8 月 5 日起,grok-voice-latest 别名将自动路由到 2.0,因此仍在使用旧版本的团队需要在那之前手动固定版本。

关键要点

• 原生语音到语音:从麦克风到扬声器只需一个模型,无需 ASR→LLM→TTS 链路——这正是首次音频能在 0.70 秒内落地的原因。

• 智能体领导者:在 Artificial Analysis 的 τ-Voice 智能体基准测试中排名第一(56.5%),远超 GPT-Realtime-2.1(45.7%)和 Gemini 3.1 Flash(37.7%)。

• 并非总体领先者:在语音到语音质量指数中排名第 2(82.9%),落后于 Qwen Audio 3.0 Realtime Plus(84.1%);OpenAI 仍在对话动态方面胜出(95.7% 对 95.1%)。

• 价格高出60%:每分钟 $0.08(约 $4.80/小时),而 Think Fast 1.0 为每分钟 $0.05——尽管据报道,该模型使用的推理 token 减少了约60%。

• 8月5日别名切换:grok-voice-latest 将自动指向 2.0;若想继续使用更便宜的版本,请在此日期前固定使用 grok-voice-think-fast-1.0。

• 为每一项声明标注来源:Artificial Analysis 的分数是独立评测;Starlink A/B 测试、转录倍率以及速度方面的表述均为 xAI 自行报告且未公开发布。

什么是 Grok Voice Think Fast 2.0

Grok Voice 是 xAI 的实时语音到语音模型系列。“Think Fast”是快速响应产品线,最初于 2026 年 4 月随 Voice Agent Builder 推出;Think Fast 2.0 是该产品线的第二代,于 2026 年 7 月 29 日发布。该模型是端到端的:它直接接收原始音频,进行推理,并直接输出音频,而不是运行由语音识别模型馈送给文本 LLM、再馈送给文本到语音模型组成的流水线。这一架构选择是其延迟优势的根源——没有串行跳转,也没有中间文本,因此模型可以在仍在聆听时就开始响应。

xAI 明确将其定位为面向语音 AI 智能体:客服热线、电话销售、前台接待、电话通信,以及其他系统需要与真人实时对话并真正把事情办成的应用场景——预约通话、筛选潜在客户、更新记录、搜索网络——而不只是闲聊。此次发布瞄准的战场是智能体能力,而非单纯的语音转写或语音合成。

与 Think Fast 1.0 相比有什么新内容

从 1.0 升级并非只是数字上的提升;xAI 描述了三个结构性变化:

• 并行语音推理。模型在说话的同时对查询进行推理,而不是先思考、后开口。实际应用中,工具调用可以在智能体说完第一句话之前就触发——这对延迟敏感的语音流程来说意义重大。

• 推理 token 用量大幅减少。xAI 报告称,推理 token 使用量的中位数降至前代的约 0.4 倍(大约减少 60%),这也是它表示尽管价格上涨、该模型的服务成本反而更低的原因之一。

• 经强化学习塑造的对话风格。RL 重塑了它说话的方式:句子更短,一次只问一个问题,没有废话——一种更简洁、更“像人”的通话风格,适合电话工作,因为东拉西扯会耗掉分钟数(而在按分钟计费时,还会耗钱)。

在可量化的速度方面,首次音频时间从 1.0 的 1.25 秒降至 2.0 的 0.70 秒。在转录方面,xAI 报告称在 24 种语言中约有 1.4 倍的提升(厂商报告,见下文)。

基准测试,逐项进行

此次发布以 Artificial Analysis 为依托,它是一家独立的第三方基准测评机构。这一点很重要:与公告中大多数其他数字不同,这些数字由中立方测得,也正是值得进行同类比较的那些。综合图景比单一头条数字更好。

语音到语音质量指数:82.9%(第二名)。 这是整体的语音到语音综合得分,相比 Think Fast 1.0 的 75.7% 有所提升。它超过了 GPT-Realtime-2.1(79.1%)和 Gemini 3.1 Flash(69.5%)——但并非第一。Qwen Audio 3.0 Realtime Plus 以 84.1% 领先。所以,“整体最佳语音模型”是数据无法支撑的夸大说法;“顶级梯队中最快的智能体语音模型”才是准确的。

τ-Voice 智能体基准测试:56.5%(第一名)。这是 xAI 最看重的指标,而排名是真实的:56.5% 击败了 Think Fast 1.0(52.1%)、GPT-Realtime-2.1(45.7%)和 Gemini 3.1 Flash(37.7%)。τ-Voice 衡量的是智能体语音性能——即模型通过语音通道完成任务的能力,包括在对话中途使用工具。在“能否胜任工作”这一狭窄维度上,Grok 领先。马斯克推广的正是这个排名。

Big Bench Audio:97.2%。一项语音推理基准测试;表现强劲,不过 Qwen 创下了 99.2% 的纪录。

全双工基准测试:95.1%。对话动态——打断处理、轮次转换、插话。相较 1.0 的 77.8% 是一次大幅跃升,但 OpenAI 仍以 95.7% 略占上风,而 Qwen 则以 98.4% 领先。

首个音频输出时间:0.70 秒。 对真实语音产品而言,这是最关键的数字。它已从 1.25 秒下降至此,并且是排名前五的模型中唯一低于一秒的数值;独立测试也普遍印证了亚秒级响应。流式 TTS 首 token 延迟约为 285 毫秒。对于电话和实时使用场景,延迟是用户每一轮交互都能切身感受到的指标,而这正是 2.0 具有决定性优势的地方。

横向看各行,这个画像很具体:说话最快、最擅长完成任务、综合排名第二、对话技巧排名第三。它是一个出色的语音智能体模型,而“最佳聊天机器人语音”的说法只能算一般。让它去做与最上面一行相匹配的任务。

转录准确度

除对话之外,xAI 声称其转录效果有实质性提升。据称,其覆盖 24 种语言和数千条短语的内部评估显示,准确率约为 Think Fast 1.0 的 1.4 倍,并且是 Deepgram Nova 3 和 ElevenLabs Scribe v2 等专用转录模型的 1.5 至 2 倍。在嘈杂的真实世界条件下——背景噪声、电话压缩、低带宽通话——其相较于专用 STT 模型所报道的准确率差距扩大到约 10 倍。

这些正是需要谨慎对待的说法。它们由 xAI 报告;评估测试框架、短语集和噪声特征均未公开。将 2.0 在嘈杂电话环境下的转录与 Deepgram 或 ElevenLabs 进行独立对比测试会很有价值,而截至本文写作时,这类测试尚未公布。从大方向上看,端到端模型在训练中吸收更多电话语音数据,是一种看似合理的真实改进——但“10x”应当经过验证,而不应被当作事实重复。

定价:每分钟 $0.08,以及那个 60% 的问题

这正是这次发布引发争议的地方。Think Fast 2.0 的音频价格为每分钟 $0.08——约合每小时 $4.80——另加每条文本输入消息 $0.004。Think Fast 1.0 则是每分钟 $0.05(每小时 $3.00)。这意味着 60% 的涨幅,而且它问世的同一个月,OpenAI 将 GPT-5.6 Luna 的价格下调了 80%、Terra 下调了 20%,理由正是 xAI 为该模型所宣称的同样的服务成本下降。

计量方式决定一切。文本模型按 token 计费,所以当模型变得更高效时,客户的账单会自动减少。语音模型按实际音频的分钟数计费,而一次对话的长度由说话的人决定,而不是由模型决定。按分钟计费的产品中,效率提升带来的收益归供应商,而不是买家。这就是为什么一个据称少用约 60% 推理 token——因此对 xAI 来说服务成本更低——的模型,租用价格却高出 60%。

拿一个真实的通话流程来算算账。一通 4 分钟通话在 1.0 上花费 $0.20;同一通电话在 2.0 上花费 $0.32。每月一万通这样的电话就是 40,000 分钟:1.0 上每月 $2,000,而 2.0 上每月 $3,200——每月相差 $1,200,约合每年 $14,400,而这仅来自路由变更,并非来自通话量。即便把速度优势往宽了算,也几乎无济于事:把每通电话整整缩短 10 秒,大约只省下 $0.013,而价格上涨却增加了 $0.12——你大约只能挽回涨幅的九分之一。任何把 2.0 宣传为更便宜模式的商业方案,都把“更快”和“更便宜”搞混了。

作为参照,2.0 仍比约为每小时 10.75 美元的 GPT-Realtime-2.1 High 便宜约 2.2 倍。所以,按绝对值来说它并不贵——但相对于它自己的前代,以及那个月其他所有模型厂商的发展方向而言,它是贵的。

8月5日迁移陷阱

有一个截止期限。2026 年 8 月 5 日,grok-voice-latest 别名将自动开始路由到 Think Fast 2.0。如果你通过该别名在线使用 Think Fast 1.0,那么“什么都不做”就会在那一天把你——以及你的账单——升级到新版本。要留在 1.0,你必须在 8 月 5 日之前显式固定 grok-voice-think-fast-1.0 模型 ID。

两种站得住脚的立场都要求在截止日期前采取行动:要么有意锁定 1.0,因为你的脚本化流程在 $3.00/小时下运行良好;要么有意迁移到 2.0,并按 $4.80/小时重新做预测,且理由应是质量,而非节省。真正说不过去的是,等到九月的账单里才发现这一变化。一条好规则:把任何以 "latest" 结尾的别名都视为一项长期有效的指令,即接受供应商接下来发布的任何东西——包括它的价格。

如何访问和使用它

Think Fast 2.0 可通过 xAI 的 Speech-to-Speech API 获取,模型 ID 为 grok-voice-think-fast-2.0,滚动别名为 grok-voice-latest。它是一个基于 WebSocket 的实时全双工模型:wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0,在握手时通过 Authorization: Bearer 标头进行身份验证。对于浏览器应用,请在服务端通过 realtime sessions 端点生成临时令牌,以确保父 API 密钥永远不会到达客户端。

该 API 与 OpenAI Realtime 兼容,因此现有的实时语音代码通常只需更换基础 URL 和密钥。会话设置通过 session.update 事件进行:选择预设语音(eve、ara、rex、sal、leo),设置输入和输出音频格式(默认 24kHz 的 PCM16;电话系统使用 μ-law),启用服务器端语音活动检测,并注册工具——包括内置的网络搜索工具——以便代理可以在对话中途采取行动。事件流遵循标准模式:客户端追加音频缓冲区帧,服务器流式传输响应音频增量,当模型决定采取行动时触发工具调用参数事件,结果作为函数调用输出推送回来。该模型支持 25 种以上语言,并可从大约一分钟的语音中定制语音克隆。

注意它不是什么:它是一个语音到语音的智能体模型,而不是通用的转写或翻译服务。如果你的产品核心任务是以低成本将音频转换为文本,那么专用的 STT 模型才是另一种工具——而且在按分钟计费的模式下,你要为整段对话付费,所以仅做转写的工作负载会很快变得昂贵。

它如何融入语音智能体技术栈

Think Fast 2.0 是一款专用的实时语音模型,需通过 xAI 的专属 API 访问,而非由模型路由器托管的通用 LLM。语音通道直接运行在 xAI 的 WebSocket 之上——亚秒级延迟正源于此,而一旦经过中间环节的跳转,这种延迟便无法保持。

围绕语音产品的其他一切——那些不具时间关键性的自然语言逻辑、对话脱离脚本时的兜底推理、摘要、分析,以及智能体在通话后触发的邮件跟进——都属于通用文本与多模态工作。对于这部分,像 OrcaRouter 这样的供应商中立端点,能让你通过一个 OpenAI 兼容 API 接入多个 LLM,因此对于技术栈中不需要实时语音通道的部分,你不会被锁定在单一供应商上。清晰的划分是:流式语音本身使用 xAI 的专用 API,而围绕它的文本与多模态推理则使用 OrcaRouter(或类似方案)。

竞赛:智能体速度与原始智能之争

Think Fast 2.0 正落在当下 AI 领域竞争最激烈的市场——实时语音智能体——的中心,而基准测试表让其中的权衡取舍变得异常明显。

Qwen Audio 3.0 Realtime Plus是智能领先者:在语音到语音质量指数上达到 84.1%(排名第一),在 Big Bench Audio 上创下 99.2% 的纪录,全双工得分为 98.4%。但其平均首音频时间约为 4.02 秒——比 Grok 的 0.70 秒慢约 5.7 倍。对于车载、可穿戴设备和手机通话而言,这种差异不是“快与慢”,而是可用与不可用。Qwen 还分为 Plus 层级(质量)和 Flash 层级(首包约 300 毫秒),以应对不同场景,这是对同一矛盾的一种深思熟虑的回应。

GPT-Realtime-2.1在大多数项目上处于中游(质量 79.1%,智能体 45.7%),并在对话动态方面胜出(95.7%)。其 High 档的每小时价格约为 Grok 的 2.2 倍。对于已经深度使用 OpenAI 生态系统的团队来说,它仍然是最低摩擦的默认选择。

Gemini 3.1 Flash在质量与智能体综合评分上落后(69.5%、37.7%),但它是更庞大的 Gemini 语音技术栈和 Google 生态系统的一部分,许多团队出于其他原因更青睐这一生态。

实用判断:按工作负载来选。如果你的语音智能体必须让人感觉即时响应,并且必须可靠完成依托工具的任务(客户支持、资格筛选、预约),那么 Think Fast 2.0 是当前实测表现最强的选项。如果你最看重最深入的推理,并且能承受数秒级延迟,那么 Qwen Plus 胜出。如果对话流畅度与生态契合度最重要,GPT-Realtime-2.1 仍是那个需要被超越的现有领先者。

它适用的三个场景

1. 电话支持与电话通信

最重要的组合是:亚秒级首音频、强大的嘈杂手机环境转写能力(供应商报告值),以及全双工打断处理。一条客服热线,坐席几乎立刻开口说话,并能在轮次中途调取账户信息,这正是 2.0 所调优的场景。它那种更简短、一次只问一个问题的 RL 说话风格,也与电话通信高度契合,因为在电话通信中,分钟就是计费单位——无论按哪家供应商的计费表来算都是如此。

2. 潜在客户资格审查与通话后跟进

智能语音代理(Agentic voice)正是 2.0 真正领先的领域,而线索资格审核则是其最典型的任务:在意图还新鲜时完成审核、路由并触发跟进。它的工具调用能在第一句话说完之前就启动,因此智能代理可以在与潜在客户交谈的同时创建 CRM 记录。要为会话级归因和严格的工具权限做好规划——语音代理可能实时出错,而收拾烂摊子的责任在你身上。

3. 正在积极开发中的语音代理产品

对于发布自有语音智能体的构建者——xAI 引用的 Tradecraft 和 GrokTerm 集成正是这种形态——2.0 的速度和 OpenAI 兼容 API 使其成为 GPT-Realtime 代码的低摩擦即插即用替代方案。固定版本,运行一个范围明确的小型试点,并设定清晰的成功条件(例如,“对定价页访客进行资格判定并分流”),衡量每完成一项成果的成本,而不是每分钟成本。

局限性与注意事项

截至撰写本文时,Think Fast 2.0 才问世五天,这一点在各项注意事项中也有所体现。Starlink 的 A/B 结果(更高的转化率和支持拦截率)由 xAI 自行报告,未公布具体数字;转录倍率以及“快近 5 倍”的说法同样属于厂商主张,而非独立基准测试。你会看到的那篇声称“性能回退和测试报告造假”的文章,所指的正是这种同样的不可验证性——xAI 公布的数字尚未被独立复现,而对可靠性敏感的语音社区有充分理由对未公开的厂商指标持怀疑态度。基准测试也无法衡量你最糟糕的那一通通话:如果智能体自信地把一条线索路由给错误的团队,0.70 秒的响应也毫无价值。语音计费按分钟计算,而且涨价已经包含在内,因此成本风险确实存在。并且,和任何全新的实时模型一样,要预料到 API 会频繁变动。请用你自己的音频验证那些准确性声明,在生产环境中固定版本,并在第一通实时通话之前就部署好升级转接和录音。

常见问题

Grok Voice Think Fast 2.0 是什么?

xAI 面向语音智能体的旗舰级语音到语音模型,于 2026 年 7 月 29 日发布:通过 WebSocket 实现原生端到端音频到音频,首音频延迟低至 0.70 秒,并在 τ-Voice 智能体基准测试中排名第一。

Grok Voice Think Fast 2.0 的价格是多少?

音频每分钟 $0.08(约 $4.80/小时),外加每条文本输入消息 $0.004——相比 Think Fast 1.0 的 $0.05/分钟上涨了 60%。

Think Fast 2.0 是最好的语音模型吗?

它在智能体任务上速度最快、表现最佳(56.5% τ-Voice,排名第一),在语音到语音质量指数上总体排名第二(82.9%),落后于 Qwen Audio 3.0 Realtime Plus(84.1%)。“最佳”取决于工作负载。

相比 Think Fast 1.0 有什么变化?

并行语音推理(边说话边思考),推理 token 减少约 60%,经强化学习调优的更简短对话风格,转录准确率提升 1.4 倍(供应商报告),首个音频输出时延从 1.25 秒降至 0.70 秒。

我的 Think Fast 1.0 流量会自动切换吗?

是的,2026年8月5日,前提是你使用的是 grok-voice-latest 别名。要留在 1.0,就在那之前将版本固定为 grok-voice-think-fast-1.0;或者有意选用 2.0,并重新预估成本。

如何调用 Grok Voice Think Fast 2.0?

通过 xAI 的 Speech-to-Speech API——一个与 OpenAI Realtime API 兼容的实时 WebSocket(wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0),具备预设语音、服务端 VAD 和工具调用功能。

它与哪些语音模型竞争?

Qwen Audio 3.0 Realtime Plus(更智能,但首次音频输出耗时 4.02 秒,慢得多),GPT-Realtime-2.1(对话动态更出色,在 High 档位下价格贵约 2.2 倍),以及 Gemini 3.1 Flash。

基准测试的说法可靠吗?

Artificial Analysis 的评分是独立且可靠的。Starlink A/B 结果、转录倍率和速度表述均由 xAI 报告,并无公开数据——请将其视为方向性参考,并用你自己的音频进行验证。

Grok Voice 适合做转录吗?

它能在对话中进行转录,xAI 声称在噪声环境下它相较专用 STT 模型有大幅提升——但它按对话分钟计费,因此专用转录工作负载更适合由专用 STT 模型来承担。

最重要的一点

Grok Voice Think Fast 2.0 是迄今实测最强的智能体语音模型,也是顶级梯队中速度最快、且优势明显的一个——0.70 秒出首个音频是真正、独立、面向用户的优势,而 τ-Voice 上的第一名也是实打实的排名。诚实的总结很具体:它是同类中用于实时、由工具支撑的语音智能体的最佳工具,但并非在每一行指标上都是最好的语音模型——Qwen 在智能上领先,OpenAI 在对话技巧上领先。争议不在速度,而在计费:对一款 xAI 称其服务成本更低的模型涨价 60%、带有硬性截止日期的自动别名迁移,以及依赖未公开厂商数据的标题式宣称。用它来获得智能体速度,锁定你的版本,给厂商宣称打上标签,并在你自己的通话中验证准确性——同时把语音产品周边的通用文本和推理放在像 OrcaRouter 这样厂商中立的端点上。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新