
Grok Voice Think Fast 2.0:xAI 最快、最贵的语音智能体,详解
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百万 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 201 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
xAI 发布了Grok Voice Think Fast 2.0,于 2026 年 7 月 29 日推出。它自称是"能力最强的语音到语音模型",也是其语音代理产品线的新旗舰。它的响应速度快于前五大竞品中的任何一款(首次音频输出仅需 0.70 秒),在智能体语音基准测试中位居榜首,且转录准确率高于上一代。但它每分钟的价格比所取代的模型贵 60%,按分钟计费会悄悄推高你的账单,而且一周后版本别名会自动切换。本指南将说明 Think Fast 2.0 究竟是什么、xAI 在底层做了哪些改动、基准测试成绩如何区分为独立评分与厂商自述、算清细账后它的真实成本是多少,以及如何调用它——另外还有你在将生产环境通话流程接入它之前最好先了解的注意事项。
准确性说明:发布详情、定价以及标题中宣称的准确性和业务声明均来自 xAI 的公告和文档(2026-07-29)。Artificial Analysis 的综合评分是独立的第三方测量结果。xAI 报告的声明——Starlink A/B 测试结果、转录倍数、“推理 token 减少 60%”以及“速度提升近 5 倍”的说法——尚未公布底层数据;请将其视为方向性的供应商数据,并自行评估。规格、价格和别名行为可能会发生变化;在构建之前请务必核实。
TL;DR。Grok Voice Think Fast 2.0 是 xAI 的端到端语音到语音模型,面向语音代理:音频进、音频出(通过 WebSocket),无需独立的 ASR→LLM→TTS 流水线。它确实很快(首次音频输出时间 0.70 秒,是前五名中唯一低于一秒的模型),在代理式语音任务上表现出色,在 Artificial Analysis 的 τ-Voice 代理基准测试中排名第一(56.5%),同时在语音到语音质量指数中总体排名第二(82.9%),仅次于 Qwen Audio 3.0 Realtime Plus(84.1%)。它边说边推理——将推理 token 的中位使用量降至旧模型的大约 40%——每分钟费用为 0.08 美元,较此前的 0.05 美元有所上涨。问题在于计费方式:语音按实际音频的挂钟分钟数计费,因此对一个服务成本更低的模型提价 60%,会直接反映在你的账单上。此外,8 月 5 日起 grok-voice-latest 别名将自动开始路由到 2.0,因此使用旧版本的团队需要在此之前明确固定版本。
关键要点
• 原生语音到语音:从麦克风到扬声器仅需一个模型,无需 ASR→LLM→TTS 链路——这正是首段音频在 0.70 秒内即可输出的原因。
• 智能体领导者:在Artificial Analysis的τ-Voice智能体基准测试中排名第一(56.5%),远超GPT-Realtime-2.1(45.7%)和Gemini 3.1 Flash(37.7%)。
• 并非整体领先者:在语音到语音质量指数中排名第二(82.9%),落后于 Qwen Audio 3.0 Realtime Plus(84.1%);OpenAI 在对话动态方面仍然胜出(95.7% 对 95.1%)。
• 贵60%:$0.08/分钟(约$4.80/小时),而Think Fast 1.0为$0.05/分钟——尽管该模型据称使用的推理令牌减少了约60%。
• 8月5日别名切换:grok-voice-latest 将自动路由到 2.0;在此之前请固定使用 grok-voice-think-fast-1.0,以继续使用更便宜的版本。
标注每项声明:Artificial Analysis 分数是独立的;Starlink A/B 测试、转录倍数和速度框架均由 xAI 报告且尚未发表。
Grok Voice Think Fast 2.0 是什么
Grok Voice 是 xAI 的实时语音到语音模型系列。"Think Fast" 是快速响应系列,最初于2026年4月与 Voice Agent Builder 一同推出;Think Fast 2.0 是该系列的第二代,于2026年7月29日发布。该模型是端到端的:它直接接收原始音频、进行推理并直接输出音频,而不是运行一个由语音识别模型、文本大语言模型、文本转语音模型组成的流水线。这种架构选择是其延迟优势的根本原因——没有串行跳数和中间文本,因此模型可以在仍在聆听时就开始生成响应。
xAI明确将其定位为面向语音AI代理:客服热线、电话销售、前台接待、电话系统,以及其他需要系统与人实时对话并切实完成事务——预约通话、筛选销售线索、更新记录、搜索网页——而不仅仅是闲聊的应用场景。此次发布瞄准的战场在于智能体能力,而非单纯的语音转写或合成。
相较于 Think Fast 1.0 的新内容
从1.0的升级不仅仅是版本号的提升;xAI描述了三个结构性变化:
• 并行语音推理。模型在说话的同时对查询进行推理,而不是先思考再开口。实际上,工具调用可以在代理说完第一句话之前就触发——这对延迟敏感的语音流程意义重大。
• 推理 token 大幅减少。xAI 报告称,中位推理 token 使用量降至前代产品的约 0.4 倍(大约减少 60%),这也是它表示尽管价格上涨,该模型的服务成本反而更低的部分原因。
• 强化学习学得的对话风格。RL重塑了它的说话方式:句子更短,一次只问一个问题,没有废话——一种更简洁、更人性化的通话风格,非常适合电话工作,因为啰嗦会消耗分钟数(而且,按分钟计费时,消耗的就是金钱)。
{{1}}在可测量的速度方面,首次音频输出时间从1.0版本的1.25秒降至2.0版本的0.70秒。{{/1}} {{2}}在转录方面,xAI报告称在24种语言上约有1.4倍的提升(据供应商报告,见下文)。{{/2}}

这些基准,逐一
此次发布以 Artificial Analysis 为依托,这是一家独立的第三方基准测试机构。这一点至关重要:与公告中大多数其他数字不同,这些数据由中立第三方测得,是真正值得逐一对比的数据。综合图景优于单一的头条数字。
语音到语音质量指数:82.9%(第二名)。这是整体语音到语音综合评分,较Think Fast 1.0的75.7%有所提升。它超过了GPT-Realtime-2.1(79.1%)和Gemini 3.1 Flash(69.5%),但并非第一。Qwen Audio 3.0 Realtime Plus以84.1%领先。因此,称其为“最佳整体语音模型”是数据无法支持的夸大说法;“顶级梯队中速度最快的智能体语音模型”才是准确的。
τ-Voice 智能体基准测试:56.5%(第一名)。这是 xAI 最看重的指标,排名是真实的:56.5% 击败了 Think Fast 1.0(52.1%)、GPT-Realtime-2.1(45.7%)和 Gemini 3.1 Flash(37.7%)。τ-Voice 衡量智能体语音性能——即模型通过语音渠道完成任务的能力,包括对话中途的工具使用。在“能否完成任务”这一狭义维度上,Grok 领先。马斯克推广的正是这一排名。
Big Bench Audio:97.2%。一个语音推理基准;表现强劲,尽管 Qwen 创下了 99.2% 的纪录。
全双工基准测试:95.1%。对话动态——打断处理、话轮转换、插入。相比1.0版本的77.8%有大幅提升,但OpenAI仍以95.7%略胜一筹,Qwen以98.4%领先。
首次音频时间:0.70秒。 对真实语音产品来说,这是最具决定性的数字。它较此前的1.25秒有所下降,而且是排名前五的模型中唯一的亚秒级数值;独立测试也广泛证实了亚秒级响应。流式TTS的首token延迟约为285毫秒。对于电话和实时应用,延迟是用户每一轮都能感受到的指标,而这也是2.0具有明显领先优势之处。
逐行来看,其特征很具体:说话最快,完成任务最出色,综合能力第二,对话技巧第三。这是一个优秀的语音助手模型,但作为“最佳聊天机器人语音”的说法则显得平平。选择它来完成与顶行匹配的工作。
转录准确性
除了对话之外,xAI 声称其转录能力也有实质性提升。其内部评估涵盖 24 种语言和数千个短语,据报道,准确率约为 Think Fast 1.0 的 1.4 倍,是 Deepgram Nova 3 和 ElevenLabs Scribe v2 等专用转录模型的 1.5–2 倍。在嘈杂的真实世界条件下——背景噪音、电话压缩、低带宽通话——与专用 STT 模型相比,报告中的准确率差距扩大到了约 10 倍。
这些正是需要谨慎对待的说法。它们是xAI报告的;评估框架、词组集和噪声配置均未公开。对2.0的带噪电话转录与Deepgram或ElevenLabs进行独立对比测试将很有价值,但截至本文撰写时,此类测试尚未发布。从方向上看,端到端模型在训练中吸收更多电话语音数据是一种合理的实际改进——但“10倍”应经过验证,而非当作事实重复。
定价:每分钟0.08美元,以及那个60%的问题
这就是此次发布引发争议的地方。Think Fast 2.0 每分钟音频收费 0.08 美元——约合每小时 4.80 美元——另外每条文本输入消息收费 0.004 美元。Think Fast 1.0 当年是每分钟 0.05 美元(每小时 3.00 美元)。这意味着涨价 60%,而且涨价与 OpenAI 下调 GPT-5.6 Luna 80% 价格和 Terra 20% 价格发生在同一个月,OpenAI 给出的理由与 xAI 对这款模型宣称的理由相同:服务成本下降。
计费单位才是关键。文本模型按token计费,因此当模型变得更高效时,客户的账单会自动缩减。语音模型按真实音频的分钟数计费,而对话的长度由说话的人决定,而非由模型决定。按分钟计费的产品,效率提升的收益归供应商所有,而不是买家。这就是为什么一个据称使用推理token减少约60%的模型——对xAI而言服务成本也因此更低——出租价格反而贵了60%。
在真实通话场景下算笔账:1.0上一次4分钟的通话费用为0.20美元;同样的通话在2.0上费用为0.32美元。每月一万次这样的通话就是40,000分钟:1.0每月2,000美元,2.0每月3,200美元——每月相差1,200美元,约合每年14,400美元,而这仅仅源于路由变更,与通话量无关。即使速度提升的收益再可观,也几乎无法弥补:每次通话省出整整10秒只能节省约0.013美元,而价格上调却增加0.12美元——你大约只能追回涨幅的九分之一。任何宣称2.0更便宜的商业论证,都是把“更快”误当成了“更便宜”。
作为背景说明,{{1}}2.0 的价格仍比 GPT-Realtime-2.1 High 便宜约 2.2 倍{{/1}},约为每小时 10.75 美元。所以按绝对值来说它并不贵——它的贵是相对于其前代产品,以及{{2}}当月所有其他模型供应商所趋向的{{/2}}方向而言的。
8月5日的迁移陷阱
有一个截止日期。2026年8月5日,grok-voice-latest 别名将自动开始路由到 Think Fast 2.0。如果您通过该别名在 Think Fast 1.0 上运行,“不做任何操作”就会在该日期将您——以及您的账单——升级到新版本。要留在 1.0,您必须在 8月5日之前显式固定 grok-voice-think-fast-1.0 模型 ID。
两个站得住脚的立场都要求在截止日期前采取行动:要么刻意锁定1.0,因为你的脚本化流程在每小时3.00美元的情况下运行良好;要么刻意转向2.0,并按每小时4.80美元重新预测,理由是基于质量而非节省。真正站不住脚的是在九月的发票中才发现这一变化。一条好的规则:把任何以“latest”结尾的别名视为一项长期指令,接受供应商下次交付的任何内容——包括其价格。
如何访问和使用它
Think Fast 2.0 可通过 xAI 的 Speech-to-Speech API 使用,模型 ID 为 grok-voice-think-fast-2.0,grok-voice-latest 为其滚动别名。这是一个通过 WebSocket 实现的实时全双工模型:wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0,在握手时使用 Authorization: Bearer 请求头进行身份验证。对于浏览器应用,请在服务端通过 realtime sessions 端点生成临时令牌,这样父级 API 密钥永远不会到达客户端。
该 API 与 OpenAI Realtime 兼容,因此现有的实时语音代码通常只需更换基础 URL 和密钥即可。会话设置通过 session.update 事件完成:选择预设语音(eve、ara、rex、sal、leo),设置输入和输出音频格式(默认 24kHz PCM16;电话场景使用 μ-law),启用服务端语音活动检测,并注册工具——包括内置的网页搜索工具——以便智能体能在对话中途采取行动。事件流程遵循标准模式:客户端追加音频缓冲区帧,服务端流式返回响应音频增量,当模型决定采取行动时触发工具调用参数事件,并将结果作为函数调用输出回传。该模型支持 25 种以上语言,并可通过约一分钟的语音进行自定义音色克隆。
请注意它不是什么:它是一个语音到语音的智能体模型,不是通用的转录或翻译服务。如果你的产品核心工作是低成本地将音频转换为文本,那么专用的STT模型是另一种工具——而且按分钟计费时,你为整个对话付费,因此纯转录的工作负载很快就会变得昂贵。

它如何融入语音代理技术栈
Think Fast 2.0 是一种专门的实时语音模型,通过 xAI 的专用 API 访问,而非由模型路由器托管的通用 LLM。语音通道直接运行在 xAI 的 WebSocket 上——亚秒级延迟正是由此实现,且经不起中间跳转。
语音产品周围的其他一切——非时间关键的自然语言逻辑、对话偏离脚本时的后备推理、摘要生成、分析以及代理在通话后触发的电子邮件跟进——都属于通用文本和多模态工作。对于这部分,像 OrcaRouter 这样的供应商中立端点通过一个兼容 OpenAI 的 API 即可对接多种 LLM,因此您不会因堆栈中不需要实时语音通道的部分而被锁定在单一供应商上。清晰的划分是:xAI 的专用 API 负责流式语音本身,OrcaRouter(或类似产品)负责围绕语音的文本和多模态推理。
竞争:智能体速度 vs 原始智能
Think Fast 2.0 正切入当前 AI 领域竞争最激烈的市场——实时语音智能体,而基准测试表让其中的权衡取舍变得异常清晰可见。
Qwen Audio 3.0 Realtime Plus是智能领域的领导者:在语音到语音质量指数上达到84.1%(排名第一),在Big Bench Audio上创下99.2%的纪录,全双工准确率达98.4%。但其平均首音频响应时间约为4.02秒——比Grok的0.70秒大约慢5.7倍。对于车载、可穿戴设备和电话通话场景,这种差异不是“快与慢”的区别,而是“可用与不可用”的区别。Qwen还针对不同场景分为Plus层级(注重质量)和Flash层级(首包约300毫秒),这是对同一矛盾的一个深思熟虑的回应。
GPT-Realtime-2.1在大多数指标上处于中游水平(质量79.1%,智能体能力45.7%),但在对话动态方面胜出(95.7%)。其High档位的每小时价格约为Grok的2.2倍。对于已经深度使用OpenAI生态系统的团队来说,它仍然是最低摩擦的默认选择。
Gemini 3.1 Flash在质量和智能体综合指标上落后(69.5%、37.7%),但它是更广泛的 Gemini 语音技术栈和 Google 生态系统的一部分,许多团队出于其他原因更青睐它。
实际结论:按工作负载来选择。如果你的语音代理必须让人感觉即时响应,并且必须可靠地完成工具支撑的任务(客服、资格筛选、预订),{{1}}Think Fast 2.0{{/1}} 是当前实测中最强的选择。如果你的优先目标是深度推理,并且能接受数秒级的延迟,{{2}}Qwen Plus{{/2}} 更胜一筹。如果对话的流畅度和生态适配最为重要,{{3}}GPT-Realtime-2.1{{/3}} 仍是需要超越的现有标杆。

它适用的三种场景
1. 电话支持与电话技术
最重要的组合:亚秒级首音频、嘈杂电话环境下的强健语音转写(据厂商报告),以及全双工打断处理。客服代表几乎立即开口、且能在对话中途调取账户信息的客服热线,正是 2.0 的调优目标。其更简短、一次只问一个问题的强化学习(RL)说话风格,也非常契合电话通信——无论在哪家供应商的计费口径下,分钟都是计费单位。
2. 线索资格认定与通话后跟进
代理语音是 2.0 真正领先的领域,而线索资格认定是代理语音的典型任务:在意图尚新时进行资格认定、路由并触发后续跟进。其工具调用可以在第一句话结束前触发,因此代理可以在与潜在客户交谈的同时创建 CRM 记录。请规划好会话级归因和严格的工具权限——语音代理可能实时出错,善后工作由你负责。
3. 正在积极开发中的语音智能体产品
对于自行构建语音助手的开发者而言——xAI 引用的 Tradecraft 和 GrokTerm 集成正是这种形态——2.0 的速度和兼容 OpenAI 的 API 使其成为 GPT-Realtime 代码的低摩擦即插即用替代方案。固定版本,运行一个小范围试点,并设定明确的成功条件(例如“筛选并引导定价页访客”),然后衡量每个已完成结果的成本,而不是每分钟成本。
限制与注意事项
Think Fast 2.0 到撰写本文时刚发布五天,这一点在注意事项中有所体现。Starlink 的 A/B 测试结果(更高的转化率和支持遏制率)是 xAI 自行报告的,并未公布具体数字;转录倍增系数和“近 5 倍速度提升”的说法同样是供应商的宣称,而非独立基准测试。你能看到的唯一一篇声称“性能回退和伪造测试报告”的文章,指的就是这种无法验证的问题——xAI 公布的数字尚未被独立复现,而对可靠性敏感的语音社区对未公布的供应商指标持合理怀疑。基准测试也无法衡量你最糟糕的情况:如果智能体自信地将线索路由到错误的团队,那么 0.70 秒的响应时间也毫无价值。语音计费按分钟计算,且已包含涨价因素,因此成本敞口是真实存在的。与任何全新的实时模型一样,预计 API 会频繁变动。请在自己的音频上验证准确性声明,在生产环境中固定版本,并在第一次上线通话之前设置好升级机制和录音。
常见问题
Grok Voice Think Fast 2.0是什么?
xAI 为语音代理打造的旗舰级语音到语音模型,于2026年7月29日发布:通过 WebSocket 实现原生端到端音频到音频,首音频延迟为0.70秒,并在 τ-Voice 代理基准测试中排名第一。
Grok Voice Think Fast 2.0 的价格是多少?
音频每分钟 $0.08(约每小时 $4.80),另加每条文本输入消息 $0.004——比 Think Fast 1.0 的每分钟 $0.05 上涨了 60%。
Think Fast 2.0 是最好的语音模型吗?
它在智能体任务上速度最快、表现最佳(56.5% τ-Voice,第一名),在语音到语音质量指数上总体排名第二(82.9%),仅次于 Qwen Audio 3.0 Realtime Plus(84.1%)。"最佳"取决于工作负载。
相比 Think Fast 1.0 有什么变化?
并行语音推理(边说边想),推理令牌减少约60%,采用RL调优的简短对话风格,转录效率提升1.4倍(供应商报告),首音频延迟从1.25秒降至0.70秒。
我的 Think Fast 1.0 会自动切换流量吗?
是的,2026年8月5日,如果你使用 grok-voice-latest 别名。在那之前固定 grok-voice-think-fast-1.0 以保持在1.0版本,或者主动选择2.0并重新预测成本。
我如何调用 Grok Voice Think Fast 2.0?
通过 xAI 的 Speech-to-Speech API —— 一个实时 WebSocket(wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0),兼容 OpenAI Realtime API,支持预设语音、服务器端 VAD 和工具调用。
它与哪些语音模型竞争?
Qwen Audio 3.0 Realtime Plus(更智能,首次音频响应需 4.02 秒,明显更慢)、GPT-Realtime-2.1(对话动态表现更好,High 档价格约贵 2.2 倍)以及 Gemini 3.1 Flash。
基准测试的声称是否可靠?
Artificial Analysis 的评分是独立且可靠的。Starlink A/B 结果、转录倍数和速度框架均由 xAI 报告,无公开数据——请将其视为方向性参考,并在你自己的音频上验证。
Grok Voice 适合转录吗?
它在对话中进行转录,xAI 声称在噪声条件下相比专用 STT 模型有大幅提升——但它是按对话分钟计费的,因此,专门的转录工作负载由专用 STT 模型来处理更为合适。
底线
Grok Voice Think Fast 2.0 是迄今测得的最强智能体语音模型,也是顶级梯队中遥遥领先的最快者——0.70秒首音响应是真实、独立、用户可感的胜利,在 τ-Voice 上位列第一也是实打实的排名。诚实的总结很具体:它是实时、工具支持的语音智能体这类用途中最好的工具,但并非每个指标上都是最好的语音模型——Qwen 在智能性上领先,OpenAI 在对话精细度上领先。争议不在速度,而在计价:xAI 声称服务成本更低的模型涨价了60%,带有硬性截止日期的自动别名迁移,以及建立在未公开厂商数据之上的头条式宣称。用它来获取智能体速度,钉住你的版本,标注厂商宣称,并在你自己的调用上验证准确性——同时把语音产品周边的通用文本和推理保留在 OrcaRouter 这类厂商中立端点上。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
