一张生成的主视觉卡片,标题为“Dots vs Gemini 3.1 Pro”。一条竖直分隔线将它分为两半:左侧面板标注为“Dots”,带有一个云电脑图标以及一行文字“自己的电脑 + 浏览器 - 4,000+ 个应用”;右侧面板标注为“Gemini 3.1 Pro”,带有一个眼睛与波形图标以及“文本、图像、音频、视频输入 - 100 万上下文 - $2.00 / $12.00”。OrcaRouter 标志合成在右下角。
Guides & Insights

Dots vs Gemini 3.1 Pro:拥有桌面的智能体对战拥有五感的模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

“多模态”这个词掩盖了这两者之间真正的区别,所以不妨先从它们各自如何与这个世界打交道说起。Gemini 3.1 Pro Preview 是谷歌的旗舰推理模型,于 2026 年 2 月 19 日以预览版形式发布:它接受文本、图像、音频、视频和文件作为输入,返回文本,可在 1,048,576 个 token 的上下文窗口中工作,输出上限为 65,536 个 token,当提示词不超过 200,000 个 token 时,每百万输入 token 收费 2.00 美元、每百万输出 token 收费 12.00 美元,超过该长度则分别涨价至 4.00 美元和 18.00 美元。Dots 是该公司的常驻智能体,于 2026 年 9 月 29 日在 DevDay 上发布:这个智能体拥有自己的云端计算机和浏览器,可在 4,000 多个已连接的应用中工作,运行于 GPT-6 Astra 之上,并随 Pro 和 Business Premium 一并提供。Gemini 3.1 Pro 观察世界并描述它;而一个 dot 则在其中行动。这是两个不同的动词,而关于这一对组合的几乎每一个实际问题,都取决于你的问题需要的是哪个动词。

输入并不等同于行动

Gemini 3.1 Pro 的媒体支持确实非常广泛——一段两小时的录音、一张产品照片、一份电子表格导出文件和一份合同,都可以出现在同一个请求中——但这些输入中的每一项都是调用之前就已经存在的东西。该模型的输出是文本:一个答案、一次提取、一份计划、一份草稿。模型运行并不会改变对话之外的任何东西。

一个圆点颠覆了这一切。它的输入很平常——你的消息、你的应用数据、你描述的一项任务——而它的输出则是现实世界中的改变:一个文件被移动、一张工单被更新、一条经你批准后发送的消息、一个在它自己的浏览器中打开的页面。OpenAI 的发布材料描述它能同时推进多个项目、从反馈中学习,并在无需新建对话线程的情况下接受新任务。这是对一名工作者的描述,而不是对模型的描述,这也解释了为什么 OpenAI 没有为它发布基准测试:你不会在排行榜上给同事做基准测试,而是观察它完成了什么,并查看 Activity View。

• 它能接收什么——一侧是消息、任务描述和已连接应用数据;另一侧是文本、图像、音频、视频和文件

• 它会产出什么——在其他软件内部进行更改,受规则和审批关卡约束,针对随后由你自行处理的文本

• 运行在哪里——OpenAI 的云计算机,自带浏览器,除非你将它们连接,否则与你的机器隔离;它面向 Google 的服务基础设施运行,可通过 API 从任何你喜欢的地方访问

• 上下文 — 对于一个点未记录,相较于输入 1,048,576 个 token、输出 65,536 个 token

• 证据 — 厂商演示,无独立基准测试,相较于 Artificial Analysis Intelligence Index 的 29.7,GPQA Diamond 为 94.1,长上下文召回为 82,且独立于 Google 列出

Gemini 3.1 Pro 有什么值得拥有的

之所以要保留这样一款模型,是因为感知本身很难,而大多数智能体在这方面表现不佳。Gemini 3.1 Pro 公布的独立评测概况不同寻常:GPQA Diamond 上的 94.1 是接近前沿水平的结果,长上下文召回上的 82 是我们所列模型集合中的第二好成绩,而 SciCode 上的 58.7 则让它在那个特定榜单上位居榜首。它并不出彩的地方是智能体决策——τ²-Bench 得分 95.6 还算可观,但其 τ-banking 分项,也就是衡量针对银行系统进行多步骤工具使用的那个分项,只有 21.4。所有这些都是第三方测量结果,在我们目录中与其来源一并列出,而非厂商自己给出的数字,这正是它们比一份发布宣传材料更有价值的原因。

那个按请求计费故事的另一半是:模型并不是免费的。它在二月进入预览,比当前前沿模型发布早了几个月,而且定价高于廉价档位:每百万 token 2.00 美元和 12.00 美元,换算下来,一页密集文本的输入成本约为 0.0006 美元。这看起来不算什么,直到你对整个媒体库进行视频摄取,这时它就会变成账单上的一项。读取一帧视频的成本与读取一段文字相同,而模型会很乐意把两者都计入账单。

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

两种拒绝转换的成本模型

dot 的成本是一项订阅,附带未公布的额度:第一个 dot 包含在 Pro 或 Business Premium 中,首月适用扩展限额,与你的 dot 的对话不会消耗 ChatGPT 的使用限额,且对于第二个 dot、额外速度或容量,或完成的任务,都没有公布价格。CNBC 对主题演讲的报道称,Sarah Friar 将新的 500 美元 Pro 500 档定价为使用额度加上 Ultrafast 模式,而不是按每个 dot 计费,因此,OpenAI 价目表上最贵的套餐也无法得出每单位代理工作的成本。

Gemini 3.1 Pro 会把一切都转换成 token,包括那些并非文本的部分。音频、视频和图像都按输入计费,所以一项任务的成本取决于你让模型看了多少世界——这是一项有用的特性,因为你可以度量它;也是一项危险的特性,因为账单上最大的那个数字往往是没人预先规划过的。在这方面,模型路由的帮助是具体而非笼统的:凭借200 多个模型,一个密钥即可调用,按提供商标价、不加价,昂贵的多模态读取和廉价的后续工作就能落在同一条流水线中的不同模型上,而 Google 的费率变动当天就会落到你的账户上,而不是等到续约时才生效。

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

两者协同工作之处

自然的搭配是一个负责协调的 dot 和一个负责感知的多模态模型。工作到达时,dot 会将其路由:任何需要查看或收听的内容都会交给 {{1}}Gemini 3.1 Pro{{/1}} 生成结构化描述,然后该描述会回到工作流中,供日程或规则据此采取行动。dot 负责跟进;模型负责阅读。这样拆分还能让昂贵的模态调用保持可审计,这一点很重要,因为正是这些调用会让人措手不及。

在 OrcaRouter 上,该模型以 google/gemini-3.1-pro-preview 的形式进行路由,按提供商标价原价透传、0% 加价,与目录中的其他模型一同提供,并具备上游提供商性能下降时的自动故障转移,以及可将多个模型组合为单次调用的路由 DSL。有一点值得说得更精确:这其中并不包含什么——dots 不在我们的目录中,没有为它提供任何端点,也不存在可用于指向请求的模型标识符。如果你希望把感知层置于自己的掌控之下——而一个二月份的预览模型恰恰是那种值得加以隔离的依赖——那么该模型应当放在你自己的端点之后,而 agent 则留在你租用的地方。

你的问题需要哪个动词?

如果工作涉及观察或聆听某些内容并给出答案,那么 Gemini 3.1 Pro 才是工具,而 dot 则是错误的购买选择。如果工作涉及在多个应用之间把某件事做完,且无需你亲自操作,那么 dot 才是工具,再多的多模态输入也无法替代它。做对这件事的团队会两者并用,并明确保持边界:感知交给可衡量、按量计费的模型,行动则依托于一个你可以取消的产品。

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新