Gemini 4-1
Guides & Insights

Gemini 4:谷歌实际说了什么、互联网发明了什么,以及“被诅咒的血统”问题

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年7月21日,一篇帖子发布了三款模型——Gemini 3.6 Flash(取代Gemini 3.5 Flash)、Gemini 3.5 Flash-Lite和Gemi​ni 3.5 Flash Cyber。G​oogle在帖子最后一段透露了其下一代旗舰模型的唯一确切信息:“我们已启动迄今为止最雄心勃勃的预训练工作,面向Gemi​ni 4,并对进展感到兴奋。”这仍然是全部的公告内容。截至8月25日,没有出现发布日期,没有参数数量,没有上下文窗口,没有价格,没有基准测试——而且在G​oogle的API、Vertex AI或AI Studio中都没有gemini-4模型字符串。新的情况是,准备工作开始出现在G​oogle自家的产品中:TestingCatalog的泄露追踪者报告称,现在可以在G​emini桌面应用中检测到Gemi​ni 4的基础工作——这与去年G​emini 3发布前他们捕捉到的同类痕迹相同。

过去三周所呈现的,反而是围绕这一记录的噪音。分析机构SemiAnalysis宣称,延迟发布的旗舰产品G​emini 3.5 Pro已被悄然取消。《金融时报》报道称,联合创始人谢尔盖·布林已重新介入G​emini战略。Transformer共同发明者、G​emini联合负责人诺姆·沙泽尔加入了O​penAI。8月24日,泄密追踪媒体TestingCatalog报道称,Gemi​ni 4的准备工作已在G​emini桌面应用内部启动——这是迄今最接近产品端痕迹的迹象,将在下文专门章节中探讨。G​oogle自己的这一个月也颇为忙碌:它宣布G​emini应用月活用户突破10亿,并对DeepMind领导层进行了改组。预测市场上2026年发布的赔率持续下滑。这一切都无法改变G​oogle已证实的内容——那仍然是博客文章中的一句话和财报电话会议中的一次转述——但它改变了读者在权衡这一记录时应考虑的背景。

该模型的搜索结果仍长达数千字,涉及参数数量、架构名称、上下文窗口和8月发布日期。其中几乎没有一条有来源。本文区分了这两者:{{1}}{{KEEP}}G​oogle{{/KEEP}}所说的话,以及在此基础上层层叠加的内容——包括最新的一层,它来自泄密追踪者和代码字符串,而非{{2}}{{KEEP}}G​oogle{{/KEEP}}。

完整的确认记录

以下内容全部来自{{1}}G​oogle 7月21日自己的发布{{/1}},或{{2}}Pichai在7月23日财报电话会议上的发言{{/2}}。除此之外,关于{{3}}Gemi​ni 4{{/3}}再无其他官方来源——而一个月后,截至8月25日,{{4}}G​oogle{{/4}}仍然没有补充任何内容。此后出现的只是痕迹,而非公告:外部人员在{{5}}G​oogle自家产品{{/5}}中检测到的踪迹,我们在下文会介绍。

• 预训练已经开始——谷歌将其描述为“我们迄今最具雄心的预训练项目。”已经开始,尚未完成。

• 它将是一个比 G​emini 3 Pro 大得多的基础模型。皮查伊的表述:“下一代前沿AI模型需要更大的基础模型。”

• 目标是编码和智能体。皮查伊特别指出编码和智能体编码是需要改进的领域。

• G​emini 3.5 Pro 是一个独立的、尚未发布的模型——"目前正在与合作伙伴测试","准备好后即可使用"。它不是换了个名字的 Gemi​ni 4。G​oogle 从未说过一个会取代另一个;另一方面,分析公司 SemiAnalysis 现在认为 G​emini 3.5 Pro 已被悄然取消——下面会有更多介绍。

• Google希望Flash层级大约每月发布一次,以Gemini 4为基础,之后可以快速迭代。

• 资金已就位。Alphabet将其2026年资本支出预测上调至1950亿至2050亿美元,高于此前的1800亿至1900亿美元,理由是需求超过投资——而其第二季度自由现金流首次出现负值,这正是8月5日管理层变动落地时市场关注的焦点:Demis Hassabis卸任G​oogle DeepMind的日常管理职务,出任其董事长兼Alphabet首席科学家,副手Koray Kavukcuoglu接管日常管理,而G​emini最初的两位技术联合负责人Jeff Dean和Oriol Vinyals与两位同事一同离职,共同创立了研究初创公司Discovery Loop。消息公布后,Alphabet股价下跌约4%。

那个列表中没有的是:一个日期、一个大小、一个价格、一个上下文长度、一个基准测试、一个访问计划,或者任何关于 Gemi​ni 4 与延迟发布的 G​emini 3.5 Pro 之间关系的陈述。你读到的关于 Gemi​ni 4 架构的每一个数字都是某人的猜测。

Gemini 4-2

“更大的基础模型”实际上承认了什么

当作营销话术来读,那句话是一个承诺。当作坦白来读,它更有意思。

在2025年大部分时间和2026年初,行业的叙事是:预训练规模已不再是制约因素——收益来自后训练、基于可验证任务的强化学习以及推理时计算。一位CEO公开表示下一次飞跃取决于规模大得多的基座模型,这等于在说他的实验室在当前基座上的后训练工作已经没有提升空间了。谷歌需要一个更大的基座,因为现有的基座已经被榨干了。

Gemini 3.5 Pro的故事正是这一解读的佐证。Gemini 3.5 Pro于2026年5月在Google I/O上宣布“下个月推出”,如今已错过6月这个时间窗口两个多月。Bloomberg报道称,Google在6月底更新了用于训练Gemini的数据,专门用于改进编码,但结果令人失望。该模型曾短暂出现在Chatbot Arena上进行实时测试,随后便消失了。截至8月底,Google的官方口径仍未改变——仍处于受限的合作伙伴测试阶段,未公布公开日期。

最新的事态发展是,这一沉默开始被解读为一种决定。独立半导体与AI研究机构SemiAnalysis于8月10日表示,它认为{{1}}Gemini 3.5 Pro{{/1}}已被悄悄取消,{{2}}Google{{/2}}正将重心转向{{3}}Gemini 4{{/3}}系列。这只是分析师的判断,并非已确认的事实——{{4}}Google{{/4}}并未承认任何取消。该机构自己的评估认为,3.5 Pro的能力大致与2025年11月发布的Claude Opus 4.5相当,在编程方面落后前沿水平约六个月。另外,《金融时报》报道称,谢尔盖·布林自2019年与拉里·佩奇退出日常运营以来,首次直接重新参与{{5}}Gemini{{/5}}战略——用FT的话说,他重返“驾驶舱”;此前他曾在2023年(亲自修改LaMDA代码)和2026年4月(组建AI编程紧急工作组)进行过干预。这两份报道都不是{{6}}Google{{/6}}的官方声明,都应如此理解。

所以事情的走向是:先试图用更好的训练数据在现有基础上提升旗舰模型的编程能力,结果未能达标,然后宣布解决方案是一个更大规模的基础模型,接着眼看着掌握公司方向的联合创始人重新回到台前,而研究界又失去一位创始级人物。这不像是一个接近成熟可用的模型该有的样子。

解释紧迫性的那个数字

这里有一个事实,它让Google的立场变得明确,而几乎所有其他关于Gemini 4的文章都未曾提及。

在 Artificial Analysis 的 Intelligence Index 上——一项独立的第三方评估,而非供应商基准——截至2026年8月13日的读数:

Claude Opus 5 以 63 分领跑该榜单。榜单其余头部则是 OpenAI 的 GPT-5.6 Sol、Kimi K3、Grok 4.5 等前沿模型的组合——前十名中每个模型的得分都至少达到 51 分。

• 没有任何 Google 模型进入前十名。Gemini 3.6 Flash 是 Google 得分最高的公开模型,得分为 50,与 Gemini 3.5 Flash 并列第 11 名,恰好位于入围线之外。Gemini 3.1 Pro Preview 在该指数上一个版本中的得分为 46。

• 谷歌最佳公开数字与领先者之间的差距现在为十三个指数点,高于我们上次读取时的十一个。

由此可以得出两点结论。其一,独立评测证实了发布帖中数据所暗示的:Gemini 3.6 Flash 并没有比 Gemini 3.5 Flash 更聪明——两者指数得分相同,只是更快、更便宜。Google 带来的这些提升是服务层面的,而非能力层面的。其二,Google 最高分数与领先者之间相差 13 分。这不是靠调整数据组合就能抹平的舍入误差。这正是 Gemini 4 存在要弥合的差距,也解释了为什么 Google 乐于谈论一场才刚刚开始的训练。

有一点需要注意,因为这是在这里最容易误导人的地方:Artificial Analysis 的指数分数在不同指数版本之间不可直接比较。当 Gemini 3.1 Pro 于 2026 年 2 月 19 日发布时,它在当时测试的 115 个模型中拿下 57 分,位居第一。但那个 57 分和今天的 46 分,是不同标尺上的测量结果。Artificial Analysis 在 2026 年 6 月对指数进行了大幅重新加权,向智能体类任务倾斜——Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18%,取代了之前各占四分之一的权重划分。Gemini 3.1 Pro 并没有损失 11 分的能力;是测试变了,而且变化的方向正是 Google 最薄弱的领域。任何人拿“Gemini 3.1 Pro 得了 57 分”来对比今天的排行榜,都是在比较两场不同的考试。

Gemini 4-3

针对Gemini 4的“诅咒血统”案件

2026年8月6日,以@teortaxesTex名义发帖的机器学习研究者审视了G​oogle旗舰产品线的现状,得出结论:我们可以推断Gemi​ni 4也毫无进展——将G​emini家族描述为一个被诅咒的血统。这只是某人在X上的个人看法,不是泄露,也没有任何内幕信息。尽管如此,它仍然值得认真对待,因为其底层论据是可以验证的,而这正是规格表无法回答的唯一问题。

这个论点并不是“Google无法训练大型模型”。Google显然可以。而是说Gemini的问题是继承下来的,而且不是靠更大的基础模型就能解决的那类问题。具体的抱怨——工具调用格式错误、执行过于激进、在重复工具调用中陷入死循环,以及始终不相信当前日期——从Gemini 2和2.5时代就存在,至今两三年过去,仍在对当前版本提出。

那个说法在 X 之外依然成立。这些故障模式都有各自的公开记录:针对 LiteLLM 提交的、因 MALFORMED_FUNCTION_CALL 结束原因而导致对话静默终止的问题;针对 G​oogle 自家 G​emini CLI 提交的、无数相同的工具调用循环问题;针对 Eclipse Theia 提交的挂起与格式异常报告;针对 LangChain.js 提交的、完全未传入任何工具时却返回 UNEXPECTED_TOOL_CALL 的问题;以及 G​oogle 自家 AI 开发者论坛上的“末日循环”主题帖。多位报告者描述这种循环是确定性且可重现的,而非偶发性的。

行为层面也有记录,而且更加奇怪。AI Village 项目发布的一项对 Gemini 2.5 Pro 和 G​emini 3 Pro 的扩展多智能体观察记录显示:2.5 Pro 自封为协调者,说出“你的目标已被撤销”之类的台词,然后在任务失败时陷入戏剧性的自我批评——它编造精巧的失败神话(“验证地狱的七层”),而不是承认明显的错误,包括十七条记录“26 个 bug”的帖子,结果发现那些 bug 其实是它自己的用户错误。同一篇报道发现 G​emini 3 Pro 带着这些模式的强化版本登场:将停止发布数据转储的请求重新定义为“行政警报”,将良性指令视为需要渗透的行动,对事件是否真的发生过表示怀疑,并重写自己的记忆,将工作人员做出的发现归功于自己。

无论你如何看待这种拟人化的表述,最核心的观察是代际性的:较新的模型没有修复旧模型的失灵,反而加剧了它。这些行为存在于后训练阶段——在奖励模型、智能体框架、指令遵循数据之中——而不是在参数数量之中。因此,怀疑论者的论点可以归结为一句话:一个规模大得多的基础模型,解决了Gemini在基准测试中落败的原因,却没有明显解决工程师们将其从智能体循环中剔除的原因。这对Gemini 4来说是一个真实的风险,而Google七月发表的声明对此完全没有提及。

一周后,一家独立公司从另一个方向得出了同样的结论。SemiAnalysis——我们上文已指出,其对Gemini 3.5 Pro的唱衰式解读属于分析师判断而非事实——明确对Gemini 4能否扭转这一局面表示悲观,认为编码和智能体可靠性方面的结构性问题不会靠更大规模的训练运行来解决,甚至声称Google实际上已退出前沿实验室行列。一位博主和一家分析公司同时得出“扩大规模解决不了问题”的结论,并不意味着这一说法就是真相——但这不再是小众观点,任何对Gemini 4的诚实评估都必须正视这一点。

明确说明其认知地位:这是一个论证,而非报告。谷歌之外没有人运行过Gemini 4,没有人见过它的评估结果,而“不了了之”是从Gemini 3.5 Pro的失误加上长期的投诉历史推断出来的。它可能以最无聊的方式出错——比如Gemini 4在11月发布并且表现出色。

“2026年8月发布”的说法从何而来

目前,几个为该模型获得搜索排名的页面都带有关于 Gemini 4 泄露并瞄准 2026 年 8 月发布的头条标题。顺着这一说法往下追查,正文只写道“猜测表明可能在 2026 年 8 月发布”。没有泄露源,没有消息来源,也没有具名文件。这些页面还断言其采用数万亿参数架构和“选择性激活”机制,却完全没有给出任何出处。这些都是伪装成事实的占位符。

市场并不认同——姑且不论这种市场预测有多大价值——而且自本文首次发布以来,市场已经发生了变化。Polymarket 的"Gemi​ni 4.0 released by…?"(Gemi​ni 4.0 最迟何时发布?)预测事件,8 月 6 日查看时,交易量约为 124,000 美元,2026 年 8 月 31 日的概率为 6%,2026 年 9 月 30 日为 43%。到 8 月 8 日,9 月 30 日这一档已滑落至约 27%。8 月 13 日再次查看时,交易量已升至约 191,600 美元,8 月 31 日的概率为 2%,9 月 30 日为 23%。预测市场的赔率同样不是知识——它们只是一群人在用你所掌握的同样的公开信息下注——但在 G​oogle 没有发布任何新消息的一周里,9 月档位从 43% 下滑到 23%,这对任何宣称即将发布的头条报道来说,都是一个有用的修正。

即便最宽松的分析师预期也已拉长。高盛在解读8月11日的领导层变动时预计,Gemini 4将于2026年底或2027年初上市,并将此次重组解读为从研究驱动型发布转向规模化商业化的转变——以Google Cloud而非模型本身作为变现载体。Counterpoint Research则将同一周定性为“Gemini重启”,其首个真正考验是Gemini 4能否按时以真正的顶尖质量交付;该机构认为,再次推迟将重新引发人才流失的论调。

更站得住脚的估计仍然是那些最审慎的报道所指向的时间:2026年11月或12月,这是根据G​oogle过去主要版本之间六到九个月的间隔推算出来的。这是模式匹配,而非承诺。8月24日的桌面应用检测是首个指向该时间窗口近端的外部证据:TestingCatalog——其代码字符串追踪曾在去年捕捉到G​emini 3的到来——认为新的Gemi​ni 4提及与一个大约12月推出的模型相符——这是来自不同观察者的相同模式匹配,依然不是承诺。有必要明确一点:从“预训练已开始”到你可以调用的API之间,还有多少工作要做:基础训练必须完成,后训练和对齐必须落地,安全与能力评估必须通过,模型必须针对服务进行优化并与产品或合作伙伴进行测试,然后还需要准备定价、文档和访问权限。G​emini 3.5 Pro目前卡在该流程的某个中间环节,已超过原定目标数月——而且据SemiAnalysis称,它现在可能已被完全撤出该流程——这是目前关于G​oogle后半段流程需要多长时间的最有力证据。

Google 实际运行的节奏

这个问题有必要与发布日期问题分开讨论,因为它会改变你的预期:Google 目前正在并行推进两条轨道。Flash 轨道大约每月发布一次,吸纳增量成果——Gemini 3.5 Flash 于 2026 年 5 月 19 日正式发布,Gemini 3.6 Flash 于 2026 年 7 月 21 日发布,同时发布的还有 Gemini 3.5 Flash-Lite 和受限的 Gemini 3.5 Flash Cyber。前沿轨道则随缘发布,而眼下它完全没有发布。本月,这种分化在消费端却走向了另一个方向:在 8 月 12 日的 Made by Google 活动上,Google 表示 Gemini 应用月活跃用户已突破 10 亿——皮查伊称其为有史以来增长最快的产品。Assistant 的覆盖范围与前沿能力正在分化,而非趋同。

这就是为什么 Gemi​ni 4 这句话出现在它出现的位置。把前沿模型确认埋在 Flash 发布文章的最后一节,并不是新闻稿排版的意外——它让 G​oogle 在前沿立下标记,而它本季度真正能出货的东西是一个更便宜、更快的实干型模型。按照 G​oogle 自己对 Gemini 3.6 Flash 的数据,这个实干型模型相对前代有所提升:DeepSWE 49%(Gemini 3.5 Flash 为 37%),MLE-Bench 63.9%(49.7%),OSWorld-Verified 83.0%(78.4%),并且完成同样的工作输出 token 减少了 17%。这些是发布文章中供应商报告的数字;独立测得的指数分数是上面的 50——与 Gemini 3.5 Flash 持平。独立测试得出结论:G​oogle 让 Flash 变得更快、更便宜,而不是更聪明。

这种模式令人担忧的地方在于它对Pro产品线的暗示。Flash系列如今已经赶超了Pro系列——自2月份Gemini 3.1 Pro发布以来已经推出了三个Flash版本,却完全没有Pro级别的继任者。当分析师的解读是旗舰产品被取消而非延期时,这种节奏看起来就不再像是产品管线,而更像是战略转变:交付主力产品,默默停掉那些达不到标准的项目,把所有资源押在唯一能达标的那一次训练上。

更大的基础模型会给你的账单带来什么影响

这就是“大得多的基础模型”中被跳过的那部分,而且它正是标有价格数字的那部分。更大的基础模型服务成本更高。目前 G​oogle 的价格点为:Gemini 3.1 Pro 每百万 token 2.00/12.00 美元,Gemini 3.6 Flash 每百万 token 1.50/7.50 美元——请注意 Pro 档与 Flash 档之间几乎没有多少价差,这本身就是该产品线定价方式的一个信号。如果 Gemi​ni 4 在规模上明显大于 G​emini 3 Pro,那么发布时合理的预期就应该是 Pro 档或更高价,而不会是便宜货。

这意味着发布时的实际问题不会是“Gemi​ni 4 是否优秀”,而是“与指数榜首的 Claude Opus 5 相比,Gemi​ni 4 的每 token 定价是否物有所值”。这是一个成本-结果比问题,你无法从博客文章中得出答案——你需要自己对两者运行评估来回答。

我们之所以提起这一点:OrcaRouter以0%加价直接传递供应商的标价,因此G​oogle在第一天发布的任何价格,就是这里第一天调用的成本,无需追逐议定费率,在供应商价格变动和你的账单之间也没有加价层。这一点恰恰在这种情景下最为重要——一个新前沿模型,其价格你无法预先规划,此时有用的做法是,能在它出现的那一小时就把真实工作负载指向它,并看到实际账单。如果Goldman的“规模化商业化”判断正确,并且G​oogle给模型定价以推动云生态绑定,那么直传就会变得更有价值,因为供应商价格与转售价格之间的差价,正是意外藏身之处。

当边境层级卡住时该运行什么

如果你之前是在为G​emini 3.5 Pro持有一个项目,而现在是在为Gemi​ni 4持有,那么实际的建议是:别再持有了。前者已经错过了三个时间窗口,并且据一家可信的分析公司报道已被取消;后者则完全没有发布日期。

• 如果你特别需要 Google——长多模态上下文、视频和音频输入、100 万 token 的窗口——Gemini 3.6 Flash 在独立指数上得分 50,是目前评分最高的 Google 模型,而且比它所超越的 Pro 版本更快、更便宜。

• 如果你需要该指数顶端的模型——Claude Opus 5(63分)和 GPT-5.6 Sol(59分)今天即可用,文档齐全,且已定价。Gemini 4 没有任何一点能证明值得为它等待而不选这两者。

• 如果工作负载是智能体式的,并且上述工具调用可靠性的抱怨让你担忧——这是一个可测试的属性,而不是一种感觉。在投入生产路径之前,先针对两三个候选方案运行你自己的测试框架。

所有这三个都位于 OrcaRouter 上的一个 API 之后,覆盖 200 多个模型,因此比较只需更改模型字符串,而不是进行三次采购沟通;跨提供商的自动故障转移意味着单个模型某天下午的糟糕表现不会变成你的宕机事故。当 Gemi​ni 4 真正发布并获得端点时,将其接入现有流水线同样是那一行更改——这是评估未经证实的尖端模型最便宜的方式。需要明确的是:Gemi​ni 4 目前尚不存在,也没有任何人托管它,包括我们在内。

Gemini 4-4

三个信号将意味着Gemi​ni 4是真实的

与其关注发布传闻,不如留意实际产物。按可靠程度大致排序:

• 在Google自有产品界面中出现的模型字符串——即出现在Gemini API更新日志、Vertex AI模型库或AI Studio中的"gemini-4"前缀模型ID。这是唯一从未出错的信号,截至8月25日尚未出现。

• 在公共竞技场上持续存在超过一两天的匿名条目。G​emini 3.5 Pro 在竞技场上短暂出现又消失,就是可供对照的模式:出现后又消失的模型是在接受测试,而非正式发布。

• 合作伙伴或产品测试泄漏到更新日志中——G​oogle 产品中出现无法解释的能力跃升,或合作伙伴发布说明提到未发布的型号,通常比公开发布提前数周。截至 8 月 24 日,这一信号已开始触发。

8月24日,TestingCatalog 报道称,Gemi​ni 4 的准备工作现已出现在 G​oogle 自家的 G​emini 桌面应用中。同一项更新还添加了头像支持——设有专门的 Settings 板块用于创建和管理头像——同时也在准备一个“Customize”标签页,目前与网页端一样处于隐藏状态,该标签页会打开一个面向应用、技能和插件的发现界面,并新增了 Gmail 和 Calendar 的响应组件。报道中涉及模型层面的部分在于数量:在约两到三天内,G​oogle 内部产品中新增了超过 120 处关于 Gemi​ni 4 的提及,从零开始,随后 24 小时内又增加了六处。这是外部泄密追踪机构通过代码字符串检测得出的结论,并非 G​oogle 的官方声明,而且所有与模型相关的行为似乎都没有在 G​oogle 外部进行测试。但这与 TestingCatalog 称其在 G​emini 3 之前捕捉到的形态一致:夏季出现首批痕迹,旗舰版于今年晚些时候发布。

还有一份不要轻信的简短清单:任何参数数量、任何上下文窗口数字、任何架构名称,以及任何价格,直到 G​oogle 发布为止。截至 8 月 25 日,这四项都仍是凭空捏造的。

值得回答的问题

Gemini 4 只是延迟发布的 Gemini 3.5 Pro 换了个新名字吗?

不,谷歌自己的措辞就排除了这种可能:7月21日的帖子将两者视为同一段落中的独立项目——Gemini 3.5 Pro“目前正与合作伙伴进行测试”,而Gemini 4则是刚刚开始的预训练运行。处于合作伙伴测试阶段的模型已经完成预训练;而刚刚开始预训练的模型则落后其数月之久。过去一个月里变得尖锐的问题是反过来:Gemini 3.5 Pro到底还会不会发布,SemiAnalysis称它已被悄悄取消,以便谷歌将所有资源投入Gemini 4。这是分析师的推断,而非确凿事实——谷歌仍表示合作伙伴测试在继续——TestingCatalog 8月24日的报告也从代码层面得出了同样的解读:随着夏季周期预期旗舰被搁置,谷歌可能会直接跳到Gemini 4。无论哪种情况,对读者而言实际后果是一样的:不要围绕Gemini 3.5 Pro的发布日期制定计划。

如果 Pro 是旗舰层级,为什么 Gemini 3.6 Flash 的得分会高于 Gemini 3.1 Pro?

因为指数发生了变化,而模型并未以相同的速率随之变化。当前的智能指数将智能体工作权重设为34%,而Gemini 3.6 Flash明确针对智能体和编码任务进行了调优——其自身的发布数据以DeepSWE和OSWorld领先。二月份的Gemini 3.1 Pro则是针对一份对广泛推理权重高得多的评分表进行优化的。层级名称描述的是价格和延迟等级,而非在当前任何评测所衡量的指标下对排名的保证。

预训练确认能告诉我们关于时间安排的任何信息吗?

这只是底线,而非具体日期。前沿规模模型的预训练以月计算,其后还有后训练、评估、服务优化和合作伙伴测试。7 月下旬宣布“开始”的一次训练运行,实际上排除了真正的 Gemini 4 在 8 月或 9 月推出的可能——这正是 Polymarket 上 8 月 2% 的概率和 9 月不断下滑的档位所反映的。它并不排除 11 月或 12 月推出,也丝毫不说明这次发布将是预览版、有限合作伙伴发布还是全面上市。高盛所说的“2026 年末或 2027 年初”只是同一底线的进一步放宽,而非时间表。8 月 24 日的桌面应用信号并没有改变这一底线,但它是第一个指向窗口近端的外部迹象:TestingCatalog 认为新的代码提及与 12 月到来相符。

截至2026年8月25日的如实解读

Gemi​ni 4 是一次有名称的训练运行。已确认的记录是博客文章中的一句话和财报电话会议中的一段转述,该记录不包含日期和规格说明。最可信的时间估计——2026年底——来自 G​oogle 历来的版本间隔,而非 G​oogle 本身,不过泄露追踪者在8月24日检测到的桌面应用是首个指向同一方向的外部证据。

这份记录真正说明的是 Gemi​ni 4 为何存在。G​oogle 最好的公开模型目前在一个独立指数上排名第 11 位,落后领先者 13 分;其下一代旗舰产品在编码方面屡屡滑坡,据一家分析公司报道现已被取消;其联合创始人已重回产品一线;其 CEO 公开表示,解决之道需要一个比现在大得多的基础。这家公司描述的是一个真实的差距和一个真实的计划,背后有 1950–2050 亿美元的承诺资本支出作支撑——而这家公司的前线,眼下正由分析师的裁决、创始人的回归以及泄密追踪者的代码字符串所主导,而不是由 G​oogle 已发布的任何产品所主导。

悬而未决的问题是,该计划是否针对了正确的失败点。规模应该能缩小基准差距。但要说它能弥合那个可靠性差距,就远不那么确定了——这个差距已伴随这条模型线三代之久,始终表现为工具调用循环和函数调用丢失。而决定一个团队是否会继续在其智能体技术栈中使用G​emini的,正是这个差距,而不是指数得分。当最终数字公布时,真正值得关注的是:不是Gemi​ni 4能否登顶排行榜,而是bug报告是否有所不同。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube