
什么是Gemini 3.5 Flash Cyber?谷歌的门控漏洞搜寻模型详解
- google新Google: Gemini 3.6 Flash2026-07-2150智能69代码
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- meta新Meta: Muse Spark 1.12026-07-1651智能71代码
- kimi新MoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56代码59数学
- minimaxMiniMax: MiniMax M32026-05-3144智能59代码59数学
- AnthropicAnthropic: Claude Opus 4.82026-05-2856智能74代码68数学
- GoogleGemini 3.5 Flash2026-05-2350智能70代码51数学
2026年7月21日,Google DeepMind 宣布推出 Gemini 3.5 Flash Cyber——这是当天发布的三个模型中的第三个,也是最特殊的一个;另外两个分别是通用型 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。它并非普通模型,无法通过对话或 API 调用。这是一款代码安全专用模型:基于 Gemini 3.5 Flash 微调,能够在 Google 的 CodeMender 代理中查找、验证并修复软件漏洞。关键在于,它受到访问限制——仅面向政府及“受信任合作伙伴”开放有限试点,不提供公开访问、自助注册渠道,也未公布定价。
这使得它与同类模型{{1}}有着根本区别——后者通常以公开价目表上的每token定价提供。Flash Cyber没有价目表,因为它没有可附定价表的公开产品——它完全存在于一个封闭的试点项目中。本篇解读将深入表象之下:Flash Cyber到底是什么,其性能数据中哪些真正独立于Google的内部测试,访问权限和定价机制实际如何运作,以及这个模型究竟适合哪些人群。
TL;DR 总结。Gemini 3.5 Flash Cyber 是一个真实的、受控的代码安全模型,运行在 CodeMender 内部,用于发现并修补软件漏洞。它尚未正式发布(GA),没有公开的 API 或定价,仅限政府和可信合作伙伴使用。在引用的一个第三方基准测试(CyberGym)中,其报告得分约为 83.2%,与 OpenAI 的 GPT-5.5-Cyber(85.6%)和 Anthropic 的 Mythos 5(83.8%)非常接近——Google 的优势被描述为成本效益,而非能力上的显著领先。其他大多数基准测试的声称,包括 V8 问题数量数据,均为 Google 自身的内部评估。
关键要点
• 它是一个代码安全专家,专用于发现、验证和修补软件漏洞——而非SOC/威胁情报或恶意软件分类工具,也非通用聊天机器人。
• 它是受限的,并非公开可用。访问权限仅限于政府和受信任的合作伙伴,通过CodeMender平台;没有公开API,也没有公布的每token价格。
• 从Gemini 3.5 Flash微调而来, 并部署为每个漏洞报告的多个并行子代理调用(Google提到最多约5个),合并成一个结果。上下文窗口未公开。
• 一个第三方基准测试。CyberGym 约 83.2%(据媒体报道),对比 GPT-5.5-Cyber 的 85.6% 和 Mythos 5 的 83.8%。其他结果(Big Sleep、Chrome、V8)是谷歌自己的内部评估。
• 双重用途,故意为之。一个如此擅长发现可利用漏洞的模型如果被滥用是危险的,因此谷歌的主要缓解措施是访问控制,加上在任何补丁之前的人工审批以及对发现结果的沙盒验证。
• 这是一个与Sec-Gemini不同的模型。谷歌早期独立的威胁情报模型处理事件和根本原因分析;Flash Cyber则专门用于修补代码漏洞。
• 它是为防御者构建的,而非开发者。目标用户是前线安全团队、政府以及经过审查的企业合作伙伴,他们大规模进行漏洞研究——明确不是面向消费者或普通应用开发者。
此处的多数性能数据均为谷歌内部评估;仅CyberGym是真正的第三方基准测试,而具体的83.2%这一数字更适合援引媒体分析而非谷歌原文——应注明为“据称”。请勿将Flash Cyber描述为全面开放,也勿引用其按token计费的价格;该模型尚处于限制访问且未定价状态。注意不要将其与谷歌2025年另一款威胁情报模型Sec-Gemini混淆。
Gemini 3.5 Flash Cyber 是什么
“Cyber”在这里指的是代码与软件安全——具体而言,是在源代码中发现、确认并修复漏洞。它既不是安全运维分析师、威胁情报助手,也不是恶意软件分类器,同时也不会像聊天模型那样回答一般性问题。它运行在 CodeMender 内部——这是 Google DeepMind 的自动化代码安全补丁 AI 代理(首次亮相于 2025 年 10 月),而非作为独立的聊天或 API 产品出售。这一框架至关重要:Flash Cyber 并非你自行指向代码库的模型,而是 Google 代表其试点合作伙伴运营的一个更大、严格受控的管道中的组件。
实践中,多个 Flash Cyber 子代理在代码库上并行运行——谷歌提到每个漏洞报告大约有五个——它们各自的发现会被合并成一份统一的综合报告。这是一种智能体多调用架构,而非一次性聊天机器人对话,这也是谷歌将其视为可与更大模型竞争的重要原因:优势来自编排方式,而非单纯的模型规模。在任何修复方案部署前,需经人工审批,且底层漏洞会在沙箱中验证——模型负责提议和发现,但真正决定部署的是人员和基础设施。
该模型基于Gemini 3.5 Flash进行微调。谷歌尚未披露Flash Cyber专用的上下文窗口尺寸或多模态能力,这本身就是一个信息点:与普通可用的Flash模型不同,这里没有可供查阅的规格表。其目标用户是前线防御人员、政府机构以及经过审核的企业合作伙伴,用于大规模进行漏洞研究和补丁分类——明确不面向消费者或普通开发者,也明确不是通过注册即可加入自己技术栈的产品。

基准测试深度解析:数字的含义
在现有记录中,只有一个第三方基准测试,理解其实际测试内容至关重要。CyberGym 是一项学术基准测试——由包括加州大学伯克利分校 Dawn Song 在内的团队构建——用于评估智能体在 188 个真实开源项目中超过 1,500 个已记录漏洞上的表现。这是一个具有实际意义的测试环境:真实代码、真实历史漏洞,而非合成谜题。媒体报道显示,Flash Cyber 在 CyberGym 上得分约为 83.2%,OpenAI 的 GPT-5.5-Cyber 为 85.6%,Anthropic 的 Mythos 5 为 83.8%。这是一个紧凑的三方集群,没有任何一方遥遥领先——这正是谷歌自身宣传更强调成本效益而非原始分数的主要原因。值得注意的是,谷歌的博客仅做出了“与显著更大模型相比具有竞争力性能”的定性声明;83.2% 的精确数字来自媒体对相关公告的分析,而非谷歌的原文或你可自行查证的公开排行榜条目。
V8 的结果是另一种类型的数字,完全属于谷歌自己的衡量标准。在与 V8 JavaScript 引擎的测试中,谷歌报告称 Flash Cyber 发现了 55 个独特的确诊问题,而标准 Gemini 3.5 Flash 发现了 47 个,Claude Opus 4.6 发现了 36 个——其中包括 10 个其他模型未发现的问题。这个比较听起来很引人注目,因为它提到了具体的竞争模型和具体数字,但这是一次在谷歌自有基础设施上、针对谷歌自己选定的目标运行的内部测试。没有任何外部方执行过这项评估、公开其方法论供复现,也没有独立验证这些数字。这是谷歌声称观察到的真实结果——但它只是供应商的声明,而非经过审计的结论,而且这里的区别比大多数基准测试报告中的区别更为重要。
“Big Sleep”评估遵循同样的模式,但分辨率更低。在针对Chrome和Safari等复杂真实世界代码库进行测试时,谷歌表示Flash Cyber“显著超越”了主流Gemini 3.5 Flash和3.6 Flash——但这只是一个定性说法,没有附上具体数字,更不用说让第三方来验证对比了。将这三种结果并列在一起,一个模式便浮现出来:唯一一个有外部来源的数字(CyberGym)显示出一个紧凑且不起眼的聚类;而另外两个听起来更炫酷的胜利(V8、Big Sleep)都是谷歌用自己选择的基线来给自己的模型打分。
这种模式并非谷歌独有,但在它身上比以往更难纠偏,因为Flash Cyber处于封闭状态。对于开放或甚至提供API访问的模型,独立研究人员最终可以重新运行基准测试,确认或质疑供应商的数据——夸大的宣称通常就是这样被戳穿的。但面对Flash Cyber,这种核查基本无法进行:外部研究人员根本无法获取权限来运行自己的CyberGym测试、自己的V8扫描,或针对实际模型的任何其他检验。即便CyberGym拥有第三方血统,那也只是覆盖了基准测试的设计本身,而非独立地让Flash Cyber在它之上重新跑一遍——分数本身仍然追溯回谷歌的披露。在访问权限扩大至当前试点范围之外之前,关于这个特定模型的所有性能宣称——无论听起来是否独立——最终都只能依赖于信任谷歌自己的说法。

不要将其与 Sec-Gemini 混淆
Google 不止有一种“安全”模型,而且它们很容易被混淆。Sec-Gemini(大约在2025年4月发布)是一款独立的、更早期的实验性模型,专注于威胁情报工作流程——根因分析与事件分析,并与 Google Threat Intelligence 和 OSV 数据库集成。如果你的关注点是安全运营中心/威胁情报用例,那么相关的产品线是 Sec-Gemini,而非 Flash Cyber。Flash Cyber 严格聚焦于发现和修复代码漏洞,它位于 CodeMender 内部。
访问、定价以及如何实际获得安全模型能力
访问的故事很简单,尽管对大多数读者来说没什么帮助:根本没有访问途径。Flash Cyber 不出售、不标价,也无法通过任何你能申请的 API 密钥获取。唯一的进入方式是成为政府机构或经审查的“可信合作伙伴”并被纳入 CodeMender 试点计划——没有自助注册、没有保证能加入的候补表单,也没有公开的价格表,因为根本没有可供定价的公开产品。Google 已表示访问权限将随时间逐步扩大,但并未为这一说法附上时间表或 GA 日期,因此“最终”是目前记录在案的最具体答案。
这与Flash Cyber自家的同类产品形成了鲜明对比。同日发布的Gemini 3.6 Flash和Gemini 3.5 Flash-Lite均已全面上市,并像其他商业模型一样按token计价。而Flash Cyber则完全属于另一个类别——它更接近于一项恰好被公开披露的Google内部能力,而非产品线。预算并非制约因素;即使是一家资金雄厚、但与Google没有安全研究关系的企业,目前也无法获得Flash Cyber的API密钥。
那么,如果团队现在就想借助AI帮助发现并修复自己代码中的漏洞,他们实际会怎么做呢?对于绝大多数未参与试点项目的团队来说,可行的途径是运行通用前沿模型——即那些已正式发布且有定价的模型——来完成相同类型的工作:代码审查、漏洞分类、补丁草拟,同时围绕这些模型进行人工审查和沙盒隔离。这与专门为此任务训练的特制工具在本质上截然不同,但它是可及的选择。像OrcaRouter这样的聚合器,它在一个兼容OpenAI的端点背后提供200多个模型,正是如今大多数团队构建此类通用模型安全工作流程的方式,而不是等待一个他们可能永远无法获准进入的封闭试点。
适用人群
在试点项目内部经过审查的防御者。如果你是政府机构或谷歌已认可为可信合作伙伴的组织,Flash Cyber 是一款真正定制的工具:它运行在 CodeMender 的“发现-验证-批准-修补”工作流程中,其并行子代理架构专为大规模扫描真实代码库而设计,并且谷歌自身的测试表明,在这一特定任务上,它能够与更大的通用模型竞争——甚至在某些内部指标上领先。对于这一小众受众,即便部分支持数据是自行报告的,其价值主张也是真实的。
其他所有人——几乎就是所有人。如果你是一个典型的工程团队、一家没有与谷歌合作的安全咨询公司,或者一名独立研究员,那么无论你的用例听起来多么合适,Flash Cyber 对你来说根本不是一个可选项。没有保证能成功的申请流程,也没有你可以通过付费解锁它的价格。今天,你实现 AI 辅助漏洞研究工作的现实路径,是一个一般可用的前沿模型——如果你想在不同提供商之间灵活切换,可以通过 OrcaRouter 之类的工具来路由——再结合你自己的审查纪律,因为那些通用模型都没有 CodeMender 内置的人工审批和沙箱验证防护措施。
正在决定是否等待的团队。如果您的组织正在探索与Google的合作路径以获取访问权限,那么有必要围绕“尚无GA日期”这一事实进行规划——同时将任何当前的安全工作流视为需要在通用可用的模型上运行,并在Google试点项目扩大时重新审视。将路线图押注在未宣布时间表的限制访问上,是大多数团队不应承担的风险。
常见问题
我可以使用Gemini 3.5 Flash Cyber吗?
除非你是经过审查的政府机构或受信任的合作伙伴,否则不行。这是CodeMender内部的一个有限访问试点项目,没有公开API,没有自助访问权限,也没有公布定价。谷歌表示访问权限会随着时间的推移而扩大,但尚未给出通用可用性(GA)的日期。
它实际上做什么?
它作为并行子代理运行,在源代码中发现、验证并修补软件漏洞,并将发现结果合并到一份报告中。任何补丁都需经人工批准,漏洞在报告前会在沙盒中进行验证。
它与OpenAI和Anthropic的网络模型相比如何?
在一个共同的第三方基准测试(CyberGym)中,三者表现非常接近:Flash Cyber 约83.2%,Anthropic Mythos 5 83.8%,OpenAI GPT-5.5-Cyber 85.6%。谷歌将其优势定位为成本效益而非最高原始分数。所有这三个模型都仅向经过审查的组织开放。
它的规格是什么?
它是从 Gemini 3.5 Flash 微调而来的。谷歌尚未专门公布 Flash Cyber 的上下文窗口、多模态能力或参数数量。
它危险吗/是两用的吗?
谷歌承认存在双重用途风险——一个善于发现可利用漏洞的模型可能被恶意利用——并指出访问控制是其主要的缓解措施,此外还包括人工审批补丁和沙箱验证发现结果。
CyberGym 的分数是独立验证的吗?
CyberGym本身是一个真正的第三方学术基准。但针对Flash Cyber的83.2%具体数据来自媒体报道谷歌的公告,而非谷歌自己的原话或公开排行榜条目,而且因为该模型是受限的,目前没有任何外部方能够自行重新运行它。请将该数字视为报道中的数字,而非独立确认的结果。
Flash Cyber 什么时候正式上线?
谷歌尚未说明。它已表示,访问权限将随着时间的推移而扩大,超出当前政府及可信合作伙伴的试点范围,但尚未公布正式上线日期或时间表,因此目前还没有具体的计划依据。
底线
Gemini 3.5 Flash Cyber 是一个狭窄而严肃的工具:一个代码安全模型,用于在 CodeMender 内部发现并修复漏洞,仅向政府和受信任的合作伙伴开放。它在唯一可用的独立基准测试上确实有能力,但与 OpenAI 和 Anthropic 的网络模型紧密聚集在一起,并未领先,而且其几乎所有突出的数据都是谷歌自己的内部评估。如果你不是经过审查的合作伙伴,你就无法使用它——对于你自己代码中一般的安全相关工作,可访问的前沿模型仍然是实用的途径。下面的比较将其与两个真正的竞争对手进行了对比。

