什麼是 Gemini 3.5 Flash Cyber?Google 的閘控漏洞狩獵模型,說明
Guides & Insights

什麼是 Gemini 3.5 Flash Cyber?Google 的閘控漏洞狩獵模型,說明

作者

jinhao song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年7月21日,Google DeepMind 公告了 Gemini 3.5 Flash Cyber——這是當日發布的三款模型中第三個且最與眾不同的一款,一同推出的還有通用型 Gemini 3.6 FlashGemini 3.5 Flash-Lite。它不是一款可供聊天或透過 API 呼叫的通用模型,而是一個程式碼安全專家:從 Gemini 3.5 Flash 進行微調的模型,用於尋找、驗證及修補軟體漏洞,運行於 Google 的 CodeMender 代理程式內。關鍵在於,它受到門控——僅限政府及「受信任的合作夥伴」在限制存取的試行計畫中使用,不對公眾開放,沒有自助註冊,也沒有公開定價。

這使得它與其兄弟模型有根本性的不同——那些模型通常可以公開使用,並像價目表上的其他模型一樣按token計價。Flash Cyber沒有價目表,因為它沒有可供定價的公開產品——它完全存在於一個封閉的試點計劃內。這篇解說文章比標題更深入:Flash Cyber究竟是什麼,它的哪些性能數據是真正獨立的、而非Google內部測試的結果,存取與定價的情況實際如何運作,以及——說實話——這個模型到底是為誰而設計的。

TL;DR 總結。Gemini 3.5 Flash Cyber 是真實存在的、受控的程式碼安全模型,運行於 CodeMender 中,用於尋找並修補軟體漏洞。此模型尚未正式發佈(GA),沒有公開 API 或定價,僅限政府與受信任的合作夥伴使用。在引用的一項第三方基準測試(CyberGym)中,其報告成績約為 83.2%,與 OpenAI 的 GPT-5.5-Cyber(85.6%)和 Anthropic 的 Mythos 5(83.8%)高度接近——Google 的優勢被定位為成本效益,而非能力突破。其他多數基準測試結果(包括 V8 問題數量數據)均為 Google 自身的內部評估。

關鍵要點

•  它是一個程式碼安全專家,專注於尋找、驗證和修補軟體漏洞——而不是SOC/威脅情報或惡意軟體分類工具,也不是一般的聊天機器人。

它是受限的,不是GA。访问仅限于政府和受信任的合作伙伴通过CodeMender平台;没有公开的API,也没有公布的每个代币价格。

從 Gemini 3.5 Flash 進行微調,並以每個漏洞報告多次平行子代理呼叫的形式部署(Google 提到最多約 5 次),合併為一個結果。未公開上下文窗口。

一個第三方基準測試。CyberGym 約83.2%(媒體報導),GPT-5.5-Cyber 為85.6%,Mythos 5 為83.8%。其他結果(Big Sleep、Chrome、V8)是Google自家的內部評估。

双重用途,刻意为之。一個模型如此擅長發現可利用的漏洞,如果被濫用是危險的,因此Google的主要緩解措施是存取控制,加上任何修補程式前的人工審核和沙箱化的發現驗證。

它與Sec-Gemini是不同的模型。Google較早的獨立威脅情報模型處理事件和根本原因分析;而Flash Cyber僅專注於修補程式碼漏洞。

它是為防禦者,而非開發者打造的。目標使用者是前線安全團隊、政府機構以及經過審查的企業合作夥伴,他們大規模進行漏洞研究—明確排除一般消費者及一般應用程式開發者。

此處大多數效能數據均為Google自身的內部評估;只有CyberGym是真正的第三方基準測試,而即便具體的83.2%這個數字,其來源更適合歸於媒體分析而非Google的逐字文本——應將其引用為「據報導」。請勿將Flash Cyber描述為普遍可用,也請勿引用按token計價的價格;該服務設有准入門檻且未定價。請勿將其與Google的另一個2025年威脅情報模型Sec-Gemini混淆。

什麼是 Gemini 3.5 Flash Cyber

「Cyber」在這裡指的是程式碼與軟體安全——具體來說,是尋找、確認並修復原始碼中的漏洞。它並非安全營運分析師、威脅情報助手或惡意軟體分類器,也不會像聊天模型那樣回答一般性問題。它運行於 CodeMender 內部,這是 Google DeepMind 用於自動化程式碼安全修補的 AI 代理(首次展示於 2025 年 10 月),而非作為獨立聊天或 API 產品銷售。這樣的定位很重要:Flash Cyber 並非一個你可以自行指向程式碼庫的模型,而是 Google 代其試點合作夥伴運作的更大、嚴格管控流程中的一個組件。

在實務上,多個 Flash Cyber 子代理會平行對同一份程式碼庫執行作業——Google 提到每個漏洞報告大約會用到五個——然後將各自的發現合併成一份統整報告。這是一種代理式多呼叫架構,而非一次性聊天機器人對話,這也是 Google 之所以將其定位為能與更大型模型競爭的主要原因:優勢來自於它的編排方式,而非單純仰賴模型原始規模。在任何修補程式發布之前,必須由人工核准,同時底層漏洞也會在沙箱中進行驗證——模型負責提出與發現問題,但實際部署仍由人員與基礎設施把關。

它是從 Gemini 3.5 Flash 微調而來的。Google 尚未公開 Flash Cyber 特定的上下文視窗大小或多模態能力,這本身即是一個數據點:與普遍可用的 Flash 模型不同,這裡沒有規格表可供查閱。其目標用戶是前線防禦者、政府以及經過審查的企業合作夥伴,他們大規模進行漏洞研究與修補程式分類——明確排除消費者或一般開發者,也明確不是一種可以透過註冊就加入自己技術棧的產品。

基準測試深度解析:數字代表的意義

記錄中只有一個第三方基準測試,而了解它實際測試的內容是很重要的。CyberGym是一個學術基準測試——由包括加州大學柏克萊分校的Dawn Song在內的團隊開發——它針對188個真實開源專案中的超過1500個有記錄的漏洞來評估代理程式。這是一個具有實際意義的測試環境:真實的程式碼、真實的歷史漏洞,而非人造的謎題。根據媒體報導,Flash Cyber在CyberGym上的表現約為83.2%,而OpenAI的GPT-5.5-Cyber為85.6%,Anthropic的Mythos 5則為83.8%。這是一個緊密的三方集群,沒有人取得壓倒性領先——這正是Google自身的宣傳偏向於成本效益而非原始分數的原因。值得注意的是,Google的部落格僅作出了「在明顯更大的模型面前仍具有競爭力表現」的定性聲明;精確的83.2%數字來自媒體對該公告的分析,而非Google本身的逐字文字或你可以自己查閱的公開排行榜條目。

V8 結果是另一種數字,完全是 Google 自家的指標。在一項針對 V8 JavaScript 引擎的測試中,Google 報告 Flash Cyber 發現了 55 個獨特且已確認的問題,而標準的 Gemini 3.5 Flash 則有 47 個,Claude Opus 4.6 有 36 個——其中包括 10 個其他模型都沒偵測到的問題。這個比較聽起來很驚人,因為它點名了特定競爭對手模型和具體數量,但這是 Google 自家基礎設施上、針對 Google 自己選定的目標所進行的內部測試。沒有任何外部單位執行這項評估、公佈可供複製的方法論,或獨立驗證這些數字。這是 Google 聲稱觀察到的實際結果——但這屬於廠商宣稱,而非經過稽核的數據,而這個區別在此處比多數基準測試報告更為重要。

「Big Sleep」評估也遵循相同模式,但解析度更低。針對像Chrome和Safari這類複雜的真實世界程式碼庫進行測試時,Google表示Flash Cyber「顯著超越」了主線Gemini 3.5 Flash和3.6 Flash——但這屬於質性宣稱,並未附上確切數據,更遑論由第三方驗證這項比較。將這三項結果並列對比,便浮現出一種模式:唯一具有外部來源(CyberGym)的數據顯示出緊密且不突出的集群;而另外兩項聽起來較亮眼的成績(V8、Big Sleep),都是Google以自家選定的基準來評測自家模型。

這個模式並非Google獨有,但在這裡比平常更難修正,因為Flash Cyber是受限制的。對於開放式甚至可透過API存取的模型,獨立研究人員最終能重新執行基準測試,確認或質疑廠商的數字——誇大的說法通常就是這樣被逮到。然而對於Flash Cyber,這種查驗幾乎無法進行:外部研究人員根本無法取得權限,來針對實際模型執行自己的CyberGym評測、自己的V8掃描,或任何其他測試。即使CyberGym的第三方背景僅涵蓋基準測試的設計,而非針對Flash Cyber進行獨立的重新執行——分數本身仍源自Google的揭露。在存取範圍擴大到當前試點之外以前,關於這個特定模型的每一項效能聲明——無論聽起來是否獨立——最終都取決於信任Google自身的說法。

不要將其與Sec-Gemini混淆

Google 擁有不止一種「安全」模型,而且它們很容易混淆。Sec-Gemini(約於 2025 年 4 月公布)是另一個獨立的早期實驗模型,專注於威脅情資工作流程——根本原因與事件分析,並與 Google Threat Intelligence 及 OSV 資料庫整合。如果您關注的是 SOC/威脅情資使用案例,那麼相關的產品線是 Sec-Gemini,而非 Flash Cyber。Flash Cyber 則狹義地專注於尋找及修復程式碼漏洞,且屬於 CodeMender 的一部分。

存取、定價以及實際取得安全性模型功能的方法

存取故事很簡單,但對大多數讀者來說沒什麼幫助:根本不存在。Flash Cyber 既無販售、無標價,也無法透過任何可申請的 API 金鑰取得。唯一進入的方式是成為政府機構或經審查的「受信任夥伴」,獲准加入 CodeMender 試行計畫——沒有自助註冊、沒有保證入選的候補表單、也沒有公開的價格表,因為根本沒有公開產品可供定價。Google 曾表示未來會擴大存取權限,但並未為此說法附上時間表或正式上市日期,因此「總有一天」是目前記錄中最具體的答案。

這與Flash Cyber自己的同類產品形成鮮明對比。{{1}}同日發佈的Gemini 3.6 Flash和Gemini 3.5 Flash-Lite,均已全面上市,並像其他商業模型一樣按token計價。Flash Cyber則完全屬於不同類別——它更接近於一項恰好被公開披露的Google內部能力,而非一條產品線。預算並非限制因素;即使是一家資金充足、但與Google沒有安全研究關係的企業,今天也無法獲得Flash Cyber的API金鑰。{{/1}} {{2}}預算並非限制因素;即使是一家資金充足、但與Google沒有安全研究關係的企業,今天也無法獲得Flash Cyber的API金鑰。{{/2}}

那麼,團隊現在如果想用 AI 幫忙尋找並修復自己程式碼中的漏洞,實際上是怎麼做的?對於絕大多數未參與試點計畫的團隊來說,可行的途徑就是運行通用前沿模型——也就是那些已經正式發布(GA)且有定價的模型——來處理同樣的工作:程式碼審查、漏洞分類、補丁草擬,並搭配自身的人員審查和沙箱隔離機制。這與專門為此任務訓練的專用工具在本質上截然不同,但它卻是當前可及的選項。像 OrcaRouter(其背後整合了超過 200 個模型,統一提供兼容 OpenAI 的端點)這類聚合器,便是大多數團隊如今用來組建此類通用模型安全工作流程的方式,而不是等待一個可能永遠無法加入的限制性試點。

適用對象

在試點計畫中經過審核的防禦者。如果您是政府機構或Google已承認的信任夥伴組織,Flash Cyber確實是一款真正為特定用途打造的工具:它運行在CodeMender的「發現-驗證-核准-修補」工作流程內,其並行子代理架構專為大規模掃描真實程式碼庫而設計,且Google自身的測試顯示,在這項特定任務上,它與較大的通用模型相比具有競爭力——甚至在某些內部指標上領先。對於這個狹窄的目標群體而言,即使部分佐證數據是自行報告的,其價值主張仍然真實。

其他所有人——也就是幾乎所有人。如果你是一個典型的工程團隊、沒有Google合作夥伴關係的安全顧問公司,或是獨立研究員,Flash Cyber根本不選項可選,無論你的使用案例聽起來多麼合適。沒有保證能成功的申請流程,也沒有你能支付的金額來解鎖它。現今你實現AI輔助漏洞工作的實際途徑,是透過一般可用的前沿模型——若你希望在不同供應商之間靈活切換,則可透過OrcaRouter這類工具路由——並結合你自己的審查紀律,因為那些通用模型都不具備CodeMender內建的人為核准與沙盒驗證防護機制。

{{1}}正在決定是否等待的團隊。{{/1}}{{2}}如果您的組織正為了取得存取權限而特別探索與 Google 的合作路徑,那麼應考量到目前並無正式發布日期的事實來規劃——在此期間,請將任何現有的安全工作流程視為需要在普遍可用的模型上運行,並在 Google 的試點計畫擴展時重新評估。將路線圖押注於沒有公布時間表的受限存取,是大多數團隊不應承擔的風險。{{/2}}

常見問題

我可以使用 Gemini 3.5 Flash Cyber 嗎?

除非您是經過審核的政府機構或受信任的合作夥伴,否則不行。這是 CodeMender 內部的有限存取試點,沒有公開 API、沒有自助存取途徑,也沒有公佈的定價。Google 表示存取權限將隨時間推移擴大,但尚未給出正式上市日期。

它實際上是做什麼的?

它會尋找、驗證並修補原始碼中的軟體漏洞,以平行子代理的形式運作,並將結果合併為一份報告。任何修補都需經人工核准,且漏洞在回報前會先於沙箱中進行驗證。

它與OpenAI和Anthropic的網絡模型相比如何?

在一個共享的第三方基準測試(CyberGym)中,這三者緊密聚集:Flash Cyber 約83.2%,Anthropic Mythos 5 83.8%,OpenAI GPT-5.5-Cyber 85.6%。Google 將其優勢定位為成本效率而非最高原始分數。這三者都僅對經過審查的組織開放。

它的規格是什麼?

它是從 Gemini 3.5 Flash 微調而來的。Google 尚未針對 Flash Cyber 公布其上下文長度、多模態能力或參數數量。

這是危險的還是雙重用途?

Google 承認雙重用途的風險——一個擅長尋找可利用漏洞的模型可能會被惡意用於攻擊——並將存取控管列為主要緩解措施,同時輔以人工核准修補程式以及沙盒驗證發現結果。

CyberGym 的分數是否經過獨立驗證?

CyberGym本身是一個真正的第三方學術基準。但針對Flash Cyber的特定83.2%數字來自於媒體對Google公告的報導,而非Google自己的逐字文本或即時公開排行榜條目,並且由於該模型受到訪問限制,目前沒有外部方能夠自行重新運行。請將該數字視為報導所得,而非經獨立確認。

Flash Cyber 何時會正式推出?

Google 尚未說明。該公司僅表示,在目前政府與受信任夥伴的試行計畫之外,存取權限將會隨時間逐步擴大,但尚未公佈正式發布日期或時間表,因此目前還沒有具體資訊可供規劃。

底線

Gemini 3.5 Flash Cyber 是一個狹窄且嚴肅的工具:一個在 CodeMender 內獵捕和修補漏洞的程式碼安全模型,僅對政府及受信任的合作夥伴開放。在僅有的一個獨立基準測試中,它確實展現了能力,但與 OpenAI 和 Anthropic 的網路安全模型相比,它仍處於一個緊密的群組中,並未脫穎而出,且其幾乎所有突出的數據都是 Google 自身的內部評估。如果你不是經過審核的合作夥伴,你無法使用它——而對於在你的程式碼上進行一般性的安全相關工作,可用的前沿模型仍然是實際的途徑。以下的比較將其與兩個真正的競爭對手並列。


© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube