Gemini 3.5 Flash Cyberとは?Googleのゲート型脆弱性探索モデルを解説
Guides & Insights

Gemini 3.5 Flash Cyberとは?Googleのゲート型脆弱性探索モデルを解説

著者

jinhao song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年7月21日、Google DeepMindは発表しました Gemini 3.5 Flash Cyber — その日リリースされた3つのモデルのうち、3番目で最も異例なものです。汎用のGemini 3.6 FlashGemini 3.5 Flash-Liteと並んでいます。これはチャットしたりAPIから呼び出したりできる汎用モデルではありません。コードセキュリティの専門家です。Gemini 3.5 Flashからファインチューニングされたモデルで、ソフトウェアの脆弱性を発見、検証、修正するためにGoogleのCodeMenderエージェント内で動作します。そして重要なのは、アクセスが制限されていることです。限定アクセスのパイロットプログラムで政府および"trusted partners"のみが利用でき、一般公開はなく、セルフサービスのサインアップもなく、公開価格もありません。

That makes it fundamentally different from its siblings, which are generally available and priced per token like any other model on a price sheet. Flash Cyber has no price sheet, because it has no public product to attach one to — it lives entirely inside a walled pilot program. This explainer goes deeper than the headline: what Flash Cyber actually is, which of its performance numbers are genuinely independent versus Google's own internal testing, how the access and pricing situation really works, and who — realistically — this model is even for. それが他の兄弟モデルとは根本的に異なる点です。他のモデルは一般公開されており、価格表にある他のモデルと同様にトークンごとに課金されます。Flash Cyberには価格表がありません。なぜなら、価格表を紐づける公開製品が存在せず、完全に囲い込まれたパイロットプログラムの内部にのみ存在するからです。この解説記事は見出し以上の深掘りをします。Flash Cyberの正体、パフォーマンス数値のうちどれが本当に独立したものか、あるいはGoogle社内テストによるものか、アクセスと価格設定の実態、そして現実的にこのモデルは誰のためのものか、といった点です。

TL;DR 結論Gemini 3.5 Flash Cyber は、CodeMender 内で動作し、ソフトウェアの脆弱性を発見・修正する実際のゲート付きコードセキュリティモデルです。GA(一般提供)ではなく、公開APIや価格設定はなく、政府および信頼できるパートナーに制限されています。引用された唯一のサードパーティベンチマーク(CyberGym)では約83.2%と報告されており、OpenAIのGPT-5.5-Cyber(85.6%)やAnthropicのMythos 5(83.8%)と密接にクラスタリングされています。Googleの優位性は、能力の突出ではなく、コスト効率として位置づけられています。V8の課題件数を含む他のほとんどのベンチマークの主張は、Google自身の内部評価です。

重要なポイント

これはコードセキュリティの専門家であり、 ソフトウェアの脆弱性を見つけ、検証し、修正するために調整されています — SOC/脅威インテルやマルウェアトリアージツールではなく、一般的なチャットボットでもありません。

•  これはゲート付きであり、GAではありません。アクセスはCodeMenderプラットフォームを通じて政府および信頼できるパートナーに限定されています。公開APIはなく、公開されたトークン単価もありません。

Gemini 3.5 Flashからファインチューニングされ、脆弱性レポートごとに複数の並列サブエージェント呼び出しとしてデプロイされ(Googleによると最大約5つ)、1つの結果に統合されます。コンテキストウィンドウは非公開です。

•  1つのサードパーティベンチマーク。 CyberGym ~83.2% (報道による)、対GPT-5.5-Cyber 85.6%およびMythos 5 83.8%。他の結果 (Big Sleep, Chrome, V8) はGoogleの内部評価です。

デュアルユース、意図的に。 悪用された場合、悪用可能なバグを見つけるのにこれほど優れたモデルは危険です。そのため、Googleの主な対策はアクセス制御であり、さらに、パッチ適用前の人間による承認と、発見結果のサンドボックス化された検証が含まれます。

•  これはSec-Geminiとは異なるモデルです。Googleの以前の別個の脅威インテリジェンスモデルはインシデントと根本原因分析を扱います。Flash Cyberはコードの脆弱性のパッチ適用に焦点を絞っています。

•  これは防御者向けに作られており、開発者向けではありません。 想定されるユーザーは、最前線のセキュリティチーム、政府機関、および大規模な脆弱性調査を行う審査済みのエンタープライズパートナーであり—明示的に消費者や一般のアプリ開発者ではありません。

ここでのパフォーマンス数値のほとんどはGoogle自身の内部評価であり、真正のサードパーティベンチマークはCyberGymのみです。また、特定の83.2%という数値は、Googleの原文よりもむしろプレス分析を出典とする方が適切ですので、“reported.”として引用してください。Flash Cyberを一般提供されていると説明したり、トークン単価を引用したりしないでください。それはゲートされており、価格未定です。また、Googleの別の2025年脅威インテリジェンスモデルであるSec-Geminiと混同しないでください。

Gemini 3.5 Flash Cyberとは

「Cyber」とは、ここではコードおよびソフトウェアのセキュリティを意味します。具体的には、ソースコード内の脆弱性の発見、確認、修正を指します。これはセキュリティ運用アナリスト、脅威インテリジェンスアシスタント、またはマルウェア分類器ではなく、チャットモデルのように一般的な質問に答えるものではありません。CodeMender(Google DeepMindの自動コードセキュリティパッチ適用AIエージェント、2025年10月に初公開)内で動作し、独立したチャットやAPI製品として販売されるものではありません。この枠組みは重要です。Flash Cyberはユーザー自身がコードベースに向けるモデルではなく、Googleがパイロットパートナーに代わって運用する、より大規模で厳密に制御されたパイプライン内のコンポーネントです。

実際には、複数のFlash Cyberサブエージェントがコードベース上で並行して動作します。Googleは、脆弱性レポートあたり約5つ程度と述べています。そして、それぞれの調査結果は単一の統合レポートにまとめられます。これは、ワンショットのチャットボットのやり取りではなく、エージェントベースのマルチコールアーキテクチャです。これが、Googleがこれをより大規模なモデルに対して競争力があると位置づける大きな理由の一つです。その強みは、生のモデルサイズではなく、どのようにオーケストレーションされるかから生まれます。修正がリリースされる前に、人間がそれを承認し、根本的な脆弱性はサンドボックスで検証されます。モデルは提案と発見を行いますが、実際にデプロイされるものを管理するのは人とインフラストラクチャです。

Gemini 3.5 Flash からファインチューニングされています。Google は Flash Cyber に固有のコンテキストウィンドウサイズやマルチモーダル機能を開示していません。これ自体が一つのデータポイントです。つまり、一般公開されている Flash モデルとは異なり、確認できる仕様シートが存在しません。その想定ユーザーは、最前線の防御担当者、政府機関、および大規模な脆弱性調査とパッチトリアージを行う審査済みのエンタープライズパートナーです。明示的に消費者や一般の開発者向けではなく、また、サインアップして自身のスタックに追加できる製品でもありません。

ベンチマークの深掘り:数字が意味するもの

記録上、第三者によるベンチマークはただ1つ存在し、それが実際に何をテストしているのかを理解する価値があります。CyberGymは学術的なベンチマークであり、UCバークレーのDawn Song氏を含むグループによって構築されたもので、188の実際のオープンソースプロジェクトにわたる1,500以上の文書化された脆弱性に対してエージェントを評価します。これは現実的なテスト環境です。実際のコード、実際の過去のバグ、合成パズルではありません。報道によると、Flash CyberはCyberGymで約83.2%、一方OpenAIのGPT-5.5-Cyberは85.6%、AnthropicのMythos 5は83.8%です。これは3者間の拮抗したクラスターであり、誰かが圧倒的にリードしているわけではありません。そのため、Google自身のメッセージは生のスコアではなくコスト効率に重点を置いています。注目すべきは、Googleのブログでは「大幅に大きなモデルに対して競争力のあるパフォーマンス」という定性的な主張のみを行っており、正確な83.2%という数字は発表に対する報道分析によるものであり、Google自身の原文や自分で確認できる公開リーダーボードのエントリから来ているわけではありません。

V8の結果は異なる種類の数値であり、完全にGoogle独自の指標です。V8 JavaScriptエンジンに対するテストで、GoogleはFlash Cyberが55件のユニークな確認済み問題を発見したと報告しており、標準のGemini 3.5 Flashでは47件、Claude Opus 4.6では36件(他のモデルが捉えなかった10件を含む)と比較されています。特定の競合モデル名と具体的な件数を挙げているため、印象的な比較に聞こえますが、これはGoogleが自社のインフラ上で、自社が選択したターゲットに対して実施した内部テストです。外部の第三者がこの評価を実施したり、その方法論を再現可能な形で公開したり、件数を独立して検証したりしたわけではありません。これはGoogleが観測したと述べる実際の結果ですが、監査されたものではなくベンダーの主張であり、その違いはほとんどのベンチマーク報告よりも重要です。

“Big Sleep”評価も同様のパターンで、さらに低い解像度で行われている。複雑で現実世界のコードベース(ChromeやSafariなど)に対してテストした結果、GoogleはFlash CyberがメインラインのGemini 3.5 Flashおよび3.6 Flashを「大幅に上回った」と述べているが、それは正確な数値が添付されていない定性的な主張に過ぎず、ましてや第三者による比較検証もない。これら3つの結果を並べてみると、あるパターンが浮かび上がる。外部の出所がある唯一の数値(CyberGym)は、タイトで特筆すべき点のないクラスターを示している。一方、より派手に見える2つの勝利(V8、Big Sleep)は、いずれもGoogleが自社のモデルを、Google自身が選んだベースラインに対して評価したものである。

そのパターンはGoogleに限ったものではないが、Flash Cyberがゲート制御されているため、ここでは通常よりも修正が難しい。オープンなモデル、あるいはAPIでアクセス可能なモデルであれば、独立した研究者が最終的にベンチマークを再実行し、ベンダーの数値を確認または反論できる。それこそが誇張された主張が通常明らかになる方法である。Flash Cyberの場合、その検証はほぼ不可能だ。外部の研究者は、実際のモデルに対して独自のCyberGymパス、独自のV8スイープ、その他のテストを実行するアクセス権を持っていないからだ。CyberGymの第三者としての出自は、ベンチマークの設計をカバーするに過ぎず、それに対するFlash Cyberの独立した再実行をカバーするものではない。スコア自体は依然としてGoogleの開示に遡る。アクセスが現在のパイロット版を超えて拡大されるまでは、この特定のモデルに関するあらゆるパフォーマンスの主張は、独立しているように聞こえるかどうかにかかわらず、最終的にはGoogle自身の説明を信頼することに依存している。

それをSec-Geminiと混同しないでください

Googleには複数の「セキュリティ」モデルが存在し、混同されやすいです。Sec-Gemini(2025年4月頃に発表)は、それとは別の、より初期の実験的なモデルで、脅威インテリジェンスのワークフロー(根本原因分析やインシデント分析)を対象としており、Google Threat IntelligenceやOSVデータベースと統合されています。SOC/脅威インテリジェンスのユースケースに関心がある場合、Flash CyberではなくSec-Geminiが該当するラインです。Flash Cyberはコードの脆弱性の発見と修正に特化しており、CodeMenderに組み込まれています。

アクセス、価格設定、および実際にセキュリティモデルの機能を取得する方法

アクセス方法についての話は単純だが、ほとんどの読者にとっては役に立たないだろう。つまり、アクセス方法は存在しない。Flash Cyberは販売されておらず、価格も掲載されておらず、リクエスト可能なAPIキーを通じてアクセスすることもできない。唯一の参入方法は、政府機関であるか、CodeMenderパイロットに承認された審査済みの“trusted partner”であることだ。セルフサービスのサインアップも、参加を保証するウェイティングリストフォームも、公開された価格表も存在しない。なぜなら、価格を付けるべき公開製品がないからだ。Googleはアクセスが時間とともに拡大すると述べているが、その声明にタイムラインやGA日付を付していない。そのため、“eventually”というのが現在記録上最も具体的な回答である。

それはFlash Cyberの同製品群とは対照的だ。同日に発表されたGemini 3.6 FlashとGemini 3.5 Flash-Liteは、いずれも一般公開されており、他の商用モデルと同様にトークン単位で価格設定されている。一方、Flash Cyberはまったく異なるカテゴリーに位置している——製品ラインというよりも、たまたま公開されたGoogleの内部機能に近い。ここでの制約は予算ではない。Googleとセキュリティ研究の関係を持たない十分な資金のある企業でさえ、現時点ではFlash CyberのAPIキーを入手する方法はない。

では、開発チームが自社のコードの脆弱性を発見・修正するためにAIの助けを借りたい場合、現時点で実際に何をしているのでしょうか。パイロットプログラムに参加していない圧倒的多数のチームにとって、現実的な方法は、汎用のフロンティアモデル(GAリリースされ価格設定されたタイプ)を、コードレビュー、脆弱性トリアージ、パッチのドラフト作成といった同じ種類の作業に使うことです。その際、チーム自身による人間のレビューとサンドボックス化を併用します。これは、このタスク専用に設計された特化型の専門ツールとは根本的に異なるものですが、アクセスしやすい選択肢です。OrcaRouterのようなアグリゲーターは、200以上のモデルを1つのOpenAI互換エンドポイントの背後に配置しており、現在、ほとんどのチームが、自分たちが参加を認められるかどうかもわからない限定パイロットを待つのではなく、このような汎用モデルによるセキュリティワークフローを構築するために利用しています。

対象者

パイロット内の審査済み防御者たち。もしあなたが政府機関、またはGoogleがすでに信頼できるパートナーとして認めている組織であれば、Flash Cyberは真に目的に特化して構築されたツールです。これはCodeMenderのdiscover-validate-approve-patchワークフロー内で動作し、その並列サブエージェントアーキテクチャは実際のコードベースを大規模にスキャンするために設計されており、Google自身のテストでは、この特定のタスクにおいて、より大規模な汎用モデルと競合するか、一部の内部指標ではそれよりも優れていることが示されています。この限られた対象者にとって、裏付けとなる数値の一部が自己申告であっても、その価値提案は現実のものです。

他のすべての人——つまりほぼ全員です。もしあなたが標準的なエンジニアチーム、Googleとの提携がないセキュリティコンサルタント、または個人の研究者であるなら、Flash Cyberは、あなたのユースケースがどんなに適していても、単に選択肢になりません。確実に機能する応募プロセスはなく、払える金額でアンロックできるわけでもありません。現在、AI支援の脆弱性対策への現実的な道は、一般的に利用可能なフロンティアモデル——プロバイダ間での柔軟性を求めるならOrcaRouterのようなものを介して——と、あなた自身のレビュー規律を組み合わせることです。なぜなら、それらの汎用モデルにはどれも、CodeMenderに組み込まれているような人間による承認とサンドボックス検証のガードレールが付属していないからです。

待つかどうかを決めるチーム。もし組織が特にアクセスを得るためにGoogleとのパートナーシップの道を模索しているなら、GA(一般提供)の日程が存在しないという事実を念頭に計画を立てる価値があります——当面は現在のセキュリティワークフローを一般提供モデルで実行する必要があるものとして扱い、Googleのパイロットが拡大した場合に再検討してください。ゲート付きアクセスにロードマップを賭け、発表されたタイムラインがない状態で進むことは、ほとんどのチームが負うべきではないリスクです。

よくある質問

Gemini 3.5 Flash Cyber を使用できますか?

審査済みの政府機関または信頼できるパートナーでない限り、アクセスはできません。これはCodeMender内の限定的なアクセスのパイロットであり、公開API、セルフサービスアクセス、公開された価格設定はありません。Googleは時間の経過とともにアクセスが拡大すると述べていますが、GAの日付は発表されていません。

実際に何をするのですか?

ソースコード内のソフトウェア脆弱性を発見、検証、および修正します。並列サブエージェントとして実行され、その発見結果はレポートに統合されます。人間がすべてのパッチを承認し、脆弱性は報告前にサンドボックスで検証されます。

OpenAIとAnthropicのサイバーモデルと比較してどうですか?

共通のサードパーティベンチマーク(CyberGym)では、これら3つは非常に接近しています。Flash Cyber 約83.2%、Anthropic Mythos 5 83.8%、OpenAI GPT-5.5-Cyber 85.6%です。Googleは、最高の生スコアではなく、コスト効率を強みとして位置づけています。3つすべて、審査済み組織に限定されています。

その仕様は何ですか?

これはGemini 3.5 Flashからファインチューニングされています。GoogleはFlash Cyberについて、そのコンテキストウィンドウ、マルチモダリティ、パラメータ数を具体的に公開していません。

危険 / デュアルユースですか?

Googleは、悪用可能なバグを見つけるのに優れたモデルが攻撃的に悪用される可能性があるというデュアルユースリスクを認識しており、その主要な緩和策としてアクセスゲーティングを挙げ、さらにパッチの人間による承認と発見事項のサンドボックス検証を併用している。

CyberGymのスコアは独立して検証されていますか?

CyberGym自体は正当な第三者による学術ベンチマークです。しかし、Flash Cyberに帰属する具体的な83.2%という数値は、Google自身の原文や公開されたリーダーボードのエントリーではなく、Googleの発表に関する報道機関の報道に基づいています。また、モデルがゲートされているため、現在外部の誰も自分で再実行することはできません。その数値は報告されたものとして扱い、独立して確認されたものとして扱わないでください。

Flash Cyberはいつ一般提供されますか?

Googleは何も言っていない。アクセスは現在の政府や信頼できるパートナーによるパイロットを超えて時間とともに拡大すると述べているが、GAの日付やタイムラインは公表されておらず、現時点で計画を立てるための確かなものは何もない。

結論

Gemini 3.5 Flash Cyberは、狭く、真面目なツールです。CodeMender内の脆弱性を検出・修正するコードセキュリティモデルであり、政府および認定されたパートナーに限定されています。利用可能な唯一の独立したベンチマークでは確かに有能ですが、OpenAIやAnthropicのサイバーモデルとほぼ同等の位置にあり、特に突出しているわけではなく、優れた数値のほとんどはGoogle社内評価によるものです。認定パートナーでなければ使用できず、自身のコードの一般的なセキュリティ関連作業には、アクセス可能なフロンティアモデルの方が実用的な選択肢です。以下の比較では、このモデルを2つの真の競合と並べています。


© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube