
CrowdStrike SafeMind 対 GPT-5.6-Cyber:拒否低減型の攻撃者 対 防御ループ
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
CrowdStrike SafeMind と OpenAI の GPT-5.6-Cyber は、どちらも同じ狭まりゆく時間枠 — 開示されたバグが悪用されるようになるまでに、防御側には数週間、時には数日しかない — への回答でありながら、正反対の方向を指しています。OpenAI が2026年8月10日、拡大した Daybreak プログラムの旗艦としてリリースした GPT-5.6-Cyber は、拒否を減らしたモデルです。汎用モデルが拒否する、エクスプロイト開発・権限昇格・認証回避といった作業を完了するよう訓練されており、その基盤となるのがGPT-5.6 Solという推論モデルです。Fal.Con 2026 で発表された SafeMind は、CrowdStrike のエージェント型セキュリティファミリーであり、NVIDIA とともにオープンな NVIDIA Nemotron ベース上に構築されています。その差別化要因はクローズドループです。攻撃モデルが攻撃経路を見つけ、防御モデルが Falcon プラットフォーム内でその経路を塞ぎます。前者は攻撃をより速く完了させるためのツールであり、後者は攻撃を無意味にするためのシステムです。
二つの姿勢であり、二つの仕様ではない
この比較を読み解く最も簡潔な方法は、姿勢の違いとして捉えることです。OpenAIの内部指標「Advanced Cybersecurity Completion Rate」は、GPT-5.6-Cyberを定義づける数値です。このモデルは、エクスプロイトチェーン開発や特権昇格といったカテゴリのリクエストを95.0%完了しました。一方、標準のGPT-5.6 Solは1.5%、Daybreak Blueを通じてアクセスしたSolは2.0%、従来のGPT-5.5-Cyberは57.3%でした。それが設計目標です——審査済みの防御者向けに、高リスクのデュアルユース業務での拒否を減らしたモデルです。OpenAIは、自社のPreparedness Frameworkに基づき、これをサイバー能力「High」と評価しました。これは、他のモデルの公開を遅らせてきた「Critical」のしきい値未満です。
SafeMindの姿勢は、行動的なものではなく構造的なものです。汎用AIのガードレールを緩める代わりに、CrowdStrikeは2つの専門AIと1つのループを構築しました。Red TempestはAI駆動の敵対者をエミュレートし、Blue Solanoは実戦で検証された防御策を展開します。そしてハーネスがこれらを継続的に実行し、Falconのテレメトリがその結果を両方のモデルにフィードバックします。NVIDIAのテストでは、NVIDIA自身のネットワークの高忠実度デジタルツインに対してこのループを実行しました。安全性の根拠はアーキテクチャにあります。システムは防御用アーティファクトに制限されており、攻撃側の半分は防御側をより良くするために存在するのであって、誰かに優れたエクスプロイトツールを提供するためではありません。

数字が示すもの、ラベルはそのまま
実世界での発見 — GPT-5.6-Cyber の具体的な成果が公開されました: サンドボックスエスケープに連鎖可能な、これまで未知の Chrome V8 の脆弱性2件(CVE-2026-15903、CVSS 8.8 として追跡); 特権昇格チェーンを含む、広く使用されているモバイルOSにおける少なくとも5件の脆弱性; 人気のデータベースにおける重大な脆弱性3件; そして単一のカーネルにおける400件以上の特権昇格の脆弱性。すべて OpenAI が報告したものであり、開示は進行中です。
• ベンチマーク — ExploitGym上で既知の脆弱性を動作する攻撃コードに変換するタスクにおいて、GPT-5.6-CyberはOpenAIによるとGPT-5.6 SolとGPT-5.5-Cyberの両方を上回った。特に、脆弱性の発見とレポート作成では、標準のGPT-5.6 Solよりも低いスコアにとどまった。OpenAIはその理由を、レポートがより短く、詳細さが足りないためとしている。SafeMindが公表した数字は、29%の検出率/6倍の修復/99%のコスト削減という主張であり、いずれもCrowdStrikeが報告したもので、再現はされていない。
• アーキテクチャ — GPT-5.6-Cyber はファインチューニング済みの推論モデルであり、SafeMind はパラメータ数が非公開の2モデル構成のエージェント型システムです。
{{1}}• 価格 — GPT-5.6-Cyberには公開価格がなく、セルフサービスAPIもありません。SafeMindのコストはFalconプラットフォーム内に含まれており、単体での価格は非公開です。{{/1}}
アクセス — ゲート付きティア、2回
どちらのモデルも一般の開発者から呼び出せるものではなく、ここにも両ベンダーの哲学の違いが再び表れている。OpenAIのDaybreakプログラムは2つのティアに分かれる。Daybreak Blueは、サイバー関連のガードレールを除去したGPT-5.6 Solを含む汎用フロンティアモデルを、定常業務を行う審査済みディフェンダー向けに公開する。Daybreak Redは制限付きティアであり、承認された脆弱性研究とレッドチームテストのためにGPT-5.6-Cyber自体へのアクセスを許可する。アクセスには本人確認、監視、承認済み用途への制限、法的確約、そして2026年9月1日以降はアカウントごとのハードウェアセキュリティキーが必要となる。CrowdStrikeのSafeMindはFalconにネイティブ統合されており、スタンドアロンアクセスはProject QuiltWorksの背後に置かれている。両者に共通する結論は、製品リストではなく審査付きアクセスプログラムであるということだ。
実際に何と呼べるか
ここで利用できる兄弟モデルは、GPT-5.6-Cyberのベースとなっているモデルです。GPT-5.6 Sol(OpenAIの主力推論モデルであり、あらゆるモデルの中でも最も広範な公開サイバーベンチマークの評価を受けているモデル)は、OrcaRouter上でOpenAIの定価、すなわち入力トークン100万件あたり4.00ドル、出力トークン100万件あたり20.00ドルでライブ提供され、マークアップなしでそのままパススルーされます。CyberGymでは公表値84.5%、ExploitGymでは33.7%(ベンダーと独立系の実行結果は異なります)を記録しており、そのためセキュリティチームはこれこそが、通常のAPI経由でルーティングできるサイバー対応フロンティアモデルに最も近い存在だと見なしています。1つのキー、プロバイダ間の自動フェイルオーバー、そして他のモデルと組み合わせるルーティングDSLにより、このモデルを試すコストは、プロバイダ自身の提示価格だけになるのです。
ただし、正直なところ、GPT-5.6-CyberとSafeMindは、再現可能なリーダーボード上で競い合うものではない。一方は承認済みレッドチーム向けのゲート付き攻撃ツールであり、もう一方はCrowdStrikeの顧客向けのゲート付き防御ループである。公開市場での問いは、その中間で何を実行するかということだ——そしてその答えは、価格を素通しした最先端の汎用モデルであり、それこそがゼロマークアップのルーターが埋めるために存在するギャップなのだ。


