
CrowdStrike SafeMind vs MAI-Cyber-1-Flash:2つのDefender専用モデル、1つのクローズドループシステム
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
CrowdStrike SafeMindとMicrosoftのMAI-Cyber-1-Flashは、同じ新しいグループに属している。つまり、防御優先で構築されたサイバーモデルであり、実用的なエクスプロイトを生成することが欠如した能力なのではなく、意図的な設計上の選択なのである。2026年7月27日に発表されたMAI-Cyber-1-Flashは、Microsoft初のセキュリティモデルであり、推論あたり50億のアクティブパラメータを持つ1,370億パラメータのMixture-of-Expertsモデルで、MAI-Thinking-1ファミリーからファインチューニングされ、MDASHエージェントハーネスに組み込まれている。Fal.Con 2026で発表されたCrowdStrike SafeMindは、CrowdStrikeがNVIDIAと共同でオープンなNVIDIA Nemotronベース上に構築したエージェント型セキュリティファミリーであり、攻撃的なRed Tempestと防御的なBlue SolanoをFalconプラットフォーム内の継続的なループでペアにしている。両方ともエクスプロイトの構築を拒否している。興味深い疑問は、スコアとループのどちらが防御のより良い証拠であるかということだ。
異なる造りの2人のディフェンダー
Microsoftのアーキテクチャはルーティングの物語です。MAI-Cyber-1-Flashは、コンパクトでコード最適化に特化したモデルであり、MDASH内の日常的な脆弱性処理の大部分を担い、最も困難なケースはフロンティアモデルであるOpenAIのGPT-5.4に委ねられます。GPT-5.4はタスクのおよそ上位10%を処理します。この2モデル構成により、従来のMDASHモデルミックスの80%が置き換えられ、Microsoftによればコストは約50%削減され、システムのCyberGymスコアは88.4%から95.95%に向上しました。このモデルは単体では防御専用ツールとして設計されており、脆弱性の特定とパッチ適用を行います。また、すべてのExploitGymカテゴリで意図的にゼロスコアを記録します。設計上、機能するエクスプロイトは一切存在しません。
CrowdStrikeのアーキテクチャは、ループの物語だ。SafeMindのRed TempestはAI敵対者をエミュレートし、Blue Solanoは実戦で検証済みの防御策を配備する。ハーネスはこれらをFalconのテレメトリに対して継続的に実行し、その結果をフィードバックして両者を改善させる——これが共進化ループである。NVIDIAのNemotron 3 Ultraは防御ハーネスを統括し、ファインチューニングされたNemotron 3 Superがルール生成を駆動する。Microsoftがコスト削減のために2つのモデルを使い分けるのに対し、CrowdStrikeは検知を向上させるために2つのモデルを互いに競わせて訓練する。

主張対スコア
MAI-Cyber-1-Flash にはより具体的なエビデンスがあり、したがってより大きな注意書きが必要である。95.95% は MDASH システムの CyberGym Level 1 スコアであり、モデル単体ではなく、モデル+ハーネス+GPT-5.4 を組み合わせた構成に対するものである。CyberGym L1 は既知の脆弱性の再現、すなわち説明と未パッチのソースコードから実際に動作する概念実証コードを生成できるかをテストするものであり、既知情報なしでの発見やパッチの正確性をテストするものではない。モデル発表時点では、この結果は公開 CyberGym リーダーボードに掲載されておらず、同リーダーボードにはマイクロソフトが以前に提出した 88.4% の MDASH 結果が依然として表示されていた。マイクロソフトはまた、CVEBench 0.314、CyberSecEval4 0.553、CRSBench 0.651 を報告している。これらはすべてベンダー公表の数値である。
SafeMindのエビデンスは、具体性に欠け、検証可能性も低い。CrowdStrikeは、主要なフロンティアモデルとオープンソースのベースラインに対して、検出率29%の向上、エンドツーエンドの修復速度6倍、検出・修復コストの99%削減を報告している。NVIDIAは、社内評価においてBlue Solanoモデルが主要なフロンティアモデルを上回る精度を達成し、コストを99%削減したと報告している。95.95%という数字に並べる公開スコアはない。CyberGymへのエントリーも、公表された検出結果リストも、リーダーボードへの掲載もない。一方のシステムは数字を公表し、もう一方はメカニズムを公表しているが、どちらも独立した検証を受けていない。
• 検出とトリアージ — SafeMindのBlue SolanoはFalconテレメトリから検出候補を生成し、検証済みの候補を対応可能な検出へと昇格させます。MAI-Cyber-1-Flashは、MDASHにおけるコード中心の脆弱性分析とパッチトリアージ向けに最適化されています。
• エクスプロイト能力 — 両者とも設計上ゼロです。MAI-Cyber-1-Flash は、明示的な安全性の選択として ExploitGym の全カテゴリーでスコア 0 を記録しています。SafeMind は、自由形式のエクスプロイト生成を行わず、モデルを防御用アーティファクトのみに制限しています。
• 仕様 — MAI-Cyber-1-Flash: 合計137B / アクティブ5BのMoE、256Kコンテキスト。SafeMind: パラメータ数は非公開、コンテキストも非公開。
• 価格 — MAI-Cyber-1-Flash には公開トークン価格がなく、スタンドアロンAPIもありません。SafeMind のコストは Falcon プラットフォーム内に含まれています。
Access — 非公開プレビュー2件、未解決の質問1件
どちらのモデルもルーティング不可能です。MAI-Cyber-1-Flash は MDASH の組み込みコンポーネントとして存在し、Azure AI Foundry のプライベートプレビューを通じて承認済みの MDASH 顧客にのみ提供されています — 一般向け API はありません。SafeMind は Falcon プラットフォームにネイティブに統合されて動作し、スタンドアロンでのアクセスは Project QuiltWorks の背後にゲートされています。両プレビューの対象外にいるセキュリティチームにとって、これらのモデルは事実上「将来構想」に過ぎません。仕組みは公開されていても、アクセスは公開されていないからです。
現在呼び出し可能なのは、両ベンダーが回避している汎用フロンティア層です。OrcaRouterでは、Claude Opus 5は、Anthropicの定価である入力トークン100万件あたり$5.00、出力トークン100万件あたり$25.00で提供されており、マークアップなしの素通しです。1Mコンテキストのモデルで、セキュリティスキャンのワークロードは本番環境で最も多く使われているものの一つです。GPT-5.6 Solも、その隣に、入力トークン100万件あたり$4.00、出力トークン100万件あたり$20.00で並んでいます。1つのAPIキーで、この2つに加えて200以上の他のモデルにもアクセスでき、プロバイダー間の自動フェイルオーバーにも対応します。これは、Microsoftが説明するMDASHスタイルのルーティングパターンを、プライベートプレビューなしで実現する実用的な代替手段です。MAI-Cyber-1-Flashの教訓が、セキュリティ業務には安価な専門モデルと後段に回したフロンティアモデルの組み合わせが適切なコスト構造だというものであれば、その構造は、ベンダー自身の価格をそのまま通すルーターを通じて、今日誰でも利用できます。


この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
