CrowdStrike SafeMind と MAI-Cyber-1-Flash を比較するヒーロータイトルカード。大きな見出しには「両者ともエクスプロイトの作成を拒否した。スコアを公開したのは片方だけ」と記されている。左パネル「CrowdStrike SafeMind」:「Nemotron 上のエージェントループ」「Red Tempest + Blue Solano」「Falcon ネイティブ、QuiltWorks ゲート付き」。右パネル「MAI-Cyber-1-Flash」:「137B MoE、5B アクティブ」「MDASH システム 95.95% CyberGym L1」「設計上 ExploitGym 0」。フッターには「95.95% はシステムスコアであり自己申告値。SafeMind の主張はベンダー申告値である」と記されている。OrcaRouter のロゴは右下隅に合成されている。
Guides & Insights

CrowdStrike SafeMind vs MAI-Cyber-1-Flash:2つのDefender専用モデル、1つのクローズドループシステム

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

CrowdStrike SafeMindとMicrosoftのMAI-Cyber-1-Flashは、同じ新しいグループに属している。つまり、防御優先で構築されたサイバーモデルであり、実用的なエクスプロイトを生成することが欠如した能力なのではなく、意図的な設計上の選択なのである。2026年7月27日に発表されたMAI-Cyber-1-Flashは、Microsoft初のセキュリティモデルであり、推論あたり50億のアクティブパラメータを持つ1,370億パラメータのMixture-of-Expertsモデルで、MAI-Thinking-1ファミリーからファインチューニングされ、MDASHエージェントハーネスに組み込まれている。Fal.Con 2026で発表されたCrowdStrike SafeMindは、CrowdStrikeがNVIDIAと共同でオープンなNVIDIA Nemotronベース上に構築したエージェント型セキュリティファミリーであり、攻撃的なRed Tempestと防御的なBlue SolanoをFalconプラットフォーム内の継続的なループでペアにしている。両方ともエクスプロイトの構築を拒否している。興味深い疑問は、スコアとループのどちらが防御のより良い証拠であるかということだ。

異なる造りの2人のディフェンダー

Microsoftのアーキテクチャはルーティングの物語です。MAI-Cyber-1-Flashは、コンパクトでコード最適化に特化したモデルであり、MDASH内の日常的な脆弱性処理の大部分を担い、最も困難なケースはフロンティアモデルであるOpenAIGPT-5.4に委ねられます。GPT-5.4はタスクのおよそ上位10%を処理します。この2モデル構成により、従来のMDASHモデルミックスの80%が置き換えられ、Microsoftによればコストは約50%削減され、システムのCyberGymスコアは88.4%から95.95%に向上しました。このモデルは単体では防御専用ツールとして設計されており、脆弱性の特定とパッチ適用を行います。また、すべてのExploitGymカテゴリで意図的にゼロスコアを記録します。設計上、機能するエクスプロイトは一切存在しません。

CrowdStrikeのアーキテクチャは、ループの物語だ。SafeMindのRed TempestはAI敵対者をエミュレートし、Blue Solanoは実戦で検証済みの防御策を配備する。ハーネスはこれらをFalconのテレメトリに対して継続的に実行し、その結果をフィードバックして両者を改善させる——これが共進化ループである。NVIDIAのNemotron 3 Ultraは防御ハーネスを統括し、ファインチューニングされたNemotron 3 Superがルール生成を駆動する。Microsoftがコスト削減のために2つのモデルを使い分けるのに対し、CrowdStrikeは検知を向上させるために2つのモデルを互いに競わせて訓練する。

A two-column scoreboard titled 'CrowdStrike SafeMind vs MAI-Cyber-1-Flash — the scoreboard'. Left column 'CrowdStrike SafeMind': 'Architecture: agentic loop, Nemotron', 'Params: undisclosed', 'Detection: 29% higher (vendor)', 'Remediation: 6x faster (vendor)', 'Cost: 99% savings claim (vendor)', 'Access: Falcon + Project QuiltWorks'. Right column 'MAI-Cyber-1-Flash': 'Architecture: 137B MoE, 5B active', 'Context: 256K tokens', 'MDASH CyberGym L1: 95.95% (system, self-reported)', 'ExploitGym: 0 by design', 'Cost: ~50% less than prior MDASH mix', 'Access: Azure AI Foundry private preview'. Footer reads 'Microsoft's 95.95% is a system score, not the model's — self-reported, not on the public leaderboard; SafeMind figures are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

主張対スコア

MAI-Cyber-1-Flash にはより具体的なエビデンスがあり、したがってより大きな注意書きが必要である。95.95% は MDASH システムの CyberGym Level 1 スコアであり、モデル単体ではなく、モデル+ハーネス+GPT-5.4 を組み合わせた構成に対するものである。CyberGym L1 は既知の脆弱性の再現、すなわち説明と未パッチのソースコードから実際に動作する概念実証コードを生成できるかをテストするものであり、既知情報なしでの発見やパッチの正確性をテストするものではない。モデル発表時点では、この結果は公開 CyberGym リーダーボードに掲載されておらず、同リーダーボードにはマイクロソフトが以前に提出した 88.4% の MDASH 結果が依然として表示されていた。マイクロソフトはまた、CVEBench 0.314、CyberSecEval4 0.553、CRSBench 0.651 を報告している。これらはすべてベンダー公表の数値である。

SafeMindのエビデンスは、具体性に欠け、検証可能性も低い。CrowdStrikeは、主要なフロンティアモデルとオープンソースのベースラインに対して、検出率29%の向上、エンドツーエンドの修復速度6倍、検出・修復コストの99%削減を報告している。NVIDIAは、社内評価においてBlue Solanoモデルが主要なフロンティアモデルを上回る精度を達成し、コストを99%削減したと報告している。95.95%という数字に並べる公開スコアはない。CyberGymへのエントリーも、公表された検出結果リストも、リーダーボードへの掲載もない。一方のシステムは数字を公表し、もう一方はメカニズムを公表しているが、どちらも独立した検証を受けていない。

• 検出とトリアージ — SafeMindのBlue SolanoはFalconテレメトリから検出候補を生成し、検証済みの候補を対応可能な検出へと昇格させます。MAI-Cyber-1-Flashは、MDASHにおけるコード中心の脆弱性分析とパッチトリアージ向けに最適化されています。

• エクスプロイト能力 — 両者とも設計上ゼロです。MAI-Cyber-1-Flash は、明示的な安全性の選択として ExploitGym の全カテゴリーでスコア 0 を記録しています。SafeMind は、自由形式のエクスプロイト生成を行わず、モデルを防御用アーティファクトのみに制限しています。

• 仕様 — MAI-Cyber-1-Flash: 合計137B / アクティブ5BのMoE、256Kコンテキスト。SafeMind: パラメータ数は非公開、コンテキストも非公開。

• 価格 — MAI-Cyber-1-Flash には公開トークン価格がなく、スタンドアロンAPIもありません。SafeMind のコストは Falcon プラットフォーム内に含まれています。

Access — 非公開プレビュー2件、未解決の質問1件

どちらのモデルもルーティング不可能です。MAI-Cyber-1-Flash は MDASH の組み込みコンポーネントとして存在し、Azure AI Foundry のプライベートプレビューを通じて承認済みの MDASH 顧客にのみ提供されています — 一般向け API はありません。SafeMind は Falcon プラットフォームにネイティブに統合されて動作し、スタンドアロンでのアクセスは Project QuiltWorks の背後にゲートされています。両プレビューの対象外にいるセキュリティチームにとって、これらのモデルは事実上「将来構想」に過ぎません。仕組みは公開されていても、アクセスは公開されていないからです。

現在呼び出し可能なのは、両ベンダーが回避している汎用フロンティア層です。OrcaRouterでは、Claude Opus 5は、Anthropicの定価である入力トークン100万件あたり$5.00、出力トークン100万件あたり$25.00で提供されており、マークアップなしの素通しです。1Mコンテキストのモデルで、セキュリティスキャンのワークロードは本番環境で最も多く使われているものの一つです。GPT-5.6 Solも、その隣に、入力トークン100万件あたり$4.00、出力トークン100万件あたり$20.00で並んでいます。1つのAPIキーで、この2つに加えて200以上の他のモデルにもアクセスでき、プロバイダー間の自動フェイルオーバーにも対応します。これは、Microsoftが説明するMDASHスタイルのルーティングパターンを、プライベートプレビューなしで実現する実用的な代替手段です。MAI-Cyber-1-Flashの教訓が、セキュリティ業務には安価な専門モデルと後段に回したフロンティアモデルの組み合わせが適切なコスト構造だというものであれば、その構造は、ベンダー自身の価格をそのまま通すルーターを通じて、今日誰でも利用できます。

A screenshot of the CrowdStrike press release page titled 'CrowdStrike Launches Frontier Models for Cybersecurity, Created with NVIDIA', captured September 2, 2026, showing the announcement headline and the SafeMind description.A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the Vision, Tools, JSON and Reasoning capability chips, a 1M-token context window, a 128K max output, .00 per 1M input tokens and 5.00 per 1M output tokens, released July 24 2026, and the endpoints /v1/chat/completions and /v1/messages.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube