
CrowdStrike SafeMind vs Claude Mythos 5: Anthropicのデュアルユースフロンティアに対抗するディフェンダー専門家
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
CrowdStrike SafeMind と Claude Mythos 5 は、2026年で最も重要な2つのセキュリティモデル発表であり、同じ問題に対して正反対の方向から答えようとするものである。SafeMind は、CrowdStrike が NVIDIA と共同で、オープンな NVIDIA Nemotron ベースの上に構築したディフェンダー特化型ファミリーであり、攻撃モデルと防御モデルが共進化ループで結ばれ、Falcon センサーテレメトリと15年分のインシデントレスポンスデータで訓練されている。Claude Mythos 5 は、Anthropic の ASL-3 に分類されるフロンティアモデルであり、脆弱性の発見に特に優れたモノリシックな汎用モデルで、信頼できるアクセス環境の中に閉じ込められ、実際のコードベースには Anthropic 自身の Claude Security スキャナを通じてのみ向けられる。この比較は、どちらの哲学がどのチームに合うかという問題であり、また、どちらのモデルもサードパーティの API からは呼び出せないという事実に関するものである。
「防御側にはフロンティアAIがない」という主張に対する二つの異なる答え
Fal.ConでのKurtzの言葉——「攻撃者にはフロンティアAIがあったが、防御者にはなかった」——は、共通の診断である。処方箋は分かれる。Claude Mythos 5を擁するAnthropicの答えは、極めて高性能なモデルを1つ構築し、それをASL-3(「サイバー攻撃を有意に強化する」能力のために確保された階層)に分類し、審査済みプログラムと制約付きスキャナーを通じてアクセスを配給することだった。そのレッドチームの成績が配給の正当化根拠となっている:発見されずに27年間眠っていたOpenBSDのバグ、500万回の自動スキャン攻撃を生き延びた16年前のFFmpegの脆弱性、4つの脆弱性を連鎖させてレンダラーとOSの両方のサンドボックスを脱出したブラウザエクスプロイト、そしてユーザーからrootへのLinuxカーネルの権限昇格である。
CrowdStrikeの答えは、モノリシックなものではなく構造的なものだ。SafeMindは、AI駆動の敵対者をエミュレートする攻撃モデルであるRed Tempestと、実戦で試された防御手段を展開する防御モデルであるBlue Solanoを組み合わせ、それらを継続的な共進化ループで動作させる。攻撃側が攻撃経路を見つけ、防御側がそれを塞ぎ、Falconテレメトリが結果を記録し、両モデルが改善される。その下にはNVIDIAのオーケストレーションが控えており、Nemotron 3 Ultraが防御ハーネスを実行し、微調整されたNemotron 3 Superがルール生成サブエージェントを動かす。その賭けは、単一の汎用モデルを少し疑り深くすることではなく、実際のエンドポイントデータ上で実際の攻撃モデルと訓練することで防御が向上するというものだ。

ラベルをオンにしたスコアボード
• 検出 — SafeMindは、主要なフロンティアモデルやオープンソースのベースラインよりも29%高い検出率を主張している。Claude Mythos 5には、これに匹敵する代表的な検出数値はなく、Anthropicのベンチマークスコアと、プロバイダーが実施した1件の結果があるのみである。
• 独立したベンチマーク — どちらのモデルも公開リーダーボードには登場していない。Mythos 5 の CyberGym L1 スコア 83.8% と ExploitBench 78% はベンダー報告によるものであり、SafeMind の 29% / 6x / 99% の数値は CrowdStrike 報告によるもので、再現されていない。
• アーキテクチャ — Claude Mythos 5 は100万トークンのコンテキストを備えたモノリシックなフロンティアモデルであり、SafeMind は Nemotron 上で動作する2モデル構成のエージェントシステムである。その差別化要因はパラメータ数(CrowdStrikeは未開示)ではなく、ループ処理にある。
• 価格 — どちらも公開されたトークン単位の価格はない。Mythos 5には第三者向けAPIがまったくない。SafeMindのコストはFalconプラットフォームに組み込まれており、単体での価格は非公開である。
• {{1}}トリアージと検知の生成—これは直接比較が可能な唯一の次元です。SafeMindのBlue Solanoは、Falconのテレメトリから検知候補を生成し、検証済みのものを実践的な検知へと昇格させます。Claude Security内のMythos 5は、CWEカテゴリ、重大度、信頼度、影響、再現手順、推奨修正を含む調査結果を生成します。{{/1}}{{2}}どちらも明示的に防御的成果物に制約されており、モデルの自由形式プロンプトは許可されていません。{{/2}}
現実にアクセスする — どちらも呼び出し可能ではない
この対戦について最も重要な事実は、同時に最も面白くない点でもある。つまり、どちらのモデルも呼び出すことはできないのだ。Claude Mythos 5はAnthropicのトラステッドアクセス領域内に留まり、エンタープライズ顧客向けのProject GlasswingとClaude Securityスキャナーを通じてのみ到達可能であり、どんなルーターもそれを変えることはできない。CrowdStrike SafeMindはFalconプラットフォーム上でネイティブに動作し、スタンドアロンモデルとハーネスはProject QuiltWorksの背後にゲートされている。パブリックエンドポイントはなく、トークン課金もなく、そして——予見できる限り——注目に値するサードパーティ統合も存在しない。
今日呼び出し可能なのは、次の一段下、つまりセキュリティワークロードを担い、通常のAPIで販売されるフロンティアモデルです。Anthropic自身のClaude Fable 5(同じファミリー系統に属する、セーフティ分類器搭載の兄弟モデル)は、OrcaRouter上で、Anthropicの定価(入力100万トークンあたり$10.00、出力100万トークンあたり$50.00)で公開されており、マークアップなしでそのまま提供されます。Claude Opus 5は$5.00/$25.00で利用でき、1つのAPIキーで両方と200以上の他のモデルにアクセスでき、プロバイダー間の自動フェイルオーバーにも対応しています。Enterprise契約なしでMythosクラスのコード解析を求めるチームにとって、ルーティングDSLワークフロー(Claude Fable 5をメインとし、Claude Opus 5へフェイルオーバーする構成)は、Anthropicがトラステッドアクセスを拡大するまでの実用的な代替策です。

じゃあ、どれ?
正直な答えは、ほとんどの組織にとって、その決定はSafeMind対Claude Mythos 5の問題ではない——それは、すでに自分たちが住んでいるベンダーのゲート付き環境がどちらか、という問題だ。CrowdStrikeの顧客であれば、SafeMindはすでに稼働しているプラットフォームの内部にやって来て、すでに生成しているテレメトリに合わせて調整され、共進化ループはあなたが眠っている間に機能する。Anthropic Enterpriseの顧客であれば、Mythos 5上のClaude Securityは、すでに支払っているプランの下で、標準のトークン料金でリポジトリをスキャンする。この2つのどちらかを選ぶということは、その能力をどのデータプレーンに委ねるかを選ぶことであり、それはベンチマークの問題ではなく、インフラストラクチャの決定なのである。
ベンチマークの問い——Blue Solanoの検出候補が、同じコードベースに対するMythos 5の検出結果に本当に勝るのか——は現実のものであり、現時点では答えが出ていない。両者が共通の公開評価環境で比較されたことが一度もないからだ。そこが注視すべきギャップである。その一方で、セキュリティ業務に実際にルーティングできるモデルは、オープンフロンティアの兄弟モデル群であり、ゼロマークアップのルーターによる価格の透明性こそが、それらを試すことを調達プロジェクトではなく2行の変更にしているのだ。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
