
CrowdStrike SafeMind 对比 Claude Mythos 5:对抗 Anthropic 双重用途前沿的防御专家
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
CrowdStrike SafeMind 和 Claude Mythos 5 是 2026 年最具影响力的两个安全模型发布,它们从相反的两端回答了同一个问题。SafeMind 是 CrowdStrike 与 NVIDIA 在开放的 NVIDIA Nemotron 基础上构建的防御专家系列——一个进攻模型和一个防御模型锁定在共同进化循环中,基于 Falcon 传感器遥测数据和十五年的事件响应数据进行训练。Claude Mythos 5 是 Anthropic 的 ASL-3 级前沿模型,一个恰好极擅长发现漏洞的通用单体模型,被限制在可信访问边界内,并且只能通过 Anthropic 自己的 Claude Security 扫描器对准真实代码库。这种比较关乎哪种理念适合哪种团队——也关乎一个事实:这两款模型都不能通过第三方 API 调用。
针对“防御者没有前沿AI”的两种不同答案
库尔茨在 Fal.Con 上的论断——"攻击者拥有前沿人工智能,而防御者没有"——是双方的共同诊断。开出的药方却各不相同。Anthropic 的应对之策是借助 Claude Mythos 5 构建一个能力极强的模型,将其归类为 ASL-3(该分级专为"显著提升网络攻击能力"的能力所保留),并通过经过审查的计划加受限扫描器来限制访问。其红队测试记录正是这种限制措施的理由:一个存在了27年未被发现的 OpenBSD 漏洞、一个存在16年的 FFmpeg 漏洞历经五百万次自动化扫描仍未被发现、一个串联四个漏洞同时逃逸渲染器与操作系统沙箱的浏览器漏洞利用程序,以及一个将 Linux 内核权限从普通用户提权至 root 的漏洞。
CrowdStrike的答案是结构性的,而非单体式的。SafeMind将进攻性模型Red Tempest(模拟AI驱动的对手)与防御性模型Blue Solano(部署经过实战检验的防护措施)配对,让它们在持续的协同进化循环中运行:进攻方找到攻击路径,防御方将其封堵,Falcon遥测记录结果,两个模型同步改进。底层由NVIDIA负责编排——Nemotron 3 Ultra运行防御性测试框架,经过微调的Nemotron 3 Super驱动规则生成子代理。其赌注在于:通过在真实终端数据上对抗真实攻击模型来训练,防御能力会变得更强,而不是让某个单一的通用型模型变得更加多疑。

带有标签的记分牌
• 检测 — SafeMind声称其检测率比领先的前沿模型和开源基线高出29%;而Claude Mythos 5没有可比的标志性检测数据,只有Anthropic提供的基准分数和一个供应商运行的结果。
• 独立基准测试——两款模型均未出现在公开排行榜上。Mythos 5 的 CyberGym L1 得分 83.8% 和 ExploitBench 得分 78% 均为厂商自行报告;SafeMind 的 29% / 6x / 99% 数据则由 CrowdStrike 报告,且未经过复现。
• 架构 — Claude Mythos 5 是一个具有 1M token 上下文的单体前沿模型;SafeMind 是 Nemotron 上的双模型智能体系统,其差异化在于循环,而非参数数量(CrowdStrike 尚未披露)。
• {{1}}价格{{/1}} — 两者都没有公开的按token计费价格。Mythos 5完全没有第三方API;SafeMind的成本已包含在Falcon平台中,独立定价未公开。{{2}}{{/2}}
• 分诊与检测生成——这是唯一具有直接比较的维度。SafeMind 的 Blue Solano 从 Falcon 遥测数据中生成检测候选,并将经验证的候选提升为可操作的检测。Claude Security 中的 Mythos 5 会生成包含 CWE 类别、严重性、置信度、影响、复现步骤和建议修复方案的发现结果。两者都明确限定于防御性工件——不允许对模型进行自由格式提示。
访问现实——两者都不可调用
这场对决最重要的一个事实也是最无趣的:你无法调用这两个模型中的任何一个。Claude Mythos 5 仍停留在 Anthropic 的受信访问边界内,只能通过 Project Glasswing 和企业客户专用的 Claude Security 扫描器触达,任何路由器都无法改变这一点。CrowdStrike SafeMind 原生运行于 Falcon 平台,独立的模型与工具链均被 Project QuiltWorks 拒之门外。目前没有公共端点,没有 Token 定价,而且在可预见的未来,也没有任何第三方集成可供观望。
如今真正可供调用的是再往下一级的模型:那些承载安全负载、并通过普通 API 销售的前沿模型。Anthropic 自家的Claude Fable 5——同一产品线中配备安全分类器的兄弟型号——已在 OrcaRouter 上线,按 Anthropic 标价销售:输入每百万 token 10.00 美元,输出每百万 50.00 美元,零加价直通。Claude Opus 5定价为 5.00 / 25.00 美元,一个 API 密钥即可访问这两款模型及 200 多个其他模型,并在各提供商之间自动故障转移。对于希望获得 Mythos 级代码分析、却不想签订企业合同的团队来说,以路由 DSL 工作流——Claude Fable 5 故障转移至 Claude Opus 5——是 Anthropic 扩大可信访问范围之前切实可行的替代方案。

那么,哪一个呢?
诚实的回答是,对大多数组织而言,决策并不是 SafeMind 与 Claude Mythos 5 之间的选择,而是你已经生活在哪家供应商的受控环境之中。如果你是 CrowdStrike 的客户,SafeMind 会出现在你已经在运行的平台内,根据你已经生成的遥测数据进行调优,协同进化循环在你睡觉时也在工作。如果你是 Anthropic Enterprise 的客户,Mythos 5 上的 Claude Security 会在你已付费的套餐下扫描你的代码仓库,按标准令牌费率计费。在这两者之间做出选择,意味着选择你信任哪个数据平面来承载这一能力——这是一个基础设施决策,而不是基准测试决策。
这个基准问题——Blue Solano 的检测候选方案能否在同一代码库上真正击败 Mythos 5 的发现——是真实存在且目前无法回答的,因为两者从未在共享的公开评估中相遇。这就是值得关注的差距。与此同时,你实际可以路由用于安全工作的模型是开放前沿的同门兄弟模型,而零加成路由器的价格透明度使试用它们只需改动两行代码,而不是一项采购工程。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
