
CrowdStrike SafeMind so với MAI-Cyber-1-Flash: Hai mô hình chỉ dành riêng cho Defender, một hệ thống vòng lặp khép kín
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
CrowdStrike SafeMind và MAI-Cyber-1-Flash của Microsoft cùng thuộc một câu lạc bộ non trẻ: các mô hình an ninh mạng được xây dựng với phòng thủ là ưu tiên hàng đầu, nơi việc tạo ra một exploit hoạt động được không phải là thiếu sót về năng lực mà là một lựa chọn thiết kế có chủ đích. MAI-Cyber-1-Flash, được công bố vào ngày 27 tháng 7 năm 2026, là mô hình bảo mật đầu tiên của Microsoft — một mô hình Mixture-of-Experts với 137 tỷ tham số, trong đó 5 tỷ tham số hoạt động cho mỗi lần suy luận, được tinh chỉnh từ dòng MAI-Thinking-1 và được tích hợp bên trong khung tác tử MDASH. CrowdStrike SafeMind, ra mắt tại Fal.Con 2026, là dòng bảo mật tác tử mà CrowdStrike xây dựng cùng NVIDIA trên nền tảng mở NVIDIA Nemotron, kết hợp nhánh tấn công Red Tempest với nhánh phòng thủ Blue Solano trong một vòng lặp liên tục bên trong nền tảng Falcon. Cả hai đều từ chối xây dựng exploit; câu hỏi thú vị là liệu một điểm số hay một vòng lặp là bằng chứng tốt hơn cho năng lực phòng thủ.
Hai hậu vệ, được tạo nên khác biệt
Kiến trúc của Microsoft xoay quanh câu chuyện định tuyến. MAI-Cyber-1-Flash là một chuyên gia nhỏ gọn, tối ưu cho mã lệnh, đảm nhiệm phần lớn công việc xử lý lỗ hổng thường quy bên trong MDASH, đồng thời chuyển những ca khó nhất cho một mô hình tiên phong — GPT-5.4 của OpenAI — vốn xử lý khoảng 10% nhiệm vụ hàng đầu. Sự phân tách hai mô hình này đã thay thế 80% tổ hợp mô hình MDASH trước đây và, theo Microsoft, cắt giảm chi phí khoảng 50% đồng thời nâng điểm CyberGym của hệ thống từ 88,4% lên 95,95%. Riêng mô hình này được thiết kế như một công cụ chỉ phòng thủ: nó xác định và vá các lỗ hổng, đồng thời cố tình đạt điểm 0 ở mọi hạng mục ExploitGym — không tạo ra exploit khả dụng nào, theo đúng thiết kế.
Kiến trúc của CrowdStrike là câu chuyện xoay quanh vòng lặp. Red Tempest của SafeMind mô phỏng các tác nhân AI đối nghịch, Blue Solano triển khai các biện pháp phòng thủ đã được kiểm chứng thực chiến, và các khung thử nghiệm chạy chúng liên tục trên dữ liệu telemetry Falcon, phản hồi kết quả để cả hai cùng cải thiện — vòng lặp đồng tiến hóa. Nemotron 3 Ultra của NVIDIA điều phối khung phòng thủ, còn Nemotron 3 Super được tinh chỉnh trở thành động lực cho việc sinh luật. Trong khi Microsoft định tuyến giữa hai mô hình để tiết kiệm chi phí, CrowdStrike huấn luyện hai mô hình chống lại nhau để nâng cao khả năng phát hiện.

Lời khẳng định so với điểm số
MAI-Cyber-1-Flash có bằng chứng cụ thể hơn, và cần lời cảnh báo lớn hơn. Mức 95,95% là điểm CyberGym Cấp độ 1 cho hệ thống MDASH — tức cấu hình kết hợp mô hình + harness + GPT-5.4, chứ không phải của riêng mô hình đứng độc lập. CyberGym L1 kiểm tra khả năng tái tạo các lỗ hổng đã biết: tạo mã bằng chứng hoạt động từ bản mô tả và mã nguồn chưa được vá, chứ không phải khám phá mù hay kiểm tra tính đúng đắn của bản vá. Tại thời điểm mô hình ra mắt, kết quả này chưa xuất hiện trên bảng xếp hạng công khai của CyberGym — nơi vẫn đang hiển thị bài dự thi MDASH 88,4% trước đó của Microsoft. Microsoft cũng công bố các điểm số CVEBench 0,314, CyberSecEval4 0,553 và CRSBench 0,651 — tất cả đều do nhà cung cấp công bố.
Bằng chứng của SafeMind ít cụ thể hơn và khó kiểm chứng hơn. CrowdStrike báo cáo tỷ lệ phát hiện cao hơn 29%, khắc phục từ đầu đến cuối nhanh hơn 6 lần và tiết kiệm 99% chi phí phát hiện và khắc phục so với các mô hình tiên phong hàng đầu và các đường cơ sở mã nguồn mở; NVIDIA báo cáo mô hình Blue Solano đạt độ chính xác cao hơn các mô hình tiên phong hàng đầu với chi phí thấp hơn 99% trong các đánh giá nội bộ. Không có điểm số công khai nào để đặt cạnh 95.95% — không có mục CyberGym, không có danh sách phát hiện được công bố, không có sự xuất hiện trên bảng xếp hạng. Một hệ thống công bố một con số, hệ thống kia công bố một cơ chế; cả hai đều chưa được xác minh độc lập.
• Phát hiện và phân loại — Blue Solano của SafeMind tạo ra các ứng viên phát hiện từ dữ liệu telemetry của Falcon và nâng các ứng viên đã được xác thực thành các phát hiện có thể hành động; MAI-Cyber-1-Flash được tối ưu hóa cho việc phân tích lỗ hổng nặng về mã và phân loại bản vá trong MDASH.
• Khả năng khai thác lỗ hổng — cả hai đều bằng 0 theo thiết kế. MAI-Cyber-1-Flash đạt điểm 0 trên tất cả các hạng mục ExploitGym như một lựa chọn an toàn tường minh; SafeMind giới hạn các mô hình của mình ở các tạo phẩm phòng thủ, không có khả năng tạo mã khai thác tự do.
• Thông số kỹ thuật — MAI-Cyber-1-Flash: 137B tổng / 5B MoE hoạt động, ngữ cảnh 256K. SafeMind: số tham số không được tiết lộ, ngữ cảnh không được tiết lộ.
• Giá — MAI-Cyber-1-Flash không có giá token công khai và không có API độc lập; chi phí của SafeMind nằm trong nền tảng Falcon.
Access — hai bản xem trước riêng tư, một câu hỏi mở
Cả hai mô hình đều không thể định tuyến được. MAI-Cyber-1-Flash tồn tại như một thành phần nhúng của MDASH, được cung cấp thông qua bản xem trước riêng tư Azure AI Foundry cho các khách hàng MDASH đã được phê duyệt — không có API công khai. SafeMind hoạt động nguyên bản trong nền tảng Falcon, với quyền truy cập độc lập bị kiểm soát phía sau Project QuiltWorks. Đối với một nhóm bảo mật nằm ngoài cả hai bản xem trước, các mô hình này về cơ bản chỉ mang tính khát vọng: cơ chế thì công khai, nhưng quyền truy cập thì không.
Những gì có thể gọi được ngay hôm nay chính là tầng frontier đa dụng mà cả hai nhà cung cấp đều né tránh. Trên OrcaRouter, Claude Opus 5 hiện hoạt động theo giá niêm yết của Anthropic: 5,00 USD cho mỗi triệu token đầu vào và 25,00 USD cho mỗi triệu token đầu ra, được chuyển tiếp nguyên giá, không tăng thêm phụ phí — một mô hình ngữ cảnh 1 triệu token với các khối lượng quét bảo mật thuộc nhóm được sử dụng nhiều nhất trong môi trường sản xuất. GPT-5.6 Sol nằm ngay bên cạnh với mức giá 4,00 USD cho mỗi triệu token đầu vào và 20,00 USD cho mỗi triệu token đầu ra. Một khóa API duy nhất truy cập được cả hai mô hình cũng như hơn 200 mô hình khác, với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp — đây là giải pháp thay thế thực tế cho kiểu định tuyến MDASH mà Microsoft mô tả, mà không cần dùng đến chương trình xem trước riêng tư. Nếu bài học từ MAI-Cyber-1-Flash là một mô hình chuyên biệt giá rẻ cộng với một mô hình frontier dự phòng sẽ tạo ra cấu trúc chi phí phù hợp cho công việc bảo mật, thì cấu trúc đó hiện đã có sẵn cho bất kỳ ai, thông qua một bộ định tuyến chuyển tiếp đúng giá niêm yết của các nhà cung cấp.


So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
