
Mistral Large 4 vs Claude Opus 5: Khoảng cách nhỏ hơn chênh lệch giá
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Con số đối đầu trực tiếp duy nhất mà bất kỳ ai đã công bố cho Mistral Large 4 so với Claude Opus 5 đến từ một đánh giá con người theo kiểu mù, và nó sát sao hơn những gì các bảng benchmark gợi ý. Surge AI đã giấu danh tính các mô hình và yêu cầu những người gán nhãn chuyên nghiệp đánh giá đầu ra lập trình trên thang điểm 1–5; Claude Opus 5 về nhất với 4,22 và Mistral Large 4 Preview về nhì với 3,74, xếp trên Kimi K3, GLM-5.3 và GLM-5.2. Trên bảng tổng hợp độc lập, hai mô hình hoàn toàn không xếp cạnh nhau — 50,8 so với 38,4 trên Intelligence Index của Artificial Analysis, ghi nhận vào ngày 6 tháng 10. Điều khiến cặp đấu này đáng để dành một buổi chiều là mô hình có điểm thấp hơn 12 điểm chỉ tốn khoảng một phần năm chi phí để chạy một tác vụ.
Cả hai số liệu đều cần được gắn nguồn gốc, vì chúng không phải cùng một loại số. Đánh giá của Surge AI là một nghiên cứu do con người thực hiện từ bên thứ ba mà Mistral đã đặt hàng và công bố — một dạng bằng chứng mạnh hơn so với một benchmark tự chạy, và vẫn là một nghiên cứu mà Mistral kiểm soát việc công bố. Các điểm chỉ số là những lần chạy của chính Artificial Analysis, có thể so sánh với nhau, và do đó là cặp phù hợp để suy luận. Không cái nào cho bạn biết nên xây dựng dựa trên mô hình nào; cùng nhau, chúng khoanh vùng câu hỏi.
Hai sản phẩm, không phải hai thế hệ của cùng một sản phẩm
Claude Opus 5 là mô hình chủ lực trọng số đóng của nhà cung cấp, ra mắt ngày 24 tháng 7 năm 2026, được cung cấp với cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra, với giá 5 USD mỗi triệu token đầu vào và 25 USD mỗi triệu token đầu ra, đọc từ bộ nhớ đệm là 0,50 USD. Đây là mô hình có năng lực nhất của nhà cung cấp trong dòng Opus và được định vị rõ ràng cho công việc tác tử tầm xa — duy trì mạch lạc qua các phiên nhiều bước với việc sử dụng công cụ nhiều.
Mistral Large 4 là một bản xem trước, được công bố vào ngày 6 tháng 10 năm 2026, mà Mistral mô tả là một mô hình mixture-of-experts thưa với 1,05 nghìn tỷ tham số, 49 tỷ tham số hoạt động và một bộ mã hóa thị giác 1,6 tỷ tham số. ID API của nó là mistral-large-4-0, nó có khả năng đa phương thức gốc, và tài liệu của Mistral cho nó cửa sổ ngữ cảnh 1M token trong khi Artificial Analysis đọc được 524.288 trên cấu hình mà họ đang thử nghiệm. Trọng số được hứa hẹn sẽ có vào cuối tháng 10 và giấy phép vẫn chưa được nêu tên.
Vậy đây không phải là một mô hình mới hơn đối đầu với một mô hình cũ hơn. Đây là một mô hình tiên phong độc quyền đối đầu với một đối thủ sắp mở trọng số, và cả hai đang được định giá tương xứng.

Cùng chỉ số, cả hai mô hình
Đọc ngày 6 tháng 10 từ các trang Artificial Analysis của họ, trên Intelligence Index v4.3:
• Chỉ số Thông minh — Mistral Large 4 Preview 38,4 so với Claude Opus 5 50,8
• Chi phí cho mỗi tác vụ lập chỉ mục — 1,13 USD cho Mistral Large 4 Preview so với 5,86 USD cho Claude Opus 5
• Terminal-Bench 4.0 — 26,8% so với 49,0%, khoảng cách đơn lẻ lớn nhất giữa chúng
• Humanity's Last Exam — 35.0% vs 54.9%
• MMMU-Pro, suy luận đa phương thức — 76,4% so với 84,7%
• AutomationBench, quy trình làm việc doanh nghiệp — 59,9% so với 56,6%, dòng duy nhất mà Mistral Large 4 dẫn đầu
• Cửa sổ ngữ cảnh — 1M được Mistral công bố và 524,288 trên cấu hình đã thử nghiệm, so với 1M được phục vụ
• Giới hạn đầu ra — không công bố cho bản xem trước so với 128K token
• Giá mỗi triệu, đầu vào / đầu ra — $1.36 / $4.18 giá niêm yết, hiện tại $0.68 / $2.09 đang khuyến mãi, so với $5.00 / $25.00

Quy luật vẫn như vậy: Opus 5 dẫn đầu ở hai hạng mục khó nhất, nặng về suy luận — công việc trên terminal và kiến thức mở — và vượt trội về khả năng hiểu đa phương thức dù Mistral Large 4 là mô hình được bán nhờ khả năng thị giác. Mistral Large 4 dẫn đầu hạng mục tự động hóa quy trình làm việc, hạng mục gần nhất với những gì một đơn vị kinh doanh thực sự yêu cầu mô hình làm, và làm được điều đó với mức giá chỉ bằng một phần năm cho mỗi tác vụ.
Nơi Mistral Large 4 thực sự chiếm ưu thế
Điều tuyên bố thú vị nhất trong bài đăng ra mắt của Mistral không phải là một điểm chuẩn. Đó là trên một trong các bài kiểm tra Chỉ số An ninh mạng của Artificial Analysis — tái tạo một lỗ hổng thực tế trong phần mềm mã nguồn mở, rồi vá nó — Mistral Large 4 đạt 82%, được cho là cao nhất trong số mọi mô hình, và rằng một số mô hình đóng hàng đầu đạt gần như bằng không ở cùng bài kiểm tra vì chúng từ chối nhiệm vụ. Mistral nêu tên Claude Opus 5.5 và GPT-6 Astra là ví dụ cho sự từ chối đó.
Đó là cách diễn giải của nhà cung cấp về một con số do nhà cung cấp trích dẫn, và nên được hiểu theo cách đó. Nó cũng là một khác biệt vận hành thực sự nếu điều đó đúng: một mô hình không tái tạo được một lỗ hổng thì không thể được dùng để chứng minh rằng lỗ hổng đó là có thật, vốn là bước đầu tiên của hầu hết quy trình ứng phó sự cố. Mistral ghép 82% với điểm 93% trên 40 bài tập thi đấu của Cybench và một phản tuyên bố rằng tỷ lệ từ chối của nó đối với các lời nhắc về mạng được lấy từ JailbreakBench, StrongREJECT và AgentHarm cao hơn tỷ lệ của các mô hình trọng số mở khác — lập luận là bạn muốn có cả năng lực lẫn sự kỷ luật trong cùng một mô hình, thay vì đánh đổi cái này lấy cái kia.
Ngoài lĩnh vực an ninh mạng, lý lẽ ủng hộ Mistral Large 4 dựa trên ba điều mà Opus 5 không cung cấp. Nó được huấn luyện và phục vụ trên hạ tầng châu Âu theo luật châu Âu, điều này quan trọng với những người mua có nghĩa vụ lưu trú dữ liệu. Mistral hứa rằng nó sẽ có thể tải xuống — đó là mục đích của toàn bộ nỗ lực này, vì tự triển khai chính là điều loại bỏ rủi ro truy cập trong lúc sự cố đang diễn ra mà Mistral ra sức mô tả. Và nó đủ rẻ trên mỗi tác vụ đến mức việc dùng nó như một lượt xử lý đầu tiên rồi chuyển phần khó còn sót lại sang một mô hình tiên tiến là hợp lý về mặt kinh tế, chứ không chỉ là một sai số làm tròn.
Nơi Claude Opus 5 vẫn xứng đáng với giá tiền của nó
Khoảng cách chỉ số 12 điểm không hề nhỏ, và bức tranh theo từng dòng cho thấy nó nằm ở đâu. Terminal-Bench 4.0 gần như gấp đôi — 49,0% so với 26,8% — và công việc terminal là đại diện công khai gần nhất cho lập trình tác tử, vốn là phần lớn lý do các đội ngũ đang mua mô hình tiên phong trong năm nay. Humanity's Last Exam tạo khoảng cách 20 điểm giữa chúng. Về khả năng tự chủ dài hạn, thiết kế suy luận thích ứng của Opus 5, mức trần đầu ra 128K và ngữ cảnh 1M được phục vụ là cấu hình bạn muốn nếu khối lượng công việc của bạn là một phiên tác tử kéo dài nhiều giờ thay vì một câu hỏi khó duy nhất.
Giới hạn đầu ra là điểm khác biệt ít được nhắc đến hơn. Mistral chưa công bố độ dài đầu ra tối đa cho bản xem trước, và 128K của Opus 5 thực sự là yếu tố giúp phá bỏ ràng buộc đối với việc tạo mã và các tài liệu dài có cấu trúc. Nếu pipeline của bạn xuất ra tệp thay vì câu trả lời, hãy kiểm tra con số đó trước khi chuyển đổi, vì đây là kiểu khoảng cách chỉ lộ ra trong môi trường production.
Chi phí mỗi tác vụ là con số cần ghi nhớ.
Giá theo từng token tôn lên các mô hình rẻ và gây hiểu nhầm về những mô hình đắt đỏ. Chi phí trên mỗi tác vụ của chính chỉ số — tổng chi tiêu để hoàn thành một tác vụ đánh giá, kể cả bộ nhớ đệm và mọi thứ khác — là con số trụ vững khi chạm trán với ngân sách: 1,13 đô la so với 5,86 đô la.
Đó không phải là giấy phép để chuyển mọi thứ sang mô hình rẻ hơn, bởi một tác vụ mà mô hình rẻ thất bại là một tác vụ bạn phải trả tiền hai lần. Đó là giấy phép để ngừng coi một mô hình tiên phong duy nhất là lựa chọn duy nhất. Trên OrcaRouter, Claude Opus 5 nằm trong danh mục ở đúng giá niêm yết của nhà cung cấp với 0% phụ phí, trong cùng một endpoint tương thích OpenAI như hơn 200 mô hình khác, và chính điều đó biến một pipeline hai mô hình thành công việc của một buổi chiều thay vì phải ký thêm hợp đồng với nhà cung cấp thứ hai. Mistral Large 4 hiện chưa có trong danh mục — bản xem trước được truy cập qua API riêng của Mistral và một số nền tảng bên thứ ba. Khi trọng số của nó được phát hành và có nhà cung cấp lưu trữ, quy tắc chuyển tiếp y hệt vẫn áp dụng: nhà cung cấp tính bao nhiêu thì bạn bị tính đúng bấy nhiêu, và việc nhà cung cấp giảm giá sẽ xuất hiện trên hóa đơn của bạn ngay trong cùng ngày.

Đối với một bản xem trước chưa được kiểm chứng, tính năng định tuyến quan trọng nhất chính là khả năng chuyển đổi dự phòng. Việc gửi một phần lưu lượng sản xuất đến Mistral Large 4 trong khi Opus 5 giữ phần còn lại đồng nghĩa với việc một lỗi hồi quy sẽ biến thành một lần định tuyến lại thay vì một sự cố ngừng dịch vụ, và bạn sẽ nắm được các kiểu thất bại thực sự của mô hình trên chính dữ liệu của mình thay vì trên một bảng xếp hạng.
Điều gì giải quyết được chuyện này trong ba tuần?
Ba dữ kiện vẫn còn bỏ ngỏ, và mỗi dữ kiện đều làm thay đổi câu trả lời. Nếu trọng số được phát hành theo một giấy phép thông thoáng, Mistral Large 4 trở thành mô hình duy nhất trong cặp này mà bạn có thể tự vận hành, và bài toán cân nhắc dành cho những người mua trong ngành bị quản lý sẽ nghiêng hẳn. Nếu mức giá khuyến mãi $0.68 / $2.09 quay trở lại mức $1.36 / $4.18 trên bảng giá, khoảng cách chi phí mỗi tác vụ sẽ thu hẹp nhưng vẫn mang tính quyết định. Và nếu Artificial Analysis đưa các số liệu coding được đánh giá riêng tư lên chỉ mục công khai của mình mà không thay đổi, thì câu chuyện về coding sẽ trở thành được bên thứ ba xác minh thay vì do nhà cung cấp công bố thay mặt bên thứ ba.
Cho đến lúc đó: Opus 5 là lựa chọn mặc định an toàn cho môi trường sản xuất và xứng đáng với mức giá gấp nhiều lần của nó cho các tác vụ agentic và thiên về terminal. Mistral Large 4 là canh bạc đáng chú ý — đủ rẻ trên mỗi tác vụ để chạy song song bên cạnh nó, đủ mạnh về tự động hóa và an ninh mạng để giành được lưu lượng ngay hôm nay, và mang theo lời hứa về khả năng tự triển khai mà không mô hình đóng nào trong so sánh này có thể sánh bằng.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
