
Mistral Large 4 vs DeepSeek V4 Pro: Kiến trúc song sinh, những canh bạc trái ngược
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hai mô hình trong so sánh này gần như giống hệt nhau trên giấy tờ nhưng lại khác biệt một trời một vực trên thực tế. Mistral Large 4 là một mô hình hỗn hợp chuyên gia thưa (sparse mixture-of-experts) với 1,05 nghìn tỷ tham số, trong đó 49 tỷ tham số hoạt động, được công bố ngày 6 tháng 10 năm 2026. DeepSeek V4 Pro là một mô hình hỗn hợp chuyên gia thưa với 1,6 nghìn tỷ tham số, trong đó 49 tỷ tham số hoạt động, được phát hành ngày 24 tháng 4 năm 2026. Cùng ngân sách kích hoạt, cùng họ kiến trúc, cùng tuyên bố về hiệu năng tiên tiến với chi phí của trọng số mở — và chỉ đúng một trong hai mới có trọng số mà bạn có thể tải về ngay hôm nay.
Sự kết hợp này không phải do bài viết này tự nghĩ ra. Bài đăng ra mắt của chính Mistral đánh giá so sánh với DeepSeek V4 Pro đích danh ở ba chỗ riêng biệt: lập trình tác tử, công việc tri thức dài hạn và tự động hóa quy trình nghiệp vụ. Đặt câu hỏi tương tự cho phía còn lại — DeepSeek V4 Pro đã làm được gì mà Mistral Large 4 đang hứa hẹn — hóa ra lại là cách nhanh nhất để thấy bản xem trước thực sự bổ sung điều gì.
Thông số kỹ thuật, được đặt cạnh nhau
Đọc vào ngày 6 tháng 10, số liệu của Mistral lấy từ thông báo và model card của chính họ, còn của DeepSeek lấy từ mục danh mục trực tuyến của họ:
• Tổng số tham số so với tham số hoạt động — tổng 1,05T / 49B hoạt động so với tổng 1,6T / 49B hoạt động
• Các phương thức — đầu vào văn bản và hình ảnh, đầu ra văn bản so với chỉ văn bản
• Cửa sổ ngữ cảnh — 1M do Mistral công bố, 524.288 trên cấu hình mà Artificial Analysis đang thử nghiệm, so với 1M được phục vụ
• Giới hạn đầu ra — không được công bố cho bản xem trước so với 384K token
Giá mỗi triệu token, đầu vào / đầu ra — giá niêm yết $1.36 / $4.18, hiện đang khuyến mãi $0.68 / $2.09, so với $0.66 / $1.98
• Đầu vào được lưu trong bộ nhớ đệm trên mỗi triệu — $0.14, hiện tại $0.07, so với $0.022
Trọng số — được hứa vào cuối tháng 10, giấy phép không nêu tên so với có sẵn ngay bây giờ
• Hạ tầng huấn luyện — 3.800 GPU NVIDIA Grace Blackwell trong các trung tâm dữ liệu châu Âu của riêng Mistral so với cụm của riêng DeepSeek

Sự đối xứng của con số kích hoạt 49B vừa là điểm nhấn vừa là cái bẫy. Các tham số hoạt động chi phối chi phí để tạo ra một token; tổng tham số chi phối những gì mô hình biết. 1.6T của DeepSeek so với 1.05T của Mistral nghĩa là DeepSeek đang có khoảng 50% năng lực nhiều hơn trên mỗi token được tính toán — một lợi thế thực sự trong công việc nặng về kiến thức và không có chút lợi thế nào trong các tác vụ mà nút thắt cổ chai là tuân theo chỉ dẫn hoặc sử dụng công cụ.
Điều mà chỉ số độc lập nói.
Cả hai mô hình đều có trang trên Artificial Analysis, khiến đây trở thành một trong số ít so sánh trong loạt bài mà cả hai bên được đo trên cùng một harness. Intelligence Index v4.3, đọc ngày 6 tháng 10:
• Chỉ số Trí tuệ — 38,4 đối với Mistral Large 4 Preview so với 36,0 đối với DeepSeek V4 Pro 0813
• Chi phí cho mỗi tác vụ lập chỉ mục — 1,13 USD so với 0,67 USD
• Terminal-Bench 4.0 — 26,8% so với 14,1%
• Humanity's Last Exam — 35,0% so với 41,0%
• AutomationBench, quy trình nghiệp vụ — 59,9% so với 56,7%
• τ²-Bench, tác tử sử dụng công cụ — không được công bố cho bản xem trước so với 96,2%
• SciCode — 54,2% so với 51,0%
Đây là một cuộc đua sát sao hơn nhiều so với những gì mức giá thể hiện, và những bất đồng mang tính thông tin chứ không phải nhiễu. Mistral Large 4 thắng ở hạng mục lập trình tác tử với cách biệt gần mười ba điểm và thắng sát nút ở hạng mục tự động hóa quy trình làm việc, trong khi DeepSeek V4 Pro thắng ở kiến thức mở với cách biệt sáu điểm và có chi phí thấp hơn 40% cho mỗi tác vụ. Cũng lưu ý rằng chỉ số này phân bổ chi phí across đọc bộ nhớ đệm, ghi bộ nhớ đệm, token suy luận và token trả lời — bộ nhớ đệm của Mistral được giảm giá 90% trong khi của DeepSeek được giảm giá 97%, đó là lý do hai mô hình có mức giá niêm yết tương tự nhau lại rơi vào $1.13 và $0.67 cho mỗi tác vụ hoàn thành.

Nơi DeepSeek V4 Pro đã giành chiến thắng
Sự khác biệt quyết định không phải là một điểm chuẩn. Đó là việc DeepSeek V4 Pro hiện đang có trọng số mở, còn Mistral Large 4 là bản xem trước được phục vụ từ cụm máy chủ của chính nhà sản xuất. Mistral nói rằng trọng số sẽ được phát hành vào cuối tháng 10 — một cam kết, không phải một sản phẩm đã có. Tổ chức Hugging Face của họ, được kiểm tra vào ngày 6 tháng 10, không có gì mới hơn tháng 7. Cho đến khi một kho lưu trữ xuất hiện với tệp giấy phép, lập luận tự triển khai mà Mistral đang đưa ra thuộc về DeepSeek.
Sự khác biệt thứ hai là độ phủ sẵn có. DeepSeek V4 Pro đã có thể định tuyến từ tháng 4 và, với khoảng cách rất lớn, là mô hình được sử dụng nhiều nhất trên danh mục của chính chúng tôi — 1,13 tỷ token trong bảy ngày qua tại thời điểm viết bài, so với hàng chục triệu token mà một mô hình tiên phong điển hình xử lý. Khối lượng đó có ý nghĩa với người mua theo cách mà một bảng xếp hạng không có: nó nghĩa là các kiểu lỗi đã được biết rõ, các đặc tính thông lượng đã được biết rõ, và các nhà cung cấp đang vận hành nó đã được kiểm chứng dưới áp lực bởi lưu lượng sản xuất của người khác.
DeepSeek cũng thắng ở những khía cạnh kỹ thuật tẻ nhạt. Mức trần đầu ra 384K so với một mức chưa được công bố, ngữ cảnh 1M được phục vụ thật thay vì chỉ được nêu, và phạm vi chỉ văn bản giúp thông lượng ngữ cảnh dài trở nên dễ dự đoán. Nếu khối lượng công việc của bạn là phân tích tài liệu, tạo nội dung dài, hoặc trích xuất nặng về kiến thức trên một triệu token, thì DeepSeek V4 Pro rẻ hơn, mở hơn và được chứng minh nhiều hơn so với bản xem trước Mistral trên mọi phương diện.
Nơi Mistral Large 4 là lựa chọn tốt hơn
Mistral đã lựa chọn kỹ lưỡng những dòng mà nó đưa vào đánh giá, và khoảng cách về lập trình không chỉ là hình thức. 26,8% so với 14,1% trên Terminal-Bench 4.0 là gần gấp đôi, và điều đó khớp với tuyên bố của Mistral về 61,7% trên DeepSWE v1.1 và 59,4% trên SWE-Atlas-QnA — những con số mà hãng nói rằng Artificial Analysis đã đánh giá riêng trước khi harness ra mắt công khai, đó là lý do chúng chưa có trên chỉ mục công khai. Khi những con số đó xuất hiện, hoặc không xuất hiện, sẽ định đoạt câu hỏi về lập trình.
Tính đa phương thức là điểm khác biệt rõ ràng thứ hai. Mistral Large 4 tiếp nhận hình ảnh một cách nguyên bản, với một bộ mã hóa thị giác chuyên dụng 1.6B, và Mistral tuyên bố khả năng định vị thị giác đạt mức tiên tiến nhất trong số các mô hình mở — nêu con số 42% so với 41% của GPT-6 Astra trên Dense 200. DeepSeek V4 Pro chỉ hỗ trợ văn bản và thẻ danh mục của nó nói rõ điều đó. Bất kỳ quy trình nào liên quan đến ảnh chụp màn hình, bản vẽ kỹ thuật, hồ sơ quét hay đọc biểu đồ thì ở đây chỉ có một ứng viên, không phải hai.
Và rồi đến an ninh mạng, nơi tuyên bố của Mistral sắc bén hơn bất cứ điều gì DeepSeek đã công bố: 82% trong bài kiểm tra Artificial Analysis Cyber Index, bài kiểm tra yêu cầu một mô hình tái tạo một lỗ hổng thực tế và vá nó, được cho là cao nhất trong số mọi mô hình, và 93% trong các bài tập thi đấu của Cybench. Đó là những con số do nhà cung cấp viện dẫn và cần được dán nhãn như vậy — nhưng chúng nằm trên một chỉ số độc lập, và chưa có kết quả DeepSeek nào tương đương được công bố. Đối với công việc bảo mật, lập trường trung thực là Mistral Large 4 đang tuyên bố một vị trí dẫn đầu mà chưa bị chứng minh là sai.
Yếu tố khác biệt cuối cùng nằm ở khía cạnh thẩm quyền tài phán. Mistral đã huấn luyện mô hình trên 3.800 GPU Grace Blackwell trong các trung tâm dữ liệu châu Âu của chính mình và cung cấp bản xem trước tại đó, với một triển khai châu Âu được vận hành từ đầu đến cuối theo luật châu Âu. Đối với một người mua châu Âu thuộc diện bị quản lý, khi lựa chọn thay thế là một mô hình trọng số mở của Trung Quốc hoặc một mô hình đóng của Mỹ, đó là một hạng mục riêng.
Giá cả, hãy đọc cho đúng.
Giá niêm yết của cả hai mô hình đều không kể hết câu chuyện. Mục trong danh mục của DeepSeek V4 Pro có hai khung giờ — 01:00–04:00 và 06:00–10:00 UTC — mà trong đó mức giá được niêm yết bị nhân lên, nên một khối lượng công việc rơi vào những giờ đó sẽ tốn gấp đôi mức giá chính. Mức $0.68 / $2.09 của Mistral Large 4 là khuyến mãi ra mắt so với bảng giá $1.36 / $4.18; khuyến mãi là giá hiện tại còn bảng giá mới là mức để bạn dự tính hóa đơn.
Điều OrcaRouter làm rõ ở đây nằm ở cơ chế chuyển tiếp nguyên giá: mức markup 0% trên giá niêm yết của nhà cung cấp, nghĩa là nhà cung cấp giảm giá thì bạn cũng được giảm giá ngay trong cùng ngày, và mức giá khuyến mại của nhà cung cấp sẽ được chuyển thẳng đến bạn thay vì bị hấp thụ. DeepSeek V4 Pro hiện đã có thể định tuyến sau một endpoint tương thích OpenAI với đúng mức giá của nhà cung cấp, dùng chung thông tin xác thực với hơn 200 mô hình khác, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp khi một bên gặp sự cố. Mistral Large 4 không có trong danh mục của chúng tôi — bản xem trước phải truy cập qua API riêng của Mistral và một số nền tảng bên thứ ba — nên nếu hôm nay bạn muốn chạy cả hai phía của phép so sánh này cùng lúc, thì có nghĩa là một tuyến qua chúng tôi và một tuyến trực tiếp.

Chọn cái nào?
Nếu bạn cần trọng số mà mình có thể nắm giữ, đầu ra 384K, một triệu token ngữ cảnh được phục vụ, chi phí thấp nhất cho mỗi tác vụ hoàn thành trong cặp và một mô hình mà hành vi của nó đã bị người khác phá vỡ trong môi trường production, thì DeepSeek V4 Pro không phải là một sự thỏa hiệp — nó là thành phẩm so với một trailer. Đây là lựa chọn mặc định đúng đắn cho công việc tài liệu, tri thức và dạng dài, và trọng số mở của nó nghĩa là giới hạn trên cho những gì bạn có thể làm với nó chính là hạ tầng của bạn chứ không phải lộ trình của nhà cung cấp.
Nếu khối lượng công việc của bạn là lập trình agentic, nếu nó liên quan đến hình ảnh, nếu nó liên quan đến công việc bảo mật, hoặc nếu quyền tài phán châu Âu là một yêu cầu chứ không phải một sở thích, thì Mistral Large 4 là mô hình đáng để chấp nhận rủi ro bản xem trước — và rủi ro đó là có giới hạn, vì Mistral đã cam kết về trọng số và về một cửa sổ red-teaming có thời điểm kết thúc được nêu rõ. Hãy đưa một phần lưu lượng vào nó ngay bây giờ, giữ DeepSeek V4 Pro cho phần còn lại, và để hai mô hình này giải quyết câu hỏi kiến trúc trên dữ liệu của bạn. Ngân sách kích hoạt 49B sẽ trông giống nhau từ cả hai phía; điều khác biệt là mọi thứ xung quanh nó.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
