
Mistral Large 4 là bản xem trước 1T tham số: Trọng số vẫn chưa được phát hành
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Mistral Large 4 ra mắt vào ngày 6 tháng 10 năm 2026 dưới dạng bản xem trước công khai — một mô hình hỗn hợp chuyên gia (mixture-of-experts) một nghìn tỷ tham số với 49 tỷ tham số hoạt động, một bộ mã hóa thị giác 1,6 tỷ tham số, và tuyên bố từ nhà sản xuất rằng đây là mô hình trọng số mở mạnh nhất được xây dựng bên ngoài Trung Quốc. Thứ chưa đến là phần mà cụm từ "open-weight" mô tả. Hôm nay không có checkpoint nào để tải xuống, không có tệp giấy phép và không có kho lưu trữ. Mistral nói rằng các trọng số sẽ ra mắt vào "cuối tháng này", sau một giai đoạn red-teaming trong đó các đối tác đã được thẩm định và cơ quan quốc gia nhận được bản dựng được mở khóa với mức kiểm duyệt giảm và năng lực mạng mở rộng. Vì vậy, mô tả chính xác về Mistral Large 4 trong tuần này là một API xem trước mà bạn có thể gọi và một mô hình mà bạn chưa thể sở hữu.
Việc tách bạch đó chính là câu chuyện, không phải một chú thích cho câu chuyện. Mọi con số Mistral công bố kèm theo thông báo — điểm lập trình, điểm an ninh mạng, các đánh giá tài chính và pháp lý — đều được tạo ra trên một bản dựng vẫn đang được thay đổi, và mọi tiêu đề so sánh nó với một mô hình tiên phong đóng đều đang so sánh một sản phẩm sẽ không phải là sản phẩm bạn tải về. Điều hữu ích nên làm với một màn ra mắt như thế này là tách bạch những gì bạn có thể kiểm chứng ngay hôm nay khỏi những gì bạn được yêu cầu tin tưởng, và bài đăng của chính mistral.ai lại rất hào phóng một cách bất thường trong việc cho biết đâu là đâu.
Thực sự có gì đang phát trực tiếp vào ngày 6 tháng 10
API xem trước đã có mặt trên Mistral Studio với mã mô hình mistral-large-4-0. Thẻ mô hình của chính Mistral mô tả nó là "một mô hình đa phương thức đa dụng, trọng số mở, tiên tiến nhất" được xây dựng trên kiến trúc MoE hạt mịn, và phân tách số lượng tham số thành 49B hoạt động so với tổng 1,05T, cùng với bộ mã hóa thị giác. Công ty đã huấn luyện nó từ đầu trên 3.800 GPU NVIDIA Grace Blackwell trong các trung tâm dữ liệu châu Âu của riêng mình, và bản xem trước được phục vụ trên chính hạ tầng đó — một lập luận về chủ quyền mà Mistral đang đưa ra mạnh mẽ không kém gì lập luận về hiệu năng.
Đặc tả, đúng như nhà cung cấp đã nêu:
• Tổng vs tổng — tổng 1,05 nghìn tỷ, 49 tỷ hoạt động trên mỗi token, MoE thưa
• Các phương thức — đầu vào văn bản và hình ảnh, đầu ra văn bản; đa phương thức gốc thay vì bộ chuyển đổi gắn thêm
• Cửa sổ ngữ cảnh — tài liệu của Mistral nêu 1M token; Artificial Analysis ghi nhận 524.288 trên cấu hình mà nó đang kiểm thử, vì vậy hãy coi 1M là mức trần của nhà cung cấp thay vì cửa sổ được phục vụ
• Giá — 1,36 USD cho mỗi triệu token đầu vào và 4,18 USD cho mỗi triệu token đầu ra, với đầu vào được lưu trong bộ nhớ đệm ở mức 0,14 USD, theo bảng giá đã công bố của Mistral
• Ưu đãi ra mắt — cùng một thẻ hiển thị mức khuyến mãi $0.68 / $2.09 bị gạch ngang, với đầu vào được cache là $0.07, tức là bằng một nửa giá
• Trọng số — chưa phát hành; "cuối tháng này", theo thông báo
• Giấy phép — không được nêu tên trong thông báo và trên trang tài liệu, nơi chỉ gắn nhãn cho mục này là "Open"
Hai trong số những dòng đó đáng để đọc hai lần. Cửa sổ ngữ cảnh khác nhau gấp đôi tùy vào việc bạn đọc nhà cung cấp hay phòng thí nghiệm bên thứ ba, điều này không có gì bất thường đối với một bản xem trước mà cấu hình phục vụ vẫn đang thay đổi, nhưng đáng để biết trước khi bạn định cỡ khối lượng công việc trên đó. Và mức giá bạn sẽ trả phụ thuộc vào việc mức khuyến mãi có tồn tại qua cửa sổ ra mắt hay không; $1.36 / $4.18 là con số trên bảng giá chính thức của Mistral, còn $0.68 / $2.09 là con số mà họ hiện đang tính. Hãy giả định theo mức đầu tiên khi bạn mô hình hóa hóa đơn của mình.

Các con số benchmark, và ai đã chạy chúng
Bài đăng của Mistral rất cẩn trọng về nguồn gốc, và sự thận trọng đó đáng để tiếp tục lưu tâm. Ba trong số những con số chủ chốt về lập trình agentic — 61.7% trên DeepSWE v1.1, 59.4% trên SWE-Atlas-QnA và 28.3% trên Terminal-Bench 4.0, kết hợp lại thành điểm số Coding Agent Index 49.8% — theo chính lời của Mistral, là "những con số được Artificial Analysis đánh giá riêng trước khi bộ khung đánh giá ra mắt công khai." Hiện chúng chưa có trên chỉ mục công khai của Artificial Analysis. Chúng sẽ có, khi bộ khung này được phát hành. Cho đến lúc đó, chúng là những con số do nhà cung cấp công bố mà một bên thứ ba đã tạo ra nhưng chưa công bố, đây là một nguồn gốc vững chắc hơn hầu hết các tuyên bố ra mắt, và vẫn không phải là một điểm số công khai có thể tái lập.

Những gì công khai và độc lập ở thời điểm hiện tại, đọc từ trang mô hình của Artificial Analysis ngày 6 tháng 10: Mistral Large 4 Preview đạt 38.4 trên Intelligence Index v4.3, mất khoảng 507 giây mỗi tác vụ, với Terminal-Bench 4.0 ở mức 26.8% và Long-Context Reasoning ở mức 81.3%. Cùng trang đó liệt kê nó là một mô hình open-weights mà trên thực tế không phải là open-weights — cờ hiển thị isOpenWeights: false với phân loại "proprietary", bởi vì thứ tồn tại chỉ là một bản preview được phục vụ từ cụm máy chủ của chính nhà cung cấp. Cờ đó là minh họa đơn lẻ rõ ràng nhất cho khoảng cách mà bài viết này bàn tới.

Kết quả đáng được trích dẫn nhất lại chính là kết quả mà Mistral không tự mình chạy. Surge AI, một công ty gán nhãn bên thứ ba, đã thực hiện một đánh giá mù do con người về chất lượng lập trình với danh tính các mô hình được giữ kín, và các chuyên gia gán nhãn đã chấm Mistral Large 4 Preview 3,74 trên thang điểm 1–5 — đứng thứ hai trong số năm mô hình, trên Kimi K3 với 3,59, GLM-5.3 với 3,60 và GLM-5.2 với 3,40, chỉ xếp sau Claude Opus 5 với 4,22. Một đánh giá mù do con người thực hiện với một phòng thí nghiệm có tên tuổi ở đầu bên kia là một loại bằng chứng khác hẳn so với một benchmark tự chạy, và đây là điểm dữ liệu độc lập mạnh nhất trong toàn bộ thông báo.
Sau đó là mảng cyber, nơi Mistral đưa ra tuyên bố sắc bén nhất. Trên Chỉ số Cyber của Artificial Analysis, công ty cho biết Mistral Large 4 nằm trong top năm toàn cầu và dẫn đầu các mô hình trọng số mở được phát triển ngoài Trung Quốc. Ở một bài kiểm tra cụ thể — tái tạo một lỗ hổng thực tế trong phần mềm mã nguồn mở, rồi vá nó — nó đạt 82%, được mô tả là cao nhất trong số mọi mô hình, cùng với 93% trên 40 bài tập thi đấu của Cybench. Mistral bổ sung một quan sát đáng chú ý: một số mô hình đóng hàng đầu, Claude Opus 5.5 và GPT-6 Astra được nêu tên trong số đó, đạt gần như bằng không ở cùng bài kiểm tra đó vì chúng từ chối thực hiện nhiệm vụ. Nếu không có trang của bên thứ ba trước mắt, con số 82% là số liệu do nhà cung cấp đưa ra; lập luận về tỷ lệ từ chối là cách diễn giải của nhà cung cấp. Cả hai đều có khả năng đúng và chưa có cái nào được xác nhận độc lập tính đến hôm nay.
Tại sao khung xem trước lại thay đổi phép tính giá
Bản xem trước không chỉ là một nhãn giai đoạn. Nó có nghĩa là mô hình có thể bị trỏ lại, đổi giá, hoặc ngừng cung cấp với thời gian báo trước ngắn hơn so với bản phát hành GA, và nó có nghĩa là cấu hình phục vụ mà bạn đo chuẩn có thể không phải là cấu hình mà bạn triển khai. Đối với một quyết định định tuyến, đó là một chi phí thực sự: một pipeline được tinh chỉnh trên bản dựng của tuần này mang theo một hóa đơn tái xác thực mà bạn không hề dự trù.
Trên OrcaRouter, nơi hơn 200 mô hình nằm sau một endpoint tương thích OpenAI duy nhất với mức giá niêm yết của nhà cung cấp và mức chênh lệch 0% được chuyển thẳng qua, một thay đổi giá trên bảng giá của nhà cung cấp cũng là thay đổi giá trên bảng giá của chúng tôi ngay trong cùng ngày — điều này đặc biệt quan trọng ở đây vì bản ra mắt này cung cấp hai mức giá, một mức bị gạch bỏ. Tự động chuyển đổi dự phòng là nửa còn lại của câu trả lời cho một bản xem trước chưa được kiểm chứng: nó cho phép bạn đặt một phần lưu lượng sản xuất lên Mistral Large 4 trong khi một mô hình chính hãng giữ phần còn lại, nhờ đó một bản xem trước bị suy giảm dưới khối lượng công việc thực tế của bạn sẽ biến thành một lần định tuyến lại thay vì một sự cố. Điều mà những độc giả cẩn thận nên không giả định là Mistral Large 4 có thể định tuyến trên OrcaRouter ngay hôm nay. Nó không có trong danh mục — bản xem trước được truy cập qua API riêng của Mistral và một số nền tảng bên thứ ba, và trọng số của nó, khi chúng xuất hiện, sẽ là một phương án tự lưu trữ.
Tuyên bố về trọng số mở hiện chỉ là một lời hứa.
Cách định khung của Mistral là Mistral Large 4 “đẩy xa giới hạn của hiệu năng trọng số mở” và rằng trọng số mở là cơ chế để doanh nghiệp duy trì quyền kiểm soát một mô hình. Đó là một lập luận có thể bảo vệ được cho mô hình mà Mistral dự định phát hành. Với mô hình mà hãng đã phát hành tuần này, cơ chế đó không hiện diện: không có kho Hugging Face, không có văn bản giấy phép, không có checkpoint tải xuống được. Tổ chức Hugging Face của chính công ty, được kiểm tra vào ngày 6 tháng 10, không có gì mới hơn tháng 7, và các mục mới nhất của nó không liên quan đến dòng Large.
Đây không phải là lời chỉ trích kế hoạch; việc phát hành trọng số theo từng giai đoạn sau một khoảng thời gian red-teaming là một chính sách mạch lạc, và Mistral đã nói rõ về điều đó. Đó là một lời cảnh báo về tính từ. "Open-weight" đang làm công việc tiếp thị trong một đoạn mà các trọng số còn bốn tuần nữa mới có, và giấy phép chi phối chúng vẫn chưa được nêu tên. Một giấy phép permissive và các điều khoản kiểu Apache là một kết cục; một giấy phép chỉ dành cho nghiên cứu hoặc giới hạn doanh thu là một kết cục khác, và thông báo không chọn giữa chúng.
Cần kiểm tra những gì trước cuối tháng Mười
Năm điều sẽ biến bản xem trước này thành một sự thật đã được xác lập, và mỗi điều đều có thể kiểm chứng mà không cần hỏi Mistral bất cứ điều gì:
• Một kho Hugging Face thuộc tổ chức Mistral chứa checkpoint và một tệp giấy phép — bản phát hành mà Mistral đã cam kết trong tháng này
• Bản thân tên giấy phép, thứ quyết định liệu “open weight” có nghĩa là tự do kiểu Apache-2.0 hay một quyền cấp bị giới hạn mức sử dụng
• Liệu mức giá khuyến mãi $0.68 / $2.09 có còn được áp dụng, hay sẽ quay trở lại mức $1.36 / $4.18 trên bảng giá
• Liệu Artificial Analysis có đưa các số liệu lập trình được đánh giá riêng tư lên chỉ mục công khai của mình khi harness ra mắt hay không, và liệu chúng có giữ nguyên ở cùng các giá trị đó không
• Cửa sổ ngữ cảnh được cung cấp, hiện đang được nhà cung cấp liệt kê là 1M và được phòng thí nghiệm độc lập đọc là 524.288
Cho đến khi những điều đó được giải quyết, cách tiếp cận đúng đắn đối với Mistral Large 4 chính là cách mà buổi ra mắt của nó mời gọi: hãy gọi nó, đo lường nó trên khối lượng công việc của bạn, và giữ đường production trên một mô hình mà hành vi của nó không được lên lịch thay đổi. Các trọng số là sự kiện. Bản xem trước là trailer.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
