
Mistral Large 4 vs Gemini 3.1 Pro: Tám tháng, hai hướng đi
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Gemini 3.1 Pro đã có mặt trên thị trường từ ngày 19 tháng 2 năm 2026 và vẫn xếp gần đầu mọi bảng xếp hạng năng lực tổng quát, kể cả những bảng mà ở đó nó đang được so sánh với các mô hình ra mắt mùa thu năm nay. Mistral Large 4 cùng lắm chỉ mới ba tuần tuổi — một bản xem trước được công bố ngày 6 tháng 10 năm 2026, với trọng số được hứa hẹn sẽ có vào cuối tháng 10 và không có giấy phép nào được nêu tên. Trên Intelligence Index của Artificial Analysis, đọc ngày 6 tháng 10, Gemini 3.1 Pro tám tháng tuổi đạt 29,7 điểm so với 38,4 của tân binh. Đó là điểm khởi đầu trung thực cho so sánh này, và nó trái ngược với điều mà các ngày phát hành gợi ý.
Lời giải thích không có gì bí ẩn. Gemini 3.1 Pro là dòng flagship thuộc nhánh preview mà Google chưa từng đưa lên thành bản phát hành ổn định, và trang của Artificial Analysis dành cho nó được ghi nhãn “Gemini 3.1 Pro Preview” — cũng chính trang đó, một chỉ số thấp hơn lại nằm cạnh điểm GPQA Diamond hàng đầu. Đây là mô hình được xây dựng để bao quát: cửa sổ ngữ cảnh rất lớn, tập hợp đa phương thức rộng, và khả năng suy luận mạnh ở các câu hỏi kiến thức. Mistral Large 4 được xây dựng cho một tấm bản đồ thế giới hoàn toàn khác, và mức giá của nó cũng tương xứng.
Mỗi loại là gì
Gemini 3.1 Pro là mô hình suy luận đa phương thức tiên phong của Google, id API là gemini-3.1-pro-preview, với cửa sổ ngữ cảnh 1.048.576 token và giới hạn đầu ra 65.536 token. Mô hình chấp nhận văn bản, hình ảnh, video, âm thanh và tệp. Nó được cung cấp từ danh mục của OrcaRouter với mức giá của chính Google. Tài liệu của Google không liệt kê Gemini 3.1 Pro nào không phải bản xem trước; tên xem trước chính là sản phẩm.
Mistral Large 4 là một mô hình hỗn hợp chuyên gia thưa với 1,05 nghìn tỷ tham số, có 49 tỷ tham số hoạt động và một bộ mã hóa thị giác chuyên dụng 1,6 tỷ tham số, được cung cấp dưới tên "Mistral Large 4 Preview" với id API là mistral-large-4-0. Tài liệu của Mistral nêu cửa sổ ngữ cảnh 1M token; Artificial Analysis đọc được 524.288 trên cấu hình mà nó đang thử nghiệm. Đầu ra tối đa không được công bố. Mistral mô tả đây là mô hình lớn nhất và có năng lực nhất của mình cho đến nay và cho biết trọng số sẽ có vào cuối tháng Mười.
Những con số, kèm theo nguồn gốc của chúng.
Cả hai mô hình đều có các trang riêng, vì vậy phần so sánh dưới đây mang tính cùng khung đánh giá thay vì đối đầu giữa nhà cung cấp với nhà cung cấp:
• Chỉ số Trí tuệ v4.3 — Mistral Large 4 Preview 38.4 so với 3.1 Pro 29.7
• Chi phí mỗi tác vụ lập chỉ mục — $1.13 so với $1.30
• Suy luận ngữ cảnh dài — 81,3% so với 82,0%
• GPQA Diamond — không được công bố cho bản xem trước so với 94.1%
• Humanity's Last Exam — 35,0% so với 47,0%
• Terminal-Bench 4.0 — 26,8% so với 4,0%
• SciCode — 54,2% so với 58,7%
• AutomationBench, quy trình nghiệp vụ — 59,9% so với 35,4%
• MMMU-Pro, suy luận đa phương thức — 76,4% so với 82,4%
• Cửa sổ ngữ cảnh — công bố 1M / kiểm thử 524,288 so với 1,048,576 được phục vụ
• Giới hạn đầu ra — không được công bố so với 65.536 token
• Giá mỗi triệu, đầu vào / đầu ra — $1.36 / $4.18 giá niêm yết, $0.68 / $2.09 giá khuyến mại, so với $2.00 / $12.00 khi dưới 200K token và $4.00 / $18.00 khi trên 200K token
• Trọng số — được hứa, giấy phép không nêu tên, so với độc quyền

Hàng nổi bật nhất là Terminal-Bench 4.0. Gemini 3.1 Pro đạt 4,0% — không phải lỗi đánh máy, và cũng không phải ảo giác trong bảng: nó phản ánh việc một mô hình từ tháng Hai được chạy trên một harness tác nhân terminal ra đời sau nó. Con số 26,8% của Mistral Large 4 cao gấp sáu lần trong cùng bài kiểm tra. Bất kỳ ai từng loại Gemini ra dựa trên một con số agentic-coding cũ thì nên đưa nó trở lại dựa trên GPQA Diamond của nó, và bất kỳ ai từng loại Mistral ra dựa trên thứ hạng chỉ số thì nên nhìn vào hàng terminal trước tiên.
Nơi Gemini 3.1 Pro vẫn nắm lợi thế
Kiến thức và độ bao phủ. GPQA Diamond 94,1% là con số cao nhất ở bất kỳ đâu trong bài viết này, ở cả hai phía, và đây là một bài kiểm tra khoa học trình độ sau đại học — không phải một con số mà một mô hình có thể đạt tới bằng lời. Humanity's Last Exam với 47,0% so với 35,0%, cùng điểm SciCode nhỉnh hơn mô hình mới, đều kể cùng một câu chuyện. Nếu khối lượng công việc của bạn là trả lời các câu hỏi khó một cách chính xác từ một kho kiến thức, Gemini 3.1 Pro vẫn là mô hình mạnh hơn tám tháng sau khi phát hành.
Độ đa dạng về phương thức là lợi thế thứ hai. Gemini 3.1 Pro tiếp nhận video và âm thanh cũng như văn bản và hình ảnh. Mistral Large 4 tiếp nhận văn bản và hình ảnh. Nếu pipeline của bạn nạp các cuộc họp được ghi âm, bản ghi màn hình hoặc âm thanh cảm biến, chỉ một mô hình ở đây có thể nhìn thấy toàn bộ đầu vào.
Giới hạn đầu ra là điểm thứ ba. 65.536 token là mức trần đã được công bố và bảo đảm; Mistral hoàn toàn chưa công bố giới hạn nào cho bản xem trước. Không điều gì trong một bài đăng ra mắt có nhiều khả năng khiến bạn gặp họa khi chạy production hơn một giới hạn đầu ra không được nêu rõ.
Và cửa sổ ngữ cảnh của Gemini thực sự được phục vụ ở mức 1.048.576 token, trong khi 1M của Mistral là con số do nhà cung cấp đưa ra, đối chiếu với 524.288 được đọc độc lập. Với một khối lượng công việc nằm ở tận cuối cửa sổ, sự khác biệt giữa một con số được công bố và một con số được đo lường đồng nghĩa với việc phải viết lại.
Nơi Mistral Large 4 thay đổi quyết định
Công việc tác tử, và cụ thể là bất cứ thứ gì chạm đến terminal, chính là nơi hai mô hình không còn so sánh được với nhau nữa. Bài đăng ra mắt của chính Mistral gộp 61,7% trên DeepSWE v1.1, 59,4% trên SWE-Atlas-QnA và 28,3% trên Terminal-Bench 4.0 thành Chỉ số Coding Agent 49,8%, và nói rõ rằng nó đứng trước DeepSeek V4 Pro 0813 và Qwen3.8 Max trên thước đo kết hợp đó. Theo lời Mistral, ba con số đó là những số liệu mà Artificial Analysis đã đánh giá riêng tư trước khi harness của họ được công bố; chúng chưa có trên chỉ số công khai và nên được dán nhãn là do nhà cung cấp công bố cho đến khi có.
Bằng chứng độc lập cũng chỉ về cùng một hướng. Trên AutomationBench — 657 quy trình công việc trải khắp Gmail, Sheets, Slack và Salesforce — Mistral Large 4 đạt 59,9%, vượt qua Kimi K3, MiMo-V2.6-Pro và DeepSeek V4 Pro, và trên cùng khung đánh giá đó, Gemini 3.1 Pro hoàn toàn không xuất hiện vì bộ đánh giá ra đời sau nó. Một nghiên cứu con người mù do Surge AI thực hiện đã xếp Mistral Large 4 Preview đứng thứ hai trong số năm mô hình về chất lượng lập trình với điểm 3,74, trên GLM-5.3 và Kimi K3, chỉ sau Claude Opus 5.
Tuyên bố về năng lực mạng là điểm sắc bén nhất trong bài đăng của Mistral và đáng được nêu chính xác: 82% trong bài kiểm tra Artificial Analysis Cyber Index, vốn yêu cầu mô hình tái tạo một lỗ hổng thực tế rồi vá nó, được mô tả là cao nhất trong số mọi mô hình, cùng 93% trên 40 bài tập thi đấu của Cybench, và khẳng định của Mistral rằng mô hình này nằm trong top năm toàn cầu trên chỉ số Cyber Index tổng thể, đồng thời dẫn đầu các mô hình trọng số mở được phát triển ngoài Trung Quốc. Đó là những con số do nhà cung cấp tự công bố trên một chỉ số độc lập. Lợi thế thực tiễn của chúng nằm ở chỗ Mistral xây dựng mô hình để làm việc đó thay vì từ chối.
Dòng rẻ nhất trong bảng cũng thuộc về Mistral, nhưng chỉ hơn một chút: $1.13 mỗi tác vụ so với $1.30, một lợi thế 13% mà mức giá khuyến mãi tạo ra và bảng giá chính thức sẽ xóa sạch. Gemini 3.1 Pro là một mô hình năm 2026 với mức giá năm 2026 và việc chạy một tác vụ index trên nó không hề tốn kém.
Tiêu chí phá thế mà không ai đánh giá chuẩn
Có hai điều đang diễn ra mà các bảng không thể hiển thị. Điều đầu tiên là việc cấp phép. Gemini 3.1 Pro là độc quyền và sẽ tiếp tục như vậy; Mistral Large 4 là bản xem trước với toàn bộ điểm nhấn nằm ở chỗ nó trở thành một tệp có thể tải xuống mà bạn có thể chạy theo chính sách của riêng mình, trên phần cứng của riêng bạn, theo luật châu Âu — Mistral đã huấn luyện nó trên 3.800 GPU Grace Blackwell trong các trung tâm dữ liệu của riêng mình và phục vụ bản xem trước tại đó. Lập luận đó không có giá trị gì cho đến khi kho lưu trữ xuất hiện và giấy phép có tên. Nó sẽ có giá trị rất lớn vào ngày điều đó thành hiện thực.

Thứ hai là rủi ro vận hành. Một bản xem trước vẫn đang được tinh chỉnh sẽ thay đổi ngay dưới chân bạn. Trên OrcaRouter, cả hai bên của so sánh này đều có thể truy cập thông qua một endpoint tương thích OpenAI với giá niêm yết của nhà cung cấp và mức markup 0% — Gemini 3.1 Pro đã có trong danh mục với mức giá của Google, trong khi Mistral Large 4 phải được truy cập thông qua API riêng của Mistral và một số nền tảng bên thứ ba, vì đây không phải là tuyến mà chúng tôi cung cấp. DSL định tuyến là phần hữu ích ở đây: gửi phân loại và trích xuất đến mô hình nào rẻ hơn trong tuần đó, đẩy những phần khó còn lại lên cấp cao hơn, và để cơ chế chuyển đổi dự phòng tự động hấp thụ những ngày tồi tệ của bản xem trước thay vì ca trực on-call của bạn phải hấp thụ chúng.

Phán quyết
Hãy hỏi khối lượng công việc là gì, chứ không phải mô hình nào tốt hơn. Đối với công việc tri thức, đầu vào âm thanh và video, giới hạn đầu ra được đảm bảo và cửa sổ một triệu token được phục vụ, Gemini 3.1 Pro vẫn là mô hình mạnh hơn và tuổi của nó không phải là một điểm yếu — đó là tám tháng để người khác tìm ra các giới hạn của nó. Đối với lập trình agentic, công việc trên terminal và vận hành bảo mật, Mistral Large 4 dẫn trước với khoảng cách đủ lớn đến mức thứ hạng trên bảng chỉ số gây hiểu nhầm, và nó là mô hình duy nhất trong hai mô hình có thể sẽ tự host được.
Yếu tố quyết định đáng theo dõi là cuối tháng 10. Nếu trọng số được phát hành theo một giấy phép thông thoáng, Mistral Large 4 sẽ không còn cạnh tranh với Gemini 3.1 Pro về giá mà bắt đầu cạnh tranh với nó về quyền kiểm soát, và đó là một cuộc chiến khác. Nếu chúng được phát hành theo một giấy phép hạn chế, câu trả lời của bài viết này không thay đổi nhiều — nhưng lý do thì có.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
