Một thẻ tiêu đề hero cho "Qwen 4 Max vs Gemini 3.1 Pro" với phụ đề "Mẫu flagship chưa được công bố đối đầu với bản xem trước không bao giờ kết thúc", ba huy hiệu dạng viên thuốc ghi "Bản xem trước từ ngày 19 tháng 2 năm 2026", "Ngữ cảnh 1,048,576 token" và "26.3% truy xuất tại 1M", một dòng chân trang ghi "Alibaba công bố ngày 22 tháng 9 năm 2026; Google xem trước ngày 19 tháng 2 năm 2026", và logo OrcaRouter ở góc dưới bên phải.
Engineering & Research

Qwen 4 Max so với Gemini 3.1 Pro: flagship chưa được công bố đối đầu với bản xem trước không bao giờ kết thúc

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hầu hết các so sánh đều đặt một sản phẩm đã phát hành đối đầu với một sản phẩm đã phát hành. Trường hợp này thì khác thường: Qwen 4 Max đã được giới thiệu dưới dạng xem trước tại hội nghị Yunqi ở Hàng Châu vào ngày 22 tháng 9 năm 2026 mà không có ngày phát hành, không có giá và không có trọng số, còn Gemini 3.1 Pro đã ở trạng thái xem trước kể từ ngày 19 tháng 2 năm 2026 và vẫn đang trong trạng thái xem trước — bảy tháng sau, mà không có ngày phát hành rộng rãi nào được công bố và không có ngày ngừng hoạt động trong bảng ngừng hỗ trợ của nó. Không mô hình nào trong cuộc so tài này là một sản phẩm đã ổn định. Đó không phải là lý do để bỏ qua so sánh. Đó chính là cuộc so sánh, và là điều duy nhất về nó thực sự mang lại thông tin hữu ích.

Bảy tháng xem trước

Nhãn "preview" lẽ ra chỉ là một trạng thái ngắn hạn. Gemini 3.1 Pro đến nay đã giữ nhãn đó qua ba lần ra mắt Flash của cùng một phòng thí nghiệm, trong đó có Gemini 3.8 Flash vào ngày 2 tháng 9 năm 2026, mẫu mà Google mô tả là mô hình Flash thông minh nhất của mình. Trên các bảng tổng hợp độc lập, mô hình đó hiện đạt điểm cao hơn 3.1 Pro. Dòng Pro của Google không có thành viên nào mới hơn: không có Gemini 3.8 Pro, và thế hệ 3.5 Pro đã bị trì hoãn và được cho là đã bị gác lại. Hệ quả thực tế là mô hình mang tên Pro không còn là mô hình đạt điểm cao nhất của chính nhà cung cấp mình.

Văn bản giới hạn của chính Google trên mục danh mục khuyên nên lập kế hoạch cho việc ngừng hỗ trợ bản xem trước, đó là cách trung thực để đọc trạng thái này. Một bản xem trước không có ngày GA và không có ngày tắt là một mô hình bạn có thể xây dựng dựa trên đó nhưng không thể lên lịch xoay quanh nó.

Phía Qwen là một hình ảnh phản chiếu với dấu bị đảo ngược. Qwen 4 Max không nằm trong giai đoạn xem trước kéo dài; nó đang ở trạng thái tiền xem trước, hoàn toàn chưa công bố bất cứ điều gì. Hai kiểu thất bại này đối lập nhau: Gemini 3.1 Pro là một endpoint thực sự mà sự tồn tại lâu dài không được xác định, còn Qwen 4 Max là một mục lộ trình đã được xác định nhưng không có endpoint.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

Sự so sánh, và con số ngữ cảnh dài quyết định điều đó

Thông số kỹ thuật của Gemini 3.1 Pro là công khai và cụ thể. Còn của Qwen 4 Max thì trống rỗng. Điều đáng để suy ngẫm là một hàng trong cột Gemini, bởi vì đó là kiểu con số thường được trích dẫn và không nên như vậy:

• Trạng thái — Gemini 3.1 Pro ở bản xem trước kể từ ngày 19 tháng 2 năm 2026, so với Qwen 4 Max được công bố ngày 22 tháng 9 năm 2026 nhưng không có ngày.

• Giá đầu vào — Gemini 3.1 Pro 2,00 USD cho mỗi 1M token với prompt tối đa 200K và 4,00 USD trên mức đó, so với Qwen 4 Max thì không được công bố

• Giá đầu ra — Gemini 3.1 Pro $12.00 cho mỗi 1M lên đến 200K và $18.00 trên 200K, so với Qwen 4 Max không được công bố

• Đầu vào được lưu trong bộ nhớ đệm — Gemini 3.1 Pro $0.20 mỗi 1M khi đọc bộ nhớ đệm, so với Qwen 4 Max chưa được công bố

• Bối cảnh — Gemini 3.1 Pro 1.048.576 token, so với Qwen 4 Max chưa được công bố

• Giới hạn đầu ra — Gemini 3.1 Pro 65.536 token, so với Qwen 4 Max không được công bố

• Phương thức — Gemini 3.1 Pro nhận đầu vào văn bản, hình ảnh, video, âm thanh và PDF với đầu ra văn bản, so với Qwen 4 Max không được công bố

• Kiểm soát suy luận — Gemini 3.1 Pro có các mức tư duy thấp, trung bình và cao, so với Qwen 4 Max chưa được công bố

• Truy hồi ngữ cảnh dài — Gemini 3.1 Pro được nhà cung cấp báo cáo MRCR v2 đạt 84,9 phần trăm tính trung bình trên tám needle ở 128K, nhưng 26,3 phần trăm ở thiết lập pointwise một triệu token, so với Qwen 4 Max không có gì được báo cáo

• Điểm số do nhà cung cấp báo cáo — Gemini 3.1 Pro SWE-bench Verified 80,6 phần trăm, GPQA Diamond 94,3 phần trăm, ARC-AGI-2 77,1 phần trăm, Humanity's Last Exam 44,4 phần trăm không dùng công cụ, so với Qwen 4 Max không có báo cáo nào

• Điểm độc lập — Gemini 3.1 Pro 30 trên Chỉ số Trí tuệ Artificial Analysis v4.3.2, so với Qwen 4 Max không có đánh giá độc lập nào

Dòng ngữ cảnh dài đó chính là điều đáng rút ra. Cửa sổ ngữ cảnh 1.048.576 token chỉ là một con số tiếp thị; khả năng truy xuất 26,3 phần trăm ở thiết lập một triệu token mới là điều chính nhà cung cấp đó báo cáo khi đo đầu xa của cửa sổ ấy. Cả hai con số đều đến từ Google, điều đó khiến khoảng cách này trở thành một nhận định về mô hình chứ không phải về bên đánh giá. Nếu khối lượng công việc của bạn phụ thuộc vào việc tìm một dữ kiện bị chôn vùi gần cuối một prompt một triệu token, con số ngữ cảnh nổi bật chẳng cho bạn biết gì hữu ích, còn dòng này cho bạn biết gần như mọi thứ.

Chỉ số đã thay đổi, còn mô hình thì không.

Gemini 3.1 Pro ra mắt ngày 19 tháng 2 năm 2026 ở mức 57 trên Chỉ số Trí tuệ Artificial Analysis, đứng đầu trong lĩnh vực. Theo bản sửa đổi chỉ số v4.3.2, công bố ngày 19 tháng 9 năm 2026, nó cho kết quả 30. Không có gì về mô hình thay đổi giữa hai ngày đó. Thước đo đã được dựng lại, và nó được dựng lại bốn ngày trước thông báo Qwen 4 của Alibaba.

Sự trùng hợp đó có ý nghĩa hơn chính những con số. Ba trong bốn mô hình trong loạt so sánh này — Gemini 3.1 Pro, Claude Opus 5 và mô hình chủ lực Qwen 3.8 — có điểm số độc lập đã thay đổi dưới cùng một bản sửa đổi, và trong mỗi trường hợp, mức thay đổi đủ lớn để đảo ngược thứ hạng. Bất kỳ so sánh nào được viết trong tháng này mà trích dẫn một giá trị chỉ số duy nhất nhưng không nêu rõ bản sửa đổi đều đang so sánh các điểm số được lấy bằng những thước đo khác nhau, và người đọc sẽ không thể thấy được lỗi đó.

Đối với Qwen 4 Max, hệ quả là mục tiêu liên tục thay đổi. Khi Alibaba cuối cùng công bố, điểm số cần vượt qua trên chỉ số này sẽ là những gì bản sửa đổi hiện hành nêu vào ngày hôm đó, và bản sửa đổi này đã thay đổi ít nhất một lần trong tuần qua.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Những gì các con số vận hành cho thấy, kể cả con số gây khó chịu

Gemini 3.1 Pro có thể định tuyến trên OrcaRouter dưới dạng google/gemini-3.1-pro-preview, mang huy hiệu Flagship và Featured mà không có banner tiền phát hành, ở mức giá niêm yết của Google là 2,00 USD và 12,00 USD mỗi triệu token với markup 0%. Bản thân việc định tuyến là trung thực — mức giá trên trang chính là mức giá mà Google công bố. Các số liệu vận hành trong bảy ngày tính đến ngày 22 tháng 9 cũng đáng để in ra thay vì bỏ qua: p50 time-to-first-token là 10,00 giây, tốc độ đầu ra khoảng 632 token mỗi giây, và tỷ lệ lỗi 77,5 phần trăm trong cả khoảng thời gian. Tỷ lệ lỗi đó không phải là một chú thích nhỏ. Với một mô hình thuộc hạng preview chưa có ngày GA, đó là con số quan trọng nhất để ra quyết định trên trang, và một bản so sánh nêu giá mà không có nó là đang bán hàng chứ không phải cung cấp thông tin.

Cùng một danh mục ấy mang gần 200 mô hình trên một endpoint tương thích OpenAI duy nhất, với cơ chế chuyển đổi dự phòng tự động và một DSL định tuyến, đây chính là cơ chế khiến cho một tỷ lệ lỗi như thế có thể chịu đựng được thay vì trở nên chí mạng: một đường dẫn nhà cung cấp bị suy giảm có thể được chuyển sang dự phòng thay vì bị đánh sập. Dòng Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash và Qwen3.8-27B — nằm trên cùng endpoint với Gemini 3.1 Pro Preview, vì vậy sự thay thế mà bài viết này thực sự nói tới, cái mà bạn có thể thực hiện ngay hôm nay, là một thay đổi chính sách định tuyến chứ không phải một dự án di trú. Qwen 4 Max không có trong danh mục, và cũng không có bậc Qwen 4 nào; khi một mô hình như vậy ra mắt, đó sẽ là nơi nó xuất hiện.

Quyết định đó, nếu có thể gọi như vậy.

Không mô hình nào ở đây là một sản phẩm mà bạn có thể cam kết gắn bó, và lời khuyên trung thực là hãy đối xử với cả hai cho phù hợp. Gemini 3.1 Pro hiện có thể gọi được với mức giá đã công bố, cửa sổ ngữ cảnh đã công bố và dấu vết đánh giá công khai, bao gồm cả điểm yếu về truy xuất ở tận cuối cửa sổ đó; nó cũng là một bản xem trước mà nhà cung cấp bảo bạn hãy lên kế hoạch cho việc ngừng hỗ trợ, đang vận hành ở tỷ lệ lỗi mà sẽ không thể chấp nhận được đối với một thành phần phụ thuộc trong sản xuất. Qwen 4 Max không có vấn đề nào trong số đó vì nó không có thuộc tính nào trong số đó.

Nếu bạn cần một mô hình ngay bây giờ, thì lựa chọn không nằm giữa hai mô hình này. Mà là giữa Gemini 3.1 Pro và mô hình chủ lực Qwen đang được phát hành, và dựa trên bằng chứng hiện có, đó là quyết định giữa chất lượng truy xuất ngữ cảnh dài so với mức giá đầu vào $2.00 cùng trọng số được công bố. Nếu bạn có thể chờ, hãy theo dõi hai thứ thay vì một: thẻ mô hình Qwen 4 Max, và ngày phát hành chính thức cho Gemini 3.1 Pro. Cái nào đến trước sẽ cho bạn biết Alibaba và Google đang thực sự ưu tiên lộ trình nào trong hai lộ trình này.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày