Thẻ tiêu đề hero cho "Qwen 4 Max vs DeepSeek V4 Pro" với phụ đề "95 tỷ tham số hoạt động so với 49 tỷ", ba huy hiệu hình viên thuốc ghi "$2.00 và $6.00", "$0.66 và $1.98" và "1 trên 25 so với 1 trên 33", một dòng chân trang ghi "Alibaba công bố ngày 22 tháng 9 năm 2026; DeepSeek niêm yết ngày 24 tháng 4 năm 2026", và logo OrcaRouter ở góc dưới cùng bên phải.
Engineering & Research

Qwen 4 Max vs DeepSeek V4 Pro: 95 tỷ tham số hoạt động so với 49 tỷ

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Thông báo Qwen 4 Max tại hội nghị Yunqi ngày 22 tháng 9 năm 2026 chỉ mang đến cho ngành một cái tên và một cấu trúc phân hạng, không gì khác — không trọng số, không giá, không cửa sổ ngữ cảnh, không ngày. DeepSeek V4 Pro đã được niêm yết từ ngày 24 tháng 4 năm 2026 dưới dạng mixture-of-experts 1,6 nghìn tỷ tham số với 49 tỷ tham số hoạt động mỗi token, ngữ cảnh 1 triệu token, và mức giá ngoài giờ cao điểm là 0,66 USD mỗi triệu token đầu vào và 1,98 USD mỗi triệu token đầu ra. Con số đáng để đặt cạnh nhau không phải tổng số tham số mà là số tham số hoạt động: Qwen3.8-Max được công bố gần nhất kích hoạt 95 tỷ tham số mỗi token, gần gấp đôi 49 tỷ tham số hoạt động mà DeepSeek V4 Pro vận hành, và chỉ một con số đó giải thích phần lớn khoảng cách giá gấp ba lần giữa hai phòng thí nghiệm trước khi cần tham khảo đến một benchmark nào.

Hai cách đặt cược khác nhau vào tính thưa thớt

Cả hai phòng thí nghiệm đều xây dựng các mô hình mixture-of-experts thưa. Họ bất đồng gay gắt về mức độ thưa. Qwen3.8-Max — mẫu flagship Qwen đang được phát hành, và là cơ sở tham chiếu cụ thể duy nhất để hình dung Qwen 4 Max sẽ như thế nào — là một mô hình 2,4 nghìn tỷ tham số, kích hoạt 95 tỷ tham số mỗi token, tỷ lệ khoảng một phần hai mươi lăm. DeepSeek V4 Pro là một mô hình 1,6 nghìn tỷ tham số, kích hoạt 49 tỷ tham số, tỷ lệ khoảng một phần ba mươi ba, và nó lưu trữ trọng số chuyên gia ở FP4 trong khi các lớp attention, router và norm vẫn ở FP8, điều này lại giảm tiếp mức tính toán trên mỗi token.

Đó không phải là những khác biệt về tinh chỉnh. Chúng là hai câu trả lời khác nhau cho cùng một câu hỏi — một mô hình tiên phong nên chi bao nhiêu cho mỗi token:

• Tổng số tham số — flagship Qwen 3.8 2.4T so với DeepSeek V4 Pro 1.6T

• Kích hoạt trên mỗi token — Qwen 3.8 chủ lực 95B so với DeepSeek V4 Pro 49B

• Tỷ lệ kích hoạt — khoảng 1 trên 25 so với khoảng 1 trên 33

• Giá đầu vào, ngoài giờ cao điểm — Qwen3.8-Max 2,00 USD mỗi 1M so với DeepSeek V4 Pro 0,66 USD mỗi 1M

• Giá đầu ra, ngoài giờ cao điểm — Qwen3.8-Max $6.00 mỗi 1M so với DeepSeek V4 Pro $1.98 mỗi 1M

• Trọng số flagship — Qwen 3.8 flagship theo giấy phép Qwen tùy chỉnh so với DeepSeek V4 Pro được phát hành theo giấy phép MIT

• Ngữ cảnh — Qwen3.8-Max 1M token so với DeepSeek V4 Pro 1M token

• Phương thức — Qwen3.8-Max đầu vào văn bản, hình ảnh và video so với DeepSeek V4 Pro chỉ văn bản trên trang niêm yết của nó

• Độ trễ quan sát được — thời gian đến token đầu tiên p50 của Qwen3.8-Max là 3,29 giây so với 3,52 giây của DeepSeek V4 Pro trên cùng một danh mục

Sự khác biệt về độ thưa và sự khác biệt về giá lần này cùng chỉ về một hướng, và đó không phải hướng mà tổng số lượng tham số gợi ý. Qwen kích hoạt số tham số mỗi token nhiều gần gấp đôi DeepSeek và tính giá cao gấp khoảng ba lần, và chỉ riêng độ thưa không bù đắp được khoảng cách đó. Thứ bù đắp phần còn lại là phương thức: dòng chủ lực của Qwen mang theo bộ mã hóa thị giác và video, chúng đều được tính phí trong mọi yêu cầu dù có hình ảnh trong đó hay không, và đó là lý do mức giá đầu vào nằm ở mức như vậy. DeepSeek V4 Pro nhận văn bản và trả về văn bản, và nó được định giá như một mô hình chỉ làm đúng việc đó.

Cần có một lưu ý cho cột DeepSeek trước khi cột này được dùng cho bất cứ mục đích gì. DeepSeek định giá theo lịch cao điểm và thấp điểm: các con số $0,66 và $1,98 là mức giá thấp điểm, còn trong các khung giờ cao điểm — 01:00 đến 04:00 và 06:00 đến 10:00 UTC vào các ngày trong tuần, trừ ngày lễ công cộng của Trung Quốc — cùng mô hình đó tính phí $1,32 cho đầu vào và $3,96 cho đầu ra. Mọi thời điểm khác, bao gồm tất cả cuối tuần và ngày lễ, đều là thấp điểm. Do đó, mức giá bạn trả phụ thuộc vào thời điểm lưu lượng của bạn chạy, và một mô hình chi phí chỉ dựa trên con số thấp điểm sẽ sai đối với bất kỳ khối lượng công việc nào có thành phần vào buổi sáng ngày thường.

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

Cột Qwen 4 Max trống, và đó không phải là tình trạng tạm thời.

Thật dễ bị cám dỗ để lấp đầy phần so sánh bằng giả định rằng Qwen 4 Max sẽ nằm gần các con số của Qwen 3.8 và có giá thấp hơn chúng. Hãy cưỡng lại điều đó. Alibaba mô tả kiến trúc Qwen 4 là một thế hệ mới và cho biết nó đang được huấn luyện; sản phẩm đã phát hành duy nhất mô tả kiến trúc đó là Qwen3.8-Flash-Next, được mở nguồn vào cuối tháng 8 năm 2026 và được ghi trên thẻ mô hình của chính nó như một bản xem trước của thiết kế Qwen 4. Đây là một mô hình chính 125 tỷ tham số với 51 tỷ tham số embedding N-gram, kích hoạt khoảng 6 tỷ mỗi bước, cùng với attention thưa QSA, residual có cổng và ngữ cảnh gốc 262.000 token có thể mở rộng tới 1 triệu.

Nếu thiết kế đó mở rộng được lên hạng Max, số lượng tham số hoạt động sẽ vẫn nằm ở mức hàng chục tỷ thay vì tăng dần về phía tổng số của DeepSeek — giữ cho chi phí tính toán mỗi bước gần như không đổi khi tổng số tham số tăng lên chính là toàn bộ mục đích của QSA và của các embedding N-gram được tra cứu thay vì được tính toán dày đặc. Đó là một định hướng chứ không phải một đặc tả, và không nên được in ra như thể là một đặc tả.

Điều có thể biết được lúc này là sự bất đối xứng vận hành. Một mô hình tồn tại thì có thể được đo lường trên khối lượng công việc của bạn; một mô hình không tồn tại thì không thể được đo lường trên bất cứ thứ gì. Qwen 4 Max có thể truy cập được, khi nó ra mắt, thông qua API của chính nhà cung cấp và một số nền tảng bên thứ ba — cùng con đường mà mọi sản phẩm chủ lực của Alibaba đã đi. Hiện tại nó không có trên OrcaRouter: danh mục không có mục nào cho dòng Qwen 4. DeepSeek V4 Pro hiện có trên OrcaRouter, và một bản chụp có ghi ngày của nó cũng vậy.

Khả năng tái lập là lập luận mà không ai đưa ra.

DeepSeek phát hành các snapshot gắn ngày và giữ chúng có thể tham chiếu được. Danh mục có cả định danh trôi nổi DeepSeek V4 Pro lẫn một biến thể đã ghim ngày 2026-08-13 — ngày đó chính là bản dựng mà chính DeepSeek chỉ định là bản phát hành GA. Điều đó nghe có vẻ không hào nhoáng, và nó quan trọng hơn cả mức chênh lệch điểm benchmark đối với bất kỳ ai đang vận hành một harness đánh giá hoặc một pipeline được kiểm soát tuân thủ: khi bạn ghim snapshot, bộ kiểm thử hồi quy của bạn đang đo mã của bạn chứ không phải nhịp phát hành của nhà cung cấp.

Thế hệ Qwen 3.8 cũng làm điều tương tự — có một bản chụp Qwen3.8-Max gắn ngày trên cùng danh mục, nằm cạnh cái tên không cố định — và không có lý do gì để cho rằng Alibaba sẽ dừng lại. Nhưng đó là đặc điểm của các mô hình đã phát hành, và cần nói thẳng rằng vào ngày Qwen 4 Max được công bố, nó sẽ không có bản chụp nào để ghim, không có định danh ổn định để kiểm thử, và không có cách nào chạy so sánh trước-và-sau trên dữ liệu của chính bạn. Dù bạn muốn thực hiện phép so sánh nào, bạn cũng sẽ chỉ làm được nó sau đó thôi.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

Chạy cả hai mà không cần chạy hai stack

OrcaRouter định tuyến DeepSeek V4 Pro dưới dạng deepseek/deepseek-v4-pro với giá 0,66 USD cho đầu vào và 1,98 USD cho đầu ra trên mỗi triệu token, đây chính là mức giá niêm yết ngoài giờ cao điểm của chính DeepSeek được chuyển thẳng qua với mức chênh lệch 0%. Chi tiết cuối cùng đó ở đây đáng giá hơn so với những nơi khác trong đợt này, bởi vì 1,98 USD cho đầu ra vốn đã gần sát mức sàn đối với một mô hình thuộc tầm tiên phong: mức biên lợi nhuận của nền tảng dù chỉ mười phần trăm cũng sẽ chiếm một phần năm khoảng cách giữa mô hình này và một lựa chọn tầm trung, và với mức chênh lệch 0%, mức giá bạn thấy trên trang chính là mức giá mà DeepSeek công bố — bao gồm cả sự phân tách giữa giờ cao điểm và ngoài giờ cao điểm, vốn được chuyển thẳng qua theo cùng lịch trình thay vì được tính trung bình thành một mức giá cố định.

Cùng một endpoint mang cả gia đình Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash và Qwen3.8-27B — bên cạnh DeepSeek V4 Pro trên một API tương thích OpenAI với gần 200 mô hình, kèm khả năng chuyển đổi dự phòng tự động khi một tuyến nhà cung cấp suy giảm và một DSL định tuyến giúp việc lựa chọn trở nên tường minh thay vì mã hoá cứng. Nếu DeepSeek cắt giảm mức giá, thay đổi đó đến khoá của bạn ngay trong ngày, bởi không có lớp biên lợi nhuận nào để một đợt giảm giá bị kẹt lại phía sau. Khi một bậc Qwen 4 ra mắt, chính danh mục đó là nơi nó sẽ xuất hiện.

Điều này đưa bạn đến đâu

DeepSeek V4 Pro thắng cuộc so sánh này do đối thủ bỏ cuộc, và đáng để nói chính xác vì sao thay vì tô vẽ. Nó rẻ hơn trên cả hai trục với hệ số khoảng ba lần, nó kích hoạt số tham số mỗi token gấp năm lần, cửa sổ ngữ cảnh của nó tương đương, và nó có một bản chụp (snapshot) ghi ngày cụ thể mà bạn có thể ghim. Qwen 4 Max có một tên hạng và một suất hội nghị.

Cuộc so sánh thực sự đang diễn ra là DeepSeek V4 Pro đối đầu với Qwen3.8-Max, và đó là một sự đánh đổi thực sự chứ không phải một cuộc thảm bại: DeepSeek là mô hình chỉ văn bản với mức giá chỉ khoảng một phần ba, có trọng số được công bố theo giấy phép MIT và hồ sơ kích hoạt trên mỗi token tinh gọn hơn, còn mô hình chủ lực của Qwen nhận đầu vào hình ảnh và video với giá 2,00 USD và 6,00 USD. Hãy lựa chọn dựa trên phương thức và chi phí đo được cho mỗi tác vụ hoàn thành, không dựa trên số lượng tham số, và hãy chạy lại so sánh khi Alibaba công bố thẻ mô hình — lúc đó câu hỏi thú vị sẽ là liệu Qwen 4 Max có định giá năng lực đa phương thức của mình cao hơn mức giá dành cho văn bản của DeepSeek với khoảng chênh nhỏ hơn so với hiện nay hay không.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày