Thẻ tiêu đề chính cho bài so sánh DeepSeek V4 Pro và Qwen3.8 Max, với phụ đề 'Chuyên gia suy luận so với mẫu toàn diện của Trung Quốc'.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Chuyên gia suy luận so với mô hình toàn năng Trung Quốc

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách nhau mười ngày, hai mô hình được chú ý nhất tại Trung Quốc đã ra mắt: Alibaba phát hành Qwen3.8 Max vào ngày 3 tháng 8 năm 2026 — một flagship sparse-MoE với 2,4 nghìn tỷ tham số mà hãng quảng bá như một mô hình toàn diện cho agent, công việc văn phòng và hiểu đa phương thức — và D​eepSeek phát hành phiên bản chính thức của DeepSeek V4 Pro vào ngày 12 tháng 8, chuyên gia về suy luận và lập trình với tổng cộng 1,6 nghìn tỷ tham số cùng mức giá khoảng một phần bảy của Q​wen đối với token đầu ra. Hai mô hình này nhắm đến cùng một nhóm nhà phát triển nhưng lại khác nhau về việc một flagship dùng để làm gì. Qwen3.8 Max muốn trở thành mô hình duy nhất mà bạn định tuyến mọi thứ qua; DeepSeek V4 Pro muốn trở thành mô hình để bạn chuyển những việc khó lên.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Những điểm chính rút ra

{{1}}Qwen3.8 Max{{/1}} là mô hình có năng lực thô cao hơn trên {{2}}các bảng xếp hạng chung của Trung Quốc{{/2}} (SuperCLUE #1, tháng 7) và là gói đa phương thức/doanh nghiệp mạnh hơn — đầu vào video, công cụ tích hợp sẵn, đầu ra có cấu trúc, tất cả trong một API.

• DeepSeek V4 Pro rẻ hơn đáng kể (~7× về output), đã mở trọng số, và hiện đang giữ các tuyên bố coding/agentic cao hơn — Terminal-Bench 2.1 đạt 87.9 so với 86.6 do nhà cung cấp Q​wen báo cáo.

• Hãy chú ý đến chi phí phát sinh do dài dòng: các lần chạy độc lập cho thấy Qwen3.8 Max trung bình ~64 lượt và ~1,14 USD cho mỗi tác vụ agent — một vấn đề chi phí thực tế mà bảng thông số kỹ thuật che giấu.

• Dòng tít trung thực: Qwen3.8 Max là flagship trong "cuộc chiến năng lực", có mức giá ngang bằng với các mô hình đóng của Mỹ; DeepSeek V4 Pro là lời phản bác về chi phí – hiệu năng.

Hai triết lý trong một bảng thông số kỹ thuật

• Tổng tham số — Qwen3.8 Max 2.4T (MoE thưa, ~95B hoạt động) so với DeepSeek V4 Pro 1.6T (MoE, ~49B hoạt động)

• Ngữ cảnh / đầu ra tối đa — cả hai đều có ngữ cảnh 1M; Q​wen đạt tối đa khoảng 128–131K đầu ra so với 384K của D​eepSeek

• Đầu vào — Q​wen hỗ trợ văn bản, hình ảnh và video; DeepSeek V4 Pro hỗ trợ văn bản và hình ảnh, với khả năng suy luận hình ảnh gốc mới trong bản dựng chính thức.

• Trọng số mở — DeepSeek V4 Pro: đã phát hành (MIT); Qwen3.8 Max: hứa hẹn trong tuần của ngày 10 tháng 8, dòng Qwen lớp Max đầu tiên từng được mở mã nguồn.

• API bổ sung — Q​wen đi kèm công cụ tích hợp và đầu ra có cấu trúc sẵn có; DeepSeek V4 Pro đi kèm các tùy chọn bật/tắt suy luận, JSON có cấu trúc, API Responses và khả năng tương thích Codex.

• Giá — Qwen3.8 Max $2,00 / $6,00 cho mỗi triệu token ($0,25 cho token được cache) so với DeepSeek V4 Pro ~$0,42 / $0,87 ($0,0035 cho token được cache)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Nơi Qwen3.8 Max vượt trội

Trên trục tổng quát, Qwen3.8 Max đang dẫn đầu và dữ liệu độc lập cũng xác nhận điều này. Artificial Analysis xếp mô hình này ở Chỉ số Trí tuệ 58, Chỉ số Lập trình 71.8 và Chỉ số Tác nhân 58 — mức tiến gần nhất mà bất kỳ phòng thí nghiệm Trung Quốc nào từng đạt tới vị trí dẫn đầu trên bảng xếp hạng tác nhân đó. Trên bảng xếp hạng tiếng Trung tháng 7 của SuperCLUE, mô hình này đứng #1 với 71.48 trong khi DeepSeek-V4-Pro đứng #5 với 64.4. Các bản demo ra mắt của Alibaba — một phiên lập trình tự chủ kéo dài 16 ngày, một bản tái tạo bài báo nghiên cứu vượt qua kết quả AIME24 của bài báo gốc — là bằng chứng mạnh mẽ nhất trong toàn bộ chu kỳ phát hành rằng đây thực sự là một tác nhân có năng lực hoạt động dài hạn.

Đối với một nhà phát triển, những lợi thế thực tế mang tính tích hợp: đầu vào video, gọi công cụ tích hợp sẵn, đầu ra có cấu trúc không cần cấu hình, và một hệ sinh thái (Model Studio, bộ công cụ Q​wen) mà D​eepSeek không tìm cách sánh kịp. Nếu khối lượng công việc nặng về tài liệu, đa phương thức, hoặc cần một giải pháp tích hợp doanh nghiệp, Qwen3.8 Max là mô hình mà thị trường Trung Quốc hiện đang mặc định lựa chọn.

DeepSeek V4 Pro vượt trội ở đâu

Về lập trình và chi phí, V4 Pro chính thức là lời phản bác. D​eepSeek báo cáo bản chính thức đạt 87.9 trên Terminal-Bench 2.1 (tăng từ 72.1 ở bản xem trước) và 62.7 trên DeepSWE — so với 86.6 Terminal-Bench do nhà cung cấp Q​wen báo cáo. Bản xem trước đã có 80.6 SWE-bench Verified, 90.1 GPQA Diamond và 93.5 LiveCodeBench, điểm lập trình cạnh tranh số 1 trong các mô hình mở, và các thay đổi của bản chính thức tập trung chính xác vào các tác vụ tác nhân và suy luận nơi những con số đó tồn tại.

Rồi đến giá cả. Với mức $0,42/$0,87 mỗi triệu token, DeepSeek V4 Pro rẻ hơn khoảng 4,8 lần cho đầu vào và rẻ hơn 6,9 lần cho đầu ra so với mức $2/$6 của Qwen3.8 Max. DeepSeek cũng đã thông báo vào ngày 6 tháng 8 rằng giá sẽ tăng, điều này khiến mức giá hôm nay chỉ là một cơ hội nhất thời, không phải cam kết — nói thêm về điều đó ở bên dưới.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Thực hiện phép tính trên một tác vụ tác tử thực tế.

Các lần chạy tác tử độc lập chính là nơi giá niêm yết của Qwen không còn là giá thực. Trong các tác vụ tác tử của Artificial Analysis, Qwen3.8 Max trung bình ~64 lượt cho mỗi tác vụ và tốn ~$1.14 mỗi tác vụ, so với ~$0.53 của thế hệ trước — mô hình này dài dòng và lên kế hoạch rất nhiều. Chạy cùng dạng tác vụ trên DeepSeek V4 Pro với giá $0.87 mỗi triệu token đầu ra, chi phí mỗi tác vụ sẽ thấp hơn khoảng một bậc độ lớn. Nếu sản phẩm của bạn là một vòng lặp gọi mô hình một trăm lần mỗi ngày cho mỗi người dùng, thì sự khác biệt đó chính là biên lợi nhuận của bạn.

Những lưu ý về độ tin cậy ở cả hai phía

Tính trung thực trong việc trích nguồn ở đây có hai mặt. Kiểm thử độc lập đã chỉ ra tỷ lệ ảo giác của Qwen3.8 Max tăng từ 23% lên 40% và điểm AA-Omniscience giảm mười điểm — mô hình trở nên mạnh hơn nhưng kém đáng tin cậy hơn trong cùng một bản phát hành. Bản xem trước của D​eepSeek được ghi nhận có tỷ lệ luôn trả lời 94% trên AA-Omniscience, nghĩa là nó có xu hướng đưa ra câu trả lời dù có biết hay không. Cả hai dấu hiệu cảnh báo này đều quan trọng cho sản xuất; không cái nào khiến các mô hình này bị loại khỏi các khối lượng công việc mà chúng hướng tới.

Tại sao thời điểm mở trọng số lại thay đổi cách tính giá

Bản phát hành open-weights của Qwen3.8 Max, khi chính thức ra mắt, sẽ thay đổi tương quan kinh tế của cuộc đối đầu này chỉ trong vòng một tuần — những người tự lưu trữ sẽ có được mô hình hàng đầu 2.4T, và áp lực giá API sẽ thực sự rõ rệt. Đây chính là kịch bản mà mô hình định giá chuyển tiếp (pass-through) giúp bạn luôn minh bạch. OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức phụ phí 0%, vì vậy ngay khi Alibaba hoặc D​eepSeek điều chỉnh giá — tăng hoặc giảm — thay đổi sẽ có hiệu lực trên cùng một key ngay trong ngày hôm đó, không cần đàm phán lại, cũng không cần đọc thêm hợp đồng thứ hai. Bạn định tuyến đến Qwen3.8 Max hoặc DeepSeek V4 Pro tùy theo đánh giá hiện tại của bạn, và mức giá luôn giữ nguyên theo đúng số tiền mà nhà cung cấp thực sự tính.

Bạn chọn cái nào cho quyết định API builder của mình?

Chọn Qwen3.8 Max khi công việc cần bao phủ toàn bộ bề mặt — đầu vào đa phương thức, đầu ra có cấu trúc, công cụ tích hợp sẵn, chất lượng tiếng Trung đứng đầu bảng xếp hạng hiện tại — và mô hình chi phí của bạn chấp nhận các phiên chạy agent tốn nhiều token. Chọn DeepSeek V4 Pro khi tác vụ nặng về suy luận hoặc lập trình, khối lượng token cao, trọng số mở quan trọng cho việc tuân thủ hoặc tự lưu trữ, hoặc hạn mức ngân sách là ràng buộc quyết định. Cách hiểu rõ ràng nhất về cuộc đối đầu này chính là điều mà hai công ty tự mình đang phát tín hiệu: Qwen3.8 Max là flagship mà bạn lấy làm thước đo cho mọi thứ, còn DeepSeek V4 Pro là kẻ khiến benchmark trông đắt đỏ.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube