
DeepSeek V4 Pro vs Qwen3.8 Max: Chuyên gia suy luận so với mô hình toàn năng Trung Quốc
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Cách nhau mười ngày, hai mô hình được chú ý nhất tại Trung Quốc đã ra mắt: Alibaba phát hành Qwen3.8 Max vào ngày 3 tháng 8 năm 2026 — một flagship sparse-MoE với 2,4 nghìn tỷ tham số mà hãng quảng bá như một mô hình toàn diện cho agent, công việc văn phòng và hiểu đa phương thức — và DeepSeek phát hành phiên bản chính thức của DeepSeek V4 Pro vào ngày 12 tháng 8, chuyên gia về suy luận và lập trình với tổng cộng 1,6 nghìn tỷ tham số cùng mức giá khoảng một phần bảy của Qwen đối với token đầu ra. Hai mô hình này nhắm đến cùng một nhóm nhà phát triển nhưng lại khác nhau về việc một flagship dùng để làm gì. Qwen3.8 Max muốn trở thành mô hình duy nhất mà bạn định tuyến mọi thứ qua; DeepSeek V4 Pro muốn trở thành mô hình để bạn chuyển những việc khó lên.

Những điểm chính rút ra
{{1}}Qwen3.8 Max{{/1}} là mô hình có năng lực thô cao hơn trên {{2}}các bảng xếp hạng chung của Trung Quốc{{/2}} (SuperCLUE #1, tháng 7) và là gói đa phương thức/doanh nghiệp mạnh hơn — đầu vào video, công cụ tích hợp sẵn, đầu ra có cấu trúc, tất cả trong một API.
• DeepSeek V4 Pro rẻ hơn đáng kể (~7× về output), đã mở trọng số, và hiện đang giữ các tuyên bố coding/agentic cao hơn — Terminal-Bench 2.1 đạt 87.9 so với 86.6 do nhà cung cấp Qwen báo cáo.
• Hãy chú ý đến chi phí phát sinh do dài dòng: các lần chạy độc lập cho thấy Qwen3.8 Max trung bình ~64 lượt và ~1,14 USD cho mỗi tác vụ agent — một vấn đề chi phí thực tế mà bảng thông số kỹ thuật che giấu.
• Dòng tít trung thực: Qwen3.8 Max là flagship trong "cuộc chiến năng lực", có mức giá ngang bằng với các mô hình đóng của Mỹ; DeepSeek V4 Pro là lời phản bác về chi phí – hiệu năng.
Hai triết lý trong một bảng thông số kỹ thuật
• Tổng tham số — Qwen3.8 Max 2.4T (MoE thưa, ~95B hoạt động) so với DeepSeek V4 Pro 1.6T (MoE, ~49B hoạt động)
• Ngữ cảnh / đầu ra tối đa — cả hai đều có ngữ cảnh 1M; Qwen đạt tối đa khoảng 128–131K đầu ra so với 384K của DeepSeek
• Đầu vào — Qwen hỗ trợ văn bản, hình ảnh và video; DeepSeek V4 Pro hỗ trợ văn bản và hình ảnh, với khả năng suy luận hình ảnh gốc mới trong bản dựng chính thức.
• Trọng số mở — DeepSeek V4 Pro: đã phát hành (MIT); Qwen3.8 Max: hứa hẹn trong tuần của ngày 10 tháng 8, dòng Qwen lớp Max đầu tiên từng được mở mã nguồn.
• API bổ sung — Qwen đi kèm công cụ tích hợp và đầu ra có cấu trúc sẵn có; DeepSeek V4 Pro đi kèm các tùy chọn bật/tắt suy luận, JSON có cấu trúc, API Responses và khả năng tương thích Codex.
• Giá — Qwen3.8 Max $2,00 / $6,00 cho mỗi triệu token ($0,25 cho token được cache) so với DeepSeek V4 Pro ~$0,42 / $0,87 ($0,0035 cho token được cache)

Nơi Qwen3.8 Max vượt trội
Trên trục tổng quát, Qwen3.8 Max đang dẫn đầu và dữ liệu độc lập cũng xác nhận điều này. Artificial Analysis xếp mô hình này ở Chỉ số Trí tuệ 58, Chỉ số Lập trình 71.8 và Chỉ số Tác nhân 58 — mức tiến gần nhất mà bất kỳ phòng thí nghiệm Trung Quốc nào từng đạt tới vị trí dẫn đầu trên bảng xếp hạng tác nhân đó. Trên bảng xếp hạng tiếng Trung tháng 7 của SuperCLUE, mô hình này đứng #1 với 71.48 trong khi DeepSeek-V4-Pro đứng #5 với 64.4. Các bản demo ra mắt của Alibaba — một phiên lập trình tự chủ kéo dài 16 ngày, một bản tái tạo bài báo nghiên cứu vượt qua kết quả AIME24 của bài báo gốc — là bằng chứng mạnh mẽ nhất trong toàn bộ chu kỳ phát hành rằng đây thực sự là một tác nhân có năng lực hoạt động dài hạn.
Đối với một nhà phát triển, những lợi thế thực tế mang tính tích hợp: đầu vào video, gọi công cụ tích hợp sẵn, đầu ra có cấu trúc không cần cấu hình, và một hệ sinh thái (Model Studio, bộ công cụ Qwen) mà DeepSeek không tìm cách sánh kịp. Nếu khối lượng công việc nặng về tài liệu, đa phương thức, hoặc cần một giải pháp tích hợp doanh nghiệp, Qwen3.8 Max là mô hình mà thị trường Trung Quốc hiện đang mặc định lựa chọn.
DeepSeek V4 Pro vượt trội ở đâu
Về lập trình và chi phí, V4 Pro chính thức là lời phản bác. DeepSeek báo cáo bản chính thức đạt 87.9 trên Terminal-Bench 2.1 (tăng từ 72.1 ở bản xem trước) và 62.7 trên DeepSWE — so với 86.6 Terminal-Bench do nhà cung cấp Qwen báo cáo. Bản xem trước đã có 80.6 SWE-bench Verified, 90.1 GPQA Diamond và 93.5 LiveCodeBench, điểm lập trình cạnh tranh số 1 trong các mô hình mở, và các thay đổi của bản chính thức tập trung chính xác vào các tác vụ tác nhân và suy luận nơi những con số đó tồn tại.
Rồi đến giá cả. Với mức $0,42/$0,87 mỗi triệu token, DeepSeek V4 Pro rẻ hơn khoảng 4,8 lần cho đầu vào và rẻ hơn 6,9 lần cho đầu ra so với mức $2/$6 của Qwen3.8 Max. DeepSeek cũng đã thông báo vào ngày 6 tháng 8 rằng giá sẽ tăng, điều này khiến mức giá hôm nay chỉ là một cơ hội nhất thời, không phải cam kết — nói thêm về điều đó ở bên dưới.

Thực hiện phép tính trên một tác vụ tác tử thực tế.
Các lần chạy tác tử độc lập chính là nơi giá niêm yết của Qwen không còn là giá thực. Trong các tác vụ tác tử của Artificial Analysis, Qwen3.8 Max trung bình ~64 lượt cho mỗi tác vụ và tốn ~$1.14 mỗi tác vụ, so với ~$0.53 của thế hệ trước — mô hình này dài dòng và lên kế hoạch rất nhiều. Chạy cùng dạng tác vụ trên DeepSeek V4 Pro với giá $0.87 mỗi triệu token đầu ra, chi phí mỗi tác vụ sẽ thấp hơn khoảng một bậc độ lớn. Nếu sản phẩm của bạn là một vòng lặp gọi mô hình một trăm lần mỗi ngày cho mỗi người dùng, thì sự khác biệt đó chính là biên lợi nhuận của bạn.
Những lưu ý về độ tin cậy ở cả hai phía
Tính trung thực trong việc trích nguồn ở đây có hai mặt. Kiểm thử độc lập đã chỉ ra tỷ lệ ảo giác của Qwen3.8 Max tăng từ 23% lên 40% và điểm AA-Omniscience giảm mười điểm — mô hình trở nên mạnh hơn nhưng kém đáng tin cậy hơn trong cùng một bản phát hành. Bản xem trước của DeepSeek được ghi nhận có tỷ lệ luôn trả lời 94% trên AA-Omniscience, nghĩa là nó có xu hướng đưa ra câu trả lời dù có biết hay không. Cả hai dấu hiệu cảnh báo này đều quan trọng cho sản xuất; không cái nào khiến các mô hình này bị loại khỏi các khối lượng công việc mà chúng hướng tới.
Tại sao thời điểm mở trọng số lại thay đổi cách tính giá
Bản phát hành open-weights của Qwen3.8 Max, khi chính thức ra mắt, sẽ thay đổi tương quan kinh tế của cuộc đối đầu này chỉ trong vòng một tuần — những người tự lưu trữ sẽ có được mô hình hàng đầu 2.4T, và áp lực giá API sẽ thực sự rõ rệt. Đây chính là kịch bản mà mô hình định giá chuyển tiếp (pass-through) giúp bạn luôn minh bạch. OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức phụ phí 0%, vì vậy ngay khi Alibaba hoặc DeepSeek điều chỉnh giá — tăng hoặc giảm — thay đổi sẽ có hiệu lực trên cùng một key ngay trong ngày hôm đó, không cần đàm phán lại, cũng không cần đọc thêm hợp đồng thứ hai. Bạn định tuyến đến Qwen3.8 Max hoặc DeepSeek V4 Pro tùy theo đánh giá hiện tại của bạn, và mức giá luôn giữ nguyên theo đúng số tiền mà nhà cung cấp thực sự tính.
Bạn chọn cái nào cho quyết định API builder của mình?
Chọn Qwen3.8 Max khi công việc cần bao phủ toàn bộ bề mặt — đầu vào đa phương thức, đầu ra có cấu trúc, công cụ tích hợp sẵn, chất lượng tiếng Trung đứng đầu bảng xếp hạng hiện tại — và mô hình chi phí của bạn chấp nhận các phiên chạy agent tốn nhiều token. Chọn DeepSeek V4 Pro khi tác vụ nặng về suy luận hoặc lập trình, khối lượng token cao, trọng số mở quan trọng cho việc tuân thủ hoặc tự lưu trữ, hoặc hạn mức ngân sách là ràng buộc quyết định. Cách hiểu rõ ràng nhất về cuộc đối đầu này chính là điều mà hai công ty tự mình đang phát tín hiệu: Qwen3.8 Max là flagship mà bạn lấy làm thước đo cho mọi thứ, còn DeepSeek V4 Pro là kẻ khiến benchmark trông đắt đỏ.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
