
Qwen 3.8 vs GPT-5.6: Giờ cả hai đều đã có giá, cái nào thắng?
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 56 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 203 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Khi Alibaba trình làng Qwen3.8-Max tại Thượng Hải vào ngày 19 tháng 7 năm 2026, phản ứng của cộng đồng là ngay lập tức: mô hình 2,4 nghìn tỷ tham số này "được cho là vượt trội so với GPT-5.6 và chỉ kém Fable 5 một chút." GPT-5.6 của OpenAI trong cấu hình Sol hàng đầu của nó đứng ở vị trí #2 trên chỉ số Artificial Analysis Intelligence Index độc lập, thấp hơn Fable 5 một điểm, vì vậy đó là một tuyên bố lớn khi không có số liệu được công bố nào đằng sau nó.
Hai điều đã thay đổi kể từ đó. Qwen3.8-Max đã được phát hành rộng rãi vào ngày 3 tháng 8 năm 2026 với bảng giá thực tế và bảng điểm chuẩn thực tế. Và vào ngày 31 tháng 7, OpenAI đã giảm giá trên toàn bộ dòng GPT-5.6 — Terra xuống còn $2 / $12, Luna xuống còn $0,20 / $1,20, còn Sol giữ nguyên ở phân khúc cao cấp. Vì vậy, cuộc so sánh này không còn là một tuyên bố đối đầu với bảng xếp hạng; mà là hai mô hình có định giá rõ ràng, có tài liệu đầy đủ và thực sự có thể so sánh được.
Lưu ý dành cho các nhà phát triển — cách nhanh nhất để xác minh một nhận định như thế này là chạy cả hai trên các prompt của riêng bạn. OrcaRouter cung cấp hơn 200 mô hình đằng sau một endpoint tương thích OpenAI, vì vậy bạn có thể so sánh trực tiếp Qwen 3.8 Max với GPT-5.6 trên cùng một tác vụ mà không cần kết nối hai SDK.
Kết luận ngắn gọn. Qwen3.8-Max ở GA có mức giá rất cạnh tranh — $2 / $6 mỗi 1 triệu token, cố định trên 1 triệu token — đưa nó về cùng mức giá đầu vào với GPT-5.6 Terra nhưng bằng nửa chi phí đầu ra của Terra, và thấp hơn nhiều so với Sol. Các con số tự công bố của nó rất ấn tượng (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Nhưng GPT-5.6 Sol vẫn thắng ở hai yếu tố quyết định việc sử dụng trong sản xuất: nó là hạng #2 được kiểm toán trên Artificial Analysis Intelligence Index (~59) và nó nhanh — lên đến 750 token/giây trên phần cứng Cerebras. Qwen3.8-Max vẫn chưa được bất kỳ đơn vị đánh giá độc lập nào chấm điểm. Vì vậy, Qwen có thể hoàn toàn đạt ngang GPT-5.6 về chất lượng one-shot và rõ ràng vượt Terra về giá đầu ra; GPT-5.6 thắng về bằng chứng đã được bình duyệt và throughput, yếu tố thường quyết định toàn bộ trận đấu.
Những điểm chính rút ra
• Qwen3.8-Max đã GA từ ngày 3 tháng 8 năm 2026 với mức giá công bố là $2 / $6 cho mỗi 1M token, đồng giá trên toàn bộ ngữ cảnh 1M token.
• So với GPT-5.6 Terra ($2 / $12 sau đợt cắt giảm ngày 31 tháng 7 của OpenAI), Qwen tương đương về đầu vào và giảm một nửa tỷ lệ đầu ra. So với Sol, Qwen rẻ hơn đáng kể.
• GPT-5.6 Sol được kiểm toán ở vị trí #2 trên AA Intelligence Index (~59), và Artificial Analysis ghi nhận rằng nó dẫn đầu trong các bài toán STEM khó nhất. Qwen3.8-Max vẫn chưa được chấm điểm bởi AA và LMArena.
• Tốc độ là điểm khác biệt rõ rệt nhất. GPT-5.6 đạt tốc độ lên tới 750 token/giây trên Cerebras. Qwen là mô hình chậm nhất trong thử nghiệm thực tế ở bản preview — kết quả được ghi nhận trước khi triển khai GA và cần kiểm tra lại.
• Bảng số liệu của Qwen đáng tin cậy nhưng chưa được bình duyệt: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tăng so với 40.7 của bản tiền nhiệm).
• Sự cởi mở chia rẽ họ vĩnh viễn: Qwen cam kết công bố trọng số mở trong tuần này cùng Qwen3.8-27B sử dụng ~17GB VRAM; GPT-5.6 là mô hình đóng và chỉ truy cập qua API.
Lưu ý về độ chính xác: tất cả số liệu chất lượng của Qwen3.8-Max đều do Alibaba công bố và chưa được bên thứ ba xác minh. Số liệu GPT-5.6 từ Artificial Analysis và có thể khác với báo cáo của chính OpenAI. Giá dòng GPT-5.6 phản ánh mức giảm giá của OpenAI vào ngày 31/7/2026. Giá Qwen theo biểu giá GA và thay thế mức chiết khấu xem trước của tháng 7.
Thông số kỹ thuật và giá, đặt cạnh nhau
Đây là dữ liệu cứng, mỗi con số đều được ghi rõ nguồn gốc.
• Nhà sản xuất / trạng thái — Qwen3.8-Max: Alibaba; GA (3 tháng 8, 2026); GPT-5.6 Sol: OpenAI; flagship mã nguồn đóng (các biến thể Sol / Terra / Luna)
• Kiến trúc — Qwen3.8-Max: tổng ~2.4T, MoE thưa (số tham số hoạt động vẫn chưa được tiết lộ); GPT-5.6 Sol: Đóng; kiến trúc không được tiết lộ
• Cửa sổ ngữ cảnh — Qwen3.8-Max: 1M token (983.616 khi bật suy luận; đầu ra tối đa 131.072); GPT-5.6 Sol: mô hình chủ lực về ngữ cảnh dài
• AA Intelligence Index — Qwen3.8-Max: Vẫn chưa được chấm điểm; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)
• Điểm mạnh đã được kiểm định — Qwen3.8-Max: Không có bên thứ ba nào; GPT-5.6 Sol: Dẫn đầu các bài toán STEM khó nhất (Artificial Analysis)
• Điểm mạnh do nhà cung cấp công bố — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (do Alibaba công bố); GPT-5.6 Sol: n/a
• Tốc độ — Qwen3.8-Max: p50 TTFT 1.64s (số liệu telemetry 7 ngày của OrcaRouter); mô hình chậm nhất trong các bài kiểm tra thực tế trên bản xem trước; GPT-5.6 Sol: Tối đa 750 tok/s trên Cerebras (Artificial Analysis)
• Giá (đầu vào / đầu ra) — Qwen3.8-Max: $2.00 / $6.00 mỗi 1M, giá cố định; đầu vào được cache $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol cao cấp (~1/3 chi phí của Fable cho mỗi AA)
• Trọng số mở — Qwen3.8-Max: Hứa hẹn trong tuần này (chưa có giấy phép); GPT-5.6: Không — đóng / chỉ dùng API
Hai điều định hình phép so sánh này, và cả hai đều mới xuất hiện kể từ tháng Bảy.
Đầu tiên, câu chuyện về giá cả thực sự trở nên thú vị chứ không chỉ đơn thuần là rẻ. Vào tháng 7, lợi thế của Qwen là một khoản giảm giá không thể dự trù. Giờ đây, sự so sánh đã cụ thể và có sự phân chia theo từng phân khúc. So với Terra ở mức $2 / $12, Qwen khớp chính xác tỷ lệ đầu vào và giảm một nửa tỷ lệ đầu ra — một lợi thế thực sự cho các tác vụ nặng về suy luận, nơi chi phí đầu ra chiếm ưu thế. So với Luna ở mức $0.20 / $1.20, Qwen đắt hơn 10 lần, và Luna là lựa chọn tốt hơn cho các tác vụ đơn giản với khối lượng lớn. So với Sol, Qwen rẻ hơn nhiều. Vì vậy, "cái nào rẻ hơn" giờ đây có ba câu trả lời khác nhau tùy thuộc vào bạn đang nói đến GPT-5.6 nào — và nói thẳng ra là đợt cắt giảm ngày 31 tháng 7 của OpenAI đã thu hẹp khoảng cách đáng kể.
Thứ hai, hạng mục tốc độ vẫn là nơi hai mô hình này khác biệt rõ rệt nhất, và nó vẫn nghiêng về phía OpenAI. Artificial Analysis đo được GPT-5.6 Sol đạt tối đa 750 token/giây trên silicon Cerebras. Không có gì trong tài liệu GA của Alibaba cho thấy Qwen3.8-Max được thiết kế cho mức thông lượng đó, và người đánh giá trong thời kỳ xem trước từng gọi nó là mô hình chậm nhất mà ông từng sử dụng đã đo chính xác những phiên chạy tác nhân dài, nơi thông lượng có tác động cộng dồn. Nếu khối lượng công việc của bạn là tương tác, tác nhân hoặc quy mô lớn, khoảng cách đó có thể quyết định kèo đấu trước khi chất lượng được nhắc tới.

Bằng chứng: bảng điểm chuẩn GA giải quyết được điều gì và không giải quyết được điều gì.
Quyết định công bố số liệu tại GA của Alibaba là một cải thiện thực sự so với bản xem trước, nơi tuyên bố cộng đồng "vượt trội GPT-5.6" không dựa trên bất kỳ công bố nào. Bảng số liệu rất ấn tượng: GPQA Diamond 92.6 về khoa học cấp sau đại học, PaperBench 93.0 về tái tạo kết quả nghiên cứu, Terminal-Bench 2.1 86.6 về vận hành shell thực tế, OSWorld-Verified 86.1 về điều khiển giao diện desktop. Bước nhảy vọt về lập trình qua các thế hệ là điểm nổi bật — FrontierSWE 73.5 so với 40.7 của phiên bản tiền nhiệm, và DeepSWE 1.1 56.6 so với 21.6.
Điều mà bảng này không làm là giải quyết việc so sánh GPT-5.6, vì hai lý do.
Điều đầu tiên là nguồn gốc. Mọi con số đều do Alibaba tạo ra trên chính bộ khung đánh giá của mình. Các bảng số liệu của nhà cung cấp được lựa chọn chứ không phải được lấy mẫu — một phòng lab công bố những benchmark mà mình đạt kết quả tốt và bỏ qua phần còn lại. Ngược lại, thứ hạng #2 của OpenAI trên Intelligence Index được ấn định bởi một nhà đánh giá không có lợi ích gì trong kết quả. Đáng chú ý, Artificial Analysis đặc biệt ghi nhận GPT-5.6 Sol dẫn đầu ở những bài toán khó nhất trong lĩnh vực STEM — chính là lãnh địa mà GPQA Diamond 92.6 của Qwen nhắm đến. Một trong những tuyên bố đó đã được kiểm chứng.
Điều thứ hai là con số yếu nhất của chính Alibaba nói lên nhiều điều. IFBench 82.8 — khả năng tuân theo chỉ dẫn trong điều kiện ràng buộc — là điểm số thấp nhất trong bảng kết quả của nó, và nó trùng khớp chính xác với lời phê bình dai dẳng nhất trong thời kỳ preview: mô hình đáp ứng quá mức, vượt quá phạm vi và thêm vào những thứ không ai yêu cầu. Điều đó gây ấn tượng trong bản demo nhưng lại tốn kém khi đầu ra được tính phí $6 mỗi triệu token và bạn cần một định dạng chính xác. Đối với các pipeline agentic, nơi các bước phía sau phân tích cú pháp đầu ra, kỷ luật tuân theo chỉ dẫn quan trọng hơn một điểm GPQA.
Để làm mốc so sánh: phiên bản tiền nhiệm Qwen3.7-Max đạt 46trên chỉ số AA Intelligence Index, so với mức ~59 của GPT-5.6 Sol. Rút ngắn mười ba điểm chỉ trong một thế hệ sẽ là một bước nhảy vọt phi thường. Có thể — việc FrontierSWE của chính Alibaba tăng gần gấp đôi cho thấy tiến bộ thực sự — nhưng cho đến khi một trọng tài công bố con số, "vượt trội hơn GPT-5.6" vẫn chỉ là tuyên bố chưa được kiểm chứng, chứ không phải là một kết quả.

Chi phí trong thực tế: một ví dụ tính toán cụ thể qua các cấp
Hãy xem xét một tác nhân suy luận gửi 100.000 token ngữ cảnh và tạo ra 10.000 token đầu ra mỗi lần gọi — một dạng điển hình của phân tích tài liệu hoặc lập kế hoạch nhiều bước.
• Qwen3.8-Max: 0,1M × $2 = $0,20, cộng thêm 0,01M × $6 = $0,06. ≈ $0,26 mỗi lần gọi.
• GPT-5.6 Terra: 0.1M × $2 = $0.20, cộng với 0.01M × $12 = $0.12. ≈ $0.32 mỗi lần gọi.
• GPT-5.6 Luna: 0.1M × $0.20 = $0,02, cộng với 0,01M × $1.20 = $0,012. ≈ $0,03 cho mỗi lần gọi.
• Ở mức 5.000 cuộc gọi/ngày: Qwen ≈ $1.300, Terra ≈ $1.600, Luna ≈ $160.
Hai bài học rút ra được. So với Terra, mức tiết kiệm của Qwen là có thật nhưng khiêm tốn — khoảng 19% ở dạng này — và không đâu gần đến lợi thế cấp số nhân mà Qwen có được trước các mô hình cao cấp như Fable 5 hay Sol. Bất kỳ ai từng cho rằng OpenAI có cấu trúc chi phí đắt đỏ nên cập nhật lại: đợt cắt giảm ngày 31/7 đã làm phần lớn công việc nhằm vô hiệu hóa câu chuyện định giá của Qwen ở phân khúc trung cấp.
Điểm mà Qwen vượt trội rõ rệt là ngữ cảnh dài và bộ nhớ đệm. Vì mức giá $2/$6 là cố định trên toàn bộ cửa sổ 1M token, một prompt 900.000 token có chi phí mỗi token tương đương với một prompt ngắn, trong khi nhiều đối thủ tính phí cao cho đầu vào dài. Và đầu vào được lưu trong bộ nhớ đệm với mức $0.25 mỗi 1M giảm chi phí đầu vào xuống 8× trên các tác vụ có ngữ cảnh lặp lại: lời gọi ở trên giảm từ $0.26 xuống còn khoảng $0.09 khi ngữ cảnh được lưu trong bộ nhớ đệm. Nếu tác tử của bạn đọc lại một ngữ cảnh gần như ổn định trong mỗi lượt, thì lợi thế bền vững nằm ở đó — không phải ở mức giá niêm yết.
Sự cởi mở và người anh em 27B
GPT-5.6 sẽ không bao giờ có thể tự lưu trữ. Qwen3.8-Max có thể — Alibaba hiện nói trọng số sẽ về trong tuần này — nhưng mô hình chủ lực không phải là mục tiêu thực tế: khoảng 1,2TB ở mức 4-bit so với khoảng 141GB mỗi H200 nghĩa là cần tám hoặc nhiều bộ tăng tốc cao cấp, và với số tham số hoạt động vẫn chưa được tiết lộ, bạn thậm chí không thể mô hình hóa thông lượng mà con số đó mang lại. Cũng vẫn chưa có văn bản giấy phép, nghĩa là khả năng sử dụng thương mại chính thức chưa được xác định.
, được công bố đồng thời, Qwen3.8-27B là bản phát hành có ý nghĩa quan trọng hơn đối với những ai quan tâm đến Qwen vì yếu tố kiểm soát hơn là sức mạnh thô. Cũng được phát hành với trọng số mở, mô hình này được cho là chạy chỉ với khoảng 17GB VRAM — chỉ một card đồ họa tiêu dùng cao cấp — khiến nó trở thành lựa chọn on-premise thực sự theo cách mà flagship 2.4T không bao giờ có được. Nếu bạn đang cân nhắc giữa Qwen và GPT-5.6 vì cần đáp ứng yêu cầu về nơi lưu trữ dữ liệu (data residency), thì 27B chính là mô hình cần đánh giá.
Câu hỏi thường gặp
Qwen 3.8 có tốt hơn GPT-5.6 không?
Không phải dựa trên bằng chứng hiện có. Bảng GA của Alibaba rất mạnh (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) nhưng hoàn toàn do tự báo cáo, và chưa có bên đánh giá độc lập nào chấm điểm mô hình này. GPT-5.6 Sol sở hữu vị trí #2 đã được kiểm toán trên Intelligence Index (~59), dẫn đầu các bài toán STEM khó nhất theo Artificial Analysis, và chạy với tốc độ lên tới 750 token/giây. GPT-5.6 thắng ở hạng mục chứng minh và tốc độ.
Liệu tuyên bố "Qwen 3.8 vượt trội hơn GPT-5.6" có đúng không?
Nó bắt đầu chỉ là cảm nhận của cộng đồng và đến nay vẫn chưa được xác minh. GA mang đến bảng benchmark riêng của Alibaba nhưng không có điểm số từ bên thứ ba — Artificial Analysis và LMArena vẫn chưa được chấm điểm. Phiên bản tiền nhiệm Qwen3.7-Max đạt 46 điểm so với mức ~59 của Sol, vì vậy tuyên bố này cần một bước nhảy rất lớn qua một thế hệ để có thể đúng theo nghĩa đen.
Cái nào rẻ hơn, Qwen 3.8 hay GPT-5.6?
Điều đó phụ thuộc vào gói dịch vụ, và câu trả lời đã thay đổi vào ngày 31 tháng 7 khi OpenAI giảm giá. Qwen3.8-Max là $2 / $6 cho mỗi 1M. GPT-5.6 Terra là $2 / $12 — cùng mức đầu vào, gấp đôi đầu ra, vì vậy Qwen thắng ở điểm đó. Luna là $0.20 / $1.20, rẻ hơn Qwen khoảng 10 lần. Sol thuộc phân khúc cao cấp, vì vậy Qwen rẻ hơn Sol rất nhiều.
Cái nào nhanh hơn?
GPT-5.6, vượt trội rõ rệt về thông lượng. Artificial Analysis báo cáo tốc độ lên tới 750 token/giây trên phần cứng Cerebras. Qwen3.8-Max cho thấy thời gian đến token đầu tiên (p50) là 1,64 giây trong dữ liệu telemetry 7 ngày của OrcaRouter, nhưng các nhà đánh giá thời kỳ xem trước nhận thấy nó rất chậm trên các bản build agentic dài — phát hiện đó có trước khi phục vụ GA và đáng được kiểm tra lại.
Qwen 3.8 Max đã rời khỏi bản xem trước chưa?
Vâng, vào ngày 3 tháng 8 năm 2026. Hiện nó đã có bảng giá công bố và một điểm cuối tương thích với OpenAI và DashScope, vì vậy việc mô tả chiến dịch tín dụng Qoder với mức giảm giá 90% vào tháng 7 không còn phản ánh đúng cách nó được bán nữa.
Tôi có thể tự lưu trữ Qwen 3.8 để tránh chi phí OpenAI không?
Thực tế mà nói, đây không phải là sản phẩm chủ lực. Các bộ trọng số được hứa hẹn sẽ ra mắt trong tuần nhưng chưa có giấy phép nào được công bố, và với dung lượng ~1.2TB ở định dạng 4-bit, bạn sẽ cần tám GPU loại H200 trở lên. Mô hình Qwen3.8-27B được công bố cùng lúc, theo báo cáo cần khoảng 17GB VRAM, mới là lựa chọn thực tế.
Tôi nên dùng cái nào hôm nay?
GPT-5.6 Sol dành cho mọi tác vụ nhạy cảm với độ trễ, tương tác hoặc đòi hỏi suy luận chính xác, nơi chất lượng được kiểm định là yếu tố quan trọng. Luna dành cho các tác vụ đơn giản khối lượng lớn, nơi chi phí rẻ nhất vượt trội. Qwen3.8-Max dành cho những trường hợp ngữ cảnh dài và prompt caching chiếm phần lớn hóa đơn của bạn — mức giá cố định 1M token và mức $0.25 cho cached input là những điểm mạnh nhất trong gói dịch vụ của nó.
Kết luận
Qwen 3.8 vs GPT-5.6là cuộc so tài công bằng hơn so với tháng 7, và ít chênh lệch một chiều hơn về giá so với kỳ vọng của người hâm mộ Qwen. Qwen3.8-Max ra mắt ở bản GA với mức giá thực tế, một bảng điểm chuẩn tự báo cáo đáng tin cậy, cùng mức giá cố định cho 1M token và bộ nhớ đệm giá rẻ, khiến nó thực sự hấp dẫn cho các tác vụ ngữ cảnh dài. Đó là những lợi thế mang tính cấu trúc, không phải khuyến mãi.
Nhưng đợt giảm giá ngày 31 tháng 7 của OpenAI đã làm giảm sức nặng của lập luận về chi phí ở phân khúc trung cấp {{1}}— Terra giờ ngang bằng Qwen về giá đầu vào —{{/1}} {{2}}và GPT-5.6 vẫn sở hữu hai đặc tính quyết định:{{/2}} {{3}}thứ hạng #2 đã được kiểm toán từ một đơn vị đánh giá không có lợi ích trong kết quả,{{/3}} {{4}}và thông lượng lên tới 750 token/giây mà Qwen chưa cho thấy bằng chứng nào về việc tiến gần đến.{{/4}} {{5}}Hãy theo dõi hai sự kiện:{{/5}} {{6}}điểm Intelligence Index độc lập đầu tiên cho Qwen3.8-Max,{{/6}} {{7}}và bộ trọng số được phát hành kèm giấy phép.{{/7}} {{8}}Cho đến lúc đó, hãy định tuyến theo đặc điểm —{{/8}} {{9}}dùng GPT-5.6 khi tốc độ và bằng chứng là quan trọng,{{/9}} {{10}}dùng Qwen khi độ dài ngữ cảnh và cache hits chiếm ưu thế trong hóa đơn —{{/10}} {{11}}và tự kiểm chứng trên các prompt của bạn.{{/11}}

So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
