
Qwen 3.8 vs Claude Fable 5: Flagship 2,4T của Alibaba cuối cùng cũng đã có giá
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 54 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 206 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleMỚIGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleMỚIGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Khi Alibaba giới thiệu Qwen3.8-Max tại Thượng Hải vào ngày 19 tháng 7 năm 2026, họ đã đưa ra một tuyên bố nổi bật hơn bất kỳ tuyên bố nào khác: mô hình 2,4 nghìn tỷ tham số này gần đạt trình độ tiên phong và chỉ xếp sau Claude Fable 5. Vào thời điểm đó, điều này không thể đánh giá được. Không có bảng giá, không có bảng benchmark, và không có giấy phép — chỉ là một tuyên bố định vị.
Vào ngày 3 tháng 8 năm 2026, Qwen3.8-Max đã chính thức phát hành rộng rãi, và phép so sánh cuối cùng đã có cơ sở từ cả hai phía. Alibaba đã công bố mức giá $2 / $6 cho mỗi triệu token và một bảng điểm chuẩn với các con số thực tế. Fable 5 vẫn đứng đầu chỉ số Artificial Analysis Intelligence Index độc lập với 95.0% được kiểm toán trên SWE-bench Verified. Vì vậy, câu hỏi trở nên sắc bén hơn: giờ đây khi Qwen đã cho thấy các con số của mình, liệu câu nói "chỉ đứng sau Fable 5" có còn trụ vững?
Một lưu ý dành cho các nhà phát triển — cách nhanh nhất để giải quyết một tuyên bố như thế này là chạy cả hai mô hình trên các prompt của riêng bạn. OrcaRouter cung cấp hơn 200 mô hình thông qua một endpoint tương thích với OpenAI, vì vậy bạn có thể cho Qwen 3.8 Max đối đầu với Fable 5 trên cùng một tác vụ mà không cần tích hợp hai SDK riêng biệt.
Kết luận TL;DR. Qwen3.8-Max ở GA là một đối thủ mạnh hơn nhiều so với bản xem trước gợi ý — và rẻ hơn đáng kể. Với mức giá $2 / $6 cố định cho 1M token nó rẻ hơn mức giá $10 / $50 của Fable 5, khoảng 5× cho input và 8× cho output, và các con số tự báo cáo của nó có dạng tiên phong (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, FrontierSWE 73.5 so với 40.7 của người tiền nhiệm). Nhưng Fable 5 vẫn giữ vương miện vì một lý do không thay đổi kể từ tháng Bảy: nó là mẫu duy nhất trong hai mẫu có trọng tài. Chỉ số Intelligence Index ~60 và SWE-bench 95.0% của Fable được kiểm toán bởi bên thứ ba; mọi con số của Qwen đều do chính Alibaba tự công bố, và cả Artificial Analysis lẫn LMArena đều chưa đăng điểm số Qwen3.8-Max. Fable 5 thắng về bằng chứng; Qwen 3.8 thắng vượt trội về giá và, một khi trọng số được phát hành, về tính mở.
Những điểm chính rút ra
• Qwen3.8-Max chính thức GA từ ngày 3 tháng 8 năm 2026 — không còn là bản xem trước. Bảng giá đã được công bố, API tương thích OpenAI và DashScope, bảng benchmark của nhà cung cấp.
• Khoảng cách giá là rất lớn: Qwen ở mức $2 / $6 cho mỗi 1M so với Fable 5 ở mức $10 / $50. Đó là khoảng 5× cho đầu vào và khoảng 8× cho đầu ra, và mức giá của Qwen là cố định trên toàn bộ ngữ cảnh 1M token mà không có phụ phí cho prompt dài.
• Fable 5 vẫn là bên duy nhất được kiểm toán. ~60 trên Artificial Analysis Intelligence Index (#1) và 95.0% SWE-bench Verified, trong khi Qwen3.8-Max vẫn chưa được bất kỳ nhà đánh giá độc lập nào chấm điểm.
• Các con số do Qwen tự công bố thực sự rất ấn tượng: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — nhưng chúng do chính hãng tự tạo ra, và các phòng lab chỉ công bố những benchmark mà họ chiến thắng.
• Alibaba chưa bao giờ công bố số tham số hoạt động, vì vậy con số 2.4T trên tiêu đề chẳng nói lên được bao nhiêu về chi phí vận hành thực tế. Kiến trúc của Fable 5 cũng không được tiết lộ — xét về tính minh bạch, cả hai bên đều không hoàn hảo.
• Trọng số mở được hứa hẹn sẽ ra mắt trong tuần này, cùng với Qwen3.8-27Bđược báo cáo là chạy với ~17GB VRAM. Fable 5 là bản đóng và chỉ dùng qua API, vĩnh viễn.
Lưu ý về độ chính xác: tất cả các số liệu chất lượng của Qwen3.8-Max do Alibaba công bố và chưa được xác minh độc lập. Các số liệu của Fable 5 đến từ Artificial Analysis và Anthropic và có thể khác nhau giữa các nền tảng theo dõi. Giá của Qwen là biểu giá GA từ Alibaba Model Studio và không còn là mức chiết khấu xem trước tạm thời áp dụng vào tháng 7.
Thông số kỹ thuật và giá, đặt cạnh nhau
Đây là dữ liệu cứng, mỗi con số đều được ghi rõ nguồn gốc.
• Nhà sản xuất / trạng thái — Qwen3.8-Max: Alibaba; GA (3 tháng 8, 2026); Claude Fable 5: Anthropic; GA chủ lực
• Kiến trúc — Qwen3.8-Max: ~2.4T tổng, MoE thưa (tham số kích hoạt vẫn chưa được tiết lộ); Fable 5: Đóng; kiến trúc không được tiết lộ
• Cửa sổ ngữ cảnh — Qwen3.8-Max: 1 triệu token (983.616 khi bật suy luận; đầu ra tối đa 131.072); Fable 5: flagship ngữ cảnh dài
• AA Intelligence Index — Qwen3.8-Max: Vẫn chưa được chấm điểm; Fable 5: ~60 — #1 (Artificial Analysis)
• SWE-bench Verified — Qwen3.8-Max: Không được báo cáo (Alibaba báo cáo FrontierSWE 73.5 thay vào đó); Fable 5: 95.0% (Anthropic / buildfastwithai)
• Điểm mạnh do nhà cung cấp báo cáo — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, PaperBench 93.0, OSWorld-Verified 86.1 (tất cả do Alibaba báo cáo); Fable 5: được kiểm toán đạt #1 tổng thể
• Giá (đầu vào / đầu ra) — Qwen3.8-Max: $2.00 / $6.00 trên 1M, cố định trên ngữ cảnh 1M; đầu vào cache $0.25; Fable 5: $10 / $50 trên 1M
• Trọng số mở — Qwen3.8-Max: Hứa hẹn trong tuần (chưa có giấy phép); Fable 5: Không — đóng / chỉ dùng API
• Đa phương thức — Qwen3.8-Max: Văn bản, hình ảnh, video đầu vào → văn bản đầu ra; Fable 5: Sản phẩm chủ lực đa phương thức
Hai điều tạo nên khung cho toàn bộ sự so sánh, và cả hai đều thay đổi vào ngày 3 tháng 8.
Đầu tiên, cột giá bây giờ là thứ nổi bật nhất trên trang. Vào tháng Bảy, lợi thế chi phí của Qwen là một phiếu giảm giá — giảm 90% tín dụng, tạm thời, không có mức giá theo token nào để lập kế hoạch. Giờ đây nó là một bảng giá, và khoảng cách này mang tính cấu trúc chứ không phải khuyến mãi. Với giá đầu ra $6 so với $50 của Fable, bạn có thể thực hiện khoảng tám lần gọi Qwen với chi phí của một lần gọi Fable. Đối với bất kỳ khối lượng công việc nào mà bạn đang trả tiền cho khối lượng thay vì cho một câu trả lời khó nhất duy nhất, tỷ lệ đó sẽ thay đổi kiến trúc của những gì bạn xây dựng.
Thứ hai, cột benchmark không còn trống — nhưng cũng không thể so sánh được. Đây chính là điểm tinh tế quan trọng nhất. Alibaba công bố FrontierSWE 73.5; Anthropic công bố SWE-bench Verified 95.0%. Đây là những benchmark khác nhau với đường cong độ khó khác nhau, và đặt 73.5 cạnh 95.0 như thể chúng đo cùng một thứ rõ ràng là gây hiểu lầm. Điều chúng ta có thể nói hẹp hơn và trung thực hơn: con số của Fable 5 được tạo ra bởi bên thứ ba trong điều kiện người khác có thể kiểm tra, còn con số của Qwen được Alibaba tạo ra trên một bộ khung đánh giá chưa ai khác từng chạy. Cho đến khi Artificial Analysis hoặc LMArena công bố điểm Qwen3.8-Max, cách đọc đúng vẫn không đổi kể từ tháng Bảy — có vẻ rất sát, nhưng vẫn chưa được chứng minh.

Chênh lệch giá thực sự mang lại cho bạn điều gì?
Nhiều ví dụ trừu tượng ít hữu ích hơn một ví dụ cụ thể, vì vậy đây là một ví dụ. Lấy một tác nhân đánh giá mã gửi 150,000 token ngữ cảnh kho lưu trữ và tạo ra 6,000 token đánh giá cho mỗi lần gọi.
• Qwen3.8-Max: 0.15M × $2 = $0.30, cộng với 0.006M × $6 = $0.036. ≈ $0.34 mỗi lần gọi.
• Claude Fable 5: 0,15M × $10 = $1,50, cộng với 0,006M × $50 = $0,30. ≈ $1,80 mỗi lần gọi.
• Ở mức 2,000 cuộc gọi/ngày: Qwen ≈ $672/ngày; Fable ≈ $3,600/ngày. Trong một tháng, khoảng $20,000 so với $108,000.
• Với bộ nhớ đệm prompt trên ngữ cảnh repo ổn định, đầu vào được lưu trong bộ nhớ đệm của Qwen ở mức $0,25/1M giảm phía đầu vào từ $0,30 xuống dưới $0,04, đưa mỗi lần gọi xuống còn ≈ $0,08 — rẻ hơn khoảng 22 lần so với Fable mỗi lần gọi.
Đó không phải là khoản tiết kiệm nhỏ nhặt; đó là sự khác biệt giữa việc chạy một trình đánh giá trên mọi pull request và chỉ chạy trên những pull request rủi ro. Và mức giá cố định theo context của Qwen khiến tác động này càng mạnh hơn khi prompt tăng lên: vì Alibaba không tính phụ phí cho prompt dài, việc đưa một context 900.000 token qua có chi phí mỗi token bằng với việc đưa một context 5.000 token.
Đối trọng trung thực là giá trên mỗi token không phải là giá trên mỗi nhiệm vụ đã giải quyết. Nếu Fable 5 giải quyết một vấn đề trong một lần xử lý trong khi một mô hình rẻ hơn cần ba lần thử cộng với hiệu chỉnh của con người, thì mô hình rẻ hơn có thể tốn kém hơn về tổng thể — và đối với những công việc suy luận khó nhất, thứ hạng #1 được kiểm toán của Fable là bằng chứng tốt nhất hiện có cho thấy nó thực sự giải quyết được nhiều hơn trong một lần xử lý. Lập luận về chi phí cho Qwen mạnh nhất với khối lượng công việc lớn, ít nhạy cảm với lỗi và yếu nhất với những khối lượng nhỏ, rủi ro cao.
Bằng chứng, và lý do vì sao nó vẫn quyết định trận đấu này.
Bằng chứng thực hành được trích dẫn nhiều nhất về Qwen3.8-Max đến từ một bài đánh giá thời kỳ xem trước (thomas-wiegold.com) đã thử mô hình với bốn bản dựng thực tế. Kết quả thực sự ấn tượng: Qwen đã vượt qua mô phỏng Go poker ngay từ lần đầu — chỉ là mô hình thứ ba từng hoàn thành bài kiểm tra đó trong một lần duy nhất, cùng với Fable 5 và Grok 4.5 — và với một bài kiểm tra trang web máy rang cà phê, nó đã tạo ra đầu ra tốt nhất mà người đánh giá từng thấy từ bài kiểm tra đó, thêm giỏ hàng, mục bán buôn và tích hợp Instagram dù không được yêu cầu, chỉ vì sự kỹ lưỡng tuyệt đối.
Điểm trừ là tốc độ: hơn 30 phút trên trang web và 1 giờ 20 phút trên mô phỏng poker, khiến nó trở thành mô hình chậm nhất mà người đánh giá đó từng sử dụng. Phát hiện đó giờ đây cần một lưu ý mà hồi tháng Bảy nó không cần. Nó được đo trên hạ tầng của bản preview, bởi một người đánh giá, trên các lượt chạy agentic dài bất thường. Phục vụ GA là một hệ thống khác. Dù sao thì, dữ liệu telemetry 7 ngày của chính OrcaRouter hiện cho thấy thời gian đến token đầu tiên ở phân vị p50 là 1,64 giây cho Qwen3.8-Max — một phép đo nội bộ, mặc dù TTFT và thông lượng đầu-cuối trên các bản build kéo dài hàng giờ là những đại lượng khác nhau. Quan điểm trung thực là phát hiện về độ chậm của bản preview nên được kiểm tra lại thay vì được lặp lại như một sự thật hiện tại.
Điều không thay đổi là {{1}}sự bất đối xứng của bằng chứng{{/1}}. Bảng benchmark GA của Alibaba là {{2}}một cải tiến thực sự so với việc không công bố gì{{/2}}, nhưng nó vẫn là {{3}}một sản phẩm do nhà cung cấp tạo ra{{/3}}: các phòng thí nghiệm tự chọn benchmark nào để công bố, và con số yếu nhất mà Alibaba tự báo cáo — IFBench 82.8, chỉ số làm theo chỉ dẫn — lại trùng khớp chính xác với {{4}}lời phàn nàn từ bản xem trước rằng mô hình làm quá mức và bỏ qua phạm vi yêu cầu{{/4}}. Trong khi đó, Fable 5 được chấm điểm bởi {{5}}một bên đánh giá không có lợi ích gắn với kết quả{{/5}}. Với câu hỏi {{6}}"mô hình nào sẽ xử lý công việc mà tôi không thể chịu nổi sai sót,"{{/6}} sự khác biệt đó không phải là chi tiết kỹ thuật vụn vặt. Nó chính là {{7}}toàn bộ cơ sở để lựa chọn{{/7}}.

Sự cởi mở: trục mà Qwen có thể giành chiến thắng vĩnh viễn
Fable 5 sẽ không bao giờ có thể tự lưu trữ. Qwen3.8-Max có thể làm được, và Alibaba hiện cho biết trọng số sẽ về trong tuần này. Nhưng hai lưu ý cần được xem xét ngang nhau.
Điều đầu tiên là hợp pháp: vẫn chưa có văn bản giấy phép và chưa có thẻ mô hình. Việc công bố trọng số mở không phải là sự cấp quyền thương mại cho đến khi có tài liệu để đọc, và giấy phép sẽ quyết định liệu bản phát hành có thể được sử dụng trong một sản phẩm hay không.
Thứ hai là vấn đề vật lý. Mô hình 2.4T cần khoảng 1.2TB ở mức lượng tử hóa 4-bit, trong khi mỗi H200 chỉ có khoảng 141GB — tức là cần tám hoặc nhiều hơn các bộ tăng tốc cao cấp trước khi bạn phục vụ được một token. Và vì Alibaba vẫn chưa công bố số lượng tham số hoạt động, bạn thậm chí không thể ước tính được thông lượng mà khoản chi đó sẽ mang lại. Đối với gần như mọi đội ngũ, tự lưu trữ mô hình hàng đầu không phải là một lựa chọn thực tế.
Điều này khiến Qwen3.8-27B — được công bố cùng thời điểm, cũng sẽ mở trọng số, được cho là chạy trong khoảng ~17GB VRAM — trở thành bản phát hành quan trọng hơn về mặt thực tiễn. Nếu lý do bạn chọn Qwen thay vì Fable 5 là vì vị trí lưu trữ dữ liệu hoặc kiểm soát trên hạ tầng riêng thay vì năng lực thô, thì 27B chính là mô hình thực sự đáp ứng điều đó. So sánh mô hình hàng đầu 2.4T với Fable 5 về độ mở hầu như chỉ mang tính lý thuyết; còn so sánh 27B về độ mở thì rất cụ thể.
Câu hỏi thường gặp
Qwen 3.8 có tốt hơn Claude Fable 5 không?
Không phải dựa trên bằng chứng hiện có. Bảng benchmark GA của Alibaba rất mạnh (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), nhưng mọi con số đều do tự công bố, và chưa có nhà đánh giá độc lập nào chấm điểm mô hình. Fable 5 nắm giữ chỉ số Intelligence Index ~60 đã được kiểm toán (#1) và 95.0% SWE-bench Verified. Fable 5 dẫn đầu về bằng chứng; Qwen 3.8 dẫn đầu vượt trội về giá.
Liệu {{1}}behind only Fable 5{{/1}} có đúng không?
Đó vẫn là sự định vị của riêng Alibaba. GA đã đưa ra một bảng điểm chuẩn nhưng không có sự xác minh từ bên thứ ba — Artificial Analysis và LMArena đều vẫn chưa được chấm điểm. Để tham khảo, phiên bản tiền nhiệm Qwen3.7-Max đạt 46 điểm trên Chỉ số Trí tuệ AA so với mức ~60 của Fable 5, vì vậy tuyên bố này đòi hỏi một bước nhảy vọt rất lớn giữa các thế hệ để có thể đúng theo nghĩa đen.
Qwen 3.8 rẻ hơn Fable 5 bao nhiêu?
Đáng kể, và giờ đây nó là một mức giá thực sự chứ không phải chiết khấu. Qwen3.8-Max có giá $2 / $6 mỗi 1M token so với mức $10 / $50 của Fable 5 — rẻ hơn khoảng 5 lần cho đầu vào và 8 lần cho đầu ra. Mức giá của Qwen cũng không đổi trên toàn bộ ngữ cảnh 1M, và đầu vào được lưu cache ở mức $0.25/1M khiến các khối lượng công việc lặp lại ngữ cảnh còn rẻ hơn nữa.
Qwen 3.8 Max đã rời khỏi bản xem trước chưa?
Vâng. Mô hình đã được phát hành chính thức vào ngày 3 tháng 8 năm 2026 với bảng giá công khai và endpoint tương thích OpenAI và DashScope. Chiến dịch tín dụng Qoder và chương trình ưu đãi 90% cho bản xem trước lan truyền hồi tháng 7 không còn phản ánh đúng cách mô hình được bán.
Qwen 3.8 có còn là mô hình chậm nhất như các đánh giá ban đầu đã nói không?
Phát hiện đó đến từ một người đánh giá trên hạ tầng xem trước chạy các bản dựng tác nhân kéo dài một giờ, và nó cần được kiểm tra lại với dịch vụ GA thay vì được coi là dữ kiện hiện tại. Dữ liệu đo từ xa trong 7 ngày của OrcaRouter cho thấy thời gian đến token đầu tiên ở phân vị 50 là 1,64 giây, mặc dù điều đó đo độ trễ token đầu tiên chứ không phải thông lượng trên các bản dựng rất dài.
Tôi có thể tự lưu trữ Qwen 3.8 thay vì trả tiền cho Fable 5?
Chưa, và có lẽ không phải là flagship. Trọng số (weights) được hứa hẹn trong tuần nhưng vẫn chưa có giấy phép; và với ~1.2TB ở định dạng 4-bit, bạn sẽ cần tám hoặc nhiều GPU lớp H200 trở lên. Mô hình Qwen3.8-27B được công bố đồng thời, được cho là tốn khoảng ~17GB VRAM, là con đường tự lưu trữ thực tế. Fable 5 đã đóng cửa vĩnh viễn.
Tôi nên dùng cái nào hôm nay?
Fable 5 dành cho công việc mà câu trả lời sai phải trả giá đắt và bạn cần độ tin cậy đã được kiểm toán — suy luận phức tạp, các luồng sản xuất rủi ro cao. Qwen3.8-Max dành cho khối lượng công việc lớn, nơi lợi thế 8× về giá đầu ra được cộng dồn: rà soát mã nguồn hàng loạt, phân tích tài liệu dài, bất cứ việc gì bạn có thể chấp nhận kiểm chứng. Nhiều đội ngũ nên chạy cả hai và định tuyến theo giá trị của từng tác vụ.
Kết luận
Qwen 3.8 vs Claude Fable 5 là một sự so sánh khác biệt về bản chất so với hai tuần trước. Qwen3.8-Max không còn là bản xem trước kèm mã giảm giá — giờ đây nó là mô hình phát hành rộng rãi với bảng giá thấp hơn Fable 5 tới 5 lần cho đầu vào và 8 lần cho đầu ra, mức giá cố định cho một triệu token, với các số liệu tự báo cáo trông giống như của mô hình tiên phong và bước nhảy vọt về khả năng lập trình so với phiên bản tiền nhiệm — điều sẽ rất đáng chú ý nếu kết quả được tái hiện.
Nhưng Fable 5 vẫn giữ vương miện, và chính vì lý do nó giữ được nó vào tháng Bảy: đó là phe có trọng tài. Chỉ số Intelligence Index #1 được kiểm toán và 95,0% SWE-bench Verified là những tuyên bố mà người khác đã kiểm chứng. Bảng xếp hạng của Alibaba, dù mạnh đến đâu, vẫn là của Alibaba. Hãy theo dõi hai sự kiện: điểm Intelligence Index độc lập đầu tiên cho Qwen3.8-Max, và việc các bộ trọng số được phát hành kèm giấy phép. Nếu cả hai đều nghiêng về Qwen, câu 'chỉ sau Fable 5' không còn là lời tiếp thị. Cho đến lúc đó, câu trả lời hợp lý không phải là chọn một người thắng cuộc mà là phân chia theo mức độ rủi ro — Fable khi không thể sai lầm, Qwen khi không thể chịu nổi chi phí đắt đỏ — và thử nghiệm cả hai trên các prompt của riêng bạn.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
