Qwen 3.8 vs Claude Opus 4.8: Quy mô giá rẻ đối đầu chuyên gia suy luận
Guides & Insights

Qwen 3.8 vs Claude Opus 4.8: Quy mô giá rẻ đối đầu chuyên gia suy luận

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Alibaba đã trình làng Qwen3.8-Max tại Thượng Hải vào ngày 19 tháng 7 năm 2026 như một mô hình 2,4 nghìn tỷ tham số được xây dựng cho quy mô và tính kỹ lưỡng. Sản phẩm của AnthropicClaude Opus 4.8 – lại là một dạng khác hẳn: một mẫu flagship cao cấp với khả năng suy luận sâu mà các nhóm tìm đến khi một nhiệm vụ có nhiều bước và một câu trả lời sai phải trả giá đắt.

Trong hai tuần, thật khó để thực hiện sự so sánh đó một cách trung thực, vì Qwen không có giá công bố và không có điểm chuẩn công bố.Điều đó đã thay đổi vào ngày 3 tháng 8 năm 2026, khi Qwen3.8-Max đạt đến khả năng sẵn sàng chung với bảng giá $2 / $6 cho mỗi triệu token và một bảng điểm chuẩn đầy đủ. Câu hỏi triết học vẫn giữ nguyên — quy mô thô và tính mở so với độ tin cậy suy luận — nhưng giờ đây có những con số ở cả hai phía.

Lưu ý dành cho các nhà phát triển — cách nhanh nhất để giải quyết một câu hỏi như thế này là chạy cả hai trên quy trình làm việc của riêng bạn. OrcaRouter cung cấp hơn 200 mô hình thông qua một endpoint tương thích OpenAI, vì vậy bạn có thể đọ Qwen 3.8 Max với Opus 4.8 trên cùng một tác vụ mà không cần tích hợp hai SDK.

Kết luận TL;DR. Opus 4.8 vẫn là chuyên gia suy luận: được đánh giá vào nhóm hàng đầu của Artificial Analysis Intelligence Index và được tin dùng cho các chuỗi agentic dài, nơi một câu trả lời sai một cách tự tin còn tốn kém hơn hóa đơn token. Điểm yếu của nó là chi phí và sự dài dòng — AA ước tính mức giá kết hợp của nó khoảng $3.85/1M ở mức nỗ lực tối đa, và nó rất ngốn token, trong khi Grok 4.5 được báo cáo là hoàn thành các tác vụ tương đương với lượng token đầu ra ít hơn khoảng 4×. Qwen3.8-Max giờ đây đáp trả bằng thứ mà nó thiếu vào tháng 7: một mức giá thực sự rẻ là $2 / $6 đồng giá trên 1M token, đầu vào cached ở mức $0.25, và một bảng benchmark của nhà cung cấp dẫn đầu bởi Terminal-Bench 2.1 86.6 và OSWorld-Verified 86.1. Nó cũng cho thấy sự cần mẫn agentic thực sự trong bài kiểm tra bên thứ ba duy nhất hiện có. Nhưng nó vẫn chưa được bất kỳ nhà đánh giá độc lập nào chấm điểm. Opus dành cho suy luận cần sự tin cậy; Qwen dành cho công việc nhạy cảm chi phí và ưu tiên sự kỹ lưỡng.

Những điểm chính rút ra

Qwen3.8-Max đã GA kể từ ngày 3 tháng 8 năm 2026 với giá $2 / $6 trên 1 triệu token, đồng giá cho toàn bộ ngữ cảnh 1 triệu token — một bảng giá thực sự, thay thế cho mức chiết khấu xem trước tạm thời của tháng 7.

Opus 4.8 đắt hơn đáng kể: Artificial Analysis ước tính chi phí tổng hợp của nó ở mức khoảng $3.85/1M ở mức nỗ lực tối đa, và nó ngốn token — được báo cáo là tạo ra lượng token đầu ra nhiều gấp ~4 lần mỗi tác vụ so với Grok 4.5, do đó các phiên chạy agent dài sẽ khiến khoảng cách càng lớn thêm.

Các nguồn mâu thuẫn về số AA chính xác của Opus 4.8. Trên AA v4.1, Kimi K3 (57.1) được báo cáo ngay trên nó, vì vậy phát biểu đáng tin cậy là "cụm dẫn đầu, dưới các mô hình dẫn đầu Fable 5 / GPT-5.6 Sol" thay vì một con số cụ thể duy nhất.

Qwen hiện có các chỉ số agentic tự báo cáo: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (từ 40.7 của phiên bản tiền nhiệm). Chưa có chỉ số nào được xác minh độc lập.

Một điểm dữ liệu agentic từ bên thứ ba của Qwen là thuận lợi: khi đối đầu với Kimi K3, nó đã tạo ra 354 trích dẫn repo so với 274, đã sử dụng 22 yêu cầu gateway so với 53, và đã ghi nhận 0 lời gọi công cụ thất bại so với 2 — trong khi đạt điểm 80/100 so với 83 của Kimi.

Tính mở phân kỳ vĩnh viễn: Qwen hứa sẽ công khai trọng số trong tuần, kèm theo Qwen3.8-27B dùng ~17GB VRAM; Opus 4.8 đóng và chỉ dùng qua API.

Lưu ý về độ chính xác: mọi số liệu chất lượng của Qwen3.8-Max đều do Alibaba công bố và chưa được bên thứ ba xác minh. Số liệu của Opus 4.8 được ghi nhận từ Artificial Analysis và các nguồn được nêu tên, có thể khác với báo cáo của chính Anthropic; vì các công cụ theo dõi mâu thuẫn nhau về chỉ số chính xác của Opus, chúng tôi chỉ nêu vị trí tương đối thay vì một con số cụ thể. Giá của Qwen áp theo biểu giá GA và thay thế mức chiết khấu của bản xem trước hồi tháng 7.

Thông số kỹ thuật và giá, đặt cạnh nhau

Đây là dữ liệu cứng, mỗi con số đều được ghi rõ nguồn gốc.

• Nhà sản xuất / trạng thái — Qwen3.8-Max: Alibaba; GA (ngày 3 tháng 8 năm 2026); Claude Opus 4.8: Anthropic; GA flagship suy luận sâu

• Kiến trúc — Qwen3.8-Max: ~2.4T tổng, MoE thưa (thông số kích hoạt vẫn chưa được tiết lộ); Opus 4.8: Đóng; kiến trúc không được tiết lộ

• Cửa sổ ngữ cảnh — Qwen3.8-Max: 1M token (983,616 với suy luận; đầu ra tối đa 131,072); Opus 4.8: flagship ngữ cảnh dài

• AA Intelligence Index — Qwen3.8-Max: Vẫn chưa được chấm điểm; Opus 4.8: Nhóm trên cùng, dưới các mô hình dẫn đầu (Artificial Analysis; Kimi K3 được báo cáo ở mức 57.1, ngay phía trên)

• Điểm mạnh cốt lõi — Qwen3.8-Max: Quy mô, độ kỹ lưỡng, kinh tế ngữ cảnh dài; Opus 4.8: Suy luận đa bước sâu sắc + độ tin cậy tác nhân

• Điểm số agentic do nhà cung cấp công bố — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (do Alibaba công bố); Opus 4.8: n/a — uy tín được tạo nên từ thực tế vận hành

• Giá (đầu vào / đầu ra) — Qwen3.8-Max: $2.00 / $6.00 trên 1M, giá cố định; đầu vào được cache $0.25; Opus 4.8: Premium — AA kết hợp ~$3.85/1M ở mức nỗ lực tối đa

• Hiệu quả token — Qwen3.8-Max: Dài dòng; IFBench 82.8 là điểm tự báo cáo yếu nhất của nó; Opus 4.8: Tốn token — tạo ra lượng output nhiều gấp ~4 lần Grok 4.5 (theo báo cáo)

• Trọng số mở — Qwen3.8-Max: Đã hứa trong tuần này (chưa có giấy phép); Opus 4.8: Không — đóng / chỉ dùng API

Hai điều tạo nên khung so sánh, và cả hai đều đã thay đổi vào ngày 3 tháng 8.

Trước hết, khoảng cách chi phí giờ đây có thể đo lường được thay vì chỉ mang tính khái niệm. Vào tháng 7, lợi thế của Qwen là một mức chiết khấu mà bạn không thể dựa vào để lập ngân sách. Giờ đây nó là một mức giá, và hình thái của khoảng cách này thật bất thường: Opus đắt đỏ tiêu tốn nhiều token, nghĩa là hai yếu tố này nhân với nhau. Nếu Opus tạo ra lượng token đầu ra gấp bốn lần cho cùng một tác vụ và tính phí cao hơn cho mỗi token, một phiên chạy agent kéo dài có thể tốn kém gấp nhiều lần so với mức giá niêm yết. Mức giá đầu ra $6, ngữ cảnh 1M đầy đủ và đầu vào được cache $0.25 của Qwen tấn công chính xác vào sự cộng dồn đó.

Thứ hai, Cột benchmark của Qwen không còn trống — và lần này, một phần của nó có liên quan trực tiếp. Toàn bộ tuyên bố của Opus 4.8 là độ tin cậy tác nhân, và Alibaba hiện đã công bố các con số về tác nhân: Terminal-Bench 2.1 86.6 cho thao tác shell, OSWorld-Verified 86.1 cho việc điều khiển GUI thực tế. Những con số đó đo lường đúng thứ cần đo. Điểm hạn chế là nguồn gốc, không phải sự liên quan: Alibaba đã tạo ra chúng trên bộ thử nghiệm của riêng mình, và chưa có bên thứ ba nào tái tạo lại chúng. Trong khi đó, danh tiếng của Opus dựa trên thứ khó công bố hơn nhưng có thể giá trị hơn — việc sử dụng trong sản xuất bền vững qua nhiều đội nhóm, đó là một loại bằng chứng mà bảng của nhà cung cấp không thể tạo ra.

Độ tin cậy suy luận so với độ kỹ lưỡng thô

Sự khác biệt thú vị giữa hai cái này không phải là chất lượng một lần — mà là cách chúng hoạt động khi một nhiệm vụ có nhiều bước và có công cụ thực sự đi kèm.

Danh tiếng của Opus 4.8 được xây dựng dựa trên độ tin cậy tác nhân: những chuỗi lý luận dài, nơi nó theo dõi ngữ cảnh, phục hồi từ những ngõ cụt và trả về những câu trả lời đáng tin cậy để hành động mà không cần kiểm tra lại từng bước. Đó là đặc tính mà các đội ngũ sẵn sàng trả giá cao, vì trong sản xuất, chi phí của một câu trả lời nhiều bước sai lầm một cách tự tin vượt xa chi phí token. Sự đánh đổi là Opus tiêu tốn nhiều token — Grok 4.5 được báo cáo là hoàn thành các tác vụ tương đương với số token đầu ra ít hơn khoảng 4× — nên độ tin cậy của nó đi kèm với một chi phí thực tế, liên tục.

Qwen 3.8 trả lời bằng một loại sức mạnh khác: sự kỹ lưỡng tuyệt đối, và hiện đã có một điểm dữ liệu từ bên thứ ba về điều này. Trong bài kiểm tra khả năng hiểu kiến trúc do Trilogy AI thực hiện (Qwen3.8-Max vs Kimi K3), Qwen đạt 80/100 so với 83 của Kimi — thua ở chỉ số chính — nhưng lại là tác nhân chăm chỉ hơn, tạo ra 354 trích dẫn repo so với 274 của Kimi, sử dụng 22 yêu cầu gateway so với 53, và ghi nhận 0 lệnh gọi công cụ thất bại so với 2. Cả hai mô hình đều đi đến cùng một kết luận kiến trúc cốt lõi; Qwen chỉ đơn giản làm nhiều công việc kiểm chứng hơn để đạt được điều đó, với việc sử dụng công cụ sạch hơn.

Kết quả không có lệnh gọi công cụ thất bại nào là tín hiệu tác nhân đầy khích lệ nhất mà Qwen có, bởi vì các lệnh gọi công cụ thất bại mới là thứ thực sự phá hỏng các tác nhân trong sản xuất. Đây cũng chỉ là một bài kiểm tra, trên một tác vụ, bởi một người đánh giá — không hề gần với cơ sở bằng chứng đằng sau danh tiếng của Opus.

Cái giá của sự kỹ lưỡng của Qwen là độ trễ và token. Các nhà đánh giá trong thời kỳ xem trước nhận thấy nó "rất tốt và rất chậm" — mất hơn 30 phút để dựng một trang web, hơn một giờ cho một mô phỏng poker, mô hình chậm nhất mà nhà đánh giá đó từng sử dụng. Hiện có hai điều cần lưu ý. Đó là hạ tầng xem trước, và hạ tầng phục vụ GA là một hệ thống khác; dữ liệu telemetry trong 7 ngày của OrcaRouter hiện cho thấy thời gian đến token đầu tiên ở mức p50 là 1,64 giây, mặc dù TTFT và thông lượng đầu cuối trên các bản build kéo dài một giờ là những đại lượng khác nhau. Phát hiện này đáng được kiểm tra lại thay vì chỉ lặp lại.

Cũng có một mối lo ngại về mặt cấu trúc đáng được nêu ra: điểm số yếu nhất mà chính Alibaba báo cáo là IFBench 82.8, khả năng tuân theo chỉ dẫn trong điều kiện ràng buộc. Đối với các pipeline agentic vốn phân tích đầu ra của mô hình ở từng bước, một mô hình vượt quá phạm vi và thực hiện thêm công việc không được yêu cầu là một rủi ro, bất kể nó có kỹ lưỡng đến đâu. Đây chính là nơi tính kỷ luật của Opus chứng minh giá trị cao cấp của nó.

Chi phí trong thực tế: nơi khoảng cách token gấp 4 lần gây ảnh hưởng

Lấy một lượt chạy agent đa bước: 80.000 token đầu vào ngữ cảnh và — đây là biến số then chốt — khối lượng đầu ra khác nhau, vì Opus được cho là tạo ra nhiều hơn khoảng 4×.

Qwen3.8-Max với 8.000 token đầu ra: 0,08M × $2 = $0,16, cộng thêm 0,008M × $6 = $0,048. ≈ $0,21 mỗi lần chạy.

Opus 4.8 với mức giá hỗn hợp ~$3,85/1M cho 80.000 token đầu vào + ~32.000 token đầu ra (gấp 4× số token): khoảng $0,43 mỗi lần chạy theo mức giá hỗn hợp — và cao hơn đáng kể nếu bạn tính riêng giá đầu vào và đầu ra theo mức giá của bậc cao cấp.

• Ở mức 3.000 lần chạy/ngày: Qwen ≈ $630/ngày; Opus ≈ $1.290/ngày hoặc cao hơn.

• Với đầu vào cache của Qwen ở mức $0.25/1M trong ngữ cảnh ổn định, chi phí chạy của nó giảm xuống còn ≈ $0.07 — rẻ hơn Opus khoảng 6 lần.

Đối trọng trung thực là điều luôn đúng trong các so sánh với Opus: nếu Opus giải quyết một nhiệm vụ chỉ trong một lần thử trong khi một mô hình rẻ hơn cần hai lần thử cộng thêm sự xem xét của con người, thì mô hình rẻ hơn đó thực ra không hề rẻ hơn. Sự dài dòng của Opus một phần chính là cơ chế tạo nên độ tin cậy của nó — nó suy luận thành lời, và điều đó tiêu tốn token. Câu hỏi dành cho khối lượng công việc của bạn là liệu bạn có đang trả tiền cho sự cân nhắc mà bạn thực sự cần hay không. Với các tác vụ suy luận rủi ro cao, khối lượng thấp, có lẽ là có. Với các tác vụ phân tích khối lượng lớn mà bạn xác minh ở các khâu sau dù thế nào đi nữa, có lẽ là không.

Sự cởi mở và câu hỏi về on-premise

Opus 4.8 đã đóng cửa và chỉ dùng qua API, vĩnh viễn. Qwen3.8-Max có thể không như vậy — trọng số được hứa hẹn trong tuần này — nhưng sản phẩm chủ lực không phải là mục tiêu tự lưu trữ thực tế: khoảng 1.2TB ở 4-bit so với khoảng 141GB mỗi H200 nghĩa là cần tám hoặc nhiều bộ tăng tốc cao cấp, và với số lượng tham số hoạt động vẫn chưa được tiết lộ, bạn không thể mô hình hóa thông lượng mà khoản chi đó sẽ mua được. Cũng chưa có văn bản giấy phép, vì vậy khả năng sử dụng thương mại chưa được xác định chính thức.

Được công bố đồng thời, Qwen3.8-27B là bản phát hành thiết thực dành cho các nhóm quan tâm đến khả năng kiểm soát hơn là sức mạnh thô. Cũng được mở trọng số, mô hình này được cho là chạy với khoảng 17GB VRAM — chỉ cần một card đồ họa cao cấp. Nếu bạn đang so sánh với Opus vì cần khả năng suy luận trong mạng nội bộ của mình, 27B là mô hình cần đánh giá; tính mở của flagship 2.4T phần lớn chỉ mang tính lý thuyết.

Câu hỏi thường gặp

Qwen 3.8 có tốt hơn Claude Opus 4.8 không?

Không phải dựa trên bằng chứng hiện có. Opus 4.8 nằm trong nhóm đứng đầu của Chỉ số Trí tuệ Artificial Analysis đã được kiểm toán và được chứng minh về khả năng suy luận tác nhân sâu trong môi trường sản xuất. Qwen3.8-Max có bảng điểm tự công bố mạnh mẽ (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) và một bài kiểm tra tác nhân bên thứ ba thuận lợi, nhưng không có điểm số độc lập. Qwen thắng về giá; Opus thắng về bằng chứng và độ tin cậy suy luận.

Tại sao số benchmark của Opus 4.8 lại được mô tả mơ hồ như vậy?

Vì các tracker thực sự mâu thuẫn với nhau. Trên AA v4.1, Kimi K3 (57.1) được báo cáo ở vị trí ngay trên Opus 4.8, đưa Opus vào cụm dẫn đầu nhưng lại nằm dưới các model dẫn đầu Fable 5 / GPT-5.6 Sol — nhưng các nguồn khác nhau lại báo cáo khác nhau, nên việc trích dẫn một con số cụ thể sẽ gây hiểu lầm. Vị trí tương đối của nó mới là điều đáng tin cậy.

Qwen 3.8 rẻ hơn Claude Opus 4.8 bao nhiêu?

Đáng kể, và khoảng cách ngày càng nới rộng trên các lần chạy dài. Qwen3.8-Max có giá $2 / $6 cho mỗi 1M ở mức cố định, với đầu vào được lưu cache ở mức $0,25. Artificial Analysis ước tính chi phí kết hợp của Opus gần $3,85/1M ở mức nỗ lực tối đa, và Opus được báo cáo là tiêu tốn nhiều token gấp ~4× so với Grok 4.5 — vì vậy khoảng cách giá nhân lên theo khối lượng đầu ra. Trên một lần chạy đa bước điển hình, Qwen rẻ hơn khoảng 2–6× tùy thuộc vào việc sử dụng cache.

Qwen 3.8 Max đã rời khỏi bản xem trước chưa?

Đúng, vào ngày 3 tháng 8 năm 2026. Nó có bảng giá công bố và một endpoint tương thích với OpenAI và DashScope, nên chiến dịch tín dụng Qoder của tháng 7 và cách trình bày giảm 90% không còn mô tả đúng cách thức nó được bán.

Qwen 3.8 có đáng tin cậy cho công việc tác tử AI không?

Những tín hiệu ban đầu đáng khích lệ nhưng còn mỏng manh. Alibaba công bố Terminal-Bench 2.1 đạt 86.6 và OSWorld-Verified đạt 86.1, và trong một bài kiểm tra của bên thứ ba, nó ghi nhận không có cuộc gọi công cụ nào thất bại trong khi đối thủ có đến hai lần. Ngược lại, điểm tự báo cáo thấp nhất của nó là IFBench 82.8 về khả năng làm theo chỉ dẫn, và những người thử nghiệm bản xem trước nhiều lần thấy nó vượt quá phạm vi — một rủi ro thực sự đối với các pipeline phân tích đầu ra của từng bước.

Tôi có thể tự lưu trữ Qwen 3.8 để tránh phí cao cấp của Opus không?

Không phải flagship, thực tế là vậy. Trọng số được hứa hẹn sẽ ra mắt trong tuần nhưng chưa có giấy phép nào được công bố, và với ~1,2TB ở dạng 4-bit, bạn sẽ cần tám GPU loại H200 trở lên. Qwen3.8-27B được công bố cùng thời điểm, theo báo cáo là chiếm ~17GB VRAM, là lựa chọn khả thi. Opus 4.8 là mã nguồn đóng, vì vậy hoàn toàn không có con đường tự lưu trữ nào ở đó.

Tôi nên dùng cái nào hôm nay?

Opus 4.8 dành cho công việc sản xuất đòi hỏi lập luận chính xác hoặc tác nhân AI mà bạn phải có thể tin tưởng, nơi một câu trả lời sai nhiều bước sẽ gây tốn kém. Qwen3.8-Max dành cho công việc ưu tiên độ kỹ lưỡng, nhạy cảm về chi phí — đặc biệt là phân tích ngữ cảnh dài, nơi mức giá phẳng 1M và $0.25 cho đầu vào được lưu trong bộ nhớ đệm khiến chi phí khó có thể tranh cãi.

Kết luận

Qwen 3.8 so với Claude Opus 4.8 vẫn là sự đối lập về triết lý, nhưng khía cạnh kinh tế không còn mang tính giả thuyết. Qwen3.8-Max ra mắt bản GA với mức giá thực tế rẻ hơn hẳn Opus, và khoảng cách này càng nới rộng vì Opus vừa có mức giá cao cấp vừa tiêu tốn nhiều token. Qwen cũng công bố các số liệu về agentic nhắm thẳng vào lĩnh vực sở trường của Opus, và bài kiểm tra agentic bên thứ ba của họ cho thấy khả năng sử dụng công cụ sạch hơn một đối thủ mạnh.

Opus duy trì lợi thế ở đúng nơi nó vốn có: vị thế được kiểm toán trong nhóm dẫn đầu và thành tích vận hành thực tế về suy luận đa bước đáng tin cậy mà không bảng so sánh nào của nhà cung cấp có thể thay thế. Những khoảng trống còn lại của Qwen là những điểm quen thuộc — chưa có điểm số độc lập, chưa công bố số tham số hoạt động, chưa có giấy phép, và điểm yếu tự công bố trong khả năng tuân theo chỉ dẫn — điều quan trọng đúng trong các pipeline tác nhân mà Opus được chọn. Hãy theo dõi hai sự kiện: điểm Intelligence Index độc lập đầu tiên và bộ trọng số được phát hành kèm giấy phép. Cho đến lúc đó, Opus là mô hình bạn tin cậy cho các quyết định quan trọng, còn Qwen 3.8 là mô hình bạn chuyển khối lượng công việc đến — hãy kiểm thử trên chính quy trình của bạn.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube