
Tencent HY4 Preview vs Qwen3.8-Max: Cuộc so tài mô hình mở tháng Tám
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Tencent HY4 Preview so với Qwen3.8-Max là cuộc chạm trán mà tháng này đang dồn tới. Qwen3.8-Max của Alibaba đã được phát hành rộng rãi vào ngày 3 tháng 8 và trở thành Qwen cấp Max đầu tiên có trọng số mở vào ngày 12 tháng 8; Tencent HY4 Preview ra mắt sáng nay, muộn hơn 25 ngày, với bảng công bố ra mắt nêu thẳng tên Qwen3.8-Max — Tencent báo cáo HY4 Preview đạt 74,1 trên Toolathlon-Verified, vượt qua Qwen3.8-Max trên điểm chuẩn đó. Cả hai đều là những flagship mã nguồn mở của Trung Quốc, cả hai đều được định giá để bán chạy, và chỉ một trong hai có điểm số độc lập.
Hai mô hình này cách xa nhau không chỉ ở quy mô — Qwen3.8-Max có 2,4 nghìn tỷ tham số so với 770 tỷ của HY4 Preview — nhưng ở các benchmark tác nhân quan trọng đối với người mua, chúng đang nhắm tới cùng một mục tiêu: các tác vụ tầm xa, nơi mô hình đọc, gọi công cụ và lặp lại mà không cần con người can thiệp. Đó chính xác là lĩnh vực mà thế hệ mô hình open-weight tháng 8 đang cố gắng chứng minh rằng chúng có thể thay thế các mô hình frontier đóng, và bước đi đầu tiên của Tencent là nhắm thẳng vào bản phát hành mã nguồn mở lớn nhất tháng này.
Bảng tỷ số

• Quy mô — HY4 Preview 770B tổng / 49B hoạt động so với Qwen3.8-Max 2.4T tổng / ~95B hoạt động
• Ngữ cảnh — HY4 Preview >1M token so với Qwen3.8-Max 1M token trên API (262K gốc trong open weights, có thể mở rộng lên ~1.01M)
• Giá mỗi 1M — HY4 Preview ¥6 đầu vào / ¥18 đầu ra (≈$0.85 / $2.50) so với Qwen3.8-Max $2.00 đầu vào / $6.00 đầu ra, đọc cache $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (do nhà cung cấp báo cáo) so với Qwen3.8-Max 86.6
• Phương thức — cả hai dạng mở đều chỉ hỗ trợ văn bản; API Qwen3.8-Max bổ sung đầu vào hình ảnh và video, còn bản xem trước HY4 Preview thì không.
• Điểm độc lập — HY4 Preview none so với Qwen3.8-Max: Chỉ số Thông minh AA 58, Chỉ số Tác nhân 58
Hai tấm thẻ kể cùng một câu chuyện từ hai phía đối lập. Trên Terminal-Bench 2.1, điểm 86.6 của Qwen3.8-Max và 85.4 của HY4 Preview chỉ cách nhau một điểm rưỡi — một điểm nghiêng về phía Qwen, và con số của HY4 chưa được kiểm toán. Về giá, HY4 Preview rẻ hơn trên cả đầu vào lẫn đầu ra cho mỗi token. Về xác minh, Qwen3.8-Max có Chỉ số Trí tuệ (Intelligence Index) độc lập là 58 và Chỉ số Tác nhân (Agentic Index) là 58; HY4 Preview không có gì ngoài sự tự quảng bá của mình. Sự chênh lệch này là khuôn mẫu kinh điển của một kẻ thách thức có mức giá tốt hơn và những tuyên bố chưa được kiểm chứng đối đầu với một nhà đương nhiệm đã được xác minh.
Đọc tuyên bố của Toolathlon.
Toolathlon-Verified đo lường độ tin cậy trong việc sử dụng công cụ của agent — mức độ nhất quán mà một mô hình dẫn dắt một công cụ xuyên suốt một tác vụ hoàn chỉnh với các lỗi phát sinh, khả năng phục hồi và các lệnh gọi đa bước. Con số 74.1 của Tencent nhắm thẳng vào điểm mạnh nhất trong hồ sơ năng lực của Qwen3.8-Max, vì Chỉ số Agentic 58 của Qwen và OSWorld-Verified 86.1 chính là những con số khiến lời quảng bá agentic của Alibaba trở nên đáng tin cậy. Qwen3.8-Max cũng đạt 82.8 trên IFBench (khả năng tuân theo chỉ dẫn) và 93.0 trên PaperBench (công việc agentic cấp nghiên cứu), cả hai đều vượt qua các mô hình như GPT-5.6 Sol ngay trên bảng xếp hạng của chính nhà cung cấp. Vậy nên Tencent đã chọn đúng benchmark duy nhất mà họ tuyên bố thắng trực tiếp mô hình mã nguồn mở lớn nhất tháng này — và tuyên bố đó hiện có thể kiểm chứng ngang bằng với bất kỳ dòng dữ liệu đơn lẻ nào khác từ nhà cung cấp: hoàn toàn không thể.
Đã xác minh so với báo cáo của nhà cung cấp
Đây là trục mà cuộc đối đầu kém công bằng nhất, và sự bất đối xứng này đáng được nói rõ. Chỉ số Intelligence Index 58 của Qwen3.8-Max đến từ Artificial Analysis, chỉ số Agentic Index 58 của nó cũng đến từ Artificial Analysis, và chính các bộ kiểm thử độc lập đã cho nó những điểm số đó cũng đo được điểm yếu của nó: tỷ lệ ảo giác 40% trên AA-Omniscience, tăng từ 23% so với thế hệ trước, và 64 lượt tác nhân mỗi tác vụ — một con số khổng lồ. Mô hình hoạt động rất chăm chỉ, và bạn phải trả tiền cho từng lượt. Tencent HY4 Preview không có bất kỳ công cụ đo lường nào như vậy. Điểm mạnh của nó chỉ là những tuyên bố, còn các kiểu thất bại — chính Tencent cũng nêu rõ suy nghĩ kéo dài và tự kiểm chứng quá mức — là những lời thừa nhận, không phải những phép đo.
Đối với một nhóm đang cân nhắc giữa hai lựa chọn, khoảng cách về khâu xác minh không phải là điều trừu tượng. Hành vi 64 lượt xử lý mỗi tác vụ của Qwen3.8-Max là một yếu tố chi phí thực tế, đã được đo lường: ở mức $2/$6, đây vẫn là tác nhân đắt nhất trên mỗi tác vụ hoàn thành trong một số so sánh của bên thứ ba, và các nhóm đã báo cáo rằng số lượt xử lý này đang ăn mòn lợi thế giá của nó. Hành vi tương đương của HY4 Preview vẫn chưa được biết — nó có thể rẻ hơn trên mỗi tác vụ so với mức giá trên mỗi token vốn đã thấp của nó, hoặc thói quen tự xác minh của nó có thể nuốt chửng phần chênh lệch. Chưa ai có thể cho bạn biết điều đó, vì chưa có ai ngoài Tencent chạy thử nó.
Giá cả và các khía cạnh thực tế của trọng số mở
Mỗi token, HY4 Preview rẻ hơn ở cả hai phía của bảng giá: {{1}}¥6/¥18 so với $2,00/$6,00 của Qwen3.8-Max{{/1}}, và cache hits ở mức {{2}}¥0,3 so với $0,25{{/2}}. Điều đó khiến HY4 Preview trở thành flagship open-weight rẻ nhất trên cả đầu vào lẫn đầu ra, không bàn cãi. Nhưng "open weights" đi kèm với hai bộ điều khoản khác nhau. Bản phát hành open-weights của Qwen3.8-Max — tức {{3}}Qwen3.8-2.4T-A95B{{/3}} — chỉ hỗ trợ văn bản, buộc bật chế độ suy luận, ngữ cảnh gốc là {{4}}262K{{/4}} thay vì {{5}}1M{{/5}} như trên API, và có giấy phép tùy chỉnh với các điều kiện theo quy mô: yêu cầu {{6}}hiển thị tên mô hình{{/6}} khi có trên 100 triệu người dùng hàng tháng, cùng giấy phép riêng cho các doanh nghiệp {{7}}Model-as-a-Service{{/7}} lớn. Trọng số của Tencent HY4 Preview đã có mặt trên HuggingFace, ModelScope và GitHub từ sáng nay, nhưng các điều khoản giấy phép chính xác và việc trọng số có khớp với API đang phục vụ hay không vẫn chưa được công bố với mức độ minh bạch tương tự. Cả hai mô hình đều có thể tải về; nhưng không mô hình nào là dễ triển khai ngay lập tức.
Điểm mấu chốt
Qwen3.8-Max là lựa chọn an toàn hơn ở mọi khía cạnh mà kiểm chứng mang lại sự an toàn: được chấm điểm độc lập về trí thông minh và năng lực tác nhân, các kiểu lỗi đã biết, giấy phép ổn định, và ba tuần phản hồi từ môi trường sản xuất. Nó cũng là lựa chọn đắt hơn trên mỗi token, và hành vi tiêu thụ nhiều lượt (turn-heavy) được đo đạc của nó là một rủi ro chi phí đã biết. Tencent HY4 Preview là lựa chọn đáng giá: rẻ hơn cả đầu vào lẫn đầu ra, tuyên bố kết quả Terminal-Bench tương đương, và một tuyên bố Toolathlon-Verified trực tiếp so với Qwen — tất cả đều chưa được kiểm chứng ngay trong ngày đầu. Nếu bạn đang đưa một mô hình open-weight vào sản xuất trong tuần này, Qwen3.8-Max là lựa chọn có cơ sở vững chắc và nó hiện đang hoạt động trên OrcaRouter với giá niêm yết của Alibaba — $2.00/$6.00, chuyển qua trực tiếp, không tăng giá. HY4 Preview là dự án đánh giá: hãy chạy nó qua API của chính Tencent với các tác vụ kiểu Toolathlon của riêng bạn, giữ luồng sản xuất trên mô hình đã kiểm chứng, và khi điểm số độc lập được công bố — hoặc khi HY4 Preview có mặt trên một router và mức giá ¥6/¥18 của nó trở thành mức chuyển qua ngay trong cùng ngày — việc hoán đổi chỉ là một quy tắc định tuyến, không phải là viết lại.


Xem gì
• Lần chạy độc lập đầu tiên của HY4 Preview trên một bộ khung tác nhân. Toolathlon-Verified 74.1 là con số Tencent muốn đạt được; một Agentic Index từ bên thứ ba sẽ là sự xác nhận.
• Số lượt đo được của HY4 Preview. Việc Qwen3.8-Max cần 64 lượt mỗi tác vụ là bài học cảnh báo; liệu HY4 Preview có rẻ hơn trên mỗi tác vụ hoàn thành hay không chính là toàn bộ lập luận kinh tế.
• Các điều khoản cấp phép trên các trọng số. Chúng sẽ quyết định liệu "mở" có nghĩa là "sử dụng được ở quy mô của bạn" đối với HY4 Preview, giống như các điều kiện của Giấy phép Qwen3.8-Max đã áp dụng cho mô hình của Alibaba.
• Liệu một trong hai nhà cung cấp có cắt giảm giá lần nữa không. Trong một tháng mà hai flagship open-weight ra mắt với mức giá cạnh tranh mạnh, mức chuyển giá trên router khiến bất kỳ đợt cắt giảm nào tiếp theo cũng hiện rõ ngay trong ngày.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
