
Tencent HY4 Preview vs tencent-hy3: Giá gấp sáu lần, và bước nhảy vọt đó thực sự mang lại điều gì
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0259Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0258Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0166Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
Tencent HY4 Preview là mô hình đầu tiên trong dòng Hunyuan khiến phiên bản tiền nhiệm của chính mình trông rẻ tiền một cách có chủ đích: Tencent niêm yết mức giá đầu vào gấp sáu lần và giá đầu ra gấp bốn lần rưỡi so với tencent-hy3, đồng thời tài liệu ra mắt khẳng định mức phí cao hơn đó là hoàn toàn xứng đáng. Được phát hành và mở mã nguồn vào ngày 28 tháng 8 năm 2026, Tencent HY4 Preview báo cáo điểm kỹ thuật phần mềm trên DeepSWE cao hơn gấp đôi mức 28.0 của Hy3, đạt 85.4 trong bài đánh giá điều khiển thiết bị đầu cuối Terminal-Bench 2.1, cùng cửa sổ ngữ cảnh tăng từ 256K lên hơn một triệu token. tencent-hy3, chính thức ra mắt vào ngày 6 tháng 7, là con ngựa thồ dày dạn của dòng sản phẩm — 295B tổng tham số, 21B tham số hoạt động, chỉ bằng một phần tư cửa sổ ngữ cảnh, và mức giá gần như chỉ là số làm tròn. Đây không phải cuộc so tài mà bảng thông số kỹ thuật để ngỏ kết quả. Câu hỏi đặt ra là liệu khoảng cách đó có đáng số tiền bỏ ra cho những gì bạn thực sự chạy hay không, và câu trả lời phụ thuộc vào loại khối lượng công việc.
Bảng điểm: nơi mà hai bên thực sự khác biệt
Mọi benchmark trong tài liệu của Tencent đều do hãng tự báo cáo — chạy trên hệ thống đánh giá riêng của Tencent tại thời điểm ra mắt từng mô hình, chưa được phòng thí nghiệm độc lập nào tái kiểm chứng, và với mô hình chủ lực, mô hình mới được công khai chưa đầy một ngày. Hãy coi điểm số là mức trần mà Tencent tin mình đạt được, và coi trọng xu hướng tổng thể hơn bất kỳ con số đơn lẻ nào. Xu hướng này là không thể nhầm lẫn, và nó tập trung vào công việc kỹ thuật agentic hơn là kiến thức tổng quát:
DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Đây là bước nhảy đơn lẻ lớn nhất trong cặp so sánh này, với mức tăng hơn gấp đôi trên một điểm chuẩn kỹ thuật phần mềm ở quy mô toàn kho lưu trữ, và đó chính là con số tạo ra sự khác biệt giữa một mô hình trò chuyện và một mô hình mà bạn có thể giao cả một kho mã nguồn.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, theo Tencent là ngang với Claude Opus 5 và vượt qua DeepSeek V4 Pro. tencent-hy3: 71.7 theo như công bố khi ra mắt vào tháng 7. Điều khiển một terminal thực tế để hoàn tất các tác vụ đa bước chính là loại công việc tầm xa mà Hy3 yếu nhất.
• Toolathlon-Verified — Bản xem trước Tencent HY4: 74.1, mà Tencent cho biết vượt qua Qwen 3.8 Max và GPT-5.6 Sol. Không có con số Hy3 tương đương nào được công bố.
• Thử nghiệm mù nội bộ — 163 chuyên gia đã chấm điểm 203 nhiệm vụ kỹ thuật với 2.99/4.00 cho Tencent HY4 Preview, nhỉnh hơn 2.92 của GLM-5.3 và 2.94 của Kimi K3. Đây là các nhà đánh giá của Tencent chấm trên chính các nhiệm vụ của Tencent; hãy coi đây chỉ mang tính định hướng.

Sợi chỉ xuyên suốt: những kết quả đạt được nằm ở việc điều khiển terminal, gọi công cụ và các tác vụ quy mô kho lưu trữ — định vị năng suất mà Tencent đã theo đuổi từ Hy3, giờ đây đã có sức mạnh tính toán để hỗ trợ.
Phần bù giá, từng dòng một
Đến đây, sự so sánh không còn chỉ là chuyện khoe khoang. Giá niêm yết của Tencent, tính trên một triệu token:
Tencent HY4 Preview: 6 nhân dân tệ (~0,85 USD). tencent-hy3: 1 nhân dân tệ (~0,14 USD). Gấp sáu lần.
• Output — Tencent HY4 Preview: 18 yuan (~US$2,50). tencent-hy3: 4 yuan (~US$0,56). Gấp 4,5 lần.
• Cache hit — Tencent HY4 Preview: 0.3 yuan. tencent-hy3: 0.25 yuan. Gần như giống nhau, điều này quan trọng hơn so với vẻ ngoài, bởi vì các vòng lặp agent (agentic loops) liên tục gửi lại cùng một system prompt và phần đầu hội thoại (conversation prefix).
Chạy một khối lượng công việc agentic-coding thực tế qua con số pha trộn — chẳng hạn 20 triệu token đầu vào và 4 triệu token đầu ra trong một tháng, một ngân sách agent dành cho nhà phát triển đơn lẻ bận rộn. Tencent HY4 Preview: 120 yuan cộng 72 yuan, khoảng 192 yuan (~27 đô la Mỹ). tencent-hy3: 20 yuan cộng 16 yuan, khoảng 36 yuan (~5 đô la Mỹ). Mẫu hàng đầu tốn chi phí gấp năm lần trở lên để chạy với cùng một hỗn hợp token — và nó sẽ yêu cầu nhiều token đầu ra hơn cho mỗi nhiệm vụ, vì nó suy nghĩ lâu hơn.
Đó không phải là lý do để tránh Tencent HY4 Preview; bước nhảy vọt DeepSWE chính là loại năng lực mà người ta mua bản premium để có. Đó là lý do để định giá khối lượng công việc trước khi bạn định tuyến nó. Và đó cũng chính là nơi tầng định tuyến chứng tỏ giá trị của mình: tencent-hy3 đã có mặt trên OrcaRouter với giá niêm yết của nhà cung cấp — chênh lệch 0%, nghĩa là con số bạn thấy chính là giá gốc của nhà cung cấp phục vụ, chứ không phải phiên bản bán lại bị độn giá — kèm theo tính năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, và khi nhà cung cấp thay đổi giá, phía chúng tôi sẽ áp dụng ngay trong cùng ngày.
Gấp bốn lần ngữ cảnh, gấp đôi tính toán chủ động
• Kiến trúc — Bản xem trước Tencent HY4: 770B tổng tham số, 49B tham số kích hoạt MoE. tencent-hy3: 295B tổng, 21B kích hoạt. Mô hình chủ lực dành lượng tính toán gấp khoảng 2,3 lần cho mỗi token.
• Cửa sổ ngữ cảnh — Tencent HY4 Preview: hơn 1 triệu token. tencent-hy3: 256K. Cả một kho mã nguồn hoặc một loạt tài liệu tài chính có thể nằm gọn trong cửa sổ của phiên bản flagship dưới dạng một yêu cầu duy nhất; trên Hy3, công việc tương tự cần phải chia nhỏ, truy xuất hoặc dùng vòng lặp tác nhân.
• Kiểm soát lập luận — tencent-hy3 cung cấp cài đặt reasoning_effort theo từng yêu cầu (no_think, low, high) cùng với lớp giải mã suy đoán (speculative-decoding) giúp duy trì tốc độ. Tencent HY4 Preview, theo chính Tencent thừa nhận, có xu hướng suy nghĩ lâu trước khi đưa ra kết quả đầu tiên và tự kiểm tra quá mức đối với các tác vụ phức tạp — đốt token để rà soát lại công việc đã hoàn thành.
Dòng cuối đó chính là điểm khác biệt ngầm quan trọng đối với các ứng dụng nhạy cảm về độ trễ. Hy3 có thể được yêu cầu trả lời trực tiếp; Tencent HY4 Preview, ít nhất ở dạng ban đầu này, thường không thể không suy nghĩ. Đối với một phiên trò chuyện độ trễ thấp hoặc một đường ống trích xuất thông lượng cao, năng lực vượt trội của mẫu chủ lực bị lãng phí và việc suy nghĩ thêm chính là một khoản thuế. Còn đối với một công việc kỹ thuật xử lý hàng loạt ngoại tuyến, khoản thuế đó chính là thứ mang lại câu trả lời tốt hơn.
Thuế xem trước: những gì Hy3 vẫn còn
"Preview" nằm ngay trong tên của Tencent HY4 Preview và nó hoạt động đúng như vậy. Không có đầu vào thị giác hay đa phương thức — mô hình chỉ hỗ trợ văn bản, nên mọi thứ liên quan đến hình ảnh hoặc video vẫn dựa trên mô hình bạn đang dùng cho mục đích đó. Bản dùng thử miễn phí hai tuần trên WorkBuddy và CodeBuddy chỉ là một lời mời nếm thử, không phải một gói dịch vụ. Tencent đã nói rõ rằng đây là phiên bản đầu tiên của Hy4, với các cải tiến tiền huấn luyện và hậu huấn luyện vẫn còn ở phía trước, theo nhịp độ đã cho ra một phiên bản lớn khoảng hai tháng một lần kể từ tháng Hai. Điểm chuẩn độc lập cho mẫu chủ lực: vẫn chưa có, ở bất kỳ đâu.
tencent-hy3 hoàn toàn trái ngược với tất cả những điều đó. Đây là bản phát hành chính thức, ổn định, đã được vận hành trong sản xuất từ tháng 7. Gói miễn phí của nó kéo dài đến ngày 30 tháng 9. Các mức suy luận của nó cho bạn một núm điều chỉnh thay vì một tính khí thất thường, và lớp giải mã phỏng đoán cùng 21B tham số kích hoạt khiến nó trở thành nửa rẻ, nhanh, dễ đoán của gia đình này — mẫu mà bạn trỏ vào đường dẫn mặc định rồi quên đi.

Ai nên chọn cái nào
Hãy chọn Tencent HY4 Preview khi nhiệm vụ là trọng tâm — một bài toán kỹ thuật phần mềm khó nhằn, một bối cảnh quy mô kho mã nguồn, một quy trình tác nhân nơi câu trả lời tốt hơn xứng đáng với chi phí token gấp năm lần và bạn có thể chịu được độ trễ của một mô hình biết suy nghĩ trước khi đáp lời. Hãy chọn tencent-hy3 khi ràng buộc là yếu tố quyết định — thông lượng cao, độ trễ thấp, ngân sách eo hẹp, hoặc bất kỳ tác vụ nào bạn muốn mô hình trả lời thay vì cân nhắc.
Mẫu thực tiễn cho việc ghép cặp như vậy là leo thang: định tuyến mô hình rẻ, dễ kiểm soát trên đường dẫn mặc định và chỉ chuyển lên mô hình chủ lực khi nhiệm vụ yêu cầu. Đó là mục đích của DSL định tuyến của OrcaRouter — kết hợp nhiều mô hình thành một lệnh gọi để chính sách là cấu hình thay vì mã — và tự động chuyển đổi dự phòng có nghĩa là đường dẫn của Hy3 vẫn tiếp tục phục vụ ngay cả khi một nhà cung cấp suy giảm. OrcaRouter hiện chưa định tuyến Tencent HY4 Preview; Tencent chưa mở mô hình cho bên thứ ba suy luận, nên hiện tại nó chạy trên điểm cuối Tencent Cloud TokenHub của nhà cung cấp và trên các triển khai tự lưu trữ của trọng số mở. Trong khi đó, tencent-hy3 đã có mặt trong danh mục hôm nay với giá niêm yết của nhà cung cấp — và ngay ngày mô hình chủ lực được mở, nó sẽ được đưa vào cùng lớp định tuyến theo cùng cách, biến việc chuyển đổi từ mô hình này sang mô hình khác thành một thay đổi một dòng thay vì viết lại.

Kết luận nhàm chán theo cách tốt nhất có thể: bản cao cấp xứng đáng với mức giá chênh lệch cho đúng việc mà nó được định giá để làm, và bản tiêu chuẩn vẫn là lựa chọn đúng cho mọi việc chỉ cần được hoàn thành. Chênh lệch giá gấp sáu lần là có thật, chênh lệch DeepSWE từ 28 lên 64 là có thật, và không chênh lệch nào triệt tiêu chênh lệch kia — bạn chỉ cần biết mình đang mua loại nào.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
