
Tencent HY4 Preview so với GPT-5.6 Sol: Tuyên bố về khả năng gọi công cụ đặt mô hình mã nguồn mở vào vị trí đối đầu với các mô hình tiên tiến nhất
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Tencent HY4 Preview là mô hình open-weight đầu tiên trong nhiều tháng có bảng công bố ra mắt tuyên bố rõ ràng vượt qua GPT-5.6 Sol. Con số được đề cập là {{1}}Toolathlon-Verified{{/1}}, một chuẩn đánh giá cho khả năng gọi công cụ của agent, trong đó Tencent báo cáo HY4 Preview đạt 74.1 — vượt qua Qwen3.8-Max và, theo so sánh của chính Tencent, vượt qua cả GPT-5.6 Sol. Trên mọi phương diện khác, hai mô hình này không thực sự ngang hàng: GPT-5.6 Sol là mô hình frontier đóng, chủ lực, được đo lường độc lập của {{2}}OpenAI{{/2}}, còn Tencent HY4 Preview là một bản xem trước open-weight {{3}}770 tỷ tham số{{/3}} được phát hành sáng nay với bảng điểm do nhà cung cấp tự báo cáo và không có sự xác minh từ bên thứ ba.
Vậy câu hỏi thú vị không phải là "mô hình nào thông minh hơn" — mà là liệu một đối thủ có trọng số mở với mức giá đầu vào chỉ bằng khoảng một phần sáu so với Sol có thể đáng tin khi tuyên bố chiếm một phần vị trí tiên phong hay không, và một đội ngũ nên làm gì với một tuyên bố hiện chưa thể kiểm chứng được.
Lời khẳng định khiến đây trở thành một cuộc đối đầu thực sự
{{1}}Toolathlon-Verified{{/1}} đo lường độ tin cậy của một mô hình trong việc điều khiển một công cụ xuyên suốt một tác vụ agent hoàn chỉnh — đọc kết quả, quyết định lời gọi kế tiếp, khôi phục sau lỗi — thay vì đo lường khả năng viết một hàm đơn lẻ của nó. Điều này quan trọng vì phần lớn nhất trong chi phí API thực tế cho các mô hình frontier nằm ở các vòng lặp agent, chứ không phải ở các lần hoàn thành một-phát. Con số {{2}}74.1{{/2}} của Tencent trên benchmark đó chính là tuyên bố cụ thể đã đưa {{3}}HY4 Preview{{/3}} vào cuộc trò chuyện của {{4}}GPT-5.6 Sol{{/4}}, và thật đáng để dừng lại suy ngẫm một chút: đó là kiểu con số mà, nếu đứng vững qua tái lập độc lập, sẽ làm cho cuộc bàn luận về chi phí giữa open-weight và closed-frontier trở nên thực chất. Nếu không đứng vững, nó chỉ trở thành thêm một bảng điểm nhà cung cấp và tan biến dưới bộ khung kiểm thử của bên thứ ba.
Hai cách mua trí thông minh

• Tham số — HY4 Preview 770B tổng / 49B hoạt động, trọng số mở so với GPT-5.6 Sol, số tham số không được tiết lộ, API đóng
• Ngữ cảnh — HY4 Preview >1M token so với GPT-5.6 Sol 1.05M token, đầu ra tối đa 128K
• Giá trên 1M — HY4 Preview ¥6 đầu vào / ¥18 đầu ra (≈$0.85 / $2.50) so với GPT-5.6 Sol $4.00 / $20.00 ở mức cơ bản, tăng lên $8.00 / $30.00 cho các yêu cầu ngữ cảnh lớn, đọc cache $0.40
Phương thức nhập liệu — HY4 Preview chỉ hỗ trợ văn bản trong bản xem trước này so với GPT-5.6 Sol hỗ trợ nhập văn bản và hình ảnh
• Chế độ suy luận — HY4 Preview không có phiên bản tương đương được công bố so với chế độ Ultra của GPT-5.6 Sol (hỗ trợ tối đa 16 tác tử song song) và mức nỗ lực suy luận Max
• Xác minh độc lập — HY4 Preview chưa có xác minh nào, còn GPT-5.6 Sol hiện diện trên mọi bảng xếp hạng lớn, với thứ hạng ngữ cảnh 1.05M trong nhóm dẫn đầu các bài kiểm tra tổng hợp ngữ cảnh dài
Cột giá là nơi toàn bộ cuộc so tài được thể hiện. Ở tầng cơ bản, GPT-5.6 Sol có giá $4.00 cho một triệu token đầu vào và $20.00 cho một triệu token đầu ra. Tencent HY4 Preview có giá khoảng $0.85 và $2.50 theo tỷ giá hiện tại. Với khối lượng công việc di chuyển nhiều token đầu ra — như kiểu lập trình tác tử (agentic coding) — mô hình trọng số mở được định giá chỉ bằng khoảng một phần tám so với mô hình đóng, và khoảng cách đó vẫn giữ nguyên ngay cả khi lưu ý rằng các con số của Sol đi kèm với nhiều xác minh đằng sau hơn.
Nơi GPT-5.6 Sol vẫn còn chiếm ưu thế
Xác minh là lợi thế đầu tiên. GPT-5.6 Sol đã được phát hành công khai từ ngày 9 tháng 7 và được đo lường độc lập kể từ đó: 88.8 trên Terminal-Bench 2.1 ở mức suy luận cơ bản, 91.9 ở chế độ Ultra, 53.6 trong Agents' Last Exam (kỷ lục tại thời điểm phát hành), 94.6 trên GPQA Diamond và 64.6 SWE-bench Pro. OpenAI cũng báo cáo mức cải thiện 54% hiệu quả token trong các tác vụ lập trình agentic so với sản phẩm chủ lực trước đây của mình. Đó là những con số bạn có thể tìm thấy được tái hiện bên ngoài tài liệu của chính OpenAI, và đó chính là đặc điểm mà Tencent HY4 Preview đang thiếu hiện nay.
Năng lực là lợi thế thứ hai, và nó mang tính cấu trúc chứ không phải chỉ là sự chênh lệch nhỏ. GPT-5.6 Sol chấp nhận đầu vào hình ảnh; HY4 Preview chỉ hỗ trợ văn bản trong bản xem trước này, khi Tencent thừa nhận rằng khả năng thị giác sẽ phải chờ đến bản phát hành đầy đủ. GPT-5.6 Sol cung cấp chế độ Ultra — một cấu hình đa tác tử phối hợp các tác tử con song song với chi phí token gấp ba đến bốn lần, hữu ích cho chính xác những tác vụ kỹ thuật có tầm nhìn dài hạn — nơi mà hai mô hình này thực sự sẽ cạnh tranh. Và các luồng sử dụng máy tính cũng như gọi công cụ theo chương trình của Sol đều được ghi chép đầy đủ, vận hành ở quy mô sản xuất và đã qua kiểm tra tải. Tuyên bố Toolathlon-Verified của Tencent, nếu được tái lập, sẽ thu hẹp khoảng cách về sử dụng công cụ; nhưng nó không thể lấp đầy các khoảng cách về đa phương thức hay đa tác tử, những điều mà HY4 Preview không hề cố gắng giải quyết.
Nơi mà HY4 Preview thực sự thú vị
Gác màn kịch điểm chuẩn sang một bên, còn lại ba điều thật sự. Thứ nhất, giá cả: ở mức ¥6/¥18 — khoảng $0.85/$2.50 — Tencent đang bán rẻ hơn mọi mô hình tiên phong phương Tây từ bốn đến tám lần về token đầu ra, và rẻ hơn chính các đồng cấp Trung Quốc mở trọng số của mình ở đầu vào. Thứ hai, trọng số mở: một MoE kích hoạt 49B có thể triển khai trên một nút duy nhất theo cách mà kiến trúc chưa được công bố của Sol sẽ không bao giờ làm được, và các trọng số đã có sẵn trên HuggingFace, ModelScope và GitHub. Thứ ba, ngữ cảnh và quỹ đạo kỹ thuật: DeepSWE 64.3 và cửa sổ ngữ cảnh 1M+ nhắm đến cùng các tác vụ tác nhân dài hạn mà chế độ Ultra của Sol hướng tới, với chi phí chỉ bằng một phần nhỏ.
Lời cảnh báo trung thực là không có điều nào trong số này vượt qua được thử nghiệm với một chuẩn đánh giá độc lập. Câu chuyện tự tối ưu hóa mà Tencent kể — mức tăng thông lượng đầu cuối 31,8% nhờ mô hình tự điều chỉnh trên ngăn xếp suy luận của chính nó — chỉ được đo lường nội bộ. Chiến thắng trong thử nghiệm mù trước GLM 5.3 và Kimi K3 cũng do nội bộ thực hiện. Mọi điểm thú vị về HY4 Preview, ở thời điểm hiện tại, mới chỉ là một tuyên bố.
Quyết định
Nếu bạn đang xây dựng một hệ thống sản xuất ngay hôm nay, GPT-5.6 Sol là lựa chọn hợp lý, và nó có thể truy cập được qua OrcaRouter với mức giá niêm yết theo bậc của chính OpenAI — $4.00/$20.00 ở bậc cơ sở, $8.00/$30.00 ở bậc trên, chuyển qua mà không có bất kỳ khoản phụ phí nào, vì vậy mọi thay đổi giá từ nhà cung cấp sẽ được phản ánh trực tiếp phía chúng tôi ngay trong cùng ngày. Nếu quy trình làm việc của bạn mang tính agentic và nặng về công cụ, cấu trúc phân bậc có nghĩa là bạn nên kiểm tra kích thước đầu vào thực tế của mình so với ngưỡng 272K token thay vì giả định một mức giá cố định.
{{1}}Nếu bạn sẵn sàng chạy một bài đánh giá song song, HY4 Preview đủ rẻ để đáng thử nghiệm thực sự: hãy định tuyến khối lượng công việc gọi công cụ của bạn qua Sol ngay hôm nay, chạy cùng các prompt đó với HY4 Preview thông qua API của chính Tencent, và so sánh trên các tác vụ kiểu Toolathlon của riêng bạn.{{/1}} {{2}}Và nếu điểm số độc lập đạt đúng như Tencent tuyên bố, lộ trình chuyển đổi rất ngắn — mô hình trọng số mở được gắn vào bộ định tuyến và quy tắc dự phòng của bạn hoán đổi endpoint, với mức giá ¥6/¥18 của nhà cung cấp được giữ nguyên vẹn.{{/2}} {{3}}Đó chính là cấu trúc trung thực của cuộc so tài này: một mô hình tiên phong đã được xác minh mà bạn có thể xây dựng dựa trên ngay hôm nay, đối đầu với một thách thức mở chưa được xác minh, đủ rẻ để thử nghiệm và được định vị để khiến cuộc thảo luận về giá xoay quanh toàn bộ lớp mô hình trọng số mở.{{/3}}


Xem gì
• Bản tái lập độc lập đầu tiên của Toolathlon-Verified. Nếu một bộ kiểm thử bên thứ ba xác nhận HY4 Preview đạt điểm trong khoảng 70, lập luận "open weights không thể sử dụng công cụ dạng tác nhân" sẽ sụp đổ.
• Liệu Tencent có phát hành khả năng thị giác trước khi ra mắt bản đầy đủ của Hy4 hay không. Chế độ chỉ hỗ trợ văn bản giới hạn HY4 Preview ở một tập con nghiêm ngặt trong số các khối lượng công việc mà GPT-5.6 Sol xử lý.
• Hóa đơn token thực tế từ xu hướng suy nghĩ kéo dài của HY4 Preview. Với mức ¥18 cho mỗi triệu token đầu ra, việc tự xác minh lan man sẽ ăn mòn lợi thế giá nhanh hơn so với mẫu $20.
• Liệu giá phân tầng của Sol có được cắt giảm thêm lần nữa trước khi Hy4 ra mắt chính thức hay không. Việc chuyển tiếp qua router khiến mức giảm được hiển thị ngay trong cùng ngày.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
