Một thẻ tiêu đề chính cho sự so sánh 'Tencent HY4 Preview vs GPT-5.6 Sol'. Điểm nhấn trung tâm ghi 'Toolathlon-Verified 74.1 – tuyên bố trọng số mở đối đầu với biên giới', kèm chú thích 'Tencent báo cáo mô hình của họ vượt trội hơn GPT-5.6 Sol về khả năng gọi công cụ tác tử'. Thẻ bên trái 'Tencent HY4 Preview' liệt kê 'Trọng số mở, 770B / 49B hoạt động', '¥6 / ¥18 mỗi 1M', 'Không có điểm số độc lập'. Thẻ bên phải 'GPT-5.6 Sol' liệt kê 'API đóng, sản phẩm chủ lực của OpenAI', '$4 / $20 giá cơ sở mỗi 1M', 'Terminal-Bench 2.1: 88.8'. Chân trang ghi 'Số liệu HY4 Preview do nhà cung cấp báo cáo; số liệu Sol được tái lập rộng rãi.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Tencent HY4 Preview so với GPT-5.6 Sol: Tuyên bố về khả năng gọi công cụ đặt mô hình mã nguồn mở vào vị trí đối đầu với các mô hình tiên tiến nhất

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tencent HY4 Preview là mô hình open-weight đầu tiên trong nhiều tháng có bảng công bố ra mắt tuyên bố rõ ràng vượt qua GPT-5.6 Sol. Con số được đề cập là {{1}}Toolathlon-Verified{{/1}}, một chuẩn đánh giá cho khả năng gọi công cụ của agent, trong đó Tencent báo cáo HY4 Preview đạt 74.1 — vượt qua Qwen3.8-Max và, theo so sánh của chính Tencent, vượt qua cả GPT-5.6 Sol. Trên mọi phương diện khác, hai mô hình này không thực sự ngang hàng: GPT-5.6 Sol là mô hình frontier đóng, chủ lực, được đo lường độc lập của {{2}}Ope​nAI{{/2}}, còn Tencent HY4 Preview là một bản xem trước open-weight {{3}}770 tỷ tham số{{/3}} được phát hành sáng nay với bảng điểm do nhà cung cấp tự báo cáo và không có sự xác minh từ bên thứ ba.

Vậy câu hỏi thú vị không phải là "mô hình nào thông minh hơn" — mà là liệu một đối thủ có trọng số mở với mức giá đầu vào chỉ bằng khoảng một phần sáu so với Sol có thể đáng tin khi tuyên bố chiếm một phần vị trí tiên phong hay không, và một đội ngũ nên làm gì với một tuyên bố hiện chưa thể kiểm chứng được.

Lời khẳng định khiến đây trở thành một cuộc đối đầu thực sự

{{1}}Toolathlon-Verified{{/1}} đo lường độ tin cậy của một mô hình trong việc điều khiển một công cụ xuyên suốt một tác vụ agent hoàn chỉnh — đọc kết quả, quyết định lời gọi kế tiếp, khôi phục sau lỗi — thay vì đo lường khả năng viết một hàm đơn lẻ của nó. Điều này quan trọng vì phần lớn nhất trong chi phí API thực tế cho các mô hình frontier nằm ở các vòng lặp agent, chứ không phải ở các lần hoàn thành một-phát. Con số {{2}}74.1{{/2}} của Tencent trên benchmark đó chính là tuyên bố cụ thể đã đưa {{3}}HY4 Preview{{/3}} vào cuộc trò chuyện của {{4}}GPT-5.6 Sol{{/4}}, và thật đáng để dừng lại suy ngẫm một chút: đó là kiểu con số mà, nếu đứng vững qua tái lập độc lập, sẽ làm cho cuộc bàn luận về chi phí giữa open-weight và closed-frontier trở nên thực chất. Nếu không đứng vững, nó chỉ trở thành thêm một bảng điểm nhà cung cấp và tan biến dưới bộ khung kiểm thử của bên thứ ba.

Hai cách mua trí thông minh

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Tham số — HY4 Preview 770B tổng / 49B hoạt động, trọng số mở so với GPT-5.6 Sol, số tham số không được tiết lộ, API đóng

• Ngữ cảnh — HY4 Preview >1M token so với GPT-5.6 Sol 1.05M token, đầu ra tối đa 128K

• Giá trên 1M — HY4 Preview ¥6 đầu vào / ¥18 đầu ra (≈$0.85 / $2.50) so với GPT-5.6 Sol $4.00 / $20.00 ở mức cơ bản, tăng lên $8.00 / $30.00 cho các yêu cầu ngữ cảnh lớn, đọc cache $0.40

Phương thức nhập liệu — HY4 Preview chỉ hỗ trợ văn bản trong bản xem trước này so với GPT-5.6 Sol hỗ trợ nhập văn bản và hình ảnh

• Chế độ suy luận — HY4 Preview không có phiên bản tương đương được công bố so với chế độ Ultra của GPT-5.6 Sol (hỗ trợ tối đa 16 tác tử song song) và mức nỗ lực suy luận Max

• Xác minh độc lập — HY4 Preview chưa có xác minh nào, còn GPT-5.6 Sol hiện diện trên mọi bảng xếp hạng lớn, với thứ hạng ngữ cảnh 1.05M trong nhóm dẫn đầu các bài kiểm tra tổng hợp ngữ cảnh dài

Cột giá là nơi toàn bộ cuộc so tài được thể hiện. Ở tầng cơ bản, GPT-5.6 Sol có giá $4.00 cho một triệu token đầu vào và $20.00 cho một triệu token đầu ra. Tencent HY4 Preview có giá khoảng $0.85 và $2.50 theo tỷ giá hiện tại. Với khối lượng công việc di chuyển nhiều token đầu ra — như kiểu lập trình tác tử (agentic coding) — mô hình trọng số mở được định giá chỉ bằng khoảng một phần tám so với mô hình đóng, và khoảng cách đó vẫn giữ nguyên ngay cả khi lưu ý rằng các con số của Sol đi kèm với nhiều xác minh đằng sau hơn.

Nơi GPT-5.6 Sol vẫn còn chiếm ưu thế

Xác minh là lợi thế đầu tiên. GPT-5.6 Sol đã được phát hành công khai từ ngày 9 tháng 7 và được đo lường độc lập kể từ đó: 88.8 trên Terminal-Bench 2.1 ở mức suy luận cơ bản, 91.9 ở chế độ Ultra, 53.6 trong Agents' Last Exam (kỷ lục tại thời điểm phát hành), 94.6 trên GPQA Diamond và 64.6 SWE-bench Pro. Ope​nAI cũng báo cáo mức cải thiện 54% hiệu quả token trong các tác vụ lập trình agentic so với sản phẩm chủ lực trước đây của mình. Đó là những con số bạn có thể tìm thấy được tái hiện bên ngoài tài liệu của chính Ope​nAI, và đó chính là đặc điểm mà Tencent HY4 Preview đang thiếu hiện nay.

Năng lực là lợi thế thứ hai, và nó mang tính cấu trúc chứ không phải chỉ là sự chênh lệch nhỏ. GPT-5.6 Sol chấp nhận đầu vào hình ảnh; HY4 Preview chỉ hỗ trợ văn bản trong bản xem trước này, khi Tencent thừa nhận rằng khả năng thị giác sẽ phải chờ đến bản phát hành đầy đủ. GPT-5.6 Sol cung cấp chế độ Ultra — một cấu hình đa tác tử phối hợp các tác tử con song song với chi phí token gấp ba đến bốn lần, hữu ích cho chính xác những tác vụ kỹ thuật có tầm nhìn dài hạn — nơi mà hai mô hình này thực sự sẽ cạnh tranh. Và các luồng sử dụng máy tính cũng như gọi công cụ theo chương trình của Sol đều được ghi chép đầy đủ, vận hành ở quy mô sản xuất và đã qua kiểm tra tải. Tuyên bố Toolathlon-Verified của Tencent, nếu được tái lập, sẽ thu hẹp khoảng cách về sử dụng công cụ; nhưng nó không thể lấp đầy các khoảng cách về đa phương thức hay đa tác tử, những điều mà HY4 Preview không hề cố gắng giải quyết.

Nơi mà HY4 Preview thực sự thú vị

Gác màn kịch điểm chuẩn sang một bên, còn lại ba điều thật sự. Thứ nhất, giá cả: ở mức ¥6/¥18 — khoảng $0.85/$2.50 — Tencent đang bán rẻ hơn mọi mô hình tiên phong phương Tây từ bốn đến tám lần về token đầu ra, và rẻ hơn chính các đồng cấp Trung Quốc mở trọng số của mình ở đầu vào. Thứ hai, trọng số mở: một MoE kích hoạt 49B có thể triển khai trên một nút duy nhất theo cách mà kiến trúc chưa được công bố của Sol sẽ không bao giờ làm được, và các trọng số đã có sẵn trên HuggingFace, ModelScope và GitHub. Thứ ba, ngữ cảnh và quỹ đạo kỹ thuật: DeepSWE 64.3 và cửa sổ ngữ cảnh 1M+ nhắm đến cùng các tác vụ tác nhân dài hạn mà chế độ Ultra của Sol hướng tới, với chi phí chỉ bằng một phần nhỏ.

Lời cảnh báo trung thực là không có điều nào trong số này vượt qua được thử nghiệm với một chuẩn đánh giá độc lập. Câu chuyện tự tối ưu hóa mà Tencent kể — mức tăng thông lượng đầu cuối 31,8% nhờ mô hình tự điều chỉnh trên ngăn xếp suy luận của chính nó — chỉ được đo lường nội bộ. Chiến thắng trong thử nghiệm mù trước GLM 5.3Kimi K3 cũng do nội bộ thực hiện. Mọi điểm thú vị về HY4 Preview, ở thời điểm hiện tại, mới chỉ là một tuyên bố.

Quyết định

Nếu bạn đang xây dựng một hệ thống sản xuất ngay hôm nay, GPT-5.6 Sol là lựa chọn hợp lý, và nó có thể truy cập được qua OrcaRouter với mức giá niêm yết theo bậc của chính Ope​nAI — $4.00/$20.00 ở bậc cơ sở, $8.00/$30.00 ở bậc trên, chuyển qua mà không có bất kỳ khoản phụ phí nào, vì vậy mọi thay đổi giá từ nhà cung cấp sẽ được phản ánh trực tiếp phía chúng tôi ngay trong cùng ngày. Nếu quy trình làm việc của bạn mang tính agentic và nặng về công cụ, cấu trúc phân bậc có nghĩa là bạn nên kiểm tra kích thước đầu vào thực tế của mình so với ngưỡng 272K token thay vì giả định một mức giá cố định.

{{1}}Nếu bạn sẵn sàng chạy một bài đánh giá song song, HY4 Preview đủ rẻ để đáng thử nghiệm thực sự: hãy định tuyến khối lượng công việc gọi công cụ của bạn qua Sol ngay hôm nay, chạy cùng các prompt đó với HY4 Preview thông qua API của chính Tencent, và so sánh trên các tác vụ kiểu Toolathlon của riêng bạn.{{/1}} {{2}}Và nếu điểm số độc lập đạt đúng như Tencent tuyên bố, lộ trình chuyển đổi rất ngắn — mô hình trọng số mở được gắn vào bộ định tuyến và quy tắc dự phòng của bạn hoán đổi endpoint, với mức giá ¥6/¥18 của nhà cung cấp được giữ nguyên vẹn.{{/2}} {{3}}Đó chính là cấu trúc trung thực của cuộc so tài này: một mô hình tiên phong đã được xác minh mà bạn có thể xây dựng dựa trên ngay hôm nay, đối đầu với một thách thức mở chưa được xác minh, đủ rẻ để thử nghiệm và được định vị để khiến cuộc thảo luận về giá xoay quanh toàn bộ lớp mô hình trọng số mở.{{/3}}

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Xem gì

• Bản tái lập độc lập đầu tiên của Toolathlon-Verified. Nếu một bộ kiểm thử bên thứ ba xác nhận HY4 Preview đạt điểm trong khoảng 70, lập luận "open weights không thể sử dụng công cụ dạng tác nhân" sẽ sụp đổ.

• Liệu Tencent có phát hành khả năng thị giác trước khi ra mắt bản đầy đủ của Hy4 hay không. Chế độ chỉ hỗ trợ văn bản giới hạn HY4 Preview ở một tập con nghiêm ngặt trong số các khối lượng công việc mà GPT-5.6 Sol xử lý.

• Hóa đơn token thực tế từ xu hướng suy nghĩ kéo dài của HY4 Preview. Với mức ¥18 cho mỗi triệu token đầu ra, việc tự xác minh lan man sẽ ăn mòn lợi thế giá nhanh hơn so với mẫu $20.

• Liệu giá phân tầng của Sol có được cắt giảm thêm lần nữa trước khi Hy4 ra mắt chính thức hay không. Việc chuyển tiếp qua router khiến mức giảm được hiển thị ngay trong cùng ngày.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube