Thẻ tiêu đề chính cho phép so sánh 'Tencent HY4 Preview vs Kimi K3'. Một thẻ trung tâm theo kiểu bảng điểm ghi 'Thử nghiệm mù nội bộ, thang 4 điểm', với 'Tencent HY4 Preview 2.99' ở bên trái và 'Kimi K3 2.94' ở bên phải. Thẻ bên trái 'Tencent HY4 Preview' liệt kê '770B / 49B kích hoạt, trọng số mở', '¥6 / ¥18 mỗi 1M', 'Bản xem trước chỉ văn bản'. Thẻ bên phải 'Kimi K3' liệt kê '2.8T / 104B kích hoạt, trọng số mở', '$3.00 / $15.00 mỗi 1M', 'Thị giác tự nhiên, AA Index 57'. Chân trang ghi 'Thử nghiệm mù do Tencent thực hiện với 163 kỹ sư trên 203 tác vụ; kết quả do nhà cung cấp công bố.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Tencent HY4 Preview đối đầu Kimi K3: Bài kiểm tra mù mà Tencent chọn công bố

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tencent HY4 Preview so với Kimi K3 là trận đối đầu duy nhất trong đợt ra mắt mô hình này mà chính Tencent chọn để chạy thử. Trong bài kiểm tra mù nội bộ của họ — 163 kỹ sư, 203 nhiệm vụ kỹ thuật, chấm điểm theo thang bốn điểm — HY4 Preview đạt 2,99/4,00 so với 2,94 của Kimi K3, và tiêu đề của Tencent gọi đó là chiến thắng. Điều khoản nhỏ của chiến thắng đó đáng đọc kỹ: HY4 Preview thắng Kimi K3 ở 51,2% nhiệm vụ, hòa ở 7,9% và thua ở 40,9%. Tỷ lệ thắng thuần 10 điểm là có thật, nhưng đó là lợi thế mong manh trước một mô hình có tổng số tham số chỉ bằng một phần ba và số tham số hoạt động chưa đến một nửa — và toàn bộ bài kiểm tra do Tencent thực hiện.

Kimi K3 là mô hình chủ lực mã nguồn mở (open-weight) 2,8 nghìn tỷ tham số của Moonshot, mô hình mở lớn nhất từng được phát hành, và là điểm tham chiếu mà mọi phòng thí nghiệm Trung Quốc đã lấy làm chuẩn để so sánh kể từ ngày 16/7. Tencent đã chọn nó làm đối thủ vì nó là tiêu chuẩn mã nguồn mở — điều này khiến nhiệm vụ của bài viết này trở nên cụ thể một cách bất thường: đọc bản so sánh trực tiếp mà kẻ thách thức tự nguyện thực hiện, và quyết định xem nó đáng giá đến đâu.

Điểm chuẩn mà Tencent chọn để công bố

Bài kiểm tra mù được chấm điểm bởi chính các kỹ sư của Tencent trên chính các bài toán kỹ thuật của Tencent — đây là điều đầu tiên cần xét lại. Một bộ bài toán do công ty tự tuyển chọn chính là môi trường mà một mô hình mới có thể đạt được màn thể hiện tốt nhất. Dù vậy, bức tranh kết quả vẫn mang nhiều thông tin: 51,2% thắng so với 40,9% thua là một cách biệt khiêm tốn, và tỷ lệ hòa 7,9% cho thấy các mô hình khá cân sức trên hầu hết các bài toán. Ở những bài toán khó — nơi một mô hình tiên phong tách mình khỏi phần còn lại — khoảng cách vẫn nằm ở đúng vị trí vốn có của nó, và tiêu đề của Tencent, "nhỉnh hơn một chút so với Kimi K3", được diễn đạt trung thực, điều mà không phải phòng thí nghiệm nào cũng công bố.

Quy mô không phải là định mệnh

Việc so sánh tham số khiến kết quả trở nên ấn tượng hoặc đáng ngờ, tùy thuộc vào giả định trước đó của bạn. Kimi K3 có tổng cộng 2,8 nghìn tỷ tham số với 104 tỷ tham số kích hoạt — 896 chuyên gia, 16 chuyên gia kích hoạt trên mỗi token — và được huấn luyện để luôn bật chế độ suy luận với chuỗi suy nghĩ (chain-of-thought) được hiển thị công khai. HY4 Preview có tổng cộng 770 tỷ tham số với 49 tỷ tham số kích hoạt, bằng một phần ba quy mô tổng thể và chưa đến một nửa khối lượng tính toán kích hoạt. Một mô hình nhỏ hơn giành chiến thắng sít sao trong bài kiểm tra mù trước một mô hình lớn hơn là xu hướng mà toàn bộ lĩnh vực mô hình trọng số mở đang đi theo — Qwen3.8-Max với 2,4 nghìn tỷ tham số và GLM-5.2 với 753 tỷ tham số đã liên tục so kè trên các benchmark tác tử trong nhiều tháng — nên kết quả này là hợp lý chứ không phải quá bất thường. Quan trọng hơn, kết quả này chưa được bất kỳ ai bên ngoài Tencent xác minh.

Bảng tỷ số

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Quy mô — HY4 Preview 770B tổng / 49B hoạt động so với Kimi K3 2.8T tổng / 104B hoạt động

• Ngữ cảnh — HY4 Preview >1M token so với Kimi K3 1M token

• Giá mỗi 1M — HY4 Preview ¥6 đầu vào / ¥18 đầu ra (≈$0.85 / $2.50) so với Kimi K3 $3.00 đầu vào / $15.00 đầu ra, cache hits $0.30

• Phương thức — HY4 Preview chỉ hỗ trợ văn bản, trong khi Kimi K3 hỗ trợ đầu vào hình ảnh và video gốc

• Suy luận — HY4 Preview không có chế độ công khai trong khi Kimi K3 có suy luận luôn bật với chuỗi suy nghĩ được truyền trực tiếp

• Điểm số độc lập — HY4 Preview: không có so với Kimi K3: AA Intelligence Index 57, top ba toàn cầu khi ra mắt

Ở các hàng mà cả hai bên đều báo cáo số liệu, các mô hình xếp hạng sát nhau. Tencent báo cáo HY4 Preview đạt 37,1 trên APEX-Agents, về cơ bản ngang bằng với 37,2 của Kimi K3 — một kết quả gần như hòa mà bảng điểm thử nghiệm mù đã tiên đoán. Toolathlon-Verified 74,1 và DeepSWE 64,3 của HY4 Preview không có số liệu tương đương từ Kimi K3 trong tay tôi, còn FrontierSWE 81,2, ProgramBench 77,8 và BrowseComp 91,2 của Kimi K3 không có số liệu tương đương từ HY4 Preview. Bảng điểm trung thực khi phản ánh rằng hai bảng số liệu hầu như không trùng khớp — bản thân điều này là một lời cảnh báo về việc coi số liệu của bất kỳ bên cung cấp nào là mô tả đầy đủ về mô hình.

Tầm nhìn là sự khác biệt thực sự lớn nhất

Đối với một nhà phát triển lựa chọn giữa hai mô hình này ngày nay, khoảng cách về cấu trúc không nằm ở trí thông minh — mà nằm ở phương thức đầu vào. Kimi K3 vốn dĩ đa phương thức: mô hình này nhận đầu vào hình ảnh và video thông qua bộ mã hóa MoonViT-V2 và là một trong những mô hình mở tốt nhất ở các tác vụ thị giác, xếp hạng thứ hai toàn cầu trên vision arena. Tencent HY4 Preview trong bản xem trước này chỉ hỗ trợ văn bản, và Tencent đã xác nhận rằng khả năng thị giác phải chờ bản phát hành đầy đủ. Bất kỳ khối lượng công việc nào cần ảnh chụp màn hình, hiểu giao diện người dùng hoặc định vị thị giác đều mặc định thuộc về Kimi K3, bất kể bài kiểm tra mù nói gì về chất lượng xử lý văn bản kỹ thuật. Nếu công việc của bạn thuần túy là mã nguồn, tài liệu và đầu ra dòng lệnh, khoảng cách này không quan trọng; ngay khi một tác vụ liên quan đến việc nhìn vào một thứ gì đó, nó sẽ quyết định kết quả so sánh.

Câu hỏi về chi phí

{{1}}Tính theo token, HY4 Preview rẻ hơn đáng kể: khoảng $0.85/$2.50 so với $3.00/$15.00 của Kimi K3, với cache hit ở mức ¥0.3 (khoảng bốn xu) so với $0.30.{{/1}} {{2}}Nhưng hai mô hình có hành vi token trái ngược nhau khiến khoảng cách này bị thu hẹp.{{/2}} {{3}}Kimi K3 suy luận ở chế độ luôn bật và phát trực tiếp chuỗi suy nghĩ của nó, điều này làm tăng token đầu ra trong mỗi yêu cầu; các nhà đánh giá đã lưu ý rằng mô hình này chậm hơn — khoảng 62 token mỗi giây — và tốn nhiều token cho các vòng lặp tác nhân.{{/3}} {{4}}HY4 Preview, theo ghi chú phát hành của chính Tencent, "có xu hướng suy nghĩ quá dài và tự kiểm tra quá mức" trong các tác vụ phức tạp.{{/4}} {{5}}Cả hai đều tiêu tốn thêm token đầu ra;{{/5}} {{6}}HY4 Preview chỉ tính phí thấp hơn cho chúng.{{/6}} {{7}}Một sự so sánh công bằng là chi phí trên mỗi tác vụ hoàn thành,{{/7}} {{8}}và chưa ai ngoài Tencent đo lường được con số đó của HY4 Preview.{{/8}}

Bản án

Tencent HY4 Preview là đối thủ cạnh tranh rẻ hơn, nhỏ hơn, chưa được kiểm chứng, tuyên bố có lợi thế hẹp trong thử nghiệm mù so với chuẩn trọng số mở; Kimi K3 là mô hình hiện hành lớn hơn, đã được kiểm chứng, hỗ trợ thị giác, có chi phí cao gấp 4 đến 5 lần mỗi token và có chỉ số Intelligence Index độc lập là 57. Bảng benchmark của cả hai mô hình đều không hoàn toàn độc lập — các điểm số nổi bật của Kimi K3 cũng do Moonshot công bố, dù Chỉ số 57 của nó thì không. Nếu khối lượng công việc của bạn là đa phương thức, Kimi K3 là lựa chọn duy nhất trong cuộc so tài này. Nếu là văn bản và kỹ thuật, HY4 Preview là lựa chọn đáng giá, sở hữu một cuộc đối đầu trực tiếp thực tế — dù do nhà cung cấp vận hành — và con đường rẻ là định tuyến Kimi K3 trên khóa sản xuất: nó đang hoạt động trên OrcaRouter ở giá niêm yết $3.00/$15.00 của Moonshot, truyền thẳng không cộng thêm phí — trong khi bạn chạy HY4 Preview qua API của chính Tencent trên các tải thử nghiệm (shadow). Khi HY4 Preview được đưa lên một bộ định tuyến, cùng một khóa và cùng các quy tắc chuyển đổi dự phòng sẽ phục vụ cả hai, và mức giá ¥6/¥18 của Tencent sẽ được truyền thẳng không thay đổi.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Xem gì

• Một lần chạy lại độc lập các bài kiểm tra mù. Tỷ lệ thắng 51,2% là tuyên bố dễ kiểm chứng nhất trong đợt ra mắt này, và một bộ khung kiểm thử của bên thứ ba sẽ giải quyết được vấn đề trong một tuần.

• Liệu HY4 Preview có tung ra tính năng vision trước khi bản HY4 đầy đủ ra mắt hay không. Đó chính là điều sẽ biến cuộc so sánh giá trị chỉ dựa trên thông số thành một trận chiến flagship thực sự.

- Chi phí cho mỗi tác vụ hoàn thành trên các khung tác nhân tiêu chuẩn. Cả hai mô hình đều sử dụng nhiều token; mô hình nào rẻ hơn cho mỗi tác vụ hoàn thành sẽ thắng trong lập luận về sản xuất.

• Phản ứng của Kimi K3 trước áp lực giá. Nếu Moonshot cắt giảm mức giá đầu ra 15 đô la, khung "kẻ thách thức giá rẻ so với tiêu chuẩn đắt đỏ" sẽ bị đảo ngược.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube