用於比較『Tencent HY4 Preview 與 Kimi K3』的主視覺標題卡。中央的記分板風格卡片顯示『內部盲測,4 分制』,左側為『Tencent HY4 Preview 2.99』,右側為『Kimi K3 2.94』。左側卡片『Tencent HY4 Preview』列出:『770B / 49B 活化參數,開放權重』、『¥6 / ¥18 每 1M』、『純文字預覽』。右側卡片『Kimi K3』列出:『2.8T / 104B 活化參數,開放權重』、『$3.00 / $15.00 每 1M』、『原生視覺,AA Index 57』。頁尾文字為『盲測由 Tencent 執行,動員 163 位工程師、涵蓋 203 項任務;結果由廠商自行回報。』OrcaRouter 標誌合成於右下角。
Guides & Insights

騰訊 HY4 預覽版 vs Kimi K3:騰訊選擇發布的盲測

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

騰訊 HY4 Preview 對上 Kimi K3,是此次模型發布中騰訊自行選擇的一場對決。在其內部盲測中——163 位工程師、203 項工程任務,以四分制評分——HY4 Preview 獲得 2.99/4.00,而 Kimi K3 為 2.94,騰訊的新聞標題稱之為勝利。這場勝利的細則值得仔細閱讀:HY4 Preview 在 51.2% 的任務上勝過 Kimi K3,在 7.9% 的任務上打平,並在 40.9% 的任務上落敗。10 個百分點的淨勝率確實存在,但相對於一個總參數量只有三分之一、活躍參數量不到一半的模型而言,這只是微幅領先——而且整個測試是由騰訊自己進行的。

Kimi K3 是 Moonshot 的 2.8 兆參數開放權重旗艦模型,也是有史以來發布的最大開放模型,更是自 7 月 16 日以來中國每個實驗室用以衡量比較的參考基準。騰訊之所以選擇它作為對手,正是因為它是開放權重的標準——這使得本文的任務格外具體:閱讀挑戰者自願提出的這一場正面對決,並自行判斷其價值。

騰訊選擇發布的基準測試

盲測是由騰訊自家的工程師在騰訊自家的工程任務上評分的,這正是首先需要打折扣的地方。由公司自行挑選的任務集,恰好是新模型能展現最佳表現的環境。即使退一步說,結果的形態仍具參考價值:51.2% 的勝率對比 40.9% 的敗率,差距並不算大;而 7.9% 的平手率則表示兩者在大多數任務上表現旗鼓相當。在那些困難任務上——也就是前沿模型真正拉開差距的地方——差距依然出現在一貫的位置。而騰訊那句「略勝 Kimi K3」的標題用詞誠實,這可不是每個實驗室都會這樣發布的。

規模並非宿命

參數的比較會讓結果要嘛令人印象深刻,要嘛令人起疑,取決於你抱持的先驗信念。Kimi K3 總參數達 2.8 兆,活躍參數 1,040 億——共 896 個專家,每個 token 啟動 16 個——而且它經過訓練,推理功能始終開啟,並暴露思維鏈。HY4 Preview 總參數 7,700 億,活躍參數 490 億,總規模僅為前者的三分之一,活躍算力更不到一半。較小的模型在盲測中以小幅優勢擊敗較大的模型,這正是整個開放權重領域一直以來的發展趨勢——Qwen3.8-Max(2.4T)與 GLM-5.2(753B)幾個月來一直在智能體基準測試上互有勝負——因此這個結果可信而非荒誕。但關鍵的是,除了騰訊內部,外界尚未有人驗證過這項結果。

計分板

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• 規模 — HY4 Preview 770B 總參數 / 49B 啟用參數 對比 Kimi K3 2.8T 總參數 / 104B 啟用參數

• 背景 — HY4 Preview 超過 1M tokens,與 Kimi K3 的 1M tokens 相比

• 每1M的價格 — HY4 Preview 輸入 ¥6 / 輸出 ¥18(約 $0.85 / $2.50)對比 Kimi K3 輸入 $3.00 / 輸出 $15.00,快取命中 $0.30

• 模態 — HY4 Preview 純文字 vs Kimi K3 原生圖像與影片輸入

• 推理 — HY4 預覽版沒有已發布的模式,而 Kimi K3 則始終開啟推理並串流思維鏈

• 獨立評分 — HY4 Preview 無評分,Kimi K3 AA 智能指數 57,發佈時全球前三

在雙方都有回報數字的列上,模型表現會聚集在一起。騰訊在 APEX-Agents 上回報 HY4 Preview 為 37.1,基本上與 Kimi K3 的 37.2 持平——這是盲測計分板會預測到的接近平手。就我手上的資料而言,HY4 Preview 的 Toolathlon-Verified 74.1 和 DeepSWE 64.3 沒有 Kimi K3 的對應分數,而 Kimi K3 的 FrontierSWE 81.2、ProgramBench 77.8 和 BrowseComp 91.2 也沒有 HY4 Preview 的對應分數。計分板誠實地顯示這兩張計分卡幾乎沒有重疊,這本身就是一個警告:不要把任何一家廠商的列當作對該模型的完整描述。

視野是最大的真正差異。

對於今天要在兩者之間做出選擇的開發者來說,結構性差距不在於智慧程度——而在於輸入模態。Kimi K3 原生支援多模態:它透過 MoonViT-V2 編碼器接收影像與影片輸入,並且是視覺任務上最出色的開源模型之一,在 vision arena 上全球排名第二。騰訊 HY4 Preview 在此預覽版中僅支援純文本,騰訊也表示視覺功能必須等到完整版發布。任何需要截圖、UI 理解或視覺定位的工作負載,預設都會落在 Kimi K3 身上,無論盲測對工程文本的評價如何。如果你的工作純粹是程式碼、文件和終端輸出,這個差距就無關緊要;一旦任務涉及「觀看」某樣東西,它就決定了勝負。

成本問題

以 token 計價,HY4 Preview 便宜得多:約 $0.85/$2.50,對比 Kimi K3 的 $3.00/$15.00;快取命中時為 ¥0.3(約四美分),對比 $0.30。但兩者的 token 行為恰好相反,因而縮小了差距。Kimi K3 始終進行推理並串流輸出思維鏈,這使得每次請求的輸出 token 大幅膨脹;評測者指出該模型較慢——約每秒 62 個 token——且在 agent 迴圈中 token 消耗較高。HY4 Preview 根據騰訊自家的發布說明,在複雜任務上「傾向於過度冗長的思考與過度的自我驗證」。兩者都多燒輸出 token;HY4 Preview 只是收費較低。公平的比較方式是每完成任務的成本,而騰訊以外尚未有人測量過 HY4 Preview 的這項數據。

裁決

Tencent HY4 Preview 是較便宜、較小、未經驗證的挑戰者,聲稱在盲測中略勝開放權重標準;Kimi K3 是較大、經驗證、具視覺能力的現任者,每個 token 的費用高出四到五倍,且有獨立的 Intelligence Index 57。兩者的基準測試卡都不是完全獨立——Kimi K3 的頭條分數同樣由 Moonshot 自家報告,不過其 Index 57 則非如此。如果你工作負載屬於多模態,Kimi K3 是這個對決中唯一的選擇。如果是純文字和工程用途,HY4 Preview 是划算之選,其名下有真實、雖由廠商主導的對比測試;而省錢的做法是讓 Kimi K3 走生產金鑰——它在 OrcaRouter 上以 Moonshot 的 $3.00/$15.00 定價上線,不加價轉發——同時透過 Tencent 自己的 API 在影子工作負載上執行 HY4 Preview。當 HY4 Preview 登上路由器時,同一個金鑰和同一套容錯轉移規則將同時承載兩者,而 Tencent 的 ¥6/¥18 費率也會原封不動地轉發。

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

看什麼

• 獨立重跑盲測任務。51.2% 的勝率是本次發布中最可檢驗的主張,第三方測試框架可在一週內定論。

• HY4 Preview 是否會在完整版 Hy4 發布之前率先推出 vision 功能。這正是能將這場純文字的價值對決,轉變為真正的旗艦之戰的關鍵所在。

• 在標準代理型框架上,每個完成任務的成本。兩種模型都消耗大量 token;誰能以較低成本完成每項任務,誰就在生產應用上勝出。

• Kimi K3 對價格壓力的回應。如果 Moonshot 降低 15 美元的輸出費率,「廉價挑戰者 vs 昂貴標準」的框架就會翻轉。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube