
騰訊 HY4 預覽版 vs Kimi K3:騰訊選擇發布的盲測
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
騰訊 HY4 Preview 對上 Kimi K3,是此次模型發布中騰訊自行選擇的一場對決。在其內部盲測中——163 位工程師、203 項工程任務,以四分制評分——HY4 Preview 獲得 2.99/4.00,而 Kimi K3 為 2.94,騰訊的新聞標題稱之為勝利。這場勝利的細則值得仔細閱讀:HY4 Preview 在 51.2% 的任務上勝過 Kimi K3,在 7.9% 的任務上打平,並在 40.9% 的任務上落敗。10 個百分點的淨勝率確實存在,但相對於一個總參數量只有三分之一、活躍參數量不到一半的模型而言,這只是微幅領先——而且整個測試是由騰訊自己進行的。
Kimi K3 是 Moonshot 的 2.8 兆參數開放權重旗艦模型,也是有史以來發布的最大開放模型,更是自 7 月 16 日以來中國每個實驗室用以衡量比較的參考基準。騰訊之所以選擇它作為對手,正是因為它是開放權重的標準——這使得本文的任務格外具體:閱讀挑戰者自願提出的這一場正面對決,並自行判斷其價值。
騰訊選擇發布的基準測試
盲測是由騰訊自家的工程師在騰訊自家的工程任務上評分的,這正是首先需要打折扣的地方。由公司自行挑選的任務集,恰好是新模型能展現最佳表現的環境。即使退一步說,結果的形態仍具參考價值:51.2% 的勝率對比 40.9% 的敗率,差距並不算大;而 7.9% 的平手率則表示兩者在大多數任務上表現旗鼓相當。在那些困難任務上——也就是前沿模型真正拉開差距的地方——差距依然出現在一貫的位置。而騰訊那句「略勝 Kimi K3」的標題用詞誠實,這可不是每個實驗室都會這樣發布的。
規模並非宿命
參數的比較會讓結果要嘛令人印象深刻,要嘛令人起疑,取決於你抱持的先驗信念。Kimi K3 總參數達 2.8 兆,活躍參數 1,040 億——共 896 個專家,每個 token 啟動 16 個——而且它經過訓練,推理功能始終開啟,並暴露思維鏈。HY4 Preview 總參數 7,700 億,活躍參數 490 億,總規模僅為前者的三分之一,活躍算力更不到一半。較小的模型在盲測中以小幅優勢擊敗較大的模型,這正是整個開放權重領域一直以來的發展趨勢——Qwen3.8-Max(2.4T)與 GLM-5.2(753B)幾個月來一直在智能體基準測試上互有勝負——因此這個結果可信而非荒誕。但關鍵的是,除了騰訊內部,外界尚未有人驗證過這項結果。
計分板

• 規模 — HY4 Preview 770B 總參數 / 49B 啟用參數 對比 Kimi K3 2.8T 總參數 / 104B 啟用參數
• 背景 — HY4 Preview 超過 1M tokens,與 Kimi K3 的 1M tokens 相比
• 每1M的價格 — HY4 Preview 輸入 ¥6 / 輸出 ¥18(約 $0.85 / $2.50)對比 Kimi K3 輸入 $3.00 / 輸出 $15.00,快取命中 $0.30
• 模態 — HY4 Preview 純文字 vs Kimi K3 原生圖像與影片輸入
• 推理 — HY4 預覽版沒有已發布的模式,而 Kimi K3 則始終開啟推理並串流思維鏈
• 獨立評分 — HY4 Preview 無評分,Kimi K3 AA 智能指數 57,發佈時全球前三
在雙方都有回報數字的列上,模型表現會聚集在一起。騰訊在 APEX-Agents 上回報 HY4 Preview 為 37.1,基本上與 Kimi K3 的 37.2 持平——這是盲測計分板會預測到的接近平手。就我手上的資料而言,HY4 Preview 的 Toolathlon-Verified 74.1 和 DeepSWE 64.3 沒有 Kimi K3 的對應分數,而 Kimi K3 的 FrontierSWE 81.2、ProgramBench 77.8 和 BrowseComp 91.2 也沒有 HY4 Preview 的對應分數。計分板誠實地顯示這兩張計分卡幾乎沒有重疊,這本身就是一個警告:不要把任何一家廠商的列當作對該模型的完整描述。
視野是最大的真正差異。
對於今天要在兩者之間做出選擇的開發者來說,結構性差距不在於智慧程度——而在於輸入模態。Kimi K3 原生支援多模態:它透過 MoonViT-V2 編碼器接收影像與影片輸入,並且是視覺任務上最出色的開源模型之一,在 vision arena 上全球排名第二。騰訊 HY4 Preview 在此預覽版中僅支援純文本,騰訊也表示視覺功能必須等到完整版發布。任何需要截圖、UI 理解或視覺定位的工作負載,預設都會落在 Kimi K3 身上,無論盲測對工程文本的評價如何。如果你的工作純粹是程式碼、文件和終端輸出,這個差距就無關緊要;一旦任務涉及「觀看」某樣東西,它就決定了勝負。
成本問題
以 token 計價,HY4 Preview 便宜得多:約 $0.85/$2.50,對比 Kimi K3 的 $3.00/$15.00;快取命中時為 ¥0.3(約四美分),對比 $0.30。但兩者的 token 行為恰好相反,因而縮小了差距。Kimi K3 始終進行推理並串流輸出思維鏈,這使得每次請求的輸出 token 大幅膨脹;評測者指出該模型較慢——約每秒 62 個 token——且在 agent 迴圈中 token 消耗較高。HY4 Preview 根據騰訊自家的發布說明,在複雜任務上「傾向於過度冗長的思考與過度的自我驗證」。兩者都多燒輸出 token;HY4 Preview 只是收費較低。公平的比較方式是每完成任務的成本,而騰訊以外尚未有人測量過 HY4 Preview 的這項數據。
裁決
Tencent HY4 Preview 是較便宜、較小、未經驗證的挑戰者,聲稱在盲測中略勝開放權重標準;Kimi K3 是較大、經驗證、具視覺能力的現任者,每個 token 的費用高出四到五倍,且有獨立的 Intelligence Index 57。兩者的基準測試卡都不是完全獨立——Kimi K3 的頭條分數同樣由 Moonshot 自家報告,不過其 Index 57 則非如此。如果你工作負載屬於多模態,Kimi K3 是這個對決中唯一的選擇。如果是純文字和工程用途,HY4 Preview 是划算之選,其名下有真實、雖由廠商主導的對比測試;而省錢的做法是讓 Kimi K3 走生產金鑰——它在 OrcaRouter 上以 Moonshot 的 $3.00/$15.00 定價上線,不加價轉發——同時透過 Tencent 自己的 API 在影子工作負載上執行 HY4 Preview。當 HY4 Preview 登上路由器時,同一個金鑰和同一套容錯轉移規則將同時承載兩者,而 Tencent 的 ¥6/¥18 費率也會原封不動地轉發。


看什麼
• 獨立重跑盲測任務。51.2% 的勝率是本次發布中最可檢驗的主張,第三方測試框架可在一週內定論。
• HY4 Preview 是否會在完整版 Hy4 發布之前率先推出 vision 功能。這正是能將這場純文字的價值對決,轉變為真正的旗艦之戰的關鍵所在。
• 在標準代理型框架上,每個完成任務的成本。兩種模型都消耗大量 token;誰能以較低成本完成每項任務,誰就在生產應用上勝出。
• Kimi K3 對價格壓力的回應。如果 Moonshot 降低 15 美元的輸出費率,「廉價挑戰者 vs 昂貴標準」的框架就會翻轉。
