
Tencent HY4 預覽 vs tencent-hy3:六倍價格,這個躍升實際買到了什麼
- google新Google: Gemini 3.8 Flash2026-09-0259智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
Tencent HY4 Preview 是 Hunyuan 家族中第一個刻意讓自家前代產品看起來廉價的模型:Tencent 將其輸入價格定為 tencent-hy3 的六倍,輸出價格為其四倍半,而發布簡報主張這溢價實至名歸。Tencent HY4 Preview 於 2026 年 8 月 28 日發布並開放原始碼,在 DeepSWE 上的軟體工程分數是 Hy3 的 28.0 的兩倍以上,在 Terminal-Bench 2.1 上取得終端操作得分 85.4,且上下文長度從 256K 跳升到超過一百萬個 token。tencent-hy3 於 7 月 6 日正式推出,是該家族中成熟的骨幹產品——總參數量 295B、活躍參數 21B、上下文長度僅為四分之一,價格則低到幾乎可以忽略不計。從規格表來看,這根本不是一場勢均力敵的較量。問題在於,就你實際運行的任務而言,這差距是否值得付出那麼多錢,而答案會因工作負載而異。
記分板:兩者真正分歧之處
騰訊材料中的每一項基準測試皆為供應商自行報告——是在各模型發佈時於騰訊自家評估環境中運行,未經獨立實驗室重現,且旗艦模型公開亮相還不到一天。請將這些分數視為騰訊自認達到的上限,並更側重於整體模式,而非任何單一數字。這個模式再明顯不過,而且集中在代理式工程工作上,而非一般知識領域:
• DeepSWE — Tencent HY4 Preview:64.3。tencent-hy3:28.0。這是該配對中最大的一次單一躍升,在儲存庫規模的軟體工程基準測試上成長超過一倍,而這個數字正是區分聊天模型與你會把整個程式碼庫交給它的模型的關鍵。
Terminal-Bench 2.1 — Tencent HY4 Preview:85.4,騰訊表示這與 Claude Opus 5 持平,並超越 DeepSeek V4 Pro。tencent-hy3:71.7,與其七月發佈時報告的成績一致。驅動真實終端完成多步驟任務,正是 Hy3 最不擅長的長程工作。
• Toolathlon 認證 — 騰訊 HY4 預覽版:74.1,騰訊宣稱超越 Qwen 3.8 Max 與 GPT-5.6 Sol。未公布可比的 Hy3 數據。
• 內部盲測 — 163位專家對203項工程任務進行評分,騰訊HY4 Preview獲得2.99/4.00,略勝GLM-5.3的2.92和Kimi K3的2.94。這是騰訊評審員在騰訊任務上的評測,僅供參考方向。

貫穿始終的主線在於:提升集中在終端操作、工具調用和代碼庫級任務上——這是騰訊自 Hy3 以來一直推動的生產力定位,如今終於有算力作為支撐。
溢價,逐行
至此,比較就不再只是為了炫耀。騰訊的牌價,每百萬個 token:
• 輸入 — Tencent HY4 Preview:6 元(約 US$0.85)。tencent-hy3:1 元(約 US$0.14)。六倍。
• 輸出 — Tencent HY4 Preview:18元(約2.50美元)。tencent-hy3:4元(約0.56美元)。4.5倍。
• 快取命中 — Tencent HY4 Preview:0.3 元。tencent-hy3:0.25 元。幾乎相同,但其實比表面上看起來更重要,因為代理迴圈會不斷重新發送相同的系統提示詞和對話前綴。
以這個混合數字來計算一個真實的代理式編碼工作負載——比方說每月 2000 萬個輸入 token 和 400 萬個輸出 token,這是一個忙碌的單一開發者 agent 的預算。Tencent HY4 Preview:120 元加上 72 元,約 192 元(約 US$27)。tencent-hy3:20 元加上 16 元,約 36 元(約 US$5)。旗艦款在相同的 token 組合下運行成本是五倍以上——而且它每個任務會要求更多輸出 token,因為它思考得更久。
這不是避開 Tencent HY4 Preview 的理由;DeepSWE 的飛躍正是高級版存在所要購買的那種能力。這是在路由之前先為工作量定價的理由。而這正是路由層發揮其價值之處:tencent-hy3 已經以供應商的目錄價格上架 OrcaRouter——0% 加價,因此你看到的數字就是服務供應商自己的價格,而非轉售且加價的版本——並具備跨供應商的自動故障轉移,且供應商價格變更當天就會在我們這端生效。
四倍的上下文,雙倍的有效運算
• 架構 — Tencent HY4 Preview:總計 770B,活躍 MoE 49B。tencent-hy3:總計 295B,活躍 21B。旗艦版在每個 token 上投入約 2.3 倍的運算量。
上下文窗口 — Tencent HY4 Preview:超過 1M tokens。tencent-hy3:256K。整個儲存庫或一批金融文件可以作為單一請求放入旗艦模型的視窗中;而在 Hy3 上,相同的工作則需要分塊、檢索或代理迴圈。
• 推理控制 — tencent-hy3 提供每次請求的 reasoning_effort 設定(no_think、low、high),並加上投機解碼(speculative-decoding)層來維持速度。Tencent HY4 Preview 根據騰訊自述,傾向在首次輸出前進行長時間思考,並在複雜任務上過度自我驗證——浪費 token 重複檢查已完成的工作。
最後一行正是延遲敏感應用的隱藏關鍵差異。Hy3 可以被指示直接作答;Tencent HY4 Preview,至少在目前這個早期版本中,往往無法不進行思考。對於低延遲聊天或高吞吐量的抽取管線,旗艦版的額外能力是浪費,其額外思考則是一種稅賦。而對於離線批次工程任務,這筆稅賦正是換取更佳答案的關鍵。
預覽稅:Hy3 仍然擁有什麼
「Preview」就寫在騰訊 HY4 Preview 的名稱裡,而它的表現也名副其實。沒有視覺或多模態輸入——該模型僅支援文字,因此任何與圖片或影片相關的任務,都仍交由你原本使用的模型處理。WorkBuddy 和 CodeBuddy 的兩週免費試用只是嚐鮮,並非正式方案。騰訊已明確表示這是 Hy4 的早期迭代,預訓練與後訓練的改進仍將陸續推出;自 2 月以來,該公司大約每兩個月就會推出一個主要版本,而這個節奏仍會持續。這款旗艦模型的獨立基準測試:至今哪裡都還沒有。
tencent-hy3 與上述種種完全相反。它是官方穩定的版本,自七月起便已投入生產。其免費方案可使用至九月三十日。它的推理等級提供的是可調旋鈕,而非難以捉摸的性情;而其推測解碼層與 21B 活躍參數,使它成為該系列中便宜、快速、可預測的那一半——一個設定好預設路徑後便可置之不理的模型。

該由誰來選擇哪一個
當任務品質是首要考量時,請選擇 Tencent HY4 Preview——例如艱難的軟體工程任務、代碼庫規模的上下文、或一個代理式工作流程,在這種情況下,更佳的答案值得五倍的 token 費用,而且你能承擔一個在開口前會思考的模型所帶來的延遲。當任務制約是首要考量時,請選擇 tencent-hy3——例如高吞吐量、低延遲、預算有限,或任何你希望模型直接回答而非深思熟慮的任務。
這類搭配的實務模式是升級機制:先將便宜、可控的模型路由到預設路徑,只有在任務確實需要時,才升級到旗艦模型。這正是 OrcaRouter 的路由 DSL 存在的意義——將多個模型組合成單一呼叫,使策略成為設定而非程式碼——而自動容錯移轉則代表,即使某個供應商效能下降,Hy3 的路徑仍會持續提供服務。OrcaRouter 尚未支援路由 Tencent HY4 Preview;騰訊尚未將該模型開放給第三方推論,因此目前它運行在供應商自家的騰訊雲 TokenHub 端點,以及開放權重的自架部署上。與此同時,tencent-hy3 現已列入目錄,以供應商的定價供應——而等到旗艦模型開放的那一天,它也會以相同的方式嵌入同一個路由層,讓兩個模型之間的切換變成一行變更,而不是全面重寫。

結論無聊得恰到好處:旗艦機型的溢價,恰好對應它所被定價來處理的工作;而主力機型對於一切只需完成的事務,依然是正確的選擇。六倍的價格差距是真實的,28 對 64 的 DeepSWE 差距也是真實的,兩者並不相互抵消——你只需要知道自己買的是哪一款。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
