騰訊 HY4 預覽版發布的主視覺標題卡片。置中的標題寫著「騰訊 HY4 預覽版 — 開源前沿,低價」。下方為關鍵規格標籤:「總計 770B / 啟用 49B(MoE)」、「1M 上下文」、「開放權重:2026 年 8 月 28 日」、「每 MTok 6 / 18 元」。頁尾一行寫著「軟體工程 · 辦公 · 遊戲開發 · 科學研究」。OrcaRouter 標誌合成於右下角。
Guides & Insights

騰訊HY4預覽版開源:770B MoE架構、百萬級上下文,價格更擊穿前沿門檻

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

騰訊HY4預覽版於2026年8月28日發布並開放原始碼,這是數月來中國實驗室首度推出真正具競爭力的開放權重旗艦模型,而其中最令人意外的數字是價格。騰訊將其定價為每百萬輸入tokens 6元人民幣(約0.85美元)、每百萬輸出tokens 18元人民幣(約2.50美元)——約為頂級封閉前沿模型輸出定價的十分之一——同時發布了一個7,700億參數的混合專家模型,每個token啟動其中490億參數,上下文長度超過一百萬tokens。它是Hunyuan家族Hy3(總參數2,950億、上下文256K)的後繼者,並將上下文擴充為四倍,同時活躍容量增加超過一倍。權重今日即可從Hugging Face、GitHub、ModelScope和GitCode下載,同款模型也已上線於騰訊自家產品:WorkBuddy、國內外版本的CodeBuddy、元寶助手,以及ima工作空間應用程式。對於一直觀察開放權重模型在軟體工程任務上不及前沿表現的人來說,這次發布終於讓差距變得可以討論——而其中的限制條件與這些數字本身同樣重要。

這樣的定位是刻意的。騰訊將Tencent HY4 Preview定位為一款生產力模型,涵蓋四個領域:軟體工程、辦公室與數據分析、遊戲開發,以及科學研究。對工程的重視,正是它與一般通用模型最大的區別——發布說明以長程任務理解、規劃與除錯為主打,而非聊天品質。這項重點不僅反映在基準測試表格上,也同樣體現在整合清單中:CodeBuddy在IDE中整合了該模型,WorkBuddy將它導入辦公室工作流程(騰訊展示它一次處理72份財務文件的能力),而遊戲開發者則可透過MCP掛鉤接入Unreal Engine 5和Unity,把一句話轉化成可玩的示範。

實際發佈的內容

這份規格說明書值得逐行細讀,因為每一行都會改變開放權重模型被允許做的事情。

• 架構 — 混合專家(Mixture-of-Experts)模型,總參數770B,每個token活躍參數49B,稀疏比例約16:1,使推論成本維持在小型團隊實際負擔得起的範圍內。

• 上下文視窗 — 超過100萬個token,是Hy3的256K的四倍。長時程工程任務 — 將整個儲存庫放入視窗、多檔案重構、大量文件批次處理 — 都變成單一請求即可解決的問題。

• 權重 — 以MIT風格開放釋出於Hugging Face、GitHub、ModelScope和GitCode。這是一個可下載、可自行託管的模型,而非託管式預覽。

• API — 可在騰訊雲的 TokenHub 上使用,這是該供應商自有的託管端點,定價為每百萬輸入 tokens 6 元、每百萬輸出 tokens 18 元,每百萬 tokens 快取命中 0.3 元。

• 產品整合 — WorkBuddy、CodeBuddy(國內版與國際版)、元寶和 ima,意味著騰訊在自家應用中所搭載的相同權重,就是你可以下載並執行的版本。

騰訊還報告了一個很少出現在發布說明中的推理工程數據:透過算子融合與通訊最佳化,端到端吞吐量提升了 31.8%。這件事之所以不只是規格表上的註腳,是因為騰訊表示 Tencent HY4 Preview 自己找到了瓶頸——該模型分析了自身的推理堆疊,且據報這些最佳化在不同上下文長度與並發等級下均保持穩定。正是這類細節,區別了一座實驗室以研究產物形式推出的模型,與一家公司預期會承載正式流量壓力的模型。而對於一個公開才幾天的預覽版來說,這也正是那種只有騰訊內部才能驗證、外界尚無人能證實的說法。

值得引用的分數

騰訊為 Tencent HY4 Preview 發布的每一項基準測試都是廠商自報——在騰訊自家的評估設置上運行,未經任何獨立實驗室複現,而且該模型公開至今僅有幾天。應將它們視為騰訊自認達到的上限,而非既定事實。

A single-model scoreboard titled 'Tencent HY4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (HF / GitHub / ModelScope / GitCode)', 'Price: 6 / 18 yuan per MTok (0.3 yuan cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 28, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

主要數據是 Terminal Bench 2.1,這是一項測試模型在編寫程式時驅動真實終端機能力的基準。騰訊報告 Tencent HY4 Preview 達到 85.4,宣稱與 Claude Opus 5 持平,且超越 DeepSeek V4 Pro,同時比自家前代 Hy3 高出 14.6 分。這個單一數字承載了許多意義——這項說法宣稱,一個開放權重模型在困難的代理式程式設計測試中,能與最昂貴的封閉前沿模型並駕齊驅——而這也正是最需要獨立驗證的說法。

內部表格的其餘部分:軟體工程基準 DeepSWE 從 Hy3 上的 28.0 躍升至 64.3,騰訊形容此為「逐步縮小與第一線模型的差距」。在工具呼叫測試 Toolathlon-Verified 中,它獲得 74.1 分,騰訊表示超越 Qwen 3.8 Max 和 GPT-5.6 Sol,並逼近 Kimi K3 與 Claude Opus 5。在 APEX-Agents pass@1 上,它取得 37.1,以些微差距落後 Kimi K3 的 37.2。此外,在另一項內部盲測中,163 位專家對 203 項工程任務的評分為 4.00 分制下的 2.99 分,略勝 GLM-5.3 的 2.92 與 Kimi K3 的 2.94。

{{1}}有兩個模式格外突出。{{/1}}{{2}}首先,所有亮眼的數據都集中在代理式工程工作上——終端機操作、工具呼叫、儲存庫規模的任務——而沒有一項落在一般知識或推理上,這與生產力定位一致,而非巧合。{{/2}}{{3}}其次,騰訊謹慎地將 DeepSWE 及其他模型描述為縮小差距,而非消除差距。{{/3}}{{4}}唯一乾淨且具市場賣點的平起平坐宣稱,是 Terminal Bench 2.1 的持平表現,而這也是最值得用你自己的工作量去驗證的宣稱。{{/4}}

這個定價實際上買到的是什麼

定價是這次發布從「有趣」轉為「顛覆」的關鍵所在。按照騰訊的標價,一百萬個輸入 token 的費用,大約等同於某些平台上一次中階 API 呼叫的價格。每百萬個輸出 token 定價 18 元人民幣(約 2.50 美元),遠低於頂級封閉前沿模型每百萬輸出 25 美元的價格;而 0.3 元人民幣的快取命中價格,讓長時間的代理循環——也就是不斷重複傳送相同系統提示詞和對話前綴的場景——運行起來格外便宜。

這也是一個路由層會改變計算方式的地方。OrcaRouter 目前尚未路由 Tencent HY4 Preview——騰訊尚未將此模型開放給第三方推論平台,因此它運行在騰訊雲自家的 TokenHub 端點,以及開放權重的自架部署上;我們不會聲稱提供我們並未提供的服務。但讓降價具有意義的那套紀律,與目錄中其他所有模型所遵循的完全相同:OrcaRouter 以零加價方式傳遞供應商的牌價,因此當像騰訊這樣的廠商將 token 定價為 6 元時,您在我們這邊支付的金額就是 6 元,而非被轉售並加價過的版本;當供應商調整價格的那一天,這項變更也會在當天同步生效於我們這邊。一個 API 涵蓋 200+ 個模型、供應商出問題時自動故障轉移,以及用來組合模型的路由 DSL——這就是當 Tencent HY4 Preview 一旦變得可路由時,將與目錄中其他開放與封閉模型一同被承載的機制。

A screenshot of the OrcaRouter model catalog page (www.orcarouter.ai/models, captured August 28, 2026) showing a browsable grid of AI models with pricing and provider information. It illustrates the one-API, 200+ models catalog through which vendor list-price pass-through and failover operate.

規格表上無法容納的部分

發布材料中的兩項主張值得分別關注,因為它們關乎模型的建構方式,而非其得分表現。

第一個是自我改進迴圈。Tencent 表示,Tencent HY4 Preview 參與了自身的研究與開發——它被用來優化產生它的訓練方法、資料策略、評測系統與底層算子。31.8% 的吞吐量提升是該迴圈最具體的公開成果:Tencent 將其歸功於模型在自己的服務技術棧中所識別出的瓶頸。這是一個初期的遞迴式自我增強循環:模型協助設計自己的下一個版本。對前沿實驗室而言,報告這類迴圈的片段並不罕見;但一個中國的開放權重模型公開將此迴圈描述為一項已交付的能力,是這些發布在自我論述方式上的一次重大轉變。

第二項是數學成果。騰訊報告,該模型將 Blaschke–Lebesgue 問題——凸幾何中一個關於定寬體最小體積的長期未解問題——的已知體積下界從 0.380799 提高到 0.41104,使其與 Meissner 四面體猜想的界限僅差約 2%。騰訊還報告,在科學研究賽道上,一項 32,512 個原子的磷脂雙層模擬實現了 2.0 倍加速,每步運算時間降至 54.9 毫秒。這類成果通常足以讓一個模型發表自己的論文;在這裡它們只是發布亮點,而與其他發布材料一樣,這些都是騰訊單方面的說法。

老實說,缺少的是什麼?

騰訊直白地列出了已知限制,而這些限制對任何決定要在這個模型上打造什麼的人來說都很要緊。它沒有視覺或多模態輸入——Tencent HY4 Preview 是純文字模型,句號——因此任何與影像或影片沾邊的工作都該放到別的模型上。騰訊也提到,該模型在複雜任務上會出現緩慢啟動的行為——在輸出第一個結果前會長時間思考——而且有過度自我驗證的傾向,會燒掉大量 token 來反覆檢查它已經做完的工作。這樣的組合對延遲敏感的聊天場景來說完全不對盤,對離線批次工程任務來說則完全可接受,這也表明了騰訊預期你會在什麼地方執行它。

而最重要的缺失是驗證。目前任何地方都還沒有騰訊HY4 Preview的獨立評分——無論是公開排行榜、第三方評測實驗室,甚至連Artificial Analysis的條目都沒有。這個模型太新了,還不足以有這些。內部專家盲測是一個有用的訊號,能看出騰訊自家評測員如何看待它與GLM-5.3和Kimi K3的比較,但那是騰訊的評測員在騰訊的任務上做的測試。規格表之上的一切都只是有待查證的說法。

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent HY4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

今天應該由誰來拉重量

誠實的回答是,這次發布清楚地區分了兩類受眾。如果你在自己的基礎設施上運行工程工作負載,而封閉 API 的成本效益一直是你裹足不前的原因,那麼 Tencent HY4 Preview 現在就值得你花一個週末認真測試:權重是開放的,上下文視窗達到儲存庫規模,而標價讓長週期的代理式迴圈變得負擔得起,這是每百萬輸出 25 美元的模型永遠無法做到的。如果你運行的是對延遲敏感的生產級聊天、任何多模態應用,或任何無法承擔一個「只以供應商自家基準測試為證據」的模型的場景,那麼請等待——騰訊自二月以來保持的兩個月迭代節奏表明,完整的 Hy4 正式版已不遠矣,而這預覽版明確是帶有已知瑕疵的早期迭代。

務實的中間路線是一種路由模式:在關鍵路徑上運行經實證的模型,並讓新模型並行其中,在成本效益佔優的任務上換用 Tencent HY4 Preview,若不佔優則自動回退。這正是路由器存在的意義——以各家供應商定價承載 Claude Opus 5、DeepSeek V4 Pro 與 Gemini 3.1 Pro 的同一個 OrcaRouter,將在 Tencent 開放此模型的那一天起承載它。在那之前,權重已放上 GitHub,API 在 Tencent Cloud,而「開放權重模型已達到代理式編碼頂級水準」的說法,終於有了具體數字可資佐證。數字是 Tencent 的;考驗是你自己的。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube