Tencent Hy4 預覽版的主視覺標題卡。置中標題顯示「Tencent Hy4 Preview — 開放權重、首日 vLLM 支援」。副標題行顯示「770B MoE · 49B 活躍參數 · 1M 上下文」。四個規格標籤顯示「開放權重 (Apache 2.0)」、「vLLM + SGLang 首日支援」、「8 卡 GPU 服務 (FP8)」、「每 MTok ¥6 / ¥18」。頁尾行顯示「2026 年 8 月 28 日發布 · 以 vLLM 運行」。OrcaRouter 標誌合成於右下角。
Guides & Insights

騰訊 Hy4 預覽版首日即支援 vLLM:真正可部署的 770B 開放權重 MoE

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

當騰訊Hy4預覽版於2026年8月28日發布時,它做到了一件大多數前沿級旗艦模型上市首日都會略過的事:它推出時即可運行。除了開放權重之外,騰訊與vLLM團隊還發布了預先建置的Docker映像檔、一份官方服務配置方案,並將框架支援直接合併進vLLM本體,因此混元系列迄今為止最大的開放權重模型——總參數7,700億,每個token活躍490億參數——在公告發布後數小時內,就能以OpenAI相容端點的形式,在你自己的GPU上運行。這種首日即可部署的運行能力,正是本文要探討的新聞重點,因為對這種規模的模型來說,「能在vLLM中運行」並非附註,而是新聞稿與能實際投入生產的東西之間的差別。

發布的其餘部分一如往常的預覽版套件,而注意事項與數據本身同樣重要。騰訊稱 Tencent Hy4 Preview 為早期迭代版本,將過長的推理與過度的自我驗證標記為已知行為,並發布了一份完全自行報告的基準測試表——目前尚無獨立實驗室對其進行評分,截至撰寫本文時,該模型推出僅兩天。這些都不改變實際重點:權重採用 Apache 2.0 授權,上下文窗口為 100 萬個 token,且發布首日即支援 vLLM,代表自行部署的路徑是真實可行,而非理想化的願景。

騰訊 Hy4 Preview 實際上是什麼

騰訊將 Tencent Hy4 Preview 定位為 Hy3(總參數 295B,上下文長度 256K)的繼任者,活躍參數容量約成長一倍,上下文窗口則擴增為四倍。其架構值得逐行細讀,因為每一行都在改變開放權重模型在你的硬體上所能被允許做到的事情。

• 架構 — 混合專家模型(Mixture-of-Experts),總參數量 770B,每個 token 在 78 層中啟動 49B 參數。第一層為密集層;其餘 77 層會將每個 token 路由至 256 個路由專家加上一個共享專家,並啟動其中最佳的 8 個。大約 16:1 的稀疏比例,正是讓推論成本維持在一個正經團隊實際能運行的範圍內的關鍵。

• 上下文窗口 — 原生支援 1,048,576 個 tokens,是所有開放權重模型中最寬廣的之一。完整的程式碼庫、多檔案重構、長文件批次:單次請求即可解決的問題。

• 注意力 — 帶有 IndexCache 的 Gated Deep​Seek Sparse Attention(Gated DSA),這是一種稀疏注意力設計,僅在 78 層中的 21 層計算新的稀疏索引,並在其他 57 層重複使用。這就是為什麼為其提供服務不僅僅是「更大的 vLLM」——它需要一個理解稀疏注意力的後端。

• 內建推測解碼(speculative decoding)— 一個總參數約10B / 活躍參數約0.7B的MTP(多 token 預測)層位於模型內部,因此vLLM和SGLang可以在無需您託管獨立草稿模型的情況下產生草稿 token。

• 權重 — Apache 2.0,同時提供 BF16 與 FP8 檢查點格式,已發布至 Hugging Face、ModelScope、GitCode 和 CNB。

「day-zero vLLM」的真正含義

發布當天合併的框架支援,是這項訊號背後的具體事件——新增 Tencent Hy4 Preview(PR #54160)的 vLLM 變更,與正式版發布落在同一個時間視窗,官方配方也鎖定 vLLM 0.29.0 或更新版本。實際操作上,這代表服務部署路徑只需一行指令,而非一整個星期的核心除錯。

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

這些旗標很重要,每個旗標都對應到模型中的特定事物,而不是制式樣板:

• --attention-backend FLASHMLA_SPARSE — 必要,非選用。Tencent Hy4 Preview 的 Gated DSA 稀疏注意力在預設的密集後端上無法正確執行,而官方配方正是設定此旗標。

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — 啟用模型內建的 MTP 層進行推測解碼,可提前生成三個草稿 token。無需部署額外的草稿模型。

• --tool-call-parser hy_v4 和 --reasoning-parser hy_v4 —— 這兩個自訂剖析器會告訴伺服器 Tencent Hy4 Preview 如何發出工具呼叫及其思考鏈,搭配 --enable-auto-tool-choice 可讓模型自行決定何時呼叫工具。

騰訊建議取樣時使用溫度 0.9 與 top_p 1.0。推理預設為「高」運算力的思維鏈,專注於數學、程式編寫與複雜任務;若你希望直接獲得回應、不需冗長思考,可在請求中傳入 no_think 推理強度,而無需替換權重。

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

首日支援並非僅限於 vLLM,這對於如此新穎的發行版本而言,本身就值得注意。SGLang 當天就釋出了預先建置的多架構映像檔(lmsysorg/sglang:hy4-preview),並支援 NEXTN 風格的推測解碼;而 Ascend 生態系也透過 vLLM-Ascend 獲得了 0-day 支援,在 16 張 Atlas 800I A3 NPU 上使用 W8A8 量化權重。開放權重的發行版本,服務生態系通常需要數週才能跟上;這次只花了數小時。

值得引用的分數

每項騰訊為Tencent Hy4 Preview發布的基準測試都是供應商自行報告的——在騰訊自家的評估環境中運行,未經任何獨立實驗室複現,且該模型已公開兩天。請將這些結果視為騰訊自認達到的天花板,而非既定事實。在第三方實際運行之前,獨立驗證不會存在;公開排行榜上尚無任何反映此模型的數據。

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

最引人注目的數字是 Terminal Bench 2.1——一項測試模型在編碼時驅動真實終端能力的基準。騰訊報告 Tencent Hy4 Preview 達到 85.4,宣稱與 Claude Opus 5 持平並超越 DeepSeek V4 Pro,也比自家前代 Hy3 高出 14.6 分。這一個數字撐起了整次發布——它宣稱一款開放權重模型在一項艱難的代理式編碼測試中,與最昂貴的封閉前沿模型平起平坐——而這正是最需要獨立驗證的宣稱。

內部表格的其餘部分,全都是騰訊自家的數據:軟體工程基準 DeepSWE 從 Hy3 上的 28.0 躍升至 64.3。SWE-bench Pro 得分為 65.7,SWE-bench Multilingual 為 82.9。在工具呼叫測試 Toolathlon-Verified 上,騰訊報告 74.1,稱其超越 Qwen 3.8 Max 與 GPT-5.6 Sol,並接近 Kimi K3 與 Claude Opus 5。在 APEX-Agents pass@1 上,它落在 37.1,僅以些微差距落後 Kimi K3 的 37.2。而在另一項內部盲測中,163 位騰訊聘請的專家為 203 項工程任務打分,平均 4.00 分中獲得 2.99 分,略勝 GLM-5.3 的 2.92 與 Kimi K3 的 2.94。

有兩個模式值得注意。每個亮眼的數字都出現在代理式工程工作上——終端操作、工具呼叫、倉儲規模任務——而沒有一個出現在一般知識或推理上,這符合生產力定位,而非巧合。騰訊將 DeepSWE 及其他模型描述為縮小而非消除差距;唯一一個乾淨且可行銷的持平主張是 Terminal Bench 2.1 的平手,而這正是最值得用你自己的工作量來驗證的主張。

實際營運要花多少錢

首先必須誠實面對的是自架設的成本帳。這不是單 GPU 模型,也不是桌上型模型。FP8 檢查點光是權重就接近 1 TB,而官方配方假設張量並行度為 8——也就是八張具備快速互連的高頻寬 GPU(騰訊在 FP8 上的參考硬體是 8×B300,完整 BF16 則需要 16×B200)。如果你沒有那樣的硬體規模,就不可能便宜地自架設它;而且稀疏注意力後端意味著在 100 萬 token 的上下文下,KV 快取的記憶體需求沒有任何捷徑可繞過。

一個發布週的附加元件改變了那些想要開放權重但不想承擔旗艦級規模的團隊的部分盤算。騰訊的 Hy 團隊發布了一個壓縮的 GGUF 版本 Tencent Hy4 Preview,透過其稱為 MIX-STQ1_0 的逐層混合量化方案,將約 1.5 TB 的 BF16 版本壓縮至大約 200 GiB——大部分專家張量降到約 1.3 位元,而殘差流關鍵層則保持較高精度。在騰訊自己的評估中,準確度變化很小:SWE-bench Multilingual 從 82.9 降至 81.3,MCP Atlas 從 83.7 降至 83.2,IFBench 從 73.5 降至 72.5——供應商稱這是一項近乎無損的取捨。這些是騰訊在自己環境中得出的數字,尚未被外部複現。200 GiB 的模型仍不是單 GPU 模型,但相較於接近 1 TB 的 FP8 checkpoint,它是明顯更小的賭注,也讓開放權重之路得以在比八顆 B300 配置所假設的更小的多 GPU 節點上實現。

API 路徑才是價格真正吸引人的地方。在騰訊雲的 TokenHub 上,Tencent Hy4 Preview 的定價為:每百萬輸入代幣 6 元(約 US$0.83),每百萬輸出代幣 18 元(約 US$2.50),以及每百萬快取命中代幣 0.3 元(約 US$0.04)。每百萬輸出約 2.50 美元的價格,遠低於頂級封閉前沿模型每百萬輸出 25 美元的定價;而低廉的快取命中價格,也讓長時間的代理循環(agentic loops)——系統提示與對話前綴不斷重複發送的情境——變得格外經濟實惠。

騰訊也正在替全新的 Tencent Hy4 Preview 在 WorkBuddy 與 CodeBuddy 內提供兩週免費試用,因此本週試用它的最便宜方式就是免費——而 WorkBuddy 正是生產力定位具體落地的所在。在任何 WorkBuddy 對話中,模型選擇器都能在 Hy3 與 Hy4 preview 之間切換,因此辦公室生產力與分析工作這一側、程式開發在另一側的區分,是每一次任務的選擇,而非部署決策。這種區分與騰訊為該模型設定的定位一致,而在 WorkBuddy 中的實機測試顯示,它能從單一提示詞一次完成複雜成果——從一個可遊玩的低多邊形遊戲原型、從十份附件彙整出完整季度業務回顧而完全不需要人工介入,以及在本週流傳的測試者示範中的黑洞模擬。這些是社群對騰訊自家應用程式的觀察,而非廠商基準測試——但它們是首批顯示該模型在真實多步驟任務上表現的實機訊號,而且在你花任何錢之前,都可以免費重現。

成本決策正是路由層改變成本計算的地方,我們也會誠實說明自己在其中的角色:OrcaRouter 目前還沒有路由 Tencent Hy4 Preview,因為 Tencent 尚未將此模型開放給第三方推論平台——它目前運行在 Tencent Cloud 自家的 TokenHub 端點,以及開放權重的自架部署上,我們不會宣稱提供我們實際上未提供的服務。路由層帶來的是圍繞於此的決策框架。如果你正在 8-GPU 節點和 API 之間做選擇,當 Tencent 開放此模型的那一天,目錄中其他項目所適用的相同不加價原則也會立即生效:OrcaRouter 以零加價方式傳遞供應商列表價格,因此供應商降價當天就會在我們這邊生效,而不是被轉售並加價。而對於一個才推出兩天、唯一依據只有供應商基準測試的模型,自動故障轉移是測試它的安全方式——將經過驗證的模型放在你的關鍵路徑上,並將 Tencent Hy4 Preview 放在旁邊,在成本效益勝出的任務上切換使用,一旦失去優勢就立刻回退,全程只需一個 API 和一把金鑰。

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

無法寫入規格表的極限

Tencent 明確列出了已知的限制,而這些限制應左右任何部署決策。Tencent Hy4 Preview 是純文字模型,僅此而已——不支援視覺或多模態輸入——因此任何與圖像或影片相關的任務都應交由其他模型處理。Tencent 也指出了複雜任務上的慢啟動行為(首次輸出前需要長時間思考),以及過度自我驗證的傾向,浪費 token 去重複檢查已完成的工作。這種組合對延遲敏感的聊天場景完全不適合,但對離線批次工程工作則完全可以接受,這也說明了 Tencent 預期你應在何種環境下運行它。

發表材料中的兩項主張值得分別關注,因為它們關乎模型是如何建構的,而非模型得了多少分。騰訊表示,Tencent Hy4 Preview 參與了自身的開發過程——它協助優化了產出自身的訓練方法、資料策略、評估框架及底層運算子,形成一個早期的遞迴自我改進迴路——並且它自主優化了自身的推論系統,相較基線實現了 31.8% 的端到端吞吐量提升。在科學層面,騰訊報告稱其將凸幾何中 Blaschke–Lebesgue 問題的已知下界從 0.380799 推進至 0.41104,並在一個含 32,512 個原子的磷脂雙層模擬中實現 2.0 倍加速,每步計算時間降至 54.9 毫秒。與第一天的其他所有內容一樣,這些都是騰訊單方面的說法。

而最重要的缺失是驗證。Tencent Hy4 Preview 至今在公開排行榜、第三方評測實驗室或 Artificial Analysis 上都還沒有任何獨立評分。這個模型太新了,還來不及有這些。內部專家盲測是一個有用的信號,可以看出騰訊自家評測者如何評價它對比 GLM-5.3 和 Kimi K3,但這是騰訊的評測者在騰訊的任務上做的測試。規格表之外的一切,都只是有待核實的說法。

本週誰應該執行 Tencent Hy4 Preview?

誠實的答案本週分為三組,其中一組完全不需要任何硬體。如果你只是想體驗騰訊 Hy4 Preview 的功能,免費的 WorkBuddy 使用權是最快的路徑——不需要 GPU、不需要 API 金鑰,開啟對話、把模型選擇器切換到 Hy4 preview,然後交給它一個 Work 或 Coding 任務。如果你有 GPU 並以批次方式執行工程負載——長時程代理任務、倉庫規模分析、離線評估——這個模型現在就值得認真測試:權重已開放、上下文視窗達倉庫規模、vLLM 路線只需一條指令,而且發布週的 GGUF 版本降低了試跑的硬體門檻。如果你正在執行對延遲敏感的生產環境對話、任何多模態任務、或任何無法承擔一個只有廠商自家基準測試作為證據的模型,那就等待——騰訊自二月以來大約每兩個月迭代一次,而且它已表示下一批 Hy4 模型即將到來,因此預覽版明確只是早期迭代。

對其他人來說,有用的姿態是一種路由模式:在你已經信任的模型旁邊證明它,以一種你可以承擔損失的成本,並且只在它在你自己的工作負載上數據成立的地方進行擴展。這就是路由器存在的意義——等到騰訊把這個模型開放給第三方推論的那一天,它就會像其他任何模型一樣,加入這個單一 API、兩百多個模型、清單價格轉售的目錄,而故障轉移和組合工具也早已就位。在那之前,權重放在 Hugging Face 上,API 放在騰訊雲上,免費試用則在 WorkBuddy 裡——而「開放權重模型達到代理式編碼頂尖層級」這個說法,終於有了一個具體的數字來支撐。這個數字是騰訊的。測試是你自己的。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube