一張用於對比「Tencent HY4 Preview vs GPT-5.6 Sol」的主視覺標題卡。中央重點標語寫著「Toolathlon-Verified 74.1 —— 開放權重對前沿模型的宣稱」,並附註「騰訊聲稱其模型在代理式工具呼叫上領先 GPT-5.6 Sol」。左側卡片「Tencent HY4 Preview」列出「開放權重,770B / 49B 活化參數」、「每 1M 令牌 ¥6 / ¥18」、「尚無獨立評測分數」。右側卡片「GPT-5.6 Sol」列出「封閉 API,OpenAI 旗艦模型」、「每 1M 令牌基礎費用 $4 / $20」、「Terminal-Bench 2.1:88.8」。頁尾文字寫著「HY4 Preview 數據為廠商自行回報;Sol 數據已廣泛重現。」OrcaRouter 標誌合成於右下角。
Guides & Insights

騰訊 HY4 預覽版 vs GPT-5.6 Sol:工具呼叫的宣稱,讓開放權重直面前沿模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Tencent HY4 Preview 是數月以來首個在發布規格表中明確宣稱勝過 GPT-5.6 Sol 的開放權重模型。所涉數字來自 Toolathlon-Verified——一個用於評測代理式工具呼叫的基準——騰訊報告 HY4 Preview 得分為 74.1,領先 Qwen3.8-Max,且按騰訊自己的比較,也領先 GPT-5.6 Sol。在其他所有維度上,這兩個模型並非真正的同級對手:GPT-5.6 Sol 是 OpenAI 的封閉式旗艦前沿模型,且經獨立測量;而 Tencent HY4 Preview 則是一個 7700 億參數的開放權重預覽版,於今天上午發布,附帶的是廠商自行申報的評分卡,沒有第三方驗證。

所以,有趣的問題不在於{{1}}「哪個模型更聰明」{{/1}}——而在於{{2}}一個輸入價格約為{{3}}Sol 的{{/3}}六分之一的開放權重挑戰者,能否可信地主張在前沿佔有一席之地;以及團隊該如何應對一個{{4}}目前無法驗證{{/4}}的主張{{/2}}。

讓這成為一場真正對決的說法

Toolathlon-Verified 衡量的是模型在完整代理式任務中可靠驅動工具的能力——讀取結果、決定下一次呼叫、從錯誤中恢復——而非它如何寫好單一函式。這件事之所以重要,是因為前沿模型實際 API 支出的最大佔比流向代理迴圈,而不是單次生成。騰訊在該基準上的 74.1 分,正是將 HY4 Preview 放進 GPT-5.6 Sol 對話中的那項具體主張,值得我們駐足思考:這種數字如果經得起獨立複現,就會讓開源權重與封閉前沿之間的成本對話變得更為真實;如果經不起,就會變成又一個在第三方評測框架下煙消雲散的廠商成績單。

兩種購買智慧的方式

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• 參數 — HY4 Preview:770B 總參數 / 49B 啟用參數,開放權重;對比 GPT-5.6 Sol:參數數量未公開,封閉 API

• 上下文 — HY4 Preview >1M tokens,對比 GPT-5.6 Sol 的 1.05M tokens,最大輸出 128K

• 每 1M 價格 — HY4 Preview ¥6 輸入 / ¥18 輸出(約 $0.85 / $2.50),對比 GPT-5.6 Sol 基本層級 $4.00 / $20.00,大上下文請求升至 $8.00 / $30.00,快取讀取 $0.40

• 輸入模態 — HY4 Preview 在此預覽版中僅支援文字,而 GPT-5.6 Sol 支援文字與圖像輸入

• 推理模式 — HY4 Preview 沒有已發佈的對應功能;GPT-5.6 Sol 則具備 Ultra 模式(最多 16 個並行子代理)與 Max 推理強度

「• 獨立驗證 — HY4 Preview 尚無任何結果,而 GPT-5.6 Sol 則已出現在各大主要排行榜上,並在長上下文綜合測試中以 1.05M 的上下文長度獲得頂級排名。」

價格欄位是整個對決的關鍵所在。在基準層級,GPT-5.6 Sol 每百萬輸入 token 收費 4.00 美元,每百萬輸出 token 收費 20.00 美元。騰訊 HY4 Preview 按當前匯率計算,分別約為 0.85 美元和 2.50 美元。對於大量輸出 token 的工作負載——例如代理式編碼——開放權重模型的定價大約是封閉模型的八分之一,而且即使考慮到 Sol 的價格數據背後有更多驗證支援,這個差距依然存在。

在 GPT-5.6 Sol 仍佔優勢之處

驗證是第一個優勢。GPT-5.6 Sol 自 7 月 9 日起正式上市,並自此接受獨立評測:在 Terminal-Bench 2.1 基礎推理得分 88.8,Ultra 模式 91.9,Agents' Last Exam 53.6(發表時紀錄),GPQA Diamond 94.6,以及 SWE-bench Pro 64.6。Ope​nAI 亦報告其智能體程式設計任務的 token 效率比自家上一代旗艦提升 54%。這些數字都可以在 Ope​nAI 自家文件之外找到重現結果,而這正是 Tencent HY4 Preview 目前所缺乏的特性。

能力是第二個優勢,而且是結構性的,而非邊際性的。GPT-5.6 Sol 接受影像輸入;HY4 Preview 在此預覽版中僅支援文字,騰訊也承認視覺功能必須等到完整版發布。GPT-5.6 Sol 搭載 Ultra 模式——一種多代理配置,以三到四倍的 token 成本協調並行子代理,正好適用於這兩個模型實際上會競爭的長期工程任務。而 Sol 的電腦使用與程式化工具呼叫路徑皆有文件記載、已在生產規模下實際運行,並經過負載測試。騰訊的 Toolathlon-Verified 宣稱若能被複現,將縮小工具使用上的差距;但它並未縮小多模態或多代理方面的差距,而 HY4 Preview 並未嘗試解決這些問題。

HY4 Preview 真正有趣的地方在於

把基準測試的排場擱到一邊,真正留下來的是三件事。第一是價格:¥6/¥18——約合 $0.85/$2.50——騰訊在輸出 token 的定價上比所有西方前沿模型便宜四到八倍,在輸入定價上也低於中國自家開放權重的同行。第二是開放權重:一個 49B 活躍參數的 MoE 可以部署在單一節點上,這是 Sol 從未公開的架構永遠做不到的,而且權重已經上架 HuggingFace、ModelScope 和 GitHub。第三是上下文長度與工程路線:DeepSWE 64.3 和超過 100 萬 token 的上下文視窗,瞄準的正是 Sol 的 Ultra 模式所鎖定的長程代理型工作負載,而成本只是其一小部分。

{{1}}老實說,這些都還沒有經過獨立基準測試的考驗。騰訊所講的自優化故事——模型自行迭代推理堆疊後端到端吞吐量提升31.8%——是內部測量的結果。{{2}}盲測勝過GLM 5.3Kimi K3也是內部進行的。{{3}}HY4 Preview目前所有令人感興趣的地方,{{4}}都只是宣稱而已。{{5}}{{6}}{{7}}

決定

如果你今天要建置生產系統,GPT-5.6 Sol 是站得住腳的選擇,而且可以透過 OrcaRouter 以 Ope​nAI 自己的分層牌價取得——基本層為 $4.00/$20.00,其上為 $8.00/$30.00,零加價轉傳,所以任何供應商價格變動當天就會在我們這邊生效。如果你的工作流程是 agentic 且工具密集,這種分層結構意味著你應該將實際輸入大小與 $272K token 門檻比對,而不是假設固定費率。

如果你願意進行影子評估,HY4 Preview 的價格低到值得認真一試:今天就透過 Sol 路由你的工具調用工作負載,透過騰訊自己的 API 對 HY4 Preview 執行相同的提示詞,然後在你自己的 Toolathlon 風格任務上進行比較。如果獨立評分落在騰訊所說的位置,切換路徑很短——開放權重模型直接放進路由器,你的故障轉移規則交換端點,而供應商的 ¥6/¥18 費率原封不動地傳遞。這就是這場對決的真實結構:一個你今天就可以在其上建置的已驗證前沿模型,對上一個未經驗證的開放挑戰者——它夠便宜所以值得測試,而且定位在讓價格討論圍繞整個開放權重類別展開。

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

看什麼

• Toolathlon-Verified 的首次獨立複現。如果第三方測試框架確認 HY4 Preview 的成績落在 70 多分,「開放權重無法勝任代理式工具使用」的論點便不攻自破。

• 騰訊是否會在完整的 Hy4 發布之前推出視覺功能。純文字的 HY4 Preview 僅限於 GPT-5.6 Sol 可處理工作負載的一個嚴格子集。

• HY4 Preview 的長思考傾向所帶來的實際 token 帳單。以每百萬輸出 token 人民幣 18 元計算,冗長的自我驗證侵蝕價格優勢的速度比 20 美元的模型更快。

• Sol 的分層定價是否會在 Hy4 全面推出前再次調降。路由器的轉嫁效應意味著降價當天即可看到。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube