
騰訊 HY4 預覽版 vs GPT-5.6 Sol:工具呼叫的宣稱,讓開放權重直面前沿模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
Tencent HY4 Preview 是數月以來首個在發布規格表中明確宣稱勝過 GPT-5.6 Sol 的開放權重模型。所涉數字來自 Toolathlon-Verified——一個用於評測代理式工具呼叫的基準——騰訊報告 HY4 Preview 得分為 74.1,領先 Qwen3.8-Max,且按騰訊自己的比較,也領先 GPT-5.6 Sol。在其他所有維度上,這兩個模型並非真正的同級對手:GPT-5.6 Sol 是 OpenAI 的封閉式旗艦前沿模型,且經獨立測量;而 Tencent HY4 Preview 則是一個 7700 億參數的開放權重預覽版,於今天上午發布,附帶的是廠商自行申報的評分卡,沒有第三方驗證。
所以,有趣的問題不在於{{1}}「哪個模型更聰明」{{/1}}——而在於{{2}}一個輸入價格約為{{3}}Sol 的{{/3}}六分之一的開放權重挑戰者,能否可信地主張在前沿佔有一席之地;以及團隊該如何應對一個{{4}}目前無法驗證{{/4}}的主張{{/2}}。
讓這成為一場真正對決的說法
Toolathlon-Verified 衡量的是模型在完整代理式任務中可靠驅動工具的能力——讀取結果、決定下一次呼叫、從錯誤中恢復——而非它如何寫好單一函式。這件事之所以重要,是因為前沿模型實際 API 支出的最大佔比流向代理迴圈,而不是單次生成。騰訊在該基準上的 74.1 分,正是將 HY4 Preview 放進 GPT-5.6 Sol 對話中的那項具體主張,值得我們駐足思考:這種數字如果經得起獨立複現,就會讓開源權重與封閉前沿之間的成本對話變得更為真實;如果經不起,就會變成又一個在第三方評測框架下煙消雲散的廠商成績單。
兩種購買智慧的方式

• 參數 — HY4 Preview:770B 總參數 / 49B 啟用參數,開放權重;對比 GPT-5.6 Sol:參數數量未公開,封閉 API
• 上下文 — HY4 Preview >1M tokens,對比 GPT-5.6 Sol 的 1.05M tokens,最大輸出 128K
• 每 1M 價格 — HY4 Preview ¥6 輸入 / ¥18 輸出(約 $0.85 / $2.50),對比 GPT-5.6 Sol 基本層級 $4.00 / $20.00,大上下文請求升至 $8.00 / $30.00,快取讀取 $0.40
• 輸入模態 — HY4 Preview 在此預覽版中僅支援文字,而 GPT-5.6 Sol 支援文字與圖像輸入
• 推理模式 — HY4 Preview 沒有已發佈的對應功能;GPT-5.6 Sol 則具備 Ultra 模式(最多 16 個並行子代理)與 Max 推理強度
「• 獨立驗證 — HY4 Preview 尚無任何結果,而 GPT-5.6 Sol 則已出現在各大主要排行榜上,並在長上下文綜合測試中以 1.05M 的上下文長度獲得頂級排名。」
價格欄位是整個對決的關鍵所在。在基準層級,GPT-5.6 Sol 每百萬輸入 token 收費 4.00 美元,每百萬輸出 token 收費 20.00 美元。騰訊 HY4 Preview 按當前匯率計算,分別約為 0.85 美元和 2.50 美元。對於大量輸出 token 的工作負載——例如代理式編碼——開放權重模型的定價大約是封閉模型的八分之一,而且即使考慮到 Sol 的價格數據背後有更多驗證支援,這個差距依然存在。
在 GPT-5.6 Sol 仍佔優勢之處
驗證是第一個優勢。GPT-5.6 Sol 自 7 月 9 日起正式上市,並自此接受獨立評測:在 Terminal-Bench 2.1 基礎推理得分 88.8,Ultra 模式 91.9,Agents' Last Exam 53.6(發表時紀錄),GPQA Diamond 94.6,以及 SWE-bench Pro 64.6。OpenAI 亦報告其智能體程式設計任務的 token 效率比自家上一代旗艦提升 54%。這些數字都可以在 OpenAI 自家文件之外找到重現結果,而這正是 Tencent HY4 Preview 目前所缺乏的特性。
能力是第二個優勢,而且是結構性的,而非邊際性的。GPT-5.6 Sol 接受影像輸入;HY4 Preview 在此預覽版中僅支援文字,騰訊也承認視覺功能必須等到完整版發布。GPT-5.6 Sol 搭載 Ultra 模式——一種多代理配置,以三到四倍的 token 成本協調並行子代理,正好適用於這兩個模型實際上會競爭的長期工程任務。而 Sol 的電腦使用與程式化工具呼叫路徑皆有文件記載、已在生產規模下實際運行,並經過負載測試。騰訊的 Toolathlon-Verified 宣稱若能被複現,將縮小工具使用上的差距;但它並未縮小多模態或多代理方面的差距,而 HY4 Preview 並未嘗試解決這些問題。
HY4 Preview 真正有趣的地方在於
把基準測試的排場擱到一邊,真正留下來的是三件事。第一是價格:¥6/¥18——約合 $0.85/$2.50——騰訊在輸出 token 的定價上比所有西方前沿模型便宜四到八倍,在輸入定價上也低於中國自家開放權重的同行。第二是開放權重:一個 49B 活躍參數的 MoE 可以部署在單一節點上,這是 Sol 從未公開的架構永遠做不到的,而且權重已經上架 HuggingFace、ModelScope 和 GitHub。第三是上下文長度與工程路線:DeepSWE 64.3 和超過 100 萬 token 的上下文視窗,瞄準的正是 Sol 的 Ultra 模式所鎖定的長程代理型工作負載,而成本只是其一小部分。
{{1}}老實說,這些都還沒有經過獨立基準測試的考驗。騰訊所講的自優化故事——模型自行迭代推理堆疊後端到端吞吐量提升31.8%——是內部測量的結果。{{2}}盲測勝過GLM 5.3和Kimi K3也是內部進行的。{{3}}HY4 Preview目前所有令人感興趣的地方,{{4}}都只是宣稱而已。{{5}}{{6}}{{7}}
決定
如果你今天要建置生產系統,GPT-5.6 Sol 是站得住腳的選擇,而且可以透過 OrcaRouter 以 OpenAI 自己的分層牌價取得——基本層為 $4.00/$20.00,其上為 $8.00/$30.00,零加價轉傳,所以任何供應商價格變動當天就會在我們這邊生效。如果你的工作流程是 agentic 且工具密集,這種分層結構意味著你應該將實際輸入大小與 $272K token 門檻比對,而不是假設固定費率。
如果你願意進行影子評估,HY4 Preview 的價格低到值得認真一試:今天就透過 Sol 路由你的工具調用工作負載,透過騰訊自己的 API 對 HY4 Preview 執行相同的提示詞,然後在你自己的 Toolathlon 風格任務上進行比較。如果獨立評分落在騰訊所說的位置,切換路徑很短——開放權重模型直接放進路由器,你的故障轉移規則交換端點,而供應商的 ¥6/¥18 費率原封不動地傳遞。這就是這場對決的真實結構:一個你今天就可以在其上建置的已驗證前沿模型,對上一個未經驗證的開放挑戰者——它夠便宜所以值得測試,而且定位在讓價格討論圍繞整個開放權重類別展開。


看什麼
• Toolathlon-Verified 的首次獨立複現。如果第三方測試框架確認 HY4 Preview 的成績落在 70 多分,「開放權重無法勝任代理式工具使用」的論點便不攻自破。
• 騰訊是否會在完整的 Hy4 發布之前推出視覺功能。純文字的 HY4 Preview 僅限於 GPT-5.6 Sol 可處理工作負載的一個嚴格子集。
• HY4 Preview 的長思考傾向所帶來的實際 token 帳單。以每百萬輸出 token 人民幣 18 元計算,冗長的自我驗證侵蝕價格優勢的速度比 20 美元的模型更快。
• Sol 的分層定價是否會在 Hy4 全面推出前再次調降。路由器的轉嫁效應意味著降價當天即可看到。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
