
Tencent HY4 Preview 對決 Qwen3.8-Max:八月開放權重模型大比拼
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
Tencent HY4 Preview 與 Qwen3.8-Max 的對決,是本月一直在醞釀的碰撞。阿里巴巴的 Qwen3.8-Max 於 8 月 3 日正式全面上市,並在 8 月 12 日成為首款開放權重的 Max 級 Qwen;25 天後的今天上午,騰訊 HY4 Preview 登場,其發布資料直接點名 Qwen3.8-Max——騰訊宣稱 HY4 Preview 在 Toolathlon-Verified 上獲得 74.1 分,領先 Qwen3.8-Max。兩者皆為開放權重的中國旗艦模型,定價皆具競爭力,但其中只有一款具備獨立評測分數。
這兩個模型之間的差距不僅僅是規模——Qwen3.8-Max 擁有 2.4 兆個參數,而 HY4 Preview 只有 7,700 億個——但在對買家重要的代理式基準測試上,它們瞄準的是同一個目標:長時間跨度的任務,即模型在沒有人類介入的情況下進行閱讀、呼叫工具並反覆迭代。這正是八月份開源權重世代試圖證明自己可以取代封閉前沿模型的領域,而騰訊的第一步就是向本月最大的開源發布發起挑戰。
計分板

• 規模 — HY4 Preview 總參數 770B / 活躍參數 49B,對比 Qwen3.8-Max 總參數 2.4T / 活躍參數約 95B
• 上下文 — HY4 Preview 在 API 上支援超過 1M tokens,而 Qwen3.8-Max 為 1M tokens(開放權重中原生支援 262K,可擴展至約 1.01M)
• 每百萬令牌價格 — HY4 Preview ¥6 輸入 / ¥18 輸出(約 $0.85 / $2.50)對比 Qwen3.8-Max $2.00 輸入 / $6.00 輸出,快取讀取 $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4(廠商回報)對比 Qwen3.8-Max 86.6
• 模態 — 兩者的開放權重版本均僅支援文字;Qwen3.8-Max API 增加了圖片和影片輸入,HY4 Preview 預覽版則不支援
• 獨立評分 — HY4 Preview 無 vs Qwen3.8-Max AA,智能指數 58、智能體指數 58
這兩張卡片從相反的角度講述同一個故事。在 Terminal-Bench 2.1 上,Qwen3.8-Max 的 86.6 與 HY4 Preview 的 85.4 相差一分半——其中一分對 Qwen 有利,而 HY4 的數據未經審計。在價格方面,HY4 Preview 在每個 token 的輸入和輸出上都更便宜。在驗證方面,Qwen3.8-Max 擁有獨立的 Intelligence Index 58 和 Agentic Index 58;HY4 Preview 則只有自家宣傳。這種差距是典型的挑戰者模式:以更低的價格和未經驗證的主張,對抗經過驗證的現任者。
閱讀 Toolathlon 的聲明
{{1}}Toolathlon-Verified{{/1}} 衡量代理式工具使用的可靠性——亦即模型在包含錯誤、恢復與多步驟呼叫的完整任務中驅動工具的一致程度。{{2}}騰訊{{/2}}的 74.1 分直接瞄準 {{3}}Qwen3.8-Max{{/3}} 各項表現中最強的一環,因為 {{4}}Qwen{{/4}} 的 Agentic Index 58 分,以及其 OSWorld-Verified 的 86.1 分,正是讓 {{5}}阿里巴巴{{/5}} 的代理式願景站得住腳的數字。{{6}}Qwen3.8-Max{{/6}} 在 IFBench(指令遵循)也繳出 82.8 分,在 PaperBench(研究級代理式工作)繳出 93.0 分,兩者在其自家榜單上都領先 {{7}}GPT-5.6 Sol{{/7}} 等模型。於是 {{8}}騰訊{{/8}} 選擇了那個它宣稱能直接贏過本月最大開源模型的基準——而這項宣稱目前的可驗證性,與其他任何單一廠商自報的數據並無二致:完全無法驗證。
Verified vs vendor-reported 的繁體中文翻譯是: **已驗證 vs 供應商回報**
這是雙方對比最不公平的軸線,而這種不對稱值得明確點出。Qwen3.8-Max 的 Intelligence Index 58 分來自 Artificial Analysis,其 Agentic Index 58 分同樣來自 Artificial Analysis;賦予它這些分數的同一套獨立測試框架,也量測出它的弱點:在 AA-Omniscience 上的幻覺率高達 40%,高於上一代的 23%,而且每項任務耗用多達 64 次代理回合——這個模型很賣力,但你得為每一次回合付出代價。Tencent HY4 Preview 完全沒有這類實測機制。它的優勢只是宣稱,而它的失敗模式——騰訊自己標註的「長時間思考」與「過度自我驗證」——是承認,而非測量。
對於在這兩者之間做選擇的團隊而言,驗證差距並非抽象概念。Qwen3.8-Max 每次任務執行 64 輪次的行為,是一個真實且經實測的成本驅動因素:在 $2/$6 的價格下,它在某些第三方比較中仍是完成每項任務最昂貴的 agent,且已有團隊回報,其輪次數量正在侵蝕它的價格優勢。HY4 Preview 的等效行為則屬未知——它每項任務的實際成本可能比其本已偏低的每 token 價格所暗示的還要便宜,也可能因其自我驗證的習慣而耗掉這項價差。目前還沒有人能告訴你是哪一種,因為除了騰訊內部之外,還沒有任何人實際運行過它。
價格與開放權重的實際考量
以每個 token 計,HY4 Preview 在計價的兩端都更便宜:¥6/¥18 對比 Qwen3.8-Max 的 $2.00/$6.00,快取命中為 ¥0.3 對比 $0.25。這使 HY4 Preview 成為無論輸入或輸出都最便宜的開源權重旗艦,就是這樣。但是,「開源權重」伴隨著兩套不同的細則。Qwen3.8-Max 的開源權重版本——Qwen3.8-2.4T-A95B——僅限文字,且強制開啟思考模式;原生上下文為 262K,而非 API 的 1M;還採用自訂授權,內含按規模分級的條件:每月用戶超過 1 億時須顯示模型名稱,而大型 Model-as-a-Service 企業則需另行取得授權。截至今天上午,Tencent HY4 Preview 的權重已發布於 HuggingFace、ModelScope 和 GitHub,但其確切授權條款,以及這些權重是否與所提供 API 的版本一致,尚未獲得同等程度的明確說明。兩個模型都可下載,但都不像下載後就能直接使用那麼簡單。
底線
{{1}}Qwen3.8-Max 在驗證所能換取安全性的每個方面都是更穩妥的選擇:獨立評分的智力與代理型工作表現、已知的失敗模式、已定案的授權條款,以及三週的生產環境回饋。但它的每 token 成本也更高,而其測得的多輪密集行為是已知的成本風險。{{/1}} {{2}}Tencent HY4 Preview 是價值型賭注:輸入與輸出都更便宜、Terminal-Bench 宣稱表現相當,並直接以 Toolathlon-Verified 對標 Qwen——但這一切在第一天都未經驗證。{{/2}} {{3}}如果你本週要將開放權重模型投入生產,Qwen3.8-Max 是站得住腳的選擇,而且它已在 OrcaRouter 上線,以 Alibaba 官方定價——$2.00/$6.00——不加價直接轉售。{{/3}} {{4}}HY4 Preview 是評估型專案:透過 Tencent 自家的 API,用你自己的 Toolathlon 風格任務來跑;生產路徑維持在已驗證的模型上。當獨立評分出爐——或當 HY4 Preview 登上路由器、其 ¥6/¥18 費率成為當日直通價——屆時切換只是路由規則的變更,而非重寫。{{/4}}


看什麼
• HY4 Preview 在智能體測試框架上的首次獨立運行。Toolathlon 認證的 74.1 是 Tencent 想要贏得的數字;第三方 Agentic Index 將是確認。
• HY4 Preview 的實測回合數。Qwen3.8-Max 每個任務 64 回合的數據堪稱前車之鑑;HY4 Preview 每個已完成任務是否更便宜,正是整個經濟論點的核心所在。
• 權重的授權條款。它們將決定「開放」對 HY4 Preview 而言是否意味著「可在你的規模下使用」,正如 Qwen3.8-Max 授權條款對阿里巴巴的模型所做的那樣。
兩家供應商是否會再次降價。這個月,兩款開放權重旗艦以激進定價出貨,因此路由器上的轉嫁價格會讓任何進一步的降價當天就顯現出來。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
