
GPT-6 Astra 與 Tencent HY4 Preview:一款模型具備稽核軌跡,而另一款則有基準測試表
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Tencent HY4 Preview与GPT-6 Astra若只看廠商自家公布的數字,是當今取得接近前沿水準的代理式編程能力最便宜的兩條路;但若看其他人的評測,它們則是該級距中最無從比較的兩個模型。Tencent HY4 Preview 於 2026 年 8 月 28 日發布並以 Apache 2.0 開源,每百萬輸入 token 為 $0.834、每百萬輸出 token 為 $2.501,採用 7,700 億參數的混合專家架構,上下文視窗突破一百萬 token,輸出上限為 64,000 token。GPT-6 Astra 自 2026 年 9 月 3 日起正式開放使用,價格為 $10.00 與 $50.00,視窗為 1,050,000 token,最大輸出為 128,000。Astra 的優勢背後有八份已發表的第三方評測支撐;HY4 Preview 的優勢則只有騰訊自家的終端機、工具呼叫與盲測評測背書,除此以外別無其他。這種不對稱並不代表較便宜的模型較弱。它代表的是:這兩者之中,只有一項比較可以被查核,另一項則只能選擇相信,而實務上的決策也會因而有所不同。
Apache 2.0 發行版實際上為你帶來了什麼
授權條款是這場對決中價格表無法表達的那一部分。Tencent HY4 Preview 不是打著開放權重旗號的託管式試探品——其權重可從 Hugging Face、GitHub、ModelScope 與 GitCode 下載,這意味著無論 Tencent 對自身定價、自身端點,或自身是否持續有意提供服務作出什麼決定,該模型都能存續下去。
• 架構——總參數 770B,每個 token 啟用 49B,78 層,256 個路由專家加一個共享專家,以及一個原生多 token 預測層用於推測解碼br /> • 服務特性——每秒 54.6 個輸出 token,首個 token 時間中位數為 6.26 秒,依據 OrcaRouter 各路由在滾動七日窗口內的測量br /> • 上下文與上限——1,048,576 token 窗口,最大輸出 64,000 tokenbr /> • 輸入介面——僅文字;無影像、無檔案、無音訊br /> • 推理控制——三個等級:high、low 與 none,預設為 high,另有文件記載的取樣建議:temperature 0.9 與 top_p 1.0br /> • 可靠性——同一七日窗口的錯誤率為 2.8%,而 Astra 路由為 10.3%
最後那組數字是這頁上最具行動價值的資訊,而且這是沒有廠商會針對自家模型公布的數據類型。Astra 的獨立基準測試分數較高,但過去一週它的路由大約每十次請求就失敗一次,而一個完全沒有獨立分數的模型則是每三十五次失敗一次。這兩個數字都不是在陳述模型本身——錯誤率衡量的是路由、速率限制與上游,而不是權重——但它們是正式生產系統實際會遇到的數字。

在哪裡可以將騰訊的數字與別人的數字相互核對
就目前已公開的證據而言,這確實極不尋常:Astra 和 HY Preview 都有一個 Terminal-Bench 2.1 的數字,而其中只有一個是廠商自行提報的。
• Terminal-Bench 2.1,操作真實終端機 — GPT-6 Astra 88.4,獨立評估;Tencent HY4 Preview 85.4,廠商回報br /> • 工具呼叫 — Astra 在 τ²-Banking 上 41.4,獨立評估;HY4 Preview 在 Toolathlon-Verified 上 74.1,廠商回報,且是在不同測試上br /> • 軟體工程 — HY4 Preview 在 DeepSWE 上 64.3,較前代 Hy3 的 28.0 提升,廠商回報br /> • 代理任務 — HY4 Preview 在 APEX-Agents 上 pass@1 37.1,廠商回報br /> • 人類偏好 — 由 163 位專家對 203 項工程任務評分,平均 2.99(滿分 4.00),由廠商執行,對比 GLM-5.3 的 2.92 與 Kimi K3 的 2.94br /> • 獨立指數 — GPT-6 Astra 的 Intelligence Index 54.7 與 GPQA Diamond 96.1,第三方;HY4 Preview 則沒有對應的指數
Terminal-Bench 那一行值得細究。獨立測得的 88.4 與廠商回報的 85.4 之間相差 3 分,這完全落在不同測試框架、不同輔助支架或不同取樣溫度所能造成的範圍內;因此,誠實的解讀並不是「Astra 領先三分」,而是「這個層級中最便宜的開放權重模型正宣稱並駕齊驅,而這個說法至少還算合理」。騰訊自身的措辭在這一點上很謹慎:它形容 DeepSWE 是「逐步縮小差距」,而非「已經追上」;而它唯一明確的並駕齊驅主張——在 Terminal-Bench 上與另一家廠商的頂尖閉源模型打成平手——正是最需要第二次測量的主張。
另外還有一項值得留意的變動,因為它改變的是經濟效益,而不是分數。2026 年 9 月 7 日,Tencent 將一項最佳化推送至實際運行的預覽版建置中,並表示這能減少複雜工作的推理回合數與每項任務的 token 用量。由於該模型按 token 計費,即使每 token 費率未變,每項完成的任務用到的 token 越少,該任務的成本就越低。這項節省幅度是 Tencent 自家的量測結果,Tencent 以外沒有人重現過——但這個機制是真實的,而這正是為什麼一個在 8 月發布的預覽版,到了 10 月實際運作時,可能比其發布說明所暗示的便宜許多。
64,000 個 token 的上限,是決定部署的規格。
規格表中段藏著最先咬人的限制,而那並不是品質。HY4 Preview 的最大輸出是 64,000 個 token,對比 Astra 的 128,000 個,而這款模型自述的用途正是程式編寫代理與長時間的工具使用鏈。一個生成的檔案、一份多檔案修補、一份冗長的結構化報告——這些都是會撞到上限的輸出;而在代理執行中,失敗不是答案稍微差一點,而是答案被截斷,必須由周邊的管線偵測並處理。
兩個模型都大約接收一百萬個 token 的輸入,因此文件閱讀這個情境確實是平手。差異完全在生成端,而且是兩倍之差,不是捨入誤差。再加上輸入面的差異——Astra 接受圖片與檔案,HY4 Preview 僅支援文字——浮現出的圖像是明確分工,而非排名:開放權重模型適合文字進、文字出的代理迴圈,其中交付物是工具呼叫或 diff;封閉模型則適合任何必須觀看某物或撰寫長篇內容的任務。
20× 產出率能換來什麼,逐行說明
• 輸入價格 — Tencent HY4 Preview 每 100 萬 $0.834,對比 GPT-6 Astra $10.00,約 12 倍br /> • 輸出價格 — HY4 Preview 每 100 萬 $2.501,對比 Astra $50.00,約 20 倍br /> • 快取輸入 — HY4 Preview 每 100 萬 $0.042,對比 Astra $1.00,約 24 倍br /> • 長請求級距 — Astra 對超過 272,000 個輸入 token 的整個請求重新計價為 $20.00 與 $75.00;HY4 Preview 的價目表沒有對應級距br /> • 400,000-token 提示的實際輸入費率 — HY4 Preview 維持不變為 $0.834,對比 Astra $20.00,約 24 倍br /> • 一般 agent 迴圈每百萬 token 成本,輸入輸出比 4:1 — HY4 Preview 約 $1.17,對比 Astra 約 $18.00br /> • 相同比例下單月 1 億 token 的成本 — HY4 Preview 約 $117,對比 Astra 約 $1,800
快取輸入這一項,對昂貴的一方而言是規模化表現最差的一項,因為代理迴圈每一輪都會重新送出同樣的系統提示與對話前綴。在 $0.042 對比 $1.00 的情況下,長時間迴圈中最便宜的 token 在 Tencent 模型上便宜了 24 倍,而這正是每 token 微小差異會最快複利放大的工作負載。每任務成本,這個能乾淨俐落地解決問題的指標,Tencent 根本完全沒有公布——因此,要取得真正重要的數字,唯一方法就是讓兩個模型跑過你自己的任務集,然後讀取 usage 物件。

掌握錯誤率的情況下,路由器在此處加入了什麼
這兩款模型都在 OrcaRouter 目錄中——tencent/hy4-preview 與 openai/gpt-6-astra——置於同一個 OpenAI 相容端點之後,各自依供應商本身的定價表原價轉供,零加成。最後這一點在這組合上比在大多數組合上更為重要,因為騰訊模型的定價表是以人民幣公布的:上方以美元呈現的數字是你實際看到的換算後價格,而非經銷商的加價,而且如果騰訊調整價格,這裡當天就會同步生效,不必等到下一次合約續約。
路由 DSL 正是這兩個模型不再互為替代方案的地方。這對模型的自然規則是在輸出端進行升級:把迴圈交給便宜的模型,而當回應因觸及 64,000 個 token 的上限而被截斷,或未通過你的結構描述檢查時,就針對openai/gpt-6-astra重試該步驟,它的輸出空間是兩倍。自動容錯移轉是這個論點的另一半,而當兩條路由之一在過去一週內每十個請求就有一個出錯時,這絕非理論上的問題——一場長時間的代理執行若被綁定在單一模型上,會連同其累積的上下文一起陣亡,而這兩個模型都不夠便宜,不能不小心就從頭重跑一次。

什麼會改變這個比較?
三件事,按它們能帶來多大改變的順序排列。對 HY4 Preview 的獨立評測——該模型已公開發布六週,沒有第三方評測指標,沒有可複現的 Terminal-Bench 分數,也沒有每項任務的成本數字,而唯一由廠商自行執行的盲測評估,是現存僅有的人類偏好資料。公布兩個模型每完成一項任務的成本,這將以一個數字取代本文中的每一個比率。以及騰訊對第三方推論的決定,因為 Apache 2.0 授權的權重任何人都可以部署提供服務,而一旦有競爭性的主機服務商架起 HY4 Preview,這個比較中便宜那一側的價格就會變成市場行情,而非一份價目表。
在那之前,可用的總結比任一家廠商的發布文都更狹隘,卻比記分板更誠實:GPT-6 Astra 是能力宣稱已經過檢驗的模型,輸出上限是兩倍,但有一條路由每十次請求就失敗一次。Tencent HY4 Preview 則是能力宣稱尚未經過檢驗的模型,有著公開的架構、開放授權、價格只要三分之一,而且在同一段期間內的錯誤率低得多。如果你的工作是文字進、文字出,而且不超過 64,000 個生成 token,那麼較便宜的模型並不是妥協——它就是正確答案,而稽核軌跡是你唯一要放棄的東西。
這對組合的自然規則是依輸出量升級:把迴圈交給便宜的模型,而當回應因撞上 64,000 個詞元的上限而遭截斷,或未通過你的結構描述檢查時,就針對openai/gpt-6-astra重試該步驟,它的輸出空間是兩倍。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
