產生的主視覺卡片標題為「Claude Sonnet 5.5 對決 Tencent HY4 Preview」,副標題為兩家實驗室都在賣 token 帳單,內含三張數據卡:每 100 萬 token 的輸出價格 $10.00 對 $2.50、權重封閉對 Apache 2.0,以及實測輸出速度每秒 138.7 對 22.3 個 token;頁尾寫著 Tencent HY4 Preview 的價格與速度依據 OrcaRouter 的目錄,供應商列表為每百萬 6 / 18 元;Claude Sonnet 5.5 則依據 Anthropic。
Guides & Insights

Claude Sonnet 5.5 對比 Tencent HY4 Preview:兩家實驗室賣的都是代幣帳單

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

相隔六週的兩次發布,用不同措辭做出相同承諾。廠商的說法是,Claude Sonnet 5.5於 2026 年 9 月 28 日推出,在每 token 費率不變的情況下,相較於 Claude Sonnet 5,每項任務成本「最多降低 30%」。第二項說法是,9 月 7 日對 Tencent HY4 Preview代管版所做的優化——該模型於 2026 年 8 月 28 日首次發布並開源——在相同任務品質下,減少推理輪次與每項任務的 token 消耗量。兩家廠商都沒有為了做出這項宣稱而調高或調降價格。兩者都在告訴你,如今 token 就是產品,而這場對決有趣之處在於,這兩項說法中只有一項能對照已公布的每項任務數據來查核——因為這兩個模型中,只有一個有獨立測量結果可供查核。

這種不對稱並不是在貶低 T​encent。HY4 Preview 沒有 Artificial Analysis 的模型頁面,沒有獨立的 Intelligence Index 分數,也沒有來自任何第三方的每項任務成本數字。它有的是廠商自家的基準測試表——Terminal-Bench 2.1 拿下 85.4、DeepSWE 64.3,以及在 203 項工程任務上進行的內部盲測,其中它平均得到 2.99,而 GLM-5.3 為 2.92、Kimi K3 為 2.94——還有在 WebDev Arena 排行榜上公開的群眾投票初登場,T​encent 表示它約落在整體第五名、開源權重模型中第三名。這些全都是真實的訊號。但它們沒有一個是每項任務成本,這意味著兩家廠商相互較勁的那個確切數字,對 HY4 Preview 來說並不可得。

雙方各自實際交付了什麼

騰訊 HY4 Preview 是一個 7700 億參數的專家混合模型,每個 token 啟用 490 億參數,擁有 78 層、256 個路由專家加上一個共享專家、用於推測解碼的原生 MTP 層,以及突破百萬 token 的上下文視窗。它在設計上僅支援文字——騰訊打造它是為了程式設計代理、複雜工具使用與生產力工作,而非圖像——並且預設採用重度推理,提供三個可設定等級(高、低、無),以及廠商建議的取樣設定:temperature 0.9 與 top_p 1.0。權重採用 Apache 2.0 授權,可從 Hugging Face、GitHub、ModelScope 和 GitCode 下載。騰訊最初指出預覽版的兩個粗糙之處:思考時間超出必要,以及過度驗證自身工作,而 9 月 7 日的更新正是針對這些問題。

Claude Sonnet 5.5 是 Anthropic 的第二款 5.5 世代模型,也是該公司定位為產品陣容中速度與智慧最佳組合的模型。一百萬個 token 的上下文,同步輸出 128,000 個 token,在 Message Batches API 上則為 300,000 個,支援文字、圖像與檔案輸入,可選擇強度的自適應思考,知識截止日為 2026 年 6 月,推出時即提供零資料保留,以及 2027 年 9 月 28 日的退役下限。價目表與 Claude Sonnet 5 相同,並未變動:每百萬輸入 token 2.00 美元、每百萬輸出 token 10.00 美元,快取讀取 0.20 美元、快取寫入 2.50 美元。封閉權重,提供 Anthropic API,以及 Bedrock、Google Cloud 和 Microsoft Foundry。

將兩者並排對照,位置幾乎是對稱的:

• 價格 — Claude Sonnet 5.5 每百萬 $2.00 輸入 / $10.00 輸出,相較於我們價目表上 Tencent HY4 Preview 的 $0.83 輸入 / $2.50 輸出,來自供應商價目表的 ¥6 / ¥18

• 快取讀取 — Claude Sonnet 5.5 每百萬 $0.20,而 Tencent HY4 Preview 在我們的價目表中為每百萬 $0.042

• 權重 — Claude Sonnet 5.5 閉源 vs 騰訊 HY4 Preview Apache 2.0,可下載

• 上下文 — Claude Sonnet 5.5 的 1,000,000 個 token 對比 Tencent HY4 Preview 的 1,048,576 個 token,實際上完全相同

• 最大輸出 — Claude Sonnet 5.5 同步 128,000,Batches 上 300,000,相較之下 Tencent HY4 Preview 在我們型錄中為 64,000

• 輸入模態 — Claude Sonnet 5.5 支援文字、圖像與檔案,對比 Tencent HY4 Preview 僅支援文字

• 獨立分數 — Claude Sonnet 5.5 智慧指數 56,每項任務 $7.60,修訂版 v4.3.2;對比 Tencent HY4 Preview 則未公布

• 實測輸出速度 — 在我們自家的流量上,Claude Sonnet 5.5 為每秒 138.7 個 token,對比 Tencent HY4 Preview 的每秒 22.3 個 token

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

兩家實驗室所提出的主張,以及為什麼其中一個是可檢驗的

A​nthropic 的「每項任務少 30%」與 T​encent 的「推理輪次更少、token 消耗更低」,是從兩個方向描述的同一個工程項目:讓模型在得出相同答案時花費更少 token。A​nthropic 明確表示費率並未改變,這意味著任何每項任務的節省都必須來自 token 數量——而這個獨立排行榜讓你看到的是問題的形態,而不是修正方案的規模。Claude Sonnet 5.5 在 Intelligence Index 評估中產生 4.1 億個輸出 token,而 MiniMax M3 為 1.17 億,Grok 4.5 為 7,700 萬。它是一個冗長的模型——這是在一個會公布該數字的排行榜上測量到的。無論相對 Claude Sonnet 5 的 30% 改善最終代表多少,它都是套用在一個非常龐大的基數上。

就 HY4 Preview 而言,公開資料中並不存在對應的數字。騰訊自家的優化說明是唯一的相關記述,而它陳述結果時並未附上數字:更少輪次、更低的輸入與輸出 token、相同品質,並經基準指標與雙重人工評估驗證。嚴格來說,那是廠商主張——有所陳述、看似合理、未經重現——本文也如此標示。在 token 經濟性恰恰是你無法從外部衡量的東西時,憑廠商的 token 經濟性主張去採用一款預覽模型,正是預覽版要你下的賭注。

還有一個細節值得在任何人打算圍繞那項最佳化來規劃自行託管部署之前先了解。Tencent 九月七日的變更適用於 Tencent 在自家代管端點上所提供的那份組建。開放權重快照並未更新——Hugging Face 儲存庫的最後修改日期仍是八月二十八日——因此自行託管的權重副本執行的是預覽說明所標記的原始、推理較長的行為。最佳化版本與可下載版本並非同一個產物。

開放權重真正發揮價值的地方,向來就是同一個地方:無法呼叫 API 的部署環境。一個具備 770B 參數、49B 活躍參數的模型,是資料中心層級的決策,而非工作站層級的決策,所以這不是 30B 模型所講的那種筆電等級故事——但對於需要在自家邊界內使用該模型的買家而言,在這種規模下,Apache 2.0 是 Claude Sonnet 5.5 無論價格多高都無法提供的選項。

在不必把正式環境路徑押上去的情況下,先試用預覽版

預覽模型正是路由不再只是成本最佳化、而變成風險控管的那種情況。之所以要把預覽組建放在路由器後面,而不是直接呼叫它,是因為預覽的定義就在於它可能在你底下悄悄改變;而你希望它前面那層做到的两件事,就是百分比拆分,以及能攔住失敗的機制。

這就是 OrcaRouter 提供的樣貌:一個相容 OpenAI 的端點,涵蓋 200 多個模型,供應商定價原價轉嫁、不額外加價,上游供應商之間的自動容錯移轉,以及一套可用來以多個模型組合呼叫的路由 DSL。Tencent HY4 Preview 今天已可在此路由為 tencent/hy4-preview,每百萬個 token 輸入 $0.83、輸出 $2.50,快取讀取 $0.042,涵蓋其 1,048,576 個 token 的視窗——同一個建置版本,以供應商的費率,並可透過你已在型錄中用於其他所有項目的同一把金鑰存取。Claude Sonnet 5 同樣可在此路由,價格為 Anthropic 的 $2.00 與 $10.00,且自 6 月 30 日起便是如此;在一個剛問世一天的模型累積正式環境實證期間,它顯然是合適的容錯移轉夥伴。

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 本身並不在我們的目錄中。它昨天才上線,通往它的路徑是 Anthropic 自家的 API,而這一頁並不會暗示其他可能——路由建議的重點在於,要在正式環境中運行一個全新層級,安全的做法是給它一小部分流量,並讓經過驗證的東西在背後支撐,而這只有在這套安排的兩端都位於你能從同一個地方觸及之處時才行得通。HY4 Preview 在這裡每週承載 37.2 萬個 token 的流量,這正是問世兩天的預覽版在還沒有人承諾採用之前會有的樣子;Claude Sonnet 5 自 6 月 30 日以來每週承載 790 萬個,而這就是候選者與基本盤之間的差別。

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

錢實際上都花到哪裡去了

單就費率而言,HY4 Preview 在輸出上比 Claude Sonnet 5.5 便宜四倍,在快取讀取上則便宜近五倍,而且在視窗大小上也不相上下。在實測方面,Claude Sonnet 5.5 在我們自家流量上的輸出生成速度快了六倍——每秒 138.7 個 token,對比 22.3——這種差距會讓四倍的費率優勢變成小得多的實際時間優勢,而且在把佇列納入考量後,偶爾甚至會變成劣勢。

在這些事實之間,決定取決於四個只有讀者能回答的問題。這項工作是否需要在提示中提供圖像或檔案?HY4 Preview 僅支援文字,這就沒什麼好討論的了。它是否需要完成多步驟的軟體任務?在這種情況下,HY4 Preview 在 Terminal-Bench 2.1 的 85.4 分成績是 Tencent 自家的數字,且未經重現。那麼預覽狀態就是你所接受的風險,而 9 月 7 日的優化值得重新測試,而非直接信任。該工作負載是否必須在你自己的邊界內運行?那麼 Apache 2.0 權重就是決定性的事實。而綜合能力水準是否比費率更重要?那麼 Claude Sonnet 5.5 經獨立測量的 56 就是應權衡的數字,每項 Index 任務為 $7.60,但需注意 Tencent 方面沒有可與之比較的對等數字。

這兩次發布真正證明的是,前沿已經不再由價目表來定義。相隔六週的兩家實驗室各自推出了模型,並且主打每項任務的 token 消耗量,而非每百萬 token 的價格;對買家而言,實際結果是那個有用的數字已不再出現在任何一家廠商的定價頁面上。它是你自己的實際工作負載所產生的 token 數量,並且是在兩個模型上分別測得的數字,而這也是本文中兩家廠商都無法提供給你的唯一一個數據。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新