生成的標題卡寫著 GPT-6 Sol 對比 Tencent HY4 Preview,較便宜的模型承載流量,統計卡顯示輸出價格每百萬 $10.00 對比 $2.50,權重封閉對比 Apache 2.0 開放權重,輸入介面為文字、圖像、檔案對比僅文字,頁腳寫著 GPT-6 Sol 的費率依 OpenAI 的費率卡;Tencent HY4 Preview 的費率與速度依 OrcaRouter 的目錄,廠商列表 6 / 18 元每百萬。
Guides & Insights

GPT-6 Sol 對比 Tencent HY4 Preview:較便宜的模型正承載著六百倍的流量

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

前沿模型與便宜模型之間的比較,通常止步於價格表,而這一組還有更好的結局。Tencent HY4 Preview與GPT-6 Sol都由 OrcaRouter 路由,這意味著同一套遙測資料涵蓋了兩者;而在同樣的七天滾動視窗中,HY4 Preview 模型處理了約 24 億個 token,GPT-6 Sol 則約為 390 萬個。這不是基準測試,也不是什麼定論;這只是單一平台上某段滾動視窗的流量,下週再讀就會是另一番光景。但這是一個真實的訊號,說明當一個強大的開放權重模型價格只要閉源模型的四分之一時,實際動手打造東西的人真正會取用的是什麼;而這也是規格表無法產生的那種數字。

這兩個模型也堪稱一堂案例研究,說明基準測試能告訴你什麼、又不能告訴你什麼。GPT-6 Sol 於 2026 年 9 月 22 日發布,是 OpenAI GPT-6 世代的中階層級,擁有獨立的 Intelligence Index 分數。HY4 Preview 由騰訊於 2026 年 8 月 28 日發布並開源,既沒有 Artificial Analysis 的模型頁面,也沒有第三方指數,更完全沒有獨立的逐項任務成本數據。所有關於它表現如何的公開資料,都是騰訊自家的量測結果。這種不對稱並不代表 HY4 Preview 是較弱的模型,而是代表它是受稽核較少的那一個,而這兩者是不同的主張。

規格,包括決定大多數部署的那兩項。

• 輸出價格 — GPT-6 Sol 每百萬 $10.00 對比 Tencent HY4 Preview 每百萬 $2.50
• 輸入價格 — GPT-6 Sol 每百萬 $2.00 對比 Tencent HY4 Preview 每百萬 $0.83
• 快取輸入 — GPT-6 Sol 每百萬 $0.20 對比 Tencent HY4 Preview 每百萬 $0.04
• 權重 — GPT-6 Sol 封閉,僅提供 API 對比 HY4 Preview 以 Apache 2.0 開源
• 輸入模態 — GPT-6 Sol 文字、圖像與檔案 對比 HY4 Preview 僅文字
• 上下文視窗 — GPT-6 Sol 1,050,000 個 token 對比 HY4 Preview 1,048,576 個 token
• 最大輸出 — GPT-6 Sol 128,000 個 token 對比 HY4 Preview 64,000 個 token
• 長請求級距 — GPT-6 Sol 當輸入超過 272,000 個 token 時,會將整個請求重新計價為 $4.00 / $15.00 對比 HY4 Preview 其價目表上沒有此級距
• 架構 — GPT-6 Sol 未公開 對比 HY4 Preview 總參數 770B,啟用 49B,78 層,256 個路由專家加上一個共享專家,原生多 token 預測層
• 獨立評分 — GPT-6 Sol 47.6 Intelligence Index 對比 HY4 Preview 未公布
• 實測輸出速度 — GPT-6 Sol 約每秒 244 個 token 對比 HY4 Preview 約每秒 54 個,兩者皆為七日滾動數據

決定大多數實際部署的兩行,是最下面的那兩行。第一是 HY4 Preview 不接受影像或檔案輸入,這讓任何必須檢視內容的管線都無法採用它。第二是輸出上限:64,000 個詞元是 GPT-6 Sol 的 128,000 的一半,而對於一個宣稱用途是編碼代理與長工具使用鏈的模型來說,這是團隊最先撞上的限制——不是品質,而是生成檔案不再能放進單一回應的那個臨界點。

相較之下,輸出價格的四分之一與快取輸入價格的五分之一,能換來大量的重試機會。而且 HY4 Preview 的架構是以 GPT-6 Sol 所沒有的方式留下文件記錄:Tencent 公布了參數量、層數、專家配置與推測解碼層,這意味著其服務特性至少有一部分可從論文預測,而不只是透過 API 才能觀察得到。

Generated comparison scoreboard titled GPT-6 Sol vs Tencent HY4 Preview, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, weights closed, context window 1,050,000 tokens, Intelligence Index 47.6. Tencent HY4 Preview: input $0.83 per million, output $2.50 per million, modality text only, weights Apache 2.0 open, context window 1,048,576 tokens, no independent score published. A footer reads Tencent HY4 Preview rates per OrcaRouter's catalogue against a vendor list of 6 / 18 yuan per million; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

HY4 Preview 的基準測試表究竟是什麼

騰訊公布的數字很亮眼,而且全都是廠商自己跑出來的。在 Terminal-Bench 2.1 上,該模型拿下 85.4;在 DeepSWE 上則是 64.3;而在涵蓋 203 項工程任務的內部盲測中,它平均得到 2.99,對比 GLM-5.3 的 2.92 與 Kimi K3 的 2.94——在騰訊自行設計的研究中,於十分制量表上領先零點零七分。它也在 WebDev Arena 排行榜首次亮相,騰訊宣稱它整體排名約第五,在開放權重模型中排名第三。競技場的結果是由群眾投票,而非廠商評分,是這批證據中最獨立的一項;其餘的都只是聲稱,而只要標明是聲稱,就仍然值得一讀。

真正要緊的落差,不在於這些數字可能偏寬鬆——供應商的測試框架通常就是如此,而且兩個方向都可能。而在於沒有第二組量測可供比對。有 Artificial Analysis 頁面的模型可以被查核;沒有頁面的模型則無法,而這個差異會在幾個月後浮現,當有人發現某個頭條數字是在其他人無法重現的測試框架上測得的。這裡沒有任何跡象顯示 HY4 Preview 遭遇了這種情況。這只意味著,一個以 85.4 為依據的採用決策,正建立在單一來源上。

實務上的解讀是,HY4 Preview 應該用你自己的流量來評估,而不是只看表格;而且這樣的成本結構讓這件事變得很便宜——在 GPT-6 Sol 輸出費率的四分之一下,用你真實的提示詞跑一週影子流量,成本還不到一次 API 層級審查。對於一個測量不足的模型來說,這才是盡職調查的正確形式,而這也正是幾乎沒有人真正去做的那種形式。

開放權重這個問題,才是真正的分界線

HY4 Preview 以 Apache 2.0 授權開源,並與基礎檢查點一同提供採用寬鬆授權的 FP8 組建。GPT-6 Sol 則是封閉的,沒有授權檔案,因為根本沒東西可授權。這項比較中的其他一切皆是取捨;這一個卻是類別上的差異。

這帶來的價值主要不在於更便宜的帳單——每百萬輸出權杖 2.50 美元的託管 API,早已低於大多數團隊自行運行 7,700 億參數模型的成本;而如果成本就是全部理由,寬鬆的授權條款也就無關緊要了。它真正換來的是不依賴任何人端點的部署方式:不會被限流的權重、可量化以配合你手上硬體的檢查點、可微調的模型,以及能留在網路邊界內的流量。GPT-6 Sol 對這四點的回答是:你根本不該需要它們——這對某一類真實存在的團隊而言是真實有力的論點,對那些確實需要這些的團隊來說則毫無意義。

模態劃分與授權條款指向同一個方向,這點值得注意。一個只讀取文字、並以 Apache 2.0 授權發布的模型,是為了成為元件而打造——某個你放進自己所掌控的管線裡的東西,餵給它你已經整理過的文字。一個能讀取文字、圖像和檔案、且只能透過 API 觸及的模型,則是為了成為進入點而打造,直接接收雜亂的輸入。這些是不同的工作,而用單一指標來比較它們,等於在回答一個兩家廠商都沒問的問題。

OrcaRouter model page for Tencent Hy4 preview (tencent/hy4-preview) by Tencent, dated 2026-08-28, tagged Tools, JSON and Reasoning, describing it as Tencent's latest mixture-of-experts flagship with 770 billion total parameters, 49 billion activated per token, 78 layers, 256 routed experts plus one shared expert and a 1M-token context window, text-only, with a list price of $0.83 per million input and $2.50 per million output and a p50 time to first token of 6.18 seconds.

將它們一起提供,以及流量數字所暗示的含義

這兩個模型都與其他 200 多個模型同處於一把 OrcaRouter 金鑰之後,而這樣的配對所暗示的路由形態,恰恰與顯而易見的那一種相反。把 HY4 Preview 放在前面——在輸出上它是便宜四倍的模型,它是擁有已記載架構的那一個,而且在我們的路由上,它正是承擔負載的那一個——並把 GPT-6 Sol 留在它後面,用於需要讀取影像、需要輸出超過 64,000 個 token,或未通過品質檢查的請求。這個組合是表達在路由 DSL 中,而非應用程式碼裡,因此兩者之間的界線是一條你能編輯、無需部署的規則。

這些速度數字需要一個但書,然後是一個結論。HY4 Preview 在我們的滾動視窗中測得約每秒 54 個輸出詞元,而 GPT-6 Sol 約為 244,且兩者都是在共享基礎設施上的觀察,而非受控基準測試——尤其騰訊的數字反映的是一個活躍參數量極大的模型,而每個詞元 490 億活躍參數意味著每個輸出詞元要進行大量運算。所以較便宜的模型是較慢的那個,而且差距很大,這正是批次管線樂於做出的取捨,而互動式管線則不然。騰訊的代管版本也在 2026 年 9 月 7 日獲得了一項效能最佳化,廠商表示能在相同任務品質下減少推理回合數與每項任務的詞元消耗——這又是廠商自稱的數字,但它預示的是更低的帳單,而不是更快的串流。

容錯移轉(Failover)正是讓這種配對無論順序為何都安全無虞的關鍵。一個 7700 億參數的開放權重模型由多家基礎設施供應商共同提供服務,而具備回退能力的路由意味著,效能衰退的主機只會造成一次重試,而非一次服務中斷。我們的型錄以不加價的方式直接呈現供應商的定價,這也意味著以貨幣報價的供應商費率不是你得等待的東西:騰訊將 HY4 Preview 列為每百萬輸入 6 元、輸出 18 元,而我們頁面顯示的美元數字是該費率換算而來,並非經銷商的價差。

Artificial Analysis model page for GPT-6 Sol (Max), a proprietary OpenAI model released September 2026, carrying a banner noting the model is deprecated and that OpenAI has launched a newer release, GPT-6.1 Sol. The page shows an Intelligence Index of 48, an output speed of 87.9 tokens per second, $2.00 per million input and $10.00 per million output, a 90% cache discount, and a 1M-token context window.

這副其實是做什麼用的

需要衝量時、在你掌控的純文字管線中、在任何必須跑在你自家硬體上的情境裡,以及任何答錯能被攔下並重試的工作負載,就選 Tencent HY4 Preview —— 這樣的價格讓重試成為你手上最便宜的品質槓桿。當輸入是圖片或檔案、當單一回覆必須承載超過 64,000 個 token,或當答案要交給一個不會查證就直接行動的人時,就選 GPT-6 Sol。如果你的流量中兩者各占一部分——而幾乎可以肯定必然如此——那就兩個都用。

兩項收尾確認。HY4 Preview 仍標示為預覽版,也依然是我們目錄中最新的騰訊模型,所以這個名稱是準確的,而非過時——但預覽版可能在你腳下悄然生變,而以寬鬆授權釋出的檢查點,也可能在毫無預警下被自家的正式版取代。至於 GPT-6 Sol,它已被 GPT-6.1 Sol 取代,短上下文費率完全相同,快取輸入的價格則從 $0.20 減半至 $0.10,OpenAI 自家的模型頁面如今也把讀者導向該版本。若你衡量採用 Sol 而非騰訊模型的原因是那個已推出八天的整合方案,這點依然成立。若你著眼的是能力,那麼該計價的便是它的後繼版本。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新