一張用於比較 GPT-6 Sol 與 Kimi K3 的文章主視覺標題卡,標題為「GPT-6 Sol vs Kimi K3」,副標為「關於開放權重的三項假設,用一張帳單來檢驗」,顯示 GPT-6 Sol 為封閉模型,價格為 $2.00/$10.00,指數為 48,而 Kimi K3 為開放權重,價格為 $3.00/$15.00,指數為 44。
Guides & Insights

GPT-6 Sol 對決 Kimi K3:關於開放權重的三項假設,以一項法案檢驗

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

購買開放權重通常是在賭三件事:它們會更便宜、能給你控制權,以及它們是防止供應商改變心意的保險。Kimi K3,Moonshot AI 於 2026 年 7 月 27 日以開放權重釋出的 2.8 兆參數模型,以及 GPT-6 Sol,2026 年 9 月 22 日推出的閉源模型,正好是檢驗這三件事的乾淨測試案例,因為這兩個模型在中立評測榜上足夠接近,使得這些假設必須獨自撐起整個論證。

以下是它們的表現。K3 在每項任務上並不便宜——它大約貴了兩倍,每百萬個 token 分別為 $3.00 和 $15.00,而 Sol 則為 $2.00 和 $10.00。控制權是真實的,但有一個大多數團隊不會跨越的硬體門檻。而保險是唯一完全站得住腳的假設,這使它成為唯一值得付費的。以下是每個項目背後的計算。

這兩個模型,簡述

Kimi K3 是一款稀疏混合專家模型,總參數量達 2.8 兆,每個詞元約啟用 1040 億個參數——約 3.7%——以修改版 MIT 授權發布,並具備 1,048,576 詞元的上下文視窗。Moonshot 的架構主張很具體:Kimi Delta Attention,一種混合線性注意力機制,該公司稱其在長上下文解碼上最高快 6.3 倍,外加 Attention Residuals 與 Stable LatentMoE 框架。它接受文字與圖像輸入,並傳回文字。未蒸餾模型大小超過 1 TB,而生產部署則以 64 個加速器為下限來描述。

GPT-6 Sol 為封閉式模型,採用單一識別碼,定價為固定 $2.00 與 $10.00,快取讀取 $0.20、快取寫入 $2.50;當輸入超過 272,000 個 token 時,整個請求會重新計價為 $4.00 與 $15.00。它支援文字與圖像輸入、文字輸出,具備 1,050,000 個 token 的視窗、922,000 個 token 的最大輸入、128,000 個 token 的輸出上限,以及 2026 年 4 月 20 日的知識截止日期。

就實際目的而言,這些上下文視窗的數字是一樣的——只相差 0.1%。這排除了偏好其中一個的最常見理由,也意味著這項決定完全取決於那三個假設。

假設一:開放權重比較便宜。事實並非如此。

• 輸入 — GPT-6 Sol 每百萬個詞元 2.00 美元,對比 Kimi K3 每百萬個詞元 3.00 美元

• 輸出 — GPT-6 Sol 每百萬個 token $10.00 對比 Kimi K3 每百萬個 token $15.00

• 快取輸入 — GPT-6 Sol 每百萬個 token 0.20 美元,對比 Kimi K3 每百萬個 token 0.30 美元;兩者皆為未快取輸入費率的十分之一

• 智慧指數,獨立評測 — GPT-6 Sol 在最大努力下為 48,對比 Kimi K3 在最大努力下為 44

• 每個 Index 任務的成本,獨立 — GPT-6 Sol $1.06 對比 Kimi K3 $2.00

• 索引執行的輸出 token — GPT-6 Sol 77M 對比 Kimi K3 160M

• 上下文視窗 — GPT-6 Sol 1,050,000 tokens,對比 Kimi K3 的 1,048,576 tokens

• 權重 — GPT-6 Sol 為封閉式,對比 Kimi K3 開放、可下載且可自行託管

• 授權條款 — GPT-6 Sol 不適用 vs Kimi K3 的 Modified MIT

• 總參數量——GPT-6 Sol 未公開,對比 Kimi K3 的 2,800 十億,其中每個符記有 104 十億為啟用參數

Sol 在價目表的每一個項目上都更便宜,而差距最大的地方,正好就是代理式工作負載花錢最多之處。獨立委員會在方向上看法一致,在幅度上也大致相同:Sol 每完成一項任務的成本約為一半,指數還高出四點。K3 為了跑出相同的指數,生成的輸出 token 量稍微超過兩倍。

一個細微差異使這不至於成為一場潰敗。Moonshot 聲稱 K3 的輸出 token 比其前代少了 21%,而架構上的努力——注意力機制、殘差設計——正是直指長上下文解碼成本。在由極長輸入主導的工作負載上,K3 的效率特性或許能縮小索引測試所顯示的部分差距。目前還沒有人在可比的測試框架上發表該項測量,因此應將其視為帶有合理機制的廠商說法,而非結果。

A six-row scoreboard card titled 'GPT-6 Sol vs Kimi K3 - the scoreboard', comparing the two models on input price, output price, Intelligence Index, cost per task, weight availability and context window. The left column lists GPT-6 Sol at $2.00 input and $10.00 output, an Index of 48, $1.06 per task, closed weights and a 1,050,000-token context; the right column lists Kimi K3 at $3.00 and $15.00, an Index of 44, $2.00 per task, open weights under Modified MIT and a 1,048,576-token context. A footer reads 'Vendor list prices; Index per Artificial Analysis.'Screenshot of the Artificial Analysis model page for Kimi K3 (max), captured 23 September 2026, showing an Intelligence Index score of 44 in the open-weights class, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a cost of $2.00 per Intelligence Index task, 160 million output tokens generated during the index run, a 1M-token context window, 2.8 trillion total parameters with 104 billion active, and open model weights under the Kimi K3 license.

假設二:開放權重讓你握有控制權。但以硬體門檻為限。

這種掌控是真實的,值得精確說明,因為「開放權重」經常被寬鬆地使用。可下載檢查點上的 Modified MIT 授權意味著你可以在自己的硬體上執行模型、對其進行微調、鎖定特定修訂版本,並將推論保持在你能控制的邊界內。無論價格多高,GPT-6 Sol 都無法提供其中任何一項。

這並不表示自架設在成本上可以取代 API。已公布的數據顯示,全精度檢查點約為 4.9 TB,在 1 位元量化下約為 397 GB,部署門檻落在合計記憶體 410 GB 的區間,而生產環境部署則以 64 個加速器來描述。已經在運行這類規模叢集的團隊,確實有真正可行的選項。沒有這類資源的團隊,則是在拿 API 帳單與資本支出採購相比,而 API 帳單以大幅差距勝出。

控制論點最誠實的版本,比一般所說的更狹隘:開放權重給你的是離開的能力,而不是低成本運行的能力。這兩者是不同的事,而大多數團隊只能擁有其中一個。

假設三:開放權重是保險。這一項成立。

第三項假設在上述每一項數字中都成立,而這正是 K3 能有市場的根本原因。Moonshot 可以被收購、可以更改未來版本的授權條款、可以淘汰 K3、可以提高價格、可以暫停訂閱——而它確實在發布後 48 小時內暫停了新訂閱,以保障現有付費用戶的服務品質,這活生生地證明 API 存取是一項政策決定,而非一項財產。

若 K3 被棄用,你下載的權重仍能運行。若 Moonshot 把 API 價格調漲為三倍,你的自架部署不受影響。若你需要向稽核人員證明你的推論堆疊凍結在某個已知版本上,檢查點能給你這項證明,而 API 做不到。這些都不會出現在每項任務成本的表格上,但全都是真實的。

問題在於它值多少。就上述數字而言,你每完成一項任務大約要付雙倍的代價來買那份保險,另外還要加上四個指數點的能力。對於一項 API 淘汰就等同業務中斷的工作負載來說,這很便宜。對於一項你只會直接換個模型的工作負載來說,這是為一個你永遠不會行使的對沖付出的溢價。

如果你想要的話,兩者可以放在同一個按鍵上。

Screenshot of OrcaRouter's model page for Kimi K3, captured 23 September 2026, showing the model id kimi/kimi-k3 from provider MoonshotAI, a 1,048,576-token context window, text and image input with text output, vision, tool, JSON and reasoning support, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a p50 time to first token of 8.11 seconds and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses.

Kimi K3 已收錄於 OrcaRouter 的目錄中,採用 Moonshot 的牌價,並以價格直通模式計價,讓 Moonshot 的價格調整當天就能在我們這邊生效,而不必等經銷商重新議價。截至本文撰寫時,GPT-6 Sol 尚未收錄於我們的目錄,僅能透過 OpenAI 自家的 API 取用。

那個組合對這個特定決策來說,價值比聽起來更高,因為這兩個模型屬於不同的失效模式。執行 K3 的理由不是它比較便宜——它並不便宜——而是它是一種對沖,而一個你無法迅速切換過去的對沖,稱不上是什麼對沖。把 K3 放在與其他所有東西相同的端點後面,搭配自動容錯移轉,以及可在設定中變更的路由規則,才能把「我們有一個開放權重的備援方案」從簡報裡的一張投影片,變成凌晨三點真正能運作的東西。

每個的實際用途

• 若你在一般工作上追求每完成一項任務的最低成本——GPT-6 Sol,領先幅度約為 2 倍。

• 如果你想要在兩者的中立排行榜上取得最高能力——GPT-6 Sol,領先四分。

• 如果你已經在 400 GB 以上的記憶體等級運行叢集,而且需要在自己邊界內進行推論——K3,那麼整個盤算會徹底改變,因為權重的邊際成本與硬體成本並不相同。

• 如果你真正的需求是你的模型無法被奪走——K3,而這是比較中 Sol 唯一無法反駁的論點。

• 如果你是因為 K3 看起來是較便宜的中國模型,而按每 token 價格來做選擇——先檢查 token 數量。針對索引執行,輸出 1.6 億個 token,相較於 Sol 的 7,700 萬個,較低的費率是在買更多 token,而不是更小的帳單。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新