
GPT-6.1 Sol 對決 Kimi K3:下載確實存在,而且它仍然不是便宜選項
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Kimi K3通常是終結這類爭論的反例。Moonshot AI 在 2026 年 7 月推出了這款 2.8 兆參數的模型,並公開了權重——moonshotai/Kimi-K3就在 Hugging Face 上,無須申請即可取用,下載次數超過一百萬,最後一次修訂在九月。所以這裡沒有「原則上開放,但為安全強化而暫緩釋出」這種但書,也沒有兩週的等待期要熬。GPT-6.1 Sol,由 OpenAI 於 2026 年 9 月 29 日發布,是封閉的、僅提供 API,而且永遠都會是如此。而在獨立排行榜上,可下載的模型拿下 43.6 分,封閉模型則是 51.8 分,但每完成一項索引任務的成本是 2.00 美元對上 0.72 美元。開放權重本應是那個廉價的逃生出口;在這組對比中,它卻是這筆交易裡昂貴的那一方,而原因不在於授權條款。
每個模型是什麼
Kimi K3 是一款稀疏混合專家模型,總參數達 2.8 兆,而每個 token 約有 1,040 億個參數——約 3.7%——處於啟用狀態。它具備 1,048,576 個 token 的上下文視窗,以文字和圖像作為輸入,並回傳文字。已發布的檢查點是 FP8 成品,而且是名副其實的大型下載檔;要在自家硬體上進行正式環境部署,屬於叢集層級的決策,而非工作站層級的決定。Moonshoot 的架構主張是一套混合線性注意力方案,聲稱在長上下文解碼時速度大幅提升,再加上殘差與路由方面的工程,才讓一個 2.8 兆參數的模型得以提供服務。
GPT-6.1 Sol 是 OpenAI 的中階更新版——位階低於 GPT-6 Astra、高於 GPT-6 Luna——具備 1,050,000 個詞元的上下文視窗、128,000 個詞元的輸出上限,支援文字、圖像與檔案輸入,知識截止日為 2026 年 4 月 30 日。推理強度提供從 low 到 max 的選項,並以 medium 為預設值;none 這個前代 GPT-6 Sol 仍接受的層級則已直接不予支援,而 OpenAI 自家的遷移說明也建議開發者改用 low。其定價為每百萬詞元 2.00 美元與 10.00 美元,快取輸入則為 0.10 美元。
每個維度一行,每一行兩側都要顯示:
• 輸入 — GPT-6.1 Sol 每 100 萬 $2.00 對比 Kimi K3 每 100 萬 $3.00
• 輸出 — GPT-6.1 Sol 每 100 萬 $10.00 對比 Kimi K3 每 100 萬 $15.00
• 快取輸入 — GPT-6.1 Sol 每 100 萬 $0.10 對比 Kimi K3 每 100 萬 $0.30
• 上下文視窗 — 1,050,000 個 token 對比 1,048,576 個 token;0.1% 的差異,無關緊要
• 最大輸出 — 兩者皆為 128,000 個 token
• 總參數與啟用參數 — 未公開 對比 總計 2.8 兆、每個 token 啟用 1,040 億
• 模態 — 輸入文字、圖像與檔案,輸出文字 對比 輸入文字與圖像,輸出文字
• 權重 — 封閉,僅限 API 對比 開放、無須審核、下載量超過 100 萬
• 長上下文條款 — 輸入超過 272,000 個 token 時,整筆請求的輸入與快取以 2 倍計價、輸出以 1.5 倍計價 對比 公布價目表上無同等條款
• Intelligence Index,獨立,最高投入 — 51.8 對比 43.6
• 每項指數任務成本,獨立 — $0.72 對比 $2.00
• 指數執行時的輸出 token 數 — 6,700 萬 對比 1.6 億,而其比較類別在排行榜上的中位數為 1.4 億
K3 勝出的那項評測,以及它為何重要
在算術之前,先說例外,因為它是真實的。在 Artificial Analysis v4.3.2 上以最大努力逐項評估計分時,GPT-6.1 Sol 在十項中領先七項,且沒有任何平手,但贏得長上下文推理評估的模型是 K3:
• AA-LCR v1.1 — Kimi K3 0.887 對 GPT-6.1 Sol 0.830。在專為長輸入推理打造的評測中領先六個百分點。
• SciCode — Kimi K3 0.595 對 GPT-6.1 Sol 0.542。K3 在科學程式設計上也同樣領先。
• Terminal-Bench 4.0 — Kimi K3 0.126 對 GPT-6.1 Sol 0.561。反方向出現 43 個百分點的差距,也是這組對比中落差最大的一項。
• Humanity's Last Exam — Kimi K3 0.469 對 GPT-6.1 Sol 0.529。
• AA-Omniscience — Kimi K3 19.7 對 GPT-6.1 Sol 41.5;在事實可靠性方面,兩者並非同一等級的模型。
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 對 GPT-6.1 Sol Elo 1575.1。
• MMMU-Pro — Kimi K3 0.805 對 GPT-6.1 Sol 0.860。
• AutomationBench-AA、GDP.pdf、CritPt — K3 分別為 0.583、0.22 和 0.234;Sol 分別為 0.649、0.310 和 0.317。
AA-LCR 的結果才是值得認真看待的那一個,因為它是唯一一個與每次任務成本那套說法相矛盾的數字,而且它指向一種工作負載:在這種負載中,看似便宜的答案在兩個方向上都錯了。如果你的流量是超長輸入、適度生成的回應,以及大量重複使用穩定的前綴——也就是冗長度永遠無法造成傷害的那種形態——那麼 K3 結合頂級長上下文分數、圖像輸入與可下載檢查點的組合,會比 Sol 的更合適,而索引執行的那個每次任務成本數字對你並不適用。這才是「開放權重值得付出溢價」的誠實版本:有時候開放模型就是更適合這項工作的模型,而在這裡,它在某一個軸上是如此。
也值得指出這兩項勝績的共同點。K3 在任務能以一次長時間的閱讀或推理來回答時表現強勁,而在必須以許多小步驟執行並檢查時則較弱。43 分的 Terminal-Bench 差距與 22 分的全知差距,是從兩個角度看到的同一項發現:持續的代理式執行並不是這個檢查點所最佳化的目標。
算術,而這才是真正決定它的關鍵。
K3 的費率表在每一個項目上都是 Sol 的 1.5 倍,而其實測的每完成一項索引任務成本是 2.8 倍,而 1.5 與 2.8 之間的差異完全可由 token 用量解釋。董事會自身的量測結果是:在同一套十項評測中,K3 的輸出 token 為 1.6 億,Sol 則為 6,700 萬。K3 以 1.5 倍的價格產生 2.4 倍的輸出,而 2.4 × 1.5 = 3.6——董事會提出的 $2.00 對 $0.72 數字比純粹比率稍微友善一些,因為輸入與快取的貢獻略微抵銷了它,但方向並無爭議。
Moonshoot 自家的行銷宣傳卻與此相悖,而且值得仔細推敲。該公司聲稱 K3 的輸出 token 數量比前代少,而架構上的工夫——注意力機制、殘差設計——正是直接衝著長上下文解碼成本而來。就算該模型在一般評測套件上的冗長程度仍是基準中位數的兩倍,這兩點也都能成立。這兩項說法關乎不同的事:相對於前一代 Kimi 的效率,以及相對於業界整體的效率。只有第二項才是你實際上被計費的依據,也是獨立董事會所衡量的那一項。
快取會緩和這一點。兩種快取輸入費率都是其模型未快取輸入費率的十分之一——K3 為 $0.30,Sol 為 $0.10——因此快取這一項並不會改變排序,但確實意味著請求多、回答少的工作負載會把差距縮小到大致是價目表比率,而非實測任務比率。而 Sol 的長上下文條款則朝反方向作用:輸入超過 272,000 個 token 時,它會把整個請求重新計價為 $4.00 與 $15.00,快取則為 $0.20,這是 K3 的均一價目表唯一徹底勝出的區間。這一點值得知道有兩個原因,因為這也是 K3 的長上下文分數在這次比較中是最佳數字的區間。

在這裡,哪些開放權重才真正值得?
有三件事,而值得把它們分開來看,因為「開放權重」通常被當成一個論點,但它其實是三件事。
第一點是,你可以離開。如果 Moonshoot 被收購、變更未來版本的授權條款、淘汰 K3 或調漲其 API 價格,你已經下載的檢查點仍會繼續運作。對這個實驗室來說,這並非假設性的情境:Moonshoot 曾在某個較早版本發布後約 48 小時內暫停接受新訂閱,以保障既有付費客戶的服務品質,這正是一項活生生的示範,證明 API 存取權是一項政策決定,而不是一項財產。這些全都不會出現在每項任務成本表裡,但全都是真實的。
第二點是你可以把版本鎖定。一個固定、經過微調的修訂版本,運行在你掌控的邊界之內,是能拿給稽核人員看的東西,而這正是 API 無法提供的。對受監管的流量而言,這比一張費率表更有價值。
第三點——也就是通常被假設的那一點——是它會更便宜。事實並非如此。該檢查點是一個 2.8 兆參數的 FP8 產物,而官方公布的部署指引是圍繞多加速器組態、而非單一節點來規劃的。已經在運行這類叢集的團隊,在這裡確實握有一個真實的選項,而且整個盤算會徹底改變,因為每個 token 的邊際成本變成了電力。沒有這類叢集的團隊,則是在拿 API 帳單與資本採購相比,而 API 帳單以大幅差距勝出。誠實的總結是:這裡的開放權重給你的是離開的能力,而不是便宜運行的能力。
兩者都在同一個按鍵上,而這正是讓這項交換變得有用的地方
Kimi K3 已在 OrcaRouter 上,採用 Moonshoot 自家的定價——每百萬個 token 3.00 美元與 15.00 美元,快取讀取為 0.30 美元,與供應商的價目表一致——而 GPT-6.1 Sol 在發布當天就以 OpenAI 的價格登上我們的線路,每百萬個 token 2.00 美元與 10.00 美元,快取輸入為 0.10 美元,且 272,000 個 token 的級距完全按照所列價格轉嫁。兩者都沒有被加價。平台直接將供應商定價轉嫁,而非加價,因此 Moonshoot 的費率變動與 OpenAI 的費率變動,都會在供應商端出現的同一天出現在我們這邊,無需另一份合約,中間也沒有經銷商。

這一組之所以比大多數組合更值得重視,原因在於這兩個模型分屬不同的失效模式。GPT-6.1 Sol 是你用來進行持續執行、工具迴圈與事實可靠性的模型;Kimi K3 則是你在面對極長輸入時使用的模型,此時你要的是最佳的長脈絡分數,並且想要一個檢查點,作為對他人商業決策的避險。這些並非互相競爭的選項,而是同一股流量上的兩條路徑。把兩者放在同一個端點後面,讓它們之間能自動容錯移轉,並訂下一條規則:把長輸入的工作導向 K3,把執行類工作導向 Sol——這正是把「我們有個開放權重備援」從設計文件裡的一行字,變成凌晨三點、某通正在失敗的通話中真正能運作的東西的關鍵。

每個所屬之處
• 終端機代理、儲存庫規模的程式開發、多步驟執行 — GPT-6.1 Sol,在 Terminal-Bench 4.0 上有 43 分的差距。這可不是勢均力敵。
• 在幻覺代價高昂之處提供答案 — GPT-6.1 Sol,在 AA-Omniscience 上有 22 分的差距。
• 極長輸入搭配簡短的生成答案 — Kimi K3。此比較中最佳的長上下文推理分數、圖像輸入,以及永遠沒機會派上用場的冗長特性。
• 自我託管,或你必須能凍結的推論堆疊 — Kimi K3,而且僅限於你已經自行操作硬體的情況。檢查點才是交付成果;執行它的經濟效益則是另一回事。
• 對供應商變更條款的避險 — Kimi K3,而這是 GPT-6.1 Sol 無論出什麼價格都無法回應的論點。
• 依價目表做選擇 — 在此比較中,K3 和 Sol 都不是便宜的選項,而在 GPT-6 系列中,兩者也都不是便宜的選項。如果帳單是決定性因素,你要的模型在價目表更下方,而不是在這張比較表上。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
