GPT-6 與 Kimi K3 比較的 Hero 標題卡。大標題為「GPT-6 vs Kimi K3」。資訊標籤寫著「Kimi K3:1,048,576 上下文,$3.00 / $15.00,2026-07-15 發布」。資訊標籤寫著「GPT-6 Sol:1,050,000 上下文,$2.00 / $10.00,2026-09-22 正式推出」。頁尾寫著「兩者皆接受文字與圖片輸入;計價與評分方式不同。」
Guides & Insights

GPT-6 對比 Kimi K3:兩款專精領域不同的兩百萬 Token 模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol 與 Kimi K3是最有可能被列入同一項任務候選名單的兩個模型:百萬 token 上下文視窗、圖像輸入,以及讓長文件變得可負擔的價格。它們從相反方向達到這個位置。Kimi K3 是 MoonshotAI 的長上下文專家,於 2026 年 7 月 15 日發布,其規格表以召回為核心——在 Artificial Analysis 的長上下文召回測試中得分 88.7%,領先我們能與之比較的該供應商旗下每一款模型。GPT-6 Sol 則是該供應商的中階通用模型,於 2026 年 9 月 22 日推出,輸入每百萬 token 2.00 美元、輸出每百萬 token 10.00 美元,其優勢在於廣度:稍大的視窗、更高的通用推理綜合分數,以及更便宜的輸出 token。

所以,誠實的說法不是孰優孰劣,而是召回與推理之別,而這取決於你載入那百萬之後,究竟要拿它們來做什麼。

這些窗戶在圖紙上大小相同。

兩張卡都標示大約一百萬個 token,而差異只是表面上的。Kimi K3 的視窗是 1,048,576 個 token——正好是 2^20,也就是每個長上下文模型都會引用的二進位百萬。GPT-6 Sol 的則是 1,050,000,一個整齊的十進位數字,大約多了 1,400 個 token。對任何你真正塞得下的工作負載來說,這兩者是同一個視窗。別根據這一點來做選擇。

不同的是封套的其餘部分,而那是一份簡短清單。

• 上下文:Kimi K3 1,048,576 個 token,GPT-6 Sol 1,050,000 — 實際上旗鼓相當
• 輸入模態:Kimi K3 接受文字與圖片;GPT-6 Sol 接受文字、圖片與檔案
• 輸出上限:GPT-6 Sol 單次回應 128,000 個 token;Kimi K3 的模型卡未公布最大輸出數字
• 標準價格:Kimi K3 每百萬 $3.00 輸入 / $15.00 輸出,GPT-6 Sol $2.00 輸入 / $10.00 輸出
• 快取輸入:Kimi K3 每百萬 $0.30,GPT-6 Sol 每百萬 $0.20
• 長上下文定價:Kimi K3 列出單一費率,未記載分級;GPT-6 Sol 在輸入超過 272,000 個 token 時,會將整個請求重新計價為 $4.00 輸入 / $15.00 輸出
• 推理控制:GPT-6 Sol 提供可配置的 reasoning.effort;Kimi K3 透過相同的 OpenAI 相容介面提供 reasoning 與 reasoning-effort 參數

Kimi K3 缺少輸出上限這件事值得點出,而非輕描淡寫帶過:MoonshotAI 公布了脈絡長度數字,卻沒有公布最大輸出數字,因此依賴硬性輸出上限來編列預算的系統,無法從規格表上直接讀到這個數字。長上下文級距是另一個不對稱之處,而且它的影響方向違反直覺——GPT-6 Sol 的檯面費率較低,但其超過 272K 後整筆請求重新計價,意味著一次 300,000 個 token 的呼叫會從第一個 token 起就以 $4.00 / $15.00 計費,而 Kimi K3 單一 $3.00 / $15.00 的費率則完全沒有記載會分級調升。就非常長的文件而言,Kimi K3 在輸入方面最終可能成為兩者中較便宜的一方,儘管其檯面費率較高。

Recall 是 Kimi K3 的真正產品

選擇 Kimi K3 的理由,不是因為它擁有很大的上下文視窗——好幾款模型都有。而是因為它能保留視窗裡的內容。在 Artificial Analysis 的長上下文召回評估中(收錄於模型目錄),Kimi K3 得分 88.7%,而 GPT-6 Sol 為 83.7%。這是在一項正是用來衡量模型能否找到並運用埋藏在長輸入中的細節的測試上,相差五個百分點;而這種差距會在生產環境中顯現為真實的失敗——摘要工具漏掉第 400 頁的條款,合約審查工具錯過賠償條款。

Kimi K3 在程式設計方面也領先,而且領先幅度比綜合指數所顯示的更大。在程式設計指數上,它達到 76.2,排名位於受評模型的前十名之內;並在 terminal-bench v2.1 上取得 85.0%——這是一項代理式命令列基準測試,程式設計代理的實用性正取決於它。其 GPQA Diamond 分數為 93.5%,位居排行榜的最高區間。

GPT-6 Sol 真正扳回一城的地方,在於綜合指標與科學程式碼。其通用智慧指數 47.6,領先 Kimi K3 的 43.6 達四點,接近最高十分位;兩者在 SciCode 上分別為 57.6% 與 59.5%,旗鼓相當,落在單次執行的雜訊範圍內;而在 Humanity's Last Exam 上,GPT-6 Sol 的 47.9% 微幅勝過 Kimi K3 的 46.9%。這些單一基準的差距,沒有一項大到足以單憑它做出選擇。

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

依工作負載計費,而非依價目表

價目表會誤導人,因為每項工作的輸入與輸出 token 比例都不同,而這兩個模型對於哪一邊比較便宜的看法並不一致。Kimi K3 是在假設你的工作以輸入為主——長文件進、短答案出——時比較便宜。GPT-6 Sol 則是在假設你的工作量均衡或偏重輸出時比較便宜,因為它的輸出費率低了三分之一。

• 讀一本書並加以摘要的形態(900K 輸入、4K 輸出):Kimi K3 ≈ $2.76,GPT-6 Sol ≈ $3.64(在 272K 重新計價適用之前);套用重新計價後,GPT-6 Sol 的整通呼叫會移到較高費率級距,差距隨之擴大
• 平衡型代理式形態(60K 輸入、20K 輸出):Kimi K3 ≈ $0.48,GPT-6 Sol ≈ $0.32
• 程式碼生成形態(30K 輸入、60K 輸出):Kimi K3 ≈ $0.99,GPT-6 Sol ≈ $0.66

那些是根據各家廠商公布費率所做的原始 token 計算,且排除了快取輸入,而快取輸入對你最常快取的那個模型最有利。重點在於答案的形狀:對於純粹的長輸入回憶類工作,Kimi K3 的固定費率勝出;而對於任何會大量回寫的任務,GPT-6 Sol 較低的輸出費率勝出。兩者都不是普遍更便宜,而若一項比較在價格上只點名一個贏家、卻未說明 token 比例,那根本沒有衡量到任何東西。

溯源是決策的一部分

Kimi K3 由中國實驗室 MoonshotAI 打造,而 GPT-6 Sol 則出自 OpenAI。這項差異並非基準測試分數,也不會出現在價目表上,但對於受監管的工作負載而言,它在價格被討論之前就已決定了候選名單。MoonshotAI 在目錄中的卡片並未公布授權欄位,因此此處的任何內容都不應被解讀為對權重是否可取得的任何一方主張——若開放權重對你的部署至關重要,請向來源端查證,而非僅憑系列名稱逕自假設。

對於需要兩者的團隊——一條管線的某個部分用中國實驗室的模型,另一部分用 OpenAI 模型,而路由、計費與資料落地問題都在同一個地方處理——這正是值得擁有一個單一閘道,而不是兩套憑證的原因。在 OrcaRouter 上,兩者kimi/kimi-k3與 GPT-6 Sol 都是同一份目錄中的即時路由,以供應商的定價、0% 加價提供,因此 MoonshotAI 或 OpenAI 的價格變動當天就會生效。自動容錯移轉意味著任一供應商上的路由效能降低,都不會讓管線停擺,而且路由 DSL 讓你依規則、而非憑猜測,把重視召回的工作送到 Kimi K3、把重視生成的工作送到 GPT-6 Sol。

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

該把哪一個放進 pipeline 中?

當任務是在極長輸入上進行檢索與保留時,就選用 Kimi K3——法律與醫療文件審閱、整份程式碼儲存庫的理解、橫跨數百份文件的謄錄分析——以及當你的提示詞輸入量夠大,使固定的 $3.00 費率勝過 GPT-6 Sol 的重新定價時。它的召回率領先幅度與前十名的程式編寫排名,正是證明這項選擇合理的兩個數字。

當工作是需要百萬 token 視窗支援的通用助理時,選擇 GPT-6 Sol:混合推理、序列化為 JSON、會大量寫回內容的代理迴圈,以及任何 128,000-token 輸出上限是優點而非限制的工作流程。它的輸出成本更低,提供明確的推理強度控制,而其綜合指標是更強的通用訊號。當一條管線確實兩者都做時,誠實的答案是路由,而不是二選一——這是在陳述你的流量型態,而不是關於任一個模型。

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新