
GPT-6 Luna 對決 Kimi K3:四倍吞吐量、三十分之一的價格,以及一個真正的例外
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
兩款模型都在過去三個月內發布,都被定位為某個前沿家族中的廉價層級,而且都對「廉價層級」的含義有著一模一樣的誤解——其實根本毫無誤解。Kimi K3 是 Moonshot AI 的開放權重旗艦模型,自 2026 年 7 月 27 日起以 Modified MIT 授權條款公開發布,定價為每百萬輸入詞元 3.00 美元、每百萬輸出詞元 15.00 美元,快取讀取為 0.30 美元。GPT-6 Luna 則是該廠商的高用量層級,自 2026 年 9 月 22 日起正式全面推出,價格為 0.10 美元與 0.50 美元,快取讀取為 1 美分。輸入端相差三十倍,輸出端也相差三十倍,而其中一方所附的授權條款,是另一方無論出多少錢都給不出的。
不過,費率表並不是決定這項搭配的因素,因為兩者的差距還不到需要抉擇的地步。真正決定的是兩家廠商都不會放在標題上的數字:實測輸出速度。Kimi K3 每秒生成 38.7 個 token,GPT-6 Luna 每秒生成 153.9 個。這是四倍的落差;對於任何模型是迴圈內元件、而非供人對話之端點的工作負載來說,四倍的吞吐量差異改變的是架構,而不是帳單。
這兩者實際上究竟是什麼
Kimi K3 是一個擁有 2.8 兆參數的混合專家模型,每個 token 有 1040 億個活躍參數,具備 1,048,576 個 token 的上下文視窗、1,048,576 個 token 的輸出上限,並在 Hugging Face 上以 Modified MIT 授權條款發布權重。它是獨立排行榜上得分最高的開放權重模型——在 112 個開放權重模型中排名第一——並且在 Code Arena 的 WebDev 排行榜上以 1,679 Elo 位居榜首。Moonshot 在 Terminal-Bench 2.0 上報告了 88.3% 的成績,這是廠商數據,未經獨立重現。
GPT-6 Luna 是 OpenAI GPT-6 世代中的小型層級,位階低於定價 $2.00/$10.00 的 GPT-6 Sol,也遠低於旗艦級的 GPT-6 Astra($10.00/$50.00)。支援文字與圖像輸入、文字輸出,具備 1,050,000 詞元的上下文視窗,最大輸入為 922,000 詞元,輸出上限為 128,000 詞元;推理強度可從 none、low、medium、high、xhigh 到 max 中選擇,預設為 medium。它是封閉式的單一識別碼模型,任何擁有 API 金鑰的人都能使用。
一個是下載,一個是端點。兩者皆按用量計價。這就是這項比較的樣貌。
卡片,逐行
每個維度一行,每一行兩側都要顯示:
• 每 100 萬輸入 — GPT-6 Luna $0.10 對比 Kimi K3 $3.00
• 每 1M 輸出 — GPT-6 Luna $0.50 對比 Kimi K3 $15.00
• 每 1M 的快取輸入 — GPT-6 Luna $0.01 對比 Kimi K3 $0.30,在兩張卡上都是各自輸入費率的十分之一
• 長上下文條款 —— GPT-6 Luna 在輸入超過 272,000 個 token 時,會將輸入與快取加倍,並將輸出提升 1.5 倍,且適用於整個請求;相較之下,Kimi K3 的規格卡上並未公布同等條款
• 上下文視窗 — GPT-6 Luna 1,050,000 個 token,最大輸入為 922,000,對比 Kimi K3 的 1,048,576 個 token
• 最大輸出 — GPT-6 Luna 128,000 個 token,對比 Kimi K3 的 1,048,576 個 token,上限高出八倍
• 智慧指數,獨立 — GPT-6 Luna 在最高努力下為 37,對比 Kimi K3 在最高努力下為 44,同一指數版本
• 預設努力程度分數 — GPT-6 Luna 29 在其預設中等設定下,對比 Kimi K3 在其最高設定下測得
• 每個 Index 任務的成本,獨立計算——GPT-6 Luna 約 $0.07,對比 Kimi K3 $2.00
• 索引執行中的輸出 token — GPT-6 Luna 150M 對上 Kimi K3 160M,相較於排行榜中位數 88M;兩者都比排行榜的中位數模型冗長得多
• 輸出速度,獨立 — GPT-6 Luna 每秒 153.9 個 token,對比 Kimi K3 每秒 38.7 個 token
• 權重 —— GPT-6 Luna 閉源、僅提供 API,對比 Kimi K3 自 2026 年 7 月 27 日起於 Hugging Face 公開
• 授權 — GPT-6 Luna 不適用,對比 Kimi K3 Modified MIT;後者與 MIT 並非相同的法律文書
• 總參數 — GPT-6 Luna 未公開,對比 Kimi K3 的 2.8 兆,其中每個 token 有 1,040 億為活躍參數
• 亮眼證據 — GPT-6 Luna 的工具呼叫與代理迴圈,每千個快取輸入 token 僅需十分之一美分;相較之下,Kimi K3 Code Arena WebDev #1 以 1,679 Elo、Terminal-Bench 2.0 達 88.3%(廠商回報),並在獨立排行榜上取得最高開放權重分數
• 在 OrcaRouter 上——GPT-6 Luna 未列入我們的目錄,而 Kimi K3 可依 Moonshot 的定價進行路由

吞吐量是那個沒人會拿來當頭條的規格。
一個每秒 38.7 個 token 的模型和一個每秒 153.9 個 token 的模型,並不是同一款產品貼上不同價格標籤。它們是不同的產品。
以一個任務為例,模型必須產出 1,500 個 token 的答案——一份摘要、一份結構化擷取、一段附有說明的程式碼修補。以每秒 153.9 個 token 的速度,這個答案大約需要十秒。以 38.7 的速度則約需三十九秒。這兩個數字都不包含推理時間或網路延遲,因此現實世界中的差距按比例來看比四倍更大,而非更小。
現在,把它放進迴圈裡跑。一個代理要完成單一任務得進行三十次模型呼叫——規劃、選擇工具、讀取結果、決定下一步、重複——這些呼叫總共會產生大約 15,000 個輸出詞元。GPT-6 Luna 生成這些內容大約花費 97 秒。Kimi K3 則大約花費 388 秒。這就是使用者願意等待的任務,與使用者得預先排程的任務之間的差別,而再怎麼寬鬆的授權條款都改變不了這一點。
冗長非但沒有抵銷速度問題,反而使其雪上加霜。Kimi K3 在完成獨立索引時產生了 1.6 億個輸出詞元,而 GPT-6 Luna 為 1.5 億個——因此在那項評估中,較慢的模型同時也產出了略多的詞元,而非更少。這兩個模型同樣冗長;它們只是速度並不相當,而在以輸出計價的方案中,冗長要付出雙重代價。
值得直說的是,這不是 Kimi K3 的缺陷。一個擁有 2.8 兆參數、其中 1040 億為活躍參數的模型,每個 token 所做的工作比小型層級的模型更多,而吞吐量數字正是對這份工作的衡量。相關問題在於:你的工作負載是否需要這份工作。如果需要,每秒 38.7 個 token 就是換取這項能力的代價。如果不需要,你就是在為自己並未要求的深思熟慮付費,而且付了三十倍。
K3 七個要點的所在位置
Kimi K3 在最高強度設定下,於獨立的 Intelligence Index 上拿下 44 分。GPT-6 Luna 在相同設定下得到 37 分。七分的差距,而在這項複合指標中,一分還落在重跑一次的雜訊範圍內——但兩者每完成一項任務的成本卻相差約二十八倍,$2.00 對上約 $0.07。
這七分並非平均分布。Kimi K3 的聲譽集中在程式編寫與代理式軟體工作上,而這正是這款模型存在的理由:Code Arena 的 WebDev 排行榜以 1,679 Elo 將它列為第一,而廠商公布的 Terminal-Bench 2.0 數字 88.3% 則是一項程式編寫代理的測量結果。GPT-6 Luna 自身的程式編寫地位是倒退一步而非向前邁進——其 Coding Agent Index 停留在 41,比它所取代的 GPT-5.6 Luna 低兩分,下滑主要集中在 SWE-Atlas-QnA 與 DeepSWE v1.1。如果你的工作是一個代理針對真實儲存庫編寫軟體,那就是七分的指數差距,加上兩分的世代退步,兩者指向同一個方向,而選擇廉價層級的理由就變得薄弱許多。
那七分差距不存在的地方,正是 GPT-6 Luna 定價所瞄準的工作類別。分類、擷取、路由、批次摘要,以及需要快速做出是非判斷的代理內層迴圈——在這些任務上,兩個模型絕大多數時候都會產出同樣可用的輸出,而這點差異經不起你自己的評估集檢驗。這個指數衡量的是一項綜合指標,其中長程推理與程式設計佔有很高的權重,而這兩者都不是路由決策所需要的。
有一個值得附加到兩邊指數數據上的注意事項:這個排行榜是滾動式評估,其修訂很重要。同一個排行榜的較早快照顯示 Kimi K3 比我們今天抓取到的 44 高出許多,因為綜合評分、測試框架和模型集都會變動。任何依賴滾動指數上兩個模型之間精確差距的比較,都是在依賴一個不會保持不變的東西。誠實的解讀是,這兩者在各自的上限處於相鄰的能力帶,而該指數無法告訴你哪一個對你的任務更好。
例外狀況:Modified MIT 實際上能為你帶來什麼
Kimi K3 的授權條款,是 GPT-6 Luna 無論付出什麼代價都無法回答的那一個層面,而它值得比「開放權重」這個詞通常所獲得的更精確界定。
權重已在 Hugging Face 上公開,而授權條款是 Modified MIT,不是 MIT。這項區別很重要:Modified MIT 授權通常會附帶條件——常見的是當模型被用於超過某個規模的產品時,必須顯示署名——任何打算以這些權重打造商業產品的人,都應該閱讀實際的條款文件,而不是只看它名稱相似的授權家族。這並不是避免使用它的理由。而是不該在採購文件中把它描述成 MIT 的理由。
下載所換得的效益是真實的,但有其限度。它能換到成本下限,意思是:在用量夠大時,固定的 GPU 佔用量能勝過按量計費的帳單。它能換到不受供應商路線圖左右的獨立性——你自行託管的模型不會在你腳下被淘汰。它能換到依自身資料分布進行微調的能力。而且它能換到將提示詞保留在自身邊界內的選項;對某些團隊來說,這在還沒提到價格之前,就已經讓比較結束了。
真正的成本在於硬體。一個擁有 2.8 兆參數、1040 億活躍參數的專家混合模型,不是能在工作站上運行的模型。要以生產級吞吐量提供服務,是一項叢集規模的投入,伴隨資本成本、營運成本,以及由你承擔而非租用的延遲特性。這並不是反對自行架設 Kimi K3 的論點——而是說,正確的比較不是每百萬輸出 token 15.00 美元對上 0.00 美元,而是每百萬輸出 token 15.00 美元對上一個包含晶片與人力的每 token 完整成本。對少數組織來說,那個數字較低。對大多數組織來說並非如此,而交叉點比授權條款讓人感覺的更遠。
執行其中一個,或兩者都執行
Kimi K3 已在 OrcaRouter 上架,採用 Moonshot 的定價,在轉嫁式定價模式下,這意味著供應商的價格變動當天就會在我們這邊生效。自動容錯移轉正是這個模型特別值得採用的一環:自架或第三方的 Kimi K3 端點效能劣化,正是你會希望路由在無需部署的情況下轉移的情境,而每秒 38.7 個 token 的模型,能吸收上游延遲的餘裕本來就比快速模型來得少。
截至目前撰寫本文時,GPT-6 Luna 並未收錄在我們的目錄中,必須透過 OpenAI 自家的 API 才能存取,因此想同時擁有兩者的團隊,會為 Kimi K3 使用一把金鑰,並與其原本用於 OpenAI 的金鑰並行運作。這也是一種組合,讓路由 DSL 能做到硬編碼分流所做不到的事:一條將編碼與長時程工作送往 Kimi K3、並將所有供程式取用且短小的工作送往 GPT-6 Luna 的規則,所表達的是一條會隨著任一家供應商每次發布而移動的界線,而且它是以組態的形式移動,而非以程式碼路徑的形式移動。模型融合是這裡另一個值得點名的組態——由一個緩慢謹慎的模型與一個快速便宜的模型共同作答所構成的組合,讓便宜的一方承擔流量,昂貴的一方裁決真正重要的案例,這正是這對模型契合得出奇的形態,因為兩者之間的成本不對稱大到足以讓把一次 Kimi K3 呼叫花在一小部分流量上是負擔得起的。

哪一個,以及何時?
如果你的工作負載屬於高流量、由程式取用且對延遲敏感,就選 GPT-6 Luna。分類、擷取、路由、大量摘要、代理的內層迴圈。以 $0.10/$0.50 的價格、一分錢的快取讀取,加上四倍於 Kimi K3 的吞吐量,這筆帳算起來毫無懸念,延遲差距也絕非微不足道。請明確設定 effort 參數,因為預設值是 medium,而文宣上的 37 是最大 effort 的數字,並讓長時間的呼叫維持在 272,000 個 token 這條線的正確一側。
如果你需要權重,就選 Kimi K3;如果你的工作是在真實的程式碼儲存庫上進行代理式編碼,而它的 WebDev 排名與廠商回報在 Terminal-Bench 2.0 上的 88.3% 才是關鍵證據;如果你需要高於 128,000 個詞元的輸出上限;或者如果你的組織無法將提示傳送到封閉端點,那就選它。把每秒 38.7 個詞元當作這筆交易的一部分接受下來,並且要實際閱讀 Modified MIT 條款,而不是自行假設。
這項比較容易引發的錯誤,就是把三十倍的比率當成能力問題的答案。它其實是詞元問題的答案。能力問題取決於你需要的是權重還是速度,而這兩個答案指向相反的方向。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
