自製的『Claude Fable 5.1 對決 Kimi K3』英雄式標題卡,副標題為『推理天花板 vs 你可以擁有的天花板』。兩個面板:『Claude Fable 5.1』(Anthropic、封閉 API、每 100 萬個 token 10.00 / 50.00 美元、AA 智能指數 53、201 款中排名第 1、最大輸出 128K)與『Kimi K3』(Moonshot AI、開放權重、每 100 萬個 token 3.00 / 15.00 美元、AA 智能指數 44、開放權重排名第 2、最大輸出可達 100 萬個 token)。頁尾寫著『Claude Fable 5.1 於 2026 年 9 月 1 日推出 · Kimi K3 API 於 7 月 16 日、權重於 2026 年 7 月 27 日推出 · 獨立數據,現行 Artificial Analysis 指數,擷取於 2026 年 9 月 10 日』;OrcaRouter 標誌位於右下角。
Guides & Insights

Claude Fable 5.1 vs Kimi K3:推理天花板 vs 你能擁有的天花板

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Fable 5.1Kimi K3 瞄準的是同一類買家——在大型程式碼庫和文件集上運行長時間、使用工具的代理的團隊——而且它們來自市場的兩個極端。Claude Fable 5.1 是 Anthropic 的封閉式旗艦模型,於 2026 年 9 月 1 日發布,定價為每百萬輸入 token 10.00 美元,每百萬輸出 token 50.00 美元,根據 Artificial Analysis 的測量,在其目前的智慧指數上得分為 53:在該指數追蹤的 201 個模型中排名第一。Kimi K3 是 Moonshot AI 的 2.8 兆參數混合專家模型,於 7 月 27 日開放了權重,在同一指數上得分為 44——在其同類的 112 個開放權重模型中排名第二。明顯的解讀是九分的智慧差距,對應大約三倍的價格差距。更有用的解讀是,這兩個模型有不同的上限,而且只有其中一個上限能由使用它的人來提高。

關於資料來源:Artificial Analysis 於九月重新調整了其 Intelligence Index,因此這裡的分數、排名、速度與每項任務成本數據皆來自當前版本,於 2026 年 9 月 10 日擷取,與任一模型發布時的數字不可直接比較。Moonshot 自身的基準測試結果以及 Anthropic 的結果,均在出現處明確標示,且雙方均未重現對方的結果。Claude Fable 5.1 才推出九天,其供應商宣稱的效能幾乎未經外部測試;Kimi K3 則已歷經六週的外部測試。

同一窗口,不同的最大值。

這兩個模型都支援 1,048,576 個 token 的上下文視窗,而且都不會因為填滿視窗而加收費用——Moonshot 對 Kimi K3 的定價是每百萬 token 一律 $3.00 / 快取 $0.30 / $15.00,而 Claude Fable 5.1 的視窗定價則是每百萬 token 一律 $10.00 / 快取 $0.25 / $50.00。{{1}}正是因為共享相同的視窗規格,{{/1}}這兩個模型才會被拿來比較:{{2}}它們是為相同類型的工作而設計的,{{/2}}在這種工作中,單一任務會累積一個程式庫、一個資料室,或一整個星期的工具輸出。

差異在管道的另一端。Kimi K3 單次響應最多可輸出 1,048,576 個 token——供應商通常將其預設為 131,072,但上限是整整一百萬,Moonshot 將此宣傳為「一次調用即可輸出整個代碼庫」。Claude Fable 5.1 將單次響應限制在 128K 輸出 token。對一輪對話而言,這個限制無關緊要;但對整個儲存庫的生成、批量遷移或大量文檔集來說,這就決定了一次調用與你必須自行構建、監督並逐輪付費的 agent 迴圈之間的差別。

這些數字,逐維度地

• 每 1M tokens 的價格 — Claude Fable 5.1 輸入 $10.00 / 輸出 $50.00,對比 Kimi K3 輸入 $3.00 / 輸出 $15.00。

• 快取輸入 — Claude Fable 5.1 每 1M 0.25 美元,Kimi K3 則為 0.30 美元;Artificial Analysis 將其轉化為有效快取折扣:98% 對 90%。

• 獨立評分、速度與成本——Claude Fable 5.1 在目前的 Intelligence Index 中得分為 53(在 201 個模型中排名第 1),每秒輸出 67.2 個 token,每個 index 任務成本 $7.63;Kimi K3 得分為 44(在 112 個開放權重模型中排名第 2),每秒輸出 35.5 個 token,每個任務成本 $2.00,而該指數指出其明顯較慢且有些冗長——每次 index 運行輸出 160M 個 token,相較於 Claude 模型的 190M。

• 上下文與輸出上限 — 1M tokens 輸入,最多 128K tokens 輸出,相較於 1M tokens 輸入,最多 1M tokens 輸出。

• 權重 — 封閉、僅限 API,對比開放且可自行託管;由 Moonshot 以 Kimi K3 授權發布,此為修改版 MIT 變體,包含針對大型經銷商的商業條款,權重存放於 Hugging Face。

{{1}}• 視覺功能 — Claude Fable 5.1 在 API 上接受文字、圖片和檔案輸入;{{/1}}{{2}}Kimi K3 在 API 上接受文字和圖片,{{/2}}{{3}}但原生視覺功能是服務層級功能,不屬於已發布權重的一部分。{{/3}}

• 推理可見性 — Kimi K3 在 API 中串流輸出其推理軌跡;Claude Fable 5.1 回傳思考區塊,其顯示方式由你選擇:摘要或省略,原始思維鏈則絕不暴露。

— 架構 — Claude Fable 5.1 的參數數量未公開;Kimi K3 是稀疏混合專家模型,總參數達 2.8T,活躍參數約 104B。

• 發布 — Claude Fable 5.1 於 2026 年 9 月 1 日推出;Kimi K3 的 API 於 2026 年 7 月 16 日推出,並於 7 月 27 日開放權重。

A self-built two-column scoreboard titled 'Claude Fable 5.1 vs Kimi K3 — the scoreboard'. Left column 'Claude Fable 5.1 (Anthropic)': 'AA Intelligence Index 53 (#1 of 201)', 'Price in / out $10.00 / $50.00 per 1M tokens', 'Cost per index task $7.63', 'Context / max output 1M / 128K', 'Weights closed, API only', 'Released Sep 1, 2026'. Right column 'Kimi K3 (Moonshot AI)': 'AA Intelligence Index 44 (#2 of 112 open-weights)', 'Price in / out $3.00 / $15.00 per 1M tokens', 'Cost per index task $2.00', 'Context / max output 1M / up to 1M', 'Weights open, self-hostable', 'Released API Jul 16, weights Jul 27, 2026'. Footer: 'AA figures per Artificial Analysis, current index version, captured Sep 10 2026.'

九分差距是什麼,以及不是什麼

在目前的指數中,Claude Fable 5.1 以 53 分領先,Kimi K3 則以 44 分位居第二,領先開放權重領域的其餘模型。九分的差距是真實的落差,並非雜訊;但這個指數是加權後的綜合指標——涵蓋代理型任務、程式設計、科學推理與通用能力——單一分數掩蓋了這款開放模型真正擅長的領域。在九月初的獨立評測中,Kimi K3 在長時程代理任務上位居開放領域的頂尖或接近頂尖:在受測模型中,AutomationBench 排名第一、Artificial Analysis 的 agentic Briefcase 套件排名第二、GDPval-AA v2 排名第三。獨立競技場資料將其網頁開發能力評定在 Code Arena 的 Web Dev 排行榜上約 1,679 Elo,截至九月初都接近該領域的頂端。這些正是這款開放模型沒有落後九分的工作負載。

Claude Fable 5.1 之所以脫穎而出,在於其嚴謹推理的天花板。Anthropic 報告在 Terminal-Bench-Science 0.1 上取得 52.6%,是先前 Claude 世代 24.7% 的兩倍多,另外在 Terminal-Bench 4.0 上取得 55.8%——兩者皆為廠商自行報告且未經重現。這些數字支撐了九月的發布將科學與長程工作的標竿推向新高度的說法。誠實的總結是,Kimi K3 在代理廣度與網頁開發上具有競爭力,而封閉模型則在推理最深入的領域領先;九個百分點的指數差距將這兩項事實壓縮成一行。

有一個數據點因其特殊性而值得單獨一提:Moonshot 自家公布的 Terminal-Bench 2.1 成績中,Kimi K3 為 88.3%,而獨立測量結果則為 85.0%。供應商數據能在中立測量下幾乎完整保留的情況相當罕見,而如此小的差距——且是偏向供應商——比任何單一指標分數都更能說明該模型的表現。

Screenshot of the Artificial Analysis model page for Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), captured September 10, 2026, showing Intelligence Index 53 ranked #1 of 201, output speed 67.2 tokens per second, a $7.63 cost per Intelligence Index task, a 98% cache discount against $10.00 input and $50.00 output pricing, 190M output tokens of verbosity, and a 1M-token context window.

所有權分叉,如實計價

開放權重是選擇 Kimi K3 的理由,也是必須仔細閱讀細則的原因。Kimi K3 是一個擁有 2.8 兆參數的稀疏混合專家模型;自行部署它代表你需要多節點 GPU 叢集,而不是在工作站上花一個下午就能搞定,而且 Kimi K3 的授權條款設有針對大型轉售商的商業門檻。你用這套基礎設施換來的是實實在在的優勢:沒有速率限制、沒有按 token 計費、可以在自己的資料上進行微調、完整的可稽核性,以及永遠不會離開你網路的提示詞——這些需求正是封閉式 API 在受監管及國防相關工作中無法被採用的原因。

有兩個注意事項必須附帶說明。自架會失去 API 原生的視覺能力,因為圖像輸入是服務層的功能,而非包含在已釋出的權重中;此外,模型速度緩慢,在目前的基準上測得每秒僅輸出 35.5 個 token——這是擁有 2.8T 參數、且推理始終啟用的混合專家模型的自然結果。生成 20,000 個 token 就需要數分鐘的生成時間;而在你自己的叢集上,這數分鐘消耗的是你自己的 GPU。

租用版本的差距比所有權問題所暗示的更為接近。Moonshot API 上的 Kimi K3 定價為 $3.00 / $15.00,快取輸入為 $0.30,約為 Claude Fable 5.1 token 費率的三分之一;而 Claude 方面則在九月將快取讀取價格調降 75%——降至每百萬 $0.25,低於 Kimi——這正是兩款模型鎖定的長時間代理工作階段中的關鍵所在,因為在這些工作階段中,相同的工具輸出會被重複讀取數十次。就獨立的每項任務成本指標而言,差距落在 Kimi K3 的 $2.00 對比 Claude Fable 5.1 的 $7.63:將近四倍的差距,而非 token 價格所暗示的三倍,因為在相同的索引工作中,Anthropic 模型約寫入 190M 個 token,而 Kimi 則為 160M 個。

看得見的推理

有一種開發者體驗上的差異,是任何基準測試表都顯示不出來的。Kimi K3 會透過 API 串流輸出其推理軌跡,讓失敗的 agent 步驟變成你可以直接閱讀的內容,而不是需要自行推斷的內容。Claude Fable 5.1 則採取相反的做法:思考永遠開啟,原始思維鏈永不回傳,顯示設定只決定你收到的是可讀摘要,還是什麼都沒有。對大多數生產環境的日誌記錄而言,摘要已經足夠;但對不斷走錯分支的 agent 進行除錯時,軌跡更勝一籌。如果你是在建構 agent 基礎設施而非消費它,這種差異會以數小時為單位顯現出來。

採購註腳

對於美國企業而言,有一個非技術性變數影響著這場較量。Moonshot AI是一家總部位於北京的實驗室,一直受到美國政府的審查:財政部長曾公開威脅要將該公司列入貿易黑名單,美國官員指控其從美國模型中蒸餾能力——Moonshot否認這項指控——而媒體報導稱,該公司與微軟、亞馬遜和Google就託管Kimi K3進行了早期談判,協議採收益分成模式,同時於9月初祕密提交了香港IPO申請。這些都不會改變技術層面的比較,而在您自己的基礎設施內部部署開放權重的美國託管方案,與將提示詞路由至離岸API在本質上有所不同。這確實意味著,關於Kimi K3的採購決策是一個帶有政策層面的決策,應該由了解這一點的人來做出。

與其爭論,不如實際進行比較。

兩個模型都可以在 OrcaRouter 上以供應商的牌價、零加成取得,因此這是個你可以用自己的資料來定論、而非依賴基準測試表的比較:Kimi K3 在 Moonshot 的 $3.00 / $15.00Claude Fable 5.1 在 Anthropic 的 $10.00 / $50.00,而且共用同一把金鑰、同一張帳單,無需簽訂第二份合約,也無需改動程式碼即可切換。將同一套評測框架同時指向兩個模型,衡量在實際工作負載下每完成一個任務的成本,並讓自動容錯移轉在候選模型仍在評估期間守住正式環境的服務路徑。如果工作負載屬於深度推理,或運行於 Claude Code 之中,閉源的旗艦模型通常勝出;如果是高產量的生成任務,百萬 token 的輸出或自行部署會改變成本結構,Kimi K3 是兩者中唯一可以自行部署持有的,而路由層就是讓你能夠同時保留兩種選擇的地方。

Screenshot of the OrcaRouter model page for Kimi K3 (model id kimi/kimi-k3) showing $3.00 input and $15.00 output per 1M tokens, the MoonshotAI provider listed as of 2026-07-15, a 1M-token context window with text and image input, Vision, Tools, JSON and Reasoning capability badges, a description of it as a 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding and end-to-end knowledge work, the /v1/chat/completions and /v1/responses endpoints, and seven-day traffic of 2,343.0M tokens.

接下來該關注的事情是對稱的。Anthropic 一直以大約每月一次的節奏發布更新,如今已證明它會在不動基本費率的情況下調降快取定價,因此這場較量的成本面可以在沒有新模型的情況下發生變化。Moonshot 自身的未來現在與其上市計畫以及那些美國雲端運算洽談緊密相關,這兩者都可能改變 Kimi K3 的提供方式與提供地點。這些都不是等待的理由:兩個模型目前都能做到上述數字所顯示的表現,而最能經得起時間考驗的決定,是讓模型 ID 保持為設定值,而不是改寫程式。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新