
Claude Sonnet 5.5 vs Kimi K3:這兩個模型都不會採用你的溫度設定
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
這裡有一項比較:兩個模型在某件事上看法一致,而這件事無論如何都會讓你的程式碼掛掉。Sonnet 5.5 於 2026 年 9 月 28 日發布,它會以 400 錯誤拒絕任何把 temperature、top_p 或 top_k 設為非預設值的請求。Kim K3 自七月中起由 Moonshot AI 正式提供,它完全不接受任何取樣參數——沒有 temperature、沒有 top_p、沒有 seed——只透過 reasoning 控制項來調整推理深度。兩家不同的實驗室、兩種不同的架構,卻得出一個共同的結論:大多數整合基於習慣而設定的那些取樣旋鈕,在兩者上都不復存在。
那不是任何人會寫的比較。大家會寫的比較是價格:Kimi K3 每百萬個輸入 token 要 3 美元、輸出要 15 美元,對上 Claude Sonnet 5.5 的 2 美元與 10 美元,這在價目表上是 Anthropic 直接勝出。但 Kimi K3 是開放權重的 2.8 兆參數混合專家模型,你可以下載並在自己的邊界內執行;而 Claude Sonnet 5.5 是可在四家雲端上取得的閉源模型。在較便宜的閉源模型與較昂貴但可下載的模型之間,這個決定根本不是取決於每 token 的價格。
每一個是什麼,各以一段說明
Claude Sonnet 5.5 是 Anthropic 5.5 世代中的第二個模型,在 Claude Opus 5.5 登上 Claude API 的五天後隨之推出。它以 claude-sonnet-5-5 的形式在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上推出,維持 1M token 的上下文視窗與 128K 同步輸出上限,並完全沿用 Claude Sonnet 5 的定價:輸入 $2、輸出 $10,快取讀取每百萬 $0.20。自適應思考預設以 high 努力程度開啟。它可提供零資料保留,而 Artificial Analysis 在其 v4.3.2 修訂版中給予它 56 的 Intelligence Index 分數——在其所測量的 216 個模型中排名第三。

Kimi K3 是 Moonshot AI 的旗艦模型:一款 2.8 兆參數的混合專家模型,每個 token 約啟動 1,040 億個參數,具備 100 萬 token 的上下文視窗與原生視覺理解能力。它是為長時程程式開發與多步驟知識工作而打造,而 Moonshot 也點名將其定位於程式設計代理框架。它採用 OpenAI API 格式,並將reasoning_effort作為唯一的推理控制項對外開放,同時以 Kimi K3 授權條款釋出開放權重——這與開源並非同一回事,而這個差別正是你在其上建構之前該讀清楚的部分。
費率表,以及其下方的數字
請就決定法案的各項關鍵面向,把這兩者並排對照,而不是看新聞標題:
• 輸入價格 — Claude Sonnet 5.5 每百萬 $2,相較於 Kimi K3 每百萬 $3
• 輸出價格 — Claude Sonnet 5.5 每百萬 $10,對比 Kimi K3 每百萬 $15
• 快取讀取 — 每百萬 $0.20,對比每百萬 $0.30
• 上下文視窗 — 1,000,000 個詞元 vs 1,048,576 個詞元
• 權重 — 專有,四個託管平台 vs 依 Kimi K3 License 的開放權重
• 智慧指數 — Claude Sonnet 5.5 56 對 Kimi K3 44,在相同的 v4.3.2 修訂版上
• 每項 Intelligence Index 任務的成本 — Claude Sonnet 5.5 為 $7.60,Kimi K3 為 $2.00
• 索引上的冗長度 — Claude Sonnet 5.5 410M 輸出 token 對比 Kimi K3 160M
最後那組對照是值得細想的反轉。Anthropic 的模型在輸入上便宜 50%,在輸出上便宜三分之一,完成同一項評估的成本卻仍是 3.8 倍,因為它達到同樣結果耗費了 2.6 倍的 token。在綜合指標上,它的得分還高出十二分,所以這並非一個浪費的模型白花成本卻一無所獲。這是兩個模型的情況:它們的成本行為無法只靠讀兩張價目表來比較,而這正是索引任務數值存在的理由。
那兩組 token 計數都不會是你的 token 計數。Moonshot 自家的文件指出,K3 的推理深度是由 reasoning_effort 決定,而非取樣設定;Claude Sonnet 5.5 的 effort 參數實際上也是如此——因此在這兩個模型上,左右你帳單金額的最大單一槓桿是 effort 設定,而不是價格談判。

400 錯誤詳解

對取樣參數的共同拒絕,是這裡最實際的重疊之處,因為那正是模型替換後隔天一早就會浮現的故障。
在 Claude Sonnet 5.5 上,規則明確且毫不寬容。非預設的 temperature、top_p 或 top_k 會傳回 400。傳送 thinking: {"type": "disabled"} 會傳回 400,並指向 between_tools,這是新的最低思考設定,在 low、medium 和 high effort 下可接受,但在 xhigh 或 max 下會被拒絕。強制工具使用—— tool_choice 設為 "any" 或設為具名工具——會傳回 400,訊息為 "tool_choice: type \"tool\" and \"any\" are not supported for this model",而修正方式是 auto,再加上嚴格工具使用或結構化輸出。還有更多:思考區塊現在會綁定至產生它們的模型與帳戶,因此對話可以從 Claude Sonnet 5 移到 Sonnet 5.5,且其推理保持不變,但無法將該推理帶到不同的模型系列;而編輯過的前綴可能會讓重播變成 400。
在 Kimi K3 上,介面較小,但後果相似。沒有取樣參數需要傳送,因此任何把取樣參數寫死的用戶端,其實早已在傳送模型不會讀取的參數。推理深度反倒是頂層的 reasoning_effort欄位。
這兩項變更指向同一個方向:以確定性旋鈕來控制提示的做法,正被模型端的投入程度旋鈕取代。任何以 temperature 0.2 和固定隨機種子自我調校的管線,都必須在這兩個模型上改依投入程度重新調校,而重新調校就是遷移。
開放權重在這裡實際上能為你帶來什麼
相較於更便宜、評分更高的閉源模型,之所以要考慮 Kimi K3,原因不在能力,也不在價格,而在於邊界。
在自己的基礎架構內執行 K3,意味著提示、文件與輸出永遠不會離開你掌控的網路,這與和供應商簽訂零資料保留協議是截然不同的合規討論。這也意味著模型不會在你毫無防備的情況下被淘汰——Claude Sonnet 5.5 附帶 Anthropic 承諾不早於 2027 年 9 月 28 日退役,而下載的檢查點則沒有這樣的日期。而且這意味著邊際成本曲線會趨於平緩:硬體之後,token 就是免費的,而這是唯一能讓一個 2.8 兆參數模型成為廉價選項的結構。
授權條款才是你真正簽下的東西。Kimi K3 是開放權重,不是開源,而 Moonshot 並不使用後者這個詞。Kimi K3 授權條款對大多數用途而言範圍很廣,但若從事模型即服務(model-as-a-service)業務且滾動營收超過門檻,就需要另行簽訂商業協議;而產品若超過大量使用者或營收門檻,必須顯示「Kimi K3」的歸屬標示。稱它採用 MIT 授權,是 K2 時代的不準確說法,至今仍在流傳。如果你打算基於這些權重來開發,而不是呼叫 API,那麼這是一件需要法律審查的事,而不是一句註腳。
而且權重之大,使得自行託管成為一項資本決策。一個約 2.8T 參數、約 104B 活躍參數的 MoE 並非單一伺服器部署,而將它建置起來所需投入的心力,才是這個選項的真正成本——這筆成本讓輸出費率上每百萬 5 美元的差距相形見絀。
OrcaRouter 的定位
大多數評估這兩者的團隊,不想在受管 API 與硬體採購之間做選擇。他們想要路由。
OrcaRouter 是一個與 OpenAI 相容的端點,涵蓋 200 多個模型,並以供應商標價直接傳遞、不加收任何加成,因此任一供應商的費率變動都會在同一天反映,而不是等到下一個帳單週期。Kimi K3 自七月起已收錄於型錄中,價格為 Moonshot 自家的 $3 / $15,實測 p50 首個 token 時間約為八秒,且過去一週約有 3.719 億個 token 流經它。Claude Sonnet 5——多數 Claude API 流量仍使用的模型,實測每秒輸出 150 個 token——自 6 月 30 日起即可路由,價格為 Anthropic 的 $2 / $10。
Claude Sonnet 5.5 尚未收錄在我們的目錄中。若情況確實如此,就照實說明,並轉往供應商自家的方案——那是取得它的途徑;而在不做出承諾的情況下測試它的方法,就是把一定比例的流量放在自動容錯移轉之後,以 Claude Sonnet 5 或 Kimi K2 作為備援如果你關注 K3 的理由是邊界而非費率,那麼權重現在就能下載,而 API 只是權宜之計——這是你基礎架構的決策,而不是模型比較的問題。
評價,依你實際購買的內容區分
當工作屬於長脈絡且輸出量大時,選擇 Claude Sonnet 5.5;當所購買的是綜合指數上的十二個點時;以及當具備零資料保留的受管 API 通過你的審查時。為 token 用量習慣編列預算——Index 上的 410M 個 token 相較於 K3 的 160M,是實實在在的倍數——並為工具使用與思考區塊的變更編列一天的時間。
當邊界本身就是需求、當你想要一個沒有供應商能淘汰的檢查點,或當你的工作負載是高用量、代理式編碼,且每項索引任務 $2.00 相對 $7.60 的差距會複利累積時,就選擇 Kimi K3。接受它是個需自行託管的 2.8T 參數模型、其授權條款包含署名與營收條款,而且在綜合評分上低於 Anthropic 層級。
無論選哪一個都避不開的,就是第一段:兩邊的取樣參數都沒了,而取代它們的控制項就是努力程度旋鈕。無論你選這兩者中的哪一個,那都是你的程式碼所需的變更。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
