Kimi K3 是 Moonshot AI 的旗艦模型,也是迄今為止功能最強大的版本——一個擁有 2.8 兆參數的混合專家(Mixture-of-Experts)模型,專為長期程式碼撰寫與端到端知識工作而設計。它配備 100 萬 token 的上下文視窗,並具備原生視覺理解能力,可接受文字與圖像輸入並輸出文字,且在超長代理會話中仍能維持連貫性。 Moonshot 將 K3 定位於程式設計代理場景,例如 Codex、Claude Code、Cline 和 RooCode,同時也適用於深度推理與知識工作。它提供頂層的 reasoning_effort 控制項與原生工具呼叫,並採用 OpenAI API 格式以實現無縫整合。請注意,K3 不接受取樣參數(無 temperature / top_p / seed)——推理深度透過 reasoning_effort 來控制。
MoonshotAI Kimi K3 是由中國 AI 公司 MoonshotAI 開發的大型語言模型。它支援 1,048,576 個 token 的上下文視窗,並可同時接受文字和圖片輸入。該模型專為需要保留並推理超長序列資訊的任務而設計,例如整本書籍、長篇研究論文或長時間對話。透過 OrcaRouter 的 OpenAI 相容 API 存取,基礎 URL 為…
Kimi K3 的主要能力是處理高達 1,048,576 個 token 的上下文窗口,使其能夠在單一提示中納入整本小說、長篇技術手冊或大量的對話歷史。它還接受圖片,實現多模態推理。該模型可以執行摘要、問答和生成等任務,涵蓋非常長的輸入。它能夠理解複雜指令並在長序列中遵循這些指令。透過 OrcaRouter,它支援與 OpenAI 相容的 API 參數,如 temperature、max_tokens、top_p 和 stop sequences。
Kimi K3 最適合用於任務本身需要極大上下文的情況——例如一次性分析一份 1,000 頁的文件,或維持包含數百條訊息完整歷史的對話。對於較短的輸入,其較高的每 token 成本(每百萬 token 3 美元 / 15 美元)可能不划算。具有較小上下文視窗的更便宜模型可以更有效地處理大多數典型任務。僅在任務需要完整上下文視窗以避免截斷或多個分塊摘要步驟時,才使用 Kimi K3。
Kimi K3 擅長處理資訊分散在極長文本或包含圖片的任務,例如從書籍長度的報告中提取關鍵事實、回答關於完整程式碼庫的問題、比較多篇研究論文,或分析一系列圖表。它也能在長時間對話中維持一致性。其優勢在於能同時關注上下文的各個部分,減少對外部檢索或分塊的需求。
雖然Kimi K3擁有較大的上下文窗口,但在狹窄任務上,其表現可能不如較小且經過微調的模型。較大的上下文也會增加延遲和計算成本。具體限制(例如最大圖像解析度、支援的檔案類型、語言能力)在給定事實中並未指定,但屬於模型設計的固有特性。使用者應注意,非常長的提示會消耗大量token,從而產生較高成本。該模型透過OrcaRouter訪問;服務提供者的正常運行時間和回應時間適用。
所提供的資訊並未包含Kimi K3的具體基準測試分數。一般來說,長上下文模型會透過如「大海撈針」測試、長文問答以及摘要生成等任務進行評估。MoonshotAI可能已發布相關結果,使用者應查閱官方文件。該模型在標準自然語言處理基準(如MMLU、GSM8K)上的表現並未說明。我們建議您在自己的評估集上測試Kimi K3,以衡量其對您使用案例的有效性。
一個 1,048,576 個詞元的上下文視窗意味著模型能在單次處理中容納約 150 萬個英文單詞或 80 萬個中文字元。實際上,這使得模型能夠處理整本書籍、大量的對話記錄或包含多張圖片的多模態資料。然而,並非所有詞元都會被平均利用;注意力機制有時會更聚焦於近期或突出的部分。模型從長上下文的中間部分檢索資訊的能力是可以測試的。在這類任務上的表現通常優於較小上下文視窗的模型,但可能仍有改善空間。
延遲和吞吐量在給定的事實中並未指定。具有非常大上下文窗口的模型通常需要更長的時間來處理每個請求,因為注意力機制隨序列長度呈二次方擴展。對於完整的1M-token輸出,預期會有高延遲。通過OrcaRouter,您可以設置max_tokens來限制輸出長度並控制響應時間。對於實時應用,考慮使用較小的模型。批處理較長的任務可能更為實用。實際性能將取決於提供商的基礎設施和當前負載。
Kimi K3 的長上下文視窗既是優勢也是挑戰。在需要對短輸入進行精確推理的任務上,它可能不如專門模型準確。與針對特定任務微調的模型相比,該模型在創意寫作或程式碼生成等領域的品質可能較低。此外,每個 token 的成本相對較高,因此將其用於短提示詞並不划算。該模型相對較新;其長期穩定性以及 MoonshotAI 的支援都是需要考慮的因素。
Kimi K3 的定價為每 100 萬輸入代幣 3.00 美元,每 100 萬輸出代幣 15.00 美元。這些是提供商的費率,OrcaRouter 未加收任何利潤。輸入代幣包含文字和圖片代幣(圖片根據其等效代幣數量計費),輸出代幣則是由模型生成的任何代幣。除按代幣計費的成本外,無其他額外費用。定價可能由提供商調整,但 OrcaRouter 會按原費率傳遞,不增加任何加價。
由於 Kimi K3 能處理極長的上下文,因此可以取代需要多次 API 呼叫的小型上下文模型,從而可能降低需要完整文件處理的任務的整體成本。然而,每個 token 的價格比許多輕量模型更貴。例如,100 萬 token 的輸入固定為 $3.00,而小型模型每百萬 token 可能只需 $0.15,但處理相同資料需要多次呼叫。取捨在於簡潔性與每個 token 的成本之間。使用者應估算每個任務的總 token 使用量。
給定的資訊並未提及 OrcaRouter 上 Kimi K3 有任何快取或大量折扣。定價嚴格按 token 計費,由供應商收取。OrcaRouter 可能提供請求記錄或重試等功能,但並未指明具體降價措施。用戶應查看 OrcaRouter 當前定價頁面以獲取最新資訊。一般來說,大量使用的用戶可直接與供應商協商,但透過 OrcaRouter 時,適用公布的費率。
圖片會轉換為 token 以進行計費。圖片的確切 token 化取決於其解析度和提供者的演算法。通常,一張標準圖片(例如 1024x1024)可能需要花費數百個 token。由於 Kimi K3 的輸入價格為每 100 萬個 token 3.00 美元,在提示中包含圖片會增加輸入 token 數量,從而增加成本。對於包含大量圖片的工作負載,總成本可能會迅速累積。建議盡可能縮小圖片大小,或僅包含相關圖片,以控制開支。
Kimi K3 透過 OrcaRouter 的 OpenAI 相容 API 進行存取。您需發送 HTTP POST 請求至 https://api.orcarouter.ai/v1/chat/completions,並將模型參數設為 "kimi/kimi-k3"。請求格式與 OpenAI 的 Chat Completions API 完全相同:需包含一個 messages 陣列,其中設有 system、user 和 assistant 角色。對於圖片輸入,請使用 type 為 "image_url" 的 content 陣列。請確保您擁有來自 OrcaRouter 的 API 金鑰。無需特殊配置;標準參數如 temperature、max_tokens、top_p 和 stop 皆受支援。
通过 OrcaRouter,Kimi K3 支持標準的 OpenAI 相容參數:temperature(預設 0.7)、max_tokens(上限為模型的輸出限制,未明確指定但可能小於 32K)、top_p、frequency_penalty、presence_penalty、停止序列(stop sequences)以及 n(生成次數)。模型亦接受 stream 參數以實現即時輸出。針對圖片輸入,可使用多模態內容格式。不支援的參數將被忽略。大上下文視窗允許設定較高的 max_tokens 以產出長篇輸出,但需注意成本。
如果您已经使用了与 OpenAI 相容的 API,迁移起来非常直接。将基础 URL 改为 https://api.orcarouter.ai/v1,更新模型 ID 为 "kimi/kimi-k3",并设置您的 OrcaRouter API 密钥。如果您使用相同的消息格式,无需修改代码。对于图片支援,请确保您的提示中包含图片 URL 或 base64 数据。您可能需要调整 max_tokens 及其他参数以符合模型的能力。先使用小样本进行测试,以验证输出品质和成本。
您需要從OrcaRouter取得API金鑰。將它放在Authorization標頭中,格式為Bearer YOUR_API_KEY。OrcaRouter負責管理驗證與計費。為安全起見,請勿分享您的金鑰。OrcaRouter也可能支援金鑰輪換。MoonshotAI無需額外驗證。所有請求都會經過OrcaRouter的基礎設施,由其處理速率限制和錯誤處理。請確保您的請求遵守OrcaRouter的服務條款。
Kimi K3 提供 1,048,576 個 token 的上下文視窗,屬於市面上最大的之一。它與其他支援百萬級 token 上下文的供應商模型相當。其定價為每百萬 token 3/15 美元,具有競爭力。與某些模型不同,Kimi K3 支援多模態輸入(文字與圖像)。一個關鍵差異點在於它透過 OrcaRouter 存取,且無加價。與 GPT-4 Turbo(128K 上下文、成本較高)等模型相比,Kimi K3 對極長序列可能更便宜,但品質特性可能不同。未提供基準比較。
當任務需要完整的超大上下文視窗時,選擇 Kimi K3——例如一次性分析一份500頁的文件,或在單一提示中包含大量圖片。上下文較小的較便宜模型(如128K tokens)可能迫使你將輸入分塊處理,進而遺失交叉引用。若任務可在不損失品質的情況下拆分,則因較低的每token成本,較便宜模型更為可取。同時也需考慮該模型的特定優勢(多模態、長上下文)是否關鍵。
所提供的資訊僅涵蓋 Kimi K3。MoonshotAI 先前有 Kimi 和 Kimi K2 等模型。Kimi K3 是最新版本,具備更大的上下文視窗與多模態支援。較早期的模型可能擁有較小的上下文範圍,且可能無法接受圖片輸入。其他模型的定價則未提供。對於 MoonshotAI 舊模型的現有用戶而言,升級至 Kimi K3 能帶來擴展的功能,但每 token 成本較高。此決策取決於更大的上下文視窗與圖片輸入是否值得這項溢價。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| 輸入 / 1M tokens | $3.00 |
| 輸出 / 1M tokens | $15.00 |
| 快取讀取 / 1M | $0.300 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3