一張生成的主視覺卡片,標題為「Dots vs Kimi K3」,副標題為「一個讀遍整座圖書館,另一個親自去把它找出來」。一條垂直分隔線將卡片一分為二:左側面板標示為「Dots」,寫著「可在 4,000+ 個應用程式中操作——額度未公開」;右側標示為「Kimi K3」,寫著「1M 上下文——長上下文召回 88.7——$3.00 / $15.00」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Dots vs Kimi K3:一個讀遍整座圖書館,另一個則去把它找出來

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

有一種特定類型的工作,這兩者之中只有一個能勝任,而在談其他任何事情之前,值得先為它命名。Kimi K3 由 Moonshot AI 於 2026 年 7 月 15 日發布,是擁有 2.8 兆參數的混合專家模型,具備 1,048,576 個 token 的上下文視窗,接受文字與圖像輸入並回傳文字,定價為每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,快取讀取則為 0.30 美元。Dots 是該公司全年無休的代理,於 2026 年 9 月 29 日的 DevDay 發表,擁有自己的雲端電腦與瀏覽器、可連接超過 4,000 個應用程式的連接器,並進駐 ChatGPT、Slack 與 Teams,運行於 GPT-6 Astra,Pro 與 Business Premium 方案皆包含在內。K3 能在單一請求中容納整份檔案庫,並針對它回答問題。一個 dot 則能前去取回你還沒想過的下一個文件。閱讀與檢索是兩種不同的工作,挑錯那一種就是代價高昂的錯誤。

Kimi K3 完全擁有的數字

長脈絡召回是區分行銷話術與真實實力的衡量指標,因為宣稱擁有龐大的脈絡視窗輕而易舉,要真正派上用場卻極為困難。K3 在此項目拿下 88.7 分,是我們收錄的所有模型中最高者,高於 GPT-5.6 Sol 的 84、MiniMax M3 的 83,以及 Gemini 3.1 Pro 的 82。它同時在 GPQA Diamond 取得 93.5、在 SciCode 取得 59.5,並擁有 76.2 的 Artificial Analysis Coding Index,在 138 個受測模型中排名第九,Intelligence Index 為 43.6,在 145 個模型中名列第十九。這些全是第三方數據,收錄於我們的目錄中並附上來源,而非轉載自發布貼文。

這帶來的是一類根本無法拆解的工作:在回答問題之前先讀完整個程式碼庫、把一整年的合約拿來與新範本逐一比對,或是進行漫長的代理式工作階段而不至於中途從記憶中脫落。K3 正是為此而生——Moonshot 將它定位於程式設計代理與長時程知識工作——而它的不尋常之處在於完全拒絕取樣參數。沒有 temperature,沒有 top_p,沒有 seed;推理深度只有一個旋鈕,叫做 reasoning_effort。這是刻意的取捨:更少的旋鈕,換來漫長工作階段中更高的一致性。

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier 'kimi/kimi-k3' with Vision, Tools, JSON and Reasoning badges, a publication date of 2026-07-15, a description of it as Moonshot AI's flagship 2.8-trillion-parameter MoE with a 1M-token context window and native visual understanding, a side panel reading 1M tokens of context over text and image input, and a price strip reading $3.00 and $15.00 with a p50 time to first token of 8.82 seconds and a seven-day traffic figure of 831.3M tokens.

點的用途,不帶行銷話術地說清楚

一個 dot 是配備行事曆的工作者。它的輸入很平凡——你的訊息、你的應用程式資料、你用一句話描述的任務——而它的輸出是某個地方發生了改變:一個檔案被移動、一張票證被更新、一則訊息在你批准後被起草並送出、一個頁面在它自己的瀏覽器中開啟。OpenAI 的發表資料描述了一個 dot 能同時推進數個專案並從回饋中學習,而誠實的解讀是:你買的是串接整合的環節,不是智慧本身。

那層把一切串接起來的「結締組織」,才是最昂貴的建置部分。一個行為舉止像真人操作的瀏覽器、由應用程式廠商維護的連接器、活動檢視畫面、核准關卡、與你自己機器的隔離——這些在原則上都不難,實際做起來卻樣樣繁瑣乏味。訂閱費付的就是這些。它不付的,是可衡量性。

• 成本 — 包含於 Pro 或 Business Premium,額度未公開(Dots),相較於每百萬輸入 $3.00 與每百萬輸出 $15.00,快取讀取 $0.30(Kimi K3)

• 單次請求上限——連一點文件記載都沒有,相較於 1,048,576 個 token 的上下文,以及在長上下文召回率上獲得行動裝置友善的 88.7 分(Kimi K3)

• 輸入與輸出 — 輸入訊息與已連結應用程式的資料,輸出其他軟體內部的變更(Dots);對比輸入文字與圖片、輸出文字(Kimi K3)

• 取樣控制 — 未公布(Dots),對比未設定 temperature、未設定 top_p 且未設定 seed,推理深度僅由 reasoning_effort 決定(Kimi K3)

• 你應該預期的速度——圓點代表未記錄;相較於我們自己為期七天的測量中,首個 token 的中位數時間為 8.82 秒,輸出約為每秒 39 個 token(Kimi K3)

• 獨立證據 — 供應商示範與能力聲明,沒有基準測試(Dots)對照 AA Coding Index 76.2,在 138 中排名第九,GPQA Diamond 93.5,長上下文召回 88.7(Kimi K3)

關於購買代理,沒有人提到的那件事

一個具有未公開額度的訂閱方案,有一項費率表所沒有的特性:你無法分辨一項任務是便宜還是昂貴。每一項工作的成本都相同——沒有邊際成本——直到它不再如此的那一刻,而接著出現的答案是一項上限,而不是一張帳單。對於工作屬於探索性質的團隊而言,這是一項優點。對於必須將成本歸屬到專案的團隊而言,這是會計上的一個缺口。

還有一個二階效應。當呼叫的邊際成本變得隱形,你便不再追問這趟呼叫是否必要,而任何流程中最便宜的優化——也就是根本不發出請求——對你而言就此消失。按量計費的模式,則迫使每個人每次讀到價目表時都得重新面對這個問題。

A generated scoreboard titled 'Dots vs Kimi K3 - what each one measures', with two columns. The left column, 'Dots', lists: price included with Pro or Business Premium; allowance not published; cost per task not published; model GPT-6 Astra (vendor-stated); computer its own cloud computer and browser; independent benchmark none. The right column, 'Kimi K3', lists: context 1,048,576 tokens; input text and image; price $3.00 in / $15.00 out per 1M; cached reads $0.30 per 1M; architecture 2.8T total MoE; long-context recall 88.7. A footer reads 'Dots details vendor-stated from OpenAI's DevDay launch; Kimi K3 figures from independent listings as carried in the OrcaRouter catalogue.'

將它們組合起來,而不假裝它們是替代方案。

行得通的模式是:一個會留意的圓點,加上一個負責閱讀的長上下文模型。工作進來了——共享雲端硬碟裡的一份文件、某個討論串中的一則訊息——圓點會決定它重不重要。如果重要,文件就會連同它可能需要的其他一切,以單一請求附上並送交 Kimi K3,而回傳的答案會完全以原始來源為依據,而不是以來源的摘要為依據。圓點負責追蹤催辦和枯燥的後勤事務;模型則負責閱讀,而且閱讀量之大,絕非由一次次小型呼叫構成的迴圈所能正確彙整。

Kimi K3 在 OrcaRouter 上以 kimi/kimi-k3 的形式路由,採用 Moonshot 的定價,不額外加價,置身於同一份目錄之中,與其他 200 多個模型共用同一組金鑰,當某個上游供應商效能下降時可自動容錯切換,並提供一套路由 DSL,能將多個模型組合為單一次呼叫。這只是整條流程中按用量計費的那一半,僅此而已:dots 不在目錄之中,沒有可供其使用的端點,也不存在任何能讓請求指向它的識別碼。如果讀取層正是你需要掌控的部分——而對於任何你打算運行一年的東西來說,通常正是如此——那就是你該自己擁有的那一層。

哪一項購買會浪費錢?

買 dot 來閱讀大型語料庫是浪費,因為 dot 會去抓取並摘要,而不是把全部內容保留下來,而摘要正是你需要的細節葬身之處。買 Kimi K3 來跨五個應用程式追蹤一個專案也是浪費,理由恰好相反:一個被呼叫才回答的模型不會主動呼叫你。

如果工作是檢索與物流,就租用那個工作者。如果工作是大規模理解,就買下計量器,並一次把全部內容都交給它。這兩者重疊的程度,遠比「agentic」這個詞所暗示的少得多,而且重疊之處並不是其中任何一方擅長的地方。

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models · 16 providers · one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards visible beneath.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新