
Dots 對決 Grok 4.6:能自行預約會議的代理,對上只會回答問題的模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 210 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
試著替一個 dot 寫出電話號碼,你會失敗,而那項失敗正是這組搭配最有用的一點。Dots 是該公司的常駐代理,於 2026 年 9 月 29 日在 DevDay 發布:每個 dot 都有自己的雲端電腦和瀏覽器,可連接超過 4,000 個應用程式,並可在 ChatGPT、Slack 和 Teams 內聯繫到,在 GPT-6 Astra 上運行,且隨 Pro 與 Business Premium 方案提供,不另收費。Grok 4.6 是 SpaceXAI 的前沿模型,於 2026 年 8 月 12 日發布,而它完全是另一種物件:500,000 個 token 的上下文視窗,支援文字、圖像與檔案輸入並輸出文字,可設定的推理強度,原生工具呼叫與結構化輸出,定價為每百萬個輸入 token 2.00 美元、每百萬個輸出 token 6.00 美元;提示低於 200,000 個 token 時適用此價,超過時加倍。其中一個是有行程表的同事。另一個則是你呼叫的函式。
兩者都真的非常擅長代理式工作,這就是為什麼混淆如此常見。Grok 4.6 在 Terminal-Bench 2.1 上獲得 88.4 分,並在 τ-banking 工具使用切片上獲得 50.7 分——這種數字會讓一個模型被描述為「一個代理」。但它並不是。它是你用來打造代理的推理引擎。
每一個實際上是什麼
• 身分 — 一個沒有可供你定址的模型識別碼的託管產品(Dots),對比一個具名、可路由,且帶有可放入設定檔的穩定字串的模型(Grok 4.6)
• 執行發生在哪裡 — 在 OpenAI 的雲端電腦上,自帶瀏覽器,除非你把它們連結起來(Dots),否則與你的機器隔離;對比之下,則是在你執行呼叫的任何地方:你控制的容器、佇列工作者、cron 任務(Grok 4.6)
• 觸及範圍 — 透過 OpenAI 的連接器(Dots)可觸及 4,000+ 個應用程式,相較於你自行串接的任何工具,因為工具呼叫是一種協定,而不是一份目錄(Grok 4.6)
• 任務的記憶 — 由產品跨越數日、跨應用程式、跨越新討論串(Dots)承載,對比 500,000-token 的視窗,以及你自己持久保存的任何內容(Grok 4.6)
• 成本 — 訂閱即包含,額度未公開(Dots),對比每百萬個 token 2.00 美元與 6.00 美元,超過 200,000 個輸入 token 後價格加倍,快取讀取為 0.50 美元(Grok 4.6)
• 證據 — 廠商演示與能力聲明,無獨立基準測試(Dots),相較於 Artificial Analysis Coding Index 的 76.8,在 138 個受測模型中排名第五,以及 GPQA Diamond 上的 94.9(Grok 4.6)
決定大多數問題的數字:額度
OpenAI 為 dots 公布了一項價格,而那不是任何你能用來衡量工作的單位價格。第一個 dot 隨 Pro 或 Business Premium 附帶提供;與它進行的對話不會消耗 ChatGPT 使用上限;第一個月適用延長限制。這就是全部已公布的成本結構。沒有額度數字,沒有第二個 dot 的價格,沒有按任務計費的費率,也沒有針對據報正在內部測試的專家型 dots 的企業價格。CNBC 對主題演講的報導指出,財務長 Sarah Friar 將每月 500 美元的 Pro 500 方案定價為一項使用額度加上新的 Ultrafast 模式,而不是按每個 dot 計費的費率;這意味著,OpenAI 價目表上最昂貴的方案,仍無法算出每單位代理工作的成本。
Grok 4.6 則反其道而行,把所有東西都攤在陽光下,包括那些對自己不利的部分。200,000 個輸入 token 的分級界線是一道斷崖:199,000 個 token 的請求,計費費率只有 201,000 個 token 的一半。這不是什麼暗藏的陷阱,而是價目表上明明白白的一個數字,而且它會改變你設計長脈絡工作的方式。你要嘛在界線處切塊,要嘛就得心知肚明地接受第二級費率。

當這對產品正在被比較時,後繼產品已經出貨。
Grok 4.7 於 2026 年 9 月 21 日發布,如今是 Grok 系列的旗艦,具備相同的 500,000 token 上下文、相同的輸入介面、相同的基本定價,以及大得多的 450,000 token 最大輸出。Grok 4.6 仍可供使用,也仍列為現行模型——版本號提升不等於退役——但如今任何人若選擇 Grok 模型,都應該在 4.6 與 4.7 之間做選擇,而不是假設 4.6 就是最前沿。之所以要直白地這麼說,是因為你正在閱讀的這篇文章,談的是一種能跨越這次轉變而依然成立的比較:無論 Grok 系列的最頂端下一季叫什麼名字,它仍然是一款按用量計費、附有價目表的模型,而 dot 仍然是一項附帶未公開額度的訂閱服務。
這也是為什麼應該把模型呼叫路由通過抽象層,而不是硬編碼特定供應商。當後繼版本推出時,更換模型只需改一行程式碼,而不是進行一次遷移。

自行打造代理,而非租用
這種搭配的有趣後果在於,Grok 4.6 讓你得以打造出 Dots 所販售的東西,先是做得很糟,然後做得更好。一個讀取佇列、以附掛工具呼叫模型、寫入結果並在失敗時重試的迴圈並不難;難的是那些 dot 免費奉送給你的部分——一個舉止像真人的瀏覽器、由應用程式廠商親自撰寫的連接器、一套審批流程與活動日誌。這些之所以值得付費訂閱,正因為它們繁瑣乏味。
按用量計費的一方勝出之處,在於工作不再一概通用的那一刻。也就是當你需要同一個呼叫在下個季度改由不同供應商執行、需要從日誌重播、需要計價精確到分,或是在上游供應商動搖時於執行途中容錯移轉到更便宜的兄弟模型的那一刻。在 OrcaRouter 上,Grok 4.6 以grok/grok-4.6的形式供應,價格就是 SpaceXAI 的定價、加價 0%——供應商自家的費率原樣透傳,因此廠商降價當天就會反映在你的帳單上——且與200 多個其他模型同處一份目錄、共用同一把金鑰,並具備自動容錯移轉與路由 DSL,可將數個模型組合成單一呼叫。而對一個點號而言,並沒有對應的東西:沒有端點、沒有識別碼,也沒有任何可供容錯移轉的來源。
要套用的測試
問問自己:如果沒有人查看,這項工作是否仍會存在。如果答案是肯定的——它必須按排程進行、橫跨多個工具、無需有人開啟聊天視窗——那麼 dot 就是為此量身打造的產品,而按用量計費的模型則是你所建構的任何東西裡的一個元件。如果答案是否定的,如果有人在等待輸出,而且輸出有格式和截止期限,那麼按用量計費的模型就是正確的購買選擇,而代理則是昂貴的繞道。
值得避免的錯誤,是為了得到更好的答案而買一個 Dot。Dot 並不是更聰明的模型;它只是套在某個模型上的一條更長牽繩。而第二個錯誤,是付費訂閱以取得某項能力,而費率表早已按 token 把該能力賣給你,而且計算方式事先就看得見。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
