
Claude Sonnet 5.5 對比 Grok 4.5:兩種 $2 輸入費率與六分鐘的等待
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5與Grok 4.5的輸入價格完全相同:每百萬個 token 收費 2.00 美元。相同之處僅止於此,而有一個數字比任何規格表都更能說明問題。在 Artificial Analysis 的 Intelligence Index v4.3.2 修訂版中,Claude Sonnet 5.5 在 Max Effort 設定下,首個回答 token 的中位等待時間為 370.8 秒。Grok 4.5 則是 6.9 秒。同樣的輸入費率。等待時間卻相差五十三倍,才終於等到任何回應。Claude Sonnet 5.5 於 2026 年 9 月 28 日發布,Grok 4.5 則於 2026 年 7 月 8 日發布,此後已在自家家族內被超車兩次;紙面上,兩者是進入前沿前段班最便宜的兩條路——而紙面掩蓋了真正重要的抉擇:你用這段等待究竟換到了什麼。
那個數字必須立刻附上但書,因為少了設定的延遲數字毫無意義:370.8 秒是 Anthropic 預設推理模式在最高強度下的表現,在吐出第一個答案詞元之前,花掉極大的思考預算。想要快速取得第一個詞元的呼叫方,會設定成別的模式。但這個方向是真實的,並不是量測假象——Artificial Analysis 測得 Claude Sonnet 5.5 的輸出速度為每秒 138.7 個詞元,僅次於少數幾個模型,而 Grok 4.5 則是 59.2。等待最久的模型,寫得也最快。你真正在取捨的,是長時間深思之後接上快速回答,以及短時間思考之後接上較慢的回答。
9月28日發生了什麼變化?
Claude Sonnet 5.5 問世才剛滿一天。Anthropic 於 2026 年 9 月 28 日以 API 識別碼 claude-sonnet-5-5 推出,同步登上 Bedrock、Google Cloud 與 Microsoft Foundry,並宣稱其執行速度比 Claude Sonnet 5 快 30%,而對大多數工作來說,每項任務的成本最多可降低 30%。這些都是廠商自家數據,尚未經過獨立重現驗證;不過它所引用的比較價格確實是真的,因為價目表維持不變:每百萬輸入詞元 2.00 美元、每百萬輸出詞元 10.00 美元、快取讀取 0.20 美元、快取寫入 2.50 美元。上下文窗口為 1,000,000 個詞元,同步輸出上限為 128,000 個詞元,而在 Message Batches API 上則為 300,000 個詞元,需帶上 output-300k-2026-03-24 標頭。知識截止時間為 2026 年 6 月。自推出起即提供零資料保留,且 Anthropic 在 2027 年 9 月 28 日之前不會淘汰此模型。

Anthropic 自家的文件頁面也異常明確地說明升級的代價:五項破壞性變更將 Claude Sonnet 5.5 與目前大多數 Claude 流量所運行的模型區隔開來,而這些變更會在下文進一步說明。
Grok 4.5 是較舊的選擇,也是較複雜的一款。SpaceXAI——這家公司在其模型卡上仍以 xAI 品牌出貨——於 2026 年 7 月 8 日發布它,作為一個 1.5 兆參數的專家混合模型,與 Cursor 程式碼編輯器一同訓練,具備 500,000 個 token 的視窗,支援文字、圖像和檔案輸入,而其發布宣傳幾乎完全建立在 token 經濟性上,而非頂尖分數。它不再是旗艦產品。Grok 4.6 和 Grok 4.7 都存在,兩者都有相同的 $2.00 / $6.00 定價,而我們的目錄列出了全部三款。因此,2026 年 9 月有趣的問題不是 Grok 4.5 好不好;而是是否還有任何理由值得選擇三者中最舊的一款。
帳單不是價目表
把兩者並排放在獨立看板上,交易的形狀便會浮現。
• 智慧指數,修訂版 v4.3.2 — Claude Sonnet 5.5 在 Max Effort 下為 56,對比 Grok 4.5 的 39
• 每項 Index 任務的成本 — Claude Sonnet 5.5 $7.60 對比 Grok 4.5 $1.04,兩者皆為實測,而非估計
• 輸出費率 — Claude Sonnet 5.5 每百萬 $10.00,相較於 Grok 4.5 每百萬 $6.00
• 輸出速度 — Claude Sonnet 5.5 138.7 tokens/秒 對比 Grok 4.5 59.2 tokens/秒
• 首個回答 Token 的時間,Max Effort — Claude Sonnet 5.5 370.8 秒 vs Grok 4.5 6.9 秒
• 整個 Index 評估過程中生成的 Token 數量 — Claude Sonnet 5.5 410M 對比 Grok 4.5 77M
• 上下文 — Claude Sonnet 5.5 1,000,000 個詞元 vs Grok 4.5 500,000 個詞元
冗長度那一列是每任務成本差距背後的機制,也是本頁最有用的一個數字。一個模型在某次評估中輸出 4.1 億個 token,而對手只輸出 7,700 萬個,它並不需要高出 67% 的輸出費率,就能讓每任務成本達到七倍——但它偏偏就是有,而且這兩種效應還朝同一個方向推。Anthropic 自己的說法與這個解讀一致,而非相抵:「每任務最多省下 30%」講的是 token 數量,不是費率,因為在 Claude Sonnet 5 與 Claude Sonnet 5.5 之間,費率並沒有改變。Artificial Analysis 從另一邊得出相同結論,並用直白的話描述這個模型:速度明顯很快,但極為冗長。面對一個精簡的模型,這同一項特性正是 Claude Sonnet 5.5 最大的營運風險。

Grok 4.5 的便宜費率到哪裡就不再便宜
$2.00 / $6.00 這條價格列是級距,不是費率。在 SpaceXAI 自家的開發者文件中,該價格適用於最高 200,000 個輸入 token,超過之後就加倍為 $4.00 輸入與 $12.00 輸出。Grok 4.5 的視窗是 500,000 個 token,因此它宣稱的視窗後半段,成本是前半段的兩倍。將儲存庫規模的提示載入 Grok 4.5,並不是一項 $6 輸出的操作;而是 $12 輸出的操作,而到了那個時候,那個有著「昂貴」$10 輸出費率的模型,在任何同樣會產生大量 token 的請求上,反而更便宜。
Claude Sonnet 5.5 沒有對應的等級。$2.00 / $10.00 的費率在整個 1,000,000 個 token 的視窗中維持不變,而快取讀取以 $0.20 計費——是輸入費率的十分之一——這正是讓長上下文情境在實務上可行、而不只是紙上談兵的原因。
視窗大小是這個論點的另一半,而且它指向同一個方向。Grok 4.5 的視窗是 500,000 個 token,而每一個都按公告費率計費。Claude Sonnet 5.5 則有 1,000,000 個 token 可運用,而真正讓這件事關鍵的,是工作負載的形態:一個需要推理的程式碼倉庫、一份冗長的代理逐字紀錄、一堆必須始終保持在視野中的文件。上限翻倍、用到一半時不會出現級距斷點,再加上快取讀取只需輸入費率的十分之一——這些正是讓「在多次呼叫之間攜帶如此大量的脈絡」從一筆得編列預算的開銷,變成帳單上單一細項的原因。
實務上的區分並不微妙:
• 簡短提示詞搭配密集輸出 — Grok 4.5 在速率上勝出,並在 token 習慣上再次勝出
• 輸入超過 200,000 個 token 的提示詞——Grok 4.5 的費率會加倍,而 Claude Sonnet 5.5 的不會
• 延遲敏感的互動式工作 — 在預設設定下,Grok 4.5 以大幅差距率先回應
• 長時程代理式執行 —— Claude Sonnet 5.5 的綜合分數與 128K 輸出上限,正是你支付額外任務成本所換得的價值,而 300K 批次上限更進一步延伸了這一點
遷移不是模型字串
任何要從 Claude Sonnet 5 轉到 Claude Sonnet 5.5 的人,在寫程式碼之前都應該先閱讀 Anthropic 的遷移說明,因為有五項行為已改變,而其中只有一項會在某個顯而易見的地方大聲出錯。
• 非預設temperature、top_p或top_k現在會回傳 400 —— 取樣量大的管線會直接停止運作,而非降級運行
• thinking: {"type": "disabled"}會回傳 400,因此必須改為between_tools,且 effort 僅限於低、中或高;xhigh 與 max 會被拒絕
• 強制工具使用 — tool_choice 為 "any"或具名工具 — 會直接被拒絕,因此強制進行符合 schema 之呼叫的迴圈必須改用 auto,並搭配嚴格工具使用或結構化輸出
• 較舊的 computer_20251124 電腦使用工具在 Claude API 與 Google Cloud 上會遭到拒絕
• 思考區塊會綁定到產生它們的模型與帳號,因此推理會從 Claude Sonnet 5 延續下去,但不會橫向延伸到不同家族——而顧問工具也不再接受 Claude Opus 4.8、Claude Opus 4.7 或 Claude Sonnet 5 作為 Sonnet 5.5 執行者背後的顧問
第六項變更完全不會導致任何失敗,這正是它危險的原因:工具呼叫之間的文字現在會在思考區塊內回傳。將該文字串流給使用者的應用程式,會在工具呼叫之間陷入靜默,直到它設定顯示值,或完全關閉事前思考為止。沒有任何錯誤。輸出只是停止出現。
Grok 4.5 這些全都不需要。它是 OpenAI 格式的模型,取樣介面完好無損,而從 Grok 4.5 自家的前代模型轉換過來,不過是改個模型字串的事。移轉成本全落在 Claude 這一邊,而且那要花上一天的工夫,不是一個下午就能搞定。
兩者共用同一組憑證,以及這件事誠實的界線
在腦中進行兩家供應商的比較很容易;真正執行比較時,成本才藏在細節裡。OrcaRouter 將 200 多款模型置於單一相容於 OpenAI 的端點之後,供應商定價原樣傳遞且不額外加價,因此任一方調價時,這裡當天就會生效,而不是等到下一次合約續約,並具備上游供應商之間的自動容錯移轉,以及用來組合呼叫的路由 DSL。整個 Grok 系列都以 SpaceXAI 自身的費率收錄於目錄中,而 Grok 4.5 可透過grok/grok-4.5路由,價格為每百萬個 token 輸入 $2.00、輸出 $6.00,涵蓋其 500,000-token 的視窗。
Claude Sonnet 5.5 並不在我們的型號目錄中,而這個頁面也不會暗示相反的情況。今天要使用它,途徑是 Anthropic 自家的 API,或者若你的基礎架構本來就落在 Bedrock 和 Google Cloud 上,也可以透過它們來取用。Claude Sonnet 5 自 6 月 30 日起已可在此路由,價格為 Anthropic 的 $2.00 與 $10.00,而且仍是大多數 Claude API 流量所運行的模型,這使它在 Claude Sonnet 5.5 才剛問世一天、尚未有任何人生產實證的情況下,成為最自然的備援目標。
所有這些都附帶一個但書,而且這不是小事。上方的 {{1}}Grok 4.5{{/1}} 那一列,是我們目錄目前所重現的廠商宣傳;該項目的流量計數在過去七天讀數為零,其吞吐量數字並未受到量測,而首字時間停留在幾乎沒被呼叫的模型往往會顯現的一秒下限。一個在此處近期沒有流量的模型,並不證明該模型不好——{{2}}4.6{{/2}} 與 {{3}}4.7{{/3}} 才是這個家族呼叫量流向之處——但這確實意味著那一頁上的營運數字相當單薄,而值得信賴的延遲數字,是實際運行路線的讀數。

該選哪一個
Grok 4.5 是正確的模型,適用於提示詞簡短、答案資訊密度高,而且整合端已經採用 OpenAI 介面的情況——也適用於請求不會超過 200,000 個輸入 token 的時候,因為一旦越過那條界線,計算方式就會易手。當第一個 token 必須在幾秒內而非幾分鐘內送達時,它也是正確的選擇。它不是目前的 Grok 旗艦;Grok 4.6 和 Grok 4.7 以相同定價位居其上,而選擇 4.5 而非其中任何一個的理由,必須是具體明確的理由。
Claude Sonnet 5.5 是正確的模型——當提示極其龐大、工作的代理性強到十七個 Index 分數與 128K 輸出上限足以合理化每項任務高出七倍的成本,或者複合分數本身就正是所要購買的東西時。它的冗長是設計決策,而非缺陷,而且在你下定決心之前,這正是該用你自己的流量來衡量的數字——因為每項 Index 任務 $7.60 對比 $1.04,只是個替代指標,真正的數字只有你的工作負載才能產生。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
