生成的 hero card 標題為 Claude Sonnet 5.5 對上 Grok 4.5,副標題為兩個 $2 的輸入費率與六分鐘的等待,顯示三張數據卡:首個 token 370.8 秒對上 6.9 秒、每項任務成本 $7.60 對上 $1.04,以及 Intelligence Index 56 對上 39,頁尾寫著 Index、每項任務成本與延遲資料取自 Artificial Analysis v4.3.2;價格依各家廠商。
Guides & Insights

Claude Sonnet 5.5 對比 Grok 4.5:兩種 $2 輸入費率與六分鐘的等待

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5與Grok 4.5的輸入價格完全相同:每百萬個 token 收費 2.00 美元。相同之處僅止於此,而有一個數字比任何規格表都更能說明問題。在 Artificial Analysis 的 Intelligence Index v4.3.2 修訂版中,Claude Sonnet 5.5 在 Max Effort 設定下,首個回答 token 的中位等待時間為 370.8 秒。Grok 4.5 則是 6.9 秒。同樣的輸入費率。等待時間卻相差五十三倍,才終於等到任何回應。Claude Sonnet 5.5 於 2026 年 9 月 28 日發布,Grok 4.5 則於 2026 年 7 月 8 日發布,此後已在自家家族內被超車兩次;紙面上,兩者是進入前沿前段班最便宜的兩條路——而紙面掩蓋了真正重要的抉擇:你用這段等待究竟換到了什麼。

那個數字必須立刻附上但書,因為少了設定的延遲數字毫無意義:370.8 秒是 Anthropic 預設推理模式在最高強度下的表現,在吐出第一個答案詞元之前,花掉極大的思考預算。想要快速取得第一個詞元的呼叫方,會設定成別的模式。但這個方向是真實的,並不是量測假象——Artificial Analysis 測得 Claude Sonnet 5.5 的輸出速度為每秒 138.7 個詞元,僅次於少數幾個模型,而 Grok 4.5 則是 59.2。等待最久的模型,寫得也最快。你真正在取捨的,是長時間深思之後接上快速回答,以及短時間思考之後接上較慢的回答。

9月28日發生了什麼變化?

Claude Sonnet 5.5 問世才剛滿一天。Anthropic 於 2026 年 9 月 28 日以 API 識別碼 claude-sonnet-5-5 推出,同步登上 Bedrock、Google Cloud 與 Microsoft Foundry,並宣稱其執行速度比 Claude Sonnet 5 快 30%,而對大多數工作來說,每項任務的成本最多可降低 30%。這些都是廠商自家數據,尚未經過獨立重現驗證;不過它所引用的比較價格確實是真的,因為價目表維持不變:每百萬輸入詞元 2.00 美元、每百萬輸出詞元 10.00 美元、快取讀取 0.20 美元、快取寫入 2.50 美元。上下文窗口為 1,000,000 個詞元,同步輸出上限為 128,000 個詞元,而在 Message Batches API 上則為 300,000 個詞元,需帶上 output-300k-2026-03-24 標頭。知識截止時間為 2026 年 6 月。自推出起即提供零資料保留,且 Anthropic 在 2027 年 9 月 28 日之前不會淘汰此模型。

Artificial Analysis model page for Claude Sonnet 5.5 in its Adaptive Reasoning, Max Effort, Default Fallback configuration, released September 2026, showing an Intelligence Index of 56, an output speed of 138.7 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, $7.60 per Intelligence Index task, 410M output tokens generated during the Index evaluation, and a 1M-token context window.

Anthropic 自家的文件頁面也異常明確地說明升級的代價:五項破壞性變更將 Claude Sonnet 5.5 與目前大多數 Claude 流量所運行的模型區隔開來,而這些變更會在下文進一步說明。

Grok 4.5 是較舊的選擇,也是較複雜的一款。SpaceXAI——這家公司在其模型卡上仍以 xAI 品牌出貨——於 2026 年 7 月 8 日發布它,作為一個 1.5 兆參數的專家混合模型,與 Cursor 程式碼編輯器一同訓練,具備 500,000 個 token 的視窗,支援文字、圖像和檔案輸入,而其發布宣傳幾乎完全建立在 token 經濟性上,而非頂尖分數。它不再是旗艦產品。Grok 4.6 和 Grok 4.7 都存在,兩者都有相同的 $2.00 / $6.00 定價,而我們的目錄列出了全部三款。因此,2026 年 9 月有趣的問題不是 Grok 4.5 好不好;而是是否還有任何理由值得選擇三者中最舊的一款。

帳單不是價目表

把兩者並排放在獨立看板上,交易的形狀便會浮現。

• 智慧指數,修訂版 v4.3.2 — Claude Sonnet 5.5 在 Max Effort 下為 56,對比 Grok 4.5 的 39

• 每項 Index 任務的成本 — Claude Sonnet 5.5 $7.60 對比 Grok 4.5 $1.04,兩者皆為實測,而非估計

• 輸出費率 — Claude Sonnet 5.5 每百萬 $10.00,相較於 Grok 4.5 每百萬 $6.00

• 輸出速度 — Claude Sonnet 5.5 138.7 tokens/秒 對比 Grok 4.5 59.2 tokens/秒

• 首個回答 Token 的時間,Max Effort — Claude Sonnet 5.5 370.8 秒 vs Grok 4.5 6.9 秒

• 整個 Index 評估過程中生成的 Token 數量 — Claude Sonnet 5.5 410M 對比 Grok 4.5 77M

• 上下文 — Claude Sonnet 5.5 1,000,000 個詞元 vs Grok 4.5 500,000 個詞元

冗長度那一列是每任務成本差距背後的機制,也是本頁最有用的一個數字。一個模型在某次評估中輸出 4.1 億個 token,而對手只輸出 7,700 萬個,它並不需要高出 67% 的輸出費率,就能讓每任務成本達到七倍——但它偏偏就是有,而且這兩種效應還朝同一個方向推。Anthropic 自己的說法與這個解讀一致,而非相抵:「每任務最多省下 30%」講的是 token 數量,不是費率,因為在 Claude Sonnet 5 與 Claude Sonnet 5.5 之間,費率並沒有改變。Artificial Analysis 從另一邊得出相同結論,並用直白的話描述這個模型:速度明顯很快,但極為冗長。面對一個精簡的模型,這同一項特性正是 Claude Sonnet 5.5 最大的營運風險。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Grok 4.5, the scoreboard, with six matched rows: input price $2.00 vs $2.00, output price $10.00 vs $6.00, Intelligence Index 56 vs 39, cost per task $7.60 vs $1.04, first token 370.8 s vs 6.9 s, and context window 1,000,000 vs 500,000 tokens, with a footer reading Index, cost per task and latency per Artificial Analysis v4.3.2; prices per the vendors.

Grok 4.5 的便宜費率到哪裡就不再便宜

$2.00 / $6.00 這條價格列是級距,不是費率。在 SpaceXAI 自家的開發者文件中,該價格適用於最高 200,000 個輸入 token,超過之後就加倍為 $4.00 輸入與 $12.00 輸出。Grok 4.5 的視窗是 500,000 個 token,因此它宣稱的視窗後半段,成本是前半段的兩倍。將儲存庫規模的提示載入 Grok 4.5,並不是一項 $6 輸出的操作;而是 $12 輸出的操作,而到了那個時候,那個有著「昂貴」$10 輸出費率的模型,在任何同樣會產生大量 token 的請求上,反而更便宜。

Claude Sonnet 5.5 沒有對應的等級。$2.00 / $10.00 的費率在整個 1,000,000 個 token 的視窗中維持不變,而快取讀取以 $0.20 計費——是輸入費率的十分之一——這正是讓長上下文情境在實務上可行、而不只是紙上談兵的原因。

視窗大小是這個論點的另一半,而且它指向同一個方向。Grok 4.5 的視窗是 500,000 個 token,而每一個都按公告費率計費。Claude Sonnet 5.5 則有 1,000,000 個 token 可運用,而真正讓這件事關鍵的,是工作負載的形態:一個需要推理的程式碼倉庫、一份冗長的代理逐字紀錄、一堆必須始終保持在視野中的文件。上限翻倍、用到一半時不會出現級距斷點,再加上快取讀取只需輸入費率的十分之一——這些正是讓「在多次呼叫之間攜帶如此大量的脈絡」從一筆得編列預算的開銷,變成帳單上單一細項的原因。

實務上的區分並不微妙:

• 簡短提示詞搭配密集輸出 — Grok 4.5 在速率上勝出,並在 token 習慣上再次勝出

• 輸入超過 200,000 個 token 的提示詞——Grok 4.5 的費率會加倍,而 Claude Sonnet 5.5 的不會

• 延遲敏感的互動式工作 — 在預設設定下,Grok 4.5 以大幅差距率先回應

• 長時程代理式執行 —— Claude Sonnet 5.5 的綜合分數與 128K 輸出上限,正是你支付額外任務成本所換得的價值,而 300K 批次上限更進一步延伸了這一點

遷移不是模型字串

任何要從 Claude Sonnet 5 轉到 Claude Sonnet 5.5 的人,在寫程式碼之前都應該先閱讀 Anthropic 的遷移說明,因為有五項行為已改變,而其中只有一項會在某個顯而易見的地方大聲出錯。

• 非預設temperature、top_p或top_k現在會回傳 400 —— 取樣量大的管線會直接停止運作,而非降級運行

• thinking: {"type": "disabled"}會回傳 400,因此必須改為between_tools,且 effort 僅限於低、中或高;xhigh 與 max 會被拒絕

• 強制工具使用 — tool_choice 為 "any"或具名工具 — 會直接被拒絕,因此強制進行符合 schema 之呼叫的迴圈必須改用 auto,並搭配嚴格工具使用或結構化輸出

• 較舊的 computer_20251124 電腦使用工具在 Claude API 與 Goo​gle Cloud 上會遭到拒絕

• 思考區塊會綁定到產生它們的模型與帳號,因此推理會從 Claude Sonnet 5 延續下去,但不會橫向延伸到不同家族——而顧問工具也不再接受 Claude Opus 4.8、Claude Opus 4.7 或 Claude Sonnet 5 作為 Sonnet 5.5 執行者背後的顧問

第六項變更完全不會導致任何失敗,這正是它危險的原因:工具呼叫之間的文字現在會在思考區塊內回傳。將該文字串流給使用者的應用程式,會在工具呼叫之間陷入靜默,直到它設定顯示值,或完全關閉事前思考為止。沒有任何錯誤。輸出只是停止出現。

Grok 4.5 這些全都不需要。它是 OpenAI 格式的模型,取樣介面完好無損,而從 Grok 4.5 自家的前代模型轉換過來,不過是改個模型字串的事。移轉成本全落在 Claude 這一邊,而且那要花上一天的工夫,不是一個下午就能搞定。

兩者共用同一組憑證,以及這件事誠實的界線

在腦中進行兩家供應商的比較很容易;真正執行比較時,成本才藏在細節裡。OrcaRouter 將 200 多款模型置於單一相容於 OpenAI 的端點之後,供應商定價原樣傳遞且不額外加價,因此任一方調價時,這裡當天就會生效,而不是等到下一次合約續約,並具備上游供應商之間的自動容錯移轉,以及用來組合呼叫的路由 DSL。整個 Grok 系列都以 SpaceXAI 自身的費率收錄於目錄中,而 Grok 4.5 可透過grok/grok-4.5路由,價格為每百萬個 token 輸入 $2.00、輸出 $6.00,涵蓋其 500,000-token 的視窗。

Claude Sonnet 5.5 並不在我們的型號目錄中,而這個頁面也不會暗示相反的情況。今天要使用它,途徑是 Anthropic 自家的 API,或者若你的基礎架構本來就落在 Bedrock 和 Google Cloud 上,也可以透過它們來取用。Claude Sonnet 5 自 6 月 30 日起已可在此路由,價格為 Anthropic 的 $2.00 與 $10.00,而且仍是大多數 Claude API 流量所運行的模型,這使它在 Claude Sonnet 5.5 才剛問世一天、尚未有任何人生產實證的情況下,成為最自然的備援目標。

所有這些都附帶一個但書,而且這不是小事。上方的 {{1}}Grok 4.5{{/1}} 那一列,是我們目錄目前所重現的廠商宣傳;該項目的流量計數在過去七天讀數為零,其吞吐量數字並未受到量測,而首字時間停留在幾乎沒被呼叫的模型往往會顯現的一秒下限。一個在此處近期沒有流量的模型,並不證明該模型不好——{{2}}4.6{{/2}} 與 {{3}}4.7{{/3}} 才是這個家族呼叫量流向之處——但這確實意味著那一頁上的營運數字相當單薄,而值得信賴的延遲數字,是實際運行路線的讀數。

OrcaRouter model page for grok/grok-4.5, dated 2026-07-08, showing a 500K-token context window, text, image and file input, the pricing row of $2.00 input and $6.00 output per million tokens, a p50 time to first token of 1.00 s, a p95 of 4.0 s, and a traffic counter reading Collecting.

該選哪一個

Grok 4.5 是正確的模型,適用於提示詞簡短、答案資訊密度高,而且整合端已經採用 OpenAI 介面的情況——也適用於請求不會超過 200,000 個輸入 token 的時候,因為一旦越過那條界線,計算方式就會易手。當第一個 token 必須在幾秒內而非幾分鐘內送達時,它也是正確的選擇。它不是目前的 Grok 旗艦;Grok 4.6 和 Grok 4.7 以相同定價位居其上,而選擇 4.5 而非其中任何一個的理由,必須是具體明確的理由。

Claude Sonnet 5.5 是正確的模型——當提示極其龐大、工作的代理性強到十七個 Index 分數與 128K 輸出上限足以合理化每項任務高出七倍的成本,或者複合分數本身就正是所要購買的東西時。它的冗長是設計決策,而非缺陷,而且在你下定決心之前,這正是該用你自己的流量來衡量的數字——因為每項 Index 任務 $7.60 對比 $1.04,只是個替代指標,真正的數字只有你的工作負載才能產生。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新