主視覺卡片標題為 Claude Sonnet 5.5 vs Grok 4.6,副標題為價目表說的是一回事,Token 帳單說的又是另一回事,並以標籤顯示輸出 $10 vs $6、每項任務成本 $7.60 vs $1.86,以及指數 56 vs 44,頁腳則引用 Artificial Analysis v4.3.2 與供應商定價。
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6:費率表說一套,Token 帳單說另一套

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在文章開始之前,標題上的算術看似已成定局。Grok 4.6 每百萬輸入詞元要價 $2,每百萬輸出詞元 $6;Claude Sonnet 5.5 則是 $2 與 $10。Space​XAI 的模型在輸出上便宜 40%,輸入價格相同,且自 2026 年 8 月 12 日起已全面開放使用——時間久到它的怪癖已有文件記載,而非僅是傳聞。Anthro​pic 的模型在 2026 年 9 月 28 日推出,就在本文撰寫的前一天,是這個級別中最新的東西,且領先幅度不小。

接著你看到獨立效率數據,排序就翻轉了。Artificial Analysis 在其 Intelligence Index 之外,也以每項任務成本為基準來衡量 GPT 與 Claude 等級的模型,而在 v4.3.2 修訂版上,這裡的兩款模型是:Grok 4.6 每項 Intelligence Index 任務為 $1.86,Claude Sonnet 5.5 則為 $7.60。價目表上較便宜的那款模型,實際上卻是營運成本較高的那款,差距達四倍。釐清箇中原因,以及這種反轉何時成立、何時不成立,就是這整篇比較的重點。

兩款型號,在各自家族中的兩個定位

Grok 4.6 是 Grok 系列目前的旗艦——SpaceXAI 自家的開發者文件將其列為最新版本,它接替了 Grok 4.5,擁有相同的 500,000 詞元上下文視窗、相同的文字、圖像與檔案輸入介面,以及相同的基礎定價。它支援可設定的推理強度、原生工具呼叫、結構化輸出與完整的取樣介面,且作為原生支援 OpenAI Responses 的一流模型,無需轉換層即可直接嵌入既有的代理框架。Artificial Analysis 給它的 Intelligence Index 為 44,在其所測量的 216 個模型中排名第 31,GPQA Diamond 數值為 94.9%。

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 是 Anthropic 5.5 世代中的第二款產品,也是該公司定位為旗下陣容中速度與智慧最佳組合的模型。claude-sonnet-5-5/ 的形式推出,具備 100 萬 token 的上下文視窗與 128K 的同步輸出上限,維持 Claude Sonnet 5 在輸入、輸出與快取上的 $2 / $10 費率,並提供零資料保留選項。在同一版指數中,它獲得 56 分,於 216 個項目中排名第三。

所以這兩者其實並不在同一個市場。一個是 500,000 詞元的前沿模型,已以精簡的費率販售七週。另一個是 1M 詞元的通用型層級,每詞元成本不比前代高,且綜合評分高出十二分。儘管如此,這個比較仍值得做,因為兩者都是 $2 輸入的模型,而這正是採購決策實際的起點。

沒有人會放上投影片的四倍差距

費率表為 token 定價。帳單以任務計價,而模型為得出答案所花費的 token 數量是設計選擇,而非固定常數。這正是兩者分歧之處,而實測數字極為鮮明:

• 輸出費率 — Claude Sonnet 5.5 每百萬 $10,相較於 Grok 4.6 每百萬 $6

• 每個 Intelligence Index 任務的成本 — Claude Sonnet 5.5 $7.60 對比 Grok 4.6 $1.86

• Index 上的冗長度 — Claude Sonnet 5.5 的 4.1 億輸出 token,對比 Grok 4.6 的 9,400 萬

• 智慧指數 — Claude Sonnet 5.5 56 對比 Grok 4.6 44,兩者皆為 v4.3.2

• 輸出速度 — Grok 4.6 測得每秒 67.7 個 token,而中位數為 82.7;Anthropic 表示 Claude Sonnet 5.5 的輸出生成速度比 Claude Sonnet 5 快 30% 以上,而 Artificial Analysis 測得後者為每秒 78.7 個 token

冗長度這條線就是機制。一個產生四倍 token 的模型,不需要高出 67% 的輸出率,就能讓每項任務的成本變成四倍——但這有幫助,而且兩種效應在這裡指向同一個方向。Anthropic 自己的說法支持這個解讀,而非與之矛盾:發布資料聲稱 Claude Sonnet 5.5 在相同的每 token 價格下,比 Claude Sonnet 5「每項任務成本最多低 30%」,這是關於 token 數量、而非速率的說法。相對於一個精簡得多的外部基準,同樣的特性就成為該模型最大的成本風險。

這些都無法讓指標差距消失。綜合分數上相差十二分,是實實在在的能力差異,而一個比較便宜卻會失敗的任務,並不比較便宜。這確實意味著,誠實的問題不是「哪個費率比較低」,而是「較難的任務要花掉多少 token」,而這個數字唯有在你實際跑過自己的工作負載之後才會出現。

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

脈絡、投入程度與整合的樣貌

第二個分歧是架構層面的,而它決定了你能在不重寫任何東西的情況下採用兩者之中的哪一個。

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 相較於 Claude Sonnet 5 變更了六項行為,其中五項為破壞性變更。傳送 thinking: {"type": "disabled"}/ 現在會傳回 400,且必須替換為 between_tools/。強制工具使用 —— tool_choice/ 為 "any"/ 或具名工具 —— 會遭到直接拒絕,因此,若迴圈強制進行符合結構描述的有效呼叫,就必須改用 auto/ 搭配嚴格工具使用或結構化輸出。較舊的 computer_20251124/ 電腦使用工具在 Claude API 與 Google Cloud 上會遭到拒絕。思考區塊現在會繫結至產生它們的模型與帳戶,因此對話可以從 Claude Sonnet 5 延續其推理,但無法橫向帶入不同的模型系列。此外,顧問工具不再接受 Claude Opus 4.8、Claude Opus 4.7 或 Claude Sonnet 5 作為 Sonnet 5.5 執行器背後的顧問。

Grok 4.6 完全不需要這些。它是一個 OpenAI 格式的模型,取樣介面保持完整,而從 Grok 4.5 遷移過來只是改個模型字串。不過,它自身的成本結構有個陷阱,而且正好是 Anthropic 的鏡像:$2 / $6 的費率適用於最多 200,000 個輸入 token,超過之後的一切都以 $4 / $12 計費。Claude Sonnet 5.5 則在整個 1M 視窗內都收取標準費率。

把這兩個結構並排放在一起,選擇就不再是哪家供應商比較便宜的問題了:

• 簡短提示、密集輸出——Grok 4.6 更精省的 token 習慣與較低的輸出率,決定性地勝出

• 極長的輸入 —— Claude Sonnet 5.5 的 1M 固定費率,在遠未觸及上下文上限之前,就已開始勝過逐級倍增的計價級距

• 大型單一輸出 — Sonnet 5.5 的 128K 上限與 Grok 4.6 相同,且在 Message Batches API 上可達 300K,前提是帶有output-300k-2026-03-24/ 標頭

• 現有的 OpenAI 形式程式碼 — Grok 4.6 不需要任何變更;Sonnet 5.5 則需要上述的工具使用與思考工作

將兩者整合至單一憑證

在腦中比較兩家廠商很容易。真正跑起來才是成本藏身之處:兩個帳號、兩套限制、兩個計費介面,還有一個得測量兩次才有意義的 token 數量。

OrcaRouter 將這一切整合成一個相容於 OpenAI 的端點,涵蓋 200 多款模型,並原樣傳遞供應商定價、不額外加價,因此無論是 Grok 或 Claude 陣營的供應商價格變動,當天就會在此生效,而不必等到下一次合約續約。整個 Grok 4.x 系列都以供應商自身的費率列於目錄中,而 Claude Sonnet 5 自 6 月 30 日起已可供路由,價格為 Anthropic 的 $2 / $10——這是多數 Claude API 流量仍使用的模型,測得每秒 150 個輸出 token,首個 token 時間的 p50 約為五秒。

Claude Sonnet 5.5 目前尚未收錄在我們的目錄中。在它被收錄之前,取得它的途徑是供應商自家的 API,而若要測試它、又不想把工作負載押在一個除了單一綜合指標之外沒人獨立評測過的模型上,做法就是把一定比例的流量導向它,並置於自動容錯移轉之後,由 Grok 4.6 或 Claude Sonnet 5 承接它漏掉的部分。嘗試全新的層級是一項路由決策,而不是遷移專案。

該如何處理這些數字?

Grok 4.6 是更值得選用的模型,當任務簡短、輸出密集,而且整合端已經支援 OpenAI 時尤其如此。以每項任務來看,它可衡量地比這個價格帶中其他任何模型都更精簡,其取樣控制功能完好無損,而上市七週也意味著它的失效模式已經被其他人找出來了。

Claude Sonnet 5.5 是更好的模型,當輸入極為龐大時、當你買的就是綜合分數時,或當工作的代理程度高到讓十二點的指標差距與 128K 輸出上限,比每項任務成本四倍的差異更重要時。遷移檢查清單是真的,而且那要花一天的工作,而不是改個模型字串。

能讓這件事有定論的,是在你自己的流量上,對兩者都執行的一項每任務 token 數測量。本文中所有決定結果的數字——$1.86 對 $7.60、94M 對 410M——都只是那個數字的代理指標,而它是其中唯一一個你能自己產出的數字。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新