為 Claude Sonnet 5.5 與 DeepSeek V4 Pro 產生的主視覺標題卡,副標題為「二十個指數點與 $0.022 的快取讀取」,顯示每百萬詞元 $2.00 與 $10.00 對比 $0.66 與 $1.98,並在右下角合成 OrcaRouter 標誌。
Guides & Insights

Claude Sonnet 5.5 對比 DeepSeek V4 Pro:20 個指數點,以及 $0.022 的快取讀取

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把兩張費率表並排放在一起,這場比較還沒開始就彷彿已經結束。Claude Sonnet 5.5 自 2026 年 9 月 28 日起全面供應,每百萬個輸入符元收費 2.00 美元,每百萬個輸出符元收費 10.00 美元。DeepSeek V4 Pro 於 2026 年 4 月 24 日發布,價格分別是 0.66 美元與 1.98 美元。在代理式工作裡,輸出才是真正關鍵的那一條,而 10.00 美元對上 1.98 美元,是五比一的差距——每十萬個符元,一元對上兩角。接著看能力面,Artificial Analysis 在 Intelligence Index v4.3 上給 Claude Sonnet 5.5 打了 56 分,DeepSeek V4 Pro 則是 36 分,在同一套評測框架上相差二十分。整股張力就在這裡:DeepSeek 的模型價格只有五分之一,實測能力約為三分之二,而在不清楚你的工作負載實際上怎麼使用符元之前,這兩個事實無法收斂成單一建議。

確切來說,每個模型是什麼

命名是這項比較第一個出錯的地方,所以先在這裡把它修正。我們所列的 DeepSeek V4 Pro 是deepseek/deepseek-v4-pro,於 2026 年 4 月 24 日發布,是一款具備 1,048,576 個 token 上下文、最大輸出 384,000 個 token、且僅接受文字輸入的模型。Artificial Analysis 追蹤的是一份標記為 DeepSeek V4 Pro 0813 的快照——即 8 月 13 日的建置版本——以下引用的數字都來自那一列。Sonnet 這邊則是 Anthropic 的anthropic/claude-sonnet-5.5,支援文字、圖像與檔案輸入,1M 上下文,最大輸出 128K。如果你是在拿供應商頁面與評測方頁面相比,而數字對不上,請先檢查建置版本後綴,再下結論說其中一方有錯。

DeepSeek V4 Pro 僅支援文字輸入。Claude Sonnet 5.5 則還能接收影像與檔案。這是第一個結構性差異,而且並非微不足道:任何會攝取螢幕截圖、PDF 或圖表的管線,都無法直接把其中一個換成另一個,因為其中一個看不見。

費率卡,逐行說明

• 輸入 — DeepSeek V4 Pro 每百萬 $0.66,相較於 Claude Sonnet 5.5 的 $2.00;DeepSeek 便宜 67%

• 輸出 — 每百萬 $1.98 對比 $10.00;DeepSeek 便宜 80%,是這項比較中最大的單一差距

• 快取讀取——每百萬 $0.022 對比 $0.20;在主宰長時間代理迴圈的那個項目上,DeepSeek 便宜 89%

• 快取寫入 — Claude Sonnet 5.5 的五分鐘時間窗為每百萬 2.50 美元;DeepSeek V4 Pro 的價目表資料列未另列快取寫入項目

• 上下文 — 1,048,576 個 token 對比 1,000,000;DeepSeek 略長一些,但這項差異並無實際影響

• 最大輸出 — 384,000 個 token 對比 128,000 個;在限制大量生成的瓶頸上,DeepSeek 以三倍勝出

• 輸入模態 — 僅文字,對比文字、圖像與檔案

推理 —— 兩者皆採用可設定的推理投入程度,而非固定的思考預算,因此深度在兩者上都是請求參數

DeepSeek 這邊有個排程細節,是費率卡比較會掩蓋掉的。我們的目錄列帶有一個定時定價時段:在 UTC 01:00 至 04:00 之間,以及 06:00 至 10:00 之間,表列費率會乘以二。在那些時段,V4 Pro 的輸入費用為 $1.32、輸出費用為 $3.96——仍比 Claude Sonnet 5.5 便宜,分別便宜 34% 與 60%,但已不再享有主打數字所暗示的差距。可排程的批次工作負載值得排程,而無法排程的工作負載,則值得以尖峰費率而非平均費率來計價。這也是那種唯有閱讀目錄、而非行銷頁面時才會浮現的細節;而這正是把每個候選模型放在同一個端點後面,而不是分散在三個供應商帳戶之後的理由。

兩個能力指標,其中一個並非獨立

在第三方評測方面,排名毫不含糊。Artificial Analysis 在 Intelligence Index v4.3 上給 Claude Sonnet 5.5 評為 56 分,DeepSeek V4 Pro 評為 36 分,兩者皆採用最大努力推理設定。同一評測者將 Claude Opus 5 列為 51 分,Gemini 3.1 Pro Preview 列為 30 分,因此 V4 Pro 的 36 分使其低於先前的 Anthropic 旗艦,卻高於 Google 的 Pro 層級——對於一個價格只要五分之一的模型而言,這是相當體面的位置,但距離頂尖還很遠。

每任務成本的反轉在這裡也同樣出現,而在這次對比中,它的走向與上一次相反。DeepSeek V4 Pro 在索引套件上進行評估的成本為 0.67 美元。Claude Sonnet 5.5 則為 7.60 美元。這不是打錯字,也不是四捨五入造成的誤差:這款較新的 Anthropic 模型在整套測試中產出 4.1 億個詞元,而中位數為 8,800 萬個,且 DeepSeek 模型的冗長程度遠不足以彌補如此規模的價格差距。在不受限的開放式任務上,較便宜的模型在實務上便宜了一個數量級,而不只是價目表上看起來如此。

廠商數據需要更謹慎處理。DeepSeek 公布 V4 Pro 的 τ²-Bench 分數為 96.2,這是個強勁的數字,但它屬於廠商自行提報,而且 τ²-Bench 後來已在 Artificial Analysis 指數的 v4.3 修訂版中被移除——所以這個數字無法獨立地與 Anthropic 所公布任何數據置於同一尺度上。Anthropic 自家針對 Claude Sonnet 5.5 的發布表格也帶有自身的但書,包括一則註腳指出 Max effort 設定在 FrontierCode 上的得分低於 Xhigh,以及一項註記指出其中兩項基準測試是在帶有結構化輸出瑕疵的預發布部署上執行。把兩家廠商的表格並排放在一起,你得到的是兩份行銷文件,而不是一份排名。本文中唯一能歸在同一軸線上的數字,是兩個指數分數與兩項每任務成本,因為這四項都是由同一個評估者產出。

為什麼產出上限比價格更重要

在這項比較中,最不受關注的數字,正是改變架構的那一個:384,000 個輸出 token 對上 128,000 個。

輸出上限不是一項舒適性功能。它決定了一項任務是一次呼叫,還是一條鏈。生成大型原始檔、輸出完整文件、產出冗長的結構化報告、翻譯一個書籍章節——任何產物大於 128,000 詞元的任務——都無法透過對 Claude Sonnet 5.5 的單次呼叫完成,而必須拆解成一系列呼叫,並在呼叫之間傳遞狀態。拆解意味著每一步都要重新送出更多輸入詞元、更多快取讀取、更多協調程式碼,以及一種全新的失敗類型:錯誤往往就棲身在區塊之間的接縫處。一個價格是五倍、卻能省去整個協調層的模型,可能在詞元成本還未變得更低之前,就先在工程工時上更便宜;而反過來說,若一項任務能在單次呼叫內完成,那麼上限根本就從未進入成本計算之中。

所以上限問題優先於價格問題。如果你最長的產出成品能容納在 128,000 個 token 以內,就忽略這一節,改以每項完成任務的成本來比較。如果不行,就要把你必須建立的管線計價,而不只是 token 的費用。

轉換成本與退路問題

無論往哪個方向遷移,重點多半在於提示詞而非程式碼,只有一個例外值得編列預算。

兩個模型都透過 effort 參數來設定推理,但它們是不同廠商的參數,具有不同的等級與不同的預設值。針對 Anthropic 高 effort 設定調校過的提示,不會以同類替換的方式轉移到 DeepSeek 的 effort 設定;它會以重新量測的方式轉移。在移轉的任一側,預期每個工作負載都要花上一天重新建立品質,之後才能信任成本預估。

例外是視覺。Claude Sonnet 5.5 能讀取圖像與檔案;DeepSeek V4 Pro 則只能讀取文字。你的流程中任何會把螢幕截圖、掃描頁面或渲染圖表交給模型的部分,都沒有 DeepSeek 的對應功能,因此全面遷移只適用於你流量中呈文字形態的那個子集。這是一條必須及早劃出的分界線,因為它通常意味著答案不是單一模型,而是拆分。

這兩者目前都能在 OrcaRouter 上路由——deepseek/deepseek-v4-pro與anthropic/claude-sonnet-5都是已上線的目錄項目,以供應商定價計價、零加成,並使用同一組憑證。這一點正是在這類比較中最為重要,因為決定因素不是哪個模型在抽象意義上更好,而是某個特定請求該交給哪個模型。把純文字的大量工作交給便宜模型、把視覺工作交給昂貴模型的分流,就是一條路由規則,而當兩個端點都由同一把金鑰與同一套容錯移轉政策來處理時,要表達這條規則就簡單得多。Claude Sonnet 5.5 本身尚未成為我們平台上的一條路由,所以這個分流做法目前的版本,是將Anthropic 模型與 DeepSeek V4 Pro 配對,而非取代它。

該決定,以規則形式表述

當任務需要「看見」——圖像、PDF、螢幕截圖、算繪輸出——當成品篇幅超過一頁散文,而你想讓前沿模型執筆,或者當二十點的指標落差,正是決定一份草稿得由人類重寫、還是能直接交付的關鍵時,就交給 Claude Sonnet 5.5。

當工作負載是文字進、文字出、量大,且能容忍推理品質上限較低時,就把它交給 DeepSeek V4 Pro:分類、擷取、摘要、大量改寫、有明確規格的程式碼轉換,以及任何你原本得為了搬移文字而支付每百萬輸出 token 十美元的情況。高達 89% 的快取讀取折扣,讓這個模型上的長上下文代理迴圈在結構上就是便宜,這是比較中其他任何方案都辦不到的。

誠實的結論:這不是 DeepSeek 正在輸掉的能力競賽,而是大多數團隊都會搞錯方向的資源分配決策——偏向購買他們根本用不到的能力。如果你的流量是文字,而你的品質標準是「好到足以讓人審閱」,而不是「好到可以不經閱讀就上線」,那麼 V4 Pro 以輸出價格的 20% 和 $0.022 的快取讀取,就是正確的預設選擇,而那 20 個指標分數,則是你目前自願支付的稅。

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新