一張生成的主視覺卡片,標題為「Claude Haiku 5.5 對 DeepSeek V4.1 Flash」,並帶有眉題「兩種模型,兩種對便宜的看法」,顯示 Claude Haiku 5.5 的輸入 $0.10、輸出 $0.50 與指數 43.40,對比 DeepSeek V4.1 Flash 的輸入 $0.30、輸出 $1.20 與指數 39.46,下方橫條寫著「每完成一項任務的成本 $0.21 對 $0.27」。
Engineering & Research

Claude Haiku 5.5 對比 DeepSeek V4.1 Flash:標價較低,不等於模型較便宜

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在價目表上,這完全不是同一量級。Claude Haiku 5.5由該廠商於 2026 年 10 月 7 日推出,定價為每百萬個輸入 token 0.10 美元、每百萬個輸出 token 0.50 美元。DeepSeek V4.1 Flash於 2026 年 9 月 10 日發布,在獨立看板上的標價為 0.30 美元與 1.20 美元,或在該廠商自家的離峰價目表上為 0.15 美元與 0.60 美元。該廠商在兩項計費上都便宜兩到三倍,而這是 Haiku 級模型首次低於 DeepSeek Flash 的費率。

接著你衡量完成一項任務的成本,落差就隨之瓦解。在同一次評估執行中,一項 Intelligence Index 任務的成本是 Claude Haiku 5.5 為 $0.21,DeepSeek V4.1 Flash 為 $0.27——是 20% 的優勢,而非 200%。原因就在同一頁:Claude Haiku 5.5 每項任務產生 162,164 個輸出 token,而 DeepSeek 為 88,574 個。你每 token 付得較少,卻買到將近兩倍的數量。

那個反轉就構成了整個比較,而以下所有內容都是在論證你的工作負載會落在它的哪一側。

兩份費率卡,均依字面所載解讀

每百萬個 Token 以美元計。Anthropic 的數據來自 Anthropic 自家的定價文件;DeepSeek 的數據則來自 DeepSeek 的模型與定價頁面,該頁面是其尖峰與離峰價格結構的權威依據。獨立測量結果為 Artificial Analysis Intelligence Index v4.3.2,讀取日期為 2026-10-08。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs DeepSeek V4.1 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 39.46, cost per task $0.21 against $0.27, output tokens per task 162,164 against 88,574, Terminal Bench 4.0 0.3283 against 0.2677, AutomationBench 0.3541 against 0.6889 and open weights 'no' against 'yes, MIT', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• 輸入 — Claude Haiku 5.5:10 萬個 token 以內為 $0.10,超過則為 $0.50。DeepSeek V4.1 Flash:看板價目表上為均一價 $0.30,或在 DeepSeek 的離峰時段為 $0.15。

• 輸出 — Claude Haiku 5.5 每 100,000 個 token 以內 $0.50,超過則 $2.50。DeepSeek V4.1 Flash 一律 $1.20,或離峰時段 $0.60。

• 快取輸入 — Claude Haiku 5.5 低於 100,000 個 token 為 $0.01,以上為 $0.05,等於 90% 折扣。DeepSeek V4.1 Flash 為 $0.006,等於 98% 折扣。這是唯一一項 DeepSeek 方案在絕對數字上更便宜的計費項目,而且便宜的程度超出人們預期。

• 分時段定價 — Anthropic 沒有這類機制。DeepSeek 在平日(不含中國國定假日)UTC 01:00 至 04:00,以及 06:00 至 10:00,會將兩項計費加倍。其餘所有時段,包括整個週末,均為離峰時段。

• 上下文與輸出上限 — 各為 100 萬個 token。Claude Haiku 5.5 的單次回應上限為 128,000 個 token;DeepSeek V4.1 Flash 的上限則為 384,000 個。

• 權重 — Claude Haiku 5.5 為專有模型,僅限 API 使用,模型 ID 為 claude-haiku-5-5。DeepSeek V4.1 Flash 以 MIT 授權開源,擁有 552B 參數、其中 16B 為活躍參數,已於 Hugging Face 上發布。

• 模態 — 兩者都接受文字與圖像並回傳文字。兩者皆非原生支援影片。

• 獨立評分 — Claude Haiku 5.5 (Max) 為 43.40,對上 DeepSeek V4.1 Flash (Max) 的 39.46。在 182 個模型的排行榜上,差距為 3.94 分。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

為什麼以任務計算的數字勝過以 token 計算的數字

牌價費率以每個 token 為單位報價,因為那正是實際計量的單位。但這種費率很難用來判斷一項工作負載的成本,因為推理模型會決定一項任務需要多少 token,而這裡的兩個模型相差達 1.8 倍。

Claude Haiku 5.5 在每項 Intelligence Index 任務中輸出 162,164 個輸出 token,拆分為 129,047 個推理與 33,118 個回答。DeepSeek V4.1 Flash 輸出 88,574 個,拆分為 62,670 個推理與 25,904 個回答。兩者都將思考計為輸出。因此,輸出費率低 60% 的模型,反而用掉幾乎兩倍昂貴的計費額度,而算下來兩者只相差不到六美分。

還有第二種效應也朝同一方向作用。index 執行不僅由輸出主導,也同樣由輸入主導,因為測試框架會重新傳送上下文:Claude Haiku 5.5 每項任務的 $0.2128 可拆解為 $0.1317 的輸入與 $0.0811 的輸出,而在輸入這一項中,$0.0954 是快取讀取、$0.0337 是快取寫入,全新輸入僅占 $0.0026。DeepSeek 的 $0.2652 拆分為 $0.1589 輸入與 $0.1063 輸出,其中 $0.0966 的輸入來自快取寫入。這兩個模型讀取的快取上下文量大致相同;但 DeepSeek 為相同的讀取與寫入付出更多。

Anthropic 自家的發布文章,開頭就從相反方向提出了類似的警告。文章說 Haiku 5.5「用於提示最多 100,000 個 token 的任務時特別划算,而這類任務約占我們先前 Haiku 模型請求量的 90%。」這個但書確實在發揮作用——請看下方的斷崖。

十萬個 token 的懸崖才是真正的分岔點

Anthropic 對 Claude Haiku 5.5 並非採取均一價計費。$0.10 與 $0.50 的費率適用於最多 100,000 個符元的提示,之後便變成 $0.50 與 $2.50——輸入價格躍升五倍,輸出價格也躍升五倍,而且是套用於整筆請求,而非僅限於超出部分。

DeepSeek 的結構完全不同。其費率取決於何時你傳送,而非傳送多少。一則 150,000 token 的提示,每個 token 的成本與一則 500 token 的提示相同,在兩個平日時段內會加倍。

在兩者上都套用長提示詞流程,比較結果就會徹底反轉。以 150,000 個輸入 token、20,000 個輸出 token 計算,Claude Haiku 5.5 的輸入費用為 $0.125、輸出為 $0.05——單次呼叫共 $0.175——而 DeepSeek 離峰時段收費 $0.0225 與 $0.012,不到四美分。這代表 DeepSeek 以約 4.5 倍的差距勝出,而同樣這兩個模型,在短提示詞的情境下卻是 Anthropic 以三倍勝出。

抽象來看,這兩種結構都沒有哪一種更好。一種是依你傳送多少來計價,另一種是依你何時傳送來計價,而在發出請求時,這兩個變數中只有一個是你所能控制的。

DeepSeek 另一個沒有人計入價格的槓桿

快取行值得單獨審視,因為它是這整項比較中最便宜的計量單位,而且它是會隨產量成長、而非縮減的那一項。

DeepSeek 的快取命中費率為每百萬個詞元 $0.006,並宣稱提供 98% 折扣——大約是 Anthropic $0.01 的六分之一,也只是雙方全新輸入成本的一小部分。任何會重新傳送穩定前綴的內容——冗長的系統提示、檢索到的文件集、工具結構描述——都會在第一次之後的每一輪按該費率計費。上述的索引執行已顯示這個占比有多大:Claude Haiku 5.5 每項任務輸入成本中有 $0.0954 是快取讀取,而這僅來自 $0.0026 的未快取輸入。

所以,實務上的分界比「Anthropic 比較便宜」更窄。如果你的請求簡短、是單輪,而且快取已暖,Claude Haiku 5.5 在價格上領先,在能力上以 3.94 個指數點領先,並且在綜合代理型列上領先。如果你的請求很長,或前綴佔比很高,或可排程至 DeepSeek 的離峰時段,DeepSeek V4.1 Flash 在成本上佔盡優勢,而且差距還不小。

你今天實際可以撥打的電話

兩個模型都能觸及,但並不對稱;而這種不對稱值得直接講明,而不是留待你自己去發現。

DeepSeek V4.1 Flash 現已登上 OrcaRouter 目錄,以供應商的定價原價直通、0% 加價——這在這裡比平常更要緊,因為 DeepSeek 的費率採尖峰時段結構。我們列出輸入 $0.15、輸出 $0.60,快取讀取 $0.003,並將兩個平日加倍時段記入定價紀錄中,因此路由至 DeepSeek 這條線路的請求,會依 DeepSeek 的計費方式計費,而非採用混合平均價。自動容錯移轉位於路由底層,因此尖峰時段的 429 或供應商局部中斷會轉移呼叫,而不是讓它失敗。

Claude Haiku 5.5 不在型錄上。Anthropic 的模型可透過 Anthropic 直接取得,也可透過其三家雲端合作夥伴——AWS、Google Cloud 和 Microsoft Azure,發布文章所點名的——而這是唯一誠實的說法。型錄中確實有 Anthropic 產品線的 Claude Sonnet 5.5 與 Claude Opus 5.5,這使得從低成本分類呼叫到中階代理式呼叫的升級路徑成為一種路由設定,而非第二套整合。

A capture of the OrcaRouter model page for DeepSeek V4.1 Flash under deepseek/deepseek-v4.1-flash, showing a 1M-token context, a 384K maximum output, text and image input, public benchmarks dated 2026-09-10, a p50 time to first token of 1.74 seconds, and the page's own description of the model as the smallest in DeepSeek's new architecture family, released September 10, 2026.

該選哪一個

如果你的流量屬於分類、擷取、路由決策、摘要和子代理回合——提示簡短、量大、還夾雜圖像——那麼 Claude Haiku 5.5 是更好的模型,而且在 100,000 個 token 以下,也是更便宜的那一個。它的分數高出 3.94 個索引點,支援圖像,而且 Anthropic 提供了可調整的努力程度旋鈕,讓你無須更換模型,就能在每次呼叫的能力與成本之間取捨。

如果你的流量屬於長文件、檢索密集類型,或者你可以把它排進排程,DeepSeek V4.1 Flash 在算術上勝出:每次長呼叫便宜三到四倍、快取費率只有 Anthropic 的六分之一、回應上限達 384,000 個 token,還有開放權重——萬一按 token 計價的模式哪天不再划算,你還能把權重握在自己手裡。

這個比較真正釐清的,比「Anthropic 現在是便宜選項」更狹窄。它釐清的是:一款小型 Anthropic 模型可以在標價上低於 DeepSeek Flash 的費率,實際帳單卻能落在與其相差不到 20% 的範圍內——而這兩個事實之間的落差,其實是一個詳細程度設定。

一組 API 就能串接 200 多個模型,一組金鑰,自動容錯移轉在底層運作,因此尖峰時段的 429 或供應商服務中斷時,會將呼叫轉移,而不是讓它失敗。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新