一張標題為「Claude Haiku 5.5 vs Qwen3.8-Flash-Next」的主視覺卡片,顯示 Claude Haiku 5.5 的輸入為 $0.10、輸出為 $0.50,上下文為 1M,對比 Qwen3.8-Flash-Next 的輸入為 $0.15、輸出為 $0.47,上下文為 256K,中間一列寫著「3:1 混合 $0.20 vs $0.23」,底部一列則寫著「Index v4.3.2 - 43.40 vs 39.82 - $0.21 vs $0.37 每項任務」。
Engineering & Research

Claude Haiku 5.5 對決 Qwen3.8-Flash-Next:每詞元相差三美分,每完成一項工作相差七十八美分

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把兩張費率表並排放,看起來就像出自同一場會議。Claude Haiku 5.5的輸入價為 $0.10,輸出價為 $0.50。Qwen3.8-Flash-Next的輸入價為 $0.15,輸出價為 $0.47。該廠商的模型在輸入上便宜三分之一,在輸出上則貴了 6%。兩家廠商都不是無意間把價格定成這種形狀,也都沒有發布比較說明來解釋他們瞄準的目標——但混合 3:1 工作負載的算術讓意圖變得清晰可辨,也讓這兩者成為整個級距中定價最接近的一對。

相似之處僅止於此。Claude Haiku 5.5 是 2026-10-07 推出的封閉式 API 模型,具備一百萬個符記的上下文視窗,最大輸出為 128,000 個符記。Qwen3.8-Flash-Next 則是擁有 1,800 億參數的開放權重模型,其中活躍參數為 60 億,權重以 Qwen Community License 1.0 發布於 Hugging Face,而其公布的上下文視窗,自家檢查點設定與獨立排行榜的說法並不完全一致。它於 2026-08-26 發布,對任何在這個級距中開發的人來說,既不新穎,也不奇特。

這兩者的定價是刻意綁在一起的。費率卡無法告訴你的是,它們是為不同用途而打造,而在試算表上看起來較便宜的那一個,實際營運起來反而更昂貴。

揭露定價的算術

以常見的 3:1 輸入對輸出比例混合這兩種費率——也就是大多數聊天與程式輔助流量大致落於的比例——Claude Haiku 5.5 每百萬個 token 的費用是 $0.20,Qwen3.8-Flash-Next 每百萬個 token 則是 $0.23。在這種混合下,Anthropic 的模型大約便宜 13%,這個差距比輸入欄所隱含的小,卻比輸出欄所隱含的大。

把比例對調,排名就會改變。在 1:1 時,兩者分別是每百萬 $0.30 與 $0.31——差距落在四捨五入誤差之內,算是平手。在 1:3、以輸出為主時,Claude Haiku 5.5 為 $0.40,Qwen3.8-Flash-Next 則是 $0.39,Qwen 以一分錢之差勝出,而這也是 Anthropic 的模型並非兩者中較便宜者的唯一比例。

所以,對於「哪個比較便宜」,並沒有單一誠實的答案;任何給出單一答案的版本,都是在替讀者挑選某一種比例。可以站得住腳的說法是:Claude Haiku 5.5 的加權是針對輸入密集型流量,Qwen3.8-Flash-Next 的加權則是針對輸出密集型流量;而兩者在 3:1 比例下每百萬個 token 相差三美分,這已是這個層級中最接近 Anthropic 數字的程度。無論發布資料怎麼說,這都是一種刻意的定位。

我們的價目表列出 Qwen3.8-Flash-Next 每百萬個 token 的輸入價格為 $0.15、輸出價格為 $0.47,快取輸入的費率則為 $0.0184。$0.15 與 $0.47 這兩個數字,與 Artificial Analysis 所記錄的該供應商定價相同,而這正是這種轉嫁安排理應產生的結果。

一天真實成交量究竟要付出多少代價

假設有一條每天推送 1,000 萬個輸入 token 和 200 萬個輸出 token 的管線。以典型的提示長度而言,那是小型生產工作負載,輕鬆落在第一個定價級距內。

• 輸入成本——使用 Claude Haiku 5.5 每天 $1.00,使用 Qwen3.8-Flash-Next 每天 $1.50。

• 輸出成本 — 在 Claude Haiku 5.5 上每天 $1.00,在 Qwen3.8-Flash-Next 上每天 $0.94。

• 每日總計 — $2.00 相較於 $2.44。在那樣的使用規模下,一年約相差 $160,也就是每百萬個 token 約 3.7 美分。

現在把費率表未列出的這兩項調整套用上去,方向就會反轉。

首先,Claude Haiku 5.5 使用與 Claude 4.7 及後續版本共用的較新分詞器;根據 Anthropic 自家的文件,它會將相同文字計為比它所取代的模型多約 30% 的符元。如果你的輸入是那些符元計數所依據的那類英文散文,實際輸入費率就不是 $0.10——而是更接近每百萬字文本 $0.13,這讓它與 Qwen3.8-Flash-Next 的差距在兩美分以內,而不是比它低三分之一。

第二,而且影響更大:Claude Haiku 5.5 很囉唆。Artificial Analysis 在執行 Intelligence Index 時,記錄到它產生了 162,164 個輸出 token,而 Qwen3.8-Flash-Next 則是 107,884 個。如果這個比例在你的工作負載上成立,而不是抽象的 3:1,那麼上面那行輸出成本就不再是 $1.00 對上 $0.94,而會變成接近 $1.50 對上 $0.94 —— 每日總計也會倒向 Qwen 這邊。

這兩項調整單獨來看都不具決定性。合在一起,它們卻決定了兩種情況的差別:兩個模型是差距小到可忽略,還是 Qwen3.8-Flash-Next 的營運成本明顯更低;而要知道適用哪一種,唯一方法就是計算你自己流量中的 token 數,而不是從價目表推論。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

固定費率不再顯得固定之處

Claude Haiku 5.5 的價格有階梯,而 Qwen3.8-Flash-Next 的則沒有。

• 價格 — Claude Haiku 5.5 每百萬個 token 輸入 $0.10/輸出 $0.50,提示詞上限 100,000 個 token,超過後為 $0.50/$2.50;Qwen3.8-Flash-Next 均一價 $0.15/$0.47。

• 快取輸入 — Claude Haiku 5.5 讀取為 $0.01、寫入為 $0.125;Qwen3.8-Flash-Next 讀取為 $0.016、寫入為 $0.23。

• 上下文 — 一百萬個 token,適用於 Claude Haiku 5.5。對 Qwen3.8-Flash-Next 而言,這個數字取決於你問的是誰:Qwen 公布的是百萬 token 視窗,檢查點自己的設定將位置嵌入上限設在 262,144,而 Artificial Analysis 記錄的評估配置為 256,000。

• 最大輸出 — Claude Haiku 5.5 為 128,000 個 token;在我們的目錄條目中,Qwen3.8-Flash-Next 則為 131,072 個。

• 輸入模態 — Claude Haiku 5.5:文字與圖像;Qwen3.8-Flash-Next:文字。

• 發佈 — 2026-10-07 適用於 Claude Haiku 5.5,2026-08-26 適用於 Qwen3.8-Flash-Next。

• 權重 — 專有,僅供 Claude Haiku 5.5 透過 API 使用;Qwen3.8-Flash-Next 則依 Qwen Community License 1.0 提供開放權重。

其中三條線與價格標題所指向的方向相反,而提示長度的階梯變化最為劇烈。在提示低於 100,000 個 token 時,Claude Haiku 5.5 在兩條費率線上都是較便宜的模型。超過此門檻後,Anthropic 的輸入費率變為五倍,而 Qwen3.8-Flash-Next 在輸入上仍保有 3.3 倍的優勢,在輸出上則保有 5.3 倍的優勢。這個門檻大致也與上下文視窗出現差異的位置吻合——其中一個模型為一百萬個 token,另一個為 262,144 個——因此需要長視窗的管線,也正是為了取得它而支付第二級費率的管線。

那不是對定價的批評;依提示長度分級的費率,是長上下文模型正常的收費方式。那是對比較方式的警告。一場以 8,000 token 提示進行的正面對決,描述的只是一組價格。同樣這兩個模型在 400,000 token 提示下,則完全是另一組價格,而第二種情況下較便宜的那個,正是第一種情況下較貴的那個。

供應商表格底下寫的內容

兩家廠商都沒有執行對方的評估套件,因此共同的全貌僅限於 Artificial Analysis 在雙方上都測量過的那些資料列。

• Intelligence Index v4.3.2 — Claude Haiku 5.5 (Max) 為 43.40,Qwen3.8-Flash-Next 則為 39.82。Anthropic 領先 3.57 分,是此系列中最大的綜合差距。

• 每項已完成的 Index 任務成本 — 在同一看板上為 $0.21,對比之下為 $0.37。

• 任務時間 — 424.6 秒,相較於 1,524.3 秒。

• Terminal Bench 4.0 — 0.3283 對 0.2525。Claude Haiku 5.5 領先 7.6 分。

• SciCode — 0.5498 對 0.5058。Claude Haiku 5.5 領先 4.4 分。

• Humanity's Last Exam — 0.4439 對 0.3804。Claude Haiku 5.5 以 6.4 分勝出。

• AutomationBench,部分分數 — 0.3541 對比 0.5591。Qwen3.8-Flash-Next 相差 20.5 分。

六列由 Anthropic 拿下,其中幾列差距懸殊,另有一列則由 Qwen 以 20 個百分點的差距勝出。這樣的格局貫穿整個價格帶:Anthropic 的小型模型在推理、科學,以及取得答案的成本與延遲方面較強,但在推動多步驟任務走到完成方面較弱。Qwen3.8-Flash-Next 則恰恰相反。

composite 列與 agentic 列之間的差距在這裡異常地大——一邊是 3.57 分,另一邊是 20.5 分——這使得這一對在該軸向上是整個區間裡最不含糊的組合。如果你的工作是一次性回答單一個困難問題,那麼在你會注意到的每一項指標上,Claude Haiku 5.5 都領先。如果你的工作是一個必須完成任務的 agent,那麼 Qwen3.8-Flash-Next 在唯一能預測這點的那一列上領先,而且領先幅度是 composite 差距的五倍以上。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

你能掌握的1800億個參數

對許多團隊來說,真正為這番比較定下結論的那一行,根本不在效能基準表裡。

Qwen3.8-Flash-Next 是一個稀疏混合專家模型,總參數量達 1,800 億,其中 60 億為活躍參數——這樣的比率讓每個詞元所耗費的運算量,相對於模型的總容量而言保持在適度的水準。它依 Qwen 社群授權條款 1.0 發布,Artificial Analysis 將其記錄為商業授權,而非寬鬆授權;在你據此規劃之前,這個區別值得細讀,因為社群授權並不是 MIT,且在再散布與規模方面有其自身條款。在遵守這些條款的前提下,它可以被下載、自行託管、鎖定至特定檢查點、量化與微調。

Claude Haiku 5.5 不可能具備上述任何一項特質。它是專有模型、僅能透過 API 使用,未公布參數數量,沒有授權條款,也沒有程式碼倉庫。Anthropic 承諾至少會讓它維持可供呼叫直到不早於 2027-10-07,這是一項真實且具體的保證——但關於可用性的保證,與權重本身是兩回事。

實際後果是雙向的,而這一點值得直白說出來,而不是當成替任何一方推銷。需要在自家租用戶環境內進行推論、需要一個固定且可供差異比對的檢查點,或需要能針對領域資料進行微調的團隊,並不是在用評比指標分數在這兩個模型之間做選擇。他們選的是 Qwen3.8-Flash-Next,因為另一個選項無論出什麼價,都提供不了他們需要的東西。需要一個具備公開系統卡、有文件化評估集與退役承諾的託管端點的團隊,則選擇另一個方向,而那些權重根本不是他們原本打算使用的功能。

經營固定費率這一塊。

關於名稱的一點說明。獨立評測機構將此模型歸類為Qwen3.8-Flash-Next;我們自家的目錄則以較短的廠商名稱 Qwen3.8 Flash 收錄同一版本,價格完全相同,為 $0.15 / $0.47,快取輸入費率為 $0.0184,並將其儲存庫指向 2026-08-26 發布的 Hugging Face 權重。下文數據若出自 Artificial Analysis,即屬於其稱為 Qwen3.8-Flash-Next 的條目。兩者是同一個模型;只是該評測機構採用了兩個名稱中較長的那個。

Qwen3.8-Flash-Next 已收錄於 OrcaRouter 目錄中,以供應商定價、0% 加成提供,採原價直通而非混合計價——因此上方所見的 $0.15 與 $0.47 就是帳單上的費率,而 Qwen 方面的任何變動會在同一天反映到我們這裡,而不是等到日後某次重新定價。Claude Sonnet 5.5 與 Claude Opus 5.5 同樣也在目錄中,這讓從小模型升級到 Anthropic 中階模型的途徑成為一項路由設定,而非另一套整合。一套 API 涵蓋 200 多個模型、一組金鑰,自動容錯移轉作為底層支撐,而當成本上限該落在路由中而非應用程式碼裡時,還有路由 DSL 可用。

Claude Haiku 5.5 並未收錄在目錄中。它可透過 Anthropic 自家的 API 存取,而這項比較中 Anthropic 的那一部分,並非我們目前有提供的服務——與其留下模糊空間,不如直接這樣說明。

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

兩者之中是哪一個,又基於什麼理由?

如果你的流量以輸入為主、提示詞低於 100,000 個 token,而且你支付的是真實用量,那麼 Claude Haiku 5.5 在兩條費率項目上都是更便宜的模型,並且在七項共同衡量指標中有六項得分更高——但要注意,30% 的分詞器差異與 Anthropic 的冗長特性都會侵蝕折扣,使折扣在價目表上看起來比在帳單上更大。

如果你的流量以輸出為主,或者你的提示詞長到足以跨越 Anthropic 的門檻,又或者你需要固定費率來做預測,那麼 Qwen3.8-Flash-Next 更便宜——在超過該級距的輸出上有時甚至便宜達五倍——而且它是在代理式完成度這一項上以 20 分勝出的模型。

如果你需要的是負重,那根本沒得比,價格也從來不是考量因素。

在以 3:1 比例混合時,這兩張卡每百萬個 token 的價格相差不到三美分,這已經近到不該由費率來決定。真正決定的是你落在這三段中的哪一段,而這是關於你的管線、而不是關於這兩個模型中任何一個的問題。