一張生成的標題卡,寫著「Claude Haiku 5.5 vs Qwen3.8-Flash-Next」,副標題為「開放權重模型並不是便宜的那一個」;一條標示為「每完成一項 Intelligence Index 任務的成本」的長條圖,標記 Claude Haiku 5.5 為 $0.21、Qwen3.8-Flash-Next 為 $0.37;頁尾一行寫著「數據為 Artificial Analysis 的獨立統計;定價依據 Anthropic 與 Alibaba。」真正的 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對比 Qwen3.8-Flash-Next:開放權重模型並非便宜的那一方

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

直覺上,阿里巴巴 Flash 級的開放權重模型會在價格上壓低 Anthropic 的封閉式小型模型,而就這兩個標價數字來看,確實如此:Qwen3.8-Flash-Next在阿里巴巴自家 API 上,每百萬輸入 token 收費 0.15 美元、每百萬輸出 token 收費 0.47 美元,而Claude Haiku 5.5則是 0.10 美元和 0.50 美元。然而,把兩者拿去跑同一套基準測試,排序就會反轉。Artificial Analysis 在 Max effort 下測得,Claude Haiku 5.5 每完成一項 Intelligence Index 任務的成本為 0.21 美元;Qwen3.8-Flash-Next 在同一測量下則要 0.37 美元,分數還低三分。更便宜的標價屬於帳單更高的模型,原因也正是決定多數這類比較的同一件事:費率表不等於價格,而開放權重模型是靠託管 API 帳單以外的別處來體現價值。那個「別處」才是這場對決的真正主題。

每一項是什麼

這兩者相隔六週登場,而且它們並非同一類的人工製品。

• Claude Haiku 5.5 — 一款於 2026 年 10 月 7 日發布的封閉權重模型,可透過 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 及 AWS 上的 Claude Platform 使用。具備 100 萬個詞元的上下文、在同步 Messages API 上最多 128,000 個輸出詞元、可自適應思考並提供從 Low 到 Max 的努力程度調整,預設為 medium,知識截止日期為 2026 年 6 月,且費率表以 100,000 個詞元為分級門檻。

• Qwen3.8-Flash-Next — 一款開放權重的混合專家模型,於 2026 年 8 月 26 日以 qwen-community-1.0 授權條款發布,阿里巴巴將其描述為未來支撐 Qwen4 之架構的實驗性預覽。它儲存 125B 的主模型參數,外加一個獨立的 51B n-gram 嵌入表——在納入 4B 多詞元預測模組之前約為 176B——且每個詞元啟動 6B 參數,具有 512 個專家、top-10 路由與 48 層。它原生支援 262,144 個詞元的上下文,可透過 YaRN 擴展至 1M,並接受文字、影像與影片輸入。

• Qwen3.8-Flash——已正式提供的商業對應版本,同樣自 2026 年 8 月 26 日起於阿里巴巴的 QwenCloud 上線,每百萬輸入權杖 $0.16、每百萬輸出權杖 $0.47,預設 1M 權杖上下文。值得與 Flash-Next 分開看待:一個是可下載、可檢視的檢查點,另一個則是定價的受管端點。

最後這兩者的差異,正是這個比較之所以有趣的全部原因。Claude Haiku 5.5 與 Qwen3.8-Flash-Next 能相互較量的地方少之又少,因為兩者之中只有一個能在你自己的硬體上運行。

這項經過審慎衡量的法案,指向相反的方向

以下所有獨立數據均來自 Artificial Analysis 的 Intelligence Index v4.3.2。Anthropic 與 Alibaba 的費率表則是供應商本身公布的價格。

• Intelligence Index — Claude Haiku 5.5 在 Max 強度下獲 43 分,於 182 個模型中排名第二。Qwen3.8-Flash-Next 獲 40 分,在其類別 117 個模型中排名第六。兩者僅差三分,Anthropic 略勝一籌。

• 每項任務成本——$0.21 對上 $0.37。每 token 較貴的模型,每完成一項任務反而便宜 43%。

• Index 測試執行時的輸出 token 數量 —— Claude Haiku 5.5 為 4.4 億,Qwen3.8-Flash-Next 為 2.4 億,兩者對比的中位數則是 1 億。Qwen 模型是更高效的寫手,卻仍是成本較高的任務,這說明了差距不單在於 token 用量,而在於輸入內容與評估方所套用計價方式的組合。

• 輸出速度 — 在相同測量下為每秒 241.9 個詞元,對比 56.0。Claude Haiku 5.5 在同一項測量中快超過四倍,而它在該次執行中 295 秒的首個詞元時間,是 Max 強度思考所產生的結果,而非網路數據;Qwen3.8-Flash-Next 的首個詞元時間為 2.53 秒。

• 費率表形態 — Claude Haiku 5.5 在 100,000 個 token 時,從 $0.10 與 $0.50 跳到 $0.50 與 $2.50。Qwen3.8-Flash 則不論長度,一律維持 $0.16 與 $0.47,這在長提示上是實質優勢,也是標價論點在與長文件正面交鋒後唯一仍站得住腳的地方。

• 分詞器 — Claude Haiku 5.5 採用與 Claude 4.7 及後續版本共用的較新分詞器,因此同一段文字會被計為比前一代 Haiku 多出約 30% 的 token。這會使提示詞膨脹,逼近 100,000 token 的級距;這是 Anthropic 自家文件所載,而且在冗長提示詞的情況下——正是 Qwen 固定費率看似最划算的情況——對這款模型不利。

所以這個取捨的樣貌是:每 token 付得多一點,換來更快、稍微更聰明、且每完成一項任務成本更低的回答,但長輸入時要留意費率斷崖。或者每 token 付得少一點,換來較慢的模型,每完成一項任務的成本更高,費率固定,並有 262,144 token 的原生視窗。

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

開放權重實際上改變計算方式的地方

以上所有內容比較的都是兩個代管 API,而這正是 Qwen3.8-Flash-Next 並非為了勝出而設計的比較。它的論點在於:它不必被租用。

• 首日推論服務支援。 SGLang 推出了 cookbook 頁面與專用映像檔;vLLM 已有對應建置,而架構支援的提取要求仍在開放中。NVIDIA 已在 GB300 NVL72 機架上驗證這兩者以及 TensorRT LLM,而 NeMo 則涵蓋微調。

• 對 176B 檢查點而言,硬體門檻很低。 51B 的 n-gram 嵌入表可以放在主機記憶體而非 VRAM,因為它的查詢位址可事先得知並能預先擷取。這正是讓模型能在 DGX Spark 叢集與 4×RTX PRO 6000 工作站上執行的原因;而同日推出的社群量化版本——只需 75GB RAM 即可運行、準確率約為完整版本 80% 的 1-bit 版本——則讓它能在小型團隊所擁有的硬體上運行。

• 微調功能可供使用。這並不是指託管式調校 API:權重歸你所有,且是在附帶一般條件的社群授權下提供,而架構則記載於一份技術報告中,該報告公開了消融實驗與負面結果。

• 這個視窗比它看起來還小。原生支援 262,144 個 token,透過 YaRN 可擴展至 1M——相較之下,Claude Haiku 5.5 原生就是 1M,而且沒有 rope-scaling 的但書。在那些 Qwen 的固定費率看起來最誘人的長文件工作負載上,真正能裝得下整份文件的模型,其實是另一個。

• 這些基準數據是由廠商自行提報的。阿里巴巴自家的表格顯示,Flash-Next 在 DeepSWE 1.1(58.7 對 54.4)、SWE-bench Pro(62.5 對 56.0)與 GPQA Diamond(91.7 對 90.8)上領先 DeepSeek-V4-Flash-0731,而在 NL2Repo-Bench(48.1 對 54.2)上落後——那是儲存庫層級的程式碼生成,也是較小模型唯一跟不上的代理式面向。這些數據全都未經第三方重現,而且該模型已推出六週。

這就是兩者之間誠實的分界。Claude Haiku 5.5 是一項按量計費的服務,品質上限固定,也沒有任何可供操作的介面。Qwen3.8-Flash-Next 則是一件產物,它的成本曲線向下彎折、趨近電力的價格,而它的品質上限取決於你能服務到什麼程度,另外還得加上一張未經重現的基準測試表所帶來的風險,以及一套仍正被各種執行環境吸納的架構。

實際的決定方式

三個問題就能定論,而其中只有第一個與基準測試有關。

你有 GPU,或者想要有 GPU 嗎?如果沒有,自架(self-host)的情境就只是理論上的空談,那麼上面針對託管服務的比較就是全部的重點——而在每項任務成本、速度與分數上,贏家都是 Claude Haiku 5.5,但要注意它的 100,000 token 步進會讓長提示詞吃虧。如果你確實有加速器閒置、使用率未達目標,Qwen3.8-Flash-Next 是少數幾個開放模型之一,其 6B 活躍參數解碼在大規模運行時是真的便宜,而每項任務 0.37 美元這個數字也就不再是重點。

平均提示詞有多長?這是標價論點唯一站得住腳的地方。在 100,000 個 token 以下——而且是經過一個大約會膨脹 30% 的分詞器之後——Claude Haiku 5.5 在每一項計費上都更便宜。超過這個門檻,固定 $0.16 與 $0.47 的方案才是更划算的一張牌,而且它的優勢會隨長度一路擴大,直到 262,144 個 token 的原生視窗上限;一旦超過,YaRN 擴展就是另一回事的工程問題了。

這個工作負載對延遲變異的容忍度有多高? 每秒 241.9 個輸出 token 對比 56.0 是個很大的差距,而自架部署還會再加上排隊等待。即時客服或瀏覽器操作代理——Anthropic 為這個層級點名的工作負載——將會感受到其中的差異。

對於任何想要直接回答第二與第三個問題、而非對它們反覆推敲的人來說,最便宜的工具是一個共用端點。Qwen3.8-Flash-Next 目前尚未出現在 OrcaRouter 的型錄上,Claude Haiku 5.5 也一樣;我們實際有路由的 Qwen 同系列模型是Qwen3.8-Flash,以供應商定價、0% 加價原樣轉嫁,這是本次比較中實際有提供服務、最接近的對等模型,也是長提示成本測試的正確基準。在 Anthropic 這一側,Claude Haiku 4.5、Claude Sonnet 5.5 與 Claude Opus 5.5 今天都能用同一把金鑰呼叫,因此跨兩代的價格實驗只是一項設定,而不是第二份合約——而且由於定價是原樣轉嫁而非混合計價,任一條腿的供應商降價,在宣布當天就會反映在我們這邊。自動容錯移轉正是讓這項實驗能安全跑在真實流量上的關鍵:預覽版模型或未經重現的基準測試表,正是把路由指向新東西、同時讓一個可信模型在其背後坐鎮的典型情境。

什麼會改變答案?

兩件事,兩者都可驗證。第一,是在同樣也跑 Claude Haiku 5.5 的測試框架上,對 Qwen3.8-Flash-Next 做獨立評測——廠商自己的表格是對照 DeepSeek,而獨立評測榜上的 40 只是單一次排名。程式碼庫層級的編碼分數才是該盯的那一列,因為 NL2Repo 正是這個模型已被證明落後的地方。第二,是執行環境那邊的工作能否落地:vLLM 的支援至今仍透過未合併的 pull request 推進,在完成之前,自行架設這套架構對那些樂在其中的團隊來說是項練習,而不是一條受支援的路徑。

在那之前,摘要很短。Qwen3.8-Flash-Next 是擁有起來更有趣的模型,也是租用起來更貴的模型。Claude Haiku 5.5 是更便宜、更快、分數更高的託管端點,其價目表會懲罰任何冗長內容。取決於你買的是 token 還是檢查點來選擇——而如果你買的是 token,請注意,這個開放權重模型並不是你以為的折扣。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.