
Claude Haiku 5.5 對比 Qwen3.8-Flash-Next:開放權重模型並非便宜的那一方
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
直覺上,阿里巴巴 Flash 級的開放權重模型會在價格上壓低 Anthropic 的封閉式小型模型,而就這兩個標價數字來看,確實如此:Qwen3.8-Flash-Next在阿里巴巴自家 API 上,每百萬輸入 token 收費 0.15 美元、每百萬輸出 token 收費 0.47 美元,而Claude Haiku 5.5則是 0.10 美元和 0.50 美元。然而,把兩者拿去跑同一套基準測試,排序就會反轉。Artificial Analysis 在 Max effort 下測得,Claude Haiku 5.5 每完成一項 Intelligence Index 任務的成本為 0.21 美元;Qwen3.8-Flash-Next 在同一測量下則要 0.37 美元,分數還低三分。更便宜的標價屬於帳單更高的模型,原因也正是決定多數這類比較的同一件事:費率表不等於價格,而開放權重模型是靠託管 API 帳單以外的別處來體現價值。那個「別處」才是這場對決的真正主題。
每一項是什麼
這兩者相隔六週登場,而且它們並非同一類的人工製品。
• Claude Haiku 5.5 — 一款於 2026 年 10 月 7 日發布的封閉權重模型,可透過 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 及 AWS 上的 Claude Platform 使用。具備 100 萬個詞元的上下文、在同步 Messages API 上最多 128,000 個輸出詞元、可自適應思考並提供從 Low 到 Max 的努力程度調整,預設為 medium,知識截止日期為 2026 年 6 月,且費率表以 100,000 個詞元為分級門檻。
• Qwen3.8-Flash-Next — 一款開放權重的混合專家模型,於 2026 年 8 月 26 日以 qwen-community-1.0 授權條款發布,阿里巴巴將其描述為未來支撐 Qwen4 之架構的實驗性預覽。它儲存 125B 的主模型參數,外加一個獨立的 51B n-gram 嵌入表——在納入 4B 多詞元預測模組之前約為 176B——且每個詞元啟動 6B 參數,具有 512 個專家、top-10 路由與 48 層。它原生支援 262,144 個詞元的上下文,可透過 YaRN 擴展至 1M,並接受文字、影像與影片輸入。
• Qwen3.8-Flash——已正式提供的商業對應版本,同樣自 2026 年 8 月 26 日起於阿里巴巴的 QwenCloud 上線,每百萬輸入權杖 $0.16、每百萬輸出權杖 $0.47,預設 1M 權杖上下文。值得與 Flash-Next 分開看待:一個是可下載、可檢視的檢查點,另一個則是定價的受管端點。
最後這兩者的差異,正是這個比較之所以有趣的全部原因。Claude Haiku 5.5 與 Qwen3.8-Flash-Next 能相互較量的地方少之又少,因為兩者之中只有一個能在你自己的硬體上運行。
這項經過審慎衡量的法案,指向相反的方向
以下所有獨立數據均來自 Artificial Analysis 的 Intelligence Index v4.3.2。Anthropic 與 Alibaba 的費率表則是供應商本身公布的價格。
• Intelligence Index — Claude Haiku 5.5 在 Max 強度下獲 43 分,於 182 個模型中排名第二。Qwen3.8-Flash-Next 獲 40 分,在其類別 117 個模型中排名第六。兩者僅差三分,Anthropic 略勝一籌。
• 每項任務成本——$0.21 對上 $0.37。每 token 較貴的模型,每完成一項任務反而便宜 43%。
• Index 測試執行時的輸出 token 數量 —— Claude Haiku 5.5 為 4.4 億,Qwen3.8-Flash-Next 為 2.4 億,兩者對比的中位數則是 1 億。Qwen 模型是更高效的寫手,卻仍是成本較高的任務,這說明了差距不單在於 token 用量,而在於輸入內容與評估方所套用計價方式的組合。
• 輸出速度 — 在相同測量下為每秒 241.9 個詞元,對比 56.0。Claude Haiku 5.5 在同一項測量中快超過四倍,而它在該次執行中 295 秒的首個詞元時間,是 Max 強度思考所產生的結果,而非網路數據;Qwen3.8-Flash-Next 的首個詞元時間為 2.53 秒。
• 費率表形態 — Claude Haiku 5.5 在 100,000 個 token 時,從 $0.10 與 $0.50 跳到 $0.50 與 $2.50。Qwen3.8-Flash 則不論長度,一律維持 $0.16 與 $0.47,這在長提示上是實質優勢,也是標價論點在與長文件正面交鋒後唯一仍站得住腳的地方。
• 分詞器 — Claude Haiku 5.5 採用與 Claude 4.7 及後續版本共用的較新分詞器,因此同一段文字會被計為比前一代 Haiku 多出約 30% 的 token。這會使提示詞膨脹,逼近 100,000 token 的級距;這是 Anthropic 自家文件所載,而且在冗長提示詞的情況下——正是 Qwen 固定費率看似最划算的情況——對這款模型不利。
所以這個取捨的樣貌是:每 token 付得多一點,換來更快、稍微更聰明、且每完成一項任務成本更低的回答,但長輸入時要留意費率斷崖。或者每 token 付得少一點,換來較慢的模型,每完成一項任務的成本更高,費率固定,並有 262,144 token 的原生視窗。


開放權重實際上改變計算方式的地方
以上所有內容比較的都是兩個代管 API,而這正是 Qwen3.8-Flash-Next 並非為了勝出而設計的比較。它的論點在於:它不必被租用。
• 首日推論服務支援。 SGLang 推出了 cookbook 頁面與專用映像檔;vLLM 已有對應建置,而架構支援的提取要求仍在開放中。NVIDIA 已在 GB300 NVL72 機架上驗證這兩者以及 TensorRT LLM,而 NeMo 則涵蓋微調。
• 對 176B 檢查點而言,硬體門檻很低。 51B 的 n-gram 嵌入表可以放在主機記憶體而非 VRAM,因為它的查詢位址可事先得知並能預先擷取。這正是讓模型能在 DGX Spark 叢集與 4×RTX PRO 6000 工作站上執行的原因;而同日推出的社群量化版本——只需 75GB RAM 即可運行、準確率約為完整版本 80% 的 1-bit 版本——則讓它能在小型團隊所擁有的硬體上運行。
• 微調功能可供使用。這並不是指託管式調校 API:權重歸你所有,且是在附帶一般條件的社群授權下提供,而架構則記載於一份技術報告中,該報告公開了消融實驗與負面結果。
• 這個視窗比它看起來還小。原生支援 262,144 個 token,透過 YaRN 可擴展至 1M——相較之下,Claude Haiku 5.5 原生就是 1M,而且沒有 rope-scaling 的但書。在那些 Qwen 的固定費率看起來最誘人的長文件工作負載上,真正能裝得下整份文件的模型,其實是另一個。
• 這些基準數據是由廠商自行提報的。阿里巴巴自家的表格顯示,Flash-Next 在 DeepSWE 1.1(58.7 對 54.4)、SWE-bench Pro(62.5 對 56.0)與 GPQA Diamond(91.7 對 90.8)上領先 DeepSeek-V4-Flash-0731,而在 NL2Repo-Bench(48.1 對 54.2)上落後——那是儲存庫層級的程式碼生成,也是較小模型唯一跟不上的代理式面向。這些數據全都未經第三方重現,而且該模型已推出六週。
這就是兩者之間誠實的分界。Claude Haiku 5.5 是一項按量計費的服務,品質上限固定,也沒有任何可供操作的介面。Qwen3.8-Flash-Next 則是一件產物,它的成本曲線向下彎折、趨近電力的價格,而它的品質上限取決於你能服務到什麼程度,另外還得加上一張未經重現的基準測試表所帶來的風險,以及一套仍正被各種執行環境吸納的架構。
實際的決定方式
三個問題就能定論,而其中只有第一個與基準測試有關。
你有 GPU,或者想要有 GPU 嗎?如果沒有,自架(self-host)的情境就只是理論上的空談,那麼上面針對託管服務的比較就是全部的重點——而在每項任務成本、速度與分數上,贏家都是 Claude Haiku 5.5,但要注意它的 100,000 token 步進會讓長提示詞吃虧。如果你確實有加速器閒置、使用率未達目標,Qwen3.8-Flash-Next 是少數幾個開放模型之一,其 6B 活躍參數解碼在大規模運行時是真的便宜,而每項任務 0.37 美元這個數字也就不再是重點。
平均提示詞有多長?這是標價論點唯一站得住腳的地方。在 100,000 個 token 以下——而且是經過一個大約會膨脹 30% 的分詞器之後——Claude Haiku 5.5 在每一項計費上都更便宜。超過這個門檻,固定 $0.16 與 $0.47 的方案才是更划算的一張牌,而且它的優勢會隨長度一路擴大,直到 262,144 個 token 的原生視窗上限;一旦超過,YaRN 擴展就是另一回事的工程問題了。
這個工作負載對延遲變異的容忍度有多高? 每秒 241.9 個輸出 token 對比 56.0 是個很大的差距,而自架部署還會再加上排隊等待。即時客服或瀏覽器操作代理——Anthropic 為這個層級點名的工作負載——將會感受到其中的差異。
對於任何想要直接回答第二與第三個問題、而非對它們反覆推敲的人來說,最便宜的工具是一個共用端點。Qwen3.8-Flash-Next 目前尚未出現在 OrcaRouter 的型錄上,Claude Haiku 5.5 也一樣;我們實際有路由的 Qwen 同系列模型是Qwen3.8-Flash,以供應商定價、0% 加價原樣轉嫁,這是本次比較中實際有提供服務、最接近的對等模型,也是長提示成本測試的正確基準。在 Anthropic 這一側,Claude Haiku 4.5、Claude Sonnet 5.5 與 Claude Opus 5.5 今天都能用同一把金鑰呼叫,因此跨兩代的價格實驗只是一項設定,而不是第二份合約——而且由於定價是原樣轉嫁而非混合計價,任一條腿的供應商降價,在宣布當天就會反映在我們這邊。自動容錯移轉正是讓這項實驗能安全跑在真實流量上的關鍵:預覽版模型或未經重現的基準測試表,正是把路由指向新東西、同時讓一個可信模型在其背後坐鎮的典型情境。
什麼會改變答案?
兩件事,兩者都可驗證。第一,是在同樣也跑 Claude Haiku 5.5 的測試框架上,對 Qwen3.8-Flash-Next 做獨立評測——廠商自己的表格是對照 DeepSeek,而獨立評測榜上的 40 只是單一次排名。程式碼庫層級的編碼分數才是該盯的那一列,因為 NL2Repo 正是這個模型已被證明落後的地方。第二,是執行環境那邊的工作能否落地:vLLM 的支援至今仍透過未合併的 pull request 推進,在完成之前,自行架設這套架構對那些樂在其中的團隊來說是項練習,而不是一條受支援的路徑。
在那之前,摘要很短。Qwen3.8-Flash-Next 是擁有起來更有趣的模型,也是租用起來更貴的模型。Claude Haiku 5.5 是更便宜、更快、分數更高的託管端點,其價目表會懲罰任何冗長內容。取決於你買的是 token 還是檢查點來選擇——而如果你買的是 token,請注意,這個開放權重模型並不是你以為的折扣。

