
Claude Haiku 5.5 對上 Qwen3.8 27B:在 API 上大獲全勝,以及開放權重為何依然存在
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
本系列中的大多數比較最終都歸結為一種取捨。這一個並非如此,而這種取捨的缺席本身就是一項發現。Claude Haiku 5.5,於 2026 年 10 月 7 日推出,勝過Qwen3.8 27B——這款 2026 年 8 月 14 日發布的開放權重 27B 稠密模型——勝出之處包括綜合智能分數、每詞元成本、每完成任務成本、上下文視窗、回應上限、代理式編碼,以及科學推理列;而且它是透過單一專有 API 做到這一切,無需任何硬體。Qwen3.8 27B 唯一徹底勝出的一列是影片輸入,另一項則是授權條款。
那不是看衰該模型的理由,因為 Apache-2.0 授權條款和視訊模態並不是安慰獎。這反倒是一個理由,要精確說明為什麼會有人選擇開放權重陣營,並且別再假裝這場爭論的重點是基準測試。
兩個模型實際運行時所依據的數字
每百萬個 token 以美元計。供應商的費率來自其自家的定價文件;共用的測量數據為 Artificial Analysis Intelligence Index v4.3.2,讀取日期為 2026-10-08,兩者皆採用其公佈的最高 effort 設定。

• 輸入 — Claude Haiku 5.5:100,000 個 token 以內為 $0.10,超過則為 $0.50;Qwen3.8 27B 依董事會記載之第三方費率為 $0.50。
• 輸出 — Claude Haiku 5.5 為 0.50 美元(最高 100,000 個字符元),超過則為 2.50 美元;Qwen3.8 27B 為 3.00 美元。
• 快取輸入 — Claude Haiku 5.5 為 $0.01 與 $0.05,享 90% 折扣;Qwen3.8 27B 為 $0.10,享 80% 折扣。
• 獨立評分 — Claude Haiku 5.5(Max)為 43.40,對上 Qwen3.8 27B(Xhigh)的 33.70。差距 9.70 分,是本批次中最大的。
• 每完成一項任務的成本 — 在同一次評估執行中,$0.21 對比 $1.01。4.7 倍的差距,也是這裡最懸殊的。
• 上下文與輸出 — Claude Haiku 5.5 為 1M 個 token,回應上限為 128,000 個 token;Qwen3.8 27B 則為 256K 個 token 的上下文。
• 模態 — 兩者皆接受文字與圖像並回傳文字。Qwen3.8 27B 額外支援影片輸入;Claude Haiku 5.5 則不支援。
• 權重 — Qwen3.8 27B 是採用 Apache 2.0 授權的 27B 稠密參數模型,可供下載。Claude Haiku 5.5 則是專有且僅限 API 使用。

為什麼每項任務的差距是每個詞元差距的四倍
費率表已顯示出有利於供應商的 5 倍輸入差距與 6 倍輸出差距,因此方向已無疑問。值得注意的是,每項任務的數字更小,相較於每 token 的數字;這與這批其他對決中的情況相反,而箇中原因很具啟發性。
Claude Haiku 5.5 在每項 Intelligence Index 任務中輸出 162,164 個輸出 token——其中 129,047 個用於推理,33,118 個用於回答。Qwen3.8 27B 則輸出 66,797 個,拆分為 47,711 個推理與 19,087 個回答。該供應商的模型每項任務花費的 token 是 2.4 倍,因此其 6 倍的輸出速率優勢壓縮為 4.7 倍的每項任務優勢。這仍然極為龐大,只是不是費率表上所宣傳的那個數字。
混合計價的數學,是看清這件事輪廓更簡潔的方式。在以輸入為主的 7:2:1 混合下——也就是大多數正式環境流量實際的權重——Claude Haiku 5.5 每百萬詞元的價格是 $0.077,而 Qwen3.8 27B 則是 $0.470。在均衡的 1:1 混合下,則是 $0.30 對上 $1.75。廠商的 100,000 詞元斷崖,是唯一能拉平這差距的東西:一旦超過,Claude Haiku 5.5 的計費在整個請求上就變成 $0.50 和 $2.50,兩個模型的價格便大致相同——而此時你等於是白白多付了 9.7 分的分數溢價。
廠商卡與獨立板不一致之處
這一組列值得放慢腳步細看,因為 Qwen3.8 27B 自家的模型卡讀起來比獨立量測結果強上不少,而這個落差正是「27B 模型足以媲美大上許多的模型」這種說法需要第二個來源的根本原因。
廠商自行公布的數據——如我們在該模型型錄頁面上所記載——包括 LiveCodeBench v6 的 90.3、GPQA Diamond 的 89.2、OSWorld-Verified 的 84.3,以及 QwenSWEBench 的 79.0。這些都是廠商自行報告且未經重現的數字,而它們所描述的是一個競爭力遠超其級別水準的模型。
在 Artificial Analysis 的獨立測試中,Qwen3.8 27B 的得分為 Terminal-Bench 4.0 上為 0.0556,SciCode 上為 0.4664、Humanity's Last Exam 為 0.3392,GDPval-AA v2.1 則為 1423.21。把 0.0556 與廠商資料卡在 OSWorld 上回報的 84.3 並列來看,這項分歧的樣貌就一目了然:在電腦與終端機的代理式工作上,獨立評測機構把這款模型放在 27B 稠密模型大致該有的位置,而廠商資料卡卻不然。
有兩列資料則朝相反方向切,而出於同樣的理由,它們也值得被提出來。Qwen3.8 27B 在 AutomationBench 上拿下 0.4824 分,對比 Claude Haiku 5.5 的 0.3541——在兩份榜單上最接近商業自動化基準的項目上,取得 12.8 分的獨立勝利。這是同一輪跑出來的真實數字,而且就落在最貼近人們實際部署小型模型用途的那一列。
誠實的解讀並不是「廠商把一切都誇大了」。而是:模型卡衡量的是其作者所選的任務,獨立評測委員會衡量的則是一組固定任務,而 Qwen3.8 27B 的強項在於廠商清單上,不在該委員會的清單上。
當你擁有硬體時,經濟效益就會改變
上述每個報價都是 API 價格,而對 Qwen3.8 27B 來說,那是錯誤的框架。
這是一款採用 Apache 2.0 授權的 27B 稠密模型。在多數團隊都能接受的量化精度下,它只需單一現代加速器就能運行,這意味著每個 token 的邊際成本不再是供應商的計費錶,而是你自己的使用率。這就是為什麼呼叫它的價格會因主機而異,而這正是本比較中兩款專有模型永遠做不到的:看板上記錄的第三方費率為輸入 $0.50、輸出 $3.00,而 OrcaRouter 的價目表則以輸入 $0.33、輸出 $2.40列出,完全沒有快取讀取這一項,因為我們是在自家基礎架構上運行權重,而不是轉售他人的端點。
對一個已經在支付 GPU 費用的團隊來說,比較的並不是每項任務 0.21 美元對上 1.01 美元。真正的比較,是供應商的計費費率,相對於在你自己擁有的硬體上執行一次請求的增量成本——而這是兩組不同的數字。這正是支持開放權重陣營的論點,也是唯一在碰上基準測試表後仍站得住腳的論點。
許可證採用 Apache 2.0 還有第二個較不明顯的後果:模型可以內建於產品中出貨、以你自己的流量進行微調、固定於特定修訂版本,並一路稽核到權重層級。這些能力無論出多少錢,都無法從專有的純 API 模型取得;而對於受監管的工作負載而言,這往往是決定性的限制條件,而非一項偏好。

打電話給他們其中一個
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 並未收錄於目錄中。它可直接透過供應商的 API 存取,也能透過 AWS、Azure 及各大雲端平台存取,這才是準確的說法。目錄中確實收錄的該供應商產品陣容是 Claude Sonnet 5.5 與 Claude Opus 5.5,這使得從自架小型模型升級至託管中階代理式模型的途徑,成為一項路由調整,而非第二次整合——自動容錯移轉無論如何都位於其底層。
這項裁決,異常地一面倒
作為文字或圖像的 API 呼叫,Claude Haiku 5.5 在每一項與授權無關的比較中都勝出。九點七個指數點、每個完成任務便宜 4.7 倍、四倍的上下文視窗、兩倍的回應上限,以及在短提示情境下低五到六倍的標價。沒有任何工作負載形態的論點能在價格上挽救 Qwen3.8 27B,因為該廠商的劣勢——沉重的輸出 token 用量——其影響遠小於其費率優勢。
拯救它的是 API 價格未能捕捉到的一切:允許重新發佈的授權、可以持有並固定的權重、影片輸入,以及一條自架路徑,其中每 token 的成本是你自己的硬體,而不是供應商的顯示卡。如果你正在尋找最便宜的方式來分類、擷取、摘要和路由文字,Claude Haiku 5.5 就是答案,而且差距並不小。如果你正在尋找一個可以放進自己產品、在自己硬體上、接受自己稽核的模型,那麼基準測試的差距在好幾段之前就已經不再是問題了。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
