一張生成的英雄卡片,標題為「Claude Haiku 5.5 對比 Qwen3.8 27B」,副標為「開放權重對上 API」,顯示 Claude Haiku 5.5 的輸入 $0.10、輸出 $0.50 與指數 43.40,對比 Qwen3.8 27B 的輸入 $0.50、輸出 $3.00 與指數 33.70,並有一條長條寫著「每完成任務成本 $0.21 對 $1.01」。
Engineering & Research

Claude Haiku 5.5 對上 Qwen3.8 27B:在 API 上大獲全勝,以及開放權重為何依然存在

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

本系列中的大多數比較最終都歸結為一種取捨。這一個並非如此,而這種取捨的缺席本身就是一項發現。Claude Haiku 5.5,於 2026 年 10 月 7 日推出,勝過Qwen3.8 27B——這款 2026 年 8 月 14 日發布的開放權重 27B 稠密模型——勝出之處包括綜合智能分數、每詞元成本、每完成任務成本、上下文視窗、回應上限、代理式編碼,以及科學推理列;而且它是透過單一專有 API 做到這一切,無需任何硬體。Qwen3.8 27B 唯一徹底勝出的一列是影片輸入,另一項則是授權條款。

那不是看衰該模型的理由,因為 Apache-2.0 授權條款和視訊模態並不是安慰獎。這反倒是一個理由,要精確說明為什麼會有人選擇開放權重陣營,並且別再假裝這場爭論的重點是基準測試。

兩個模型實際運行時所依據的數字

每百萬個 token 以美元計。供應商的費率來自其自家的定價文件;共用的測量數據為 Artificial Analysis Intelligence Index v4.3.2,讀取日期為 2026-10-08,兩者皆採用其公佈的最高 effort 設定。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• 輸入 — Claude Haiku 5.5:100,000 個 token 以內為 $0.10,超過則為 $0.50;Qwen3.8 27B 依董事會記載之第三方費率為 $0.50。

• 輸出 — Claude Haiku 5.5 為 0.50 美元(最高 100,000 個字符元),超過則為 2.50 美元;Qwen3.8 27B 為 3.00 美元。

• 快取輸入 — Claude Haiku 5.5 為 $0.01 與 $0.05,享 90% 折扣;Qwen3.8 27B 為 $0.10,享 80% 折扣。

• 獨立評分 — Claude Haiku 5.5(Max)為 43.40,對上 Qwen3.8 27B(Xhigh)的 33.70。差距 9.70 分,是本批次中最大的。

• 每完成一項任務的成本 — 在同一次評估執行中,$0.21 對比 $1.01。4.7 倍的差距,也是這裡最懸殊的。

• 上下文與輸出 — Claude Haiku 5.5 為 1M 個 token,回應上限為 128,000 個 token;Qwen3.8 27B 則為 256K 個 token 的上下文。

• 模態 — 兩者皆接受文字與圖像並回傳文字。Qwen3.8 27B 額外支援影片輸入;Claude Haiku 5.5 則不支援。

• 權重 — Qwen3.8 27B 是採用 Apache 2.0 授權的 27B 稠密參數模型,可供下載。Claude Haiku 5.5 則是專有且僅限 API 使用。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

為什麼每項任務的差距是每個詞元差距的四倍

費率表已顯示出有利於供應商的 5 倍輸入差距與 6 倍輸出差距,因此方向已無疑問。值得注意的是,每項任務的數字更小,相較於每 token 的數字;這與這批其他對決中的情況相反,而箇中原因很具啟發性。

Claude Haiku 5.5 在每項 Intelligence Index 任務中輸出 162,164 個輸出 token——其中 129,047 個用於推理,33,118 個用於回答。Qwen3.8 27B 則輸出 66,797 個,拆分為 47,711 個推理與 19,087 個回答。該供應商的模型每項任務花費的 token 是 2.4 倍,因此其 6 倍的輸出速率優勢壓縮為 4.7 倍的每項任務優勢。這仍然極為龐大,只是不是費率表上所宣傳的那個數字。

混合計價的數學,是看清這件事輪廓更簡潔的方式。在以輸入為主的 7:2:1 混合下——也就是大多數正式環境流量實際的權重——Claude Haiku 5.5 每百萬詞元的價格是 $0.077,而 Qwen3.8 27B 則是 $0.470。在均衡的 1:1 混合下,則是 $0.30 對上 $1.75。廠商的 100,000 詞元斷崖,是唯一能拉平這差距的東西:一旦超過,Claude Haiku 5.5 的計費在整個請求上就變成 $0.50 和 $2.50,兩個模型的價格便大致相同——而此時你等於是白白多付了 9.7 分的分數溢價。

廠商卡與獨立板不一致之處

這一組列值得放慢腳步細看,因為 Qwen3.8 27B 自家的模型卡讀起來比獨立量測結果強上不少,而這個落差正是「27B 模型足以媲美大上許多的模型」這種說法需要第二個來源的根本原因。

廠商自行公布的數據——如我們在該模型型錄頁面上所記載——包括 LiveCodeBench v6 的 90.3、GPQA Diamond 的 89.2、OSWorld-Verified 的 84.3,以及 QwenSWEBench 的 79.0。這些都是廠商自行報告且未經重現的數字,而它們所描述的是一個競爭力遠超其級別水準的模型。

在 Artificial Analysis 的獨立測試中,Qwen3.8 27B 的得分為 Terminal-Bench 4.0 上為 0.0556,SciCode 上為 0.4664、Humanity's Last Exam 為 0.3392,GDPval-AA v2.1 則為 1423.21。把 0.0556 與廠商資料卡在 OSWorld 上回報的 84.3 並列來看,這項分歧的樣貌就一目了然:在電腦與終端機的代理式工作上,獨立評測機構把這款模型放在 27B 稠密模型大致該有的位置,而廠商資料卡卻不然。

有兩列資料則朝相反方向切,而出於同樣的理由,它們也值得被提出來。Qwen3.8 27B 在 AutomationBench 上拿下 0.4824 分,對比 Claude Haiku 5.5 的 0.3541——在兩份榜單上最接近商業自動化基準的項目上,取得 12.8 分的獨立勝利。這是同一輪跑出來的真實數字,而且就落在最貼近人們實際部署小型模型用途的那一列。

誠實的解讀並不是「廠商把一切都誇大了」。而是:模型卡衡量的是其作者所選的任務,獨立評測委員會衡量的則是一組固定任務,而 Qwen3.8 27B 的強項在於廠商清單上,不在該委員會的清單上。

當你擁有硬體時,經濟效益就會改變

上述每個報價都是 API 價格,而對 Qwen3.8 27B 來說,那是錯誤的框架。

這是一款採用 Apache 2.0 授權的 27B 稠密模型。在多數團隊都能接受的量化精度下,它只需單一現代加速器就能運行,這意味著每個 token 的邊際成本不再是供應商的計費錶,而是你自己的使用率。這就是為什麼呼叫它的價格會因主機而異,而這正是本比較中兩款專有模型永遠做不到的:看板上記錄的第三方費率為輸入 $0.50、輸出 $3.00,而 OrcaRouter 的價目表則以輸入 $0.33、輸出 $2.40列出,完全沒有快取讀取這一項,因為我們是在自家基礎架構上運行權重,而不是轉售他人的端點。

對一個已經在支付 GPU 費用的團隊來說,比較的並不是每項任務 0.21 美元對上 1.01 美元。真正的比較,是供應商的計費費率,相對於在你自己擁有的硬體上執行一次請求的增量成本——而這是兩組不同的數字。這正是支持開放權重陣營的論點,也是唯一在碰上基準測試表後仍站得住腳的論點。

許可證採用 Apache 2.0 還有第二個較不明顯的後果:模型可以內建於產品中出貨、以你自己的流量進行微調、固定於特定修訂版本,並一路稽核到權重層級。這些能力無論出多少錢,都無法從專有的純 API 模型取得;而對於受監管的工作負載而言,這往往是決定性的限制條件,而非一項偏好。

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

打電話給他們其中一個

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 並未收錄於目錄中。它可直接透過供應商的 API 存取,也能透過 AWS、Azure 及各大雲端平台存取,這才是準確的說法。目錄中確實收錄的該供應商產品陣容是 Claude Sonnet 5.5 與 Claude Opus 5.5,這使得從自架小型模型升級至託管中階代理式模型的途徑,成為一項路由調整,而非第二次整合——自動容錯移轉無論如何都位於其底層。

這項裁決,異常地一面倒

作為文字或圖像的 API 呼叫,Claude Haiku 5.5 在每一項與授權無關的比較中都勝出。九點七個指數點、每個完成任務便宜 4.7 倍、四倍的上下文視窗、兩倍的回應上限,以及在短提示情境下低五到六倍的標價。沒有任何工作負載形態的論點能在價格上挽救 Qwen3.8 27B,因為該廠商的劣勢——沉重的輸出 token 用量——其影響遠小於其費率優勢。

拯救它的是 API 價格未能捕捉到的一切:允許重新發佈的授權、可以持有並固定的權重、影片輸入,以及一條自架路徑,其中每 token 的成本是你自己的硬體,而不是供應商的顯示卡。如果你正在尋找最便宜的方式來分類、擷取、摘要和路由文字,Claude Haiku 5.5 就是答案,而且差距並不小。如果你正在尋找一個可以放進自己產品、在自己硬體上、接受自己稽核的模型,那麼基準測試的差距在好幾段之前就已經不再是問題了。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新