「Claude Haiku 5.5 vs Qwen3.8 27B」というタイトル、キッカー「オープンウェイト vs API」の生成されたヒーローカード。Claude Haiku 5.5は入力$0.10、出力$0.50、インデックス43.40、Qwen3.8 27Bは入力$0.50、出力$3.00、インデックス33.70を示し、バーには「完了したタスクあたりのコスト $0.21 vs $1.01」と表示。
Engineering & Research

Claude Haiku 5.5 対 Qwen3.8 27B:APIでの完勝、そしてオープンウェイトが今なお存在する理由

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

このシリーズの比較のほとんどは、結局のところトレードオフに行き着く。今回の比較はそうではない。そしてトレードオフが存在しないこと自体が、今回の知見である。Claude Haiku 5.52026年10月7日に出荷され、Qwen3.8 27B、2026年8月14日公開のオープンウェイト27Bデンスモデルを、総合知能スコア、トークンあたりコスト、完了タスクあたりコスト、コンテキストウィンドウ、応答上限、エージェント型コーディング、科学推論の各項目すべてで上回る。しかもそれを、ハードウェアを必要としない単一の独自APIから実現している。Qwen3.8 27Bが完全に勝利する項目は動画入力の一つだけであり、もう一つはライセンスである。

それはこのモデルを見限る理由にはならない。Apache-2.0ライセンスと動画モダリティは残念賞ではないからだ。むしろ、なぜ人がオープンウェイト側を選ぶのかを正確に語り、議論がベンチマークの話であるかのように装うのをやめるべき理由である。

両方のモデルが実際に実行された数値

100万トークンあたりの米ドル建て。ベンダーの料金は各社自身の価格ドキュメントに基づく。共通の測定値は Artificial Analysis Intelligence Index v4.3.2(2026-10-08 取得)で、いずれも公開されている最も高い effort 設定での値。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• 入力 — Claude Haiku 5.5 は 100,000 トークンまで $0.10、それを超えると $0.50。Qwen3.8 27B は、ボードに記録された第三者レートで $0.50。

• 出力 — Claude Haiku 5.5 は 100,000トークンまで $0.50、それを超えると $2.50;Qwen3.8 27B は $3.00。

• キャッシュ入力 — Claude Haiku 5.5 $0.01と$0.05、90%割引;Qwen3.8 27B $0.10、80%割引。

• 独立スコア — Claude Haiku 5.5(Max)が43.40に対し、Qwen3.8 27B(Xhigh)は33.70。9.70ポイントの差は、このバッチで最大です。

• 完了したタスクあたりのコスト — 同じ評価実行で、$1.01に対して$0.21。4.7倍の差で、これもここでは最大です。

• コンテキストと出力 — Claude Haiku 5.5 では 1M トークン、および 128,000 トークンの応答上限。Qwen3.8 27B では 256K トークンのコンテキスト。

• モダリティ — どちらもテキストと画像を入力として受け取り、テキストを返します。Qwen3.8 27B は動画入力にも対応していますが、Claude Haiku 5.5 は対応していません。

• 重み — Qwen3.8 27B は Apache 2.0 の下で提供される 27B の密なパラメータで、ダウンロード可能です。Claude Haiku 5.5 はプロプライエタリで、API 専用です。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

タスクごとのギャップがトークンごとのギャップの4倍になる理由

料金表はすでに、ベンダーに有利な入力5倍・出力6倍の差を示しており、方向性は問うまでもない。読む価値があるのは、タスク単位の数値が小さい——トークン単位の数値よりも。そしてこれは、このバッチの他の対戦で起きたこととは逆であり、その理由は示唆に富む。

Claude Haiku 5.5は、Intelligence Indexのタスク1件あたり162,164出力トークンを生成する——推論129,047、回答33,118。Qwen3.8 27Bは66,797で、内訳は推論47,711、回答19,087。ベンダーのモデルはタスク1件あたり2.4倍のトークンを消費するため、出力レートで6倍の優位性は、タスク1件あたり4.7倍の優位性に圧縮される。それでも依然として膨大だ。ただ、料金表が謳う数字ではないだけだ。

ブレンド計算は、その形をより明快に見る方法だ。入力重視の7:2:1ブレンド——実際の本番トラフィックが持つことの多い重み——では、Claude Haiku 5.5は100万トークンあたり$0.077になるのに対し、Qwen3.8 27Bは$0.470だ。バランスの取れた1:1ブレンドでは、$0.30対$1.75だ。これを埋められる唯一のものは、ベンダーの10万トークンの崖だけだ。それを超えると、Claude Haiku 5.5のメーターはリクエスト全体で$0.50と$2.50になり、両モデルはほぼ同じ価格で並ぶ——その時点で、あなたは9.7ポイントのスコアプレミアムに何の意味もなく金を払っていることになる。

ベンダーカードと独立系ボードが不一致の場合

ここは、じっくり時間をかけて見る価値のある行のセットだ。なぜなら Qwen3.8 27B 自身のモデルカードは、独立した測定値よりもかなり強い内容を示しており、その差こそが、「はるかに大規模なモデルに匹敵する27Bモデル」という主張に第二の情報源が必要となる、まさにその理由だからだ。

The vendor's own published figures, as recorded on our catalogue page for the model, include 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified, and 79.0 on QwenSWEBench. Those are vendor-reported and unreproduced, and they describe a model that is competitive well above its weight class.

Artificial Analysisによる独立実行では、Qwen3.8 27BのスコアはTerminal-Bench 4.0で0.0556、SciCodeで0.4664、Humanity's Last Examで0.3392、GDPval-AA v2.1で1423.21です。この0.0556を、ベンダーカードがOSWorldで報告する84.3と並べてみれば、食い違いの構図は明らかです。コンピュータとターミナルを使うエージェント作業では、独立系の評価ボードはこのモデルを27Bのdenseモデルが属するおおよその位置に置いており、ベンダーカードはそうしていません。

逆方向に働く行が2つあり、同じ理由でそれらを述べておく価値がある。Qwen3.8 27BはAutomationBenchでClaude Haiku 5.5の0.3541に対して0.4824を記録する — どちらのボードにも存在するビジネスオートメーション・ベンチマークに最も近いものでの、12.8ポイントの独立した勝利だ。これは同じ実行から得られた実際の数字であり、人々が実際に小型モデルを配備する用途に最も近い行におけるものだ。

正直な解釈は「ベンダーがすべてを水増しした」ということではない。モデルカードはその作成者が選んだタスクを測定し、独立した評価ボードは固定されたセットを測定するのであって、Qwen3.8 27B の強みはベンダーのリストにはあっても、ボードのリストにはない、ということだ。

ハードウェアを所有すると、経済性が変わる

上記で示したレートはすべてAPI価格であり、Qwen3.8 27B にとってそれは誤った前提です。

これはApache 2.0の下にある27Bのdenseモデルです。ほとんどのチームが受け入れるであろう量子化で、単一の最新アクセラレータに収まります。そのため、トークンの限界コストはベンダーのメーターではなく、あなた自身の稼働率になります。だからこそ、呼び出し価格がホストによって異なるのです。この比較に含まれるどちらのプロプライエタリモデルにも決してできないことです。価格ボードには第三者レートとして入力$0.50、出力$3.00が記録されており、OrcaRouterのカタログでは入力$0.33、出力$2.40で、キャッシュ読み取りの行は一切ありません。なぜなら、私たちは誰かのエンドポイントを再販しているのではなく、自社インフラ上で重みを実行しているからです。

すでにGPUに費用を払っているチームにとって、比較はタスクあたり0.21ドル対1.01ドルではない。ベンダーの請求単価と、自社所有ハードウェア上で1リクエストを処理する際の増分コストとの比較であり、これは別の数字だ。それがオープンウェイト側の論拠であり、ベンチマーク表と突き合わせても生き残る唯一の論拠なのだ。

ライセンスがApache 2.0であることには、もう一つ、それほど明白ではない帰結があります。モデルを製品に組み込んで出荷し、自社のトラフィックでファインチューニングし、特定のリビジョンに固定し、重みのレベルまで監査できるのです。そうしたことはどれも、プロプライエタリなAPI専用モデルからは、いくら大金を積んでも手に入りません。そして規制対象のワークロードにとっては、これは好みの問題ではなく、多くの場合、決定的な制約条件です。

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

どちらかを呼ぶこと

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 はカタログに掲載されていません。ベンダーのAPIから直接、また AWS、Azure、主要なクラウドプラットフォームを通じて利用可能であり、これが正確な説明です。カタログにベンダーのラインナップとして掲載されているのはClaude Sonnet 5.5 と Claude Opus 5.5であり、これにより、セルフホストの小規模モデルからホスト型の中間層エージェント型モデルへのエスカレーションパスは、2つ目の統合ではなくルーティングの変更となります — 自動フェイルオーバーはいずれにせよその下に位置します。

異例なほどに偏った評決

テキストまたは画像に対するAPI呼び出しとして、Claude Haiku 5.5は、ライセンスに関する行以外のすべての行でこの比較に勝利する。インデックスポイント9.7、完了タスクあたり4.7倍安価、コンテキストウィンドウは4倍、応答上限は2倍、そしてショートプロンプト領域では5~6倍低い価格。価格の面でQwen3.8 27Bを救うワークロード形状の議論は存在しない。なぜなら、そのベンダーの不利な点——出力トークンの多用——は、その料金上の優位性よりもはるかに価値が低いからだ。

それを救うのは、API価格が捉えていないものすべてだ。再配布を許可するライセンス、保持してピン留めできる重み、動画入力、そしてトークンあたりのコストがベンダーの料金表ではなく自前のハードウェアになるセルフホストの道。テキストを分類し、抽出し、要約し、ルーティングするための最も安価な方法を探しているなら、Claude Haiku 5.5 が答えであり、その差は決して僅差ではない。自分の製品の中に、自前のハードウェア上に、自分の監査の下に置けるモデルを探しているなら、ベンチマークの差は数段落前にもう論点ではなくなっている。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新