タイトルが「Claude Sonnet 5.5 vs Qwen3.8 Max」、サブタイトルが「6週間、2つのティア、コストについての1つの判定」のヒーローカード。ピルには「入力 $2(両方)」「出力 $10 vs $6」「Index 56 vs 45」と表示され、フッターには Artificial Analysis v4.3.2 とベンダー価格が引用されている。
Guides & Insights

Claude Sonnet 5.5 対 Qwen3.8 Max:6週間、2つのティア、コストに関する1つの評決

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

3つのプロンプトで計算してみれば、ベンチマークにたどり着く前に比較はほぼ決着する。短いサポート返信の呼び出しなら、入力2,000トークン、出力500トークン。{{KEEP}}Qwen3.8 Max{{/KEEP}}では入力100万トークンあたり2ドル、出力100万トークンあたり6ドルなので0.4セント、{{KEEP}}Claude Sonnet 5.5{{/KEEP}}では2ドルと10ドルなので0.9セント。リポジトリのリファクタリングなら、入力400,000、出力30,000で、43セント対83セント。予算を実際に使い切る長いエージェントセッションなら、入力200万トークン、出力200,000トークンで、入力側が支配的になるほど数値が大きくなると5.20ドル対6.30ドルになる。

出力価格で2.25倍の差として始まるギャップは、エージェント規模ではおよそ1.2倍に縮まる。そして、そのスケーリングは珍しいものではない。Qwen3.8 MaxとClaude Sonnet 5.5はどちらも出力上限が高い1Mトークンモデルで、どちらも入力100万トークンあたり$2の価格設定で、互いに8週間以内にリリースされた——ベンダー側のものは2026年8月3日で、9月2日付のリフレッシュがあり、Anthro​pic側のものは9月28日。両者の違いは料金表ではない。それぞれが完了するために費やすものだ。

何がリリースされたのか、そしていつか

Qwen3.8 Maxは、Alibabaがこれまでに提供してきた中で最も高い能力を備えたティアです。Alibabaは自社の移行ガイドの中で、これをGPT-5.5、Claude Opus 4.7、Gemini 3.1 Proに真っ向から対抗するものとして位置づけており、利用可能な中で最も強力な推論を必要とするタスクには常にこれを推奨しています。100万トークンのコンテキストウィンドウを備え、テキスト、画像、動画の入力を受け付け、出力はテキストです。ここで挙げた機能のうち、動画入力に対応している点はClaude Sonnet 5.5が持たない唯一の機能です。価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、キャッシュ読み取りは0.25ドル、キャッシュ書き込みは2.50ドルです。当社のカタログにある8月3日付のエントリに加えて、9月2日に更新されたものとしてQwen3.8 Max (0902)が掲載されており、同じ主要な料金と131Kの出力上限を備えています。

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5はAnthropicの5.5世代における2番目のモデルで、Claude Opus 5.5の6日後の2026年9月28日にリリースされました。これはclaude-sonnet-5-5としてClaude APIおよびAmazon Bedrock、Google Cloud、Microsoft Foundryで提供され、100万トークンのウィンドウ、128Kの同期出力上限を持ち、Message Batches APIではoutput-300k-2026-03-24ヘッダー付きで300Kまで拡張され、Claude Sonnet 5の料金はそのまま維持されています:入力$2、出力$10、キャッシュ読み取り$0.20、キャッシュ書き込み$2.50。リリース時点からゼロデータ保持、廃止は2027年9月28日より早まることはありません。

つまり、入力レートは同一で、コンテキストウィンドウのサイズも同じ、そして2社は互いに1か月以内に更新した。両者を分けるものはすべて、請求の出力側かベンチマークにある。

ベンチマーク:ベンダー表と独立系インデックスの比較

ここには二種類の証拠が存在し、それらは置き換え可能なものではない。

Anthropicの発表表はベンダー報告によるもので、第三者による再現は一切なく、8つの評価を対象としている。重要なのは、その行である。

・Terminal-Bench 4.0 — Claude Sonnet 5.5 が 70.6%、Claude Sonnet 5 が 10.3%

• CursorBench 4.0 — Claude Sonnet 5の34.1%に対して55.5%

• GDPval-AA v2.1 — Claude Sonnet 5 の 1449 に対して 1844、Claude Opus 5.5 が 1846、GPT-6 Sol が 1487

• Humanity's Last Exam、ツール使用時 — 64.5% 対 54.9%、Claude Opus 5.5 は 67.7%

• OSWorld 2.1、一部 — 80.1% 対 57.0%

• チャートグラフィー、ツールなし — 61.6% 対 15.6%

Alibabaは直接的に同等な4列の表を公開していないため、同じ軸に置ける数値は独立系のものだけです。Artificial Analysis、v4.3.2 リビジョン

• 総合知能指数 — Claude Sonnet 5.5 は 216 中 3 位で 56、Qwen3.8 Max は 27 位で 45

• {{1}}Index{{/1}}タスクあたりのコスト — $7.60 対 $5.41

• 出力速度 — Anthropicのモデルは、毎秒78.7トークンと測定されたClaude Sonnet 5のベースラインを基準に動作し、Qwen3.8 Maxは39.1と測定されています

• 冗長性 — Index 上の出力トークン 410M 対 190M

Qwen3.8 Max 自体の評価項目ごとのスコアは、わずかな差どころか、十分に見応えのある水準だ。GPQA Diamond で 92.8%、Terminal-Bench 2.1 で 88.8%、長文コンテキスト想起で 80.3%、tau-banking で 47.8%。総合では後れを取る。決定的に勝てる項目が一つもなく、新しくなった Anthropic の階層がいくつかの点で完全に勝利しているからだ。また、Qwen3.8 Max の独立したページには 2026年9月2日というリリース日と 984K というコンテキスト値が記載されている点にも注意が必要だ。これは8月のビルドではなく (0902) のリフレッシュ版について述べているのであり、両者の数値を混同するのは誤りだ。

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

どちらの列にも欠けているものは、そこに含まれているものと同じくらい重要である。Anthropic の OSWorld や Terminal-Bench の数値を独立に再現した者はいない。Qwen3.8 Max について Chartography や CursorBench の数値を公表した者もいない。合成値は両モデルで同じ方法によって測定された唯一の数値であり、まさにそれゆえに、その下にあるタスク当たりコストの数値がこれほど大きな役割を果たすのである。

それを決める数字、そしてそれはどちらの料金表にも載っていない

Artificial Analysisは両モデルに同じ方法で課金している。Index内の10の評価を実行し、トークンを数え、定価を掛ける。Claude Sonnet 5.5はタスクあたり7.60ドル、Qwen3.8 Maxは5.41ドルとなり、より高い総合スコアにもかかわらず、Anthropicのモデルには40%の割高が生じる。冗長性の測定値がその方向性を説明する——4億1000万トークン対1億9000万トークン——そして速度の測定値が残りを説明する。より少ないトークンを出力し、トークンあたりにより長い時間を要するモデルは、出力に2倍の料金を支払っている側ではない。

Anthropic自身の効率性に関する主張も、それと矛盾するどころか同じ話に合致する。同社は、Claude Sonnet 5.5はClaude Sonnet 5より30%以上速く出力を生成し、同一価格で「タスクあたり最大30%安く済む」と述べている——これは料金ではなく、タスクあたりのトークン数に関する主張だ。トークン消費が半分未満のモデルに対してもこれが成り立つかどうかは、まさに$7.60という数字が問うていることであり、1回の独立した実行は1つのデータ点にすぎない。

実務上の帰結:調達部門が目を向けるのは $6 対 $10 の出力レートであり、それはこの記事で最も予測精度の低い数字だ。予測に効くのは、自社のプロンプトにおけるタスクあたりのトークン数であり、どちらのベンダーもそれを教えてはくれない。

入力、動画、そして移行の罠

すぐに明らかになる能力の違いはモダリティです。Qwen3.8 Max はテキストや画像に加えて動画も受け付けますが、Claude Sonnet 5.5 はテキストと画像だけです。画面録画の分析、会議映像のパイプライン、あるいは動画を第一級の入力として扱うあらゆるものにとって、これはベンチマークの差ではなく、適格性に関する二者択一の問いであり、これらのモデルのうち片方しか合格しません。

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

1週間後に現れる違いは、行動面にある。Claude Sonnet 5.5は、Claude Sonnet 5上で動作するコードに5つの破壊的変更を加える。デフォルト以外のtemperature、top_pまたはtop_kは400を返すようになる。thinking: {"type": "disabled"}を送信すると、between_toolsを指す400が返る。これは新たな最小のthinking設定で、low、medium、high effortでは受け入れられ、xhighまたはmaxでは拒否される。強制ツール使用、つまりtool_choiceが"any"または名前付きツールである場合は、問答無用で400を返す。古いcomputer_20251124 computer-useツールは、Claude APIとGoogle Cloudでは拒否される。また、thinkingブロックはそれを生成したモデルとアカウントに紐づけられるため、推論はClaude Sonnet 5から引き継ぐことはできても別のファミリーへ持ち出すことはできず、編集された会話プレフィックスはリプレイをエラーに変えうる。

Qwen3 Max はそのどれも要求しません。OpenAI 形式のモデルであり、リクエストの仕様はごく一般的です。別の Qwen ティアからこれに移行する場合、変更点はモデル文字列だけです。

二つのコストを正直に天秤にかけよう。Qwenモデルを選ぶと、11ポイントの総合差と、そもそも独自には検証できないAnthropicのベンダー数値を失うことになる。Anthropicモデルを選ぶと、動画入力と、4つのAPI変更のチェックリストを失う。それらは最初に叩かれた時点でそれぞれ400で盛大に失敗する——これは良い種類の失敗だが、いずれにせよ1日分の作業だ。

OrcaRouterの位置づけ

選ぶのではなくルーティングする理由は、決め手となる数値——あなたのトラフィックにおけるタスクあたりのコスト——が、どちらのベンダーのドキュメントからも算出できないからだ。

OrcaRouterは、200を超えるモデルに対応する単一のOpenAI互換エンドポイントであり、プロバイダーの定価をマークアップなしでそのまま通しているため、どちらか一方における値下げやティアの変更は、発表されたその日に反映されます。Qwen3.8 Maxの両ビルドが、Alibaba自身の$2 / $6でカタログに掲載されています — 8月のエントリーと(0902)のリフレッシュ版 — に加えて、Claude APIトラフィックの大半が今なお稼働しているモデル、Claude Sonnet 5も、6月30日からAnthropicの$2 / $10でルーティング可能で、実測で毎秒150出力トークンです。Claude Sonnet 5.5自体はまだ当社のカタログにはありません。それが事実であるうちは、それに至る正直なルートはベンダー自身のAPIとAnthropicが挙げる3つのクラウドであり、ワークロードを移さずに試す方法は、トラフィックの一部を自動フェイルオーバーの背後に置いてClaude Sonnet 5またはQwen3.8 Maxへと振り向けることです。

どれが、どの仕事向けですか?

Qwen3.8 Maxは、動画入力、出力レート、索引タスクあたりの実測コスト、そして統合にかかる工数で優位に立つ。十二ポイントの総合スコア差が出力品質に現れない、大量かつ仕様が明確な業務にとって、これが適切なデフォルトである。

Claude Sonnet 5.5 は、独立系の複合指標で、Anthropic のベンダー数値が Terminal-Bench 4.0 で自社の前世代モデルを 60 ポイント上回ったエージェント型コーディング評価で、300K のバッチ出力上限で、そして料金表では下せない業務に即した判断で優位に立つ。タスクが十分に難しく、安さよりも正確さが重要になるなら、選ぶべきモデルはこれだ。

どちらについても答えを変えるものは同じであり、それは新しいベンチマークのリリースではない。それは、両方のモデルについて、自分のプロンプトで、自分のエフォート設定における、タスクあたりのトークン数だ。AnthropicのエフォートパラメータとQwenの出力上限はどちらもその数値を左右するレバーであり、どちらもベンダーの価格表ではなく、あなた自身によって設定される。

この比較でひとつだけ決着がつくのは、入力100万トークンあたり2ドルという水準では、請求の入力側はもはや中国のフラッグシップとAnthropicの中位モデルを分ける要因ではないということだ。その競争は数カ月前に出力側とトークン数へ移っている。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新