Qwen-Image-2.1 を発表する Qwen ベンダーブログ記事のヘッダー。タイトル「Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation」が「Now open weights」という文言と Qwen のマークの上に表示され、ページの言語切り替えは EN に設定されている
Guides & Insights

Qwen-Image-2.1は、Artificial Analysisの両ボードでトップのオープンウェイト画像モデルです

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

アリババのQwenチームがQwen-Image-2.1を2026年9月20日にオープンウェイトで公開した。12日後、独立系のスコアボードがそれに追いつき、その結果はローンチ時よりも興味深いものになっている。AA-Image-T2I v2.0リーダーボードでは、Qwen-Image-2.1は166モデル中18位、Eloスコアは1,034で、5,286件のブラインド比較に基づく。AA-Image-Editing v2.0では97モデル中18位、Eloスコアは1,074で、5,536件に基づく。これらの行はいずれも、すべてのモデルを個別に表示するボード上でOpen Weightsと表示されている。どちらのボードでも、このマークが付いた他のモデルでそれらより上位に位置するものはない。これが結論のすべてだ。ブラインドのペアワイズ比較でモデルを採点する唯一の公開画像ボード2つにおいて、公開されたQwen-Image-2.1はこの分野で最強のダウンロード可能なウェイトであり、両方の位置を占めているのはQwen-Image-2.1そのものであって、そのプレビュー版ではない。

以下では、その2つの数字がどこから来ているのか、その周辺の行がどのようなものか、そしてローンチ時の報道の大半が触れなかったボード上の3つの詳細について説明する。まずは、そのボードにはそのモデル向けのAPIがどこにも記録されていないという事実からだ。

2 行が配置されている場所

Artificial Analysis は両方のボードをブラインドのペアワイズ比較から構築している。2つのモデルが同じプロンプトに回答し、投票者がより良い出力を選び、その集計から Elo が導かれる。2つのボードが共有しているのはハウススタイルだけで、それ以外は何もない。評価対象のタスクは異なり、母集団も異なり、それぞれの Elo 値は互いに比較できない。Qwen-Image-2.1 が両方でたまたま同じ順位になったのは、2つの異なる分布による偶然である。

テキストから画像生成、ボード上に166モデル:

• リーダーボードの最上位は GPT Image 2.5 Sunburst(max)で、14,023 回の出現から 1,107 Elo —— Qwen-Image-2.1 のサンプル数の 2 倍以上を擁するプロプライエタリモデルです。

• Qwen-Image-2.1は、5,286回の登場で、Elo 1,034、95%信頼区間1,024~1,044の18位に位置しています。

• 順位を見る前に、行数を確認しよう。 Qwen-Image-2.1は両方のボードで18位だが、これらの順位は異なる集団から来ている——テキストから画像生成は166モデル、編集は97モデル——そして2つのElo値は別々のスケールに属している。同一の順位は算術的なものであり、2つのボードが何かについて一致している証拠ではない。

• Aliba​ba自身の2つのProティアモデルは、このボード上でそれより上位に位置している。Qwen-Image-3.0-ProはElo 1,089で14位、Qwen-Image-3.0は1,075で16位だ。どちらもOpen Weightsマーカーを持っていない。このボードの9月時点のスナップショットでは、両方とも2026年7月リリースとして掲載されている。これは、最新のQwe​n画像モデルが最高スコアのモデルではないという話のバージョンであり、text-to-imageでは実際に最高スコアにはなっていない。

画像編集、ボード上に97モデル:

• GPT Image 2.5 Sunburst (max)も、17,899回の登場で1,182 Eloを記録し、このボードでも首位に立っています。

• Qwen-Image-2.1はElo 1,074、区間1,065~1,083、出現回数5,536で18位につけている。これはテキストから画像生成の行よりやや大きいサンプルであり、編集機能の側がより目立つローンチコピーを得たモデルとしては納得がいく。

• その周辺の行はひしめき合っている。grok-imagine-image は1つ下の1,071、Luma UNI 1 Max は1,069。このボードでそのすぐ下に位置する最も近いオープンウェイトの行は HunyuanImage 3.0 Instruct で、5,221回の出現で1,066 — Elo差はわずか8。7つの行が18 Eloポイント圏内に収まっている。

「最高のオープンウェイトモデル」という主張を正直に読み解く

見出しのその表現は特定の役割を果たしており、そのまま繰り返すのではなく、検証されるべきものである。

• これはマーカー内での順位であり、総合順位ではありません。 Qwen-Image-2.1は、両方のボードで総合18位です。各ボードでそれを1位に押し上げているのは「Open Weights」ラベルであり、このラベルはボード独自の権限に基づいてモデルごとに付与されています — テキストから画像生成のボードでは47行がこのマーカーを持ち、編集ボードでは、掲載されている97行のうち36行がこれを持っています。

• このラベルが示しているのは重みであって、利用条件ではない。 Qwen-Image-2.1 は、2026年9月20日付の Qwen Research License Agreement に基づいて提供されており、同契約が付与するのは非商用目的に限られた権利である。理事会の「Open Weights」ラベルは、ダウンロード可能であることについては正確だが、ダウンロードしたものを何に使えるかについては何も語っていない。「最高のオープンウェイト画像モデル」を「製品で自由に使える」と読む者は、ラベルをその意味の範囲を超えて読んでいる。

• これはスナップショットであり、確定したランキングではありません。 投票が積み重なるにつれて、ボードは毎日変動します。Qwen-Image-2.1の信頼区間は、テキスト・トゥ・イメージで±10 Elo、編集で±9であり、その下の行は重なり合う区間上に位置しています。この位置は恒久的なものではなく、現時点のものとして扱ってください。

ローンチ報道に欠けていた詳細:APIなし

Qwen-Image-2.1 の両方の行には、明示的なAPI は利用できません という注記が付いています。これはランキングにとって実際のコストであり、5,286 票と 5,536 票を誰が生成したかについて何かを物語っています — プロンプトを送る先のエンドポイントがなければ、比較は重みを自分で実行して出力を提出した人々によるものでした。セルフホスト専用モデルの独立した Elo は、誰でも呼び出せるものの Elo よりも本当に難しい測定であり、ここでのサンプルが上位行の 3 分の 1 のサイズである理由でもあります。

開発者にとって、この構図は見慣れたものだ。この分野で最強のダウンロード可能な画像モデルは、今日呼び出せるものではない。実際には、これによって作業は二つに分かれる。自前のハードウェア上で Qwen-Image-2.1 を自分で動かすか、このボード上でその周辺にあるモデルのいずれかを呼び出すかだ。2番目の選択肢こそ、ルーティングがその真価を発揮する場面だ。200以上のモデルを1つの API で扱い、プロバイダの定価をマークアップなしでそのまま適用し、プロバイダの品質が低下した際の自動フェイルオーバー、そして複数のモデルを1回の呼び出しに組み合わせるためのルーティング DSL を備えている。OrcaRouter は現在 Qwen-Image-2.1 を提供していない。このプラットフォームの画像系ラインナップは、Google の Imagen 各ティアと Gemini の画像プレビュー、xAI の Grok Imagine 画像エンドポイント、そして OpenAI の GPT-Image ファミリーだ。このボードでは、それが最上位にある GPT Image 2.5 Sunburst の行であり、「最高スコアが欲しい、しかも今日の午後には呼び出せるようにしたい」という要望に対する正当な答えだ。

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

ボードで注目すべき点

このストーリーを動かす3つの要素は、すでにすべてボード上に見えている。

第一は、APIが登場するかどうかである。Alibabaや提供パートナーがQwen-Image-2.1をエンドポイントの背後に置けば、APIは利用できませんという注記は消え、票数は隣接する行と同程度まで増え、信頼区間も狭まるはずである。1,034や1,074におけるより狭い区間は、現在のものよりはるかに強い主張となる。

2つ目はAlibaba自身のスタックです。Qwen-Image-3.0-Proは1,089、Qwen-Image-3.0は1,075で、どちらもテキストから画像の生成ではQwen-Image-2.1を上回っていますが、Open Weightsのマーカーは備えていません。Qwen-Image-2.1がその系統の後継ではなく、ダウンロード可能な対応版として位置づけられているのだとすれば、興味深いのはその差が縮まるかどうかです — そして編集ボードではすでに縮まっています。そこではQwen-Image-3.0-ProがQwen-Image-2.1をEloポイントで2ポイントリードしています。

三つ目はライセンスです。両方のボード上のすべての Open Weights 行は、そのラベルに対して等しく適格ですが、その背後にあるライセンスは到底等しくありません。ボードはそのことを決して教えてくれません。それはスコアボードに欠けている唯一の列です。

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

よくある質問

Qwen-Image-2.1は最高のオープンウェイト画像モデルですか?

これら2つのボードでは、はい — それは両方で Open Weights マーカーを付けている最高Eloの行であり、テキストから画像生成では1,034、編集では1,074です。総合ではそれぞれ18位 — そしてその18は、一方のボードでは166行中、もう一方では97行中での順位であり、互いに比較できない2つのEloスケールを代表しています。この主張が成り立つのは、両方の限定条件が付いたままの場合だけです。

なぜ2つのボードで同じ対象に対して異なるElo値が表示されるのですか?

それらは異なるタスクを異なるモデル集団に対して採点している。テキストから画像生成のEloと編集のEloは別々の尺度であり、1,034と1,074を比較しても、測っているのはモデルではなくリーダーボードだ。

Qwen-Image-2.1はAPI経由で呼び出せますか?

どちらのボードの行も利用可能なAPIなしと記録している。重みはAlibabaのリポジトリからダウンロードできるため、モデルは動作する — ただ、ボードがその提供元として認定したホスト型エンドポイントが存在しないだけだ。

今日中にダウンロードではなく数値が欲しいなら、両方のボードのトップはベンダー自身のAPI経由で呼び出せる。GPT-Image系列、GoogleのImagen各ティア、xAIのGrok Imagineは、OrcaRouterが直接フロントを務める画像モデルだ。実験には重みファイルを、締め切りにはエンドポイントを残しておけ。