生成されたヒーロータイトルカードは、見出しが「Qwen-Image-2.1、両方の画像アリーナを制す」、副題が「#1オープンソースのレーベルが隠しているもの」で、Image Edit Arena とラベルされた2枚のリーダーボードカードを表示している。ランクチップは「16 of 56」、スコアチップは「1367」。また、Text-to-Image Arena はランクチップが「17 of 79」、スコアチップが「1228」。それらの上には「qwen-research licence」と表示されたタグがある。
Guides & Insights

Qwen-Image-2.1が2つの画像アリーナで首位に:オープンソース第1位というレッテルが隠すもの

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Qwen-Image-2.1 を手がけたチームは、Arena による評価に謝意を示した。そしてその評価は本物だ。Qwen-Image-2.1は、Arena の画像ボードのうち、ボード側が Proprietary とラベル付けしていない両ボードで最高スコアのモデルである。Image Edit で 1,367、Text-to-Image で 1,228(2026年9月22日時点のスナップショット)。両ボードでその上に並ぶ行はすべて Proprietary タグを帯びている。発表が伝えていない3つの事実は、主張そのものと同じくらい検証可能だ——それらのスコアが得る総合順位、Preliminaryフラグが両方の行に付いており、さらにライセンス文字列はqwen-researchで、以前の画像モデルに付いていた Apache 2.0 ではない。この主張はボードとの接触に耐える。ただ、見出しが示唆するほど多くを語ってはいない。

2つのボードを並べて読み比べる

Arenaスコアは、ブラインドの一対比較投票から作られるElo形式のレーティングである。人は2つの出力を見て、どちらのモデルがどちらを生成したかを知らないまま選ぶ。これはベンダーのベンチマークとはカテゴリー的に異なる証拠クラスであり、だからこそ、それに依拠する主張は繰り返すのではなく検証する価値がある。両方のボードは2026年9月22日に取得され、どちらもランキング画像からざっと読むのではなく、行ごとに読まれた。

A screenshot of the LMArena Image Edit Arena leaderboard, captured September 22 2026, showing the board header reading 29,902,508 votes and 56 models, with ranks 13 to 22 visible: gemini-3-pro-image-preview at 1385, reve-2.1 at 1375, gpt-image-1.5-high-fidelity at 1370, qwen-image-2.1 at rank 16 with 1367 and a confidence interval of plus or minus 9 and 4,841 votes marked Preliminary, reve-2.0 at 1358, uni-1.1-max at 1334, grok-imagine-image at 1329, uni-1.1 at 1315, gemini-3.1-flash-lite-image at 1314 and qwen-image-2.0-pro-2026-06-22 at 1304, with every row above qwen-image-2.1 labelled Proprietary.

Image Editボードには56のモデルと29,902,508票がリストされています。Qwen-Image-2.1はスコア1,367、信頼区間±9、投票数4,841で16位に位置しています。その上の15行 — 1,526のgpt-image-2.5-sunburstから1,370のgpt-image-1.5-high-fidelityまで — はすべてプロプライエタリです。すぐ下の2行、1,358のreve-2.0と1,334のuni-1.1-maxも同様です。

A screenshot of the LMArena Text-to-Image Arena leaderboard, captured September 22 2026, showing the board header reading 6,258,152 votes and 79 models, with ranks 14 to 21 visible: gemini-3-pro-image-2k at 1246, gpt-image-1.5-high-fidelity at 1239, gemini-3-pro-image-preview at 1232, qwen-image-2.1 at rank 17 with 1228 and a confidence interval of plus or minus 11 and 2,843 votes marked Preliminary, ideogram-4.0-quality at 1204 labelled Ideogram Open Model, qwen-image-2.0-pro-2026-06-22 at 1191, uni-1.1-max at 1188 and mai-image-2 at 1183, with Proprietary labelling on every row above qwen-image-2.1.

Text-to-Image ボードは同じ日に79モデルと6,258,152票を掲載している。Qwen-Image-2.1は1,228で17位、信頼区間は±11、2,843票。同じパターンだ。その上にある16行は Proprietary で、その下にある最初の非Proprietary行は1,204のideogram-4.0-qualityで、Ideogram Open Modelとラベル付けされている。

それらの行から引き出す価値のある詳細が2つある。なぜなら、それらはその主張が通常繰り返されるあり方に反するからだ。

順位とスコアは別のことを物語る — 1,367 は画像編集ボードにおける非Proprietaryの最高スコアであり、同時に16位でもあり、首位から159ポイント差、15位まであと3ポイントだ。
一方のボードでは、Alibaba自身のクローズドモデルが勝利する — Proprietaryとタグ付けされた qwen-image-3.0-pro は Text-to-Image で 1,254 に位置し、qwen-image-2.1 の 1,228 を26ポイント上回る。編集ボードでは、オープンモデルが以前のプロプライエタリモデル qwen-image-2.0-pro-2026-06-22 の 1,304 を打ち負かす。両方のボードで社のチャンピオンが同じモデルというわけではない。
次に続くオープンモデルとの差は、一方のボードでは大きく、もう一方では小さい — Image Edit では、次に続く非Proprietaryの行は hunyuan-image-3.0-instruct の 1,302 で、65ポイント差。Text-to-Image では ideogram-4.0-quality の 1,204 で、24ポイント差だ。

ライセンス文字列はランキングよりも多くの役割を果たしている

Arenaの各行には組織とライセンスのラベルが付いている。Qwen-Image-2.1の表記はAlibaba · qwen-researchと両ボードで表示されている。これは、Alibabaの以前の画像モデルに付いているApache 2.0ラベルではない。編集ボードでは1,241のqwen-image-editと1,235のqwen-image-edit-2511がどちらもApache 2.0とタグ付けされており、Text-to-Imageでは1,125のqwen-image-2512と1,057のqwen-imageも同様だ。ベンダーのブログ投稿は同じ話を締めくくっており、2026年9月20日付のQwen Research License Agreementの下で重みを公開している。これは研究と評価を許可するもので、商用利用は許可しない。

つまり「第1位のオープンソースモデル」という表現を正直に読み解くと、その響きよりもずっと狭い意味になる。リーダーボード自体が用いる二分法——プロプライエタリか、そうでないか——に従えば、Qwen-Image-2.1が第1位だ。一方、用途分野の制限を認めないOSIのオープンソース定義に照らせば、これはそもそもオープンソースではなく、比較対象となっている大半のモデルも同様だ。同じリーダーボードには、以下のラベルが付いた行が並んでいる:flux-non-commercial-licensetencent-hunyuan-communitykrea-2-community-licenseおよびIdeogram Open Model。Arenaの「オープンソース」フィルターは、プロプライエタリか否かという粗い切り替えスイッチだ。それは有用ではある。しかしライセンスレビューではない。

その区別は、ここでは2ポイントの差よりも重要です。なぜなら、それはもう1週間投票が行われても変わり得ない唯一のものだからです。今日このファミリーからライセンス制限の少ない画像モデルを入手したいなら、Apache 2.0 の行は qwen-image-edit と qwen-image-edit-2511 です — どちらもより旧型で、同じ編集リーダーボードでは120ポイント以上低くなっています(1,367 に対して 1,241 と 1,235)。最高スコアのオープンとラベル付けされた Qwen 画像モデルと、商用利用可能な Qwen 画像モデルは、同じダウンロードではありません。

速報値とは、数字がまだ動く可能性があるということです。

Qwen-Image-2.1の両方の行には、ボードのPreliminaryマーカーが付いている。これは、ある行がスコアを確定とみなすのに十分な票を集めていない場合にArenaが付与するものだ。その理由は投票数にある。Image Editでは4,841票で、ボード全体は29,902,508票。Text-to-Imageでは2,843票で、ボード全体は6,258,152票だ。これと比べると、周囲の行ははるかに多くの票を集めている。gpt-image-1.5-high-fidelityは編集ボードで589,013票、qwen-image-2.0-pro-2026-06-22はText-to-Imageボードで307,705票を獲得している。

3日前に登場したモデルにおける±9と±11の信頼区間は、警告サインではない。それは新リリースが示す当然の姿だ。ただし、投票が積み重なるにつれて、オープン階層の上位における具体的な順位が変わり得ることは確かだ。特にText-to-Imageでは、次に続くオープンの行との差が24ポイントある。

ベンダー自身の仕様書における、そのモデルとは何か

アリババ自身の解説には、32のSingle-Stream DiTレイヤーから構築された7Bパラメータの視覚生成コンポーネントを備えた、テキストから画像生成と編集を統合したモデル、透過画像のネイティブな生成と編集、最大10枚の参照画像のサポート、そして2048×2048のネイティブ出力上限が記述されている——パイプライン全体のダウンロードはおよそ33 GBだ。透過対応はそのリストの中で最も一般的でない項目であり、Arenaの編集ボードがそれを明確に測定しているわけではないため、ボードの順位はその特定の能力についてどちらかを示す証拠にはならない。

ベンダーの主要なベンチマークは Qwen-Image-Bench で、そこではこのモデルは 60.28 と報告されており、Nano Banana 2.0 の 59.82、GPT Image 1.5 の 59.65 を上回っている。これはベンダーが実施した評価で、第三者による再現はなく、しかも差は 1 ポイント未満だ。プロンプトセットが変われば生き残らないような差である。はっきり述べておく価値がある。上記の Arena の数値は他者の投票であり、Qwen-Image-Bench の数値は Alibaba 自身のものである。両者は同じ種類の証拠ではなく、モデルに対する一つの印象へと平均化すべきではない。

デプロイメント サポートはリリースの後にではなく、リリースと同時に提供された。このモデル向けの初日からの統合が ComfyUI、SGLang、vLLM-Omni、LightX2V、および Diffusers ライブラリに存在する。つまり、ほとんどのチームにとって実務上の問いは、そのモデルを提供できるかどうかではなく、提供コストが見合うかどうかである。

今週中に画像APIが必要なら、こうした主張がどこに落ち着くか

ここで重要なのは、自分たちの立場について正確であることです。OrcaRouterはQwen-Image-2.1を、またどのバージョンのQwen-Imageモデルもルーティングしていません。Arenaのスコアが決め手になったのなら、そのモデルはベンダー自身のAPIや複数のサードパーティプラットフォーム経由、あるいはセルフホストのダウンロードとして利用できるものであり、私たちを通してではありません。私たちが販売できるQwen画像ルートはありませんし、ボードの順位は、そうでないふりをする理由にはなりません。

私たちがルーティングするのは、それらのボードがランク付けしている画像ティアの残りであり、Qwen-Image-2.1より上位にある行のいくつかもそこに含まれています。OpenAIGPT-Image-2、GPT-Image-1.5、GPT-Image-1-miniが利用可能で、GoogleのImagen 4の各ティアやGeminiの画像プレビューエンドポイント、xAIのGrok Imagine画像エンドポイントも同様です。このような組み合わせこそ、こうした主張に対する実用的な答えです。もしArenaがオープンモデルをそのまま首位に置いていたなら、切り替えは単一のキーに対する1行のコード変更で済んだでしょう。そうはなりませんでした——両ボードの最上位はプロプライエタリであり、興味深い判断は、研究ライセンスのダウンロードと、今日呼び出せるホスト型エンドポイントのどちらを選ぶかという点にあります。

その決定には、プラットフォームの3つの特性が重要です。ルーティングは200以上のモデルにまたがる1つのOpenAI互換エンドポイントで実行されるため、ホストされている行を相互に比較することは、2つ目の契約や2つ目のSDKを意味しません。プロバイダーのリスト価格はゼロマークアップでパススルーされるため、ベンダーの価格変更は、次の契約更新時ではなく、発表された当日に請求書に反映されます。また、プロバイダー間の自動フェイルオーバーにより、新しく投票数の少ないモデルは、3日目に本番環境の依存関係になるのではなく、フォールバックチェーン内で確立されたモデルの後ろに位置することができます。これは、Qwen-Image-2.1が現在置かれている状況とほぼ同じです。

その主張は正しい。そして、読んだときの印象よりも薄い。

アリババが投稿した内容は検証可能だ。2026年9月22日時点のArenaの両画像ボードのスナップショットでは、Qwen-Image-2.1がProprietaryタグの付いていないモデルの中で最高スコアとなっている。この投稿が圧縮しているのは、それに条件を付けるすべてだ — 総合16位と17位、数千票に基づく暫定スコア、そしてその表現が想起させるオープンソースライセンスの代わりに置かれている研究ライセンス。

A generated scoreboard titled Qwen-Image-2.1 - the scoreboard, with rows reading Image Edit Arena score 1367 at rank 16 of 56, Text-to-Image Arena score 1228 at rank 17 of 79, row status Preliminary on both boards, licence qwen-research non-commercial, Apache 2.0 sibling qwen-image-edit at 1241, and vendor benchmark Qwen-Image-Bench 60.28 unreproduced, above a footer reading Arena figures per the LMArena boards captured September 22 2026; Qwen-Image-Bench figure vendor-reported, no third-party reproduction.

だからといって、この結果が小さくなるわけではない。リリースから3日で両方のボードにおける最初の非プロプライエタリな行になったことは、オープン層がどこに位置するかを実際に変える出来事だ——それに先行する寛容ライセンスのQwen画像モデルは、同じ編集ボードで120ポイント以上も後れを取っている。ただし、それは「オープンソースの最高の画像モデル」という主張と同じではない。その違いは、確認に1分ほどかかるライセンスの行と順位の列にある。