Qwen-Image-2.1 対 Hy Image3.5 の記事用のヒーローカードを生成。見出しは「Qwen-Image-2.1 vs Hy Image3.5」、サブタイトルは「各ランキングで両者の順位は逆になる」、チップは「編集:Hy Image3.5が1,088対1,074でリード」「テキストから画像生成:Qwen-Image-2.1が1,034対975でリード」、フッターは「両モデルのスコアはArtificial Analysis(2026年9月)に基づく」で、右下にOrcaRouterのロゴを合成。
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5:独立系のボードが正反対の順位を付けている

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

直接対決させてみようQwen-Image-2.1とHy Image3.5を Artificial Analysis の2つの画像リーダーボードで。すると両ボードは、どちらのほうが優れているかをめぐって意見が分かれる。テキストから画像への生成では、Qwen-Image-2.1 が Hy Image3.5 に59 Elo の差をつけている——1,034 対 975、18位 対 66位。画像編集では、同じ2モデルの立場が逆転する:Hy Image3.5が 1,088 Elo で14位、Qwen-Image-2.1が 1,074 で18位。今度は逆方向に14ポイントの差だ。両モデルが公開されたのは2日違い——Qwen-Image-2.1 はオープンウェイトで2026年9月20日に、Hy Image3.5 はパブリックプレビューで2026年9月22日に——で、どちらかが同じ尺度でスコアを持ったのはこれが初めてであり、だからこそこの不一致は、ただ報じるだけでなく読む価値があるものになっている。

明白な対応は、編集ボードはノイズが多いと言って先に進むことだ。それは半分正しい。残りの半分は、その2つの行は同じほど堅牢ではなく、一方に付いている価格はもう一方の価格とは同じではなく、これらのモデルの一方は重みへの権利を伴うが、もう一方は決して伴わないということだ。

{{1}}2つのボード{{/1}}、{{2}}2つのオーダー{{/2}}

Artificial Analysis はブラインドのペアワイズ比較を実施している——同じプロンプトを2つのモデルに与え、投票者が勝者を選び、Elo が蓄積される——そしてタスクごとに別々のボードを公開している。テキストから画像生成のボードには166行、編集のボードには97行が含まれる。両モデルについて、それぞれの2つの行はいずれも同じプロバイダーのスナップショットに由来するため、これはバージョンの不一致ではない。

• テキストから画像 — Qwen-Image-2.1 は Elo 1,034(区間 1,024〜1,044)、5,286 件の比較で 166 件中 18 位。Hy Image3.5 は Elo 975(区間 966〜984)、5,334 件の比較で 166 件中 66 位。両区間は重なっていない。同程度のサンプルサイズで 59 ポイントの差は、丸めによる誤差ではなく、実際の順序付けである。

• 画像編集 — Hy Image3.5 は 1,088 Elo(区間 1,079~1,097)、5,550 件の比較で 97 件中 14 位。Qwen-Image-2.1 は 1,074 Elo(区間 1,065~1,083)、5,536 件の比較で 97 件中 18 位。これらの区間は 1,079 から 1,083 の 4 ポイント幅で重なっている。順序は方向性を示すものであり、確立されたものではない。

• 両方のボードでサンプルサイズは近く — テキストから画像生成では5,286対5,334、編集では5,536対5,550 — したがって、信頼度の差は一方のモデルの投票が少なすぎることが原因ではない。

• ボード上のモデルの表示は異なっており、これは重要です。Qwen-Image-2.1 の行には Open Weights マーカーが付いていますが、Hy Image3.5 の行には付いていません。

正直に読むと、非対称だ。テキストから画像:Qwen-Image-2.1 が明らかに勝っている。編集:Hy Image3.5 がおそらく優位だが、その差は測定ノイズの範囲内だ。

非対称性はどこから来るのか

Hy Image3.5の編集能力は、Tencentがそれをどんな仕様で出したかを見れば驚きではない。プレビュー版は1リクエストにつき最大5枚の参照画像、同じモデルでのテキストから画像生成と画像から画像生成、そしてマルチターン編集を備えて公開され、ローンチ時には編集面が強調された。Qwen-Image-2.1は参照画像も扱う統合型の生成・編集スタックで構築されたが、そのボードの行を見ると、編集側はAlibaba自身のQwen-Image-3.0-Proより2 Elo低い結果で終えており、これはローンチ時の枠組みが示唆したよりも狭い結果だ。

テンセント自身の主張も、ボードが示している内容とは一致しない。ベンダーはこのプレビュー版について、Hy Image3.0 に対するブラインド評価でおよそ30%の勝率だと謳っている。その数字はテンセントの外部では誰も再現しておらず、独立系のボードもテキストからの画像生成ではそれを裏付けてはいない。そこでは、975の Hy Image3.5 preview は20 Elo下回っている——995のオープンウェイト版 HunyuanImage 3.0 Instruct と比べて。編集では同じ比較がベンダーに軍配を上げる。1,088の Hy Image3.5 preview は、1,066の HunyuanImage 3.0 Instruct を22 Elo上回っている。テンセント自身の後継モデルでありながら、一方のボードでは1世代分の前進、もう一方では一歩後退だ。

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

価格の軸では、両者は全く比較にならない

Hy Image3.5 preview は従量課金制の API です。Tencent Cloud は、中国本土エンドポイントでは 2K 画像 1 枚につき ¥0.15、国際エンドポイントでは US$0.024 を請求し、課金されるのは API が返した画像のみです。Artificial Analysis の価格列には、1,000 画像あたり $24.00 と記録されています。これは、このボードが使用する単位で同じ数値です。そして、text-to-image ボードの最上位行が同じ 1,000 枚の画像に対して示す $210.70 と比べると、価格の 9 分の 1 未満です。

Qwen-Image-2.1 には価格の行がない。エンドポイントが存在しないからだ。そのボードの両方の行には、明示的なNo API availableという注記が添えられている。このモデルは購入するものではない。ダウンロードするものであり、その対価は GPU 時間と、後述のライセンスの問題という形で支払うことになる。その行に付いた 5,286 票と 5,536 票は、自分で重みを動かしている人々によるものだ。この事実はまた、ランキングに残しておく価値のある注意点を与える。セルフホスト専用モデルの独立した Elo は、誰でも呼び出せるものの Elo とは異なる集団を測っているのだ。

これらのいずれかを製品に組み込む計画なら、実用的な線引きは今や明確で、それは価格が示唆するのと同じ線引きだ。編集スコアがより高いモデルはレンタルする側、テキストから画像へのスコアがより高いモデルは自分で動かす側になる。OrcaRouter はそのレンタル側だ — 200 以上のモデルを単一の API で扱い、プロバイダーの定価をゼロマークアップでそのまま通し、プロバイダー間の自動フェイルオーバー、および複数のモデルを 1 回の呼び出しに組み合わせるためのルーティング DSL を備える。当社は Hy Image3.5 preview や Qwen-Image-2.1 をルーティングしていない。プラットフォーム上の画像系ラインナップは、Google の Imagen の各ティアと Gemini の画像プレビュー、xAI の Grok Imagine 画像エンドポイント、OpenAI の GPT-Image ファミリーだ。この 2 つは、ベンチマークの 1 行だけを根拠にそのリストから第一候補になるものではない。まさにそれが、下記のライセンスの問いがそれを決める理由だ。

どちらのボードにも列がない軸

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1は、2026年9月20日付のQwen Research License Agreementに基づいてリリースされています。これは非商業的目的に限って権利を付与するものであり、商業利用にはベンダーからの別途ライセンスが必要です。Hugging Faceのリポジトリがライセンスをその他と報告しているのはそのためです — これはOSIライセンスではなく、そのように解釈されるべきものではありません。ボードの両方の行にあるOpen Weightsマーカーは正確であり、この点について何も示していません。

Hy Image3.5 previewにはライセンス可能な重みがない。Tencentはそれらを公開しておらず、このプレビューはTencent自身のプラットフォームから提供されていて、この世代のダウンロード可能なリリースは存在しない。得られるのは料金表、参照画像の上限、そして開始と停止ができるサービスだけだ。監査するものも、ホストするものも、交渉するものもない——そしてTencentが価格を変更したりプレビューを終了したりすれば、手元に残るものも何もない。

オープンウェイトの疑問に実際に決着をつける比較対象は、Qwenのモデルではなく、テンセント自身の前身モデルだ。HunyuanImage 3.0 Instructは両方のリーダーボードにオープンウェイトのマーカー付きで載っており、編集が1,066、テキストから画像が995。Qwen-Image-2.1はどちらでもそれを上回る。つまり、「自分のハードウェアで動かせるダウンロード可能な重み」が要件なら、この対決で最良の選択肢はどちらのボードでもアリババのもので、出力の販売を依然として禁じるライセンスの下にある。

この書類仕事がひとりでに片付くような都合のいい話はない。重みがなく従量課金の、より良い編集スコアを取るか、商用化できない重み付きの、より良いテキストto画像スコアを取るかだ。自分が許容できる制約を選び、それから自分のプロンプトで両方を実際に測れ——両者の編集スコア差は、重なり合う区間の内側で4ポイント幅しかなく、単一のホールドアウト・プロンプトセットで消えてしまう類の差だ。