記事「Qwen-Image 2.1 vs Qwen-Image 3.0」用に生成されたヒーローカード。2枚の角丸モデルカードが「Qwen-Image 2.1」と「Qwen-Image 3.0」と表示され、日付マーカーとして 20 Sep 2026 と 21 Jul 2026 があり、一方にはダウンロードアイコン、もう一方にはクラウドアイコンが付き、リボンには「数字が小さいほうが新しいモデル」と書かれている。
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0:小さい数字のほうが新しいモデル

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

まず、誰もがつまずくところから始めよう。Qwen-Image 2.1Qwen-Image 3.0よりも新しい。ベンダーは2026年7月21日にQwen-Image 3.0を出荷し、8月5日に一般提供を開始した。Qwen-Image 2.1を出荷したのは2026年9月20日——7週間後であり、マイナーバージョンが1つ低い。この番号は連番ではなく、同じ名前を共有する2つの異なる製品ラインであり、どちらについても最も役立つ事実はただ一つ、それらの上に構築できるかどうかを決める問いに対して正反対の立場を取っているという点だ。Qwen-Image 3.0はクローズドでホスト型であり、重みもライセンスも技術レポートもない。Qwen-Image 2.1はオープンウェイトで、今日ダウンロードでき、非商用利用のみを許可する研究ライセンスの下にある。

たまたま名前が同じ2つの製品

Qwen-Imageファミリーは、14か月の間にこれまでに3つの異なるライセンス方針を採っており、それらを並べて示すことで混乱の大部分は解消される:

Qwen-Image 1.0 と 2.0 — Hugging Face と ModelScope で Apache 2.0 のオープンウェイト、ローンチ当日にテクニカルレポート、セルフホスト可能、ファインチューニング可能、量子化可能。

Qwen-Image 3.0 — クローズド。ウェイト非公開、ライセンスの明示なし、モデルカードなし、技術レポートなし、公開されたベンチマーク表もなし。Pro版とStandard版があり、ホスト型APIを通じてのみ利用可能。

Qwen-Image 2.1 — 再びオープンウェイト化されたが、2026年9月20日付のQwen Research License Agreementに基づくもので、権利は「非営利目的のみ」に付与され、商用利用には別途交渉されたライセンスが必要となる。

それを年表ではなくパターンとして読めば、輪郭は明確だ。Alibabaはもはや「オープン」を二者択一として扱っていない。Qwen-Image 2.1は、1.0や2.0のような寛容なリリースでもなければ、3.0のようなクローズドなリリースでもない。それは第三の立場だ — 検査し、実行し、改変できる重みがあり、その前面には商用のゲートがボルト留めされている。

各モデルの正体

Qwen-Image 2.1 — 視覚生成コンポーネントに70億パラメータを持つ、統合されたテキストから画像への生成および画像編集モデルで、32層のシングルストリームDiTとして構築されています。Qwen3-VL 8Bテキストエンコーダーと、16×の空間圧縮を行う64チャンネルRGBA VAEが並置され、完全なダウンロードは約33 GBで、テキストエンコーダーがその半分以上を占めます。テキスト用のトークンレベル因果マスクと画像生成用のチャンクレベル双方向マスクを備えたブロック因果アテンション、さらにマルチ画像編集のためのプレフィックスKVキャッシュ再利用。ネイティブ2K、デフォルトでは40ステップで2048×2048、7つのアスペクト比プリセット。

Qwen-Image 3.0 — Pro版とStandard版からなるクローズドなホスト型モデルで、単一のAPIを通じて画像生成と編集を提供します。アリババの発表資料では、最大約4,500トークンのプロンプト、約10ピクセルまで判読可能なテキスト、20以上のフォントにわたる12言語のカバレッジ、最大2048×2048の出力、1回の呼び出しにつき最大6枚の画像をうたっています。パラメータ数は公表されていません。広く繰り返されている約20BのMMDiTという数値は、確認されたものではなく報じられたものです。

実務上最も重要なアーキテクチャ上の違いは、規模ではなく、モデルがどこで動くのか、そしてそれに対して何ができるかにある。Qwen-Image 2.1 は、中身を検査し、量子化し、自社データでファインチューニングし、自前のハードウェアで動かせるファイルとして登場する。SGLang 対応のプルリクエストは、重みが公開される3日前にマージされた。Qwen-Image 3.0 はエンドポイントとして登場する。量子化もファインチューニングもできず、Alibaba が動かしている場所以外で動かすこともできない。

エディティングこそ、両者が最も大きく乖離する点だ

両方のモデルは生成と編集を1つのシステムで行うため、興味深い比較は編集の詳細な部分にある——そしてここでは、より新しく小型なモデルのほうが、スペック上はより高性能だ。

参照画像 — Qwen-Image 2.1 は最大 10 個の入力参照を受け付けます。Qwen-Image 3.0 の Pro ドキュメントでは、1~3 枚の入力画像のサポートについて記載されています。

ローカル編集コントロール — Qwen-Image 2.1は円、ペイント注釈、および独自の入力として提供される別個のマスクをサポートしており、元の画像はマークされないまま保たれます。Qwen-Image 3.0の文書化された編集パスは、ローカルな書き換え、コンテンツ拡張、スタイル転送、マルチカメラアングル生成をカバーしていますが、マスクベースのワークフローは公開されていません。

透過性 — Qwen-Image 2.1 は RGBA 画像をネイティブに生成・編集し、透明レイヤー内のテキストを編集し、RGB 写真から被写体を透明レイヤーへ抽出します。Qwen-Image 3.0 の発表には透過性に関する記載がありません。

プロンプトリライティング — Qwen-Image 2.1 には専用のリライト用チェックポイントが2つ搭載されており、どちらもファインチューニングされた Qwen3.5-VL 9B モデルで、一方はテキストから画像生成用、もう一方は編集用です。リライティングのコードとシステムプロンプトも公開されています。Qwen-Image 3.0 のプロンプト処理は、API の背後に隠されたブラックボックスです。

エコシステム — Qwen-Image 2.1 は Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V で初日からサポートされ、さらに AMD ROCm と FlagOS のパスも用意されています。Qwen-Image 3.0 には API があります。

その最後の一行は、修辞的な誇張ではない。パイプラインがComfyUI上で動いているチーム、あるいは推論スタックがvLLMであるチームにとって、マージ済みのパイプラインクラスを持つモデルとHTTPエンドポイントを持つモデルの違いは、統合タスクと書き直しの違いにほかならない。

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

価格、そして価格が捉えられないもの

Qwen-Image 3.0 は両者の中で唯一、公表価格がある。ベンダーのクラウドでは、Pro は画像1枚あたり約 $0.04、Standard は約 $0.03 と記載されており、国内のコンシューマー向け価格は ¥0.18 付近から始まる。これらは発表時の数字であり、独立した監査は受けていない。Qwen-Image 2.1 には公表されたホスト型料金がまったくない。ダウンロード形式であり、コストは自分の GPU 時間にかかる費用次第だ。

その2つの数字は比較対象にならない。そうでないかのように装うのが、この対決で最もよくある誤りだ。画像1枚あたりの価格には、モデル、提供インフラ、スケーリング、そして他社の稼働率まで含まれている。重みのダウンロードには、そのどれも含まれていない。問うべきはどちらの数字が小さいかではなく、33 GBのモデルスタックを運用する能力があなたにあるかどうか、そして安い側のライセンスが、あなたが使おうとしている用途を許しているかどうかだ。

これにより、ライセンスが本来あるべき場所である比較の中心に戻ってきます。Qwen-Image 3.0 の規約は公開されていないため、規制の厳しい業種や代理店の業務にとってはそれ自体が問題です — 引用できる文書が存在しないのです。Qwen-Image 2.1 の規約は公開されており、非商用と明記されています。不明瞭なライセンスと明確に制限的なライセンスのどちらかであれば、明確に制限的なほうが計画を立てやすいのです。少なくとも、どんな会話をすべきかが分かるからです。

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

どちらを選ぶべきか

テキスト主体の制作画像が必要で、その実行を他に任せたいなら — Qwen-Image 3.0が適しています。ただし、その目玉であるテキストレンダリングの数値はベンダーによる主張であり、存在する独立系のテストでは、小さいフォントのテキストが一部のケースで依然として文字化けすることが報告されている点には留意が必要です。

モデルを自分で実行したい、ファインチューニングしたい、あるいはデータを自前のハードウェア上に保持したい場合 — 2つのうち唯一の選択肢が Qwen-Image 2.1 であり、その代償として研究ライセンスが必要となる。

透明なアセット、製品の切り抜き、または3枚を超える参照画像が必要な場合 — 公開されている仕様を見る限り、Qwen-Image 2.1 のほうが強力なツールであり、参照画像の数では大差がついています。

商用利用の権利と寛容なライセンスが必要です — そのどちらもあなたのモデルには当てはまりません。Qwen-Image 3.0 は利用規約が一切公開されておらず、Qwen-Image 2.1 は商業ライセンスの個別交渉が必要です。このファミリーで Apache-2.0 としてリリースされているのは、より旧世代の Qwen-Image 1.0 と 2.0 です。

あの最後の行こそ、じっくり考える価値がある。それは縮小しつつある集合を表しているからだ。すでに付与されたライセンスは遡って変わるものではないため、Apache-2.0 の Qwen-Image リリースは当初の条件のまま使い続けられる。しかし、最新の Qwen-Image が寛容なライセンスで提供されるという前提で商用画像パイプラインを計画しているなら、直近3件のリリースはその前提に反する証拠となる。

どちらか一方を、それにパイプラインを賭けずに実行する

これらのモデルはどちらも、理由は異なりますが、今日そのまま本番経路に置くには扱いにくいものです。一方はライセンスのため、もう一方はブラックボックスでありパラメータ数が非公開であるためです。まさにそうした状況のためにルーティングレイヤーは存在します。OrcaRouterは200以上のモデルを、プロバイダーの定価でマークアップなしの単一のOpenAI互換エンドポイントの背後に配置し、プロバイダー間の自動フェイルオーバーと、複数のモデルを1回の呼び出しに組み合わせられるルーティングDSLを備えています。そのため、新しいモデルや扱いにくいモデルは、実績のあるモデルの前に置くのではなく、その隣に並べることができます。モデルフュージョンはこの考え方をさらに推し進め、複数のモデルをパネルとして同時に実行し、発表時のグラフではなく自分のプロンプトで比較できるようにします。

Qwen-Image 2.1 も Qwen-Image 3.0 も、当社が現在ルーティングしているモデルには含まれておらず、本記事もそう主張するものではありません。当社が実際にルーティングしている画像モデル — OpenAIGPT-Image シリーズ、Google の Imagen 4 の各ティアと Gemini の画像プレビュー、そして xAI の Grok Imagine 画像エンドポイント — こそが、Qwen の両モデルをご自身の判断で評価する間、フェイルオーバー経路を実際に構築する際の土台となるものです。

注目すべき点は、見た目よりも狭い。アリババは今や、同じ四半期に同じファミリー内で、オープンウェイト、クローズドのホスト型モデル、研究ライセンスのダウンロードを提供することを示した。次のリリースでは、どのパターンが勝ったかはわからない。ライセンスファイルが教えてくれる。

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.