Ming-Image-0.1-Design と Qwen-Image 2.1 の比較用タイトルカード。ライセンスとハードウェア費用が選択を決めるというサブタイトル付きで、一方のカードには「より柔軟なライセンス」、もう一方には「より制限の厳しいライセンス」と表示される。
Guides & Insights

Ming-Image-0.1-Design 対 Qwen-Image 2.1:本当の違いはライセンスにある

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月、わずか3日違いで登場した2つのオープン画像モデルは、スペック表を眺める限りでは同じ買い物に見える。Ming-Image-0.1-Designは、Ant GroupのinclusionAIチームが開発し、9月17日にMITライセンスの下でHugging Faceに重みを公開した。Qwen-Image 2.1は、AlibabaQwenチームによるもので、9月20日にQwen Research License Agreementの下で続いた。どちらもネイティブRGBAを出力し、どちらも2K出力をうたい、どちらも同じ買い手を狙っている。すなわち、自らホストし、検査し、改変できる画像生成を求めるチームだ。両者を実際に隔てている2つの点は、スペック表が最も苦手とする2つ——生成物に対して法的に何が許されるか、そして1枚生み出すのにどれだけのシリコンを要するか——である。

それは単なる修辞的なフレーミングではない。これらのモデルの一方では、ライセンスが商用利用を完全に阻む壁となるが、もう一方ではまったく問題にならない。そして、各ベンダーが箱に印刷しているパラメータ数は、実際のダウンロード量を3~4分の1に過小評価している。この2つの事実が、どんなベンチマークよりもずっと早く購入を左右する——そして、ベンチマークのほうはというと、まったく比較できないのだ。

各リポジトリに実際に含まれている内容

どちらのモデルも単一のネットワークではない。どちらもパイプラインであり、規模はそのパイプラインにこそ宿っている:

• ジェネレーター — Ming-Image-0.1-Designは6.15Bパラメータのデザイントランスフォーマーを搭載(BF16で12.31 GB)。Qwen-Image 2.1は、32層、ブロック因果アテンション、および非公開のアクティブパラメータ数(約14.2 GB)を備えた7.1BのシングルストリームDiTを搭載。

• テキスト側 — Ming-Image-0.1-Design は、トランスフォーマーを 17.01B のマルチモーダル LLM(34.02 GB)と 3.09B のコネクタ(6.17 GB)と組み合わせています。Qwen-Image 2.1 は Qwen3-VL 8B のテキストエンコーダー(約17.5 GB)を使用しています。

• 総パラメータ数 — Ming-Image-0.1-Design が 26.44B であるのに対し、Qwen-Image 2.1 はおよそ15~16B。どちらのベンダーの見出しの数字も合計値ではないことに注意:「6B」と「7B」はいずれもジェネレーターのみを指す。

• リポジトリサイズ — Ming-Image-0.1-Design は 52.88 GB(うち 49.25 GiB が重み)。Qwen-Image 2.1 はおよそ 33 GB。

• 透明性 — どちらも事後的なマッティング工程を経由するのではなく、モデルから直接ネイティブRGBAを出力します。Ming-Image-0.1-Designは独自のRGBA VAEを使用し、Qwen-Image 2.1は16×の空間圧縮を備えた64チャンネルRGBA VAEを使用します。

• デフォルト生成 — Ming-Image-0.1-Design は 2048×2048、12 ステップ、BF16、CFG 1.0 で検証済み。Qwen-Image 2.1 はデフォルトで 2048×2048、40 ステップ、7 つのアスペクト比プリセットを使用します。

• ライセンス — Ming-Image-0.1-Design には MIT。Qwen-Image 2.1 には Qwen Research License Agreement(非商用)。

「6B」というラベルはかなりの働きをしている

Ant Groupのリポジトリは60億パラメータモデルをタイトルに掲げており、トランスフォーマーは実際に6.15Bです。しかし、ダウンロードする重みは49.25 GiB、リポジトリは52.88 GBで、ベンダーが検証した構成 — フルテキストスタックを常駐させた状態でのBF16による2048×2048 — は1台の80 GiB CUDA GPU向けに指定されています。これは48 GBカードでの丸め誤差ではありません。使えないカードなのです。48 GBアクセラレータではこのパイプラインを保持できず、ベンダーが文書化していないオフロードの小細工なしでは2台でも保持できません。

Qwen-Image 2.1 はより扱いやすいダウンロードですが、ただしアリババは公式のVRAM数値を一切公表していないという但し書きが付きます公式のVRAM数値は一切公表されていません。モデルカードに示されている唯一の指針は、小容量のカードではCPUオフロードを有効にするというものです。リリース以降に計測されたもののほうが、公表されたものよりも有用です。int8パイプラインは合計で約16 GiBで動作し、24 GBのカードに完全に常駐できます。一方、フルBF16実行は、CPUオフロード併用で約17 GBから、テキストエンコーダの配置によっては1024×1024でピーク約40 GiBまでと報告されています。報告されている単一画像あたりのレイテンシは、B200で数秒から、現行のワークステーション向けカードで10秒未満の範囲です。これらの数値はすべて、仕様ではなくコミュニティによる計測値として扱ってください — オフロード戦略による変動は、モデル同士の差異よりも大きいのです。

実用的なまとめ:Qwen-Image 2.1は、オフロードをいとわなければ3090クラスのモデルであり、Ming-Image-0.1-Designは、より小さな構成が存在しないデータセンタークラスのモデルだ。

ライセンスは分かれ道だ

これは実際にプロジェクトを止めることになる部分であり、2つのリリースが最も扱いを異にする部分でもある。

Ming-Image-0.1-DesignはMITライセンスです。有償製品に組み込んで出荷する、ファインチューニングする、重みを再配布する、変更を非公開のままにする——そのどれもAnt Groupと話をする必要はありません。

Qwen-Image 2.1はそうではない。同モデルには2026年9月20日付のQwenリサーチライセンス契約が適用され、重みのライセンスは研究および評価目的に限定されている。商用利用にはAlibabaとの別途契約が必要であり、その契約の価格は公表されていない。派生版および再配布には、本ライセンス、「Built with Qwen」または「Improved using Qwen」の表示、ならびにHangzhou Tongyi Laboratoryの著作権表示を添付する必要があり、「Qwen」を派生モデルの主要な名称とすることはできない。本ライセンスは中国法に準拠し、管轄は杭州とする。

ベンダー自身のフォローアップには、真に明確化する点が一つある。Alibabaは、生成された画像はライセンス対象の「Materials」には含まれないと述べている。したがって、モデルが生成するものについての権利はあなたに残る。制限は重みとモデルに付随するのであって、あなたの出力には付随しない。これは意味のある除外規定であり、正確に読む価値がある。というのも、安易な要約——「画像はあなたのもの、モデルはそうではない」——は正しいからだ。

それは方向転換でもある。以前のQwen-Imageリリース、オリジナルのQwen-Imageや2511、2512ビルドを含むものは、Apache 2.0のままで商用利用が許されている。昨年そのライセンスのためにQwen-Imageを選び、今月2.1にアップグレードしたチームは、同意したことのない研究専用の制限を引き継ぐことになる。寛容な条件が要件なら、Qwen-Image 2.1はあなたが持っていたものの新しいバージョンではない — それは別の契約である。

それぞれが何をするために作られているのか

ライセンスの分岐は意図の違いを映し出しており、どちらも法的に選べる選択肢であるなら、選択を導くべきなのはその違いのほうだ。

Ming-Image-0.1-Design はデザインツールです。テキストスタックは、短いブリーフを 8K の構造化プロンプトに展開するために存在し、ベンダーはそれを取り巻く「スキル」を提供しています — 約 15 秒でビジュアルドラフトを生成する Design Skill と、スライド形状の出力を狙った PPT Skill です。そのコンパニオンリポジトリである Ming-Image-0.1-Design-Layer は、フラット化されたデザインを受け取り、それを個別のレイヤーとして返します。これは、ここでオープンな領域の他の何も提供していない唯一の機能です。inclusionAI によると、Layer モデルは同じ作業で 20B のオープンレイヤーモデルより約 4.3 倍高速に動作します(183 秒対 795 秒)— ベンダー報告であり、再現されておらず、比較対象は確認できるほど正確には名指しされていません。

Qwen-Image 2.1 は生成器兼エディターです。1 つのチェックポイントでテキストから画像への生成と指示ベースの編集の両方を行い、1 回の編集につき最大 10 枚の参照画像を受け付け、フレームの残りの部分には手を加えないローカル編集をサポートします。ComfyUI、Diffusers、vLLM-Omni、SGLang-Diffusion、LightX2V で day-zero サポートとともに登場しました — これは Ming-Image-0.1-Design がまだ持っていないサービングの話で、同モデル自身のサービングガイドが vLLM-Omni を指しているからです。

それはランキングではなく分岐として読んでください。仕事が「ブリーフからレイヤー化された編集可能なデザイン素材を制作すること」なら、Ming-Image-0.1-Design は二者のうちそれを実現する唯一のものです。仕事が「参照に基づいて生成し、その後反復的に編集すること」なら、Qwen-Image 2.1 は単一モデルでそれを実現し、Ming-Image-0.1-Design はそれをまったく行いません。

ベンチマークは比較にならない、そしてそれが正直な答えだ

両ベンダーとも数値を公表している。どちらの数値も、もう一方と並べて扱うことはできない。そうしている記事は結果をでっち上げているにすぎない。

Ming-Image-0.1-Designの根拠はArtificial Analysisのランキングです。UI/UX Design向けにオープンウェイトで絞り込んだText-to-Image Leaderboardで、Elo 1,082により首位に立ち、Ideogram 4.0 Qualityの1,052、Ideogram 4.0の1,015、HunyuanImage 3.0 Instructの1,005、FLUX.2 [dev]の1,000を上回っています。ベンダーはまた、レイアウトで67.4%、複雑な構図で67.0%、テキスト描画で66.7%の勝率、およびCrelloで12の指標すべてで首位を報告しています。このリーダーボードは第三者による測定ツールであるため、ここではEloのほうが2種類の根拠のうちより強いものです。勝率とCrelloでの席巻はベンダー報告であり、主張として読むべきです。

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Qwen-Image 2.1の根拠は、Qwenチームが構築したベンチマークであるQwen-Image-Benchであり、そこで60.28を記録し、59.82のNano Banana 2.0と59.65のGPT Image 1.5を抑えてオープンソース分野をリードしている。資料はこのベンチマークがQwen製であることを指摘しており、上位3者は1ポイント以内に収まっている——作者が同時に競争相手でもあるベンチマークのノイズの範囲内に十分収まる差である。

つまり、UI/UXデザインのサブセットにおける第三者によるElo評価と、ベンダーが構築した総合スコアを比べている。測定ツールも、タスクも、評価者も異なる。この2つのモデルを直接対決させた実行結果を公開した者はおらず、利用可能な証拠からすれば、誰にもできない。有用な読み取り方は限定的で、はっきり述べておく価値がある — Ming-Image-0.1-Designには特にデザイン作業について第三者による裏付けがあり、Qwen-Image 2.1には一般的な生成と編集についてベンダー報告の強みがあり、これら2つの主張の重なりは、見出しの数字が示唆するよりも小さい。

どちらか一方をエンドポイントに導入すること

どちらのモデルも、今日はOrcaRouterのカタログには載っていません。Ming-Image-0.1-DesignとQwen-Image 2.1はどちらも現時点ではセルフホスト前提の選択肢です。重みはダウンロード可能で、サービングガイドも実際に存在しますが、GPUは自分で立ち上げる必要があり、Mingの場合はそのGPUが80 GiBのものです。ここではこれらをルートとしてではなく、オープンウェイトのリリースとして掲載しています。

ハードウェアを導入する前に知っておく価値があるのは、同じワークロードを呼び出しとして実行するといくらかかるかということです。当社のルーティング対応画像モデルには以下が含まれます: google/gemini-2.5-flash-imagegoogle/gemini-3-pro-image-previewgoogle/gemini-3.1-flash-image-preview、Imagen 4.0の3つのティア(fast、standard、ultra)、grok/grok-imagine-image、そしてGPT-Imageファミリー — openai/gpt-image-1、openai/gpt-image-1-mini、openai/gpt-image-1.5、openai/gpt-image-2。これらのいずれかに対して1週間デザインブリーフを回してみれば、Ming-Image-0.1-Designのレイヤー出力が本当に必要な機能なのかどうかを、80 GiBカードの何分の一かのコストで判断できます。しかもそれは、ライセンスとVRAMのどちらが障害になるのかを知る前に分かります。セルフホストモデルを本番経路に移すとき、その同じエンドポイントがルーティングの拠点になります — 200以上のモデルを1つのキーで、プロバイダー間の自動フェイルオーバー、そして0%のマークアップ。だからベンダーが値下げを発表すれば、その当日に当社側でも反映されます。

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

誰がどれを選ぶべきか

選ぶならMing-Image-0.1-Design。成果物が画像ではなくデザイン素材である場合です。レイヤー化された出力、構造化されたプロンプト拡張、スライドの形での生成、そしてそれで作ったものを何でも販売できるライセンスを備えています。本格的なカード(GPU)に予算を割き、それを取り巻くサービングエコシステムがQwen側よりも薄いことは受け入れてください。顧客の前に数字を出す必要があるなら、2つのうちでより役立つのもこちらです。その最も強力な根拠が、この比較において唯一の第三者による数字だからです。

選ぶべきはQwen-Image 2.1、ワークフローが生成してから編集するものである場合、参照画像による条件付けが必要な場合、またはすでに所有しているハードウェアで実行したい場合です。これはより小型で、初日からより快適に使え、そのライセンスは、多くの人が実際に最初に行う研究・評価作業には十分適しています。出力が商用で、法務レビューが現実のものになった瞬間、これは間違った選択になります。なぜなら、商用ライセンスへの唯一の道はAlibabaとの直接契約であり、計画を立てる基準となる公表価格が存在しないからです。

どちらも選ぶべきではない——少なくとも、今月、本番環境での画像生成が必要だというのなら。これらはどちらも重みであり、重みは能力になる前に、ハードウェアと法務上のコミットメントである。設計上の問い——レイヤード出力は自分のチームが出荷できるものを変えるか——には、まずホスト型エンドポイント上で答えを出せる。そしてその答えこそが、80 GiBのカードを買うかどうかを決めるべきものだ。

何を見るべきか

この比較を左右するのは三つの点だ。Ming-Image-0.1-Design が、自前の vLLM-Omni ガイド以外のサービング経路を獲得できるかどうか。というのも、現在それが、同モデルと Qwen-Image 2.1 の5フレームワーク day-zero リストとの間の差になっているからだ。Alibaba が商用 Qwen ライセンスに価格を付けるかどうか。というのも、価格が付いていないことは、この組み合わせにおける最大の未知数だからだ。そして、誰か — ラボ、独立評価者、失うもののないベンダー — が、同じプロンプトでこの2つを直接ぶつけるかどうか。それが実現するまで、公平な比較に最も近いものは、スコアではまったくない。それはライセンスの行であり、Ming-Image-0.1-Design がその項目で完全に勝っている。

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.