Qwen-Image 2.1(研究ライセンスのもとでダウンロード可能なオープンウェイト)と、Meta Muse Image(Meta 独自の API を通じて画像1枚あたり一律1セントで利用できるエージェント型モデル)の比較用ヒーローカード
Guides & Insights

Qwen-Image 2.1 vs Meta Muse Image:呼び出せるモデル vs 手元に置けるモデル

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較には画質をめぐる版もあり、それはまだ書けない——正直に書くことはできない。Qwen-Image 2.1はQwen-Imageチームが2026年9月20日に公開したものだが、いかなる種類の独立したスコアも持っていない。Meta Muse ImageはMeta Superintelligence Labsが2026年7月7日にMeta初の自社開発画像モデルとして発表したもので、測定済みだ——Artificial Analysisの画像編集リーダーボードでElo約1,105の3位、テキストからの画像生成ではトップ5入り、そして1,000枚あたり10ドルで品質対価格のパレートフロンティア上にある。しかし、この2つについてより有用な問いは、どちらが優れているかではない。それぞれで何が許されるのか、であり、その答えはほぼ完全に反転している。

アクセスと検査可能性は別物であり、その両方を提供しているところはない

Meta Muse Image は、呼び出せるモデルです。2026年8月以降、Meta 自身の Model API を通じて、OpenAI 互換エンドポイント経由で、画像1枚あたり一律 $0.01 — 千枚でおよそ $10 — で利用できるようになりました。これは、7月のローンチ時にこのモデルがどう説明されていたか — 開発者向けの経路がまったくなかった — からの実質的な変化です。この定額制は、ほぼ他のすべてがトークン単位で課金されるカテゴリでは異例であり、コスト予測をきわめて容易にします。千枚なら10ドルで、それが単純な画像でも精巧な画像でも変わりません。

Qwen-Image 2.1 は、あなたが手元に置いておけるものです。これは重みのダウンロード — 拡散トランスフォーマー、テキストエンコーダー、VAE を合わせて約 33 GB — として、2026年9月20日付の Qwen Research License Agreement に基づいて公開されており、同契約は「FOR NON-COMMERCIAL PURPOSES ONLY」の権利を付与し、商用利用には別途ライセンスを必要とします。ホスト型エンドポイントはありません。定額制もありません。隠されているものも何もありません。アーキテクチャを読み、プロンプトを書き換えるシステムプロンプトを読み、差分を確認し、上書きし、そのすべてを自分のハードウェアで実行できます。

つまり、このトレードオフは品質対品質ではない。従量制で計測され、商用ライセンスされた、自分たちが所有していないモデルと、無料で計測されず、非商用で、完全に自分たちが所有するモデルとの比較なのだ。そのどちらか一方を、何かを犠牲にすることなく選べるチームはごくわずかだ。

なぜMuseは通常の意味での拡散モデルとは少し違うのか

Meta Muse Image が異例なのは、単に生成するだけではない点だ。ループを実行する。ウェブを検索し、コードを書いて実行し、画像を返す前に自身の出力をレビューできる。これは Meta 自身の説明であり、このモデルが単に競争力があるだけでなく興味深い理由でもある — エージェント的ステップこそが、プロンプトの曖昧さが解消される場所であり、「今年の数字のグラフを作って」のようなリクエストが近似ではなく答えられる場所だからだ。

それはまた、その挙動について推論するのがより難しい理由でもある。従来の画像モデルは、プロンプトからピクセルへの関数だ。エージェント型のモデルには軌跡があり、その軌跡はモデルカードから読み取れるようなものではない。ベンダーが報告する数値——複数画像にわたるキャラクターの一貫性94%、参照画像は最大10枚、長辺最大1600ピクセルの出力——は、外枠を示しているのであって、ループを示しているのではない。

Qwen-Image 2.1は、同じ曖昧さの問題を逆の方法で解決している。明示的に、そしてオープンに。画像モデルとともに、このリリースには2つのプロンプト書き換えチェックポイントが同梱されている——Qwen/Qwen-Image-2.1-PE-T2IQwen/Qwen-Image-2.1-PE-I2Iで、それぞれ約18.8GBのファインチューニング済みQwen3.5-VL 9Bであり、曖昧な指示を受け取って、拡散モデルがそれを見る前に正確な指示へと書き換える。I2I版は常に入力画像を持つため、常に編集タスクである。そして決定的に重要なのは、書き換え器の挙動が次のファイルで規定されていることだ——system_prompt.txt。これはリポジトリに同梱されており、つまり、あなたのプロンプトが何を意味するかを決めるステップは、読んで変更できるものなのである。

MetaのエージェントループとAlibabaのプロンプトリライターは、どちらも「モデルはあなたの意図を理解していない」という問題への答えだ。一方はあなたに代わって決定を下すサービス。もう一方はあなたが編集できるファイルだ。

片方だけに数字がある場合、その数字がどのように見えるか

Meta Muse ImageはArtificial Analysisの両方の画像ボードに掲載されている。画像編集では約Elo 1,105で3位、1,122のMAI-Image-2.6と1,117のGPT Image 2 (high)に次いでおり、テキストからの画像生成では約Elo 1,116でトップ5圏内に入っている。1,000枚あたり10ドルで、品質対価格のパレートフロンティア上に位置する。これは有用な立ち位置だ。ボード上で最高のモデルではないが、より多く支払えば測定可能な形でより多くを得られる数少ないモデルの一つである。

Qwen-Image 2.1 にはそうしたものは何もない。あるのは、サードパーティが誰も再現していない Qwen-Image-Bench のチャートを載せたベンダーのブログ投稿と、たった1件のハンズオンレポートだ——Qwen Ambassador プログラムのアーリーアクセステスターが、最終ウェイトを ModelScope Studio のインターフェースで実行し、テキストから画像生成でおよそ10~15秒、編集で18~23秒かかったと報告し、複数参照の一貫性は入力画像が3枚くらいから低下した。レビュアーは1人、タイマーなし、プロンプトセットなし。これは有用なシグナルであり、ベンチマークではない。そして正直に扱うなら、モデルがどこに着地する可能性があるかについてのヒントとして受け止めるべきであり、現在どこにあるかの証拠として扱うべきではない。

Qwen-Image 2.1 が具体的に優れているのは品質ではなく、ピクセルレベルでの機能です。デフォルトで 2048×2048 のネイティブ 2K 出力、40 推論ステップ、7 つのアスペクト比プリセット、最大 10 枚の参照画像、円やペイントによる注釈、または別途マスクを使ったローカル編集、そして RGBA 生成による透明レイヤーの編集と RGB 写真からの被写体抽出が可能です。Meta のモデルは 1600 ピクセルが上限で、透明性に関する説明は公開されていません。本物のアルファチャンネルがすぐに必要なら、それはあなたのために決められた選択です。

Two-column scoreboard for Qwen-Image 2.1 and Meta Muse Image: Qwen-Image 2.1 rows read Access open weights download, self-host / Licence research-only, non-commercial / Editing score none / Output 2048x2048 native with RGBA / Prompt handling inspectable rewrite checkpoint / Price your own GPU time; Meta Muse Image rows read Access Meta Model API, OpenAI-compatible / Licence commercial, via Meta / Editing score AA #3, Elo about 1,105 / Output up to 1600px / Prompt handling agentic loop, searches and self-reviews / Price flat $0.01 per image; footer reads 'Meta figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

定額制こそが、よく考える価値のある部分だ

画像1枚あたり定額1セントというのは技術的な決定ではなく価格設定上の決定であり、モデルの用途そのものを変える。トークン課金による画像価格は複雑さに罰を与える。複数の参照画像を伴う長い指示は短いものより高くつく。つまり、画像のコストがその難しさと結びついてしまうのだ。定額制になればその結びつきは消え、合理的な行動もそれに伴って変わる——プロンプトを長さで最適化するのはやめ、モデルが本来想定された使われ方、すなわちエージェントループと参照画像がそれぞれの役割を果たす形で使うようになる。

これはまた、自社モデルを提供している企業だけが提示できる種類の価格設定でもあり、プロバイダーを選ぶ際には指摘しておく価値があります。OrcaRouter は 200 以上のモデルを、OpenAI 互換の単一エンドポイントの背後で、プロバイダー定価・マークアップなしで提供し、プロバイダー間の自動フェイルオーバーと、複数のモデルを 1 回の呼び出しに組み合わせるルーティング DSL を備えています。ここで重要な性質はパススルーです。当社はマークアップした価格ではなくプロバイダーの定価を請求するため、ベンダーの価格変更 — 定額料金の登場やトークン料金の引き下げなど — は、契約を待つことなく、当社側では当日に反映されます。Meta Muse Image も Qwen-Image 2.1 も、現在当社がルーティングするモデルには含まれておらず、本記事はそうであるかのように示唆するものではありません。当社が実際に提供している画像モデルは、OpenAI の GPT-Image ファミリー、Google の Imagen 4 の各ティアと Gemini の画像プレビュー、そして xAI の Grok Imagine 画像エンドポイントです。

この比較で本当に重要な対照は、この2つのモデルのうち片方にはそもそも価格が存在するという点だ。Meta Muse Image は1枚あたり0.01ドル。価格は公開されていて、今日の午後にも呼び出せるAPIで使える。Qwen-Image 2.1 の代償は、33GBのダウンロード、すでに手元にあるGPU、そして非商用限定と記されたライセンスの法務レビューだ。

彼らが偶然に収束する場所

両モデルは最大10枚の参照画像を受け付けます。それは偶然というより、業界が一つの答えに落ち着いたことの表れです。10枚あればキャラクターシート、商品セット、スタイル参照パックには十分で、それを超えると条件付けは助けにならなくなり、むしろ妨げ始めます。Metaは自社モデルについて、マルチ画像キャラクター一貫性94%という数値を公表しています。Alibabaは同等のものを公表しておらず、唯一の独立した実地レポートは、3枚目の参照画像あたりから一貫性が低下し始めることを示唆しています。同じ上限を主張しながら、その裏付けとなる証拠がまったく異なる2つのモデル——これこそがこの比較全体を縮図にしたものです。

両者は、どちらも解決していない問題でも一致している。どちらも両方を与えてはくれない。Meta Muse Image はダウンロードも検査も自分のハードウェア上での実行もできず、そのエージェントループは構造上ブラックボックスだ。Qwen-Image 2.1 は販売も呼び出しもできず、まだ何かと比較して評価することもできない。制約が締め切りなら、今日使えるのはどちらか一方だ。制約がコンプライアンスレビュー、あるいはパイプラインが正確に何をしているかを理解する必要性なら、もう一方が使える。

Screenshot of the Artificial Analysis image-editing leaderboard captured September 9 2026, showing Meta Muse Image ranked third at Elo 1,105 behind MAI-Image-2.6 and GPT Image 2 (high), listed at $10.0 per 1,000 images on the quality-versus-price Pareto frontier, with no Qwen-Image 2.1 entry on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

次に何をすべきかで選べ、どちらが優れているかで選ぶな。

今四半期に、測定可能なモデルを背後に備えた商用ライセンスの下で画像生成を出荷する必要があるなら、Meta Muse Imageが答えであり、画像1枚あたり0.01ドルは予算に組み込める数字です。画像モデルを端から端まで理解する必要があるなら——アテンションマスキング、プロンプトリライター、VAE、ライセンス——Qwen-Image 2.1は二つのうち、それを可能にする唯一のものであり、研究ライセンスのせいで、他の用途にはほとんど使えません。どちらの選択も品質を妥協するものではありません。なぜなら、品質に関する疑問は一方ではまだ決着していないからです。十分な数の人々がQwen-Image 2.1を公開で実行し、それをボードに載せれば、その問いは閉じます。そして、アーリーアクセスのテスターたちは9月29日までに公開するよう求められました。その日が、この比較が本当のものになる日です。