ヒーローカードには「Qwen-Image-2.1 vs Grok Imagine Image 2.0」と表示され、サブタイトルは「無料のウェイト vs 有料環境」、さらに3つの行があります。Qwen-Image-2.1は画像1枚あたりゼロコストで非商用、Grok Imagine Image 2.0は画像1枚あたり約$0.02~$0.06、編集マスクとネイティブアルファ vs 参照画像。ファイルと価格タグのアイコンの横に配置されています。
Guides & Insights

Qwen-Image-2.1 対 Grok Imagine Image 2.0:無償の重み 対 有料環境

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

一方は1枚あたりのコストがゼロで、生成物の販売を禁じるライセンスが付いてくる。もう一方は購入先にもよるが1枚あたり2~6セントかかり、そうした制限はなく、実際に確認できるランキングにも載っている。Qwen-Image-2.1は2026年9月20日、研究用ライセンスの下でオープンウェイトとして公開された。Grok Imagine Image 2.0はベンダーの有料画像エンドポイントであり、自社APIと多数のサードパーティプロバイダーを通じて提供されている。両者の選択は品質の問題ではない。モデルそのものを所有したいのか、それを取り巻く環境を借りたいのかという問題であり、その環境は価格だけから想像する以上に多くの役割を担っている。

写真がそれぞれの側でいくらかかるか

Qwen-Image-2.1の価格は画像1枚あたりゼロで、初回だけ非ゼロです。約33 GBをダウンロードします — 約14 GBの7B・32層シングルストリーム拡散トランスフォーマーに加え、残りの大部分を占めるQwen3-VL 8Bテキストエンコーダー — その後は、画像1枚あたりの限界費用はそれを動かす電気代だけです。制約のあるカードでは、モデルカードはpipe.enable_model_cpu_offload()によるCPUオフロードを推奨しています。これは標準的な回避策であり、金銭ではなく速度を犠牲にします。

Grok Imagine Image 2.0の価格は逆の形だ。xAI自身のドキュメントでは、フラッグシップは出力画像1枚あたり$0.04、ベースのGrok Imagine画像エンドポイントは$0.02、品質ティアは$0.05と記載されている。サードパーティのプロバイダーも、独自の階層化を伴いながら同様の価格帯に収まっている — あるプロバイダーは、解像度や品質設定に関係なく、テキストから画像生成に$0.05、編集に$0.06の定額料金を記載し、別のプロバイダーは、品質ティアについて1Kと2Kの両方で$0.045の定額を提示し、3社目は最大5枚の入力画像を使うテキストから画像生成または参照編集で$0.025を宣伝している。市場全体では、画像1枚あたりおよそ$0.02から$0.06に落ち着き、コンシューマー向けのアクセスは画像ごとの課金ではなくX PremiumとSuperGrokにバンドルされている。

コストモデル — Qwen-Image-2.1 は固定のハードウェア費用とダウンロード費用で、1枚あたりの限界費用はゼロです。一方 Grok Imagine Image 2.0 は純粋に限界費用型で、ボリュームに比例して永遠に線形に増加します。
損益分岐点 — このクロスオーバーは計算できるボリュームの問題であり、プロバイダーが料金を変更するたびに動きます。月に数千枚程度なら、ホスト型は GPU を買うより明らかに安上がりです。高いボリュームが継続する場合は、ローカル型がコストで勝ち、それ以外のあらゆる軸で負けます。
ローカル側では買えないもの — レート制限、稼働率、そして他社の運用チームです。ホスト型側で買えないものは、重みです。

リーダーボードが語ること、そして語らないこと

Grok Imagine Image 2.0には、公開ランキングに関する主張があります。xAIの発表資料は、2026年8月7日時点で、Text-to-ImageとImage Edit Arenaの両ボードにおいて総合2位に位置し、GPT Image 2の後塵を拝しているとしていました。これはベンダーが引用した、日時が記録されたスナップショットであり、そのように読むべきものです。その後数週間の第三者トラッカーは、画像編集で2位前後、テキストから画像生成で3位とし、これもGPT Image 2の後塵を拝する形で、Elo値は1,300台前半、一部の追跡サイトでは1,173~1,175に近い値を報告していました。これらの数値のばらつき自体が教訓です。このカテゴリーのリーダーボードの順位は週ごとに動き、日付が添えられていない順位は情報ではありません。

Qwen-Image-2.1にはランキングが一切ありません。これを執筆した時点で、独立系の画像リーダーボードには掲載されていませんでした。その唯一の品質指標はベンダー自身のQwen-Image-Benchチャートで、そこでは60.28と表示されており、Nano Banana 2.0の59.82、GPT Image 1.5の59.65と比較されています — ベンダー資料であり、第三者による再現はありません。唯一の真に独立したデータポイントは、SGLang統合作業とともに公開された機能検証です。透過PNG出力は合格し、アルファは0~255の全範囲で保持され、RGBA PSNRは単一サンプルで60.69 dBを測定しました。著者らはこれを品質保証ではなく正確性チェックであると明示的に説明しています。

つまり、正直な成績表はこうだ。一方のモデルには、変動する公開ランキングと、それに付随するベンダーの主張がある。もう一方には、ベンダーのスコアカードと、合格した統合テストがある。これは比較ではないし、そうでないと主張する記事で両方を実行したものは一つもない。

A two-column board for Qwen-Image-2.1 and Grok Imagine Image 2.0 carrying both sides on one line per dimension: Price model, Licence, Transparency, Ranking evidence, Reference images and Distribution. Footer notes that rankings are time-stamped and move week to week, that the vendor claim is unaudited, and that no head-to-head evaluation of the two exists.

Alpha、そしてそれが唯一の技術的非対称性である理由

Qwen-Image-2.1の透過性はモデルに組み込まれている。16×の空間圧縮を行う64チャンネルRGBA VAEとは、アルファチャンネルがノイズ除去の対象となる潜在空間の一部であることを意味し、これによって単一の仕組みから三つのことが可能になる。透過付きの生成、すでに透過を持つ画像をまず平坦化することなくその内部で編集すること、そして通常のRGB写真から被写体を抽出し、硬いマスクではなくアルファを返すことだ。背景除去ノードも、マッティングモデルも、エッジのクリーンアップも不要——これがベンダーの主張であり、SGLangによる機能検証だけが、このチャンネルが名目上ではなく実在することを示す唯一の独立した証拠である。

Grok Imagine Image 2.0には、文書化された同等機能はありません。公開されている機能範囲はテキストから画像生成と参照ベースの編集で、解像度と品質の階層があり、一部のプロバイダーでは最大5枚の入力画像に対応します。アセットに、髪、ガラス、煙などのきれいな半透明エッジを伴う切り抜き被写体が必要な場合、Grok側ではマッティング工程を追加することになり、Qwen側では不要です。その工程が、もう一方の側のライセンスにまつわる頭痛の種よりもコストがかかるかどうかが、実際のエンジニアリング上の問いであり、それは被写体次第です。

編集環境対チェックポイント

二つのシステムは、編集インテリジェンスをどこに置くべきかについて意見が分かれている。

Grok Imagine Image 2.0 はそれをサービス化しています。参照画像と指示を送ると、その意味するところはプロバイダーが判断し、解像度と品質のティアはリクエストごとに選択されます。読むべきものも、調整すべきものも、壊れるものもありません — これは、diffusers パイプラインを自前で抱えたくないチームにとって、真の利点です。また、名目上は同じモデルでありながらプロバイダーによって価格が異なる理由でもあります。買っているのは重みだけでなく、環境なのです。

Qwen-Image-2.1 では、それが中身を検査できるチェックポイントに収められています。画像モデルと並んで、プロンプト書き換えモデルを2つ同梱しています——PE-T2I と PE-I2I で、それぞれ Qwen3.5-VL 9B をファインチューニングした約 18.8 GB のもの——そして書き換えコードは prompt_rewrite/ フォルダにあり、同梱の system_prompt.txt には、とりわけレンダリングされるテキストの言語がどのように選ばれるかが明記されています。これは、ホスト型の画像 API では提供されないレベルの検査可能性です。同時に、これはモデル本体に加えて 37.6 GB のリライターでもあり、大半のパイプラインがオプション扱いするコンポーネントにとっては、ディスクと読み込み時間の実コストになります。

編集サーフェス — Qwen-Image-2.1 は円、ペイント注釈、または別個のマスクによるローカル編集をサポートし、さらに透明レイヤー編集と被写体抽出にも対応しています。Grok Imagine Image 2.0 で文書化されている編集は参照画像駆動です。
参照入力 — Qwen-Image-2.1 は最大 10 枚の参照画像を受け付け、早期アクセスのレビュアー 1 名は、参照画像が約 3 枚以降になるとマルチ参照の一貫性が低下すると報告しています。複数の Grok プロバイダーは最大 5 枚の入力画像を文書化しています。
ネイティブ解像度 — Qwen-Image-2.1 は 2K でネイティブ出力し、7 つのアスペクトプリセットにわたり 40 ステップでのデフォルトは 2048×2048 です。Grok Imagine Image 2.0 の解像度は、プロバイダーごとに価格が設定されるリクエスト単位の選択です。

配布とライセンス

ここが両者の最も鋭い分岐点であり、それは決して技術的な違いなどではない。

Grok Imagine Image 2.0は、xAIのAPI経由でも、複数の独立系サードパーティプロバイダー経由でも利用できます。つまり価格競争が起きているということであり、あなたが支払う料金は定価ではなく市場価格だということです。ダウンロードもGPUも、読むべきライセンスファイルも不要で、プロバイダー自身の利用規約以外に商用利用の制限もありません。

Qwen-Image-2.1 を入手できる方法は1つだけだ。ダウンロードするのである。これは2026年9月20日付の Qwen Research License Agreement の下で提供され、非商用目的のみの権利を付与し、商用利用にはベンダーから別途ライセンスを申請する必要があると明記している。これは、Apache 2.0 の下で提供されていた以前の Qwen-Image シリーズからの厳格化であり、この2つのどちらを選ぶかという現実の判断の大半を決める唯一の事実である。出力品質で両者を比較しているスタジオは、間違った問いに答えている。Qwen-Image-2.1 をクライアント業務に使えないスタジオにとっては、そもそも両者を比較する話ではない。

OrcaRouter は、その取り決めの「レンタル側」が存在する場所です。当社は200 以上のモデルを、プロバイダー定価・マークアップゼロで、1 つの OpenAI 互換エンドポイントの背後にルーティングしており、プロバイダー間の自動フェイルオーバー、ルーティング DSL、モデルフュージョンを備えています。そのため画像ルートでは、あるプロバイダーの午後の調子に賭けるのではなく、プライマリとフォールバックを指定できます。当社は xAI Grok Imagine の画像エンドポイントもルーティングしていますが、バージョンにご注意ください。当社のカタログに収録されているのはgrok/grok-imagine-imageであり、Grok Imagine Image 2.0 ではありません。したがって、より新しいモデルは現在お客様に提供できるものではありません。また、Qwen-Image はいかなるバージョンもルーティングしていないため、Qwen-Image-2.1 はローカル専用となります。当社が実際にルーティングしている画像系統は、OpenAI の GPT-Image ファミリー、Google の Imagen 4 の各ティアと Gemini の画像プレビュー、そしてその旧 Grok Imagine 画像エンドポイントです。定価はマークアップされずそのまま渡されるため、これらのいずれかでベンダーが値下げを行えば、当日から反映されます。

Decision card titled 'The tiebreak' with two panels: 'Own it - Qwen-Image-2.1', zero cost per image with native alpha, masks and local editing under a non-commercial licence, and 'Rent it - Grok Imagine Image 2.0', about $0.02 to $0.06 per image on commercial terms with no documented transparency path.

何がこの回答を変えるでしょうか

3つのこと、そしてその3つすべてが四半期以内にあり得る。

Qwen-Image-2.1の商用ライセンス。 ベンダーがスタジオが支払う価格で条件を公表すれば、透明性の優位性と限界費用ゼロの両方が商用業務で使えるようになり、この比較はまったく様相を変える。現時点では公表された価格も明示された条件もない。
Qwen-Image-2.1の独立系ベンチマーク。 第三者がベンダーのQwen-Image-Benchの数値を再現したり、このモデルを公開画像ボードに掲載したりすれば、唯一残る未解決の問い——実際に優れているのか——に決着がつく。
Grok側の価格改定。 プロバイダー間の競争により、名目上同じモデルで0.02ドルから0.06ドルまでの価格差がすでに生じている。持続的な値下げが実現すれば、現在よりも多くのボリューム帯域でホスト型ルートがデフォルトになる。

どちらかが実現するまでは、決め手は品質でも価格でもない。アルファ版が必要で非商用ライセンスでも構わないなら、それをダウンロードしてハードウェアで支払うことになる。あるいは製品として出荷する必要があり、モデルの運用は誰かに任せたいなら、画像ごとに課金され、VAEのことを二度と考えなくて済む。

Screenshot of the OrcaRouter catalogue page for the grok/grok-imagine-image endpoint, showing the model listing, the per-request price card, and the OpenAI-compatible code sample.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新