ヒーロータイトルカードには「Ming-Image-0.1-Design vs MAI Image 2.5 Pro」、サブタイトルには「2048 x 2048 対 1,048,576ピクセルの上限」と表示され、「2048 x 2048」とラベル付けされた画像アイコンカードと、「1,048,576ピクセルの上限」とラベル付けされたドキュメントアイコンカードがある。右下隅にはOrcaRouterのロゴが合成されている。
Guides & Insights

Ming-Image-0.1-Design 対 MAI Image 2.5 Pro:メガピクセルの上限が決め手となる

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

の比較で最も重要な数字はMing-Image-0.1-DesignMAI Image 2.5 ProElo スコアではない。それは 1,048,576 だ。これは Microsoft が MAI Image 2.5 Pro について明記している出力上限 —— およそ 1024 x 1024 —— であり、一方で inclusionAI の Ming-Image-0.1-Design は 2048 x 2048 を推奨し、中間サイズでは一切レンダリングせず、リクエストを 1024 か 2048 のいずれかのバケットにスナップする。どちらのモデルも、画像内に読み取れるテキストを入れるのが本当に得意で、だからこそ両者は同じ話題に何度も登場する。4 メガピクセルのレイアウトが得られるのはそのうち一方だけで、ハイパースケーラーのプレミアム階層でトークン単位の課金なのもそのうち一方だけだ。

Ming-Image-0.1-DesignはinclusionAIの6Bテキスト画像生成モデルで、MITライセンス、重みは2026年9月17日に公開された。MAI Image 2.5 ProはMicrosoft AIの品質ティアで、2026年7月23日からMicrosoft Foundryでパブリックプレビュー中。テキストレンダリングに関するどちらの主張も、それを発表したラボの外で再現されたことはない——しかし、そのうちの一方はアリーナを経ており、その違いは以下のすべてを貫いている。

それぞれが何のために作られているか

MAI Image 2.5 Proは、MicrosoftのMAI-Image-2.5ファミリーの最上位に位置するモデルで、バランスの取れた作業向けのMAI-Image-2.5、大量処理向けのMAI-Image-2.5-Flashの上に位置します。そして8月19日時点で、MAI-Image-2.6はすでにプライベートプレビュー中です。Microsoftはこれを同社史上最も高精細な画像モデルと説明しており、ヒーローイメージ、詳細な編集、画像内テキストの正確なレンダリングを目的としています。これは複数画像入力に対応する設計で、ベンダーによれば生成を通じて94%のキャラクター一貫性を実現し、既存のアセットを1か所だけ変更してそのまま出荷するようなワークフローに向けたモデルとして位置づけられています。

Ming-Image-0.1-Designはゼロから生成するジェネレーターであり、エディターではありません。プロンプトを入力すると画像が出力され、参照画像は不要です。その領域はテキスト密度の高いグラフィックデザイン—UIモックアップ、ダッシュボード、インフォグラフィック、ポスター—であり、際立った機械的特徴は、プロンプトが文書化された透明性フレーズのいずれかで始まる場合にネイティブRGBAを出力することです。コンパニオンモデルであるMing-Image-0.1-Design-Layerは、平坦化されたデザインを2~9枚の別々のRGBA PNGに分解し、それらが元のデザインに再構成されます。

• 出力上限 — Ming-Image-0.1-Design は 2048 x 2048(推奨)、または 1024 x 1024。中間サイズはこれら2つのいずれかにスナップされるのに対し、MAI Image 2.5 Pro は 1,048,576 ピクセル、およそ 1024 x 1024 が上限

• コアモード — プロンプトのみの生成 vs 参照画像間でキャラクターの一貫性を保つマルチ画像編集

• 透過性 — サンプラーからのネイティブRGBA、加えてコンパニオンモデルによる2〜9レイヤー分解。一方、文書化されているものはなし

• ライセンスとアクセス — 自分でホストするMITウェイト 対 Microsoft Foundryでの商用プレビュー

• 課金単位 — 自前のGPU時間(80 GiBのカード1枚)か、トークン単位か。Foundryで計測

• 独立系テキスト画像生成の順位 — Ming-Image-0.1-Designは#45、Elo 995、サンプル数21,342、対してMAI Image 2.5 Proは#12、Elo 1,098、サンプル数13,521

• 独立した編集配置 — エントリーなし 対 {{KEEP}}MAI Image 2.5 Pro{{/KEEP}}は#10、Elo 1,106、13,581サンプル

2つのアリーナ番号を一緒に読み取ってください

2026年9月24日に読んだArtificial Analysisのボードは、「あるモデルの方が優れている」というより、もっと具体的なことを示している。

テキストから画像生成のボードでは、MAI Image 2.5 Pro は13,521票でElo 1,098、95%信頼区間±8の12位につけています。Ming-Image-0.1-Design は21,342票でElo 995、±8の45位です。これは103 Eloの差であり、信頼区間がこれほど狭いボードではノイズではありません。画像編集のボードでは、MAI Image 2.5 Pro は13,581票でElo 1,106の10位です。Ming-Image-0.1-Design はそこにまったくエントリーがありません。

すると、デザインチームにとって重要な唯一のスライスで状況が一変する。同じリーダーボードのUI/UXデザインスライスでは、MAI Image 2.5 Proはスライス内の1,241票でElo 1,131の10位、Ming-Image-0.1-Designは2,100票でElo 1,084の16位。差は103 Eloから47に縮まり、編集でこれまでベンチマークされたことのないモデルが、プロンプトがデザイン用プロンプトになった途端にその距離の大半を埋める。

それがこの選択の構図だ。MAI Image 2.5 Pro は、測定上、より優れた汎用画像モデルであり、より優れた編集モデルでもある。Ming-Image-0.1-Design は、タスクがレイアウトのときは総合順位をはるかに上回る性能を発揮する専門特化型であり、透明背景のパスを備えているのは両者のうちこれだけだ。

両方の数値セットに一つ注意点があります。これらはスライスの数値であり、スライスは動くものです。MAI Image 2.5 Proのフルボードでの13,521票という集計は、その信頼区間が狭くなるほど十分に大きいものの、投票数が千数百票程度しかないユースケースのスライスはより不確かな数字であり、両モデルの背後にあるベンダーの主張は誰によっても検証されていません。

A rendered two-column scoreboard headed 'Six dimensions', titled 'Ming-Image-0.1-Design vs MAI Image 2.5 Pro'. The Ming-Image-0.1-Design column reads: output ceiling 2048 x 2048; mode prompt-only generation; transparency native RGBA plus layers; price basis own GPU time on an 80 GiB card; full board #45, Elo 995, 21,342 votes; UI/UX slice #16, Elo 1,084, 2,100 votes. The MAI Image 2.5 Pro column reads: output ceiling 1,048,576 pixels; mode multi-image editing with 94% consistency claimed; transparency none documented; price basis $106 per 1M image output tokens; full board #12, Elo 1,098, 13,521 votes; UI/UX slice #10, Elo 1,131, 1,241 votes.

マイクロソフトが主張しているもの、そしてそれが実際にかかるコスト

マイクロソフト自身によるMAI Image 2.5 Proの数値は、すべてベンダー報告によるもので、独立して再現されたものはありません:

• テキストレンダリング精度は96.8%で、中国語、英語、日本語、韓国語、スペイン語に対応していると記載されていますが、同じドキュメントでは出力が約1メガピクセルに制限されているため、その主張に付随する「8K」という表現はマーケティングと解釈するのが妥当です。

• Microsoftの社内評価において、GPT-Image-1.5よりプロンプト追従性が27%高い

• 複数画像生成をまたいだキャラクターの一貫性 94%

• PowerPointやOneDriveといった特定のMicrosoftシナリオにおいて、GPTモデルと比べてGPUコストを最大84~89%削減 — これは特定シナリオにおける数値であり、一般的な数値ではありません

文書化された仕様書は、それらの主張を裏付けている。テキスト入力は最大32,000トークン、131kのコンテキストウィンドウ、出力トークンは4,096、JPEGおよびPNG画像入力、そして1,048,576ピクセルの出力上限だ。その上限は購入者の問題である。1メガピクセルを超えられない高品質エディターは、印刷用ツールではなく、ソーシャルおよびWebアセット向けツールであり、テキスト描画の精度がどれほど高くてもピクセル数は変わらない。

Foundry では、価格はトークン従量制です。テキスト入力トークン100万個あたり $5、画像入力トークン100万個あたり $8、画像出力トークン100万個あたり $106 です。Microsoft は画像あたりのトークン数を公開していないため、画像あたりの数値は見積もりではなく計算によるものです。Artificial Analysis の換算を用いると、1024 x 1024 の画像は1,000枚あたり約 $108.50 となり、同系列の MAI-Image-2.5 の1,000枚あたり約 $48 のおよそ2.3倍、MAI-Image-2.5-Flash の1,000枚あたり約 $20 の5.4倍です。Pro ティアは意図的に割高に設定されています。Preview の価格は GA の価格でもなく、一般提供前に料金表が変更される可能性があります。

Ming-Image-0.1-Design には比較対象となるベンダー料金表がありません。ホスト型エンドポイントが存在しないためです。Artificial Analysis のボードでは 1,000 画像あたり $30.00 と掲載されていますが、これはベンダーが公表した価格ではなく、ボード側で導出された列です — inclusionAI が提供しているのはウェイトとサービングレシピであり、API ではありません。実際のコストは、80 GiB の VRAM を搭載した CUDA GPU 1 基、BF16、CFG 1.0 での 12 サンプリングステップ、そして推奨される 2048 ピクセル出力です。guidance 1.0 での 12 ステップは蒸留済みまたはガイダンス不要のサンプラーであり、それによってそのステップ数で 2048 ピクセルのレンダリングが手頃になります。また、このカードの推奨レシピでは、拡散モデルの前段で視覚言語モデルを実行し、短いプロンプトを座標、階層、色仕様、逐語テキストを含む構造化された Figma 風の JSON レイアウトに書き換えます。

私たち自身の側で正確にしておくべき点が2つあります。当社はどちらのモデルもルーティングしていません。Microsoft の画像モデルも inclusionAI のモデルも OrcaRouter のカタログには掲載されていないため、どちらもベンダー自身のルート、あるいはお客様自身のハードウェアを意味します。200以上のモデルにまたがる単一の OpenAI 互換エンドポイント、プロバイダーの定価を0%のマークアップでそのまま適用するためベンダーの価格変更が当日に反映されること、そしてプロバイダー間の自動フェイルオーバーです。すでに信頼しているホスト型画像モデルと、これらのいずれかに対して同じプロンプトセットを実行するのは、調達の仕事ではなくワンキーで済む仕事です。

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the rows around both models. MAI-Image-2.5-Pro appears at row 12, creator Microsoft AI, Elo 1,098, range 8-13, 13,521 samples, July 2026, $108.5 per 1k imgs. Nano Banana 2 Lite appears at row 13 with Elo 1,092. Ming-Image-0.1-Design appears at row 45, creator InclusionAI, Elo 995, range 39-50, 21,342 samples, September 2026, $30.0 per 1k imgs, with the Open Weights badge. The Open Weights badge also appears on Ideogram 4.0 (Quality) at row 34 and on FLUX.2 [dev] at row 40.

誰も尋ねないサイズの疑問

この比較のダウンロード面を複雑にする2つ目の数値があり、モデルが6Bとして宣伝されている以上、それを明言しておく価値がある。Ming-Image-0.1-Designの拡散トランスフォーマーは6.15Bパラメータである。パッケージはおよそ52.88 GBである。というのも、マルチモーダルテキストエンコーダーが17.01B、コネクターが3.09Bを追加するためで、BF16では合計およそ26Bパラメータになる。Layerコンパニオンのトランスフォーマーはその2倍の12.31Bで、そのパッケージはさらに大きく、およそ65.20 GBである。80 GiBのVRAM要件は、6Bという数値の結果ではなく、トランスフォーマーとともに常駐するすべてのものの結果である。

MAI Image 2.5 Proは正反対のプロファイルを持っています。ダウンロードするものも、配信するものも何もなく、それで生成できるものには厳しい上限があります。この2つの問題のどちらがより深刻かは、あなたのチームがすでにGPUを運用しているかどうかによって完全に決まります。

A rendered summary card headed 'The arithmetic', titled 'What the two price tags are actually measuring', listing four rows: the MAI Image 2.5 Pro token rates of $5 per 1M text input, $8 per 1M image input and $106 per 1M image output; the per-image arithmetic of about $108.50 per 1,000 images at 1024 x 1024, roughly 2.3x MAI-Image-2.5 and 5.4x MAI-Image-2.5-Flash; that Ming-Image-0.1-Design has no vendor rate card and the board lists $30.00 per 1,000 images as a board-derived column; and the pixel ceiling of 1,048,576 for MAI Image 2.5 Pro against 2048 x 2048, four times the area, for Ming-Image-0.1-Design.

1つを選ぶ

• 既存の画像を高品質で編集でき、1メガピクセル内でも十分に通用する —— MAI Image 2.5 Pro。編集ボードで実際に10位にランクインし、生成スコアを裏付ける大量の投票数を誇り、ベンダー公称の一貫性数値を伴うマルチ画像パイプラインも文書化されています。価格はそれらすべてを反映したものです。

• テキスト密度の高いレイアウトを生成していて、透過性や編集可能なレイヤーが必要な場合 — Ming-Image-0.1-Design。ネイティブRGBAと2~9レイヤー分解は、MAI Image 2.5 Proがどんな価格でも提供する機能ではなく、2048 x 2048の出力はピクセル予算の4倍です。

• 印刷解像度の出力が必要な場合——どちらも不可。片方は100万画素が上限で、もう片方は2048×2048が上限です。

• レビューで擁護できる数値が必要だ — フルボードでは MAI Image 2.5 Pro、UI/UX スライスでは Ming-Image-0.1-Design、そしてテキストレンダリング精度ではどちらも使えない。そこでは両方の主張がベンダー報告であり、再現されていない。

正直な結論としては、これら2つのモデルは実際には競合関係にない。MAI Image 2.5 Proは、解像度の上限があり、それに見合った価格のプレミアムなホスト型エディターだ。Ming-Image-0.1-Designは無料ダウンロードで、デザイン特化のアリーナスライスにおいてオープンウェイト分野をリードし、その代わりに80 GiBのカードを求める。注目すべきは、マイクロソフトがGA前にメガピクセル上限を引き上げるかどうか、そしてinclusionAIがこれらのウェイトにエンドポイントを付けるかどうかだ。なぜなら、どちらかの動きがあれば、これは2種類の異なるコミットメントの比較ではなく、真の直接対決になるからだ。