「Ming-Image-0.1-DesignがオープンウェイトUIデザインボードの首位に立つ」と書かれたヒーロータイトルカード、サブタイトルは「Artificial AnalysisのUI/UXデザイン部門で最高評価のオープンウェイトモデル、Elo 1,084」。トロフィーアイコンのカードには「最高評価のオープンウェイトモデル」、スクリーンアイコンのカードには「UI/UXデザインで首位」と表示。OrcaRouterのロゴが右下隅に合成されています。
Guides & Insights

Ming-Image-0.1-DesignがオープンウェイトUIデザインボードで首位に — そしてその数字も納得だ

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この主張はMing-Image-0.1-Designとともに広まっており、その内容は次のとおりだ。inclusionAI の 6B モデルは UI や UX の作業向けのオープンウェイトのテキストto画像モデルとして最高であり、Artificial Analysis の UI/UX Design リーダーボードのオープンウェイト版で 1,082 Elo を記録して首位に立っているというものだ。ベンダーが示すリーダーボードのスクリーンショットは通常、最も弱い種類の証拠なので、まずやるべきは実際のボードを読むことだ。2026年9月24日時点ではそれは持ちこたえているが、スクリーンショットには示されていない重要な但し書きが1つある。1,082 はユースケース別のスライスであり、ボードそのものではない。そして、Text to Image の総合リーダーボードでは、同じモデルは Elo 995 で45位に位置している。

どちらの数値も本物であり、同じアリーナから得られたもので、同じ重みを表している。両者を分けているのは、どのプロンプトに対して投票が投じられたかである。

ライブボードに実際に表示されているもの

Artificial Analysisはブラインドペアワイズアリーナを1回実行し、その後、同じ投票プールをユースケース別のスライスにフィルタリングします。ダッシュボード、アプリ画面、ポスター、インフォグラフィック向けに構築されたモデルにとって重要なのはUI/UXデザインのスライスであり、ここでMing-Image-0.1-Designが最も力を発揮します:

• 総合テキスト to 画像ボード — Ming-Image-0.1-Design は第45位、Elo 995、95% CI ±8、21,342サンプル、2026年9月に掲載、画像1,000枚あたり$30.00、Open Weights 指定

• UI/UXデザインのスライス — Ming-Image-0.1-Designは16位、Elo 1,084、スライス内の2,100サンプル

• そのスライスで最高位のオープンウェイト・エントリー — Ming-Image-0.1-Design。それに続くオープンウェイトモデルは、第22位(1,047)の Ideogram 4.0 (Quality)、第31位(1,018)の Ideogram 4.0、第40位(1,005)の HunyuanImage 3.0 Instruct

• UI/UXスライスのトップ — GPT Image 2.5 Flare(max)が1,226、GPT Image 2.5 Sunburst(max)が1,215、GPT Image 2(high)が1,204、Grok Imagine Image 2.0が1,183

• ベンダー自身のスクリーンショットに対して — inclusionAIはMingについて1,082を公表しており、それに対してIdeogram 4.0 (Quality)は1,052、FLUX.2 [dev]は1,000でした。ライブスライスでは現在、それぞれ1,084、1,047、1,000となっています

見出しはそれ自体の前提においては正確だ。Ming-Image-0.1-DesignはUI/UXデザイン部門で最高評価のオープンウェイトモデルであり、その部門のトップ20に入る唯一のオープンウェイトモデルでもある。また、その部門の首位から142 Elo遅れており、プロンプトがデザイン用プロンプトでない場合には中位に位置する。ダッシュボードで勝ち、総合995に落ち着くモデルはオールラウンダーではなくスペシャリストであり、この2つの数値が矛盾するのは、どちらか一方を全体像として読んだ場合だけだ。

フルボード上の21,342サンプルも、それが何ではないかという点で注目に値する。これは大量の投票数であり、だからこそ信頼区間は±8 Eloと狭い。しかし、サンプル数は手法の独立性と同じではない。アリーナは人間のブラインドな好みに基づいているので、inclusionAIの誰もスコアを書いていない——その部分は本物だ。スコアが測定しているのは「投票者がこれら2つの画像のどちらを好んだか」であり、UIスクリーンショットを判断するよう求められた投票者は、読みやすいテキストと一貫したレイアウトを評価する傾向がある。それはまさに、このモデルが訓練された軸である。

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Ming-Image-0.1-Designとは

Ming-Image-0.1-Designは、Ant Groupに関連するAI研究所であるinclusionAIによるテキストから画像を生成するモデルで、MITライセンスの下で公開され、重みは2026年9月17日に、完全なリリースパッケージは9月22日に公開されます。プロンプトだけで生成でき、参照画像は不要です。写真ではなく、文字の多いグラフィックデザイン——UIモックアップ、ダッシュボード、インフォグラフィック、ポスター、そして表示されるテキストが実際に読まれるサイズで判読可能であり続けなければならないあらゆるもの——を対象としています。

文書化された推論構成は特定的で、ステップあたり異常に安価である:

• 解像度 — 2048 x 2048 を推奨、高速に生成したい場合は 1024 x 1024。中間のサイズは、これら2つのいずれかにスナップされます

• サンプリングステップ — 12

• ガイダンス — CFGスケール 1.0

• 精度 — BF16

• ハードウェア — VRAM 80 GiB を搭載した CUDA GPU 1 基。検証済みの構成として説明されています。

ガイダンススケール1.0での12ステップは、蒸留済みまたはガイダンス不要のサンプラーの特徴です。これにより、ほとんどの拡散モデルなら試みないようなステップ数で2048ピクセルの出力を手頃に生成でき、一度に1枚ではなく大量の画像生成を回している人にとって、このモデルが興味深い主な理由でもあります。

もう一つの構造的な特徴は透明性です。Ming-Image-0.1-Design はネイティブ RGBA を出力できるため、プロンプトがドキュメントに記載された透明性フレーズのいずれかで始まる場合、透明な背景はマッティング処理ではなくサンプラーから出力されます。コンパニオンモデルの Ming-Image-0.1-Design-Layer はさらに進んでいます。平坦化されたデザインとレイヤープランを受け取り、別々の RGBA PNG(テキスト、カード、メイン被写体、背景)を返します。それらは元のデザインに再合成できます。これがデザインモデルと画像モデルの違いです。平坦な PNG はレイアウトの画像であり、分離されたレイヤーはまだ編集できるレイアウトです。

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

6Bのラベルと26Bのダウンロード

「6B」は、ほとんどの人が意味している部分については正確だが、実行できるかどうかを決める部分については誤解を招く。拡散トランスフォーマーは6.15Bパラメータだ。実際にダウンロードするパッケージはおよそ52.88 GBで、これはマルチモーダルテキストエンコーダーが17.01Bパラメータで、コネクターがさらに3.09Bを加えるためだ——BF16で合計約26Bパラメータになる。Layerモデルのトランスフォーマーはベースモデルの2倍の12.31Bで、そのパッケージはさらに大きく、およそ65.20 GBだ。

これは2つの実用的な理由から重要です。第一に、80 GiBのVRAM要件は6Bトランスフォーマーに関するものではなく、それと一緒に常駐しなければならないすべてのものに関するものです。第二に、「6B」と表現されるモデルとの比較では、どの6Bを指しているかを確認する必要があります。20Bのテキストエンコーダーを備えた6Bの拡散トランスフォーマーは、エンドツーエンドの6Bモデルとはまったく異なる展開上の問題です。

プロンプト処理は、カードが隠すのではなく明示しているもう一つの点だ。推奨レシピでは、まず書き換えステップを実行し、視覚言語モデルを使って短いプロンプトを、座標、階層、色仕様、逐語テキストを含む構造化されたFigma風のJSONレイアウト記述に展開する。モデルカードには、その作業にLing-3.0-flash-VLまたはQwen3.8-27Bが挙げられている。言い換えれば、ベンダーがベンチマークしているパイプラインは2モデル構成のパイプラインだ。一行のプロンプトで書き換えステップなしにMing-Image-0.1-Designを呼び出すなら、UI/UXスライスで1,084を出した構成を実行していることにはならない。

これによりデザインパイプラインがどうなるか

Ming-Image-0.1-Designについて正直にまとめると、それは特定の、そして高コストな問題――見て確認しても破綻しない、テキスト密度の高いレイアウトを生成する――を解決しており、その問題を測定する唯一のリーダーボードで、オープンウェイト分野のトップに立っている。総合的な画像リーダーボードで首位なわけではなく、その前にVLMを置く必要性をなくすものでもなく、本格的なGPUを要求する。

これが変えるのは、デザインワークフローの中間部分だ。現在のパイプラインがフラットな画像を生成し、その後、それを切り分けるために人間かセグメンテーションモデルにコストを払っているなら、RGBAをネイティブに出力するモデルと、2〜9個の名前付きレイヤーを出力するコンパニオンが、1つの工程をなくす。それはEloの1列よりも価値があり、どのリーダーボードも測っていない部分だ。

インフラをコミットせずに試したいチームにとって、この切り分けは正確に押さえておく価値があります。Ming-Image-0.1-Design は MIT ライセンスのダウンロード製品であり、自社のハードウェアで動くか、まったく動かないかのどちらかです — OrcaRouter はいかなるバージョンの inclusionAI モデルもルーティングしておらず、そうでないと言うのは当社が果たせない主張になってしまいます。ルーティングレイヤーが提供するのは、その周辺の面です:200以上のモデルにまたがる1つの OpenAI 互換エンドポイント、プロバイダー間の自動フェイルオーバー、そしてプロバイダーの定価を0%のマークアップでそのまま適用するため、実際に呼び出すモデルのベンダー価格が変われば、当社側でも同日に反映されます。デザインパイプラインを立ち上げていて、このモデルをすでに信頼しているホステッドモデルと A/B 比較したいなら、その比較は2つの契約ではなく1つのキーで実行できます。

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

何が状況を変えるでしょうか

Ming-Image-0.1-Designを、強力なオープンウェイトの専門特化モデルからデフォルトへと押し上げるには、3つのことが必要だ。第一に、LayerモデルのCrelloの数値を独立に再現すること。モデルカードには1024でRGB L1誤差0.0574、alpha soft IoU 0.8923が報告されているが、外部のグループはそれらをまだ実行していない。第二に、80 GiBの要件をなくすホスト型エンドポイント。そして第三に、モデルがUI/UX Designと同じくらいの成績を収める2つ目のユースケーススライス。なぜなら、1つのボードの1つのスライスでしか勝てないモデルは、汎用性がまだ証明されていないモデルだからだ。

それまでは、正確な文はこういう狭いものになる。Artificial Analysis UI/UX Designスライスにおいて、2026年9月24日時点の数値で、inclusionAIのMing-Image-0.1-Designは2,100票でElo 1,084を獲得し、オープンウェイトのテキスト画像生成モデルとして最高評価だ——そして同じアリーナの全体ボードでは995で45位である。どちらもこのモデルについての話だ。どちらもローンチの主張ではない。なぜならこのモデルにはローンチがなく、あったのはリポジトリだけだったからだ。