ヒーロータイトルカードには「Ming-Image-0.1-Design vs GPT Image 2.5」と書かれ、サブタイトルは「一方のスコアは見知らぬ人々が投票したもので、もう一方はモデル自身のチームが描いたもの」で、2枚のカードには「GPT Image 2.5:UI/UXデザインボードでElo 1,227、ブラインド投票1,287、1,000画像あたり$210.72」と「Ming-Image-0.1-Design:自身のリポジトリ内で公開されたボードでElo 1,082、ダウンロード数0」と書かれている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Ming-Image-0.1-Design 対 GPT Image 2.5:研究室自身の数値 対 見知らぬ人々の投票

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を同じ文に入れるMing-Image-0.1-DesignGPT Image 2.5と、真っ先に浮かぶ比較は品質だ。だが有益な比較は出所である。GPT Image 2.5 は、ライブの Artificial Analysis UI/UX Design ボードで1位と2位を占めており、Elo は1,227と1,218、それぞれ1,287票と1,303票のブラインドによる人間の投票に基づいている——つまり、モデルを作ったわけでもなく、どの出力がどちらのものかも知らされていない人々によって生み出されたランキングである。Ming-Image-0.1-Design に付いているスコアはただ一つ、Elo 1,082だけで、そのスコアは inclusionAI 自身の Hugging Face リポジトリ内に同梱されたリーダーボード画像、それも他ではどこにも見つけられなかったボードに載っており、しかもダウンロード数ゼロのモデルのものだ。このうち一方の数字は証拠である。もう一方は、書体をまとった主張にすぎない。どちらのモデルについての判断を形作るべきなのは、両者の間の145 Eloではなく、この隔たりのほうである。

並んだ2つの数字、そしてそれらを比べるときの落とし穴

その数値は、比較できそうに見えるほど近く、かつ種類が十分に異なっているため、比較できるものではない。以下が、正確に述べたその集合である。

• GPT Image 2.5は、ライブボードで — Flare(max)構成で1,227.0 Eloの1位、Sunburst(max)で1,218.1の2位、サンプル数は1,287と1,303、追跡価格は1,000枚あたり$210.72。このモデルはそのボードに2026年9月8日リリースとして掲載されていた。

• Ming-Image-0.1-Designは、単独のカードで — 1,082 Eloで1位、1,052のIdeogram 4.0 (Quality)を上回り、FLUX.2 devのバリアントは994から1,000の間に位置し、「Text to Image Leaderboard: UI/UX Design」と題されたグラフィック上に、フッターには「Image Arenaでのブラインド選好投票によるEloスコア」と記されている。サンプル数は表示されていない。方法論は公開されていない。私たちが探した限りでは、このボード自体は公開ウェブ上には存在しない。

• 落とし穴 — Elo はボードごとに計算される。スコアは、同じボード上の他のスコアと比較して初めて意味を持つ。だからこそ、同じ FLUX.2 リリースが、一般的なテキストから画像へのボードでは 1,026、UI/UX Design カテゴリビューでは 1,065 と表示される。1,227 から 1,082 を引いても、2 つのモデル間の品質差を測ったことにはならない。別の数値から別の数値を引いただけだ。

A two-column scoreboard comparing GPT Image 2.5 with Ming-Image-0.1-Design. The GPT Image 2.5 column reads: 1,227 Elo first place, 1,287 blind votes, released 8 Sep 2026, $210.72 per 1,000 images, independent board, callable. The Ming-Image-0.1-Design column reads: 1,082 Elo first place, no vote count published, weights 17 Sep 2026, no published price, vendor-published board, not callable. A footer notes the two Elo figures are not on the same scale.

何がブラインド投票をブラインド投票たらしめるのか

Artificial Analysisは、その手法の検証に足る部分を公開している。その画像アリーナは、匿名モデルによる2つの生成物を対戦させ、投票者に勝者を選ばせ、その結果をEloレーティングに変換する——ボードに表示されるサンプル数とは、各モデルが蓄積してきたそうした比較の回数である。この構造こそが、スコアをモデル自身の作者に対して耐性のあるものにしている。GPT Image 2.5を訓練した人々はそのループには現れず、モデルが制作者のお気に入りであるからといって1位にランクされることはない。完璧な計測器ではない——投票者のプールは自己選択的であり、プロンプトは管理されたベンチマークスイートではない——しかしそれは、ベンダー以外の誰かが手にしている計測器なのだ。

Ming-Image-0.1-Design リポジトリ内の図は、検証可能にする部分を欠いたまま、その形式を借用している。「ブラインド選好投票」がその主張だ。「Our Image Arena」が運営者であり、その運営者は inclusionAI だ。公開された投票数はなく、プロンプト分布も見えず、ペアリングを検査する方法もない。その図の背後にある評価が誠実かつ厳密である可能性は十分にある——モデルのチームなら知っているだろう。また、外部からは完全に検証不可能でもある。これは、その上に構築するかどうかを決める側にとって、唯一重要なことだ。

付け加えておく価値がある。なぜなら、それは安易な筋書きに反するからだ。Ming-Image-0.1-Design は、現行の Artificial Analysis ボードにはまったく載っていない。UI/UX Design カテゴリーにも、一般的なテキスト・トゥ・イメージのボードにも、オープンウェイト表示にもない。その不在は、それが劣っている証拠ではない——ダウンロード数ゼロでホスト型エンドポイントもないモデルは、投票を積み上げようがない。それは、まだ独立した数値が存在しないことの証拠であり、別の主張だ。

価格は曖昧でない部分だ

コストの面では、両モデルは比べ物にならず、議論の余地もない。

• GPT Image 2.5 は商用エンドポイントです。Artificial Analysis は UI/UX カテゴリにおいて 1,000 枚あたり $210.72 と追跡しており、これは 1 枚あたりおよそ 21 セントで、この分野の価格帯の最高水準に位置します。同じボード上の参考として、Grok Imagine Image 2.0 は 1,000 枚あたり $60、MAI-Image-2.6 は $38.9、Muse Image は $10 と追跡されています。

• Ming-Image-0.1-Design はエンドポイントがないため価格がありません。重みは MIT ライセンスで無料でダウンロードでき、実行には 80 GiB の CUDA GPU 1 枚の 1 時間あたりのコストがかかります。モデルカードで検証済みの構成は、そのクラスのカード 1 枚で、解像度 2048 x 2048、サンプリングステップ 12 です。

• どちらの数値も安定していません。両ベンダーとも料金を改定するため、今日書いた1画像あたりの比較は、数週間単位の寿命しかありません。ここだけは、OrcaRouterの経済性をはっきり述べておく価値があります:当社はプロバイダの定価を0%のマークアップでそのまま通しています。そのため、ベンダーの料金変更は、当社側で独自の再価格設定サイクルを経た後ではなく当日に反映されます — これは、2つの候補の差が1画像あたり21セント対6セントで、どちらも変動しうる場合に重要なことです。

実際に今日、何に電話できるのか、そしてその中で私たちがどこに位置するのか

可用性となると、この比較はもはや思考実験ではなくなる。

GPT Image 2.5は、OpenAIが独自の条件で販売している、実際のAPIを備えた実在の製品です。OrcaRouter経由でルーティングすることはできません——2026年9月23日時点で、当社のカタログにGPT Image 2.5の項目は存在しません——そして、存在しないルートについて説明するつもりはありません。同じラインからカタログに実際に掲載されているのは前世代のopenai/gpt-image-2で、入力トークン100万あたり$8.00、出力トークン100万あたり$30.00、そしてopenai/gpt-image-1.5も並んでおり、これらは当社がルーティングする他のすべてと同じキーの背後にあります。

Ming-Image-0.1-Design はどこからもルーティングできません。このリポジトリでは推論が無効化されており、Hugging Face は推論プロバイダーのデプロイがないと報告しており、クイックスタートは 404 を返すコンパニオン GitHub リポジトリを指しています。当社のカタログにはいかなる種類の inclusionAI モデルも含まれていません。実行する唯一の方法は、シャードをダウンロードして自分で配信することです。

つまり、選択肢の形はこうだ。今日、市場価格の最高値で買える選択肢が一つ。そして、今日、GPU 1台分の価格と自分自身のエンジニアリング時間で動かせるが、性能を裏付ける独立した証拠が一切ない選択肢がもう一つ。Ming-Image-0.1-Design が GPT Image 2.5 のより安価な代替だと言う人は、二つ目の選択肢のコストを計算に入れていない。

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears on the board.

どちらにも賭けずに両方を保つ方法

ここでの実用的な助言は、判断よりも限定的だ。なぜなら、この二つのモデルはまだ代替可能ではないからだ。

本番環境でUIやデザイン品質の画像生成が必要なら、GPT Image 2.5は弁明不要の選択であり、自分自身と交渉すべきは価格であって品質ではない — 独立系の評価ボードでは、順位が疑いようもないほど大きな差をつけて首位に立っている。Ming-Image-0.1-Designが優れているかどうかを知りたいなら、選択肢は二つあり、そのうち推測が不要なのは片方だけだ。MITの重みを80 GiBのカードに載せて自前の評価セットを回すか、誰か他の人がやってくれるのを待つか。それまでの間、1,082を結果として扱ってはならない。そして、本当の要件がどちらか一方のモデルそのものではなく選択肢の確保にあるなら、報われるのは生成呼び出しを単一のインターフェースの背後に置くという規律だ — 200以上のモデルをまたぐ1つのキー、書き直しではなくモデルIDの変更、エンドポイントが不調のときの自動フェイルオーバー — そうすれば、この二つのどちらが先に独立した数値を出しても、それを採用するコストは設定1行であって、スプリント1本ではない。

締めくくりに、この記事を変えるだろうものについて一言。Artificial Analysis UI/UX DesignボードにMing-Image-0.1-Designの行が現れ、その隣にサンプル数が表示されれば、ベンダーの1,082は主張からデータポイントに変わる——そして、inclusionAI以外の誰かがこのモデルについて測定可能なことを述べるのは初めてになる。それが注目すべき出来事であり、ダウンロードカウンターよりも監視する価値が高いものだ。

The OrcaRouter models catalogue, captured 23 September 2026, showing the English-language model directory with its search box, the copy-the-model-ID instructions, and the filter panel for input modalities, context length, price, status and series.