「Ming-Image-0.1-Design vs Qwen-Image 3.0」のヒーロータイトルカード。サブタイトルは「Who shows you how the text gets drawn.」——Ming-Image-0.1-Design(6.15Bパラメータ、MITライセンス、読むことのできる重み、2026年9月17日公開)とQwen-Image 3.0(クローズドなホスト型モデル、パラメータ数は非公開、ライセンスもレポートもなし、2026年8月5日一般提供開始)を対比させ、右下隅にOrcaRouterのロゴを配置。
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0:テキストがどのように描かれるかを示してくれるのはどっち?

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

最も興味深いのは、Ming-Image-0.1-Designのモデルカードには書かれていない。それは推論フレームワークへのあるコミットの中にある。2026年9月17日、このモデルがひっそりとHugging Faceにアップロードされた前後のこと、vLLM-Omniはfeat: add byte5 support for Mingというタイトルの変更をマージした。これはByT5グリフエンコーダを新しいming_flash_omniパイプラインに組み込むものだ — この専用コンポーネントの仕事はただ一つ、あなたが求めた画像ではなく、描画を求めた文字を見ることにある。これはコードを読んで初めて分かる種類の詳細であり、まさにQwen-Image 3.0 — ベンダーのクローズドなホスト型画像モデルで、2026年7月21日に出荷され、8月5日に一般提供開始となった — が誰にも一切読ませない詳細でもある。どちらのモデルも、読みやすい文字組みが難しい部分となるデザイン作業を狙っている。その仕組みを教えてくれるのは、そのうちの一方だけだ。

それぞれがテキストについて述べていること

Qwen-Image 3.0 のテキストレンダリングに関する説明は、完全にローンチ時の主張であり、紙の上では優れたものです。Alibaba の資料では、プロンプトは最大およそ4,500トークン、判読可能なテキストは最小で約10ピクセル、12言語・20種類以上のフォントをカバー、出力は最大2048×2048、1回の呼び出しで最大6枚の画像、そして単一のホスト型APIを通じてPro版とStandard版で提供されると述べられています。しかし、それを検証するための重みの公開も、明示されたライセンスも、モデルカードも、技術レポートも、公開されたベンチマーク表もありません。広く繰り返されている約20BのMMDiTパラメータ数は、確認されたものではなく伝聞です。

Ming-Image-0.1-Designのストーリーはリポジトリです。6,154,901,056個のパラメータ、MITライセンス、diffusersパイプラインタグ、すべての重みはBF16 safetensors形式で、約71.5 GBが以下にまたがります:connector/mllm/mlp/scheduler/transformer/vae/。推奨推論は2048×2048で12サンプリングステップ、ガイダンス1.0、1台の80 GiB CUDA GPU上で、または速度のために1024で、vLLM-Omniはデプロイ用に指定され、別の視覚言語モデルはプロンプト拡張用に指定されています。カードは、UI、インフォグラフィック、ポスター、その他のテキストリッチなビジュアルデザイン向けのテキストから画像へのモデルであり、透明な背景のためにRGBA出力を持つと説明しています。

その2つの段落は同じ種類の記述ではないし、なぜそう言えるのかは率直に言っておく価値がある。一方は、その製品を売っている人たちが書いた製品の説明だ。もう一方は、誰でもダウンロードして確認できる成果物についての説明だ。

グリフエンコーダーは、カテゴリを説明する部分です。

画像モデルにおけるテキストレンダリングは、通常、ある特有の仕方で失敗する。モデルは、書かれているように見えて実際には書かれていないものを生成する。字形はもっともらしいのに、単語は間違っている。その理由は、何よりもまずアーキテクチャ上のものである。ほとんどの画像モデルには、文字を文字として見るコンポーネントが存在しないため、文字は草と同じように視覚的統計から再構築される。

vLLM-Omni のコミットが興味深いのは、まさにそれがその点を指し示しているからだ。追加されたファイル、すなわち byte5_encoder.pypipeline_ming.pyt5_block_mapper.py とステージ入力プロセッサは、ある経路を記述している。そこでは ByT5 のバイトレベルエンコーダが画像に現れるべきテキストを読み取り、トークナイザの語彙がフォントと色のマーカーで拡張され、得られた特徴量がシーケンス次元に沿って付加され、ネガティブ側はゼロを受け取る。この最後の細部こそ、これが単なる配線作業ではなく実際の設計判断であることを示す決め手だ。もしネガティブ分岐が同じグリフ特徴量を担っていたなら、classifier-free guidance はテキストの描画へと引き寄せられ、プロンプトから遠ざかってしまう。つまりゼロは、この二つの目的がぶつかり合わないようにするために存在している。エンコーダは、チェックポイントが実際に byte5/サブフォルダを含む場合にのみ読み込まれる。

正直さについて2点。これはサードパーティ製の推論フレームワークのコミットであり、Ant Groupの声明ではなく、それらのファイルが何を意味するかという解釈はベンダーのものではなく私たちのものである。そしてこれは結果ではなく設計意図を裏付けるものである。グリフエンコーダが存在することは良好なテキストレンダリングと整合するが、テキストレンダリングが良好であることの証拠ではない。品質に関する唯一の独立した証拠は、以下で述べる単一のリーダーボード上の順位である。

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Qwen-Image 3.0との対比は、Alibabaのモデルがテキストを下手に描画するという点ではない——Alibabaの外部には、それがどれほどうまくテキストを描画するか言える人はいない、それこそが要点だ。対比のポイントは、「このモデルはどう文字を描くのか」という問いに対して、一方のモデルには答えがあり、他方にはマーケティング上の主張しかないということ、そして答えと主張の間の隔たりこそが、エンジニアリング上の意思決定が行われる場所だ。

唯一の数字、そしてそれが載っていない盤

Ming-Image-0.1-Designは、Artificial AnalysisのUI/UXデザイン向けText to Imageリーダーボードのオープンウェイト表示で、Elo 1,082で第1位にランクされている——Ideogram 4.0(Quality)の1,052、Ideogram 4.0の1,015、HunyuanImage 3.0 Instructの1,005、FLUX.2 [dev]の1,000、FLUX.2 [dev] Flashの999、FLUX.2 [dev] Turboの994を上回っている。そのボードのコピーはモデル自身のカードに転載されているもので、Artificial Analysisのブランディングが付されている。誰もそのスコアを独立に再現していない。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

それはオープンウェイトのボードであり、Qwen-Image 3.0 はエントリーしていないため、その不在は品質について何も語らない。それが語っているのは構造的なことだ。ブラインド選好ボードは、重みが公開されているモデルしかランク付けできない。そのことは、オープンなリリースに、製品が存在する何か月も前に測定可能な位置づけを与え、クローズドなリリースにはマーケティング用の数字を与えるだけで、それ以外は何も与えない。Qwen-Image 3.0 の主張——10ピクセルの可読性、4,500トークンのプロンプト、20種類以上のフォント——には、その背後に独立した測定が一切ない。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

実際にこれをどうテストするのか、そして試すにはどれくらいのコストがかかるのか

読みやすい文字が理由でこれを読んでいるのなら、そのテストはリーダーボードではない。それはあなた自身の書体、あなた自身の言語、あなた自身の文字列を、両方の候補に通して人が読むものだ。そのテストには、これらのモデルの一方が手軽に使えて安価であること、もう一方がダウンロード可能であることが必要で、両者は正反対の原則で価格設定されている。

• Qwen-Image 3.0 — Pro版では1画像あたり約0.04ドル、Standard版では約0.03ドルで、国内の消費者向け価格は1画像あたり約¥0.18から。これらは提供開始時の数値であり、監査は受けていません。今日の午後にはプロンプトマトリクスを実行し、呼び出しごとに支払うことができます。

• Ming-Image-0.1-Design — 公開価格はありません。ホスト型エンドポイントが存在しないためです。コストは 71.5 GB のダウンロード、80 GiB のカード、そして自分自身の時間であり、利点は、同じテストをグリフエンコーダの経路に向け、実際に処理を担っているのがそのコンポーネントなのかを確認できることです。

これはまさにルーティングレイヤーが想定している状況であり、そのどの部分が当てはまるのかを正確に押さえておく価値があります。Qwen-Image 3.0 も Ming-Image-0.1-Design も当社のプラットフォーム上には存在しないため、ルーティングレイヤーが今日どちらかをキーの背後に置くことはできません。できるのは、あなたが比較を実行している間、その比較を公平に保つことです:OrcaRouter は 200 以上のモデルを OpenAI 互換の単一エンドポイントの背後に、プロバイダーの定価で、マークアップなしで提供し、プロバイダー間の自動フェイルオーバーを備えていますそのため、すでに信頼しているモデルが本番経路を担い続けることができ — そのコストはプロバイダーの定価に紐づいたままなので、ベンダーの料金改定は同じ日に当社側に反映されます — 一方で、まだ測定されていないデザインモデルは、その前に立つのではなく、その隣で評価されます。

オープンなリリースが2つ、クローズドなリリースが1つ、そしてあるパターン

特筆すべきは、Ming のリリースが、それ自体を超えて何の証拠になっているかである。Ant Group は、6.15億パラメータの設計モデルを MIT ライセンスの下で、何の告知もなく公開し、同じライセンスの下でレイヤー分解用の第2のモデルも公開した。Alibaba は、ライセンスもモデルカードもレポートもないクローズドなホスト型モデルを公開し、同じ種類の作業を対象とし、画像ごとの課金にした。

それらは、デザインモデルにおける価値がどこにあるかについての2つの異なる賭けだ。一方は、モデルが製品であり、重みが流通チャネルだと言う。もう一方は、モデルはサービスであり、重みは手元に残しておくものだと言う。どちらの賭けも同じ市場で正しくなり得るし、評価時に唯一重要な問い――依存する前に、これがどう機能するかを知ることができるか――に対しては、まったく異なる答えを生み出す。

• テキストがどのようにレンダリングされるのか、そしてなぜ時々そうならないのかを知る必要があるなら — Ming-Image-0.1-Design は、2つの中で唯一、実際に確かめられるものであり、MIT ライセンスによって、見つけた内容に基づいて行動できます。

• 画像1枚あたりの課金でインフラ不要の本番用エンドポイントが今すぐ必要な場合、二者のうちそれを提供しているのは Qwen-Image 3.0 だけで、その内部構造も料金に含まれています。

• 導入を決める前に独立した証拠が必要なら——どちらも十分とは言えない。一方は一度しか再現されていないリーダーボード上の順位だけで、もう一方は数字が一切添えられていないベンダーの主張資料にすぎない。

注視すべきは、このパターンが続くかどうかだ。グリフエンコーダーを内蔵した、告知なしのMITによるリリースは、その作者たちがモデルをどう使われると想定しているか——検査され、ローカルで実行され、改変されること——を示す声明である。同じチームからの次のリリースが告知され、ベンチマークされ、ホストされるなら、あれは一度きりのものだったということだ。もしそれがまた静かなリポジトリなら、デザインモデルというカテゴリーには2つ目のオープンな競合が存在することになり、市場のクローズドな側は7月にはなかった価格問題を抱えることになる。