ヒーロータイトルカードは「Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash」、サブタイトルは「一方はレイヤー化されたデザインを返し、もう一方は静止画を一切返せない」で、2枚のミニマルなアイコンカードを伴う。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

Ming-Image-0.1-Design 対 Gemini Omni 1.1 Flash:デザイン成果物には両方の半面が必要

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

に動画を頼むと、Ming-Image-0.1-Design静止画が返ってくる。Gemini Omni 1.1 Flashに静止画を頼むとエラーになる — 同モデルのドキュメントには、画像生成、画像編集、画像とテキストのインターリーブ出力がこのモデルではサポート対象外の機能として記載されている。つまり、この2つを2列に並べたページは、レンダラーとプロジェクターを比較しているようなものだ。本当に比較する価値があるのは、デザインチームが繰り返し間違えている点だ。出荷される成果物には通常、画面と動くアセットが必要で、この2つのモデルはその半分ずつを担っている。その間の受け渡しが、静かに作業を台無しにするのだ。

Ming-Image-0.1-Designは、inclusionAIの6Bテキストから画像へのモデルで、MITライセンスで公開され、重みは2026年9月17日に公開された、テキスト密度の高いグラフィックデザイン向けに作られている。Gemini Omni 1.1 FlashはGoogleの本番向け動画モデルで、2026年8月27日から一般提供されており、同期した音声を伴うショートフォームのモーション向けに作られている。どちらももう一方の代替ではなく、興味深い問いは両者の間で何が起こるかだ。

二つの半分を、率直に述べれば

まず、それぞれが実際に何を返すかから始めよう。ほかのすべてはそこから続いてくる。

• 出力 — Ming-Image-0.1-Design は静止画像を返し、12サンプリングステップと CFG 1.0 で最大 2048×2048、速度重視なら 1024×1024 です。Gemini Omni 1.1 Flash は動画を返し、10秒の生成呼び出しと延長呼び出しから組み立てられた最大40秒です。

• 透過性 — Ming-Image-0.1-Design は、プロンプトが文書化された透過フレーズで始まる場合にネイティブ RGBA を出力するため、アルファはサンプラーから得られます。Gemini Omni 1.1 Flash には透過出力がなく、パイプラインにも透過動画フォーマットは存在しません

• 構造 — Ming-Image-0.1-Design のコンパニオン Layer モデルは、平坦化されたデザインを2~9枚の個別の RGBA PNG に分解し、それらは元のデザインに再合成される。Gemini Omni 1.1 Flash は単一の平坦化されたクリップを返す

• 参照入力 — Ming-Image-0.1-Design は参照画像を必要とせず、プロンプトのみから生成します。Gemini Omni 1.1 Flash はプロンプトごとに最大10枚の画像と最大3つの3秒の参照ビデオクリップを受け入れ、シーンを延長する際には最大10秒の以前の映像を読み取ります。

• 解像度の上限 — Ming-Image-0.1-Design はネイティブ 2048。Gemini Omni 1.1 Flash はネイティブ 720p でレンダリングし、1080p および 4K へアップスケール、さらに 360p のドラフト用ティアを備える

• コスト — Ming-Image-0.1-Design にはホスト型の価格がありません。ホスト型エンドポイントが存在しないためです。そのため、コストは 80 GiB カード 1 枚上でのあなた自身の GPU 時間です。Gemini Omni 1.1 Flash は 720p で 1 秒あたり $0.10 を請求し、360p ドラフト階層では 1 秒あたり約 $0.03 です

• ライセンス — Ming-Image-0.1-Design は MIT、商用利用可。Gemini Omni 1.1 Flash の商用 API で、その出力には SynthID ウォーターマークが付与されます

A rendered two-column scoreboard headed 'Two halves', titled 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'. The Ming-Image-0.1-Design column reads: returns a still to 2048 x 2048; 12 steps, CFG 1.0; transparency native RGBA; structure 2-9 editable RGBA layers; cost your own 80 GiB GPU; independent placement #1 open weights in the UI/UX slice. The Gemini Omni 1.1 Flash column reads: returns video to 40 seconds; 10-second calls with 10s lookback; transparency none and no alpha video; structure one flattened clip; cost $0.10 per second at 720p; independent placement top of the video arenas with no audio.

ハンドオフが途切れる場所

もし両方を生成するデザインパイプラインを構築しているなら、方向は一方通行だけです。Ming-Image-0.1-Design がフレームを作り、Gemini Omni 1.1 Flash がそれをアニメーション化します。逆は存在しません。そして、その間の継ぎ目こそが、デザイン作業が失われる場所なのです。

最初に犠牲になるのはアルファチャンネルだ。透明背景で生成された UI アセットこそ、そもそも RGBA を出力するサンプラーを使う理由である——切り抜きパスなしで既存のレイアウトにそのまま載せられるからだ。そのフレームを動画経路に流すと透明性は失われる。それを保持できる透過動画出力が存在しないからだ。透明性は、クリップが戻ってきた後に適用されるコンポジター内で生き残るのであって、モデルチェーン内ではない。クリップが存在する前にコンポジットを計画するチームは、結局それをやり直すことになる。

2つ目の犠牲になるのは解像度です。Ming-Image-0.1-Designはネイティブで2048でレンダリングします。Gemini Omni 1.1 Flashはネイティブで720pでレンダリングし、そこからアップスケールします。2048ピクセルのデザインフレームを720pのレンダリング経路に通すと、詳細の大半は捨てられ、その後に続くアップスケールは、あなたが制御していないベンダー側の工程です。

第三はテキストです。Ming-Image-0.1-Design の全前提は、レンダリングされたテキストが、それが実際に読まれるサイズのまま判読可能であり続けること——Artificial Analysis UI/UX Design スライスでその 1,084 Elo が測っているのは、まさにこの軸です。そのフレームをアニメーション化する動画モデルは、コピーを再レンダリングするのではなく、与えられたピクセルを動かすだけです。フレームのパースペクティブ、スケール、ライティングを変える動きは、タイポグラフィもそれに合わせて動かしてしまい、静止画では判読できていた小さな文字は、その変換を経ても生き残れません。

そのいずれも、どちらのモデルの欠陥ではない。それは、成果物が、互いに受け渡すようには設計されていない2つのシステムにまたがって分割されたときに起こることだ。そして解決策はモデルの選択ではなく、制作上の判断である。成果物のどの層を平坦化してよいかを決め、それを意図的に平坦化することだ。

それぞれの半分が実際に得意なこと

Ming-Image-0.1-Design の根拠はサードパーティーのアリーナである。Artificial Analysis の Text to Image リーダーボードでは、21,342 票で Elo 995 の 104 中 45 位にあり、同ボードの UI/UX Design スライスでは、スライス内 2,100 票で Elo 1,084 を記録し、オープンウェイトモデル中 1 位である。これら二つの数値の差こそが、このモデルを正直に表している。すなわち、汎用モデルではなく、測定された専門特化モデルである。その Layer コンパニオンの数値 — Crello テストセットにおける 1024 での RGB L1 誤差 0.0574 と alpha soft IoU 0.8923 — はベンダー報告値であり未再現であるため、その旨を明記すべきである。

Gemini Omni 1.1 Flash の根拠もまた独立しているが、別のリーダーボードでの話だ。Artificial Analysis では、2026年9月2日時点で、音声なしカテゴリのテキスト→動画と画像→動画の両アリーナで首位に立っており、Elo は1,324と1,364だった。音声を有効にすると1,237と1,180に下がり、2位と4位になる。この音声の差は、スペックシートが隠し、リーダーボードが暴く細部であり、ボード首位という主張を軸にキャンペーンの予算を組む前に知っておく価値がある。

二つのボードは重ならない。そこが要点だ。デザインのスチルと10秒のクリップが互いに比べられ評価される場など存在しないし、そうでないとほのめかす記事はスコアボードをでっち上げているだけだ。

Screenshot of Google's Gemini API models documentation at ai.google.dev/gemini-api/docs/models, captured 24 September 2026 in English. The left navigation lists Gemini 3, Nano Banana, Veo, Gemini Omni Flash, Lyria 3.5 & Lyria Clip, Text-to-speech, Transcribe and other model families. The body shows the Models guide heading, a Gemini 3 section with Gemini 3.8 Flash, Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking cards marked New and Stable, and a Generative media models entry in the on-this-page rail.

分割に要するコスト、試行あたり

二つの半分の経済性は比較できるものではなく、一つの予算項目に平均化すべきではない。

静止画側では、ハードウェアさえあれば Ming-Image-0.1-Design は画像1枚あたりのコストがかかりません。そのため、重要な意味でイテレーションは無料になります。午後のひとときで20種類のダッシュボードのバリエーションを生成し、そのうち19種類を捨てられます。動画側では、Gemini Omni 1.1 Flash での10秒・720pクリップは約$1.00の請求になります。同じ10秒を360pのドラフト階層で行うと、およそ$0.30です。720pの完全な40秒シーン — 1回の生成と3回の延長呼び出し — は約$4.00になります。Googleは1080pおよび4K階層の秒単位料金を公開しておらず、1秒あたり$0.15および$0.30と記載するリセラーの出品情報はベンダーの数値ではなくマーケットプレイスによる推定値であるため、高解像度制作の予算は暫定的なものにとどまります。

実務上の帰結として、この二つの部分は正反対の進め方を求める。静止画では反復しよう。そこでは再試行は無料だ。動画では一発で決めよう。そこでは再試行のたびに課金される。動画側で反復するチームは、請求書を見て驚くチームだ。なぜなら、最初のフレームは無料で、撮り直しはすべてを食うからだ。

ここでルーティング層がどこに収まるかは、営業トークが示唆するほど広くはなく、正確に述べておく価値がある。Ming-Image-0.1-Design は MIT のダウンロード品だ — OrcaRouter は inclusionAI のモデルを一切ルーティングしないので、これは自分のハードウェアで動かすか、さもなければ動かないかのどちらかになる。Gemini Omni 1.1 Flash は独自のキーと独自の秒単位メーターを持つベンダー API であり、当社もこれをルーティングしていない。Google は Omni 動画 API をサードパーティのルーティングに開放していない。モーション側で当社が実際に扱っているのは Kling の動画シリーズで、kling-v3kling-v3-omnikling-video-o1、さらに MiniMax H3 が含まれる — つまり、成果物のアニメーション部分に、2つ目のベンダー契約ではなくホスト型のルートが必要なら、当社側にそれが存在する。画像側では、OpenAI の GPT-Image ファミリー、Google の Imagen 4 の各ティアと Gemini の画像プレビュー、そして xAI の Grok Imagine 画像エンドポイントを扱っている。その理由は、プロバイダーの定価が0%のマークアップでパススルーされるからであり、けっして上乗せされるのではない。したがって、そのいずれかでベンダーが値下げすれば、当社側では当日から反映される。

A rendered summary card headed 'The handoff', titled 'What a still loses on the way to motion', listing four losses: the alpha channel (Ming-Image-0.1-Design emits it from the sampler, Gemini Omni 1.1 Flash has no transparent video output); resolution (2048 x 2048 in against a path that renders natively at 720p and upscales); typography (the video model moves the pixels it is given and does not re-render the copy); and working style (stills iterate for free, video bills about $1.00 per 10 seconds at 720p and about $0.30 at the 360p draft tier).

決断を、一気に

• 編集可能なデザインアセットが必要です — Ming-Image-0.1-Design、その理由はレイヤー分解にあります。透過切り抜き、アイコン、スプライト、レイヤー合成は、RGBAを出力するサンプラーがパイプラインから工程を丸ごと1つ取り除く領域です。

• 動きを、測定可能な形で必要なら — Gemini Omni 1.1 Flash。2つのうち、ボードのトップに独立したアリーナ結果を持つ唯一のものであり、予測に組み込める1秒あたりの公開価格を持つ唯一のものです。

• 両方が必要だ — ビデオ分の予算はアセット単位ではなく試行単位で計上し、アルファチャンネルが残っていると決めつけず、クリップが戻ってからコンポジットを計画すること。

• 出力を売り込む必要がある — Gemini Omni 1.1 Flash は間違いなく安全な方だ。MIT が Ming-Image-0.1-Design の重みをカバーし、Google の API 利用規約が動画をカバーしているからだ。透かしがそのトレードオフだ。すべての Omni クリップには SynthID が付与されるが、Ming-Image-0.1-Design の出力には一切付与されない。

次に注目すべきは、また別の直接対決ではない。inclusionAIがMing-Image-0.1-Designにホスト型エンドポイントを接続するかどうか——それがかなえば80 GiBという参入コストが消え、この比較は根本から変わる——そしてGoogleがOmniの動画ボードで音声の差を埋めるかどうかだ。予算を手にするのはデザイン成果物のどちらの半分か、それを決めるのはまた別のスコアボードではなく、この2つの事実である。