
MAI-Image-2.5-Pro vs Grok Imagine Image 2.0:画像生成における編集ファーストの2つの賭け
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
今年最も注目すべき画像モデルの2つは、編集こそが未来であり、生成は前提条件にすぎない、という大きな考え方で一致している。MAI-Image-2.5-Pro(マイクロソフト、7月23日よりFoundryで公開プレビュー提供中)とGrok Imagine Image 2.0(xAI、8月7日にGrokアプリのデフォルト「Quality Mode」としてリリース)は、どちらもまず編集ツールとして自らを売り込む。だが、それを証明するために構築したツールは異なる。マイクロソフトのモデルは品質エンジンだ。外科的で一貫性を保つ編集を行い、Artificial Analysis Image Editing Arenaで1位にランクされている。xAIのモデルは編集環境だ。もう一つの主要アリーナで2〜3位にランクされる生成モデルを中核に、Magic Wand、セグメンテーション、背景除去、Smart Resizeといったユーザー向けツール一式を備える。一方は忠実度で評価され、もう一方はワークフローで評価される。それが両者の本当の違いだ。
編集ツールセットは同じ形ではありません。
• MAI-Image-2.5-Pro — これはツールボックスではなく、エンジンです。指示と画像を渡せば、対象オブジェクトの置換、レイアウト変更、画像内テキストの更新、アーティファクトの除去といった、精密で外科的な編集を実行します。その間、被写体のアイデンティティ、照明、テクスチャは反復を重ねても一貫して保たれます。Microsoftが報告する94%のマルチイメージ文字一貫性という主張(ベンダー報告値)がすべてを物語っています。1つだけ変えて、他はすべて維持する、と。
• Grok Imagine Image 2.0 — 環境です。Magic Wand(選択した領域のみを編集)、Segmentation(正確な領域の色を変更または置換)、背景除去、複数参照入力(コンシューマーアプリでは最大5枚、APIでは3枚)、Smart Resize(1つの画像を9つのアスペクト比に再構成)、そしてプロダクト写真、ヘッドショット、Eコマース、ゲームアセット、マーケティングポスター用のテンプレートを備えています。
そのリストを読めば、位置付けは明確になる。MAI-Image-2.5-Proは開発者がAPIを向けるモデルであり、Grok Imagine Image 2.0はユーザーがUIの中で操作するモデルだ。xAIは発表時にこれを「編集環境」と呼んだが、そのツールセットはまさにその通りだ。
それぞれの順位
• MAI-Image-2.5-Pro — Artificial Analysis Image Editing Arena で第1位(Elo 1,272、盲検投票約6,100件);テキストから画像生成で第7位(1,292 Elo)。独立した盲検嗜好スコアリング。
• Grok Imagine Image 2.0 — xAIのローンチ時の主張は、Arenaのテキストから画像へのリーダーボードでGPT Image 2に次いで世界第2位というものでした。8月10日のスナップショットでは、GPT Image 2(1,381)とマイクロソフトの新しいMAI-Image-2.6(1,336)に次ぐ第3位(Elo 1,316)でした。この順位は独立した暫定的なものであり、xAIの「世界第2位」という表現は、その後のライブボードが改訂したベンダーによるローンチ時の主張であると明示すべきです。
どちらのモデルも相手のホームグラウンドで先頭を走っておらず、相手のメインボードのトップも保持していない。明確な読み方はこうだ。Microsoftのモデルは編集スコアで優れており、xAIのモデルはツーリングで優れて、生成のトップ付近に位置している。

テキストレンダリング、決め手となる機能
画像内テキストは、この2つが最も大きく分かれる点であり、独立した証拠が一方的な点でもある。MicrosoftはMAI-Image-2.5-Proについて、英語、中国語、日本語、韓国語、スペイン語にわたって96.8%のテキスト描画精度を主張している。これはベンダー報告による未検証の数値であり、メガピクセル出力上限とセットになっているが、多言語対応という実質的な表明能力ではある。Grok Imagine Image 2.0の独立したテスト結果は、OrcaRouter自身によるGPT Image 2との比較評価として公開されており、CJKテキストの描画が信頼できないことを示している。あるテストでは、映画ポスターの見出しで簡体字を要求したのに繁体字で描画され、ローカライズ広告作業には致命的な不合格点となった。画像内に判読可能な単語が含まれるワークフローであれば、書面上はMAI-Image-2.5-Proの方が安全な選択肢であり、Grokのテキスト品質は、信頼する前に自社素材で試して確認する必要がある。
価格
• MAI-Image-2.5-Pro — トークン課金制: テキスト入力100万トークンあたり$5、画像入力100万トークンあたり$8、画像出力100万トークンあたり$106。Artificial Analysisの換算では、1024×1024の画像は約1,000枚あたり$108.50。
• Grok Imagine Image 2.0 — 画像ごとの定額料金で、トークンは不要:品質ティア(`grok-imagine-image-quality`)では1Kまたは2Kで1枚あたり0.05ドル、標準ティアでは0.02ドル。編集時は入力と出力の両方が課金されます。1Kの場合、 1,000枚の品質画像あたり50ドル — これはMAI-Image-2.5-Proの1,000枚あたりの価格の約半分で、プロンプトの長さに左右されない固定コストです。
価格設定モデルは根本的に異なります。Microsoftのトークン課金は長いプロンプトや大きな出力にペナルティを課しますが、xAIの画像あたりの定額料金は予測可能で、プロンプトの長さに依存しません。大量利用の場合、定額料金の方が予測しやすく、品質層の価格もMAI-Image-2.5-Proよりも安価です。

可用性とルーティングの角度
両方とも利用可能ですが、アクセス方法が異なります。MAI-Image-2.5-Pro は Microsoft Foundry のプレビュー版および MAI Playground で提供されており、Microsoft アカウントが必要で、プレビューレートカードが適用されます。Grok Imagine Image 2.0 は 8月7日に xAI のコンシューマーアプリでリリースされ、その品質ティアは xAI の Imagine API から呼び出せます。また、8月中旬以降は OrcaRouter の OpenAI 互換エンドポイントでも利用可能で、標準ティアと品質ティアは1つのキーの背後にあり、プロバイダー価格は0%マークアップで透過的に適用され、GPT Image 2 などのフォールバックへの自動フェイルオーバーが行われます。
これが実際に意味する違いは次の通りです。本番パイプラインでGrok Imagine Image 2.0を採用する場合、すでに使用しているかもしれないエンドポイント上でモデル文字列を変更するだけで済み、低額の定額料金と、モデルが失敗するケースに対する組み込みのフォールバックが用意されています。これはまさに、ルーティング層が捕捉するために存在する障害モードです。MAI-Image-2.5-Proを採用する場合は、今のところFoundryと直接契約する必要があり、正直なルーティングに関する注意点は1か月前と同じです。つまり、MicrosoftのプレビューがサードパーティのAPIを通じて広く呼び出し可能になったとき、そのときに初めて同じワンキーパターンがMAI-Image-2.5-Proにも適用されるということです。

評決
選ぶべきなのはMAI-Image-2.5-Proです。これは、既存画像の高忠実度編集が仕事で、出力結果が品質を保たなければならない場合に当てはまります。Artificial Analysisで独立系No.1エディタであり、実際の多言語テキストレンダリングの実力を謳っており、価格もそれに見合っています。また、選ぶべきなのはGrok Imagine Image 2.0です。これは、実際のツールを備えた編集ワークフロー、予測しやすく画像1枚あたりのコストが約半分の定額料金、そして今日からフォールバック付きでルーティングできるモデルをお望みの場合です。正直な言い方は「どちらが優れているか」ではなく、どの賭けがあなたのワークフローに合うかです。Microsoftは忠実度が編集を制すと賭け、xAIはツールセットがユーザーを制すと賭けています。どちらも理にかなっており、あなたの出力品質の要件とテキストレンダリングリスクへの許容度が決め手となります。
