
MAI-Image-2.5-Proが画像編集で第1位を獲得:マイクロソフトの独立した勝利が実際に示すもの
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
MAI-Image-2.5-Proは現在、独立系のブラインド投票ボードであるArtificial Analysisのリーダーボードで、画像編集モデルとして最高評価を獲得しています。一方、純粋なテキストから画像への生成ではまだわずか7位にとどまっています。この差こそが核心です。公開プレビューから1か月も経っていない、Microsoft AIが完全に社内で開発したこのモデルが、GPT Image 2、Reve 2.1、そして自社の姉妹モデルであるMAI-Image-2.5を編集ボードで追い抜いた一方で、「何もないところから何かを描いて」というプロンプトに対しては、同じ分野のほとんどのモデルに後れを取っています。両方の数字を合わせて読むと、Microsoftが何を世に送り出したのかが正確に見えてきます。既存の画像を変更することに特化したモデルであり、汎用の生成モデルではないのです。
二つの数字、並んで
2026年8月のスナップショット時点で、Artificial AnalysisのImage Editing Arenaでは、MAI-Image-2.5-ProはElo 1,272で第1位とされており、これは約6,100件のブラインドユーザー比較に基づいています。後続は僅差です:Reve 2.1が1,262、次いでMAI-Image-2.5とGPT Image 2(high)が1,256で同率、GPT Image 1.5(high)が1,250、Qwen-Image-3.0-Proが1,249、GogleのNano Banana 2が1,249です。Text-to-Image Arenaでは、これはElo 1,292で第7位で、GPT Image 2(high)の1,369、Reve 2.1の1,322、Nano Banana 2の1,320、GPT Image 1.5(high)の1,310、MAI-Image-2.5の1,304、Nano Banana Proの1,296に次ぐ位置にあります。
• 編集中: No. 1 — 1,272 Elo、約6,100サンプル
• テキストから画像生成: No. 7 — 1,292 Elo、約11,500サンプル
• 編集における2位との差: Reve 2.1より10 Elo高い
• テキスト画像生成における1位との差: GPT Image 2より77 Elo下回る(高)
編集ランクが虚飾の数字以上の価値を持つ理由は、その仕組みにある。Artificial Analysisのアリーナは、ブラインド方式の人間の好みに基づく評価だ。投票者は同じ入力画像と指示を見て、2つの編集結果を比較し、より優れた方を選ぶ。スコアを書き込むベンダーのスクリプトなど存在しない。したがって、そこでの#1は「人々がこの編集者の出力を最も好んだ」という市場が持ちうる最も近い指標であり、それは最近の上昇であって、発売日の一時的な数字ではない。方向性は確かなものと捉え、正確なEloは暫定的なものと見なすべきだ。投票数が少ないボードは変動するからだ。

同じ日に取得されたテキスト画像生成ボードは、同じモデルを別の光で映し出す — もはや首位ではないが、1,290〜1,370 Eloに密集するフィールドの中で、依然としてトップ10に余裕を持って収まっている。

MAI-Image-2.5-Pro の正体
MAI-Image-2.5-Pro は、Microsoft AI による MAI-Image-2.5 ファミリーの高品質ティアで、2026年7月23日に MAI-Voice-2-Flash とともに発表され、Microsoft Foundry (Azure AI Foundry) と無料の MAI Playground でパブリックプレビューとして提供されました。Microsoft はこれをこれまでで最も忠実度の高い画像モデルであると説明しており、ヒーローイメージ、詳細な編集、画像内の正確なテキスト描画を目的としています。このファミリーは現在、コストカーブ全体を網羅しています。バランスの取れた作業向けの MAI-Image-2.5、大量処理向けの MAI-Image-2.5-Flash、そして品質面の最上位に位置する Pro ティアです。さらに、新しい兄弟モデルである MAI-Image-2.6 は、8月19日時点で既にプライベートプレビューに入っています。
Microsoft自身によるProティアの主張は、すべてベンダーによる報告であり、独立して再現されたものはまだない:
• 96.8%のテキスト描画精度 — 中国語、英語、日本語、韓国語、スペイン語をカバーするとされているが、同じドキュメントでは出力が約1メガピクセルに制限されているため、この主張の「8K」という表現はマーケティング用語と見なすのが妥当だ。
• GPT-Image-1.5よりプロンプト追従性が27%高い(Microsoftの内部評価による)。
• マルチイメージのキャラクター一貫性94%世代をまたいだ
• GPTモデルと比較してGPUコストが最大84〜89%削減(特定のMicrosoftシナリオ(PowerPoint、OneDrive)における数値であり、一般的な数値ではありません。)
文書化されたスペックシートがそれらの主張を裏付けています:テキスト入力は最大32,000トークン、131kのコンテキストウィンドウ、4,096出力トークン、JPEG/PNG画像入力、そして出力は1,048,576ピクセル(1024×1024相当)に制限されます。その最後の数字は購入者にとって重要です。これは高品質なエディタであり、印刷解像度の生成器ではありません。
品質が際立つ場所
リーダーボードが測定している編集強度は、マイクロソフトが強調している点と一致しています。{{1}}画像の他の部分の整合性を保ちながら行う、正確で外科的な編集です。ターゲットを絞ったオブジェクトの置き換え、レイアウト変更、画像内テキストの更新、モーションブラーなどのアーティファクトの除去——{{/1}}こうした編集は、旧世代のモデルではシーン全体を再生成して被写体を見失ってしまう類のものです。その点と94%のキャラクター一貫性の主張を合わせれば、{{2}}商業的に重要なワークフロー、つまり既存アセットを取り込み、1箇所だけ変更して出荷する——のために設計されたモデルであることが分かります。{{/2}}
#7のテキストから画像へのランキングは、正直なカウンターウェイトである。空のプロンプトから、MAI-Image-2.5-Proは優れているがリーダーではない — GPT Image 2 (high)から77 Elo遅れているのは、ブラインドボード上では実際の差である。Microsoftは現在、テキストから画像への王座を主張しているわけではない。編集の王座を主張しているのであり、データは広い主張よりも狭い主張の方をはるかに裏付けている。
料金
MAI-Image-2.5-ProはFoundry上でトークン従量課金です:テキスト入力トークン100万件あたり5ドル、画像入力トークン100万件あたり8ドル、画像出力トークン100万件あたり106ドル。マイクロソフトは画像1枚あたりのトークン数を公表していないため、画像1枚あたりのコストは計算値であり、公式見積もりではありません。Artificial Analysisの換算によると、1024×1024の画像の場合、コストはおよそ108.50ドル(画像1,000枚あたり)になります。これは姉妹モデルのMAI-Image-2.5(1kあたり約48ドル)の約2.3倍、MAI-Image-2.5-Flash(1kあたり約20ドル)の約5.4倍であり、Proティアは意図的なプレミアム価格設定です。
プレビュー価格はGA価格ではありません。プレビューの料金表は、一般提供開始前に変更される可能性があります。変更された場合、パススルールーティングレイヤーによって、値下げが当日中に請求書に反映されます。OrcaRouterでは、プロバイダーのリスト価格が0%のマークアップでそのまま渡されるため、MAI-Image-2.5-Proが呼び出し可能なサードパーティAPI経由で利用可能になれば、Microsoftが請求する金額がそのままお客様が支払う金額になります。再交渉も、追加の契約も不要です。

なぜ1位はモデル単体ではなく、マイクロソフトという企業に属するのか
リーダーボードの結果が発表されたのは、マイクロソフトが第三者製の画像モデルを自社製モデルへと目に見えて置き換えつつある時期と重なる。MAI-Image-2.5はすでにBing Image Creatorのデフォルトエンジンとなっており、PowerPoint、OneDrive、Dynamics 365 Contact Centerでも動作している。Proティアは、より高忠実度の作業向けに位置づけられた同じファミリーだ。マイクロソフトは、MAIモデルが「第三者モデルからの蒸留を経ずに」クリーンで追跡可能なデータでトレーニングされていると述べている。これはOpenAI依存への直接的な回答であり、コスト削減の主張(PowerPointでのGPUコスト最大84%削減、ベンダー報告・特定シナリオに基づく)も同じストーリーの一部である。つまり、置き換え対象のモデルよりもタスクあたりのコストが低い自社製モデル、というわけだ。
独立したリーダーボードがなければ、そのいずれも懐疑的な買い手に証明することはできないでしょう。だからこそ、1位は単なるスコアではなく戦略的に重要なのです。これは、マイクロソフトの社内画像ラインが、それが作られた特定のタスクにおいて競合他社を上回るという最初の独立した証拠です。
次に見るもの
• 編集リードは投票が蓄積されるにつれて維持されるか? ~6,100サンプルでの1,272 Eloはリードであり、確定ではない。Reve 2.1は10ポイント差。
• 一般提供と最終料金表 — プレビュー価格はGA価格ではありません。
• 解像度の上限。 1メガピクセルという上限により、Proは印刷用途には不向きだ。マイクロソフトがこれを撤廃すれば、状況は一変する。
• MAI-Image-2.6(プライベートプレビュー、8月19日)— 次のファミリーステップであり、もう一方の主要アリーナではテキストから画像生成で2位にランクインしています。
• ベンダーの主張に関する独立した評価 — テキストレンダリングの精度と文字の一貫性は、Microsoft以外では未検証です。
スプリットボードから得られる教訓は、「マイクロソフトが今や最高の画像モデルを作っている」ということではない。それはもっと狭く、もっと有用なものだ: マイクロソフトは現在、独立したリーダーボードで最も評価の高い画像エディターを、プレミアム価格で、プレビュー版として、厳格な解像度上限付きで提供している。 あなたの作業が既存の画像を変更すること(ヒーローショット、商品ビジュアル、画像内テキスト)なら、それはまさに注目すべきモデルだ。あなたの作業がまっさらなキャンバスからの生成なら、7位というランクは、より良い選択は依然としてGPT Image 2であることを示している——そしてそれが両方の数字が示す正直な読み方だ。
