Microsoft Foundryでプレビュー公開中のMAI-Image-2.5-Proと、画像ティアが未リリースのBlack Forest Labs製マルチモーダル基盤モデルFlux 3との対戦を紹介するヒーローカード
Guides & Insights

MAI-Image-2.5-Pro vs Flux 3:同じ発売週、二つの異なる現実

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MAI-Image-2.5-ProFlux 3は、同じ週(2026年7月23日)に発表された。1ヶ月後、両者は異なる宇宙にいる。MAI-Image-2.5-Proは、Microsoftの品質重視の画像モデルであり、Microsoft Foundryでパブリックプレビュー中であり、Artificial Analysis Image Editing ArenaでNo. 1に上昇した(Elo 1,272、約6,100のブラインド投票による)。Flux 3は、Black Forest Labsの統合マルチモーダル基盤モデルであり、その階層のうち動画のみをリリースしており、画像階層には公開エンドポイントも価格も誰も実行できるベンチマークもない。「どの画像モデルを使うべきか」と尋ねる読者には、ここには2つの候補があるのではなく、1つの製品と1つの約束があるだけだ。

それぞれが実際に何なのか

MAI-Image-2.5-Pro — 焦点を絞った独自の画像生成・編集モデルで、Microsoft社内のMAI-Image-2.5ファミリーの中で最も忠実度の高いティアです。トークン課金制で、Foundry上でホストされ、ヒーローイメージ、詳細な編集、画像内テキストレンダリングを目的としています。このモデルは画像のみを扱います。

Flux 3 — 画像・動画・音声(さらにロボットの行動予測)を統合的に学習した統一マルチモーダル基盤モデルであり、BFLがSelf-Flowと呼ぶフローマッチング手法に基づいて構築されています。発表された5つのバリアントは、Flux 3 Video、Flux 3 Image、Flux 3 Action、ロボティクス向けのFlux-mimic、そしてFlux 3 Dev(オープンウェイトは2026年後半に公開予定)です。画像はより大きな構想の中の1つのモダリティであり、製品そのものではありません。

その構造上の違いは、どんな仕様よりも重要です。画像に特化したモデルはその全能力を静止画に注ぎ込みますが、マルチモーダルモデルは能力をメディア全体に分散させます。MAI-Image-2.5-Proは画像編集で勝つために存在します。Flux 3はすべてをこなす単一のモデルとして存在し、その画像機能は、まだ実現していないビジョンの一部なのです。

可用性: 全体の比較

2026年8月中旬の時点で、その非対称性は絶対的である:

MAI-Image-2.5-Pro — Azure AI Foundry 上で世界7つのリージョンにてパブリックプレビューが提供開始。無料の MAI Playground も利用できます。マイクロソフトアカウントがあれば、本日からすぐに呼び出すことが可能です。これは、Bing Image Creator、PowerPoint、OneDrive を支える製品ファミリーの品質層としてすでに位置づけられています。

Flux 3 Image — 未リリース。BFLのドキュメントには画像エンドポイントは記載されておらず、現在呼び出し可能な画像ラインはFLUX.2(Pro、Dev、Flex、Klein)のまま。Flux 3のページには「近日公開」ラベルと申し込みフォームがあり、開始ボタンはない。BFLは7月23日の発表後「数週間以内」に画像の早期アクセスを開始すると述べていたが、現時点ではモデルID、画像仕様、プロンプト制限は一切公開されていない。一般提供に達しているのはFlux 3 Videoのみ(8月4日、秒単位の課金)。

つまり、「今日の画像編集にどれを基盤として使えるか」に対する実用的な答えは、ただ一つの名前だけです。

それぞれの側が示すことのできる証拠

MAI-Image-2.5-Proの編集性能は独立に測定されています。編集部門で第1位のEloを獲得していることに加え、テキストから画像へのランクは1,292 Eloで第7位 — 良好ですが首位ではありません。スペシャリストモデルとしては正直な評価です。マイクロソフトはまた、ベンダー提供の主張も公開しています。テキスト描画精度96.8%(5言語をカバーすると明記)、内部評価でGPT Image 1.5よりプロンプト忠実度が27%向上、マルチイメージのキャラクター一貫性94%。これらはすべてマイクロソフト自身の数値として位置づけるべきです。独立しているのはリーダーボードの方です。

Flux 3 Imageには公開された証拠が一切ない。テストできる画像エンドポイントがないため、画像ベンチマークも存在しない。このファミリーでBFLが報告している唯一の数値はFlux 3 Videoに関するもの、すなわちtext-to-videoで1,135、image-to-videoで1,051という内部Eloスコアであり、BFLはこれがOmni Flash、H3、Seedance 2.0を上回ると主張している。だがこれらはベンダー申告の数値で、再現されておらず、そもそも画像版には当てはまらない。Flux 3の画質を「ベンチマーク」しているとされる記事はどれも、ビデオの数値か旧世代のFLUX.2ラインから外挿しているにすぎない。

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2Comparison scoreboard for MAI-Image-2.5-Pro and Flux 3: availability in preview on Microsoft Foundry versus image tier unreleased; image editing rank No. 1 at 1,272 Elo versus no image benchmarks; scope focused image model versus unified multimodal; text rendering 96.8% claimed versus roadmap claim of multilingual accuracy; price USD 108.50 per 1k versus no image price published; callable today versus coming soon

Flux 3が画像に対して約束すること(ベンダーのロードマップであり、仕様ではない)

BFLの画像ティアに関するロードマップの主張は、まさにそれらが主張であるがゆえに、知る価値がある:

• さまざまなスタイル、アスペクト比、解像度に対応した画像合成と編集

• 複雑なプロンプト処理の改善と高精度な多言語テキストレンダリング

• 参照画像からのゼロショットスタイル転送。複数のスタイル参照を1回のパスでブレンド

• ファインチューニングなしで世代を超えたキャラクターとブランドの一貫性

• 非破壊編集 — テクスチャ、粒子、照明、背景を保持するため、複数回の編集でも劣化しません

最後の項目こそが興味深い主張だ。それはMAI-Image-2.5-Proのsurgical-edit設計がすでに搭載し、高評価を得ている「シーンを再生成せずに編集する」という特性と同一のものだ。Flux 3 Imageがそれを実現すれば、MAI-Image-2.5-Proがすでに行っていることと直接競合することになる。「もし」が鍵となる言葉だ。エンドポイントが存在するまでは、そのリストのすべてが未検証なのだから。

コスト

MAI-Image-2.5-Pro — テキスト入力トークン100万件あたり5ドル、画像入力トークン100万件あたり8ドル、画像出力トークン100万件あたり106ドル。Artificial Analysis の換算では、1024×1024 の画像は約1,000件あたり108.50ドル。プレビュー価格であり、GAで変更される可能性があります。

Flux 3 Image — 価格は存在しない。エンドポイントが存在しないからだ。公開されているFlux 3の価格は動画のみで、フルレンダリングの場合、HDが1秒あたり$0.17、FHDが1秒あたり$0.29である。参考までに、呼び出し可能なFLUX.2画像ラインでは、BFLはFlux Proで1枚あたり約$0.04、Flux Devで$0.015を請求している。ただし、これは前世代のものであり、予測ではない。

価格は空白行と比較できません。今日のコスト比較は、MAI-Image-2.5-Proのプレミアムレートと、まったく何もないものとの比較です。

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, showing the preview launch and positioning as Microsoft's highest-fidelity image model

どれを基に構築するか

2026年に成果物が画像であるなら、答えはMAI-Image-2.5-Proです(または他のホスト型エディタの1つ — GPT Image 2は依然としてテキストから画像への生成と、もう1つの主要な編集ボードでリードしています)。これは呼び出し可能で、独立した編集スコアで第1位を獲得しており、約1メガピクセルの解像度上限が、あなたのユースケースに対して確認すべき主なポイントです。Flux 3は注目すべき項目です。画像ティアが登場したら、その非破壊編集とブランド一貫性の主張は、まさにMicrosoftが現在第1位と評価しているモデルに対して真剣にテストする価値があるでしょう。

また、その待ち時間にはルーティングという形の考え方もあります。Flux 3 Image が最終的にエンドポイントを取得したとき、ベンチマークもない真新しいモデルを採用する低リスクな方法は、トラフィックの一部をそのモデルにルーティングし、実績のあるモデルを自動フェイルオーバーとして維持することです——単一のエンドポイント、プロバイダー価格を0%マークアップで透過的に渡し、未検証のモデルがロードマップのスライドではなく実際のトラフィックでその地位を勝ち取るようにする。それが OrcaRouter が存在するためのパターンであり、MAI-Image-2.5-Pro のようなプレビュー層モデルが一般提供前に採用可能になるのと同じパターンです。

評決

同じ発売週から1か月後、MAI-Image-2.5-Proは今日すぐに利用できる確かな第1位のエディタであり、Flux 3は画像機能がまだロードマップ上の約束にすぎないマルチモーダル基盤モデルです。画質で両者を比較するのは、ボクサーとまだリングに上がっていないファイターを比較するようなものです。画像制作には今すぐMAI-Image-2.5-Proを使用し、Flux 3 Imageは、エンドポイントが実際に提供される日に再評価するリストに入れておきましょう。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube