MAI-Image-2.5-Pro(Microsoft Foundry プレビューのプレミアム編集モデル)と Bernini-Diffusers-v2(ByteDance の Apache-2.0 オープンウェイトパイプライン)の対決を紹介するヒーローカード
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2:実測No.1 対 未計測のオープンウェイトへの賭け

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を比較するMAI-Image-2.5-ProBernini-Diffusers-v2ことは、実際には2つの画像モデルを比較しているわけではない。これは、同じ問い——「既存画像の良い編集結果を得るにはどうすればよいか」——に対する2つの異なる答えを比較しているのである。一方は編集ランキング第1位の裏付けとして6,100件のブラインド人間投票を有し、他方にはREADMEしかない。MAI-Image-2.5-Proは、マイクロソフトの品質重視画像モデルであり、2026年7月23日にMicrosoft Foundryでパブリックプレビューを開始し、現在Artificial Analysis Image Editing Arenaの首位に立っている。Bernini-Diffusers-v2は、ByteDanceの第2世代統合生成フレームワークであり、2026年8月13日にApache-2.0の重みとしてHugging Faceに公開された。アナウンスもなく、ByteDance社外の誰も実行したことのない画像品質ベンチマークも存在しない。この対決における実際的な違いはすべて、この2つの事実に起因する。

片方は呼ぶもの、もう片方は走るもの。

MAI-Image-2.5-Pro — Azure AI Foundry と MAI Playground でパブリックプレビュー中のホスト型 API モデル。プロプライエタリで、トークン従量課金制。ファインチューニングやセルフホスティングには対応していません。エンドポイントが提供され、トークン単位で支払います。インフラストラクチャは Microsoft が運用します。

Bernini-Diffusers-v2 — Apache-2.0ウェイトをHugging Faceからダウンロードして自分で実行します。スタックはQwen2.5-VL-7BセマンティックプランナーがWan2.2ベースのDiTレンダラーを駆動する構成で、READMEのハードウェア推奨はPython 3.11.2 / PyTorch 2.5.1+cu124を備えたHopperクラスのGPU(H100/H800/H200)です。クラスターはご自身で用意してください。

これが一言で表した決定ルールです。組織がスタックを所有したいなら、Berniniは選択肢の一つです。組織が請求書とSLAを必要とするなら、候補になるのはMAI-Image-2.5-Proだけです。この2つは互いに代替できるものではありません。

エビデンスのギャップこそが本当の見出しだ

この2つのモデルは、画像AIにおける最大の品質問題である「出力の測定」を挟んで正反対の立場にある。MAI-Image-2.5-Proの編集スキルは独立して評価されており—Artificial Analysis Image Editing Arenaで、約6,100件のブラインド比較によるElo 1,272で第1位、Reve 2.1、GPT Image 2、そして同系列のMAI-Image-2.5を抑えての首位だ。一方、テキストから画像への生成ランクは1,292 Eloで7位であり、これが正直な均衡を示すカウンターウェイトとなっている。つまり、このモデルは白紙のキャンバスから描くリーダーではなく、編集のスペシャリストなのである。これらの数値は、ブラウザさえあれば誰でも検証できる。

Bernini-Diffusers-v2には、同等の公開スコアは存在しない。モデルカードにはEditVerse 8.02、OpenVE 3.96、OpenS2V 63.83、VBench 84.46と報告されているが、これらはすべてベンダー自己申告であり、すべてビデオ側のメトリクスである。カード上には、画像バイヤーがテキストから画像への変換または画像編集のリーダーボード結果として認識できるものは何もない。カードは、BerniniがByteDanceの内部ブラインドペアワイズアリーナでクローズド商用モデルの「ファーストティア」に到達すると主張しているが、これはまさに、独立した検証を経て初めて意味を持つような類のベンダー自己評価である。

MAI-Image-2.5-Pro:編集 Elo 1,272(独立、約6,100票);テキストから画像 Elo 1,292(独立、約11,500票)

Bernini-Diffusers-v2:公開画像ベンチマークはなし。動画側メトリクスのみ、ベンダー報告による

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

編集に関する二つの異なる理論

両方のモデルは、編集とはシーンを再生成することを意味すべきではないという考えに基づいて構築されています。しかし、その実現方法は異なります。

MAI-Image-2.5-Proは、マイクロソフトの「一貫性を伴う精密で外科的な編集」という売り込みです。1つのオブジェクトを変更し、画像内のテキストを更新し、モーションブラーを除去し、それ以外のすべて—被写体の同一性、照明、質感—を安定に保ちます。その一貫性こそが、94%の複数画像キャラクター一貫性という主張(ベンダー報告、未検証)の背後にあるメカニズムです。製品の目標は、狭い編集だけを行って停止するモデルです。

Bernini-Diffusers-v2は、「プラン→レンダリング」パイプラインです。Qwen2.5-VLプランナーが命令を意味的なステップに分解します(天候を変更する、スタイルを入れ替える、オブジェクトを挿入する、被写体を維持するなど)。そしてレンダラーが結果を描画します。この設計は複雑で多段階の命令を対象としており、同じ重みでテキストから画像、画像から画像、ビデオタスク(t2i、i2i、t2v、v2v、rv2v、r2v)をカバーします。その広さが利点です。一方、測定されていないコストとして、7Bプランナーが非常に微妙な編集において真のボトルネックとなる可能性があり、ByteDance外部の誰もその処理能力を定量化していません。

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

テキストレンダリング、実践の戦場

画像内テキストの描画は、現代の画像エディタがその価値を問われる領域であり、ここでの差は歴然としている。MAI-Image-2.5-Pro の目玉機能は正確なテキスト描画であり、Microsoft は英語・中国語・日本語・韓国語・スペイン語で 96.8% の精度を主張している(ベンダー報告値。同じドキュメントでは出力が約 1 メガピクセルに制限されているため、この数値は方向性を示すものとして捉えるべきだ)。一方、Bernini-Diffusers-v2 はテキスト描画精度を一切公開していない。ローカライズ広告やパッケージ、あるいは判読可能な単語を含むあらゆる成果物を生成するワークフローにおいて、一方の候補は測定可能な裏付けを示し、他方は何も示していない。

コスト、および請求書の形状

MAI-Image-2.5-Pro — テキスト入力トークン100万トークンあたり5ドル、画像入力トークン100万トークンあたり8ドル、画像出力トークン100万トークンあたり106ドル。画像あたりのコストは公開されていません。Artificial Analysisの換算では、1024×1024の画像は1,000枚あたり約108.50ドルとなります。プレビュー価格であり、GA時点で変更される可能性があります。

Bernini-Diffusers-v2 — ウェイトは無料ですが、セルフホスティングにはH100クラスのハードウェア(またはクラウドレンタル)、稼働を維持するための運用、そして自前のスケーリングが必要です。経済性はAPIモデルとは逆転します。つまり、1日10枚の画像には高くつき、大量利用では安くなります。

ほとんどのチームにとって、正直なところBerniniの総所有コストが有利になるのは、すでにGPUフリートを運用しており、ワークロードが大規模で安定している場合だけです。そうでなければ、プレミアム料金の従量制APIのほうが、より安価な失敗の仕方です。

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

ここでルーターができることとできないこと

現在、どちらのモデルもOrcaRouter経由ではルーティングできません。その理由は正反対です。MAI-Image-2.5-ProはMicrosoft Foundryのダイレクトプレビューの背後にあり、Bernini-Diffusers-v2はそもそもエンドポイントではなく、重み(ウェイト)にすぎません。この対決においては、これは原則として重要な意味を持ちます。ルーターパターンは、この比較のうち呼び出し可能なAPIである側にのみ適用されます。MAI-Image-2.5-Proが呼び出し可能なサードパーティAPIに到達した場合、プレビューコードに本番パスを賭けずに採用する方法は、実績のあるモデルを自動フェイルオーバーとして、トラフィックの一部をそれにルーティングすることです。OrcaRouterでは、それは1つのエンドポイントであり、プロバイダー価格は0%マークアップでそのまま透過され、低投票のリーダーボードが見落としたものは何でもキャッチするフォールバックが備わっています。オープンウェイト側にはこれに相当するものはありません。Berniniのスタックを自分で実行するか、まったく使用しないかのどちらかです。

評決

MAI-Image-2.5-Proは、プレミアムで測定可能なホステッドエディタです。独立系の編集評価ボードで第1位、実際のテキストレンダリング性能の実績、そしてそれに見合う価格設定です。Bernini-Diffusers-v2は、無料で広範、かつ画像分野では未実証のオープンウェイトパイプラインで、動画も処理できます。セルフホストするなら本当に興味深いものですが、誰かが公開の画像評価を実行するまでは、事実上スコアリング不可能です。ワークフローに呼び出し可能なAPIと、説明できる数値が必要なら、選択肢はMAI-Image-2.5-Proか、それが凌ぐ他のホステッドエディタです。ワークフローに所有権が必要で、ハードウェアを運用できるなら、Bernini-Diffusers-v2はテストする価値があります。ただし、それは測定済みの第1位の競合としてではなく、未測定の可能性への賭けとして採用すべきです。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube