MAI-Image-2.5-Pro(1,000画像あたり約108.50ドル)とQwen-Image 3.0(1,000画像あたり約25ドル)の対決を示すヒーローカード。この2つのAPI画像モデルは、どちらもテキストレンダリングで先頭を走る。
Guides & Insights

MAI-Image-2.5-Pro vs Qwen-Image 3.0:4倍の価格で得られる異なる種類のテキスト

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

並べてみると、MAI-Image-2.5-ProQwen-Image 3.0では、最初に気づくのは価格だ。おおよそ1,000画像あたり$108.50がMicrosoftのプレミアムティアの料金で、それに対して約1,000画像あたり$25〜30がAlibabaのQwen-Image 3.0の料金だ。Alibaba自身の提示レートは約25ドルで、Artificial Analysisのリーダーボードでは30ドルとなっている。どちらの数字でも3倍以上の差がある。そのプレミアムが実際に買うのは、別種のテキスト描画機能だ。Qwen-Image 3.0は、AlibabaのQ​wenチームが2026年7月21日にリリースし、8月4日に国際APIを公開したもので、大量処理向けテキスト描画モデルとして価格設定されている。12言語で約10pxまで判読可能で、密度の高いプロンプト向けに4,500トークンのプロンプトウィンドウを備える。MAI-Image-2.5-Proは、7月23日からMicrosoft Foundryでパブリックプレビュー中で、独立したリーダーボードで最も評価の高いエディタであり、ベンダーが主張するテキスト描画精度を備える一方、出力上限は約1メガピクセルに固定されている。両者ともテキストが売りのAPI画像モデルであり、単一の品質スコアではなく、ジョブあたりの価格で競争している。

2つのテキスト記事、どちらも完全には検証されていない

テキストバトルこそが両モデルが存在する理由であり、同時に証拠が最も乏しい部分でもある——このセクションのすべての数字はベンダーによる報告であり、独立に再現されたものは一つもない。

Qwen-Image 3.0 — Alibabaの発表資料によると、約10pxまで判読可能なレンダリングが可能で、ネイティブ対応は12言語のほか、20以上のフォントと100以上のアートスタイル、数学記法、下付き文字、上付き文字、複数行の数式に対応し、一般的なWeb、ゲーム、ソフトウェアのインターフェースにも精通している。プロンプトウィンドウは最大4,500トークンの入力に対応——前世代比4.5倍の増加で、新聞の一面や9コマの知識グリッドのような密度の高いブリーフも一度に処理できる。

MAI-Image-2.5-Pro — マイクロソフトは主張している:96.8%のテキスト描画精度は中国語、英語、日本語、韓国語、スペイン語にわたり、27%高いプロンプト順守率は内部評価でGPT-Image-1.5より高く、そして94%の複数画像キャラクター一貫性。入力仕様は紙上ではより広く、最大32,000トークンのテキスト入力と131kのコンテキストウィンドウを備え、出力は1,048,576ピクセル(1024×1024相当)に制限されている。

執筆時点では、どちらの主張も再現されていない。違いは主張の形にある。Q​wenの主張は、複数の文字体系にわたる量と可読性に関するものであり、Microsoftの主張は、定義された5つの言語における正確性と一貫性に関するものである。どちらのベンダーも、他の研究所が実行して検証できるベンチマークを公開していない。

編集にこそ、プレミアムは宿る

両者を分けるのは編集能力であり、これが独立した証拠を持つ唯一の軸です。MAI-Image-2.5-ProはArtificial Analysis Image Editing ArenaのElo 1,272で第1位(約6,100票のブラインド投票)となり、Reve 2.1、MAI-Image-2.5、GPT Image 2を上回っています。同じボードでは、より新しいQwen-Image-3.0-Proは1,249—競争力のあるスコアで、23 Elo差、今月になってようやく国際APIに到達したモデルとしては注目に値します。

基本モデルに加えて、アリババの編集ポートフォリオは単一の目玉というより専門的なテクニックの集合体だ。古画の修復、パノラマ生成、スケッチからPPTへの変換、マルチショットのストーリーボードなどが含まれる。マイクロソフトの方はより狭く深い賭けであり、フレーム内の他の部分を一貫して保つ正確で外科的な編集(オブジェクトの置換、レイアウト変更、画像内テキストの更新、ぼかしの除去)に焦点を当てている。これは、古いモデルがシーン全体を再生成して被写体を見失ってしまう類の編集だ。「既存のアセットを取得して、1つ変更して、リリースする」というワークフローにとっては、Proティアの独立した#1がより強いシグナルであり、クリエイティブな編集フォーマットの寄せ集めにとっては、Q​wenのリストの方が広い。

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

スペックの対比

• 価格 — 1k画像あたり約$108.50(1024×1024、AA変換) vs 1k画像あたり約$25〜30(Alibabaの見積もり vs AAの提示レート)br />• リリース — 2026年7月23日(パブリックプレビュー、Foundry) vs 2026年7月21日、国際APIは8月4日br />• テキスト入力 — 32,000トークン、131kコンテキスト vs 4,500トークンのプロンプトウィンドウbr />• 出力上限 — 約1,048,576ピクセル(約1K) vs 最大2048×2048br />• 1回の呼び出しあたりの画像数 — リクエストあたり単一出力 vs 1回の呼び出しあたり最大6枚br />• 編集ランク — 第1位、Elo 1,272(AA) vs 同じボード上でのQwen-Image-3.0-Proの1,249br />• 来歴 — Microsoftの「第三者のモデルからの蒸留は行っていない」という主張 vs 出力へのAIGC由来ラベルbr />• 重み — 非公開、APIのみ vs 非公開、APIのみ

出力上限と1回の呼び出しあたりの件数は、見た目以上に重要です。Qwen-Image 3.0は2048×2048の画像をレンダリングでき、1回の呼び出しで最大6枚の画像を返すことができ、これはバッチ経済性の機能です。Proティアは約1Kで頭打ちとなり、リクエストごとに1つの出力のみを返します。あなたの要件が「6つの商品ショットの展開を提供して」というものであれば、Alibabaモデルはそのために作られており、Microsoftモデルはそうではありません。

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

プレミアムが元を取るとき

決定ルールは、どのモデルが「優れている」かではなく、画像が何のためにあるのかに関するものです。

MAI-Image-2.5-Pro の割増料金を支払うのは、出力がヒーローアセットの場合です — 商品ビジュアル、ポスター、キーフレーム、キャンペーンに組み込まれ、50回も再生成されない画像。編集ランキング1位とキャラクターの一貫性という主張が最も重要となるのは、編集が最初から正しく行われなければならないときです。

Qwen-Image 3.0 でのボリューム購入は、出力が使い捨てまたは大量の場合に適しています — ローカライズされた広告バリエーション、プレースホルダーアート、スケッチからPPTへのデッキ、ストーリーボードフレームなど、微調整ではなく再生成するようなものすべて。$25~30 / 1k であれば、失敗した生成は丸め誤差程度のコストですが、$108.50 / 1k ではそうはいきません。

名前を付ける価値のある中間領域がある。高密度で多言語の画像内テキスト作業——日本語とスペイン語のコピーが入ったランディングページのモックや、数式を含むインフォグラフィック——には、Qwenの10pxの可読性と12言語対応が紙面上ではより適しており、しかも価格は4分の1だ。Microsoftのモデルの反論は、5言語にわたる96.8%の精度という主張だが、その主張は未検証であり、検証されていない2つのテキスト主張の間で選ぶ買い手は、おそらく価格に重きを置くべきだ。

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

適用される場合のルーティングレイヤー

どちらのモデルもまだOrcaRouter経由では利用できません — Qwen-Image 3.0はAlibaba自身のAPI(Alibaba Cloud BailianとQ​wenプラットフォーム)および複数のサードパーティプラットフォームで提供されており、MAI-Image-2.5-ProはMicrosoft Foundry上にあります — したがって、正直な比較をするなら、どちらも現時点では当社側にはありません。いずれかが呼び出し可能なホステッドプロバイダー経由で利用できるようになれば、パススルー経済の原則が適用されます: プロバイダーの定価に対するマークアップは0%なので、ベンダーのレートカードがそのまま支払額となり、ローンチ割引や値下げは発表当日に請求書へ反映されます。もう半分はフェイルオーバーの論点です: Qwen-Image 3.0は登場から数週間の国際的なAPIであり、実績のあるフォールバックがエッジケースを吸収している間にトラフィックの一部を振り向けるタイプのモデルです — これはまさにルーティングレイヤーが構築されるための構成です。

評決

Qwen-Image 3.0とMAI-Image-2.5-Proは、同じ製品の価格が違うだけではなく、たまたま価格設定が異なる別の製品です。Microsoftのモデルは編集性能で頂点に立ち、より大きなコンテキストウィンドウを備え、5言語にわたる未検証の精度を謳っています。ヒーローアセットや緻密な編集用途には、プレミアム価格は正当化できます。Alibabaのモデルはより多くの文字体系を読みやすく描画し、独自の条件で1回の生成あたりより密度の高い指示を受け付け、より大きな画像を6枚単位で出力し、価格は4分の1です。大量生成や多言語のテキスト・イン・イメージ作業には、経済的に合理的な選択肢です。画像そのものが商品である場合はプレミアム版を購入し、画像が在庫である場合は量産版を購入してください。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube