Ideogram 4.5 vs GPT Image 2.5 のヒーロータイトルカード。「編集スコアで Elo 差 97 — しかもベンダーが対戦相手を名指し」と表示され、チップは「Ideogram 4.5 — 2026年9月30日公開」「GPT Image 2.5 Sunburst — 2026年9月8日公開」「Ideogram 4.5 編集 Elo 1,064」「Sunburst 編集 Elo 1,182」。OrcaRouter のロゴが右下隅に合成されている。
Guides & Insights

Ideogram 4.5 vs GPT Image 2.5:この勝負、Ideogramが自ら仕掛けた

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ほとんどのモデル比較は、それを書いている本人が組み立てたものだ。これはIdeogramが組み立てた。Ideogram 4.5のローンチページは2026年9月30日から公開されており、並べて比較する編集デモを動かし、キャプションで対戦相手を名指ししている——「Ideogram 4.5 と GPT Image 2.5 Sunburst、Nano Banana Pro、Nano Banana 2 で同じ編集を行った場合」。そして、視聴者に何が見えるかについてこう主張する——「GPT Image と Nano Banana の出力は数回の編集で使い物にならなくなるが、Ideogram 4.5 は編集を重ねてもきれいなままだ」。

それは異例なほど率直だ。ベンダーがベンチマークの対象を自ら選び、結果を事前に教えてくれるというのは、ある意味では真剣に受け止める価値があり、別の意味では懐疑的に見るべきものだ。GPT Image 2.5は、両方の画像カテゴリにおいて独立系のボード上で最強の存在であり、対戦相手として選ぶのは正しい。しかもこれは2つの識別子によるリリース——FlareとSunburst、いずれも2026年9月8日リリース——であり、その公開アリーナスコアにはIdeogram 4.5は現時点で及んでいない。興味深い問いは、誰がアリーナで勝つかではない。Ideogramの主張が、アリーナでは測れていない何かを測っているかどうかだ。

両方のモデルがどこに立っているか、正確に

• Ideogram 4.5 — 2026年9月30日にリリース。精密編集モデル。4段階のレンダリング速度で生成と編集に対応。ネイティブ2K。編集は最大4,016 × 6,016(24.2 MP)のソース解像度で実演。テキストから画像生成は167件中34位、Elo 1,014 ± 11(2,247票)。画像編集は23位、Elo 1,064 ± 11(2,382票)。速度設定により1枚あたり$0.03–$0.22。

• GPT Image 2.5 Sunburst — 2026年9月8日、OpenAIの分割された画像アップグレードのうち精度優先の半身として出荷、API識別子 gpt-image-2.5-sunburst。テキストから画像生成 No. 1、1,197 ± 9 Elo(14,023票)。画像編集 No. 1、1,182 ± 8 Elo(17,899票)。ボードの換算で1,000枚あたり210.70ドル。

• GPT Image 2.5 Flare — 同じリリースの高速版で、識別子はgpt-image-2.5-flare。両方のボードで2位:テキストから画像が1,190、編集が1,162。1,000あたり$210.70で同じ。

2つの編集の数値を並べてみると、その差は118 Elo——1,182対1,064——で、信頼区間は±8と±11。区間は重なっていない。単発編集の好みを測るボードでは、Sunburstが勝ち、しかもその背後には約7.5倍の投票数がある。

リーダーボードが測定しているものと測定していないもの

ここが、Ideogramの主張が証拠と突き合わせられたときに生き残れるかどうかを決める部分です。

Artificial Analysisの編集アリーナは、ブラインド形式の一対比較による人間の選好評価です。投票者は同じソース画像と同じ指示を見て、ラベルのない2つの編集結果を受け取り、より良い方を選びます。これは「この2つの出力のうち、どちらが指示が求めたものにより近く見えるか」を判断するための強力な手法です。

それは Ideogram が宣伝しているものを測定することはできない。1つの編集を評価する投票者は、モデルが壁紙を静かに変更したか、顔を2ミリメートルずらしたか、フレームの残りの部分に粒状感を再レンダリングしたかを見ることができない。Ideogram が修正すると主張している失敗は、シーケンス全体 — 4ターン目、7ターン目、10ターン目 — でのみ可視化され、主流のアリーナは投票者にシーケンスを提示しない。1,064 Elo は、Ideogram の個々の編集が優れていることを示している。それらが優れたままであり続けるかについては、何も語っていない。

それはIdeogramにとって諸刃の剣であり、正直に言えばこうだ。リーダーボードはドリフトの主張を裏づけておらず、反証もしていない。それが反証しているのは、読者がローンチページから受け取りかねない暗黙の、より強い主張——4.5のほうが優れたエディターだ、異論の余地なく——である。リーダーボードに照らせば、4.5は自身の誤差範囲よりも広い差で順位の低いエディターだ。

Screenshot of the Ideogram 4.5 model page showing the model-comparison section headed 'Compare models across multi-turn edits', with a side-by-side video widget captioned to show the same edits applied to Ideogram 4.5 alongside GPT Image 2.5 Sunburst, Nano Banana Pro and Nano Banana 2

それぞれが相手にない機能を持つ点

• ソース解像度での編集 — Ideogram 4.5 の際立った技術的主張。そのページでは、4,016 × 6,016 のソースにダウンスケーリングなしで編集を適用した例が示されており、編集の境界が十分に保持されるため、切り抜いた部分を元の画像に再びつなぎ合わせることができると謳われている。印刷用途において、これは納品物と妥協作との違いである。

• パラメータ面の広さ — GPT Image 2.5の場合。OpenAIはxhighとmaxを品質ラダーに追加し、透過背景をファーストクラスのパラメータにした。backgroundはtransparent、opaque、autoに設定でき、出力はPNGまたはWebP。透過出力はGPT Image 2では欠けていた要素で、2.5のペアでは目玉機能となった。

• スピードレーン — Flareは高速なデフォルトとして使われることを目的に存在する。OpenAIは前世代比で最大50%低いレイテンシを主張している。Sunburstはあえて低速で、厳しい精査に耐える必要のある編集を狙っている。

• 価格体系 — Ideogramはレンダリング速度に応じて画像ごとに課金します($0.03~$0.22)。OpenAIはGPT Image 2と同じ料金表でトークン単位に課金します — 画像入力トークン100万個あたり$8、画像出力トークン100万個あたり$30 — そのため、独立した画像1枚あたりの換算では、高品質な1024 × 1024で$0.21近くになります。

価格曲線が厄介な位置で交差している。Ideogram 4.5 の Low および Medium 設定では、1 画像あたりの価格が OpenAI の 2 つより劇的に安い。High では——ドリフトのデモが置かれている設定であり、24 メガピクセルのソースを実行する設定でもある——両者はほぼ同じ数字になる。ほとんどの購入者が実際に行う比較は、高品質な Ideogram 4.5 対 高品質な Sunburst であり、その比較では、測定ボード上で 118 Elo の劣勢を抱えながら、価格はほぼ互角だ。

ドリフト主張が本当なら、それは問題ない。それこそが賭けのすべてだ。

Screenshot of OrcaRouter's public model catalogue listing 206 models from 16 providers behind one API key, with the model cards and the three-step 'How to call any model' panel showing the OpenAI-compatible endpoint.Comparison scoreboard for Ideogram 4.5 and GPT Image 2.5 Sunburst. Left column 'Ideogram 4.5': live Sep 30 2026, editing rank 23 at 1,064 Elo from 2,382 votes, text-to-image rank 34 at 1,014 Elo, $0.03 to $0.22 per image, max edit resolution 4,016 by 6,016 pixels, open weights planned. Right column 'GPT Image 2.5 Sunburst': live Sep 8 2026, editing rank 1 at 1,182 Elo from 17,899 votes, text-to-image rank 1 at 1,197 Elo, $210.70 per 1,000 images, transparent background output, quality ladder through max. A footer reads 'All leaderboard figures per Artificial Analysis, October 2026; price conversions are the board's own.'

誰も宣伝しないアクセシビリティの違い

実用的な非対称性がひとつ、スコアボードとは逆向きに働いている。GPT Image 2.5の2つの識別子は、OrcaRouterのカタログにあるどのモデルよりも新しい — 当社のOpenAI画像ラインは現在、GPT-Image-1.5が100万トークンあたり$8/$32、GPT-Image-2が$8/$30で、いずれもプロバイダー定価のままマークアップなしで提供されている。2.5のペアは、GPT-Image-2と同じ$8/$30でOpenAIの料金表に登場した。つまり、ルーティング可能になった瞬間に、新しい価格ではなく同じパススルー価格で並ぶことになり、両者のコストの問いは、どのベンダーに問い合わせるかではなく、トークン効率をめぐるものになる。

Ideogram 4.5はIdeogram自身のAPIおよびパートナープラットフォームで利用できます。当社のカタログには含まれていません。このことは、地味な形で比較に影響します。これら2つのモデルのうち一方はOpenAI互換クライアントにそのまま差し替え可能で、もう一方は新規統合です。すでにOpenAI形式のエンドポイント経由でGPT-Image-2を呼び出しているなら、Sunburstを試すコストはモデルIDの変更だけです。Ideogram 4.5を試すコストは、品質を評価する前に、2つ目の契約と2つ目のクライアントが必要になることです。

ルーティング層はその違いをなくすものではない。すでに互換性のある側から面倒な接続作業を取り除き、本番経路をそれにコミットすることなく、新規参入者にトラフィックの一部を流せるようにするだけだ。ここではフェイルオーバーが通常以上に重要になる。試すことになるのは、中心的な主張に独立した検証がなく、サンプルサイズが競合の5分の1しかないモデルだからだ。

解決する方法

この比較を単一の画像で実行しないでください。それはアリーナの手法であり、間違った道具です — それは Sunburst が勝つと教えるでしょうが、そんなことはあなたがすでに知っていたはずです。

シーケンスで実行しろ。自分の仕事から画像を5枚か10枚取り、同じ6つか8つの段階的編集からなる連鎖を書き、その同一の連鎖を Ideogram 4.5 (High) と Sunburst (max) で実行する。次に各モデルについて、モデルに触れさせようと一度も頼んでいない領域で、ターン1とターン8の差分を取る。動いたピクセルを数える。その数値——シーケンス全体にわたる未変更領域の乖離——こそ、Ideogram が勝っていると主張しているものだ。そして私の知る限り、どちらのモデルについてもそれを公表している人はいない。

次に、両方の実行を完成したシーケンスごとに値付けしてください。その時点で、あなたは118 Eloを超える価値のある答えを得るでしょう。なぜなら、それは投票者パネルのものではなく、あなたの画像についてのものになるからです。

この対戦は実際のところ何なのか

Ideogram 4.5は、掲示板上で勝てるようなコンテストには参加しておらず、しかもそのことを自覚しているように見える——だからこそローンチページでは、ランクを記載するのではなく、ある挙動をデモしている。そのデモが示す挙動は、テストする価値があるほどに現実的で、反証可能なほどに具体的だ。繰り返し編集が一貫して成立するか、しないか——自分のファイルで10ターンのテストを行えば、半日で決着がつく。

今日の妥当な見方は、GPT Image 2.5 Sunburst が、現存する唯一の独立した指標において、誤差範囲を超える差で優れたエディターであり、その数値の背後にはるかに多くの裏付けがある、というものだ。そして Ideogram 4.5 は、より狭く、測定もされていない特性を、低設定ではより安く、その主張が依拠する設定ではほぼ同等の価格で売り込んでいる。マルチターンの忠実性が制作上のボトルネックなら、テストは安価で、そのモデルには試す価値が十分にある。そうでなければ、リーダーボードがすでに答えを出している。