「Grok Imagine Image 2.0」のヒーロータイトルカード。「Grok Imagine Image 2.0 — テキストから画像を生成するArenaで第2位、精密編集、現在Grokアプリで利用可能」と表示され、キャプション行には「2026年8月7日にxAIが発表」、さらにフラットな絵フレームにペンを重ねた編集アイコンが添えられています。
Guides & Insights

{{1}}Grok Imagine Image 2.0{{/1}}: {{2}}Artificial Analysis{{/2}}で{{3}}第4位{{/3}}、{{4}}価格は3分の1{{/4}}

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok Imagine Image 2.0 は、Artificial Analysis の Text to Image Leaderboard で4位に登場した。だが重要な数字は順位ではない——その隣にある価格だ。このモデルは Elo 1,153.66 で、GPT Image 2.5 Flare (max)、GPT Image 2.5 Sunburst (max)、GPT Image 2 (high) の3エントリーの後ろに位置する。Microsoft の MAI-Image-2.6 や Nano Banana 2 モデルを含む、他のすべてのラボのモデルを上回っている。これによりこのモデルは、あの三者を除けば最高位の画像生成モデルとなり、そのトップ4の中では大差で最安だ。Artificial Analysis は 1,000 枚あたり $60 と価格設定しており、上位3エントリーの約 $211 と対照的だ。モデル自体は 2026年8月7日 のものだ——変わったのは、独立系のボードがそれをどこに置くか、そしてそれが開発元のローンチ時に用いた「世界2位」という見せ方に何をもたらすかだ。

#4位という順位が実際に測っているもの

Artificial AnalysisのText to Image Leaderboardは、人間の好みに基づくブラインド形式のアリーナだ。投票者は、モデル名のラベルなしで同じプロンプトの出力を見て、優れている方を選ぶ。その結果得られるEloは、どのベンダーからも独立して公開される。Grok Imagine Image 2.0のエントリーは、Elo 1,153.66で第4位、95%信頼区間は1,141.66~1,165.66と記されている。その数字はxAIから一切提供されたものではない。(ボードを見るときに知っておく価値のある事務的な詳細が1つある。Artificial Analysisはこのモデルの作成者をSpaceXAIと記載している。)

価格の側面こそが、この話のより興味深い半分だ。同じページには品質と価格が対比してプロットされ、1ドルあたり最も多くのEloを返すモデルを示すパレート線が引かれている。そして、このボード自身が公表した数値によれば、Grok Imagine Image 2.0 は1,000枚あたり100ドル未満の価格帯で最高スコアのモデルである。品質の上でそのすぐ上に位置する次のモデル、GPT Image 2 (high) は1,000枚あたり211ドルかかる——約17 Elo多いために、およそ3.5倍の費用だ。それは価格性能比に関する主張であり、最高のモデルであるという主張ではない。そして、それこそが独立したデータが実際に裏付けている話のバージョンである。

最先端の位置にあるのは事実だが、その差は小さい。そして、そう率直に言う価値がある。MicrosoftのMAI-Image-2.6は1つ下の順位で1,000枚あたり38.90ドル、MetaのMuse Imageは1,000枚あたり10ドルでElo 1,111だ。このランキング表のElo間隔は約±12ポイントなので、6.5 Elo差の#4と#5は互いの誤差範囲内にある。この順位は確定した枠ではなく「トップ5」として捉えるべきだ。

14位の順位アップは、Grok Imagine Image 2.0 が置き換えた階層との差である。xAIの以前の品質階層である grok-imagine-image-quality は、同じランキングで 1,043.21 Elo の第18位にあり、オリジナルの grok-imagine-image は 1,017.86 で第29位だ。これは、xAIが現在画像のデフォルトとして記載しているモデルと、それが取って代わるモデルとの間に、およそ110 Elo、14ランクの差があることを意味する。

「世界2位」という主張の現在地

ローンチ時点で、xAIはテキスト・トゥ・イメージと画像編集の両方のArenaボードで2位という結果を挙げ、約1,320 Eloで、Preliminary(暫定)と表示されていた。これらはxAIが自身の発表で強調した数値であり、同社が委託した独立評価ではない。その後、数値は変動している。8月10日時点のスナップショットでは、同モデルは1,316 Eloで3位となり、MAI-Image-2.6とGPT Image 2の後方に位置している。画像編集での2位は、依然としてxAI自身による引用のままである。

Artificial Analysisは、方法も投票者層も異なる別のランキングボードであり、現在はこのモデルを#4に置いている。両者は実際には矛盾していない——人間の好みを異なる形でサンプリングしており、どちらも週ごとに動くボードのスナップショットだ。6週間にわたる独立ランキングを正直に要約すれば、Grok Imagine Image 2.0は一貫してトップ5に入り、xAIが発表した#2にちょうどなることは決してなかった。

Grok Imagine Image 2.0が実際に提供するもの

xAIはGrok Imagine Image 2.0を、単なるワンショット生成ツールではなく編集環境として位置づけている。その機能は以下のとおりです:

Magic Wand — フレームの残りの部分には触れない、領域レベルの編集

セグメンテーション — カラーグレーディング、置換、または調整のための精密な領域選択

背景削除 — 透明背景の被写体書き出し

マルチ画像入力 — 1回の編集につき最大5枚のソース画像。xAIのドキュメントでは現在5枚と記載されており、APIの提供開始時に上限だった3枚から増えています

Smart Resize — 1つの画像を9つのアスペクト比(縦1:2から横2:1まで)に再構成し、トリミングではなく新しいフレームコンテンツを生成します

テンプレート — 商品撮影、ヘッドショット、ECリスティング、ゲームアセット、マーケティングポスター用のプリセットワークフロー

API は、コンシューマーアプリが表に出さないコントロールを公開している。アスペクト比 — 21:9 と 5:2 を含み、どちらも 2.0 で新登場 —、解像度(デフォルトでは 1K、オプションで 2K)、および low、medium、auto を取る品質パラメーターだ。コンシューマー側では、このモデルは grok.com/imagine、iOS、Android 上のデフォルトの Quality Mode として提供され、8 月 13 日以降は Runway のプラットフォームにも掲載され、Runway がすでにホストしている画像および動画モデルに加わった。この掲載は独立した評価ではなくベンダーとパートナーの声明だが、ローンチ後にサードパーティ配布の最初の兆しとなった。

見出しテキストのレンダリングについて、xAIはモデルが「デザイナーがするようにタイポグラフィとレイアウトを計画する」と述べており、密度の高い複数パートからなる構成を維持し、小さなテキストを鮮明に描画します。また、複数ターンにわたる反復的な編集を通じて、被写体のアイデンティティと設定を保持します。

最初の独立テストでわかったこと

6つのプロンプト、単一シード、チェリーピッキングなしでのgpt-image-2との比較では、明確な分断が見つかり、新しいリーダーボードでの位置づけの中にそれを覆すものは何もない。

Grokの勝利:フォトリアリズムと同一性保持。ポートレートの手の解剖学的構造は正確で、毛穴レベルの肌のディテール、サブサーフェススキャタリング、自然なキャッチライトとリムライトを備えていました。45度の幾何学的回転タスクでは、GrokはArcFace 0.5の閾値を上回る顔の同一性を維持しましたが、gpt-image-2はより逸脱しました。

Grokの敗北:制作に重要な領域。簡体字中国語の映画ポスター見出しを依頼したところ、繁体字中国語の文字が返され、ローカライゼーション・出版パイプラインにおける「重大な失格要件」と評された。水彩画スタイルの融合をリクエストしたところ、軽い絵画的テクスチャ処理を施しただけのフォトリアリスティックな画像が返され、「カテゴリーレベルの失格」となった。ローカル編集では3件のリクエストすべてを完了したが、窓の景色を保持できず、ハイライトのアンカーも誤った位置に設定された。

要約:Grok Imagine Image 2.0は「フォトリアリズムとアイデンティティではリードし、編集の信頼性、多言語テキスト、真のスタイル変換では後れを取っている」。リーダーボードは数千件のブラインド比較にわたる選好を平均したものであり、モデルがあなたの中国語の見出しを正しく処理できるかどうかまでは教えてくれない。6つのプロンプトによる1回のテストも、証拠の集積にはならない — しかし両者のうち、具体的な失敗のほうが、ローカライズ済みアセットを出荷するチームにとって、より実行可能なシグナルである。

APIと価格計算

ローンチ以降、開発者向けの状況は変わった。grok-imagine-image-2.0 は現在、xAI が画像生成、単一画像編集、複数画像編集のためにドキュメント化しているモデルであり、xAI 自身のモデルページが画像向けに推奨しているモデルでもある。ローンチ当初の「開発者 API アクセスは近日提供予定」という一文は、ベンダーのモデルページと価格ページから消えている。

• grok-imagine-image-2.0:画像1枚あたり$0.04から、実際に提供された品質に基づいて課金されます

• grok-imagine-image (1.0): 画像1枚あたり$0.02、以下の変更の影響を受けません

• grok-imagine-image-quality: 画像1枚につき$0.05、2026年11月2日に廃止予定

品質はコストを左右するレバーです。Auto — パラメータを省略した場合のデフォルト — は現在、生成には low、編集には medium を適用するため、生成リクエストは low レート、編集は medium レートで課金されます。low または medium に固定すれば、サービスがどちらの経路を選ぶかに左右されず、請求額が予測可能になります。

最後の項目には期限がある。xAIの移行ガイドによると、grok-imagine-image-qualityスラッグは2026年11月2日に廃止される。9月2日から始まった60日前の通知を経てのことだ。その日以降もスラッグの解決は続くが、リクエストはqualityがlowに設定されたgrok-imagine-image-2.0によって処理される——互換性のためのリダイレクトであり、完全な停止ではない。lowティアはどの解像度でも旧qualityティアより画像1枚あたり0.01ドル安いため、何も変更しないチームは価格の下落と、出力品質の静かな変化を目にすることになる。grok-imagine-image-2.0を指定し、安定した出力が重要な箇所ではqualityを固定するなど、意図的に移行するのが、望ましいやり方だ。この日付とリダイレクトの挙動はxAI自身のドキュメントによるもの——ベンダーが述べたものであり、独自に検証されたものではない。

OpenAIの選択肢と比べると、この比較は価格差というよりむしろ料金モデルの違いだ。gpt-image-2はトークン課金制で、OpenAIが公表している料金では画像入力トークン100万あたり8ドル、画像出力トークン100万あたり30ドルであり、1枚あたりのコストは解像度とディテールによって変動する。Artificial Analysisが示す代表値では、GPT Image 2(high)が1,000枚あたり211ドル、それに対してGrokは60ドルであり、この変動が1つの数字として表れている。1枚あたりの定額課金のほうが大規模運用でははるかに予測しやすく、4位のモデルが検討に値する主な理由はまさにそこにある。

パイプラインを賭けずに試してみる

Grok Imagine Image 2.0に対する妥当な反応は、依然として「試してみるだけで、まだ本格導入はしない」だ。その位置づけは重なり合う信頼区間に収まっており、ある独立したテストはローカライズされたテキストとスタイル転送に実際の弱点があると指摘し、xAIは11月にその下のスラッグを廃止する。まさにこれが、直接統合を配線するのではなく、ルーティングを使うべきケースだ。

OrcaRouterでは、grok-imagine-image — 当社のカタログにあるxAIの画像モデル — がgpt-image-2と同じOpenAI互換エンドポイント上にあります。つまり、xAIとOpenAIの画像モデル間の移行はモデル文字列の変更だけで済みます。2つ目の契約も、新しいSDKも不要です。OrcaRouterはプロバイダーの定価をマークアップなしでそのまま通すため、ベンダーの値下げは同じ日にここでも反映され、自動フェイルオーバーはエラー、レート制限、拒否を本番パスへ流すのではなくフォールバックモデルへ送ることができます。正直な注意点が1つ、元のレビューから変わらずあります。xAIの最新の品質ティアは、すでに当社のカタログにあるGrok画像モデルとは別のエントリなので、特定のGrokバリアントが今日ルーティング可能だと決めつけず、現在のモデル一覧を確認してください。

次に見るもの

1. 11月2日の移行。チームが明示的に grok-imagine-image-2.0 へ移行するのか、それともリダイレクトとその低品質なデフォルトへ流れてしまうのか——これは xAI がこのモデルでなお最も大きく失敗しうるポイントであり、しかもリダイレクトのせいで、レスポンスの model フィールドを読まない限りその間違いは見えなくなります。

2. 第4位が維持されるかどうか。MAI-Image-2.6との差はEloで6.5、信頼区間は±12ポイントのため、さらに数千票が加わればランキングはどちら向きにも入れ替わりうる。前のティアからの110 Eloの伸びは堅牢に見えるが、正確な順位はそうではない。

3. コンシューマー向け機能のうち、どこまでがAPIに到達しているか。生成、編集、複数画像の編集については文書化されています。テンプレートと、名前付きのSmart Resizeワークフローは依然としてアプリの機能であり、その隔たりこそが、残る「コンシューマー専用」という但し書きの存在する場所です。

結論から言うと、Grok Imagine Image 2.0 は実際に能力の高いモデルであり、今や独立系評価でもその位置が示されている。Artificial Analysis の Text to Image Leaderboard では4位で、そこでの非OpenAIエントリーとしては最上位、置き換えたティアを約110 Elo上回り、同ボードの価格対品質フロンティア上では1,000画像あたり60ドルで、すぐ上に位置するOpenAIモデルの約211ドルと対比される。「世界2位」という枠組みは常にxAIのローンチ時点のスナップショットであり、独立系ボードがそう言い切ったことは一度もない。その最も明白な2つの独立系弱点 — 簡体字中国語への準拠とスタイル転送の信頼性 — は、チームが画像APIに最も頻繁に求める機能に該当する。フォトリアルで人物同一性を保つ作業にはすぐに試す価値がある。ローカライズされたテキストや様式化されたアセットを提供するパイプラインでは待つべきだ。また、廃止される品質スラッグをすでに呼び出しているなら、11月2日より前に移行せよ。