「Grok Imagine Image 2.0 vs Flux 3」のヒーロータイトルカード。「Grok Imagine Image 2.0 vs Flux 3」というタイトル、サブタイトル「片方はArenaのランキングで現在第2位。もう片方はまだ登場していません。」、さらに完成した編集と未完成の輪郭に分かれた額縁のフラットイラストと小さなVSバッジが含まれています。
Guides & Insights

Grok Imagine Image 2.0 VS Flux 3:出荷済みエディタ vs マルチモーダルの約束

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これは、実際に呼び出せるのは片方だけという直接対決であり、その見出しの正直な表現は、比較そのものである。 Grok Imagine Image 2.0は、xAIの編集ファーストの画像モデルで、2026年8月7日にGrokアプリに搭載された。同じ週に、公開Text-to-Image Arenaで暫定Elo 1,320として2位に入り、1,380のGPT Image 2だけが上回った。Flux 3は、7月23日に発表されたBlack Forest Labsの統合マルチモーダル基盤モデルで、画像・動画・音声・ロボット動作の予測を1つの重みセットで学習する。しかし、その画像ティアには今日8月8日時点で、公開エンドポイントも価格もリリース済みデモもない。片方は今日の午後に呼び出せるモデルであり、もう片方は7月下旬から誰もが注目してきた画像リリースだが、まだ誰も実行できない。その非対称性こそがすべてを物語っており、公正な比較がどのようなものかをも決定づける。

Two-column comparison scoreboard for Grok Imagine Image 2.0 and Flux 3: availability 'live now, Aug 7 2026' vs 'announced, not shipped'; Text-to-Image Arena '#2, Elo 1,320 (preliminary)' vs 'no ranking yet'; editing 'Magic Wand + segmentation, shipped' vs 'promised across styles & ratios'; in-image text 'designer-planned typography' vs 'multilingual text promised'; price '$0.02-$0.05 per image' vs 'unpriced'; API 'open; 2.0 model ID unconfirmed' vs 'no endpoint yet'. Footer reads 'Grok figures per arena.ai + xAI docs; Flux 3 status per BFL docs, August 2026.'

スコアボード

この次元でこのペアリングが実際に有効になっている点について、現在の各陣営の状況は以下のとおりです。Grok Imagine Image 2.0の数値は公開されているArenaボードとxAI公式ドキュメントに基づくもので、Flux 3の画像ステータスはBlack Forest Labsの7月23日の発表と現在のBFLドキュメントに基づいています。また、Flux 3側のロードマップに関する主張はすべてベンダー報告であり、エンドポイントが存在するまで未検証です。

• 可用性 — Grok Imagine Image 2.0は8月7日よりGrokアプリ(ウェブ、iOS、Android)で利用可能。一方、Flux 3イメージティアは7月23日に発表されたが、まだリリースされていない。

• Text-to-Image Arena — Grok Imagine Image 2.0は公開ボード上でElo 1,320・2位、暫定タグ付き。一方、Flux 3 imageはランキングもエントリーもない。

• 編集 — Grok Imagine Image 2.0 はマジックワンド、セグメンテーション、背景除去、マルチリファレンス入力を搭載。一方、Flux 3 イメージは「スタイルやアスペクト比を問わない」編集を約束するが、公開デモはまだない。

• 画像内テキスト — Grok Imagine Image 2.0は、デザイナー設計のタイポグラフィとより鮮明な小さなテキストを主張しているのに対し、Flux 3 imageは画像内での多言語テキストレンダリングを約束している。

• 価格 — Grok Imagine Image 2.0はxAIのAPIで1枚あたり$0.02〜$0.05、Flux 3の画像は価格未設定。現時点で課金対象となるのはビデオ層($0.06〜$0.54/秒)のみ。

• API — Grok Imagine Image 2.0 開発者APIが公開されました。Image 2.0のモデルIDはまだ未確認で、一方Flux 3イメージにはエンドポイントが存在しません。

なぜこのマッチアップは普通のシュートアウトにはなり得ないのか

通常の画像モデル比較では、両方のエンドポイントに同じプロンプトを送り、出力を比較します。しかしここではそれができません。エンドポイントが1つしかないからです。Grok Imagine Image 2.0 は、xAI の自社アプリと開発者 API を通じて呼び出せます。開発者 API はベース画像モデルの3月世代から公開されており、Image 2.0 専用の API モデル ID はまだ未確認です。これは、それに基づいて計画を立てる人にとって重要な点です。Flux 3 image はどこからも呼び出せません。BFL の公式ドキュメントでも現在は「同期オーディオ付き動画が利用可能」とだけ表示され、追加のモダリティは利用可能になり次第、同じリクエスト形式で提供されるという注記があります。したがって、正直な直接比較とは、各社が何を出荷し、何を約束し、今日どのようなものを作れるかについてです。それは実際の比較であり、ベンチマークの比較ではありません。

Screenshot of Black Forest Labs' FLUX 3 documentation as of August 2026, showing the heading 'FLUX 3 — one model, multiple modalities,' the line that FLUX 3 generates video with synchronized audio and that more modalities ship on the same request shape as they land, specs of up to 20 seconds at FHD 24 fps, and a left navigation that still lists FLUX.2 Image Editing and FLUX.2 Text to Image under image tools.

編集ツールセットは、Image 2.0がすでに先を行っている分野です。

Grok Imagine Image 2.0は、編集を後付けではなく第一級の機能として搭載しています。Magic Wandは選択した領域のみを編集し、フレームの他の部分には触れません。セグメンテーションにより、単一オブジェクトのマテリアルに至るまで正確な領域の再着色や置き換えが可能です。背景除去は被写体を透明キャンバス上に書き出し、他の場所で再利用できます。マルチリファレンス入力は1回の生成で最大5枚の画像を受け付けるため、複数の被写体を合成する際に手動での切り貼りは不要です。Smart Resizeは、1:2の縦長バナーから2:1の横長バナーまで9つのアスペクト比に対応して再構成し、寸法が変わるとフレームを自動的に埋めます。写真、グラフィックデザイン、イラストレーション向けに特化してトレーニングされており、商品撮影、ヘッドショット、EC商品リスト、ゲームアセット、マーケティングポスター用のプリビルトテンプレートを同梱——成果物を生み出す商用ワークフローを真っ向から狙ったポジショニングです。

Flux 3のイメージティアは、BFLの発表資料によると、「スタイルとアスペクト比を横断した」編集と、静止画と動画をまとめて処理する単一モデルを約束している。しかし、公開されたデモも、サンプルギャラリーも、テスト用のエンドポイントもない。編集の面では、現時点ではこれはまだ大きな隔たりがある。ひとつは出荷済みで測定可能だが、もうひとつはロードマップ上の主張にすぎない。

両方とも同じ弱点を追いかけている:画像内のテキスト

画像内の判読可能なテキストは、画像生成における最も難しい未解決問題であり、両ベンダーは同じ2週間のうちにそれに取り組んだ。x​AIは、Grok Imagine Image 2.0が{{1}}「デザイナーがするように」{{/1}}レイアウトとタイポグラフィを計画し、密度の高いグラフィックでは小さなテキストがよりシャープになり、文字化けした単語、ロゴ、ラベルが減ると述べている。BFLが発表したFlux 3画像ティアの改善点には、{{2}}「画像内の多言語テキストレンダリング」{{/2}}が含まれており、これは同じ失敗モードへの直接的な回答であり、7月の発表における数少ない具体的な主張の1つである。どちらの機能もまだ独立にベンチマークされておらず、どちらもベンダーの主張にすぎない。実際的な違いは、Image 2.0の主張は今日、自分のプロンプトでテストできるのに対し、Flux 3の主張はまったくテストできないということだ。

価格(片側のみに価格がある場合)

Grok Imagine Image 2.0 は、xAI の API 上で画像1枚ごとの課金制です。grok-imagine-image は1枚あたり0.02ドル、grok-imagine-image-quality は1枚あたり0.05ドルで、レート制限は毎秒5リクエストです。編集は入力画像と生成された出力の両方に対して課金されます。コンシューマー向けアプリでは、これは月額30ドルの SuperGrok サブスクリプションの背後にあり、無料ティアは今年の初めに廃止されました。そのため、これを使って構築する人にとっての価格の基準となるのは、アプリではなく API なのです。

Screenshot of xAI's official grok-imagine-image model documentation showing the pricing card at $0.02 per generated image, the note that you are charged for each image generated and also when an image is used as input, the alias grok-imagine-image-2026-03-02 for the March 2026 base model, and a 5 requests-per-second rate limit.

Flux 3の画像ティアには価格がありません。エンドポイントがないためです。公開されているBFLの数値はビデオティアのものだけです——ドラフトは1秒あたり$0.06、HDは$0.17/s、FHDは$0.29/sで、テキストから動画および画像から動画向け、動画から動画はおよそ2倍——これは少なくとも、BFLがFlux 3ファミリーを市場のプレミアム層に位置づけていることを示しています。画像ティアが登場すれば、xAIの$0.02という下限をはるかに上回る1枚あたりの価格になっても驚きではありませんが、それは推測であり、事実ではありません。正確に言えば、BFLは画像の価格を一切発表していないのです。

Flux 3がもたらす、Image 2.0にはできないもの

Flux 3の存在意義は、決して現在の静止画にあるわけではない。BFLは画像・動画・音声・ロボット動作にまたがる単一の重みセットを学習させた。つまり「画像モデル」とは、後で同期された音声とエフェクトを生成し、供給されたキーフレームを20秒のクリップに動かし、そして長期的にはロボットの行動を予測する、まさに同じモデルなのである。もしあなたのパイプラインが、静止画から動画作品まで被写体のアイデンティティを維持することを必要とするなら、あるいは全モダリティを網羅する単一のリクエスト形式を求めるなら——それは、Grok Imagine Image 2.0のような静止画・編集向け製品では賭けないアーキテクチャ上の賭けなのだ。

一方で、{{1}}Grok Imagine Image 2.0は、暫定的ではあるものの、今日実際のArenaランクを有する本物の製品です{{/1}}。そして{{2}}Flux 3 imageは、すでに姉妹部門のリリースを見届けた約束にすぎません。FLUX 3 Videoは8月4日から5日にかけて一般提供が開始されましたが、画像部門は依然として「数週間後」とされています{{/2}}。{{3}}マルチモーダルへの野心は終着点ではありません。{{/3}}

誰がどれを選ぶべきか

今四半期中に本番用の画像編集(背景除去、領域編集、マルチリファレンス合成)が必要なら、Grok Imagine Image 2.0は2つのうち実際に採用できる唯一の製品であり、1枚あたり$0.02〜$0.05という価格なら、自分のプロンプトを体系的にテストするのも安価で気軽に実行できる。単一モデルから静止画・動画・音声をカバーするパイプラインを計画していて、待つ余裕があるなら、Flux 3 imageのほうが興味深い賭けだ。ただし、それは未出荷の賭けであり、「数週間以内」という日程以外に確約された納期はなく、価格も未定だ。

現在、どちらのモデルもOrcaRouter上にはありません。{{1}}xAIはImage 2.0を自社アプリと開発者APIで配布し{{/1}}、{{2}}BFLは自社APIで提供しています{{/2}}が、どちらもまだサードパーティのホストには登場していません。登場したら、この2つは単一のルーティングレイヤーを介して実行する価値があります。{{3}}自社プロンプトでの画像ごとのA/Bテスト{{/3}}、{{4}}どちらかのモデルが新しいうちは実績のある生成モデルへの自動フェイルオーバー{{/4}}、そして{{5}}0%マークアップのパススルー{{/5}}により、表示される価格表はプロバイダーの定価そのものとなり、{{6}}割引があればその日のうちに反映されます{{/6}}。それが、公開から2日目のモデルと未リリースのモデルを、どちらかに本番を賭けることなく採用する方法です。

結論

Grok Imagine Image 2.0 対 Flux 3 は、今のところ接戦ではありません。なぜなら、それはレースではないからです — 競争相手の一方しかトラックにいないのです。Image 2.0 は、イメージごとの価格で有能な編集ツールキットを出荷しており、Arenaランクは本物ですが暫定的なものであり、編集ランキングは x​AI が引用したもので、独立して確認されたものではありません。Flux 3 image はより野心的なアーキテクチャであり、まだ出荷されておらず、価格もデモもありません。今日画像が必要なら、選択肢は自ずと決まります。画像生成の行方に賭けているなら、Flux 3 のイメージ層に注目してください — そして、すべてのロードマップの主張は、エンドポイントが存在するまでは未検証として扱ってください。