OpenAIのgpt-image-2は、gpt-imageシリーズの次世代版です。標準のOpenAI Images APIを通じてアクセスするトークン課金型の画像モデルです。gpt-image-1からのドロップインアップグレードで、同じSDK、同じ呼び出し形式、同じパラメータを使用します。既存のOpenAIクライアントをOrcaRouterのベースURLに向け、モデルを`openai/gpt-image-2`に設定してください。価格は入力$5.00 / 出力$30.00(100万トークンあたり)、原価で請求されます。マークアップゼロ、移行作業ゼロです。
OpenAI GPT-Image-2は、OpenAIが提供するマルチモーダルモデルで、画像の生成と編集に特化しています。テキストプロンプトとオプションの画像入力を受け付け、修正された画像や全く新しいビジュアル出力を生成します。このモデルの性能は、LM Arena Image Edit…
GPT-Image-2は、テキスト記述から画像を生成し、テキストによる指示に基づいて既存の画像を編集するように設計されています。色、テクスチャ、形状、構図などの属性を変更したり、オブジェクトを追加・削除したりすることができます。このモデルは、プロンプト設計を通じてインペインティング(画像の一部を置き換える)とアウトペインティング(キャンバスを拡張する)を暗黙的にサポートします。また、スタイル転送も可能であり、ユーザーがソース画像に特定の美的スタイルを適用できます。これらの機能により、簡単な修正から創造的な視覚実験まで、幅広いタスクに適しています。
はい、GPT-Image-2は入力画像を必要とせず、テキストプロンプトから完全に新しい画像を生成できます。このモデルは提供された説明を使用して、シーン構成、照明、色、オブジェクトなどの詳細を含む視覚的表現を作成します。生成される画像の品質と忠実度は、プロンプトの具体性と基盤となるアーキテクチャの制約に依存します。最良の結果を得るには、プロンプトは明確で、曖昧な参照を避けるべきです。この機能は、アイデア出し、プロトタイピング、コンセプト説明からユニークなイラストを生成するのに役立ちます。
GPT-Image-2は、主な入力としてテキストプロンプトを受け付けます。画像編集時には、既存の画像をURLまたはAPIリクエスト内の生のbase64エンコードデータとして提供する必要があります。画像はPNGやJPEGなどの標準フォーマットである必要があり、解像度とサイズの制限はOpenAIのAPI仕様に従います。このモデルは動画や複数画像の入力をネイティブでサポートしておらず、各リクエストは単一のプロンプトと画像のペアに対して動作します。出力画像は一般的なフォーマット(通常はPNG)で生成され、クライアントの希望に応じてURLまたはbase64データとして提供できます。
GPT-Image-2はリクエスト間で状態を保持しません。各API呼び出しは独立しています。プロンプトの連続によって画像を段階的に洗練させるマルチステップ編集は、呼び出し元のアプリケーションが管理する必要があります。開発者は、各ステップで前回の出力を次のリクエストの入力として渡すワークフローを実装できます。このアプローチにより、最初に色を調整し、次に背景を追加し、最後にリサイズするといった反復的な編集が可能になります。機能面では有効ですが、組み込みの状態がないため、アプリケーションは中間画像の保存や各ステップに適したプロンプトの構築といったコンテキストを処理しなければなりません。
LM Arena Image Edit Eloスコア1467.0は、画像編集出力の品質を測定するベンチマークです。この文脈におけるEloスコアは、人間による評価者がモデルの出力をペアごとに比較して算出されます。スコア1467は、GPT-Image-2がベースラインモデルを大幅に上回り、他の主要な画像編集モデルと互角に競争できることを示しています。これは、オブジェクトの挿入、背景の置き換え、色の変更、構成の編集といったタスクにおいて高いパフォーマンスを反映しています。このスコアは、画像編集カテゴリのLM Arenaリーダーボードの中でも最高レベルの一つであり、モデルがプロンプトに忠実で、一貫性があり、視覚的に魅力的な編集を生成することを示唆しています。
GPT-Image-2 のレイテンシは、プロンプトの複雑さ、入力のサイズ(ある場合)、および希望する出力解像度によって異なります。OpenAI はこのモデルに対する固定のレイテンシ保証を提供しておらず、典型的な応答時間は数秒から、大きな画像や複雑な編集の場合は数十秒の範囲です。OrcaRouter はリレーであり、プロバイダの処理時間にオーバーヘッドを追加しないため、実際の待機時間は OpenAI を直接呼び出す場合と同じです。本番アプリケーションでは、ユーザーはタイムアウトとリトライロジックを実装し、スループットを管理するためにバッチ処理を検討する必要があります。
GPT-Image-2は、自然言語による指示に基づいた正確な変更を必要とする画像編集タスクに優れています。高いLMアリーナEloスコアは、正確で美的に優れた編集結果を生み出す能力を反映しています。このモデルは、オブジェクトの置き換えにおいて適切な照明や影を維持するなど、複雑な構成変更をうまく処理します。また、ゼロから高品質な画像を生成し、優れたフォトリアリズムとプロンプトへの忠実性を実現します。ユーザーからは、「このシーンを油絵のように見せて」といった創造的な指示に対して、もっともらしいスタイル変換を行うとよく報告されています。
強力なベンチマーク性能にもかかわらず、GPT-Image-2には限界があります。特に複数のオブジェクトを同時に修正する必要がある場合、非常に長い指示や複数の部分からなる指示では苦戦することがあります。このモデルは、特に複雑なシーンにおいて、歪んだ顔や非現実的なテクスチャなどのアーティファクトを時折生成することがあります。また、特定の種類のコンテンツの生成を防ぐ安全性の制限があり、一部の創造的な使用を制限する可能性があります。さらに、このモデルはOpenAIのインフラを通じてアクセスされるため、ユーザーはOpenAIのコンテンツポリシーとレート制限の対象となり、バルク編集ワークフローに影響を与える可能性があります。
GPT-Image-2はトークン単位で価格設定されています。入力トークン100万個あたり$8.00、出力トークン100万個あたり$30.00です。入力トークンには、テキストプロンプトと、base64でエンコードされた画像データ(画像はトークン化されるため)が含まれます。出力トークンは生成された画像表現です。リクエストの総コストは、プロンプトの長さと、入力画像および出力画像の解像度に依存します。OrcaRouterはこの価格設定をゼロマークアップでそのまま適用します。つまり、コストはOpenAIが請求する金額と全く同じです。OrcaRouterプラットフォームによる追加料金は一切発生しません。
いいえ。OrcaRouterは、GPT-Image-2をプロバイダー料金で請求し、マークアップは一切ないと明示しています。つまり、トークンあたりの価格は入力がちょうど8.00ドル、出力が30.00ドルです。OrcaRouterによる月額の購読料、基本費用、またはマークアップ率は一切かかりません。課金されるのはOpenAIが消費したトークンコストのみです。ユーザーはサービス中断を避けるため、OrcaRouterで有効な請求方法を設定しておく必要がありますが、価格設定は透明で予測可能です。
OpenAIは画像生成や編集プロンプトのキャッシュを公開していません。各リクエストは独立して処理されます。そのため、同じ入力画像で同一のプロンプトを繰り返すと、通常は毎回全トークンコストが発生します。ただし、アプリケーションで同じ入力画像を頻繁に使用する場合、画像を外部に保存し、base64として再エンコードせずにURLで参照することで(対応している場合)、入力トークン使用量を削減できる可能性があります。OrcaRouterは、このモデルのトークン消費を削減する追加のキャッシュレイヤーを提供していません。
GPT-Image-2の価格はOpenAIによって設定されており、その特殊な編集機能により、画像モデルの中でも高コストの選択肢の一つです。OrcaRouterで利用可能なStability AIモデルのようなより安価な代替手段は、トークンあたりのレートが低いかもしれませんが、LM Arenaベンチマークで測定される編集精度には及ばない可能性があります。トレードオフはコストと出力品質の間です。単純な編集やリスクの低いアプリケーションでは、より安価なモデルで十分かもしれませんが、高い忠実度とプロンプトへの準拠が重要な場合には、GPT-Image-2が望ましいです。
To use GPT-Image-2 through OrcaRouter, send an HTTP POST request to the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1/images/generations (or a similar endpoint depending on the operation). Set the model parameter to "openai/gpt-image-2". Include a prompt string and optionally an image (as base64 or URL) for editing tasks. OrcaRouter authenticates requests using your API key (typically passed in the Authorization header as "Bearer <key>"). The response will contain generated image data in the format specified by the request, usually as a URL or base64 string.
APIパラメータは、基本的にOpenAIの画像生成スキーマに従います。主要なパラメータとしては、"model"("openai/gpt-image-2"に設定)、"prompt"(テキストによる指示)、"n"(生成する画像数、デフォルトは1)、"size"(出力サイズ、"1024x1024"など)、"response_format"("url"または"b64_json")、"user"(レート制限追跡用)があります。編集タスクでは、"image"(入力画像をbase64形式で)および"mask"(インペインティング用、修正する領域を指定)を含めることもできます。サポートされているパラメータの完全なリストとその制約については、OpenAIの公式ドキュメントを参照してください。
移行は簡単です。OrcaRouterはOpenAIと完全互換のAPIを提供しているためです。必要な変更は、ベースURLをhttps://api.openai.comからhttps://api.orcarouter.ai/v1に更新し、モデル文字列を"gpt-image-2"のようなものから"openai/gpt-image-2"に変更するだけです。認証、リクエストのシリアライズ、レスポンス処理に関する既存のコードは、変更なしで動作します。パラメータ名やデータ構造の変更は不要です。エンドポイントとモデルIDを更新した後、単一のリクエストでテストして、接続と課金動作を確認してください。
OrcaRouterはAPIキー認証を使用します。リクエストヘッダーにOrcaRouterのAPIキーを含める必要があります。レート制限はOrcaRouterとOpenAIの両方によって決定されます。OrcaRouterは悪用を防ぐために制限を課す場合がありますが、通常は寛大です。OpenAIはティアと課金に基づいた独自のレート制限を適用し、OrcaRouter経由でモデルにアクセスする場合も直接アクセスする場合も同様に適用されます。ユーザーはOrcaRouterダッシュボードで使用状況を監視し、それに応じてリクエストのペースを調整する必要があります。APIキー以外の追加認証は必要ありません。
GPT-Image-2とDALL-E 3は、どちらもOpenAIの画像生成モデルですが、それぞれ異なるユースケースを想定しています。DALL-E 3は、ゼロから創造的でフォトリアリスティックな画像を生成することに特化した汎用テキスト・ツー・イメージモデルです。GPT-Image-2は既存画像の編集に最適化されており、高いLM Arena Image Edit Eloスコアがその証拠です。DALL-E 3もある程度の編集は可能ですが、その強みはオリジナル生成にあります。GPT-Image-2は、特にプロンプトが元の構図の要素を保持することを含む場合、入力画像に対してより正確な修正を生成する傾向があります。
Stability AIのSD3.5などのモデルは、トークンあたりのコストが低いオープンソースの画像生成器ですが、同等の品質を達成するにはより多くのプロンプトエンジニアリングが必要になる場合があります。一方、独自モデルであるGPT-Image-2は、豊富な訓練データと編集タスク向けの微調整の恩恵を受けており、そのLM Arenaスコアに反映されています。どちらを選ぶかは、予算と品質要件によります。精度が重要な高リスクの編集にはGPT-Image-2が適しています。大量生成やコストが最優先事項である場合は、OrcaRouterで利用可能なStability AIモデルが有効な代替手段となり得ますが、特定のアプリケーションにおける品質の違いを評価する必要があります。
編集を必要としないシンプルな画像生成タスクや、不完全な編集に対する許容度が高い場合には、より低価格のモデルを選択しましょう。例えば、プレースホルダー画像、シンプルなアイコン、低解像度のグラフィックスを生成する場合には、GPT-Image-2のような高度なモデルは必要ありません。同様に、プロンプトが明るさの調整やトリミングなどの軽微な変更のみを含む場合には、より特化していないモデルで十分な場合があります。OrcaRouterは、さまざまな価格帯の画像モデルを提供しています。具体的なユースケースを評価し、編集タスクが複雑で高い忠実度が要求される場合にはGPT-Image-2が適切ですが、そうでない場合には代替モデルによるコスト削減を検討してください。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1| 入力 / 1M tokens | $8.00 |
|---|---|
| 出力 / 1M tokens | $30.00 |
| キャッシュ読み取り / 1M | $1.25 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2