Gemini 2.5 Flash Image(通称「Nano Banana」)が一般提供を開始しました。これは、状況を理解する最先端の画像生成モデルであり、画像生成などが可能です。
Google: Nano Banana (Gemini 2.5 Flash Image) は、Googleが開発したマルチモーダル言語モデルで、Gemini 2.5 Flashシリーズの一部です。画像とテキストの両方を入力として受け付け、テキスト出力を生成します。このモデルは、OrcaRouterのOpenAI互換APIを介して、モデル識別子…
中核的な機能は、画像として提示された視覚コンテンツの理解と推論にあります。画像とテキストプロンプトが与えられると、モデルはシーンの説明、物体の識別、コンテンツに関する質問への回答、テキスト抽出(OCR)、および基本的な視覚的推論(例:空間関係、色、動作)を実行できます。また、画像に付随するテキスト(指示やコンテキストなど)も処理可能です。フラッシュ層アーキテクチャを採用しているため、低レイテンシと高スループットに最適化されており、リアルタイムまたは大量処理のアプリケーションに適しています。ただし、詳細な分析や長い推論チェーンを必要とする複雑な視覚タスクでは、Gemini 2.5 Proのようなより高価で大規模なモデルと比較して、推論の深さや精度で劣る可能性があります。このモデルは、画像生成、動画分析、または32Kトークンを超える長いコンテキストを必要とするマルチターン会話のようなタスク向けには設計されていません。
アプリケーションが画像入力を全く必要としない場合、テキストのみのモデル(例えば、より小規模なGeminiバリアントやオープンソースモデル)を使用する方がコスト効率が高くなります。同様に、視覚要素を伴わないテキストベースの推論のみを扱うタスクでは、画像処理のオーバーヘッドは不要です。出力長が長いシナリオ(画像から詳細なレポートやストーリーを生成する場合など)では、出力トークン100万あたり30ドルという価格が高額になる可能性があります。そのような場合、出力価格がより低いモデルを検討するか、このモデルで簡潔な要約を生成し、その後より安価なテキストのみのモデルで拡張することを検討してください。また、リクエストごとに複数の画像を処理する必要がある場合や、非常に大きな画像を扱う場合には、より大きなコンテキストウィンドウや特定の画像解像度をサポートするモデルの方が適しているかもしれません。
大量デプロイでは、このモデルの低い入力コスト(100万トークンあたり0.30ドル)と高速な推論が効果を発揮します。理想的なユースケースとしては、大規模な写真ライブラリの自動画像タグ付け、何千もの商品画像に対する代替テキストの生成、スキャン文書のバッチ処理によるOCR、ユーザーがアップロードした画像のリアルタイムコンテンツモデレーションなどが挙げられます。出力コストが高いため、応答は短く(多くの場合、単語、ラベル、または一文)抑える必要があります。例えば、画像を所定のカテゴリに分類する、フォームからいくつかの主要フィールドを抽出する、画像に関するYes/Noの質問に答える、といった用途です。バッチ処理はOrcaRouterのAPIを介し、同時リクエストで実行できます。このモデルのレイテンシは概して低いですが、実際のスループットは画像のサイズと複雑さに依存します。OrcaRouterには、API全体の使用量以外に個別のレート制限はありません。
主な制限は、入力コストに比べて出力トークンのコストが高く、長いテキスト生成に費用がかかることです。32,768トークンのコンテキストウィンドウにより、1回のリクエストで処理できるテキスト量と画像のサイズ(トークン換算)が制限されます。このモデルは、深いマルチモーダル推論、複雑な視覚的詳細、または複数の画像の同時処理(画像を追加するたびにコンテキストを消費)を必要とするタスク用には設計されていません。さらに、フラッシュ層モデルとして、医療画像分析、細かい物体検出、希少な物体認識などの専門的な視覚タスクでは、より高性能であるが低速または高コストのモデルと比較して精度が低い可能性があります。モデルのトレーニングデータやベンチマークでの具体的なパフォーマンスは、提供された事実では開示されていません。ユーザーは自身のデータセットで評価する必要があります。最後に、画像とテキスト入力のみをサポートし、ビデオや音声はサポートしていません。
提供された事実には、Google: Nano Banana (Gemini 2.5 Flash Image)の具体的なベンチマークスコアは含まれていません。これはGoogleのGemini 2.5 Flashシリーズの一部であり、一般的に最高精度ではなく効率性を重視しています。数値がないため、ユーザーはVQAv2、COCO Captions、OCRなどの標準的な視覚言語タスクにおいて、他のフラッシュ層マルチモーダルモデルと同等のパフォーマンスを期待すべきです。ただし、正確なスコアは提供されていません。ご自身の代表的なデータセットでモデルを評価し、その機能が要件を満たすかどうかを判断することをお勧めします。OrcaRouterは、Googleが公開しているものを超える内部ベンチマークは提供していません。正確な精度指標が必要な場合は、Googleの公式ドキュメントでGemini 2.5 Flashシリーズを参照してください。ただし、この特定のモデル識別子には独自のファインチューニングが施されている可能性があることに留意してください。
提供された事実には、このモデルのレイテンシ測定値は含まれていません。Gemini 2.5 Flashファミリーの一環として、低レイテンシと高スループット向けに設計されています。通常、Googleのフラッシュ層モデルは、速度と引き換えに推論品質をある程度犠牲にしており、準リアルタイムアプリケーションに適しています。実際のレイテンシは、入力画像のサイズと解像度、テキストプロンプトの長さ、要求される出力トークン数、そしてAPIの現在の負荷などの要因に依存します。一般的に、単純な画像キャプション作成タスクは数百ミリ秒から数秒で完了する場合がありますが、より複雑なプロンプトで長い出力が必要な場合は時間がかかります。最良の結果を得るには、画像解像度を妥当な範囲に抑え、出力長を制限してください。OrcaRouterのAPIには、プロバイダーの応答時間以外の追加オーバーヘッドはありません。
強み: このモデルは、1枚の画像から高速かつ低コストで回答が必要なタスクに優れています。一般的な物体の識別、画像からのテキスト読み取り、視覚コンテンツに関する直接的な質問への回答を迅速に行えます。入力コストが低いため、大量の画像処理が現実的です。限界: 小さな物体のカウント、非常に似たテクスチャの区別、複雑な図表の理解など、高い精度が要求されるタスクでは苦戦する可能性があります。モデルの理解はピクセルデータとテキストプロンプトから推測できる範囲に限定され、トレーニングデータ(カットオフ時期は不明)を超えた外部知識にはアクセスできません。また、出力コストが高いため、画像ごとに詳細な回答を生成するとすぐに費用がかさみます。長く詳細な分析が必要なタスクには、より高性能(通常はより高価)なモデルが適しています。暗くぼやけた画像や異常な角度など、エッジケースでのパフォーマンスは低下する可能性があります。
価格設定は明確です:入力トークン100万個につき0.30ドル、出力トークン100万個につき30.00ドルです。入力トークンには、テキストプロンプトと画像の両方のトークンが含まれます(画像はモデルによってトークン化されます)。出力トークンは応答として生成されるトークンです。設定料金はなく、月額最低料金もなく、OrcaRouterは追加のマークアップを一切行いません。つまり、プロバイダーのレートをそのまま支払うことになります。トークンはOrcaRouterのシステムによってカウントされます。請求は通常、使用量に基づいて行われ、リクエストを送信するたびに料金が発生します。使用状況はOrcaRouterのダッシュボードで監視できます。入力トークンは出力トークンよりもはるかに安価であるため、典型的なリクエスト(短い出力)の総コストは、特に大きな画像を含める場合、入力側が支配的になります。たとえば、1024×1024の画像は数千の入力トークンを消費する可能性があります。
テキストのみのモデル(例:Gemini 1.5 Flash テキストのみ、入力 $0.075/M、出力 $0.30/M)と比較すると、このモデルの入力コストは4倍、出力コストは100倍高く、ビジョンの追加複雑性を反映しています。画像分析を必要としないタスクでは、それらのテキストのみのモデルの方がはるかに安価です。大規模なマルチモーダルモデル(Gemini 2.5 Proなど、トークンあたりのコストは高いが推論能力に優れる)と比較すると、このモデルは入力コストが安く、出力コストは特定のProティアに応じて同程度かそれ以上になります。Flashティアのトレードオフは、入力コストが低い代わりに精度が低いことです。アプリケーションで高い精度が必要で、高い入力コストを許容できる場合は、Proモデルの方が適している可能性があります。出力長が大きい場合、このモデルの出力コストが高額になるため、Gemini 1.5 Flash(テキスト+ビジョン)など、出力価格が低いモデルを検討してください(これらのモデルでは異なる料金が適用される場合があります)。
提供された事実には、このモデルに関するOrcaRouterでのキャッシュメカニズムやボリュームディスカウントは記載されていません。OrcaRouterはプロバイダーの料金をマークアップなしでそのまま通すため、割引がある場合にはGoogleとの直接の課金契約によるものとなります。現時点では、OrcaRouterの公開情報に画像埋め込みやプロンプトの自動キャッシュはありません。ユーザーは各リクエストが使用された入力および出力トークンに基づいて課金されると想定する必要があります。大量利用ユーザーは、潜在的なエンタープライズ契約について問い合わせるためにOrcaRouterに連絡する価値があるかもしれませんが、標準的な従量課金料金は入力$0.30/M、出力$30.00/Mです。コストを最小化するには、以前生成した出力を可能な限り再利用し、各リクエストのトークン数を制限してください(例:画像のリサイズや簡潔なプロンプトの使用)。
Google: Nano Banana (Gemini 2.5 Flash Image) を OrcaRouter 経由で使用するには、model パラメータを "google/gemini-2.5-flash-image" に設定した POST リクエストを https://api.orcarouter.ai/v1/chat/completions に送信します。API は OpenAI のチャット補完フォーマットに従います。Authorization ヘッダーに "Bearer YOUR_API_KEY" として OrcaRouter API キーを含めてください。リクエストボディには、画像とテキストの両方を含むユーザーメッセージを含む messages 配列を指定します。画像の場合、タイプ "image_url" の content 部分に URL または base64 データを含めます。例: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}。レスポンスは、モデルの回答を含む標準的なチャット補完です。
OrcaRouter APIは、OpenAI APIと同じパラメーターの多くをサポートしています。必須パラメーター:model(必須、"google/gemini-2.5-flash-image"に設定)、messages(必須、メッセージオブジェクトの配列)、max_tokens(整数、生成する最大トークン数)、temperature(浮動小数点数、デフォルト1.0、ランダム性を制御)、top_p(浮動小数点数、デフォルト1.0)、presence_penaltyおよびfrequency_penalty(浮動小数点数)、stop(文字列または文字列の配列、最大4つのシーケンス)、stream(ブール値、ストリーミング応答用)。画像入力の場合、messagesには、contentがパーツの配列で、各パーツにtypeフィールド("text"または"image_url")があるユーザーメッセージを少なくとも1つ含める必要があります。image_urlパーツには、"url"文字列(公開URLまたはbase64のデータURL)を持つ"image_url"オブジェクトが必要です。ファインチューニングや追加のモデル固有パラメーターは公開されていません。コンテキストウィンドウは32,768トークンなので、prompt_token_count + image_token_count + max_tokens <= 32768を確認してください。
OrcaRouterへの移行は、すでにOpenAI互換のAPIを使用している場合、最小限のコード変更で済みます。単にベースURLを以前のエンドポイントから https://api.orcarouter.ai/v1 に変更してください。APIキーをOrcaRouterのキーに更新してください。モデルを呼び出す際は、modelパラメータを"google/gemini-2.5-flash-image"(または希望するモデル)に設定してください。既存のモデルIDをそれに合わせて調整してください。画像入力の場合、リクエスト形式がOpenAIの規約に準拠していることを確認してください(例:content配列にimage_urlを使用)。通常、その他のコード変更は必要ありません。異なるAPI形式(例:クラウドエンドポイント)を使用していた場合は、リクエスト構造を書き換える必要があるかもしれません。OrcaRouterは一般的なSDK向けのドキュメントを提供しています。少数のリクエストでテストし、トークン数と料金を確認してください。OrcaRouterはプロバイダーのレートをマークアップなしで請求するため、料金が以前のプロバイダーと異なる場合があることに注意してください。
テキスト専用のGemini 2.5 Flash(OrcaRouterで利用可能な場合)と比較すると、このモデルは画像入力機能を追加しますが、入力コストが高くなります。テキスト専用バージョンは通常、入力トークンあたりのコストが低く、出力コストも大幅に低いため、純粋なテキストタスクに適しています。Gemini 2.5 Proモデルと比較すると、このflash層のモデルは入力コストが安いものの、精度や推論の深さが劣る可能性があります。Proモデルはより大きなコンテキストウィンドウ(多くの場合100万トークン)を持ち、複雑なマルチステップタスクでのパフォーマンスが優れています。出力コストはProモデルと同等かそれ以上になる場合があります。テキストと一緒に画像を理解する必要があるタスクには、このモデルはコスト効率の良い入門点を提供します。ただし、動画、音声、または複数の画像を同時に処理する必要がある場合は、それらのモダリティをサポートするモデル(例:一部の構成で動画と音声をサポートするGemini 2.5 Pro)を検討すべきです。
このモデルは、OrcaRouterを通じて利用可能なマルチモーダルオプションの一つです。GPT-4o(OpenAI)は通常、より大きなコンテキストウィンドウ(128k)を持ち、画像理解や推論において全体的に優れた性能を発揮する可能性がありますが、入力・出力コストは高くなります。Claudeのビジョンモデル(例:Claude 3.5 Sonnet)も競争力がありますが、価格設定やコンテキスト長が異なります。Gemini 2.5 Flash Imageの主な利点は低い入力コストであり、大量の短い出力タスクに適しています。ただし、複雑な視覚的推論、医療画像解析、詳細な文書分析には、より高度なモデルの方が優れた結果を生む可能性があります。選択は、コスト、精度、レイテンシの具体的なトレードオフに依存します。OrcaRouterでは、モデルIDを変更するだけで簡単にモデルを切り替えられるため、このモデルを代替案と並行してテストし、最適なものを判断することが可能です。
より高価なモデル(例:Gemini 2.5 Pro、GPT-4o、Claude 3.5 Sonnet)は、タスクに高い精度、長いコンテキスト、またはより多くのステップを要する推論が求められる場合に正当化されます。このモデルで不正確または不完全な結果が生じる場合、後処理や人手による修正が必要になればコスト削減は無駄になります。医用画像の分析、法律文書の解釈、コンプライアンス関連の機密コンテンツの処理といったタスクでは、プレミアムモデルの信頼性が高いコストに見合う可能性があります。また、長い出力(例:ページ全体の説明)の生成や非常に大きな画像の処理が必要な場合、コンテキストウィンドウが大きく、出力トークンコストが低いモデルの方が全体的に費用対効果が高くなることがあります。このモデルのフラッシュ層は、深さではなく速度とスループットを重視して設計されています。おおよその理解で十分な場面で使用し、精度が重要になる場合は上位モデルに切り替えてください。
データのプライバシーと取り扱いは、Geminiモデルに関するGoogleのポリシーに依存します。他のクラウドAPIと同様に、入力データ(画像およびテキスト)は処理のためにGoogleのサーバーに送信されます。Googleは、オプトアウトするか、そのような使用を禁止するエンタープライズグレードのアカウントを使用しない限り、モデル改善のためにデータを使用する可能性があります。提供された事実は、この特定のモデルのデータ取り扱いの詳細を指定していません。OrcaRouterをゲートウェイとして使用する場合、データはOrcaRouterのインフラストラクチャを通過しますが、最終的にはGoogleによって処理されます。OrcaRouterはお客様のデータを保存したり、トレーニングに使用したりすることはありません。ユーザーはGemini APIに関するGoogleのデータ処理条件を確認し、必要に応じてエンドツーエンドの暗号化を検討する必要があります。機密データについては、一部の組織はサードパーティのゲートウェイではなく、自社のインフラストラクチャでホストされるモデル(例:データ所在地を指定したVertex AI経由)を好みます。ただし、OrcaRouterは統一されたAPIキーと課金を提供するため、データ取り扱いの懸念が許容できる場合、アクセスを簡素化する可能性があります。
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| 入力 / 1M tokens | $0.300 |
| 出力 / 1M tokens | $30.00 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image