Gemini 2.5 Flashは、Googleの最先端のワークホースモデルであり、高度な推論、コーディング、数学、科学的タスクのために特別に設計されています。内蔵の「思考」機能を備えており、より優れた応答を提供することができます...
Google Gemini 2.5 Flashは、Googleが開発したマルチモーダル言語モデルです。Gemini 2.5シリーズに属し、テキスト、画像、音声、動画入力を効率的に処理するよう設計されています。このモデルは1,048,576トークンのコンテキストウィンドウをサポートしており、非常に長いドキュメントや複数ファイルにわたる会話を処理できます。出力長は最大65,536トークンに達します。G…
Gemini 2.5 Flashは5つの入力モダリティ(ファイル(例:PDF、ドキュメント)、画像、テキスト、音声、動画)を受け入れます。これにより、ユーザーは単一のリクエストで多様なデータを提供できます。例えば、動画の録画、付随するテキストスクリプト、PDFの参考文書を提出すると、モデルはすべてのモダリティにわたって推論します。モデルはこれらの入力をネイティブに処理し、ほとんどのフォーマットで別途エンコードやチャンク化を必要としません。このマルチモーダルサポートは、動画の要約、複数ドキュメントの分析、インタラクティブアシスタントなどのタスクに特に有用です。
1,048,576トークンのコンテキストウィンドウを備えたGemini 2.5 Flashは、一度の処理で書籍全体、長大なコードベース、または数時間分の書き起こし音声を取り込むことができます。これにより、スライディングウィンドウ技術や外部メモリが不要になります。ユースケースとしては、ソフトウェアプロジェクト全体のバグレビュー、引用が多数含まれる長大な法律文書の分析、数時間の会議の要約などがあります。この大きなコンテキストにより、モデルは非常に長い会話にわたって一貫性を維持できますが、出力長は65,536トークンに制限されています。
ベンチマークに基づくと、Gemini 2.5 Flashは数学的推論に優れており、MATH-500で93.2をスコアしました。また、大規模なコンテキストとマルチモーダルトレーニングにより、コード生成と理解においても強力なパフォーマンスを示します。モデルが音声と動画をネイティブに処理できる能力は、前処理のオーバーヘッドを削減します。トークンあたりの低コストは、バッチ処理やリアルタイムアプリケーションにとって魅力的です。ただし、非常に高い創造性やドメイン固有の専門知識を必要とするタスクには、特殊化されたモデルやより大きなモデルが好まれる場合があります。
Gemini 2.5 Flash は、入力100万トークンあたり0.30ドル、出力100万トークンあたり2.50ドルという競争力のある価格設定がすでになされています。しかし、分類や短いテキスト生成のような非常にシンプルなタスクでは、Gemini 1.5 Flash のようなより小規模なモデルやサードパーティの代替モデルの方が、トークンあたりのコストが低くなる可能性があります。予想されるトークン使用量とレイテンシ要件を評価してください。ワークロードに100万トークンのコンテキストやマルチモーダル入力が不要な場合は、より小さいコンテキストウィンドウを持つテキスト専用モデルを選択することでコストを削減できます。OrcaRouter のカタログでは、コスト比較のためのオプションが提供されています。
MATH-500は、代数、幾何、確率、数論を網羅する500の難解な数学問題からなるベンチマークです。スコア93.2は、モデルがこれらの問題の93.2%を正解したことを意味し、強力な数学的推論と問題解決能力を示しています。このスコアにより、Gemini 2.5 Flashは数学タスクにおいてトップクラスのモデルの一つに位置づけられます。このベンチマークは、計算精度と論理的推論の両方をテストします。教育ツール、科学計算、または数学を多用するワークフローに取り組む開発者は、このスコアを参考にすることができます。
速度はリクエストの複雑さ、トークン長、サーバ負荷に依存します。GoogleはGemini 2.5 Flashの具体的なレイテンシ数値を公開していません。ただし、“Flash”という名称は、Proバリアントと比較して低レイテンシ向けの最適化を示しています。OrcaRouterを通じた通常の使用では、応答時間はリアルタイムアプリケーションに対して競争力があります。高スループットのシナリオでは、リクエストのバッチ処理やストリーミング出力の利用を検討してください。OrcaRouterはOpenAI互換APIを介してストリーミング応答をサポートしており、知覚レイテンシを低減できます。
予算モデル(GPT-4o miniやClaude 3 Haikuなど)と比較して、Gemini 2.5 Flashはより大きなコンテキストウィンドウ(1M対通常128K-200K)とマルチモーダル入力をサポートしています。MATH-500のスコアは93.2で、同程度の価格帯の多くの代替モデルよりも高いです。コストは競争力があり、特に出力トークンは1Mトークンあたり$2.50です。ただし、純粋にクリエイティブな文章作成や会話の流暢さに特化したタスクでは、他のモデルがより良いパフォーマンスを発揮する可能性があります。非数学タスクに関するベンチマークデータは提供されていないため、直接比較は限定的です。
Gemini 2.5 Flashは数学とコードにおいて優れた性能を発揮しますが、事実の想起、微妙な言語理解、創造的生成といった他の側面での性能は、提供されたベンチマークではカバーされていません。「Flash」モデルであるため、推論の深さと速度のトレードオフが生じる可能性があります。最大出力トークン数65,536は、非常に長いレポートの生成や、極めて長い入力の要約には不十分かもしれません。さらに、モデルの学習データのカットオフ日や潜在的なバイアスは明記されていません。重要なアプリケーションでは、出力を検証する必要があります。
価格設定は明確です:入力1百万トークンあたり$0.30、出力1百万トークンあたり$2.50です。これらの料金はGoogleのプロバイダーレートに基づいて請求され、OrcaRouterによるマークアップは一切加算されません。隠れた手数料や追加料金はありません。例えば、入力トークン1千万の処理には$3.00、出力トークン1百万の生成には$2.50がかかります。この価格は対応するすべての入力モダリティに適用されます。トークン数には、すべてのテキスト、画像パッチ(変換後)、およびGoogleのトークン化スキームに従ったオーディオ/ビデオセグメントが含まれます。
プロンプトキャッシングを使用すると、同じコンテキストが複数のリクエストで再利用される場合、入力コストを削減できます。Google Geminiモデルは、繰り返されるプレフィックストークンの自動キャッシングをサポートしています。OrcaRouterでは、キャッシングの動作はGoogleのポリシーに従います。アプリケーションが同じシステム指示や参照ドキュメントを頻繁に送信する場合、キャッシングにより実効的な入力トークンコストが低下する可能性があります。正確な節約額はキャッシュヒット率に依存します。価格情報には特定のキャッシング割引は記載されていませんが、ユーザーはキャッシングの対象条件についてGoogleのドキュメントを参照する必要があります。
Gemini 2.5 Proは通常、Flashよりもトークンあたりのコストが高い(Proの正確な価格は提供されていない)ですが、複雑な推論タスクにおいてはより高品質な結果をもたらす可能性があります。Flashは速度と経済性を優先するアプリケーション向けに設計されています。大量生産においては、Flashのトークンあたりのコストが低いことで大幅なコスト削減が可能になります。ただし、タスクに絶対的な最高精度が求められる場合(例:法律や医療に関する推論)、Proの追加コストは正当化される可能性があります。最適な費用対効果のトレードオフを判断するために、両方をデータのサンプルで評価してください。
OrcaRouter はマークアップを追加しないため、トークンあたりの価格は Google のプロバイダーレートのままです。エンタープライズ向けには Google から直接大口割引が提供される可能性がありますが、これらは記載されている標準の従量課金制価格には反映されていません。OrcaRouter は最低契約期間のないシンプルなトークン単位のモデルを提供しています。ユーザーはボリュームに基づく取り決めの可能性について OrcaRouter に問い合わせることができますが、具体的な割引体系は事実として提供されていません。
OrcaRouterのOpenAI互換APIを介してGemini 2.5 Flashを呼び出します。ベースURLを「https://api.orcarouter.ai/v1」に、モデルIDを「google/gemini-2.5-flash」に設定します。任意のOpenAI SDKまたはHTTPクライアントを使用できます。認証にはOrcaRouterのAPIキーが必要です。モデルパラメータを指定して、/chat/completionsにPOSTリクエストを送信します。Pythonの例: client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY"); response = client.chat.completions.create(model="google/gemini-2.5-flash", messages=[{"role":"user","content":"Hello"}])。このAPIはストリーミング、関数呼び出し、その他の標準的なOpenAIパラメータをサポートしています。
すべての標準的なOpenAIチャット完了パラメータがサポートされています。これには、messages(メッセージオブジェクトの配列)、temperature(0~2)、top_p、max_tokens(最大65536)、frequency_penalty、presence_penalty、stop、stream(ブール値)、logprobsが含まれます。マルチモーダル入力には、テキストとimage_urlまたはfile_url部分を含むcontent構造を使用します。オーディオおよびビデオ入力は、ファイルサイズに応じて、base64エンコードされたデータURIまたはURLとして提供できます。APIは、必要に応じてJSONモードのresponse_formatもサポートしています。正確なフォーマットの詳細については、OrcaRouterのドキュメントを参照してください。
移行は簡単です。OrcaRouterはOpenAI互換のエンドポイントを使用するためです。OpenAI、Anthropic、その他のプロバイダーをご利用の場合は、ベースURLをhttps://api.orcarouter.ai/v1に変更し、APIキーをOrcaRouterのキーに差し替えてください。モデルIDを"google/gemini-2.5-flash"に更新します。メッセージ形式、ストリーミング、その他の呼び出し構造を変更する必要はありません。GoogleのネイティブVertex AIまたはGenerative AI SDKから移行するユーザーは、OpenAIメッセージ形式に適合させる必要がありますが、多くのライブラリに変換ユーティリティが用意されています。
OrcaRouterは標準的なHTTPエラーコードを公開しています:認証エラーは401、レート制限は429、サーバーエラーは500です。レート制限はお使いのOrcaRouterプランによって異なります。GoogleもAPIキーごとに独自のレート制限を課す場合があります。APIはOpenAI形式でエラーを返します。1Mのコンテキストウィンドウまたは65Kの出力を超える大きなリクエストの場合、400エラーが発生します。OrcaRouterのドキュメントには、具体的なレート制限の階層が記載されています。レート制限に達した場合は、指数バックオフを使用した再試行を検討してください。
GPT-4o miniは、OpenAIのより小型で低価格なモデルで、コンテキストウィンドウは128Kトークン(Gemini 2.5 Flashの8分の1)です。GPT-4o miniはテキストのみですが、Gemini 2.5 Flashはファイル、画像、音声、動画をサポートしています。MATH-500では、GPT-4o miniは約70~80点(この比較の正確な数値は非公開)で、Gemini 2.5 Flashは93.2点です。GPT-4o miniの価格は、入力/出力1Mトークンあたり約$0.15/$0.60で、Gemini Flashよりも入力は安いが出力は高いです。マルチモーダルで長いコンテキストのタスクにはGemini Flashを、超低コストのテキスト専用アプリケーションにはGPT-4o miniを選んでください。
Gemini 2.0 Flash(前世代)は、1Mトークンのコンテキストウィンドウと同様のマルチモーダルサポートを備えていました。しかし、Gemini 2.5 Flashは数学的推論を改善しており、MATH-500スコアが93.2であるのに対し、2.0 Flashのスコア(未提供だが、おそらく低い)であることからも明らかです。2.5 Flashの価格は1Mトークンあたり$0.30/$2.50で、2.0 Flashは1Mトークンあたり$0.15/$0.60でした。つまり、2.5 Flashはトークンあたりのコストが高くなっています。トレードオフは精度の向上です。高い数学性能を必要としないコスト重視のプロジェクトでは、2.0 Flashが適しているかもしれません。OrcaRouterは両方のバージョンを提供しています。
その他の低価格マルチモーダルモデルには、Claude 3 Haiku(200Kコンテキスト、テキスト+画像)やLlama 3.2 90B(128Kコンテキスト、テキスト+画像)があります。Gemini 2.5 Flashは最大のコンテキストウィンドウ(1M)を提供し、音声/動画をネイティブサポートする点は、この価格帯では珍しいです。MATH-500スコア93.2は、多くの同クラスのモデルよりも高い数値です。ただし、純粋なテキスト生成においては、Mistral Smallのようなモデルの方が低レイテンシを実現できる可能性があります。最適な選択は、必要なモダリティ要件と、より大きなコンテキストがコストに見合うかどうかに依存します。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 入力 / 1M tokens | $0.300 |
| 出力 / 1M tokens | $2.50 |
| キャッシュ読み取り / 1M | $0.030 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gemini_2_5_flash,
title = {Gemini 2.5 Flash API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash}
}Google. (2025). Gemini 2.5 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash