Gemini 3.6 Flashは、Googleの最新の高速でコスト効率の高いGemini 3ファミリーのモデルであり、テキスト、画像、動画、音声、ファイルを読み取り、テキストで応答するネイティブマルチモーダルモデルです。1Mトークンのコンテキストウィンドウと最大64K出力トークンを備えています。フロンティアに近い品質をFlashレベルの速度と価格で必要とするチーム向けに構築されており、コーディングエージェント、ドキュメントおよびメディア理解、検索拡張生成、高スループット自動化における強力なデフォルトモデルです。 前世代の3.5 Flashと比較して、トークン効率が大幅に向上し、冗長性が低減されています。同じかそれ以上の品質を達成しながら、出力トークンが少なくなるため、長いエージェント実行でのコストとレイテンシが直接的に低下します。構成可能な推論努力(呼び出し元がリクエストごとに速度と深度を調整可能)、ネイティブのツール呼び出し、構造化出力をサポートし、そのティアにおける長コンテキストおよびエージェントコーディング評価で強力な性能を発揮します。128k平均マルチニードル検索で91.8%、SWE-Bench Pro、Terminal-Bench、OSWorldで競争力のあるスコアを達成しています。 Gemini 3.6 Flashは、OpenAIのchat-completions形式とGeminiのネイティブgenerateContent APIの両方に対応しており、既存のGeminiおよびOpenAI互換の統合に対するドロップインアップグレードとなります。フロンティアモデルの知能の大部分をフロンティア価格を支払わずに求める場合、日常のワークホースとして使用してください。
Google Gemini 3.6 Flashは、Googleによって開発された大規模マルチモーダルモデルであり、OrcaRouterのAPIを通じて透過的な価格設定(マークアップなし)で提供されています。テキスト、画像、動画、ファイル、音声の入力を受け付け、最大1,048,576トークンのコンテキストウィンドウと最大65,536トークンの出力をサポートしています。このモデルは、長文書の処理、複数…
Gemini 3.6 Flash は、長いコンテキスト(最大1,048,576トークン)の処理とマルチモーダル入力の処理に優れています。GDM-MRCR v2 8-needle(128k平均)におけるベンチマークスコア91.8は、広大なデータの中から特定の情報を正確に特定できることを示しており、大きなドキュメント内での強力な検索と理解力を示しています。また、このモデルは音声と動画の入力をサポートしており、動画からの音声書き起こし、チャートの分析、一連の画像に関する質問への回答などのユースケースを可能にします。Flashという名称は低レイテンシとコスト効率を示唆しており、リアルタイムまたは大量処理のアプリケーションに適しています。OrcaRouterを通じてプロバイダー価格で提供され、マークアップがゼロであるため、総コストは透明で予測可能です。
Gemini 3.6 FlashはすでにGoogleが提供するコスト最適化されたFlashバリアントです。ただし、ユースケースがマルチモーダル入力を必要としない場合(例:テキストのみのタスク)、より短いコンテキストウィンドウを持つ小さなテキスト専用モデルの方が安価で高速になる可能性があります。タスクが8K~32Kトークンに収まる場合、Gemini 1.5 Flash(OrcaRouter経由で利用可能な場合)や他の軽量モデルで、より低いトークン単価で十分に対応できる可能性があります。さらに、音声、動画、ファイル入力を一切使用しない場合、必要のない機能に対してコストを支払うことになります。判断は、正確な入力モダリティ、必要なコンテキスト長、品質要件に基づいて行うべきです。OrcaRouterは各モデルの価格を一覧表示しているため、トークン単価を比較して最も経済的なオプションを選択できます。
Gemini 3.6 Flash が役立つタスクには、以下が含まれます: (1) 100K トークンを超えるドキュメントからの長文脈検索と質問応答、(2) 視覚、音声、テキストデータを組み合わせる必要があるマルチモーダル推論、(3) 動画の要約または分析、(4) 画像とテキストを含む PDF、スプレッドシート、プレゼンテーションの解析などのファイル処理、(5) コストに敏感でありながらマルチモーダル機能を必要とするアプリケーション。65,536 トークンの出力制限により、長い要約、レポート、またはコードの生成が可能です。このモデルは、厳密な論理的推論や数学的推論が必要なタスクには適しておらず、そのような場合は非 Flash バリアントが必要になることがあります。そのようなユースケースでは、精度は向上する可能性がありますが、コストが高くなります。代替手段と比較して品質を確認するために、特定のタスクをベンチマークしてください。
OrcaRouterのOpenAI互換APIを通じて、Gemini 3.6 Flashは適切に設定された場合にストリーミングレスポンス(`stream`パラメータを使用)および関数呼び出し(すなわちツール使用)をサポートします。これらの機能の正確な利用可能性は基盤となるGoogle APIに依存しますが、OrcaRouterはOpenAIのリクエスト形式をGoogleのエンドポイントにマッピングします。ストリーミングの場合は、リクエストに`"stream": true`を設定してください。関数呼び出しの場合は、標準のOpenAIスキーマを使用してリクエスト本文にツールを定義します。これらの機能は、OrcaRouterのベースURLでモデルID `google/gemini-3.6-flash`を使用してテストする必要があります。すべてのGeminiモデルバージョンがあらゆる機能をサポートしているわけではないことに注意してください。エイリアスの背後にある特定のモデルバージョンについては、Googleのドキュメントを参照してください。
与えられたベンチマークスコアは、平均コンテキスト長128KトークンのGDM-MRCR v2 8-needleで91.8です。GDM-MRCR(Googleのマルチコンテキスト検索)v2は、長いコンテキスト内に配置された複数の情報(「ニードル」)を検索し、推論するモデルの能力を測定します。スコア91.8は、モデルが平均して91.8%のニードルを正常に発見し、クエリに正しく回答したことを示します。これはFlashモデルとしては強力な結果であり、Gemini 3.6 Flashが非常に長いドキュメントから事実を確実に抽出できることを示しています。ベンチマークは包括的ではなく、特定のシナリオをテストします。実際の性能は、検索タスクの複雑さ、妨害情報の数、情報の形式によって異なる場合があります。
Gemini 3.6 Flashのレイテンシデータは提供されていませんが、Flashモデルは一般的に非Flashバリアントと比較して推論時間が短くなるよう最適化されています。実際の応答時間は、入力コンテキストの長さ、要求された出力トークン数、マルチモーダルエンコーディングの複雑さ(例:画像や動画フレームの数)、およびプロバイダーのサーバー負荷などの要因によって異なります。OrcaRouterはゲートウェイとして機能するため、レイテンシにはGoogleのサーバーへのラウンドトリップとOrcaRouterのAPIルーティングによるオーバーヘッドの両方が含まれます。非常に低いレイテンシが要求されるアプリケーションの場合は、代表的なプロンプトでテストし、エンドツーエンドの時間を測定することをお勧めします。一般に、FlashモデルはProモデルよりも高速になるように設計されており、ストリーミングを使用することで認識されるレイテンシを低減できます。
Gemini 3.6 Flashは提供された長コンテキストベンチマークでは良好な性能を示すものの、そのFlashバリアントは、より大規模で高価なモデルと比較して、推論、数学、コード生成タスクにおいて精度が低い可能性があります。そのようなタスクの正確な比較スコアは提供されていません。さらに、65,536トークンの出力制限は寛大ではあるものの、非常に長い文書やコードベース全体を生成するには不十分な場合があります。また、このモデルは大規模言語モデルに共通するバイアスや事実誤認を示す可能性があります。マルチモーダル理解の品質は、トークン圧縮により多くの画像や長い動画を含む場合に低下する可能性があります。最後に、モデルはOrcaRouterを介してアクセスされるため、GoogleまたはOrcaRouterでのサービス中断が可用性に影響を与える可能性があります。品質を検証するために、常にモデルを実際のデータでテストしてください。
Gemini 3.6 Flashは、テキスト、画像、動画、ファイル、音声コンテンツを含むすべての入力に対して、合計1,048,576トークン(約100万トークン)のコンテキストウィンドウを提供します。1回の応答で許可される最大出力トークンは65,536トークンです。つまり、非常に長いドキュメント、複数の画像、長大な文字起こしを入力しても、十分な長さの応答を受け取ることができます。この大きなコンテキストウィンドウは主要な強みであり、書籍の要約、法律文書のレビュー、広範な履歴を伴うマルチターン会話などのタスクを可能にします。ただし、100万トークン全体のコンテキストを使用すると、無視できない処理時間とトークンコストが発生する可能性があります。大規模なコンテキストを使用すると、入力トークンが100万トークンあたり1.50ドルのレートで消費されるため、100万トークンの入力ではリクエストごとに1.50ドルのコストがかかることに注意してください(出力コストは別途)。
料金は、入力トークン100万トークンあたり1.50ドル、出力トークン100万トークンあたり7.50ドルです。OrcaRouterは、Googleが提供するこれらのレートをそのまま適用し、マージンは一切加算しません。リクエストごとの追加料金やプラットフォーム手数料は発生しません。入力トークンには、ユーザーメッセージ(システム、ユーザー、アシスタントの履歴)の全トークンと、トークンにエンコードされたマルチモーダルコンテンツが含まれます。出力トークンは、生成されたテキストのみをカウントします。リクエストごとのコストは、入力と出力の長さによって異なります。例えば、入力10万トークン、出力1,000トークンの場合、コストは0.15ドル(入力)+ 0.0075ドル(出力)= 0.1575ドルとなります。大量利用の場合、この透明性のある料金設定により、正確なコスト予測が可能です。
OrcaRouterは現在、Gemini 3.6 Flashに固有のキャッシングやバルク割引を提供していません。料金はプロバイダーレートに基づくトークン単位の定額です。一部のAIプラットフォームでは、繰り返しのコンテキストに対するキャッシュベースの割引を提供していますが、このモデルについてはOrcaRouter経由ではその機能は言及されていません。プロンプトの長さを最適化し、不要なコンテキストを制限し、出力トークンを短くすることでコストを削減できます。より低いトークン単価が必要な場合は、より小さいモデル(例:Gemini 1.5 Flash)がタスクに適しているか検討してください。Googleは予約容量に対して異なる料金プランを提供する可能性がありますが、それはOrcaRouterの従量課金APIでは利用できません。価格オプションの更新については、常にOrcaRouterのドキュメントを確認してください。
OrcaRouterはプロバイダー価格をゼロマークアップでそのまま通すため、OrcaRouter経由のGemini 3.6 Flashのトークンあたりのコストは、Googleが直接請求するものと同一になるはずです。しかし、OrcaRouterを使用することで、統一されたOpenAI互換のAPIを利用でき、よりシンプルな請求と統合の利点が得られる可能性があります。ゲートウェイサービスに追加コストはかかりません。もし直接Google Cloudと契約している場合、ボリュームディスカウントを受けられる可能性があり、価格を100万トークンあたり$1.50/$7.50未満に下げられるかもしれません。OrcaRouterはそのような割引を提供していないため、非常に高いボリューム(月間100億トークン超)の場合、直接契約の方が安くなる可能性があります。ほとんどのユーザーにとって、OrcaRouterは標準APIの利便性と共に価格の同等性を提供します。
プロンプトに画像、動画、音声、またはファイルを含めると、サービスはこれらをトークンに変換し、入力トークン制限にカウントされ、入力レート(1Mトークンあたり$1.50)で課金されます。画像1枚または音声1秒あたりに消費されるトークンの正確な数は明示されていませんが、大まかな目安として、画像1枚あたり解像度に応じて数百から数千トークンを消費する可能性があります(解像度が高いほどトークン数が増加)。動画は通常、フレームのシーケンスとして処理され、各フレームにトークンが消費されます。PDFなどのファイルはテキストと画像として抽出され、画像はそれに応じてトークン化されます。コストを見積もるには、サンプルのマルチモーダルプロンプトでテストし、API応答の`usage`フィールド(利用可能な場合)を使用してトークン使用量を監視してください。視覚コンテンツを最小限に抑えるか、低解像度バージョンを使用することで費用を削減できます。
Gemini 3.6 Flash を使用するには、OrcaRouter の OpenAI 互換エンドポイントにリクエストを送信します。ベース URL を `https://api.orcarouter.ai/v1` に設定してください。リクエストボディでは、モデルを `"google/gemini-3.6-flash"` と指定します。API は OpenAI と同じチャット補完エンドポイント `POST /chat/completions` をサポートしています。`api_key` と `base_url` を設定することで、任意の OpenAI SDK(Python、Node.js など)を使用できます。Python の例: `client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1")` その後 `response = client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...])` を実行します。このモデルは、`temperature`、`max_tokens`、`stream`、`tools` などの標準的なパラメータを受け入れます。
サポートされているパラメータには、`messages`(ロールとコンテンツを持つメッセージオブジェクトの配列)、`max_tokens`(最大65536)、`temperature`、`top_p`、`stop`シーケンス、`stream`(ブーリアン)、`tools`(関数呼び出し用)、および`tool_choice`が含まれます。マルチモーダルコンテンツは、メッセージの`content`フィールドにパーツの配列(例:text、image_url、audio_data)を使用して含めることができます。正確な形式はOpenAI Vision APIの規則に従います。OrcaRouterはこれらのパラメータを基盤となるGoogle APIに変換します。すべてのOCR固有のパラメータ(`response_modalities`など)が利用できるわけではないことに注意してください。サポートされている画像および音声フォーマットの詳細については、OrcaRouterのドキュメントを参照してください。ただし、一般的にはJPEG、PNG、GIF、MP3、WAVが受け入れられます。`max_tokens`を65536の制限内で希望の出力長に設定してください。
アプリケーションが現在OpenAIのAPI(例:`gpt-4o`)を呼び出している場合、OrcaRouterを介してGemini 3.6 Flashに移行するには、ベースURLとモデル名の2つを変更する必要があります。クライアント設定を更新してください:ベースURLを`https://api.orcarouter.ai/v1`に設定し、モデルIDとして`"google/gemini-3.6-flash"`を使用します。システム、ユーザー、アシスタントのロールを含む既存のメッセージ形式はそのまま動作します。マルチモーダルサポートについては、OpenAIのビジョンメッセージ構造を使用して、画像や音声URLを含めるようにコードを適応させることができます。OrcaRouterがAPI変換を処理するため、モデルとベースURL以外のリクエスト構造を変更する必要はありません。まず少数のリクエストでテストし、期待通りの動作とトークン使用量を確認してください。
OrcaRouterを使用するには、プラットフォームから提供されるAPIキーが必要です。このキーを `Authorization` ヘッダーに `Bearer <your_key>` として含めてください。OrcaRouterを介して送信されたデータはGoogleの推論サーバーに転送されます。OrcaRouterはお客様のデータを学習したり、リクエスト処理に必要な範囲(例:課金のためのログ記録)を超えてプロンプトを保存することはありません。Googleのデータ取り扱いポリシーはモデルプロバイダーに適用されます。OrcaRouterは標準的なリクエストログ以外に追加のデータ保持を行うことはありません。機密情報については、OrcaRouterのプライバシーポリシーとGoogleのGeminiデータ使用条項を確認してください。APIはOpenAI互換であるため、転送中の暗号化(HTTPS)やキーローテーションなどの標準的なセキュリティ対策を実装できます。
両方のモデルはマルチモーダル入力(テキスト、画像、音声)をサポートし、大規模なコンテキストウィンドウを提供します。GPT-4oはデフォルトで128Kのコンテキスト(256Kに拡張可能)を持ち、Gemini 3.6 Flashは1,048,576トークン(1M)を提供します。料金は異なります:GPT-4oは入力1Mあたり2.50ドル、出力1Mあたり10ドル(執筆時点)であるのに対し、Gemini 3.6 Flashは1.50ドル/7.50ドルです。ベンチマークスコアはテストが異なるため直接比較できませんが、Gemini 3.6 Flashは特定の検索ベンチマークで91.8という高いスコアを示しており、強力なパフォーマンスが示唆されます。GPT-4oは多くのタスクで優れた指示追従と推論能力を提供する可能性があり、一方Gemini 3.6 Flashは長文コンテキスト検索とコスト効率に優れています。選択は、特定のユースケースにおいてコンテキスト長、コスト、または生の精度のどれを優先するかに依存します。
Claude 3.5 Sonnet(200Kコンテキスト)は、Gemini 3.6 Flashの1Mトークンと比較してコンテキストウィンドウが短いです。トークンあたりの料金は、Claude 3.5 Sonnetが入力100万トークンあたり$3.00、出力100万トークンあたり$15.00で、Geminiの$1.50/$7.50よりも高くなっています。Claudeはニュアンスのある推論や安全性の準拠に強みを持つ可能性がある一方、Gemini Flashはマルチモーダルの汎用性と長文コンテキストの検索に重点を置いています。Geminiの動画や音声入力への対応は、それらのモダリティを伴うタスクにおいて優位性をもたらします。ただし、Claudeの出力は通常より長く(最大8192トークン、Geminiの65Kに対して)、非常に長い出力が必要なタスク(例:レポート全体の生成)には、Gemini 3.6 Flashの方が適している可能性があります。標準データセットでのベンチマーク比較は提供されていないため、実証的なテストが推奨されます。
主な要件が (a) 128Kトークン(最大1M)を超えるコンテキストウィンドウ、(b) 音声、ビデオ、またはファイル入力を処理する必要がある、(c) マルチモーダルモデルの中でトークンあたりのコストが低い、という場合は、Gemini 3.6 Flashを選択してください。このモデルは長文書の検索に特に優れており(ベンチマークスコア91.8で実証済み)。タスクがテキストのみで128Kトークン以内に収まる場合、GPT-4o miniやClaude 3 Haikuなどのモデルの方が安価になる可能性があります。最高の推論精度が必要で予算が許せば、より高コストではありますが、Proモデル(例:OrcaRouter経由で利用可能なGemini 3.6 Pro)の方が適しているかもしれません。OrcaRouterのベンチマークデータと価格比較を参考にして選択してください。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 入力 / 1M tokens | $1.50 |
| 出力 / 1M tokens | $7.50 |
| キャッシュ読み取り / 1M | $0.150 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gemini_3_6_flash,
title = {Gemini 3.6 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.6-flash}
}Google. (2026). Gemini 3.6 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.6-flash