Gemini 3.5 Flash-Lite は、Google の最もコスト効率の高い Gemini モデルであり、コールあたりのコストが支配的な非常に高ボリューム、レイテンシーに敏感なワークロード向けに特別に構築されています。その価格帯にもかかわらず、ネイティブでマルチモーダル(テキスト、画像、ビデオ、音声、およびテキスト出力付きファイルを受け入れ)であり、より大きな Flash ティアと同じ 1M トークンのコンテキストウィンドウと最大 64K の出力トークンを備えているため、長いドキュメントやマルチメディア入力も対応可能です。3.6 Flash の価格の約 5 分の 1 で、分類、抽出、ルーティング、要約、軽量エージェント、合成データ生成、および数百万回実行されるあらゆるパイプラインに適したツールです。設定可能な推論努力、ネイティブツール呼び出し、構造化出力を引き続きサポートし、軽量モデルとしてはエージェントおよび長コンテキストベンチマークで力を発揮します。例えば、OSWorld-Verified で 74.0%、128k マルチニードル検索で 72.2% であり、以前の 3.1 Flash-Lite を大きく上回っています。OpenAI のチャット補完形式と Gemini のネイティブ generateContent API の両方に対応しているため、単一の統合の背後でより重いモデルと混在させることができます。簡単で高ボリュームのトラフィックを Flash-Lite にルーティングし、難しいタスクを 3.6 Flash または Pro モデルにエスカレーションします。
Google Gemini 3.5 Flash-Liteは、Googleが開発したマルチモーダル言語モデルで、OrcaRouterのOpenAI互換APIを通じて提供されます。テキスト、画像、動画、ファイル、音声の入力を処理でき、複数のデータタイプを組み合わせたタスクに適しています。このモデルは1,048,576トークンのコンテキストウィンドウを持ち、最大65,536トークンの出力をサポートします…
Gemini 3.5 Flash-Liteは、マルチモーダル入力とツール使用サポートにより、幅広いタスクを処理できます。要約、質問応答、コード生成などのテキストのみのタスクを扱います。画像では、シーンの説明、ドキュメントからのテキスト抽出、図の解釈が可能です。動画入力により、アクティビティ認識、キャプション付け、時間的推論が可能になります。音声入力は、文字起こし、言語識別、音声ベースの分析を促進します。また、このモデルはツール呼び出しをサポートしており、CharXiv Reasoningスコア76.5(ツール使用時)で示されています。つまり、外部APIやデータベースを呼び出すエージェントワークフローに統合できます。ただし、クリエイティブライティング、高度な抽象推論、または深いドメイン専門知識を必要とするタスク向けには設計されていません。その強みは、生のパフォーマンスではなく、速度、コスト、およびモダリティサポートの幅にあります。
コストとスループットが最優先であり、タスクがその能力範囲内に収まる場合、Gemini 3.5 Flash-Liteを選択すべきです。このモデルは、数千のドキュメントのインデックス作成、数時間分の音声の文字起こし、画像ストリームのリアルタイム分類などの高容量パイプラインに優れています。大きなコンテキストウィンドウ(1Mトークン)により、司法事例分析やコードベースのリファクタリングなど、長い入力の全体的な理解を必要とするタスクに最適です。より大きなモデル(例:Gemini 3.5 Pro)は複雑なベンチマークでより高い精度を達成する可能性がありますが、トークンあたりのコストが大幅に高く、スループットも低くなります。アプリケーションが10〜100倍のコスト削減のために多少の品質トレードオフを許容できる場合、このモデルは有力な選択肢です。逆に、事実の正確性、創造的な生成、または最先端の推論を必要とするタスクには、より大きなモデルが推奨されます。
はい、このモデルはネイティブでビデオと音声の入力をテキスト、画像、ファイルと共に受け付けます。ビデオ入力はフレームのシーケンスまたはビデオファイルとして提供できます。モデルはビジュアルフレームと関連する音声トラックを処理します。音声入力はWAV、MP3、FLACなどの一般的なフォーマットで動作します。大きなコンテキストウィンドウにより、長時間の録音を1回のリクエストで処理できます。例えば、高詳細な1時間の音声書き起こしは約10,000トークンを消費する可能性があります。これは、会議の要約、ポッドキャスト分析、または音声ベースのカスタマーサポートに役立ちます。モデルは音声やビデオの出力を生成せず、応答は常にテキストであることに注意してください。マルチモーダル理解の品質はモデルのflash‑lite層に相当します。抽出や分類には十分ですが、より大きなマルチモーダルモデルと比較して微妙な詳細を見逃す可能性があります。
Gemini 3.5 Flash-Liteはツール呼び出しをサポートしており、CharXiv Reasoning with toolsのベンチマークパフォーマンス(スコア76.5)に示されています。つまり、応答生成中にモデルが呼び出せる関数やAPIを定義できます。典型的な使用例としては、データベース参照、Web検索、算術演算などがあります。モデルはユーザーの指示とコンテキストに基づいて、いつツールを呼び出すかを選択します。ツール使用により、事実の正確性を向上させ、複雑なマルチステップ推論を可能にします。ただし、このモデルはflash-liteの派生であるため、ツール呼び出しの信頼性はより大きな専門モデルよりも低くなる可能性があります。アプリケーションが完全なツールオーケストレーションに大きく依存する場合は、検証レイヤーやフォールバックロジックを追加する必要があるかもしれません。OrcaRouterはOpenAIのAPIと同じ形式でツール定義を渡すため、統合が容易です。
このモデルは、ツールを使用して評価した場合、CharXiv Reasoningベンチマークで76.5のスコアを達成しました。CharXivは、チャートベースの視覚データに対する推論能力をテストするもので、モデルがチャート画像を解釈し、それに関する質問に答えることが求められます。「ツール使用」条件とは、モデルが計算機などの外部関数を呼び出すことができることを意味します。このスコアは中程度の性能を示しており、チャートに関連する推論は可能ですが、専門モデルのレベルには達していません。このモデルについては、他のベンチマークスコアは提供されていません。比較として、Gemini 3.5 Proなどのより大規模なモデルは、このタスクでより高いスコアを出す可能性があります。この値は参考値として有用です。つまり、妥当なチャート解釈が期待できますが、アプリケーションで視覚推論タスクに高い精度が要求される場合は、十分にテストする必要があります。
提供されたのはCharXiv Reasoning(ツール使用)のスコア76.5のみです。提供情報には、Gemini 3.5 Flash-LiteのMMLU、HumanEval、長文コンテキスト検索スコアなどの追加ベンチマークデータはありません。つまり、その性能を他のタスクに一般化するには、自身のデータによる実証テストが必要です。このモデルのflash-liteの性質上、ほとんどの標準ベンチマークではフルサイズモデルに劣ることが予想されます。しかし、実運用環境では効率性と低コストがこうした欠点を上回ることがよくあります。特定のベンチマーク(コード生成や多言語理解など)で検証済みの性能が必要な場合は、ご自身で評価を実施してください。OrcaRouterは個別のベンチマーク結果をホストしておらず、ここで引用されている数値は直接プロバイダーから提供されたものです。
提供されたデータにはレイテンシの詳細は指定されていません。経験則として、flash‑lite モデルはその大規模な兄弟モデルと比較して低レイテンシになるよう設計されていますが、実際の応答時間は入力長、出力長、同時リクエスト負荷、基盤となるハードウェアなど多くの要因に依存します。100万トークンのコンテキストウィンドウでは、注意機構の二次関数的なスケーリングにより、非常に長いプロンプトを処理するとレイテンシが大幅に増加する可能性があります。短い入力(例:数百トークン)では、サブ秒の応答が期待できます。100万トークンに近い入力の場合、レイテンシは数十秒に達する可能性があります。OrcaRouter はこのモデルに対して特定のレイテンシ SLA を保証しません。低レイテンシが重要な場合は、より小さなコンテキスト(例:トランケーション)または専用エンドポイントの使用を検討してください。応答時間は OrcaRouter のダッシュボードで監視できます。
Gemini 3.5 Flash-Lite は最先端の精度を目的として設計されていません。その強みは速度、コスト、および大規模なコンテキストです。制限事項には、複雑な推論ベンチマークでの低いパフォーマンス、大規模モデルと比較した事実想起の低下、および曖昧な入力に対する「幻覚」傾向が含まれます。このモデルは、深いドメイン知識を必要とするタスク(例:法律推論、医療診断)や微妙な創造的作業に苦戦する可能性があります。ツール使用機能は動作しますが、専用のエージェントモデルほど信頼性が高くない可能性があります。さらに、提供されているベンチマークスコアは1つだけ(ツール使用時のCharXiv Reasoning 76.5)であるため、テストなしで他のドメインでの良好なパフォーマンスを想定することはできません。重要なアプリケーションでは、常に独自のデータでベンチマークを実施し、信頼度が低い場合にはより高性能なモデルへのフォールバックを検討してください。
価格は、入力トークン100万件あたり$0.30、出力トークン100万件あたり$2.50です。これらのレートは、OrcaRouterによるマークアップなしで請求されるプロバイダーレートです。入力トークンには、モダリティに関係なく、プロンプト内のすべてのトークン(テキスト、画像トークン、ビデオフレーム、オーディオサンプル、ファイル内容)が含まれます。出力トークンは、生成されたテキストトークンです。100,000入力トークンと1,000出力トークンを消費する典型的な長文コンテキストクエリの場合、コストはおおよそ($0.30 * 0.1)+($2.50 * 0.001)= $0.030 + $0.0025 = リクエストあたり$0.0325となります。大規模になると、このモデルは数万件のクエリを数百ドルで処理できます。これを、トークンあたり10〜50倍のコストがかかることが多い大規模モデルと比較してください。低い出力価格は、長い応答(例:全文書の要約)を生成するアプリケーションにとって特に有利です。
提供された情報では、キャッシュメカニズムやキャッシュされたトークンに対する割引料金は指定されていません。したがって、モデルに送信されるすべてのトークンは、繰り返しに関係なく、100万トークンあたり0.30ドルの標準入力レートで課金されると想定する必要があります。一部のプロバイダーは、繰り返されるプレフィックスが割引料金(例:50%オフ)で課金されるautomatic prompt cachingを提供しています。このモデルでは、そのようなキャッシュ割引は発表されていません。同じコンテキスト(例:大きなシステムプロンプト)を頻繁に再送信する場合は、OrcaRouterまたはGoogleが透過的キャッシュを実装しているかどうかを調査するとよいでしょう。明確な情報がない場合は、すべての入力に対してトークンあたりの全額コストを予算化するのが最も安全です。再利用されるコンテンツをトリミングして最適化することで、実質的な請求額を削減できます。
ゼロマークアップとは、OrcaRouterがプロバイダー料金をそのまま請求し、いかなる追加マージンも加えないことを意味します。Gemini 3.5 Flash-Liteの場合、入力価格は$0.30/1Mトークン、出力価格は$2.50/1Mトークンです。これはGoogleが請求する料金であり、OrcaRouterはそれを値上げせずにそのまま適用します。トークンごとに追加のプラットフォーム手数料を支払うことはありません。これは、通常10~20%以上のマークアップを追加するAPIゲートウェイの中では異例です。マークアップがないことで、OrcaRouter経由でアクセスする場合、このモデルはさらにコスト効率が高くなります。帯域幅とAPIインフラの料金は依然として支払いますが、これらのコストはプロバイダー料金に含まれており、OrcaRouterはそれらを個別に項目化しません。この価格設定モデルは透過的です。使用状況ダッシュボードに表示されるコストが最終的なコストです。
OrcaRouterのOpenAI互換APIを使用して呼び出す場合、ベースURLは https://api.orcarouter.ai/v1 です。モデルパラメータには「"google/gemini-3.5-flash-lite"」を設定します。チャット補完(POST /v1/chat/completions)とエンベッディング(対応している場合)の両方が機能します。マルチモーダル入力では、roles配列と、text、image_url、file_urlフィールドを含む可能性のあるcontentオブジェクトでメッセージを構成します。cURLリクエストの例: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' OrcaRouterのAPIキーを使用する必要があり、GoogleのAPIキーは使用しないでください。
このモデルは、OpenAI互換の標準パラメータをサポートしています:model、messages、max_tokens(モデルの65,536制限まで)、temperature、top_p、stop、frequency_penalty、presence_penalty、およびtools(関数呼び出し用)。追加のGoogle固有のパラメータ(safety_settingsなど)は直接公開されていない場合があります。必要な場合は、OrcaRouterのドキュメントで同等のものを確認してください。モデルはmax_tokensの制限を尊重します。マルチモーダル入力の場合、contentのtypeフィールドは以下をサポートしています:text、image_url、video_url(OrcaRouterが公開している場合)、audio_url、file_url。fileタイプはPDF、CSVなどを受け入れることができます。大きなメディアファイルは、データURIとして事前エンコードするか、公開ホストする必要がある場合があることに注意してください。OrcaRouterはファイルが特定のサイズ未満であることを要求する場合もあります。正確なパラメータサポートについては、常に最新のAPIドキュメントを参照してください。
別のAPIプロバイダー(例:Google AI Studio、Vertex AI、その他のゲートウェイ)からOrcaRouterに移行するには、ベースURLをhttps://api.orcarouter.ai/v1に変更し、モデルIDを"google/gemini-3.5-flash-lite"に設定してください。既存のコードでOpenAI Pythonクライアントを使用している場合は、base_urlとapi_keyを渡します。例: ```python from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) ``` 以前のプロバイダーが異なるスキーマ(例:Anthropic)を使用していた場合、マルチモーダルメッセージのフォーマットを調整する必要があるかもしれません。OrcaRouterはOpenAI形式を期待します。ユーザーコンテンツ配列には複数のパーツを含めることができます。ツール定義もOpenAIスタイルです。移行に関する追加料金はなく、説明の通りトークンごとの支払いのみです。
直接的な比較データは提供されていませんが、定性的に考察することは可能です。Gemini 2.0 Flash(仮に存在するとして)は、おそらく初期世代のFlashモデルでしょう。Gemini 3.5 Flash‑Liteは、より新しい軽量版(Lite)で、より大きなコンテキストウィンドウ(128K に対して 1M)と低価格を備えています。Gemini 3.5 Flash‑Liteのトークンあたりのコストは、100万トークンあたり $0.30/$2.50 と非常に低価格です。旧世代のFlashモデルはトークンあたりのコストが高く、コンテキストウィンドウが短い可能性があります。ただし、Gemini 2.0 FlashはLite版ではなくフルスペックのFlashモデルであるため、生の精度において優れている可能性があります。もしタスクに最高の品質が求められ、高いコストを許容できるのであれば、旧世代のフルFlashモデルの方が適しているかもしれません。大きなコンテキストと低コストが必要なら、3.5 Flash‑Liteが合理的な選択です。
OpenAIのGPT-4o miniは、同様に低コストでマルチモーダルなモデルです。コンテキストウィンドウは128Kトークン(1Mよりかなり小さい)で、価格は入力トークン100万件あたり0.15ドル、出力トークン100万件あたり0.60ドルです(2025年初頭時点、価格は変更されている可能性があります)。Gemini 3.5 Flash‑Liteは、8倍のコンテキストウィンドウを提供し、入力価格は2倍、出力価格は4倍です。そのため、Geminiはトークンあたりのコストは高いものの、コンテキスト容量ははるかに大きくなります。完全な1Mコンテキストが必要なタスク(例:書籍全体の処理)では、複数のGPT‑4o mini呼び出しにチャンク分割するよりも、Gemini Flash‑Liteの方がコスト効率が良いです。コンテキストが短い場合、GPT‑4o miniの方が安価で、ベンチマークスコアが優れている可能性があります。どちらのベンチマークスコアもデータなしでは直接比較できません。
ベンチマークの比較は提供されていません。Llama 3.2 90B(このモデルが存在すると仮定)は、大きなオープンウェイトモデルで、コンテキストウィンドウが比較的小さく(通常128Kトークン)、API経由で実行する場合のトークンあたりのコストが高くなります。Gemini 3.5 Flash‑Liteはプロプライエタリモデルで、はるかに大きなコンテキストウィンドウと非常に低価格を備えており、利用可能なマルチモーダルモデルの中で最もトークンあたりのコストが安いものの一つです。Llama 3.2 90Bはそのサイズにより、多くのNLPベンチマークでより高い精度を達成する可能性がありますが、マルチモーダルではなく、コンテキスト制限が厳しくなっています。タスクがテキストのみで最高の精度が必要な場合、Llama 90B(OrcaRouter経由でアクセス可能なら)の方が良いかもしれません。マルチモーダル、長いコンテキスト、または高スループットのシナリオでは、Gemini Flash‑Liteに明確な利点があります。選択はアプリケーションの具体的な要件に依存します。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 入力 / 1M tokens | $0.300 |
| 出力 / 1M tokens | $2.50 |
| キャッシュ読み取り / 1M | $0.030 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite