Gemini 3.5 Flash-Lite 是 Google 最具成本效益的 Gemini 模型,專為大量高頻、延遲敏感的任務而設計,此類任務中以每次呼叫成本為主要考量。儘管價格低廉,它仍原生支援多模態——可處理文字、圖片、影片、音訊及檔案並輸出文字——並具備與較大 Flash 層級相同的 100 萬 Tokens 上下文視窗及最高 64K Tokens 輸出,因此長篇文件與混合媒體輸入仍在可處理範圍內。 價格約為 3.6 Flash 的五分之一,它非常適合分類、提取、路由、摘要、輕量級代理、合成資料生成,以及任何需要執行數百萬次的管線。它仍支援可設定的推理努力、原生工具呼叫與結構化輸出,並在代理與長上下文基準測試中以輕量級模型展現超水準表現——例如在 OSWorld-Verified 上達 74.0%,在 128k 多針檢索上達 72.2%,明顯優於先前的 3.1 Flash-Lite。 它同時支援 OpenAI 聊天完成格式與 Gemini 原生的 generateContent API,因此您可以將其與較重型模型整合在同一介面中——將簡單、高流量的任務路由至 Flash-Lite,並將困難任務升級至 3.6 Flash 或 Pro 模型。
Google Gemini 3.5 Flash-Lite 是一款由 Google 開發的多模態語言模型,透過 OrcaRouter 的 OpenAI 相容 API 提供。它接受文字、圖像、影片、檔案及音訊輸入,適合結合多種資料類型的任務。該模型的上下文窗口為 1,048,576 個 token,並支援最多 65,536 個輸出 token。計費方式以供應商費率為準,無任何加成:每百萬輸入…
Gemini 3.5 Flash-Lite 憑藉其多模態輸入和工具使用支援,能夠勝任廣泛的任務。它可以處理純文字任務,例如摘要、問答和程式碼生成。透過圖片,它可以描述場景、從文件中提取文字或解讀圖表。影片輸入可實現活動識別、字幕生成和時間推理。音訊輸入則便於轉錄、語言辨識和語音分析。該模型也支援工具呼叫,其 CharXiv Reasoning 分數(使用工具時)為 76.5 即可證明。這意味著它可以整合到代理工作流程中,在流程中呼叫外部 API 或資料庫。然而,它並非為創意寫作、高度抽象推理或需要深厚領域專業知識的任務而設計。其優勢在於速度、成本以及廣泛的模態支援,而非原始效能。
當成本和吞吐量為首要考量,且任務在其能力範圍內時,應選擇 Gemini 3.5 Flash-Lite。此模型擅長處理高容量管線,例如為數千份文件建立索引、轉錄數小時的音訊,或對影像串流進行即時分類。其大規模上下文視窗(100 萬個 token)使其非常適合需要對長輸入有全局理解的任務,例如司法案件分析或程式碼庫重構。較大的模型(例如 Gemini 3.5 Pro)可能在複雜基準測試中達到更高準確度,但會帶來顯著更高的每 token 成本與較低的吞吐量。如果你的應用能為了 10 到 100 倍的成本降低而容忍小幅的品質取捨,此模型將是十分合適的選擇。反之,對於需要事實精確性、創意生成或最先進推理能力的任務,則建議使用較大的模型。
是的,該模型原生支援影片和音訊輸入,以及文字、圖片和檔案。影片輸入可以是一系列畫格或一個影片檔案;模型會處理視覺畫格及任何相關的音軌。音訊輸入支援常見格式,如 WAV、MP3 或 FLAC。大型上下文窗口允許在一次請求中處理長時間的錄音——例如,一個小時的高細節音訊轉錄可能耗用約 10,000 個 token。這對於會議摘要、播客分析或語音客服很有用。請注意,模型不會產生音訊或影片輸出;回應始終是文字。多模態理解的品質與模型的 flash-lite 層級相當:足以進行提取和分類,但與較大的多模態模型相比,可能會遺漏細微細節。
Gemini 3.5 Flash-Lite 支援工具呼叫,從其在 CharXiv Reasoning with tools(得分 76.5)的基準測試表現即可看出。這表示您可以定義模型在生成回應時可呼叫的函式或 API。典型使用案例包括資料庫查詢、網路搜尋或算術運算。模型會根據使用者指令和上下文決定何時呼叫工具。使用工具可以提高事實準確性,並實現複雜的多步驟推理。然而,由於此模型是 Flash-Lite 變體,其工具呼叫的可靠度可能低於較大型的專用模型。如果您的應用程式高度仰賴無瑕疵的工具編排,則可能需要加入驗證層或備援邏輯。OrcaRouter 以與 OpenAI API 相同的格式傳遞工具定義,讓整合更直接了當。
該模型在搭配工具進行評估時,於 CharXiv Reasoning 基準測試中獲得 76.5 分。CharXiv 旨在測試模型基於圖表視覺資料進行推理的能力,要求模型解讀圖表影像並回答相關問題。所謂「搭配工具」條件,是指模型可以呼叫外部功能(例如計算機)來輔助運作。此分數顯示中等水準——模型具備圖表相關推理能力,但尚未達到專業模型的程度。目前尚未提供該模型的其他基準測試分數。作為對照,較大的模型如 Gemini 3.5 Pro 在此任務上預期會獲得更高分數。此數值可作為參考點:您可以預期合理的圖表解讀能力,但若您的應用對視覺推理任務要求高準確度,則應進行徹底測試。
僅提供 CharXiv Reasoning(含工具)評分:76.5。所提供的資訊中並未包含 Gemini 3.5 Flash‑Lite 的其他基準測試數據,例如 MMLU、HumanEval 或長文本檢索評分。這表示若要推論該模型在其他任務上的表現,需要使用您自己的資料進行實證測試。由於該模型屬於 flash‑lite 類型,在多數標準基準測試中預計會比完整模型表現較差。然而,其高效率與低成本往往能在生產環境中彌補這些不足。如果您需要某個特定基準測試(例如程式碼生成或多語言理解)的驗證效能,則應自行進行評估。OrcaRouter 不另行提供基準測試結果;此處引用的數字直接來自提供商。
提供的資料中未指定延遲詳細資訊。一般來說,flash‑lite 模型設計上相對於較大的同類模型具有較低延遲,但實際回應時間取決於許多因素:輸入長度、輸出長度、並行請求負載以及底層硬體。在 1M 上下文視窗下,由於注意力機制的二次方擴展,處理非常長的提示可能會大幅增加延遲。對於短輸入(例如幾百個 token),您可以預期次秒級回應。對於接近 1M token 限制的輸入,延遲可能達到數十秒。OrcaRouter 不為此模型保證特定的延遲 SLA。如果低延遲至關重要,請考慮使用較小的上下文(例如透過截斷)或專用端點。您可以透過 OrcaRouter 儀表板監控回應時間。
Gemini 3.5 Flash-Lite 並非專為最先進的精確度所設計。其優勢在於速度、成本與大上下文處理能力。限制包括在複雜推理基準測試中表現較差、相較於大型模型事實回憶能力較弱,以及在模糊輸入上容易產生「幻覺」。該模型在需要深度領域專業知識(例如法律推理、醫療診斷)或細膩創意工作的任務上可能力不從心。其工具使用能力雖具功能性,但可能不如專用代理模型可靠。此外,由於僅提供一項基準測試分數(CharXiv Reasoning 76.5 with tools),在未經測試的情況下,無法假設其於其他領域也有良好表現。對於關鍵應用,務必使用自有數據進行基準測試,並在信心不足時考慮備用至更強模型。
定價為每100萬個輸入Token $0.30,每100萬個輸出Token $2.50。這些價格是提供商費率,OrcaRouter不收取任何額外費用。輸入Token包括提示中的所有Token(文字、圖像Token、影片幀、音訊樣本、檔案內容),無論模態為何。輸出Token則是生成的文字Token。以一個典型的長上下文查詢為例,輸入Token為100,000個、輸出Token為1,000個,每次請求的成本約為($0.30 * 0.1)+($2.50 * 0.001)= $0.030 + $0.0025 = $0.0325。在大規模應用下,此模型僅需幾百美元即可處理數百萬次查詢。相比之下,較大的模型每個Token的成本通常高出10至50倍。低廉的輸出定價尤其有利於需要生成較長回應的應用(例如全文摘要)。
提供的資訊並未指定任何快取機制或快取權杖的折扣定價。因此,你應假設發送給模型的所有權杖均按標準輸入費率計費,即每百萬權杖 0.30 美元,無論是否重複。有些提供者會提供自動提示快取,重複的前綴將以較低費率計費(例如五折)。對於這個模型,目前尚未宣布此類快取折扣。如果你經常重複發送相同的上下文(例如大量的系統提示),建議調查 OrcaRouter 或 Google 是否實現了透明快取。在缺乏明確資訊的情況下,最穩妥的做法是為所有輸入預留全額的每權杖成本。透過精簡重複內容來最佳化,可以減少實際費用。
零加價意味著 OrcaRouter 僅按供應商費率收費,不增加任何額外利潤。以 Gemini 3.5 Flash-Lite 為例,輸入價格為每 1M tokens 0.30 美元,輸出價格為每 1M tokens 2.50 美元——這就是 Google 的收費標準,OrcaRouter 原價傳遞,不加價。您無需為每個 token 支付額外的平台費用。這在 API 閘道器中並不常見,因為後者通常會再加 10‑20% 或更多。沒有加價使得此模型經由 OrcaRouter 存取時更具成本效益。您仍需支付頻寬和 API 基礎設施費用,但這些成本已包含在供應商費率中;OrcaRouter 不會單獨列項。此定價模式十分透明:使用儀表板中顯示的費用即為最終費用。
您使用 OrcaRouter 的 OpenAI 相容 API,基於 URL https://api.orcarouter.ai/v1。將模型參數設定為 "google/gemini-3.5-flash-lite"。聊天完成(POST /v1/chat/completions)和嵌入(若支援)皆可運作。對於多模態輸入,您需要使用 roles 陣列和 content 物件來建構訊息,content 物件可包含 text、image_url 或 file_url 欄位。範例 cURL 請求: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' 您必須使用 OrcaRouter API 金鑰,而非 Google API 金鑰。
該模型支援標準的 OpenAI 相容參數:model、messages、max_tokens(上限為模型的 65,536 限制)、temperature、top_p、stop、frequency_penalty、presence_penalty,以及 tools(用於函式呼叫)。其他 Google 專用參數(例如 safety_settings)可能不會直接暴露;若有需要,請查閱 OrcaRouter 文件以了解等效參數。模型會遵守 max_tokens 限制。對於多模態輸入,content 中的 type 欄位支援:text、image_url、video_url(如果 OrcaRouter 有提供)、audio_url 和 file_url。file 類型可接受 PDF、CSV 等檔案。請注意,大型媒體檔案可能需要預先編碼為 data URI 或託管於公開位置。OrcaRouter 也可能要求檔案不得超過特定大小。請務必查閱最新的 API 文件以確認確切的參數支援情形。
若要從其他 API 提供者(例如 Google AI Studio、Vertex AI 或其他閘道)遷移至 OrcaRouter,請將基礎網址取代為 https://api.orcarouter.ai/v1,並將模型 ID 設定為 "google/gemini-3.5-flash-lite"。若您現有的程式碼使用 OpenAI Python 客戶端,請傳入 base_url 與 api_key。範例: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="您的_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) 如果您先前的提供者使用了不同的架構(例如 Anthropic),您可能需要調整多模態訊息的格式。OrcaRouter 預期使用 OpenAI 格式。使用者內容陣列可包含多個部分。工具定義也是 OpenAI 風格。無需額外的遷移費用;您只需按照所述方式按令牌計費。
未提供直接比較數據,但我們可以定性推理。若Gemini 2.0 Flash存在,它很可能是較早世代的Flash模型。Gemini 3.5 Flash‑Lite則是較新的輕量變體,具備更大的上下文窗口(1M對比可能為128K)且價格更低。Gemini 3.5 Flash‑Lite每百萬token的成本為$0.30/$2.50,價格極低。較舊的Flash模型可能每token成本更高,上下文窗口也更短。然而,若Gemini 2.0 Flash是完整版Flash模型而非輕量變體,其原始準確度可能更佳。若您的任務要求最高品質且能負擔更高成本,較舊的完整版Flash模型可能更合適;若需要大上下文與低成本,則3.5 Flash‑Lite是合理選擇。
OpenAI 的 GPT-4o mini 是一個類似的低成本多模態模型。它擁有 128K tokens 的上下文視窗(遠小於 1M),定價為每百萬輸入 tokens $0.15、每百萬輸出 tokens $0.60(截至 2025 年初;價格可能已變動)。Gemini 3.5 Flash‑Lite 提供 8 倍大的上下文視窗,但輸入價格為 2 倍、輸出價格為 4 倍。因此 Gemini 每 token 更貴,但提供更大的上下文容量。對於需要完整 1M 上下文的任務(例如處理整本書),Gemini Flash‑Lite 比試圖將輸入拆分為多次 GPT-4o mini 呼叫更具成本效益。如果上下文較短,GPT-4o mini 更便宜,且可能擁有更佳的基準測試表現。在沒有數據的情況下,兩者的基準測試分數無法直接比較。
未提供基準測試比較。Llama 3.2 90B(假設此模型存在)是一個大型開源權重模型,具有較小的上下文視窗(通常為128K tokens),且透過API運行時每個token的成本較高。Gemini 3.5 Flash‑Lite是一個專有模型,擁有更大的上下文視窗且定價極低——是市面上最便宜的每個token多模態模型之一。Llama 3.2 90B可能因其規模而在許多NLP基準測試中達到更高準確度,但它不具備多模態能力且上下文限制更嚴格。如果你的任務僅限於文字且需要最高準確度,Llama 90B(若能透過OrcaRouter存取)可能更適合。而對於多模態、長上下文或高吞吐量的場景,Gemini Flash‑Lite則具有明顯優勢。選擇取決於你應用的具體需求。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 輸入 / 1M tokens | $0.300 |
| 輸出 / 1M tokens | $2.50 |
| 快取讀取 / 1M | $0.030 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite