Gemini 3.5 Flash-Lite 是谷歌最具成本效益的 Gemini 模型,专为调用成本占主导的超高吞吐量、延迟敏感型工作负载而设计。尽管价格低廉,它原生支持多模态——接受文本、图片、视频、音频和文件输入并输出文本——同时拥有与更大型的 Flash 层级相同的 100 万 Token 上下文窗口和最高 6.4 万 Token 输出能力,因此长文档和多模态输入依然在可处理范围内。 其价格约为 3.6 Flash 的五分之一,非常适合分类、信息提取、路由、摘要、轻量级智能体、合成数据生成,以及任何需要运行数百万次的流程。它仍然支持可配置的推理努力、原生工具调用和结构化输出,在智能体和长上下文基准测试中表现超越其轻量模型定位——例如在 OSWorld-Verified 上达到 74.0%,在 128k 多针检索上达到 72.2%,显著领先于此前的 3.1 Flash-Lite。 它同时支持 OpenAI 聊天补全格式和 Gemini 原生 generateContent API,因此你可以将其与更重的模型混合在单一集成中——将简单、高吞吐量的流量路由至 Flash-Lite,将困难任务升级到 3.6 Flash 或 Pro 模型处理。
Google Gemini 3.5 Flash-Lite 是由 Google 开发的多模态语言模型,通过 OrcaRouter 兼容 OpenAI 的 API 提供。它支持文本、图像、视频、文件和音频输入,适用于结合多种数据类型的任务。该模型的上下文窗口为 1,048,576 个 token,最多可输出 65,536 个 token。按供应商费率计费,零加价:每百万输入 token 0.30…
Gemini 3.5 Flash-Lite 凭借其多模态输入和工具调用支持,能够胜任广泛的任务。它可以处理纯文本任务,如摘要、问答和代码生成。借助图像,它能够描述场景、从文档中提取文本或解读图表。视频输入则支持活动识别、字幕生成和时间推理。音频输入便于进行转录、语言识别和基于语音的分析。该模型还支持工具调用,其CharXiv推理得分(使用工具时)为76.5,这意味着它可以集成到调用外部API或数据库的智能体工作流程中。然而,它并非专为创意写作、高度抽象推理或需要深厚领域专业知识的任务而设计。其优势在于速度、成本以及广泛的模态支持,而非原始性能。
当成本与吞吐量是首要考虑因素且任务在其能力范围内时,应选择 Gemini 3.5 Flash-Lite。该模型在高吞吐量管道中表现出色,例如索引数千份文档、转录数小时音频或对图像流进行实时分类。其大上下文窗口(100万 token)使其非常适合需要全局理解长输入的任务,如同法案例分析或代码库重构。更大的模型(如 Gemini 3.5 Pro)可能在复杂基准测试中获得更高准确率,但会带来显著更高的单 token 成本和更低的吞吐量。如果你的应用能够容忍轻微的质量折衷以换取 10-100 倍的成本降低,该模型是一个强有力的选择。反之,对于需要事实精准性、创造性生成或最先进推理能力的任务,建议采用更大的模型。
是的,该模型原生支持视频和音频输入,同时也能处理文本、图像和文件。视频输入可以以帧序列或视频文件的形式提供;模型会处理视觉帧及其关联的音频轨道。音频输入支持WAV、MP3或FLAC等常见格式。较大的上下文窗口允许在单个请求中处理长录音——例如,一小时的高细节音频转录可能需要消耗约10,000个令牌。这对于会议总结、播客分析或语音客户支持非常有用。请注意,模型不会生成音频或视频输出;响应始终是文本格式。多模态理解的质量与该模型的闪速精简版(flash-lite tier)相当:足以满足提取和分类的需求,但与更大的多模态模型相比,可能会遗漏一些细微的细节。
Gemini 3.5 Flash-Lite 支持工具调用,这一点可以从其在 CharXiv Reasoning with tools 上的基准测试表现(得分 76.5)看出。这意味着你可以定义模型在生成响应时能够调用的函数或 API。典型用例包括数据库查询、网络搜索或算术运算。模型会根据用户的指令和上下文决定何时调用工具。使用工具可以提高事实准确性,并支持复杂的多步推理。然而,由于该模型是 flash-lite 变体,其工具调用的可靠性可能低于更大的专用模型。如果你的应用高度依赖无懈可击的工具编排,你可能需要添加验证层或回退逻辑。OrcaRouter 以与 OpenAI API 相同的格式传递工具定义,使集成变得简单直接。
该模型在使用工具进行评估时,在CharXiv推理基准测试中得分为76.5。CharXiv测试的是基于图表视觉数据进行推理的能力,要求模型解读图表图像并回答相关问题。“with tools”条件意味着模型可以调用外部函数(例如计算器)提供辅助。这一得分表明其性能中等——能够进行图表推理,但未达到专业模型的水平。目前该模型没有提供其他基准测试分数。作为对比,更大的模型(如Gemini 3.5 Pro)在此任务上的得分可能会更高。该值作为参考点很有用:你可以期待合理的图表解读,但如果你的应用对视觉推理任务要求高精度,则应进行充分测试。
仅提供了 CharXiv 推理(含工具)得分:76.5。在提供的信息中,没有 Gemini 3.5 Flash‑Lite 的其他基准测试数据——例如 MMLU、HumanEval 或长上下文检索得分。这意味着要将其性能推广到其他任务上,需要对您自己的数据进行实证测试。考虑到该模型的闪存精简特性,预计其在大多数标准化基准测试中的表现将不如完整尺寸模型。然而,其高效性和低成本往往能在生产环境中弥补这些不足。如果您需要在特定基准测试(例如代码生成或多语言理解)上验证性能,应自行进行评估。OrcaRouter 不托管单独的基准测试结果;此处引用的数字直接来自提供商。
提供的资料中未指定延迟细节。根据经验法则,flash‑lite 模型相对于其更大的同类模型设计为低延迟,但实际响应时间取决于多种因素:输入长度、输出长度、并发请求负载以及底层硬件。对于 1M 上下文窗口,处理极长提示会因注意力的二次缩放而大幅增加延迟。对于短输入(例如几百个 token),您预期可获得亚秒级响应。对于接近 1M token 限制的输入,延迟可能达到数十秒。OrcaRouter 不对此模型保证特定的延迟 SLA。如果低延迟至关重要,请考虑使用较小的上下文(例如通过截断)或专用端点。您可以通过 OrcaRouter 仪表盘监控响应时间。
Gemini 3.5 Flash-Lite 并非为追求最先进的精准度而设计。其优势在于速度、成本和大上下文窗口。其局限性包括:在复杂推理基准测试中表现较低、与更大模型相比事实回忆能力减弱,以及在模糊输入下容易产生“幻觉”。该模型在处理需要深度领域专业知识(如法律推理、医疗诊断)或精细创意工作的任务时可能会遇到困难。其工具使用能力虽然可用,但可能不如专用智能体模型那样可靠。此外,由于仅提供一个基准分数(CharXiv 推理 76.5,带工具),在没有测试的情况下,不能假设其在其他领域表现良好。对于关键应用,始终使用自己的数据进行基准测试,并在置信度较低时考虑回退到更强大的模型。
定价为每百万输入Token $0.30,每百万输出Token $2.50。这些价格是提供商直接收取的费率,OrcaRouter不进行任何加价。输入Token包括提示中的所有Token(文本、图像Token、视频帧、音频样本、文件内容),无论模态如何。输出Token是生成的文本Token。对于一个典型的长上下文查询,消耗100,000个输入Token和1,000个输出Token,每次请求的成本约为($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325。大规模使用时,该模型仅需几百美元即可处理数百万次查询。相比之下,大型模型每个Token的成本通常高出10-50倍。较低的输出定价特别有利于生成较长响应(例如,完整文档摘要)的应用。
所提供的信息未指定任何缓存机制或缓存令牌的折扣定价。因此,您应假定发送给模型的每个令牌均按标准输入费率(每百万令牌0.30美元)计费,无论重复与否。某些提供商会提供自动提示缓存,其中重复前缀以较低费率(例如五折)计费。对于此模型,尚未公布此类缓存折扣。如果您经常重新发送相同上下文(例如较大的系统提示),您可能需要调查OrcaRouter或Google是否实现了透明缓存。在缺乏明确信息的情况下,最稳妥的做法是为所有输入预算完整的每令牌成本。通过修剪重复使用的内容进行优化,可减少您的实际账单。
零加价意味着OrcaRouter完全按照提供商费率收费,不添加任何额外利润。对于Gemini 3.5 Flash-Lite,输入价格为每100万令牌0.30美元,输出价格为每100万令牌2.50美元——这是Google的收费标准,OrcaRouter原样传递,不加价。您无需为每个令牌支付任何额外的平台费用。这在API网关中并不常见,通常它们会额外加价10-20%甚至更多。零加价使得该模型通过OrcaRouter访问时更具成本效益。您仍需支付带宽和API基础设施费用,但这些成本已包含在提供商费率中;OrcaRouter不会单独列出这些费用。这种定价模式透明公开:您的使用仪表盘上显示的成本即为最终成本。
您可以通过OrcaRouter的OpenAI兼容API进行调用,基础URL为https://api.orcarouter.ai/v1。将模型参数设置为"google/gemini-3.5-flash-lite"。支持聊天补全(POST /v1/chat/completions)和嵌入(如果支持)。对于多模态输入,您需要使用一个包含角色数组和内容对象(可能包含文本、image_url或file_url字段)的消息结构。示例cURL请求: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"描述这张图片"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' 您必须使用OrcaRouter API密钥,而不是Google API密钥。
该模型支持标准的 OpenAI 兼容参数:model、messages、max_tokens(最大可达模型的 65,536 限制)、temperature、top_p、stop、frequency_penalty、presence_penalty 以及 tools(用于函数调用)。其他 Google 特有参数(如 safety_settings)可能不会直接暴露;如需使用,请查阅 OrcaRouter 文档以寻找等价参数。模型会遵守 max_tokens 限制。对于多模态输入,content 中的 type 字段支持:text、image_url、video_url(若 OrcaRouter 暴露此选项)、audio_url 和 file_url。file 类型可接受 PDF、CSV 等文件。请注意,大型媒体文件可能需要预先编码为 data URI 或托管在公开可访问的地址。OrcaRouter 可能还要求文件大小不超过特定限制。请始终参考最新的 API 文档以获取确切的参数支持信息。
要从其他 API 提供商(例如 Google AI Studio、Vertex AI 或其他网关)迁移到 OrcaRouter,只需将基础 URL 替换为 https://api.orcarouter.ai/v1,并将模型 ID 设置为 "google/gemini-3.5-flash-lite"。如果您现有的代码使用 OpenAI Python 客户端,请传入 base_url 和 api_key。示例: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) 如果您之前的提供商使用了不同的模式(例如 Anthropic),则可能需要调整多模态消息的格式。OrcaRouter 期望使用 OpenAI 格式。用户内容数组可以包含多个部分。工具定义也是 OpenAI 风格的。没有额外的迁移费用;您只需按描述中的每 token 付费。
没有提供直接比较数据,但我们可以进行定性推理。Gemini 2.0 Flash(如果存在的话)很可能是较早一代的闪速模型。Gemini 3.5 Flash‑Lite 是更新、更轻量的变体,拥有更大的上下文窗口(1M 对比可能为 128K)且定价更低。Gemini 3.5 Flash‑Lite 每百万个Token的成本为 $0.30/$2.50,非常低。较旧的闪速模型可能具有更高的每Token成本和更短的上下文窗口。然而,Gemini 2.0 Flash 如果是完整闪速模型而非轻量变体,其原始准确性可能更好。如果您的任务要求最高质量且能承受更高成本,较旧的完整闪速模型可能更优。如果您需要大上下文和低成本,3.5 Flash‑Lite 是合理的选择。
来自OpenAI的GPT-4o mini是一款类似的低成本多模态模型。它的上下文窗口为128K tokens(远小于1M),输入价格每百万tokens 0.15美元,输出价格每百万tokens 0.60美元(截至2025年初,价格可能已变动)。Gemini 3.5 Flash‑Lite提供8倍大的上下文窗口,输入价格是其2倍,输出价格是其4倍。因此,Gemini每个token更贵,但提供更大的上下文容量。对于需要完整1M上下文的任务(例如处理整本书),Gemini Flash‑Lite比将输入分块多次调用GPT-4o mini更具成本效益。如果上下文较短,GPT-4o mini更便宜,且可能在基准测试中表现更好。没有数据时,两者的基准分数不能直接比较。
未提供基准比较。Llama 3.2 90B(假设该模型存在)是一个大型开源权重模型,上下文窗口较小(通常为128K tokens),通过API运行时每个token的成本较高。Gemini 3.5 Flash‑Lite是一个专有模型,具有更大的上下文窗口和极低的定价——是可用的最便宜的每token多模态模型之一。Llama 3.2 90B可能因其规模而在许多NLP基准测试上取得更高的准确率,但它不是多模态模型,且上下文限制更严格。如果你的任务是纯文本且需要最高准确率,Llama 90B(如果能通过OrcaRouter访问)可能更好。对于多模态、长上下文或高吞吐量场景,Gemini Flash‑Lite具有明显优势。选择取决于你应用的具体需求。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 输入 / 1M tokens | $0.300 |
| 输出 / 1M tokens | $2.50 |
| 缓存读取 / 1M | $0.030 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite