Gemini 2.5 Flash Lite

google/gemini-2.5-flash-lite
视觉音频工具JSON推理
来自 Google · 2025-07-22

Gemini 2.5 Flash-Lite 是 Gemini 2.5 系列中的轻量级推理模型,针对超低延迟和成本效益进行了优化。它提供了更高的吞吐量、更快的令牌生成速度和更好的性能……

上下文1M tokens
最大输出65K
输入模态text + image + file + audio + video
输出模态text
p50 首字节1.34 s
输入$0.10/ 百万 tokens
输出$0.40/ 百万 tokens
p50 首字节1.34 s7 天
p95 首字节8.52 s7 天
流量11.3Mtokens / 7 天

Google Gemini 2.5 Flash Lite 是 Google 推出的 Gemini 2.5 Flash 模型的更小、更快、更经济版本。它设计用于处理多种多模态输入——包括文本、图像、文件、音频和视频——同时保持 1,048,576 个令牌的大上下文窗口。最大输出为 65,536 个令牌,因此可以在单次交互中生成长篇内容或处理大量指令。该模型通过 OrcaRouter 兼容…

什么是Google Gemini 2.5 Flash Lite?

谁应该使用这个模型?

它支持哪些输入方式?

与其他谷歌模型相比如何?

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • include_reasoning
  • max_tokens
  • reasoning
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

价格

输入 / 1M tokens$0.100
输出 / 1M tokens$0.400
缓存读取 / 1M$0.010
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $1.90 · 启用提示缓存后 $1.59

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.000201

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
1.34 s
输出速度
541 tok/s
p95 首字节
8.52 s
错误率
0.44%

公共基准测试

7.4
AA Coding
优于所参与对比模型中的 1%
第 125 / 共 126
6.7
AA Intelligence
优于所参与对比模型中的 3%
第 122 / 共 128
35.3
AA Math
优于所参与对比模型中的 12%
第 71 / 共 81
AIME
50.0
AIME 2025
35.3
GPQA Diamond
47.4
Humanity's Last Exam
3.7
IFBench
31.5
LiveCodeBench
40.0
Long-Context Recall
32.0
MATH-500
92.6
MMLU-Pro
72.4
SciCode
17.7
TerminalBench Hard
2.3
τ²-Bench
19.0
来源: artificialanalysis.ai

社区热度

本周开发者的讨论

Hacker News0 次提及 · 近 7 天较上周减少 1

对比一览

Gemini 2.5 Flash LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
输入 $/百万$0.10$2.00$4.00$0.50
输出 $/百万$0.40$12.00$18.00$3.00
上下文1.0M1.0M1.0M1.0M
质量2/1010/1010/109/10
并排对比并排对比并排对比并排对比

更多 Google 模型

常见问题

Gemini 2.5 Flash Lite 在 OrcaRouter 上的每 token 成本是多少?
输入令牌每百万个收费0.10美元,输出令牌每百万个收费0.40美元。OrcaRouter按提供商费率计费,零加价。
上下文窗口大小是多少?
上下文窗口为1,048,576个token(100万个token),最大输出为65,536个token。
该模型的主要优势是什么?
优点包括低成本、高速、强大的数学推理能力(在MATH-500上得分92.6)、非常大的上下文窗口,以及对文本、图像、文件、音频和视频的多模态支持。
它与Gemini 2.5 Flash相比如何?
Gemini 2.5 Flash Lite 更便宜、更快,但在复杂推理、创意写作和代码生成方面的性能可能略低于完整版 Flash 模型。
使用此模型时,OrcaRouter 会存储或共享我的数据吗?
提供的资料未明确说明OrcaRouter的数据处理政策。通常,API提供商可能仅处理数据以完成请求。请查看OrcaRouter的隐私政策以了解详情。
如何通过兼容OpenAI的API调用此模型?
在您的OpenAI客户端库中使用基础URL https://api.orcarouter.ai/v1 和模型ID "google/gemini-2.5-flash-lite"。在Authorization标头中包含您的OrcaRouter API密钥。
我可以使用多模态输入,如图像和音频吗?
是的,该模型接受文本、图像、文件、音频和视频输入。您可以使用标准的 OpenAI 多模态格式将它们作为用户消息中的内容部分包含在内。
预期延迟是多少?
该模型专为低延迟设计,尤其是与大型模型相比。确切时间取决于输入/输出长度和服务器负载。未提供具体的延迟数据。
支持哪些编程语言和框架?
任何支持HTTP请求和OpenAI API格式的语言(Python、JavaScript、Go、Java等)都可以使用。官方的OpenAI Python库可以无缝工作。
OrcaRouter是否为高流量提供缓存或折扣?
没有提供缓存或批量折扣信息。定价按Token计费,采用提供商费率,不加价。企业咨询请联系OrcaRouter。

嵌入此徽章

Google: Gemini 2.5 Flash Lite$0.10/M in1337ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-2.5-flash-lite.svg" alt="Google: Gemini 2.5 Flash Lite 在 OrcaRouter" /> </a>
Markdown [![Google: Gemini 2.5 Flash Lite](https://www.orcarouter.ai/embed/google/gemini-2.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite)

以数据形式获取模型卡

GET /api/public/models/google/gemini-2.5-flash-lite打开