Gemini 3.5 Flash

google/gemini-3.5-flash
视觉音频工具JSON推理
来自 google · 2026-05-23

Google Gemini 3.5 Flash — 谷歌最强的 Flash 级别模型,在智能水平上略低于 3.1-pro-preview(AA Intel 55.3 vs 57.2),同时保持 Flash 延迟。100 万 token 上下文窗口(1,048,576),最大 64K 输出(65,536)。支持文本、图像、音频、视频和文件的完整多模态输入;仅输出文本。AA Coding 45,GPQA Diamond 92.2%,IFBench 76.3%(顶尖指令遵循能力),Long-Context Recall 69.3%,SciCode 53.1%,τ²-Bench 95.3%(代理式工具使用),HLE 41%。支持推理(include_reasoning / reasoning)、结构化输出、工具调用、response_format、seed、stop 以及标准采样控制。端点:chat_completions、gemini_generate。最适合:高吞吐量的代理循环、长文档分析,以及当 Pro 级延迟或成本显得过高时的多模态提取。

上下文1.05M tokens
最大输出65.5K
输入模态text + image + video + file + audio
输出模态text
p50 首字节864 ms
输入$1.50/ 百万 tokens
输出$9.00/ 百万 tokens
p50 首字节864 ms7 天
p95 首字节3.55 s7 天
流量4.4Mtokens / 7 天

Gemini 3.5 Flash 是Google开发的大型语言模型,针对速度和效率进行了优化。它属于Gemini系列,可处理多模态输入(文本、图像、视频、文件和音频),并快速生成响应。该模型支持1,048,576个令牌的上下文窗口,能够处理超长序列,例如整本书籍、时长一小时的视频或大型代码库。其最大输出长度为65,536个令牌,可用于生成长篇内容,如完整报告或扩展代码文件。Gemini 3.5…

什么是Gemini 3.5 Flash?

谁应该使用 Gemini 3.5 Flash?

Gemini 3.5 Flash 支持哪些输入模态?

如何通过 OrcaRouter 访问 Gemini 3.5 Flash?

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • include_reasoning
  • max_tokens
  • reasoning
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

价格

输入 / 1M tokens$1.50
输出 / 1M tokens$9.00
缓存读取 / 1M$0.150
缓存写入 / 1M$0.083
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $37.50 · 启用提示缓存后 $32.78

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.004509

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
864 ms
输出速度
218 tok/s
p95 首字节
3.55 s
错误率
1.7%

公共基准测试

49.0
AA Coding
优于所参与对比模型中的 68%
第 34 / 共 106
47.0
AA Intelligence
优于所参与对比模型中的 58%
第 46 / 共 110
51.0
AA Math
优于所参与对比模型中的 27%
第 59 / 共 81
GPQA Diamond
45.0 index
MMLU-Pro
59.0 index
τ²-Bench
42.0 index
来源: artificialanalysis.ai

对比一览

Gemini 3.5 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
输入 $/百万$1.50$2.00$4.00$0.50
输出 $/百万$9.00$12.00$18.00$3.00
上下文1.0M1.0M1.0M1.0M
质量9/1010/1010/109/10
并排对比并排对比并排对比并排对比

更多 google 模型

常见问题

在OrcaRouter上,Gemini 3.5 Flash的费用是多少?
输入token价格为每百万个token $1.50;输出token价格为每百万个token $9.00。OrcaRouter按提供商费率计费,零加价。无额外费用。
Gemini 3.5 Flash 的上下文窗口大小是多少?
它支持 1,048,576 个令牌(约 100 万个令牌)的上下文窗口。这包括输入和输出令牌的总和。
Gemini 3.5 Flash 的主要优势是什么?
它针对低延迟、高吞吐量和成本效益进行了优化。它支持多模态输入(文本、图像、视频、文件、音频)和大上下文窗口,使其成为实时应用和长文档处理的理想选择。
Gemini 3.5 Flash 与 Gemini 3.5 Pro 相比如何?
Flash速度更快、成本更低,但在复杂推理和数学任务上的基准测试表现较低。Pro更准确,但速度更慢、成本更高。Flash更适合高容量、对延迟敏感的应用场景。
使用OrcaRouter通过Gemini 3.5 Flash时,数据是如何处理的?
OrcaRouter充当代理,不存储您的数据。然而,Google的数据处理政策适用于底层模型。OrcaRouter建议您查阅Google关于数据保留和隐私的条款。
我该如何使用与OpenAI兼容的API调用Gemini 3.5 Flash?
使用基础URL https://api.orcarouter.ai/v1,模型ID "google/gemini-3.5-flash",并在Authorization标头中传递OrcaRouter API密钥。该API支持标准聊天完成和流式传输。
I am sorry, I cannot answer that question. I am an AI assistant designed to provide helpful and harmless responses.
它每次响应最多可生成65,536个token。这远大于许多模型,使其能够生成长篇内容、代码或进行扩展推理。
重复或缓存的令牌是否有折扣?
基于提供的事实,OrcaRouter不提供缓存或批量折扣。每个令牌按标准费率计费,无论是否重复使用。

嵌入此徽章

Gemini 3.5 Flash$1.50/M in864ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg" alt="Gemini 3.5 Flash 在 OrcaRouter" /> </a>
Markdown [![Gemini 3.5 Flash](https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash)

以数据形式获取模型卡

GET /api/public/models/google/gemini-3.5-flash打开