Gemini 2.5 Flash Image,又称“Nano Banana”,现已正式发布。这是一款具备上下文理解能力的最先进的图像生成模型,能够进行图像生成……
Google:Nano Banana (Gemini 2.5 Flash Image) 是 Google 开发的多模态语言模型,属于 Gemini 2.5 Flash 系列。它接受图像和文本作为输入,并生成文本输出。该模型通过 OrcaRouter 兼容 OpenAI 的 API 进行访问,模型标识为“google/gemini-2.5-flash-image”。模型具有 32,768 个…
核心能力集中在理解与推理以图像形式呈现的视觉内容上。给定一张图片和一段文本提示后,模型可以描述场景、识别物体、回答关于内容的问题、提取文本(OCR),以及执行基本的视觉推理(例如空间关系、颜色、动作)。它还能处理随图片一同提供的文本,如说明或上下文信息。由于采用了闪速级架构,该模型针对低延迟和高吞吐量进行了优化,适用于实时或高数据量的应用场景。然而,在处理需要精细分析或长推理链的复杂视觉任务时,其推理深度或准确性可能无法与更昂贵、更大型的模型(如Gemini 2.5 Pro)相媲美。该模型不适用于图像生成、视频分析或需要超过32K标记长上下文的多轮对话等任务。
如果你的应用完全不需要图像输入,使用纯文本模型(例如较小的Gemini变体或开源模型)将更具成本效益。同样,如果任务仅涉及基于文本的推理而不包含视觉成分,则图像处理的开销是不必要的。对于输出长度较长的情况——例如根据图像生成详细报告或故事——每百万输出令牌30美元的费用可能会变得昂贵。在这种情况下,可考虑输出定价更低的模型,或者先用该模型生成简短摘要,再用更便宜的纯文本模型进行扩展。此外,如果每个请求需要处理多张图像或处理非常大的图像,则具有更大上下文窗口或特定图像分辨率支持的模型可能更为合适。
高容量部署可从该模型的低输入成本(每百万tokens $0.30)和快速推理中获益。理想用例包括为大型照片库自动标记图像、为数千张产品图片生成替代文本、对批量扫描文档执行OCR,以及对用户上传图像进行实时内容审核。由于输出成本较高,回复应保持简短——通常为一个单词、标签或一句话。例如:将图像分类到预定义类别、从表单中提取少量关键字段,或回答关于图像的是非问题。可通过OrcaRouter的API以并发请求方式进行批量处理。该模型延迟通常较低,但实际吞吐量取决于图像大小和复杂度。除整体API使用量限制外,OrcaRouter没有单独的速率限制。
主要限制在于输出令牌成本相对于输入成本较高,这使得生成长文本的费用昂贵。32,768个令牌的上下文窗口限制了单次请求可处理的文本量和图像大小(以令牌计)。该模型并非为需要深度多模态推理、复杂视觉细节或同时处理多张图像(每增加一张图像会消耗上下文)的任务而设计。此外,作为闪速层级模型,与能力更强但速度较慢或成本更高的模型相比,它在医学图像分析、细粒度目标检测或罕见物体识别等专业视觉任务上的准确率可能较低。模型训练数据及在基准测试中的具体性能在提供的事实中未披露;用户应使用自己的数据集进行评估。最后,它仅支持图像和文本输入,不支持视频或音频。
提供的资料未包含Google: Nano Banana (Gemini 2.5 Flash Image)的任何具体基准分数。它是Google Gemini 2.5 Flash系列的一部分,该系列整体以效率为重,而非追求顶尖精度。在缺乏数据的情况下,用户可预期其性能与其他Flash级多模态模型在标准视觉语言任务(如VQAv2、COCO Captions和OCR)上相当。但确切分数未给出。我们建议用户在自有代表性数据集上评估该模型,以判断其能力是否满足需求。OrcaRouter不提供除Google公开信息之外的内部基准。如需精确准确度指标,请查阅Google官方关于Gemini 2.5 Flash系列的文档,但请注意,此特定模型标识符可能经过了自身的微调。
所提供的资料中不包含该模型的延迟测量数据。作为Gemini 2.5 Flash系列的一部分,它专为低延迟和高吞吐量而设计。通常,谷歌的flash层级模型会在推理质量上做出一定妥协以换取速度,使其适用于近实时应用场景。实际延迟取决于多种因素,例如输入图像的尺寸和分辨率、文本提示的长度、请求的输出令牌数量以及API当前的负载。总体而言,简单的图像标题生成任务可能在几百毫秒到几秒内完成,而需要较长输出的复杂提示则耗时更长。为获得最佳效果,请保持合理的图像分辨率并限制输出长度。OrcaRouter的API除了提供商响应时间外,不会增加额外开销。
优势:该模型在需要从单张图像快速获得成本效益高的答案时表现出色。它能快速识别常见物体、从图像中读取文本,并回答关于视觉内容的直接问题。较低的输入成本使其适合处理大量图像。局限性:该模型在处理需要高精度的任务时可能遇到困难,例如计数小物体、区分非常相似的纹理或理解复杂图表。模型的理解仅限于从像素数据和文本提示中推断出的信息;它无法访问训练数据之外的外部知识(截止日期未知)。此外,由于输出成本较高,为每张图像生成冗长的答案会迅速增加费用。对于需要详细分析的长篇任务,更适合使用功能更强(通常也更昂贵)的模型。在边缘情况(如昏暗模糊图像或异常角度)下,性能可能较低。
定价非常直接:每100万输入令牌收费0.30美元,每100万输出令牌收费30.00美元。输入令牌包括来自文本提示和图像(图像由模型进行令牌化)的令牌。输出令牌是作为响应生成的令牌。无需设置费用,没有月度最低消费,OrcaRouter不增加任何加价——您支付的价格就是提供商费率。令牌由OrcaRouter的系统进行计数。计费通常按用量计算,随着您发送请求而产生费用。您可以通过OrcaRouter仪表盘监控使用情况。由于输入令牌比输出令牌便宜得多,典型请求(短输出)的总成本主要由输入端决定,尤其是在包含大图像的情况下。例如,一张1024x1024的图像可能消耗数千个输入令牌。
与纯文本模型(例如,Gemini 1.5 Flash 纯文本版本,输入成本 $0.075/百万 token,输出成本 $0.30/百万 token)相比,该模型的输入成本高出4倍,输出成本高出100倍,这反映了视觉处理的额外复杂性。对于不需要图像分析的任务,那些纯文本模型要便宜得多。与更大的多模态模型(如 Gemini 2.5 Pro,其每 token 成本更高但推理能力更强)相比,该模型在输入成本上更低,但在输出成本上根据具体的 Pro 层级可能相近或更高。Flash 层级的权衡在于以较低输入成本换取较低的准确性。如果你的应用需要高准确性且能承受较高的输入成本,Pro 模型可能更合适。如果输出长度很大,该模型的输出成本会变得过高,因此可以考虑输出定价更低的模型,例如定价可能不同的 Gemini 1.5 Flash(文本+视觉)版本。
提供的事实并未提及OrcaRouter上该模型的任何缓存机制或批量折扣。OrcaRouter直接透传提供商的定价,不加价,因此任何折扣均需通过Google的直接结算安排获得。截至目前,OrcaRouter公开信息中并未提及图像嵌入或提示词的自动缓存。用户应假设每次请求均基于所使用的输入和输出令牌计费。对于高用量用户,可联系OrcaRouter咨询潜在的企业协议,但标准按需付费价格为输入每百万令牌$0.30、输出每百万令牌$30.00。为降低成本,请尽可能重复使用已生成的输出,并限制每次请求中的令牌数量(例如通过调整图像尺寸或使用简短提示)。
要使用 Google: Nano Banana (Gemini 2.5 Flash Image) 通过 OrcaRouter,发送一个 POST 请求到 https://api.orcarouter.ai/v1/chat/completions,并将模型参数设置为 "google/gemini-2.5-flash-image"。该 API 遵循 OpenAI 聊天补全格式。在 Authorization 标头中以 "Bearer YOUR_API_KEY" 的形式包含你的 OrcaRouter API 密钥。在请求体中,提供一个包含用户消息的 messages 数组,该消息同时包含图像和文本。对于图像,包含一个类型为 "image_url" 的 content 部分,其中包含 URL 或 base64 数据。示例:{"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"这张图片里有什么?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}。响应将是一个标准的聊天补全,包含模型的回答。
OrcaRouter API 支持 OpenAI API 中的许多相同参数。基本参数:model(必填,设置为 "google/gemini-2.5-flash-image")、messages(必填,消息对象数组)、max_tokens(整数,生成的最大令牌数)、temperature(浮点数,默认为 1.0,控制随机性)、top_p(浮点数,默认为 1.0)、presence_penalty 和 frequency_penalty(浮点数)、stop(字符串或字符串数组,最多 4 个序列)以及 stream(布尔值,用于流式响应)。对于图像输入,messages 必须至少包含一条用户消息,其内容为 parts 数组,每个 part 带有 type 字段("text" 或 "image_url")。image_url 部分必须包含一个 "image_url" 对象,其中包含一个 "url" 字符串(可以是公开可访问的 URL,也可以是包含 base64 的数据 URL)。没有暴露微调或其他模型专属参数。上下文窗口为 32,768 个令牌,因此请确保 prompt_token_count + image_token_count + max_tokens <= 32768。
迁移到OrcaRouter只需对代码进行最小修改,前提是您已在使用兼容OpenAI的API。只需将基础URL从之前的端点更改为 https://api.orcarouter.ai/v1,并将您的API密钥更新为OrcaRouter密钥。调用模型时,将model参数设置为"google/gemini-2.5-flash-image"(或您所需的模型),并相应调整现有模型ID。对于图像输入,请确保请求格式符合OpenAI约定(例如,使用包含image_url的内容数组)。通常无需其他代码更改。如果您之前使用的是其他API格式(例如云端点),则可能需要重写请求结构。OrcaRouter为常见SDK提供了文档。建议先用少量请求进行测试,以验证令牌计数和定价。请注意,OrcaRouter按供应商费率计费且不加价,因此定价可能与您之前的供应商不同。
与纯文本的Gemini 2.5 Flash(若在OrcaRouter上可用)相比,此模型增加了图像输入能力,但输入成本更高。纯文本版本通常每个输入token成本更低,输出成本也显著降低,因此更适合纯文本任务。与Gemini 2.5 Pro模型相比,此闪存级模型输入成本更低,但准确度和推理深度可能较低。Pro模型拥有更大的上下文窗口(通常为100万token),在复杂多步任务上性能更优。Pro模型的输出成本可能相似或更高。对于需要同时理解图像和文本的任务,此模型提供了一种经济实惠的入门选择。但若需处理视频、音频或多张图像,应考虑支持这些模态的模型(例如某些配置下支持视频和音频的Gemini 2.5 Pro)。
此模型是通过 OrcaRouter 提供的众多多模态选项之一。GPT-4o (OpenAI) 通常拥有更大的上下文窗口(128k),在整体图像理解和推理方面可能表现更优,但输入和输出成本也更高。Claude 的视觉模型(例如 Claude 3.5 Sonnet)同样具有竞争力,但定价和上下文长度有所不同。Gemini 2.5 Flash Image 的主要优势在于其低输入成本,使其非常适合高并发、短输出的任务。然而,对于复杂的视觉推理、医疗影像或详细的文档分析,更高级的模型可能会产生更好的结果。具体选择取决于成本、准确性和延迟之间的权衡。OrcaRouter 允许您通过更改模型 ID 轻松切换不同模型,因此可以很方便地将此模型与替代方案一起测试,以确定最佳选择。
当任务要求更高的准确性、更长的上下文或多步骤推理时,使用更昂贵的模型(如Gemini 2.5 Pro、GPT-4o或Claude 3.5 Sonnet)就变得合理。如果您的应用程序使用该模型产生不正确或不完整的结果,那么需要后处理或人工修正时,节省的成本就白费了。对于分析医学图像、解读法律文档或处理敏感合规内容等任务,高端模型的可靠性可能值得更高的成本。此外,如果您需要生成长输出(例如整页描述)或处理非常大的图像,上下文窗口更大且输出token成本更低的模型整体而言可能更具成本效益。此模型的"闪速"层级意味着它专为速度和吞吐量设计,而非深度。在近似理解足够时使用它;当精度至关重要时升级。
数据隐私和处理取决于Google对Gemini模型的政策。与任何云API一样,输入数据(图像和文本)会被发送到Google的服务器进行处理。除非您选择退出或使用禁止此类使用的企业级账户,否则Google可能会将数据用于模型改进。所提供的事实并未说明此特定模型的数据处理细节。当使用OrcaRouter作为网关时,数据会经过OrcaRouter的基础设施,但最终由Google处理。OrcaRouter不会存储您的数据或将其用于训练。用户应查看Google关于Gemini API的数据处理条款,并在必要时考虑端到端加密。对于敏感数据,一些组织更倾向于将模型托管在自己的基础设施上(例如通过具有数据驻留的Vertex AI),而非第三方网关。然而,如果数据处理问题可以接受,OrcaRouter提供了统一的API密钥和计费,这可能会简化访问。
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| 输入 / 1M tokens | $0.300 |
| 输出 / 1M tokens | $30.00 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image