谷歌面向机器人的多模态预览模型,支持文本、图像、视频和音频输入,最多可输出65,536个token。
google/gemini-robotics-er-1.6-preview 是 Google Gemini 系列中针对机器人和具身推理优化的预览模型。这是一个多模态模型,可以处理文本、图像、视频和音频输入。其名称中的 "er" 可能代表 "具身推理"(embodied reasoning),表明其专注于理解并在物理环境中执行操作。该模型每次请求最大支持 65,536 个 token…
该模型专为机器人相关的多模态推理设计。它能解读图像和视频,识别物体、环境及人类行为;也能处理音频指令并从语音中提取信息。通过结合这些模态,模型可生成用于机器人操作、导航或交互的指令。例如,给定一段厨房视频以及一句“从台面上取苹果”的语音请求,模型能输出一系列动作步骤。较大的输出上下文使其能够为机器人控制器生成详细计划或代码。需要注意的是,该预览版本在这些任务上的性能尚未经过公开基准测试。
如果你的应用不需要多模态输入(例如只使用文本),那么一个纯文本的小模型会更经济高效。robotics-er模型的输入令牌定价相对较高(每百万个令牌1.00美元),而许多通用模型则更便宜。对于没有视觉或音频上下文的简单问答或文本生成,建议考虑通过OrcaRouter使用更轻量的模型,例如Gemini 1.5 Flash或更小的开源模型。此外,如果不需要最大65,536个令牌的输出,选择输出上下文较小的模型可以降低延迟和成本。请评估多模态能力是否值得为你的用例付出相应价格。
65,536个token的输出限制对于生成长篇内容尤为有价值,例如机器人运动序列(如使用ROS或控制库的Python代码)、用于3D重建的详细环境描述,或者需要广泛推理的多步骤任务计划。它还可用于上下文学习,即在单个提示中给模型提供大量示例,并期望其生成全面输出。对于机器人研究而言,这使得生成覆盖众多可能情况的长期规划成为可能。但请注意,较长的输出会增加成本和延迟,因此需考量是否更短的响应即可满足需求。
音频和视频输入作为多模态提示的一部分进行处理。当您发送视频时,模型可能将其视为帧序列或使用视频理解编码器(具体方法为Google内部技术)。音频可以作为音频文件的URL包含在内。模型可以转录或理解语音指令,并据此生成文本响应。音频和视频处理的质量取决于Google's Gemini API支持的采样率和格式;请查阅提供商文档以了解支持的文件类型和最大时长。OrcaRouter仅以OpenAI兼容格式中继输入。
作为预览版本,谷歌尚未公布gemini-robotics-er-1.6-preview模型的具体基准测试分数。通用Gemini 1.6系列在多模态任务中表现强劲,但这一机器人专用变体可能具有不同的优势。用户应在依赖该模型前,针对自身领域特定任务评估其性能。OrcaRouter除提供商已公布的数据外,不提供额外的基准测试数值。为确保实际可靠性,请使用自有数据进行A/B测试,并对比其他模型的延迟、准确率和成本。
提供商未指定 google/gemini-robotics-er-1.6-preview 的延迟。通常,处理视频和音频的多模态模型由于编码开销,其延迟高于纯文本模型。此外,较大的输出上下文会增加响应时间,尤其是在长生成任务中。实际延迟取决于请求大小、复杂度以及 Google 基础设施和 OrcaRouter 代理上的服务器负载。为获得最佳性能,请尽量减少不必要的输入数据并设置合适的 max_tokens。OrcaRouter 的 API 返回标准时间头;监视这些数据将为您提供适用于实际用例的经验数据。
该模型的主要优势在于支持多种输入模态(文本、图像、视频、音频),并结合了高达65,536个token的极大输出上下文。这使得它非常适合需要理解视觉和听觉信息并生成详尽、丰富计划的复杂机器人任务。预览性质表明它是首批针对具身推理进行微调的Gemini模型之一。另一个优势是通过OrcaRouter的OpenAI兼容API直接访问,这降低了熟悉OpenAI接口的团队的集成门槛。
作为预览模型,其稳定性和性能可能无法达到生产就绪模型的标准。缺乏公开的基准测试意味着其在标准机器人任务上的准确性未知。与成熟模型相比,它可能具有更高的故障率或意外行为。该模型仅生成文本输出,不生成图像或音频。每百万输出代币的价格($5.00)相比许多模型较高。此外,较大的输出上下文可能会鼓励不必要的冗长回复。用户在将此模型用于任何严肃应用之前,应进行充分的原型测试。
在OrcaRouter上对google/gemini-robotics-er-1.6-preview的计费非常直观:每100万输入token收费1.00美元,每100万输出token收费5.00美元。输入和输出token均按照Google的分词方式计算,这可能与其他模型有所不同。OrcaRouter按提供商精确费率收费,零加价。API代理服务不收取额外费用。成本基于请求和响应中处理的token总数计算,包括多模态输入token(例如,图像块可能被计为token)。请始终查看API响应中返回的使用量以跟踪成本。
输出 token 的成本(每百万 $5.00)远高于输入成本(每百万 $1.00)。这意味着让模型生成长回复比提供较长输入会使成本增加更多。对于输出长度可以保持较短(例如单句指令)的使用场景,成本可能可以接受。然而,如果利用完整的 65,536 个输出上下文,单次请求的输出成本可能高达 $0.33(65k token,按 $5/M 计算)。将其与输出定价更低或上下文窗口更小的模型进行比较。此外,多模态输入如果涉及大量 token(例如高分辨率图像或长视频),成本可能较高。考虑使用 token 压缩或在可能的情况下降低分辨率。
OrcaRouter 目前按提供商费率应用,零加价。由于它是透传代理,没有内置缓存来减少重复提示前缀的成本。但是,您可以在应用程序层面实现缓存:如果重复使用相同的输入上下文(例如静态系统提示或参考图像),存储模型的响应并重复使用它,避免重复调用 API。OrcaRouter 的企业计划可能提供折扣或批量定价;请联系 OrcaRouter 团队了解详情。除非另有特殊协议,否则所有用量均适用标准定价。
使用标准 OpenAI 聊天补全端点。将 'model' 参数设置为 'google/gemini-robotics-er-1.6-preview'。基础 URL 为 https://api.orcarouter.ai/v1。在 Authorization 标头中包含您的 OrcaRouter API 密钥。对于纯文本消息,请求体与 OpenAI ChatCompletion 请求相同:{ "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "您的消息"}], "max_tokens": 2000 }。对于多模态输入,将内容构造为一个包含 type 和 data 字段的数组,遵循提供商的 schema。OrcaRouter 在内部将请求转换为 Google 格式。
该API支持与OpenAI /v1/chat/completions端点相同的参数:model、messages、max_tokens(最多65536)、temperature(0到2,默认1)、top_p(0到1,默认1)、frequency_penalty、presence_penalty、停止序列、stream(布尔值)、logprobs和user。并非所有参数在Google后端都能生效;例如,frequency_penalty和presence_penalty可能效果有限。对于流式传输,设置“stream: true”以逐token接收响应。响应格式与OpenAI一致,包括choices、usage(prompt_tokens、completion_tokens、total_tokens)和id。请查阅OrcaRouter文档以获取任何特定于模型的参数覆盖。
由于 OrcaRouter 提供与 OpenAI 兼容的 API,迁移通常只需更改基础 URL 和 API 密钥。将 'https://api.openai.com/v1' 替换为 'https://api.orcarouter.ai/v1',并将模型设置为 'google/gemini-robotics-er-1.6-preview'。如果您的应用程序使用 OpenAI Python 客户端,请更新 base_url 和 api_key。对于多模态输入,请注意 OpenAI 的图像格式使用 'image_url',但 Google 的格式可能需要不同的字段名称(如 'video_url')。OrcaRouter 的 API 接受 OpenAI 多模态模式的超集;请参阅其文档了解确切结构。在迁移复杂逻辑之前,请先使用简单请求进行测试。
Gemini 1.5 Pro 是一款通用多模态模型,在性能和成本之间取得了良好的平衡。名为“robotics-er”的预览模型专门针对机器人和具身推理进行了优化,正如其名称所示。虽然 Gemini 1.5 Pro 通常支持最多 8,192 个输出 token,但该模型提供最多 65,536 个输出 token。定价有所不同:Gemini 1.5 Pro 每百万输入 token 约 1.25 美元,每百万输出 token 约 5.00 美元,因此该模型在输入方面略便宜,但输出价格相同。不过,预览模型可能通用知识较少,而更侧重于对物理世界的理解。目前没有基准测试对比数据;用户应自行测试其任务效果。
GPT-4o是OpenAI的多模态模型,支持文本、图像和音频(非视频),输出限制为16,384个token。而robotics-er模型拥有更大的输出上下文(65,536),并明确支持视频输入,这是GPT-4o本身不具备的。定价差异:GPT-4o的标准使用费用为每百万输入token $2.50,每百万输出token $10.00,因此robotics模型每token更便宜。然而,GPT-4o是一个成熟的、拥有广泛基准测试的生产模型,而该模型仍为预览版。对于机器人特定任务,Google模型可能设计为性能更优,但缺乏公开基准测试,这仅是推测。
Llama 3 模型为纯文本模型(或即将支持多模态),但可自托管,在大规模部署时可能更具成本优势。机器人模型提供原生多模态支持(包括视频和音频),而开源替代方案可能需要额外组件才能实现。预览模型的按 Token 计费对于高用量场景可能成本较高,而自托管开源模型的基础设施成本可预测。然而,Google 模型受益于云规模基础设施和持续更新。在原型开发阶段,预览模型通过 API 实现的易用性可能抵消其成本。请综合评估包括开发时间在内的总拥有成本。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| 输入 / 1M tokens | $1.00 |
| 输出 / 1M tokens | $5.00 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
GET /api/public/models/google/gemini-robotics-er-1.6-preview打开 @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview