O modelo multimodal de pré-visualização da Google para robótica, que suporta entradas de texto, imagem, vídeo e áudio com até 65.536 tokens de saída.
google/gemini-robotics-er-1.6-preview é um modelo de pré-visualização da família Gemini do Google, otimizado para robótica e raciocínio incorporado. É um modelo multimodal que pode processar entradas…
O modelo é projetado para raciocínio multimodal relacionado à robótica. Ele pode interpretar imagens e vídeos para identificar objetos, ambientes e ações humanas. Pode processar comandos de áudio e extrair informações da linguagem falada. Combinando essas modalidades, pode gerar instruções para manipulação robótica, navegação ou interação. Por exemplo, dado um vídeo de uma cozinha e um pedido falado para 'pegar a maçã do balcão', o modelo pode gerar uma sequência de ações. O grande contexto de saída permite que ele produza planos detalhados ou código para controladores de robôs. Observe que o desempenho do modelo nessas tarefas ainda não foi avaliado publicamente para esta versão de pré-visualização.
Se a sua aplicação não exigir entradas multimodais (por exemplo, você usa apenas texto), um modelo menor apenas de texto seria mais econômico. O modelo robotics-er tem um preço relativamente alto para tokens de entrada ($1,00 por milhão) em comparação com muitos modelos de uso geral. Para respostas simples a perguntas ou geração de texto sem contexto visual ou de áudio, considere usar um modelo mais leve disponível no OrcaRouter, como o Gemini 1.5 Flash ou um modelo de código aberto menor. Além disso, se a saída máxima de 65.536 tokens não for necessária, um modelo com um contexto de saída menor pode oferecer menor latência e custo. Avalie se as capacidades multimodais justificam o preço para o seu caso de uso.
O limite de saída de 65.536 tokens é particularmente valioso para gerar conteúdo de formato longo, como sequências de movimento robótico (por exemplo, código Python usando ROS ou bibliotecas de controle), descrições detalhadas de ambientes para reconstrução 3D ou planos de tarefas em várias etapas que exigem raciocínio extenso. Também pode ser usado para aprendizado em contexto, onde o modelo recebe muitos exemplos em um único prompt e espera-se que produza uma saída abrangente. Para pesquisa em robótica, isso permite gerar planos de longo prazo que cobrem muitas contingências possíveis. No entanto, note que saídas mais longas aumentam o custo e a latência, então considere se uma resposta mais curta seria suficiente.
Entradas de áudio e vídeo são processadas como parte do prompt multimodal. Quando você envia um vídeo, o modelo provavelmente o trata como uma sequência de quadros ou usa um codificador de compreensão de vídeo (os métodos exatos são internos do Google). O áudio pode ser incluído como um URL para um arquivo de áudio. O modelo pode transcrever ou entender comandos falados e gerar respostas de texto de acordo. A qualidade do processamento de áudio e vídeo depende da amostragem e do formato suportados pela API Gemini do Google; consulte a documentação do provedor para tipos de arquivo suportados e durações máximas. O OrcaRouter simplesmente retransmite a entrada no formato compatível com OpenAI.
Como uma versão de pré-visualização, o Google não publicou resultados específicos de benchmarks para o modelo gemini-robotics-er-1.6-preview. Modelos gerais do Gemini 1.6 demonstraram forte desempenho em tarefas multimodais, mas esta variante específica para robótica pode ter pontos fortes diferentes. Os usuários devem avaliar o desempenho do modelo em suas próprias tarefas específicas de domínio antes de confiar nele. O OrcaRouter não fornece números de benchmark além do que o provedor publica. Para confiabilidade no mundo real, realize testes A/B com seus próprios dados e compare latência, precisão e custo com outros modelos.
A latência para o google/gemini-robotics-er-1.6-preview não é especificada pelo provedor. Em geral, modelos multimodais que processam vídeo e áudio tendem a ter latência maior do que modelos apenas de texto devido à sobrecarga de codificação. Além disso, o grande contexto de saída pode aumentar o tempo de resposta, especialmente para gerações longas. A latência real depende do tamanho da solicitação, da complexidade e da carga do servidor tanto na infraestrutura do Google quanto no proxy do OrcaRouter. Para obter o melhor desempenho, minimize dados de entrada desnecessários e defina max_tokens adequado. A API do OrcaRouter retorna cabeçalhos de tempo padrão; monitorá-los fornecerá dados empíricos para o seu caso de uso.
A principal força do modelo é seu suporte a múltiplas modalidades de entrada (texto, imagem, vídeo, áudio) combinado com um contexto de saída excepcionalmente grande de até 65.536 tokens. Isso o torna adequado para tarefas complexas de robótica que exigem compreensão de informações visuais e auditivas e a geração de planos extensos e ricos em detalhes. A natureza de pré-visualização sugere que ele está entre os primeiros modelos Gemini ajustados para raciocínio incorporado. Outra força é o acesso direto via API compatível com OpenAI do OrcaRouter, que reduz a barreira de integração para equipes familiarizadas com a interface da OpenAI.
Como modelo de pré-visualização, sua estabilidade e desempenho podem não corresponder aos modelos prontos para produção. A falta de benchmarks publicados significa que sua precisão em tarefas padrão de robótica é desconhecida. Ele pode apresentar taxas de falha mais altas ou comportamentos inesperados em comparação com modelos estabelecidos. O modelo não gera saídas de imagem ou áudio, apenas texto. O preço por token de saída é relativamente alto ($5.00 por milhão) em comparação com muitos modelos. Além disso, o grande contexto de saída pode incentivar respostas prolixas que nem sempre são necessárias. Os usuários devem prototipar extensivamente antes de se comprometerem com este modelo para qualquer aplicação séria.
A cobrança pelo google/gemini-robotics-er-1.6-preview no OrcaRouter é direta: US$ 1,00 por 1 milhão de tokens de entrada e US$ 5,00 por 1 milhão de tokens de saída. Tanto os tokens de entrada quanto os de saída são contados de acordo com a tokenização do Google, que pode diferir de outros modelos. O OrcaRouter cobra a taxa exata do provedor, sem margem de lucro. Não há taxas adicionais para o serviço de proxy de API. O custo é baseado no número total de tokens processados na requisição e na resposta, incluindo tokens de entrada multimodais (por exemplo, patches de imagem podem ser contados como tokens). Sempre verifique o uso retornado na resposta da API para acompanhar os custos.
O custo do token de saída ($5.00 por milhão) é significativamente maior que o custo de entrada ($1.00 por milhão). Isso significa que fazer o modelo gerar respostas longas aumenta o custo muito mais do que fornecer uma entrada mais longa. Para casos de uso em que o comprimento da saída pode ser mantido curto (por exemplo, um comando de uma frase), o custo pode ser aceitável. No entanto, se você utilizar todo o contexto de saída de 65.536 tokens, uma única solicitação pode custar até $0.33 apenas pela saída (65k tokens a $5/M). Compare isso com modelos com preços de saída mais baixos ou janelas de contexto menores. Além disso, entradas multimodais podem ser caras se exigirem muitos tokens (por exemplo, imagens de alta resolução ou vídeos longos). Considere a compressão de tokens ou o uso de resolução mais baixa quando possível.
Atualmente, o OrcaRouter aplica a taxa do provedor sem margem de lucro. Não há cache embutido que reduza o custo para prefixos de prompt repetidos, pois é um proxy de passagem. No entanto, você pode implementar o cache no nível da aplicação: se reutilizar contextos de entrada idênticos (por exemplo, prompts de sistema estáticos ou imagens de referência), armazene a resposta do modelo e reutilize-a, evitando chamadas repetidas à API. Descontos ou preços por volume podem estar disponíveis por meio dos planos empresariais do OrcaRouter; entre em contato com a equipe do OrcaRouter para obter detalhes. O preço padrão se aplica a todo uso, a menos que um acordo especial esteja em vigor.
Use o endpoint padrão de chat completions da OpenAI. Defina o parâmetro 'model' como 'google/gemini-robotics-er-1.6-preview'. A URL base é https://api.orcarouter.ai/v1. Inclua sua chave da API OrcaRouter no cabeçalho Authorization. Para mensagens somente texto, o corpo da requisição é idêntico a uma requisição ChatCompletion da OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Para entradas multimodais, estruture o conteúdo como um array com campos type e data de acordo com o esquema do provedor. O OrcaRouter traduz a requisição para o formato do Google internamente.
A API suporta os mesmos parâmetros que o endpoint /v1/chat/completions da OpenAI: model, messages, max_tokens (até 65536), temperature (0 a 2, padrão 1), top_p (0 a 1, padrão 1), frequency_penalty, presence_penalty, stop sequences, stream (booleano), logprobs e user. Nem todos os parâmetros podem ser eficazes no backend do Google; por exemplo, frequency_penalty e presence_penalty podem ter efeito limitado. Para streaming, defina 'stream: true' para receber respostas token por token. O formato de resposta é semelhante ao da OpenAI, incluindo choices, usage (prompt_tokens, completion_tokens, total_tokens) e id. Consulte a documentação do OrcaRouter para quaisquer substituições de parâmetros específicos do modelo.
Já que o OrcaRouter fornece uma API compatível com a OpenAI, a migração geralmente se resume a alterar a URL base e a chave da API. Substitua 'https://api.openai.com/v1' por 'https://api.orcarouter.ai/v1' e defina o modelo como 'google/gemini-robotics-er-1.6-preview'. Se seu aplicativo usa o cliente Python da OpenAI, atualize o base_url e o api_key. Para entradas multimodais, observe que o formato da OpenAI para imagens usa 'image_url', mas o formato do Google pode exigir nomes de campo diferentes (como 'video_url'). A API do OrcaRouter aceita um superconjunto do esquema multimodal da OpenAI; consulte a documentação deles para a estrutura exata. Teste com uma solicitação simples antes de migrar a lógica complexa.
O Gemini 1.5 Pro é um modelo multimodal de uso geral com um bom equilíbrio entre desempenho e custo. O modelo de pré-visualização para robótica é especializado em robótica e raciocínio corporificado, como sugere seu nome. Enquanto o Gemini 1.5 Pro normalmente suporta até 8.192 tokens de saída, este modelo oferece até 65.536 tokens de saída. Os preços diferem: o Gemini 1.5 Pro custa US$ 1,25 por milhão de tokens de entrada e US$ 5,00 por milhão de tokens de saída (aproximadamente), portanto este modelo é ligeiramente mais barato na entrada, mas igual na saída. No entanto, o modelo de pré-visualização pode ter menos conhecimento geral e mais foco na compreensão do mundo físico. Não há comparações de benchmarks disponíveis; os usuários devem testar em suas próprias tarefas.
GPT-4o é um modelo multimodal da OpenAI com suporte para texto, imagens e áudio (não vídeo) e um limite de saída de 16.384 tokens. O modelo robotics-er tem um contexto de saída muito maior (65.536) e suporta explicitamente entrada de vídeo, o que o GPT-4o não faz nativamente. Diferenças de preço: GPT-4o cobra US$2,50 por milhão de tokens de entrada e US$10,00 por milhão de tokens de saída para uso padrão, tornando o modelo de robótica mais barato por token. No entanto, o GPT-4o é um modelo de produção maduro com extensos benchmarks, enquanto este modelo é uma prévia. Para tarefas específicas de robótica, o modelo do Google pode ser projetado para melhor desempenho, mas sem benchmarks públicos, isso é especulativo.
Os modelos Llama 3 são apenas de texto (ou em breve multimodais) mas disponíveis para auto-hospedagem, o que pode ser mais barato em escala. O modelo robotics-er oferece suporte multimodal nativo (incluindo vídeo e áudio) pronto para uso, o que as alternativas de código aberto podem não fornecer sem componentes adicionais. O preço por token do modelo de pré-visualização pode ser caro para uso em alto volume, enquanto um modelo de código aberto executado em seu próprio hardware tem custos de infraestrutura previsíveis. No entanto, o modelo Google se beneficia de infraestrutura e atualizações em escala de nuvem. Para prototipagem, a facilidade de uso do modelo de pré-visualização (via API) pode superar o custo. Avalie seu custo total de propriedade incluindo tempo de desenvolvimento.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Entrada / 1M tokens | $1.00 |
| Saída / 1M tokens | $5.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/google/gemini-robotics-er-1.6-previewAbrir @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview