El modelo de vista previa multimodal de Google para robótica, que admite entradas de texto, imagen, video y audio con hasta 65,536 tokens de salida.
google/gemini-robotics-er-1.6-preview es un modelo de vista previa de la familia Gemini de Google optimizado para robótica y razonamiento corporal. Es un modelo multimodal que puede procesar entradas…
El modelo está diseñado para el razonamiento multimodal relacionado con la robótica. Puede interpretar imágenes y video para identificar objetos, entornos y acciones humanas. Puede procesar comandos de audio y extraer información del lenguaje hablado. Combinando estas modalidades, puede generar instrucciones para manipulación robótica, navegación o interacción. Por ejemplo, dado un video de una cocina y una solicitud hablada para "traer la manzana del mostrador", el modelo puede generar una secuencia de acciones. El gran contexto de salida le permite producir planes detallados o código para controladores robóticos. Tenga en cuenta que el rendimiento del modelo en estas tareas aún no está evaluado públicamente para esta versión de vista previa.
Si su aplicación no requiere entradas multimodales (por ejemplo, solo usa texto), un modelo más pequeño solo de texto sería más rentable. El modelo robotics-er tiene un precio relativamente alto para tokens de entrada ($1.00 por millón) en comparación con muchos modelos de uso general. Para responder preguntas simples o generar texto sin contexto visual o de audio, considere usar un modelo más ligero disponible a través de OrcaRouter, como Gemini 1.5 Flash o un modelo de código abierto más pequeño. Además, si no es necesario el máximo de salida de 65,536 tokens, un modelo con un contexto de salida más pequeño puede ofrecer menor latencia y costo. Evalúe si las capacidades multimodales justifican el precio para su caso de uso.
El límite de salida de 65,536 tokens es particularmente valioso para generar contenido de formato largo, como secuencias de movimiento robótico (por ejemplo, código Python usando ROS o bibliotecas de control), descripciones detalladas del entorno para reconstrucción 3D, o planes de tareas de varios pasos que requieren un razonamiento extenso. También se puede utilizar para aprendizaje en contexto, donde al modelo se le proporcionan muchos ejemplos dentro de un solo prompt y se espera que genere una salida completa. Para la investigación en robótica, esto permite generar planes de largo alcance que cubren muchas contingencias posibles. Sin embargo, tenga en cuenta que las salidas más largas aumentan el costo y la latencia, por lo que considere si una respuesta más corta sería suficiente.
Las entradas de audio y video se procesan como parte del prompt multimodal. Cuando envías un video, el modelo probablemente lo trata como una secuencia de fotogramas o utiliza un codificador de comprensión de video (los métodos exactos son internos de Google). El audio se puede incluir como una URL a un archivo de audio. El modelo puede transcribir o comprender comandos hablados y generar respuestas de texto en consecuencia. La calidad del procesamiento de audio y video depende del muestreo y formato compatibles con la API Gemini de Google; consulta la documentación del proveedor para conocer los tipos de archivo compatibles y las duraciones máximas. OrcaRouter simplemente retransmite la entrada en el formato compatible con OpenAI.
Como versión preliminar, Google no ha publicado puntuaciones de referencia específicas para el modelo gemini-robotics-er-1.6-preview. Los modelos generales de Gemini 1.6 han demostrado un rendimiento sólido en tareas multimodales, pero esta variante específica para robótica puede tener fortalezas diferentes. Los usuarios deben evaluar el rendimiento del modelo en sus propias tareas específicas del dominio antes de confiar en él. OrcaRouter no proporciona cifras de referencia más allá de lo que publica el proveedor. Para obtener fiabilidad en el mundo real, realice pruebas A/B con sus propios datos y compare la latencia, precisión y costo con otros modelos.
La latencia de google/gemini-robotics-er-1.6-preview no está especificada por el proveedor. En general, los modelos multimodales que procesan video y audio tienden a tener una latencia mayor que los modelos solo de texto debido a la sobrecarga de codificación. Además, el gran contexto de salida puede aumentar el tiempo de respuesta, especialmente para generaciones largas. La latencia real depende del tamaño de la solicitud, la complejidad y la carga del servidor tanto en la infraestructura de Google como en el proxy de OrcaRouter. Para obtener el mejor rendimiento, minimice los datos de entrada innecesarios y establezca un max_tokens adecuado. La API de OrcaRouter devuelve encabezados de tiempo estándar; monitorearlos le proporcionará datos empíricos para su caso de uso.
La principal fortaleza del modelo es su soporte para múltiples modalidades de entrada (texto, imagen, video, audio) combinado con un contexto de salida excepcionalmente grande de hasta 65,536 tokens. Esto lo hace muy adecuado para tareas complejas de robótica que requieren comprender información visual y auditiva, además de generar planes extensos y ricos en detalles. Su naturaleza de vista previa sugiere que es uno de los primeros modelos Gemini ajustados para razonamiento incorporado. Otra fortaleza es el acceso directo a través de la API compatible con OpenAI de OrcaRouter, lo que reduce la barrera de integración para los equipos familiarizados con la interfaz de OpenAI.
Como modelo de vista previa, su estabilidad y rendimiento pueden no coincidir con los modelos listos para producción. La falta de puntos de referencia publicados significa que su precisión en tareas robóticas estándar es desconocida. Puede tener tasas de fallo más altas o comportamientos inesperados en comparación con modelos establecidos. El modelo no genera imágenes ni salidas de audio, solo texto. El precio por token de salida es relativamente alto ($5.00 por millón) en comparación con muchos modelos. Además, el amplio contexto de salida puede fomentar respuestas extensas que no siempre son necesarias. Los usuarios deben prototipar exhaustivamente antes de comprometerse con este modelo para cualquier aplicación seria.
La facturación para google/gemini-robotics-er-1.6-preview en OrcaRouter es sencilla: $1.00 por 1 millón de tokens de entrada y $5.00 por 1 millón de tokens de salida. Tanto los tokens de entrada como los de salida se cuentan según la tokenización de Google, que puede diferir de otros modelos. OrcaRouter cobra la tarifa exacta del proveedor sin margen adicional. No hay tarifas adicionales por el servicio de proxy API. El costo se basa en el número total de tokens procesados en la solicitud y la respuesta, incluyendo los tokens de entrada multimodales (por ejemplo, los parches de imagen pueden contarse como tokens). Siempre verifique el uso devuelto en la respuesta de la API para realizar un seguimiento de los costos.
El costo de salida ($5.00 por millón) es significativamente más alto que el costo de entrada ($1.00 por millón). Esto significa que hacer que el modelo genere respuestas largas aumenta el costo mucho más que proporcionar una entrada más larga. Para casos de uso donde la longitud de salida pueda mantenerse corta (por ejemplo, un comando de una sola oración), el costo puede ser aceptable. Sin embargo, si aprovechas el contexto completo de salida de 65,536 tokens, una sola solicitud podría costar hasta $0.33 solo por la salida (65k tokens a $5/M). Compáralo con modelos que tienen precios de salida más bajos o ventanas de contexto más pequeñas. Además, las entradas multimodales pueden ser costosas si requieren muchos tokens (por ejemplo, imágenes de alta resolución o videos largos). Considera la compresión de tokens o usar menor resolución cuando sea posible.
OrcaRouter actualmente aplica la tarifa del proveedor con margen cero. No hay un caché integrado que reduzca el costo para prefijos de indicación repetidos, ya que es un proxy de paso. Sin embargo, puede implementar el almacenamiento en caché a nivel de aplicación: si reutiliza contextos de entrada idénticos (p. ej., indicaciones de sistema estáticas o imágenes de referencia), almacene la respuesta del modelo y reutilícela, evitando llamadas repetidas a la API. Es posible que haya descuentos o precios por volumen disponibles a través de los planes empresariales de OrcaRouter; contacte al equipo de OrcaRouter para obtener más detalles. Se aplican tarifas estándar a todo el uso, a menos que se haya acordado un acuerdo especial.
Utilice el endpoint estándar de chat completions de OpenAI. Establezca el parámetro 'model' en 'google/gemini-robotics-er-1.6-preview'. La URL base es https://api.orcarouter.ai/v1. Incluya su clave API de OrcaRouter en el encabezado Authorization. Para mensajes de solo texto, el cuerpo de la solicitud es idéntico a una solicitud de ChatCompletion de OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Para entradas multimodales, estructure el contenido como un arreglo con campos de tipo y datos según el esquema del proveedor. OrcaRouter traduce la solicitud al formato de Google internamente.
La API admite los mismos parámetros que el endpoint /v1/chat/completions de OpenAI: model, messages, max_tokens (hasta 65536), temperature (0 a 2, predeterminado 1), top_p (0 a 1, predeterminado 1), frequency_penalty, presence_penalty, stop sequences, stream (booleano), logprobs y user. No todos los parámetros pueden ser efectivos en el backend de Google; por ejemplo, frequency_penalty y presence_penalty pueden tener un efecto limitado. Para streaming, establece 'stream: true' para recibir respuestas token por token. El formato de respuesta es similar al de OpenAI, incluyendo choices, usage (prompt_tokens, completion_tokens, total_tokens) e id. Consulta la documentación de OrcaRouter para cualquier anulación de parámetros específica del modelo.
Dado que OrcaRouter proporciona una API compatible con OpenAI, la migración generalmente consiste en cambiar la URL base y la clave de API. Reemplace 'https://api.openai.com/v1' por 'https://api.orcarouter.ai/v1' y configure el modelo en 'google/gemini-robotics-er-1.6-preview'. Si su aplicación usa el cliente de Python de OpenAI, actualice base_url y api_key. Para entradas multimodales, tenga en cuenta que el formato de OpenAI para imágenes usa 'image_url', pero el formato de Google puede requerir nombres de campo diferentes (como 'video_url'). La API de OrcaRouter acepta un superconjunto del esquema multimodal de OpenAI; consulte su documentación para conocer la estructura exacta. Pruebe con una solicitud simple antes de migrar lógica compleja.
Gemini 1.5 Pro es un modelo multimodal de propósito general con un buen equilibrio entre rendimiento y costo. El modelo de vista previa robotics-er está especializado en robótica y razonamiento corporeizado, como sugiere su nombre. Mientras que Gemini 1.5 Pro admite hasta 8,192 tokens de salida típicamente, este modelo ofrece hasta 65,536 tokens de salida. Los precios difieren: Gemini 1.5 Pro cuesta aproximadamente $1.25 por millón de tokens de entrada y $5.00 por millón de tokens de salida, por lo que este modelo es ligeramente más barato en entrada pero igual en salida. Sin embargo, el modelo de vista previa puede tener menos conocimiento general y más enfoque en la comprensión del mundo físico. No hay comparaciones de referencia disponibles; los usuarios deben probar en sus propias tareas.
GPT-4o es un modelo multimodal de OpenAI con soporte para texto, imágenes y audio (sin video) y un límite de salida de 16 384 tokens. El modelo robotics-er tiene un contexto de salida mucho más grande (65 536) y admite explícitamente entrada de video, algo que GPT-4o no hace de forma nativa. Diferencias de precio: GPT-4o cobra $2.50 por millón de tokens de entrada y $10.00 por millón de tokens de salida para uso estándar, lo que hace que el modelo robotics sea más barato por token. Sin embargo, GPT-4o es un modelo de producción maduro con amplios benchmarks, mientras que este modelo es una vista previa. Para tareas específicas de robótica, el modelo de Google podría estar diseñado para un mejor rendimiento, pero sin benchmarks públicos, esto es especulativo.
Los modelos Llama 3 son solo texto (o pronto multimodales) pero están disponibles para autoalojamiento, lo que puede ser más barato a escala. El modelo robotics-er ofrece soporte multimodal nativo (incluyendo video y audio) de fábrica, lo que las alternativas de código abierto pueden no proporcionar sin componentes adicionales. El precio por token del modelo de vista previa puede ser costoso para uso de alto volumen, mientras que un modelo de código abierto ejecutado en su propio hardware tiene costos de infraestructura predecibles. Sin embargo, el modelo Google se beneficia de la infraestructura a escala de nube y las actualizaciones. Para prototipado, la facilidad de uso del modelo de vista previa (a través de API) puede superar el costo. Evalúe su costo total de propiedad, incluyendo el tiempo de desarrollo.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Entrada / 1M tokens | $1.00 |
| Salida / 1M tokens | $5.00 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/google/gemini-robotics-er-1.6-previewAbrir @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview