Le modèle multimodal de prévisualisation de Google pour la robotique, prenant en charge les entrées de texte, d'image, de vidéo et audio avec jusqu'à 65 536 tokens de sortie.
google/gemini-robotics-er-1.6-preview est un modèle d'aperçu de la famille Gemini de Google, optimisé pour la robotique et le raisonnement incarné. Il s'agit d'un modèle multimodal capable de traiter…
Le modèle est conçu pour le raisonnement multimodal lié à la robotique. Il peut interpréter des images et des vidéos pour identifier des objets, des environnements et des actions humaines. Il peut traiter des commandes audio et extraire des informations du langage parlé. En combinant ces modalités, il peut générer des instructions pour la manipulation robotique, la navigation ou l'interaction. Par exemple, étant donné une vidéo d'une cuisine et une demande orale de 'va chercher la pomme sur le comptoir', le modèle peut produire une séquence d'actions. Le grand contexte de sortie lui permet de produire des plans détaillés ou du code pour les contrôleurs de robots. Notez que les performances du modèle sur ces tâches ne sont pas encore évaluées publiquement pour cette version préliminaire.
Si votre application ne nécessite pas d'entrées multimodales (par exemple, vous utilisez uniquement du texte), un modèle texte seul plus petit serait plus rentable. Le modèle robotics-er est relativement cher pour les tokens d'entrée ($1.00 par million) par rapport à de nombreux modèles à usage général. Pour des réponses simples à des questions ou la génération de texte sans contexte visuel ou audio, envisagez d'utiliser un modèle plus léger disponible via OrcaRouter, comme Gemini 1.5 Flash ou un modèle open-source plus petit. De plus, si la sortie maximale de 65,536 tokens n'est pas nécessaire, un modèle avec un contexte de sortie plus petit peut offrir une latence et un coût réduits. Évaluez si les capacités multimodales justifient le prix pour votre cas d'utilisation.
La limite de sortie de 65 536 tokens est particulièrement utile pour générer du contenu de longue forme tel que des séquences de mouvement robotique (par exemple, du code Python utilisant ROS ou des bibliothèques de contrôle), des descriptions détaillées d'environnement pour la reconstruction 3D, ou des plans de tâches en plusieurs étapes nécessitant un raisonnement approfondi. Elle peut également être utilisée pour l'apprentissage en contexte, où le modèle reçoit de nombreux exemples dans une même invite et doit produire une sortie complète. Pour la recherche en robotique, cela permet de générer des plans à long horizon couvrant de nombreuses éventualités. Cependant, notez que des sorties plus longues augmentent le coût et la latence, alors réfléchissez si une réponse plus courte ne suffirait pas.
Les entrées audio et vidéo sont traitées dans le cadre de l'invite multimodale. Lorsque vous envoyez une vidéo, le modèle la traite probablement comme une séquence d'images ou utilise un encodeur de compréhension vidéo (les méthodes exactes sont internes à Google). L'audio peut être inclus sous forme d'URL vers un fichier audio. Le modèle peut transcrire ou comprendre des commandes vocales et générer des réponses textuelles en conséquence. La qualité du traitement audio et vidéo dépend de l'échantillonnage et du format pris en charge par l'API Gemini de Google ; consultez la documentation du fournisseur pour connaître les types de fichiers et les durées maximales pris en charge. OrcaRouter relaie simplement l'entrée dans un format compatible OpenAI.
En tant que version préliminaire, Google n'a pas publié de scores de benchmark spécifiques pour le modèle gemini-robotics-er-1.6-preview. Les modèles généraux Gemini 1.6 ont montré de bonnes performances sur les tâches multimodales, mais cette variante spécifique à la robotique peut avoir des atouts différents. Les utilisateurs doivent évaluer les performances du modèle sur leurs propres tâches spécifiques avant de s'y fier. OrcaRouter ne fournit pas de chiffres de benchmark au-delà de ce que le fournisseur publie. Pour une fiabilité dans le monde réel, effectuez des tests A/B avec vos propres données et comparez la latence, la précision et le coût par rapport à d'autres modèles.
La latence pour google/gemini-robotics-er-1.6-preview n'est pas spécifiée par le fournisseur. En général, les modèles multimodaux qui traitent la vidéo et l'audio ont tendance à avoir une latence plus élevée que les modèles textuels en raison du surcoût de codage. De plus, le grand contexte de sortie peut augmenter le temps de réponse, surtout pour les générations longues. La latence réelle dépend de la taille de la requête, de sa complexité et de la charge du serveur à la fois sur l'infrastructure de Google et le proxy d'OrcaRouter. Pour de meilleures performances, minimisez les données d'entrée inutiles et définissez un max_tokens approprié. L'API d'OrcaRouter renvoie des en-têtes de timing standard ; leur surveillance vous donnera des données empiriques pour votre cas d'utilisation.
Le principal atout du modèle est sa prise en charge de multiples modalités d'entrée (texte, image, vidéo, audio) combinée à un contexte de sortie exceptionnellement large pouvant atteindre 65 536 tokens. Cela le rend particulièrement adapté aux tâches robotiques complexes nécessitant la compréhension à la fois des informations visuelles et auditives, ainsi que la génération de plans détaillés et riches. Son caractère préliminaire suggère qu'il fait partie des premiers modèles Gemini affinés pour le raisonnement incarné. Un autre atout est l'accès simple via l'API compatible OpenAI d'OrcaRouter, ce qui abaisse la barrière d'intégration pour les équipes familières avec l'interface d'OpenAI.
En tant que modèle d'aperçu, sa stabilité et ses performances peuvent ne pas correspondre à celles des modèles prêts pour la production. L'absence de benchmarks publiés signifie que son exactitude sur les tâches robotiques standard est inconnue. Il peut présenter des taux d'échec plus élevés ou des comportements inattendus par rapport aux modèles établis. Le modèle ne génère pas d'images ni de sorties audio, uniquement du texte. Le prix par token de sortie est relativement élevé ($5.00 per million) comparé à de nombreux modèles. De plus, le grand contexte de sortie peut encourager des réponses verbeuses qui ne sont pas toujours nécessaires. Les utilisateurs devraient prototyper de manière extensive avant de s'engager sur ce modèle pour toute application sérieuse.
La facturation pour google/gemini-robotics-er-1.6-preview sur OrcaRouter est simple : 1,00 $ par million de tokens d’entrée et 5,00 $ par million de tokens de sortie. Les tokens d’entrée et de sortie sont comptés selon la tokenisation de Google, qui peut différer de celle d’autres modèles. OrcaRouter facture exactement le tarif du fournisseur sans aucune majoration. Il n’y a pas de frais supplémentaires pour le service de proxy API. Le coût est basé sur le nombre total de tokens traités dans la requête et la réponse, y compris les tokens d’entrée multimodaux (par exemple, les vignettes d’image peuvent être comptées comme des tokens). Vérifiez toujours l’utilisation renvoyée dans la réponse de l’API pour suivre les coûts.
Le coût des tokens de sortie (5,00 $ par million) est nettement plus élevé que le coût des tokens d'entrée (1,00 $ par million). Cela signifie que faire générer des réponses longues par le modèle augmente bien plus le coût que de fournir une entrée plus longue. Pour les cas d'usage où la longueur de la sortie peut être réduite (par exemple, une commande d'une phrase), le coût peut être acceptable. Cependant, si vous utilisez la totalité des 65 536 tokens de contexte de sortie, une seule requête peut coûter jusqu'à 0,33 $ rien que pour la sortie (65k tokens à 5 $/M). Comparez cela avec des modèles ayant un tarif de sortie inférieur ou des fenêtres de contexte plus petites. De plus, les entrées multimodales peuvent être coûteuses si elles nécessitent beaucoup de tokens (par exemple, des images haute résolution ou des longues vidéos). Envisagez la compression des tokens ou l'utilisation d'une résolution plus faible lorsque cela est possible.
OrcaRouter applique actuellement le tarif du fournisseur sans marge bénéficiaire. Il n'y a pas de mise en cache intégrée qui réduit le coût pour les préfixes de prompt répétés, car il s'agit d'un proxy de transit. Cependant, vous pouvez implémenter la mise en cache au niveau de l'application : si vous réutilisez des contextes d'entrée identiques (par exemple, des invites système statiques ou des images de référence), stockez la réponse du modèle et réutilisez-la, évitant ainsi des appels API répétés. Des remises ou des tarifs basés sur le volume peuvent être disponibles via les plans entreprise d'OrcaRouter ; contactez l'équipe OrcaRouter pour plus de détails. La tarification standard s'applique à toute utilisation, sauf accord spécial en place.
Utilisez le point de terminaison standard des complétions OpenAI. Définissez le paramètre 'model' sur 'google/gemini-robotics-er-1.6-preview'. L'URL de base est https://api.orcarouter.ai/v1. Incluez votre clé API OrcaRouter dans l'en-tête Authorization. Pour les messages textuels uniquement, le corps de la requête est identique à une requête ChatCompletion OpenAI : { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Pour les entrées multimodales, structurez le contenu sous forme de tableau avec les champs type et data selon le schéma du fournisseur. OrcaRouter traduit la requête en interne au format Google.
L'API prend en charge les mêmes paramètres que le endpoint /v1/chat/completions d'OpenAI : model, messages, max_tokens (jusqu'à 65536), temperature (de 0 à 2, par défaut 1), top_p (de 0 à 1, par défaut 1), frequency_penalty, presence_penalty, stop sequences, stream (booléen), logprobs et user. Tous les paramètres ne sont pas nécessairement effectifs sur le backend de Google ; par exemple, frequency_penalty et presence_penalty peuvent avoir un effet limité. Pour le streaming, définissez 'stream: true' pour recevoir les réponses token par token. Le format de réponse est le même que celui d'OpenAI, incluant choices, usage (prompt_tokens, completion_tokens, total_tokens) et id. Consultez la documentation d'OrcaRouter pour toute surcharge de paramètres spécifiques au modèle.
Puisqu'OrcaRouter fournit une API compatible OpenAI, la migration consiste généralement à modifier l'URL de base et la clé API. Remplacez 'https://api.openai.com/v1' par 'https://api.orcarouter.ai/v1' et définissez le modèle sur 'google/gemini-robotics-er-1.6-preview'. Si votre application utilise le client OpenAI Python, mettez à jour base_url et api_key. Pour les entrées multimodales, notez que le format OpenAI pour les images utilise 'image_url', mais le format de Google peut nécessiter des noms de champs différents (comme 'video_url'). L'API d'OrcaRouter accepte un sur-ensemble du schéma multimodal d'OpenAI ; référez-vous à leur documentation pour la structure exacte. Testez avec une requête simple avant de migrer une logique complexe.
Gemini 1.5 Pro est un modèle multimodal polyvalent offrant un bon équilibre entre performance et coût. Le modèle d'aperçu robotics-er est spécialisé dans la robotique et le raisonnement incarné, comme son nom l'indique. Alors que Gemini 1.5 Pro prend en charge jusqu'à 8,192 jetons de sortie généralement, ce modèle offre jusqu'à 65,536 jetons de sortie. Les tarifs diffèrent : Gemini 1.5 Pro coûte 1,25 $ par million de jetons d'entrée et 5,00 $ par million de jetons de sortie (approximativement), donc ce modèle est légèrement moins cher à l'entrée mais identique à la sortie. Cependant, le modèle d'aperçu peut avoir moins de connaissances générales et se concentrer davantage sur la compréhension du monde physique. Les comparaisons de référence ne sont pas disponibles ; les utilisateurs doivent tester sur leurs propres tâches.
GPT-4o est un modèle multimodal d'OpenAI prenant en charge le texte, les images et l'audio (non vidéo) avec une limite de sortie de 16 384 tokens. Le modèle robotics-er dispose d'un contexte de sortie beaucoup plus large (65 536) et prend explicitement en charge l'entrée vidéo, ce que GPT-4o ne fait pas nativement. Différences de prix : GPT-4o coûte 2,50 $ par million de tokens d'entrée et 10,00 $ par million de tokens de sortie pour une utilisation standard, ce qui rend le modèle robotics moins cher par token. Cependant, GPT-4o est un modèle de production mature avec des benchmarks étendus, tandis que ce modèle est une version préliminaire. Pour les tâches spécifiques à la robotique, le modèle Google peut être conçu pour de meilleures performances, mais en l'absence de benchmarks publics, cela reste spéculatif.
Les modèles Llama 3 sont uniquement textuels (ou bientôt multimodaux) mais disponibles pour auto-hébergement, ce qui peut être moins cher à grande échelle. Le modèle robotics-er offre un support multimodal natif (y compris vidéo et audio) directement, ce que les alternatives open source peuvent ne pas fournir sans composants supplémentaires. La tarification par jeton du modèle d'aperçu peut être coûteuse pour une utilisation à grand volume, alors qu'un modèle open source exécuté sur votre propre matériel a des coûts d'infrastructure prévisibles. Cependant, le modèle Google bénéficie d'une infrastructure et de mises à jour à l'échelle du cloud. Pour le prototypage, la facilité d'utilisation (via API) du modèle d'aperçu peut l'emporter sur le coût. Évaluez votre coût total de possession, y compris le temps de développement.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Entrée / 1M tokens | $1.00 |
| Sortie / 1M tokens | $5.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/google/gemini-robotics-er-1.6-previewOuvrir @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview