Googles multimodales Vorschaumodell für Robotik, das Text-, Bild-, Video- und Audioeingaben mit bis zu 65.536 Ausgabetoken unterstützt.
google/gemini-robotics-er-1.6-preview ist ein Vorschaumodell aus Googles Gemini-Familie, optimiert für Robotik und verkörperte Argumentation. Es ist ein multimodales Modell, das Text, Bilder, Video-…
Das Modell ist für robotikbezogenes multimodales Denken ausgelegt. Es kann Bilder und Videos interpretieren, um Objekte, Umgebungen und menschliche Handlungen zu identifizieren. Es kann Audiobefehle verarbeiten und Informationen aus gesprochener Sprache extrahieren. Durch die Kombination dieser Modalitäten kann es Anweisungen für robotische Manipulation, Navigation oder Interaktion generieren. Zum Beispiel kann das Modell bei einem Video einer Küche und einer gesprochenen Aufforderung, 'den Apfel von der Theke zu holen', eine Abfolge von Aktionen ausgeben. Der große Ausgabekontext ermöglicht es dem Modell, detaillierte Pläne oder Code für Robotercontroller zu erstellen. Beachten Sie, dass die Leistung des Modells bei diesen Aufgaben für diese Vorschauversion noch nicht öffentlich bewertet wurde.
Wenn Ihre Anwendung keine multimodalen Eingaben erfordert (z. B. verwenden Sie nur Text), wäre ein kleineres reines Textmodell kosteneffizienter. Das robotics-er-Modell ist mit 1,00 $ pro Million Eingabe-Tokens relativ teuer im Vergleich zu vielen Allzweckmodellen. Für einfache Frage-Antwort-Aufgaben oder Textgenerierung ohne visuellen oder audiologischen Kontext sollten Sie ein leichteres Modell in Betracht ziehen, das über OrcaRouter verfügbar ist, wie z. B. Gemini 1.5 Flash oder ein kleineres Open-Source-Modell. Falls außerdem die maximale Ausgabe von 65.536 Tokens nicht erforderlich ist, kann ein Modell mit kleinerem Ausgabekontext geringere Latenz und Kosten bieten. Bewerten Sie, ob die multimodalen Fähigkeiten den Preis für Ihren Anwendungsfall rechtfertigen.
Die Begrenzung der Ausgabe auf 65.536 Token ist besonders wertvoll für die Generierung von Langform-Inhalten wie robotischen Bewegungsabläufen (z. B. Python-Code mit ROS oder Steuerungsbibliotheken), detaillierten Umgebungsbeschreibungen für die 3D-Rekonstruktion oder mehrstufigen Aufgabenplänen, die umfangreiches Denken erfordern. Sie kann auch für das In-Context-Lernen verwendet werden, bei dem dem Modell viele Beispiele in einer einzigen Eingabeaufforderung gegeben werden und erwartet wird, dass es eine umfassende Ausgabe liefert. Für die Robotikforschung ermöglicht dies die Generierung langfristiger Pläne, die viele mögliche Eventualitäten abdecken. Beachten Sie jedoch, dass längere Ausgaben die Kosten und die Latenz erhöhen. Überlegen Sie daher, ob eine kürzere Antwort ausreichen würde.
Audio- und Videoeingaben werden als Teil des multimodalen Prompts verarbeitet. Wenn Sie ein Video senden, behandelt das Modell es wahrscheinlich als eine Sequenz von Frames oder verwendet einen Video-Encoder (die genauen Methoden sind intern bei Google). Audio kann als URL zu einer Audiodatei eingefügt werden. Das Modell kann gesprochene Befehle transkribieren oder verstehen und entsprechende Textantworten generieren. Die Qualität der Audio- und Videoverarbeitung hängt von der Abtastrate und dem Format ab, das von der Google Gemini API unterstützt wird; konsultieren Sie die Anbieterdokumentation für unterstützte Dateitypen und maximale Dauern. OrcaRouter gibt die Eingabe einfach im OpenAI-kompatiblen Format weiter.
Als Vorabversion hat Google keine spezifischen Benchmark-Ergebnisse für das Modell gemini-robotics-er-1.6-preview veröffentlicht. Allgemeine Gemini 1.6-Modelle haben starke Leistungen bei multimodalen Aufgaben gezeigt, aber diese robotikspezifische Variante könnte andere Stärken haben. Benutzer sollten die Leistung des Modells anhand ihrer eigenen domänenspezifischen Aufgaben bewerten, bevor sie sich darauf verlassen. OrcaRouter stellt keine Benchmark-Zahlen zur Verfügung, die über das hinausgehen, was der Anbieter veröffentlicht. Für die Zuverlässigkeit in der Praxis führen Sie A/B-Tests mit Ihren eigenen Daten durch und vergleichen Sie Latenz, Genauigkeit und Kosten mit anderen Modellen.
Die Latenz für google/gemini-robotics-er-1.6-preview wird vom Anbieter nicht angegeben. Im Allgemeinen haben multimodale Modelle, die Video und Audio verarbeiten, aufgrund des Kodierungs-Overheads eine höhere Latenz als reine Textmodelle. Zusätzlich kann der große Ausgabekontext die Antwortzeit erhöhen, insbesondere bei langen Generierungen. Die tatsächliche Latenz hängt von der Anfragegröße, der Komplexität und der Serverlast sowohl auf der Infrastruktur von Google als auch auf dem Proxy von OrcaRouter ab. Für beste Leistung minimieren Sie unnötige Eingabedaten und setzen Sie geeignete max_tokens. Die API von OrcaRouter gibt standardmäßige Timing-Header zurück; die Überwachung dieser liefert Ihnen empirische Daten für Ihren Anwendungsfall.
Die Hauptstärke des Modells ist die Unterstützung mehrerer Eingabemodalitäten (Text, Bild, Video, Audio) in Kombination mit einem außergewöhnlich großen Ausgabekontext von bis zu 65.536 Tokens. Dies macht es gut geeignet für komplexe Robotikaufgaben, die sowohl visuelle als auch auditive Informationen verstehen und umfangreiche, detailreiche Pläne erstellen müssen. Der Vorschau-Charakter deutet darauf hin, dass es eines der ersten Gemini-Modelle ist, die für verkörpertes Denken (embodied reasoning) feinabgestimmt wurden. Eine weitere Stärke ist der unkomplizierte Zugang über die OpenAI-kompatible API von OrcaRouter, was die Integrationshürde für Teams senkt, die mit der OpenAI-Schnittstelle vertraut sind.
Als Vorschaumodell können Stabilität und Leistung möglicherweise nicht mit produktionsreifen Modellen mithalten. Das Fehlen veröffentlichter Benchmarks bedeutet, dass seine Genauigkeit bei standardmäßigen Robotikaufgaben unbekannt ist. Es kann im Vergleich zu etablierten Modellen höhere Ausfallraten oder unerwartetes Verhalten aufweisen. Das Modell erzeugt keine Bilder oder Audioausgaben, sondern nur Text. Die Preise pro Ausgabetoken sind mit 5,00 $ pro Million im Vergleich zu vielen Modellen relativ hoch. Darüber hinaus kann der große Ausgabekontext zu ausführlichen Antworten führen, die nicht immer notwendig sind. Benutzer sollten vor der Verwendung dieses Modells für ernsthafte Anwendungen umfangreiche Prototypen erstellen.
Die Abrechnung für google/gemini-robotics-er-1.6-preview auf OrcaRouter ist unkompliziert: $1,00 pro 1 Million Eingabe-Token und $5,00 pro 1 Million Ausgabe-Token. Weiterhin werden sowohl Eingabe- als auch Ausgabe-Token gemäß der Tokenisierung von Google gezählt, die von anderen Modellen abweichen kann. OrcaRouter berechnet den exakten Anbieterpreis ohne Aufschlag. Es fallen keine zusätzlichen Gebühren für den API-Proxy-Dienst an. Die Kosten basieren auf der Gesamtzahl der in der Anfrage und Antwort verarbeiteten Token, einschließlich multimodaler Eingabe-Token (z. B. können Bildausschnitte als Token gezählt werden). Überprüfen Sie stets die in der API-Antwort zurückgegebene Nutzung, um die Kosten zu verfolgen.
Die Kosten für Ausgabe-Token ($5.00 pro Million) sind deutlich höher als die Kosten für Eingabe-Token ($1.00 pro Million). Das bedeutet, dass das Modell lange Antworten generieren zu lassen die Kosten weit mehr erhöht als die Bereitstellung längerer Eingaben. Für Anwendungsfälle, bei denen die Ausgabelänge kurz gehalten werden kann (z. B. ein Befehl mit einem Satz), können die Kosten akzeptabel sein. Wenn Sie jedoch den gesamten Ausgabekontext von 65.536 Token nutzen, könnte eine einzelne Anfrage allein für die Ausgabe bis zu $0.33 kosten (65k Token bei $5/M). Vergleichen Sie dies mit Modellen mit niedrigeren Ausgabepreisen oder kleineren Kontextfenstern. Auch multimodale Eingaben können teuer sein, wenn sie viele Token erfordern (z. B. hochauflösende Bilder oder lange Videos). Erwägen Sie Token-Kompression oder die Verwendung niedrigerer Auflösung, wenn möglich.
OrcaRouter wendet derzeit den Anbietertarif ohne Aufschlag an. Es gibt kein integriertes Caching, das die Kosten für wiederholte Prompt-Präfixe senkt, da es sich um einen Durchgangsproxy handelt. Sie können jedoch Caching auf Anwendungsebene implementieren: Wenn Sie identische Eingabekontexte wiederverwenden (z. B. statische System-Prompts oder Referenzbilder), speichern Sie die Antwort des Modells und verwenden Sie sie erneut, um wiederholte API-Aufrufe zu vermeiden. Rabatte oder Mengenpreise sind möglicherweise über die Enterprise-Pläne von OrcaRouter verfügbar; wenden Sie sich an das OrcaRouter-Team für Details. Sofern keine Sondervereinbarung getroffen wurde, gelten die Standardpreise für die gesamte Nutzung.
Verwenden Sie den standardmäßigen OpenAI Chat Completions Endpunkt. Setzen Sie den 'model'-Parameter auf 'google/gemini-robotics-er-1.6-preview'. Die Basis-URL lautet https://api.orcarouter.ai/v1. Fügen Sie Ihren OrcaRouter-API-Schlüssel in den Authorization-Header ein. Bei reinen Textnachrichten ist der Anfragekörper identisch mit einer OpenAI ChatCompletion-Anfrage: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Für multimodale Eingaben strukturieren Sie den Inhalt als Array mit Typ- und Datenfeldern gemäß dem Provider-Schema. OrcaRouter übersetzt die Anfrage intern in das Google-Format.
Die API unterstützt dieselben Parameter wie der OpenAI /v1/chat/completions-Endpunkt: model, messages, max_tokens (bis zu 65536), temperature (0 bis 2, Standard 1), top_p (0 bis 1, Standard 1), frequency_penalty, presence_penalty, Stop-Sequenzen, stream (boolesch), logprobs und user. Nicht alle Parameter sind auf Googles Backend wirksam; zum Beispiel können frequency_penalty und presence_penalty nur begrenzt wirken. Für Streaming setzen Sie 'stream: true', um tokenweise Antworten zu erhalten. Das Antwortformat spiegelt das von OpenAI wider, einschließlich choices, usage (prompt_tokens, completion_tokens, total_tokens) und id. Überprüfen Sie die OrcaRouter-Dokumentation auf etwaige modellspezifische Parameterüberschreibungen.
Da OrcaRouter eine OpenAI-kompatible API bereitstellt, besteht die Migration in der Regel darin, die Basis-URL und den API-Schlüssel zu ändern. Ersetzen Sie 'https://api.openai.com/v1' durch 'https://api.orcarouter.ai/v1' und setzen Sie das Modell auf 'google/gemini-robotics-er-1.6-preview'. Falls Ihre App den OpenAI Python-Client verwendet, aktualisieren Sie base_url und api_key. Bei multimodalen Eingaben ist zu beachten, dass das OpenAI-Format für Bilder 'image_url' verwendet, während das Google-Format möglicherweise andere Feldnamen erfordert (wie 'video_url'). Die API von OrcaRouter akzeptiert eine Obermenge des multimodalen Schemas von OpenAI; konsultieren Sie deren Dokumentation für die genaue Struktur. Testen Sie mit einer einfachen Anfrage, bevor Sie komplexe Logik migrieren.
Gemini 1.5 Pro ist ein universelles multimodales Modell mit einer ausgewogenen Mischung aus Leistung und Kosten. Das Robotics-er Vorschaumodell ist, wie der Name schon sagt, auf Robotik und verkörperte Schlussfolgerungen spezialisiert. Während Gemini 1.5 Pro normalerweise bis zu 8.192 Ausgabetoken unterstützt, bietet dieses Modell bis zu 65.536 Ausgabetoken. Die Preisgestaltung unterscheidet sich: Gemini 1.5 Pro kostet ca. 1,25 $ pro Million Eingabetoken und 5,00 $ pro Million Ausgabetoken, daher ist dieses Modell beim Eingang etwas günstiger, aber beim Ausgang gleich. Allerdings verfügt das Vorschaumodell möglicherweise über weniger allgemeines Wissen und ist stärker auf das Verständnis der physischen Welt fokussiert. Benchmark-Vergleiche sind nicht verfügbar; Nutzer sollten anhand ihrer eigenen Aufgaben testen.
GPT-4o ist ein multimodales Modell von OpenAI mit Unterstützung für Text, Bilder und Audio (nicht Video) und einem Ausgabelimit von 16.384 Token. Das Robotik-Modell hat einen viel größeren Ausgabekontext (65.536) und unterstützt explizit Videoeingabe, was GPT-4o nicht nativ tut. Preisunterschiede: GPT-4o verlangt 2,50 $ pro Million Eingabe- und 10,00 $ pro Million Ausgabe-Token für die Standardnutzung, was das Robotik-Modell pro Token günstiger macht. Allerdings ist GPT-4o ein ausgereiftes Produktionsmodell mit umfangreichen Benchmarks, während dieses Modell eine Vorschau ist. Für robotikspezifische Aufgaben könnte das Google-Modell für eine bessere Leistung ausgelegt sein, aber ohne öffentliche Benchmarks ist dies spekulativ.
Llama 3 Modelle sind rein textbasiert (oder bald multimodal) aber zur Selbsthostung verfügbar, was in großem Maßstab günstiger sein kann. Das Robotics-er-Modell bietet native multimodale Unterstützung (einschließlich Video und Audio) direkt aus der Box, was Open-Source-Alternativen möglicherweise ohne zusätzliche Komponenten nicht bieten. Die Preise pro Token des Vorschau-Modells können bei hohem Volumen teuer sein, während ein Open-Source-Modell, das auf eigener Hardware läuft, vorhersehbare Infrastrukturkosten hat. Das Google-Modell profitiert jedoch von cloud-skalierbarer Infrastruktur und Updates. Für das Prototyping kann die Benutzerfreundlichkeit des Vorschau-Modells (über API) die Kosten überwiegen. Bewerten Sie Ihre Gesamtbetriebskosten einschließlich der Entwicklungszeit.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Eingabe / 1M Tokens | $1.00 |
| Ausgabe / 1M Tokens | $5.00 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/google/gemini-robotics-er-1.6-previewÖffnen @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview