Google's multimodale previewmodel voor robotica, dat tekst, afbeeldingen, video en audio-invoer ondersteunt met maximaal 65.536 uitvoertokens.
google/gemini-robotics-er-1.6-preview is een previewmodel uit Google's Gemini-familie, geoptimaliseerd voor robotica en belichaamde redenering. Het is een multimodaal model dat tekst, afbeeldingen,…
Het model is ontworpen voor robotica-gerelateerde multimodale redenering. Het kan afbeeldingen en video interpreteren om objecten, omgevingen en menselijke acties te identificeren. Het kan audiocommandos verwerken en informatie uit gesproken taal halen. Door deze modaliteiten te combineren, kan het instructies genereren voor robotmanipulatie, navigatie of interactie. Bijvoorbeeld, gegeven een video van een keuken en een gesproken verzoek om 'de appel van het aanrecht te halen,' kan het model een reeks acties uitvoeren. De grote uitvoercontext stelt het in staat om gedetailleerde plannen of code voor robotcontrollers te produceren. Merk op dat de prestaties van het model op deze taken voor deze previewversie nog niet publiekelijk zijn gebenchmarkt.
Als uw toepassing geen multimodale invoer vereist (bijvoorbeeld u gebruikt alleen tekst), is een kleiner tekst-only model kosteneffectiever. Het robotics-er model is relatief duur voor invoertokens ($1,00 per miljoen) vergeleken met veel algemene modellen. Voor eenvoudige vraagbeantwoording of tekstgeneratie zonder visuele of audio-context, overweeg dan een lichter model dat beschikbaar is via OrcaRouter, zoals Gemini 1.5 Flash of een kleiner open-source model. Ook als de maximale uitvoer van 65.536 tokens niet nodig is, kan een model met een kleinere uitvoercontext lagere latentie en kosten bieden. Evalueer of de multimodale mogelijkheden de prijs voor uw gebruikssituatie rechtvaardigen.
De uitvoerlimiet van 65.536 tokens is bijzonder waardevol voor het genereren van langere inhoud, zoals robotbewegingssequenties (bijv. Python-code met ROS of besturingsbibliotheken), gedetailleerde omgevingsbeschrijvingen voor 3D-reconstructie, of meerstappentakenplannen die uitgebreide redenering vereisen. Het kan ook worden gebruikt voor in-context leren, waarbij het model binnen één prompt veel voorbeelden krijgt en een uitgebreide uitvoer wordt verwacht. Voor robotica-onderzoek maakt dit het mogelijk om langetermijnplannen te genereren die veel mogelijke onvoorziene omstandigheden dekken. Houd er echter rekening mee dat langere uitvoer de kosten en latentie verhoogt, dus overweeg of een korter antwoord volstaat.
Audio- en video-ingangen worden verwerkt als onderdeel van de multimodale prompt. Wanneer je een video verzendt, behandelt het model dit waarschijnlijk als een reeks frames of gebruikt het een video-begripsencoder (exacte methoden zijn intern bij Google). Audio kan worden opgenomen als een URL naar een audiobestand. Het model kan gesproken opdrachten transcriberen of begrijpen en dienovereenkomstig tekstreacties genereren. De kwaliteit van audio- en videoverwerking hangt af van de sampling en het formaat dat wordt ondersteund door de Gemini API van Google; raadpleeg de documentatie van de provider voor ondersteunde bestandstypen en maximale duur. OrcaRouter geeft de invoer eenvoudigweg door in het OpenAI-compatibele formaat.
Als een preview-release heeft Google geen specifieke benchmarkscores gepubliceerd voor het gemini-robotics-er-1.6-preview model. Algemene Gemini 1.6 modellen hebben sterke prestaties laten zien op multimodale taken, maar deze robotics-specifieke variant kan andere sterke punten hebben. Gebruikers moeten de prestaties van het model evalueren op hun eigen domeinspecifieke taken voordat ze erop vertrouwen. OrcaRouter biedt geen benchmarkcijfers verder dan wat de provider publiceert. Voor betrouwbaarheid in de praktijk, voer A/B-testen uit met uw eigen gegevens en vergelijk latentie, nauwkeurigheid en kosten met andere modellen.
De latentie voor google/gemini-robotics-er-1.6-preview wordt niet gespecificeerd door de provider. Over het algemeen hebben multimodale modellen die video en audio verwerken een hogere latentie dan alleen-tekst modellen vanwege de coderingsoverhead. Bovendien kan de grote uitvoercontext de reactietijd verhogen, vooral bij lange generaties. De werkelijke latentie hangt af van de verzoekgrootte, complexiteit en serverbelasting op zowel de infrastructuur van Google als de proxy van OrcaRouter. Voor de beste prestaties minimaliseert u onnodige invoergegevens en stelt u de juiste max_tokens in. De API van OrcaRouter retourneert standaard timing-headers; het monitoren daarvan geeft u empirische gegevens voor uw gebruikssituatie.
De belangrijkste kracht van het model is de ondersteuning voor meerdere invoermodaliteiten (tekst, afbeelding, video, audio) gecombineerd met een uitzonderlijk grote uitvoercontext van maximaal 65.536 tokens. Dit maakt het zeer geschikt voor complexe robotica-taken die zowel visuele als auditieve informatie moeten begrijpen en het genereren van uitgebreide, detailrijke plannen. Het preview-karakter suggereert dat het een van de eerste Gemini-modellen is die zijn verfijnd voor belichaamd redeneren. Een ander voordeel is de eenvoudige toegang via de OpenAI-compatibele API van OrcaRouter, wat de integratiebarrière verlaagt voor teams die vertrouwd zijn met de interface van OpenAI.
Als previewmodel kunnen de stabiliteit en prestaties mogelijk niet overeenkomen met productierijpe modellen. Het ontbreken van gepubliceerde benchmarks betekent dat de nauwkeurigheid bij standaard robotica-taken onbekend is. Het kan hogere faalpercentages of onverwacht gedrag vertonen vergeleken met gevestigde modellen. Het model genereert geen afbeeldingen of audio-uitvoer, alleen tekst. De prijs per uitvoertoken is relatief hoog ($5,00 per miljoen) in vergelijking met veel modellen. Bovendien kan de grote uitvoercontext leiden tot breedsprakige reacties die niet altijd nodig zijn. Gebruikers moeten uitgebreid prototypen voordat ze dit model voor een serieuze toepassing inzetten.
Facturering voor google/gemini-robotics-er-1.6-preview op OrcaRouter is eenvoudig: $1,00 per 1 miljoen invoertokens en $5,00 per 1 miljoen uitvoertokens. Zowel invoer- als uitvoertokens worden geteld volgens de tokenisatie van Google, die kan verschillen van andere modellen. OrcaRouter rekent het exacte tarief van de provider zonder opslag. Er zijn geen extra kosten voor de API-proxyservice. De kosten zijn gebaseerd op het totale aantal tokens dat in het verzoek en antwoord is verwerkt, inclusief multimodale invoertokens (bijv. afbeeldingspatches kunnen als tokens worden geteld). Controleer altijd het gebruik dat in het API-antwoord wordt geretourneerd om de kosten bij te houden.
De outputtokenkosten ($5,00 per miljoen) zijn aanzienlijk hoger dan de inputkosten ($1,00 per miljoen). Dit betekent dat het model lange antwoorden laten genereren de kosten veel meer verhoogt dan het aanleveren van langere invoer. Voor gebruikssituaties waarin de uitvoerlengte kort kan worden gehouden (bijv. een eenzinnige opdracht), kunnen de kosten acceptabel zijn. Als u echter de volledige 65.536 outputcontext benut, kan één enkele aanvraag tot $0,33 alleen al voor de output kosten (65k tokens à $5/M). Vergelijk dit met modellen met lagere outputprijzen of kleinere contextvensters. Ook multimodale invoer kan duur zijn als veel tokens nodig zijn (bijv. afbeeldingen met hoge resolutie of lange video's). Overweeg tokencompressie of het gebruik van een lagere resolutie waar mogelijk.
OrcaRouter past momenteel het tarief van de provider toe zonder opslag. Er is geen ingebouwde caching die de kosten voor herhaalde prompt-voorvoegsels verlaagt, aangezien het een doorgeefproxy is. U kunt echter caching op applicatieniveau implementeren: als u identieke invoercontexten hergebruikt (bijv. statische systeemprompts of referentieafbeeldingen), sla dan de reactie van het model op en gebruik deze opnieuw, waardoor herhaalde API-aanroepen worden vermeden. Kortingen of volumeprijzen zijn mogelijk beschikbaar via de enterprise-abonnementen van OrcaRouter; neem contact op met het OrcaRouter-team voor meer informatie. Standaardprijzen zijn van toepassing op al het gebruik, tenzij er een speciale overeenkomst is.
Gebruik het standaard OpenAI chat completions endpoint. Stel de 'model'-parameter in op 'google/gemini-robotics-er-1.6-preview'. De basis-URL is https://api.orcarouter.ai/v1. Voeg uw OrcaRouter API-sleutel toe in de Authorization-header. Voor tekst-only berichten is de request body identiek aan een OpenAI ChatCompletion-verzoek: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Voor multimodale invoer, structureer de inhoud als een array met type- en data-velden volgens het provider-schema. OrcaRouter vertaalt het verzoek intern naar Google's formaat.
De API ondersteunt dezelfde parameters als het OpenAI /v1/chat/completions eindpunt: model, messages, max_tokens (tot 65536), temperature (0 tot 2, standaard 1), top_p (0 tot 1, standaard 1), frequency_penalty, presence_penalty, stop-sequenties, stream (boolean), logprobs en user. Niet alle parameters werken mogelijk op de backend van Google; bijvoorbeeld, frequency_penalty en presence_penalty hebben mogelijk beperkt effect. Voor streaming stelt u 'stream: true' in om token-voor-token antwoorden te ontvangen. Het antwoordformaat weerspiegelt dat van OpenAI, inclusief choices, usage (prompt_tokens, completion_tokens, total_tokens) en id. Raadpleeg de OrcaRouter-documentatie voor eventuele modelspecifieke parameteroverschrijvingen.
Aangezien OrcaRouter een OpenAI-compatibele API biedt, komt migratie meestal neer op het wijzigen van de basis-URL en API-sleutel. Vervang 'https://api.openai.com/v1' door 'https://api.orcarouter.ai/v1' en stel het model in op 'google/gemini-robotics-er-1.6-preview'. Als uw app de OpenAI Python-client gebruikt, werk dan de base_url en api_key bij. Let bij multimodale invoer op dat de OpenAI-indeling voor afbeeldingen 'image_url' gebruikt, maar de indeling van Google mogelijk andere veldnamen vereist (zoals 'video_url'). De API van OrcaRouter accepteert een superset van het multimodale schema van OpenAI; raadpleeg hun documentatie voor de exacte structuur. Test met een eenvoudig verzoek voordat u complexe logica migreert.
Gemini 1.5 Pro is een multimodaal model voor algemeen gebruik met een sterke balans tussen prestaties en kosten. Het robotics-er preview model is gespecialiseerd in robotica en belichaamde redenering, zoals de naam al suggereert. Terwijl Gemini 1.5 Pro doorgaans tot 8.192 outputtokens ondersteunt, biedt dit model tot 65.536 outputtokens. De prijzen verschillen: Gemini 1.5 Pro kost ongeveer $1,25 per miljoen inputtokens en $5,00 per miljoen outputtokens, dus dit model is iets goedkoper voor input maar hetzelfde voor output. Het previewmodel heeft echter mogelijk minder algemene kennis en meer focus op begrip van de fysieke wereld. Benchmarkvergelijkingen zijn niet beschikbaar; gebruikers moeten testen op hun eigen taken.
GPT-4o is een multimodaal model van OpenAI met ondersteuning voor tekst, afbeeldingen en audio (niet-video) en een uitvoerlimiet van 16,384 tokens. Het robotics-er model heeft een veel grotere uitvoercontext (65,536) en ondersteunt expliciet video-invoer, wat GPT-4o niet native doet. Prijsverschillen: GPT-4o rekent $2.50 per miljoen invoer- en $10.00 per miljoen uitvoertokens voor standaardgebruik, waardoor het robotics model goedkoper is per token. GPT-4o is echter een volwassen productiemodel met uitgebreide benchmarks, terwijl dit model een preview is. Voor robotics-specifieke taken kan het Google-model ontworpen zijn voor betere prestaties, maar zonder openbare benchmarks is dit speculatief.
Llama 3-modellen zijn alleen-tekst (of binnenkort multimodaal) maar beschikbaar voor self-hosting, wat op schaal goedkoper kan zijn. Het robotics-er model biedt native multimodale ondersteuning (inclusief video en audio) uit de doos, die opensource-alternatieven mogelijk niet bieden zonder extra componenten. De prijs per token van het previewmodel kan duur zijn voor hoog volume, terwijl een opensourcemodel dat op eigen hardware draait voorspelbare infrastructuurkosten heeft. Het Google-model profiteert echter van cloud-schaal infrastructuur en updates. Voor prototyping kan het gemak van het previewmodel (via API) opwegen tegen de kosten. Evalueer uw totale eigendomskosten, inclusief ontwikkelingstijd.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Invoer / 1M tokens | $1.00 |
| Uitvoer / 1M tokens | $5.00 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
Waar ontwikkelaars het deze week over hebben
GET /api/public/models/google/gemini-robotics-er-1.6-previewOpenen @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview