Googles multimodala förhandsvisningsmodell för robotik, som stöder text-, bild-, video- och ljudinmatningar med upp till 65,536 utdatatokens.
google/gemini-robotics-er-1.6-preview är en förhandsmodell från Googles Gemini-familj optimerad för robotik och inbäddat resonemang. Det är en multimodal modell som kan bearbeta text, bilder, video…
Modellen är utformad för robotrelaterad multimodalt resonemang. Den kan tolka bilder och video för att identifiera objekt, miljöer och mänskliga handlingar. Den kan bearbeta ljudkommandon och extrahera information från talat språk. Genom att kombinera dessa modaliteter kan den generera instruktioner för robotmanipulation, navigering eller interaktion. Till exempel, givet en video av ett kök och en muntlig begäran att 'hämta äpplet från bänken,' kan modellen mata ut en sekvens av åtgärder. Den stora utdatakontexten gör att den kan producera detaljerade planer eller kod för robotkontroller. Observera att modellens prestanda på dessa uppgifter ännu inte är offentligt benchmarkad för denna förhandsversion.
Om din applikation inte kräver multimodala inmatningar (t.ex. du endast använder text), skulle en mindre textbaserad modell vara mer kostnadseffektiv. Robotics-er-modellen är prissatt relativt högt för inmatningstokens ($1.00 per miljon) jämfört med många generella modeller. För enkel frågesvar eller textgenerering utan visuell eller ljudkontext, överväg att använda en lättare modell tillgänglig via OrcaRouter, såsom Gemini 1.5 Flash eller en mindre öppen källkodsmodell. Om den maximala utmatningen på 65,536 tokens inte är nödvändig, kan en modell med mindre utmatningskontext erbjuda lägre latens och kostnad. Utvärdera om de multimodala kapaciteterna motiverar priset för ditt användningsfall.
Gränsen på 65 536 tokens är särskilt värdefull för att generera långformat innehåll som robotrörelsesekvenser (t.ex. Python-kod med ROS eller styrbibliotek), detaljerade miljöbeskrivningar för 3D-rekonstruktion eller flerstegsplaner för uppgifter som kräver omfattande resonemang. Den kan också användas för in-context learning, där modellen får många exempel inom en enda uppmaning och förväntas producera ett omfattande resultat. Inom robotikforskning möjliggör detta generering av långsiktiga planer som täcker många möjliga oförutsedda händelser. Observera dock att längre utdata ökar kostnad och latens, så överväg om ett kortare svar skulle räcka.
Audio- och videoinmatningar bearbetas som en del av den multimodala prompten. När du skickar en video behandlar modellen den troligen som en sekvens av bildrutor eller använder en videoavkodare (exakta metoder är Googles interna). Ljud kan inkluderas som en URL till en ljudfil. Modellen kan transkribera eller förstå talade kommandon och generera textsvar därefter. Kvaliteten på ljud- och videobearbetningen beror på samplingen och formatet som stöds av Googles Gemini API; konsultera leverantörens dokumentation för filtyper som stöds och maximal varaktighet. OrcaRouter vidarebefordrar helt enkelt inmatningen i det OpenAI-kompatibla formatet.
Som en förhandsversion har Google inte publicerat specifika benchmarkresultat för modellen gemini-robotics-er-1.6-preview. Allmänna Gemini 1.6-modeller har visat stark prestanda på multimodala uppgifter, men denna robotspecifika variant kan ha andra styrkor. Användare bör utvärdera modellens prestanda på sina egna domänspecifika uppgifter innan de förlitar sig på den. OrcaRouter tillhandahåller inga benchmarkvärden utöver vad leverantören publicerar. För verklig tillförlitlighet, genomför A/B-testning med dina egna data och jämför latens, noggrannhet och kostnad mot andra modeller.
Latens för google/gemini-robotics-er-1.6-preview anges inte av leverantören. I allmänhet har multimodala modeller som bearbetar video och ljud tendens att ha högre latens än textbaserade modeller på grund av kodningsomkostnaden. Dessutom kan den stora utdatakontexten öka svarstiden, särskilt för långa genereringar. Faktisk latens beror på förfrågningsstorlek, komplexitet och serverbelastning på både Googles infrastruktur och OrcaRouter's proxy. För bästa prestanda, minimera onödig indata och ställ in lämpliga max_tokens. OrcaRouter's API returnerar standardtidsmätningshuvuden; övervakning av dessa ger dig empiriska data för ditt användningsfall.
Modellens främsta styrka är dess stöd för flera inmatningsmodaliteter (text, bild, video, ljud) i kombination med en exceptionellt stor utdatakontext på upp till 65 536 tokens. Detta gör den väl lämpad för komplexa robotikuppgifter som kräver förståelse av både visuell och auditiv information samt generering av omfattande, detaljrika planer. Förhandsversionen indikerar att den är en av de första Gemini-modellerna som finjusterats för inbäddat resonemang. En annan styrka är den enkla åtkomsten via OrcaRouters OpenAI-kompatibla API, vilket sänker integrationsbarriären för team som är bekanta med OpenAIs gränssnitt.
Som en förhandsvisningsmodell kanske dess stabilitet och prestanda inte matchar produktionsklara modeller. Avsaknaden av publicerade riktmärken innebär att dess noggrannhet på standardrobotikuppgifter är okänd. Den kan ha högre felfrekvens eller oväntade beteenden jämfört med etablerade modeller. Modellen genererar inte bilder eller ljudutdata, endast text. Prissättningen per utdatatoken är relativt hög ($5.00 per miljon) jämfört med många modeller. Dessutom kan den stora utdatakontexten uppmuntra till utförliga svar som inte alltid är nödvändiga. Användare bör prototypa utförligt innan de förbinder sig till denna modell för någon seriös tillämpning.
Fakturering för google/gemini-robotics-er-1.6-preview på OrcaRouter är enkel: $1.00 per 1 miljon inmatningstokens och $5.00 per 1 miljon utmatningstokens. Både inmatnings- och utmatningstokens räknas enligt Googles tokenisering, vilket kan skilja sig från andra modeller. OrcaRouter debiterar exakt leverantörens pris utan påslag. Det finns inga extra avgifter för API-proxytjänsten. Kostnaden baseras på det totala antalet tokens som bearbetas i förfrågan och svar, inklusive multimodala inmatningstokens (t.ex. bildfragment kan räknas som tokens). Kontrollera alltid användningen som returneras i API-svaret för att följa kostnaderna.
Kostnaden för utdatatokens ($5.00 per miljon) är betydligt högre än kostnaden för indata ($1.00 per miljon). Det innebär att få modellen att generera långa svar ökar kostnaden betydligt mer än att tillhandahålla längre indata. För användningsfall där utdatalängden kan hållas kort (t.ex. ett enmeningars kommando), kan kostnaden vara acceptabel. Men om du utnyttjar hela 65,536 utdatakontexten, kan en enskild begäran kosta upp till $0.33 bara för utdata (65k tokens till $5/M). Jämför detta med modeller som har lägre utdatapris eller mindre kontextfönster. Dessutom kan multimodala indata vara dyra om de kräver många tokens (t.ex. högupplösta bilder eller långa videor). Överväg tokenkomprimering eller att använda lägre upplösning när det är möjligt.
OrcaRouter tillämpar för närvarande leverantörspriset utan påslag. Det finns ingen inbyggd cachning som minskar kostnaden för upprepade prompt-prefix, eftersom det är en genomströmningsproxy. Du kan dock implementera cachning på applikationsnivå: om du återanvänder identiska inmatningskontexter (t.ex. statiska systempromptar eller referensbilder), lagra modellens svar och återanvänd det, vilket undviker upprepade API-anrop. Rabatter eller volympriser kan finnas tillgängliga via OrcaRouters företagsplaner; kontakta OrcaRouter-teamet för detaljer. Standardprissättning gäller för all användning om inte ett särskilt avtal finns.
Använd standard OpenAI chat completions-endpointen. Ställ in parametern 'model' till 'google/gemini-robotics-er-1.6-preview'. Bas-URL:n är https://api.orcarouter.ai/v1. Inkludera din OrcaRouter API-nyckel i Authorization-headern. För textmeddelanden är förfrågans kropp identisk med en OpenAI ChatCompletion-förfrågan: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. För multimodala inmatningar, strukturera innehållet som en array med type- och datafält enligt leverantörens schema. OrcaRouter översätter förfrågan till Googles format internt.
API:n stödjer samma parametrar som OpenAI /v1/chat/completions endpoint: model, messages, max_tokens (upp till 65536), temperature (0 till 2, standard 1), top_p (0 till 1, standard 1), frequency_penalty, presence_penalty, stop sequences, stream (boolean), logprobs och user. Alla parametrar är kanske inte effektiva på Googles backend; till exempel kan frequency_penalty och presence_penalty ha begränsad effekt. För streaming, ställ in 'stream: true' för att ta emot svar token-för-token. Svarsformatet speglar OpenAIs, inklusive choices, usage (prompt_tokens, completion_tokens, total_tokens) och id. Se OrcaRouter-dokumentationen för eventuella modellspecifika parameteröverskridanden.
Eftersom OrcaRouter tillhandahåller en OpenAI-kompatibel API, handlar migrering vanligtvis om att ändra bas-URL och API-nyckel. Ersätt 'https://api.openai.com/v1' med 'https://api.orcarouter.ai/v1' och ställ in modellen till 'google/gemini-robotics-er-1.6-preview'. Om din app använder OpenAI Python-klienten, uppdatera base_url och api_key. För multimodala indata, notera att OpenAI-formatet för bilder använder 'image_url', men Googles format kan kräva andra fältnamn (som 'video_url'). OrcaRouters API accepterar en övermängd av OpenAIs multimodala schema; se deras dokumentation för exakt struktur. Testa med en enkel begäran innan du migrerar komplex logik.
Gemini 1.5 Pro är en allmänt multimodal modell med en stark balans mellan prestanda och kostnad. Robotics-er preview-modellen är specialiserad på robotik och inbäddat resonemang, som namnet antyder. Medan Gemini 1.5 Pro vanligtvis stöder upp till 8 192 utmatningstoken, erbjuder denna modell upp till 65 536 utmatningstoken. Prissättningen skiljer sig: Gemini 1.5 Pro kostar cirka $1,25 per miljon ingångstoken och $5,00 per miljon utmatningstoken, så denna modell är något billigare på ingång men samma på utgång. Preview-modellen kan dock ha mindre allmän kunskap och mer fokus på förståelse av den fysiska världen. Jämförelser av riktmärken finns inte tillgängliga; användare bör testa på sina egna uppgifter.
GPT-4o är en multimodal modell från OpenAI med stöd för text, bilder och ljud (ej video) samt en utdatagräns på 16 384 token. Roboter-modellen har en betydligt större utdatakontext (65 536) och stöder explicit videoinmatning, vilket GPT-4o inte gör inbyggt. Pris skillnader: GPT-4o kostar $2,50 per miljon inmatningstoken och $10,00 per miljon utdatatoken för standardanvändning, vilket gör robotmodellen billigare per token. GPT-4o är dock en mogen produktionsmodell med omfattande benchmarks, medan denna modell är en förhandsvisning. För robotspecifika uppgifter kan Google-modellen vara designad för bättre prestanda, men utan offentliga benchmarks är detta spekulativt.
Llama 3-modeller är endast text (eller snart multimodala) men tillgängliga för självhostning, vilket kan vara billigare i stor skala. Robotics-er-modellen erbjuder inbyggt multimodalt stöd (inklusive video och ljud) direkt ur lådan, vilket alternativ med öppen källkod kanske inte tillhandahåller utan ytterligare komponenter. Prissättningen per token för preview-modellen kan vara dyr för högvolymanvändning, medan en modell med öppen källkod som körs på din egen hårdvara har förutsägbara infrastrukturkostnader. Google-modellen drar dock nytta av molnskalig infrastruktur och uppdateringar. För prototyputveckling kan preview-modellens användarvänlighet (via API) uppväga kostnaden. Utvärdera din totala ägandekostnad inklusive utvecklingstid.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Inmatning / 1M token | $1.00 |
| Utdata / 1M tokens | $5.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/google/gemini-robotics-er-1.6-previewÖppna @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview