Il modello preview multimodale di Google per la robotica, che supporta input di testo, immagini, video e audio con fino a 65.536 token di output.
google/gemini-robotics-er-1.6-preview è un modello preview della famiglia Gemini di Google, ottimizzato per la robotica e il ragionamento incarnato. È un modello multimodale in grado di elaborare…
Il modello è progettato per il ragionamento multimodale legato alla robotica. È in grado di interpretare immagini e video per identificare oggetti, ambienti e azioni umane. Può elaborare comandi vocali ed estrarre informazioni dal linguaggio parlato. Combinando queste modalità, può generare istruzioni per la manipolazione robotica, la navigazione o l'interazione. Ad esempio, dato un video di una cucina e una richiesta parlata di 'prendere la mela dal bancone', il modello può produrre una sequenza di azioni. Il grande contesto di output gli consente di generare piani dettagliati o codice per controllori robotici. Si noti che le prestazioni del modello su questi compiti non sono ancora state valutate pubblicamente per questa versione di anteprima.
Se la tua applicazione non richiede input multimodali (ad esempio, usi solo testo), un modello più piccolo solo testo sarebbe più conveniente. Il modello robotics-er ha un prezzo relativamente alto per i token di input ($1.00 per milione) rispetto a molti modelli generici. Per semplici domande e risposte o generazione di testo senza contesto visivo o audio, considera l'utilizzo di un modello più leggero disponibile tramite OrcaRouter, come Gemini 1.5 Flash o un modello open-source più piccolo. Inoltre, se l'output massimo di 65,536 token non è necessario, un modello con un contesto di output più piccolo potrebbe offrire latenza e costi inferiori. Valuta se le capacità multimodali giustifichino il prezzo per il tuo caso d'uso.
Il limite di output di 65.536 token è particolarmente utile per generare contenuti in formato lungo, come sequenze di movimento robotico (ad esempio, codice Python che utilizza ROS o librerie di controllo), descrizioni dettagliate dell'ambiente per la ricostruzione 3D, o piani di attività multi-step che richiedono un ragionamento approfondito. Può anche essere utilizzato per l'apprendimento contestuale, dove al modello vengono forniti molti esempi all'interno di un singolo prompt e ci si aspetta che produca un output completo. Per la ricerca in robotica, ciò consente di generare piani a lungo orizzonte che coprono molte possibili contingenze. Tuttavia, si noti che output più lunghi aumentano costi e latenza, quindi valutare se una risposta più breve sia sufficiente.
Gli input audio e video vengono elaborati come parte del prompt multimodale. Quando invii un video, il modello probabilmente lo tratta come una sequenza di fotogrammi o utilizza un encoder di comprensione video (i metodi esatti sono interni di Google). L'audio può essere incluso come URL di un file audio. Il modello può trascrivere o comprendere comandi vocali e generare risposte testuali di conseguenza. La qualità dell'elaborazione audio e video dipende dal campionamento e dal formato supportati dall'API Gemini di Google; consulta la documentazione del provider per i tipi di file supportati e le durate massime. OrcaRouter si limita a inoltrare l'input nel formato compatibile con OpenAI.
Essendo una versione in anteprima, Google non ha pubblicato punteggi di benchmark specifici per il modello gemini-robotics-er-1.6-preview. I modelli Gemini 1.6 generali hanno mostrato buone prestazioni in attività multimodali, ma questa variante specifica per la robotica potrebbe avere punti di forza diversi. Gli utenti dovrebbero valutare le prestazioni del modello sui propri compiti specifici di dominio prima di fare affidamento su di esso. OrcaRouter non fornisce numeri di benchmark oltre a quelli pubblicati dal provider. Per un'affidabilità reale, esegui test A/B con i tuoi dati e confronta latenza, accuratezza e costo rispetto ad altri modelli.
La latenza per google/gemini-robotics-er-1.6-preview non è specificata dal provider. In generale, i modelli multimodali che elaborano video e audio tendono ad avere una latenza maggiore rispetto ai modelli solo testo a causa del sovraccarico di codifica. Inoltre, il grande contesto di output può aumentare il tempo di risposta, specialmente per generazioni lunghe. La latenza effettiva dipende dalla dimensione della richiesta, dalla complessità e dal carico del server sia sull'infrastruttura di Google che sul proxy di OrcaRouter. Per prestazioni ottimali, riduci al minimo i dati di input non necessari e imposta un max_tokens appropriato. L'API di OrcaRouter restituisce intestazioni di temporizzazione standard; monitorandole otterrai dati empirici per il tuo caso d'uso.
Il punto di forza principale del modello è il supporto per molteplici modalità di input (testo, immagine, video, audio) combinato con un contesto di output eccezionalmente ampio, fino a 65.536 token. Ciò lo rende particolarmente adatto per compiti robotici complessi che richiedono la comprensione di informazioni visive e uditive e la generazione di piani estesi e ricchi di dettagli. La natura di anteprima suggerisce che sia uno dei primi modelli Gemini ottimizzati per il ragionamento incarnato. Un altro punto di forza è l'accesso diretto tramite l'API compatibile con OpenAI di OrcaRouter, che abbassa la barriera di integrazione per i team familiari con l'interfaccia di OpenAI.
Essendo un modello in anteprima, la sua stabilità e prestazioni potrebbero non essere all'altezza dei modelli pronti per la produzione. La mancanza di benchmark pubblicati significa che la sua precisione su compiti standard di robotica è sconosciuta. Potrebbe presentare tassi di errore più elevati o comportamenti imprevisti rispetto ai modelli affermati. Il modello non genera immagini o output audio, solo testo. Il prezzo per token di output è relativamente alto ($5.00 per milione) rispetto a molti modelli. Inoltre, il grande contesto di output potrebbe incoraggiare risposte verbose che non sono sempre necessarie. Gli utenti dovrebbero fare ampi prototipi prima di impegnarsi con questo modello per qualsiasi applicazione seria.
La fatturazione per google/gemini-robotics-er-1.6-preview su OrcaRouter è semplice: $1.00 per 1 milione di token di input e $5.00 per 1 milione di token di output. Sia i token di input che quelli di output sono conteggiati secondo la tokenizzazione di Google, che può differire da altri modelli. OrcaRouter addebita la tariffa esatta del provider senza alcun ricarico. Non ci sono costi aggiuntivi per il servizio proxy API. Il costo si basa sul numero totale di token elaborati nella richiesta e nella risposta, inclusi i token di input multimodali (ad esempio, le patch di immagini possono essere conteggiate come token). Controlla sempre l'utilizzo restituito nella risposta API per tenere traccia dei costi.
Il costo dei token di output ($5.00 per milione) è significativamente più alto del costo di input ($1.00 per milione). Ciò significa che far generare al modello risposte lunghe aumenta il costo molto più che fornire input più lunghi. Per casi d'uso in cui la lunghezza dell'output può essere mantenuta breve (ad esempio, un comando di una frase), il costo può essere accettabile. Tuttavia, se si sfrutta l'intero contesto di output di 65.536 token, una singola richiesta potrebbe costare fino a $0.33 solo per l'output (65k token a $5/M). Confrontalo con modelli con prezzi di output inferiori o finestre di contesto più piccole. Inoltre, gli input multimodali possono essere costosi se richiedono molti token (ad esempio, immagini ad alta risoluzione o video lunghi). Considera la compressione dei token o l'uso di una risoluzione inferiore quando possibile.
OrcaRouter applica attualmente la tariffa del provider senza alcun margine. Non esiste una cache integrata che riduca il costo per prefissi di prompt ripetuti, poiché si tratta di un proxy pass-through. Tuttavia, è possibile implementare la memorizzazione nella cache a livello di applicazione: se si riutilizzano contesti di input identici (ad esempio, prompt di sistema statici o immagini di riferimento), memorizzare la risposta del modello e riutilizzarla, evitando chiamate API ripetute. Sconti o prezzi basati sul volume potrebbero essere disponibili tramite i piani enterprise di OrcaRouter; contatta il team di OrcaRouter per i dettagli. La tariffa standard si applica a tutti gli utilizzi, salvo diverso accordo speciale.
Utilizza l'endpoint standard delle chat completions di OpenAI. Imposta il parametro 'model' su 'google/gemini-robotics-er-1.6-preview'. L'URL di base è https://api.orcarouter.ai/v1. Includi la tua chiave API di OrcaRouter nell'intestazione Authorization. Per messaggi di solo testo, il corpo della richiesta è identico a una richiesta ChatCompletion di OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Per input multimodali, struttura il contenuto come un array con campi type e data secondo lo schema del provider. OrcaRouter traduce internamente la richiesta nel formato di Google.
L'API supporta gli stessi parametri dell'endpoint /v1/chat/completions di OpenAI: model, messages, max_tokens (fino a 65536), temperature (da 0 a 2, default 1), top_p (da 0 a 1, default 1), frequency_penalty, presence_penalty, stop sequences, stream (booleano), logprobs e user. Non tutti i parametri potrebbero essere efficaci sul backend di Google; ad esempio, frequency_penalty e presence_penalty potrebbero avere un effetto limitato. Per lo streaming, imposta 'stream: true' per ricevere risposte token per token. Il formato della risposta rispecchia quello di OpenAI, incluse choices, usage (prompt_tokens, completion_tokens, total_tokens) e id. Consulta la documentazione di OrcaRouter per eventuali override di parametri specifici del modello.
Poiché OrcaRouter fornisce un'API compatibile con OpenAI, la migrazione di solito consiste nel modificare l'URL di base e la chiave API. Sostituisci 'https://api.openai.com/v1' con 'https://api.orcarouter.ai/v1' e imposta il modello su 'google/gemini-robotics-er-1.6-preview'. Se la tua applicazione utilizza il client Python di OpenAI, aggiorna base_url e api_key. Per input multimodali, nota che il formato di OpenAI per le immagini utilizza 'image_url', ma il formato di Google potrebbe richiedere nomi di campo diversi (come 'video_url'). L'API di OrcaRouter accetta un superset dello schema multimodale di OpenAI; consulta la loro documentazione per la struttura esatta. Testa con una semplice richiesta prima di migrare logiche complesse.
Gemini 1.5 Pro è un modello multimodale per uso generico con un buon equilibrio tra prestazioni e costo. Il modello preview robotics-er è specializzato per la robotica e il ragionamento incarnato, come suggerisce il nome. Mentre Gemini 1.5 Pro supporta tipicamente fino a 8.192 token di output, questo modello ne offre fino a 65.536. I prezzi differiscono: Gemini 1.5 Pro costa circa $1,25 per milione di token in input e $5,00 per milione di token in output, quindi questo modello è leggermente più economico in input ma identico in output. Tuttavia, il modello preview potrebbe avere una conoscenza generale inferiore e una maggiore attenzione alla comprensione del mondo fisico. Non sono disponibili confronti tramite benchmark; gli utenti dovrebbero testarlo sui propri compiti.
GPT-4o è un modello multimodale di OpenAI che supporta testo, immagini e audio (non video) con un limite di output di 16.384 token. Il modello robotics-er ha un contesto di output molto più ampio (65.536) e supporta esplicitamente l'input video, cosa che GPT-4o non fa nativamente. Differenze di prezzo: GPT-4o costa $2,50 per milione di token in input e $10,00 per milione di token in output per l'uso standard, rendendo il modello robotics più economico per token. Tuttavia, GPT-4o è un modello di produzione maturo con ampi benchmark, mentre questo modello è un'anteprima. Per attività specifiche della robotica, il modello di Google potrebbe essere progettato per prestazioni migliori, ma senza benchmark pubblici si tratta di speculazione.
I modelli Llama 3 sono solo testo (o presto multimodali) ma disponibili per l'hosting autonomo, che può essere più economico su larga scala. Il modello di robotica offre supporto nativo multimodale (inclusi video e audio) pronto all'uso, che le alternative open-source potrebbero non fornire senza componenti aggiuntivi. Il prezzo per token del modello in anteprima può essere costoso per un uso ad alto volume, mentre un modello open-source eseguito sul proprio hardware ha costi di infrastruttura prevedibili. Tuttavia, il modello Google beneficia di infrastruttura su scala cloud e aggiornamenti. Per il prototyping, la facilità d'uso del modello in anteprima (tramite API) può superare il costo. Valuta il costo totale di possesso incluso il tempo di sviluppo.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Input / 1M token | $1.00 |
| Output / 1M token | $5.00 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/google/gemini-robotics-er-1.6-previewApri @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview