Model multimodalny Google w wersji zapoznawczej dla robotyki, obsługujący wprowadzanie tekstu, obrazów, wideo i dźwięku z możliwością generowania do 65 536 tokenów wyjściowych.
google/gemini-robotics-er-1.6-preview to model podglądowy z rodziny Google Gemini, zoptymalizowany pod kątem robotyki i rozumowania osadzonego. Jest to model multimodalny, który może przetwarzać dane…
Model jest zaprojektowany do multimodalnego rozumowania związanego z robotyką. Potrafi interpretować obrazy i wideo w celu identyfikacji obiektów, środowisk i działań ludzi. Może przetwarzać polecenia audio i wyciągać informacje z języka mówionego. Łącząc te modalności, może generować instrukcje do manipulacji, nawigacji lub interakcji robotów. Na przykład, biorąc pod uwagę wideo z kuchni i mówioną prośbę „przynieś jabłko z lady”, model może wygenerować sekwencję działań. Duży kontekst wyjściowy umożliwia mu tworzenie szczegółowych planów lub kodu dla kontrolerów robotów. Należy zauważyć, że wydajność modelu w tych zadaniach nie została jeszcze publicznie porównana w tej wersji podglądowej.
Jeśli Twoja aplikacja nie wymaga multimodalnych wejść (np. używasz tylko tekstu), bardziej opłacalny będzie mniejszy model tekstowy. Model robotics-er jest stosunkowo drogi pod względem tokenów wejściowych ($1.00 za milion) w porównaniu z wieloma modelami ogólnego przeznaczenia. W przypadku prostego odpowiadania na pytania lub generowania tekstu bez kontekstu wizualnego czy audio, rozważ użycie lżejszego modelu dostępnego przez OrcaRouter, takiego jak Gemini 1.5 Flash lub mniejszego modelu open-source. Poza tym, jeśli maksymalna liczba tokenów wynosząca 65,536 nie jest konieczna, model z mniejszym kontekstem wyjściowym może zapewnić niższe opóźnienie i koszt. Oceń, czy możliwości multimodalne uzasadniają cenę dla Twojego przypadku użycia.
Limit wyjścia wynoszący 65,536 tokenów jest szczególnie cenny przy generowaniu długich treści, takich jak sekwencje ruchu robotów (np. kod w Pythonie wykorzystujący ROS lub biblioteki sterowania), szczegółowe opisy środowiska do rekonstrukcji 3D lub wieloetapowe plany zadań wymagające rozległego rozumowania. Można go również użyć do uczenia się w kontekście, gdzie model otrzymuje wiele przykładów w jednym poleceniu i oczekuje się od niego wyczerpującej odpowiedzi. W badaniach nad robotyką umożliwia to generowanie długoterminowych planów obejmujących wiele możliwych scenariuszy. Należy jednak pamiętać, że dłuższe wyniki zwiększają koszt i opóźnienie, więc zastanów się, czy krótsza odpowiedź nie wystarczy.
Dane wejściowe audio i wideo są przetwarzane jako część multimodalnego promptu. Kiedy wysyłasz wideo, model prawdopodobnie traktuje je jako sekwencję klatek lub używa enkodera rozumienia wideo (dokładne metody są wewnętrzne dla Google). Audio może być dołączone jako URL do pliku audio. Model może transkrybować lub rozumieć polecenia mówione i odpowiednio generować odpowiedzi tekstowe. Jakość przetwarzania audio i wideo zależy od próbkowania i formatu obsługiwanego przez Google Gemini API; skonsultuj się z dokumentacją dostawcy w celu uzyskania informacji o obsługiwanych typach plików i maksymalnych czasach trwania. OrcaRouter po prostu przekazuje dane wejściowe w formacie zgodnym z OpenAI.
Jako wersja zapoznawcza, Google nie opublikowało szczegółowych wyników benchmarków dla modelu gemini-robotics-er-1.6-preview. Ogólne modele Gemini 1.6 wykazały się wysoką wydajnością w zadaniach multimodalnych, ale ten wariant specyficzny dla robotyki może mieć inne mocne strony. Użytkownicy powinni ocenić wydajność modelu na swoich własnych zadaniach domenowych przed rozpoczęciem polegania na nim. OrcaRouter nie udostępnia wyników benchmarków poza tymi, które publikuje dostawca. Aby uzyskać rzeczywistą niezawodność, przeprowadź testy A/B na własnych danych i porównaj opóźnienie, dokładność oraz koszt z innymi modelami.
Opóźnienie dla google/gemini-robotics-er-1.6-preview nie jest określone przez dostawcę. Ogólnie modele multimodalne przetwarzające wideo i audio mają zwykle wyższe opóźnienie niż modele tekstowe ze względu na narzut związany z kodowaniem. Dodatkowo duży kontekst wyjściowy może wydłużyć czas odpowiedzi, zwłaszcza przy długich generacjach. Rzeczywiste opóźnienie zależy od rozmiaru zapytania, złożoności oraz obciążenia serwera zarówno infrastruktury Google, jak i proxy OrcaRouter. Aby uzyskać najlepszą wydajność, minimalizuj niepotrzebne dane wejściowe i ustaw odpowiednie max_tokens. API OrcaRouter zwraca standardowe nagłówki czasu; monitorowanie ich dostarczy danych empirycznych dla Twojego przypadku użycia.
Główną siłą modelu jest obsługa wielu modalności wejściowych (tekst, obraz, wideo, audio) w połączeniu z wyjątkowo dużym kontekstem wyjściowym wynoszącym do 65 536 tokenów. To sprawia, że doskonale nadaje się do złożonych zadań robotyki, które wymagają zrozumienia zarówno informacji wizualnych, jak i dźwiękowych oraz generowania obszernych, bogatych w szczegóły planów. Charakter podglądowy sugeruje, że jest to jeden z pierwszych modeli Gemini dostrojonych do rozumowania ucieleśnionego. Kolejną zaletą jest prosty dostęp za pośrednictwem API OrcaRouter zgodnego z OpenAI, co obniża barierę integracji dla zespołów zaznajomionych z interfejsem OpenAI.
Jako model podglądowy, jego stabilność i wydajność mogą nie dorównywać modelom gotowym do produkcji. Brak opublikowanych benchmarków oznacza, że jego dokładność w standardowych zadaniach robotycznych jest nieznana. Może mieć wyższy wskaźnik awaryjności lub nieoczekiwane zachowania w porównaniu z uznanymi modelami. Model nie generuje obrazów ani dźwięków, a jedynie tekst. Cena za token wyjściowy jest stosunkowo wysoka ($5.00 za milion) w porównaniu z wieloma modelami. Dodatkowo duży kontekst wyjściowy może zachęcać do rozwlekłych odpowiedzi, które nie zawsze są konieczne. Użytkownicy powinni dokładnie prototypować przed zaangażowaniem się w ten model w jakimkolwiek poważnym zastosowaniu.
Rozliczenia za google/gemini-robotics-er-1.6-preview na OrcaRouter są proste: 1,00 USD za 1 milion tokenów wejściowych i 5,00 USD za 1 milion tokenów wyjściowych. Zarówno tokeny wejściowe, jak i wyjściowe są liczone zgodnie z tokenizacją Google, która może różnić się od innych modeli. OrcaRouter pobiera dokładnie stawkę dostawcy, bez żadnej marży. Nie ma dodatkowych opłat za serwis proxy API. Koszt opiera się na łącznej liczbie tokenów przetworzonych w żądaniu i odpowiedzi, w tym tokenów wejściowych multimodalnych (np. fragmenty obrazów mogą być liczone jako tokeny). Zawsze sprawdzaj użycie zwrócone w odpowiedzi API, aby śledzić koszty.
Koszt tokenów wyjściowych (5,00 USD za milion) jest znacznie wyższy niż koszt wejściowy (1,00 USD za milion). Oznacza to, że zmuszanie modelu do generowania długich odpowiedzi zwiększa koszt znacznie bardziej niż dostarczanie dłuższego wejścia. W przypadkach użycia, w których długość wyjścia może być utrzymana krótko (np. jednozdaniowe polecenie), koszt może być akceptowalny. Jednakże, jeśli wykorzystasz pełny kontekst wyjściowy wynoszący 65,536 tokenów, pojedyncze żądanie może kosztować nawet 0,33 USD tylko za wyjście (65 tys. tokenów po 5 USD za milion). Porównaj to z modelami o niższych cenach wyjściowych lub mniejszych oknach kontekstu. Ponadto, wejścia multimodalne mogą być kosztowne, jeśli wymagają wielu tokenów (np. obrazy w wysokiej rozdzielczości lub długie filmy). Rozważ kompresję tokenów lub użycie niższej rozdzielczości, jeśli to możliwe.
OrcaRouter obecnie stosuje stawkę dostawcy bez żadnej marży. Nie ma wbudowanego buforowania, które zmniejsza koszt dla powtarzających się prefiksów promptów, ponieważ jest to proxy przekazujące. Możesz jednak zaimplementować buforowanie na poziomie aplikacji: jeśli używasz ponownie identycznych kontekstów wejściowych (np. statycznych promptów systemowych lub obrazów referencyjnych), zachowaj odpowiedź modelu i użyj jej ponownie, unikając powtarzających się wywołań API. Rabaty lub ceny hurtowe mogą być dostępne w ramach planów korporacyjnych OrcaRouter; skontaktuj się z zespołem OrcaRouter, aby uzyskać szczegóły. Standardowe ceny obowiązują dla wszystkich użyć, chyba że obowiązuje specjalna umowa.
Użyj standardowego punktu końcowego OpenAI do chat completions. Ustaw parametr 'model' na 'google/gemini-robotics-er-1.6-preview'. Podstawowy adres URL to https://api.orcarouter.ai/v1. Dołącz swój klucz API OrcaRouter w nagłówku Authorization. Dla wiadomości tylko tekstowych, treść żądania jest identyczna z żądaniem OpenAI ChatCompletion: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. W przypadku danych multimodalnych, sformatuj treść jako tablicę z polami type i data zgodnie ze schematem dostawcy. OrcaRouter tłumaczy żądanie wewnętrznie na format Google.
API obsługuje te same parametry co punkt końcowy OpenAI /v1/chat/completions: model, messages, max_tokens (do 65536), temperature (0 do 2, domyślnie 1), top_p (0 do 1, domyślnie 1), frequency_penalty, presence_penalty, sekwencje stop, stream (boolean), logprobs oraz user. Nie wszystkie parametry mogą być skuteczne w backendzie Google; na przykład frequency_penalty i presence_penalty mogą mieć ograniczony efekt. W przypadku strumieniowania ustaw 'stream: true', aby otrzymywać odpowiedzi token po tokenie. Format odpowiedzi odzwierciedla ten z OpenAI, włączając w to choices, usage (prompt_tokens, completion_tokens, total_tokens) oraz id. Sprawdź dokumentację OrcaRouter w poszukiwaniu jakichkolwiek nadpisań parametrów specyficznych dla modelu.
Ponieważ OrcaRouter udostępnia API kompatybilne z OpenAI, migracja zazwyczaj polega na zmianie podstawowego URL i klucza API. Zastąp 'https://api.openai.com/v1' na 'https://api.orcarouter.ai/v1' i ustaw model na 'google/gemini-robotics-er-1.6-preview'. Jeśli Twoja aplikacja używa klienta OpenAI w Pythonie, zaktualizuj base_url i api_key. W przypadku danych multimodalnych, pamiętaj, że format OpenAI dla obrazów używa 'image_url', ale format Google może wymagać innych nazw pól (jak 'video_url'). API OrcaRouter akceptuje nadzbiór schematu multimodalnego OpenAI; zapoznaj się z ich dokumentacją, aby poznać dokładną strukturę. Przetestuj przy użyciu prostego zapytania przed migracją złożonej logiki.
Gemini 1.5 Pro to ogólnego przeznaczenia model multimodalny, który zapewnia dobrą równowagę między wydajnością a kosztem. Model zapoznawczy robotics-er jest wyspecjalizowany w robotyce i rozumowaniu ucieleśnionym, co sugeruje jego nazwa. Podczas gdy Gemini 1.5 Pro zazwyczaj obsługuje do 8 192 tokenów wyjściowych, ten model oferuje do 65 536 tokenów wyjściowych. Ceny różnią się: Gemini 1.5 Pro kosztuje około $1.25 za milion tokenów wejściowych i $5.00 za milion tokenów wyjściowych, więc ten model jest nieco tańszy pod względem wejścia, ale taki sam pod względem wyjścia. Jednak model zapoznawczy może mieć mniej ogólnej wiedzy i bardziej skupiać się na rozumieniu świata fizycznego. Porównania porównawcze nie są dostępne; użytkownicy powinni testować na własnych zadaniach.
GPT-4o to multimodalny model od OpenAI obsługujący tekst, obrazy i dźwięk (bez wideo) z limitem wyjściowym wynoszącym 16 384 tokeny. Model robotyczny ma znacznie większy kontekst wyjściowy (65 536) i wyraźnie obsługuje wejście wideo, czego GPT-4o nie robi natywnie. Różnice cenowe: GPT-4o kosztuje 2,50 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych przy standardowym użyciu, co sprawia, że model robotyczny jest tańszy za token. Jednak GPT-4o to dojrzały model produkcyjny z rozbudowanymi benchmarkami, podczas gdy ten model jest wersją podglądową. W przypadku zadań specyficznych dla robotyki model Google może być zaprojektowany tak, aby oferować lepszą wydajność, ale bez publicznych benchmarków jest to spekulacja.
Modele Llama 3 są tylko tekstowe (lub wkrótce multimodalne), ale dostępne do samodzielnego hostowania, co może być tańsze przy większej skali. Model robotics-er oferuje natywne wsparcie multimodalne (w tym wideo i audio) od razu po wyjęciu z pudełka, czego alternatywy open-source mogą nie zapewniać bez dodatkowych komponentów. Cena za token modelu preview może być kosztowna przy dużym użyciu, podczas gdy model open-source uruchomiony na własnym sprzęcie ma przewidywalne koszty infrastruktury. Jednak model Google korzysta z infrastruktury na skalę chmurową i aktualizacji. Do prototypowania łatwość użycia modelu preview (przez API) może przeważyć nad kosztem. Oceń całkowity koszt posiadania, włączając czas rozwoju.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Wejście / 1M tokenów | $1.00 |
| Wyjście / 1M tokenów | $5.00 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/google/gemini-robotics-er-1.6-previewOtwórz @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview