Google의 로보틱스용 멀티모달 프리뷰 모델로, 텍스트, 이미지, 비디오 및 오디오 입력을 지원하며 최대 65,536개의 출력 토큰을 갖습니다.
google/gemini-robotics-er-1.6-preview는 Google Gemini 제품군의 프리뷰 모델로, 로보틱스 및 구현 추론(embodied reasoning)에 최적화되어 있습니다. 텍스트, 이미지, 비디오, 오디오 입력을 처리할 수 있는 멀티모달 모델입니다. 이름의 'er'은 'embodied reasoning'을 의미할 가능성이…
이 모델은 로봇 관련 멀티모달 추론을 위해 설계되었습니다. 이미지와 비디오를 해석하여 객체, 환경 및 인간의 행동을 식별할 수 있습니다. 음성 명령을 처리하고 구어에서 정보를 추출할 수 있습니다. 이러한 모달리티를 결합하여 로봇 조작, 탐색 또는 상호작용을 위한 지침을 생성할 수 있습니다. 예를 들어, 주방 비디오와 '카운터에서 사과를 가져와'라는 음성 요청이 주어지면 모델은 일련의 동작을 출력할 수 있습니다. 큰 출력 컨텍스트를 통해 로봇 컨트롤러를 위한 상세한 계획이나 코드를 생성할 수 있습니다. 이 미리보기 버전에서는 이러한 작업에 대한 모델의 성능이 아직 공개적으로 벤치마킹되지 않았습니다.
애플리케이션에 멀티모달 입력이 필요하지 않은 경우(예: 텍스트만 사용), 더 작은 텍스트 전용 모델이 더 비용 효율적입니다. robotics-er 모델은 입력 토큰에 대해 많은 범용 모델에 비해 상대적으로 높은 가격($1.00 per million)이 책정되어 있습니다. 시각적 또는 오디오 컨텍스트 없이 간단한 질문 응답이나 텍스트 생성을 위해서는 OrcaRouter를 통해 제공되는 Gemini 1.5 Flash 또는 더 작은 오픈소스 모델과 같은 더 가벼운 모델을 고려하십시오. 또한 최대 출력 65,536 토큰이 필요하지 않은 경우 출력 컨텍스트가 더 작은 모델이 지연 시간과 비용을 낮출 수 있습니다. 사용 사례에 멀티모달 기능이 가격을 정당화하는지 평가하십시오.
65,536-토큰 출력 제한은 특히 긴 형식의 콘텐츠를 생성하는 데 유용합니다. 예를 들어 로봇 모션 시퀀스(예: ROS 또는 제어 라이브러리를 사용한 Python 코드), 3D 재구성을 위한 상세한 환경 설명, 또는 광범위한 추론이 필요한 다단계 작업 계획 등이 있습니다. 또한 단일 프롬프트 내에 많은 예제를 제공하고 포괄적인 출력을 기대하는 인컨텍스트 학습에도 사용할 수 있습니다. 로보틱스 연구의 경우, 이는 많은 가능한 상황을 다루는 장기 계획을 생성할 수 있게 합니다. 그러나 더 긴 출력은 비용과 지연 시간을 증가시키므로, 짧은 응답으로 충분할지 고려하세요.
오디오 및 비디오 입력은 멀티모달 프롬프트의 일부로 처리됩니다. 동영상을 보내면 모델은 이를 프레임 시퀀스로 처리하거나 비디오 이해 인코더(정확한 방법은 Google 내부 사항)를 사용할 가능성이 높습니다. 오디오는 오디오 파일의 URL로 포함될 수 있습니다. 모델은 음성 명령을 전사하거나 이해하고 이에 따라 텍스트 응답을 생성할 수 있습니다. 오디오 및 비디오 처리 품질은 Google의 Gemini API에서 지원하는 샘플링 및 형식에 따라 달라집니다. 지원되는 파일 유형 및 최대 지속 시간에 대해서는 제공업체 문서를 참조하십시오. OrcaRouter는 입력을 OpenAI 호환 형식으로 단순히 중계합니다.
미리보기 버전으로서 Google은 gemini-robotics-er-1.6-preview 모델에 대한 구체적인 벤치마크 점수를 공개하지 않았습니다. 일반 Gemini 1.6 모델은 멀티모달 작업에서 강력한 성능을 보였지만, 이 로보틱스 특화 변형은 다른 강점을 가질 수 있습니다. 사용자는 모델에 의존하기 전에 자체 도메인 특화 작업에서 성능을 평가해야 합니다. OrcaRouter는 제공업체가 게시한 이상의 벤치마크 수치를 제공하지 않습니다. 실제 신뢰성을 위해서는 자체 데이터로 A/B 테스트를 수행하고 다른 모델과 지연 시간, 정확도, 비용을 비교하십시오.
google/gemini-robotics-er-1.6-preview의 레이턴시는 제공사에서 지정하지 않았습니다. 일반적으로 비디오와 오디오를 처리하는 멀티모달 모델은 인코딩 오버헤드로 인해 텍스트 전용 모델보다 레이턴시가 더 높은 경향이 있습니다. 또한 큰 출력 컨텍스트는 특히 긴 생성에서 응답 시간을 증가시킬 수 있습니다. 실제 레이턴시는 요청 크기, 복잡성, 그리고 Google 인프라와 OrcaRouter 프록시 모두의 서버 부하에 따라 달라집니다. 최상의 성능을 위해 불필요한 입력 데이터를 최소화하고 적절한 max_tokens를 설정하세요. OrcaRouter의 API는 표준 타이밍 헤더를 반환합니다. 이를 모니터링하면 사용 사례에 대한 경험적 데이터를 얻을 수 있습니다.
이 모델의 주요 장점은 다중 입력 모달리티(텍스트, 이미지, 비디오, 오디오)를 지원하면서 최대 65,536개 토큰의 매우 큰 출력 컨텍스트를 제공한다는 점입니다. 이는 시각 및 청각 정보를 모두 이해하고 방대하고 세부적인 계획을 생성해야 하는 복잡한 로봇 공학 작업에 적합합니다. 프리뷰 성격상 이는 embodied reasoning에 맞게 미세 조정된 최초의 Gemini 모델 중 하나임을 시사합니다. 또 다른 강점은 OrcaRouter의 OpenAI 호환 API를 통한 간편한 접근성으로, OpenAI 인터페이스에 익숙한 팀의 통합 장벽을 낮춰줍니다.
미리보기 모델로서 안정성과 성능이 프로덕션 준비 모델과 일치하지 않을 수 있습니다. 공개된 벤치마크가 없으므로 표준 로봇 작업에 대한 정확성을 알 수 없습니다. 기존 모델에 비해 실패율이 높거나 예상치 못한 동작이 발생할 수 있습니다. 이 모델은 이미지나 오디오 출력을 생성하지 않으며 텍스트만 출력합니다. 출력 토큰당 가격은 많은 모델에 비해 상대적으로 높습니다(백만 개당 $5.00). 또한 큰 출력 컨텍스트로 인해 항상 필요하지 않은 장황한 응답이 발생할 수 있습니다. 사용자는 이 모델을 진지한 애플리케이션에 적용하기 전에 광범위한 프로토타이핑을 수행해야 합니다.
google/gemini-robotics-er-1.6-preview on OrcaRouter의 요금 체계는 간단합니다: 입력 토큰 100만 개당 $1.00, 출력 토큰 100만 개당 $5.00입니다. 입력 및 출력 토큰 모두 Google의 토큰화 방식에 따라 계산되며, 이는 다른 모델과 다를 수 있습니다. OrcaRouter는 정확한 제공업체 요율을 적용하며 마크업이 전혀 없습니다. API 프록시 서비스에 대한 추가 수수료는 없습니다. 비용은 요청 및 응답에서 처리된 총 토큰 수를 기준으로 하며, 멀티모달 입력 토큰(예: 이미지 패치가 토큰으로 계산될 수 있음)을 포함합니다. 비용을 추적하려면 API 응답에서 반환된 사용량을 항상 확인하세요.
출력 토큰 비용($5.00/백만)은 입력 비용($1.00/백만)보다 현저히 높습니다. 이는 모델이 긴 응답을 생성하도록 하면 더 긴 입력을 제공하는 것보다 비용이 훨씬 더 증가한다는 것을 의미합니다. 출력 길이를 짧게 유지할 수 있는 사용 사례(예: 한 문장 명령)에서는 비용이 허용 가능할 수 있습니다. 그러나 전체 65,536 출력 컨텍스트를 활용하는 경우 단일 요청이 출력만으로 최대 $0.33까지 비용이 들 수 있습니다(65k 토큰, $5/백만 기준). 이를 출력 가격이 더 낮거나 컨텍스트 창이 더 작은 모델과 비교하세요. 또한, 멀티모달 입력은 많은 토큰을 필요로 하는 경우(예: 고해상도 이미지 또는 긴 비디오) 비용이 많이 들 수 있습니다. 가능한 경우 토큰 압축 또는 낮은 해상도 사용을 고려하세요.
OrcaRouter는 현재 제공업체 요율을 마크업 없이 적용합니다. 반복되는 프롬프트 접두사에 대한 비용을 줄이는 내장 캐싱 기능은 없습니다. 이는 패스스루 프록시이기 때문입니다. 그러나 애플리케이션 수준에서 캐싱을 구현할 수 있습니다: 동일한 입력 컨텍스트(예: 정적 시스템 프롬프트 또는 참조 이미지)를 재사용하는 경우 모델의 응답을 저장하고 재사용하여 반복적인 API 호출을 방지할 수 있습니다. OrcaRouter의 엔터프라이즈 플랜을 통해 할인 또는 볼륨 가격이 제공될 수 있습니다. 자세한 내용은 OrcaRouter 팀에 문의하십시오. 특별 계약이 체결되지 않은 경우 모든 사용에 표준 가격이 적용됩니다.
표준 OpenAI Chat Completions 엔드포인트를 사용하세요. 'model' 파라미터를 'google/gemini-robotics-er-1.6-preview'로 설정하세요. 기본 URL은 https://api.orcarouter.ai/v1입니다. Authorization 헤더에 OrcaRouter API 키를 포함하세요. 텍스트 전용 메시지의 경우 요청 본문은 OpenAI ChatCompletion 요청과 동일합니다: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. 멀티모달 입력의 경우, 콘텐츠를 공급자 스키마에 따라 type 및 data 필드가 있는 배열로 구성하세요. OrcaRouter는 요청을 내부적으로 Google 형식으로 변환합니다.
API는 OpenAI /v1/chat/completions 엔드포인트와 동일한 파라미터를 지원합니다: model, messages, max_tokens (최대 65536), temperature (0~2, 기본값 1), top_p (0~1, 기본값 1), frequency_penalty, presence_penalty, stop sequences, stream (boolean), logprobs, user. 일부 파라미터는 Google의 백엔드에서 효과적이지 않을 수 있습니다. 예를 들어, frequency_penalty와 presence_penalty는 제한된 효과를 가질 수 있습니다. 스트리밍의 경우, 'stream: true'로 설정하여 토큰 단위 응답을 수신하세요. 응답 형식은 OpenAI의 형식을 따르며, choices, usage (prompt_tokens, completion_tokens, total_tokens), id를 포함합니다. 모델별 파라미터 재정의에 대해서는 OrcaRouter 문서를 확인하세요.
OrcaRouter는 OpenAI와 호환되는 API를 제공하므로, 마이그레이션은 일반적으로 기본 URL과 API 키를 변경하는 문제입니다. 'https://api.openai.com/v1'을 'https://api.orcarouter.ai/v1'로 바꾸고 모델을 'google/gemini-robotics-er-1.6-preview'로 설정하세요. 앱에서 OpenAI Python 클라이언트를 사용하는 경우 base_url과 api_key를 업데이트하세요. 멀티모달 입력의 경우, OpenAI에서 이미지에 사용하는 형식은 'image_url'이지만 Google 형식은 다른 필드 이름(예: 'video_url')이 필요할 수 있습니다. OrcaRouter의 API는 OpenAI의 멀티모달 스키마의 상위 집합을 허용합니다. 정확한 구조는 해당 문서를 참조하세요. 복잡한 로직을 마이그레이션하기 전에 간단한 요청으로 테스트하세요.
Gemini 1.5 Pro는 성능과 비용 간의 강력한 균형을 제공하는 범용 멀티모달 모델입니다. robotics-er 프리뷰 모델은 이름에서 알 수 있듯이 로봇 공학 및 구현 추론에 특화되어 있습니다. Gemini 1.5 Pro는 일반적으로 최대 8,192개의 출력 토큰을 지원하는 반면, 이 모델은 최대 65,536개의 출력 토큰을 제공합니다. 가격은 다릅니다: Gemini 1.5 Pro는 입력 토큰 100만 개당 약 $1.25, 출력 토큰 100만 개당 약 $5.00이며, 따라서 이 모델은 입력에서 약간 저렴하지만 출력에서는 동일합니다. 그러나 프리뷰 모델은 일반 지식이 덜하고 물리적 세계 이해에 더 초점을 맞출 수 있습니다. 벤치마크 비교는 제공되지 않습니다. 사용자는 자신의 작업에 대해 테스트해야 합니다.
GPT-4o는 OpenAI의 멀티모달 모델로, 텍스트, 이미지, 오디오(비디오 제외)를 지원하며 출력 토큰 한도는 16,384개입니다. 로보틱스 모델은 훨씬 더 큰 출력 컨텍스트(65,536)를 가지며 GPT-4o가 기본적으로 지원하지 않는 비디오 입력을 명시적으로 지원합니다. 가격 차이: GPT-4o는 표준 사용 시 입력 백만 토큰당 $2.50, 출력 백만 토큰당 $10.00을 청구하므로 로보틱스 모델이 토큰당 더 저렴합니다. 하지만 GPT-4o는 광범위한 벤치마크를 갖춘 성숙한 프로덕션 모델인 반면, 이 모델은 프리뷰입니다. 로보틱스 특정 작업의 경우 Google 모델이 더 나은 성능을 위해 설계되었을 수 있지만, 공개 벤치마크가 없으므로 이는 추측에 불과합니다.
Llama 3 모델은 텍스트 전용(또는 곧 멀티모달)이지만 자체 호스팅이 가능하여 규모가 커질수록 비용 효율적입니다. 로보틱스-er 모델은 기본적으로 네이티브 멀티모달(비디오 및 오디오 포함) 지원을 제공하지만, 오픈소스 대안은 추가 구성 요소 없이는 이를 제공하지 못할 수 있습니다. 프리뷰 모델의 토큰당 가격은 대규모 사용 시 비쌀 수 있는 반면, 자체 하드웨어에서 실행되는 오픈소스 모델은 예측 가능한 인프라 비용이 듭니다. 그러나 Google 모델은 클라우드 규모의 인프라와 업데이트의 이점을 누립니다. 프로토타이핑의 경우, 프리뷰 모델의 사용 편의성(API를 통한)이 비용보다 중요할 수 있습니다. 개발 시간을 포함한 총소유비용을 평가하세요.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| 입력 / 1M tokens | $1.00 |
| 출력 / 1M tokens | $5.00 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
GET /api/public/models/google/gemini-robotics-er-1.6-preview열기 @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview