Мультимодальная предварительная модель Google для робототехники, поддерживающая ввод текста, изображений, видео и аудио с возможностью вывода до 65 536 токенов.
google/gemini-robotics-er-1.6-preview — это превью-модель из семейства Gemini от Google, оптимизированная для робототехники и воплощённого рассуждения. Это мультимодальная модель, способная…
Модель предназначена для мультимодального рассуждения, связанного с робототехникой. Она может интерпретировать изображения и видео для идентификации объектов, окружения и действий человека. Она может обрабатывать аудиокоманды и извлекать информацию из устной речи. Объединяя эти модальности, она может генерировать инструкции для манипуляции, навигации или взаимодействия робота. Например, при наличии видео кухни и устного запроса 'принеси яблоко со стойки', модель может выдать последовательность действий. Большой контекст вывода позволяет ей создавать подробные планы или код для контроллеров робота. Обратите внимание, что производительность модели на этих задачах еще не была публично протестирована для этой предварительной версии.
Если ваше приложение не требует мультимодальных входных данных (например, вы используете только текст), более компактная текстовая модель будет более экономически эффективной. Модель robotics-er оценивается относительно дорого за входные токены ($1.00 за миллион) по сравнению со многими универсальными моделями. Для простого ответа на вопросы или генерации текста без визуального или аудиоконтекста рассмотрите возможность использования более легкой модели, доступной через OrcaRouter, например Gemini 1.5 Flash или меньшей модели с открытым исходным кодом. Кроме того, если максимальный выход в 65 536 токенов не требуется, модель с меньшим контекстом вывода может обеспечить меньшую задержку и стоимость. Оцените, оправдывают ли мультимодальные возможности цену для вашего случая использования.
Ограничение на вывод в 65 536 токенов особенно ценно для генерации длинного контента, такого как последовательности движений роботов (например, код Python с использованием ROS или библиотек управления), подробные описания среды для трехмерной реконструкции или многошаговые планы задач, требующие обширных рассуждений. Его также можно использовать для обучения в контексте, когда модели даётся много примеров в одном запросе и ожидается получение всеобъемлющего результата. Для исследований в робототехнике это позволяет генерировать долгосрочные планы, охватывающие множество возможных непредвиденных обстоятельств. Однако имейте в виду, что более длинные выводы увеличивают стоимость и задержку, поэтому подумайте, не будет ли достаточным более короткий ответ.
Аудио- и видеовходы обрабатываются как часть мультимодального запроса. Когда вы отправляете видео, модель, вероятно, рассматривает его как последовательность кадров или использует видеокодер для понимания (точные методы являются внутренними для Google). Аудио может быть включено в виде URL-адреса к аудиофайлу. Модель может транскрибировать или понимать голосовые команды и генерировать текстовые ответы. Качество обработки аудио и видео зависит от частоты дискретизации и формата, поддерживаемых API Google Gemini; обратитесь к документации провайдера для получения информации о поддерживаемых типах файлов и максимальной длительности. OrcaRouter просто передает ввод в формате, совместимом с OpenAI.
В качестве предварительной версии Google не опубликовал конкретных показателей производительности для модели gemini-robotics-er-1.6-preview. Общие модели Gemini 1.6 показали высокую производительность в мультимодальных задачах, но этот вариант, ориентированный на робототехнику, может иметь другие сильные стороны. Пользователям следует оценивать производительность модели на своих собственных доменных задачах, прежде чем полагаться на нее. OrcaRouter не предоставляет показателей производительности сверх тех, что публикует поставщик. Для реальной надежности проводите A/B-тестирование с вашими собственными данными и сравнивайте задержку, точность и стоимость с другими моделями.
Задержка для google/gemini-robotics-er-1.6-preview не указана провайдером. В целом, мультимодальные модели, обрабатывающие видео и аудио, как правило, имеют более высокую задержку, чем текстовые модели, из-за накладных расходов на кодирование. Кроме того, большой выходной контекст может увеличить время ответа, особенно при длинных генерациях. Фактическая задержка зависит от размера запроса, сложности и нагрузки на сервер как в инфраструктуре Google, так и в прокси OrcaRouter. Для наилучшей производительности минимизируйте ненужные входные данные и устанавливайте соответствующий max_tokens. API OrcaRouter возвращает стандартные заголовки времени; их мониторинг даст вам эмпирические данные для вашего варианта использования.
Основная сила модели заключается в поддержке нескольких входных модальностей (текст, изображение, видео, аудио) в сочетании с исключительно большим выходным контекстом до 65 536 токенов. Это делает её хорошо подходящей для сложных задач робототехники, требующих понимания как визуальной, так и аудиальной информации и генерации обширных, детализированных планов. Предварительный характер модели предполагает, что это одна из первых моделей Gemini, настроенных для воплощённого мышления. Ещё одной сильной стороной является простой доступ через совместимый с OpenAI API от OrcaRouter, что снижает барьер интеграции для команд, знакомых с интерфейсом OpenAI.
Будучи предварительной моделью, ее стабильность и производительность могут не соответствовать готовым к выпуску моделям. Отсутствие опубликованных эталонов означает, что ее точность в стандартных задачах робототехники неизвестна. Она может иметь более высокий уровень сбоев или неожиданное поведение по сравнению с устоявшимися моделями. Модель не создает изображения или аудиовыходы, только текст. Цена за выходной токен относительно высока ($5.00 за миллион) по сравнению со многими моделями. Кроме того, большой контекст вывода может стимулировать многословные ответы, которые не всегда необходимы. Пользователям следует тщательно прототипировать перед тем, как принять решение об использовании этой модели для каких-либо серьезных приложений.
Тарификация google/gemini-robotics-er-1.6-preview на OrcaRouter проста: $1.00 за 1 миллион входных токенов и $5.00 за 1 миллион выходных токенов. Как входные, так и выходные токены подсчитываются в соответствии с токенизацией Google, которая может отличаться от других моделей. OrcaRouter взимает точную ставку провайдера без наценки. За услугу прокси-сервера API дополнительная плата не взимается. Стоимость рассчитывается на основе общего количества токенов, обработанных в запросе и ответе, включая мультимодальные входные токены (например, фрагменты изображений могут учитываться как токены). Всегда проверяйте использование, возвращаемое в ответе API, для отслеживания затрат.
Стоимость токенов на выходе ($5.00 за миллион) значительно выше, чем стоимость на входе ($1.00 за миллион). Это означает, что заставить модель генерировать длинные ответы увеличивает стоимость гораздо больше, чем предоставление более длинного ввода. Для сценариев использования, где длина вывода может быть короткой (например, команда в одно предложение), стоимость может быть приемлемой. Однако, если вы используете полный контекст вывода из 65,536 токенов, один запрос может стоить до $0.33 только за вывод (65k токенов по $5/M). Сравните это с моделями с более низкой ценой на вывод или меньшими окнами контекста. Кроме того, мультимодальные входные данные могут быть дорогими, если они требуют много токенов (например, изображения высокого разрешения или длинные видео). Рассмотрите сжатие токенов или использование более низкого разрешения, когда это возможно.
OrcaRouter в настоящее время применяет тариф провайдера с нулевой наценкой. Встроенное кэширование, снижающее стоимость для повторяющихся префиксов подсказок, отсутствует, так как это прокси-сервер прямого прохода. Однако вы можете реализовать кэширование на уровне приложения: если вы повторно используете одинаковые входные контексты (например, статические системные подсказки или эталонные изображения), сохраняйте ответ модели и используйте его повторно, избегая повторных вызовов API. Скидки или оптовые цены могут быть доступны через корпоративные планы OrcaRouter; свяжитесь с командой OrcaRouter для получения подробной информации. Стандартные цены применяются ко всем видам использования, если не действует специальное соглашение.
Используйте стандартную конечную точку OpenAI ChatCompletion. Установите параметр 'model' в значение 'google/gemini-robotics-er-1.6-preview'. Базовый URL: https://api.orcarouter.ai/v1. Включите ваш API-ключ OrcaRouter в заголовок Authorization. Для текстовых сообщений тело запроса идентично запросу OpenAI ChatCompletion: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Для мультимодальных входных данных структурируйте содержимое в виде массива с полями type и data в соответствии со схемой провайдера. OrcaRouter внутренне преобразует запрос в формат Google.
API поддерживает те же параметры, что и конечная точка OpenAI /v1/chat/completions: model, messages, max_tokens (до 65536), temperature (от 0 до 2, по умолчанию 1), top_p (от 0 до 1, по умолчанию 1), frequency_penalty, presence_penalty, стоп-последовательности, stream (логическое значение), logprobs и user. Не все параметры могут быть эффективны на серверной стороне Google; например, frequency_penalty и presence_penalty могут иметь ограниченное действие. Для потоковой передачи установите 'stream: true', чтобы получать ответы токен за токеном. Формат ответа соответствует OpenAI, включая choices, usage (prompt_tokens, completion_tokens, total_tokens) и id. Обратитесь к документации OrcaRouter для получения информации о любых переопределениях параметров, специфичных для модели.
Поскольку OrcaRouter предоставляет API, совместимый с OpenAI, миграция обычно сводится к изменению базового URL и ключа API. Замените 'https://api.openai.com/v1' на 'https://api.orcarouter.ai/v1' и установите модель 'google/gemini-robotics-er-1.6-preview'. Если ваше приложение использует клиент OpenAI для Python, обновите base_url и api_key. Для мультимодальных входных данных обратите внимание, что формат OpenAI для изображений использует 'image_url', но формат Google может требовать другие имена полей (например, 'video_url'). API OrcaRouter принимает надмножество мультимодальной схемы OpenAI; обратитесь к их документации за точной структурой. Протестируйте с помощью простого запроса перед миграцией сложной логики.
Gemini 1.5 Pro — это многоцелевая мультимодальная модель с отличным балансом производительности и стоимости. Предварительная модель robotics-er специализирована на робототехнике и воплощенном мышлении, как следует из ее названия. В то время как Gemini 1.5 Pro обычно поддерживает до 8 192 выходных токенов, эта модель предлагает до 65 536 выходных токенов. Цены различаются: Gemini 1.5 Pro стоит $1,25 за миллион входных токенов и $5,00 за миллион выходных токенов (приблизительно), поэтому эта модель немного дешевле на входе, но такая же на выходе. Однако предварительная модель может иметь меньше общих знаний и больше сосредоточена на понимании физического мира. Сравнения по тестам недоступны; пользователям следует тестировать на своих собственных задачах.
GPT-4o — это мультимодальная модель от OpenAI с поддержкой текста, изображений и аудио (не видео) и ограничением вывода в 16 384 токена. Модель robotics-er имеет гораздо больший выходной контекст (65 536) и явно поддерживает видеовход, чего нет у GPT-4o в стандартной версии. Различия в ценообразовании: GPT-4o взимает $2.50 за миллион входных токенов и $10.00 за миллион выходных токенов для стандартного использования, что делает робототехническую модель дешевле за токен. Однако GPT-4o — это зрелая производственная модель с обширными бенчмарками, в то время как эта модель является предварительной версией. Для задач, специфичных для робототехники, модель Google может быть спроектирована для лучшей производительности, но без публичных бенчмарков это предположительно.
Модели Llama 3 поддерживают только текст (или вскоре станут мультимодальными), но доступны для самостоятельного размещения, что может быть дешевле в масштабе. Модель robotics-er предлагает встроенную мультимодальную поддержку (включая видео и аудио) «из коробки», которую open-source альтернативы могут не предоставлять без дополнительных компонентов. Цена за токен ознакомительной модели может быть высокой при больших объёмах использования, тогда как open-source модель, запущенная на собственном оборудовании, имеет предсказуемые инфраструктурные затраты. Однако модель Google выигрывает от облачной инфраструктуры и обновлений. Для прототипирования простота использования ознакомительной модели (через API) может перевесить стоимость. Оцените совокупную стоимость владения, включая время разработки.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Ввод / 1M токенов | $1.00 |
| Вывод / 1M токенов | $5.00 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/google/gemini-robotics-er-1.6-previewОткрыть @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview