Model pratinjau multimodal Google untuk robotika, mendukung input teks, gambar, video, dan audio dengan hingga 65,536 token keluaran.
google/gemini-robotics-er-1.6-preview adalah model pratinjau dari keluarga Gemini Google yang dioptimalkan untuk robotika dan penalaran yang melekat (embodied reasoning). Ini adalah model multimodal…
Model ini dirancang untuk penalaran multimodal yang berhubungan dengan robotika. Model ini dapat menafsirkan gambar dan video untuk mengidentifikasi objek, lingkungan, dan tindakan manusia. Model ini dapat memproses perintah audio dan mengekstrak informasi dari bahasa lisan. Dengan menggabungkan modalitas-modalitas ini, model dapat menghasilkan instruksi untuk manipulasi robot, navigasi, atau interaksi. Misalnya, diberikan video dapur dan permintaan lisan untuk 'mengambil apel dari meja', model dapat menghasilkan urutan tindakan. Konteks keluaran yang besar memungkinkannya untuk menghasilkan rencana atau kode yang terperinci untuk pengendali robot. Perhatikan bahwa kinerja model pada tugas-tugas ini belum diuji secara terbuka untuk versi pratinjau ini.
Jika aplikasi Anda tidak memerlukan input multimodal (misalnya, Anda hanya menggunakan teks), model teks-saja yang lebih kecil akan lebih hemat biaya. Harga model robotics-er relatif tinggi untuk token masukan ($1,00 per juta) dibandingkan dengan banyak model tujuan umum. Untuk menjawab pertanyaan sederhana atau pembuatan teks tanpa konteks visual atau audio, pertimbangkan untuk menggunakan model yang lebih ringan yang tersedia melalui OrcaRouter, seperti Gemini 1.5 Flash atau model sumber terbuka yang lebih kecil. Juga, jika output maksimum 65,536 token tidak diperlukan, model dengan konteks output yang lebih kecil dapat menawarkan latensi dan biaya yang lebih rendah. Evaluasi apakah kemampuan multimodal membenarkan harga untuk kasus penggunaan Anda.
Batas output 65,536 token sangat berharga untuk menghasilkan konten panjang seperti urutan gerakan robot (misalnya, kode Python menggunakan ROS atau pustaka kontrol), deskripsi lingkungan yang detail untuk rekonstruksi 3D, atau rencana tugas multi-langkah yang memerlukan penalaran ekstensif. Ini juga dapat digunakan untuk pembelajaran dalam konteks, di mana model diberikan banyak contoh dalam satu prompt dan diharapkan menghasilkan output yang komprehensif. Untuk penelitian robotika, hal ini memungkinkan pembuatan rencana horizon panjang yang mencakup banyak kemungkinan kontingensi. Namun, perhatikan bahwa output yang lebih panjang meningkatkan biaya dan latensi, jadi pertimbangkan apakah respons yang lebih pendek sudah cukup.
Input audio dan video diproses sebagai bagian dari prompt multimodal. Saat Anda mengirim video, model kemungkinan memperlakukannya sebagai rangkaian bingkai atau menggunakan encoder pemahaman video (metode pastinya adalah internal Google). Audio dapat disertakan sebagai URL ke file audio. Model dapat mentranskripsikan atau memahami perintah lisan dan menghasilkan respons teks sesuai. Kualitas pemrosesan audio dan video bergantung pada sampling dan format yang didukung oleh API Gemini Google; konsultasikan dokumentasi penyedia untuk jenis file dan durasi maksimum yang didukung. OrcaRouter cukup menyampaikan input dalam format yang kompatibel dengan OpenAI.
Sebagai rilis pratinjau, Google belum mempublikasikan skor benchmark spesifik untuk model gemini-robotics-er-1.6-preview. Model Gemini 1.6 umum telah menunjukkan performa yang kuat pada tugas multimodal, tetapi varian khusus robotika ini mungkin memiliki keunggulan yang berbeda. Pengguna harus mengevaluasi performa model pada tugas spesifik domain mereka sendiri sebelum mengandalkannya. OrcaRouter tidak menyediakan angka benchmark di luar yang dipublikasikan oleh penyedia. Untuk keandalan dunia nyata, lakukan pengujian A/B dengan data Anda sendiri dan bandingkan latensi, akurasi, serta biaya dengan model lain.
Latensi untuk google/gemini-robotics-er-1.6-preview tidak ditentukan oleh penyedia. Secara umum, model multimodal yang memproses video dan audio cenderung memiliki latensi yang lebih tinggi dibandingkan model teks saja karena overhead pengkodean. Selain itu, konteks output yang besar dapat meningkatkan waktu respons, terutama untuk generasi yang panjang. Latensi aktual tergantung pada ukuran permintaan, kompleksitas, dan beban server pada infrastruktur Google maupun proksi OrcaRouter. Untuk kinerja terbaik, minimalkan data input yang tidak perlu dan atur max_tokens yang sesuai. API OrcaRouter mengembalikan header waktu standar; memantau hal tersebut akan memberi Anda data empiris untuk kasus penggunaan Anda.
Kekuatan utama model ini adalah dukungannya terhadap berbagai modalitas input (teks, gambar, video, audio) yang dikombinasikan dengan konteks output yang sangat besar, hingga 65.536 token. Hal ini membuatnya sangat cocok untuk tugas robotika kompleks yang memerlukan pemahaman informasi visual dan auditori serta pembuatan rencana yang ekstensif dan kaya detail. Sifat pratinjau ini menunjukkan bahwa model ini termasuk salah satu model Gemini pertama yang disesuaikan untuk penalaran terwujud. Kekuatan lainnya adalah akses mudah melalui API yang kompatibel dengan OpenAI dari OrcaRouter, yang menurunkan hambatan integrasi bagi tim yang akrab dengan antarmuka OpenAI.
Sebagai model pratinjau, stabilitas dan kinerjanya mungkin tidak sebanding dengan model yang siap produksi. Kurangnya tolok ukur yang dipublikasikan berarti akurasinya pada tugas robotika standar tidak diketahui. Model ini mungkin memiliki tingkat kegagalan yang lebih tinggi atau perilaku yang tidak terduga dibandingkan dengan model yang sudah mapan. Model ini tidak menghasilkan gambar atau keluaran audio, hanya teks. Harga per token keluaran relatif tinggi ($5.00 per juta) dibandingkan dengan banyak model. Selain itu, konteks keluaran yang besar dapat mendorong respons yang bertele-tele yang tidak selalu diperlukan. Pengguna harus melakukan purwarupa secara ekstensif sebelum berkomitmen menggunakan model ini untuk aplikasi serius apa pun.
Tagihan untuk google/gemini-robotics-er-1.6-preview di OrcaRouter bersifat langsung: $1,00 per 1 juta token input dan $5,00 per 1 juta token output. Baik token input maupun output dihitung berdasarkan tokenisasi Google, yang mungkin berbeda dari model lain. OrcaRouter mengenakan tarif persis dari penyedia tanpa markup. Tidak ada biaya tambahan untuk layanan proxy API. Biaya didasarkan pada jumlah total token yang diproses dalam permintaan dan respons, termasuk token input multimodal (misalnya, potongan gambar dapat dihitung sebagai token). Selalu periksa penggunaan yang dikembalikan dalam respons API untuk melacak biaya.
Biaya token output ($5.00 per juta) secara signifikan lebih tinggi daripada biaya input ($1.00 per juta). Ini berarti membuat model menghasilkan respons panjang meningkatkan biaya jauh lebih banyak daripada memberikan input yang lebih panjang. Untuk kasus penggunaan di mana panjang output dapat dijaga pendek (mis., perintah satu kalimat), biaya mungkin dapat diterima. Namun, jika Anda memanfaatkan konteks output penuh 65,536, satu permintaan bisa menghabiskan biaya hingga $0.33 hanya untuk output (65k token pada $5/M). Bandingkan ini dengan model yang memiliki harga output lebih rendah atau jendela konteks yang lebih kecil. Juga, input multimodal bisa mahal jika memerlukan banyak token (mis., gambar resolusi tinggi atau video panjang). Pertimbangkan kompresi token atau menggunakan resolusi lebih rendah jika memungkinkan.
OrcaRouter saat ini menerapkan tarif penyedia dengan markup nol. Tidak ada caching bawaan yang mengurangi biaya untuk prefiks prompt yang berulang, karena ini adalah proxy passthrough. Namun, Anda dapat menerapkan caching di tingkat aplikasi: jika Anda menggunakan kembali konteks input yang identik (misalnya, prompt sistem statis atau gambar referensi), simpan respons model dan gunakan kembali, sehingga menghindari panggilan API yang berulang. Diskon atau harga volume mungkin tersedia melalui paket enterprise OrcaRouter; hubungi tim OrcaRouter untuk informasi lebih lanjut. Harga standar berlaku untuk semua penggunaan kecuali ada perjanjian khusus yang berlaku.
Gunakan endpoint chat completions standar OpenAI. Atur parameter 'model' menjadi 'google/gemini-robotics-er-1.6-preview'. URL dasarnya adalah https://api.orcarouter.ai/v1. Sertakan kunci API OrcaRouter Anda di header Authorization. Untuk pesan teks saja, body permintaan identik dengan permintaan OpenAI ChatCompletion: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Untuk input multimodal, susun konten sebagai array dengan bidang tipe dan data sesuai dengan skema penyedia. OrcaRouter menerjemahkan permintaan ke format Google secara internal.
API mendukung parameter yang sama dengan endpoint OpenAI /v1/chat/completions: model, messages, max_tokens (hingga 65536), temperature (0 hingga 2, default 1), top_p (0 hingga 1, default 1), frequency_penalty, presence_penalty, stop sequences, stream (boolean), logprobs, dan user. Tidak semua parameter mungkin efektif di backend Google; misalnya, frequency_penalty dan presence_penalty mungkin memiliki efek terbatas. Untuk streaming, atur 'stream: true' untuk menerima respons token per token. Format respons meniru OpenAI, termasuk choices, usage (prompt_tokens, completion_tokens, total_tokens), dan id. Periksa dokumentasi OrcaRouter untuk setiap penggantian parameter khusus model.
Karena OrcaRouter menyediakan API yang kompatibel dengan OpenAI, migrasi biasanya hanya masalah mengubah URL dasar dan kunci API. Ganti 'https://api.openai.com/v1' dengan 'https://api.orcarouter.ai/v1' dan atur model ke 'google/gemini-robotics-er-1.6-preview'. Jika aplikasi Anda menggunakan klien Python OpenAI, perbarui base_url dan api_key. Untuk input multimodal, perhatikan bahwa format OpenAI untuk gambar menggunakan 'image_url', tetapi format Google mungkin memerlukan nama bidang yang berbeda (seperti 'video_url'). API OrcaRouter menerima superset dari skema multimodal OpenAI; lihat dokumentasi mereka untuk struktur yang tepat. Uji dengan permintaan sederhana sebelum memigrasikan logika yang kompleks.
Gemini 1.5 Pro adalah model multimodal serbaguna dengan keseimbangan performa dan biaya yang baik. Model pratinjau robotics-er dirancang khusus untuk robotika dan penalaran berwujud, sesuai dengan namanya. Meskipun Gemini 1.5 Pro biasanya mendukung hingga 8.192 token keluaran, model ini menawarkan hingga 65.536 token keluaran. Perbedaan harga: Gemini 1.5 Pro berharga sekitar $1,25 per juta token masukan dan $5,00 per juta token keluaran, sehingga model ini sedikit lebih murah untuk masukan tetapi sama untuk keluaran. Namun, model pratinjau mungkin memiliki pengetahuan umum yang lebih sedikit dan lebih fokus pada pemahaman dunia fisik. Perbandingan tolok ukur tidak tersedia; pengguna harus menguji pada tugas mereka sendiri.
GPT-4o adalah model multimodal dari OpenAI yang mendukung teks, gambar, dan audio (non-video) dengan batas keluaran 16.384 token. Model robotics-er memiliki konteks keluaran yang jauh lebih besar (65.536) dan secara eksplisit mendukung masukan video, yang tidak didukung secara asli oleh GPT-4o. Perbedaan harga: GPT-4o mengenakan biaya $2,50 per juta masukan dan $10,00 per juta token keluaran untuk penggunaan standar, sehingga model robotics lebih murah per token. Namun, GPT-4o adalah model produksi yang matang dengan tolok ukur yang luas, sementara model ini adalah pratinjau. Untuk tugas-tugas spesifik robotika, model Google mungkin dirancang untuk kinerja yang lebih baik, tetapi tanpa tolok ukur publik, ini bersifat spekulatif.
Model Llama 3 hanya berbasis teks (atau segera multimodal) tetapi tersedia untuk dihosting sendiri, yang bisa lebih murah dalam skala besar. Model robotics-er menawarkan dukungan multimodal bawaan (termasuk video dan audio) langsung dari awal, yang mungkin tidak disediakan oleh alternatif sumber terbuka tanpa komponen tambahan. Harga per-token dari model pratinjau bisa mahal untuk penggunaan volume tinggi, sedangkan model sumber terbuka yang dijalankan di perangkat keras Anda sendiri memiliki biaya infrastruktur yang dapat diprediksi. Namun, model Google mendapatkan keuntungan dari infrastruktur dan pembaruan berskala cloud. Untuk pembuatan prototipe, kemudahan penggunaan model pratinjau (melalui API) mungkin lebih penting daripada biaya. Evaluasi total biaya kepemilikan Anda termasuk waktu pengembangan.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Input / 1M token | $1.00 |
| Output / 1M token | $5.00 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/google/gemini-robotics-er-1.6-previewBuka @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview