نموذج المعاينة متعدد الوسائط من Google للروبوتات، يدعم إدخالات النص والصورة والفيديو والصوت مع ما يصل إلى 65,536 رمز إخراج.
google/gemini-robotics-er-1.6-preview هو نموذج أولي من عائلة Gemini من Google مُحسَّن للروبوتات والاستدلال المُجسَّد. إنه نموذج متعدد الوسائط يمكنه معالجة النصوص والصور والفيديو والمدخلات الصوتية. من…
الموديل مصمم للاستدلال متعدد الوسائط المتعلق بالروبوتات. يمكنه تفسير الصور والفيديو لتحديد الأشياء والبيئات والإجراءات البشرية. كما يمكنه معالجة الأوامر الصوتية واستخراج المعلومات من اللغة المنطوقة. من خلال دمج هذه الوسائط، يمكنه توليد تعليمات للتلاعب بالروبوتات أو التنقل أو التفاعل. على سبيل المثال، عند إعطائه فيديو لمطبخ وطلب منطوق "أحضر التفاحة من المنضدة"، يمكن للموديل إخراج سلسلة من الإجراءات. سياق الإخراج الكبير يمكنه من إنتاج خطط تفصيلية أو كود لوحدات التحكم في الروبوت. يُلاحظ أن أداء الموديل في هذه المهام لم يتم قياسه علنًا بعد لهذه النسخة التجريبية الأولية.
إذا كان تطبيقك لا يتطلب مدخلات متعددة الوسائط (على سبيل المثال، تستخدم النص فقط)، فإن نموذجًا نصيًا أصغر سيكون أكثر فعالية من حيث التكلفة. نموذج robotics-er مسعر بسعر مرتفع نسبيًا لرموز الإدخال (1.00 دولار لكل مليون) مقارنة بالعديد من النماذج العامة. للإجابة البسيطة على الأسئلة أو توليد النص دون سياق بصري أو صوتي، فكر في استخدام نموذج أخف متاح عبر OrcaRouter، مثل Gemini 1.5 Flash أو نموذج مفتوح المصدر أصغر. أيضًا، إذا كان الحد الأقصى للإخراج البالغ 65,536 رمزًا غير ضروري، فإن نموذجًا بسياق إخراج أصغر قد يوفر زمن استجابة وتكلفة أقل. قيم ما إذا كانت القدرات متعددة الوسائط تبرر السعر لحالة الاستخدام الخاصة بك.
يُعد حد الإخراج البالغ 65,536 رمزًا مفيدًا بشكل خاص لتوليد محتوى طويل مثل تسلسلات الحركة الروبوتية (على سبيل المثال، كود Python باستخدام ROS أو مكتبات التحكم)، ووصف البيئات المفصل لإعادة البناء ثلاثي الأبعاد، أو خطط المهام متعددة الخطوات التي تتطلب استدلالًا واسعًا. ويمكن استخدامه أيضًا في التعلم السياقي، حيث يُعطى النموذج أمثلة عديدة ضمن مطالبة واحدة ويُتوقع منه إنتاج مخرجات شاملة. وفي أبحاث الروبوتات، يتيح ذلك توليد خطط طويلة المدى تغطي العديد من الاحتمالات المحتملة. ومع ذلك، لاحظ أن المخرجات الأطول تزيد التكلفة وزمن الاستجابة، لذا فكر فيما إذا كانت الاستجابة الأقصر كافية.
تتم معالجة المدخلات الصوتية والمرئية كجزء من الاستعلام متعدد الوسائط. عند إرسال فيديو، يعالج النموذج المحتوى على الأرجح كسلسلة من الإطارات أو يستخدم مشفرًا لفهم الفيديو (الطرق الدقيقة داخلية من Google). يمكن تضمين الصوت كرابط URL لملف صوتي. يمكن للنموذج نسخ الأوامر المنطوقة أو فهمها وتوليد استجابات نصية وفقًا لذلك. تعتمد جودة معالجة الصوت والفيديو على التنسيق ومعدل العينات المدعومين من واجهة Gemini API من Google؛ يُرجى الرجوع إلى وثائق المزوّد للحصول على أنواع الملفات المدعومة والحدود القصوى للمدة. يقوم OrcaRouter ببساطة بتوجيه المدخلات بصيغة متوافقة مع OpenAI.
كإصدار تجريبي، لم تنشر Google نتائج قياس أداء محددة لنموذج gemini-robotics-er-1.6-preview. أظهرت نماذج Gemini 1.6 العامة أداءً قويًا في المهام متعددة الوسائط، ولكن هذا النوع المخصص للروبوتات قد يكون له نقاط قوة مختلفة. يجب على المستخدمين تقييم أداء النموذج على مهامهم الخاصة بمجالهم قبل الاعتماد عليه. لا يوفر OrcaRouter أرقام قياس أداء تتجاوز ما ينشره المزود. للحصول على موثوقية في العالم الحقيقي، قم بإجراء اختبار A/B باستخدام بياناتك الخاصة وقارن زمن الاستجابة والدقة والتكلفة مع النماذج الأخرى.
لم يتم تحديد زمن الاستجابة لنموذج google/gemini-robotics-er-1.6-preview من قِبَل المزود. بشكل عام، تميل النماذج متعددة الوسائط التي تعالج الفيديو والصوت إلى زمن استجابة أعلى من النماذج النصية فقط بسبب الحمل الزائد للتشفير. بالإضافة إلى ذلك، يمكن أن يؤدي سياق الإخراج الكبير إلى زيادة وقت الاستجابة، خاصةً للتوليدات الطويلة. يعتمد زمن الاستجابة الفعلي على حجم الطلب، وتعقيده، وحمل الخادم على كل من البنية التحتية لجوجل ووكيل OrcaRouter. للحصول على أفضل أداء، قلل من بيانات الإدخال غير الضرورية واضبط max_tokens المناسب. توفر واجهة برمجة تطبيقات OrcaRouter رؤوس توقيت قياسية؛ ومراقبتها ستمنحك بيانات تجريبية لحالة الاستخدام الخاصة بك.
القوة الرئيسية للنموذج هي دعمه لعدة وسائط إدخال (نص، صورة، فيديو، صوت) مقترنة بسياق إخراج كبير بشكل استثنائي يصل إلى 65,536 رمزًا. وهذا يجعله مناسبًا تمامًا لمهام الروبوتات المعقدة التي تتطلب فهم المعلومات البصرية والسمعية معًا وتوليد خطط موسعة وغنية بالتفاصيل. تشير طبيعة المعاينة إلى أنه من بين نماذج Gemini الأولى التي تم ضبطها بدقة للاستدلال المتجسد. قوة أخرى هي الوصول المباشر عبر واجهة برمجة التطبيقات المتوافقة مع OpenAI من OrcaRouter، مما يقلل من حاجز التكامل للفرق المألوفة بواجهة OpenAI.
كنموذج معاينة، قد لا يتطابق استقراره وأداؤه مع النماذج الجاهزة للإنتاج. عدم وجود معايير منشورة يعني أن دقته في المهام الروبوتية القياسية غير معروفة. قد يكون لديه معدلات فشل أعلى أو سلوكيات غير متوقعة مقارنة بالنماذج الراسخة. النموذج لا ينتج صورًا أو مخرجات صوتية، فقط نصًا. سعر كل مليون رمز مخرج مرتفع نسبيًا ($5.00 لكل مليون) مقارنة بالعديد من النماذج. بالإضافة إلى ذلك، قد يشجع سياق الإخراج الكبير على ردود مطولة ليست ضرورية دائمًا. يجب على المستخدمين إنشاء نماذج أولية بشكل مكثف قبل الالتزام بهذا النموذج لأي تطبيق جاد.
الفوترة لـ google/gemini-robotics-er-1.6-preview على OrcaRouter مباشرة: 1.00 دولار لكل مليون رمز إدخال و5.00 دولار لكل مليون رمز إخراج. يتم حساب كل من رموز الإدخال والإخراج وفقًا لترميز Google، والذي قد يختلف عن النماذج الأخرى. يفرض OrcaRouter السعر الدقيق للمزود بدون هامش ربح. لا توجد رسوم إضافية لخدمة وكيل API. تعتمد التكلفة على إجمالي عدد الرموز المعالجة في الطلب والاستجابة، بما في ذلك رموز الإدخال متعددة الوسائط (على سبيل المثال، قد تُعد أجزاء الصورة كرموز). تحقق دائمًا من الاستخدام المُعاد في استجابة API لتتبع التكاليف.
تكلفة رمز الإخراج (5.00 دولار لكل مليون) أعلى بكثير من تكلفة الإدخال (1.00 دولار لكل مليون). هذا يعني أن جعل النموذج يولد ردودًا طويلة يزيد التكلفة أكثر بكثير من توفير إدخال أطول. بالنسبة لحالات الاستخدام حيث يمكن إبقاء طول الإخراج قصيرًا (على سبيل المثال، أمر من جملة واحدة)، قد تكون التكلفة مقبولة. ومع ذلك، إذا استفدت من سياق الإخراج الكامل البالغ 65,536 رمزًا، فقد تصل تكلفة طلب واحد إلى 0.33 دولار فقط للإخراج (65k رمز بسعر 5 دولارات للمليون). قارن هذا بالنماذج ذات تسعير الإخراج الأقل أو نوافذ السياق الأصغر. أيضًا، يمكن أن تكون المدخلات متعددة الوسائط باهظة الثمن إذا تطلبت العديد من الرموز (على سبيل المثال، الصور عالية الدقة أو مقاطع الفيديو الطويلة). فكر في ضغط الرموز أو استخدام دقة أقل عند الإمكان.
يطبق OrcaRouter حاليًا سعر المزود دون أي هوامش ربح. لا توجد آلية تخزين مؤقت مدمجة تقلل التكلفة للبادئات المتكررة للاستعلامات، حيث أنه يعمل كبروكسي عابر. مع ذلك، يمكنك تنفيذ التخزين المؤقت على مستوى التطبيق: إذا أعدت استخدام نصوص إدخال متطابقة (مثل التعليمات النظامية الثابتة أو الصور المرجعية)، قم بتخزين استجابة النموذج وإعادة استخدامها، لتجنب استدعاءات API المتكررة. قد تكون الخصومات أو التسعير الحجمي متاحة عبر خطط OrcaRouter للمؤسسات؛ اتصل بفريق OrcaRouter للحصول على التفاصيل. ينطبق التسعير القياسي على جميع الاستخدامات ما لم يكن هناك اتفاق خاص.
استخدم نقطة نهاية محادثات OpenAI القياسية. عيّن معامل 'model' إلى 'google/gemini-robotics-er-1.6-preview'. عنوان URL الأساسي هو https://api.orcarouter.ai/v1. قم بتضمين مفتاح API الخاص بـ OrcaRouter في رأس Authorization. بالنسبة للرسائل النصية فقط، يكون نص الطلب مطابقًا لطلب ChatCompletion الخاص بـ OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. بالنسبة للإدخالات متعددة الوسائط، قم بتنظيم المحتوى كمصفوفة تحتوي على حقول type و data وفقًا لمخطط المزود. يقوم OrcaRouter بترجمة الطلب إلى صيغة Google داخليًا.
تدعم واجهة API نفس الوسائط التي يدعمها نقطة النهاية /v1/chat/completions من OpenAI: model، messages، max_tokens (حتى 65536)، temperature (0 إلى 2، الافتراضي 1)، top_p (0 إلى 1، الافتراضي 1)، frequency_penalty، presence_penalty، تسلسلات الإيقاف stop sequences، stream (قيمة منطقية)، logprobs، و user. قد لا تكون جميع الوسائط فعّالة على الخادم الخلفي لـ Google؛ على سبيل المثال، قد يكون لـ frequency_penalty و presence_penalty تأثير محدود. للتدفق، قم بتعيين 'stream: true' لتلقي الاستجابات رمزًا تلو الآخر. يتطابق تنسيق الاستجابة مع تنسيق OpenAI، بما في ذلك choices، usage (prompt_tokens، completion_tokens، total_tokens)، و id. راجع وثائق OrcaRouter لمعرفة أي تجاوزات خاصة بنموذج معين.
بما أن OrcaRouter يوفر واجهة برمجة تطبيقات متوافقة مع OpenAI، فإن عملية الترحيل غالبًا ما تقتصر على تغيير عنوان URL الأساسي ومفتاح API. استبدل 'https://api.openai.com/v1' بـ 'https://api.orcarouter.ai/v1' واضبط النموذج على 'google/gemini-robotics-er-1.6-preview'. إذا كان تطبيقك يستخدم عميل Python الخاص بـ OpenAI، فقم بتحديث base_url وapi_key. بالنسبة للإدخالات متعددة الوسائط، لاحظ أن تنسيق OpenAI للصور يستخدم 'image_url'، لكن تنسيق Google قد يتطلب أسماء حقول مختلفة (مثل 'video_url'). تقبل واجهة OrcaRouter مجموعة شاملة من مخطط OpenAI متعدد الوسائط؛ راجع وثائقهم للحصول على التركيبة الدقيقة. اختبر الطلب بطلب بسيط قبل ترحيل المنطق المعقد.
Gemini 1.5 Pro هو نموذج متعدد الوسائط للأغراض العامة يتمتع بتوازن قوي بين الأداء والتكلفة. نموذج المعاينة robotics-er متخصص في الروبوتات والاستدلال المتجسد، كما يوحي اسمه. بينما يدعم Gemini 1.5 Pro عادةً ما يصل إلى 8,192 رمز إخراج، فإن هذا النموذج يقدم ما يصل إلى 65,536 رمز إخراج. تختلف الأسعار: تبلغ تكلفة Gemini 1.5 Pro حوالي 1.25 دولار لكل مليون رمز إدخال و5.00 دولارات لكل مليون رمز إخراج، لذا فإن هذا النموذج أرخص قليلاً في الإدخال لكنه مماثل في الإخراج. ومع ذلك، قد يحتوي نموذج المعاينة على معرفة عامة أقل وتركيز أكثر على فهم العالم المادي. المقارنات المعيارية غير متوفرة؛ يجب على المستخدمين الاختبار على مهامهم الخاصة.
GPT-4o هو نموذج متعدد الوسائط من OpenAI يدعم النصوص والصور والصوت (بدون فيديو) وحد أقصى لإخراج الرموز يبلغ 16,384 رمزًا. أما نموذج الروبوتات فلديه سياق إخراج أكبر بكثير (65,536) ويدعم صراحة إدخال الفيديو، وهو ما لا يدعمه GPT-4o أصلاً. اختلافات الأسعار: يتقاضى GPT-4o 2.50 دولار لكل مليون رمز إدخال و 10.00 دولار لكل مليون رمز إخراج للاستخدام القياسي، مما يجعل نموذج الروبوتات أرخص لكل رمز. ومع ذلك، فإن GPT-4o هو نموذج إنتاج ناضج مع معايير قياسية واسعة، في حين أن هذا النموذج هو نسخة معاينة. بالنسبة للمهام الخاصة بالروبوتات، قد يكون نموذج Google مصممًا لأداء أفضل، ولكن بدون معايير قياسية عامة، يبقى هذا تخمينًا.
نماذج Llama 3 هي نماذج نصية فقط (أو قريبًا متعددة الوسائط) ولكنها متاحة للاستضافة الذاتية، مما قد يكون أرخص على نطاق واسع. النموذج المتخصص في الروبوتات يقدم دعمًا أصليًا متعدد الوسائط (يشمل الفيديو والصوت) مباشرة خارج الصندوق، وهو ما قد لا توفره البدائل مفتوحة المصدر دون مكونات إضافية. التسعير لكل رمز مميز للنموذج التجريبي يمكن أن يكون مكلفًا للاستخدام عالي الحجم، بينما النموذج مفتوح المصدر الذي يعمل على أجهزتك الخاصة له تكاليف بنية تحتية متوقعة. ومع ذلك، فإن نموذج Google يستفيد من البنية التحتية السحابية واسعة النطاق والتحديثات. من أجل النماذج الأولية، قد تفوق سهولة استخدام النموذج التجريبي (عبر API) التكلفة. قم بتقييم التكلفة الإجمالية للملكية بما في ذلك وقت التطوير.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| الإدخال / 1M توكن | $1.00 |
| الإخراج / 1M توكن | $5.00 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
ما يتحدث عنه المطورون هذا الأسبوع
GET /api/public/models/google/gemini-robotics-er-1.6-previewفتح @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview