
Gemini Robotics ER 2: عقل الروبوت الاستدلالي المجسّد من Google DeepMind، شرح
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3150الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 206 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicجديدAnthropic: Claude Opus 52026-07-2461الذكاء78البرمجة
- googleجديدGoogle: Gemini 3.6 Flash2026-07-2150الذكاء69البرمجة
- googleجديدGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1651الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1557الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0951الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0955الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0959الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0854الذكاء72البرمجة
- tencentTencent: Hy32026-07-0641الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3053الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1651الذكاء69البرمجة60الرياضيات
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242الذكاء61البرمجة61الرياضيات
- anthropicAnthropic: Claude Fable 52026-06-0960الذكاء77البرمجة
نموذج Google DeepMind Gemini Robotics ER 2 — الذي صدر في المعاينة العامة في 30 يوليو 2026 — هو نموذج رؤية ولغة متخصص صُمم ليكون "الدماغ" رفيع المستوى للروبوت. تعني "ER" الاستدلال المجسّد (Embodied Reasoning): فبدلاً من قيادة المحركات مباشرةً، يرى ER 2 العالم المادي ويفهمه، ويُفكر في المكان والزمان، ويخطط لمهام متعددة الخطوات، ويستدعي الأدوات، وينسق الروبوتات. كما يتضمن نسخة بثّ فوري للتحكم التفاعلي منخفض الكمون. يشرح هذا الدليل ماهية ER 2، وكيف يختلف عن نموذج التحكم المباشر، وما الجديد مقارنةً بـ ER 1.6، وأين يندمج — مع قدرات موثّقة المصادر.
ملاحظة حول الدقة: ادعاءات القدرات والتوافر والسلامة مأخوذة من إعلان Google DeepMind وسجل تغييرات Gemini API (2026-07-30). معايير الروبوتات مبكرة ومُبلَّغ عنها من الموردين؛ وتتبع التسعيرة فوترة Gemini API القياسية ولم تُنشر التفاصيل. تتبدل التفاصيل — تحقق قبل البناء.
الخلاصة. Gemini Robotics ER 2 هو VLM ذو استدلال تجسيدي يعمل كعقل تخطيط وإدراك للروبوت: فهم الفيديو، الاستدلال المكاني، تنسيق الأدوات متعددة الخطوات، تحديد لحظات الفيديو، تتبع التقدم، تنسيق الروبوتات المتعددة، والتصحيح الذاتي، مع نسخة بث للتفاعل الصوتي والمرئي ثنائي الاتجاه في الوقت الفعلي. وهو متاح في Gemini API (code>gemini-robotics-er-2-preview/code> و code>gemini-robotics-er-2-streaming-preview/code>) وGoogle AI Studio، كمعاينة مغلقة. تضعها Google كأكثر نماذجها أمانًا للروبوتات حتى الآن، مع تحسينات ملحوظة مقارنةً بـ ER 1.6 في تنسيق الروبوتات المتعددة وتتبع التقدم. إنها طبقة استدلال، وليست متحكمًا منخفض المستوى في المشغلات.
النقاط الرئيسية
• الاستدلال الجسدي (ER): ER 2 هو الدماغ عالي المستوى للإدراك والتخطيط، وليس متحكمًا حركيًا مباشرًا (هذا هو خط VLA/الجهاز المنفصل).
• المهارات الأساسية: فهم الفيديو، الاستدلال المكاني، تنسيق الأدوات متعددة الخطوات، تحديد لحظات الفيديو، تصنيف التقدم، تنسيق الروبوتات المتعددة، التصحيح الذاتي.
• نسخة البث المباشر: code>gemini-robotics-er-2-streaming-preview/code> تضيف تفاعلًا سمعيًا بصريًا ثنائي الاتجاه منخفض الكمون للتحكم والحوار في الوقت الفعلي.
{{1}}السلامة أولاً:{{/1}} تضع Google نموذج ER 2 كأكثر نماذجها الروبوتية أمانًا في الالتزام بقيود السلامة والقرب من البشر، مع مكاسب معيار {{2}}ASIMOV2{{/2}}.
• التوفر: Gemini API + Google AI Studio (معاينة عامة)؛ Enterprise Agent Platform في معاينة خاصة؛ نماذج VLA/على الجهاز مقتصرة على الشركاء الأوائل. مغلق.
ما معنى "الاستدلال المتجسد"؟
أصبحت منظومات الروبوتات الحديثة تنقسم بشكل متزايد إلى طبقتين. دماغ استدلال عالي المستوى يفهم المشهد، ويقرر ما يجب فعله، ويخطط؛ بينما يترجم نموذج الحركة منخفض المستوى الخطط إلى أوامر حركية دقيقة. Gemini Robotics ER 2 هو الطبقة الأولى: نموذج لغوي-بصري للاستدلال التجسيدي. يستقبل الفيديو (والصوت والنص)، ويبني فهمًا للأشياء والفضاء والتقدم بمرور الوقت، ويُخرج خططًا واستدعاءات أدوات — بما في ذلك استدعاء أدوات خارجية مثل Google Search — يمكن لنظام حركة منفصل أو لإنسان تنفيذها. بعبارة أخرى، ER 2 هو الجزء من الروبوت الذي يفكر، وليس الجزء الذي يتحرك؛ نماذج Google للتحكم المباشر القائمة على الرؤية-اللغة-الحركة (VLA) والنماذج التي تعمل على الجهاز هي خط منفصل، يقتصر حاليًا على شركاء مبكرين.

ما الذي يمكن أن يفعله ER 2
تصف جوجل مجموعة واسعة من مهارات الاستدلال المجسّد. يمكن لنظام ER 2 فهم الفيديو وتحديد لحظات محددة فيه ("متى سقط الكوب؟")، والاستدلال حول الفضاء ثلاثي الأبعاد والعلاقات بين الأشياء، وتصنيف تقدم المهمة (هل الخطوة مكتملة، أو جزئية، أو فاشلة؟)، وتنسيق استخدام الأدوات متعددة الخطوات لتحقيق هدف. يمكنه إجراء حوار مع شخص وتخطيط مهام تمتد لعدة دقائق، وتصحيح نفسه عند حدوث خطأ، والأهم من ذلك — تنسيق عمل عدة روبوتات معًا. هذه هي بالضبط القدرات التي يحتاجها الروبوت للعمل في بيئات حقيقية فوضوية بدلاً من العروض التوضيحية المبرمجة.
النمط المتدفق: التفاعل في الوقت الفعلي
إلى جانب المعاينة القياسية، طرحت Google code>gemini-robotics-er-2-streaming-preview/code>، مُحسَّن لزمن الاستجابة المنخفض والصوت والفيديو ثنائي الاتجاه. وهذا مهم للاستخدامات المتجسدة: فالروبوت يحتاج إلى الإدراك والتفكير والاستجابة بشكل مستمر، وليس عبر جولات طلب-استجابة بطيئة. نموذج البث المباشر يتيح تفاعلًا في الوقت الفعلي — مشاهدة بث مباشر، والتحدث مع شخص، وتعديل خطة أثناء التنفيذ — وهو أمر ضروري للمساعدات التفاعلية، ودعم التشغيل عن بُعد، والمهام الديناميكية متعددة الخطوات.
ما الجديد مقارنةً بـ ER 1.6
ER 2 هو تحسن واضح عن Gemini Robotics ER 1.6. تسلط Google الضوء على تنسيق أفضل بشكل ملحوظ بين الروبوتات المتعددة وتتبع تقدم المهام، وتنسيق أدوات متعدد الخطوات أقوى، وسلوك أمان محسّن. فيما يتعلق بالسلامة تحديدًا، تضع Google نموذج ER 2 كأكثر نماذجها الروبوتية أمانًا حتى الآن، مستشهدة بالالتزام المحسّن بقيود السلامة وسلوك القرب من البشر، والمكاسب في معيار سلامة ASIMOV2. بالنسبة للفرق التي تبني عمليات نشر حقيقية، فإن تحسينات التنسيق وتتبع التقدم والسلامة هي الترقيات الأكثر تأثيرًا.
السلامة والتقييم
السلامة أمر محوري في positioning الخاص بـ ER 2. تذكر Google أنها تتصدر في الالتزام بقيود السلامة وفي مدى اقتراب سلوكها من الحكم البشري الآمن حول الأشخاص، مع تحسّن في درجات ASIMOV2 (وهو معيار مرجعي للروبوتات موجّه نحو السلامة). ونظرًا لأن الروبوتات تعمل في العالم المادي، فإن خصائص السلامة هذه أهم بكثير مما هي عليه بالنسبة لشات بوت — فخطأ التخطيط يمكن أن يسبب ضررًا حقيقيًا. وكما هو الحال مع أي معيار مرجعي من بائع، تعامل مع التفاصيل على أنها أولية واسترشادية؛ فالتقييم المستقل للروبوتات ما زال في طور النضج.

التوفر والتسعير
يتوفر ER 2 في المعاينة العامة عبر Gemini API — معرّفات النماذج code>gemini-robotics-er-2-preview/code> و code>gemini-robotics-er-2-streaming-preview/code> — وفي Google AI Studio. إن تكامل Enterprise Agent Platform قيد المعاينة الخاصة، وتبقى نماذج VLA ذات التحكم المباشر والنماذج المدمجة في الأجهزة مقتصرة على الشركاء الأوائل. وهو مغلق. يتبع التسعير فواتير Gemini API القياسية؛ لم تنشر Google أسعارًا خاصة بالروبوتات عند الإطلاق. تأكد من الوصول الحالي والتكاليف في وثائق Gemini API.
ثلاثة سيناريوهات يناسب فيها ER 2
1. روبوتات المستودعات والخدمات اللوجستية
الاستدلال المكاني، وتتبّع التقدّم، والتنسيق متعدد الروبوتات تناسب مهام الالتقاط والوضع، والفرز، ومهام الأساطيل حيث يجب على الروبوتات فهم المشاهد والتعاون.
2. الروبوتات المساعدة التفاعلية
يتيح التفاعل الصوتي والمرئي في الوقت الفعلي للنسخة البثية للروبوتات القدرة على المشاهدة والاستماع والمحادثة وتخطيط مهام متعددة الدقائق مع شخص.
٣. التفتيش والمراقبة
يُسهِم فهم الفيديو وتحديد موضع اللحظة في جعل ER 2 مفيدًا لتحليل البث المباشر أو المسجَّل — لرصد الأحداث، وتصنيف الحالات، والإشارة إلى التقدّم أو الإخفاقات.
كيف يتناسب مع مجموعة تقنيات الذكاء الاصطناعي الأوسع
Gemini Robotics ER 2 هو نموذج روبوتات متخصص يُستخدم عبر واجهة Gemini API من Google، وليس LLM للأغراض العامة — لذا ليس شيئًا يستضيفه موجه نماذج عام. بالنسبة للأجزاء اللغوية والمتعددة الوسائط للأغراض العامة في تطبيق حول روبوت — واجهات اللغة الطبيعية، والاستدلال، والتنسيق، والتحليلات — تُبقي نقطة نهاية محايدة تجاه البائع خياراتك مفتوحة:a href="https://www.orcarouter.ai/">OrcaRouter/a> يوفر نقطة نهاية واحدة متوافقة مع OpenAI عبر العديد من نماذج النصوص والوسائط المتعددة (بما في ذلك نماذج Gemini العامة من Google)، بينما يعمل التحكم التجسيدي في ER 2 عبر واجهة برمجة تطبيقات الروبوتات المخصصة من Google. هذا الفصل طبيعي: استخدم الدماغ الروبوتي المتخصص للتجسيد، ونقطة نهاية محايدة تجاه البائع لكل شيء آخر.
القيود والتحفظات
ER 2 عبارة عن طبقة تفكير/تخطيط، وليس روبوتًا جاهزًا — لا تزال بحاجة إلى نظام حركة (نماذج VLA من Google/نماذج على الجهاز، مقتصرة على الشركاء، أو نظامك الخاص) لتنفيذ الخطط فيزيائيًا. إنها معاينة مغلقة، لذا قد يتغير التوفر والسلوك، ولم تُنشر تفاصيل التسعير. ادعاءاتها المتعلقة بالمعايير والسلامة مقدمة من البائع وأولية؛ التقييم المستقل للروبوتات غير ناضج. والنشر المادي يحمل التزامات سلامة في العالم الحقيقي تتجاوز بكثير اختبارات البرمجيات. تعامل معها كمعاينة قوية للنمذجة الأولية، وليس كوحدة تحكم إنتاجية مكتملة.
الأسئلة الشائعة
ما هو Gemini Robotics ER 2؟
نموذج Google DeepMind للرؤية واللغة القائم على الاستدلال المجسّد — دماغ روبوت عالي المستوى للإدراك والتخطيط — تم إطلاقه في معاينة عامة في 30 يوليو 2026، مع نسخة بث في الوقت الفعلي.
هل يتحكم ER 2 في محركات الروبوت مباشرة؟
لا. ER 2 هو طبقة التفكير/التخطيط؛ أما التحكم الحركي المباشر فتتولاه نماذج منفصلة للرؤية-اللغة-الفعل (VLA) ونماذج على الجهاز، وهي حالياً مقتصرة على شركاء مبكرين.
ماذا يمكن أن يفعل ER 2؟
فهم الفيديو وتحديد اللحظات، الاستدلال المكاني، تنسيق الأدوات متعدد الخطوات، تصنيف التقدم، تنسيق الروبوتات المتعددة، التصحيح الذاتي، والتفاعل في الوقت الفعلي (النسخة المتدفقة).
كيف يختلف ER 2 عن ER 1.6؟
تذكر Google أنها حقّقت تنسيقاً أفضل بين الروبوتات المتعددة وتتبّعاً أدق للتقدّم، وإدارة أقوى للأدوات، وسلامة محسّنة — بما في ذلك مكاسب في معيار سلامة ASIMOV2 — ما يجعل ER 2 أكثر نماذجها الروبوتية أماناً حتى الآن.
كيف يمكنني الوصول إلى Gemini Robotics ER 2؟
عبر Gemini API (code>gemini-robotics-er-2-preview/code>، code>gemini-robotics-er-2-streaming-preview/code>) وGoogle AI Studio، كمعاينة عامة مغلقة. الأسعار تتبع الفوترة القياسية لـ Gemini API.
هل ER 2 آمن للروبوتات الحقيقية؟
تضعه جوجل كأكثر نماذجها الروبوتية أمانًا من حيث الالتزام بقيود السلامة والقرب من البشر، لكن النشر الفيزيائي يحمل التزامات سلامة واقعية؛ تعامل مع ادعاءات السلامة باعتبارها مبكّرة وتحقق منها بدقة.
خلاصة القول
Gemini Robotics ER 2 خطوة كبيرة نحو الذكاء الاصطناعي المجسّد: دماغ استدلالي يركز على السلامة، يمكّن الروبوتات من فهم الفيديو، والاستدلال حول المكان والزمان، وتخطيط مهام متعددة الدقائق، والتنسيق مع الروبوتات الأخرى، والتفاعل في الوقت الفعلي عبر نسخته المتدفقة. إنها طبقة تخطيط وليست وحدة تحكم بالمحركات، وهي معاينة مغلقة مبكرة بمعايير أبلغ عنها البائع — لكن مكاسب التنسيق وتتبع التقدم والسلامة مقارنة بـ ER 1.6 كبيرة. جرّب النماذج الأولية من خلال Gemini API للتجسيد، وحافظ على أجزاء اللغة العامة/متعددة الوسائط في مجموعتك التقنية محايدة تجاه البائع عبر نقطة نهاية مثل OrcaRouter.
