
Gemini Robotics ER 2: อธิบายสมองหุ่นยนต์แบบ Embodied-Reasoning ของ Google DeepMind
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 206 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleใหม่Google: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleใหม่Google: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
- anthropicAnthropic: Claude Fable 52026-06-0960ความฉลาด77การเขียนโค้ด
Google DeepMindGemini Robotics ER 2 — เปิดตัวในรูปแบบพรีวิวสาธารณะเมื่อวันที่ 30 กรกฎาคม 2026 — เป็นโมเดลวิทัศน์-ภาษาเฉพาะทางที่สร้างมาเพื่อทำหน้าที่เป็น "สมอง" ระดับสูงของหุ่นยนต์ "ER" ย่อมาจาก Embodied Reasoning: แทนที่จะขับเคลื่อนมอเตอร์โดยตรง ER 2 มองเห็นและเข้าใจโลกทางกายภาพ ให้เหตุผลเกี่ยวกับพื้นที่และเวลา วางแผนงานหลายขั้นตอน ประสานการทำงานของเครื่องมือ และประสานงานหุ่นยนต์ อีกทั้งยังมาพร้อมเวอร์ชันสตรีมมิ่งแบบเรียลไทม์สำหรับการควบคุมแบบโต้ตอบที่มีความหน่วงต่ำ คู่มือนี้จะอธิบายว่า ER 2 คืออะไร แตกต่างจากโมเดลควบคุมโดยตรงอย่างไร มีอะไรใหม่เมื่อเทียบกับ ER 1.6 และเหมาะกับบริบทใด — พร้อมระบุที่มาของความสามารถ
หมายเหตุความถูกต้อง: ข้อกล่าวอ้างด้านความสามารถ ความพร้อมใช้งาน และความปลอดภัยมาจากประกาศของ Google DeepMind และบันทึกการเปลี่ยนแปลงของ Gemini API (2026-07-30) เกณฑ์ชี้วัดด้านหุ่นยนต์ยังอยู่ในช่วงเริ่มต้นและรายงานโดยผู้จำหน่าย ราคาเป็นไปตามการเรียกเก็บเงินมาตรฐานของ Gemini API และไม่ได้มีการเผยแพร่รายละเอียดเฉพาะ รายละเอียดอาจมีการเปลี่ยนแปลง — ควรตรวจสอบก่อนเริ่มพัฒนา
TL;DR. Gemini Robotics ER 2 คือ embodied-reasoning VLM ที่ทำหน้าที่เป็นสมองด้านการวางแผนและการรับรู้ของหุ่นยนต์: ความเข้าใจวิดีโอ การให้เหตุผลเชิงพื้นที่ การจัดลำดับการใช้เครื่องมือหลายขั้นตอน การระบุตำแหน่งช่วงเวลาในวิดีโอ การติดตามความคืบหน้า การประสานงานหุ่นยนต์หลายตัว และการแก้ไขตนเอง พร้อมเวอร์ชันสตรีมมิงสำหรับการโต้ตอบแบบเสียง-วิดีโอสองทิศทางแบบเรียลไทม์ ใช้งานได้ใน Gemini API (code>gemini-robotics-er-2-preview/code> และ code>gemini-robotics-er-2-streaming-preview/code>) และ Google AI Studio ในรูปแบบ closed preview Google วางตำแหน่งให้เป็นโมเดลหุ่นยนต์ที่ปลอดภัยที่สุดเท่าที่เคยมีมา พร้อมการปรับปรุงที่โดดเด่นเหนือ ER 1.6 ในด้านการประสานงานหุ่นยนต์หลายตัวและการติดตามความคืบหน้า มันคือชั้นการให้เหตุผล ไม่ใช่ตัวควบคุมแอคชูเอเตอร์ระดับต่ำ
ประเด็นสำคัญ
• Embodied Reasoning (ER): ER 2 คือสมองระดับสูงสำหรับการรับรู้และการวางแผน ไม่ใช่ตัวควบคุมมอเตอร์โดยตรง (ส่วนนั้นคือสายงาน VLA/บนอุปกรณ์ที่แยกต่างหาก)
• ทักษะหลัก: ความเข้าใจวิดีโอ, การให้เหตุผลเชิงพื้นที่, การจัดประสานเครื่องมือแบบหลายขั้นตอน, การระบุตำแหน่งช่วงเวลาในวิดีโอ, การจำแนกระดับความก้าวหน้า, การประสานงานหุ่นยนต์หลายตัว, การแก้ไขตนเอง
• เวอร์ชันสตรีมมิง: code>gemini-robotics-er-2-streaming-preview/code> เพิ่มการโต้ตอบเสียง-วิดีโอแบบสองทิศทางที่มีความหน่วงต่ำสำหรับการควบคุมและการสนทนาแบบเรียลไทม์
• เน้นความปลอดภัยเป็นหลัก: Google วางตำแหน่ง ER 2 เป็นโมเดลหุ่นยนต์ที่ปลอดภัยที่สุดในด้านการปฏิบัติตามข้อจำกัดด้านความปลอดภัยและการอยู่ใกล้ชิดมนุษย์ พร้อมกับการปรับปรุงคะแนนในเกณฑ์มาตรฐาน ASIMOV2
• ความพร้อมใช้งาน: Gemini API + Google AI Studio (พรีวิวสาธารณะ); Enterprise Agent Platform อยู่ในช่วงพรีวิวส่วนตัว; โมเดล VLA/บนอุปกรณ์จำกัดเฉพาะพันธมิตรกลุ่มแรก ปิดให้บริการ
"Embodied Reasoning" หมายความว่าอะไร
สแตกหุ่นยนต์สมัยใหม่เริ่มแยกออกเป็นสองชั้นมากขึ้นเรื่อยๆ ชั้นแรกคือสมองสำหรับการให้เหตุผลระดับสูงที่เข้าใจฉาก ตัดสินใจว่าจะทำอะไร และวางแผน ส่วนชั้นที่สองคือโมเดลการทำงานระดับต่ำที่แปลงแผนเป็นคำสั่งควบคุมมอเตอร์ที่แม่นยำ Gemini Robotics ER 2 คือชั้นแรก: โมเดลวิชัน-แลงเกจสำหรับการให้เหตุผลแบบฝังตัว (embodied-reasoning vision-language model) โดยรับข้อมูลวิดีโอ (รวมถึงเสียงและข้อความ) สร้างความเข้าใจเกี่ยวกับวัตถุ พื้นที่ และความคืบหน้าเมื่อเวลาผ่านไป และส่งออกแผนและการเรียกใช้เครื่องมือ — รวมถึงการเรียกใช้เครื่องมือภายนอกอย่าง Google Search — ซึ่งระบบการทำงานแยกต่างหากหรือมนุษย์สามารถนำไปปฏิบัติได้ กล่าวอีกนัยหนึ่ง ER 2 คือส่วนของหุ่นยนต์ที่คิด ไม่ใช่ส่วนที่เคลื่อนไหว โมเดลวิชัน-แลงเกจ-แอ็กชัน (VLA) ที่ควบคุมโดยตรงของ Google และโมเดลบนอุปกรณ์เป็นไลน์แยกต่างหาก ซึ่งปัจจุบันจำกัดเฉพาะพันธมิตรช่วงแรก

สิ่งที่ ER 2 ทำได้
Google อธิบายถึงชุดทักษะการใช้เหตุผลเชิงกายภาพ (embodied reasoning) ในวงกว้าง ER 2 สามารถเข้าใจวิดีโอและระบุตำแหน่งช่วงเวลาที่เฉพาะเจาะจงภายในวิดีโอนั้นได้ ("แก้วตกเมื่อไหร่?") ให้เหตุผลเกี่ยวกับพื้นที่ 3 มิติและความสัมพันธ์ระหว่างวัตถุ จัดประเภทความคืบหน้าของงาน (ขั้นตอนเสร็จสิ้น ทำไปบางส่วน หรือล้มเหลว?) และประสานการใช้เครื่องมือหลายขั้นตอนเพื่อบรรลุเป้าหมาย มันสามารถสนทนากับบุคคลและวางแผนงานที่กินเวลาหลายนาที แก้ไขตัวเองเมื่อเกิดข้อผิดพลาด และ—ที่โดดเด่น—ประสานงานหุ่นยนต์หลายตัวให้ทำงานร่วมกัน สิ่งเหล่านี้คือความสามารถที่หุ่นยนต์จำเป็นต้องมีเพื่อปฏิบัติงานในสภาพแวดล้อมจริงที่ยุ่งเหยิง แทนที่จะเป็นการสาธิตตามสคริปต์
รูปแบบสตรีมมิง: การโต้ตอบแบบเรียลไทม์
นอกจากพรีวิวมาตรฐานแล้ว Google เปิดตัวcode>gemini-robotics-er-2-streaming-preview/code>, ปรับให้เหมาะสมสำหรับวิดีโอเสียงแบบสองทิศทางที่มีความหน่วงต่ำ สิ่งนี้สำคัญสำหรับการใช้งานของหุ่นยนต์ กล่าวคือ หุ่นยนต์ต้องรับรู้ ให้เหตุผล และตอบสนองอย่างต่อเนื่อง ไม่ใช่ในรอบการร้องขอ-ตอบกลับที่ช้า โมเดลแบบสตรีมมิงช่วยให้เกิดการโต้ตอบแบบเรียลไทม์ ไม่ว่าจะเป็นการดูฟีดสด การพูดคุยกับบุคคล และการปรับแผนได้ทันที ซึ่งจำเป็นสำหรับผู้ช่วยแบบโต้ตอบ การสนับสนุนการควบคุมระยะไกล และงานหลายขั้นตอนที่เปลี่ยนแปลงตลอดเวลา.
มีอะไรใหม่เทียบกับ ER 1.6
ER 2 ดีขึ้นอย่างชัดเจนเมื่อเทียบกับ Gemini Robotics ER 1.6 Google เน้นย้ำถึงการประสานงานหุ่นยนต์หลายตัวและการติดตามความคืบหน้าของงานที่ดีขึ้นอย่างเห็นได้ชัด การจัดการเครื่องมือแบบหลายขั้นตอนที่แข็งแกร่งขึ้น และพฤติกรรมด้านความปลอดภัยที่ดีขึ้น ในด้านความปลอดภัยโดยเฉพาะ Google วางตำแหน่ง ER 2 เป็นโมเดลหุ่นยนต์ที่ปลอดภัยที่สุดเท่าที่เคยมีมา โดยอ้างถึงการปฏิบัติตามข้อจำกัดด้านความปลอดภัยและพฤติกรรมเมื่ออยู่ใกล้มนุษย์ที่ดีขึ้น รวมถึงความคืบหน้าในเกณฑ์มาตรฐานความปลอดภัย ASIMOV2 สำหรับทีมที่กำลังสร้างการใช้งานจริง การปรับปรุงด้านการประสานงาน การติดตามความคืบหน้า และความปลอดภัยถือเป็นการอัปเกรดที่สำคัญที่สุด
ความปลอดภัยและการประเมินผล
ความปลอดภัยเป็นหัวใจสำคัญของ positioning ของ ER 2 {{1}}Google รายงานว่า ER 2 มีความเป็นเลิศด้านการปฏิบัติตามข้อจำกัดด้านความปลอดภัยและความใกล้เคียงของพฤติกรรมกับการตัดสินใจของมนุษย์ที่ปลอดภัยรอบตัวคน โดยมีคะแนนที่ดีขึ้นใน {{2}}ASIMOV2{{/2}} (เกณฑ์ชี้วัดหุ่นยนต์ที่เน้นความปลอดภัย){{/1}} {{3}}เนื่องจากหุ่นยนต์ปฏิบัติการในโลกกายภาพ คุณสมบัติด้านความปลอดภัยเหล่านี้จึงสำคัญกว่าหุ่นยนต์แชทบอทอย่างมาก — ข้อผิดพลาดในการวางแผนอาจก่อให้เกิดอันตรายจริงได้{{/3}} {{4}}เช่นเดียวกับเกณฑ์ชี้วัดจากผู้ขายรายอื่น ควรถือว่ารายละเอียดเหล่านี้เป็นข้อมูลเบื้องต้นและใช้เพื่อทิศทางเท่านั้น การประเมินหุ่นยนต์โดยอิสระยังอยู่ในช่วงพัฒนา{{/4}}

ความพร้อมใช้งานและราคา
ER 2 พร้อมใช้งานในรูปแบบพรีวิวสาธารณะผ่าน Gemini API — รหัสโมเดล code>gemini-robotics-er-2-preview/code> และ code>gemini-robotics-er-2-streaming-preview/code> — และใน Google AI Studio การผสานรวม Enterprise Agent Platform อยู่ในช่วงพรีวิวส่วนตัว โมเดล VLA แบบควบคุมโดยตรงและโมเดลบนอุปกรณ์ยังจำกัดเฉพาะพันธมิตรเริ่มต้นเท่านั้น การเข้าถึงยังปิดอยู่ การกำหนดราคาเป็นไปตามการเรียกเก็บเงินมาตรฐานของ Gemini API Google ไม่ได้เผยแพร่อัตราเฉพาะสำหรับงานหุ่นยนต์ในตอนเปิดตัว โปรดยืนยันการเข้าถึงและค่าใช้จ่ายปัจจุบันในเอกสารประกอบ Gemini API
สามสถานการณ์ที่ ER 2 เหมาะสม
1. หุ่นยนต์คลังสินค้าและโลจิสติกส์
การให้เหตุผลเชิงพื้นที่ การติดตามความคืบหน้า และการประสานงานของหุ่นยนต์หลายตัว เหมาะสำหรับงานหยิบและวาง การคัดแยก และงานฝูงหุ่นยนต์ ซึ่งหุ่นยนต์ต้องเข้าใจฉากและทำงานร่วมกัน
2. หุ่นยนต์ผู้ช่วยแบบโต้ตอบ
การโต้ตอบเสียง-วิดีโอแบบเรียลไทม์ของรูปแบบสตรีมมิงช่วยให้หุ่นยนต์สามารถมองดู ฟัง สนทนา และวางแผนงานหลายนาทีร่วมกับบุคคลได้
3. การตรวจสอบและการติดตาม
ความเข้าใจวิดีโอและการระบุตำแหน่งเหตุการณ์ทำให้ ER 2 มีประโยชน์สำหรับการวิเคราะห์ฟีดสดหรือฟีดที่บันทึกไว้ — การตรวจจับเหตุการณ์ การจำแนกสถานะ และการทำเครื่องหมายความคืบหน้าหรือความล้มเหลว
มันเข้ากับชุดเทคโนโลยี AI ที่กว้างขึ้นได้อย่างไร
Gemini Robotics ER 2 เป็นโมเดลหุ่นยนต์เฉพาะทางที่เข้าถึงได้ผ่าน Gemini API ของ Google ไม่ใช่ LLM วัตถุประสงค์ทั่วไป — ดังนั้นจึงไม่ใช่สิ่งที่เราเตอร์โมเดลทั่วไปจะโฮสต์ สำหรับส่วนภาษาและมัลติโมดัลวัตถุประสงค์ทั่วไปของแอปพลิเคชันรอบหุ่นยนต์ — อินเทอร์เฟซภาษาธรรมชาติ การให้เหตุผล การจัดประสานงาน การวิเคราะห์ — เอนด์พอยต์ที่เป็นกลางของผู้ให้บริการช่วยให้ตัวเลือกของคุณเปิดกว้าง: a href="https://www.orcarouter.ai/">OrcaRouter/a> มอบเอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งเดียวสำหรับโมเดลข้อความและมัลติโมดัลจำนวนมาก (รวมถึงโมเดล Gemini ทั่วไปของ Google) ในขณะที่การควบคุมเชิงกายภาพของ ER 2 ทำงานผ่าน API หุ่นยนต์เฉพาะของ Google การแยกแบบนี้เป็นเรื่องธรรมชาติ: ใช้สมองหุ่นยนต์เฉพาะทางสำหรับการควบคุมกายภาพ และใช้เอนด์พอยต์ที่เป็นกลางสำหรับอย่างอื่นทั้งหมด
ข้อจำกัดและข้อควรระวัง
ER 2 เป็นชั้นการให้เหตุผล/การวางแผน ไม่ใช่หุ่นยนต์แบบพร้อมใช้ทันที — คุณยังต้องมีระบบลงมือปฏิบัติ (โมเดล VLA/บนอุปกรณ์ของ Google ซึ่งจำกัดเฉพาะพันธมิตร หรือระบบของคุณเอง) เพื่อนำแผนไปปฏิบัติจริงในโลกกายภาพ นี่เป็นการแสดงตัวอย่างแบบปิด ความพร้อมใช้งานและพฤติกรรมอาจเปลี่ยนแปลงได้ และยังไม่มีการเผยแพร่รายละเอียดด้านราคา การอ้างสิทธิ์ด้านเกณฑ์มาตรฐานและความปลอดภัยเป็นข้อมูลที่รายงานโดยผู้ผลิตและยังอยู่ในช่วงแรกเริ่ม การประเมินวิทยาการหุ่นยนต์โดยอิสระยังไม่สมบูรณ์ และการใช้งานกับอุปกรณ์จริงมีความรับผิดชอบด้านความปลอดภัยในโลกจริงที่กว้างไกลเกินกว่าการทดสอบซอฟต์แวร์ ควรมองว่าเป็นตัวอย่างที่ทรงพลังสำหรับการสร้างต้นแบบ ไม่ใช่ตัวควบคุมการผลิตที่สมบูรณ์
คำถามที่พบบ่อย
Gemini Robotics ER 2 คืออะไร
โมเดลวิทัศน์-ภาษาสำหรับการให้เหตุผลเชิงกายภาพของ Google DeepMind — สมองระดับสูงสำหรับการรับรู้และการวางแผนของหุ่นยนต์ — เปิดตัวในพรีวิวสาธารณะเมื่อวันที่ 30 กรกฎาคม 2026 พร้อมตัวแปรสตรีมมิงแบบเรียลไทม์
ER 2 ควบคุมมอเตอร์หุ่นยนต์โดยตรงหรือไม่?
ไม่ใช่ ER 2 คือชั้นการให้เหตุผล/การวางแผน ส่วนการควบคุมมอเตอร์โดยตรงนั้นดำเนินการโดยโมเดลวิทัศน์-ภาษา-การกระทำ (VLA) และโมเดลบนอุปกรณ์ที่แยกต่างหาก ซึ่งในปัจจุบันจำกัดเฉพาะพันธมิตรในช่วงแรก
ER 2 ทำอะไรได้บ้าง?
การทำความเข้าใจวิดีโอและการระบุตำแหน่งเหตุการณ์ การให้เหตุผลเชิงพื้นที่ การจัดการเครื่องมือแบบหลายขั้นตอน การจำแนกระดับความคืบหน้า การประสานงานหุ่นยนต์หลายตัว การแก้ไขด้วยตนเอง และการโต้ตอบแบบเรียลไทม์ (รูปแบบสตรีมมิง)
ER 2 แตกต่างจาก ER 1.6 อย่างไร?
Google รายงานการประสานงานหุ่นยนต์หลายตัวและการติดตามความคืบหน้าที่ดีขึ้น การจัดการเครื่องมือที่มีประสิทธิภาพแข็งแกร่งขึ้น และความปลอดภัยที่ได้รับการปรับปรุง — รวมถึงผลลัพธ์ที่ดีขึ้นในเกณฑ์ชี้วัดความปลอดภัย ASIMOV2 — ทำให้ ER 2 เป็นโมเดลหุ่นยนต์ที่ปลอดภัยที่สุดเท่าที่เคยมีมา
ฉันจะเข้าถึง Gemini Robotics ER 2 ได้อย่างไร
ผ่าน Gemini API (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) และ Google AI Studio ในรูปแบบ closed public preview ราคาเป็นไปตามมาตรฐานการเรียกเก็บเงินของ Gemini API.
ER 2 ปลอดภัยสำหรับหุ่นยนต์จริงหรือไม่?
กูเกิลวางตำแหน่งให้มันเป็นโมเดลหุ่นยนต์ที่ปลอดภัยที่สุดในด้านการปฏิบัติตามข้อจำกัดด้านความปลอดภัยและการอยู่ใกล้มนุษย์ แต่การนำไปใช้งานจริงย่อมมีภาระผูกพันด้านความปลอดภัยในโลกจริง จงถือว่าข้ออ้างด้านความปลอดภัยเป็นเพียงระยะเริ่มต้น และตรวจสอบอย่างเข้มงวด
บรรทัดล่าง
Gemini Robotics ER 2 คือก้าวสำคัญของ embodied AI: สมองเชิงเหตุผลที่เน้นความปลอดภัย ซึ่งช่วยให้หุ่นยนต์เข้าใจวิดีโอ คิดวิเคราะห์เกี่ยวกับพื้นที่และเวลา วางแผนงานที่กินเวลาหลายนาที ประสานงานกับหุ่นยนต์อื่น และโต้ตอบแบบเรียลไทม์ผ่านเวอร์ชันสตรีมมิ่ง มันคือชั้นการวางแผน ไม่ใช่ตัวควบคุมมอเตอร์ และยังเป็นพรีวิวแบบปิดในช่วงแรกที่มีเบนช์มาร์กที่รายงานโดยผู้จำหน่าย — แต่การประสานงาน การติดตามความคืบหน้า และการพัฒนาด้านความปลอดภัยเมื่อเทียบกับ ER 1.6 ถือว่ามีนัยสำคัญ คุณสามารถสร้างต้นแบบด้วย Gemini API สำหรับงานด้าน embodiment และรักษาส่วนภาษา/มัลติโมดัลทั่วไปของสแต็กของคุณให้เป็นกลางกับผู้จำหน่ายผ่านเอนด์พอยต์อย่าง OrcaRouter
