โมเดลมัลติโมดัลตัวอย่างของกูเกิลสำหรับหุ่นยนต์ รองรับอินพุตแบบข้อความ รูปภาพ วิดีโอ และเสียง พร้อมเอาต์พุตสูงสุด 65,536 โทเค็น
google/gemini-robotics-er-1.6-preview เป็นโมเดลพรีวิวจากตระกูล Gemini ของ Google ที่ปรับแต่งสำหรับงานหุ่นยนต์และการให้เหตุผลแบบฝังตัว (embodied reasoning) เป็นโมเดลแบบหลายรูปแบบ (multimodal)…
โมเดลนี้ถูกออกแบบมาสำหรับการให้เหตุผลแบบ multimodal ที่เกี่ยวข้องกับหุ่นยนต์ สามารถตีความภาพและวิดีโอเพื่อระบุวัตถุ สภาพแวดล้อม และการกระทำของมนุษย์ สามารถประมวลผลคำสั่งเสียงและดึงข้อมูลจากภาษาพูด เมื่อรวมรูปแบบเหล่านี้เข้าด้วยกัน มันสามารถสร้างคำแนะนำสำหรับการจัดการ การนำทาง หรือการโต้ตอบของหุ่นยนต์ ตัวอย่างเช่น เมื่อได้รับวิดีโอของห้องครัวและคำขอทางเสียงให้ 'หยิบแอปเปิ้ลจากเคาน์เตอร์' โมเดลสามารถส่งออกชุดของการกระทำ บริบทเอาต์พุตขนาดใหญ่ช่วยให้มันสามารถสร้างแผนหรือโค้ดโดยละเอียดสำหรับตัวควบคุมหุ่นยนต์ โปรดทราบว่าประสิทธิภาพของโมเดลในงานเหล่านี้ยังไม่ได้ถูกทดสอบวัด Benchmark ต่อสาธารณะสำหรับเวอร์ชันพรีวิวนี้
หากแอปพลิเคชันของคุณไม่จำเป็นต้องใช้การป้อนข้อมูลแบบหลายรูปแบบ (เช่น คุณใช้เฉพาะข้อความ) โมเดลที่รับเฉพาะข้อความที่มีขนาดเล็กกว่าจะคุ้มค่าทางต้นทุนมากกว่า โมเดล robotics-er มีราคาค่อนข้างสูงสำหรับโทเคนอินพุต ($1.00 ต่อล้านโทเคน) เมื่อเทียบกับโมเดลทั่วไปหลายตัว สำหรับการตอบคำถามง่ายๆ หรือการสร้างข้อความที่ไม่มีบริบทภาพหรือเสียง ให้พิจารณาใช้โมเดลที่เบากว่าซึ่งมีให้ผ่าน OrcaRouter เช่น Gemini 1.5 Flash หรือโมเดลโอเพนซอร์สขนาดเล็กกว่า นอกจากนี้ หากไม่จำเป็นต้องใช้เอาต์พุตสูงสุด 65,536 โทเคน โมเดลที่มีบริบทเอาต์พุตขนาดเล็กกว่าอาจให้เวลาแฝงและต้นทุนที่ต่ำกว่า ประเมินว่าความสามารถแบบหลายรูปแบบนั้นคุ้มค่ากับราคาสำหรับกรณีการใช้งานของคุณหรือไม่
ขีดจำกัดเอาต์พุต 65,536 โทเค็นมีค่าอย่างยิ่งสำหรับการสร้างเนื้อหาแบบยาว เช่น ลำดับการเคลื่อนไหวของหุ่นยนต์ (เช่น โค้ด Python ที่ใช้ ROS หรือไลบรารีควบคุม) คำอธิบายสภาพแวดล้อมโดยละเอียดสำหรับการสร้างแบบจำลอง 3D หรือแผนงานหลายขั้นตอนที่ต้องใช้การให้เหตุผลอย่างกว้างขวาง นอกจากนี้ยังสามารถใช้สำหรับการเรียนรู้ในบริบท (in-context learning) โดยที่โมเดลจะได้รับตัวอย่างจำนวนมากในพรอมพ์เดียวและคาดหวังให้สร้างผลลัพธ์ที่ครอบคลุม สำหรับการวิจัยหุ่นยนต์ สิ่งนี้ช่วยให้สามารถสร้างแผนระยะยาวที่ครอบคลุมสถานการณ์ที่เป็นไปได้มากมาย อย่างไรก็ตาม โปรดทราบว่าเอาต์พุตที่ยาวขึ้นจะเพิ่มต้นทุนและความหน่วง ดังนั้นให้พิจารณาว่าคำตอบที่สั้นกว่านั้นเพียงพอหรือไม่
อินพุตเสียงและวิดีโอจะถูกประมวลผลเป็นส่วนหนึ่งของพร้อมต์แบบหลายรูปแบบ (multimodal prompt) เมื่อคุณส่งวิดีโอ โมเดลน่าจะถือว่าวิดีโอดังกล่าวเป็นลำดับของเฟรม หรือใช้ตัวเข้ารหัสสำหรับทำความเข้าใจวิดีโอ (วิธีการที่แน่ชัดเป็นข้อมูลภายในของ Google) เสียงสามารถรวมเป็น URL ของไฟล์เสียงได้ โมเดลสามารถถอดความหรือเข้าใจคำสั่งเสียงพูดและสร้างข้อความตอบกลับตามนั้น คุณภาพของการประมวลผลเสียงและวิดีโอขึ้นอยู่กับการสุ่มตัวอย่างและรูปแบบที่รองรับโดย API Gemini ของ Google โปรดปรึกษาเอกสารของผู้ให้บริการสำหรับประเภทไฟล์ที่รองรับและระยะเวลาสูงสุด OrcaRouter เพียงแค่ส่งต่ออินพุตในรูปแบบที่เข้ากันได้กับ OpenAI
ในฐานะรุ่นพรีวิว Google ยังไม่ได้เผยแพร่คะแนน benchmark เฉพาะสำหรับโมเดล gemini-robotics-er-1.6-preview โดยทั่วไปโมเดล Gemini 1.6 แสดงประสิทธิภาพที่แข็งแกร่งในงาน multimodal แต่วาเรียนต์เฉพาะสำหรับหุ่นยนต์นี้อาจมีจุดแข็งที่แตกต่างกัน ผู้ใช้ควรประเมินประสิทธิภาพของโมเดลในงานเฉพาะโดเมนของตนเองก่อนที่จะพึ่งพามัน OrcaRouter ไม่ได้ให้ตัวเลข benchmark นอกเหนือจากที่ผู้ให้บริการเผยแพร่ เพื่อความน่าเชื่อถือในโลกจริง ให้ทำการทดสอบ A/B กับข้อมูลของคุณเองและเปรียบเทียบ latency, accuracy และ cost กับโมเดลอื่นๆ
ความหน่วงสำหรับ google/gemini-robotics-er-1.6-preview ไม่ได้ระบุโดยผู้ให้บริการ โดยทั่วไป โมเดลมัลติโมดัลที่ประมวลผลวิดีโอและเสียงมักจะมีความหน่วงสูงกว่าโมเดลที่ประมวลผลเฉพาะข้อความ เนื่องจากการเข้ารหัสที่เพิ่มขึ้น นอกจากนี้ บริบทเอาต์พุตขนาดใหญ่สามารถเพิ่มระยะเวลาตอบสนอง โดยเฉพาะสำหรับการสร้างที่ยาว ความหน่วงจริงขึ้นอยู่กับขนาดคำขอ ความซับซ้อน และโหลดเซิร์ฟเวอร์ทั้งบนโครงสร้างพื้นฐานของ Google และพร็อกซีของ OrcaRouter เพื่อประสิทธิภาพสูงสุด ให้ลดข้อมูลนำเข้าที่ไม่จำเป็นและตั้งค่า max_tokens ที่เหมาะสม API ของ OrcaRouter ส่งคืนส่วนหัวมาตรฐานเกี่ยวกับเวลา การตรวจสอบสิ่งเหล่านั้นจะให้ข้อมูลเชิงประจักษ์สำหรับกรณีการใช้งานของคุณ
จุดแข็งหลักของโมเดลคือการรองรับรูปแบบอินพุตหลายรูปแบบ (ข้อความ, ภาพ, วิดีโอ, เสียง) ควบคู่กับบริบทเอาต์พุตที่ใหญ่เป็นพิเศษสูงสุด 65,536 โทเคน ทำให้เหมาะสำหรับงานหุ่นยนต์ที่ซับซ้อนซึ่งต้องเข้าใจทั้งข้อมูลภาพและเสียง และสร้างแผนที่ละเอียดครอบคลุม ลักษณะที่เป็นพรีวิวบ่งชี้ว่าเป็นหนึ่งในโมเดล Gemini รุ่นแรกที่ได้รับการปรับแต่งสำหรับการให้เหตุผลแบบฝังตัว จุดแข็งอีกประการคือการเข้าถึงที่ตรงไปตรงมาผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter ซึ่งช่วยลดอุปสรรคในการบูรณาการสำหรับทีมที่คุ้นเคยกับอินเทอร์เฟซของ OpenAI
เนื่องจากเป็นรุ่นตัวอย่าง ความเสถียรและประสิทธิภาพอาจไม่เทียบเท่ารุ่นที่พร้อมใช้งานจริง การไม่มีเกณฑ์วัดประสิทธิภาพที่เผยแพร่ทำให้ไม่ทราบความแม่นยำในงานหุ่นยนต์มาตรฐาน อาจมีอัตราความล้มเหลวสูงหรือพฤติกรรมที่ไม่คาดคิดเมื่อเทียบกับรุ่นที่ได้รับการยอมรับ โมเดลนี้ไม่สร้างภาพหรือเสียง มีเพียงข้อความเท่านั้น ราคาต่อโทเค็นเอาต์พุตค่อนข้างสูง ($5.00 ต่อล้าน) เมื่อเทียบกับหลายโมเดล นอกจากนี้ บริบทเอาต์พุตที่ใหญ่ อาจกระตุ้นให้เกิดการตอบที่ยืดเยื้อซึ่งไม่จำเป็นเสมอไป ผู้ใช้ควรทดลองต้นแบบอย่างละเอียดก่อนที่จะนำโมเดลนี้ไปใช้ในงานสำคัญใดๆ
การเรียกเก็บเงินสำหรับ google/gemini-robotics-er-1.6-preview บน OrcaRouter นั้นตรงไปตรงมา: $1.00 ต่อ 1 ล้านโทเคนอินพุต และ $5.00 ต่อ 1 ล้านโทเคนเอาต์พุต โทเคนทั้งอินพุตและเอาต์พุตจะถูกนับตาม tokenization ของ Google ซึ่งอาจแตกต่างจากโมเดลอื่น OrcaRouter คิดค่าบริการตามอัตราของผู้ให้บริการโดยไม่มีส่วนเพิ่ม ไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับบริการพร็อกซี API ค่าใช้จ่ายขึ้นอยู่กับจำนวนโทเคนทั้งหมดที่ประมวลผลในคำขอและการตอบกลับ รวมถึงโทเคนอินพุตแบบ multimodal (เช่น แผ่นภาพอาจถูกนับเป็นโทเคน) ควรตรวจสอบการใช้งานที่ส่งคืนในการตอบกลับของ API เสมอเพื่อติดตามค่าใช้จ่าย
ต้นทุนของโทเค็นเอาต์พุต ($5.00 ต่อล้าน) สูงกว่าต้นทุนอินพุต ($1.00 ต่อล้าน) อย่างมีนัยสำคัญ ซึ่งหมายความว่าการทำให้โมเดลสร้างคำตอบยาวๆ จะเพิ่มต้นทุนมากกว่าการให้อินพุตที่ยาวกว่า สำหรับกรณีการใช้งานที่ความยาวเอาต์พุตสามารถทำให้สั้นได้ (เช่น คำสั่งหนึ่งประโยค) ต้นทุนอาจจะยอมรับได้ อย่างไรก็ตาม หากคุณใช้ประโยชน์จากบริบทเอาต์พุตเต็ม 65,536 ไบต์ คำขอเดียวอาจมีต้นทุนสูงถึง $0.33 สำหรับเอาต์พุตเท่านั้น (65k โทเค็นที่ $5/ล้าน) เปรียบเทียบกับโมเดลที่มีราคาเอาต์พุตต่ำกว่าหรือหน้าต่างบริบทที่เล็กกว่า นอกจากนี้ อินพุตแบบหลายโมดัลอาจมีราคาแพงหากต้องใช้โทเค็นจำนวนมาก (เช่น ภาพความละเอียดสูงหรือวิดีโอยาว) พิจารณาการบีบอัดโทเค็นหรือใช้ความละเอียดต่ำกว่าเมื่อเป็นไปได้
ปัจจุบัน OrcaRouter ใช้อัตราของผู้ให้บริการโดยไม่มีส่วนเพิ่ม (zero markup) ไม่มีระบบแคชในตัวที่ช่วยลดต้นทุนสำหรับ prompt prefixes ที่ใช้ซ้ำ เนื่องจากเป็นพร็อกซีแบบส่งผ่าน (passthrough proxy) อย่างไรก็ตาม คุณสามารถใช้แคชในระดับแอปพลิเคชันได้: หากคุณใช้บริบทอินพุตที่เหมือนกันซ้ำ (เช่น system prompts แบบคงที่หรือ reference images) ให้จัดเก็บการตอบสนองของโมเดลและนำมาใช้ซ้ำ เพื่อหลีกเลี่ยงการเรียก API ซ้ำๆ ส่วนลดหรือราคาตามปริมาณอาจมีให้ผ่านแผนองค์กรของ OrcaRouter; ติดต่อทีม OrcaRouter เพื่อขอรายละเอียด ราคามาตรฐานจะใช้กับทุกการใช้งาน เว้นแต่จะมีข้อตกลงพิเศษ
ใช้ปลายทางมาตรฐานของ OpenAI chat completions endpoint ตั้งค่าพารามิเตอร์ 'model' เป็น 'google/gemini-robotics-er-1.6-preview' URL ฐานคือ https://api.orcarouter.ai/v1 รวมคีย์ API ของ OrcaRouter ของคุณในส่วนหัว Authorization สำหรับข้อความที่ประกอบด้วยข้อความเท่านั้น เนื้อหาคำขอจะเหมือนกับคำขอ ChatCompletion ของ OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 } สำหรับอินพุตแบบหลายรูปแบบ ให้จัดโครงสร้างเนื้อหาเป็นอาร์เรย์ที่มีฟิลด์ type และ data ตาม schema ของผู้ให้บริการ OrcaRouter จะแปลงคำขอเป็นรูปแบบของ Google ภายใน
API รองรับพารามิเตอร์เดียวกันกับ endpoint /v1/chat/completions ของ OpenAI ได้แก่ model, messages, max_tokens (สูงสุด 65536), temperature (0 ถึง 2, ค่าเริ่มต้น 1), top_p (0 ถึง 1, ค่าเริ่มต้น 1), frequency_penalty, presence_penalty, stop sequences, stream (boolean), logprobs และ user พารามิเตอร์บางตัวอาจไม่มีผลกับแบ็กเอนด์ของ Google เช่น frequency_penalty และ presence_penalty อาจมีผลจำกัด สำหรับการสตรีม ให้ตั้งค่า 'stream: true' เพื่อรับการตอบกลับแบบทีละโทเคน รูปแบบการตอบกลับเหมือนกับของ OpenAI รวมถึง choices, usage (prompt_tokens, completion_tokens, total_tokens) และ id ตรวจสอบเอกสารของ OrcaRouter สำหรับการแทนที่พารามิเตอร์เฉพาะรุ่นใดๆ
เนื่องจาก OrcaRouter มี API ที่เข้ากันได้กับ OpenAI การย้ายระบบจึงมักเป็นเพียงการเปลี่ยน base URL และ API key แทนที่ 'https://api.openai.com/v1' ด้วย 'https://api.orcarouter.ai/v1' และตั้งค่า model เป็น 'google/gemini-robotics-er-1.6-preview' หากแอปพลิเคชันของคุณใช้ OpenAI Python client ให้อัปเดต base_url และ api_key สำหรับอินพุตแบบ multimodal โปรดทราบว่ารูปแบบของ OpenAI สำหรับรูปภาพใช้ 'image_url' แต่รูปแบบของ Google อาจต้องใช้ชื่อฟิลด์ที่แตกต่างกัน (เช่น 'video_url') API ของ OrcaRouter รองรับ schema แบบ multimodal ที่เป็นซูเปอร์เซตของ OpenAI; โปรดดูเอกสารของพวกเขาสำหรับโครงสร้างที่แน่นอน ทดสอบด้วยคำขออย่างง่ายก่อนที่จะย้ายระบบโลจิกที่ซับซ้อน
Gemini 1.5 Pro เป็นโมเดลหลายรูปแบบเอนกประสงค์ที่มีสมดุลที่แข็งแกร่งระหว่างประสิทธิภาพและต้นทุน โมเดลพรีวิว robotics-er เชี่ยวชาญด้านหุ่นยนต์และการให้เหตุผลเชิงกายภาพ ตามที่ชื่อบอกไว้ ขณะที่ Gemini 1.5 Pro โดยทั่วไปรองรับโทเค็นเอาต์พุตสูงสุด 8,192 โทเค็น แต่โมเดลนี้รองรับสูงสุด 65,536 โทเค็น ราคาแตกต่างกัน: Gemini 1.5 Pro มีราคาประมาณ 1.25 ดอลลาร์ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ 5.00 ดอลลาร์ต่อโทเค็นเอาต์พุต 1 ล้านโทเค็น ดังนั้นโมเดลนี้มีอินพุตถูกกว่าเล็กน้อย แต่เอาต์พุตเท่ากัน อย่างไรก็ตาม โมเดลพรีวิวอาจมีความรู้ทั่วไปน้อยกว่าและเน้นความเข้าใจโลกทางกายภาพมากกว่า ไม่มีการเปรียบเทียบเกณฑ์มาตรฐาน ผู้ใช้ควรทดสอบกับงานของตนเอง
GPT-4o เป็นโมเดลมัลติโมดัลจาก OpenAI ที่รองรับข้อความ รูปภาพ และเสียง (ที่ไม่ใช่วิดีโอ) และมีขีดจำกัดเอาต์พุต 16,384 โทเค็น โมเดล robotics-er มีบริบทเอาต์พุตที่ใหญ่กว่ามาก (65,536) และรองรับอินพุตวิดีโออย่างชัดเจน ซึ่ง GPT-4o ไม่รองรับโดยธรรมชาติ ความแตกต่างด้านราคา: GPT-4o คิดค่าบริการ $2.50 ต่อล้านอินพุตและ $10.00 ต่อล้านเอาต์พุตโทเค็นสำหรับการใช้งานมาตรฐาน ทำให้โมเดล robotics-er ราคาถูกกว่าต่อโทเค็น อย่างไรก็ตาม GPT-4o เป็นโมเดลการผลิตที่เติบโตเต็มที่พร้อมเกณฑ์มาตรฐานที่ครอบคลุม ในขณะที่โมเดลนี้เป็นรุ่นพรีวิว สำหรับงานเฉพาะด้านหุ่นยนต์ โมเดลของ Google อาจถูกออกแบบให้มีประสิทธิภาพดีกว่า แต่หากไม่มีเกณฑ์มาตรฐานสาธารณะ ก็เป็นเพียงการคาดเดา
โมเดล Llama 3 เป็นโมเดลที่ใช้ข้อความเท่านั้น (หรือเร็วๆ นี้จะมีหลายรูปแบบ) แต่สามารถโฮสต์เองได้ ซึ่งอาจประหยัดกว่าในระดับใหญ่ โมเดลสำหรับหุ่นยนต์ (robotics-er) รองรับหลายรูปแบบโดยตรง (รวมถึงวิดีโอและเสียง) ซึ่งทางเลือกโอเพนซอร์สอาจไม่มีให้โดยไม่ต้องเพิ่มส่วนประกอบเพิ่มเติม การกำหนดราคาต่อโทเค็นของโมเดลพรีวิวอาจแพงสำหรับการใช้งานปริมาณมาก ในขณะที่โมเดลโอเพนซอร์สที่รันบนฮาร์ดแวร์ของคุณเองมีต้นทุนโครงสร้างพื้นฐานที่คาดการณ์ได้ อย่างไรก็ตาม โมเดลของ Google ได้ประโยชน์จากโครงสร้างพื้นฐานและอัปเดตระดับคลาวด์ สำหรับการสร้างต้นแบบ ความสะดวกในการใช้งาน (ผ่าน API) ของโมเดลพรีวิวอาจคุ้มค่ากับต้นทุน ประเมินต้นทุนรวมในการเป็นเจ้าของของคุณ รวมถึงเวลาในการพัฒนา
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| อินพุต / 1M โทเค็น | $1.00 |
| เอาต์พุต / 1M โทเค็น | $5.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/google/gemini-robotics-er-1.6-previewเปิด @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview