Mô hình xem trước đa phương thức của Google dành cho robot, hỗ trợ đầu vào văn bản, hình ảnh, video và âm thanh với tối đa 65,536 token đầu ra.
google/gemini-robotics-er-1.6-preview là một mô hình xem trước thuộc dòng Gemini của Google, được tối ưu hóa cho robot và suy luận nhúng (embodied reasoning). Đây là một mô hình đa phương thức có thể…
Mô hình được thiết kế cho suy luận đa phương thức liên quan đến robot. Nó có thể diễn giải hình ảnh và video để xác định đối tượng, môi trường và hành động của con người. Nó có thể xử lý các lệnh thoại và trích xuất thông tin từ ngôn ngữ nói. Kết hợp các phương thức này, mô hình có thể tạo ra hướng dẫn cho thao tác, dẫn đường hoặc tương tác của robot. Ví dụ, với một video về căn bếp và yêu cầu bằng giọng nói 'lấy quả táo từ quầy bếp', mô hình có thể xuất ra một chuỗi các hành động. Ngữ cảnh đầu ra lớn cho phép nó tạo ra các kế hoạch chi tiết hoặc mã cho bộ điều khiển robot. Lưu ý rằng hiệu suất của mô hình trên các tác vụ này vẫn chưa được công bố điểm chuẩn công khai cho phiên bản xem trước này.
Nếu ứng dụng của bạn không yêu cầu đầu vào đa phương thức (ví dụ: bạn chỉ sử dụng văn bản), một mô hình chỉ văn bản nhỏ hơn sẽ tiết kiệm chi phí hơn. Mô hình robotics-er có giá tương đối cao cho token đầu vào ($1.00 per million) so với nhiều mô hình đa năng. Đối với việc trả lời câu hỏi đơn giản hoặc tạo văn bản mà không có ngữ cảnh hình ảnh hoặc âm thanh, hãy cân nhắc sử dụng một mô hình nhẹ hơn có sẵn qua OrcaRouter, chẳng hạn như Gemini 1.5 Flash hoặc một mô hình mã nguồn mở nhỏ hơn. Ngoài ra, nếu đầu ra tối đa 65,536 tokens là không cần thiết, một mô hình có ngữ cảnh đầu ra nhỏ hơn có thể mang lại độ trễ và chi phí thấp hơn. Đánh giá xem các khả năng đa phương thức có biện minh cho mức giá cho trường hợp sử dụng của bạn hay không.
Giới hạn đầu ra 65.536 token đặc biệt hữu ích để tạo nội dung dài như chuỗi chuyển động robot (ví dụ: mã Python sử dụng ROS hoặc thư viện điều khiển), mô tả môi trường chi tiết cho tái tạo 3D, hoặc kế hoạch tác vụ nhiều bước đòi hỏi suy luận sâu rộng. Nó cũng có thể được sử dụng cho học trong ngữ cảnh, khi mô hình được cung cấp nhiều ví dụ trong một lời nhắc duy nhất và dự kiến tạo ra đầu ra toàn diện. Đối với nghiên cứu robot, điều này cho phép tạo ra các kế hoạch tầm xa bao phủ nhiều tình huống dự phòng. Tuy nhiên, lưu ý rằng đầu ra dài hơn làm tăng chi phí và độ trễ, vì vậy hãy cân nhắc xem liệu phản hồi ngắn hơn có đủ hay không.
Đầu vào âm thanh và video được xử lý như một phần của prompt đa phương thức. Khi bạn gửi một video, mô hình có thể xử lý nó như một chuỗi các khung hình hoặc sử dụng bộ mã hóa hiểu video (phương pháp chính xác là nội bộ của Google). Âm thanh có thể được bao gồm dưới dạng URL đến tệp âm thanh. Mô hình có thể phiên âm hoặc hiểu các lệnh nói và tạo phản hồi văn bản tương ứng. Chất lượng xử lý âm thanh và video phụ thuộc vào lấy mẫu và định dạng được hỗ trợ bởi API Gemini của Google; tham khảo tài liệu của nhà cung cấp để biết các loại tệp được hỗ trợ và thời lượng tối đa. OrcaRouter chỉ đơn giản chuyển tiếp đầu vào theo định dạng tương thích với OpenAI.
Là bản phát hành xem trước, Google chưa công bố điểm chuẩn cụ thể cho mô hình gemini-robotics-er-1.6-preview. Các mô hình Gemini 1.6 nói chung đã thể hiện hiệu suất mạnh mẽ trên các tác vụ đa phương thức, nhưng biến thể chuyên biệt cho robot này có thể có những điểm mạnh khác nhau. Người dùng nên đánh giá hiệu suất của mô hình trên các tác vụ chuyên biệt của riêng họ trước khi phụ thuộc vào nó. OrcaRouter không cung cấp số liệu điểm chuẩn ngoài những gì nhà cung cấp đã công bố. Để có độ tin cậy trong thực tế, hãy tiến hành thử nghiệm A/B với dữ liệu của riêng bạn và so sánh độ trễ, độ chính xác cũng như chi phí với các mô hình khác.
Độ trễ của google/gemini-robotics-er-1.6-preview không được nhà cung cấp chỉ định. Nói chung, các mô hình đa phương thức xử lý video và âm thanh thường có độ trễ cao hơn các mô hình chỉ văn bản do chi phí mã hóa. Ngoài ra, bối cảnh đầu ra lớn có thể làm tăng thời gian phản hồi, đặc biệt đối với các sinh văn bản dài. Độ trễ thực tế phụ thuộc vào kích thước yêu cầu, độ phức tạp và tải máy chủ trên cả cơ sở hạ tầng của Google và proxy của OrcaRouter. Để có hiệu suất tốt nhất, hãy giảm thiểu dữ liệu đầu vào không cần thiết và đặt max_tokens phù hợp. API của OrcaRouter trả về các tiêu đề thời gian chuẩn; việc theo dõi các tiêu đề đó sẽ cung cấp cho bạn dữ liệu thực nghiệm cho trường hợp sử dụng của bạn.
Điểm mạnh chính của mô hình là hỗ trợ nhiều phương thức đầu vào (văn bản, hình ảnh, video, âm thanh) kết hợp với ngữ cảnh đầu ra cực kỳ lớn lên tới 65,536 token. Điều này làm cho nó phù hợp với các tác vụ robot phức tạp đòi hỏi hiểu cả thông tin thị giác và thính giác cũng như tạo ra các kế hoạch chi tiết, phong phú. Bản chất preview cho thấy nó là một trong những mô hình Gemini đầu tiên được tinh chỉnh cho suy luận nhúng. Một điểm mạnh khác là truy cập trực tiếp qua API tương thích OpenAI của OrcaRouter, giúp giảm rào cản tích hợp cho các nhóm quen thuộc với giao diện OpenAI.
Là một mô hình xem trước, độ ổn định và hiệu suất của nó có thể không bằng các mô hình đã sẵn sàng sản xuất. Việc thiếu các điểm chuẩn được công bố có nghĩa là độ chính xác của nó trên các tác vụ robot tiêu chuẩn chưa được biết đến. Nó có thể có tỷ lệ lỗi cao hơn hoặc các hành vi không mong đợi so với các mô hình đã được thiết lập. Mô hình không tạo ra hình ảnh hoặc đầu ra âm thanh, chỉ có văn bản. Giá trên mỗi token đầu ra tương đối cao (5,00 đô la mỗi triệu) so với nhiều mô hình. Ngoài ra, ngữ cảnh đầu ra lớn có thể khuyến khích các phản hồi dài dòng không phải lúc nào cũng cần thiết. Người dùng nên tạo nguyên mẫu mở rộng trước khi cam kết sử dụng mô hình này cho bất kỳ ứng dụng nghiêm túc nào.
Việc tính phí cho google/gemini-robotics-er-1.6-preview trên OrcaRouter rất đơn giản: $1.00 cho mỗi 1 triệu token đầu vào và $5.00 cho mỗi 1 triệu token đầu ra. Cả token đầu vào và đầu ra đều được đếm theo cách tokenization của Google, có thể khác với các mô hình khác. OrcaRouter tính phí chính xác theo tỷ lệ của nhà cung cấp, không có phụ phí. Không có khoản phí bổ sung nào cho dịch vụ proxy API. Chi phí dựa trên tổng số token được xử lý trong yêu cầu và phản hồi, bao gồm cả token đầu vào đa phương thức (ví dụ: các mảnh hình ảnh có thể được tính là token). Luôn kiểm tra thông tin sử dụng được trả về trong phản hồi API để theo dõi chi phí.
Chi phí token đầu ra ($5.00/ triệu) cao hơn đáng kể so với chi phí đầu vào ($1.00/ triệu). Điều này có nghĩa là việc khiến mô hình tạo ra các phản hồi dài sẽ làm tăng chi phí nhiều hơn so với việc cung cấp đầu vào dài hơn. Đối với các trường hợp sử dụng mà độ dài đầu ra có thể được giữ ngắn (ví dụ: một câu lệnh đơn), chi phí có thể chấp nhận được. Tuy nhiên, nếu bạn tận dụng toàn bộ ngữ cảnh đầu ra 65,536, một yêu cầu đơn lẻ có thể tốn tới $0.33 chỉ cho đầu ra (65k token với giá $5/ triệu). Hãy so sánh điều này với các mô hình có giá đầu ra thấp hơn hoặc cửa sổ ngữ cảnh nhỏ hơn. Ngoài ra, đầu vào đa phương thức có thể đắt nếu chúng yêu cầu nhiều token (ví dụ: hình ảnh độ phân giải cao hoặc video dài). Hãy cân nhắc nén token hoặc sử dụng độ phân giải thấp hơn khi có thể.
OrcaRouter hiện áp dụng giá của nhà cung cấp với markup bằng không. Không có bộ nhớ đệm tích hợp giúp giảm chi phí cho các tiền tố prompt lặp lại, vì đây là proxy truyền qua. Tuy nhiên, bạn có thể triển khai bộ nhớ đệm ở cấp ứng dụng: nếu bạn sử dụng lại các ngữ cảnh đầu vào giống hệt nhau (ví dụ: system prompt tĩnh hoặc hình ảnh tham chiếu), hãy lưu trữ phản hồi của mô hình và sử dụng lại, tránh các lệnh gọi API lặp lại. Giảm giá hoặc định giá theo khối lượng có thể có sẵn thông qua các gói doanh nghiệp của OrcaRouter; liên hệ với nhóm OrcaRouter để biết chi tiết. Giá tiêu chuẩn áp dụng cho tất cả việc sử dụng trừ khi có thỏa thuận đặc biệt.
Sử dụng endpoint chat completions tiêu chuẩn của OpenAI. Đặt tham số 'model' thành 'google/gemini-robotics-er-1.6-preview'. URL cơ sở là https://api.orcarouter.ai/v1. Bao gồm khóa API OrcaRouter của bạn trong header Authorization. Đối với tin nhắn chỉ văn bản, nội dung yêu cầu giống hệt như yêu cầu ChatCompletion của OpenAI: { "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }. Đối với đầu vào đa phương thức, cấu trúc nội dung dưới dạng mảng với các trường type và data theo schema của nhà cung cấp. OrcaRouter dịch yêu cầu sang định dạng của Google bên trong.
API hỗ trợ các tham số tương tự như endpoint /v1/chat/completions của OpenAI: model, messages, max_tokens (tối đa 65536), temperature (0 đến 2, mặc định 1), top_p (0 đến 1, mặc định 1), frequency_penalty, presence_penalty, stop sequences, stream (boolean), logprobs và user. Không phải tất cả các tham số đều có hiệu quả trên backend của Google; ví dụ, frequency_penalty và presence_penalty có thể có tác dụng hạn chế. Đối với streaming, đặt 'stream: true' để nhận phản hồi từng token một. Định dạng phản hồi tương tự như của OpenAI, bao gồm choices, usage (prompt_tokens, completion_tokens, total_tokens) và id. Kiểm tra tài liệu OrcaRouter để biết bất kỳ ghi đè tham số nào theo từng mô hình.
Vì OrcaRouter cung cấp API tương thích với OpenAI, việc di chuyển thường chỉ cần thay đổi base URL và API key. Thay thế 'https://api.openai.com/v1' bằng 'https://api.orcarouter.ai/v1' và đặt model thành 'google/gemini-robotics-er-1.6-preview'. Nếu ứng dụng của bạn sử dụng Python client của OpenAI, hãy cập nhật base_url và api_key. Đối với đầu vào đa phương thức, lưu ý rằng định dạng OpenAI cho hình ảnh sử dụng 'image_url', nhưng định dạng của Google có thể yêu cầu tên trường khác (ví dụ: 'video_url'). API của OrcaRouter chấp nhận một tập hợp siêu của lược đồ đa phương thức của OpenAI; hãy tham khảo tài liệu của họ để biết cấu trúc chính xác. Hãy kiểm tra với một yêu cầu đơn giản trước khi di chuyển logic phức tạp.
Gemini 1.5 Pro là mô hình đa phương thức đa năng với sự cân bằng tốt giữa hiệu suất và chi phí. Mô hình xem trước robotics-er được chuyên biệt hóa cho robot và suy luận nhập thể, như tên gọi của nó. Trong khi Gemini 1.5 Pro thường hỗ trợ tới 8,192 token đầu ra, mô hình này cung cấp tới 65,536 token đầu ra. Giá cả khác nhau: Gemini 1.5 Pro có giá 1.25$ mỗi triệu token đầu vào và 5.00$ mỗi triệu token đầu ra (xấp xỉ), vì vậy mô hình này rẻ hơn một chút cho đầu vào nhưng cùng giá cho đầu ra. Tuy nhiên, mô hình xem trước có thể có ít kiến thức tổng quát hơn và tập trung nhiều hơn vào hiểu biết về thế giới vật lý. Không có so sánh điểm chuẩn; người dùng nên tự kiểm tra trên các tác vụ của mình.
GPT-4o là một mô hình đa phương thức từ OpenAI hỗ trợ văn bản, hình ảnh và âm thanh (không phải video) với giới hạn đầu ra 16.384 token. Mô hình robotics-er có ngữ cảnh đầu ra lớn hơn nhiều (65.536) và hỗ trợ đầu vào video một cách rõ ràng, điều mà GPT-4o không hỗ trợ một cách nguyên bản. Sự khác biệt về giá: GPT-4o tính phí $2.50 cho mỗi triệu token đầu vào và $10.00 cho mỗi triệu token đầu ra cho sử dụng tiêu chuẩn, khiến mô hình robotics rẻ hơn mỗi token. Tuy nhiên, GPT-4o là một mô hình sản xuất trưởng thành với nhiều điểm chuẩn mở rộng, trong khi mô hình này chỉ là bản xem trước. Đối với các tác vụ cụ thể về robotics, mô hình của Google có thể được thiết kế để có hiệu suất tốt hơn, nhưng nếu không có điểm chuẩn công khai, điều này chỉ là suy đoán.
Mô hình Llama 3 chỉ hỗ trợ văn bản (hoặc sắp tới đa phương thức) nhưng có thể tự lưu trữ, giúp tiết kiệm chi phí khi sử dụng quy mô lớn. Mô hình robotics-er cung cấp hỗ trợ đa phương thức gốc (bao gồm video và âm thanh) ngay khi xuất xưởng, điều mà các giải pháp mã nguồn mở khác có thể không cung cấp nếu không có các thành phần bổ sung. Định giá theo token của mô hình xem trước có thể đắt đỏ khi sử dụng khối lượng lớn, trong khi mô hình mã nguồn mở chạy trên phần cứng của bạn có chi phí hạ tầng dự đoán được. Tuy nhiên, mô hình của Google được hưởng lợi từ hạ tầng quy mô đám mây và các bản cập nhật. Đối với việc xây dựng nguyên mẫu, tính dễ sử dụng (qua API) của mô hình xem trước có thể bù đắp chi phí. Hãy đánh giá tổng chi phí sở hữu bao gồm cả thời gian phát triển.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| Đầu vào / 1M tokens | $1.00 |
| Đầu ra / 1M tokens | $5.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/google/gemini-robotics-er-1.6-previewMở @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview