Google 的機器人多模態預覽模型,支援文字、影像、影片和音訊輸入,最多可輸出 65,536 個令牌。
google/gemini-robotics-er-1.6-preview 是 Google Gemini 系列中的一個預覽模型,針對機器人和具身推理進行了優化。它是一個多模態模型,可以處理文字、圖片、影片和音訊輸入。名稱中的「er」很可能代表「embodied reasoning」(具身推理),表示其專注於理解和在物理環境中行動。該模型每次請求支援最多輸出 65,536 個…
該模型專為機器人相關的多模態推理而設計。它能解讀圖片和影片以辨識物件、環境和人類動作。它能處理音訊指令,並從口語中提取資訊。結合這些模態,它能生成機器人操作、導航或互動的指令。例如,給定一段廚房影片和一句口語要求「從檯面上拿取蘋果」,模型可以輸出一連串動作。大型輸出上下文使其能夠為機器人控制器產生詳細計畫或程式碼。請注意,此預覽版本中,模型在這些任務上的表現尚未公開標竿測試。
如果您的應用程式不需要多模態輸入(例如,您僅使用文字),那麼較小的純文字模型將更具成本效益。robotics-er 模型的輸入 token 定價相對較高(每百萬個 1.00 美元),與許多通用模型相比。對於無須視覺或音訊背景的簡單問答或文字生成,請考慮使用 OrcaRouter 提供的較輕量模型,例如 Gemini 1.5 Flash 或較小的開源模型。此外,如果不需要最大 65,536 個 token 的輸出,則採用較小輸出上下文的模型可能帶來更低的延遲與成本。請評估多模態功能是否值得您使用案例的價格。
65,536 個 token 的輸出上限對於生成長篇內容特別有價值,例如機器人動作序列(例如使用 ROS 或控制函式庫的 Python 程式碼)、用於 3D 重建的詳細環境描述,或需要大量推理的多步驟任務規劃。它也可用於情境學習(in-context learning),在單一提示中提供多個範例,並期望模型產出全面的結果。對於機器人研究而言,這使得生成涵蓋多種可能突發狀況的長程規劃成為可能。然而,請注意較長的輸出會增加成本與延遲,因此需考量較短的回應是否已足夠。
音訊和影片輸入會作為多模態提示的一部分進行處理。當你傳送影片時,模型很可能將其視為一系列幀,或使用影片理解編碼器(確切方法為 Google 的內部技術)。音訊可以透過音訊檔案的 URL 來納入。模型能夠轉錄或理解語音指令,並據此生成文字回覆。音訊與影片處理的品質取決於 Google Gemini API 所支援的取樣與格式;請查閱提供者文件以了解支援的檔案類型與最長時長。OrcaRouter 僅以 OpenAI 相容格式轉發輸入內容。
作為預覽版本,Google 尚未公佈 gemini-robotics-er-1.6-preview 模型的具體基準測試分數。一般 Gemini 1.6 模型在多模態任務上表現強勁,但此機器人專用變體可能有不同優勢。使用者應先評估該模型在自己領域特定任務上的表現,再決定是否依賴它。OrcaRouter 僅提供供應商公佈的基準測試數據。若要驗證真實世界的可靠性,請使用自有數據進行 A/B 測試,並比較延遲、準確度及成本與其他模型的差異。
`google/gemini-robotics-er-1.6-preview`的延遲未由提供者指定。一般而言,處理影片和音訊的多模態模型因其編碼開銷,延遲往往高於純文字模型。此外,較大的輸出上下文可能增加回應時間,尤其對於長時間生成的情況。實際延遲取決於請求大小、複雜度,以及Google基礎設施與OrcaRouter代理伺服器上的負載。為達最佳效能,請減少不必要的輸入資料,並設定適當的`max_tokens`。OrcaRouter的API會回傳標準計時標頭;監測這些標頭將能為您的使用案例提供實測數據。
該模型的主要優勢在於支援多種輸入模態(文字、圖像、影片、音訊),並結合高達65,536個token的極大輸出上下文,使其非常適合需要理解視覺與聽覺資訊、並產生詳盡且豐富計畫的複雜機器人任務。其預覽版本特性顯示,這是首批針對具身推理進行微調的Gemini模型之一。另一項優勢是透過OrcaRouter相容於OpenAI的API可直接存取,從而降低熟悉OpenAI介面的團隊的整合門檻。
作為預覽模型,其穩定性與效能可能不及生產級模型。缺乏公佈的基準測試意味著其在標準機器人任務上的準確性未知。與成熟模型相比,它可能出現較高的失敗率或非預期行為。此模型僅能輸出文字,無法生成圖像或音訊。每百萬輸出代幣的費用($5.00)相較許多模型偏高。此外,較大的輸出上下文可能導致不必要的冗長回覆。在將此模型用於任何正式應用之前,使用者應進行充分的原型測試。
OrcaRouter 上 google/gemini-robotics-er-1.6-preview 的計費很直接:每 100 萬個輸入代幣 $1.00,每 100 萬個輸出代幣 $5.00。輸入和輸出代幣均按照 Google 的分詞方式計算,這可能與其他模型不同。OrcaRouter 以零加成收取確切的提供商費率。API 代理服務無需額外費用。費用基於請求和回應中處理的總代幣數,包括多模態輸入代幣(例如,圖像塊可能被計為代幣)。請始終檢查 API 回應中傳回的用量來追蹤費用。
輸出token成本(每百萬個$5.00)明顯高於輸入成本(每百萬個$1.00)。這意味著讓模型生成較長的回應,所增加的成本遠高於提供較長的輸入。對於能保持輸出簡短(例如一句指令)的使用情境,成本或許可以接受。然而,若使用完整的65,536個輸出token上下文,單次請求的輸出部分(65k tokens,以$5/百萬計)成本可能高達$0.33。相較之下,其他模型的輸出定價較低或上下文視窗較小。此外,多模態輸入若需要大量token(例如高解析度圖片或長影片),成本可能高昂。請考慮使用token壓縮或盡可能採用較低解析度。
OrcaRouter 目前以零加價方式套用供應商費率。由於它是純透傳代理,並未內建可針對重複提示前綴降低成本的快取機制。不過,您可以在應用程式層級實作快取:若重複使用相同的輸入上下文(例如靜態系統提示或參考圖片),請儲存模型回應並重複使用,以避免重複的 API 呼叫。OrcaRouter 的企業方案可能提供折扣或大宗定價,詳情請聯絡 OrcaRouter 團隊。除非另有特殊協議,否則所有用量均適用標準定價。
使用標準的 OpenAI chat completions 端點。將 'model' 參數設為 'google/gemini-robotics-er-1.6-preview'。基礎 URL 為 https://api.orcarouter.ai/v1。在 Authorization 標頭中包含您的 OrcaRouter API 金鑰。對於純文字訊息,請求主體與 OpenAI ChatCompletion 請求完全相同:{ "model": "google/gemini-robotics-er-1.6-preview", "messages": [{"role": "user", "content": "Your message"}], "max_tokens": 2000 }。對於多模態輸入,請根據提供者架構將內容結構化為帶有 type 和 data 欄位的陣列。OrcaRouter 會內部將請求轉換為 Google 的格式。
此 API 支援與 OpenAI /v1/chat/completions 端點相同的參數:model、messages、max_tokens(最高 65536)、temperature(0 到 2,預設為 1)、top_p(0 到 1,預設為 1)、frequency_penalty、presence_penalty、stop 序列、stream(布林值)、logprobs 和 user。並非所有參數在 Google 的後端都有效;例如 frequency_penalty 和 presence_penalty 的效果可能有限。若使用串流,請設定 'stream: true' 以逐個 token 接收回應。回應格式與 OpenAI 相同,包含 choices、usage(prompt_tokens、completion_tokens、total_tokens)以及 id。請查閱 OrcaRouter 文件以了解任何特定於模型的參數覆寫。
由於 OrcaRouter 提供相容於 OpenAI 的 API,遷移通常只需變更基礎 URL 和 API 金鑰。將 'https://api.openai.com/v1' 替換為 'https://api.orcarouter.ai/v1',並將模型設定為 'google/gemini-robotics-er-1.6-preview'。如果你的應用程式使用 OpenAI Python 用戶端,請更新 base_url 和 api_key。對於多模態輸入,請注意 OpenAI 用於影像的格式使用 'image_url',但 Google 的格式可能需要不同的欄位名稱(例如 'video_url')。OrcaRouter 的 API 接受 OpenAI 多模態架構的超集;請參閱他們的文件以了解確切結構。在遷移複雜邏輯之前,先用簡單請求進行測試。
Gemini 1.5 Pro 是一個通用多模態模型,在效能與成本之間取得良好平衡。如其名稱所示,robotics-er 預覽模型專門針對機器人技術與具身推理。雖然 Gemini 1.5 Pro 通常支援最多 8,192 個輸出 token,但此模型提供最多 65,536 個輸出 token。定價不同:Gemini 1.5 Pro 每百萬輸入 token 約為 1.25 美元,每百萬輸出 token 約為 5.00 美元,因此此模型在輸入方面略便宜,輸出方面則相同。然而,預覽模型可能擁有較少的通用知識,而更專注於對物理世界的理解。目前沒有基準比較數據;使用者應在自己的任務上進行測試。
GPT-4o 是 OpenAI 的多模態模型,支援文字、圖片和音訊(非影片),輸出限制為 16,384 個 token。而 robotics-er 模型具有更大的輸出上下文(65,536),並明確支援影片輸入,這是 GPT-4o 原生不支援的。價格差異:GPT-4o 標準使用收費為每百萬輸入 token 2.50 美元,每百萬輸出 token 10.00 美元,因此 robotics 模型每個 token 更便宜。然而,GPT-4o 是成熟的生產模型,擁有廣泛的基準測試,而此模型僅為預覽版。對於機器人特定任務,Google 模型可能設計得更好,但缺乏公開基準測試,這僅是推測。
Llama 3 模型目前僅支援純文字(或即將推出多模態),但可自行託管,在大規模使用時成本較低。而 robotics-er 模型則原生支援多模態(包括影片與音訊),開源替代方案若無額外元件可能無法提供此功能。預覽模型的逐 token 定價對於高用量場景可能較為昂貴,但自行運行開源模型則可預測基礎設施成本。然而,Google 模型受益於雲端規模的基礎設施與持續更新。在原型開發階段,預覽模型透過 API 的易用性可能勝過成本考量。請評估包含開發時間在內的總體擁有成本。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-robotics-er-1.6-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_pinclude_reasoningreasoning| 輸入 / 1M tokens | $1.00 |
| 輸出 / 1M tokens | $5.00 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
GET /api/public/models/google/gemini-robotics-er-1.6-preview開啟 @misc{orcarouter_gemini_robotics_er_1_6_preview,
title = {google/gemini-robotics-er-1.6-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview}
}google. (n.d.). google/gemini-robotics-er-1.6-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-robotics-er-1.6-preview