Gemini 2.5 Flash Image,又稱「Nano Banana」,現已正式推出。這是一款具備情境理解能力、最先進的影像生成模型。它能夠進行影像生成,...
Google: Nano Banana (Gemini 2.5 Flash Image) 是由 Google 開發的多模態語言模型,屬於 Gemini 2.5 Flash 系列。它同時接受圖像和文字作為輸入,並生成文字輸出。該模型透過 OrcaRouter 的 OpenAI 相容 API 進行存取,使用的模型識別碼為 "google/gemini-2.5-flash-image"。具備…
核心能力集中在理解和推理以圖像形式呈現的視覺內容。給定一張圖像和一則文字提示,該模型可以描述場景、識別物體、回答有關內容的問題、提取文字(OCR),並執行基本的視覺推理(例如空間關係、顏色、動作)。它還可以處理伴隨圖像的文字,例如說明或上下文。由於它採用快閃級架構,因此針對低延遲和高吞吐量進行了優化,使其適用於即時或高流量的應用。然而,在需要細粒度分析或冗長推理鏈的複雜視覺任務上,它可能無法比擬更昂貴、更大的模型(如 Gemini 2.5 Pro)的推理深度或準確性。該模型並非為圖像生成、視頻分析或需要超過32K令牌的長上下文的多次對話等任務而設計。
如果您的應用完全不需要圖像輸入,使用純文字模型(例如較小的Gemini變體或開源模型)會更具成本效益。同樣地,如果您的任務僅涉及純文字推理而無視覺元素,則圖像處理的額外開銷是不必要的。對於輸出長度較長的情境——例如從圖像生成詳細報告或故事——每百萬輸出代幣30美元的成本可能會變得昂貴。在這種情況下,請考慮輸出定價較低的模型,或使用此模型生成簡要摘要,再使用更便宜的純文字模型進行擴展。此外,如果您需要在每個請求中處理多張圖像或處理非常大的圖像,具有較大上下文窗口或特定圖像解析度支援的模型可能更合適。
高流量部署可受惠於此模型的低成本輸入(每百萬個 token 僅需 $0.30)及快速推論。理想使用案例包括:為大型相片庫自動標籤圖片、為數千張產品圖片生成替代文字、對批量掃描文件執行 OCR,以及對使用者上傳的圖片進行即時內容審核。由於輸出成本高昂,回應應保持簡短——通常為一個單詞、標籤或一句話。例如:將圖片分類至預先定義的類別、從表格中提取少數關鍵欄位,或回答關於圖片的「是/否」問題。批次處理可透過 OrcaRouter 的 API 以並行請求執行。此模型的延遲通常較低,但實際吞吐量取決於圖片大小與複雜度。OrcaRouter 除了整體 API 用量外,沒有單獨的速率限制。
主要限制在於輸出token相對於輸入token的成本較高,導致長文本生成費用昂貴。32,768個token的上下文窗口限制了單次請求可處理的文字量及圖像大小(以token計算)。該模型並非專為需要深度多模態推理、複雜視覺細節或同時處理多張圖像的任務而設計(每增加一張圖像會消耗更多上下文)。此外,作為flash級別模型,在專業視覺任務(如醫學圖像分析、細粒度物體檢測或稀有物體識別)上的準確度可能低於功能更強大但速度較慢或成本較高的模型。所提供的資料中未揭露模型的訓練數據及在基準測試中的具體表現;使用者應根據自身資料集進行評估。最後,該模型僅支援圖像與文字輸入,不支援影片或音訊。
提供的資料中並未包含 Google: Nano Banana(Gemini 2.5 Flash 影像)的任何具體基準評分。它屬於 Google 的 Gemini 2.5 Flash 系列,該系列整體著重效率而非頂尖準確度。在缺乏數據的情況下,使用者應預期其效能與其他閃電級多模態模型在標準視覺語言任務(如 VQAv2、COCO Captions 和 OCR)上表現相當。然而,未提供確切分數。我們建議您使用自己的代表性數據集評估該模型,以確定其能力是否符合您的需求。OrcaRouter 不會提供除 Google 公開數據之外的內部基準。如果您需要精確的準確度指標,請查閱 Google 官方文件中有關 Gemini 2.5 Flash 系列的資料,但請注意,此特定模型標識可能有其自身的微調。
提供的资料中没有包含此模型的延迟测量数据。作为Gemini 2.5 Flash系列的一部分,它专为低延迟和高吞吐量而设计。通常,Google的闪存层级模型会在推理质量上做出一定妥协以换取速度,使其适用于近实时应用。实际延迟取决于多种因素,例如输入图像的大小和分辨率、文本提示的长度、请求的输出token数量以及API的当前负载。一般来说,简单的图像标题任务可能在几百毫秒到几秒内完成,而需要更长输出的复杂提示则耗时更长。为获得最佳效果,请保持图像分辨率合理并限制输出长度。OrcaRouter的API除了提供商的响应时间外,没有额外开销。
優勢:該模型在需要從單張圖像快速獲得具成本效益答案的任務中表現出色。它能快速識別常見物體、讀取圖像中的文字,並回答關於視覺內容的直接問題。低廉的輸入成本使其適合處理大量圖像。 限制:在需要高精確度的任務上可能表現不佳,例如計數小型物體、區分極為相似紋理,或理解複雜圖表。模型的理解僅限於從像素數據與文字提示推斷的內容,無法存取訓練數據以外的外部知識(截止日期未知)。此外,由於輸出成本高昂,為每張圖像生成冗長答案可能迅速變得昂貴。對於需要長期詳細分析的任務,更具能力(且通常更昂貴)的模型會更合適。在邊緣案例(如昏暗模糊的圖像或不尋常角度)的表現可能較低。
價格非常直接:每100萬個輸入Token收費0.30美元,每100萬個輸出Token收費30.00美元。輸入Token包含文字提示和圖片的Token(圖片會由模型進行Token化處理)。輸出Token則是模型生成的回應內容。沒有設定費、沒有每月最低消費,OrcaRouter也不加收任何費用——你支付的價格就是供應商的原價。Token由OrcaRouter系統計數。計費方式通常按使用量計算,在你發送請求時開始計費。你可以透過OrcaRouter控制面板監控用量。由於輸入Token遠比輸出Token便宜,一般請求(短輸出)的總成本主要來自輸入端,尤其當你包含大尺寸圖片時。例如,一張1024x1024的圖片可能會消耗數千個輸入Token。
與純文字模型(例如 Gemini 1.5 Flash 純文字版,輸入成本 $0.075/M、輸出成本 $0.30/M)相比,此模型的輸入成本高出 4 倍,輸出成本高出 100 倍,這反映了視覺功能的額外複雜性。對於不需要圖像分析的任務,那些純文字模型便宜得多。與更大的多模態模型(例如 Gemini 2.5 Pro,其每 token 成本較高但推理能力更強)相比,此模型在輸入成本上更低,但輸出成本則視具體的 Pro 層級而相似或更高。Flash 層級的取捨是以較低的準確度換取較低的輸入成本。如果您的應用需要高準確度且能承受較高的輸入成本,Pro 模型可能更適合。如果輸出長度很大,此模型的輸出成本將變得過高,因此可以考慮輸出定價更低的模型,例如 Gemini 1.5 Flash(文字+視覺),其費率可能有所不同。
所提供的資訊並未提及 OrcaRouter 上此模型的任何快取機制或大量折扣。OrcaRouter 以無加價方式傳遞供應商的定價,因此任何折扣都必須來自 Google 的直接帳務安排。截至目前,OrcaRouter 公開的資訊中並未提及自動快取圖像嵌入或提示的功能。使用者應假設每個請求都依據所使用的輸入和輸出 Token 進行計費。對於大量使用的用戶,或許值得聯絡 OrcaRouter 詢問可能的企業協議,但標準即付即用定價為輸入 $0.30/M 和輸出 $30.00/M。為降低成本,請盡可能重複使用先前產生的輸出,並限制每個請求中的 Token 數量(例如,透過調整圖像大小或使用簡短提示)。
使用 Google: Nano Banana (Gemini 2.5 Flash Image) 透過 OrcaRouter,請發送 POST 請求至 https://api.orcarouter.ai/v1/chat/completions,並將 model 參數設為 "google/gemini-2.5-flash-image"。該 API 遵循 OpenAI 聊天完成格式。在 Authorization 標頭中加入您的 OrcaRouter API 金鑰,格式為 "Bearer YOUR_API_KEY"。在請求主體中,提供一個 messages 陣列,內含包含圖片和文字的使用者訊息。對於圖片,請包含一個類型為 "image_url" 的內容部分,並提供 URL 或 base64 資料。範例:{"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"這張圖片裡有什麼?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}。回應將是標準的聊天完成內容,包含模型的回答。
OrcaRouter API 支援許多與 OpenAI API 相同的參數。必要參數:model(必填,設定為 "google/gemini-2.5-flash-image")、messages(必填,訊息物件陣列)、max_tokens(整數,要產生的最大 token 數)、temperature(浮點數,預設為 1.0,控制隨機性)、top_p(浮點數,預設為 1.0)、presence_penalty 和 frequency_penalty(浮點數)、stop(字串或字串陣列,最多 4 個序列)、以及 stream(布林值,用於串流回應)。對於圖片輸入,messages 必須包含至少一則使用者訊息,其 content 為一個 parts 陣列,每個 part 都有一個 type 欄位("text" 或 "image_url")。image_url part 必須有一個 "image_url" 物件,內含一個 "url" 字串(可以是公開可存取的 URL,或包含 base64 的 data URL)。沒有提供微調或其他模型特定的參數。上下文視窗為 32,768 個 token,因此請確保 prompt_token_count + image_token_count + max_tokens <= 32768。
如果已經在使用 OpenAI 相容的 API,遷移到 OrcaRouter 只需要進行極少的程式碼變更。只需將基礎 URL 從先前的端點更改為 https://api.orcarouter.ai/v1。將您的 API 金鑰更新為您的 OrcaRouter 金鑰。在呼叫模型時,將模型參數設定為「google/gemini-2.5-flash-image」(或您想要的模型)。相應地調整任何現有的模型 ID。對於影像輸入,請確保您的請求格式符合 OpenAI 慣例(例如,使用帶有 image_url 的 content 陣列)。通常不需要其他程式碼變更。如果您之前使用的是不同的 API 格式(例如雲端端點),則可能需要重寫請求結構。OrcaRouter 為常見 SDK 提供了文件。使用少量請求進行測試,以驗證 token 計數和價格。請注意,OrcaRouter 以無加價的供應商價格計費,因此價格可能與您之前的供應商不同。
與純文字的 Gemini 2.5 Flash(若 OrcaRouter 提供此選項)相比,此模型新增了圖片輸入能力,但輸入成本較高。純文字版本通常每輸入 token 成本較低,且輸出成本顯著更低,因此更適合純文字任務。與 Gemini 2.5 Pro 模型相比,此 Flash 層級模型輸入成本較低,但準確度與推理深度可能較差。Pro 模型擁有更大的上下文視窗(通常為 100 萬 token),在複雜的多步驟任務上表現更佳。Pro 模型的輸出成本可能相近或更高。對於需要同時理解圖片與文字的任務,此模型提供了經濟實惠的入門選擇。然而,若需處理影片、音訊或同時處理多張圖片,則應考慮支援這些多模態的模型(例如某些配置下支援影片與音訊的 Gemini 2.5 Pro)。
此模型是透過 OrcaRouter 提供的多種多模態選項之一。GPT-4o(OpenAI)通常擁有較大的上下文窗口(128k),並可能在整體圖像理解與推理上表現更佳,但輸入與輸出成本也較高。Claude 的視覺模型(例如 Claude 3.5 Sonnet)同樣具競爭力,但在定價與上下文長度上有所不同。Gemini 2.5 Flash Image 的主要優勢在於其低廉的輸入成本,使其非常適合大量、短輸出的任務。然而,對於複雜的視覺推理、醫療影像或詳細文件分析,更先進的模型可能產出更好的結果。選擇取決於成本、準確性與延遲之間的具體權衡。OrcaRouter 讓您能透過修改模型 ID 輕鬆切換模型,因此您可以將此模型與其他替代方案並行測試,以找出最適合的方案。
當任務需要更高的準確性、更長的上下文或需要更多步驟的推理時,較昂貴的模型(例如 Gemini 2.5 Pro、GPT-4o 或 Claude 3.5 Sonnet)就變得合理。如果您的應用程式在此模型下產生不正確或不完整的結果,那麼如果您需要後處理或人工修正,節省的成本就白費了。對於分析醫學影像、解讀法律文件或處理敏感合規內容等任務,高階模型的可靠性可能值得較高的成本。此外,如果您需要生成較長的輸出(例如整頁描述)或處理非常大的影像,具有較大上下文視窗和較低輸出 token 成本的模型整體上可能更具成本效益。此模型的 flash 層級特性意味著它專為速度和吞吐量而設計,而非深度。在近似理解就足夠的情況下使用它;當精確性重要時升級。
數據隱私與處理方式取決於 Google 對 Gemini 模型的相關政策。與任何雲端 API 相同,輸入資料(圖片與文字)會傳送至 Google 的伺服器進行處理。除非您選擇退出或使用禁止此類用途的企業級帳戶,否則 Google 可能將資料用於模型改善。所提供的資訊並未說明此特定模型的資料處理細節。使用 OrcaRouter 作為閘道時,資料會經過 OrcaRouter 的基礎設施,但最終仍由 Google 處理。OrcaRouter 不會儲存您的資料或用於訓練。使用者應審閱 Google 針對 Gemini API 的資料處理條款,並視需要考慮端到端加密。對於敏感性資料,部分組織偏好使用自家基礎設施代管的模型(例如透過 Vertex AI 並具備資料駐留功能),而非第三方閘道。然而,若資料處理問題可接受,OrcaRouter 提供統一的 API 金鑰與計費功能,這可能簡化存取流程。
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| 輸入 / 1M tokens | $0.300 |
| 輸出 / 1M tokens | $30.00 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image