Gemini 2.5 Flash 是 Google 最先進的主力模型,專為進階推理、程式碼撰寫、數學與科學任務所設計。它內建了「思考」能力,可提供更具...
Google Gemini 2.5 Flash 是由 Google 開發的多模態語言模型。它屬於 Gemini 2.5 系列,專為高效處理文字、圖像、音訊和影片輸入而設計。該模型支援 1,048,576 個 token 的上下文視窗,能夠處理極長的文件或多檔案對話。輸出長度可達 65,536 個 token。Google…
Gemini 2.5 Flash 接受五種輸入模態:檔案(例如 PDF、文件)、圖片、文字、音訊及影片。這讓使用者能在單一請求中提供豐富多樣的資料。舉例來說,你可以提交一段影片錄影、一份對應的文字腳本,以及一份 PDF 參考文件,模型便會跨越所有模態進行推理。對於多數格式,該模型會直接原生處理這些輸入,無需額外編碼或切塊。這種多模態支援對於影片摘要、多文件分析及互動式助手等任務尤其實用。
擁有 1,048,576 個 token 的上下文視窗,Gemini 2.5 Flash 可在單次處理中攝入整本書籍、大型程式碼庫或數小時的轉錄音訊。這消除了對滑動視窗技術或外部記憶體的需求。使用場景包括:審查整個軟體專案中的錯誤、分析帶有大量引用的長篇法律文件,或總結長達數小時的會議。大上下文也使模型能在極長的對話中保持連貫性,不過輸出長度上限為 65,536 個 token。
根據基準測試,Gemini 2.5 Flash 在數學推理方面表現出色,MATH-500 得分為 93.2。由於其龐大的上下文和多模態訓練,該模型在程式碼生成與理解方面也展現出強大的效能。模型原生處理音訊和影片的能力降低了預處理的開銷。其低廉的每個 token 成本使其適合批次處理與即時應用。然而,對於需要極高創造力或領域專業知識的任務,則可能更適合使用專門化或規模更大的模型。
Gemini 2.5 Flash 的定價已極具競爭力,每 100 萬輸入 Token 僅需 0.30 美元,每 100 萬輸出 Token 則為 2.50 美元。然而,對於非常簡單的任務(例如分類或短文本生成),使用較小的模型(如 Gemini 1.5 Flash 或第三方替代方案)可能帶來更低的每 Token 成本。請評估您預期的 Token 使用量與延遲需求。如果您的負載不需要完整的 100 萬上下文或多模態輸入,那麼採用上下文視窗較小的純文字模型可降低費用。OrcaRouter 的目錄提供了多種選項供您進行成本比較。
MATH-500是一個由500道具挑戰性的數學題目組成的基準測試,涵蓋代數、幾何、機率與數論。93.2分表示模型正確解答了93.2%的題目,展現出強大的數學推理與解題能力。此分數使Gemini 2.5 Flash躋身數學任務中表現最佳的模型之一。該基準測試同時評估計算準確性與邏輯推理。開發教育工具、科學計算或大量數學相關工作流程的開發者可將此分數作為參考依據。
速度取決於請求的複雜度、Token 長度及伺服器負載。Google 尚未公布 Gemini 2.5 Flash 的具體延遲數據。然而,「Flash」標示代表其相較於 Pro 版本已針對低延遲進行最佳化。透過 OrcaRouter 的一般使用情境下,回應時間足以因應即時應用需求。針對高吞吐量場景,可考慮批次處理請求或使用串流輸出。OrcaRouter 透過其 OpenAI 相容 API 支援串流回應,有助於降低感知延遲。
與 GPT-4o mini 或 Claude 3 Haiku 等平價模型相比,Gemini 2.5 Flash 提供了更大的上下文視窗(1M,相較於通常的 128K-200K)以及多模態輸入支援。其 MATH-500 得分高達 93.2,超越許多價格相近的競品。成本極具競爭力,特別是輸出 tokens 價格為每 1M tokens $2.50。然而,對於純粹專注於創意寫作或對話流暢度的任務,其他模型可能表現更佳。由於未提供非數學任務的基準測試數據,因此直接比較有限。
雖然 Gemini 2.5 Flash 在數學和程式碼方面表現良好,但在其他面向——例如事實回憶、細微語言理解或創意生成——的表現,並未被所提供的基準測試所涵蓋。作為一款「Flash」模型,它可能為了速度而犧牲了部分推理深度。最多 65,536 個 token 的輸出長度,可能不足以生成非常長的報告或極長輸入的摘要。此外,該模型的訓練資料截止日期和潛在偏見並未明確說明;使用者應針對關鍵應用程式驗證其輸出。
定價簡單明瞭:輸入每100萬個Token收費0.30美元,輸出每100萬個Token收費2.50美元。這些費率按Google的供應商費率計費,OrcaRouter不另加任何加成。無隱藏費用或附加費。舉例來說,處理1000萬個輸入Token的費用為3.00美元,而生成100萬個輸出Token的費用為2.50美元。此定價適用於所有支援的輸入模式。Token計數包含所有文字、圖像區塊(轉換後)以及音訊/視訊片段,依Google的Token化方案計算。
提示快取可以在多個請求中重複使用相同上下文時降低輸入成本。Google Gemini模型支援自動快取重複的前綴標記。在OrcaRouter上,快取行為遵循Google的政策。如果您的應用程式經常發送相同的系統指令或參考文件,快取可能會降低有效的輸入標記成本。確切的節省取決於快取命中率。定價資訊中未提供特定的快取折扣,但使用者應查閱Google的文件以了解快取資格。
Gemini 2.5 Pro 的每個 Token 成本通常高於 Flash(未提供 Pro 的具體價格),但在處理複雜推理任務時可能產生更高品質的結果。Flash 則是專為重視速度與經濟性的應用場景而設計。對於高流量的生產環境,Flash 較低的每個 Token 成本可帶來顯著的節省。然而,若某項任務要求絕對最佳的精確度(例如在法律或醫療推理領域),Pro 的額外成本或許是合理的。建議先取樣您的資料對兩者進行評估,以找出最佳的價格效能取捨。
OrcaRouter 不額外加價,因此每代幣的價格維持在 Google 的提供者費率。企業可直接向 Google 取得批量折扣,但這些折扣並未反映在所列的標準隨用隨付定價中。OrcaRouter 提供簡單的按代幣計費模式,無最低承諾用量。使用者可聯絡 OrcaRouter 以了解可能的按量計費方案資訊,但事實中並未提供具體的折扣結構。
通過 OrcaRouter 的 OpenAI 相容 API 呼叫 Gemini 2.5 Flash。將 base URL 設為 https://api.orcarouter.ai/v1,模型 ID 設為 "google/gemini-2.5-flash"。使用任何 OpenAI SDK 或 HTTP 客戶端。驗證需要來自 OrcaRouter 的 API 金鑰。向 /chat/completions 發送 POST 請求,並帶上 model 參數。Python 範例:client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY"); response = client.chat.completions.create(model="google/gemini-2.5-flash", messages=[{"role":"user","content":"Hello"}])。該 API 支援串流、函式呼叫及其他標準 OpenAI 參數。
所有標準的 OpenAI 聊天完成參數均受支援,包括:messages(訊息物件陣列)、temperature(0-2)、top_p、max_tokens(最高 65536)、frequency_penalty、presence_penalty、stop、stream(布林值)以及 logprobs。對於多模態輸入,請使用包含 text 和 image_url 或 file_url 部分的 content 結構。音訊和視訊輸入可以根據檔案大小以 base64 編碼的資料 URI 或 URL 形式提供。若有需要,API 也支援附帶 JSON 模式的 response_format。詳細格式說明請參閱 OrcaRouter 的文件。
遷移過程很直接,因為 OrcaRouter 使用與 OpenAI 相容的端點。若您正在使用 OpenAI、Anthropic 或其他提供者,請將基礎 URL 改為 https://api.orcarouter.ai/v1,並將 API 金鑰換成 OrcaRouter 的金鑰。將模型 ID 更新為 "google/gemini-2.5-flash"。訊息格式、串流或其他呼叫結構均無需變更。對於原本使用 Google 原生 Vertex AI 或 Generative AI SDK 的使用者,您需要調整為 OpenAI 的訊息格式,但許多函式庫都提供轉換工具。
OrcaRouter 會暴露標準的 HTTP 錯誤代碼:401 表示未授權、429 表示速率限制、500 表示伺服器錯誤。速率限制取決於您的 OrcaRouter 方案。Google 也可能對每個 API 金鑰施加自身的速率限制。API 會以 OpenAI 格式回傳錯誤。對於超過 1M 上下文窗口或 65K 輸出的龐大請求,您將收到 400 錯誤。OrcaRouter 的文件提供了具體的速率限制層級。若觸及速率限制,建議使用指數退避重試。
GPT-4o mini 是 OpenAI 推出的一款較小、較便宜的模型,其上下文窗口為 128K 個 token(比 Gemini 2.5 Flash 小 8 倍)。GPT-4o mini 僅支援文字,而 Gemini 2.5 Flash 則支援檔案、圖片、音訊和影片。在 MATH-500 上,GPT-4o mini 得分約為 70-80(本次比較未提供確切數字),而 Gemini 2.5 Flash 得分為 93.2。GPT-4o mini 的定價約為每 1M 個 token(輸入/輸出)0.15 美元/0.60 美元——輸入方面比 Gemini Flash 便宜,但輸出方面更貴。對於多模態、長上下文任務,請選擇 Gemini Flash;對於成本極低的純文字應用,請選擇 GPT-4o mini。
Gemini 2.0 Flash(上一代)具備 1M token 的上下文長度與相似的多模態支援。然而,Gemini 2.5 Flash 在數學推理方面有所提升,MATH-500 分數為 93.2,而 2.0 Flash 的分數(未提供,但可能較低)。2.5 Flash 的定價為每 1M token $0.30/$2.50,而 2.0 Flash 為每 1M token $0.15/$0.60——因此 2.5 Flash 每個 token 的費用更高,但換取的是更高的準確度。對於對成本敏感且不需要高數學效能的專案,2.0 Flash 可能更適合。OrcaRouter 提供這兩個版本。
其他預算多模態模型包括 Claude 3 Haiku(200K 上下文,文字+圖片)和 Llama 3.2 90B(128K 上下文,文字+圖片)。Gemini 2.5 Flash 提供最大的上下文視窗(1M)並原生支援音訊/影片,這在同價位中相當罕見。其 MATH-500 分數為 93.2,高於許多同級模型。然而,對於純文字生成,像 Mistral Small 這類模型可能提供較低的延遲。最佳選擇取決於您特定的模態需求,以及更大的上下文是否值得付出相應成本。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 輸入 / 1M tokens | $0.300 |
| 輸出 / 1M tokens | $2.50 |
| 快取讀取 / 1M | $0.030 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gemini_2_5_flash,
title = {Gemini 2.5 Flash API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash}
}Google. (2025). Gemini 2.5 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash