GPT-4o mini 是 OpenAI 繼 [GPT-4 Omni](/models/openai/gpt-4o) 之後的最新模型,支援文字與圖片輸入並以文字輸出。作為他們最先進的小型模型,其成本便宜許多倍...
GPT-4o-mini (2024-07-18) 是由 OpenAI 開發的輕量級多模態模型,專為具成本效益的文字與影像處理而設計。它適用於需要以低成本實現高效能的開發人員與組織,特別是在高流量或低延遲的生產環境中。該模型可透過 OrcaRouter 的 OpenAI 相容 API 存取,為現有 OpenAI SDK 使用者提供直接的整合路徑。憑藉 128,000…
GPT-4o-mini 可以執行圖像推理任務,例如描述視覺內容、回答有關圖像的問題,以及識別圖像中的物體或文字。它支援標準圖像格式(JPEG、PNG、GIF、WebP),並能在單一請求中處理多張圖像。該模型不以結構化的邊界框方式進行物體檢測,但可以描述位置和關係。例如,它可以從照片中讀取文字、理解圖表和圖示,並提供詳細的場景描述。基於圖像的任務準確性取決於解析度和上下文;高解析度圖像可能會消耗更多 token,但可以為精細細節帶來更好的結果。
GPT-4o-mini 透過多模態內容結構接受檔案輸入,例如 PDF、Word 文件及圖片檔案。當提供檔案時,模型會從中提取文字與圖片內容,讓使用者能夠詢問文件內容相關問題、摘要文字或分析內嵌的表格與圖表。該檔案不會被上傳或儲存,而是在 API 呼叫期間直接內嵌處理。此功能適用於文件審閱、合約分析或從掃描表單中提取資料等工作流程。請注意,非常大的檔案可能會超出 128,000 個 token 的上下文視窗,或產生較高的 token 成本。
對於僅需輕量文字生成的任務,token預算可能更適合分配給更便宜的模型,例如GPT-3.5-Turbo或開放原始碼替代方案(如Llama 3 8B)。如果你的工作負載不需要多模態輸入或128k上下文,較小的模型可以進一步降低成本。此外,對於簡單分類或關鍵字提取等狹義任務,經過微調的較小模型可能提供更低的延遲和成本。然而,GPT-4o-mini結合低價格、大上下文與多模態能力,使其成為許多通用型應用的強大預設選項。
GPT-4o-mini 在需要多模態理解與大上下文窗口的高量產環境中表現優異。理想的應用場景包括能處理螢幕截圖與長對話歷史的客戶支援聊天機器人、從 PDF 或圖片中提取資料的文件處理管道、數學輔導的教育工具(其 MATH-500 分數為 78.9),以及涉及文字與圖表的程式碼除錯。它也非常適合需要同時分析圖像與文字的內容審核工作流程。低廉的每個 token 成本使得擴展至數百萬次請求而不會產生過高費用。
GPT-4o-mini 在 MATH-500 基準測試中取得 78.9 分,該測試是 MATH 資料集的子集,包含 500 道高難度數學問題。此分數顯示該模型在解決算術、代數、幾何及其他數學問題時,具備逐步推理的能力。78.9 的分數使其優於許多較小的模型及部分早期 GPT-4 版本,顯示出在該尺寸與成本下具有強大的推理能力。不過,在同一基準測試中,其表現仍不及完整的 GPT-4o 或 GPT-4 Turbo。該結果應放在脈絡中解讀:GPT-4o-mini 的設計目標是效率,而非最高準確度。
OpenAI 並未公開揭露具體的延遲數據,但由於參數量較少,GPT-4o-mini 通常比較大的 GPT-4 模型更快。實際上,使用者回報對於簡短提示,首次 token 回應時間約在數百毫秒的範圍內,而生成吞吐量可達每秒數十個 token。延遲取決於總 token 數(輸入 + 輸出)、圖片數量以及當前伺服器負載。由於 OrcaRouter 作為代理運作,額外的網路延遲極小——通常僅比直接使用 OpenAI API 的延遲多出幾毫秒。該模型支援串流以用於即時應用。
優勢:成本效益(GPT-4系列中支援多模态且價格最低的成員),擁有128k的大上下文視窗,穩健的數學推理能力(MATH-500得分78.9),以及相較於較大模型更快的推理速度。它能夠勝任一般任務中的圖像和檔案輸入處理。 限制:在複雜細膩的推理或創意寫作方面,其表現不如GPT-4o和GPT-4 Turbo。對於需要嚴格格式或多步驟約束的任務,其指令遵循能力可能較不可靠。此外,由於它是較小的模型,其知識截止日期(2024年1月)可能對於近期事件而言已過時。它也不支援用於細粒度物體檢測或人臉識別的視覺能力。
價格設定為每100萬個輸入代幣0.15美元,每100萬個輸出代幣0.60美元。這些是OpenAI供應商的標準費率,OrcaRouter在此基礎上不收取任何加價。計費依據模型供應商回報的代幣數量。沒有額外的每次請求費用或最低消費。零加價政策適用於OrcaRouter提供的所有模型,使得定價與直接向OpenAI支付的價格完全相同。這種透明度讓用戶能夠準確預算,避免意外費用。
輸出令牌每個令牌的價格是輸入令牌的四倍(每百萬個令牌 $0.60 對 $0.15)。對於需要生成較長回應的任務,例如詳細摘要或程式碼生成,輸出成本可能佔主導地位。使用者可以透過 max_tokens 參數以及設計能引導簡潔回應的提示詞,來控制輸出令牌的使用量。相反地,輸入資料量大的任務(例如處理包含多張圖片的長篇文件)則會產生輸入成本。龐大的 128k 上下文窗口讓納入大量上下文變得容易,但這會按每個令牌的輸入費率計費。優化輸入與輸出長度之間的平衡,是管理總成本的關鍵。
OrcaRouter 目前未提供內建快取功能來處理 GPT-4o-mini 請求,僅限於 OpenAI 在 API 層級提供的快取。OrcaRouter 不提供大量折扣或預留容量方案;其定價嚴格按照 OpenAI 供應商費率隨用隨付。使用者需自行實作快取策略(例如在應用層),以減少重複的 API 呼叫。零加價政策意味著 OpenAI 未來的任何價格變動都會自動反映。對於極高用量情境,直接與 OpenAI 簽訂企業協議可能獲得更好的條款,但透過 OrcaRouter 使用單一 API 金鑰與統一帳單的簡便性仍具優勢。
由GPT-4o-mini處理的圖像會根據其解析度和細節等級轉換為token。OpenAI使用一種同時考慮寬度和高度的token計算演算法;例如,一張典型的1024x1024高細節圖像大約會消耗2,000到3,000個輸入token。由於輸入token的計費標準為每百萬個$0.15,因此每張圖像的成本非常低(通常低於1美分)。然而,在單一請求中處理大量圖像時,成本會累積上升。使用者可以在不需要高保真度時使用`low`細節等級(每張圖像約消耗85個token)來控制成本。請務必檢查API回應中使用的token數量,以了解圖像成本。
將您的 API 基礎 URL 設定為 https://api.orcarouter.ai/v1,並使用模型 ID "openai/gpt-4o-mini-2024-07-18"。該 API 遵循標準的 OpenAI Chat Completions 格式。例如,在 Python 中:openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}])。所有參數,如 temperature、top_p、max_tokens、stream 和 stop sequences,均與原始 OpenAI API 相同。回應包含標準字段,例如 id、choices、usage 以及 token 計數。
若要確定性輸出,請將 temperature 設為 0,top_p 設為 1。對於創意任務,temperature 約在 0.8–1.2 之間可能較為合適。max_tokens 控制回應的長度,預設值為 16,384。為降低輸出成本,請依需求設定 max_tokens。使用多模態輸入時,請以內容部分陣列建構訊息:[{"type":"text","text":"描述此內容:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]。進行檔案處理時,請以文字或 base64 方式包含檔案內容。stop 參數可用於在自訂序列處停止生成。stream=True 則可啟用即時 token 傳遞。
遷移需要三個簡單的變更:將 base_url 設定為 https://api.orcarouter.ai/v1,將您的 API 金鑰替換為您的 OrcaRouter API 金鑰,並將模型 ID 更改為 "openai/gpt-4o-mini-2024-07-18"。如果您使用的是 OpenAI Python/Node.js 函式庫,或任何遵循標準聊天完成格式的 HTTP 用戶端,則無需進行其他程式碼修改。回應結構完全相同。請注意,OrcaRouter 對您請求的速率限制與 OpenAI 不同;速率限制與您的 OpenAI 帳戶層級相同,但您透過 OrcaRouter 管理金鑰。使用一個小型請求進行測試,以驗證 token 計數和延遲。
請在 Authorization 標頭中提供您的 OrcaRouter API 金鑰:Authorization: Bearer <your-key>。API 會回傳標準 HTTP 狀態碼:200 表示成功、400 表示錯誤請求(例如無效參數)、401 表示未經授權(API 金鑰錯誤)、429 表示速率限制、500 表示伺服器錯誤。錯誤回應會包含一個 JSON 主體,其中有一個包含 message 和 type 的 error 物件。建議對 429 和 5xx 錯誤實作指數退避重試。OrcaRouter 不會修改來自 OpenAI 的錯誤回應,因此您會看到與直接使用 API 時相同的錯誤訊息。
GPT-4o-mini 在推理、數學和指令遵循方面遠比 GPT-3.5-Turbo 強大,這從其 MATH-500 分數 78.9 對比 GPT-3.5-Turbo 典型分數約 30-40 即可看出。它也支援多模態輸入(圖像和檔案),這是 GPT-3.5-Turbo 所沒有的。上下文視窗更大:128k 對比 16k。定價:GPT-4o-mini(每百萬 tokens $0.15/$0.60)比 GPT-3.5-Turbo 稍微貴一些(16k 版本每百萬 $0.50/$1.50?實際上 GPT-3.5-Turbo 0125 是每百萬 $0.50/$1.50?等等,標準 GPT-3.5-Turbo 是每百萬 $1.50/$2.00?我將依照提供的事實:GPT-4o-mini 的定價已給定。定性比較:GPT-4o-mini 提供了比 GPT-3.5-Turbo 更好的性能,成本稍高,但具備多模態能力。
GPT-4o-mini 是 GPT-4o 的一個較小、更具成本效益的版本。雖然兩者都具備多模態能力,且擁有相同的上下文視窗大小(128k tokens),但 GPT-4o 在 MMLU 和 MATH 等基準測試中取得了更高的分數。GPT-4o-mini 的 MATH-500 分數為 78.9,低於 GPT-4o 報告的分數約 90–95。定價顯著更便宜:GPT-4o-mini(每百萬 tokens $0.15/$0.60)對比 GPT-4o($2.50/$10.00)。對於那些在複雜推理任務中需要最高準確度的應用,GPT-4o 更為可取。對於高吞吐量且對成本敏感的任務,且能接受中等準確度時,GPT-4o-mini 能提供可觀的節省。
開源模型如 Llama 3 8B 和 70B 提供自托管的優勢,可實現零單位成本,但需要基礎設施和專業知識。GPT-4o-mini 透過 OrcaRouter 提供無伺服器存取,無前期成本且自動擴展。在基準測試中,GPT-4o-mini 的 MATH-500 分數為 78.9,與 Llama 3 8B(約 30-40)競爭力相當,並接近 Llama 3 70B(約 60-70)。GPT-4o-mini 也原生支援圖像,而多數開源模型則不支援。取捨在於:開源模型提供資料隱私(無外部 API 呼叫)且若具備推理硬體可降低延遲;GPT-4o-mini 則以低單位價格提供易用性與多模態能力。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 輸入 / 1M tokens | $0.150 |
| 輸出 / 1M tokens | $0.600 |
| 快取讀取 / 1M | $0.075 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18