GPT-4o mini 是 OpenAI 繼 [GPT-4 Omni](/models/openai/gpt-4o) 之後的最新模型,支援文字與圖片輸入並以文字輸出。作為他們最先進的小型模型,其成本便宜許多倍...
GPT-4o-mini 是 OpenAI 的 GPT-4o 模型的一個更小、更快的變體,專為降低計算成本而最佳化,同時保留多模態能力。它可以處理文字、圖片和上傳的檔案作為輸入,並產生文字輸出。該模型由 OpenAI 託管,可透過 OrcaRouter 兼容 OpenAI 的 API 在基礎網址 https://api.orcarouter.ai/v1 存取,模型識別碼為…
GPT-4o-mini 在多種語言任務上表現優異,包括摘要、翻譯、分類以及問答。它支援結構化 JSON 輸出、函式呼叫與工具使用,可與外部 API 及資料庫整合。128K 上下文視窗讓它能處理大型文件或對話歷史,進行連貫的分析。該模型在常見基準測試中表現良好(MATH-500 得分 78.9),適合教育數學問題、程式碼解釋與資料擷取等任務。對於較簡單的任務,GPT-4o-mini 通常能以較低成本達到與較大模型相當的表現。然而,在需要深厚領域專業知識或高度創意輸出的任務中,其品質可能不如 GPT-4o。
可以在 API 請求中以 URL 或 base64 編碼資料的形式提供圖片。模型會解讀圖片,理解其中的物件、文字及空間關係等視覺內容。這使得視覺問答、圖表解讀及手寫數字辨識等應用場景成為可能。圖片 token 會計入上下文限制,因此高解析度或大尺寸圖片會消耗更多 128K token 預算。模型不會生成圖片,僅處理圖片。對於需要細緻視覺細節的任務(例如醫學影像),專門的視覺模型可能更準確,但 GPT-4o-mini 提供了一個成本合理的通用解決方案。
GPT-4o-mini 除了接受文字和圖片之外,也可接受上傳的檔案。常見檔案類型包括 PDF、.docx、.txt、.csv 和 .json。模型會從檔案中提取文字及相關視覺元素(若檔案包含內嵌圖片),並將其作為上下文的一部分進行處理。這對於分析研究論文、法律合約或試算表相當實用,無需手動複製內容。請注意,檔案內容會計入 token 用量;例如,一份 50 頁的 PDF 可能消耗數千個 token。OrcaRouter 根據總輸入 token(包含來自檔案的 token)計費。除了 token 消耗之外,不另收檔案處理費用。
若您的工作負載僅涉及文字,不包含圖片或檔案,且所需的上下文低於16K tokens,則較小的模型(例如GPT-3.5-turbo)可能提供較低的每個token成本。同樣地,對於吞吐量極高的任務(如簡單分類或瑣碎問答),專用的微調模型可能更具成本效益。GPT-4o-mini在多模態或長上下文使用案例中具有成本效率,但其優勢在於平衡效能與價格。如果您的應用程式可以容忍較慢的回應或較高的成本以換取最高準確度,GPT-4o則是一個替代方案。請針對您的特定任務進行基準測試,以確認哪個模型符合您的品質與預算門檻。
MATH-500 是 MATH 基準測試的子集,包含 500 道競賽等級的數學問題,涵蓋代數、幾何、數論和概率。分數 78.9 表示 GPT-4o-mini 正確解答了約 78.9% 的題目。對於較小的模型而言,這是一項強勁的成果,反映了其數學推理能力。它超越了許多同尺寸的早期模型。然而,在特定問題領域的表現可能有所差異。該基準測試在零樣本條件下進行,即不提供任何先前的範例。對於實際的數學輔導,模型可能需要仔細的提示設計才能正確處理多步驟的解答。
雖然唯一提供的基準是MATH-500,但廣為人知的公開資訊顯示GPT-4o-mini在MMLU(大規模多任務語言理解)、HellaSwag和GSM8K上也表現出競爭力。在這些指標上,它通常排名低於GPT-4o,但高於GPT-3.5-turbo。在推理基準上,以其參數量而言展現出強勁表現。在創意寫作或開放式生成方面,其輸出連貫,但可能缺乏較大模型的細膩度。延遲通常低於GPT-4o,因此適合即時應用。如需確切分數,請參考OpenAI的文件。OrcaRouter提供存取服務,無需額外加價。
延遲取決於請求的複雜度、token 數量以及 API 負載。GPT-4o-mini 被設計為快速回應——對於中等長度的提示,通常在一秒內返回第一個 token。對於長文件(例如 50K tokens),由於模型需要處理整個上下文,延遲將會增加。OrcaRouter 不會修改速度;您體驗到的回應時間與直接呼叫 OpenAI API 相同。支援串流以減少感知延遲。對於延遲敏感的應用,建議保持提示長度簡短並使用串流。確切的首次 token 時間可通過監控回應時間來測量;未提供特定的 SLA。
雖然能力不錯,但GPT-4o-mini因其較小的規模而有其限制。與GPT-4o相比,它在複雜的多步驟推理上可能產出較不準確的答案。它有時可能會誤解細微的指令,或在非常長的輸出中無法保持完美的連貫性。其多模態理解能力良好但並非完美;它可能會遺漏圖片中的小細節或計數錯誤。該模型可能表現出其訓練數據中存在的偏見。它不支援網路搜索或即時數據存取,除非經過明確的微調以用於工具使用。對於需要高精確度的任務(例如法律建議、醫療診斷),人工審查是必要的。基準測試分數反映的是受控環境;實際表現可能有所不同。
OrcaRouter 以 OpenAI 的原始定價直通,不加任何加成:每 100 萬個輸入代幣 0.15 美元,每 100 萬個輸出代幣 0.60 美元。輸入代幣包含所有文字、影像代幣及檔案內容;輸出代幣則計入生成的文字。無月費或隱藏費用。對於具備 128K 上下文窗口的多模態模型而言,這是每代幣的最低成本之一。作為對比,GPT-4o 每 100 萬輸入代幣收費 2.50 美元、每 100 萬輸出代幣收費 10 美元,因此 GPT-4o-mini 在輸入端便宜 94%,輸出端也便宜 94%。對於高用量應用,成本優勢顯著。
雖然GPT-4o-mini每個Token成本低廉,但其較小的模型規模可能需要更多嘗試次數或更詳細的提示才能達到所需準確度,從而可能增加總Token消耗量。對於GPT-4o一次就能正確回答、但GPT-4o-mini需要三次的任務,整體成本可能相近甚至更高。此外,若需提交大量小型請求,API呼叫的開銷可能增加延遲,但不會直接產生費用。未啟用快取機制,每個請求都是全新處理。請同時使用兩種模型評估您的使用場景,找出最佳的成本效能平衡。OrcaRouter提供一致的定價,沒有數量折扣。
OrcaRouter 未實作提示快取。每個對 GPT-4o-mini 的請求都會發送到 OpenAI 的伺服器並按 token 計費。重複的提示沒有折扣。如果您的工作負載經常重複相同的系統訊息或冗長的上下文,您可以考慮在您端儲存回應,以避免重新提交相同的提示。某些供應商提供提示快取折扣,但透過 OrcaRouter 您支付的是標準供應商費率。這是透明且可預測的。缺乏快取簡化了定價,但意味著您應設計查詢以最小化重複的 token 使用。
(注意:這裡沒有提供其他版本的GPT-4o-mini。假設問題是與其他迷你模型如Claude 3 Haiku或Gemini Flash比較,但只有事實可供參考。因此,我們改為與GPT-4o比較。)與GPT-4o相比,GPT-4o-mini價格大幅降低:每100萬輸入tokens從$2.50降至$0.15(便宜94%),每100萬輸出tokens從$10降至$0.60(便宜94%)。許多使用者發現GPT-4o-mini足以應付80-90%的任務,帶來巨大節省。然而,對於需要極高精確度的任務(例如複雜程式碼生成、細微法律推理),成本節省可能無法彌補品質下降。OrcaRouter讓您可以透過同一個API端點,僅需更改模型ID即可輕鬆切換模型。
使用OpenAI用戶端程式庫或任何HTTP用戶端,將基礎網址指向https://api.orcarouter.ai/v1。將模型參數設為"openai/gpt-4o-mini"。驗證需要一個OrcaRouter API金鑰。一個簡短的Python範例: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) 所有OpenAI API參數都支援,包括temperature、max_tokens、stream和tools。OrcaRouter會將請求代理至OpenAI,並傳回未變更的回應。
標準 OpenAI Chat Completions 參數:model(必要:"openai/gpt-4o-mini")、messages(訊息物件陣列)、temperature(0-2,預設 1)、top_p(0-1,預設 1)、n(回應數量,預設 1)、stream(布林值)、stop(字串/陣列)、max_tokens(最高 16384)、presence_penalty、frequency_penalty、logit_bias、user(可選)以及用於函式呼叫的 tools。針對視覺功能,請在 messages 中包含圖片內容(類型為 "image_url" 或含 detail 的 "image_url")。檔案輸入可以 base64 編碼。OrcaRouter 會將所有參數傳遞給 OpenAI。注意:支援回應格式(JSON 模式);適當時設定 response_format={ "type": "json_object" }。
遷移很簡單:將客戶端中的基礎 URL 從 "https://api.openai.com/v1" 改成 "https://api.orcarouter.ai/v1",並將你的 API 金鑰替換為 OrcaRouter 金鑰。將模型名稱更新為 "openai/gpt-4o-mini"(或者保留為 "gpt-4o-mini"?但實際上模型 ID 是 "openai/gpt-4o-mini",所以請使用這個)。所有其他程式碼保持不變,因為 API 完全相容 OpenAI。你也可以保留多個模型字串,並根據成本或能力進行路由。OrcaRouter 不會改變回應格式。用幾個查詢進行測試,確保標頭和串流功能如預期運作。
是的,GPT-4o-mini 支援透過伺服器推送事件(SSE)進行串流。在請求中設定 stream=true。回應將包含一系列包含 delta 內容的區塊。這能減少使用者取得第一個 token 的時間,並實現即時顯示。OrcaRouter 會在轉發串流回應時保持原封不動。請注意,計費的總 token 數量保持不變。串流與所有輸入模態(文字、圖片、檔案)相容。您也可以將串流與函式呼叫結合使用;模型會在適當的時候串流工具呼叫區塊。max_tokens 參數適用於整個回應。
GPT-4o-mini 是 GPT-4o 較小、較便宜的版本。它在輸入和輸出 tokens 上成本約減少 94%。它擁有相同的 128K 上下文視窗和 16K 最大輸出。它支援相同的多模態輸入,但在複雜推理和創意任務上通常略遜一籌。在 MATH-500 上,GPT-4o-mini 得分 78.9,而 GPT-4o 得分約 92+(近似值)。對於許多日常任務如客戶支援、摘要和簡單視覺處理,GPT-4o-mini 已足夠。當你需要頂尖效能且能接受較高延遲和成本時,請選擇 GPT-4o。
與 Claude 3 Haiku 或 Gemini 1.5 Flash 等模型的比較:GPT-4o-mini 提供 128K 的上下文視窗,而 Haiku 支援 200K,Flash 則支援 1M。定價相似(Haiku 每百萬 tokens $0.25/$1.25;Flash $0.35/$1.05)。GPT-4o-mini 的 MATH-500 分數為 78.9,具有競爭力;Haiku 在類似數學基準測試中得分約 73,Flash 約 78。在多模態輸入方面,三者皆支援圖片。GPT-4o-mini 在其價格點上可能提供更好的推理品質,但上下文視窗小於部分競爭對手。最佳選擇取決於您對延遲、成本與品質的具體需求。OrcaRouter 也提供 Haiku 和 Flash 的存取,方便進行並排比較。
GPT-3.5-turbo 較舊,具有 16K 上下文窗口,且成本略低(每 1M 輸入 $0.50,GPT-4o-mini 則為 $0.15?實際上 GPT-3.5-turbo-0125 的成本為 $0.50/$1.50,但上下文較小。根據提供的定價,GPT-4o-mini 每 Token 更便宜,並提供更大的上下文窗口和多模態輸入。因此對於大多數任務,GPT-4o-mini 更優越。然而,一些已在使用 GPT-3.5-turbo 的舊應用可能需要最小的變更。GPT-4o-mini 在推理基準測試上也表現更好。除非延遲極其關鍵,或者您已經微調了 GPT-3.5 模型,否則 GPT-4o-mini 是推薦的直接升級替代方案。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| 輸入 / 1M tokens | $0.150 |
| 輸出 / 1M tokens | $0.600 |
| 快取讀取 / 1M | $0.075 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini