OpenAI 的 gpt-image-2 是 gpt-image 系列的新一代產品——這是一個透過標準 OpenAI Images API 存取的 token 計費影像模型。它是 gpt-image-1 的無縫升級:相同的 SDK、相同的呼叫格式、相同的參數。將您現有的 OpenAI 客戶端指向 OrcaRouter 的基礎 URL,並將模型設定為 `openai/gpt-image-2`。定價為每 1M tokens 輸入 $5.00 / 輸出 $30.00,按成本計費——零加成、零遷移。
OpenAI GPT-Image-2 是 OpenAI 推出的一款多模態模型,專門用於生成和編輯圖像。它接受文字提示和可選的圖像輸入,以產生修改後或全新的視覺輸出。該模型的性能以 LM Arena 圖像編輯 Elo 分數 1467.0 來衡量,使其在該基準測試的圖像編輯任務中名列前茅。GPT-Image-2 可通過 OrcaRouter 的 API 使用,該 API 作為底層 OpenAI…
GPT-Image-2 的設計目的是根據文字描述生成圖像,並基於文字指令編輯現有圖像。它能修改色彩、紋理、形狀和構圖等屬性,也能添加或移除物件。該模型透過提示設計隱式支援內補(替換圖像部分區域)與外擴(延伸畫布)功能。此外,它還允許風格轉移,讓使用者能將特定美學套用至來源圖像。這些能力使其適用於從簡單修正到創意視覺實驗等各種任務。
是的,GPT-Image-2 可以根據文字提示生成全新的圖像,無需任何輸入圖像。該模型利用提供的描述來建立視覺呈現,包括場景構圖、光線、顏色和物體等細節。生成圖像的品質和保真度取決於提示的具體程度以及底層架構的限制。為獲得最佳效果,提示應清晰明確,避免模糊的參考。這項功能對於構思、原型設計以及根據概念描述生成獨特插圖非常有用。
GPT-Image-2 接受文字提示作為主要輸入。在編輯圖片時,需要提供現有圖片,可以是 URL 或 API 請求中的原始 base64 編碼數據。圖片應使用標準格式,如 PNG 或 JPEG,解析度和大小限制由 OpenAI 的 API 規範決定。該模型本身不支援影片或多圖片輸入;每個請求僅操作單一提示-圖片對。輸出圖片以常見格式生成,通常為 PNG,可以根據客戶端偏好以 URL 或 base64 數據形式傳遞。
GPT-Image-2 在請求之間不維持狀態;每個 API 呼叫都是獨立的。多步驟編輯——透過一系列提示逐步優化圖像——必須由呼叫端應用程式管理。開發人員可以實作一個工作流程,其中每個步驟將前一個輸出作為輸入傳遞給下一個請求。這種方法支援迭代編輯,例如先調整顏色,然後添加背景,再調整大小。雖然功能上可行,但缺乏內建狀態意味著應用程式必須處理上下文,例如儲存中間圖像並為每個步驟建構適當的提示。
LM Arena 圖像編輯 Elo 分數 1467.0 是一項衡量圖像編輯輸出品質的基準。在此背景下,Elo 分數是根據人類評估者對模型輸出進行兩兩比較計算得出的。1467 分的成績表明 GPT-Image-2 顯著優於基線模型,並與其他領先的圖像編輯模型競爭力相當。這反映了其在物體插入、背景替換、顏色更改和構圖編輯等任務上的強大表現。該分數是 LM Arena 排行榜上圖像編輯類別中最高的之一,顯示該模型生成的編輯結果具有連貫性、忠於提示且視覺吸引力強。
GPT-Image-2 的延遲取決於提示詞的複雜度、輸入大小(若有),以及期望的輸出解析度。OpenAI 並未針對此模型提供固定的延遲保證;典型回應時間從數秒到數十秒不等,取決於大型圖片或複雜編輯需求。由於 OrcaRouter 是零附加延遲的中繼,實際等待時間與直接呼叫 OpenAI 相同。對於正式環境的應用,使用者應實作超時與重試機制,並考慮批次處理以管理吞吐量。
GPT-Image-2 擅長根據自然語言指令進行精確修改的影像編輯任務。其高 LM Arena Elo 分數反映了其在保持準確性與美觀性的同時產出編輯成果的能力。該模型能良好處理複雜的構圖變化,例如在替換物體時維持適當的光影效果。此外,它也能從無到有生成具備良好寫實感且遵循提示的高品質影像。使用者普遍回報,該模型能透過合理的風格轉換處理創意指令(例如「讓這個場景看起來像油畫」)。
儘管GPT-Image-2在基準測試中表現優異,但仍存在侷限性。它在處理超長或多步驟指令時可能遇到困難,尤其是當需要同時修改多個物件時。模型偶爾會產生瑕疵,例如變形的臉部或不自然的紋理,特別是在複雜場景中。此外,安全限制會阻止生成特定類型的內容,這可能限制某些創意用途。由於模型是透過OpenAI的基礎設施存取,使用者需遵守OpenAI的內容政策與速率限制,這可能影響批次編輯的工作流程。
GPT-Image-2 的定價是按 token 計費:每百萬個輸入 token 收費 $8.00,每百萬個輸出 token 收費 $30.00。輸入 token 包含文字提示以及任何以 base64 編碼的影像資料(因為影像會被 token 化)。輸出 token 則是生成的影像表示。一次請求的總成本取決於提示的長度以及輸入和輸出影像的解析度。OrcaRouter 以零加價的方式傳遞此定價,意即成本完全等同於 OpenAI 的收費。OrcaRouter 平台不會增加任何額外費用。
不。OrcaRouter 明確表示,GPT-Image-2 按照供應商費率計費,且不附加任何加價。這意味著每 token 的價格準確為輸入 $8.00 和輸出 $30.00。OrcaRouter 不收取任何月費、基本費用或加價百分比。唯一的費用是 OpenAI 使用的 token 消耗金額。用戶應確保已在 OrcaRouter 設定有效的付款方式以避免服務中斷,但定價公式透明且可預測。
OpenAI 並未公開提供圖片生成或編輯提示詞的快取功能;每個請求都是獨立處理的。因此,重複使用相同的輸入圖片和完全相同的提示詞,每次呼叫通常都會產生完整的代幣成本。不過,如果你的應用程式經常使用相同的輸入圖片,可以考慮將圖片儲存在外部並透過 URL 引用(如果支援),而不是重新編碼為 base64,藉此減少輸入代幣的使用量。OrcaRouter 並未提供任何額外的快取層來降低此模型的代幣消耗。
GPT-Image-2 的定價由 OpenAI 制定,因其專門的編輯功能,屬於圖片模型中成本較高的選項之一。較便宜的替代方案(例如 OrcaRouter 上提供的 Stability AI 模型)可能提供較低的每令牌費率,但在 LM Arena 基準測試中,其編輯精度可能無法匹敵。需要在成本與輸出品質之間權衡。對於簡單編輯或低風險應用,價格較低的模型可能就已足夠;而當忠實度和提示遵從性至關重要時,GPT-Image-2 則更為可取。
若要透過 OrcaRouter 使用 GPT-Image-2,請向相容於 OpenAI 的端點(例如 https://api.orcarouter.ai/v1/images/generations,或其他視操作而定之類似端點)發送 HTTP POST 請求。將模型參數設為 "openai/gpt-image-2"。在請求中包含提示字串,並可選擇性地附上影像(以 base64 或 URL 格式)來執行編輯任務。OrcaRouter 會使用您的 API 金鑰(通常透過 Authorization 標頭傳遞,格式為 "Bearer <key>")來驗證請求。回應中將包含根據請求所指定格式(通常為 URL 或 base64 字串)的生成影像資料。
API 參數大致遵循 OpenAI 的圖像生成架構。關鍵參數包括 "model"(設置為 "openai/gpt-image-2")、"prompt"(文字指令)、"n"(要生成的圖像數量,預設為 1)、"size"(輸出尺寸,例如 "1024x1024")、"response_format"("url" 或 "b64_json")以及 "user"(用於速率限制追蹤)。對於編輯任務,你也可以包含 "image"(輸入圖像的 base64 編碼)和 "mask"(用於修補,指定要修改的區域)。請參考 OpenAI 的官方文檔以獲取支援的參數完整列表及其限制。
遷移非常直接,因為OrcaRouter提供了完全兼容OpenAI的API。唯一需要修改的是將基礎URL從https://api.openai.com更新為https://api.orcarouter.ai/v1,並將模型字串從類似"gpt-image-2"改為"openai/gpt-image-2"。您現有的驗證、請求序列化和回應處理程式碼應可無需修改直接運作。不需要變更參數名稱或資料結構。在更新端點和模型ID後,先用單一請求測試以確認連線和計費行為。
OrcaRouter 使用 API 金鑰進行驗證。你必須在請求標頭中包含你的 OrcaRouter API 金鑰。速率限制由 OrcaRouter 與 OpenAI 共同決定。OrcaRouter 可能會施加限制以防止濫用,但這些限制通常較為寬鬆。OpenAI 則根據層級與計費套用其自身的速率限制,無論你是透過 OrcaRouter 還是直接存取模型,這些限制都會適用。使用者應透過 OrcaRouter 儀表板監控使用情況,並相應調整請求頻率。除了 API 金鑰之外,無需其他額外驗證。
GPT-Image-2 和 DALL-E 3 都是 OpenAI 的图像生成模型,但針對不同的使用場景設計。DALL-E 3 是一個通用文字轉圖像模型,專注於從無到有地生成創意且逼真的圖像。而 GPT-Image-2 則最佳化於編輯現有圖像,其在高 LM Arena 圖像編輯 Elo 分數上的表現足以證明這點。雖然 DALL-E 3 也能進行部分編輯,但其強項在於原創生成。GPT-Image-2 對於輸入圖像的修改往往更為精確,特別是在提示詞要求保留原始構圖元素的情況下。
Stability AI 模型(如 SD3.5)是開源影像生成器,每個 token 的成本較低,但可能需要更多提示工程才能達到相近的品質。GPT-Image-2 作為專有模型,受益於大量訓練資料以及針對編輯任務的微調,這也反映在其 LM Arena 分數上。兩者之間的選擇取決於預算與品質要求。對於精度至關重要的高風險編輯任務,GPT-Image-2 較為理想。至於大量生成或成本為主要考量時,OrcaRouter 上提供的 Stability AI 模型或許是可行的替代方案,但您仍需針對自身應用場景評估品質差異。
當您的任務僅涉及簡單的圖片生成且無編輯需求,或對編輯瑕疵容忍度較高時,請選擇較便宜的模型。例如,生成佔位圖片、簡單圖標或低解析度圖形,可能不需要GPT-Image-2這類的高階模型。同樣地,如果您的提示僅包含微調(如調整亮度或裁切),較不專門的模型可能就已足夠。OrcaRouter提供一系列不同價位的圖片模型。請評估您的具體使用情境——若編輯任務複雜且需高保真度,使用GPT-Image-2是合理的;否則,請考慮其他模型以節省成本。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1| 輸入 / 1M tokens | $8.00 |
|---|---|
| 輸出 / 1M tokens | $30.00 |
| 快取讀取 / 1M | $1.25 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2