OpenAI's gpt-image-2 è la prossima generazione della serie gpt-image — un modello di immagini fatturato a token, accessibile tramite la standard OpenAI Images API. È un aggiornamento drop-in rispetto a gpt-image-1: stesso SDK, stessa struttura delle chiamate, stessi parametri. Punta il tuo client OpenAI esistente all'URL di base di OrcaRouter e imposta il modello su `openai/gpt-image-2`. Il prezzo è $5.00 input / $30.00 output per 1M di token, fatturato al costo — zero ricarichi, zero migrazione.
OpenAI GPT-Image-2 è un modello multimodale di OpenAI specializzato nella generazione e modifica di immagini. Accetta prompt di testo e input facoltativi di immagini per produrre output visivi…
GPT-Image-2 è progettato per generare immagini a partire da descrizioni testuali e per modificare immagini esistenti basandosi su istruzioni testuali. Può modificare attributi come colore, texture, forma e composizione, nonché aggiungere o rimuovere oggetti. Il modello supporta l'inpainting (sostituzione di parti di un'immagine) e l'outpainting (estensione della tela) implicitamente attraverso la progettazione del prompt. Consente inoltre il trasferimento di stile, permettendo agli utenti di applicare un'estetica data a un'immagine sorgente. Queste capacità lo rendono adatto a compiti che vanno da semplici correzioni a esperimenti visivi creativi.
Sì, GPT-Image-2 può generare immagini completamente nuove da prompt testuali senza richiedere alcuna immagine in input. Il modello utilizza la descrizione fornita per creare una rappresentazione visiva, includendo dettagli sulla composizione della scena, illuminazione, colori e oggetti. La qualità e la fedeltà dell'immagine generata dipendono dalla specificità del prompt e dai vincoli dell'architettura sottostante. Per ottenere i migliori risultati, i prompt dovrebbero essere chiari ed evitare riferimenti ambigui. Questa capacità è utile per ideazione, prototipazione e generazione di illustrazioni uniche a partire da descrizioni di concetti.
GPT-Image-2 accetta prompt di testo come input principale. Durante la modifica delle immagini, richiede un'immagine esistente da fornire come URL o come dati grezzi codificati in base64 all'interno della richiesta API. L'immagine deve essere in un formato standard come PNG o JPEG, con limiti di risoluzione e dimensioni determinati dalle specifiche API di OpenAI. Il modello non supporta input video o multi-immagine in modo nativo; ogni richiesta opera su una singola coppia prompt-immagine. Le immagini di output vengono generate in formati comuni, tipicamente PNG, e possono essere fornite come URL o dati base64 a seconda delle preferenze del cliente.
GPT-Image-2 non mantiene lo stato tra le richieste; ogni chiamata API è indipendente. La modifica in più passaggi—dove un'immagine viene progressivamente perfezionata attraverso una serie di prompt—deve essere gestita dall'applicazione chiamante. Gli sviluppatori possono implementare un flusso di lavoro in cui ogni passaggio passa l'output precedente come input alla richiesta successiva. Questo approccio consente una modifica iterativa, ad esempio regolando prima i colori, poi aggiungendo uno sfondo, quindi ridimensionando. Sebbene funzionale, la mancanza di stato integrato significa che l'applicazione deve gestire il contesto, come la memorizzazione delle immagini intermedie e la costruzione dei prompt appropriati per ogni passaggio.
Il punteggio Elo di 1467.0 di LM Arena per l'editing di immagini è un benchmark che misura la qualità dei risultati di editing delle immagini. I punteggi Elo in questo contesto vengono calcolati sulla base di confronti a coppie degli output dei modelli da parte di valutatori umani. Un punteggio di 1467 indica che GPT-Image-2 supera significativamente i modelli di base ed è competitivo con altri modelli leader di editing di immagini. Riflette prestazioni elevate in compiti come l'inserimento di oggetti, la sostituzione dello sfondo, i cambiamenti di colore e le modifiche compositive. Questo punteggio è tra i più alti nella classifica LM Arena per la categoria di editing di immagini, suggerendo che il modello produce modifiche coerenti, fedeli alle richieste e visivamente accattivanti.
La latenza per GPT-Image-2 varia in base alla complessità del prompt, alla dimensione dell’input (se presente) e alla risoluzione di output desiderata. OpenAI non pubblica garanzie di latenza fisse per questo modello; i tempi di risposta tipici vanno da pochi secondi a decine di secondi per immagini grandi o modifiche complesse. Poiché OrcaRouter è un relay che non aggiunge overhead al tempo di elaborazione del provider, il tempo di attesa effettivo è lo stesso di una chiamata diretta a OpenAI. Per applicazioni in produzione, gli utenti dovrebbero implementare timeout e logica di retry, e considerare l'elaborazione batch per gestire il throughput.
GPT-Image-2 eccelle nelle attività di editing di immagini che richiedono modifiche precise basate su istruzioni in linguaggio naturale. Il suo alto punteggio Elo di LM Arena riflette la sua capacità di produrre modifiche sia accurate che esteticamente gradevoli. Il modello gestisce bene modifiche compositive complesse, come la sostituzione di oggetti mantenendo illuminazione e ombre adeguate. Genera anche immagini di alta qualità da zero con buon fotorealismo e aderenza al prompt. Gli utenti riportano comunemente che gestisce istruzioni creative (ad es., "rendi questa scena simile a un dipinto a olio") con un plausibile trasferimento di stile.
Nonostante le sue ottime prestazioni nei benchmark, GPT-Image-2 presenta dei limiti. Può avere difficoltà con istruzioni molto lunghe o composte da più parti, specialmente quando più oggetti richiedono modifiche simultanee. Il modello può produrre artefatti occasionali, come volti distorti o texture irrealistiche, in particolare in scene complesse. Presenta anche restrizioni di sicurezza che impediscono la generazione di determinati tipi di contenuti, il che può limitare alcuni usi creativi. Inoltre, poiché il modello è accessibile tramite l'infrastruttura di OpenAI, gli utenti sono soggetti alla policy sui contenuti e ai limiti di frequenza di OpenAI, che possono influenzare i flussi di lavoro di modifica in batch.
GPT-Image-2 ha un prezzo per token: $8,00 per milione di token in input e $30,00 per milione di token in output. I token di input includono il prompt testuale e qualsiasi dato immagine codificato in base64 (poiché le immagini sono tokenizzate). I token di output sono la rappresentazione dell'immagine generata. Il costo totale per una richiesta dipende dalla lunghezza del prompt e dalla risoluzione sia dell'immagine in input che di quella in output. OrcaRouter applica questi prezzi senza alcun margine, quindi il costo è esattamente quello addebitato da OpenAI. Nessuna commissione aggiuntiva viene aggiunta dalla piattaforma OrcaRouter.
No. OrcaRouter dichiara esplicitamente che fattura GPT-Image-2 alla tariffa del fornitore senza alcun margine. Ciò significa che il prezzo per token è esattamente $8.00 in input e $30.00 in output. Non ci sono costi di abbonamento mensili, costi base o percentuali di margine aggiunte da OrcaRouter. Gli unici addebiti sono i costi dei token consumati da OpenAI. Gli utenti devono assicurarsi di aver impostato un metodo di fatturazione valido con OrcaRouter per evitare interruzioni del servizio, ma la formula dei prezzi è trasparente e prevedibile.
OpenAI non offre pubblicamente la memorizzazione nella cache per i prompt di generazione o modifica delle immagini; ogni richiesta viene elaborata in modo indipendente. Pertanto, ripetere prompt identici con la stessa immagine di input comporterà in genere costi completi di token per ogni invocazione. Tuttavia, se la tua applicazione utilizza frequentemente la stessa immagine di input, potresti ridurre l'uso di token di input memorizzando l'immagine esternamente e facendovi riferimento tramite un URL (se supportato) invece di ricodificarla in base64. OrcaRouter non fornisce alcun livello aggiuntivo di memorizzazione nella cache che ridurrebbe il consumo di token per questo modello.
Il prezzo di GPT-Image-2 è stabilito da OpenAI e rientra tra le opzioni più costose per i modelli di immagine grazie alle sue capacità di editing specializzate. Alternative più economiche, come i modelli Stability AI disponibili su OrcaRouter, possono offrire tariffe per token più basse ma potrebbero non eguagliare la precisione di editing misurata dal benchmark LM Arena. Il compromesso è tra costo e qualità dell'output. Per modifiche semplici o applicazioni a basso rischio, un modello meno costoso potrebbe essere sufficiente, mentre GPT-Image-2 è preferibile quando l'alta fedeltà e la conformità al prompt sono fondamentali.
Per utilizzare GPT-Image-2 tramite OrcaRouter, invia una richiesta HTTP POST all'endpoint compatibile con OpenAI all'indirizzo https://api.orcarouter.ai/v1/images/generations (o un endpoint simile a seconda dell'operazione). Imposta il parametro model su "openai/gpt-image-2". Includi una stringa prompt e, opzionalmente, un'immagine (in formato base64 o URL) per attività di modifica. OrcaRouter autentica le richieste utilizzando la tua chiave API (tipicamente passata nell'header Authorization come "Bearer <key>"). La risposta conterrà i dati dell'immagine generata nel formato specificato dalla richiesta, solitamente come URL o stringa base64.
I parametri API seguono in gran parte lo schema di generazione di immagini di OpenAI. I parametri principali includono "model" (impostato su "openai/gpt-image-2"), "prompt" (l'istruzione testuale), "n" (numero di immagini da generare, default 1), "size" (dimensioni di output come "1024x1024"), "response_format" ("url" o "b64_json") e "user" (per il monitoraggio dei limiti di richiesta). Per attività di modifica, puoi anche includere "image" (l'immagine di input come base64) e "mask" (per inpainting, specificando quali aree modificare). Fai riferimento alla documentazione ufficiale di OpenAI per l'elenco completo dei parametri supportati e dei relativi vincoli.
La migrazione è semplice perché OrcaRouter fornisce un'API completamente compatibile con OpenAI. Le uniche modifiche necessarie sono aggiornare l'URL di base da https://api.openai.com a https://api.orcarouter.ai/v1 e modificare la stringa del modello, ad esempio da "gpt-image-2" a "openai/gpt-image-2". Il codice esistente per autenticazione, serializzazione delle richieste e gestione delle risposte dovrebbe funzionare senza modifiche. Non sono necessari cambiamenti ai nomi dei parametri o alle strutture dati. Dopo aver aggiornato l'endpoint e l'ID del modello, testa con una singola richiesta per confermare la connettività e il comportamento di fatturazione.
OrcaRouter utilizza l'autenticazione tramite chiave API. Devi includere la tua chiave API OrcaRouter nell'intestazione della richiesta. I limiti di velocità sono determinati sia da OrcaRouter che da OpenAI. OrcaRouter può imporre limiti per prevenire abusi, ma di solito sono generosi. OpenAI applica i propri limiti di velocità in base al livello e alla fatturazione, che si applicano indipendentemente dal fatto che tu acceda al modello tramite OrcaRouter o direttamente. Gli utenti dovrebbero monitorare l'utilizzo tramite il dashboard di OrcaRouter e regolare di conseguenza la frequenza delle richieste. Non è richiesta alcuna autenticazione aggiuntiva oltre alla chiave API.
GPT-Image-2 e DALL-E 3 sono entrambi modelli di generazione di immagini di OpenAI, ma mirano a casi d’uso diversi. DALL-E 3 è un modello text-to-image generico progettato per generare immagini creative e fotorealistiche da zero. GPT-Image-2 è ottimizzato per la modifica di immagini esistenti, come dimostrato dal suo alto punteggio Elo in LM Arena Image Edit. Sebbene DALL-E 3 possa anche eseguire alcune modifiche, il suo punto di forza risiede nella generazione originale. GPT-Image-2 tende a produrre modifiche più accurate alle immagini in input, specialmente quando il prompt implica preservare elementi della composizione originale.
I modelli Stability AI come SD3.5 sono generatori di immagini open-source che offrono costi inferiori per token, ma potrebbero richiedere una maggiore ingegneria dei prompt per raggiungere una qualità simile. GPT-Image-2, in quanto modello proprietario, beneficia di un'ampia mole di dati di addestramento e di un fine-tuning specifico per attività di editing, come riflesso nel suo punteggio LM Arena. La scelta tra i due dipende dal budget e dai requisiti di qualità. Per editing ad alto rischio in cui la precisione è fondamentale, GPT-Image-2 è preferibile. Per la generazione in batch o quando il costo è la preoccupazione principale, i modelli Stability AI disponibili su OrcaRouter possono rappresentare un'alternativa valida, anche se è necessario valutare le differenze di qualità per la propria applicazione specifica.
Scegli un modello più economico quando il tuo compito è la semplice generazione di immagini senza necessità di modifica, o quando la tolleranza per modifiche imperfette è alta. Ad esempio, generare immagini placeholder, icone semplici o grafica a bassa risoluzione potrebbe non richiedere la sofisticatezza di GPT-Image-2. Allo stesso modo, se il tuo prompt prevede solo piccole regolazioni (ad esempio, cambiare la luminosità o ritagliare), un modello meno specializzato potrebbe essere sufficiente. OrcaRouter offre una gamma di modelli di immagine con diversi livelli di prezzo. Valuta il tuo caso specifico: se il compito di modifica è complesso e richiede alta fedeltà, GPT-Image-2 è giustificato; altrimenti, considera il risparmio sui costi derivante da modelli alternativi.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1| Input / 1M token | $8.00 |
|---|---|
| Output / 1M token | $30.00 |
| Lettura cache / 1M | $1.25 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/openai/gpt-image-2Apri @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2