O gpt-image-2 da OpenAI é a próxima geração da série gpt-image — um modelo de imagem faturado por token acessado através da API padrão de Imagens da OpenAI. É uma atualização direta do gpt-image-1: mesmo SDK, mesma forma de chamada, mesmos parâmetros. Aponte seu cliente OpenAI existente para a URL base da OrcaRouter e defina o modelo como `openai/gpt-image-2`. O preço é de $5.00 de entrada / $30.00 de saída por 1M tokens, cobrado ao custo — sem margem, sem migração.
OpenAI GPT-Image-2 é um modelo multimodal da OpenAI que se especializa em gerar e editar imagens. Ele aceita prompts de texto e entradas de imagem opcionais para produzir saídas visuais modificadas…
GPT-Image-2 foi projetado para gerar imagens a partir de descrições textuais e editar imagens existentes com base em instruções textuais. Ele pode modificar atributos como cor, textura, forma e composição, além de adicionar ou remover objetos. O modelo suporta inpainting (substituição de partes de uma imagem) e outpainting (extensão da tela) implicitamente por meio do design de prompts. Também permite transferência de estilo, possibilitando que os usuários apliquem uma estética específica a uma imagem de origem. Essas capacidades o tornam adequado para tarefas que vão desde correções simples até experimentações visuais criativas.
Sim, o GPT-Image-2 pode gerar imagens completamente novas a partir de prompts de texto sem exigir nenhuma imagem de entrada. O modelo utiliza a descrição fornecida para criar uma representação visual, incluindo detalhes sobre composição da cena, iluminação, cores e objetos. A qualidade e fidelidade da imagem gerada dependem da especificidade do prompt e das limitações da arquitetura subjacente. Para obter melhores resultados, os prompts devem ser claros e evitar referências ambíguas. Essa capacidade é útil para ideação, prototipagem e geração de ilustrações exclusivas a partir de descrições conceituais.
GPT-Image-2 aceita prompts de texto como entrada principal. Ao editar imagens, exige que uma imagem existente seja fornecida como URL ou como dados brutos codificados em base64 na solicitação da API. A imagem deve estar em um formato padrão, como PNG ou JPEG, com limites de resolução e tamanho definidos pelas especificações da API da OpenAI. O modelo não oferece suporte nativo a vídeo ou entradas de múltiplas imagens; cada solicitação opera em um único par prompt-imagem. As imagens de saída são geradas em formatos comuns, geralmente PNG, e podem ser entregues como URLs ou dados base64, dependendo da preferência do cliente.
GPT-Image-2 não mantém estado entre requisições; cada chamada de API é independente. A edição em várias etapas—onde uma imagem é progressivamente refinada por meio de uma série de prompts—deve ser gerenciada pelo aplicativo que faz a chamada. Os desenvolvedores podem implementar um fluxo de trabalho onde cada etapa passa a saída anterior como entrada para a próxima requisição. Essa abordagem permite edição iterativa, como ajustar cores primeiro, depois adicionar um fundo, e então redimensionar. Embora funcional, a falta de estado interno significa que o aplicativo deve lidar com o contexto, como armazenar imagens intermediárias e construir os prompts apropriados para cada etapa.
A pontuação Elo de Edição de Imagem do LM Arena de 1467,0 é um benchmark que mede a qualidade das saídas de edição de imagem. As pontuações Elo neste contexto são calculadas com base em comparações pareadas das saídas do modelo por avaliadores humanos. Uma pontuação de 1467 indica que o GPT-Image-2 supera significativamente os modelos de base e é competitivo com outros modelos líderes de edição de imagem. Reflete um desempenho forte em tarefas como inserção de objetos, substituição de fundo, alterações de cor e edições composicionais. Esta pontuação é uma das mais altas no ranking do LM Arena para a categoria de edição de imagem, sugerindo que o modelo produz edições coerentes, fiéis aos prompts e visualmente atraentes.
A latência do GPT-Image-2 varia dependendo da complexidade do prompt, do tamanho da entrada (se houver) e da resolução de saída desejada. A OpenAI não publica garantias fixas de latência para este modelo; os tempos de resposta típicos variam de alguns segundos a dezenas de segundos para imagens grandes ou edições complexas. Como o OrcaRouter é um relay que adiciona zero de sobrecarga ao tempo de processamento do provedor, o tempo de espera real é o mesmo que chamar a OpenAI diretamente. Para aplicações de produção, os usuários devem implementar timeouts e lógica de repetição, e considerar o processamento em lote para gerenciar a taxa de transferência.
GPT-Image-2 se destaca em tarefas de edição de imagem que exigem modificações precisas com base em instruções em linguagem natural. Sua alta pontuação Elo no LM Arena reflete sua capacidade de produzir edições que são tanto precisas quanto esteticamente agradáveis. O modelo lida bem com mudanças composicionais complexas, como substituir objetos mantendo iluminação e sombras adequadas. Ele também gera imagens de alta qualidade do zero, com bom fotorrealismo e aderência ao prompt. Usuários comumente relatam que ele lida com instruções criativas (por exemplo, "faça esta cena parecer uma pintura a óleo") com transferência de estilo plausível.
Apesar de seu forte desempenho em benchmarks, o GPT-Image-2 tem limitações. Ele pode ter dificuldades com instruções muito longas ou de múltiplas partes, especialmente quando vários objetos exigem modificação simultânea. O modelo pode produzir artefatos ocasionais, como rostos distorcidos ou texturas irreais, particularmente em cenas complexas. Também possui restrições de segurança que impedem a geração de certos tipos de conteúdo, o que pode limitar alguns usos criativos. Além disso, como o modelo é acessado por meio da infraestrutura da OpenAI, os usuários estão sujeitos à política de conteúdo e aos limites de taxa da OpenAI, o que pode afetar fluxos de trabalho de edição em lote.
GPT-Image-2 é precificado por token: US$ 8,00 por milhão de tokens de entrada e US$ 30,00 por milhão de tokens de saída. Tokens de entrada incluem o prompt de texto e quaisquer dados de imagem codificados como base64 (já que imagens são tokenizadas). Tokens de saída são a representação da imagem gerada. O custo total de uma requisição depende do comprimento do prompt e da resolução tanto da imagem de entrada quanto da de saída. O OrcaRouter repassa essa precificação sem margem de lucro, ou seja, o custo é exatamente o que a OpenAI cobra. Nenhuma taxa adicional é adicionada pela plataforma OrcaRouter.
Não. A OrcaRouter afirma explicitamente que cobra o GPT-Image-2 pela taxa do provedor, sem margem de lucro. Isso significa que o preço por token é exatamente $8,00 para entrada e $30,00 para saída. Não há taxas de assinatura mensal, custos base ou percentuais de margem adicionados pela OrcaRouter. Os únicos encargos são os custos de token consumidos pela OpenAI. Os usuários devem garantir que tenham um método de pagamento válido configurado com a OrcaRouter para evitar interrupção do serviço, mas a fórmula de precificação é transparente e previsível.
OpenAI não oferece publicamente cache para prompts de geração ou edição de imagens; cada solicitação é processada de forma independente. Portanto, repetir prompts idênticos com a mesma imagem de entrada geralmente incorrerá em custos de token completos a cada chamada. No entanto, se sua aplicação usar frequentemente a mesma imagem de entrada, você pode reduzir o uso de tokens de entrada armazenando a imagem externamente e referenciando-a por meio de uma URL (se suportado) em vez de recodificá-la como base64. O OrcaRouter não fornece nenhuma camada de cache adicional que reduziria o consumo de tokens para este modelo.
O preço do GPT-Image-2 é definido pela OpenAI e está entre as opções de maior custo para modelos de imagem devido às suas capacidades especializadas de edição. Alternativas mais baratas, como os modelos Stability AI disponíveis no OrcaRouter, podem oferecer taxas por token mais baixas, mas podem não corresponder à precisão de edição medida pelo benchmark LM Arena. A troca é entre custo e qualidade da saída. Para edições simples ou aplicações de baixo risco, um modelo menos caro pode ser suficiente, enquanto o GPT-Image-2 é preferível quando alta fidelidade e conformidade com o prompt são críticas.
Para usar o GPT-Image-2 através do OrcaRouter, envie uma requisição HTTP POST para o endpoint compatível com OpenAI em https://api.orcarouter.ai/v1/images/generations (ou um endpoint similar dependendo da operação). Defina o parâmetro model como "openai/gpt-image-2". Inclua uma string de prompt e opcionalmente uma imagem (como base64 ou URL) para tarefas de edição. O OrcaRouter autentica requisições usando sua chave de API (normalmente passada no cabeçalho Authorization como "Bearer <key>"). A resposta conterá os dados da imagem gerada no formato especificado pela requisição, geralmente como uma URL ou string base64.
Os parâmetros da API seguem em grande parte o esquema de geração de imagens da OpenAI. Os parâmetros-chave incluem "model" (definido como "openai/gpt-image-2"), "prompt" (a instrução de texto), "n" (número de imagens a gerar, padrão 1), "size" (dimensões de saída como "1024x1024"), "response_format" ("url" ou "b64_json") e "user" (para rastreamento de limite de taxa). Para tarefas de edição, você também pode incluir "image" (a imagem de entrada como base64) e "mask" (para inpainting, especificando quais áreas modificar). Consulte a documentação oficial da OpenAI para a lista completa de parâmetros suportados e suas restrições.
A migração é simples, pois o OrcaRouter oferece uma API totalmente compatível com a OpenAI. As únicas alterações necessárias são atualizar a URL base de `https://api.openai.com` para `https://api.orcarouter.ai/v1` e modificar a string do modelo de algo como `"gpt-image-2"` para `"openai/gpt-image-2"`. Seu código existente para autenticação, serialização de requisições e tratamento de respostas deve funcionar sem modificações. Não são necessárias alterações nos nomes dos parâmetros ou nas estruturas de dados. Após atualizar o endpoint e o ID do modelo, teste com uma única requisição para confirmar a conectividade e o comportamento de cobrança.
OrcaRouter usa autenticação por chave de API. Você deve incluir sua chave de API do OrcaRouter no cabeçalho da solicitação. Os limites de taxa são determinados tanto pelo OrcaRouter quanto pela OpenAI. O OrcaRouter pode impor limites para evitar abuso, mas geralmente são generosos. A OpenAI aplica seus próprios limites de taxa com base no nível e na cobrança, que se aplicam independentemente de você acessar o modelo através do OrcaRouter ou diretamente. Os usuários devem monitorar o uso através do painel do OrcaRouter e ajustar o ritmo das solicitações conforme necessário. Não é necessária autenticação adicional além da chave de API.
GPT-Image-2 e DALL-E 3 são modelos de geração de imagens da OpenAI, mas visam casos de uso diferentes. DALL-E 3 é um modelo de texto para imagem de propósito geral focado em gerar imagens criativas e fotorrealistas a partir do zero. GPT-Image-2 é otimizado para editar imagens existentes, como evidenciado por sua alta pontuação LM Arena Image Edit Elo. Embora DALL-E 3 também possa realizar algumas edições, sua força está na geração original. GPT-Image-2 tende a produzir modificações mais precisas nas imagens de entrada, especialmente quando o prompt envolve preservar elementos da composição original.
Modelos Stability AI, como o SD3.5, são geradores de imagem de código aberto que oferecem custos menores por token, mas podem exigir mais engenharia de prompt para alcançar qualidade similar. O GPT-Image-2, como modelo proprietário, se beneficia de extensos dados de treinamento e ajuste fino para tarefas de edição, refletido em sua pontuação no LM Arena. A escolha entre eles depende do orçamento e dos requisitos de qualidade. Para edições de alto risco onde a precisão importa, o GPT-Image-2 é preferível. Para geração em massa ou quando o custo é a principal preocupação, os modelos Stability AI disponíveis no OrcaRouter podem ser uma alternativa viável, embora você deva avaliar as diferenças de qualidade para sua aplicação específica.
Escolha um modelo mais barato quando sua tarefa for geração simples de imagens sem requisitos de edição, ou quando a tolerância para edições imperfeitas for alta. Por exemplo, gerar imagens placeholder, ícones simples ou gráficos de baixa resolução pode não exigir a sofisticação do GPT-Image-2. Da mesma forma, se seu prompt envolver apenas ajustes menores (por exemplo, alterar brilho ou cortar), um modelo menos especializado pode ser suficiente. O OrcaRouter oferece uma variedade de modelos de imagem com diferentes faixas de preço. Avalie seu caso de uso específico — se a tarefa de edição for complexa e exigir alta fidelidade, o GPT-Image-2 é justificado; caso contrário, considere economia de custos com modelos alternativos.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1| Entrada / 1M tokens | $8.00 |
|---|---|
| Saída / 1M tokens | $30.00 |
| Leitura de cache / 1M | $1.25 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/openai/gpt-image-2Abrir @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2