GPT-4o mini é o modelo mais novo da OpenAI depois do [GPT-4 Omni](/models/openai/gpt-4o), suportando entradas de texto e imagem com saídas de texto. Como seu modelo pequeno mais avançado, é muitas vezes mais acessível…
GPT-4o-mini (2024-07-18) é um modelo multimodal leve desenvolvido pela OpenAI, projetado para processamento de texto e imagens com baixo custo. Ele é destinado a desenvolvedores e organizações que…
O GPT-4o-mini pode realizar tarefas de raciocínio de imagem, como descrever conteúdo visual, responder a perguntas sobre imagens e identificar objetos ou textos em imagens. Ele suporta formatos de imagem padrão (JPEG, PNG, GIF, WebP) e pode lidar com várias imagens em uma única solicitação. O modelo não realiza detecção de objetos no sentido estruturado de caixas delimitadoras, mas pode descrever localizações e relacionamentos. Por exemplo, ele pode ler texto de uma fotografia, entender gráficos e diagramas e fornecer descrições detalhadas de cenas. A precisão das tarefas baseadas em imagem depende da resolução e do contexto; imagens de alta resolução podem incorrer em mais custos de tokens, mas podem produzir melhores resultados para detalhes minuciosos.
O GPT-4o-mini aceita entradas de arquivos como PDFs, documentos do Word e arquivos de imagem por meio da estrutura de conteúdo multimodal. Quando um arquivo é fornecido, o modelo extrai texto e conteúdo de imagem dele, permitindo que os usuários façam perguntas sobre o conteúdo do documento, resumam seu texto ou analisem tabelas e figuras incorporadas. O arquivo não é carregado ou armazenado; ele é processado inline durante a chamada da API. Isso é útil para fluxos de trabalho que envolvem revisão de documentos, análise de contratos ou extração de dados de formulários digitalizados. Observe que arquivos muito grandes podem exceder a janela de contexto de 128.000 tokens ou gerar altos custos de tokens.
Para tarefas que exigem apenas geração de texto leve, os orçamentos de tokens podem ser melhor atendidos por modelos ainda mais baratos, como GPT-3.5-Turbo ou alternativas de código aberto (ex.: Llama 3 8B). Se sua carga de trabalho não precisar de entrada multimodal ou de um contexto de 128k, um modelo menor pode reduzir ainda mais os custos. Além disso, para tarefas restritas, como classificação simples ou extração de palavras-chave, um modelo menor ajustado pode oferecer menor latência e custo. No entanto, a combinação de preço baixo, contexto grande e capacidade multimodal do GPT-4o-mini o torna uma opção padrão forte para muitas aplicações de uso geral.
O GPT-4o-mini se destaca em ambientes de produção de alto volume que se beneficiam da compreensão multimodal e de grandes janelas de contexto. Casos de uso ideais incluem chatbots de suporte ao cliente que podem lidar com capturas de tela e longos históricos de conversas, pipelines de processamento de documentos para extrair dados de PDFs ou imagens, ferramentas educacionais para tutoria de matemática (como evidencia sua pontuação de 78,9 no MATH-500) e depuração de código onde tanto texto quanto diagramas estão envolvidos. Também é adequado para fluxos de moderação de conteúdo que exigem análise de imagens junto com texto. O baixo custo por token permite escalar para milhões de solicitações sem despesas proibitivas.
GPT-4o-mini alcança uma pontuação de 78,9 no benchmark MATH-500, um subconjunto do dataset MATH composto por 500 problemas matemáticos desafiadores. Essa pontuação indica a capacidade do modelo de resolver problemas de aritmética, álgebra, geometria e outras áreas matemáticas com raciocínio passo a passo. Uma pontuação de 78,9 coloca-o acima de muitos modelos menores e de algumas variantes anteriores do GPT-4, sugerindo fortes capacidades de raciocínio para um modelo de seu tamanho e custo. No entanto, ele não é tão performático quanto o GPT-4o completo ou o GPT-4 Turbo no mesmo benchmark. O resultado deve ser interpretado em contexto: GPT-4o-mini é projetado para eficiência, não para precisão máxima.
As figuras de latência específicas não são divulgadas publicamente pela OpenAI, mas o GPT-4o-mini é geralmente mais rápido que os modelos GPT-4 maiores devido ao seu menor número de parâmetros. Na prática, os usuários relatam tempo até o primeiro token na faixa de algumas centenas de milissegundos para prompts curtos e taxa de geração de dezenas de tokens por segundo. A latência depende do número total de tokens (entrada + saída), da quantidade de imagens e da carga atual do servidor. Como o OrcaRouter atua como um proxy, a latência adicional de rede é mínima — geralmente dentro de alguns milissegundos da latência direta da API da OpenAI. O modelo suporta streaming para aplicações em tempo real.
**Pontos fortes:** Eficiência de custo (menor preço entre os membros da família GPT-4 com suporte multimodal), grande janela de contexto de 128k, raciocínio matemático sólido (78,9 MATH-500) e inferência rápida em comparação com modelos maiores. Ele lida com entradas de imagem e arquivo de forma competente para tarefas gerais. **Limitações:** Em raciocínios complexos e sutis ou escrita criativa, tem desempenho inferior em comparação com GPT-4o e GPT-4 Turbo. Sua capacidade de seguir instruções pode ser menos confiável para tarefas que exigem formatação rigorosa ou restrições de múltiplas etapas. Além disso, por ser um modelo menor, sua data de corte de conhecimento (janeiro de 2024) pode estar desatualizada para eventos muito recentes. Ele também não suporta recursos de visão para detecção de objetos refinada ou reconhecimento facial.
Os preços são definidos em $0.15 por 1 milhão de tokens de entrada e $0.60 por 1 milhão de tokens de saída. Estas são as taxas padrão do provedor OpenAI, e o OrcaRouter cobra margem zero sobre elas. A cobrança é baseada na contagem de tokens conforme relatado pelo provedor do modelo. Não há taxas adicionais por solicitação nem valores mínimos. A política de margem zero se aplica a todos os modelos disponíveis através do OrcaRouter, tornando os preços idênticos ao que você pagaria diretamente à OpenAI. Essa transparência permite que os usuários façam orçamentos com precisão, sem custos surpresa.
Os tokens de saída são quatro vezes mais caros por token do que os tokens de entrada ($0,60 vs $0,15 por milhão). Para tarefas que geram respostas longas, como resumos detalhados ou geração de código, os custos de saída podem dominar. Os usuários podem controlar o uso de tokens de saída por meio do parâmetro max_tokens e criando prompts que eliciam respostas concisas. Por outro lado, tarefas com grandes entradas (por exemplo, processamento de documentos longos com muitas imagens) incorrem em custos de entrada. A grande janela de contexto de 128k facilita a inclusão de contexto substancial, mas isso ocorre à taxa por token de entrada. Otimizar o equilíbrio entre o comprimento de entrada e saída é fundamental para gerenciar o custo geral.
OrcaRouter não oferece atualmente cache integrado para requisições GPT-4o-mini além do que a OpenAI fornece no nível da API. Não há descontos por volume ou opções de capacidade reservada disponíveis através do OrcaRouter; o preço é estritamente pay-as-you-go na taxa do provedor OpenAI. Os usuários são responsáveis por implementar suas próprias estratégias de cache (por exemplo, na camada de aplicação) para reduzir chamadas de API duplicadas. A política de margem zero significa que quaisquer alterações futuras de preços pela OpenAI são refletidas automaticamente. Para casos de uso de volume extremamente alto, acordos empresariais diretos com a OpenAI podem oferecer melhores condições, mas através do OrcaRouter a simplicidade de uma única chave de API e faturamento unificado ainda pode ser vantajosa.
Imagens processadas pelo GPT-4o-mini são convertidas em tokens com base em sua resolução e nível de detalhe. A OpenAI utiliza um algoritmo de cálculo de tokens que considera tanto a largura quanto a altura; por exemplo, uma imagem típica de 1024x1024 em alto detalhe pode custar cerca de 2.000 a 3.000 tokens de entrada. Como os tokens de entrada são cobrados a $0,15 por milhão, o custo por imagem é muito baixo (tipicamente abaixo de um centavo). No entanto, processar muitas imagens em uma única solicitação pode acumular. Os usuários podem controlar os custos usando o nível de detalhe `low` (custa aproximadamente 85 tokens por imagem) quando alta fidelidade não for necessária. Sempre verifique os tokens usados na resposta da API para entender os custos das imagens.
Defina sua URL base da API para https://api.orcarouter.ai/v1 e use o ID do modelo "openai/gpt-4o-mini-2024-07-18". A API segue o formato padrão de chat completions da OpenAI. Por exemplo, em Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "sua-chave-orcarouter"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Olá!"}]). Todos os parâmetros como temperature, top_p, max_tokens, stream e sequências de parada são suportados como na API original da OpenAI. As respostas incluem campos padrão como id, choices, usage com contagens de tokens.
Para saídas determinísticas, defina temperature=0 e top_p=1. Para tarefas criativas, uma temperature em torno de 0.8–1.2 pode ser adequada. Max_tokens controla o comprimento da resposta; o padrão é 16.384. Para reduzir o custo de saída, defina max_tokens conforme sua necessidade. Ao usar entradas multimodais, estruture as mensagens com um array de partes de conteúdo: [{"type":"text","text":"Descreva isto:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Para processamento de arquivos, inclua o conteúdo do arquivo como texto ou base64. O parâmetro stop pode ser usado para interromper a geração em sequências personalizadas. Stream=True permite a entrega de tokens em tempo real.
A migração requer três mudanças simples: Defina o base_url para https://api.orcarouter.ai/v1, substitua sua chave de API pela sua chave de API do OrcaRouter e altere o ID do modelo para "openai/gpt-4o-mini-2024-07-18". Nenhuma outra modificação no código deve ser necessária se você estiver usando as bibliotecas Python/Node.js da OpenAI ou qualquer cliente HTTP que siga o formato padrão de chat completions. A estrutura da resposta é idêntica. Observe que o OrcaRouter não limita suas requisições de forma diferente da OpenAI; os mesmos limites de taxa se aplicam de acordo com o nível da sua conta OpenAI, mas você gerencia as chaves através do OrcaRouter. Teste com uma requisição pequena para verificar as contagens de tokens e a latência.
Forneça sua chave de API do OrcaRouter no cabeçalho Authorization: Authorization: Bearer <your-key>. A API retorna códigos de status HTTP padrão: 200 para sucesso, 400 para requisição inválida (ex.: parâmetros inválidos), 401 para não autorizado (chave de API incorreta), 429 para limitação de taxa e 500 para erros do servidor. As respostas de erro incluem um corpo JSON com um objeto de erro contendo uma mensagem e um tipo. Recomenda-se implementar tentativas com backoff exponencial para erros 429 e 5xx. O OrcaRouter não modifica as respostas de erro da OpenAI, portanto, as mesmas mensagens de erro que você vê com a API direta aparecerão.
O GPT-4o-mini é significativamente mais capaz que o GPT-3.5-Turbo em raciocínio, matemática e seguir instruções, como demonstrado por sua pontuação MATH-500 de 78,9 em comparação com a pontuação típica do GPT-3.5-Turbo em torno de 30-40. Ele também suporta entradas multimodais (imagens e arquivos), o que o GPT-3.5-Turbo não faz. A janela de contexto é maior: 128k contra 16k. Preços: GPT-4o-mini ($0,15/$0,60 por milhão de tokens) é ligeiramente mais caro que o GPT-3.5-Turbo ($0,50/$1,50 para a versão de 16k? Na verdade, o GPT-3.5-Turbo 0125 é $0,50/$1,50 por milhão? Espere, o GPT-3.5-Turbo padrão é $1,50/$2,00 por milhão? Vou me ater aos fatos fornecidos: o preço do GPT-4o-mini é fornecido. Compare qualitativamente: o GPT-4o-mini oferece melhor desempenho a um custo ligeiramente maior que o GPT-3.5-Turbo, mas com capacidade multimodal.
GPT-4o-mini é uma versão menor e mais econômica do GPT-4o. Embora ambos compartilhem capacidades multimodais e o mesmo tamanho de janela de contexto (128k tokens), o GPT-4o alcança pontuações mais altas em benchmarks como MMLU e MATH. A pontuação MATH-500 do GPT-4o-mini de 78.9 é menor do que a pontuação reportada do GPT-4o, de aproximadamente 90–95. O preço é significativamente mais barato: GPT-4o-mini ($0.15/$0.60) vs GPT-4o ($2.50/$10.00 por milhão de tokens). Para aplicações onde a precisão máxima em tarefas complexas de raciocínio é crítica, o GPT-4o é preferível. Para tarefas de alto rendimento e sensíveis a custo, onde uma precisão moderada é aceitável, o GPT-4o-mini oferece economias substanciais.
Modelos de código aberto como Llama 3 8B e 70B oferecem a vantagem de auto-hospedagem com custo zero por token, mas exigem infraestrutura e conhecimento técnico. O GPT-4o-mini via OrcaRouter fornece acesso serverless sem custos iniciais e escalonamento automático. Em benchmarks, a pontuação MATH-500 do GPT-4o-mini de 78,9 é competitiva com o Llama 3 8B (cerca de 30-40) e mais próxima do Llama 3 70B (cerca de 60-70). O GPT-4o-mini também suporta imagens nativamente, o que a maioria dos modelos de código aberto não faz. A troca: modelos de código aberto oferecem privacidade de dados (sem chamada externa de API) e menor latência se houver hardware de inferência disponível. O GPT-4o-mini oferece facilidade de uso e capacidade multimodal a um baixo preço por token.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $0.150 |
| Saída / 1M tokens | $0.600 |
| Leitura de cache / 1M | $0.075 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Abrir @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18