GPT-4o mini é o modelo mais novo da OpenAI depois do [GPT-4 Omni](/models/openai/gpt-4o), suportando entradas de texto e imagem com saídas de texto. Como seu modelo pequeno mais avançado, é muitas vezes mais acessível…
GPT-4o-mini é uma variante menor e mais rápida do modelo GPT-4o da OpenAI, otimizada para menor custo computacional, mantendo capacidades multimodais. Ela pode processar texto, imagens e arquivos…
GPT-4o-mini destaca-se em uma ampla gama de tarefas linguísticas, incluindo sumarização, tradução, classificação e respostas a perguntas. Ele suporta saída JSON estruturada, chamada de funções e uso de ferramentas, permitindo integração com APIs e bancos de dados externos. A janela de contexto de 128K permite processar grandes documentos ou históricos de conversas para uma análise coerente. Tem bom desempenho em benchmarks comuns (pontuação MATH-500 de 78,9) e é adequado para problemas matemáticos educacionais, explicação de código e extração de dados. Para tarefas mais simples, o GPT-4o-mini frequentemente iguala modelos maiores a uma fração do custo. No entanto, tarefas que exigem profundo conhecimento de domínio ou resultados altamente criativos podem apresentar qualidade reduzida em comparação com o GPT-4o.
As imagens podem ser fornecidas como URLs ou dados codificados em base64 na requisição da API. O modelo interpreta imagens, compreendendo conteúdo visual como objetos, texto em imagens e relações espaciais. Isso permite casos de uso como perguntas e respostas visuais (visual Q&A), interpretação de diagramas e reconhecimento de dígitos manuscritos. Os tokens de imagem contam contra o limite de contexto, então imagens de alta resolução ou grandes consomem mais do orçamento de 128K tokens. O modelo não gera imagens; ele apenas as processa. Para tarefas que exigem detalhes visuais refinados (por exemplo, imagens médicas), um modelo de visão especializado pode ser mais preciso, mas o GPT-4o-mini oferece uma solução de propósito geral com custo razoável.
O GPT-4o-mini aceita arquivos enviados além de texto e imagens. Tipos de arquivo comuns incluem PDFs, .docx, .txt, .csv e .json. O modelo extrai texto e elementos visuais relevantes (se o arquivo contiver imagens incorporadas) e os processa como parte do contexto. Isso é útil para analisar artigos de pesquisa, contratos legais ou planilhas sem cópia manual. Observe que o conteúdo do arquivo contribui para o uso de tokens; por exemplo, um PDF de 50 páginas pode consumir vários milhares de tokens. O OrcaRouter cobra com base no total de tokens de entrada, incluindo aqueles de arquivos. Não há taxa adicional de processamento de arquivos além do consumo de tokens.
Se sua carga de trabalho envolve apenas texto, sem imagens ou arquivos, e o contexto necessário está abaixo de 16K tokens, um modelo menor (como o GPT-3.5-turbo) pode oferecer custo mais baixo por token. Da mesma forma, para tarefas de altíssima taxa de transferência, como classificação simples ou perguntas e respostas triviais, um modelo ajustado dedicado pode ser mais econômico. O GPT-4o-mini é econômico para casos de uso multimodais ou de contexto longo, mas sua força está em equilibrar desempenho e preço. Se sua aplicação pode tolerar respostas mais lentas ou custo maior para máxima precisão, o GPT-4o é uma alternativa. Avalie sua tarefa específica para confirmar qual modelo atende aos seus limites de qualidade e orçamento.
MATH-500 é um subconjunto do benchmark MATH, composto por 500 problemas de matemática em nível de competição, abrangendo álgebra, geometria, teoria dos números e probabilidade. Uma pontuação de 78,9 indica que o GPT-4o-mini respondeu corretamente aproximadamente 78,9% desses problemas. Esse é um resultado forte para um modelo menor, refletindo sua capacidade de raciocínio matemático. Ele supera muitos modelos anteriores de tamanho semelhante. No entanto, o desempenho pode variar em domínios específicos de problemas. O benchmark é conduzido sob condições de zero-shot, ou seja, nenhum exemplo prévio é fornecido. Para tutoria de matemática no mundo real, o modelo pode precisar de prompts cuidadosos para lidar corretamente com soluções de múltiplas etapas.
Embora o único benchmark fornecido seja o MATH-500, informações públicas amplamente conhecidas indicam que o GPT-4o-mini também obtém pontuações competitivas em MMLU (compreensão massiva de múltiplas tarefas linguísticas), HellaSwag e GSM8K. Ele geralmente fica abaixo do GPT-4o, mas acima do GPT-3.5-turbo nessas métricas. Em benchmarks de raciocínio, apresenta um desempenho forte considerando sua contagem de parâmetros. Em escrita criativa ou geração de texto aberto, suas saídas são coerentes, mas podem carecer da nuance de modelos maiores. A latência é geralmente menor que a do GPT-4o, tornando-o adequado para aplicações em tempo real. Para pontuações exatas, consulte a documentação da OpenAI. O OrcaRouter fornece acesso sem acréscimos adicionais.
A latência depende da complexidade da solicitação, da contagem de tokens e da carga da API. O GPT-4o-mini foi projetado para ser rápido — normalmente retornando o primeiro token em menos de um segundo para prompts de comprimento moderado. Para documentos longos (por exemplo, 50K tokens), a latência aumentará à medida que o modelo processa todo o contexto. O OrcaRouter não modifica a velocidade; você experimenta os mesmos tempos de resposta que chamadas diretas à API da OpenAI. O streaming é suportado para reduzir a latência percebida. Para aplicações críticas de latência, considere manter os comprimentos dos prompts curtos e usar streaming. O tempo exato até o primeiro token pode ser medido monitorando o tempo de resposta; nenhum SLA específico é fornecido.
Embora capaz, o GPT-4o-mini tem limitações devido ao seu tamanho reduzido. Pode produzir respostas menos precisas em raciocínios complexos de múltiplas etapas em comparação com o GPT-4o. Às vezes, pode interpretar mal instruções sutis ou falhar em manter coerência perfeita em saídas muito longas. Sua compreensão multimodal é boa, mas não impecável; pode perder pequenos detalhes em imagens ou contar elementos incorretamente. O modelo pode apresentar vieses presentes em seus dados de treinamento. Não oferece suporte a pesquisa na internet ou acesso a dados em tempo real, a menos que seja explicitamente ajustado para uso de ferramentas. Para tarefas que exigem alta precisão (por exemplo, aconselhamento jurídico, diagnóstico médico), a revisão humana é essencial. As pontuações de benchmark refletem ambientes controlados; o desempenho no mundo real pode variar.
OrcaRouter repassa o preço exato da OpenAI sem margem de lucro: $0,15 por 1 milhão de tokens de entrada e $0,60 por 1 milhão de tokens de saída. Tokens de entrada incluem todo texto, tokens de imagem e conteúdo de arquivo. Tokens de saída contam o texto gerado. Não há taxas mensais nem encargos ocultos. Este é um dos menores custos por token para um modelo multimodal com janela de contexto de 128K. Para comparação, o GPT-4o custa $2,50 por 1M de entrada e $10 por 1M de saída, tornando o GPT-4o-mini 94% mais barato na entrada e 94% mais barato na saída. A vantagem de custo é significativa para aplicações de alto volume.
Embora o GPT-4o-mini seja barato por token, seu tamanho menor pode exigir mais tentativas ou prompts mais detalhados para alcançar a precisão desejada, potencialmente aumentando o consumo total de tokens. Para tarefas em que o GPT-4o obtém a resposta correta em uma tentativa, mas o GPT-4o-mini precisa de três, o custo geral pode ser semelhante ou até maior. Além disso, se você precisar enviar muitas solicitações pequenas, a sobrecarga das chamadas de API pode adicionar latência, mas não custo direto. O cache não é aplicado; cada solicitação é processada do zero. Avalie seu caso de uso com ambos os modelos para determinar o melhor equilíbrio entre custo e desempenho. O OrcaRouter oferece preços consistentes sem descontos por volume.
OrcaRouter não implementa cache de prompts. Cada requisição ao GPT-4o-mini é enviada aos servidores da OpenAI e faturada por token. Não há taxa com desconto para prompts repetidos. Se sua carga de trabalho repete frequentemente a mesma mensagem do sistema ou contexto extenso, você pode considerar armazenar a resposta em seu lado para evitar reenviar prompts idênticos. Alguns provedores oferecem descontos de cache de prompt, mas através do OrcaRouter você paga a taxa padrão do provedor. Isso é transparente e previsível. A falta de cache simplifica a precificação, mas significa que você deve projetar suas consultas para minimizar o uso redundante de tokens.
(Nota: Nenhuma outra variante do GPT-4o-mini é fornecida. Supondo que a pergunta seja sobre comparação com outros modelos mini como Claude 3 Haiku ou Gemini Flash, mas apenas fatos são fornecidos. Em vez disso, comparamos com o GPT-4o.) Em comparação com o GPT-4o, o GPT-4o-mini é dramaticamente mais barato: US$ 0,15 vs US$ 2,50 por 1M de tokens de entrada (94% mais barato) e US$ 0,60 vs US$ 10 por 1M de tokens de saída (94% mais barato). Muitos usuários consideram o GPT-4o-mini adequado para 80-90% das tarefas, proporcionando grandes economias. No entanto, para tarefas que exigem máxima precisão (por exemplo, geração de código complexo, raciocínio jurídico detalhado), a economia de custos pode não justificar quedas de qualidade. O OrcaRouter permite alternar entre modelos facilmente por meio do mesmo endpoint de API, alterando o ID do modelo.
Use a biblioteca cliente OpenAI ou qualquer cliente HTTP, apontando a URL base para https://api.orcarouter.ai/v1. Defina o parâmetro model como "openai/gpt-4o-mini". A autenticação requer uma chave de API OrcaRouter. Um exemplo mínimo em Python: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="sua-chave") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explique computação quântica."}]) Todos os parâmetros da API OpenAI são suportados, incluindo temperature, max_tokens, stream e tools. O OrcaRouter faz proxy das requisições para OpenAI e retorna as respostas sem alterações.
Parâmetros padrão do OpenAI Chat Completions: model (obrigatório: "openai/gpt-4o-mini"), messages (array de objetos de mensagem), temperature (0-2, padrão 1), top_p (0-1, padrão 1), n (número de respostas, padrão 1), stream (booleano), stop (string/array), max_tokens (até 16384), presence_penalty, frequency_penalty, logit_bias, user (opcional) e tools para chamada de funções. Para visão, inclua conteúdo de imagem nas mensagens (type "image_url" ou "image_url" com detail). Entradas de arquivo podem ser codificadas em base64. O OrcaRouter passa todos os parâmetros para o OpenAI. Nota: O formato de resposta (modo JSON) é suportado; defina response_format={ "type": "json_object" } quando apropriado.
A migração é simples: altere a URL base no seu cliente de "https://api.openai.com/v1" para "https://api.orcarouter.ai/v1" e substitua sua chave de API por uma chave OrcaRouter. Atualize o nome do modelo para "openai/gpt-4o-mini" (ou mantenha como "gpt-4o-mini"? O fato diz que o ID do modelo é "openai/gpt-4o-mini", então use esse). Todo o restante do código permanece inalterado porque a API é totalmente compatível com a OpenAI. Você também pode manter várias strings de modelo e rotear com base no custo ou na capacidade. O OrcaRouter não altera o formato da resposta. Teste com algumas consultas para garantir que os cabeçalhos e o streaming funcionem conforme o esperado.
Sim, o GPT-4o-mini suporta streaming via eventos enviados pelo servidor (SSE). Defina stream=true na requisição. A resposta será uma série de blocos contendo conteúdo delta. Isso reduz o tempo até o primeiro token para os usuários e permite exibição em tempo real. O OrcaRouter encaminha respostas de streaming sem modificação. Observe que a contagem total de tokens faturados permanece a mesma. O streaming é compatível com todas as modalidades de entrada (texto, imagem, arquivo). Você também pode combinar streaming com chamadas de função; o modelo transmitirá um bloco de chamada de ferramenta quando apropriado. O parâmetro max_tokens se aplica a toda a resposta.
GPT-4o-mini é a versão menor e mais barata da GPT-4o. Custa cerca de 94% menos tanto em tokens de entrada quanto de saída. Possui a mesma janela de contexto de 128K e saída máxima de 16K. Suporta as mesmas entradas multimodais, mas geralmente é um pouco menos precisa em tarefas complexas de raciocínio e criatividade. No MATH-500, GPT-4o-mini obtém 78,9 enquanto GPT-4o obtém 92+ (aproximadamente). Para muitas tarefas cotidianas, como suporte ao cliente, sumarização e visão simples, GPT-4o-mini é suficiente. Escolha GPT-4o quando precisar de desempenho de alto nível e puder aceitar maior latência e custo.
Comparação com modelos como Claude 3 Haiku ou Gemini 1.5 Flash: o GPT-4o-mini oferece uma janela de contexto de 128K, enquanto o Haiku permite 200K e o Flash 1M. Os preços são semelhantes (Haiku $0,25/$1,25 por 1M de tokens; Flash $0,35/$1,05). A pontuação MATH-500 de 78,9 do GPT-4o-mini é competitiva; o Haiku pontua cerca de 73 e o Flash cerca de 78 em benchmarks de matemática semelhantes. Para entradas multimodais, todos os três aceitam imagens. O GPT-4o-mini pode ter melhor qualidade de raciocínio para seu preço, mas a janela de contexto é menor do que a de alguns concorrentes. A melhor escolha depende de seus requisitos específicos de latência, custo e qualidade. O OrcaRouter também fornece acesso ao Haiku e ao Flash, permitindo comparação lado a lado.
GPT-3.5-turbo é mais antigo, tem uma janela de contexto de 16K e custa um pouco menos ($0.50 por 1M de entrada vs $0.15 para GPT-4o-mini? Na verdade, GPT-3.5-turbo-0125 custa $0.50/$1.50, mas com contexto menor. Com base nos preços fornecidos, GPT-4o-mini é mais barato por token e oferece maior contexto e entrada multimodal. Portanto, para a maioria das tarefas, GPT-4o-mini é superior. No entanto, algumas aplicações legadas que já usam GPT-3.5-turbo podem exigir mudanças mínimas. GPT-4o-mini também tem melhor desempenho em benchmarks de raciocínio. A menos que a latência seja extremamente crítica ou você tenha ajustado finamente um modelo GPT-3.5, GPT-4o-mini é a atualização substituta recomendada.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $0.150 |
| Saída / 1M tokens | $0.600 |
| Leitura de cache / 1M | $0.075 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/openai/gpt-4o-miniAbrir @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini