A versão de 2024-08-06 do GPT-4o oferece desempenho aprimorado em saídas estruturadas, com a capacidade de fornecer um esquema JSON no respone_format. Leia mais [aqui](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" de "omni") é...
GPT-4o (2024-08-06) é uma versão do modelo GPT-4o da OpenAI, lançada em agosto de 2024. É um modelo de linguagem grande multimodal que processa entradas de texto, imagem e arquivos. O modelo é…
Os principais pontos fortes do modelo estão no raciocínio matemático e na compreensão multimodal. Sua pontuação de 79,5 no MATH-500 indica forte capacidade de resolver problemas matemáticos complexos passo a passo. Ele pode interpretar imagens, diagramas e gráficos, fornecendo descrições ou análises precisas. A janela de contexto de 128K permite processar grandes quantidades de informação, como um livro completo ou uma série de imagens com texto associado. Também lida com uploads de arquivos, sendo útil para tarefas como extrair dados de planilhas ou ler arquivos de código. Essas capacidades são apoiadas pela otimização contínua da OpenAI, e o modelo é amplamente utilizado em ambientes de produção.
GPT-4o (2024-08-06) se destaca em tarefas que exigem combinar informações visuais e textuais. Exemplos incluem resolver problemas matemáticos com diagramas, analisar capturas de tela de interfaces de usuário para relatórios de bugs, extrair dados de documentos digitalizados e fornecer explicações detalhadas de figuras complexas. Também é eficaz para geração de código e depuração quando o contexto inclui capturas de tela de erros ou estruturas de arquivos. Aplicações educacionais se beneficiam de seu raciocínio passo a passo. Para tarefas puramente textuais e simples, como perguntas e respostas básicas ou resumo de textos curtos, um modelo mais barato como o GPT-4o mini pode ser suficiente. Este modelo é melhor reservado para fluxos de trabalho de alto valor, multimodais ou que exigem raciocínio intenso.
Para tarefas que não utilizam visão, processamento de arquivos ou raciocínio avançado, um modelo menor e mais barato é mais econômico. Por exemplo, aplicativos de chat simples, geração de conteúdo de formato curto ou tarefas de classificação podem ser tratados por modelos como GPT-4o mini ou GPT-3.5 Turbo. Se o seu aplicativo processa apenas texto e não requer a janela de contexto de 128K, um modelo de contexto menor pode reduzir latência e custo. Além disso, se seus dados não envolvem imagens ou arquivos, um modelo apenas de texto é suficiente. Avalie se a complexidade da tarefa justifica o preço mais alto por token do GPT-4o. O OrcaRouter oferece uma gama de modelos com diferentes faixas de preço para atender a diversos casos de uso.
Sim, o modelo aceita entradas de arquivos. Você pode enviar arquivos como PDFs, documentos do Word, planilhas, imagens e arquivos de código. O modelo extrai e compreende o conteúdo desses arquivos, tratando-os como parte do contexto. Por exemplo, ele pode ler texto de um PDF, interpretar números em um CSV ou analisar código-fonte em um arquivo .py. Quando combinado com entradas de imagem, pode processar mídia mista, como um documento com gráficos incorporados. Isso é particularmente útil para automatizar extração de dados, revisão de documentos e análise de código. Note que o processamento de arquivos conta para a janela de contexto de 128.000 tokens, portanto, arquivos grandes podem consumir espaço significativo.
No benchmark MATH-500, o GPT-4o (2024-08-06) obteve uma pontuação de 79,5. O MATH-500 é um subconjunto do dataset MATH, composto por 500 problemas desafiadores de nível competitivo, cobrindo tópicos como álgebra, geometria, teoria dos números e probabilidade. Uma pontuação de 79,5 indica respostas corretas em aproximadamente quatro a cada cinco problemas. Isso o coloca entre os modelos com melhor desempenho em raciocínio matemático. Embora nenhuma outra pontuação de benchmark seja fornecida, essa métrica demonstra a força do modelo na dedução lógica passo a passo e na aritmética. Os usuários podem esperar um desempenho confiável em aplicações com uso intensivo de matemática, como tutoria, verificação e geração de problemas.
Pontuações específicas de benchmarks além do MATH-500 não são fornecidas nos fatos disponíveis. No entanto, o GPT-4o como uma família de modelos é amplamente conhecido por ter um desempenho competitivo em uma variedade de benchmarks padrão, incluindo MMLU (compreensão massiva de linguagem multitarefa), HumanEval (geração de código) e várias tarefas de visão-linguagem. A versão de agosto de 2024 pode incorporar atualizações que melhoram o raciocínio e o seguimento de instruções. Sem números exatos, os usuários devem consultar as avaliações publicadas pela OpenAI para os dados mais atuais. Para fins práticos, o modelo é considerado estado da arte entre os modelos de API aberta em termos de capacidades combinadas de texto e visão.
Não são fornecidos números específicos de latência ou throughput para este modelo. Geralmente, o GPT-4o é projetado para ser mais rápido que as variantes anteriores do GPT-4, mantendo a qualidade. A latência depende de fatores como tamanho da entrada, tamanho da saída, requisições concorrentes e a infraestrutura de backend. Quando acessado via OrcaRouter, as requisições são roteadas para os servidores da OpenAI, e os tempos de resposta são similares aos das chamadas diretas à API. Os usuários podem otimizar usando o menor contexto necessário e definindo limites razoáveis de max_tokens. Para aplicações em tempo real, é aconselhável testar com cargas de trabalho representativas. O OrcaRouter não introduz latência adicional além do roteamento de rede.
Pontos fortes: raciocínio matemático forte (MATH-500 79.5), entrada multimodal (texto, imagens, arquivos), grande janela de contexto de 128K e alto limite de tokens de saída (16,384). É particularmente eficaz para raciocínio complexo, compreensão de visão e tarefas que exigem contexto de longo alcance. Limitações: custo mais alto em comparação com modelos menores; pode não ser ideal para tarefas simples ou de baixa latência; a precisão pode variar em entradas ambíguas ou mal formatadas; as capacidades de visão podem não ter bom desempenho em imagens distorcidas ou de baixa resolução. Além disso, como todos os LLMs, pode produzir respostas plausíveis, mas incorretas, especialmente em domínios fora de seus dados de treinamento. Mitigue validando as saídas e usando engenharia de prompt.
O preço para GPT-4o (2024-08-06) é baseado no uso de tokens. Tokens de entrada são cobrados a $2.50 por 1 milhão de tokens. Tokens de saída são cobrados a $10.00 por 1 milhão de tokens. Esta é a taxa do provedor (OpenAI), e o OrcaRouter não aplica nenhum acréscimo — você paga exatamente o mesmo que se chamasse a OpenAI diretamente. Os tokens são contados com base no texto enviado e recebido. Entradas de imagens e arquivos consomem tokens proporcionais ao seu tamanho e complexidade de processamento (o custo de tokens de imagem segue a política da OpenAI). Não há taxas adicionais para usar o endpoint da API. A cobrança é geralmente agregada por período de uso, e você pode monitorar o consumo de tokens através do painel do OrcaRouter.
Sem custos ocultos ou sobretaxas. O OrcaRouter cobra exatamente a taxa do provedor, sem margem de lucro. Os preços listados ($2,50/1M de entrada, $10/1M de saída) são inclusivos. Não há taxas adicionais para autenticação, conexão ou suporte. No entanto, entradas de imagem e arquivo incorrem em custos de tokens determinados pelas políticas de preços da OpenAI, que podem exceder o custo de tokens apenas de texto. Por exemplo, uma imagem de 1080x1080 pode custar um certo número de tokens além dos tokens de texto. Consulte a documentação da OpenAI para obter o preço exato de tokens de imagem. O OrcaRouter repassa esses custos sem margem de lucro. Não há desconto baseado em cache de acordo com as informações atuais.
Escolher o GPT-4o (2024-08-06) em vez de modelos mais baratos, como GPT-4o mini ou GPT-3.5 Turbo, envolve um trade-off entre desempenho e custo. O preço por token é mais alto, portanto, para aplicações de alto volume, os custos podem se acumular rapidamente. No entanto, se a tarefa exigir as capacidades multimodais do modelo ou o contexto de 128K, modelos mais baratos podem não ser suficientes, potencialmente levando a resultados incompletos ou de menor qualidade. Para tarefas somente de texto com raciocínio simples, um modelo mais barato reduz despesas sem sacrificar muita qualidade. O OrcaRouter permite alternar facilmente entre modelos, para que você possa experimentar e encontrar o melhor equilíbrio entre custo e desempenho para cada caso de uso.
Os fatos disponíveis não mencionam nenhum mecanismo de cache ou desconto para este modelo. A OrcaRouter cobra pela taxa do provedor sem margem de lucro, então quaisquer descontos viriam presumivelmente da precificação da própria OpenAI (por exemplo, descontos por faixas para uso de alto volume, se aplicável). A OrcaRouter pode oferecer seus próprios recursos de cache, mas isso não está confirmado para este modelo. Para minimizar custos, considere reduzir o uso de tokens de entrada truncando o histórico da conversa, usando prompts mais curtos e limitando o comprimento da saída com o parâmetro max_tokens. Para consultas idênticas repetidas, você pode implementar cache no nível da aplicação.
Para chamar o GPT-4o (2024-08-06) através do OrcaRouter, use a URL base https://api.orcarouter.ai/v1 e defina o ID do modelo como "openai/gpt-4o-2024-08-06". A API é totalmente compatível com as bibliotecas de cliente da OpenAI. Por exemplo, em Python com a biblioteca openai, você configuraria openai.api_base = "https://api.orcarouter.ai/v1" e openai.api_key = "your-orcarouter-api-key". Em seguida, chame openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). Todos os parâmetros padrão (temperature, max_tokens, top_p, etc.) são suportados. Consulte a documentação do OrcaRouter para obter detalhes sobre autenticação e limites de taxa.
Como o modelo suporta a API compatível com OpenAI, você pode usar o conjunto completo de parâmetros disponíveis no endpoint de chat completions da OpenAI. Os principais parâmetros incluem: model (definido para o ID do modelo), messages (lista de objetos role-content), temperature (0-2), top_p (0-1), n (número de conclusões), max_tokens (até 16384), stop (sequências), frequency_penalty, presence_penalty, logit_bias e user (para rastreamento de uso). Para entradas multimodais, você inclui uma imagem ou file_url no conteúdo de uma mensagem usando o formato apropriado (por exemplo, content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). Consulte a documentação da OpenAI para a sintaxe de entrada de imagens e arquivos.
Migrar da API direta da OpenAI para o OrcaRouter requer duas alterações: 1) Definir a URL base como https://api.orcarouter.ai/v1, e 2) Substituir sua chave de API da OpenAI por uma chave de API do OrcaRouter. Não são necessárias alterações de código para formatação de mensagens ou parâmetros. O ID do modelo muda de "gpt-4o-2024-08-06" para "openai/gpt-4o-2024-08-06". Toda a lógica existente para lidar com streaming, chamada de funções e análise de respostas permanece a mesma. A API do OrcaRouter foi projetada para ser uma substituição direta. Após a migração, você também pode acessar modelos de outros provedores através da mesma interface, permitindo fácil comparação e balanceamento de carga.
A autenticação é feita por meio de uma chave de API fornecida pela OrcaRouter. Inclua-a no cabeçalho como "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". Os limites de taxa são gerenciados pela OrcaRouter e podem diferir dos limites diretos da OpenAI. Verifique seu plano OrcaRouter para obter detalhes. Se você exceder os limites de taxa, receberá respostas HTTP 429. Para mitigar, implemente lógica de repetição com backoff exponencial. A OrcaRouter também pode permitir que você defina limites de taxa por usuário por meio do parâmetro user. Para necessidades de alto throughput, entre em contato com o suporte da OrcaRouter para acordos personalizados. O modelo em si não possui limites de taxa separados; ele está sujeito aos limites gerais do endpoint.
GPT-4o (2024-08-06) é o modelo flagship de tamanho completo, enquanto GPT-4o mini é uma variante menor e mais barata. Principais diferenças: GPT-4o tem uma janela de contexto de 128K (vs. também 128K do GPT-4o mini, mas o mini tem um limite de saída menor, tipicamente 16K também? Na verdade, GPT-4o mini também tem contexto de 128K e saída de 16K, mas é menos capaz em raciocínio e visão. O modelo completo obtém 79,5 no MATH-500; GPT-4o mini obtém pontuações mais baixas em benchmarks de matemática. Preços: GPT-4o é mais caro ($2,50/$10 vs. GPT-4o mini a $0,15/$0,60 por 1M de tokens). Para tarefas que exigem alta precisão ou raciocínio complexo, o modelo completo é justificado. Para tarefas mais simples, o mini oferece uma alternativa econômica.
Em comparação com o GPT-4 (por exemplo, GPT-4-0613 ou GPT-4 Turbo), o GPT-4o (2024-08-06) oferece várias melhorias: entrada multimodal nativa (texto, imagens, arquivos) sem exigir modelos de visão separados, janela de contexto maior (128K contra os 32K do GPT-4 para versões mais antigas) e inferência mais rápida. O preço é mais baixo do que as variantes anteriores do GPT-4, que muitas vezes eram mais caras. Por exemplo, o GPT-4 Turbo tinha contexto semelhante, mas preço mais alto. Em termos de benchmarks, a pontuação MATH-500 de 79.5 supera os modelos mais antigos do GPT-4. No entanto, alguns usuários podem considerar os modelos anteriores mais estáveis para tarefas específicas devido a um histórico de treinamento mais longo. No geral, o GPT-4o é um sucessor mais moderno e eficiente.
A escolha depende das necessidades específicas e das preferências do provedor. O GPT-4o (2024-08-06) se destaca em raciocínio matemático (MATH-500 79,5) e tarefas multimodais com texto, imagens e arquivos. Os modelos Claude da Anthropic podem oferecer recursos de segurança mais robustos ou janelas de contexto mais longas em algumas versões, mas geralmente têm preços mais altos. Os modelos Gemini do Google oferecem multimodalidade e grande contexto, mas podem ter perfis de desempenho diferentes. Usando o OrcaRouter, você pode testar vários provedores com uma única API. Para tarefas que exigem alta precisão matemática, o GPT-4o é um forte candidato. Para sumarização de texto puro ou tarefas de baixo custo, outros modelos podem ser mais econômicos. Avalie as pontuações de referência e os preços para o seu caso de uso.
Ao usar o GPT-4o através do OrcaRouter, seus dados são enviados para os servidores da OpenAI para inferência. O OrcaRouter não armazena ou processa seus prompts além de encaminhá-los. As políticas de uso de dados da OpenAI se aplicam — verifique os termos da OpenAI se tiver dúvidas sobre uso de dados de treinamento ou retenção de dados. Se você precisar que os dados permaneçam em uma jurisdição específica ou evitar determinados provedores, o OrcaRouter permite que você escolha entre vários provedores por solicitação. Você também pode usar os recursos de roteamento do OrcaRouter para direcionar solicitações a provedores que atendam aos seus requisitos de conformidade. Sempre revise a documentação de tratamento de dados tanto do OrcaRouter quanto do provedor subjacente.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $2.50 |
| Saída / 1M tokens | $10.00 |
| Leitura de cache / 1M | $1.25 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/openai/gpt-4o-2024-08-06Abrir @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06