GPT-4o ("o" para "omni") é o modelo de IA mais recente da OpenAI, que suporta tanto entradas de texto quanto de imagem com saídas de texto. Ele mantém o nível de inteligência do [GPT-4 Turbo](/models/openai/gpt-4-turbo) enquanto é duas vezes mais...
GPT-4o (2024-05-13) é um modelo de linguagem multimodal da OpenAI, acessível através da API da OrcaRouter. Ele processa texto, imagens e arquivos, sendo adequado para tarefas que combinam dados…
O GPT-4o pode analisar imagens fornecidas como parte da entrada. Ele pode descrever conteúdo visual, responder perguntas sobre objetos, texto dentro de imagens e relações espaciais. Ele também pode extrair e transcrever texto de documentos escaneados ou fotos. Como ele processa imagens diretamente, você não precisa de um modelo OCR ou de visão separado. A imagem é tokenizada para se ajustar à janela de contexto. Por exemplo, um usuário pode enviar uma captura de tela de um gráfico e pedir ao modelo para interpretar as tendências. A compreensão do modelo não se limita a legendas simples; ele pode raciocinar sobre o conteúdo, comparar várias imagens e usar pistas visuais juntamente com instruções textuais. Essa capacidade está integrada na mesma chamada de API, usando o mesmo formato de mensagem que as solicitações apenas de texto. No OrcaRouter, você envia imagens como dados codificados em base64 ou URLs no array de conteúdo. O ID do modelo permanece "openai/gpt-4o-2024-05-13".
O GPT-4o aceita arquivos como entrada. Os formatos suportados incluem PDF, documentos do Microsoft Office (Word, Excel, PowerPoint), arquivos de texto e formatos de imagem. Para PDFs e arquivos do Office, o modelo extrai o conteúdo textual e analisa o layout. Ele não renderiza diretamente formatação complexa, mas lê o conteúdo do texto. Isso é útil para processar relatórios, contratos, planilhas ou apresentações sem extração manual. O conteúdo do arquivo é tokenizado e conta para o total de tokens de entrada. O modelo pode responder perguntas sobre o conteúdo do arquivo, resumi-lo ou realizar cálculos em dados tabulares. Ao usar arquivos, você os inclui como parte do conteúdo da mensagem usando os campos apropriados da API OpenAI. O OrcaRouter lida com a transmissão sem modificações. Observe que as capacidades do modelo dependem da qualidade do texto extraído; imagens fortemente escaneadas em PDFs podem não ser totalmente legíveis, a menos que contenham camadas de texto incorporadas.
GPT-4o é um modelo premium com custo mais alto do que alternativas como GPT-4o-mini ou variantes anteriores do GPT-3.5. Se sua tarefa não exigir as capacidades multimodais (por exemplo, tarefas apenas de texto), contexto grande (até 128K), ou o nível de raciocínio matemático medido pelo MATH-500 (79.1), um modelo mais barato pode ser mais econômico. Por exemplo, classificação simples, geração de conteúdo em formato curto ou chat básico podem ser realizados por modelos de menor custo que ainda produzem qualidade aceitável. Além disso, se sua aplicação for sensível à latência e o modelo menor for mais rápido, a compensação pode favorecer a velocidade em vez da precisão absoluta. Finalmente, se você raramente precisa processar imagens ou arquivos, a capacidade multimodal adicional é desnecessária. OrcaRouter oferece uma gama de modelos para que você possa selecionar a melhor relação custo-desempenho. Avalie os requisitos do seu caso de uso em relação às pontuações de benchmark e ao preço para determinar se as vantagens do GPT-4o justificam o custo adicional.
O GPT-4o pode gerar até 16.384 tokens por solicitação. Este é um limite generoso que permite respostas longas, código detalhado ou análises com vários parágrafos. No entanto, os tokens de saída são cobrados a US$ 15,00 por milhão, tornando as saídas mais longas mais caras. Você pode controlar o comprimento da saída usando o parâmetro max_tokens na chamada de API. Se você prevê que precisará de gerações muito longas, considere dividir ou fragmentar a solicitação. O limite de 16.384 se aplica a toda a conclusão, incluindo etapas de raciocínio ou chain-of-thought, se solicitado. Para tarefas muito complexas que exigem raciocínio extenso, talvez seja necessário usar várias chamadas. No OrcaRouter, o número de tokens de saída é informado no campo usage da resposta da API, para que você possa acompanhar os custos com precisão. Não há limite adicional imposto pelo OrcaRouter; o limite nativo do modelo é aplicado.
GPT-4o obteve 79,1 no benchmark MATH-500. O MATH-500 consiste em 500 problemas desafiadores de matemática em diversos tópicos, como álgebra, geometria, teoria dos números e probabilidade. Uma pontuação de 79,1 significa que o modelo respondeu corretamente a 79,1% dos problemas. Esse é um resultado forte, que indica uma capacidade robusta de raciocínio matemático, especialmente para um modelo multimodal. O benchmark testa tanto a resolução de problemas quanto o raciocínio passo a passo. Essa pontuação pode orientar expectativas para aplicações envolvendo tutoria de matemática, computação científica ou quebra-cabeças lógicos. Observe que o desempenho no benchmark não garante resultados idênticos em tarefas do mundo real; pode ser necessário ajuste específico para o domínio ou engenharia de prompts. Ao considerar este modelo, compare sua pontuação no MATH-500 com a de outros modelos que você avalia. A OrcaRouter não fornece dados adicionais de benchmark, portanto este é o único ponto de referência fornecido para este modelo.
A latência depende de vários fatores: o comprimento da entrada, o comprimento da saída esperada, a carga atual nos servidores da OpenAI e o caminho de rede entre sua aplicação e o OrcaRouter. O OrcaRouter não adiciona sobrecarga significativa além do tempo de resposta do provedor subjacente. Para solicitações típicas com entrada moderada (alguns milhares de tokens) e saídas curtas (abaixo de 1.000 tokens), as respostas geralmente chegam em alguns segundos. Saídas mais longas (próximas a 16.384 tokens) naturalmente levarão mais tempo, pois o modelo gera tokens sequencialmente. Entradas de imagem também aumentam a latência devido à tokenização e ao processamento. Você pode otimizar a latência reduzindo o comprimento da saída, usando prompts mais curtos ou enviando solicitações em lote. O OrcaRouter fornece endpoints de API padrão que retornam resultados de forma assíncrona via streaming, se desejado. Para aplicações interativas em tempo real, considere usar o modo de streaming (stream: true) para começar a processar assim que os tokens chegarem. Nenhum número específico de latência é fornecido nos fatos do modelo, portanto, estas são estimativas qualitativas.
Pontos fortes: Entrada multimodal (texto, imagem, arquivo), grande janela de contexto de 128K, forte raciocínio matemático (MATH-500: 79.1) e alto limite de tokens de saída (16.384). Ele lida com documentos longos e conversas de múltiplas etapas de forma eficaz. A API é compatível com o padrão OpenAI, facilitando a integração. Limitações: Custo mais alto em comparação com modelos menores. Não otimizado para tarefas que não se beneficiam de multimodalidade ou contexto grande. Nenhuma informação é fornecida sobre desempenho em idiomas não-ingleses ou benchmarks específicos de segurança. A compreensão de imagens pode ser limitada para cenas muito complexas ou imagens de baixa resolução. Além disso, o modelo pode produzir respostas incorretas em problemas fora de sua distribuição de treinamento. Não há garantia de latência divulgada. Para usuários que exigem latência extremamente baixa ou custo extremamente baixo, um modelo diferente pode ser melhor. A pontuação de referência de 79.1 no MATH-500 indica margem para melhoria nos problemas de matemática mais difíceis. Avalie se essas concessões estão alinhadas com os requisitos da sua aplicação.
O GPT-4o é cobrado por token, com tarifas separadas para tokens de entrada e saída. Tokens de entrada são $5.00 por 1 milhão de tokens. Tokens de saída são $15.00 por 1 milhão de tokens. Estas são as tarifas do provedor, repassadas pelo OrcaRouter sem margem de lucro. O custo por requisição = (input tokens/1e6 * 5) + (output tokens/1e6 * 15). Por exemplo, uma conversa com 4,000 tokens de entrada e 200 tokens de saída custaria (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. Não há taxas adicionais para chamadas de API em si; você paga apenas pelos tokens consumidos. Os preços são atualizados dinamicamente com base em mudanças do provedor; o OrcaRouter repassa quaisquer ajustes futuros. Como não há margem de lucro, os usuários se beneficiam das mesmas tarifas que clientes diretos da OpenAI, mas com a conveniência do gerenciamento unificado e faturamento do OrcaRouter. Esteja ciente de que imagens e arquivos são tokenizados e contribuem para a contagem de tokens de entrada, muitas vezes aumentando o custo em comparação com entradas apenas de texto.
Não. O OrcaRouter não oferece descontos, tokens em cache ou preços reduzidos para entradas repetidas. Cada token é cobrado pela taxa padrão do provedor. Não há custo separado de cache nem sobretaxa para alto volume. Os US$ 5/US$ 15 por milhão de tokens são taxas fixas. Usuários que exigem throughput muito alto podem consultar acordos personalizados, mas o serviço padrão não inclui descontos por volume. Além disso, não há taxas ocultas, como encargos de conexão ou mínimos mensais. O preço é transparente e diretamente vinculado ao uso de tokens. Para otimização de custos, considere reduzir o tamanho da entrada (por exemplo, cortando o histórico, usando prompts mais curtos) e o comprimento da saída (por exemplo, definindo um max_tokens mais baixo). Além disso, usar o modelo apenas quando suas capacidades são necessárias (multimodal, contexto grande) ajuda a controlar os custos. Se sua aplicação tiver prompts repetitivos que são idênticos a cada vez, o cache na camada da aplicação pode reduzir o uso de tokens, mas o próprio OrcaRouter não oferece esse recurso.
GPT-4o tem um preço premium. Para muitas tarefas, um modelo mais barato (por exemplo, GPT-4o-mini ou GPT-3.5-turbo) pode ser suficiente. Faça um trade-off avaliando a complexidade e a precisão necessária. Se sua tarefa envolve extração ou classificação simples com contexto limitado, um modelo mais barato pode ter desempenho semelhante por uma fração do custo. Por outro lado, se a tarefa requer entendimento sutil de imagens, documentos longos ou alta precisão matemática (pontuação MATH-500 de 79.1 versus pontuações mais baixas em modelos mais baratos), o GPT-4o pode valer o prêmio. Use testes A/B em uma amostra representativa para comparar qualidade e custo. Além disso, considere que o mesmo preço por milhão de tokens se aplica independentemente do comprimento do texto; solicitações mais curtas são mais baratas. Se seu fluxo de trabalho usa frequentemente o contexto completo de 128K, o custo de tokens de entrada para essa solicitação pode ser alto; certifique-se de que o contexto é genuinamente necessário. O OrcaRouter fornece métricas de uso para que você possa monitorar e otimizar.
Para chamar o GPT-4o no OrcaRouter, use o endpoint de API compatível com OpenAI: base_url = "https://api.orcarouter.ai/v1". Defina o parâmetro do modelo como "openai/gpt-4o-2024-05-13". Você precisará de uma chave de API do OrcaRouter. O formato da solicitação segue a API padrão Chat Completions do OpenAI: array de mensagens com funções (system, user, assistant), conteúdo opcional para imagens e arquivos, e parâmetros como temperature, max_tokens, top_p, frequency_penalty, presence_penalty e stop. Por exemplo, uma solicitação de texto simples é enviada como um POST para /chat/completions. Para imagens, inclua o conteúdo como parte da mensagem do usuário com o tipo "image_url". Para arquivos, inclua-os também como parte do conteúdo (o formato específico segue a especificação do OpenAI). A resposta incluirá a mensagem do assistente, estatísticas de uso (prompt_tokens, completion_tokens, total_tokens) e outros metadados. Nenhum cabeçalho especial é necessário além do padrão Content-Type e Authorization. A integração é idêntica ao usar o OpenAI diretamente.
Todos os parâmetros padrão do OpenAI Chat Completions são suportados: messages (obrigatório), model (obrigatório, definido como "openai/gpt-4o-2024-05-13"), temperature (0–2, padrão 1), top_p (0–1, padrão 1), n (número de conclusões, padrão 1), stop (strings ou lista de strings), max_tokens (padrão 16.384, limite máximo em 16.384), presence_penalty (−2 a 2, padrão 0), frequency_penalty (−2 a 2, padrão 0), logit_bias (mapa de IDs de token para valor de viés), user (string para monitoramento de abuso), stream (booleano, padrão false) e functions/tools (para chamada de funções). Para entradas multimodais, o conteúdo das mensagens pode ser um array de partes de conteúdo com tipo "text" ou "image_url". Além disso, você pode incluir conteúdo do tipo "file" conforme a documentação da OpenAI (ex.: para anexos PDF). O OrcaRouter passa esses parâmetros diretamente para o provedor sem modificação. Certifique-se de não exceder a janela de contexto de 128K tokens. A API retorna códigos de erro padrão para solicitações inválidas, limitação de taxa ou falhas de autenticação.
A migração é direta porque a API do OrcaRouter é totalmente compatível com a OpenAI. Você só precisa alterar duas coisas: a URL base de https://api.openai.com/v1 para https://api.orcarouter.ai/v1, e o ID do modelo de "gpt-4o-2024-05-13" para "openai/gpt-4o-2024-05-13". Sua chave de API do OrcaRouter substitui sua chave da OpenAI. Todo o código existente que usa a biblioteca Python/Node da OpenAI ou requisições HTTP cruas funcionará sem outras modificações. O formato das mensagens, os nomes dos parâmetros e a estrutura da resposta são idênticos. Para bibliotecas que aceitam um parâmetro de URL base, basta defini-lo para o endpoint do OrcaRouter. Se você estava usando o cliente da OpenAI, pode instanciá-lo com base_url definido para o endpoint do OrcaRouter. Nenhuma alteração na engenharia de prompts ou na lógica de cache é necessária. O OrcaRouter também suporta streaming (stream: true) e chamadas de função exatamente como antes. Os testes podem ser feitos com um pequeno conjunto de requisições para verificar se o comportamento corresponde.
O OrcaRouter não modifica o comportamento do modelo. Ele atua puramente como um gateway, encaminhando suas solicitações para os servidores da OpenAI e retornando a resposta exatamente como recebida. Nenhum pré-processamento, pós-processamento ou filtragem de conteúdo adicional é aplicado pelo OrcaRouter. Em relação ao tratamento de dados: o OrcaRouter não armazena nem registra dados de prompts ou respostas além do necessário para faturamento e monitoramento operacional. As políticas de dados da OpenAI se aplicam ao uso do modelo por meio do OrcaRouter. Conforme os fatos fornecidos, não há menção de retenção de dados pelo OrcaRouter além do registro padrão de API. Os usuários devem revisar tanto a política de privacidade do OrcaRouter quanto a política da OpenAI para entender o tratamento de dados. Se você tiver requisitos rigorosos de residência de dados, consulte o OrcaRouter sobre as opções disponíveis. Não há indicação de que o OrcaRouter compartilhe dados com outros clientes. A única modificação necessária é no ID do modelo; nenhuma instrução personalizada é injetada.
As principais diferenças entre GPT-4o e GPT-4o-mini são o tamanho da janela de contexto, capacidades multimodais, desempenho em benchmarks e custo. GPT-4o oferece uma janela de contexto de 128K e suporta entradas de imagens e arquivos. GPT-4o-mini (com base nas ofertas da OpenAI) normalmente tem um contexto menor (por exemplo, 128K ou 16K em algumas versões) e pode não suportar todas as modalidades. No MATH-500, GPT-4o pontua 79,1; GPT-4o-mini pontuaria menos. Preços: GPT-4o custa $5/$15 por milhão de tokens, enquanto GPT-4o-mini é significativamente mais barato (por exemplo, $0,15/$0,60 por milhão de tokens em algumas versões). Assim, GPT-4o-mini é adequado para tarefas mais simples onde o menor custo é primordial, enquanto GPT-4o é melhor para raciocínio complexo, contexto longo, tarefas multimodais. Ao escolher entre eles, considere os requisitos de precisão e a necessidade de visão ou manipulação de arquivos. OrcaRouter oferece ambos os modelos sob IDs distintos. Se sua carga de trabalho raramente usa imagens ou contexto grande, GPT-4o-mini pode ser a escolha economicamente superior.
GPT-4o (2024-05-13) é um modelo multimodal com uma janela de contexto de 128K, enquanto versões mais antigas do GPT-4 (como gpt-4-0613) geralmente têm um contexto de 8K ou 32K e são apenas texto (algumas versões posteriores suportam imagens por meio de endpoints de visão separados). O preço do GPT-4o ($5/$15 por milhão de tokens) é geralmente menor do que o preço do GPT-4 Turbo no seu pico (por exemplo, $10/$30 por milhão de tokens). Desempenho em benchmarks: a pontuação fornecida de 79,1 no MATH-500 é para o GPT-4o; o GPT-4 não tinha uma pontuação oficial no MATH-500 nos fatos fornecidos, mas sabia-se que pontuava mais baixo em benchmarks matemáticos semelhantes. O GPT-4o também oferece um limite de saída maior (16K tokens) em comparação com o GPT-4 mais antigo (4K ou 8K, dependendo da versão). No geral, o GPT-4o oferece melhor valor para aplicações multimodais e de contexto longo. No entanto, modelos GPT-4 mais antigos podem ter sido ajustados para tarefas específicas; avalie com seus próprios dados. Por meio do OrcaRouter, ambas as famílias de modelos estão acessíveis.
Uma comparação direta requer fatos específicos do modelo não fornecidos aqui. Em geral, ambos os modelos são competitivos em raciocínio e capacidades multimodais. O GPT-4o tem uma janela de contexto de 128K, similar ao contexto de 200K do Claude (para Sonnet). Ambos suportam imagens. As pontuações de benchmark variam: o GPT-4o fornece uma pontuação MATH-500 de 79.1; as pontuações do Claude 3.5 Sonnet nesse benchmark não são fornecidas. Preços: GPT-4o é $5/$15 por milhão de tokens; o preço do Claude Sonnet é tipicamente em torno de $3/$15 por milhão de tokens (sujeito a alterações). Assim, os custos de entrada para o GPT-4o são mais altos. As diferenças de desempenho dependem da tarefa: alguns usuários consideram o Claude superior para escrita de longa duração, enquanto o GPT-4o se destaca em matemática e codificação. Sem uma avaliação controlada, recomenda-se testar ambos em amostras representativas. O OrcaRouter oferece ambos os modelos, então você pode comparar facilmente alterando o ID do modelo. Em última análise, o melhor modelo depende dos seus requisitos específicos de precisão, latência e custo. Os fatos fornecidos não incluem as pontuações do Claude, portanto, esta comparação permanece qualitativa.
Llama 3 (por exemplo, Llama 3 70B) é um modelo de código aberto que pode ser auto-hospedado, enquanto o GPT-4o é proprietário e acessado via API. O GPT-4o suporta entradas multimodais (texto, imagem, arquivo) com um contexto de 128K, enquanto o Llama 3 é tipicamente apenas texto (a menos que seja ajustado para visão) e tem um contexto menor (por exemplo, 8K ou 32K). Pontuações de benchmark: a pontuação MATH-500 do GPT-4o é 79.1; o Llama 3 70B obtém cerca de 70–75 em benchmarks de matemática semelhantes (não fornecidos em fatos, mas conhecimento geral). Custo: o custo da API do GPT-4o por token é fixo; auto-hospedar o Llama 3 envolve custos de infraestrutura (GPU, eletricidade) que podem ser menores em volumes altos. Latência: o GPT-4o baseado em API pode ser mais rápido para cargas de trabalho em explosão; modelos auto-hospedados podem oferecer latência consistente se a capacidade for reservada. Flexibilidade: o Llama 3 pode ser ajustado; o GPT-4o não pode. Para usuários que desejam evitar dependência de fornecedor ou lidar com dados sensíveis totalmente on-premise, modelos de código aberto são atraentes. O OrcaRouter fornece acesso a ambos os tipos: você pode usar o GPT-4o via API e também acessar modelos de código aberto através do OrcaRouter, se disponíveis.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $5.00 |
|---|---|
| Saída / 1M tokens | $15.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/openai/gpt-4o-2024-05-13Abrir @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13