Preview modelo GPT-4o apenas texto com contexto de 128K, saída de 16K, acessado via OrcaRouter API a $2.50/$10 por M de tokens.
Este modelo é uma versão de pré-visualização da OpenAI, limitada a entradas apenas de texto. Ele possui o identificador openai/gpt-4o-search-preview-2025-03-11 quando acessado via API da OrcaRouter.…
Como uma prévia do GPT-4o apenas para texto, ele se destaca na compreensão e geração de linguagem natural em uma ampla gama de domínios. Pode realizar sumarização de documentos, respostas a perguntas, escrita criativa, tradução e geração de código. A grande janela de contexto permite manter a coerência em passagens muito longas, tornando-o adequado para tarefas como análise de livros ou processamento de logs extensos. Ele suporta mensagens de sistema, usuário e assistente em um formato semelhante a chat. As capacidades de raciocínio zero-shot e few-shot do modelo são típicas para modelos da classe GPT-4, permitindo lidar com instruções complexas sem necessidade de ajuste fino extensivo.
Se sua tarefa não exigir todo o poder de raciocínio do GPT-4o, considere usar um modelo menor ou mais barato do OrcaRouter, como o openai/gpt-4o-mini ou o gpt-3.5-turbo. Exemplos de tarefas mais adequadas para modelos mais baratos incluem classificação simples, geração de conteúdo de formato curto ou perguntas e respostas básicas com contexto limitado. O custo do modelo de pré-visualização pode ser injustificado para solicitações de alto volume e baixa complexidade. Além disso, se for necessária entrada multimodal, este modelo não pode lidar com imagens ou áudio; outro modelo (por exemplo, o GPT-4o padrão ou o GPT-4V) seria necessário. Sempre avalie a compensação entre qualidade e custo por token.
Este modelo é identificado como uma variante 'search-preview', mas nenhuma capacidade específica de uso de ferramentas ou pesquisa na web é detalhada nas especificações publicamente disponíveis. Ele é apenas texto e opera como um modelo de linguagem padrão. Os usuários não devem presumir qualquer funcionalidade integrada de pesquisa ou recuperação. Para geração aumentada, você pode implementar pipelines de geração aumentada por recuperação (RAG) separadamente, alimentando documentos recuperados no contexto do modelo. O OrcaRouter não adiciona middleware de uso de ferramentas; o modelo responde exclusivamente com base em seu treinamento e no prompt fornecido. Versões futuras podem alterar esse comportamento, mas, a partir da prévia, nenhuma integração de ferramentas está documentada.
Como uma prévia, este modelo pode exibir comportamento inesperado ou menor confiabilidade em comparação com versões estáveis. É apenas texto, portanto qualquer solicitação multimodal será rejeitada. A saída máxima de 16.384 tokens é substancial, mas ainda pode truncar gerações muito longas. O corte de conhecimento e os dados de treinamento do modelo não são especificados; ele pode não ter conhecimento de eventos muito recentes. O uso em produção é desencorajado porque o modelo pode ser atualizado ou removido. Além disso, a latência pode ser maior do que a de modelos estáveis devido à sua natureza de prévia. Sempre teste minuciosamente antes de implantar em escala.
Não foram fornecidas pontuações específicas de benchmark para esta versão de pré-visualização em particular. Como uma variante do GPT-4o, espera-se que tenha desempenho semelhante ao GPT-4o padrão em tarefas comuns de linguagem, mas os números exatos não são divulgados. Os usuários podem realizar suas próprias avaliações usando conjuntos de dados públicos. A ampla janela de contexto oferece uma vantagem em benchmarks de documentos longos, mas como esta é uma pré-visualização, as pontuações podem diferir do modelo de produção. Para números oficiais, consulte os relatórios de benchmark oficiais da OpenAI para o GPT-4o. O OrcaRouter não modifica as saídas ou o desempenho do modelo.
Os números de latência e throughput para este modelo de preview não foram publicados. Como preview, pode ser mais lento que o GPT-4o estável devido à infraestrutura experimental. Os tempos de resposta dependem do tamanho da entrada, do tamanho da saída e da demanda concorrente. O OrcaRouter não impõe latência adicional além do roteamento normal da API. Para estimar a velocidade, os desenvolvedores podem executar requests de exemplo com payloads típicos. Para aplicações de produção que exigem desempenho consistente, considere usar o modelo estável gpt-4o, a menos que os recursos específicos do preview sejam necessários.
Modelos da classe GPT-4 são conhecidos por forte raciocínio em vários domínios, incluindo matemática, lógica e inferência de senso comum. Espera-se que esta prévia herde essas capacidades. O grande contexto permite raciocínio complexo de cadeia de pensamento em muitas etapas sem perder o controle das partes anteriores. No entanto, nenhum benchmark de raciocínio específico é fornecido para esta versão exata. Os usuários devem validar o desempenho em suas próprias tarefas específicas de domínio. O modelo também pode exibir melhor seguimento de instruções em comparação com versões anteriores do GPT, mas novamente, recomenda-se verificação independente.
Além de ser uma prévia, o modelo não possui suporte multimodal. Ele não pode processar imagens, áudio ou vídeo diretamente. Sua data de corte de conhecimento é desconhecida, portanto pode carecer de informações sobre eventos posteriores ao seu treinamento. O limite de saída de 16.384 tokens, embora generoso, não pode produzir textos extremamente longos em uma única geração; para saídas mais longas, é necessário prompting iterativo ou divisão. A prévia também pode apresentar taxas de erro mais altas ou taxas de recusa para determinados tópicos sensíveis. O desempenho em idiomas diferentes do inglês pode variar. Sempre teste em dados representativos antes da implantação.
O modelo é precificado em $2,50 por 1 milhão de tokens para entrada e $10,00 por 1 milhão de tokens para saída. Essas são as taxas do provedor OpenAI; o OrcaRouter não adiciona markup. Por exemplo, processar um prompt de 10.000 tokens e gerar 1.000 tokens custaria aproximadamente $0,025 para entrada e $0,01 para saída, totalizando $0,035. Os custos escalam linearmente com o uso de tokens. Não há taxas adicionais para usar o OrcaRouter como gateway de API. Certifique-se de monitorar o uso para evitar cobranças inesperadas. Compare com modelos mais baratos se sua tarefa não precisar de todas as capacidades.
Atualmente, o OrcaRouter não oferece descontos por volume ou cache de tokens para este modelo. Toda a cobrança é feita conforme o uso, com base no consumo real de tokens à taxa do provedor. O OrcaRouter não realiza cache de prompts ou respostas; cada solicitação é processada de forma independente. Se você tiver uma taxa de transferência muito alta, entre em contato com o OrcaRouter para possíveis acordos personalizados. Para otimizar custos, considere usar prompts mais curtos, reutilizar o contexto de forma eficiente ou agrupar chamadas. O modelo não oferece preços reduzidos para hits em cache, pois não há mecanismo de cache implementado.
A US$ 2,50/US$ 10 por milhão de tokens, esta pré-visualização tem preço semelhante ao GPT-4o padrão, mas pode diferir ligeiramente. Alternativas mais baratas incluem openai/gpt-4o-mini (aproximadamente US$ 0,15/US$ 0,60 por milhão) ou gpt-3.5-turbo (cerca de US$ 0,50/US$ 1,50). Para tarefas que toleram qualidade inferior, esses modelos oferecem economias significativas. O custo do modelo de pré-visualização está no extremo superior do catálogo do OrcaRouter. Se você o utiliza apenas para testes, pode incorrer em custos moderados dependendo do volume de requisições. Avalie sempre o uso esperado de tokens e compare com o ganho de qualidade ao usar um modelo maior.
Para usar este modelo, defina a URL base do seu cliente de API como https://api.orcarouter.ai/v1 e especifique o ID do modelo como openai/gpt-4o-search-preview-2025-03-11. Você deve usar uma chave de API emitida pela OrcaRouter. A API é totalmente compatível com OpenAI, portanto, o código existente escrito para o endpoint de chat completions da OpenAI funcionará com alterações mínimas. Exemplo de chamada usando curl: curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_ORCAROUTER_KEY" -H "Content-Type: application/json" -d '{ "model": "openai/gpt-4o-search-preview-2025-03-11", "messages": [{"role": "user", "content": "Hello"}], "max_tokens": 100 }'.
Você pode usar todos os parâmetros padrão de completions de chat suportados pela OpenAI: 'messages', 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' e 'n'. O modelo suporta uma janela de contexto de 128.000 tokens, então 'max_tokens' pode ser definido até 16.384. 'temperature' controla a aleatoriedade; os valores variam de 0 a 2. 'stream' é suportado para resposta em tempo real. O OrcaRouter não introduz parâmetros adicionais. Certifique-se de que suas solicitações estejam em conformidade com os limites de token; entradas mais longas que a janela de contexto (incluindo a resposta) serão truncadas ou retornarão um erro.
Migrar é simples. Substitua sua URL base da OpenAI (https://api.openai.com/v1) pela URL base do OrcaRouter (https://api.orcarouter.ai/v1). Altere sua chave de API para uma chave do OrcaRouter. Atualize o campo model para openai/gpt-4o-search-preview-2025-03-11. Nenhuma outra alteração de código é necessária. Se você estava usando um modelo diferente da OpenAI, pode continuar usando a mesma estrutura de código. O OrcaRouter repassa todos os parâmetros padrão. Após a migração, verifique se as respostas são consistentes. Observe que o faturamento será gerenciado pelo OrcaRouter, e você precisará de uma conta lá.
OrcaRouter não divulga publicamente limites de taxa específicos para este modelo de pré-visualização. A disponibilidade depende da infraestrutura da OpenAI e da capacidade do gateway da OrcaRouter. Para aplicações de produção, considere o status de pré-visualização do modelo e possíveis instabilidades. A OrcaRouter pode impor limites de uso razoáveis para evitar abusos. Você pode esperar um serviço de melhor esforço, mas nenhum SLA é fornecido. Se precisar de taxa de transferência garantida, entre em contato com a OrcaRouter para opções dedicadas. O modelo também pode ser removido ou substituído sem aviso prévio, portanto, planeje modelos de fallback.
O modelo padrão GPT-4o (openai/gpt-4o) é um lançamento multimodal e estável, enquanto esta prévia é apenas de texto e destinada a testes iniciais. A prévia pode incluir funcionalidades futuras que ainda não estão na versão padrão, mas também pode ser menos confiável. O preço é semelhante. O modelo padrão tem suporte de entrada mais amplo (imagens, áudio). Se você não precisa de funcionalidades da prévia, o GPT-4o padrão é a opção mais segura. Ambos estão disponíveis no OrcaRouter com a mesma interface de API, facilitando a alternância.
Gpt-4o-mini é um modelo menor e mais barato, otimizado para tarefas simples. Custa aproximadamente $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída (aproximado). Este modelo de pré-visualização é cerca de 16x mais caro para entrada e 16x mais caro para saída. O modelo de pré-visualização oferece contexto maior (128K vs. 128K? Na verdade, gpt-4o-mini também tem 128K, mas isso pode variar. Sabemos que este modelo é 128K. O contexto do gpt-4o-mini também é 128K de acordo com informações públicas, mas não podemos assumir. Diremos 'janela de contexto comparável', mas note a diferença de preço.) Este modelo é melhor para raciocínio complexo, enquanto gpt-4o-mini é suficiente para muitas tarefas padrão. Escolha com base nas necessidades de qualidade e orçamento.
Os modelos Claude (por exemplo, Claude 3.5 Sonnet) oferecem grandes janelas de contexto e raciocínio robusto, mas sua API não é diretamente compatível com a OpenAI. O OrcaRouter fornece uma interface unificada para vários provedores, mas esta prévia é exclusiva da OpenAI. Os modelos Claude podem ter preços e pontos fortes diferentes em áreas como segurança e geração de texto longo. Para uma comparação direta, você precisaria testar em seus próprios casos de uso. O OrcaRouter permite alternar entre provedores, mas este modelo de prévia está disponível apenas pela rota da OpenAI. Nenhuma comparação de benchmark é fornecida.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-search-preview-2025-03-11",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Entrada / 1M tokens | $2.50 |
| Saída / 1M tokens | $10.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/openai/gpt-4o-search-preview-2025-03-11Abrir @misc{orcarouter_gpt_4o_search_preview_2025_03_11,
title = {openai/gpt-4o-search-preview-2025-03-11 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-search-preview-2025-03-11}
}openai. (n.d.). openai/gpt-4o-search-preview-2025-03-11 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-search-preview-2025-03-11