GPT-4o mini Search Preview é um modelo especializado para pesquisa na web em Chat Completions. Ele é treinado para entender e executar consultas de pesquisa na web.
O GPT-4o-mini Search Preview é uma variante do modelo GPT-4o-mini da OpenAI que inclui capacidades integradas de pesquisa na web. Ele foi projetado para fornecer respostas que incorporam informações…
O modelo combina compreensão e geração geral de linguagem com pesquisa web ao vivo. Ele pode responder perguntas sobre eventos recentes, extrair dados de sites específicos e sintetizar informações de múltiplas fontes online. Ele mantém as capacidades típicas do GPT-4o-mini: sumarização de texto, tradução, geração de código, raciocínio lógico e escrita criativa. A pré-visualização de pesquisa adiciona a capacidade de acessar notícias atuais, preços de ações, clima, detalhes de produtos e outros dados sensíveis ao tempo. No entanto, como o modelo é ajustado para velocidade e eficiência, sua profundidade de raciocínio pode ser menor que a do modelo GPT-4o completo.
O modelo se destaca em cenários onde as respostas dependem de informações variáveis ou recentes. Exemplos incluem agentes de atendimento ao vivo que precisam verificar status de pedidos ou políticas de devolução, ferramentas de conteúdo que geram resumos de tópicos em alta e assistentes de pesquisa que compilam fatos de múltiplas fontes online. Também é útil para verificar alegações contra dados atuais, como checar o último anúncio de uma empresa ou o placar de um esporte. Devido ao seu custo relativamente baixo e tempos de resposta rápidos, é adequado para aplicações com alto volume de solicitações onde o web grounding é um recurso essencial.
Se a sua aplicação não exigir pesquisa na web ou informações atualizadas, considere usar a base GPT-4o-mini sem pré-visualização de busca. O modelo base é ainda mais barato (mesmo preço por token, mas sem a sobrecarga da recuperação de busca) e pode ser mais rápido para tarefas puramente conversacionais. Para consultas muito simples que não necessitam de amplo conhecimento do mundo, modelos menores como GPT-4o-mini (base) ou até mesmo modelos mais antigos como GPT-3.5 Turbo podem ser suficientes. Avalie se o recurso de pré-visualização de busca justifica o custo para o seu caso de uso específico.
A pré-visualização da busca é automaticamente acionada pelo modelo quando ele considera que a consulta precisa de informações externas. Você não precisa configurar APIs de busca ou passar resultados de busca manualmente. No entanto, você pode influenciar o comportamento do modelo instruindo-o a usar a busca na web explicitamente, ou especificando fontes. O modelo respeita os filtros de segurança e conteúdo padrão aplicados pela OpenAI. Observe que a busca na web pode introduzir latência em comparação ao modelo base, pois o modelo aguarda os resultados da busca antes de gerar a resposta final.
Pontuações específicas de benchmark para o GPT-4o-mini Search Preview não foram divulgadas publicamente como uma variante separada. No entanto, com base no GPT-4o-mini base, espera-se que este modelo tenha um bom desempenho em benchmarks padrão de NLP como MMLU, HellaSwag e GSM8K, mas provavelmente com menor precisão do que o GPT-4o completo. O recurso de pré-visualização de pesquisa pode melhorar o desempenho em tarefas que exigem conhecimento atual (como curiosidades sobre eventos recentes), mas não altera as capacidades de raciocínio do modelo subjacente. Para precisão factual, o modelo depende da qualidade e atualidade das fontes da web que ele recupera.
O GPT-4o-mini Search Preview é projetado para baixa latência em comparação com o GPT-4o. O GPT-4o-mini base é conhecido por inferência rápida, e o search preview adiciona tempo extra para recuperação web. O tempo total de resposta depende de fatores como latência de rede, o número de resultados de pesquisa recuperados e o comprimento do contexto. No uso típico, as respostas são geradas em poucos segundos. Para aplicações que exigem latência mínima absoluta, o GPT-4o-mini base (sem search) seria mais rápido. A API do OrcaRouter oferece suporte a streaming para começar a exibir tokens à medida que são gerados.
Pontos fortes: O modelo fornece informações atualizadas sem integração de busca separada, possui uma grande janela de contexto (128k tokens) e é custo-efetivo para uso de alto volume. Limitações: Aceita apenas texto; pode, às vezes, recuperar conteúdo da web incompleto ou irrelevante; seu raciocínio é menos profundo que o GPT-4o; e a pré-visualização da busca pode aumentar a latência. Além disso, o modelo pode nem sempre citar fontes explicitamente, portanto, os usuários devem verificar informações críticas. Ele não foi projetado para tarefas como compreensão multimodal, matemática avançada ou raciocínio complexo em cadeia de pensamento, nas quais o GPT-4o tem melhor desempenho.
OrcaRouter fatura o GPT-4o-mini Search Preview pela taxa do provedor, sem margem de lucro: US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Isso significa que você paga exatamente o que a OpenAI cobra, sem taxas adicionais. O preço é por token, com tokens de contexto contados como entrada e tokens gerados como saída. O modelo usa o esquema de tokenização padrão da OpenAI. Não há cobranças extras pelo recurso de pré-visualização de pesquisa em si; o custo é o mesmo que o GPT-4o-mini base, apesar da recuperação adicional da web.
Comparado ao GPT-4o (que custa US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída), o GPT-4o-mini Search Preview é significativamente mais barato — cerca de 16 vezes menos para entrada e 16,6 vezes menos para saída. Isso o torna um forte candidato para aplicações onde o custo por consulta é importante, especialmente quando você precisa de pesquisa na web. No entanto, o GPT-4o-mini base (sem search preview) custa o mesmo por token, mas não possui pesquisa. Se a pesquisa não for necessária, você pode economizar a pequena latência extra, mas o custo por token é idêntico.
OrcaRouter pode suportar cache de resultados de pesquisa ou respostas do modelo, dependendo da configuração. Se ativado, consultas repetidas para a mesma informação podem ser servidas a partir do cache, reduzindo tanto a latência quanto o uso de tokens. No entanto, as políticas de cache variam. Para as informações mais atuais, o modelo normalmente realiza uma nova pesquisa na web em cada solicitação. Para minimizar custos, considere usar o base GPT-4o-mini se suas consultas não exigirem dados da web. Sempre monitore seu uso de tokens através do painel do OrcaRouter para entender seus gastos.
O OrcaRouter repassa os preços exatos da OpenAI sem adicionar nenhuma margem. A cobrança é baseada na contagem de tokens informada pelo provedor. Não há taxas de configuração, mínimos mensais ou cobranças extras pelo gateway de API. Você paga apenas pelos tokens que utiliza, de acordo com as tarifas especificadas. Para o GPT-4o-mini Search Preview, isso significa US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Certifique-se de que sua conta esteja configurada com o OrcaRouter para acessar o modelo a essas tarifas.
Para usar o modelo, envie uma requisição POST para https://api.orcarouter.ai/v1/chat/completions com o campo model definido como "openai/gpt-4o-mini-search-preview". Este endpoint é compatível com OpenAI, portanto você pode usar qualquer SDK ou cliente OpenAI alterando a URL base e a chave de API. Exemplo curl: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' A pré-visualização de pesquisa será acionada automaticamente.
A API suporta todos os parâmetros padrão de conclusão de chat do OpenAI: temperatura (0-2, padrão 1), top_p, n, stream, stop, max_tokens (até 16384), presence_penalty, frequency_penalty e logit_bias. O modelo respeita esses parâmetros. Para pré-visualização de pesquisa, não há parâmetros adicionais necessários; o modelo decide quando pesquisar. No entanto, você pode solicitar que ele explicitamente peça uma pesquisa na web (por exemplo, "Pesquise na web pelas últimas notícias sobre...") para incentivar a recuperação. Observe que o modelo pode optar por não pesquisar se considerar que o conhecimento interno é suficiente.
Se você já usa a API da OpenAI, migrar para o OrcaRouter é simples: altere a URL base de https://api.openai.com/v1 para https://api.orcarouter.ai/v1 e substitua sua chave de API por uma do OrcaRouter. O ID do modelo se torna "openai/gpt-4o-mini-search-preview". Todos os outros corpos de solicitação e formatos de resposta permanecem idênticos. Você pode usar qualquer biblioteca cliente da OpenAI (Python, Node.js, etc.) sem modificações. O OrcaRouter também suporta streaming, chamada de funções e outros recursos avançados compatíveis com a API da OpenAI.
Para streaming de respostas, defina "stream": true na sua solicitação. O OrcaRouter retorna dados como eventos enviados pelo servidor (server-sent events), idêntico ao formato de streaming do OpenAI. Cada evento contém um delta da resposta. O streaming é particularmente útil para aplicações voltadas ao usuário, pois permite mostrar os tokens à medida que são gerados. Para consultas de pré-visualização de pesquisa, o modelo pode primeiro indicar que está pesquisando antes de gerar a resposta final. O stream incluirá esses tokens intermediários. Certifique-se de que seu cliente possa lidar graciosamente com atualizações parciais.
GPT-4o-mini Search Preview é uma variante menor, mais rápida e mais barata do GPT-4o com capacidades adicionais de pesquisa na web. Enquanto o GPT-4o possui raciocínio superior, base de conhecimento maior (até seu corte de treinamento) e suporte multimodal (imagens, áudio), este modelo é exclusivamente textual e depende da pesquisa na web para superar seu conhecimento limitado de treinamento. Para tarefas que exigem análise profunda ou matemática complexa, o GPT-4o é melhor. Para aplicações sensíveis a custos que necessitam de informações recentes, o GPT-4o-mini Search Preview é uma alternativa forte. O preço é cerca de 16 vezes mais barato.
A base GPT-4o-mini não inclui busca na web; ela depende exclusivamente de seus dados de treinamento, que têm uma data de corte no final de 2023. A GPT-4o-mini Search Preview adiciona a capacidade de recuperar informações atuais da internet. Ambos os modelos têm a mesma janela de contexto (128k tokens), saída máxima (16384) e precificação por token. A variante Search Preview pode ter latência ligeiramente maior devido à recuperação na web. Se seu aplicativo não precisar de dados ao vivo, o modelo base é funcionalmente idêntico e pode ser mais rápido. Ambos os modelos são acessados via OrcaRouter com diferentes IDs de modelo.
Outros modelos habilitados para pesquisa incluem o Gemini com base na Pesquisa Google, ou modelos que usam recuperação da web baseada em plugins. O GPT-4o-mini Search Preview oferece integração nativa sem plugins externos. Geralmente é mais barato que modelos de pesquisa maiores (como GPT-4 com navegação). No entanto, pode ser menos abrangente nos resultados de pesquisa em comparação com APIs de pesquisa dedicadas. Para conhecimento web de alta precisão, considere complementar com uma API de pesquisa factual e alimentar os resultados a um modelo base. Este modelo é melhor para consultas de simples a moderadamente complexas que se beneficiam de dados web atuais.
Escolha este modelo quando precisar: (1) baixo custo por consulta, (2) pesquisa web automática sem integração personalizada, (3) tempos de resposta rápidos e (4) uma grande janela de contexto. Escolha uma variante completa do GPT-4o se precisar de entradas multimodais ou raciocínio mais profundo. Escolha o GPT-4o-mini básico se não precisar de pesquisa web e quiser respostas um pouco mais rápidas. Escolha uma API de pesquisa dedicada mais um modelo pequeno se precisar de controle refinado sobre fontes e resultados de pesquisa. Este modelo é melhor como substituto direto para GPT-3.5 ou GPT-4o-mini em aplicações que se beneficiariam de informações ao vivo.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Entrada / 1M tokens | $0.150 |
| Saída / 1M tokens | $0.600 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/openai/gpt-4o-mini-search-previewAbrir @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview