GPT-4o mini Search Preview es un modelo especializado para la búsqueda web en Chat Completions. Está entrenado para entender y ejecutar consultas de búsqueda web.
GPT-4o-mini Search Preview es una variante del modelo GPT-4o-mini de OpenAI que incluye capacidades de búsqueda web integradas. Está diseñado para proporcionar respuestas que incorporan información…
El modelo combina comprensión y generación general del lenguaje con búsqueda web en vivo. Puede responder preguntas sobre eventos recientes, extraer datos de sitios web específicos y sintetizar información de múltiples fuentes en línea. Conserva las capacidades típicas de GPT-4o-mini: resumen de texto, traducción, generación de código, razonamiento lógico y escritura creativa. La vista previa de búsqueda añade la capacidad de acceder a noticias actuales, precios de acciones, clima, detalles de productos y otros datos sensibles al tiempo. Sin embargo, debido a que el modelo está ajustado para velocidad y eficiencia, su profundidad de razonamiento puede ser menor que la del modelo GPT-4o completo.
El modelo sobresale en escenarios donde las respuestas dependen de información cambiante o reciente. Ejemplos incluyen agentes de servicio al cliente en vivo que necesitan verificar el estado de un pedido o políticas de devolución, herramientas de contenido que generan resúmenes de temas de tendencia y asistentes de investigación que recopilan datos de múltiples fuentes en línea. También es útil para verificar afirmaciones contra datos actuales, como consultar el último anuncio de una empresa o un marcador deportivo. Debido a su costo relativamente bajo y tiempos de respuesta rápidos, es adecuado para aplicaciones con altos volúmenes de solicitudes donde la conexión a la web es una característica clave.
Si tu aplicación no requiere búsqueda web o información actualizada, considera usar la versión base GPT-4o-mini sin vista previa de búsqueda. El modelo base es aún más económico (el mismo precio por token, pero sin la sobrecarga de la recuperación de búsqueda) y puede ser más rápido para tareas puramente conversacionales. Para consultas muy simples que no necesitan un amplio conocimiento del mundo, modelos más pequeños como GPT-4o-mini (base) o incluso modelos más antiguos como GPT-3.5 Turbo pueden ser suficientes. Evalúa si la función de vista previa de búsqueda justifica el costo para tu caso de uso específico.
La vista previa de búsqueda se activa automáticamente cuando el modelo considera que la consulta necesita información externa. No es necesario configurar APIs de búsqueda ni proporcionar resultados de búsqueda manualmente. Sin embargo, puede influir en el comportamiento del modelo indicándole que use la búsqueda web explícitamente, o especificando fuentes. El modelo respeta los filtros de seguridad y contenido estándar aplicados por OpenAI. Tenga en cuenta que la búsqueda web puede introducir latencia en comparación con el modelo base, ya que el modelo espera los resultados de búsqueda antes de generar la respuesta final.
Las puntuaciones específicas de benchmarks para GPT-4o-mini Search Preview no se han publicado oficialmente como una variante separada. Sin embargo, basándose en GPT-4o-mini base, se espera que este modelo tenga un buen rendimiento en benchmarks estándar de PNL como MMLU, HellaSwag y GSM8K, aunque probablemente con menor precisión que el GPT-4o completo. La función de vista previa de búsqueda puede mejorar el rendimiento en tareas que requieren conocimientos actualizados (como preguntas sobre eventos recientes), pero no cambia las capacidades de razonamiento del modelo subyacente. En cuanto a la precisión factual, el modelo depende de la calidad y actualidad de las fuentes web que recupera.
GPT-4o-mini Search Preview está diseñado para tener baja latencia en comparación con GPT-4o. La versión base de GPT-4o-mini es conocida por su inferencia rápida, y la vista previa de búsqueda añade tiempo extra para la recuperación web. El tiempo total de respuesta depende de factores como la latencia de red, la cantidad de resultados de búsqueda recuperados y la longitud del contexto. En uso típico, las respuestas se generan en unos pocos segundos. Para aplicaciones que requieren la latencia más baja posible, la versión base de GPT-4o-mini (sin búsqueda) sería más rápida. La API de OrcaRouter admite streaming para comenzar a mostrar los tokens a medida que se generan.
Fortalezas: El modelo proporciona información actualizada sin necesidad de integración de búsqueda separada, tiene una ventana de contexto grande (128k tokens) y es rentable para uso de alto volumen. Limitaciones: Solo acepta texto; a veces puede recuperar contenido web incompleto o irrelevante; su razonamiento es menos profundo que GPT-4o; y la vista previa de búsqueda puede aumentar la latencia. Además, el modelo puede no citar fuentes explícitamente siempre, por lo que los usuarios deben verificar información crítica. No está diseñado para tareas como comprensión multimodal, matemáticas avanzadas o razonamiento complejo de cadena de pensamiento donde GPT-4o tiene un mejor rendimiento.
OrcaRouter factura GPT-4o-mini Search Preview a la tarifa del proveedor sin margen: $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida. Esto significa que pagas exactamente lo que OpenAI cobra, sin tarifas adicionales. El precio es por token, contando los tokens de contexto como entrada y los tokens generados como salida. El modelo utiliza el esquema de tokenización estándar de OpenAI. No hay cargos adicionales por la función de vista previa de búsqueda en sí; el costo es el mismo que el de GPT-4o-mini base, a pesar de la recuperación web adicional.
En comparación con GPT-4o (que cuesta $2.50 por millón de tokens de entrada y $10 por millón de tokens de salida), GPT-4o-mini Search Preview es significativamente más barato—aproximadamente 16 veces menos para entrada y 16.6 veces menos para salida. Esto lo convierte en un fuerte candidato para aplicaciones donde el costo por consulta importa, especialmente cuando necesitas búsqueda web. Sin embargo, el GPT-4o-mini base (sin vista previa de búsqueda) cuesta lo mismo por token pero carece de búsqueda. Si no se necesita búsqueda, podrías ahorrar la ligera latencia adicional, pero el costo por token es idéntico.
OrcaRouter puede admitir el almacenamiento en caché de resultados de búsqueda o respuestas del modelo, dependiendo de la configuración. Si está habilitado, las consultas repetidas para la misma información podrían servirse desde la caché, reduciendo tanto la latencia como el uso de tokens. Sin embargo, las políticas de caché varían. Para obtener la información más actualizada, el modelo normalmente realiza una búsqueda web nueva en cada solicitud. Para minimizar costos, considere usar la versión base GPT-4o-mini si sus consultas no requieren datos web. Supervise siempre su uso de tokens a través del panel de control de OrcaRouter para comprender sus gastos.
OrcaRouter aplica los precios exactos de OpenAI sin añadir ningún margen. La facturación se basa en el recuento de tokens según lo informado por el proveedor. No hay tarifas de configuración, mínimos mensuales ni cargos adicionales por la puerta de enlace de la API. Solo pagas por los tokens que usas a las tarifas especificadas. Para GPT-4o-mini Search Preview, eso significa $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida. Asegúrate de que tu cuenta esté configurada con OrcaRouter para acceder al modelo a estas tarifas.
Para usar el modelo, envíe una solicitud POST a https://api.orcarouter.ai/v1/chat/completions con el campo model establecido en "openai/gpt-4o-mini-search-preview". Este endpoint es compatible con OpenAI, por lo que puede usar cualquier SDK o cliente de OpenAI cambiando la URL base y la clave API. Ejemplo con curl: ``` curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' ``` La vista previa de búsqueda se activará automáticamente.
La API admite todos los parámetros estándar de finalización de chat de OpenAI: temperature (0-2, predeterminado 1), top_p, n, stream, stop, max_tokens (hasta 16384), presence_penalty, frequency_penalty y logit_bias. El modelo respeta estos parámetros. Para la vista previa de búsqueda, no se necesitan parámetros adicionales; el modelo decide cuándo buscar. Sin embargo, puede indicarle que solicite explícitamente una búsqueda web (por ejemplo, "Busca en la web las últimas noticias sobre...") para fomentar la recuperación. Tenga en cuenta que el modelo puede optar por no buscar si considera que su conocimiento interno es suficiente.
Si ya usas la API de OpenAI, migrar a OrcaRouter es sencillo: cambia la URL base de https://api.openai.com/v1 a https://api.orcarouter.ai/v1 y reemplaza tu clave de API por una de OrcaRouter. El ID del modelo se convierte en "openai/gpt-4o-mini-search-preview". Todos los demás cuerpos de solicitud y formatos de respuesta permanecen idénticos. Puedes usar cualquier cliente de OpenAI (Python, Node.js, etc.) sin modificaciones. OrcaRouter también admite streaming, llamadas a funciones y otras funciones avanzadas compatibles con la API de OpenAI.
Para transmitir respuestas en streaming, establezca "stream": true en su solicitud. OrcaRouter devuelve datos como eventos enviados por el servidor, idénticos al formato de streaming de OpenAI. Cada evento contiene un delta de la respuesta. El streaming es particularmente útil para aplicaciones orientadas al usuario, para mostrar tokens a medida que se generan. Para consultas de vista previa de búsqueda, el modelo puede indicar primero que está buscando antes de generar la respuesta final. El flujo incluirá esos tokens intermedios. Asegúrese de que su cliente pueda manejar actualizaciones parciales de manera adecuada.
GPT-4o-mini Search Preview es una variante más pequeña, rápida y barata de GPT-4o, con capacidades añadidas de búsqueda web. Mientras que GPT-4o ofrece un razonamiento superior, una base de conocimiento más grande (hasta su fecha de corte de entrenamiento) y soporte multimodal (imágenes, audio), este modelo es solo texto y depende de la búsqueda web para superar su limitado conocimiento de entrenamiento. Para tareas que requieren análisis profundo o matemáticas complejas, GPT-4o es mejor. Para aplicaciones sensibles al costo que necesitan información actualizada, GPT-4o-mini Search Preview es una alternativa sólida. El precio es aproximadamente 16 veces más barato.
La base GPT-4o-mini no incluye búsqueda web; depende únicamente de sus datos de entrenamiento, cuya fecha de corte es a finales de 2023. GPT-4o-mini Search Preview añade la capacidad de recuperar información actual de internet. Ambos modelos tienen la misma ventana de contexto (128k tokens), salida máxima (16384) y precios por token. La variante de vista previa de búsqueda puede tener una latencia ligeramente mayor debido a la recuperación web. Si su aplicación no necesita datos en vivo, el modelo base es funcionalmente idéntico y puede ser más rápido. Ambos modelos se acceden a través de OrcaRouter con diferentes IDs de modelo.
Otros modelos con capacidad de búsqueda incluyen Gemini con grounding de Búsqueda de Google, o modelos que utilizan recuperación web basada en plugins. GPT-4o-mini Search Preview ofrece integración nativa sin plugins externos. Generalmente es más barato que modelos de búsqueda más grandes (como GPT-4 con navegación). Sin embargo, puede ser menos exhaustivo en los resultados de búsqueda en comparación con APIs de búsqueda dedicadas. Para conocimiento web de alta precisión, considere complementar con una API de búsqueda factual y alimentar los resultados a un modelo base. Este modelo es mejor para consultas simples a moderadamente complejas que se benefician de datos web actuales.
Elija este modelo cuando necesite: (1) bajo costo por consulta, (2) búsqueda web automática sin integración personalizada, (3) tiempos de respuesta rápidos y (4) una ventana de contexto amplia. Elija una variante completa de GPT-4o si necesita entradas multimodales o un razonamiento más profundo. Elija la base GPT-4o-mini si no necesita búsqueda web y desea respuestas ligeramente más rápidas. Elija una API de búsqueda dedicada más un modelo pequeño si necesita un control detallado sobre las fuentes y los resultados de búsqueda. Este modelo es mejor como reemplazo directo de GPT-3.5 o GPT-4o-mini en aplicaciones que se beneficiarían de información en vivo.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Entrada / 1M tokens | $0.150 |
| Salida / 1M tokens | $0.600 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/openai/gpt-4o-mini-search-previewAbrir @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview