GPT-4o mini es el modelo más nuevo de OpenAI después de [GPT-4 Omni](/models/openai/gpt-4o), que admite tanto entradas de texto como de imagen con salidas de texto. Como su modelo pequeño más avanzado, es muchas veces más asequible...
GPT-4o-mini es una variante más pequeña y rápida del modelo GPT-4o de OpenAI, optimizada para un menor costo computacional, pero que conserva capacidades multimodales. Puede procesar texto, imágenes…
GPT-4o-mini sobresale en una amplia gama de tareas de lenguaje, incluyendo resumen, traducción, clasificación y respuesta a preguntas. Admite salida JSON estructurada, llamadas a funciones y uso de herramientas, lo que permite la integración con API y bases de datos externas. La ventana de contexto de 128K le permite ingerir grandes documentos o historiales de conversación para un análisis coherente. Se desempeña bien en benchmarks comunes (puntuación MATH-500 de 78.9) y es adecuado para problemas matemáticos educativos, explicación de código y extracción de datos. Para tareas más simples, GPT-4o-mini a menudo iguala a modelos más grandes a una fracción del costo. Sin embargo, las tareas que requieren un profundo conocimiento del dominio o resultados altamente creativos pueden experimentar una calidad disminuida en comparación con GPT-4o.
Las imágenes pueden proporcionarse como URLs o datos codificados en base64 dentro de la solicitud a la API. El modelo interpreta las imágenes, comprendiendo contenido visual como objetos, texto en imágenes y relaciones espaciales. Esto permite casos de uso como preguntas y respuestas visuales, interpretación de diagramas y reconocimiento de dígitos manuscritos. Los tokens de imagen cuentan contra el límite de contexto, por lo que las imágenes de alta resolución o grandes consumen más del presupuesto de 128K tokens. El modelo no genera imágenes, solo las procesa. Para tareas que requieren detalles visuales finos (p. ej., imágenes médicas), un modelo de visión especializado puede ser más preciso, pero GPT-4o-mini ofrece una solución de propósito general con un costo razonable.
GPT-4o-mini acepta archivos cargados además de texto e imágenes. Los tipos de archivo comunes incluyen PDFs, .docx, .txt, .csv y .json. El modelo extrae texto y elementos visuales relevantes (si el archivo contiene imágenes incrustadas) y los procesa como parte del contexto. Esto es útil para analizar trabajos de investigación, contratos legales u hojas de cálculo sin tener que copiar manualmente. Tenga en cuenta que el contenido del archivo contribuye al uso de tokens; por ejemplo, un PDF de 50 páginas puede consumir varios miles de tokens. OrcaRouter cobra según el total de tokens de entrada, incluidos los de los archivos. No hay una tarifa adicional por procesamiento de archivos más allá del consumo de tokens.
Si tu carga de trabajo involucra solo texto sin imágenes ni archivos, y el contexto requerido es inferior a 16K tokens, un modelo más pequeño (como GPT-3.5-turbo) puede ofrecer un menor costo por token. Del mismo modo, para tareas de rendimiento muy alto como clasificación simple o preguntas y respuestas triviales, un modelo dedicado y ajustado podría ser más económico. GPT-4o-mini es rentable para casos de uso multimodal o de contexto largo, pero su fortaleza reside en equilibrar rendimiento y precio. Si tu aplicación puede tolerar respuestas más lentas o un costo mayor para máxima precisión, GPT-4o es una alternativa. Evalúa tu tarea específica para confirmar qué modelo cumple con tus umbrales de calidad y presupuesto.
MATH-500 es un subconjunto del benchmark MATH, que consta de 500 problemas matemáticos de nivel competitivo que abarcan álgebra, geometría, teoría de números y probabilidad. Una puntuación de 78.9 indica que GPT-4o-mini respondió correctamente aproximadamente el 78.9% de estos problemas. Este es un resultado sólido para un modelo más pequeño, lo que refleja su capacidad de razonamiento matemático. Supera a muchos modelos anteriores de tamaño similar. Sin embargo, el rendimiento puede variar en dominios de problemas específicos. El benchmark se realiza bajo condiciones de cero disparos (zero-shot), lo que significa que no se proporcionan ejemplos previos. Para la tutoría de matemáticas en el mundo real, el modelo puede necesitar una preparación cuidadosa de las indicaciones para manejar correctamente soluciones de varios pasos.
Si bien el único punto de referencia proporcionado es MATH-500, la información pública ampliamente conocida indica que GPT-4o-mini también obtiene puntuaciones competitivas en MMLU (comprensión masiva de lenguaje multitarea), HellaSwag y GSM8K. Generalmente se ubica por debajo de GPT-4o pero por encima de GPT-3.5-turbo en estas métricas. En evaluaciones de razonamiento, muestra un rendimiento sólido para su cantidad de parámetros. En escritura creativa o generación de texto abierto, sus salidas son coherentes pero pueden carecer del matiz de los modelos más grandes. La latencia es generalmente menor que la de GPT-4o, lo que lo hace adecuado para aplicaciones en tiempo real. Para puntuaciones exactas, consulte la documentación de OpenAI. OrcaRouter proporciona acceso sin recargos adicionales.
La latencia depende de la complejidad de la solicitud, la cantidad de tokens y la carga de la API. GPT-4o-mini está diseñado para ser rápido—normalmente devolviendo el primer token en menos de un segundo para indicaciones de longitud moderada. Para documentos largos (por ejemplo, 50K tokens), la latencia aumentará a medida que el modelo procesa todo el contexto. OrcaRouter no modifica la velocidad; experimentas los mismos tiempos de respuesta que las llamadas directas a la API de OpenAI. Se admite streaming para reducir la latencia percibida. Para aplicaciones críticas en latencia, considera mantener las indicaciones cortas y usar streaming. El tiempo exacto hasta el primer token se puede medir monitoreando el tiempo de respuesta; no se proporciona un SLA específico.
Aunque capaz, GPT-4o-mini tiene limitaciones debido a su tamaño más pequeño. Puede producir respuestas menos precisas en razonamientos complejos de múltiples pasos en comparación con GPT-4o. A veces puede malinterpretar instrucciones matizadas o no mantener una coherencia perfecta en salidas muy largas. Su comprensión multimodal es buena pero no perfecta; podría pasar por alto pequeños detalles en imágenes o contar mal elementos. El modelo puede exhibir sesgos presentes en sus datos de entrenamiento. No admite búsqueda en internet ni acceso a datos en tiempo real a menos que esté específicamente ajustado para uso de herramientas. Para tareas que requieren alta precisión (por ejemplo, asesoramiento legal, diagnóstico médico), la revisión humana es esencial. Las puntuaciones de referencia reflejan entornos controlados; el rendimiento en el mundo real puede variar.
OrcaRouter transmite los precios exactos de OpenAI sin margen adicional: $0.15 por 1 millón de tokens de entrada y $0.60 por 1 millón de tokens de salida. Los tokens de entrada incluyen todo el texto, tokens de imagen y contenido de archivos. Los tokens de salida cuentan el texto generado. No hay tarifas mensuales ni cargos ocultos. Este se encuentra entre los costos por token más bajos para un modelo multimodal con una ventana de contexto de 128K. A modo de comparación, GPT-4o cuesta $2.50 por 1M de entrada y $10 por 1M de salida, lo que hace que GPT-4o-mini sea un 94% más barato en entrada y un 94% más barato en salida. La ventaja de costo es significativa para aplicaciones de alto volumen.
Mientras que GPT-4o-mini es barato por token, su tamaño más pequeño puede requerir más intentos o indicaciones más detalladas para lograr la precisión deseada, lo que potencialmente aumenta el consumo total de tokens. Para tareas donde GPT-4o obtiene la respuesta correcta en un intento pero GPT-4o-mini necesita tres, el costo total puede ser similar o incluso mayor. Además, si necesita enviar muchas solicitudes pequeñas, la sobrecarga de las llamadas a la API podría agregar latencia, pero no costo directo. No se aplica almacenamiento en caché; cada solicitud se procesa desde cero. Evalúe su caso de uso con ambos modelos para determinar el mejor equilibrio entre costo y rendimiento. OrcaRouter ofrece precios consistentes sin descuentos por volumen.
OrcaRouter no implementa el almacenamiento en caché de indicaciones. Cada solicitud a GPT-4o-mini se envía a los servidores de OpenAI y se factura por token. No hay una tarifa reducida para indicaciones repetidas. Si tu carga de trabajo repite con frecuencia el mismo mensaje del sistema o un contexto extenso, puedes considerar almacenar la respuesta en tu lado para evitar reenviar indicaciones idénticas. Algunos proveedores ofrecen descuentos por almacenamiento en caché de indicaciones, pero a través de OrcaRouter pagas la tarifa estándar del proveedor. Esto es transparente y predecible. La falta de almacenamiento en caché simplifica los precios, pero significa que debes diseñar tus consultas para minimizar el uso redundante de tokens.
(Nota: No se proporciona ninguna otra variante de GPT-4o-mini. Se asume que la pregunta trata sobre la comparación con otros modelos mini como Claude 3 Haiku o Gemini Flash, pero solo se proporcionan hechos. En su lugar, comparamos con GPT-4o.) En comparación con GPT-4o, GPT-4o-mini es dramáticamente más barato: $0.15 frente a $2.50 por 1M de tokens de entrada (94% más barato) y $0.60 frente a $10 por 1M de tokens de salida (94% más barato). Muchos usuarios consideran que GPT-4o-mini es adecuado para el 80-90% de las tareas, lo que genera enormes ahorros. Sin embargo, para tareas que requieren máxima precisión (por ejemplo, generación de código complejo, razonamiento legal matizado), el ahorro de costos puede no justificar las caídas de calidad. OrcaRouter le permite cambiar fácilmente entre modelos a través del mismo endpoint de API cambiando el ID del modelo.
Usa la biblioteca cliente de OpenAI o cualquier cliente HTTP, apuntando la URL base a https://api.orcarouter.ai/v1. Establece el parámetro del modelo en "openai/gpt-4o-mini". La autenticación requiere una clave API de OrcaRouter. Un ejemplo mínimo en Python: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Todos los parámetros de la API de OpenAI son compatibles, incluyendo temperature, max_tokens, stream y tools. OrcaRouter envía solicitudes a OpenAI y devuelve las respuestas sin cambios.
Parámetros estándar de OpenAI Chat Completions: model (obligatorio: "openai/gpt-4o-mini"), messages (arreglo de objetos de mensaje), temperature (0-2, por defecto 1), top_p (0-1, por defecto 1), n (número de respuestas, por defecto 1), stream (booleano), stop (cadena/arreglo), max_tokens (hasta 16384), presence_penalty, frequency_penalty, logit_bias, user (opcional) y tools para invocación de funciones. Para visión, incluya contenido de imagen en los mensajes (type "image_url" o "image_url" con detail). Las entradas de archivo pueden estar codificadas en base64. OrcaRouter pasa todos los parámetros a OpenAI. Nota: El formato de respuesta (modo JSON) es compatible; establezca response_format={ "type": "json_object" } cuando corresponda.
La migración es simple: cambie la URL base en su cliente de "https://api.openai.com/v1" a "https://api.orcarouter.ai/v1" y reemplace su clave de API con una clave de OrcaRouter. Actualice el nombre del modelo a "openai/gpt-4o-mini" (o manténgalo como "gpt-4o-mini"? El hecho dice que el id del modelo es "openai/gpt-4o-mini", así que use ese). Todo el otro código permanece sin cambios porque la API es completamente compatible con OpenAI. También puede mantener múltiples cadenas de modelo y enrutar según el costo o la capacidad. OrcaRouter no altera el formato de respuesta. Pruebe con algunas consultas para asegurarse de que los encabezados y la transmisión funcionen como se espera.
Sí, GPT-4o-mini admite streaming mediante eventos enviados por el servidor (SSE). Configura stream=true en la solicitud. La respuesta será una serie de fragmentos que contienen contenido delta. Esto reduce el tiempo hasta el primer token para los usuarios y permite la visualización en tiempo real. OrcaRouter reenvía las respuestas de streaming sin modificaciones. Ten en cuenta que el recuento total de tokens facturados sigue siendo el mismo. El streaming es compatible con todas las modalidades de entrada (texto, imagen, archivo). También puedes combinar streaming con llamadas a funciones; el modelo transmitirá un fragmento de llamada a herramienta cuando corresponda. El parámetro max_tokens se aplica a la respuesta completa.
GPT-4o-mini es el hermano más pequeño y económico de GPT-4o. Cuesta aproximadamente un 94% menos tanto en tokens de entrada como de salida. Tiene la misma ventana de contexto de 128K y un máximo de salida de 16K. Admite las mismas entradas multimodales, pero generalmente es ligeramente menos preciso en tareas de razonamiento complejo y creatividad. En MATH-500, GPT-4o-mini obtiene una puntuación de 78.9 mientras que GPT-4o obtiene 92+ (aproximadamente). Para muchas tareas cotidianas como atención al cliente, resúmenes y visión simple, GPT-4o-mini es suficiente. Elija GPT-4o cuando necesite un rendimiento de primer nivel y pueda aceptar una latencia y un costo más altos.
Comparación con modelos como Claude 3 Haiku o Gemini 1.5 Flash: GPT-4o-mini ofrece una ventana de contexto de 128K, mientras que Haiku permite 200K y Flash 1M. Los precios son similares (Haiku $0.25/$1.25 por 1M de tokens; Flash $0.35/$1.05). La puntuación MATH-500 de GPT-4o-mini de 78.9 es competitiva; Haiku obtiene alrededor de 73 y Flash alrededor de 78 en pruebas de matemáticas similares. Para entradas multimodales, los tres aceptan imágenes. GPT-4o-mini puede tener mejor calidad de razonamiento por su precio, pero la ventana de contexto es más pequeña que la de algunos competidores. La mejor opción depende de sus requisitos específicos de latencia, costo y calidad. OrcaRouter también proporciona acceso a Haiku y Flash, lo que permite una comparación lado a lado.
GPT-3.5-turbo es más antiguo, tiene una ventana de contexto de 16K y cuesta ligeramente menos ($0.50 por 1M de entrada vs $0.15 para GPT-4o-mini? En realidad GPT-3.5-turbo-0125 cuesta $0.50/$1.50 pero con contexto más pequeño. Según los precios proporcionados, GPT-4o-mini es más barato por token y ofrece un contexto más amplio y entrada multimodal. Por lo tanto, para la mayoría de las tareas, GPT-4o-mini es superior. Sin embargo, algunas aplicaciones heredadas que ya usan GPT-3.5-turbo pueden requerir cambios mínimos. GPT-4o-mini también se desempeña mejor en puntos de referencia de razonamiento. A menos que la latencia sea extremadamente crítica o que haya ajustado fino un modelo GPT-3.5, GPT-4o-mini es la actualización directa recomendada.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $0.150 |
| Salida / 1M tokens | $0.600 |
| Lectura caché / 1M | $0.075 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/openai/gpt-4o-miniAbrir @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini