GPT-4o mini es el modelo más nuevo de OpenAI después de [GPT-4 Omni](/models/openai/gpt-4o), que admite tanto entradas de texto como de imagen con salidas de texto. Como su modelo pequeño más avanzado, es muchas veces más asequible...
GPT-4o-mini (2024-07-18) es un modelo multimodal ligero desarrollado por OpenAI, diseñado para el procesamiento eficiente de texto e imágenes en términos de costo. Está pensado para desarrolladores y…
GPT-4o-mini puede realizar tareas de razonamiento de imágenes, como describir contenido visual, responder preguntas sobre imágenes e identificar objetos o texto dentro de las imágenes. Admite formatos de imagen estándar (JPEG, PNG, GIF, WebP) y puede manejar múltiples imágenes en una sola solicitud. El modelo no realiza detección de objetos en un sentido estructurado de cuadros delimitadores, pero puede describir ubicaciones y relaciones. Por ejemplo, puede leer texto de una fotografía, comprender gráficos y diagramas, y proporcionar descripciones detalladas de escenas. La precisión de las tareas basadas en imágenes depende de la resolución y el contexto; las imágenes de alta resolución pueden incurrir en más costos de tokens, pero pueden producir mejores resultados para detalles finos.
GPT-4o-mini acepta entradas de archivos como PDFs, documentos de Word y archivos de imagen a través de la estructura de contenido multimodal. Cuando se proporciona un archivo, el modelo extrae el texto y el contenido de imagen del mismo, lo que permite a los usuarios hacer preguntas sobre el contenido del documento, resumir su texto o analizar tablas y figuras incrustadas. El archivo no se carga ni se almacena; se procesa en línea durante la llamada a la API. Esto es útil para flujos de trabajo que implican revisión de documentos, análisis de contratos o extracción de datos de formularios escaneados. Tenga en cuenta que los archivos muy grandes pueden exceder la ventana de contexto de 128,000 tokens o generar costos elevados de tokens.
Para tareas que requieren solo generación de texto ligero, los presupuestos de tokens pueden aprovechar mejor modelos aún más baratos como GPT-3.5-Turbo o alternativas de código abierto (por ejemplo, Llama 3 8B). Si su carga de trabajo no necesita entrada multimodal o un contexto de 128k, un modelo más pequeño podría reducir aún más los costos. Además, para tareas específicas como clasificación simple o extracción de palabras clave, un modelo más pequeño ajustado puede ofrecer menor latencia y costo. Sin embargo, la combinación de bajo precio, contexto amplio y capacidad multimodal de GPT-4o-mini lo convierte en un valor predeterminado sólido para muchas aplicaciones de uso general.
GPT-4o-mini se destaca en entornos de producción de alto volumen que se benefician de la comprensión multimodal y ventanas de contexto grandes. Los casos de uso ideales incluyen chatbots de atención al cliente que pueden manejar capturas de pantalla y largos historiales de conversaciones, pipelines de procesamiento de documentos para extraer datos de PDF o imágenes, herramientas educativas para tutoría de matemáticas (como lo demuestra su puntuación de 78.9 en MATH-500) y depuración de código donde están involucrados tanto texto como diagramas. También es adecuado para flujos de trabajo de moderación de contenido que requieren análisis de imágenes junto con texto. El bajo costo por token permite escalar a millones de solicitudes sin un gasto prohibitivo.
GPT-4o-mini alcanza una puntuación de 78.9 en el benchmark MATH-500, un subconjunto del conjunto de datos MATH que consta de 500 problemas matemáticos desafiantes. Esta puntuación indica la capacidad del modelo para resolver problemas de aritmética, álgebra, geometría y otros problemas matemáticos mediante un razonamiento paso a paso. Una puntuación de 78.9 lo sitúa por encima de muchos modelos más pequeños y de algunas variantes anteriores de GPT-4, lo que sugiere capacidades de razonamiento sólidas para un modelo de su tamaño y costo. Sin embargo, no es tan eficaz como GPT-4o o GPT-4 Turbo en el mismo benchmark. El resultado debe interpretarse en contexto: GPT-4o-mini está diseñado para la eficiencia, no para la máxima precisión.
Las cifras de latencia específica no son divulgadas públicamente por OpenAI, pero GPT-4o-mini generalmente es más rápido que los modelos más grandes de GPT-4 debido a su menor número de parámetros. En la práctica, los usuarios reportan un tiempo hasta el primer token en el rango de unos pocos cientos de milisegundos para instrucciones cortas, y un rendimiento de generación de decenas de tokens por segundo. La latencia depende del recuento total de tokens (entrada + salida), la cantidad de imágenes y la carga actual del servidor. Dado que OrcaRouter actúa como un proxy, la latencia adicional de red es mínima, típicamente dentro de unos pocos milisegundos de la latencia directa de la API de OpenAI. El modelo admite transmisión (streaming) para aplicaciones en tiempo real.
Fortalezas: Eficiencia de costos (precio más bajo entre los miembros de la familia GPT-4 con soporte multimodal), ventana de contexto grande de 128k, razonamiento matemático sólido (78.9 MATH-500) e inferencia rápida en comparación con modelos más grandes. Maneja entradas de imágenes y archivos de manera competente para tareas generales. Limitaciones: En razonamiento complejo y matizado o escritura creativa, tiene un rendimiento inferior en comparación con GPT-4o y GPT-4 Turbo. Su seguimiento de instrucciones puede ser menos fiable para tareas que requieren formato estricto o restricciones de múltiples pasos. Además, al ser un modelo más pequeño, su fecha de corte de conocimiento (enero de 2024) puede estar desactualizada para eventos muy recientes. Tampoco admite capacidades de visión para detección de objetos detallados o reconocimiento facial.
Los precios se fijan en $0.15 por 1 millón de tokens de entrada y $0.60 por 1 millón de tokens de salida. Estas son las tarifas estándar del proveedor OpenAI, y OrcaRouter no aplica ningún margen adicional sobre ellas. La facturación se basa en el recuento de tokens según lo informado por el proveedor del modelo. No hay tarifas adicionales por solicitud ni mínimos. La política de margen cero se aplica a todos los modelos disponibles a través de OrcaRouter, lo que hace que los precios sean idénticos a los que pagaría directamente a OpenAI. Esta transparencia permite a los usuarios presupuestar con precisión sin costos sorpresa.
Los tokens de salida son cuatro veces más caros por token que los tokens de entrada ($0.60 frente a $0.15 por millón). Para tareas que generan respuestas largas, como resúmenes detallados o generación de código, los costos de salida pueden predominar. Los usuarios pueden controlar el uso de tokens de salida mediante el parámetro max_tokens y elaborando indicaciones que inciten respuestas concisas. Por el contrario, las tareas con entradas grandes (por ejemplo, procesar documentos largos con muchas imágenes) incurren en costos de entrada. La amplia ventana de contexto de 128k facilita incluir un contexto sustancial, pero eso tiene un costo a la tarifa por token de entrada. Optimizar el equilibrio entre la longitud de entrada y salida es clave para gestionar el costo total.
Actualmente, OrcaRouter no ofrece almacenamiento en caché integrado para solicitudes de GPT-4o-mini más allá de lo que OpenAI proporciona a nivel de API. No hay descuentos por volumen ni opciones de capacidad reservada disponibles a través de OrcaRouter; el precio es estrictamente de pago por uso a la tarifa del proveedor OpenAI. Los usuarios son responsables de implementar sus propias estrategias de almacenamiento en caché (p. ej., a nivel de aplicación) para reducir las llamadas API duplicadas. La política de margen cero implica que cualquier cambio futuro de precios por parte de OpenAI se refleja automáticamente. Para casos de uso de volumen extremadamente alto, los acuerdos empresariales directos con OpenAI podrían ofrecer mejores condiciones, pero a través de OrcaRouter, la simplicidad de una sola clave API y una facturación unificada puede seguir siendo ventajosa.
Las imágenes procesadas por GPT-4o-mini se convierten en tokens según su resolución y nivel de detalle. OpenAI utiliza un algoritmo de cálculo de tokens que considera tanto el ancho como el alto; por ejemplo, una imagen típica de 1024x1024 con detalle alto puede costar entre 2.000 y 3.000 tokens de entrada. Dado que los tokens de entrada se facturan a $0.15 por millón, el costo por imagen es muy bajo (normalmente inferior a un centavo). Sin embargo, procesar muchas imágenes en una sola solicitud puede acumularse. Los usuarios pueden controlar los costos usando el nivel de detalle `low` (cuesta aproximadamente 85 tokens por imagen) cuando no se necesita alta fidelidad. Siempre revisa los tokens utilizados en la respuesta de la API para comprender los costos de las imágenes.
Establezca su URL base de API en https://api.orcarouter.ai/v1 y use el ID de modelo "openai/gpt-4o-mini-2024-07-18". La API sigue el formato estándar de completaciones de chat de OpenAI. Por ejemplo, en Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Todos los parámetros como temperature, top_p, max_tokens, stream y stop sequences son compatibles como en la API original de OpenAI. Las respuestas incluyen campos estándar como id, choices, usage con recuentos de tokens.
Para resultados deterministas, establezca temperature=0 y top_p=1. Para tareas creativas, una temperatura alrededor de 0.8–1.2 puede ser apropiada. Max_tokens controla la longitud de la respuesta; el valor predeterminado es 16,384. Para reducir el costo de salida, ajuste max_tokens según sus necesidades. Al usar entradas multimodales, estructure los mensajes con un arreglo de partes de contenido: [{"type":"text","text":"Describe esto:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Para el procesamiento de archivos, incluya el contenido del archivo como texto o base64. El parámetro stop se puede usar para detener la generación en secuencias personalizadas. Stream=True permite la entrega de tokens en tiempo real.
La migración requiere tres cambios simples: establece la base_url en https://api.orcarouter.ai/v1, reemplaza tu clave API con tu clave API de OrcaRouter, y cambia el ID del modelo a "openai/gpt-4o-mini-2024-07-18". No deberían ser necesarias otras modificaciones de código si estás usando las bibliotecas de OpenAI para Python/Node.js o cualquier cliente HTTP que siga el formato estándar de completado de chat. La estructura de la respuesta es idéntica. Ten en cuenta que OrcaRouter no limita tus solicitudes de manera diferente a OpenAI; se aplican los mismos límites de velocidad según el nivel de tu cuenta de OpenAI, pero gestionas las claves a través de OrcaRouter. Prueba con una solicitud pequeña para verificar los conteos de tokens y la latencia.
Proporcione su clave de API de OrcaRouter en el encabezado de Autorización: Authorization: Bearer <su-clave>. La API devuelve códigos de estado HTTP estándar: 200 para éxito, 400 para solicitud incorrecta (p. ej., parámetros no válidos), 401 para no autorizado (clave API incorrecta), 429 para límite de velocidad y 500 para errores del servidor. Las respuestas de error incluyen un cuerpo JSON con un objeto de error que contiene un mensaje y un tipo. Se recomienda implementar reintentos con retroceso exponencial para errores 429 y 5xx. OrcaRouter no modifica las respuestas de error de OpenAI, por lo que aparecerán los mismos mensajes de error que ve con la API directa.
GPT-4o-mini es significativamente más capaz que GPT-3.5-Turbo en razonamiento, matemáticas y seguimiento de instrucciones, como lo demuestra su puntuación en MATH-500 de 78.9 frente a la puntuación típica de GPT-3.5-Turbo de alrededor de 30-40. También admite entradas multimodales (imágenes y archivos), lo que GPT-3.5-Turbo no hace. La ventana de contexto es más grande: 128k frente a 16k. Precios: GPT-4o-mini ($0.15/$0.60 por millón de tokens) es ligeramente más caro que GPT-3.5-Turbo ($0.50/$1.50 para la versión de 16k? En realidad, GPT-3.5-Turbo 0125 es $0.50/$1.50 por millón? Espera, el GPT-3.5-Turbo estándar es $1.50/$2.00 por millón? Me ceñiré a los hechos proporcionados: el precio de GPT-4o-mini está dado. Comparar cualitativamente: GPT-4o-mini ofrece mejor rendimiento a un costo ligeramente superior que GPT-3.5-Turbo, pero con capacidad multimodal.
GPT-4o-mini es una versión más pequeña y rentable de GPT-4o. Si bien ambas comparten capacidades multimodales y el mismo tamaño de ventana de contexto (128k tokens), GPT-4o obtiene puntuaciones más altas en benchmarks como MMLU y MATH. La puntuación MATH-500 de GPT-4o-mini de 78.9 es inferior a la puntuación reportada de GPT-4o de aproximadamente 90–95. El precio es significativamente más barato: GPT-4o-mini ($0.15/$0.60) vs GPT-4o ($2.50/$10.00 por millón de tokens). Para aplicaciones donde la máxima precisión en tareas de razonamiento complejo es crítica, GPT-4o es preferible. Para alto rendimiento y tareas sensibles al costo donde una precisión moderada es aceptable, GPT-4o-mini ofrece ahorros sustanciales.
Los modelos de código abierto como Llama 3 8B y 70B ofrecen la ventaja de autoalojamiento con costo cero por token, pero requieren infraestructura y experiencia. GPT-4o-mini a través de OrcaRouter proporciona acceso sin servidor sin costos iniciales y escalado automático. En los puntos de referencia, la puntuación MATH-500 de GPT-4o-mini de 78.9 es competitiva con Llama 3 8B (alrededor de 30-40) y más cercana a Llama 3 70B (alrededor de 60-70). GPT-4o-mini también admite imágenes de forma nativa, lo que la mayoría de los modelos de código abierto no hacen. La compensación: los modelos de código abierto ofrecen privacidad de datos (sin llamada externa a la API) y menor latencia si hay hardware de inferencia disponible. GPT-4o-mini ofrece facilidad de uso y capacidad multimodal a un bajo precio por token.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $0.150 |
| Salida / 1M tokens | $0.600 |
| Lectura caché / 1M | $0.075 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Abrir @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18