GPT-4o ("o" por "omni") es el último modelo de inteligencia artificial de OpenAI, que admite entradas tanto de texto como de imágenes con salidas de texto. Mantiene el nivel de inteligencia de [GPT-4 Turbo](/models/openai/gpt-4-turbo) mientras es dos veces más...
GPT-4o (2024-05-13) es un modelo de lenguaje multimodal de OpenAI, accesible a través de la API de OrcaRouter. Procesa texto, imágenes y archivos, lo que lo hace adecuado para tareas que combinan…
GPT-4o puede analizar imágenes proporcionadas como parte de la entrada. Puede describir contenido visual, responder preguntas sobre objetos, texto dentro de imágenes y relaciones espaciales. También puede extraer y transcribir texto de documentos escaneados o fotografías. Debido a que procesa imágenes directamente, no necesita un modelo OCR o de visión por separado. La imagen se tokeniza para ajustarse dentro de la ventana de contexto. Por ejemplo, un usuario podría cargar una captura de pantalla de un gráfico y pedirle al modelo que interprete las tendencias. La comprensión del modelo no se limita a subtítulos simples; puede razonar sobre el contenido, comparar múltiples imágenes y usar señales visuales junto con instrucciones textuales. Esta capacidad está integrada en la misma llamada API, utilizando el mismo formato de mensaje que las solicitudes solo de texto. En OrcaRouter, envía imágenes como datos codificados en base64 o URL en el array de contenido. El ID del modelo sigue siendo "openai/gpt-4o-2024-05-13".
GPT-4o acepta archivos como entrada. Los formatos compatibles incluyen PDF, documentos de Microsoft Office (Word, Excel, PowerPoint), archivos de texto y formatos de imagen. Para PDFs y archivos de Office, el modelo extrae contenido textual y analiza el diseño. No renderiza directamente formatos complejos, sino que lee el contenido de texto. Esto es útil para procesar informes, contratos, hojas de cálculo o presentaciones sin extracción manual. El contenido del archivo se tokeniza y cuenta para el total de tokens de entrada. El modelo puede responder preguntas sobre el contenido del archivo, resumirlo o realizar cálculos sobre datos tabulares. Al usar archivos, los incluyes como parte del contenido del mensaje utilizando los campos apropiados de la API de OpenAI. OrcaRouter maneja la transmisión sin modificaciones. Ten en cuenta que las capacidades del modelo dependen de la calidad del texto extraído; las imágenes muy escaneadas en PDFs pueden no ser totalmente legibles a menos que contengan capas de texto incrustadas.
GPT-4o es un modelo premium con un costo mayor que alternativas como GPT-4o-mini o variantes anteriores de GPT-3.5. Si tu tarea no requiere las capacidades multimodales (por ejemplo, tareas solo de texto), un contexto grande (hasta 128K) o el nivel de razonamiento matemático medido por MATH-500 (79.1), un modelo más barato puede ser más económico. Por ejemplo, la clasificación simple, la generación de contenido breve o el chat básico pueden ser manejados por modelos de menor costo que aún producen una calidad aceptable. Además, si tu aplicación es sensible a la latencia y el modelo más pequeño es más rápido, la compensación puede favorecer la velocidad sobre la precisión absoluta. Finalmente, si rara vez necesitas procesar imágenes o archivos, la capacidad multimodal adicional es innecesaria. OrcaRouter ofrece una gama de modelos para que puedas seleccionar la mejor relación precio-rendimiento. Evalúa los requisitos de tu caso de uso frente a las puntuaciones de referencia y los precios para determinar si las ventajas de GPT-4o justifican el costo adicional.
GPT-4o puede generar hasta 16,384 tokens por solicitud. Este es un límite generoso que permite respuestas extensas, código detallado o análisis de varios párrafos. Sin embargo, los tokens de salida se facturan a $15.00 por millón, lo que hace que las respuestas más largas sean más costosas. Puedes controlar la longitud de la salida usando el parámetro max_tokens en la llamada a la API. Si anticipas que necesitarás generaciones muy largas, considera dividir o fragmentar la solicitud. El límite de 16,384 aplica a la finalización completa, incluidos los pasos de razonamiento o la cadena de pensamiento si se solicitan. Para tareas muy complejas que requieren pensamiento extendido, es posible que necesites realizar múltiples llamadas. En OrcaRouter, el recuento de tokens de salida se reporta en el campo usage de la respuesta de la API, para que puedas hacer un seguimiento preciso de los costos. No hay ningún límite adicional impuesto por OrcaRouter; se aplica el límite nativo del modelo.
GPT-4o obtuvo 79.1 en el punto de referencia MATH-500. MATH-500 consta de 500 problemas matemáticos desafiantes en varios temas como álgebra, geometría, teoría de números y probabilidad. Una puntuación de 79.1 significa que el modelo respondió correctamente el 79.1% de los problemas. Este es un resultado sólido que indica una capacidad de razonamiento matemático robusta, especialmente para un modelo multimodal. El punto de referencia evalúa tanto la resolución de problemas como el razonamiento paso a paso. Esta puntuación puede orientar las expectativas para aplicaciones que involucren tutoría matemática, computación científica o acertijos lógicos. Tenga en cuenta que el rendimiento en el punto de referencia no garantiza resultados idénticos en tareas del mundo real; pueden ser necesarios ajustes específicos del dominio o ingeniería de indicaciones. Al considerar este modelo, compare su puntuación MATH-500 con la de otros modelos que evalúe. OrcaRouter no proporciona datos adicionales de referencia, por lo que este es el único punto de referencia proporcionado para este modelo.
La latencia depende de varios factores: la longitud de la entrada, la longitud de la salida esperada, la carga actual en los servidores de OpenAI y la ruta de red entre su aplicación y OrcaRouter. OrcaRouter no agrega una sobrecarga significativa más allá del tiempo de respuesta del proveedor subyacente. Para solicitudes típicas con entrada moderada (unos pocos miles de tokens) y salidas cortas (menos de 1,000 tokens), las respuestas suelen llegar en unos pocos segundos. Las salidas más largas (cerca de 16,384 tokens) naturalmente tomarán más tiempo porque el modelo genera tokens secuencialmente. Las entradas de imagen también aumentan la latencia debido a la tokenización y el procesamiento. Puede optimizar la latencia reduciendo la longitud de la salida, usando indicaciones más cortas o agrupando solicitudes. OrcaRouter proporciona endpoints API estándar que devuelven resultados de forma asíncrona mediante streaming si se desea. Para aplicaciones interactivas en tiempo real, considere usar el modo de streaming (stream: true) para comenzar a procesar tan pronto como lleguen los tokens. No se proporcionan números de latencia específicos en los datos del modelo, por lo que estas son estimaciones cualitativas.
Fortalezas: Entrada multimodal (texto, imagen, archivo), gran ventana de contexto de 128K, sólido razonamiento matemático (MATH-500: 79.1) y alto límite de tokens de salida (16,384). Maneja documentos largos y conversaciones de múltiples turnos de manera efectiva. La API es compatible con OpenAI estándar, facilitando la integración. Limitaciones: Mayor costo en comparación con modelos más pequeños. No está optimizado para tareas que no se benefician de la multimodalidad o el gran contexto. No se proporciona información sobre el rendimiento en idiomas distintos al inglés ni sobre evaluaciones de seguridad específicas. La comprensión de imágenes puede ser limitada para escenas muy complejas o imágenes de baja resolución. Además, el modelo puede producir respuestas incorrectas en problemas fuera de su distribución de entrenamiento. No hay una garantía de latencia revelada. Para usuarios que requieren latencia extremadamente baja o costo extremadamente bajo, otro modelo puede ser mejor. La puntuación de referencia de 79.1 en MATH-500 indica margen de mejora en los problemas matemáticos más difíciles. Evalúe si estas compensaciones se alinean con los requisitos de su aplicación.
GPT-4o se factura por token, con tarifas separadas para tokens de entrada y salida. Los tokens de entrada cuestan $5.00 por 1 millón de tokens. Los tokens de salida cuestan $15.00 por 1 millón de tokens. Estas son las tarifas del proveedor, transferidas por OrcaRouter sin margen de beneficio. El costo por solicitud = (tokens de entrada/1e6 * 5) + (tokens de salida/1e6 * 15). Por ejemplo, una conversación con 4000 tokens de entrada y 200 tokens de salida costaría (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. No hay tarifas adicionales por las llamadas API; solo pagas por los tokens consumidos. El precio se actualiza dinámicamente según los cambios del proveedor; OrcaRouter transmite cualquier ajuste futuro. Como no hay margen, los usuarios se benefician de las mismas tarifas que los clientes directos de OpenAI, pero con la conveniencia de la gestión y facturación unificadas de OrcaRouter. Ten en cuenta que las imágenes y archivos se tokenizan y contribuyen al conteo de tokens de entrada, lo que a menudo aumenta el costo en comparación con entradas solo de texto.
No. OrcaRouter no ofrece descuentos, tokens almacenados en caché ni precios reducidos para entradas repetidas. Cada token se factura a la tarifa estándar del proveedor. No hay ningún costo separado de almacenamiento en caché ni recargo por alto volumen. Las tarifas de $5/$15 por millón de tokens son fijas. Los usuarios que requieran un rendimiento muy alto pueden consultar acuerdos personalizados, pero el servicio estándar no incluye descuentos por volumen. Además, no hay cargos ocultos como tarifas de conexión o mínimos mensuales. El precio es transparente y está directamente vinculado al uso de tokens. Para optimizar costos, considere reducir el tamaño de la entrada (por ejemplo, recortando el historial, usando indicaciones más cortas) y la longitud de la salida (por ejemplo, estableciendo un valor max_tokens más bajo). Además, usar el modelo solo cuando sus capacidades sean necesarias (multimodal, contexto grande) ayuda a controlar los costos. Si su aplicación tiene indicaciones repetitivas que son idénticas cada vez, el almacenamiento en caché a nivel de aplicación puede reducir el uso de tokens, pero OrcaRouter mismo no ofrece tal función.
GPT-4o tiene un precio premium. Para muchas tareas, un modelo más económico (por ejemplo, GPT-4o-mini o GPT-3.5-turbo) puede ser suficiente. Evalúe la compensación considerando la complejidad y la precisión requerida. Si su tarea implica extracción o clasificación simple con contexto limitado, un modelo más barato puede rendir de manera similar a una fracción del costo. Por el contrario, si la tarea requiere una comprensión matizada de imágenes, documentos largos o alta precisión matemática (puntuación MATH-500 de 79.1 frente a puntuaciones más bajas en modelos más baratos), GPT-4o puede valer la prima. Realice pruebas A/B en una muestra representativa para comparar calidad y costo. También considere que el mismo precio por millón de tokens se aplica independientemente de la longitud del texto; las solicitudes más cortas son más baratas. Si su flujo de trabajo utiliza con frecuencia el contexto completo de 128K, el costo de tokens de entrada para esa solicitud puede ser alto; asegúrese de que el contexto sea realmente necesario. OrcaRouter proporciona métricas de uso para que pueda monitorear y optimizar.
Para llamar a GPT-4o en OrcaRouter, use el endpoint de API compatible con OpenAI: base_url = "https://api.orcarouter.ai/v1". Establezca el parámetro model en "openai/gpt-4o-2024-05-13". Necesitará una clave de API de OrcaRouter. El formato de solicitud sigue la API estándar de OpenAI Chat Completions: un array messages con roles (system, user, assistant), contenido opcional para imágenes y archivos, y parámetros como temperature, max_tokens, top_p, frequency_penalty, presence_penalty y stop. Por ejemplo, una solicitud de texto simple se envía como POST a /chat/completions. Para imágenes, incluya el contenido como parte del mensaje del usuario con el tipo "image_url". Para archivos, inclúyalos también como parte del contenido (el formato específico sigue la especificación de OpenAI). La respuesta incluirá el mensaje del asistente, estadísticas de uso (prompt_tokens, completion_tokens, total_tokens) y otros metadatos. No se requieren encabezados especiales más allá de los estándar Content-Type y Authorization. La integración es idéntica al uso directo de OpenAI.
Todos los parámetros estándar de OpenAI Chat Completions son compatibles: messages (obligatorio), model (obligatorio, configurado en "openai/gpt-4o-2024-05-13"), temperature (0–2, valor predeterminado 1), top_p (0–1, valor predeterminado 1), n (número de finalizaciones, valor predeterminado 1), stop (cadenas o lista de cadenas), max_tokens (valor predeterminado 16,384, límite máximo de 16,384), presence_penalty (−2 a 2, valor predeterminado 0), frequency_penalty (−2 a 2, valor predeterminado 0), logit_bias (mapa de IDs de tokens a valor de sesgo), user (cadena para monitoreo de abuso), stream (booleano, valor predeterminado false) y functions/tools (para llamadas a funciones). Para entradas multimodales, el contenido de messages puede ser un arreglo de partes de contenido con tipo "text" o "image_url". Adicionalmente, puede incluir contenido de tipo "file" según la documentación de OpenAI (por ejemplo, para archivos PDF adjuntos). OrcaRouter pasa estos parámetros directamente al proveedor sin modificación. Asegúrese de no exceder la ventana de contexto de 128K tokens. La API devuelve códigos de error estándar para solicitudes inválidas, limitación de velocidad o fallos de autenticación.
La migración es sencilla porque la API de OrcaRouter es totalmente compatible con OpenAI. Solo necesitas cambiar dos cosas: la URL base de https://api.openai.com/v1 a https://api.orcarouter.ai/v1, y el ID del modelo de "gpt-4o-2024-05-13" a "openai/gpt-4o-2024-05-13". Tu clave API de OrcaRouter reemplaza tu clave de OpenAI. Todo el código existente que utilice la biblioteca Python/Node de OpenAI o solicitudes HTTP sin formato funcionará sin otras modificaciones. El formato del mensaje, los nombres de los parámetros y la estructura de la respuesta son idénticos. Para las bibliotecas que aceptan un parámetro de URL base, simplemente configúralo al endpoint de OrcaRouter. Si estabas usando el cliente de OpenAI, puedes instanciarlo con base_url configurado al endpoint de OrcaRouter. No se requieren cambios en la ingeniería de prompts ni en la lógica de almacenamiento en caché. OrcaRouter también admite streaming (stream: true) y llamadas a funciones exactamente como antes. Las pruebas se pueden realizar con un pequeño conjunto de solicitudes para verificar que el comportamiento coincida.
OrcaRouter no modifica el comportamiento del modelo. Actúa únicamente como una puerta de enlace, reenviando tus solicitudes a los servidores de OpenAI y devolviendo la respuesta tal cual. OrcaRouter no aplica ningún preprocesamiento, posprocesamiento ni filtrado de contenido adicional. En cuanto al manejo de datos: OrcaRouter no almacena ni registra datos de los mensajes o de las respuestas más allá de lo necesario para la facturación y la monitorización operativa. Las políticas de datos propias de OpenAI se aplican al uso del modelo a través de OrcaRouter. Según los hechos proporcionados, no se menciona retención de datos por parte de OrcaRouter más allá del registro estándar de API. Los usuarios deben revisar tanto la política de privacidad de OrcaRouter como la política de OpenAI para entender el manejo de datos. Si tienes requisitos estrictos de residencia de datos, consulta con OrcaRouter sobre las opciones disponibles. No hay indicios de que OrcaRouter comparta datos con otros clientes. El ID del modelo es la única modificación necesaria; no se inyectan instrucciones personalizadas.
Las diferencias principales entre GPT-4o y GPT-4o-mini son el tamaño de la ventana de contexto, las capacidades multimodales, el rendimiento en benchmarks y el costo. GPT-4o ofrece una ventana de contexto de 128K y admite entradas de imágenes y archivos. GPT-4o-mini (basado en las ofertas de OpenAI) típicamente tiene un contexto más pequeño (por ejemplo, 128K o 16K en algunas versiones) y puede no admitir todas las modalidades. En MATH-500, GPT-4o obtiene 79.1; GPT-4o-mini obtendría una puntuación más baja. Precios: GPT-4o cuesta $5/$15 por millón de tokens, mientras que GPT-4o-mini es significativamente más barato (por ejemplo, $0.15/$0.60 por millón de tokens en algunas versiones). Por lo tanto, GPT-4o-mini es adecuado para tareas más simples donde el costo más bajo es primordial, mientras que GPT-4o es mejor para razonamiento complejo, contexto largo y tareas multimodales. Al elegir entre ellos, considere los requisitos de precisión y la necesidad de visión o manejo de archivos. OrcaRouter ofrece ambos modelos bajo IDs distintos. Si su carga de trabajo rara vez usa imágenes o contexto grande, GPT-4o-mini puede ser la elección económicamente superior.
GPT-4o (2024-05-13) es un modelo multimodal con una ventana de contexto de 128K, mientras que las versiones anteriores de GPT-4 (como gpt-4-0613) suelen tener un contexto de 8K o 32K y son solo de texto (algunas versiones posteriores admiten imágenes a través de endpoints de visión separados). El precio de GPT-4o ($5/$15 por millón de tokens) es generalmente más bajo que el precio de GPT-4 Turbo en su punto máximo (por ejemplo, $10/$30 por millón de tokens). Rendimiento en benchmarks: la puntuación proporcionada de MATH-500 de 79.1 es para GPT-4o; GPT-4 no tenía una puntuación oficial de MATH-500 en los datos proporcionados, pero se sabía que obtenía puntuaciones más bajas en benchmarks de matemáticas similares. GPT-4o también ofrece un límite de salida más alto (16K tokens) en comparación con GPT-4 anterior (4K u 8K según la versión). En general, GPT-4o ofrece un mejor valor para aplicaciones multimodales y de contexto largo. Sin embargo, los modelos GPT-4 anteriores pueden haber sido ajustados para tareas específicas; evalúe con sus propios datos. A través de OrcaRouter, se puede acceder a ambas familias de modelos.
Una comparación directa requiere datos específicos del modelo que no se proporcionan aquí. En general, ambos modelos son competitivos en razonamiento y capacidades multimodales. GPT-4o tiene una ventana de contexto de 128K, similar al contexto de 200K de Claude (para Sonnet). Ambos admiten imágenes. Las puntuaciones de referencia varían: GPT-4o proporciona una puntuación MATH-500 de 79.1; las puntuaciones de Claude 3.5 Sonnet en ese benchmark no se proporcionan. Precios: GPT-4o cuesta $5/$15 por millón de tokens; el precio de Claude Sonnet suele rondar los $3/$15 por millón de tokens (sujeto a cambios). Por lo tanto, los costos de entrada para GPT-4o son más altos. Las diferencias de rendimiento dependen de la tarea: algunos usuarios consideran a Claude superior para escritura extensa, mientras que GPT-4o sobresale en matemáticas y codificación. Sin una evaluación controlada, se recomienda probar ambos en muestras representativas. OrcaRouter ofrece ambos modelos, por lo que puede compararlos fácilmente cambiando el ID del modelo. En última instancia, el mejor modelo depende de sus requisitos específicos de precisión, latencia y costo. Los datos proporcionados no incluyen las puntuaciones de Claude, por lo que esta comparación sigue siendo cualitativa.
Llama 3 (por ejemplo, Llama 3 70B) es un modelo de código abierto que puede alojarse de forma local, mientras que GPT-4o es propietario y se accede a través de una API. GPT-4o admite entradas multimodales (texto, imagen, archivo) con un contexto de 128K, mientras que Llama 3 suele ser solo de texto (a menos que se ajuste para visión) y tiene un contexto más pequeño (por ejemplo, 8K o 32K). Puntuaciones de referencia: la puntuación de GPT-4o en MATH-500 es 79.1; Llama 3 70B obtiene alrededor de 70–75 en puntos de referencia matemáticos similares (no proporcionado en hechos, sino conocimiento general). Costo: el costo por token de la API de GPT-4o es fijo; alojar localmente Llama 3 implica costos de infraestructura (GPU, electricidad) que pueden ser menores en volúmenes altos. Latencia: GPT-4o basado en API puede ser más rápido para cargas de trabajo ráfaga; los modelos autoalojados pueden ofrecer latencia constante si se reserva capacidad. Flexibilidad: Llama 3 se puede ajustar; GPT-4o no. Para los usuarios que desean evitar la dependencia de un proveedor o manejar datos sensibles completamente en las instalaciones, los modelos de código abierto son atractivos. OrcaRouter proporciona acceso a ambos tipos: puede usar GPT-4o a través de la API y también acceder a modelos de código abierto a través de OrcaRouter si están disponibles.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrada / 1M tokens | $5.00 |
|---|---|
| Salida / 1M tokens | $15.00 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/openai/gpt-4o-2024-05-13Abrir @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13