
GPT-6.1 Sol vs DeepSeek V4 Pro: Tres medidores, tres respuestas diferentes
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pregunta qué tan separados están GPT-6.1 Sol y DeepSeek V4 Pro, y la respuesta honesta es que depende de qué medidor leas, y los tres medidores discrepan entre sí más de lo que la mayoría de las comparaciones de modelos discrepan en todo. En precio por millón de tokens, con una ponderación de 3:1 entre entrada y salida, son $4,00 frente a $0,99 — un factor de cuatro. En lo que realmente costó ejecutar la misma batería de evaluaciones, son $0,72 frente a $0,67 por tarea — siete por ciento. En el Artificial Analysis Intelligence Index son 51,8 frente a 36 — dieciséis puntos, lo que suena decisivo hasta que miras contra quién se comparó cada número, porque la propia metodología de ese evaluador sitúa a los dos modelos en ligas distintas. GPT-6.1 Sol se lanzó el 29 de septiembre de 2026 a $2,00 de entrada y $10,00 de salida con una ventana de 1.050.000 tokens. DeepSeek V4 Pro es un modelo insignia de mezcla de expertos con licencia MIT, 1,6 billones de parámetros con 49 mil millones activos, lanzado el 13 de agosto de 2026 a $0,66 y $1,98 con una ventana de 1.048.576 tokens. Uno es un modelo de texto que puedes descargar. El otro ve imágenes. Determinar por cuál de los tres medidores deberías guiarte en realidad es todo el trabajo.
La fila de índice no es la comparación que parece ser.
Empieza por el número que más se cita, porque es el que más a menudo se cita mal.
Artificial Analysis publica su metodología junto con su tabla de clasificación, y dos frases de ella importan aquí. Los modelos de pesos abiertos, dice, se comparan solo con otros modelos de pesos abiertos de la misma clase de tamaño —diminuta, pequeña, mediana, grande, con el límite en 150 mil millones de parámetros—. Los modelos propietarios se comparan, en cambio, dentro de una banda de precios, con una proporción combinada de 3:1 entre entrada y salida. Esos son dos grupos de comparación diferentes. DeepSeek V4 Pro 0813 es de pesos abiertos —las propias preguntas frecuentes del evaluador lo dicen, y remiten a los pesos publicados— y, con 1,6 billones de parámetros totales, cae en la clase grande de pesos abiertos. GPT-6.1 Sol es propietario y se puntúa frente a modelos de su propia banda de precios.
Un 51,8 y un 36 situados en filas adyacentes de la misma tabla, por lo tanto, no son un cara a cara. Son una puntuación frente a un conjunto de pares y una puntuación frente a otro, que es precisamente por lo que las cifras de coste por tarea son comparables y los números brutos del índice no lo son. Si quieres saber si DeepSeek V4 Pro es bueno para un modelo descargable, 36 es el número que responde a eso. Si quieres saber cómo se comporta frente a un modelo de frontera alojado, la columna del índice no te lo dirá, y este es un caso en el que lo honesto es decirlo en lugar de restar 36 a 51,8 y llamarlo una brecha.
Qué se puede comparar de manera limpia: las tarjetas de precios, los límites de contexto y de salida, las listas de modalidades, y el costo de ejecutar la misma suite de evaluación — porque esa última cifra es una contabilización de trabajo idéntico, no una puntuación.
Lo que dicen los medidores en bruto

• Precio de entrada — GPT-6.1 Sol $2.00 vs DeepSeek V4 Pro $0.66 por millón de tokens
• Precio de salida — GPT-6.1 Sol $10.00 vs. DeepSeek V4 Pro $1.98, pasando a $1.32 y $3.96 dentro de dos ventanas UTC de cuatro horas en días laborables
• Lectura de caché — GPT-6.1 Sol $0.10 vs DeepSeek V4 Pro $0.022 por millón de tokens; ambos usan caché, y el lado barato vuelve a ser 4,5× más barato
• Coste por tarea de indexación — GPT-6.1 Sol $0.72 frente a DeepSeek V4 Pro $0.67
• Tokens de salida emitidos en la suite de índices — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Salida máxima — DeepSeek V4 Pro 384,000 tokens vs GPT-6.1 Sol 128,000 tokens
• Modalidades — GPT-6.1 Sol acepta texto, imágenes y archivos; DeepSeek V4 Pro solo acepta texto
La cuarta y la quinta líneas son el par interesante. DeepSeek V4 Pro emite 2,4 veces más tokens en la misma suite y aun así termina siendo un 7 % más barato por tarea, porque su tarifa de salida es una quinta parte de la de GPT-6.1 Sol. Así se ve un modelo impulsado por el precio cuando se mide la salida en lugar de la tarifa: la verbosidad es real, y no elimina la ventaja. La ventana temporal es el asterisco. Dos bloques de cuatro horas entre semana —40 de las 168 horas de una semana— duplican la tarifa listada a $1,32 y $3,96, y ese recargo se aplica a los mismos tokens que, de otro modo, serían los más baratos en cualquiera de las dos tarjetas.
Lo que no hace el modelo más barato
Tres cosas, y cada una es un límite estricto en lugar de una compensación.
No ve. DeepSeek V4 Pro es texto de entrada, texto de salida. Nada de capturas de pantalla, ni PDF escaneados, ni lectura de gráficos, ni diagramas en un ticket. Los flujos de trabajo con uso intensivo de computadora y documentos —las cargas de trabajo exactas para las que está posicionado GPT-6.1 Sol— quedan descartados a cualquier precio. Si tu pipeline ya enruta las imágenes a un modelo de visión, esto no es un problema; si no lo hace, es la restricción decisiva.
No tiene una cadencia de lanzamientos con la que puedas planificar. El nombre "deepseek-v4-pro" se ha resuelto a la compilación 0813 desde agosto, y llegar hasta ahí no fue silencioso: el proveedor anunció la retirada de la compilación para el 14 de septiembre, retiró el anuncio dos días antes de la fecha y siguió sirviendo la API con la facturación sin cambios. Nuestro propio catálogo todavía lo lista como el buque insignia con el mismo contexto, techo de salida y límite de concurrencia. Un proveedor que puede retirar una deprecación en dos días también puede decidir no hacerlo; la conclusión operativa no es que el modelo sea inestable, sino que el nombre es un puntero, y fijar el comportamiento a un identificador de compilación en lugar de a un nombre de ruta es el seguro barato.
No conlleva el conocimiento que lo rodea. GPT-6.1 Sol tiene ocho días y ya cuenta con una configuración independiente publicada; DeepSeek V4 Pro tiene un historial de evaluación más largo y una base de profesionales mucho más amplia, incluido un stack de servicio publicado y trabajo de throughput de terceros. Para un despliegue autoalojado, ese conjunto de material vale más que la fila del índice, porque es lo que consultas cuando el modelo se comporta de forma extraña en tu hardware en lugar de en un benchmark.
Cuando el medidor cuatro veces más barato es el medidor equivocado
Si el modelo barato fuera simplemente peor en todo, este sería un artículo corto. El hecho incómodo es que los dos están a un 7 % de distancia por tarea en trabajo idéntico, y a un 2,4× de distancia en cuánto escriben para llegar ahí. Eso significa que el medidor de tokens combinados —el que dice 4×— está midiendo una diferencia que en su mayoría no pagas, porque le pone precio a una mezcla de tokens que quizá nunca envíes. Y el medidor de índice, el que dice 16 puntos, mide entre dos grupos de pares y no se puede restar.
Así que la división práctica no es «modelo de frontera para el trabajo difícil, modelo barato para el trabajo fácil». Es una división por modalidad y una división por volumen. Todo lo que incluya una imagen va a GPT-6.1 Sol, y también todo aquello en lo que la respuesta sea corta y el razonamiento sea la parte cara: sus cinco niveles de esfuerzo, de bajo a máximo con medio como predeterminado, permiten comprar razonamiento sin comprar prosa, y su entrada en caché a $0.10 hace que un prompt largo y repetido sea barato. Todo lo que sea solo texto, de gran volumen y tolerante con una respuesta más larga —clasificación, extracción, resumen, generación masiva con un presupuesto de salida de 384,000 tokens— va a DeepSeek V4 Pro, idealmente fuera de las dos ventanas UTC.
Ambos en una misma tecla, y la división es una línea de configuración.
Ambos modelos están en OrcaRouter a las tarifas publicadas por sus propios proveedores, sin añadir nada: GPT-6.1 Sol a $2.00 / $10.00, subiendo a $4.00 / $15.00 por encima de 272.000 tokens de prompt, y DeepSeek V4 Pro a $0.66 / $1.98, con las dos ventanas temporales mantenidas tal como se indican. Una clave, una factura, un endpoint compatible con OpenAI para ambos.
Esa es la razón por la que la división anterior vale la pena anotarla en lugar de discutir sobre ella. Una división por modalidad puede expresarse como una regla de enrutamiento, de modo que las solicitudes con imágenes van al modelo de visión y el grueso del texto va al barato sin cambiar la aplicación; si una ruta se degrada, la conmutación por error mueve la llamada en lugar de hacerla fallar. Y como ambos están en el mismo endpoint, la comparación de precios que realmente importa —la tuya, con tu tráfico, con tu mezcla de tokens— puede generarse a partir de tus propias facturas en lugar del promedio de una suite de benchmarks.


El veredicto, en una línea, es que la lectura de cuatro veces más barata es de la que hay que desconfiar y la lectura del siete por ciento es la que hay que comprobar. Cuatro veces es lo que dice el medidor combinado sobre una mezcla de tokens que puede que no envíes. El siete por ciento es lo que costó la misma evaluación en ambos, y viene con una diferencia de verbosidad de 2,4× incorporada. Los dieciséis puntos son reales, también abarcan dos grupos de pares, y la restricción que en realidad decide la mayoría de los despliegues de este par no es un número en absoluto: uno de estos modelos puede leer una captura de pantalla y el otro no.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
