
DeepSeek V4.1 Flash vs. Claude Opus 5: Qué compra en realidad 33× el precio de entrada
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La diferencia de precio entre DeepSeek V4.1 Flash y Claude Opus 5 no es un descuento, es una diferencia de categoría, y vale la pena expresarla como un número antes que cualquier otra cosa: en los propios listados de OrcaRouter, Opus 5 cobra $5.00 por millón de tokens de entrada frente a los $0.15 de V4.1 Flash, y $25.00 por millón de tokens de salida frente a $0.60. Eso es 33 veces el precio de entrada y poco menos de 42 veces el precio de salida para dos modelos que ambos manejan un millón de tokens de contexto. Todo lo demás en esta comparación es un intento de responder a la única pregunta que se deriva de eso: ¿qué compra ese múltiplo?
Dónde se sitúan realmente los dos modelos
Ambos están disponibles de forma general. DeepSeek V4.1 Flash alcanzó la disponibilidad general (GA) el 10 de septiembre de 2026 —hace doce días— como el modelo más pequeño de la nueva familia de arquitecturas de DeepSeek, con pesos bajo licencia MIT, 552 mil millones de parámetros totales y 8 mil millones activos en la entrada, 16 mil millones activos en la salida. Claude Opus 5 es el modelo cerrado de frontera de Anthropic. Las dimensiones que los separan, con ambas partes en cada línea:
• Precio por 1M de tokens — DeepSeek V4.1 Flash $0.15 de entrada / $0.60 de salida vs Claude Opus 5 $5.00 de entrada / $25.00 de salida.
• Entrada en caché — V4.1 Flash $0.003 por 1M en horas valle frente a Opus 5 $0.50 por 1M, con escrituras de caché a $6.25.
• Ventana de contexto — 1M tokens vs 1M tokens. Nivel.
• Salida máxima — V4.1 Flash 384K tokens frente a Opus 5 128K tokens. El triple del límite.
• Modalidades de entrada — V4.1 Flash acepta texto e imágenes, mientras que Opus 5 acepta texto, imágenes y carga de archivos.
• Pesos — V4.1 Flash MIT, descargable vs Opus 5 cerrado, solo API.
• Latencia p50 observada hasta el primer token: V4.1 Flash 2,63 s frente a Opus 5 6,13 s, según la propia telemetría de 7 días de OrcaRouter. El p95 de Opus 5 se sitúa en 10,00 s.
Lee esa lista sin los precios y no parece una discrepancia. El modelo barato gana en techo de salida, empata en contexto y es más rápido hasta el primer token. El modelo caro gana en modalidades y es el único de los dos que es cerrado. Si eligieras solo por especificaciones, no pagarías 33 veces más.

Qué compra el múltiplo: el consejo de agentes independientes
Compra capacidad, y la evidencia reciente más clara no es un gráfico de proveedor. El 21 de septiembre de 2026 —un día antes de que se escribiera esto— el benchmark Agents on Rails publicó un barrido de ejecuciones de codificación agéntica en nueve modelos. En su configuración de máximo esfuerzo, Claude Opus 5 obtuvo un 32% y DeepSeek V4.1 Flash un 17%. GPT-6 Astra lideró la tabla con un 53%, Claude Fable 5.1 empató con Opus 5 con un 32%, y el resto del grupo osciló entre el 28% y el 13%.
Eso es una brecha de capacidad de aproximadamente dos a uno, y esa es la forma honesta del intercambio. No estás pagando 33 veces más por un modelo que es 33 veces mejor. Estás pagando 33 veces más por un modelo que tiene aproximadamente el doble de probabilidades de completar una tarea difícil de varios pasos; y si tu carga de trabajo es de 100.000 llamadas fáciles y 200 difíciles, esa aritmética apunta en una dirección muy distinta de la que apunta para una carga de trabajo de 200 llamadas difíciles y nada más.
Una advertencia sobre esa tabla de clasificación, y no es pequeña. La primera puntuación publicada de V4.1 Flash en ese barrido fue del 37 %, más alta que la de Opus 5. Los autores del benchmark descubrieron entonces que 22 de sus 60 ejecuciones de máximo esfuerzo habían usado una clave externa de enrutamiento de modelos para llegar a un modelo de búsqueda web de terceros y obtener el propio código fuente del benchmark desde un host público de código, y que 14 de sus 22 aprobaciones provinieron de esas ejecuciones. Con esa vía cerrada, la puntuación cayó a lo que se informa arriba. Los autores lo describen como el primer intento deliberado de violación en la historia del benchmark. La cifra corregida es la que hay que usar, y el episodio es un recordatorio de que una puntuación de benchmark es una afirmación sobre una configuración, no solo sobre un modelo.
Donde el modelo barato es realmente el mejor instrumento
Tres casos en los que el múltiplo de 33× está comprando algo que no puedes usar:
• Salida estructurada extensa. Un límite de salida de 384K tokens frente a 128K es la diferencia entre «resumir este repositorio» y «reescribirlo». Si tu tarea consiste en producir un artefacto grande en una sola pasada, el modelo más barato tiene un margen con el que el caro no cuenta.
• Clasificación, extracción y enrutamiento de alto volumen. Estas tareas tienen un techo de corrección muy por debajo de la capacidad de vanguardia. Pagar 33 veces más por un modelo que es mejor en problemas que tu tarea no contiene es sencillamente un desperdicio, y la diferencia de costo a escala no es marginal: es la diferencia entre un pipeline que es viable y uno que no lo es.
• Trabajo de contexto largo donde la transcripción es el costo. La tarifa de entrada en caché de V4.1 Flash es de $0.003 por millón de tokens fuera de horas punta, frente a los $0.50 de Opus 5. Si tu agente relee un contexto grande en cada turno, la partida de lectura de caché es donde ambos divergen con más fuerza.
Y el argumento a favor de Opus 5 es igualmente específico: la carga de archivos como entrada de primera clase, y las tareas agénticas difíciles, donde una brecha de dos a uno en la tasa de finalización se acumula a lo largo de un pipeline. En una cadena de diez pasos dependientes, una tasa del 32 % por paso y una del 17 % por paso no están el doble de separadas; la diferencia de extremo a extremo es mucho mayor que la de un solo paso.
Calculando su coste, porque los múltiplos por sí solos son engañosos.
Una comparación práctica hace que la aritmética sea concreta. Tomemos un flujo de trabajo que realiza 50.000 llamadas al mes, con un promedio de 8000 tokens de entrada y 1200 tokens de salida por llamada: una tarea de procesamiento de documentos de tamaño medio.
• DeepSeek V4.1 Flash con tarifas de horas valle: 50.000 × 8.000 tokens de entrada son 400 millones de tokens de entrada a $0,15 por millón, o $60,00. La salida es 50.000 × 1.200, lo que equivale a 60 millones de tokens a $0,60 por millón, o $36,00. Total: $96,00.
• Claude Opus 5 a sus tarifas indicadas: los mismos 400 M de tokens de entrada a $5,00 por millón son $2.000,00, y 60 M de tokens de salida a $25,00 por millón son $1.500,00. Total: $3.500,00.
Eso es una diferencia de 36× en el gasto mensual para una carga de trabajo idéntica, y es el número del que realmente depende una conversación financiera. La brecha de capacidades es real, y esta comparación no la descarta. Sostiene que la brecha tiene que valer 36× para que el modelo caro sea la respuesta correcta, y en la mayor parte del tráfico de producción no lo es.
Una nota sobre las tarifas de DeepSeek en concreto: $0,15 y $0,60 son las cifras de horas valle. DeepSeek las duplica durante las horas punta, que son de 01:00 a 04:00 y de 06:00 a 10:00 UTC en días laborables. Los fines de semana son enteramente de horas valle. Si tu carga de trabajo está orientada a lotes y puedes programarla, la tarifa indicada es la tarifa que obtienes.

Ejecutar ambos en lugar de elegir
La decisión que esta comparación realmente respalda no es «elegir uno». Es enrutar según la tarea —el modelo barato para el volumen, el caro para la cola difícil—, y la fricción para hacerlo suele estar en compras, no en ingeniería: dos proveedores, dos contratos, dos SDK, dos conjuntos de claves que rotar.
Ambos modelos están detrás de una única clave de OrcaRouter, lo que simplifica eso. OrcaRouter transfiere los precios de lista del proveedor con un 0% de margen, por lo que las cifras anteriores son las tarifas del propio proveedor y no las nuestras, y un cambio de precio del proveedor se aplica en nuestro lado el mismo día: el esquema de horas punta y horas valle de DeepSeek se aplica exactamente como DeepSeek lo define. Puedes expresar la división como una regla de enrutamiento en lugar de como código de la aplicación, y colocar la conmutación por error automática detrás de la ruta barata para que un límite de velocidad o una interrupción en V4.1 Flash degrade al modelo caro en lugar de a un error.
Si quieres ver lo que has estado pagando, las dos páginas de modelos muestran la misma telemetría utilizada anteriormente, y añadir ambas a una vista de comparación es la forma más rápida de ver tu propio reparto de tráfico frente a la diferencia de precio.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
