
Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 puntos de índice y una lectura de caché a $0.022
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Ponga las dos tarifas una al lado de la otra y la comparación parece resuelta antes de empezar. Claude Sonnet 5.5, disponible de forma general desde el 28 de septiembre de 2026, cuesta $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida. DeepSeek V4 Pro, lanzado el 24 de abril de 2026, cuesta $0.66 y $1.98. La salida es la línea que importa en el trabajo con agentes, y $10.00 frente a $1.98 es una brecha de cinco a uno: un dólar frente a veinte centavos por cada cien mil tokens. Luego mire el lado de la capacidad, donde Artificial Analysis sitúa a Claude Sonnet 5.5 en 56 en Intelligence Index v4.3 y a DeepSeek V4 Pro en 36, una brecha de veinte puntos en el mismo sistema de evaluación. Esa es toda la tensión: el modelo de DeepSeek se sitúa en un quinto del precio de salida y aproximadamente dos tercios de la capacidad medida, y los dos hechos no se resuelven en una única recomendación sin saber qué hace realmente tu carga de trabajo con un token.
Qué es cada modelo, con precisión
La denominación es el primer punto donde esta comparación falla, así que corrijámoslo aquí. DeepSeek V4 Pro, tal como lo listamos, es deepseek/deepseek-v4-pro, publicado el 24 de abril de 2026, un modelo con contexto de 1.048.576 tokens, una salida máxima de 384.000 tokens y entrada solo de texto. Artificial Analysis hace seguimiento de una instantánea que etiqueta como DeepSeek V4 Pro 0813 —una compilación del 13 de agosto— y las cifras citadas a continuación provienen de esa fila. Del lado de Sonnet está anthropic/claude-sonnet-5.5 de Anthropic, con entrada de texto, imagen y archivos, contexto de 1M y salida máxima de 128K. Si estás comparando una página de proveedor con una página de evaluador y las cifras no coinciden, revisa el sufijo de la compilación antes de concluir que una de ellas está equivocada.
DeepSeek V4 Pro solo admite entrada de texto. Claude Sonnet 5.5 también acepta imágenes y archivos. Esa es la primera diferencia estructural y no es marginal: cualquier pipeline que ingiera capturas de pantalla, PDF o diagramas no puede simplemente intercambiar uno por otro, porque uno de ellos no puede ver.
La tarjeta de tarifas, línea por línea
• Entrada — $0.66 por millón para DeepSeek V4 Pro frente a $2.00 para Claude Sonnet 5.5; DeepSeek es 67% más barato
• Salida — $1.98 por millón frente a $10.00; DeepSeek es un 80% más barato, la brecha individual más amplia en esta comparación
• Lectura de caché — $0.022 por millón frente a $0.20; DeepSeek es un 89 % más barato en la línea que domina los bucles largos de agentes
• Escritura de caché — $2.50 por millón para la ventana de cinco minutos en Claude Sonnet 5.5; la fila del catálogo de DeepSeek V4 Pro no incluye una línea separada de escritura de caché
• Contexto — 1.048.576 tokens frente a 1.000.000; DeepSeek es marginalmente más largo, una distinción sin consecuencias prácticas
• Salida máxima — 384,000 tokens frente a 128,000; DeepSeek gana por un factor de tres en el techo que limita la generación masiva
• Modalidad de entrada — solo texto frente a texto, imagen y archivo
• Razonamiento — ambos utilizan un esfuerzo de razonamiento configurable en lugar de un presupuesto de pensamiento fijo, por lo que la profundidad es un parámetro de solicitud en cada uno
Hay un detalle de programación del lado de DeepSeek que una comparación de tarifas ocultará. Nuestra fila de catálogo conlleva una ventana de tarificación horaria: entre las 01:00 y las 04:00 UTC, y de nuevo entre las 06:00 y las 10:00 UTC, las tarifas indicadas se multiplican por dos. En esas horas, V4 Pro cuesta $1.32 de entrada y $3.96 de salida —sigue siendo más barato que Claude Sonnet 5.5, en un 34% y un 60% respectivamente, pero ya no por los márgenes que sugieren las cifras destacadas. Las cargas de trabajo por lotes que se pueden programar merecen ser programadas, y las cargas de trabajo que no se pueden programar merecen tarificarse a la tarifa pico en lugar del promedio. Esto también es el tipo de cosa que solo aparece si se lee el catálogo en lugar de la página de marketing, lo cual es el argumento para poner cada modelo candidato detrás de un solo endpoint en lugar de tres cuentas de proveedores.
Dos números de capacidad, uno de ellos no independiente
En el ámbito de terceros, la clasificación es inequívoca. Artificial Analysis puntúa a Claude Sonnet 5.5 con 56 y a DeepSeek V4 Pro con 36 en el Intelligence Index v4.3, ambos en una configuración de razonamiento de esfuerzo máximo. El mismo evaluador sitúa a Claude Opus 5 con 51 y a Gemini 3.1 Pro Preview con 30, por lo que el 36 de V4 Pro lo coloca por debajo del anterior buque insignia de Anthropic y por encima del nivel Pro de Google — una posición respetable para un modelo a una quinta parte del precio, y muy lejos de la cima.
La inversión del costo por tarea también aparece aquí, y en esta comparación va en la dirección opuesta a la anterior. DeepSeek V4 Pro cuesta $0.67 evaluarlo en la suite de índices. Claude Sonnet 5.5 cuesta $7.60. No es un error tipográfico ni un artefacto de redondeo: el modelo más reciente de Anthropic emite 410 millones de tokens en toda la suite frente a una mediana de 88 millones, y la verbosidad del modelo DeepSeek no se acerca ni de lejos a cerrar una diferencia de precio de ese tamaño. En tareas abiertas sin restricciones, el modelo más barato es más barato por un orden de magnitud en la práctica, no solo en la tarifa.
Las cifras de los proveedores deben tratarse con más cuidado. DeepSeek publica una cifra de 96,2 en τ²-Bench para V4 Pro, que es una cifra sólida, pero está reportada por el proveedor y τ²-Bench se ha eliminado desde entonces del índice de Artificial Analysis en su revisión v4.3 — por lo que es una cifra que no puede situarse de forma independiente en la misma escala que ninguna de las que publica Anthropic. La propia tabla de lanzamiento de Anthropic para Claude Sonnet 5.5 tiene sus propias salvedades, incluida una nota al pie de que la configuración de esfuerzo Max obtiene una puntuación inferior a Xhigh en FrontierCode y una nota de que dos de los benchmarks se ejecutaron en un despliegue previo al lanzamiento con un error de salidas estructuradas. Ponga las tablas de ambos proveedores una al lado de la otra y tendrá dos documentos de marketing, no un ranking. Las únicas cifras de este artículo que pertenecen a un mismo eje son las dos puntuaciones del índice y los dos costos por tarea, porque un solo evaluador produjo las cuatro.
Por qué el techo de salida importa más que el precio
El número en esta comparación que recibe menos atención es el que cambia la arquitectura: 384.000 tokens de salida frente a 128.000.
El techo de salida no es una característica de comodidad. Decide si una tarea es una sola llamada o una cadena. Generar un archivo fuente grande, emitir un documento completo, producir un informe estructurado largo, traducir un capítulo de un libro —cualquier cosa en la que el artefacto sea más grande que 128.000 tokens— no se puede hacer en una sola llamada a Claude Sonnet 5.5, y debe descomponerse en una secuencia con estado transferido entre llamadas. La descomposición significa más tokens de entrada reenviados en cada paso, más lecturas de caché, más código de orquestación y una nueva clase de fallo en la que las costuras entre fragmentos son donde viven los errores. Un modelo a cinco veces el precio que elimina toda una capa de orquestación puede ser más barato en horas de ingeniería antes de ser más barato en tokens, y en la dirección opuesta, una tarea que cabe en una sola llamada es una tarea en la que el techo nunca entra en la aritmética en absoluto.
Así que la cuestión del límite máximo es anterior a la cuestión del precio. Si tu artefacto más largo cabe en menos de 128,000 tokens, ignora esta sección y compara según el costo por tarea terminada. Si no es así, calcula el precio del pipeline que tendrías que construir, no solo el de los tokens.
El costo de cambio y el problema del fallback
La migración en cualquier dirección consiste principalmente en prompting más que en código, con una excepción para la que conviene reservar presupuesto.
Ambos modelos configuran el razonamiento mediante un parámetro de esfuerzo, pero son parámetros de proveedores diferentes, con niveles distintos y valores predeterminados distintos. Un prompt ajustado a una configuración de esfuerzo alto de Anthropic no se traslada a una configuración de esfuerzo de DeepSeek como un intercambio equivalente; se traslada como una nueva medición. Espere dedicar un día por carga de trabajo a restablecer la calidad antes de confiar en una proyección de costos, en cualquiera de los dos lados del cambio.
La excepción es la visión. Claude Sonnet 5.5 lee imágenes y archivos; DeepSeek V4 Pro solo lee texto. Cualquier parte de tu pipeline que le entregue a un modelo una captura de pantalla, una página escaneada o un gráfico renderizado no tiene equivalente en DeepSeek, por lo que una migración completa solo está disponible para el subconjunto de tu tráfico con forma de texto. Esa es una línea divisoria que conviene trazar desde el principio, porque normalmente significa que la respuesta no es un único modelo, sino una división.
Ambos son enrutables en OrcaRouter hoy — deepseek/deepseek-v4-pro y anthropic/claude-sonnet-5 son ambas entradas activas del catálogo, con el precio de lista del proveedor y 0 % de recargo, con una sola credencial. Eso importa sobre todo en exactamente este tipo de comparación, donde el factor decisivo no es qué modelo es mejor en abstracto, sino a qué modelo debería ir una solicitud determinada. Una división que envía el trabajo masivo de solo texto al modelo barato y el trabajo de visión al caro es una regla de enrutamiento, y es mucho más fácil de expresar cuando ambos endpoints responden a la misma clave y a la misma política de conmutación por error. Claude Sonnet 5.5 en sí todavía no es una ruta en nuestra plataforma, así que la versión actual de esa división empareja el modelo de Anthropic con DeepSeek V4 Pro en lugar de reemplazarlo.
La decisión, enunciada como regla
Envíalo a Claude Sonnet 5.5 cuando la tarea necesite ver —imágenes, PDFs, capturas de pantalla, resultados renderizados—, cuando el artefacto sea más largo que una página de texto y quieras que lo escriba un modelo de frontera, o cuando una diferencia de veinte puntos en el índice sea la diferencia entre un borrador que una persona tiene que reescribir y uno que puede entregar.
Envíalo a DeepSeek V4 Pro cuando la carga de trabajo sea texto de entrada, texto de salida, de gran volumen y tolerante a un techo más bajo en calidad de razonamiento: clasificación, extracción, resumen, reescritura masiva, transformación de código con una especificación clara y cualquier cosa en la que, de otro modo, estuvieras pagando diez dólares por millón de tokens de salida por mover palabras de un lado a otro. El descuento del 89 % por lectura de caché hace que los bucles de agentes con contexto largo en este modelo sean estructuralmente baratos de una forma en que nada más en la comparación lo es.
El veredicto honesto: esta no es una carrera de capacidades que DeepSeek esté perdiendo, sino una decisión de asignación de recursos que la mayoría de los equipos resuelve mal, inclinándose por comprar capacidad que no utilizan. Si tu tráfico es texto y tu listón de calidad es «lo bastante bueno para revisarlo» en lugar de «lo bastante bueno para enviarlo sin leerlo», V4 Pro, con un 20 % del precio de salida y lecturas de caché a $0.022, es el valor predeterminado correcto, y esos veinte puntos de índice son un impuesto que actualmente te ofreces voluntariamente a pagar.



Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
