Tarjeta de título generada titulada 'Step 5 Preview vs Claude Opus 5 — la brecha de precio' con dos columnas: Step 5 Preview con AA Index 44, precio $1.00 entrada / $2.70 salida, costo de ejecución del índice $922.84 y velocidad de salida 99.8 tokens/seg; Claude Opus 5 con AA Index 51, precio $5.00 entrada / $25.00 salida, costo de ejecución del índice $7,274.74 y velocidad de salida 55.3 tokens/seg. Un pie de página dice '7.9x el costo por 7 puntos de índice. Ambos según el Artificial Analysis Intelligence Index v4.3.2 con el máximo esfuerzo de razonamiento.'
Guides & Insights

Step 5 Preview vs Claude Opus 5: Siete puntos de índice por siete veces la factura

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El material de lanzamiento de StepFun para Step 5 Preview presenta una única afirmación comparativa: una sola tarea en él cuesta un octavo de la misma tarea en Claude Opus 5. Ambos modelos ahora se encuentran en el mismo ranking independiente, por lo que esa afirmación se puede comprobar en lugar de discutir. Artificial Analysis ejecutó cada uno a través de Intelligence Index v4.3.2 — diez evaluaciones — y publicó cuánto costó cada ejecución, con Claude Opus 5 puntuado en su propia configuración de máximo esfuerzo de razonamiento. Step 5 Preview: 44 en el índice, $922.84 para completar la ejecución. Claude Opus 5: 51 en el índice, $7,274.74. Eso es 7.9 veces el dinero por 7 puntos de puntuación, y la proporción que citó StepFun resulta ser la precisa. Lo que la proporción oculta es la parte interesante, porque la brecha no es principalmente una brecha de precio. Es una brecha de verbosidad vestida con la ropa de una brecha de precio, y separar las dos cambia qué modelo deberías poner frente a qué carga de trabajo.

Dos costos de ejecución, un tablero y lo que realmente hay dentro de ellos

Un costo total de ejecución es la comparación única más limpia disponible aquí porque ambos modelos respondieron a las mismas preguntas bajo el mismo arnés, y ninguno de los proveedores produjo la cifra. También es la cifra con más probabilidades de ser malinterpretada, así que vale la pena desglosarla.

• Puntuación del índice — Step 5 Preview 44 frente a Claude Opus 5 51, Claude Opus 5 obtuvo su puntuación en su ajuste de esfuerzo de razonamiento máximo

• Coste total para completar el índice — Step 5 Preview 922,84 $ vs Claude Opus 5 7.274,74 $

• Precio combinado con una combinación 7:2:1 de aciertos de caché / entrada / salida — Step 5 Preview $0.51 por 1M de tokens frente a Claude Opus 5 $3.85

• Tokens de salida generados durante la ejecución del índice — Step 5 Preview 160M vs Claude Opus 5 140M

• Precio de lista — Step 5 Preview $1.00 de entrada / $2.70 de salida vs Claude Opus 5 $5.00 de entrada / $25.00 de salida

Si se observan las filas tres y cinco en conjunto, la aritmética deja de ser una simple comparación de precios. La tarifa combinada de Step 5 Preview es 7,5 veces más barata, y la tarifa de lista es 5 veces más barata en entrada y 9,3 veces más barata en salida —así que la combinación hace un trabajo que el precio de entrada no hace. Esto se debe a que la combinación está ponderada hacia la salida, y la salida es donde más divergen los dos modelos. Claude Opus 5 cobra 9,3 veces la tarifa de salida de Step 5 Preview, y ambos modelos escriben muchísimo: 140M tokens de salida para Claude Opus 5 frente a una mediana de 92M en los modelos que puntúa el índice, y 160M para Step 5 Preview frente a la misma mediana de 92M.

La lectura honesta es más limitada que «el modelo barato es una ganga». Step 5 Preview es más barato en todos los aspectos, y no es un modelo frugal: escribe un 74% más de salida que el modelo mediano con el que se lo compara, que es exactamente el comportamiento que el precio debería castigar. Claude Opus 5 escribe un 52% más que la mediana y cobra 9,3 veces más por cada uno de esos tokens. Quien limita la longitud de la salida obtiene una proporción distinta que quien no lo hace.

La pregunta no es cuál es mejor. Es dónde se sitúa el punto de cruce

Supongamos que el índice es un proxy razonable del trabajo que realmente envías —tareas agénticas de horizonte largo, código, uso de herramientas en varios pasos—. Entonces el punto de cruce es fácil de enunciar: Claude Opus 5 tiene que ser al menos 7,9 veces más útil por tarea antes de que valga la pena su factura, y en el índice es 7 puntos mejor en una escala de 100 puntos. Esos dos hechos no tienen por qué apuntar en la misma dirección, porque una diferencia de 7 puntos en el índice no significa ser 16% mejor en todo. Es el agregado de diez evaluaciones, y la composición importa más que el total.

Ese es el argumento para preocuparse por la forma de las dos puntuaciones en lugar del titular. La lectura de Terminal-Bench 4.0 de Step 5 Preview es del 33,3 %, un resultado agéntico real, por delante de DeepSeek V4.1 Flash con un 26,8 %, pero nada en el registro publicado muestra aún que iguale a Claude Opus 5 en las evaluaciones de largo horizonte en las que el modelo de Anthropic es más fuerte. Los propios materiales de StepFun lo admiten en la formulación: en ALE-CLI, FrontierFinance y DRACO, la compañía sitúa a Step 5 Preview en segundo lugar, por detrás de GPT-6 Astra o de Claude Opus 5, y por delante de los otros modelos abiertos de la comparación. El segundo puesto a una quinta parte del precio es un resultado genuinamente bueno. Tampoco es el primer puesto, y las tareas en las que un modelo queda segundo suelen ser las tareas que necesitaban el primero.

La otra asimetría es lo que ocurre con una mala elección. Una respuesta incorrecta de un modelo barato que tardó cuatro segundos y 2.000 tokens te cuesta el reintento; la misma respuesta incorrecta de Claude Opus 5 a 25 dólares por millón de tokens de salida te cuesta el reintento más la deliberación. Si tu canalización reintenta cuando hay un fallo —la mayoría de los bucles de agentes lo hacen—, el coste efectivo por tarea exitosa es la cifra que importa, y no guarda la misma proporción que el precio de lista, porque los dos modelos no fallarán a la misma tasa. Nadie ha publicado todavía esa cifra para Step 5 Preview.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

El contraste de especificaciones, dimensión por dimensión

• Puntuación del índice — Step 5 Preview 44 vs Claude Opus 5 51, ambos en Intelligence Index v4.3.2, Claude Opus 5 en su configuración de máximo esfuerzo de razonamiento

• Precio por 1M de tokens — Step 5 Preview $1.00 entrada / $2.70 salida vs. Claude Opus 5 $5.00 entrada / $25.00 salida

• Descuento por caché — Step 5 Preview 95% vs Claude Opus 5 90%

• Contexto — ambos 1M tokens; StepFun no ha publicado un límite máximo de salida y el de Anthropic es 128K

• Entrada — ambos aceptan texto e imágenes; ambos solo generan texto

• Velocidad de salida — Step 5 Preview 99,8 tokens/seg vs Claude Opus 5 55,3 tokens/seg

• Superficie de control — Step 5 Preview expone el razonamiento extendido; Claude Opus 5 reemplaza temperature y top_p por un dial adaptativo de esfuerzo de razonamiento

• Pesos — Step 5 Preview cerrado hoy, checkpoint BF16 programado para el 15 de octubre; Claude Opus 5 propietario en todo momento

• Evidencia independiente — ambos puntuados por Artificial Analysis; las filas de benchmark agéntico de StepFun son ejecutadas por el proveedor y no reproducidas

Dos filas merecen una nota. La diferencia de velocidad es real y, en la práctica, mayor de lo que sugiere la tabla: 99,8 tokens por segundo frente a 55,3 es un modelo que termina aproximadamente el doble de rápido con la misma salida, y el tiempo hasta el primer token de Step 5 Preview, de 2,96 segundos, frente a los 56,84 segundos de Claude Opus 5 en la misma tabla, es algo de otro orden —aunque esa segunda cifra mide la configuración de razonamiento de máximo esfuerzo, en la que el modelo delibera antes de emitir nada. No es la latencia que ve una llamada de producción. Frente al endpoint estándar, nuestro propio catálogo reporta un tiempo hasta el primer token p50 de 6,73 segundos para Claude Opus 5, que es la cifra con la que planificar si no estás pidiendo deliberadamente la máxima deliberación.

La fila de descuento de caché es la que decide silenciosamente las cargas de trabajo repetidas, y favorece a Step 5 Preview, 95% frente a 90%. Un bucle de agente que reenvía el mismo prompt de sistema y el contexto del repositorio en cada llamada vive casi por completo de ese descuento, por lo que una diferencia de cinco puntos se acumula a lo largo de una sesión larga.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Donde Claude Opus 5 sigue siendo la única respuesta

Nada de lo anterior argumenta en contra del modelo de Anthropic. Cuesta lo que cuesta porque hace lo que el índice intenta medir, y lo hace cerca de la cima de la tabla: 51 en Intelligence Index v4.3.2, siete puntos por delante de Step 5 Preview y al alcance de los líderes de la generación actual. Las cargas de trabajo en las que una brecha agregada de 7 puntos subestima la diferencia son aquellas que no toleran una respuesta de segundo lugar: un refactor de varias horas en el que el modo de fallo es un cambio sutil de comportamiento, un modelo financiero en el que la cadena de razonamiento tiene que ser auditable, una migración en la que una decisión equivocada se descubre una semana después. En esos casos, el reintento no es barato y la deliberación es el producto.

Las cargas de trabajo en las que la brecha es irrelevante son las que se componen de muchas decisiones pequeñas: pasos de clasificación y enrutamiento, extracción, resumen, andamiaje de pruebas, las mil llamadas que hace un agente entre las dos llamadas que realmente importan. En esos casos, un modelo con 44 que responde en la mitad del tiempo a una quinta parte del precio de entrada no es una concesión. Es la opción predeterminada correcta, y el modelo caro se reserva para el paso que tiene que estar bien.

Ejecutar la división sin ejecutar dos integraciones

La versión práctica de esta comparación es un pipeline por niveles, y la razón por la que los equipos no construyen uno es la adquisición, no la ingeniería: dos proveedores, dos contratos, dos SDK, dos claves que rotar. Claude Opus 5 está en nuestro catálogo a $5.00 y $25.00, y los modelos de texto más baratos que pondrías por delante están en el mismo catálogo, todos detrás de una sola clave para más de 200 modelos, con el precio de lista del proveedor trasladado con un 0% de recargo. Step 5 Preview no está en esa lista: se ejecuta en la propia API de StepFun y, hasta que lleguen los pesos, ese es el único lugar donde se ejecuta. Componer el escalonamiento entre los modelos que sí enrutamos es una expresión del DSL de enrutamiento en lugar de un cambio de código: envía las llamadas rutinarias al modelo pequeño, escala al caro según una condición de confianza o complejidad, y mantén ambas rutas detrás del mismo endpoint.

La conmutación por error automática importa por una razón específica aquí, más que como una característica genérica. Step 5 Preview abrió su API el día del anuncio sin pesos publicados y sin una flota de servicio divulgada; es un endpoint de vista previa con apenas días de antigüedad, y los endpoints de vista previa están limitados en capacidad de una manera en que los maduros no lo están. Claude Opus 5 es servido por muchos proveedores independientes, que es la redundancia que una vista previa no puede ofrecer. Mantener un modelo probado como la opción de respaldo —de nuestro lado, eso significa un modelo de producción del catálogo, no la vista previa— es cómo se obtiene una señal de calidad real sobre tu propia carga de trabajo sin hacer que tu ruta de producción dependa de una flota que aún se está dimensionando.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

La regla de decisión

Si tu carga de trabajo consiste en un pequeño número de tareas muy difíciles, Claude Opus 5 no es la opción cara: es la barata, porque la segunda mejor respuesta cuesta más que la diferencia. Si tu carga de trabajo consiste en un gran número de tareas ordinarias entre las que se cuelan unas pocas difíciles, Step 5 Preview a $1.00 y $2.70 con un 95% de descuento por caché es la opción predeterminada mejor, y la diferencia de 7 puntos es en su mayor parte un error de redondeo en un trabajo que no la necesitaba.

Lo que cambiaría ese cálculo es evidencia independiente sobre las tasas de fallo y sobre las filas agénticas de horizonte largo. Los propios números de StepFun sitúan al modelo en segundo lugar en las evaluaciones en torno a las cuales construyó su lanzamiento, y ningún tercero los ha reproducido. Presta atención al punto de control del 15 de octubre para ver dos cosas: si la licencia permite el ajuste fino que te permitiría cerrar una brecha de 7 puntos con tus propios datos, y si la verbosidad se mantiene una vez que se elimine el sufijo de vista previa. Lo primero cambiaría la proporción; lo segundo ya la movió una vez.