
Step 5 Preview vs Nemotron 3 Ultra: veintiún puntos de índice por veinte centavos
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Uno de estos modelos puedes descargarlo esta misma tarde, y es el que pierde por veintiún puntos. Step 5 Preview, el buque insignia cerrado de StepFun, abrió su API el 20 de septiembre de 2026 y no tiene ningún archivo de licencia que puedas sostener en la mano; NVIDIA Nemotron 3 Ultra 550B A55B está en Hugging Face desde el 4 de junio de 2026 bajo una licencia permisiva con sus recetas de entrenamiento adjuntas. En el Artificial Analysis Intelligence Index, la pareja marca 44 frente a 23. En precio de salida, marca 2,70 $ frente a 2,50 $ por millón de tokens. Veintiún puntos por veinte centavos no es una comparación que se resuelva limpiamente en ninguna de las dos direcciones, y por eso merece la pena hacerla bien en lugar de echar un vistazo a las dos columnas destacadas y elegir un bando.
Ninguno de estos dos es un lanzamiento de esta semana, y eso importa para cómo se leen las cifras que aparecen a continuación. Ambos son invocables desde hace meses, ambos han pasado por el mismo arnés independiente, y ninguno tiene un cambio de tarifa dentro de la ventana. Lo que ha cambiado es más pequeño y más interesante: el índice con el que se puntúa a ambos se reconstruyó en septiembre, y ahora se los evalúa con respecto a dos medianas distintas extraídas de dos poblaciones distintas. Ahí es donde realmente se decide esta comparación.
Dos tipos de producto muy diferentes
Lee las hojas de especificaciones una al lado de la otra y lo primero que se nota es que apenas si son la misma categoría de cosa.
• Parámetros — Step 5 Preview es de aproximadamente 600 mil millones en total con 27 mil millones activos por token según la documentación propia de StepFun; Nemotron 3 Ultra es de 550 mil millones en total con 55 mil millones activos, según la cifra que el panel independiente registra frente a su configuración.
• Arquitectura — StepFun no publica una descripción de las partes internas de Step 5 Preview. La ficha de NVIDIA documenta un híbrido: capas Mamba-2 intercaladas, capas de atención seleccionadas, una disposición LatentMoE y cabezales de Predicción Multi-Token.
• Ventana de contexto — 1M tokens en la tabla de especificaciones de Step 5 Preview, con una salida máxima de 64.000 tokens, también documentada por StepFun. Nemotron 3 Ultra figura con 262.144 tokens según el evaluador que lo ejecutó; la ficha del proveedor anuncia hasta 1M, alcanzable mediante una configuración de servicio y no de forma predeterminada.
• Entrada — texto, imágenes y video en Step 5 Preview, hasta 60 imágenes por solicitud y archivos MP4 de menos de 128 MB. Solo texto en Nemotron 3 Ultra.
• Control de razonamiento — un ajuste documentado de esfuerzo bajo, medio y alto del lado de StepFun; una marca de plantilla de chat del lado de NVIDIA que activa o desactiva la traza de pensamiento.
• Pesos — ninguno publicado para Step 5 Preview, que es propietario y solo API, con un checkpoint BF16 que StepFun ha dicho que llegará el 15 de octubre de 2026. Nemotron 3 Ultra se distribuye con versiones BF16 y NVFP4 y un modelo de recompensa GenRM en Hugging Face bajo OpenMDW-1.1.
• Mínimo de implementación: no aplicable para el modelo de API; ocho GPU de clase B200 o de clase GB200, o dieciséis H100, en el abierto, según la línea mínima del proveedor.
• Tarifario — $1,00 de entrada, $0,10 en un acierto de caché y $2,70 de salida para Step 5 Preview, según la página de precios en inglés de StepFun. Aproximadamente $0,60 de entrada, $0,16 en un acierto de caché y $2,50 de salida para Nemotron 3 Ultra, y presta mucha atención a de dónde procede ese par: NVIDIA no publica ningún tarifario, por lo que corresponde a los precios de proveedor observados que registra el panel independiente, no a una cifra del fabricante.
La fila que la mayoría de la gente considera decisiva es la primera, y es la menos informativa de las ocho. Los dos totales se sitúan a menos de un nueve por ciento de distancia entre sí, mientras que los parámetros activos difieren en un factor de dos, y los parámetros activos son los que rigen el coste de cómputo de cada token generado. Ninguna de las dos cifras predice una diferencia de veintiún puntos.

La mediana es una elección que se hace antes de leer la puntuación.
El consejo independiente no puntúa los modelos según un único campo. Los agrupa en categorías, y la categoría en la que cae un modelo cambia la frase impresa bajo su puntuación, sin cambiar la puntuación.
Step 5 Preview se sitúa en la clase de razonamiento general, que el tablero contabiliza en 227 modelos, y su mediana de modelos comparables es 26. Nemotron 3 Ultra se sitúa en la clase de pesos abiertos, contabilizada en 117 modelos, donde la mediana es 18. Así, el mismo tablero describe 44 como «muy por encima de la media» y 23 como «por encima de la media», y ambas descripciones son ciertas, porque 44 está dieciocho puntos por encima de su mediana y 23 está cinco puntos por encima de la suya.
Esto no es un truco y no es que el tablero esté siendo injusto. Es la forma correcta de presentar un modelo abierto: comparas un checkpoint descargable con otros checkpoints descargables, porque un equipo que solo puede tomar una descarga no está eligiendo entre los 227. Pero sí significa que cualquiera que cite «por encima del promedio» sobre Nemotron 3 Ultra y «por encima del promedio» sobre un 44 está comparando dos frases diferentes entre sí. Si quieres un solo número para el par, usa el índice bruto y acepta la brecha de veintiún puntos; si quieres la decisión, usa la clase y admite que ya has elegido tu campo.

Lo que un arnés midió en ambos
Las tablas de proveedores no pueden restarse entre sí, porque StepFun y NVIDIA ejecutaron suites distintas en días distintos, y los materiales de NVIDIA no incluyen todos los benchmarks que reporta StepFun. El terreno honesto es la intersección: lo que un único evaluador ejecutó contra ambos.
En el Artificial Analysis Intelligence Index, esa intersección es 44 frente a 23. En coste por tarea de índice completada, es de 1,03 $ frente a 0,60 $. En velocidad de salida se invierte, y de forma marcada: 87 tokens por segundo para Step 5 Preview frente a 135,6 para Nemotron 3 Ultra, así que el modelo que obtiene casi el doble de puntuación es el que responde aproximadamente medio segundo de generación más lento por token.
La fila individual más destacada es Terminal-Bench 4.0. Step 5 Preview obtiene 33,3 por ciento allí. Nemotron 3 Ultra obtiene 0,5 por ciento. Eso no es un artefacto de redondeo de ninguna de las dos partes y no es una brecha sutil: en esa suite específica de terminal agéntica, el buque insignia de pesos abiertos prácticamente no registra. La trampa es que la misma tabla también incluye el mismo modelo con 53,9 por ciento en Terminal-Bench 2.1. Dos benchmarks con casi el mismo nombre, dos generaciones distintas de la misma familia de tareas, y un modelo que se sitúa en 53,9 en el más antiguo y en 0,5 en el más nuevo. Si alguna vez te han citado un número de Nemotron en los cincuenta, de ahí viene, y no es la suite actual.
Una coincidencia merece una mención precisamente porque es rara. La propia tarjeta de NVIDIA afirma un 87,0 por ciento en GPQA sin herramientas; la ejecución independiente midió un 86,7 por ciento. Que una cifra del proveedor y una cifra externa queden separadas por tres décimas de punto es el aspecto que tiene una tabla de evaluación digna de confianza, y hace que el 0,5 por ciento en Terminal-Bench 4.0 sea más fácil de aceptar como real en lugar de como un error del evaluador.
A dónde va realmente el dinero en una corrida de índices
Los precios por token predicen muy poco sobre lo que cuesta una carga de trabajo, y este par demuestra el punto mejor que la mayoría. El tablero publica la descomposición de costos de la ejecución completa del índice de cada modelo, y para ambos, la partida dominante no es la generación.
El coste de $1.03 por tarea de Step 5 Preview se divide en $0.85 de entrada y $0.17 de salida. Dentro de la cifra de entrada, $0.62 corresponde a lecturas de caché, $0.22 a escrituras de caché y solo $0.014 a entrada sin caché. Dentro de la cifra de salida, $0.12 es la traza de razonamiento y $0.06 es la respuesta final.
Los $0.60 por tarea de Nemotron 3 Ultra se dividen en $0.53 de entrada y $0.07 de salida, y la composición dentro de la línea de entrada es casi la imagen especular: $0.48 de escrituras en caché frente a solo $0.04 de lecturas de caché.
Se desprenden dos conclusiones. La primera es que en una evaluación de horizonte largo con reutilización intensiva de prefijos, aproximadamente el ochenta por ciento de lo que pagas se sitúa en el lado de la entrada del libro mayor, lo que hace que tu tasa de aciertos de caché y tu disciplina de contexto sean los números que debes optimizar en lugar de la longitud de tu salida. La segunda es que los dos modelos llegan a sus facturas de manera diferente: Step 5 Preview está pagando por volver a leer un prefijo compartido grande, mientras que Nemotron 3 Ultra está pagando por escribir contenido distinto en la caché en primer lugar. Un coste principal similar, dos facturas diferentes — y si tu carga de trabajo se parece más a uno de esos patrones que al otro, el orden en $1.03 y $0.60 puede invertirse.
Las cifras de verbosidad explican el resto de la línea de salida. Step 5 Preview generó unos 160 millones de tokens de salida en todo el conjunto de índices, frente a una mediana de 82 millones, que la junta describe sin rodeos como muy verboso. Nemotron 3 Ultra generó 110 millones frente a una mediana de 140 millones, que la junta califica de bastante conciso. El modelo más barato es el conciso, y lo es en la dirección que importa para una factura.

Lo que compra la descarga y lo que cuesta conservarlo
El precio de Nemotron 3 Ultra no es de $2.50 por millón de tokens de salida si tomas el checkpoint. Ese es el precio de alquilar el despliegue que otra persona hace de él. Si tomas la descarga, has comprado otro conjunto de costos y otro conjunto de derechos.
Los derechos son concretos y son la parte que un modelo solo de API no puede igualar a ningún precio. OpenMDW-1.1 viene con los pesos, y NVIDIA publica las colecciones de datos de preentrenamiento y postentrenamiento, y las recetas de entrenamiento junto con ellos. Existe una versión NVFP4 de aproximadamente la mitad del tamaño para el mismo modelo, y los pesos Ultra se preentrenaron con una receta NVFP4 en lugar de cuantizarse después, por eso la versión pequeña es un artefacto de primera clase en la tarjeta, y no un experimento de la comunidad. La postura comercial se declara sin rodeos: listo para uso comercial y no comercial.
Los costos son igual de concretos. El despliegue mínimo es de ocho GPU de clase B200 o dieciséis H100, y ese es el mínimo que indica la tarjeta, no una sugerencia. La ventana de contexto que realmente obtienes depende de cómo configures el servicio, con 256K como valor predeterminado y 1M detrás de un ajuste explícito. Un equipo que no puede comprometer un rack no está eligiendo entre estos dos modelos a $1.00 y $0.60 de entrada; está eligiendo entre un modelo y una orden de compra.
Hay una versión de esta comparación en la que el modelo abierto gana en el eje del que la gente dice preocuparse y que rara vez pone precio: la dependencia. Step 5 Preview es un endpoint al que llamas y un proveedor en el que confías, con un checkpoint prometido en lugar de entregado. Si StepFun revisa su tarifa, endurece sus límites, deprecia el ID o tiene una mala semana, tu única palanca es tu propio manejo de errores. Los pesos de Nemotron 3 Ultra ya están en el disco de algún clúster, y eso vale algo real incluso mientras ese mismo modelo pierde por veintiún puntos de índice.
Vale la pena ser precisos sobre qué significa «prometido» del otro lado, porque el panorama es más enrevesado de lo que admite cualquiera de los dos bandos. Varios espejos de terceros de una compilación BF16 aparecieron en Hugging Face el 20 de septiembre, el día en que se abrió la API, algunos de ellos con bastante más de un terabyte de safetensors. Esas son resubidas de la comunidad, no un lanzamiento del proveedor, y StepFun no ha publicado ningún anuncio de pesos abiertos junto a ellas. Lo que establecen es que los pesos están circulando y que el checkpoint prometido del 15 de octubre sería una formalización más que una divulgación.
Un número que se movió mientras lo leíamos
Una cifra de este artículo cambió entre dos lecturas de la misma página, y merece la pena mencionarla porque así es exactamente como una comparación queda obsoleta en silencio.
El panel independiente mostró un costo de $0,71 por tarea del índice para Step 5 Preview en la cobertura fechada el 9 de octubre de 2026. Al leerlo de nuevo el 10 de octubre, la misma página dice $1,03. Nada cambió en el modelo durante ese intervalo, porque nada puede cambiar de la noche a la mañana en los pesos de un modelo solo de API. Lo que cambió es la contabilidad de la evaluación: cuando se mueve el precio de la caché de un proveedor, cuando el evaluador revisa sus supuestos de lectura de caché o cuando una ejecución se recalcula con una combinación de tokens diferente, la cifra por tarea cambia y la puntuación del índice no.
Así que trata el coste por tarea como un número vivo con una fecha estampada en él, en lugar de como una propiedad del modelo. Cada cifra por tarea en este artículo es la lectura del 10 de octubre y está etiquetada como tal. Si estás construyendo un presupuesto a partir de esta página, constrúyelo a partir de una cifra que obtengas tú mismo el día en que te comprometas — y si estás comparando dos artículos de diferentes semanas, verifica las fechas de captura antes de concluir que un modelo se abarató.
¿A cuál llamarías realmente?
Di primero la parte incómoda: OrcaRouter no enruta ninguno de estos dos modelos. Se puede acceder a Step 5 Preview a través de la propia API de StepFun y un puñado de plataformas de terceros, y Nemotron 3 Ultra se sirve desde los propios endpoints de NVIDIA y por varios proveedores, y puedes verificar ambas afirmaciones con nuestro catálogo en el mismo minuto en que las lees.
Lo que eso deja es la forma de la dependencia, más que la elección de modelo, y es el único punto en el que una capa de enrutamiento justifica su existencia aquí. Una vista previa solo por API en una única ruta de proveedor es precisamente la configuración en la que una mala tarde del proveedor se convierte en tu caída de servicio, y el seguro barato es un plano de control capaz de transferir una solicitud a un respaldo cualificado en el momento en que una ruta de proveedor se degrada. Para eso sirve la conmutación por error automática: no como sustituto de Step 5 Preview, sino como aquello que pones delante de los modelos que realmente puedes llamar, de modo que un endpoint específico de un proveedor nunca sea el único camino hacia producción. Ese mismo catálogo que hace esto incluye más de 200 modelos detrás de una sola clave y una sola factura, con el precio de lista del proveedor repercutido con un 0 % de margen — lo cual es la otra mitad del argumento, porque un cambio de tarifa en cualquier punto aguas arriba está activo en nuestro lado el mismo día, en lugar de en la próxima renovación de contrato.
Si ninguno de los dos modelos es el que vas a llamar, la versión corta es esta. Elige Step 5 Preview cuando quieras la puntuación, la entrada de vídeo e imagen y el descuento del 90 por ciento en caché, y acepta que estás alquilando una preview sin licencia sobre los pesos y con un checkpoint de octubre que aún no has visto. Elige Nemotron 3 Ultra cuando los pesos importen más que la puntuación —por las restricciones on-premise, por el fine-tuning, por una licencia que puedas leer— y presupuesta el rack antes de presupuestar los tokens, porque a 0,60 $ por millón de tokens de entrada, un despliegue de 550 mil millones de parámetros solo sale barato si alguien más ya está pagando por las GPU.
Lo que hay que seguir de cerca es el 15 de octubre. Si StepFun publica el checkpoint BF16 que ha prometido, la asimetría central de este artículo —que solo uno de estos dos es una descarga— deja de ser cierta, y los veintiún puntos del índice se vuelven considerablemente más difíciles de desestimar. Si la fecha se retrasa, el argumento a favor del modelo de pesos abiertos se fortalece por defecto, lo cual es una manera extraña de cerrar una brecha de capacidades y, a la vez, una muy común.
