
Step 5 Preview vs Gemini 3.1 Pro: Dos modelos llamados Preview, con siete meses de diferencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ambos Step 5 Preview y Gemini 3.1 Pro llevan la palabra preview, y la palabra no significa lo mismo en ninguno de los dos. StepFun anunció Step 5 Preview el 20 de septiembre de 2026, con la API abierta, los pesos programados para el 15 de octubre, y un repositorio BF16 en Hugging Face que no contiene más que un .gitattributes. El otro se ha estado lanzando como gemini-3.1-pro-preview en la API y como "Gemini 3.1 Pro Preview" en cada tabla de clasificación desde el 19 de febrero de 2026, manejando tráfico de producción durante siete meses sin que la etiqueta se haya quitado nunca. Uno es una vista previa genuina de algo que no está terminado. El otro es una convención de nombres adjunta a un producto terminado. Compararlos en el mismo eje significa decidir cuál de esas dos cosas estás comprando realmente, y la respuesta de segundo orden — que el modelo siga llamándose preview después de siete meses es la más predecible de las dos — es la parte que vale la pena llevar a una decisión de adquisición.
Lo que dice el mismo tablero
Artificial Analysis puntúa a ambos en el Intelligence Index v4.3.2, diez evaluaciones. Es el único lugar donde estos dos se han medido por la misma mano, y el resultado arroja una diferencia mayor de lo que sugerirían los materiales de los proveedores de uno y otro lado.
• Índice de Inteligencia — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
• Clasificación — Step 5 Preview 24.º de 200 modelos vs. Gemini 3.1 Pro Preview 69.º de 200
• Precio por 1 millón de tokens — Step 5 Preview $1.00 de entrada / $2.70 de salida vs. Gemini 3.1 Pro $2.00 de entrada / $12.00 de salida
• Descuento de caché — Step 5 Preview 95% vs Gemini 3.1 Pro 90%
• Velocidad de salida — Step 5 Preview 99.8 tokens/seg vs Gemini 3.1 Pro 118.9 tokens/seg
• Tiempo hasta el primer token — Step 5 Preview 2,96 s frente a Gemini 3.1 Pro 35,72 s
• Contexto — ambos 1M tokens; nuestro catálogo incluye Gemini 3.1 Pro con un límite de salida de 65K, StepFun no ha publicado ninguno
• Modalidades de entrada — Step 5 Preview: texto e imagen. Gemini 3.1 Pro: texto, imagen, audio, vídeo y archivo. Ambos solo generan texto.
• Pesos — Step 5 Preview cerró hoy, checkpoint BF16 programado para el 15 de octubre; Gemini 3.1 Pro propietario en su totalidad
Una brecha de 14 puntos en una escala en la que la cima de la tabla se sitúa en 53 es grande, y debería informarse junto a lo que la hace extraña: las cifras de evaluación publicadas por el propio Google para este modelo son excelentes. El proveedor informa 77,1 % en ARC-AGI-2, 82,8 % en su suite multimodal, 94,1 en GPQA Diamond y 47,0 en Humanity's Last Exam. Esas no son cifras débiles. Además, son de Google, ejecutadas en los arneses de Google, y miden capacidades específicas en lugar del agregado que puntúa el índice. Ambos conjuntos de números pueden ser exactos a la vez. Cuando la evaluación principal de un proveedor y un compuesto independiente discrepan de forma tan marcada, el compuesto es la referencia con la que hay que planificar una carga de trabajo de producción, porque es el que penaliza al modelo por las cosas que el proveedor no eligió medir.
Las dos filas de velocidad merecen leerse juntas en lugar de por separado. Gemini 3.1 Pro genera tokens un 19 % más rápido una vez que arranca —118,9 frente a 99,8— y tarda 35,72 segundos en arrancar, frente a los 2,96 de Step 5 Preview. Ese es el perfil de un modelo que delibera antes de emitir. Para un trabajo por lotes en el que no hay una persona esperando, el generador más rápido gana en rendimiento. Para un bucle de agente que hace docenas de llamadas dependientes, una diferencia de doce veces en el tiempo hasta el primer token es la diferencia entre una herramienta interactiva y una cola.

El único eje en el que Gemini gana de forma contundente
La modalidad no es una nota al pie en esta comparación. Gemini 3.1 Pro acepta texto, imágenes, audio, video y archivos arbitrarios, y Step 5 Preview acepta texto e imágenes. Si tu flujo de trabajo incluye una grabación de pantalla, una grabación de llamada, un conjunto de PDF o una señal de video, solo uno de estos dos modelos puede siquiera recibir la entrada, y la diferencia de 14 puntos en el índice es irrelevante porque el otro modelo no puede responder la pregunta.
Esa asimetría decide más cargas de trabajo reales que las tablas de benchmarks. La revisión de vídeo, el análisis de reuniones, la transcripción de audio más razonamiento, y los flujos de trabajo documentales basados en archivos escaneados son todos casos en los que la amplitud de Gemini 3.1 Pro lo convierte en el único candidato de esta página. También es la razón por la que el modelo ha permanecido en producción durante siete meses bajo una etiqueta de vista previa: las cargas de trabajo que soporta son aquellas en las que un modelo más reciente de texto e imagen no puede desplazarlo.
Para el trabajo con texto e imágenes, el cálculo se invierte. Step 5 Preview va 14 puntos por delante en el agregado, es aproximadamente el doble de rápido en el precio de entrada y 4,4 veces más barato en la salida, y responde en una duodécima parte del tiempo. En una carga de trabajo de extracción de documentos o de chat sobre capturas de pantalla, no hay razón para pagar el sobreprecio y esperar los once segundos adicionales de deliberación.
Donde el precio resulta menos plano de lo que parece
Los precios anunciados subestiman la diferencia, y la razón es un límite de tramo en lugar de una tarifa.
Los $2.00 y $12.00 de Gemini 3.1 Pro se mantienen hasta los 200,000 tokens de entrada. Por encima de eso, ambas tarifas pasan a $4.00 y $18.00 — un aumento del 50% en la salida que se aplica a toda la solicitud, no solo a la parte que supera el límite. Los $1.00 y $2.70 de Step 5 Preview no tienen un nivel publicado; el precio es el precio para cualquier longitud que permita la ventana de contexto.
Ambos modelos anuncian un contexto de 1M de tokens, así que los dos te invitan a construir pipelines de contexto largo. En uno de ellos, una solicitud de 300.000 tokens cuesta el doble de lo que sugiere la lista de precios; en el otro, no. Esa es una ventaja estructural para Step 5 Preview justo en la categoría para la que StepFun lo creó —trabajo agéntico de horizonte largo con un contexto amplio al que se hace referencia repetidamente—, y se ve reforzada por el descuento de caché, donde el 95% de Step 5 Preview frente al 90% de Gemini 3.1 Pro amplía aún más la diferencia en el patrón de prefijo repetido que genera un bucle de agente.
Calculado a grandes rasgos y señalado como aritmética más que como una cifra citada: un bucle de agente que envía un contexto de 250.000 tokens en cada uno de cuarenta turnos son diez millones de tokens de entrada. A la tarifa superior a 200K de Gemini 3.1 Pro, con la caché absorbiendo el prefijo repetido, eso es un aumento significativo respecto a lo que implica la tarifa de lista de $2.00. Con la tarifa plana de $1.00 de Step 5 Preview y un descuento de caché más profundo, el mismo bucle cuesta menos y, lo que es más importante, cuesta algo que puedes predecir a partir de la lista de precios sin leer antes la tabla de niveles.

La disponibilidad es la diferencia silenciosa
Gemini 3.1 Pro ha sido invocable durante siete meses a través de la API de Google y, de manera más útil para la planificación, a través de múltiples proveedores independientes, que es lo que hace que una cifra de latencia p50 sea significativa en lugar de anecdótica. Step 5 Preview abrió su API el 20 de septiembre y tiene exactamente una fuente. Un endpoint de una sola fuente que tiene apenas unos días es el componente menos predecible que podrías poner en una ruta de producción, no porque el modelo sea malo, sino porque nadie conoce todavía su curva de capacidad.
Ese es el argumento a favor del enrutamiento en lugar de elegir. Gemini 3.1 Pro Preview está en nuestro catálogo a $2.00 y $12.00 con el escalón de nivel traspasado sin cambios, y los modelos con los que se lo compara están junto a él, detrás de una sola clave para más de 200 modelos, con el precio de lista del proveedor traspasado con un 0% de margen. Step 5 Preview no está en esa lista: se ejecuta en la API propia de StepFun y, hasta que lleguen los pesos, ese es el único lugar donde se ejecuta. La conmutación automática por error es lo que hace que una preview de pocos días sea segura de probar en lugar de una apuesta: mantén la ruta de producción en un modelo con historial comprobado, envía el grueso de texto e imágenes a Step 5 Preview mientras lo evalúas con tu propio tráfico, y deja que el respaldo aguante cuando el endpoint de la preview se degrade. No hay un segundo contrato ni un SDK aparte para los modelos que sí enrutamos, así que un cambio de precios de Google aparece en tu factura como la cifra vigente en lugar de al renovar.

¿Cuál estás comprando en realidad?
Si tu trabajo llega como video, audio o archivos, Gemini 3.1 Pro es el único modelo en esta página que puede aceptarlo, y la diferencia de índice no entra en la decisión. Siete meses en producción con la etiqueta de vista previa aún puesta es una señal de estabilidad, no una advertencia: la convención de nombres persiste porque Google nunca ha necesitado cambiarla, y el modelo se comporta como el caballo de batalla de producción que es.
Si tu trabajo son texto e imágenes en volumen con un contexto grande y repetido, Step 5 Preview va por delante en todas las métricas que importan: 14 puntos de índice, la mitad del precio de entrada, una tarifa de salida 4,4 veces más barata, sin acantilado de niveles, un descuento de caché más profundo y un tiempo hasta el primer token medido en segundos en lugar de en medio minuto. Lo que compras ahí es un endpoint de fuente única con unos días de antigüedad, sin licencia publicada y sin techo de salida publicado, lo cual es un riesgo real y acotado.
Lo que hay que observar no es el índice. Es si StepFun publica un techo de salida junto con la ventana de contexto de 1M de tokens, porque el anuncio del proveedor no dice nada al respecto y una configuración independiente de terceros que circuló durante la filtración indicaba 350.000 de contexto con un límite de salida de 64.000 — un producto materialmente distinto del que figura en la lista de precios. El techo de 65K de Gemini 3.1 Pro, tal como lo enumera nuestro catálogo, tampoco es generoso, pero está declarado, y un límite declarado es uno que puedes tener en cuenta al diseñar.
