Una tarjeta de título principal generada con el titular 'StepAudio 3 ASR vs StepAudio 3' y el subtítulo 'Uno es un modelo. El otro son cinco productos con un mismo nombre', sobre el pie de página 'cifras de StepFun según lo publicado en septiembre de 2026.'
Guides & Insights

StepAudio 3 ASR vs StepAudio 3: No existe ningún modelo con ese nombre

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Busca StepAudio 3 y encontrarás una familia, no un modelo. El lanzamiento de audio de StepFun del 15 de septiembre de 2026 puso cinco productos bajo ese nombre —Realtime, ASR, texto a voz, Gen y Music—, y el producto de transcripción entre ellos, StepAudio 3 ASR, es el que ha estado escalando en las tablas de clasificación desde entonces. El nivel que la propia documentación de StepFun llama su modelo ASR más grande hasta la fecha es StepAudio 3 ASR Max, y la variante conversacional con la que comparte una arquitectura base es StepAudio 3 Realtime. Si intentas comparar «StepAudio 3 ASR» con «StepAudio 3», estás comparando un producto con una línea de productos, y la respuesta depende por completo de cuál de los tres querías decir en realidad.

Esta página resuelve eso. No es una comparación de marketing — es la desambiguación que necesitas antes de poder leer correctamente cualquier hoja de especificaciones de StepAudio 3, porque los tres nombres anteriores conllevan precios diferentes, endpoints diferentes y modos de fallo diferentes.

Por qué el nombre es ambiguo

StepFun lanzó todo el stack de audio en un día, y la convención de nomenclatura hizo que el nombre de la familia fuera la raíz de cada nombre de producto. Eso queda ordenado en una diapositiva de lanzamiento y resulta incómodo en cualquier otro contexto. Significa que una búsqueda del nombre de la familia devuelve una mezcla de cinco productos diferentes, y una fila de benchmark etiquetada como "StepAudio 3" podría ser plausiblemente cualquiera de ellos.

La consecuencia práctica es que no se puede saber a partir de un titular qué se midió. Una publicación que dice «StepAudio 3 encabeza la tabla de clasificación de transcripción» está describiendo StepAudio 3 ASR. Una publicación que dice «StepAudio 3 gana en dinámicas conversacionales» está describiendo StepAudio 3 Realtime. Ambas son ciertas, son productos diferentes y no son intercambiables.

Existe una segunda ambigüedad específicamente dentro de la línea de ASR. La documentación de StepFun se refiere a un nivel ASR Max como su modelo ASR más grande hasta la fecha, con su propia estructura de precios y su propio endpoint, mientras que las filas de la tabla de clasificación pública llevan la etiqueta más sencilla. Determinar si esos son un único SKU con dos nombres o dos SKU es lo más útil que puede hacer esta página, y la siguiente sección lo hace.

Las tres cosas que puede significar el nombre.

StepAudio 3 ASR — el producto de transcripción. Un endpoint de streaming que devuelve texto incremental a medida que decodifica y una transcripción final al final. StepFun lo describe como transcripción con un modelo de lenguaje adjunto para contexto, ajustado para audio médico, legal, financiero, automotriz y de programación, y para entradas difíciles como habla susurrada, habla rápida, habla conectada, canto y música de fondo. Es el modelo que se sitúa en una tasa de error de palabras del 1,7 % en el índice AA-WER de Artificial Analysis para voz a texto sin streaming.

StepAudio 3 ASR Max — el nivel que la documentación de StepFun denomina su modelo ASR más grande hasta la fecha. Tiene la tarifa de lista publicada de 2,8 yuanes por hora. No es un transcriptor más barato; es la cima de la gama ASR.

StepAudio 3 Realtime — el modelo conversacional de dúplex completo. Razona directamente sobre el habla en lugar de ejecutar una cadena de transcribir y luego razonar, y transcribe como subproducto de ello. No es un producto de ASR, y su precisión en tareas de transcripción no es aquello para lo que fue ajustado.

Todo lo demás en la familia —TTS, Gen, Music— es un trabajo completamente distinto y no debería aparecer en absoluto en una comparación de transcripción.

¿Son ASR y ASR Max el mismo modelo?

Las pruebas apuntan a que sí, y la verificación es aritmética. StepFun incluye el nivel ASR Max a 2,8 yuanes por hora. Convertido a una tasa aproximada de 7,1 yuanes por dólar, eso equivale a unos 0,39 USD por hora, o aproximadamente 6,6 USD por cada 1000 minutos. Artificial Analysis incluye el modelo en su tabla de clasificación a 6,67 USD por cada 1000 minutos. Dos cifras publicadas de forma independiente, una de la lista de precios del proveedor y otra del panel de terceros, que difieren en menos de un centavo. Eso es lo que cabría esperar si la fila de la tabla de clasificación y la tarifa de lista de ASR Max describen el mismo SKU.

Vale la pena ser precisos sobre lo que eso demuestra y lo que no. Demuestra que el eje de precios de la tabla de clasificación y la lista de precios del proveedor describen el mismo producto al mismo precio. No demuestra que el 1,7 % de la tabla de clasificación se haya medido en el endpoint exacto al que llamarías, porque la tabla no publica su configuración de decodificación ni el endpoint al que accedió. Así que: el mismo producto, muy probablemente; las mismas condiciones de medición, sin verificar.

Lo que es seguro es el salto generacional dentro de la línea. StepAudio 2.5 ASR se sitúa en el 4,7 % en la misma tabla a 0,15 yuanes por hora. El nivel actual es del 1,7 % a 2,8 yuanes por hora. Eso es una reducción del 64 % en la tasa de error de palabras a cambio de aproximadamente diecinueve veces la tarifa: el equilibrio más marcado de la familia y el que decide si vale la pena la actualización.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Las dimensiones que realmente difieren

Una vez que se decide el nombre, la comparación se reduce a una lista corta. Estas son las que cambian una decisión:

• Precisión — StepAudio 3 ASR con 1,7 % de AA-WER sin streaming frente a StepAudio 2.5 ASR con 4,7 % en la misma clasificación. Medido por Artificial Analysis, no por StepFun.

• Precio — 2,8 yuanes por hora frente a 0,15 yuanes por hora. Ambas tarifas de lista de proveedores, ambas vigentes. Aproximadamente 19 veces.

• Pesos — únicamente API alojada para ambos. No hay pesos abiertos en ningún punto de la familia, ni opción local, ni posibilidad de autoalojamiento en ningún nivel.

• Forma del endpoint — un único endpoint de transcripción en streaming que devuelve texto incremental y final frente a la misma forma de la generación anterior. Nada del modelo de integración ha cambiado, así que una migración es un cambio de identificador de modelo en lugar de una reescritura.

• Ajuste para audio difícil: StepAudio 3 ASR está ajustado explícitamente para habla susurrada, rápida, conectada y cantada, y para audio con música de fondo. Ese ajuste es el producto; la generación anterior no se diseñó para ello.

• Ganancias por dominio atribuidas al proveedor — StepFun informa que el chino cae un 9,3 %, el inglés cae un 25,0 %, los dialectos caen un 22,3 %, los verticales caen un 42,1 % y el cambio de código cae un 27,9 % de una generación a otra. Reportadas por el proveedor y no reproducidas, así que trátalas como direccionales.

Notablemente ausentes de esa lista: la longitud de contexto, la compatibilidad con formatos de audio, la duración máxima de audio y un identificador de modelo. La documentación pública de StepFun para este modelo no los indica, y cualquiera que cite esas cifras está citando otra cosa.

ASR vs Realtime es la comparación que la gente realmente necesita

Si estás eligiendo entre productos de transcripción en lugar de entre generaciones, la comparación interesante no es ASR frente a ASR Max, sino ASR frente a Realtime. El propio material técnico de StepFun dice que ambos comparten sus etapas de preentrenamiento y entrenamiento intermedio y solo divergen durante el ajuste fino supervisado. Misma base, diferente ajuste fino, diferente producto.

Ese único hecho tiene una lectura práctica. La tasa de error de palabras del 1.7% es una propiedad del ajuste fino del ASR. No es una promesa sobre el modelo en tiempo real, que optimiza la toma de turnos, el manejo de interrupciones y el razonamiento sobre el habla en lugar de la precisión de la transcripción. Si tu arquitectura transcribe como efecto secundario de una conversación en vivo, no estás comprando el 1.7% — estás comprando un modelo conversacional que resulta que emite texto.

Lo inverso también es cierto y menos evidente: como comparten una arquitectura base, el modelo ASR no es un pequeño modelo especializado adosado a la familia. Es un sistema de la misma escala, ajustado de forma diferente. Por eso la tarifa de ASR es cercana a la del resto de la familia en lugar de estar cerca del extremo barato del mercado.

Qué hacer con esto si vas a elegir uno

Tres preguntas lo resuelven. ¿Necesitas una transcripción o necesitas una conversación? Si es una transcripción, StepAudio 3 ASR es el producto y el nombre de la familia es ruido. Si es una conversación, quieres StepAudio 3 Realtime y no deberías estar leyendo benchmarks de ASR en absoluto. Y si necesitas una transcripción de audio realmente difícil —con acento, susurrado, cantado o con música de fondo—, el sobrecoste de 19x es el precio del nivel que se ajustó para ello, y la prueba honesta es tu propio audio en lugar de un índice combinado.

La decisión en la que es fácil equivocarse es tratar la capa de transcripción como permanente. Elijas lo que elijas, la transcripción es una entrada para otra cosa — un resumidor, una extracción estructurada, una verificación de cumplimiento, un índice de búsqueda — y esas llamadas recaen en modelos de texto ordinarios. Esa es la capa que escala con el uso en lugar de con los minutos de audio, y es la capa que vale la pena mantener portátil desde el principio. OrcaRouter pone casi 200 modelos de texto detrás de una API con conmutación automática entre proveedores, un DSL de enrutamiento que compone varios en una sola llamada, y fusión de modelos cuando el juicio de un modelo no es suficiente. Cuando un proveedor publica una tarifa, ese precio de lista se transmite sin margen, por lo que un cambio de precio en el lado del texto llega a tu factura el día en que se anuncia.

Para dejar claro el alcance, ya que esta página trata sobre una familia que no servimos: no hay ningún endpoint de StepAudio 3 en OrcaRouter. Se accede a los modelos de transcripción y voz a través de la propia API de StepFun. Lo que ofrece OrcaRouter es la capa de razonamiento posterior a la transcripción, que es donde una decisión de cambio es barata de tomar y costosa de posponer.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Lo que nadie ha resuelto

La cuestión del nombre es resoluble. La afirmación sobre el rendimiento aún no lo es. Todavía no hay ningún informe técnico publicado para el modelo ASR, ni un conjunto de pruebas publicado, ni una configuración de decodificación, ni un protocolo reproducible por parte de alguien ajeno a StepFun, y las propias comparaciones del proveedor son contra otros productos chinos de ASR en lugar de contra el líder actual de pesos abiertos. El 1,7 % es una medición real de terceros sobre un índice combinado de tres conjuntos de datos; todo lo demás sobre este modelo es una afirmación del proveedor.

Dos cosas cambiarían el panorama. Una comparación directa con Whisper Large v3 Turbo usando el mismo audio, que nadie ha publicado. Y una tarifa para el resto de la familia: cuatro de los cinco modelos de StepAudio 3 seguían con precios de vista previa gratuita por tiempo limitado en el lanzamiento, y solo la transcripción y la síntesis tenían tarifas publicadas, lo que significa que la lista de precios que puedes consultar hoy cubre dos de cinco productos.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Esa es la capa que escala con el uso en lugar de con los minutos de audio, y es la capa que vale la pena mantener portable desde el principio. conmutación por error automática entre proveedores, un DSL de enrutamiento que combina varios en una sola llamada, y fusión de modelos cuando el juicio de un solo modelo no es suficiente.