Una tarjeta de título principal generada con el titular 'StepAudio 3 ASR vs Whisper Large v3 Turbo' y el subtítulo '1,7 por ciento frente a 4,6 por ciento, y no existe ninguna prueba comparativa directa', sobre el pie de página 'StepAudio según Artificial Analysis; Whisper según Hugging Face.'
Guides & Insights

StepAudio 3 ASR vs. Whisper Large v3 Turbo: 1,7 % frente a 4,6 %, y nadie ha ejecutado la prueba

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La comparación que buscas no existe. StepAudio 3 ASR y Whisper Large v3 Turbo se sitúan en el mismo índice AA-WER de Artificial Analysis para voz a texto sin streaming — 1,7 % de tasa de error de palabras frente a cifras en el rango del 4 al 5,5 % — y, a finales de septiembre de 2026, nadie ha publicado una comparación directa sobre audio idéntico. Ni StepFun, ni los mantenedores de Whisper, ni un laboratorio independiente. La propia documentación de StepFun compara con Doubao ASR 2.0, Seed 2.0 Lite y HY3.0 ASR Preview, todos productos de ASR chinos. El lado de Whisper no tiene ningún proveedor que publique comparaciones, porque Whisper Large v3 Turbo se puede descargar desde hace años y sus cifras dependen de quién lo sirve.

Así que esta página hace la versión honesta: lee la única tabla que mide ambas cosas, separa lo que es comparable de lo que no, y dice con claridad dónde se agotan las pruebas. La respuesta breve es que la brecha en precisión es real y de unos tres puntos de ancho, y la brecha en todo lo demás —precio, licencia, capacidad de despliegue— va en la dirección opuesta y es mayor.

Lo que realmente es cada uno

StepAudio 3 ASR es un modelo de transcripción alojado lanzado por StepFun el 15 de septiembre de 2026 como parte de la familia de audio StepAudio 3 de cinco modelos. Se accede a él a través de un único endpoint de streaming que devuelve texto incremental durante la decodificación y una transcripción final al terminar. StepFun lo describe como transcripción con un modelo de lenguaje adjunto para aportar contexto, optimizado para audio médico, legal, financiero, automotriz y de programación, y para entradas que hacen fallar a los reconocedores convencionales: habla susurrada, habla rápida, habla conectada, canto y audio con música de fondo. No hay pesos abiertos, ni vía local, ni opción de autoalojamiento en ningún nivel. La tarifa de lista publicada es de 2,8 yuanes por hora, aproximadamente $6,67 por cada 1000 minutos en el propio eje de precios de la tabla de clasificación.

Whisper Large v3 Turbo es un modelo de pesos abiertos publicado por OpenAI bajo la licencia MIT: 809 millones de parámetros, 99 idiomas, un derivado podado y ajustado de Whisper large-v3 con las capas del decodificador reducidas. Se ha descargado millones de veces y una larga lista de plataformas lo ofrece de forma comercial, además de poder ejecutarse en tu propio hardware. Esa última propiedad constituye toda la comparación, y es la razón por la que la brecha de precisión no es el único número que importa.

El único tablero que mide ambos

El índice AA-WER de Artificial Analysis informa el porcentaje de palabras transcritas incorrectamente; cuanto menor sea, mejor, y su versión 2 combina tres conjuntos de datos: AA-AgentTalk al 50 %, VoxPopuli-Cleaned-AA al 25 % y Earnings22-Cleaned-AA al 25 %. La vista sin streaming muestra 36 de los 71 modelos que rastrea. Ambos modelos aparecen en ella, algo que la mayoría de las comparaciones no puede afirmar.

Léelo tal como el tablero los enumera:

• StepAudio 3 ASR — 1.7% AA-WER, aproximadamente $6.67 por cada 1,000 minutos de audio

• Whisper Large v3 Turbo, un endpoint alojado — 4.6% de AA-WER, aproximadamente $0.67 por cada 1,000 minutos

Whisper Large v3 Turbo, un segundo endpoint alojado — 5,5 % de AA-WER, alrededor de 15,00 $ por cada 1000 minutos

• Whisper Large v3, una generación distinta de pesos abiertos — 4,1 % en un endpoint, 10,1 % en otro

• StepAudio 2.5 ASR, la generación anterior de StepFun — 4.7%

Las dos últimas líneas son las más instructivas del tablero, y no tienen nada que ver con StepFun. Los mismos pesos abiertos de Whisper obtienen un 4,1 % en un endpoint y un 10,1 % en otro. Eso supone una diferencia de 6 puntos con parámetros idénticos, generada enteramente por diferencias en el servicio: estrategia de fragmentación, hardware, configuración de decodificación y la forma en que cada host maneja el audio que supera sus límites internos. La propia nota al pie del tablero lo confirma, al señalar que, para uno de sus conjuntos de datos, a algunos modelos se les fragmenta el audio en segmentos de unos nueve minutos y a otros en segmentos de unos treinta segundos debido a límites de tiempo.

Lo que significa que la comparación «StepAudio 3 ASR vs Whisper Large v3 Turbo» en realidad son dos comparaciones apiladas. El modelo frente a los pesos, y el modelo frente al endpoint que hayas utilizado para hacer el benchmark. La segunda varía más que la primera.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

De dónde viene la brecha de precisión y cuánto confiar en ella

Tres puntos de tasa de error de palabras es una gran diferencia en un campo donde los cinco mejores sistemas se sitúan a menos de 0,6 puntos entre sí. También es el único número de esta comparación que midió un tercero, y conlleva salvedades reales que cortan en ambos sentidos.

En contra de StepAudio 3 ASR: la cifra es un índice combinado, y la combinación es 50 % AA-AgentTalk — un conjunto de datos de conversaciones de agentes. Un modelo ajustado para transcripción específica de dominio con un LLM adjunto para contexto está bien adaptado a ese tipo de audio. Si se reponderara el índice hacia habla leída o noticias de difusión, el orden podría estrecharse. Además, todavía no hay ningún informe técnico publicado para el modelo ASR, ni un conjunto de pruebas publicado, ni una configuración de decodificación, ni un protocolo reproducible de nadie fuera de StepFun.

Frente a Whisper Large v3 Turbo: el 4,6 % es el número de un endpoint alojado, no una propiedad del modelo. Los pesos son fijos y públicos; la puntuación no lo es. Un equipo que ejecute los mismos pesos con cuidado, con un chunking adecuado al dominio y una buena configuración del decodificador, puede obtener resultados notablemente mejores que la fila de la tabla —y un equipo que los ejecute sin cuidado puede obtener resultados peores que el 10,1 % que publicó la otra generación de pesos abiertos. El resumen honesto es que el lado de pesos abiertos de esta comparación tiene un suelo que se puede medir y un techo que hay que ganarse.

Lo que falta es el número que lo resolvería: ambos sistemas, un mismo conjunto de audio, un mismo protocolo de decodificación, y todo publicado. Nadie lo ha llevado a cabo, y hasta que alguien lo haga, «1,7 % frente a 4,6 %» es una comparación de dos mediciones tomadas en condiciones distintas, más que una medición de dos sistemas entre sí.

Las otras cuatro dimensiones, donde Whisper gana por un margen mayor

La precisión es la dimensión que gana StepFun. En el resto de la lista, el modelo de pesos abiertos no se acerca, y estas son las que deciden si un despliegue es posible en absoluto:

• Licencia y pesos — pesos abiertos con licencia MIT y 809M de parámetros frente a una API alojada sin pesos publicados en ningún nivel.

• Despliegue — autoalojado, en las instalaciones, con aislamiento de red o a través de cualquiera de docenas de plataformas comerciales vs. únicamente la API de StepFun.

• Costo mínimo: alrededor de $0,67 por cada 1.000 minutos en un endpoint alojado, y aún más bajo si lo ejecutas por tu cuenta, frente a alrededor de $6,67 por cada 1.000 minutos según la tarifa publicada del proveedor.

• Residencia de datos — el audio nunca sale de la infraestructura que usted controla frente al audio que se envía a un punto de conexión de terceros.

• Riesgo de integración — el modelo no puede ser retirado, cambiado de precio ni declarado obsoleto a tus espaldas, porque tú tienes los pesos, a diferencia de una tarifa alojada que puede cambiar con una lista de precios.

• Comportamiento con audio largo — el chunking es decisión tuya y se puede ajustar por archivo, frente a lo que el endpoint del proveedor haga internamente, que no está documentado.

Esa diferencia de precios es de aproximadamente diez a uno frente al endpoint Whisper más barato, y es la imagen especular de lo que ocurrió dentro de la propia línea de StepFun: el modelo al que este reemplaza, StepAudio 2.5 ASR, figuraba a 0,15 yuanes por hora, y el nivel actual figura a 2,8. StepFun aumentó la tarifa de transcripción unas diecinueve veces para comprar precisión, lo que lo sitúa en un mercado distinto del de un modelo autoalojado de pesos abiertos, en lugar de ser una versión más cara de este.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Cuál deberías elegir

La división es más nítida que en la mayoría de los cara a cara:

• Elige Whisper Large v3 Turbo si el audio es corriente, el volumen es alto, los datos no pueden salir de tu infraestructura o necesitas que el despliegue sea permanente y con precios estables. La licencia MIT significa que la decisión es tuya para revertirla y nadie puede retirarla.

• Usa StepAudio 3 ASR si el audio es realmente difícil —con acento, susurrado, cantado o con música de fondo— o si el dominio es uno de los cinco para los que StepFun está optimizado. Eso es lo que compra el premium, y en ese audio una diferencia de precisión de tres puntos es la diferencia entre una transcripción utilizable y una pasada de corrección manual.

• No optes por ninguna de las dos, de forma exclusiva, si no sabes cuál es tu audio. El costo de equivocarse es asimétrico: la ruta de pesos abiertos se puede probar en tu propio hardware por el precio de una hora de GPU, y la ruta alojada no cuesta nada probarla, pero te compromete con una tarifa que no puedes controlar.

El argumento a favor de un híbrido es más fuerte aquí que en la mayoría de las comparaciones, y la razón es la dispersión de endpoints en la tabla. Como los mismos pesos de Whisper obtienen puntuaciones de entre el 4,1 % y el 10,1 % según quién los sirva, la jugada práctica es enrutar la ruta de pesos abiertos a través de más de un servidor en lugar de comprometerse con uno solo —que es lo que te da la conmutación por error automática, y es el mismo mecanismo que te permite poner un modelo alojado delante de una ruta de producción sin apostar la ruta a él.

Cómo encaja esto en un stack, y qué servimos y qué no

Elijas lo que elijas para la transcripción, la transcripción va a parar a algún sitio. Un generador de resúmenes, una extracción estructurada, una verificación de cumplimiento, un índice de búsqueda: esas llamadas recaen en modelos de texto convencionales y son la parte de la factura que escala con el uso, no con los minutos de audio. El propio modelo en tiempo real de StepFun anuncia llamadas a herramientas y ejecución asíncrona de tareas largas, lo que significa que incluso la capa de audio está constantemente pasando trabajo a algo que no es un modelo de audio.

Para ser explícitos con el alcance, porque sería fácil dar a entender lo contrario: ni StepAudio 3 ASR ni Whisper Large v3 Turbo están en OrcaRouter. Se accede a StepAudio a través de la API propia de StepFun, y los pesos de Whisper son tuyos para ejecutarlos o llevarlos a una plataforma de alojamiento. Lo que ofrece OrcaRouter es la capa de delegación a la que se alimenta la transcripción — casi 200 modelos de texto detrás de una sola API, con conmutación por error automática para que una llamada descendente no se caiga junto con un único proveedor, un DSL de enrutamiento que compone varios modelos en una sola llamada, y fusión de modelos cuando el criterio de un solo modelo no basta. Cuando un proveedor publica una tarifa, ese precio de lista se traslada sin recargo, de modo que un cambio de precio llega a tu factura el día en que se anuncia — lo cual, dado que esta comparación incluye a un proveedor que multiplicó por diecinueve su tarifa de transcripción en una sola versión, no es un beneficio hipotético.

Si estás a punto de gastar dinero real en la cuestión de la precisión, la secuencia barata es esta: ejecuta primero los pesos abiertos con tu propio audio, porque puedes, y porque el número que obtengas será más relevante que el de cualquier tabla comparativa. Luego decide si la brecha que queda justifica diez veces la tarifa. La mayoría de los equipos descubrirá que vale la pena para una parte de su tráfico y no para el resto, y eso es un problema de enrutamiento más que una elección de modelo.

¿Qué lo resolvería?

Una prueba publicada. Ambos sistemas, el mismo audio, el mismo protocolo de decodificación, una división honesta entre habla leída, audio conversacional y los casos difíciles para los que StepFun afirma haberse ajustado. Hasta que eso exista, la comparación es un índice de terceros por un lado y un conjunto de pesos abiertos con una puntuación variable por el otro, y la única forma responsable de interpretarlo es como un punto de partida en lugar de una respuesta.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.