Une carte de titre hero générée, avec le titre principal « StepAudio 3 ASR vs Whisper Large v3 Turbo » et le sous-titre « 1,7 pour cent contre 4,6 pour cent, et aucun test comparatif direct n'existe », au-dessus du pied de page « StepAudio selon Artificial Analysis ; Whisper selon Hugging Face. »
Guides & Insights

StepAudio 3 ASR vs Whisper Large v3 Turbo : 1,7 % contre 4,6 %, et personne n'a fait le test

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La comparaison que vous recherchez n'existe pas. StepAudio 3 ASR et Whisper Large v3 Turbo se situent sur le même indice AA-WER d'Artificial Analysis pour la reconnaissance vocale non-streaming — 1,7 % de taux d'erreur de mot, contre des chiffres de l'ordre de 4 à 5,5 % — et depuis fin septembre 2026, personne n'a publié de comparaison directe sur un audio identique. Ni StepFun, ni les mainteneurs de Whisper, ni un laboratoire indépendant. La documentation de StepFun elle-même établit des benchmarks face à Doubao ASR 2.0, Seed 2.0 Lite et HY3.0 ASR Preview, tous des produits de reconnaissance vocale chinois. Du côté de Whisper, aucun fournisseur ne publie de comparaisons, car Whisper Large v3 Turbo est téléchargeable depuis des années et ses chiffres dépendent de celui qui le déploie.

Ainsi, cette page propose la version honnête : elle consulte le seul classement qui mesure les deux, sépare ce qui est comparable de ce qui ne l'est pas, et indique clairement où les preuves s'arrêtent. La réponse courte est que l'écart en matière de précision est réel et d'environ trois points, et que l'écart sur tout le reste — prix, licence, facilité de déploiement — va dans l'autre sens et est plus important.

Ce que chacun est réellement

StepAudio 3 ASR est un modèle de transcription hébergé publié par StepFun le 15 septembre 2026 dans le cadre de la famille audio StepAudio 3, composée de cinq modèles. Il est accessible via un point de terminaison de streaming unique qui renvoie du texte incrémental pendant le décodage et une transcription finale à la fin. StepFun le décrit comme de la transcription à laquelle est attaché un modèle de langage pour le contexte, optimisée pour l'audio médical, juridique, financier, automobile et de programmation, ainsi que pour les entrées qui mettent en échec les reconnaisseurs conventionnels — parole chuchotée, parole rapide, parole liée, chant et audio avec de la musique en dessous. Il n'existe pas de poids ouverts, pas de déploiement sur site et aucune option d'auto-hébergement, quel que soit le niveau. Le tarif catalogue publié est de 2,8 yuans par heure, soit environ 6,67 $ pour 1 000 minutes sur l'axe de prix propre au classement.

Whisper Large v3 Turbo est un modèle à poids ouverts publié par OpenAI sous licence MIT : 809 millions de paramètres, 99 langues, un dérivé élagué et affiné de Whisper large-v3 avec un nombre réduit de couches de décodeur. Il a été téléchargé des millions de fois et est servi commercialement par une longue liste de plateformes et exécutable sur votre propre matériel. Cette dernière propriété constitue toute la comparaison, et c'est la raison pour laquelle l'écart de précision n'est pas le seul chiffre qui compte.

Le seul tableau qui mesure les deux

L'indice AA-WER d'Artificial Analysis indique le pourcentage de mots transcrits incorrectement, plus il est bas, mieux c'est, et sa version 2 combine trois jeux de données : AA-AgentTalk à 50 %, VoxPopuli-Cleaned-AA à 25 % et Earnings22-Cleaned-AA à 25 %. La vue non-streaming présente 36 des 71 modèles qu'il suit. Les deux modèles y figurent, ce que la plupart des comparaisons ne peuvent pas prétendre.

Lisez-les comme le conseil les liste :

• StepAudio 3 ASR — 1,7 % AA-WER, environ 6,67 $ par 1 000 minutes d’audio

• Whisper Large v3 Turbo, un point de terminaison hébergé — 4,6 % d’AA-WER, environ 0,67 $ par 1 000 minutes

• Whisper Large v3 Turbo, un deuxième point de terminaison hébergé — 5,5 % de AA-WER, environ 15,00 $ par 1 000 minutes

• Whisper Large v3, une autre génération à poids ouverts — 4,1 % sur un point de terminaison, 10,1 % sur un autre

• StepAudio 2.5 ASR, la génération précédente de StepFun — 4,7 %

Les deux dernières lignes sont les plus instructives du tableau, et elles ne concernent pas StepFun du tout. Les mêmes poids ouverts de Whisper obtiennent 4,1 % sur un point de terminaison et 10,1 % sur un autre. Soit un écart de 6 points sur des paramètres identiques, produit entièrement par des différences de serving : stratégie de découpage, matériel, configuration de décodage, et manière dont chaque hôte gère l’audio plus long que ses limites internes. La note de bas de page du tableau le dit d’ailleurs, en signalant que, pour l’un de ses jeux de données, certains modèles voient leur audio découpé en segments d’environ neuf minutes et d’autres en segments d’environ trente secondes en raison de limites de temps.

Ce qui signifie que la comparaison « StepAudio 3 ASR vs Whisper Large v3 Turbo » est en réalité deux comparaisons superposées. Le modèle face aux poids, et le modèle face à l’endpoint sur lequel vous avez effectué votre benchmark. La seconde varie davantage que la première.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

D'où vient l'écart de précision, et dans quelle mesure lui faire confiance

Trois points de taux d’erreur de mots représentent un écart considérable dans un domaine où les cinq meilleurs systèmes se tiennent à moins de 0,6 point les uns des autres. C’est aussi le seul chiffre de cette comparaison qu’une tierce partie ait mesuré, et il s’accompagne de réserves bien réelles qui jouent dans les deux sens.

Face à StepAudio 3 ASR : le chiffre est un indice composite, et la composition est à 50 % AA-AgentTalk — un jeu de données de conversations d’agents. Un modèle ajusté pour la transcription spécifique à un domaine, avec un LLM attaché pour le contexte, est bien adapté à ce type d’audio. Repondérez l’indice vers de la parole lue ou des actualités radiodiffusées, et le classement pourrait se resserrer. Il n’existe toujours aucun rapport technique publié pour le modèle ASR, aucun ensemble de test publié, aucune configuration de décodage et aucun protocole reproductible provenant de qui que ce soit en dehors de StepFun.

Face à Whisper Large v3 Turbo : ces 4,6 % correspondent au chiffre d'un point de terminaison hébergé, pas à une propriété du modèle. Les poids sont figés et publics ; le score, lui, ne l'est pas. Une équipe qui exécute ces mêmes poids avec soin, en découpant le flux de manière adaptée au domaine et avec une bonne configuration du décodeur, peut obtenir un résultat nettement meilleur que la ligne du tableau de bord — et une équipe qui les exécute sans rigueur peut obtenir un résultat pire que les 10,1 % affichés par l'autre génération de poids ouverts. Le résumé honnête, c'est que le camp des poids ouverts dans cette comparaison a un plancher que l'on peut mesurer et un plafond qu'il faut mériter.

Ce qui manque, c'est le chiffre qui trancherait : les deux systèmes, un seul ensemble audio, un seul protocole de décodage, le tout publié. Personne ne l'a fait, et tant que personne ne le fera, « 1,7 % vs 4,6 % » est une comparaison de deux mesures prises dans des conditions différentes plutôt qu'une mesure de deux systèmes l'un par rapport à l'autre.

Les quatre autres dimensions, où Whisper l’emporte davantage

L'exactitude est la dimension que StepFun remporte. Sur le reste de la liste, le modèle à poids ouverts n'est pas près du compte, et ce sont ces critères qui déterminent si un déploiement est possible tout court :

• Licence et poids — poids ouverts sous licence MIT avec 809 M de paramètres, contre une API hébergée sans poids publiés à aucun niveau.

• Déploiement — auto-hébergé, sur site, en réseau isolé (air-gapped), ou via l'une des dizaines de plateformes commerciales, contre l'API StepFun uniquement.

• Coût plancher — environ 0,67 $ pour 1 000 minutes sur un point de terminaison hébergé, et encore moins si vous l’exécutez vous-même, contre environ 6,67 $ pour 1 000 minutes au tarif publié du fournisseur.

• Résidence des données — l’audio ne quitte jamais l’infrastructure que vous contrôlez, contrairement à l’audio envoyé vers un point de terminaison tiers.

• Risque d’intégration — le modèle ne peut pas vous être retiré, re-tarifé ou déprécié sous vos pieds, parce que vous détenez les poids, contrairement à un tarif hébergé qui peut changer avec une grille tarifaire.

• Comportement sur les audios longs — le découpage en segments est à votre discrétion et peut être ajusté fichier par fichier, contrairement à ce que fait en interne le point de terminaison du fournisseur, qui n'est pas documenté.

Cet écart de prix est d'environ dix contre un par rapport au point de terminaison Whisper moins cher, et il est l'exact reflet de ce qui s'est passé au sein de la propre gamme de StepFun : le modèle que celui-ci remplace, StepAudio 2.5 ASR, était affiché à 0,15 yuan par heure, et le palier actuel est affiché à 2,8. StepFun a multiplié le tarif de transcription par environ dix-neuf pour acheter de la précision, ce qui le place sur un marché différent de celui d'un modèle à poids ouverts auto-hébergé plutôt que dans une version plus chère de celui-ci.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Lequel vous devriez choisir

La séparation est plus nette que dans la plupart des face-à-face :

• Choisissez Whisper Large v3 Turbo si l’audio est ordinaire, le volume est élevé, les données ne peuvent pas quitter votre infrastructure, ou si vous avez besoin que le déploiement soit permanent et à prix stable. La licence MIT signifie que la décision de revenir en arrière vous appartient et que personne ne peut vous la retirer.

• Choisissez StepAudio 3 ASR si l’audio est vraiment difficile — avec un accent, chuchoté, chanté ou accompagné de musique en arrière-plan — ou si le domaine fait partie des cinq pour lesquels StepFun a été optimisé. C’est ce que l’on achète avec l’offre premium, et sur cet audio, un écart de précision de trois points fait la différence entre une transcription utilisable et une passe de correction manuelle.

• N’adoptez ni l’un ni l’autre de façon exclusive si vous ne savez pas à quelle catégorie appartient votre audio. Le coût de se tromper est asymétrique : la voie des poids ouverts peut être testée sur votre propre matériel pour le prix d’une heure de GPU, et la voie hébergée ne coûte rien à essayer, mais vous engage sur un tarif que vous ne pouvez pas contrôler.

L'argument en faveur d'une solution hybride est plus fort ici que dans la plupart des comparaisons, et la raison en est l'écart entre les points de terminaison dans le classement. Comme les mêmes poids Whisper obtiennent un score allant de 4,1 % à 10,1 % selon qui les sert, la mesure pratique consiste à acheminer la voie des poids ouverts sur plus d'un hôte plutôt que de s'engager sur un seul — ce que vous apporte le basculement automatique, et c'est le même mécanisme qui vous permet de placer un modèle hébergé en amont d'un chemin de production sans faire dépendre ce chemin de lui.

Comment cela s’intègre à une stack, et ce que nous servons et ne servons pas

Quel que soit l’outil que vous choisissez pour la transcription, le texte transcrit va quelque part. Un outil de résumé, une extraction structurée, un contrôle de conformité, un index de recherche — ces appels aboutissent à des modèles textuels ordinaires, et ils constituent la partie de la facture qui évolue avec l’usage plutôt qu’avec les minutes audio. Le modèle temps réel de StepFun lui-même met en avant l’appel d’outils et l’exécution asynchrone de tâches longues, ce qui signifie que même la couche audio confie constamment du travail à quelque chose qui n’est pas un modèle audio.

Pour être explicite sur le périmètre, car il serait facile de laisser entendre le contraire : ni StepAudio 3 ASR ni Whisper Large v3 Turbo ne se trouvent sur OrcaRouter. StepAudio est accessible via l'API de StepFun, et les poids de Whisper sont à vous : à exécuter vous-même ou à confier à une plateforme d'hébergement. Ce qu'OrcaRouter propose, c'est la couche de délégation que la transcription alimente — près de 200 modèles de texte derrière une seule API, avec basculement automatique pour qu'un appel en aval ne meure pas à cause d'un seul fournisseur, un DSL de routage qui compose plusieurs modèles en un seul appel, et la fusion de modèles lorsque le jugement d'un seul modèle ne suffit pas. Lorsqu'un fournisseur publie un tarif, ce prix catalogue est répercuté sans marge, de sorte qu'un changement de tarif se répercute sur votre facture le jour de son annonce — ce qui, étant donné que cette comparaison inclut un fournisseur qui a multiplié par dix-neuf son tarif de transcription en une seule version, n'est pas un avantage hypothétique.

Si vous êtes sur le point de dépenser de l’argent réel sur la question de la précision, la séquence économique est la suivante : commencez par exécuter les poids ouverts sur votre propre audio, parce que c’est possible, et parce que le chiffre que vous obtiendrez sera plus pertinent que celui de n’importe quel classement. Décidez ensuite si l’écart qui subsiste vaut dix fois le tarif. La plupart des équipes constateront que cela vaut la peine pour une partie de leur trafic, mais pas pour le reste, et il s’agit là d’un problème de routage plutôt que d’un choix de modèle.

Qu'est-ce qui réglerait ça ?

Un test publié. Les deux systèmes, le même audio, le même protocole de décodage, une répartition honnête entre parole lue, audio conversationnel et les cas difficiles pour lesquels StepFun affirme avoir optimisé. Tant que cela n'existe pas, la comparaison oppose un indice tiers d'un côté à un ensemble de poids ouverts avec un score variable de l'autre, et la seule façon responsable de l'interpréter est d'y voir un point de départ plutôt qu'une réponse.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.