Une carte de titre hero générée avec le gros titre « StepAudio 3 ASR vs StepAudio 3 » et le sous-titre « L'un est un modèle. L'autre est cinq produits portant un seul nom », au-dessus du pied de page « Chiffres StepFun tels que publiés en septembre 2026. »
Guides & Insights

StepAudio 3 ASR vs StepAudio 3 : Aucun modèle ne porte ce nom

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Cherchez StepAudio 3 et vous trouverez une famille, pas un modèle. La sortie audio de StepFun du 15 septembre 2026 a placé cinq produits sous ce nom — Realtime, ASR, synthèse vocale, Gen et Music — et le produit de transcription parmi eux, StepAudio 3 ASR, est celui qui ne cesse de grimper dans les classements depuis. Le palier que la documentation de StepFun elle-même qualifie de plus grand modèle ASR à ce jour est StepAudio 3 ASR Max, et le pendant conversationnel avec lequel il partage une architecture est StepAudio 3 Realtime. Si vous essayez de comparer « StepAudio 3 ASR » à « StepAudio 3 », vous comparez un produit à une gamme de produits, et la réponse dépend entièrement duquel des trois vous vouliez réellement parler.

Cette page résout ce problème. Il ne s'agit pas d'une comparaison marketing : c'est la clarification dont vous avez besoin avant de pouvoir lire correctement la moindre fiche technique de StepAudio 3, car les trois noms ci-dessus correspondent à des prix différents, des points de terminaison différents et des modes de défaillance différents.

Pourquoi le nom est ambigu

StepFun a livré toute la pile audio en une journée, et la convention de nommage a fait du nom de famille le radical de chaque nom de produit. C’est propre sur une diapositive de lancement et peu pratique partout ailleurs. Cela signifie qu’une recherche du nom de famille renvoie un mélange de cinq produits différents, et une ligne de benchmark étiquetée « StepAudio 3 » pourrait plausiblement être n’importe lequel d’entre eux.

La conséquence pratique, c’est qu’à la lecture d’un titre, vous ne pouvez pas savoir quelle chose a été mesurée. Une publication qui dit « StepAudio 3 arrive en tête du classement de la transcription » décrit StepAudio 3 ASR. Une publication qui dit « StepAudio 3 gagne sur la dynamique conversationnelle » décrit StepAudio 3 Realtime. Les deux affirmations sont vraies, il s’agit de produits différents, et ils ne sont pas interchangeables.

Il existe une seconde ambiguïté, spécifiquement au sein de la gamme ASR. La documentation de StepFun désigne un niveau ASR Max comme son plus grand modèle ASR à ce jour, avec sa propre tarification et son propre point de terminaison, tandis que les lignes du classement public portent un libellé plus simple. Déterminer s'il s'agit d'un seul SKU sous deux noms ou de deux SKU est la chose la plus utile que cette page puisse faire, et la section suivante s'en charge.

Les trois choses que le nom peut signifier

StepAudio 3 ASR — le produit de transcription. Un point de terminaison en streaming qui renvoie du texte incrémentiel au fur et à mesure du décodage et une transcription finale à la fin. StepFun le décrit comme une transcription à laquelle est associé un modèle de langage pour le contexte, optimisée pour l’audio médical, juridique, financier, automobile et de programmation, ainsi que pour des entrées difficiles comme les chuchotements, la parole rapide, la parole liée, le chant et la musique de fond. C’est le modèle affichant un taux d’erreur de mot de 1,7 % sur l’indice AA-WER d’Artificial Analysis pour la transcription vocale non en streaming.

StepAudio 3 ASR Max — le palier que la documentation de StepFun présente comme son plus grand modèle ASR à ce jour. Il affiche le tarif catalogue publié de 2,8 yuans par heure. Ce n'est pas un transcripteur bon marché ; c'est le haut de la gamme ASR.

StepAudio 3 Realtime — le modèle conversationnel full-duplex. Il raisonne directement sur la parole plutôt que d’exécuter une chaîne « transcrire puis raisonner », et il transcrit comme sous-produit de cela. Ce n’est pas un produit ASR, et sa précision sur les tâches de transcription n’est pas ce pour quoi il a été optimisé.

Tout le reste dans la famille — TTS, Gen, Music — relève d'un tout autre métier et ne devrait pas du tout figurer dans une comparaison de transcription.

ASR et ASR Max sont-ils le même modèle ?

Les éléments de preuve indiquent que oui, et la vérification est arithmétique. StepFun indique le palier ASR Max à 2,8 yuans par heure. Converti à environ 7,1 yuans pour un dollar, cela fait environ 0,39 $ l’heure, soit environ 6,6 $ pour 1 000 minutes. Artificial Analysis répertorie le modèle dans son classement à 6,67 $ pour 1 000 minutes. Deux chiffres publiés indépendamment, l’un provenant de la liste de prix du fournisseur et l’autre du tableau tiers, à un centime près l’un de l’autre. C’est ce à quoi on s’attendrait si la ligne du classement et le tarif catalogue d’ASR Max décrivaient le même SKU.

Il vaut la peine d’être précis sur ce que cela prouve et ne prouve pas. Cela prouve que l’axe des prix du classement et la grille tarifaire du fournisseur décrivent le même produit au même prix. Cela ne prouve pas que le 1,7 % du classement a été mesuré sur l’endpoint exact que vous appelleriez, car le classement ne publie ni sa configuration de décodage ni l’endpoint qu’il a sollicité. Donc : même produit, très probablement ; mêmes conditions de mesure, non vérifié.

Ce qui est certain, c'est le saut générationnel au sein de la gamme. StepAudio 2.5 ASR se situe à 4,7 % sur le même tableau à 0,15 yuan de l'heure. Le palier actuel est à 1,7 % à 2,8 yuan de l'heure. Cela représente une réduction de 64 % du taux d'erreur sur les mots pour environ dix-neuf fois le tarif — le compromis le plus tranchant de la famille et celui qui détermine si la mise à niveau en vaut la peine.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Les dimensions qui diffèrent réellement

Une fois la dénomination arrêtée, la comparaison se réduit à une courte liste. Voici celles qui font basculer une décision :

• Précision — StepAudio 3 ASR affiche un AA-WER de 1,7 % en non-streaming, contre StepAudio 2.5 ASR à 4,7 % sur le même classement. Mesure réalisée par Artificial Analysis, et non par StepFun.

• Prix — 2,8 yuan par heure contre 0,15 yuan par heure. Tous deux sont des tarifs catalogue des fournisseurs, tous deux actuels. Environ 19 fois.

• Poids — API hébergée uniquement pour les deux. Aucun poids ouvert nulle part dans la famille, aucune voie sur site, aucune option d’auto-hébergement à quelque niveau que ce soit.

• Forme du point de terminaison — un point de terminaison unique de transcription en streaming renvoyant du texte incrémental et final, par rapport à la même forme dans la génération précédente. Rien n’a changé dans le modèle d’intégration, donc une migration consiste à échanger un identifiant de modèle plutôt qu’à réécrire le code.

• Réglage pour les cas audio difficiles — StepAudio 3 ASR est explicitement optimisé pour la parole chuchotée, rapide, enchaînée et chantée, ainsi que pour les enregistrements audio comportant de la musique en fond. Cette optimisation est le produit ; la génération précédente n’a pas été conçue pour cela.

Gains par domaine annoncés par le fournisseur — StepFun rapporte une baisse de 9,3 % pour le chinois, de 25,0 % pour l’anglais, de 22,3 % pour les dialectes, de 42,1 % pour les verticales et de 27,9 % pour l’alternance codique d’une génération à l’autre. Ces chiffres sont rapportés par le fournisseur et non reproduits ; il convient donc de les considérer comme indicatifs.

Notablement absents de cette liste : la longueur du contexte, la prise en charge des formats audio, la durée audio maximale et un identifiant de modèle. La documentation publique de StepFun pour ce modèle ne les indique pas, et quiconque cite ces chiffres cite autre chose.

ASR vs Realtime est la comparaison dont les gens ont réellement besoin.

Si vous choisissez entre des produits de transcription plutôt qu’entre des générations, la comparaison intéressante n’est pas ASR face à ASR Max — c’est ASR face à Realtime. La documentation technique de StepFun indique que les deux partagent leurs étapes de pré-entraînement et d’entraînement intermédiaire et ne divergent que lors du fine-tuning supervisé. Même base, fine-tuning différent, produit différent.

Ce seul fait a une lecture pratique. Le taux d’erreur de mot de 1,7 % est une propriété du fine-tuning de l’ASR. Ce n’est pas une promesse concernant le modèle temps réel, qui optimise la gestion des tours de parole, le traitement des interruptions et le raisonnement sur la parole plutôt que l’exactitude de la transcription. Si votre architecture transcrit comme effet secondaire d’une conversation en direct, vous n’achetez pas les 1,7 % — vous achetez un modèle conversationnel qui se trouve émettre du texte.

L'inverse est également vrai, et moins évident : parce qu'ils partagent un socle, le modèle ASR n'est pas un petit modèle spécialisé greffé sur la famille. C'est un système de même envergure, ajusté finement différemment. C'est pourquoi le tarif de l'ASR est proche de celui du reste de la famille plutôt que proche du bas de gamme du marché.

Que faire de ceci si vous en choisissez un

Trois questions suffisent pour trancher. Avez-vous besoin d’une transcription, ou avez-vous besoin d’une conversation ? S’il s’agit d’une transcription, StepAudio 3 ASR est le produit et le nom de famille est du bruit. S’il s’agit d’une conversation, vous voulez StepAudio 3 Realtime et vous ne devriez pas du tout lire de benchmarks ASR. Et si vous avez besoin de la transcription d’un audio vraiment difficile — avec accent, chuchoté, chanté, ou avec de la musique en dessous — le surcoût de 19x est le prix du palier qui a été optimisé pour cela, et le test honnête, c’est votre propre audio plutôt qu’un indice composite.

La décision qu'il est facile de prendre à tort est de considérer la couche de transcription comme permanente. Quoi que vous choisissiez, la transcription est une entrée pour autre chose — un outil de résumé, une extraction structurée, un contrôle de conformité, un index de recherche — et ces appels aboutissent sur des modèles de texte ordinaires. C'est la couche qui évolue avec l'usage plutôt qu'avec les minutes d'audio, et c'est la couche qu'il vaut la peine de garder portable dès le départ. OrcaRouter place près de 200 modèles de texte derrière une seule APIavec un basculement automatique entre fournisseurs, un DSL de routage qui en compose plusieurs en un seul appel, et une fusion de modèles lorsque le jugement d'un seul modèle ne suffit pas. Lorsqu'un fournisseur publie un tarif, ce prix catalogue est répercuté sans marge, de sorte qu'un changement de prix côté texte se répercute sur votre facture le jour même de son annonce.

Pour être clair sur le périmètre, puisque cette page concerne une famille que nous ne servons pas : aucun point de terminaison StepAudio 3 ne se trouve sur OrcaRouter. Les modèles de transcription et de voix sont accessibles via l’API propre à StepFun. Ce qu’OrcaRouter prend en charge, c’est la couche de raisonnement en aval de la transcription, là où une décision de bascule est peu coûteuse à prendre et coûteuse à reporter.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Ce que personne n'a réglé

La question du nom est résoluble. Celle de la performance ne l’est pas encore. Il n’existe toujours aucun rapport technique publié pour le modèle ASR, aucun jeu de test rendu public, aucune configuration de décodage et aucun protocole reproductible provenant de qui que ce soit en dehors de StepFun, et les comparaisons du fournisseur lui-même portent sur d’autres produits ASR chinois plutôt que sur le modèle à poids ouverts dominant. Le 1,7 % est une véritable mesure réalisée par un tiers sur un indice composite de trois jeux de données ; tout le reste concernant ce modèle est une affirmation du fournisseur.

Deux choses changeraient la donne. Un face-à-face avec Whisper Large v3 Turbo sur un audio identique, que personne n’a publié. Et un tarif pour le reste de la gamme — quatre des cinq modèles StepAudio 3 étaient encore sous une tarification d’aperçu gratuit à durée limitée au lancement, et seules la transcription et la synthèse disposaient de tarifs publiés, ce qui signifie que la grille tarifaire que vous pouvez consulter aujourd’hui ne couvre que deux produits sur cinq.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

C'est la couche qui évolue avec l'usage plutôt qu'avec les minutes audio, et c'est la couche qu'il vaut la peine de garder portable dès le départ. basculement automatique entre fournisseurs, un DSL de routage qui en compose plusieurs en un seul appel, et la fusion de modèles lorsque le jugement d'un modèle ne suffit pas.