Сгенерированная карточка главного заголовка с заголовком «StepAudio 3 ASR против Whisper Large v3 Turbo» и подзаголовком «1,7 процента против 4,6 процента, и прямого сравнительного теста не существует», над футером «StepAudio по данным Artificial Analysis; Whisper по данным Hugging Face».
Guides & Insights

StepAudio 3 ASR против Whisper Large v3 Turbo: 1,7% против 4,6%, и никто не провёл этот тест

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сравнения, которое вы хотите, не существует. StepAudio 3 ASR и Whisper Large v3 Turbo находятся на одном и том же индексе Artificial Analysis AA-WER для непотокового распознавания речи в текст — 1,7% ошибок в словах по сравнению с показателями в диапазоне 4–5,5% — и по состоянию на конец сентября 2026 года никто не опубликовал прямого сравнения на идентичном аудио. Ни StepFun, ни сопровождающие Whisper, ни независимая лаборатория. В собственной документации StepFun приведены сравнения с Doubao ASR 2.0, Seed 2.0 Lite и HY3.0 ASR Preview, все китайские ASR-продукты. У стороны Whisper вообще нет вендора, публикующего сравнения, потому что Whisper Large v3 Turbo доступен для скачивания уже много лет, и его показатели зависят от того, кто его обслуживает.

Итак, эта страница представляет честную версию: она читает единственную таблицу, которая измеряет и то, и другое, отделяет сопоставимое от несопоставимого и прямо говорит, где доказательства заканчиваются. Краткий ответ: разрыв в точности реален и составляет примерно три пункта, а разрыв во всём остальном — цене, лицензии, возможности развёртывания — идёт в обратную сторону и является большим.

Что каждый из них на самом деле из себя представляет

StepAudio 3 ASR — это размещённая в облаке модель транскрипции, выпущенная StepFun 15 сентября 2026 года в составе аудиосемейства StepAudio 3 из пяти моделей. Доступ к ней осуществляется через единый потоковый эндпоинт, который возвращает инкрементальный текст в процессе декодирования и окончательную расшифровку в конце. StepFun описывает её как транскрипцию с языковой моделью, подключённой для контекста, настроенную на медицинское, юридическое, финансовое, автомобильное и программное аудио, а также на входные данные, которые не поддаются традиционным распознавателям — шёпот, быстрая речь, слитная речь, пение и аудио с музыкой на фоне. Нет открытых весов, нет локального развёртывания и нет возможности самостоятельного хостинга ни на одном тарифном уровне. Опубликованная ставка по прайс-листу составляет 2,8 юаня в час, что примерно соответствует $6,67 за 1000 минут по ценовой шкале самого лидерборда.

Whisper Large v3 Turbo — это модель с открытыми весами, опубликованная OpenAI под лицензией MIT: 809 миллионов параметров, 99 языков, сокращённая и дообученная производная Whisper large-v3 с уменьшенным числом слоёв декодера. Её скачали миллионы раз, её коммерчески предоставляет длинный список платформ, и её можно запустить на собственном оборудовании. Это последнее свойство и составляет суть сравнения, и именно поэтому разрыв в точности — не единственное число, которое имеет значение.

Единственная плата, которая измеряет и то, и другое

Индекс AA-WER от Artificial Analysis отражает процент неправильно транскрибированных слов: чем ниже, тем лучше. Версия 2 индекса объединяет три набора данных: AA-AgentTalk — 50%, VoxPopuli-Cleaned-AA — 25% и Earnings22-Cleaned-AA — 25%. В непоточном представлении отображаются 36 из 71 отслеживаемых моделей. Обе модели присутствуют в нём, чем могут похвастаться немногие сравнения.

Читайте так, как их перечисляет совет:

• StepAudio 3 ASR — 1,7 % AA-WER, примерно 6,67 $ за 1 000 минут аудио

• Whisper Large v3 Turbo, одна размещённая конечная точка — 4,6% AA-WER, около $0,67 за 1 000 минут

• Whisper Large v3 Turbo, второй хостируемый эндпоинт — 5,5% AA-WER, около $15,00 за 1 000 минут

• Whisper Large v3, другое поколение с открытыми весами — 4,1% на одном эндпоинте, 10,1% на другом

• StepAudio 2.5 ASR, предыдущее поколение StepFun — 4.7%

Последние две строки на табло — самые показательные, и они вовсе не о StepFun. Одни и те же открытые веса Whisper дают 4,1% на одном эндпоинте и 10,1% на другом. Это разброс в 6 процентных пунктов при идентичных параметрах, полностью обусловленный различиями в сервинге: стратегией чанкинга, оборудованием, конфигурацией декодирования и тем, как каждый хост обрабатывает аудио длиннее своих внутренних ограничений. Собственная сноска на табло говорит об этом же, отмечая, что для одного из его наборов данных аудио одних моделей разбивается на фрагменты примерно по девять минут, а других — примерно по тридцать секунд из-за лимитов времени.

А значит, сравнение «StepAudio 3 ASR vs Whisper Large v3 Turbo» — это на самом деле два сравнения, наложенных друг на друга. Модель против весов и модель против того эндпоинта, который вам довелось бенчмаркать. Второе варьируется сильнее, чем первое.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Откуда берётся разрыв в точности и насколько ему можно доверять

Разница в три пункта по частоте ошибок в словах — это большой разрыв в области, где пять лучших систем отстоят друг от друга не более чем на 0,6 пункта. Это также единственная цифра в этом сравнении, которую измерила третья сторона, и она сопровождается реальными оговорками, которые действуют в обоих направлениях.

Против StepAudio 3 ASR: этот показатель — составной индекс, на 50% состоящий из AA-AgentTalk — датасета диалогов агентов. Модель, настроенная на предметно-специфичную транскрипцию с подключённой для контекста LLM, хорошо подходит для аудио такого рода. Пересчитайте индекс с большим весом для чтения вслух или новостных трансляций — и порядок может уплотниться. Кроме того, для ASR-модели до сих пор нет опубликованного технического отчёта, нет выпущенного тестового набора, нет конфигурации декодирования и нет воспроизводимого протокола от кого-либо за пределами StepFun.

В сравнении с Whisper Large v3 Turbo: 4,6 % — это показатель одного хостингового эндпоинта, а не свойство модели. Веса фиксированы и общедоступны; оценка — нет. Команда, которая аккуратно запускает те же веса, с разбиением на фрагменты, подходящим для предметной области, и хорошей конфигурацией декодера, может показать заметно лучший результат, чем строка на табло, — а команда, которая запускает их небрежно, может показать результат хуже, чем 10,1 %, которые показало другое поколение открытых весов. Честный вывод таков: у стороны этого сравнения с открытыми весами есть нижний предел, который можно измерить, и верхний предел, который нужно заслужить.

Не хватает числа, которое поставило бы точку: обе системы, один аудионабор, один протокол декодирования — и всё это опубликовано. Никто такого эксперимента не проводил, и пока кто-нибудь не проведёт, «1,7 % против 4,6 %» — это сравнение двух измерений, сделанных в разных условиях, а не измерение двух систем друг против друга.

Остальные четыре измерения, где Whisper выигрывает с большим отрывом

Точность — это измерение, в котором побеждает StepFun. По остальным пунктам списка модель с открытыми весами сильно уступает, и именно они решают, возможно ли развёртывание вообще:

• Лицензия и веса — открытые веса под лицензией MIT с 809 млн параметров против размещённого API, веса которого не опубликованы ни на одном уровне.

• Развёртывание — самостоятельно размещённое, на собственных серверах, в изолированной среде или через любую из десятков коммерческих платформ, в отличие от только API StepFun.

• Минимальная стоимость — около $0,67 за 1 000 минут на одной хостируемой конечной точке, и ещё ниже, если запускать самостоятельно, против примерно $6,67 за 1 000 минут по опубликованному тарифу поставщика.

• Хранение данных — аудио никогда не покидает инфраструктуру, которую вы контролируете, в отличие от аудио, отправляемого на стороннюю конечную точку.

• Риск интеграции — модель нельзя отозвать, переоценить или объявить устаревшей у вас из-под носа, потому что вы владеете весами, а не арендуете её по хостинговому тарифу, который может меняться вместе с прайс-листом.

• Поведение при длинном аудио — разбиение на фрагменты (chunking) — это ваше решение, и его можно настраивать для каждого файла, в отличие от того, что эндпоинт поставщика делает внутри, а это не документировано.

Этот ценовой разрыв составляет примерно десять к одному по сравнению с более дешёвым эндпоинтом Whisper, и это зеркальное отражение того, что произошло внутри собственной линейки StepFun: модель, которую заменяет эта, StepAudio 2.5 ASR, стоила 0,15 юаня в час, а текущий тариф — 2,8. StepFun подняла тариф на транскрипцию примерно в девятнадцать раз, чтобы купить точность, что выводит её на другой рынок по сравнению с самостоятельно размещённой моделью с открытыми весами, а не делает её более дорогой версией этой модели.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Какой из них вам стоит выбрать

Это разделение более четкое, чем в большинстве очных противостояний:

• Выбирайте Whisper Large v3 Turbo, если аудио обычное, объём большой, данные не могут покидать вашу инфраструктуру или вам нужно, чтобы развёртывание было постоянным и стабильным по стоимости. Лицензия MIT означает, что решение можно отменить по вашему усмотрению, и никто не сможет отобрать у вас это право.

• Берите StepAudio 3 ASR, если аудио действительно сложное — с акцентом, шёпотом, пением или музыкой на фоне — или если предметная область входит в пятёрку тех, под которые StepFun выполнял донастройку. Вот за что вы платите повышенную цену, и на таком аудио разница в точности в три процентных пункта — это разница между пригодным для использования транскриптом и ручным проходом коррекции.

• Не выбирайте ни один из них в качестве единственного, если вы не знаете, что представляет собой ваше аудио. Цена ошибки асимметрична: путь с открытыми весами можно протестировать на собственном оборудовании за цену одного GPU-часа, а хостинговый путь ничего не стоит попробовать, но привязывает вас к тарифу, который вы не можете контролировать.

Аргументы в пользу гибрида здесь сильнее, чем в большинстве сравнений, и причина — разброс по эндпоинтам на табло. Поскольку одни и те же веса Whisper показывают от 4,1% до 10,1% в зависимости от того, кто их обслуживает, практичный шаг — маршрутизировать путь открытых весов через более чем один хост, а не привязываться к одному, — что и обеспечивает автоматическое переключение при отказе, и это тот же механизм, который позволяет поставить хостируемую модель перед продакшен-путём, не ставя весь этот путь в зависимость от неё.

Как это вписывается в стек и что мы обслуживаем, а что — нет

Что бы вы ни выбрали для транскрипции, транскрипт куда-то попадает. Суммаризатор, структурированное извлечение, проверка на соответствие, поисковый индекс — эти вызовы приходятся на обычные текстовые модели, и именно они составляют ту часть счёта, которая растёт с использованием, а не с минутами аудио. Собственная realtime-модель StepFun заявляет о поддержке вызова инструментов и асинхронном выполнении длительных задач, а значит, даже аудиослой постоянно передаёт работу чему-то, что не является аудиомоделью.

Чтобы прямо обозначить рамки, потому что легко было бы подразумевать обратное: ни StepAudio 3 ASR, ни Whisper Large v3 Turbo не находятся на OrcaRouter. Доступ к StepAudio осуществляется через собственный API StepFun, а веса Whisper вы можете запускать сами или разместить на хостинговой платформе. То, что несёт OrcaRouter, — это слой делегирования, на вход которому поступает транскрипт — почти 200 текстовых моделей за одним API, с автоматическим переключением при сбое, чтобы последующий вызов не умирал из-за одного провайдера, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно. Там, где провайдер публикует тариф, эта прейскурантная цена передаётся без наценки, поэтому изменение цены доходит до вашего счёта в день его объявления — и, учитывая, что это сравнение содержит вендора, который поднял свой тариф на транскрипцию в девятнадцать раз за один релиз, это не гипотетическая выгода.

Если вы собираетесь потратить реальные деньги на вопрос точности, дешёвая последовательность действий такова: сначала запустите открытые веса на собственном аудио — потому что можете, и потому что полученное число будет релевантнее, чем у любой таблицы лидеров. Затем решите, стоит ли оставшийся разрыв десятикратной ставки. Большинство команд обнаружат, что это оправдано для части их трафика и не оправдано для остального, а это задача маршрутизации, а не выбор модели.

Что бы это уладило

Один опубликованный тест. Обе системы, одно и то же аудио, один и тот же протокол декодирования, честное разделение между чтением с листа, разговорной речью и сложными случаями, для которых, как утверждает StepFun, была проведена настройка. Пока этого не существует, сравнение — это сторонний индекс с одной стороны и набор открытых весов с переменной оценкой с другой, и единственный ответственный способ его интерпретировать — как отправную точку, а не как ответ.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.