
StepAudio 3 ASR против Whisper Large v3 Turbo: 1,7% против 4,6%, и никто не провёл этот тест
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Сравнения, которое вы хотите, не существует. StepAudio 3 ASR и Whisper Large v3 Turbo находятся на одном и том же индексе Artificial Analysis AA-WER для непотокового распознавания речи в текст — 1,7% ошибок в словах по сравнению с показателями в диапазоне 4–5,5% — и по состоянию на конец сентября 2026 года никто не опубликовал прямого сравнения на идентичном аудио. Ни StepFun, ни сопровождающие Whisper, ни независимая лаборатория. В собственной документации StepFun приведены сравнения с Doubao ASR 2.0, Seed 2.0 Lite и HY3.0 ASR Preview, все китайские ASR-продукты. У стороны Whisper вообще нет вендора, публикующего сравнения, потому что Whisper Large v3 Turbo доступен для скачивания уже много лет, и его показатели зависят от того, кто его обслуживает.
Итак, эта страница представляет честную версию: она читает единственную таблицу, которая измеряет и то, и другое, отделяет сопоставимое от несопоставимого и прямо говорит, где доказательства заканчиваются. Краткий ответ: разрыв в точности реален и составляет примерно три пункта, а разрыв во всём остальном — цене, лицензии, возможности развёртывания — идёт в обратную сторону и является большим.
Что каждый из них на самом деле из себя представляет
StepAudio 3 ASR — это размещённая в облаке модель транскрипции, выпущенная StepFun 15 сентября 2026 года в составе аудиосемейства StepAudio 3 из пяти моделей. Доступ к ней осуществляется через единый потоковый эндпоинт, который возвращает инкрементальный текст в процессе декодирования и окончательную расшифровку в конце. StepFun описывает её как транскрипцию с языковой моделью, подключённой для контекста, настроенную на медицинское, юридическое, финансовое, автомобильное и программное аудио, а также на входные данные, которые не поддаются традиционным распознавателям — шёпот, быстрая речь, слитная речь, пение и аудио с музыкой на фоне. Нет открытых весов, нет локального развёртывания и нет возможности самостоятельного хостинга ни на одном тарифном уровне. Опубликованная ставка по прайс-листу составляет 2,8 юаня в час, что примерно соответствует $6,67 за 1000 минут по ценовой шкале самого лидерборда.
Whisper Large v3 Turbo — это модель с открытыми весами, опубликованная OpenAI под лицензией MIT: 809 миллионов параметров, 99 языков, сокращённая и дообученная производная Whisper large-v3 с уменьшенным числом слоёв декодера. Её скачали миллионы раз, её коммерчески предоставляет длинный список платформ, и её можно запустить на собственном оборудовании. Это последнее свойство и составляет суть сравнения, и именно поэтому разрыв в точности — не единственное число, которое имеет значение.
Единственная плата, которая измеряет и то, и другое
Индекс AA-WER от Artificial Analysis отражает процент неправильно транскрибированных слов: чем ниже, тем лучше. Версия 2 индекса объединяет три набора данных: AA-AgentTalk — 50%, VoxPopuli-Cleaned-AA — 25% и Earnings22-Cleaned-AA — 25%. В непоточном представлении отображаются 36 из 71 отслеживаемых моделей. Обе модели присутствуют в нём, чем могут похвастаться немногие сравнения.
Читайте так, как их перечисляет совет:
• StepAudio 3 ASR — 1,7 % AA-WER, примерно 6,67 $ за 1 000 минут аудио
• Whisper Large v3 Turbo, одна размещённая конечная точка — 4,6% AA-WER, около $0,67 за 1 000 минут
• Whisper Large v3 Turbo, второй хостируемый эндпоинт — 5,5% AA-WER, около $15,00 за 1 000 минут
• Whisper Large v3, другое поколение с открытыми весами — 4,1% на одном эндпоинте, 10,1% на другом
• StepAudio 2.5 ASR, предыдущее поколение StepFun — 4.7%
Последние две строки на табло — самые показательные, и они вовсе не о StepFun. Одни и те же открытые веса Whisper дают 4,1% на одном эндпоинте и 10,1% на другом. Это разброс в 6 процентных пунктов при идентичных параметрах, полностью обусловленный различиями в сервинге: стратегией чанкинга, оборудованием, конфигурацией декодирования и тем, как каждый хост обрабатывает аудио длиннее своих внутренних ограничений. Собственная сноска на табло говорит об этом же, отмечая, что для одного из его наборов данных аудио одних моделей разбивается на фрагменты примерно по девять минут, а других — примерно по тридцать секунд из-за лимитов времени.
А значит, сравнение «StepAudio 3 ASR vs Whisper Large v3 Turbo» — это на самом деле два сравнения, наложенных друг на друга. Модель против весов и модель против того эндпоинта, который вам довелось бенчмаркать. Второе варьируется сильнее, чем первое.

Откуда берётся разрыв в точности и насколько ему можно доверять
Разница в три пункта по частоте ошибок в словах — это большой разрыв в области, где пять лучших систем отстоят друг от друга не более чем на 0,6 пункта. Это также единственная цифра в этом сравнении, которую измерила третья сторона, и она сопровождается реальными оговорками, которые действуют в обоих направлениях.
Против StepAudio 3 ASR: этот показатель — составной индекс, на 50% состоящий из AA-AgentTalk — датасета диалогов агентов. Модель, настроенная на предметно-специфичную транскрипцию с подключённой для контекста LLM, хорошо подходит для аудио такого рода. Пересчитайте индекс с большим весом для чтения вслух или новостных трансляций — и порядок может уплотниться. Кроме того, для ASR-модели до сих пор нет опубликованного технического отчёта, нет выпущенного тестового набора, нет конфигурации декодирования и нет воспроизводимого протокола от кого-либо за пределами StepFun.
В сравнении с Whisper Large v3 Turbo: 4,6 % — это показатель одного хостингового эндпоинта, а не свойство модели. Веса фиксированы и общедоступны; оценка — нет. Команда, которая аккуратно запускает те же веса, с разбиением на фрагменты, подходящим для предметной области, и хорошей конфигурацией декодера, может показать заметно лучший результат, чем строка на табло, — а команда, которая запускает их небрежно, может показать результат хуже, чем 10,1 %, которые показало другое поколение открытых весов. Честный вывод таков: у стороны этого сравнения с открытыми весами есть нижний предел, который можно измерить, и верхний предел, который нужно заслужить.
Не хватает числа, которое поставило бы точку: обе системы, один аудионабор, один протокол декодирования — и всё это опубликовано. Никто такого эксперимента не проводил, и пока кто-нибудь не проведёт, «1,7 % против 4,6 %» — это сравнение двух измерений, сделанных в разных условиях, а не измерение двух систем друг против друга.
Остальные четыре измерения, где Whisper выигрывает с большим отрывом
Точность — это измерение, в котором побеждает StepFun. По остальным пунктам списка модель с открытыми весами сильно уступает, и именно они решают, возможно ли развёртывание вообще:
• Лицензия и веса — открытые веса под лицензией MIT с 809 млн параметров против размещённого API, веса которого не опубликованы ни на одном уровне.
• Развёртывание — самостоятельно размещённое, на собственных серверах, в изолированной среде или через любую из десятков коммерческих платформ, в отличие от только API StepFun.
• Минимальная стоимость — около $0,67 за 1 000 минут на одной хостируемой конечной точке, и ещё ниже, если запускать самостоятельно, против примерно $6,67 за 1 000 минут по опубликованному тарифу поставщика.
• Хранение данных — аудио никогда не покидает инфраструктуру, которую вы контролируете, в отличие от аудио, отправляемого на стороннюю конечную точку.
• Риск интеграции — модель нельзя отозвать, переоценить или объявить устаревшей у вас из-под носа, потому что вы владеете весами, а не арендуете её по хостинговому тарифу, который может меняться вместе с прайс-листом.
• Поведение при длинном аудио — разбиение на фрагменты (chunking) — это ваше решение, и его можно настраивать для каждого файла, в отличие от того, что эндпоинт поставщика делает внутри, а это не документировано.
Этот ценовой разрыв составляет примерно десять к одному по сравнению с более дешёвым эндпоинтом Whisper, и это зеркальное отражение того, что произошло внутри собственной линейки StepFun: модель, которую заменяет эта, StepAudio 2.5 ASR, стоила 0,15 юаня в час, а текущий тариф — 2,8. StepFun подняла тариф на транскрипцию примерно в девятнадцать раз, чтобы купить точность, что выводит её на другой рынок по сравнению с самостоятельно размещённой моделью с открытыми весами, а не делает её более дорогой версией этой модели.

Какой из них вам стоит выбрать
Это разделение более четкое, чем в большинстве очных противостояний:
• Выбирайте Whisper Large v3 Turbo, если аудио обычное, объём большой, данные не могут покидать вашу инфраструктуру или вам нужно, чтобы развёртывание было постоянным и стабильным по стоимости. Лицензия MIT означает, что решение можно отменить по вашему усмотрению, и никто не сможет отобрать у вас это право.
• Берите StepAudio 3 ASR, если аудио действительно сложное — с акцентом, шёпотом, пением или музыкой на фоне — или если предметная область входит в пятёрку тех, под которые StepFun выполнял донастройку. Вот за что вы платите повышенную цену, и на таком аудио разница в точности в три процентных пункта — это разница между пригодным для использования транскриптом и ручным проходом коррекции.
• Не выбирайте ни один из них в качестве единственного, если вы не знаете, что представляет собой ваше аудио. Цена ошибки асимметрична: путь с открытыми весами можно протестировать на собственном оборудовании за цену одного GPU-часа, а хостинговый путь ничего не стоит попробовать, но привязывает вас к тарифу, который вы не можете контролировать.
Аргументы в пользу гибрида здесь сильнее, чем в большинстве сравнений, и причина — разброс по эндпоинтам на табло. Поскольку одни и те же веса Whisper показывают от 4,1% до 10,1% в зависимости от того, кто их обслуживает, практичный шаг — маршрутизировать путь открытых весов через более чем один хост, а не привязываться к одному, — что и обеспечивает автоматическое переключение при отказе, и это тот же механизм, который позволяет поставить хостируемую модель перед продакшен-путём, не ставя весь этот путь в зависимость от неё.
Как это вписывается в стек и что мы обслуживаем, а что — нет
Что бы вы ни выбрали для транскрипции, транскрипт куда-то попадает. Суммаризатор, структурированное извлечение, проверка на соответствие, поисковый индекс — эти вызовы приходятся на обычные текстовые модели, и именно они составляют ту часть счёта, которая растёт с использованием, а не с минутами аудио. Собственная realtime-модель StepFun заявляет о поддержке вызова инструментов и асинхронном выполнении длительных задач, а значит, даже аудиослой постоянно передаёт работу чему-то, что не является аудиомоделью.
Чтобы прямо обозначить рамки, потому что легко было бы подразумевать обратное: ни StepAudio 3 ASR, ни Whisper Large v3 Turbo не находятся на OrcaRouter. Доступ к StepAudio осуществляется через собственный API StepFun, а веса Whisper вы можете запускать сами или разместить на хостинговой платформе. То, что несёт OrcaRouter, — это слой делегирования, на вход которому поступает транскрипт — почти 200 текстовых моделей за одним API, с автоматическим переключением при сбое, чтобы последующий вызов не умирал из-за одного провайдера, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно. Там, где провайдер публикует тариф, эта прейскурантная цена передаётся без наценки, поэтому изменение цены доходит до вашего счёта в день его объявления — и, учитывая, что это сравнение содержит вендора, который поднял свой тариф на транскрипцию в девятнадцать раз за один релиз, это не гипотетическая выгода.
Если вы собираетесь потратить реальные деньги на вопрос точности, дешёвая последовательность действий такова: сначала запустите открытые веса на собственном аудио — потому что можете, и потому что полученное число будет релевантнее, чем у любой таблицы лидеров. Затем решите, стоит ли оставшийся разрыв десятикратной ставки. Большинство команд обнаружат, что это оправдано для части их трафика и не оправдано для остального, а это задача маршрутизации, а не выбор модели.
Что бы это уладило
Один опубликованный тест. Обе системы, одно и то же аудио, один и тот же протокол декодирования, честное разделение между чтением с листа, разговорной речью и сложными случаями, для которых, как утверждает StepFun, была проведена настройка. Пока этого не существует, сравнение — это сторонний индекс с одной стороны и набор открытых весов с переменной оценкой с другой, и единственный ответственный способ его интерпретировать — как отправную точку, а не как ответ.

