
StepAudio 3 ASR против StepAudio 3: модели с таким названием не существует
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Поищите StepAudio 3 — и вы найдёте целое семейство, а не отдельную модель. Аудиорелиз StepFun от 15 сентября 2026 года объединил под этим названием пять продуктов — Realtime, ASR, синтез речи, Gen и Music, — и именно продукт для транскрипции среди них, StepAudio 3 ASR, с тех пор поднимается вверх в лидербордах. Уровень, который в собственной документации StepFun назван самой крупной ASR-моделью на сегодняшний день, — это StepAudio 3 ASR Max, а его «разговорный» собрат, с которым он делит базовую архитектуру, — это StepAudio 3 Realtime. Если вы пытаетесь сравнить «StepAudio 3 ASR» с «StepAudio 3», вы сравниваете продукт с линейкой продуктов, и ответ полностью зависит от того, какой именно из трёх вы имели в виду.
Эта страница решает это. Это не маркетинговое сравнение — это устранение неоднозначности, необходимое вам перед тем, как вы сможете правильно прочитать любую спецификацию StepAudio 3, потому что три названия выше подразумевают разные цены, разные конечные точки и разные режимы отказов.
Почему имя неоднозначно
StepFun выпустила весь аудиостек за один день, и соглашение об именовании сделало название семейства основой каждого названия продукта. Это аккуратно выглядит на слайде запуска и неудобно во всех остальных случаях. Это означает, что поиск по названию семейства возвращает смесь из пяти разных продуктов, а строка бенчмарка с меткой «StepAudio 3» вполне может относиться к любому из них.
Практическое следствие состоит в том, что по заголовку нельзя понять, что именно измерялось. Пост, в котором говорится «StepAudio 3 возглавляет таблицу лидеров по транскрипции», описывает StepAudio 3 ASR. Пост, в котором говорится «StepAudio 3 побеждает по динамике разговора», описывает StepAudio 3 Realtime. Оба утверждения верны, это разные продукты, и они не взаимозаменяемы.
Внутри линейки ASR есть и вторая неоднозначность. В документации StepFun уровень ASR Max назван её самой крупной ASR-моделью на сегодняшний день, со своим ценообразованием и своим эндпоинтом, тогда как строки публичного лидерборда несут более простое обозначение. Разобраться, являются ли они одним SKU под двумя названиями или двумя SKU, — самое полезное, что может сделать эта страница, и следующий раздел это делает.
Три вещи, которые может означать это имя
• StepAudio 3 ASR — продукт для транскрипции. Потоковый эндпоинт, возвращающий инкрементальный текст по мере декодирования и итоговую расшифровку в конце. StepFun описывает его как транскрипцию с подключённой языковой моделью для контекста, настроенную для медицинского, юридического, финансового, автомобильного и программного аудио, а также для сложных входных данных, таких как шёпот, быстрая речь, слитная речь, пение и фоновая музыка. Это модель с показателем частоты ошибок в словах 1,7% в индексе AA-WER от Artificial Analysis для непоточного распознавания речи в текст.
• StepAudio 3 ASR Max — уровень, который документация StepFun называет своей крупнейшей на сегодняшний день ASR-моделью. Его опубликованная ставка по прайс-листу составляет 2,8 юаня в час. Это не более дешёвый инструмент для транскрипции; это вершина линейки ASR.
• StepAudio 3 Realtime — полнодуплексная диалоговая модель. Она рассуждает непосредственно по речи, а не запускает цепочку «сначала транскрибируй, потом рассуждай», и транскрибирует как побочный результат этого. Это не ASR-продукт, и её точность в задачах транскрибирования — не то, для чего её настраивали.
Всё остальное в этом семействе — TTS, Gen, Music — это совершенно другая задача, и оно вообще не должно фигурировать в сравнении транскрипций.
ASR и ASR Max — это одна и та же модель?
Данные указывают на «да», и проверка здесь арифметическая. StepFun указывает тариф ASR Max в 2,8 юаня за час. При пересчёте примерно по 7,1 юаня за доллар это около $0,39 в час, или примерно $6,6 за 1000 минут. Artificial Analysis указывает эту модель в своей таблице лидеров по цене $6,67 за 1000 минут. Две независимо опубликованные цифры — одна из прайс-листа поставщика, другая со сторонней таблицы — различаются менее чем на цент. Именно этого и следовало бы ожидать, если строка в таблице лидеров и тариф ASR Max из прайс-листа описывают один и тот же SKU.
Стоит четко обозначить, что это доказывает, а что — нет. Это доказывает, что ось цен в таблице лидеров и тарифная карта поставщика описывают один и тот же продукт по одной и той же цене. Но это не доказывает, что 1,7% в таблице лидеров были измерены на том самом эндпоинте, к которому обратились бы вы, потому что таблица не публикует ни конфигурацию декодирования, ни эндпоинт, к которому она обращалась. Итак: один и тот же продукт — весьма вероятно; одинаковые условия измерения — не подтверждены.
Что несомненно — так это поколенческий скачок внутри линейки. StepAudio 2.5 ASR показывает 4,7% в том же рейтинге за 0,15 юаня в час. Текущий тариф — 1,7% за 2,8 юаня в час. Это снижение частоты ошибок в словах на 64% при примерно девятнадцатикратной цене — самый резкий компромисс в семействе, и именно он решает, стоит ли обновление того.

Измерения, которые действительно различаются
Как только вопрос с названиями решён, сравнение сводится к короткому списку. Именно эти пункты меняют решение:
• Точность — StepAudio 3 ASR: 1,7% AA-WER в нестриминговом режиме против 4,7% у StepAudio 2.5 ASR на том же лидерборде. Измерено Artificial Analysis, а не StepFun.
• Цена — 2,8 юаня в час против 0,15 юаня в час. Оба — прейскурантные тарифы поставщика, оба актуальны. Примерно в 19 раз.
• Веса — только облачный API для обоих. Никаких открытых весов нигде в семействе, никакого локального развёртывания, никакой возможности самостоятельного хостинга ни на одном уровне.
• Форма эндпоинта — один потоковый эндпоинт транскрипции, возвращающий промежуточный и окончательный текст, — такая же, как в предыдущем поколении. В модели интеграции ничего не изменилось, поэтому миграция — это замена идентификатора модели, а не переписывание.
• Настройка под сложное аудио — StepAudio 3 ASR явно оптимизирована для шёпотной, быстрой, слитной и певческой речи, а также для аудио с музыкой на фоне. Эта настройка и есть продукт; предыдущее поколение для этого не создавалось.
• Заявленные вендором улучшения по доменам — StepFun сообщает о снижении: китайский язык — на 9,3%, английский — на 25,0%, диалекты — на 22,3%, отраслевые вертикали — на 42,1%, а переключение между языками — на 27,9% от поколения к поколению. Данные предоставлены вендором и не воспроизведены, поэтому считайте их ориентировочными.
Примечательно, чего нет в этом списке: длина контекста, поддержка аудиоформатов, максимальная продолжительность аудио и идентификатор модели. В публичной документации StepFun по этой модели они не указаны, и любой, кто называет эти цифры, ссылается на что-то другое.
ASR против Realtime — это сравнение, которое действительно нужно людям
Если вы выбираете между продуктами для транскрипции, а не между поколениями, интересное сравнение — не ASR против ASR Max, а ASR против Realtime. В собственных технических материалах StepFun говорится, что оба используют общие этапы предварительного и промежуточного обучения и расходятся только на этапе тонкой настройки с учителем. Одна и та же база, разная тонкая настройка, разный продукт.
У этого единственного факта есть практическая интерпретация. Частота ошибок в словах 1,7% — это свойство дообученной модели ASR. Это не обещание относительно realtime-модели, которая оптимизируется для смены реплик, обработки перебиваний и рассуждений на основе речи, а не для точности транскрипции. Если ваша архитектура транскрибирует как побочный эффект живого разговора, вы не покупаете эти 1,7% — вы покупаете разговорную модель, которая попутно выдаёт текст.
Верно и обратное, и это менее очевидно: поскольку у них общая основа, модель ASR — это не небольшая специализированная модель, прикрученная к семейству. Это система того же масштаба, но иначе дообученная. Именно поэтому тариф на ASR близок к остальным моделям семейства, а не к дешёвому сегменту рынка.
Что с этим делать, если вы выбираете один
Три вопроса решают всё. Вам нужна расшифровка или разговор? Если расшифровка, то продукт — StepAudio 3 ASR, а название семейства — шум. Если разговор, вам нужен StepAudio 3 Realtime, и вам вообще не стоит читать бенчмарки ASR. А если вам нужна расшифровка по-настоящему сложного аудио — с акцентом, шёпотом, пением или музыкой под ним, — то 19-кратная надбавка — это цена уровня, который был настроен под это, и честный тест — ваше собственное аудио, а не смешанный индекс.
Решение, которое легко принять ошибочно, — считать слой транскрипции неизменным. Что бы вы ни выбрали, транскрипт служит входными данными для чего-то другого — суммаризатора, структурированного извлечения данных, проверки на соответствие требованиям, поискового индекса, — и эти вызовы идут к обычным текстовым моделям. Именно этот слой масштабируется вместе с объёмом использования, а не с количеством минут аудио, и именно его стоит с самого начала делать переносимым. OrcaRouter ставит почти 200 текстовых моделей за одним API с автоматическим переключением между провайдерами при сбоях, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слиянием моделей, когда суждения одной модели недостаточно. Там, где провайдер публикует тариф, эта цена из прайс-листа передаётся без наценки, поэтому изменение цены на текстовой стороне отражается в вашем счёте в день его объявления.
Чтобы внести ясность в рамки: поскольку эта страница посвящена семейству, которое мы не обслуживаем, на OrcaRouter нет эндпоинта StepAudio 3. Модели транскрипции и голоса доступны через собственный API StepFun. OrcaRouter предоставляет слой рассуждений, идущий после транскрипта, а именно там решение о переключении дёшево принять и дорого отложить.

То, что никто не урегулировал
С названием можно разобраться. С утверждением о производительности — пока нет. Для ASR-модели всё ещё нет опубликованного технического отчёта, нет выпущенного тестового набора, нет конфигурации декодирования и нет воспроизводимого протокола от кого-либо за пределами StepFun, а собственные сравнения вендора — с другими китайскими ASR-продуктами, а не с действующим лидером среди открытых весов. Показатель 1,7 % — это реальное измерение третьей стороны по смешанному индексу из трёх наборов данных; всё остальное, что касается этой модели, — заявления вендора.
Две вещи изменили бы картину. Прямое сравнение с Whisper Large v3 Turbo на идентичном аудио, которое никто не публиковал. И тариф для остальных представителей семейства — четыре из пяти моделей StepAudio 3 на момент запуска всё ещё предлагались по ограниченной по времени бесплатной ознакомительной цене, а опубликованные тарифы были только у транскрипции и синтеза, а значит, прайс-лист, который можно прочитать сегодня, охватывает два из пяти продуктов.

Это тот слой, который масштабируется в зависимости от использования, а не от минут аудио, и именно этот слой стоит с самого начала делать переносимым. автоматическое переключение при сбое между провайдерами, DSL маршрутизации, который объединяет несколько в один вызов, и слияние моделей, когда суждения одной модели недостаточно.
