Сгенерированная титульная карточка hero с заголовком «StepAudio 3 ASR vs StepAudio 3» и подзаголовком «Один — это модель. Другой — пять продуктов под одним именем», над футером «Данные StepFun, опубликованные в сентябре 2026 года».
Guides & Insights

StepAudio 3 ASR против StepAudio 3: модели с таким названием не существует

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поищите StepAudio 3 — и вы найдёте целое семейство, а не отдельную модель. Аудиорелиз StepFun от 15 сентября 2026 года объединил под этим названием пять продуктов — Realtime, ASR, синтез речи, Gen и Music, — и именно продукт для транскрипции среди них, StepAudio 3 ASR, с тех пор поднимается вверх в лидербордах. Уровень, который в собственной документации StepFun назван самой крупной ASR-моделью на сегодняшний день, — это StepAudio 3 ASR Max, а его «разговорный» собрат, с которым он делит базовую архитектуру, — это StepAudio 3 Realtime. Если вы пытаетесь сравнить «StepAudio 3 ASR» с «StepAudio 3», вы сравниваете продукт с линейкой продуктов, и ответ полностью зависит от того, какой именно из трёх вы имели в виду.

Эта страница решает это. Это не маркетинговое сравнение — это устранение неоднозначности, необходимое вам перед тем, как вы сможете правильно прочитать любую спецификацию StepAudio 3, потому что три названия выше подразумевают разные цены, разные конечные точки и разные режимы отказов.

Почему имя неоднозначно

StepFun выпустила весь аудиостек за один день, и соглашение об именовании сделало название семейства основой каждого названия продукта. Это аккуратно выглядит на слайде запуска и неудобно во всех остальных случаях. Это означает, что поиск по названию семейства возвращает смесь из пяти разных продуктов, а строка бенчмарка с меткой «StepAudio 3» вполне может относиться к любому из них.

Практическое следствие состоит в том, что по заголовку нельзя понять, что именно измерялось. Пост, в котором говорится «StepAudio 3 возглавляет таблицу лидеров по транскрипции», описывает StepAudio 3 ASR. Пост, в котором говорится «StepAudio 3 побеждает по динамике разговора», описывает StepAudio 3 Realtime. Оба утверждения верны, это разные продукты, и они не взаимозаменяемы.

Внутри линейки ASR есть и вторая неоднозначность. В документации StepFun уровень ASR Max назван её самой крупной ASR-моделью на сегодняшний день, со своим ценообразованием и своим эндпоинтом, тогда как строки публичного лидерборда несут более простое обозначение. Разобраться, являются ли они одним SKU под двумя названиями или двумя SKU, — самое полезное, что может сделать эта страница, и следующий раздел это делает.

Три вещи, которые может означать это имя

StepAudio 3 ASR — продукт для транскрипции. Потоковый эндпоинт, возвращающий инкрементальный текст по мере декодирования и итоговую расшифровку в конце. StepFun описывает его как транскрипцию с подключённой языковой моделью для контекста, настроенную для медицинского, юридического, финансового, автомобильного и программного аудио, а также для сложных входных данных, таких как шёпот, быстрая речь, слитная речь, пение и фоновая музыка. Это модель с показателем частоты ошибок в словах 1,7% в индексе AA-WER от Artificial Analysis для непоточного распознавания речи в текст.

StepAudio 3 ASR Max — уровень, который документация StepFun называет своей крупнейшей на сегодняшний день ASR-моделью. Его опубликованная ставка по прайс-листу составляет 2,8 юаня в час. Это не более дешёвый инструмент для транскрипции; это вершина линейки ASR.

StepAudio 3 Realtime — полнодуплексная диалоговая модель. Она рассуждает непосредственно по речи, а не запускает цепочку «сначала транскрибируй, потом рассуждай», и транскрибирует как побочный результат этого. Это не ASR-продукт, и её точность в задачах транскрибирования — не то, для чего её настраивали.

Всё остальное в этом семействе — TTS, Gen, Music — это совершенно другая задача, и оно вообще не должно фигурировать в сравнении транскрипций.

ASR и ASR Max — это одна и та же модель?

Данные указывают на «да», и проверка здесь арифметическая. StepFun указывает тариф ASR Max в 2,8 юаня за час. При пересчёте примерно по 7,1 юаня за доллар это около $0,39 в час, или примерно $6,6 за 1000 минут. Artificial Analysis указывает эту модель в своей таблице лидеров по цене $6,67 за 1000 минут. Две независимо опубликованные цифры — одна из прайс-листа поставщика, другая со сторонней таблицы — различаются менее чем на цент. Именно этого и следовало бы ожидать, если строка в таблице лидеров и тариф ASR Max из прайс-листа описывают один и тот же SKU.

Стоит четко обозначить, что это доказывает, а что — нет. Это доказывает, что ось цен в таблице лидеров и тарифная карта поставщика описывают один и тот же продукт по одной и той же цене. Но это не доказывает, что 1,7% в таблице лидеров были измерены на том самом эндпоинте, к которому обратились бы вы, потому что таблица не публикует ни конфигурацию декодирования, ни эндпоинт, к которому она обращалась. Итак: один и тот же продукт — весьма вероятно; одинаковые условия измерения — не подтверждены.

Что несомненно — так это поколенческий скачок внутри линейки. StepAudio 2.5 ASR показывает 4,7% в том же рейтинге за 0,15 юаня в час. Текущий тариф — 1,7% за 2,8 юаня в час. Это снижение частоты ошибок в словах на 64% при примерно девятнадцатикратной цене — самый резкий компромисс в семействе, и именно он решает, стоит ли обновление того.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Измерения, которые действительно различаются

Как только вопрос с названиями решён, сравнение сводится к короткому списку. Именно эти пункты меняют решение:

• Точность — StepAudio 3 ASR: 1,7% AA-WER в нестриминговом режиме против 4,7% у StepAudio 2.5 ASR на том же лидерборде. Измерено Artificial Analysis, а не StepFun.

• Цена — 2,8 юаня в час против 0,15 юаня в час. Оба — прейскурантные тарифы поставщика, оба актуальны. Примерно в 19 раз.

• Веса — только облачный API для обоих. Никаких открытых весов нигде в семействе, никакого локального развёртывания, никакой возможности самостоятельного хостинга ни на одном уровне.

• Форма эндпоинта — один потоковый эндпоинт транскрипции, возвращающий промежуточный и окончательный текст, — такая же, как в предыдущем поколении. В модели интеграции ничего не изменилось, поэтому миграция — это замена идентификатора модели, а не переписывание.

• Настройка под сложное аудио — StepAudio 3 ASR явно оптимизирована для шёпотной, быстрой, слитной и певческой речи, а также для аудио с музыкой на фоне. Эта настройка и есть продукт; предыдущее поколение для этого не создавалось.

• Заявленные вендором улучшения по доменам — StepFun сообщает о снижении: китайский язык — на 9,3%, английский — на 25,0%, диалекты — на 22,3%, отраслевые вертикали — на 42,1%, а переключение между языками — на 27,9% от поколения к поколению. Данные предоставлены вендором и не воспроизведены, поэтому считайте их ориентировочными.

Примечательно, чего нет в этом списке: длина контекста, поддержка аудиоформатов, максимальная продолжительность аудио и идентификатор модели. В публичной документации StepFun по этой модели они не указаны, и любой, кто называет эти цифры, ссылается на что-то другое.

ASR против Realtime — это сравнение, которое действительно нужно людям

Если вы выбираете между продуктами для транскрипции, а не между поколениями, интересное сравнение — не ASR против ASR Max, а ASR против Realtime. В собственных технических материалах StepFun говорится, что оба используют общие этапы предварительного и промежуточного обучения и расходятся только на этапе тонкой настройки с учителем. Одна и та же база, разная тонкая настройка, разный продукт.

У этого единственного факта есть практическая интерпретация. Частота ошибок в словах 1,7% — это свойство дообученной модели ASR. Это не обещание относительно realtime-модели, которая оптимизируется для смены реплик, обработки перебиваний и рассуждений на основе речи, а не для точности транскрипции. Если ваша архитектура транскрибирует как побочный эффект живого разговора, вы не покупаете эти 1,7% — вы покупаете разговорную модель, которая попутно выдаёт текст.

Верно и обратное, и это менее очевидно: поскольку у них общая основа, модель ASR — это не небольшая специализированная модель, прикрученная к семейству. Это система того же масштаба, но иначе дообученная. Именно поэтому тариф на ASR близок к остальным моделям семейства, а не к дешёвому сегменту рынка.

Что с этим делать, если вы выбираете один

Три вопроса решают всё. Вам нужна расшифровка или разговор? Если расшифровка, то продукт — StepAudio 3 ASR, а название семейства — шум. Если разговор, вам нужен StepAudio 3 Realtime, и вам вообще не стоит читать бенчмарки ASR. А если вам нужна расшифровка по-настоящему сложного аудио — с акцентом, шёпотом, пением или музыкой под ним, — то 19-кратная надбавка — это цена уровня, который был настроен под это, и честный тест — ваше собственное аудио, а не смешанный индекс.

Решение, которое легко принять ошибочно, — считать слой транскрипции неизменным. Что бы вы ни выбрали, транскрипт служит входными данными для чего-то другого — суммаризатора, структурированного извлечения данных, проверки на соответствие требованиям, поискового индекса, — и эти вызовы идут к обычным текстовым моделям. Именно этот слой масштабируется вместе с объёмом использования, а не с количеством минут аудио, и именно его стоит с самого начала делать переносимым. OrcaRouter ставит почти 200 текстовых моделей за одним API с автоматическим переключением между провайдерами при сбоях, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слиянием моделей, когда суждения одной модели недостаточно. Там, где провайдер публикует тариф, эта цена из прайс-листа передаётся без наценки, поэтому изменение цены на текстовой стороне отражается в вашем счёте в день его объявления.

Чтобы внести ясность в рамки: поскольку эта страница посвящена семейству, которое мы не обслуживаем, на OrcaRouter нет эндпоинта StepAudio 3. Модели транскрипции и голоса доступны через собственный API StepFun. OrcaRouter предоставляет слой рассуждений, идущий после транскрипта, а именно там решение о переключении дёшево принять и дорого отложить.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

То, что никто не урегулировал

С названием можно разобраться. С утверждением о производительности — пока нет. Для ASR-модели всё ещё нет опубликованного технического отчёта, нет выпущенного тестового набора, нет конфигурации декодирования и нет воспроизводимого протокола от кого-либо за пределами StepFun, а собственные сравнения вендора — с другими китайскими ASR-продуктами, а не с действующим лидером среди открытых весов. Показатель 1,7 % — это реальное измерение третьей стороны по смешанному индексу из трёх наборов данных; всё остальное, что касается этой модели, — заявления вендора.

Две вещи изменили бы картину. Прямое сравнение с Whisper Large v3 Turbo на идентичном аудио, которое никто не публиковал. И тариф для остальных представителей семейства — четыре из пяти моделей StepAudio 3 на момент запуска всё ещё предлагались по ограниченной по времени бесплатной ознакомительной цене, а опубликованные тарифы были только у транскрипции и синтеза, а значит, прайс-лист, который можно прочитать сегодня, охватывает два из пяти продуктов.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Это тот слой, который масштабируется в зависимости от использования, а не от минут аудио, и именно этот слой стоит с самого начала делать переносимым. автоматическое переключение при сбое между провайдерами, DSL маршрутизации, который объединяет несколько в один вызов, и слияние моделей, когда суждения одной модели недостаточно.