
VibeVoice-ASR-Streaming-7B против GPT-Transcribe: контрольная точка live-сессии в сравнении с файловым endpoint OpenAI
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Две модели на этой странице — не соперники в том смысле, который подразумевают их названия: они созданы для разных моментов жизни аудиозаписи, и честное сравнение сводится к тому, в каком моменте живёт ваш продукт. GPT Transcribe — это асинхронный эндпоинт транскрипции от OpenAI: вы загружаете готовый файл, он обрабатывается примерно в 34 раза быстрее реального времени, и вы получаете транскрипт по цене $0,0045 за минуту аудио с независимо измеренным показателем ошибок на словах 3,31% в бенчмарке AA-WER от Artificial Analysis. VibeVoice-ASR-Streaming-7B устроен противоположным образом: стриминговый чекпойнт Microsoft Research, тихо загруженный на Hugging Face 2 сентября 2026 года под лицензией MIT, предназначен для транскрипции аудио, пока оно ещё поступает, — это WebSocket-сессия, которая выдаёт текст фрагментами по мере роста записи. Сравнивать их только по точности было бы бессмысленно, потому что у одной стороны есть проверенный показатель, а другая вообще не публиковала никаких цифр в текстовом виде.
Всё, что указано ниже, помечено соответствующим образом. Показатели GPT Transcribe — это опубликованная цена OpenAI и независимое измерение Artificial Analysis, оба находятся в открытом доступе с момента запуска модели 28 июля 2026 года. Сторона VibeVoice-ASR-Streaming-7B — это то, что можно узнать из репозитория: конфигурация чекпоинта, карточка модели и документация Microsoft по потоковому распознаванию речи, — поскольку ни одна третья сторона не проводила бенчмаркинг этой модели, а Microsoft не публиковала показатель word-error rate для потокового режима в читаемом виде.
Два разных момента в жизни звука
GPT Transcribe предназначен для записей, которые уже состоялись. Конечная точка OpenAI принимает аудиофайлы размером до 25 МБ в обычных форматах — mp3, mp4, mpeg, mpga, m4a, wav, webm — и после обработки возвращает полную расшифровку, примерно в 34 раза быстрее реального времени, так что часовая запись обрабатывается за пару минут. Это пакетный канал, и OpenAI устанавливает соответствующую цену: $0,0045 за аудиоминуту, около $0,27 за аудиочас. Если вам нужна именно трансляция в реальном времени, OpenAI предлагает отдельную модель — GPT Live Transcribe по цене $0,017 за минуту, что почти в четыре раза дороже пакетной цены, — и это самое близкое решение со стороны OpenAI к тому, что делает VibeVoice-ASR-Streaming-7B.
VibeVoice-ASR-Streaming-7B схлопывает это различие в обратную сторону: это стриминговый чекпоинт, который также обрабатывает целые файлы. Его конфигурация препроцессора демонстрирует живой контракт: аудио на входе с частотой 24 кГц, сжатое в 3200 раз до потока токенов в 7,5 Гц, затем обрабатываемое чанками по 22 кадра с упреждением на 4 кадра — примерно 2,9 секунды аудио на чанк и около полусекунды будущего контекста, с выводом текста по мере разрешения каждого чанка. Контекст сеанса переносится через KV-кэш, поэтому длинный сеанс не пересчитывается с нуля. Документированный путь обслуживания (плагин vLLM) предоставляет конечную точку WebSocket-потока для живых сеансов и конечную точку транскрибации целых файлов, так что одни и те же веса обслуживают обе формы, — но причина существования модели именно в живом режиме, и поминутной тарификации нет, потому что нет размещённого API. GPU вы приносите сами.

Журнал доказательств односторонний.
GPT Transcribe — один из наиболее тщательно протестированных API транскрибации в продакшене. Artificial Analysis оценил его в 3,31% ошибок на AA-WER — девятое место среди примерно пятидесяти отслеживаемых систем, — с известным слабым местом, скрытым в подпоказателях: на специально сложной по акустике выборке Earnings22 показатель падает до 6,10%. Это проверенные, воспроизводимые цифры из нейтрального рейтинга, и у них есть ограничения, которые сами по себе задокументированы. Модель вышла на 25% дешевле своего предшественника GPT-4o Transcribe и примерно на 0,7 пункта лучше по тому же бенчмарку.
VibeVoice-ASR-Streaming-7B не имеет сопоставимых показателей нигде. В карточке модели метрики оценки приведены в виде изображения, а технический отчёт Microsoft — это PDF, однако ни одной цитируемой цифры WER для потокового режима или значения задержки в текстовом виде нет, и ничто невозможно проверить независимо. Единственный числовой ориентир в семействе VibeVoice — это указанная поставщиком таблица в карточке пакетной модели VibeVoice-ASR — средний WER 7,77% на восьми англоязычных тестовых наборах и 2,20% на LibriSpeech clean, — которая описывает не потоковую модель, и её нельзя воспринимать как показатель точности данного чехпоинта. Если для вашего решения о покупке нужно число, которое вы сможете защитить перед коллегой, то только у одной стороны этого сравнения такое число есть.
Что возвращает каждый из них помимо простого транскрипта
Две модели делают разные ставки на контекст, и именно здесь сравнение функций становится по-настоящему интересным. Фишка GPT Transcribe — это подсказки контекста: можно передать произвольное описание записи, список ключевых слов и имён собственных, а также ожидаемый список языков; OpenAI сообщает, что на их тесте Context-Aware ASR семантическая точность выросла с 41,6% без контекста до 45,2% с ним. Кроме того, он возвращает определённый язык. Чего он не делает — так это диаризации говорящих или посекундных временных меток для слов — OpenAI указывает на отдельные модели для этого, — поэтому расшифровка встречи возвращается в виде единой неразделённой стены текста, если только вы сами не выстроите слой говорящих.
VibeVoice-ASR-Streaming-7B делает противоположную ставку. В карточке модели заявлен потоковый вывод с атрибуцией говорящих — кто что сказал, публикуется по мере разрешения чанка, — а также настраиваемые хот-ворды через контекстный промпт (флаг CLI — `--context_info`). Именно эту возможность GPT Transcribe явно не поддерживает, и именно поэтому для многоговорящего живого аудио эти две модели не взаимозаменяемы. Противовесом служит верификация: отсутствующие функции GPT Transcribe — это задокументированное продуктовое решение, тогда как заявленная атрибуция говорящих у VibeVoice — это утверждение из карточки модели, не подтверждённое ни одним независимым тестом. Различаются стороны и по временным меткам — ни одна из них не предлагает посегментные временные метки на сравниваемом пути, хотя пакетная модель семейства VibeVoice их поддерживает.

Формы цены и вопрос собственности
Структуры затрат едва ли могли бы различаться сильнее, и ни у одной из них нет безусловного преимущества. GPT Transcribe — это API с оплатой по факту использования: $0,27 за час аудио, без инфраструктуры, без GPU, 25 МБ на запрос и эксплуатационные гарантии OpenAI — цена отказа от самостоятельного запуска модели распознавания речи. VibeVoice-ASR-Streaming-7B стоит $0 за веса, но это примерно 18 ГБ в bf16 без учёта KV-кэша: потребуется GPU класса 24 ГБ, демонстрационный код microsoft/VibeVoice или плагин vLLM, а также собственные мониторинг и масштабирование. Лицензия MIT — вот та разница, которую не отражает никакая повременная оплата: веса остаются вашими навсегда; вы можете дообучать их и запускать на оборудовании под вашим контролем, без платы за каждое рабочее место и без потолка в 25 МБ.
Языковое покрытие — это область, где обе стороны отличаются большей расплывчатостью, чем хотелось бы покупателям. VibeVoice-ASR-Streaming-7B указывает в своей карточке модели 10 языков — английский, китайский, испанский, португальский, немецкий, японский, корейский, французский, русский, итальянский — против 50+ у пакетной версии VibeVoice-ASR. OpenAI не публикует сопоставимый список подтверждённых языков для GPT Transcribe; в материалах к запуску она сообщает о сильных результатах на 22 языках Common Voice, а её выявленный в ходе аудита акустический недостаток на Earnings22 напоминает, что «поддерживается» и «справляется с шумным аудио на этом языке» — это разные утверждения. Если ваши потребности в покрытии широки, ни один список не даёт ответа — тестируйте свои реальные диалекты.

Суть: выбирай по линии, а не по очкам.
Выбирайте GPT Transcribe, когда аудио — это готовый файл, когда вам нужен документально подтверждённый показатель точности с известными ограничениями или когда $0,27 в час — разумная цена за то, чтобы не запускать собственную инфраструктуру распознавания речи. Используйте его вместе с GPT Live Transcribe только в том случае, если доставка в реальном времени оправдывает почти четырёхкратное удорожание. Выбирайте VibeVoice-ASR-Streaming-7B, когда задача решается в реальном времени и в ней участвует несколько говорящих, когда вы хотите, чтобы расшифровка появлялась, пока разговор ещё идёт, когда потоковый вывод с указанием говорящего — это функция, которую вы хотите оценить, или когда открытые веса и контроль над данными важнее измеренных показателей бенчмарка.
Одно структурное замечание для команд, строящих на любом из этих решений: слой транскрибации сегодня не маршрутизируется OrcaRouter — ни одна из моделей распознавания речи на этой странице не входит в его каталог, поэтому выбор ASR полностью остаётся за вами. Что маршрутизация действительно даёт — так это слой поверх транскрипта. Живой поток транскрипции полезен только тогда, когда что-то с ним работает: суммаризатор, правило оповещения, планировщик голосового агента. Именно этот стек OrcaRouter предоставляет через один API: более 200 моделей по ценам провайдеров без наценки, плюс автоматическое переключение при сбоях. Паттерн, который делает непроверенный чекпоинт вроде VibeVoice-ASR-Streaming-7B доступным для пробы, заключается именно в этом: держите конечную точку, потребляющую ваши транскрипты, заменяемой — и модель без единого бенчмарка сможет заслужить или потерять ваш трафик на основании вашей собственной аудиозаписи, а не по заявлению в день запуска.
