
VibeVoice-ASR-Streaming-1.5B против Gemini 3.5 Transcribe: тихое потоковое ASR от Microsoft против нового API Google
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Семь дней и один философский водораздел разделяют две новейшие потоковые системы распознавания речи в текст. 26 августа 2026 года Google выпустила Gemini 3.5 Transcribe в публичную предварительную версию: размещённый, закрытый API распознавания речи в текст, тарифицируемый за аудиотокен, с отдельной конечной точкой Live для сеансов реального времени. 2 сентября 2026 года Microsoft Research загрузила VibeVoice-ASR-Streaming-1.5B на Hugging Face в пространство имён microsoft — веса под лицензией MIT, без пресс-релиза, без анонса и, на момент написания, без какого-либо стороннего освещения. Обе системы распознают речь, пока она ещё поступает. Практически всё остальное в них — кому разрешено их запускать, сколько они стоят, какие доказательства их работы существуют — различается.
Эта страница сравнивает их в том виде, в каком они реально существуют сегодня, поэтому две стороны доказательств несимметричны. Gemini 3.5 Transcribe — это действующий продукт Google с опубликованными ценами на токены и сторонними показателями точности от Artificial Analysis; ниже эти цифры обозначены как AA. VibeVoice-ASR-Streaming-1.5B — это чекпойнт, в карточке модели которого вообще нет текстовых данных ни о показателе частоты ошибок в словах, ни о задержке: оценка в карточке представлена изображением, а единственное объявление о стриминговом семействе на данный момент — новостная строка от 3 сентября в GitHub-репозитории VibeVoice от Microsoft. Всё, что ниже относится к стороне Microsoft, известно из репозитория: файлы конфигурации, карточка модели и собственная документация Microsoft по стримингу. Независимых бенчмарков этой модели пока не проводилось.
Обе модели на первый взгляд
• Что это — VibeVoice-ASR-Streaming-1.5B: открытый чекпоинт, лицензия MIT, самостоятельное размещение против Gemini 3.5 Transcribe: размещённый API, закрытые веса.
• Релиз — веса 2 сентября 2026 г., новость в репозитории 3 сентября, по сравнению с публичной предварительной версией от 26 августа 2026 г. с полными материалами запуска.
• Потоковый формат — текст выдаётся порциями по ~2,9 секунды с опережением ~0,5 с, состояние сеанса хранится в префиксном кеше; в отличие от Live-сеанса WebSocket, который тарифицируется за каждый аудиотокен и ограничен 10 минутами аудио на сеанс.
• Точность в печатных материалах — ни один показатель WER или задержки не опубликован в тексте; по измерениям AA WER составляет 2,6% на предварительно записанном эндпоинте и 4,0% на Live-эндпоинте.
• Выходные данные о говорящих — заявлена потоковая атрибуция «кто что сказал» (не проверено), тогда как на Live endpoint нет ни диаризации говорящих, ни пословных временных меток.
• Hotwords — поддерживаются через тот же контекстный промпт, что и batch VibeVoice-ASR, но не являются заявленной функцией Live endpoint.
• Стоимость: $0 за веса, ~5,6 ГБ для самостоятельного хостинга против примерно $0,30 за аудио-час (в среднем) на эндпоинте для предварительно записанного аудио и ~$0,54 на Live, согласно опубликованным Google расценкам на токены.

Размещенный API и тихая загрузка с интервалом в семь дней.
Gemini 3.5 Transcribe — это модель транскрибации от Google, которая приходит на смену прежней, и поставляется в виде двух продуктов. Предварительно записанная конечная точка, обслуживаемая через Interactions API, принимает полный аудиофайл и возвращает транскрипт с ожидаемыми дополнительными возможностями. Живая конечная точка, gemini-3.5-transcribe-live, работает через двунаправленный WebSocket и конкурирует с VibeVoice-ASR-Streaming-1.5B по характеру задачи: транскрибация сеанса по мере его прохождения. Google анонсировала её в обычном порядке — публичный предварительный запуск 26 августа, цены на странице модели, сторонние рейтинги, которые подхватили её в течение нескольких дней.
В стриминговом релизе Microsoft ничего этого не было. 2 сентября аккаунт microsoft на Hugging Face создал два чекпойнта в одну минуту: VibeVoice-ASR-Streaming-7B и VibeVoice-ASR-Streaming-1.5B. В таблице моделей в репозитории GitHub теперь указан VibeVoice-ASR-Streaming как представитель семейства, а в разделе новостей есть запись от 3 сентября, объявляющая о «единой стриминговой ASR-модели, которая непрерывно транскрибирует, кто и что сказал, по мере поступления речи, с поддержкой настраиваемых ключевых слов и 10 языков» — но в этом анонсе упоминается только 7B, а 1.5B — меньший собрат, выпущенный вместе с ней без отдельного упоминания. Когда мы проверили через день после загрузки, оба чекпойнта всё ещё показывали ноль загрузок.

Что означает "стриминг" с каждой стороны
Слово «streaming» скрывает реальное различие в архитектуре. Конфигурация препроцессора Microsoft делает темп VibeVoice конкретным: звук поступает с частотой 24 кГц и сжимается в 3200 раз в поток речевых токенов со скоростью около 7,5 Гц (один токен каждые ~133 мс). Затем в конфигурации объявляется фрагмент из 22 кадров и упреждение из 4 кадров — примерно 2,9 секунды аудио на фрагмент, причём около половины секунды будущего аудио используется для уточнения текущего сегмента. Модель выдаёт текст один раз за каждый завершённый фрагмент; в документации Microsoft отмечается, что контекст более ранних фрагментов сохраняется через KV-кэш, поэтому длительный сеанс не пересчитывается с нуля. Арифметика заложена в конфигурации; практическое следствие — транскрипт растёт примерно трёхсекундными приращениями, а не отдельными частичными результатами по словам.
Конечная точка Google Live имеет другую форму потоковой передачи: двунаправленная WebSocket-сессия, в которой аудио тарифицируется из расчёта 25 аудио-токенов в секунду, разработанная для интерактивного использования, но ограниченная 10 минутами аудио на сессию и — конкретно на конечной точке Live — не поддерживающая диаризацию говорящих или таймстампы на уровне слов. Для тех, кто сравнивает эти два варианта как движки живой транскрипции, значимые различия — это лимит сессии (10 минут на стороне Google Live, а на стороне Microsoft — только ограничения вашего собственного GPU и памяти), частота выдачи (~3-секундные фрагменты против того, что доставляет WebSocket-сессия) и дополнительные выходные данные (атрибуция говорящих и хотворды, заявленные в карточке Microsoft и отсутствующие в списке возможностей Google Live).
Точность: на одной стороне — числа, на другой — картинка.
Это самый большой разрыв в этом сравнении, и это разрыв в доказательствах, а не обязательно в качестве. Artificial Analysis оценивает Gemini 3.5 Transcribe с уровнем ошибок в словах 2,6% на предварительно записанном endpoint и 4,0% на Live endpoint — надбавка, которую вы платите за доставку в реальном времени, отражается в уровне ошибок, что является обычным и честным компромиссом для потоковых систем. Это сторонние цифры на нейтральном рейтинге, опубликованные через несколько дней после запуска.
У VibeVoice-ASR-Streaming-1.5B нет сопоставимых показателей нигде. Карточка модели содержит график с результатами оценки в виде изображения, но не приводит в текстовом виде никаких числовых значений WER, RTF или задержки — нечего процитировать и нечего проверить независимо. Microsoft не привела в текстовом виде показатели точности потоковых моделей ни для 7B, ни для 1.5B. Единственный числовой ориентир во всей линейке — карточка пакетной модели VibeVoice-ASR: в ней сообщается о среднем WER 7.77%, полученном вендором на восьми английских тестовых наборах, и 2.20% на LibriSpeech clean. Но эти цифры описывают непотоковую модель, а потоковые модели обычно жертвуют небольшой точностью ради выигрыша в задержке. Пока кто-нибудь не прогонит потоковый чекпойнт через публичный испытательный стенд, честная позиция такова: модель Google измерена, а Microsoft — нет.
Стоимость: за аудио-час против за GPU-час
Google продаёт Gemini 3.5 Transcribe по токенам, и ценообразование чётко разделяется между двумя конечными точками. Для предзаписанной конечной точки указано $2 за 1 млн аудио-входных токенов и $12 за 1 млн текстовых выходных токенов, что в сумме даёт примерно $0,30 за аудио-час. Для Live-конечной точки указано $3,50 за 1 млн аудио-токенов и $21 за 1 млн текстовых токенов — примерно $0,54 за аудио-час, то есть примерно на 80% дороже, чем для предзаписанной; это цена доставки в реальном времени. Google тарифицирует аудио из расчёта 25 токенов в секунду, так что тишина бесплатна только в том случае, если ваш клиент не передаёт её в потоке; переподключения, дублированный аудиопоток и логирование могут увеличить реальный счёт. Существует бесплатный тариф, с оговоркой, что контент бесплатного тарифа может использоваться для улучшения продуктов Google.

Модель Microsoft тарифицируется в GPU-часах. Контрольная точка 1.5B — это примерно 5,6 ГБ весов в формате bf16 (языковой каркас Qwen класса 1.5B плюс аудиотокенизаторы и диффузионная головка — метаданные safetensors в сумме дают около 3 млрд параметров), а документированные способы её запуска предполагают самостоятельный хостинг: Python-демо из репозитория microsoft/VibeVoice или плагин для vLLM, который Microsoft описывает для обслуживания OpenAI-совместимых и WebSocket-конечных точек. Готового хостингового тарифа пока нет, поскольку ни один провайдер инференса ещё не предлагает эту модель. Вопрос стоимости целиком сводится к тому, дешевле ли ваше собственное GPU-время, чем почасовая ставка Google, — а при любом sustained объёме транскрибации это почти наверняка так. Вопрос лицензии при этом отделён от вопроса стоимости, потому что веса под лицензией MIT остаются вашими навсегда, чего не гарантирует ни одна API-подписка.
Эти два подхода не исключают друг друга в продакшн-стеке. Прагматичный паттерн для команды, которой нужна транскрибация в реальном времени уже сегодня, — держать ASR-слой за одним эндпоинтом, чтобы выбор оставался обратимым: маршрутизирующий API, который обслуживает более 200 моделей по прайс-листам провайдеров без наценки (так что изменение цены вендора вступает в силу в тот же день) и обеспечивает автоматический фейловер, — это именно тот слой, который позволяет использовать проверенный API Google по умолчанию и направлять часть реального трафика на тестирование VibeVoice-ASR-Streaming-1.5B, как только провайдер начнёт его хостить. Именно такова модель OrcaRouter, и это низкорисковый способ внедрить чекпойнт, точность которого ещё никто не проверил.
Кто должен выбирать
Выбирайте Gemini 3.5 Transcribe, если вам нужен API для транскрибации, который работает уже сегодня, с опубликованной точностью, предсказуемыми ценами за час и без необходимости присматривать за GPU — и особенно если ваше аудио не входит в десять языков, перечисленных Microsoft, или если вам нужны диаризация и временные метки на уровне слов для транскрибации файлов через endpoint для предварительно записанного аудио. Ограничение в 10 минут для живых сессий — это реальное ограничение, которое стоит проверить на вашем сценарии использования, прежде чем выбирать его для живых сессий.
Выбирайте VibeVoice-ASR-Streaming-1.5B, если вы разворачиваете модель самостоятельно, если вам нужны веса и контроль над данными, которые даёт лицензия MIT, если вам требуется неограниченная длина сеанса или если потоковый вывод с определением «кто что сказал» и горячие слова — это функции, которые вы хотите оценить. Закладывайте в бюджет установку из исходного кода, ~5,6 ГБ весов на GPU NVIDIA и собственный этап проверки — бенчмарка, на который можно опереться, нет, так что вопрос точности вам предстоит решить на собственном аудио.
Вердикт по итогам недели: Google выпустил выверенный продукт, а Microsoft — интересную ставку. Gemini 3.5 Transcribe — более безопасный вариант по умолчанию, подкреплённый сторонними цифрами; VibeVoice-ASR-Streaming-1.5B — открытая, самостоятельно разворачиваемая и совершенно непроверенная альтернатива. Выбор обходится дёшево, потому что он не обязан быть постоянным — держите ASR-эндпойнт заменяемым, и контрольная точка, выпущенная без единого бенчмарка, может завоевать или потерять ваш трафик на основе ваших собственных транскриптов.
