Hero-карточка со сравнением {{1}}«VibeVoice-ASR-Streaming-7B против Gemini 3.5 Transcribe Live»{{/1}}, надзаголовком «Потоковое распознавание речи — сентябрь 2026», подзаголовком о том, что тихий открытый чекпоинт Microsoft встречается со сдержанным Live API от Google, чипами {{2}}«Веса MIT — 2 сент.»{{/2}}, {{3}}«Google API — 26 авг.»{{/3}} и {{4}}«WER для VibeVoice не опубликован»{{/4}}, а также сноской «Что нам известно на данный момент». Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

VibeVoice-ASR-Streaming-7B против Gemini 3.5 Transcribe Live: одна неделя, два вида потокового распознавания речи

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Последняя неделя августа и первые дни сентября 2026 года породили две потоковые системы преобразования речи в текст, которые выглядят как конкуренты, а на самом деле являются разными ответами на один и тот же вопрос. 26 августа Google вывел Gemini 3.5 Transcribe Live в публичную предварительную версию: это размещенный закрытый эндпоинт преобразования речи в текст, который возвращает готовую расшифровку через 0,40 секунды после того, как говорящий замолкает, а его характеристики подтверждаются измеренным Artificial Analysis показателем потоковой частоты ошибок в словах 4,0% и полными материалами запуска. 2 сентября Microsoft Research загрузил VibeVoice-ASR-Streaming-7B на Hugging Face в пространство имен microsoft: открытые веса под лицензией MIT, без пресс-релиза, без страницы запуска и с карточкой модели, в которой вообще не указаны в читаемом виде ни показатель ошибок в словах, ни показатель задержки. Обе системы принимают аудио, пока оно всё ещё поступает. Это почти единственное, что их объединяет.

Доказательства по двум сторонам несимметричны, поэтому это сравнение написано в формате «что нам известно на данный момент». Gemini 3.5 Transcribe Live — это продукт Google с опубликованными ценами на токены и сторонними измерениями, которые отмечены ниже. VibeVoice-ASR-Streaming-7B — это контрольная точка, все утверждения о которой взяты непосредственно из самого репозитория: файлов конфигурации, карточки модели и документации Microsoft по потоковой передаче в репозитории VibeVoice на GitHub. Что касается стороны Microsoft, здесь ещё ничего не подвергалось независимому бенчмаркингу, и мы прямо говорим об этом везде, где цифра в противном случае могла бы показаться аргументом.

Тропа релиза: запуск API и тихая загрузка

Google выпустила Gemini 3.5 Transcribe Live обычным путём. Модель находится под баннером Gemini Audio вместе со своим собратом Gemini 3.5 Transcribe (путь предварительно записанных Interactions API), цены указаны на странице модели, а независимые лидерборды подхватили Live-эндпоинт в течение нескольких дней — именно оттуда берутся 4,0% WER для потоковой передачи и финальная задержка 0,40 секунды. Существует бесплатный тариф с обычной оговоркой, что контент бесплатного тарифа может использоваться для улучшения продуктов Google.

В потоковом релизе Microsoft не было ничего из этого механизма. Репозиторий Hugging Face microsoft/VibeVoice-ASR-Streaming-7B был создан 2 сентября 2026 года в 15:46 UTC и последний раз изменён через три минуты; в нём восемь шардов safetensors, токенизатор и конфиг препроцессора под лицензией MIT. Официальная регистрация — это строка в журнале новостей от 3 сентября в репозитории microsoft/VibeVoice, объявляющая о «единой потоковой ASR-модели, которая непрерывно транскрибирует, кто что сказал, по мере поступления речи, с поддержкой настраиваемых хот-вордов и 10 языков», со ссылками на демо по адресу aka.ms/vibeasr и технический отчёт о потоковом ASR. Когда мы проверили через день после загрузки, чекпойнт по-прежнему показывал ноль загрузок, и ни один провайдер размещённого инференса не указывает его в своих списках. Карточка модели сообщает больше, чем анонс, а репозиторий — источник почти всего нижеследующего.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Характеристики, рядом

• Что это — VibeVoice-ASR-Streaming-7B: потоковое распознавание речи (ASR) с открытыми весами, самостоятельное развёртывание, против Gemini 3.5 Transcribe Live: размещённый потоковый API, закрытые веса.

• Форма потоковой передачи — выдает текст фрагментами примерно по 2,9 секунды с упреждением около 0,5 секунды (на основе конфигурации контрольной точки) по сравнению с двунаправленным WebSocket-соединением с непрерывными промежуточными расшифровками и окончательным результатом через 0,40 секунды после того, как говорящий замолкает.

• Точность на бумаге — ни один показатель WER или задержки не опубликован, тогда как по данным Artificial Analysis потоковый WER составляет 4,0%, а на модели для предварительно записанных аудиофайлов — 2,6%.

• Спикеры — заявлена потоковая атрибуция «кто что сказал» (неподтверждённая); на Live-конечной точке диаризация говорящих отсутствует (доступна в модели для предзаписанных аудио — до трёх говорящих).

• Языки — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) против автоопределения по 85+ языкам с переключением в процессе работы.

• Длительность сеанса — ограничена только вашим GPU и памятью, а не жёстким лимитом в 10 минут на Live-сеанс.

• Стоимость — $0 за веса, около 18 ГБ в bf16 для самостоятельного хостинга против примерно $0,54 за час аудио на Live с учётом токенов текстового вывода.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Что означает "стриминг" с каждой стороны

Слово скрывает реальное различие в дизайне, и стоит быть точным, потому что две системы даже не пытаются создать один и тот же ритм. Конфигурация препроцессора Microsoft делает ритм VibeVoice конкретным: звук поступает на частоте 24 кГц и сжимается в 3200 раз в поток токенов со скоростью около 7,5 кадра в секунду, затем конфигурация задаёт блок из 22 кадров и упреждение в 4 кадра — примерно 2,9 секунды аудио на блок и около половины секунды будущего аудио для уточнения. Модель выдаёт текст один раз за каждый разрешённый блок, а контекст предыдущих блоков сохраняется через KV-кэш, поэтому длительный сеанс не пересчитывается с нуля. Практический транскрипт растёт приращениями примерно по три секунды.

Live-эндпоинт Google рассчитан на более быстрый и интерактивный контур: аудио идёт через WebSocket чанками PCM на 16 или 24 кГц, частичные расшифровки возвращаются непрерывно, пока говорит собеседник, а финальная форматированная расшифровка появляется через 0,40 секунды после конца речи — это замер Artificial Analysis, на который ссылается Google. Оборотная сторона — ограничение сессии (десять минут аудио, после чего вашему приложению необходимо переподключиться и склеить результаты) и отсутствие дополнительных функций: ни диаризации дикторов, ни пословных временных меток на Live-пути, хотя обе есть в предварительно записанном Gemini 3.5 Transcribe. Так что честный вывод такой: потоковая модель Google быстрее на одно высказывание, а стриминговый чекпоинт Microsoft медленнее на чанк, но заявляет атрибуцию дикторов, которой лишён Live-режим Google, и при этом поддерживает длительность сессии, которой у Google нет.

Точность: измеряется по сравнению с пустым пространством

Самый большой разрыв в этом сравнении — недостаток доказательств, а не обязательно разница в качестве. Artificial Analysis зафиксировала у Gemini 3.5 Transcribe Live среднюю частоту ошибок в словах 4,0% в потоковом режиме и 2,6% у непотоковой модели, причём последняя заняла пятое место в её рейтинге WER на момент запуска; Google отдельно называет 5,50% для потокового и 5,04% для непотокового сценария на многоязычном наборе FLEURS. Читайте их так, как они обозначены: Artificial Analysis независима от Google, но у API, которому всего один день, показатели ещё не устоялись, а надбавка потокового режима над пакетным — 4,0% против 2,6% — обычная цена работы в реальном времени.

У VibeVoice-ASR-Streaming-7B нет сопоставимых показателей нигде. В карточке модели оценочный график представлен в виде изображения, а технический отчёт Microsoft — это PDF, но ни один из них не даёт потоковых значений WER или задержки в виде обычного текста, которые можно было бы процитировать или проверить независимо. Единственный числовой ориентир во всём семействе — карточка пакетной модели VibeVoice-ASR, в которой указан полученный вендором средний WER 7,77 % на восьми английских тестовых наборах и 2,20 % на LibriSpeech clean. Это цифры для не потоковой модели, а не для этой; потоковые модели, как правило, немного теряют в точности ради выигрыша в задержке. Пока кто-то не прогонит потоковый чекпоинт через публичный испытательный стенд, справедливая формулировка такова: одна сторона этого сравнения измерена, а другая — нет.

Стоимость: API с оплатой по факту использования против GPU, который вы уже заложили в бюджет

Google тарифицирует Gemini 3.5 Transcribe Live по токенам и выставляет счёт за аудио из расчёта 25 токенов в секунду. По опубликованным тарифам Live — $3,50 за 1 млн аудиотокенов и $21 за 1 млн текстовых выходных токенов — усреднённый аудио-час обходится примерно в $0,54, то есть около $9 за 1000 аудиоминут, а предзаписанная модель ещё дешевле — примерно $0,30 в час. Тишина бесплатна, только если ваш клиент не передаёт её в потоковом режиме: повторные подключения, дублирование аудио и логирование добавляют к реальному счёту дополнительные тарифицируемые токены.

Чекпойнт Microsoft вместо этого тарифицируется в GPU-часах. Одни только веса bf16 занимают около 18 ГБ ещё до какого-либо KV-кэша; документированные варианты — это Python-демо из репозитория microsoft/VibeVoice и плагин для vLLM, который обслуживает WebSocket- и OpenAI-совместимые конечные точки. Цены на аренду нет, потому что модель пока не хостит ни один провайдер; в Azure AI Foundry она отсутствует, в отличие от пакетного VibeVoice-ASR, который доступен там с марта. Самостоятельный хостинг речевой LLM класса 7B означает, что в бюджет нужно закладывать GPU класса 24 ГБ и собственное время на эксплуатацию; взамен вы получаете неограниченную длительность сессии и веса, которые навсегда остаются у вас. Обе модели не являются взаимоисключающими — в этом суть последнего раздела.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Держать выбор недорогим

То, какой вариант вы выберете, зависит от того, нужен ли вам номер или код. Выбирайте Gemini 3.5 Transcribe Live, если вам нужна транскрипция, которая работает уже сегодня: с опубликованной точностью и без необходимости в GPU, — и если ваш аудиоматериал не ограничен десятью языками или вы готовы самостоятельно сделать разметку дикторов, поскольку Live-эндпоинт её не предоставляет. Выбирайте VibeVoice-ASR-Streaming-7B, когда вы размещаете модель у себя, когда важны неограниченная длительность сессии или заявленный потоковый вывод с атрибуцией дикторов и когда вы готовы провести собственную оценку, ведь опереться на бенчмарк не на что.

Ни тот, ни другой выбор не обязан быть окончательным — и именно здесь слой маршрутизации окупает себя: он служит моделям, работающим с транскриптом, а не самому распознаванию речи. OrcaRouter сегодня не маршрутизирует распознавание речи, и ни одна из моделей на этой странице не входит в его каталог; его задача — единый API к 200+ языковым моделям, потребляющим живой транскрипт, — суммаризатору, экстрактору пунктов действий, планировщику голосового агента, — по списковым ценам провайдеров, передаваемым без наценки, и с автоматическим переключением между провайдерами. Если вендор снижает цену на любую модель в этом стеке, изменение вступает в силу в тот же день, потому что списковые цены передаются дальше, а не накручиваются. Этап распознавания речи остаётся там, где вы его разместили; стек же, работающий с транскриптом, — это как раз тот слой, где один ключ и резервный маршрут превращают недельной давности чекпоинт без бенчмарков из ставки в проверяемый вариант.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube