
Voxtral Mini 4B Realtime Arabic против Gemini 3.5 Transcribe Live: диалекты против широты охвата
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Две потоковые модели распознавания речи — и две совершенно разные ставки на то, что считать сложной частью транскрипции. Voxtral Mini 4B Realtime Arabic — это дообученная модель на 4,4 млрд параметров, которую Mistral AI 8 октября 2026 года выложила в публичный репозиторий без анонсирующего поста, записи в блоге или строчки в новостном индексе компании; она специально обучена на современном стандартном арабском и пятнадцати названных диалектах и выпущена под Apache 2.0 с доступными для скачивания весами BF16. Gemini 3.5 Transcribe Live — это потоковый эндпоинт Gogle для Gemini 3.5 Transcribe, анонсированный в августе 2026 года со всей атрибутикой платформенного релиза, охватывающий более 85 локалей и закрытый: preview-API без весов и с ограничением сессии в десять минут. Одна модель углубилась в одну языковую семью и прямо сказала об этом в разделе собственных ограничений; другая пошла вширь и оставила гарантии на уровне акцентов незаявленными. Какую из них выбрать, зависит от оси, которую маркетинг ни одного из вендоров не ставит на первое место: от того, как на самом деле звучит ваше аудио.
Это не симметричное сравнение, и об этом стоит сказать сразу, а не прятать это. Модель Mistral на момент написания существует всего 48 часов, у неё нет анонса от вендора, нет независимой оценки и нет опубликованной цены. Модель Google находится в публичном превью с конца августа, и её измеряют на стороннем трекере. Рассматривайте сторону Mistral как набор утверждений из карточки модели, а сторону Google — как набор измерений плюс набор утверждений, и сравнение останется честным.
Что представляет собой каждая модель, до цифр
• Voxtral Mini 4B Realtime Arabic — потоковая ASR-модель, дообученная на основе Voxtral-Mini-4B-Realtime-2602, примерно с 4,4 млрд параметров в BF16, принимающая аудио с частотой 16 кГц через каузальный аудиокодер и языковой декодер. Она выдаёт текст по мере поступления аудио с настраиваемой задержкой транскрипции и распространяется под лицензией Apache 2.0, веса доступны на Hugging Face. Mistral совместно разработала её с Министерством цифрового перехода и административной реформы Марокко в рамках партнёрства, подписанного в январе 2026 года, и описывает модель как суверенный ИИ-актив.
• Gemini 3.5 Transcribe Live — потоковая половина выпуска двух моделей. Конечная точка Live API передаёт непрерывный звук с микрофона по WebSocket, возвращает промежуточные транскрипции, пока говорящий ещё говорит, и формирует окончательную транскрипцию вскоре после завершения каждой реплики. Пакетный аналог, gemini-3.5-transcribe, обслуживает предварительно записанные файлы длительностью до часа. Обе находятся в публичной предварительной версии, обе доступны только через API, и ни у одной не опубликованы веса.
Первое структурное различие — не в точности. Оно в том, что одно из них — файл, который можно скачать уже сегодня вечером, а другое — сервис, для использования которого нужно получить одобрение.

Языковой охват: 16 против более чем 85 — и дело не в разрыве.
Подсчёт языков заставляет модель Mistral выглядеть узкой, а модель Google — огромной. Эти подсчёты измеряют разные вещи, и сопоставление их бок о бок без этой оговорки — самая распространённая ошибка, к которой провоцирует это сравнение.
• Voxtral Mini 4B Realtime Arabic — 16 арабских вариантов, индивидуально названных на карточке модели по диалектным семьям: современный стандартный арабский, а также марокканский, ливийский, тунисский, алжирский и хассания из Магриба; заливский, наджди, оманский и санаани из Залива; египетский и суданский из долины Нила; месопотамский и оба — южнолевантийский и северолевантийский; и чадский арабский. Собственная формулировка карточки такова, что модель нацелена на транскрипцию арабского языка, и что переключение кода — когда говорящие чередуют языки в середине разговора — это возможность, которую она была создана реализовать правильно, а не побочный эффект.
• Gemini 3.5 Transcribe Live — автоматическое определение языка для более чем 85 локалей, переключение языкового кода внутри предложения и между предложениями. В документации Google арабский указан в этом наборе; в таблице локалей арабская запись обозначена как арабский (Египет), а более широкий охват арабских локалей не детализирован в собственной документации модели.
Прочитайте это честно, и очертания компромисса проявятся. 85 с лишним у Google — это заявка на широту: если ваше аудио на языке, отличном от арабского, эндпоинт Google его покрывает, а модель Mistral откажется от него — в карточке прямо сказано, что для других языков следует использовать оригинальную Voxtral Mini 4B Realtime, а не этот чекпоинт. 16 у Mistral — это заявка на глубину. Она не претендует на транскрибирование арабского; она претендует на транскрибирование марокканской дарижи, арабского Персидского залива, египетского арабского и чадского арабского как отдельных целевых разновидностей, а это существенно более сложная задача, чем транскрибировать современный стандартный арабский и надеяться, что диалект проявится из этого сам собой. Бенчмарк с перевесом в сторону английского и приоритетом широты никогда не покажет вам эту разницу, потому что диалектных наборов в нём нет.
Для марокканского колл-центра или линии поддержки клиентов в странах Залива модель, которая работает с 16 диалектами и ни с чем больше, может превзойти модель, которая поддерживает 85 локалей при неуказанной точности по каждому диалекту. Для европейской компании, транскрибирующей встречи на пяти языках, уравнение мгновенно переворачивается. Ни один из поставщиков не ошибается; они выбрали разных клиентов.

Числа, которые можно сравнить, и те, которые нельзя
Вот где асимметрия даёт о себе знать. Две модели сообщают о разных единицах, на разных корпусах, с разной доказательной базой за ними, и ни одна третья сторона не сопоставляла их друг с другом.
• Voxtral Mini 4B Realtime Arabic — средняя частота ошибок на уровне символов 8,82% по семи арабским бенчмаркам при заданной задержке транскрипции 480 миллисекунд. Согласно собственной карточке Mistral, независимо не воспроизводилось.
• Модель, которую он пытается догнать, — Voxtral Transcribe Arabic с показателем 7,91 % CER на тех же семи бенчмарках при том же способе измерения, так что модель реального времени отстаёт на 0,91 процентного пункта от офлайн-модели для арабского языка того же вендора. Этот разрыв — собственное сравнение Mistral, и именно поэтому оно необычайно показательно: вендор сам сообщает вам, во что обходится потоковая обработка с точки зрения точности на этой языковой семье.
• Gemini 3.5 Transcribe Live — 4,0 % потоковой частоты ошибок в словах, измеренной Artificial Analysis и упомянутой Google, при этом окончательная транскрипция поступает через 0,40 секунды после окончания речи. Также измерено: 2,6 % в непотоковой таблице того же трекера и 5,50 % в потоковом режиме на FLEURS по собственным данным Google.
Не ставьте 8,82 % CER рядом с 4,0 % WER и не делайте из этого никаких выводов. Частота ошибок на уровне символов и частота ошибок на уровне слов имеют разные знаменатели — арабская орфография делает разрыв между ними больше, чем для языков с латинской письменностью, — а корпуса не одни и те же, нормализация не одна и та же, и одно число сопровождается воспроизводимым скриптом, тогда как другое берётся из фиксированной смеси трекера, смещённой в сторону англоязычной речи операторов.
Более полезное сравнение — то, что приведено в самой карточке Mistral: 8,82% в потоковом режиме против 7,91% в офлайн-режиме, на идентичных бенчмарках с идентичной нормализацией. Это чистое измерение того, что даёт и чего стоит низкая задержка именно для арабского языка, и оно ценнее любого межвендорного процентного сравнения. Чего никто не опубликовал, так это сопоставимого прогона моделей Google и Mistral на арабском языке на одном и том же аудио. Пока кто-нибудь этого не сделает, «какая модель точнее в арабском» остаётся открытым вопросом, и единственный защитимый ответ таков: попробуйте обе на своих записях.
Одна деталь в карточке Mistral заслуживает упоминания, потому что она идёт вразрез с интересами самого вендора. В ней отмечается, что фильтры безопасности Gemini блокируют транскрипцию некоторых аудиообразцов FLEURS. Это реальное, проверяемое наблюдение о пайплайне конкурента, и это также ровно то, что никогда не появляется в таблице лидеров, — модель, которая отказывается транскрибировать образец, оценивается как ошибка или как отсутствие, и ни одна из этих трактовок не является справедливой. Если ваше аудио содержит материал, который может поймать контент-фильтр, это риск при развёртывании, который не выявит никакой показатель WER.
Задержка: регулятор против фиксированного числа
Потоковые модели обычно сравнивают по одному показателю задержки. У этих двух нет ни одного общего.
• Voxtral Mini 4B Realtime Arabic — настраиваемая задержка транскрипции. CER 8,82% указан для 480 миллисекунд, а задержка регулируется, то есть показатель точности — это одна точка на кривой, которую выбирает оператор, а не свойство модели. Его базовая модель заявляет диапазон от 240 миллисекунд до 2,4 секунды.
• Gemini 3.5 Transcribe Live — 0,40 секунды от окончания речи до финальной транскрипции по данным Artificial Analysis, при этом промежуточные результаты поступают непрерывно во время речи. Google отдельно заявляет об улучшении времени до финальной транскрипции на 70% по сравнению с Chirp 3; это цифра производителя, и она не воспроизведена.
Оба оказываются в одной и той же области — примерно полсекунды — но инженерный смысл различается. Модель Mistral передаёт вам компромисс между задержкой и точностью в виде параметра, так что вы можете работать с задержкой 240 мс, когда субсекундные субтитры важнее последних нескольких процентных пунктов точности, и увеличивать задержку, когда это не так. Эндпоинт Google представляет собой фиксированную рабочую точку с присущим Google поведением контент-фильтра. Для голосового агента регулировка ценнее, чем немного лучшее фиксированное число, потому что правильная настройка зависит от вашего аудио и ваших пользователей, и ни один из поставщиков не может выбрать её за вас.
Настоящий водораздел: открытые веса против эндпоинта предварительного просмотра
Разница в лицензировании и распространении в этом сравнении больше, чем любой разрыв в бенчмарках, и она определяет большинство реальных внедрений ещё до того, как речь заходит о точности.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, веса BF16 на Hugging Face, обслуживается через vLLM по WebSocket на /v1/realtime и нативно поддерживается в Transformers начиная с версии 5.2.0. В карточке есть пример на Python и модуль нормализации, так что вы можете сами воспроизвести вычисление CER для арабского. Ничто в пайплайне не требует серверов Mistral, а модель достаточно мала, чтобы операционный вопрос сводился к тому, какой использовать GPU, а не к тому, можете ли вы себе его позволить.
• Gemini 3.5 Transcribe Live — только API, публичная предварительная версия, без опубликованных ценовых обязательств помимо ставок из прайс-листа и с ограничением сессии в десять минут, а значит, всё, что длиннее, придётся разбивать на части, переподключать и сшивать собственным кодом. Три ограничения, о которых сообщалось вместе с запуском, особенно важны для арабоязычных внедрений: потоковая конечная точка не возвращает ни диаризацию говорящих, ни временные метки на уровне слов — и то и другое есть в пакетной конечной точке, но не в этой. Если вашей расшифровке на арабском нужно знать, кто что сказал, или её нужно синхронизировать с аудио, конечная точка Live не сможет этого выдать независимо от языка.
Эти два ограничения — сильнейший аргумент в пользу небольшой открытой модели при реальном развёртывании для арабского языка, и они не имеют никакого отношения к точности. Конвейеру колл-центра нужна атрибуция говорящего, конвейеру соответствия требованиям нужны временные метки, а офлайн-модель для арабского с контролируемым вами скриптом нормализации даёт и то и другое, не требуя спорить с контрактом конечной точки. В карточке модели Mistral это также указано как ограничение, а не как преимущество: она нацелена на транскрипцию, это дообученная версия общей модели реального времени, и там честно сказано, что выше по стеку существует более широкая модель, если она вам понадобится.
Сколько стоит каждый из них и что неизвестно
• Gemini 3.5 Transcribe Live — примерно $0,009 за минуту аудио по смешанной ставке, рассчитанные исходя из цен по прайс-листу: $3,50 за миллион входных токенов и $21 за миллион выходных токенов, при этом аудио оценивается в 25 токенов в секунду, а транскрипт — примерно в 175 токенов в минуту. Эндпоинт пакетной обработки стоит около $0,005 за минуту. Обе цифры — это оценки на основе предположений Google о токенизации, поэтому они изменятся, если изменится методика расчёта. Сегодня доступен бесплатный тариф.
• Voxtral Mini 4B Realtime Arabic — опубликованной цены нет, потому что нет опубликованного сервиса. Стоимость — это ровно то, во сколько обходится ваше оборудование. Модель BF16 с 4,4 млрд параметров помещается на одном современном ускорителе, поэтому предельные затраты на час аудио — это электроэнергия и загрузка, а фиксированные затраты — сама машина. Это дешевле, чем любой API с поминутной оплатой при больших объёмах, и дороже, чем любой API с поминутной оплатой при нулевом объёме, что и представляет собой обычную форму компромисса, характерного для открытых весов.
Самая важная неизвестная на стороне Mistral — не цена. А то, является ли этот репозиторий началом продуктовой линейки или разовой поставкой в рамках партнёрства с Марокко. Модель, которая выпускается тихо, без анонса, без цен и без сервиса, — это модель, за которой нет обязательств по поддержке. Apache 2.0 означает, что лицензию нельзя отозвать для весов, которые у вас уже есть, но это ничего не говорит о том, будет ли чекпоинт поддерживаться, а указатель на базовую модель в самой карточке позволяет предположить, что поддерживаемой линейкой по-прежнему остаётся общая модель реального времени.
Для слоя над транскриптом слой маршрутизации оправдывает себя способом, не имеющим никакого отношения к транскрипции. Ни одна из этих моделей не является сервисом распознавания речи, который мы размещаем, — OrcaRouter не маршрутизирует ни одну из этих конечных точек, — но суммаризатор, классификатор намерений или агент, потребляющий этот поток, — это модель, которую можно маршрутизировать: один API-ключ для более чем 200 моделей по прейскурантной цене провайдера с наценкой 0%, так что снижение цены поставщиком отражается на нашей стороне в тот же день, а также автоматическое переключение при сбое, если провайдер начнёт деградировать. Если вы уже объединяете двух поставщиков речевых технологий для покрытия диалектов, перевод нижестоящих языковых моделей на один ключ, а не на два контракта, — это дешёвая половина интеграции.
Что взять за основу
Если ваше аудио на арабском — один диалект, несколько или переключение кодов между арабским и чем-то ещё — модель Mistral является более серьёзным кандидатом, и причина структурная, а не численная. Она называет диалекты, для которых была создана, она достаточно мала, чтобы работать на вашем собственном оборудовании, она возвращает необработанный текст, который вы можете постобработать собственной нормализацией, и она не находится за ограничением сессии в десять минут или контент-фильтром, который вы не можете проверить. Цена этого в том, что она работает только с одной языковой семьёй и отвергает все остальные, и что никто пока не опубликовал независимой оценки её работы.
Если ваше аудио охватывает несколько языков или если вам уже сегодня нужен сервис с каналом поддержки и опубликованным прайс-листом, Gemini 3.5 Transcribe Live можно вызвать уже сейчас, он измеряется сторонним трекером и покрывает языки, которые чекпоинт Mistral отклонит. Издержки — это лимит сессии, отсутствие диаризации и временных меток на потоковом эндпоинте, а также тот факт, что точность именно для арабского — это утверждение, которое вам придётся проверять самостоятельно: в списке локалей указан Египет, а производительность по диалектам не детализирована.
Смотреть нужно не на бенчмарк. А на то, объявит ли Mistral эту модель вообще, и если да, то по какой цене и с какой языковой дорожной картой. Тихий репозиторий с лицензией Apache 2.0 — полезный артефакт и слабое обязательство. Если вслед за этим появится дорожная карта арабских диалектов — левантийский, заливный, египетский как отдельные чекпойнты — путь малых моделей станет по-настоящему полным ответом для региона, и аргумент о широте охвата будет приводить гораздо труднее.

Ни одна из них не является речевой моделью, которую размещаем мы, но слой над транскриптом маршрутизируется — более 200 моделей за одним API-ключом по прайс-листу провайдера с наценкой 0%, так что снижение цены поставщиком на модель рассуждений ниже по потоку от вашего транскрипта вступает в силу в тот же день.
Автоматическое переключение при сбое означает, что у составного речевого конвейера на один домен отказа меньше, потому что суммаризатор или классификатор интентов, потребляющий транскрипцию, можно перенаправить, вместо того чтобы он отключался вместе с провайдером.
