
Voxtral Mini 4B Realtime Arabic против Voxtral 4B TTS: два конца одного разговора
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Эти две модели имеют общее название, число параметров и файл лицензии, который ведёт себя иначе, — и на этом сходство заканчивается. Voxtral Mini 4B Realtime Arabic, выложенная на Hugging Face 8 октября 2026 года без сопроводительного анонса, принимает аудио на вход и выдаёт арабский текст — это потоковая дообученная версия Voxtral-Mini-4B-Realtime-2602, созданная для современного стандартного арабского языка и пятнадцати названных диалектов, лицензия Apache 2.0, средняя частота ошибок в символах 8,82 % при задержке в 480 миллисекунд. Voxtral 4B TTS, анонсированная Mistral AI в марте 2026 года, делает обратное: текст на входе, речь на выходе, двадцать предустановленных голосов плюс адаптация по короткому эталонному фрагменту, девять языков, включая арабский, и лицензия — CC BY-NC 4.0 — запрещающая коммерческое использование самих весов. Они не альтернативы и не варианты. Это две половины голосового цикла, и причина рассматривать их вместе в том, что решения, которые вы принимаете относительно одного из них, ограничивают другой сильнее, чем ожидает большинство команд.
Большинство страниц со сравнениями скажут вам, что эти модели не связаны, потому что одна — это ASR, а другая — TTS, и на этом остановятся. Это верно, но бесполезно. На самом деле стоит знать, где они пересекаются: голосовому агенту нужны обе, две лицензии указывают в противоположных направлениях, аппаратные требования у них похожи, а характеристики пропускной способности — нет, и заявления о поддержке арабского языка имеют совершенно разную форму. Всё ниже — об этих четырёх точках пересечения.
Что представляет собой каждая модель — в терминах, важных для пайплайна
• Voxtral Mini 4B Realtime Arabic — потоковое автоматическое распознавание речи. Аудио 16 кГц на входе, текст на выходе, примерно 4,4 млрд параметров в BF16, обслуживается через vLLM с WebSocket по адресу /v1/realtime или нативно в Transformers начиная с версии 5.2.0. Каузальный аудиокодер и языковой декодер, настраиваемая задержка транскрипции, заявленная как 480 миллисекунд для опубликованного показателя точности, и поставляемый в комплекте модуль нормализации, чтобы частоту ошибок в арабских символах можно было пересчитать. Apache 2.0.
• Voxtral 4B TTS — потоковый и пакетный синтез речи. На входе текст, на выходе аудио 24 кГц в форматах WAV, PCM, FLAC, MP3, AAC или Opus, около 4 миллиардов параметров, с набором из 20 предустановленных голосов и адаптацией голоса по референсному клипу длительностью всего три секунды. Собственный бенчмарк Mistral на одном H200 под управлением vLLM-Omni 0.18.0 при входном тексте из 500 символов и десятисекундном референсном клипе сообщает: при параллелизме 1 задержка составляет 70 миллисекунд, а коэффициент реального времени — 0,103; при параллелизме 16 они возрастают до 331 миллисекунды и 0,237, а при параллелизме 32 задержка достигает 552 миллисекунд. Доступен как API по цене $0,016 за тысячу символов.
Первое наблюдение из этих двух абзацев: эта пара небольшая. Обе модели находятся в диапазоне 4 миллиардов параметров, и обе помещаются на одном ускорителе в BF16, а значит, арабоязычный голосовой агент, полностью построенный на открытых весах, — это развёртывание максимум на двух GPU и, вероятно, даже на одном GPU с квантованием обеих моделей. Именно поэтому их стоит рассматривать как единый набор, а не как два отдельных продуктовых решения.

Асимметрия лицензий — это вывод, а не сноска
Вот что удивляет людей, которые полагают, что модели из одной лаборатории с одинаковым соглашением об именовании имеют одинаковые условия.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Коммерческое использование, модификация, распространение и дообучение разрешены при условии соблюдения стандартного ограничения на нарушение прав третьих лиц.
• Voxtral 4B TTS — CC BY-NC 4.0, унаследованная от лежащих в его основе наборов данных эталонных голосов. Некоммерческая. В карточке Mistral прямо сказано, что модель наследует лицензию своих голосовых референсов, взятых из источников, включая EARS, CML-TTS, IndicVoices-R и набор арабского естественного аудио. Веса доступны для скачивания, а лицензия не является коммерческой.
Это жёсткое ограничение на ту самую архитектуру, к которой все обращаются в первую очередь. Если вы создаёте арабский голосовой агент, у которого ветвь распознавания речи — Voxtral Mini 4B Realtime Arabic, а ветвь синтеза речи — Voxtral 4B TTS, вы получаете конвейер, в котором половина компонентов свободна для коммерческого использования, а половина — нет, и ограничивающая половина определяет продукт. То, что модель ASR распространяется под Apache 2.0, не спасает ветвь TTS. Локальный запуск этой пары не меняет лицензию, и отказ от поставки весов тоже её не меняет — ограничение привязано к использованию, а не к распространению.

Коммерческий маршрут, который Mistral предлагает для речевой части, — это размещённый API по цене $0.016 за тысячу символов, что является соглашением об оказании услуг, а не предоставлением лицензии. Для продуктовой команды практическое следствие состоит в том, что свободно коммерциализируемая половина цикла — это половина, которая слушает, а половина, которая говорит, — либо зависимость от API, либо разговор о лицензировании. Это переворачивает то, что большинство команд предполагают, когда начинают строить открытый голосовой стек, и это стоит обнаружить до того, как вы напишете интеграцию, а не после.
Арабские заявления не согласуются между собой, и только одно из них — обещание покрытия.
Обе модели указывают арабский. Эти пункты списка означают разное.
• Voxtral Mini 4B Realtime Arabic — арабский язык — это весь охват. Шестнадцать разновидностей перечислены в качестве целей обучения: современный стандартный арабский, марокканский, ливийский, тунисский, алжирский и хассания, арабский Персидского залива, надждийский, оманский и санаанский арабский, египетский и суданский, месопотамский, а также южнолевантийский и северолевантийский, и чадский. Всё, что выходит за пределы этого набора, задокументировано как вне области охвата. Одна совокупная оценка точности, 8,82% CER, усреднённая по семи арабским бенчмаркам.
• Voxtral 4B TTS — арабский входит в число девяти поддерживаемых языков наряду с английским, французским, испанским, немецким, итальянским, португальским, нидерландским и хинди. В карточке упоминаются «разнообразные диалекты» в рамках этой поддержки, но они не перечисляются, и для арабского — как и для любого из остальных восьми — не опубликовано показателей качества по отдельным языкам.
Если читать их вместе, эта пара даёт подробное утверждение о том, насколько хорошо ваша система будет слышать арабский, и почти ничего не говорит о том, насколько хорошо она будет на нём говорить. Эта асимметрия имеет реальные последствия для голосового агента на дариже или арабском Персидского залива: у входной стороны есть опубликованный бенчмарк и список диалектов, по которым можно проводить оценку, а у выходной стороны — языковой значок и список голосов. Никто не публиковал измерение разборчивости диалектного арабского для Voxtral 4B TTS, и функция адаптации голоса этого не решает — адаптация голоса меняет то, на кого похожа речь, а не то, на каком диалекте она говорит.
Есть второй, более тонкий момент относительно собственного показателя точности модели ASR, который переносится и на сторону TTS. Mistral сообщает о 8,82% CER в потоковом режиме против 7,91% для офлайн-версии Voxtral Transcribe Arabic на тех же семи бенчмарках с той же нормализацией, так что потоковый режим стоит примерно один пункт. Эквивалентный компромисс на стороне TTS — во что обходится потоковый инференс по качеству вывода по сравнению с пакетным — в материале вообще не оценён количественно. Числа задержки есть; разницы в качестве нет.
Пропускная способность: одна модель создана для высоких нагрузок, а другая — нет.
Mistral опубликовала данные о пропускной способности ровно для одной из этих моделей, и цифры объясняют, почему.
• Voxtral 4B TTS — при измерении на одном H200 с vLLM-Omni, входе длиной 500 символов и 10-секундном аудиообразце пропускная способность составляет примерно от 119 символов в секунду времени GPU при параллелизме 1 до около 879 при параллелизме 16 и примерно 1 431 при параллелизме 32, а задержка растёт с 70 миллисекунд до 331, а затем до 552. Это кривая пропускной способности, по которой можно планировать мощности, и она имеет именно ту форму, которую следует ожидать от модели, созданной как производственный голосовой сервис.
• Voxtral Mini 4B Realtime Arabic — в карточке не приводится ни показателя пропускной способности, ни данных о поведении при параллельной работе, ни результатов аппаратного бенчмарка. Что в ней действительно указано, так это архитектура: причинный энкодер и схема внимания со скользящим окном как в энкодере, так и в декодере, описанная для базовой модели как поддерживающая фактически неограниченную потоковую обработку. Точка точности указана при задержке 480 миллисекунд, что подразумевает, что модель успевает за аудио в реальном времени на подходящем оборудовании, — и на этом опубликованные границы производительности исчерпываются.
Этот разрыв — не столько критика той или иной модели, сколько констатация уровня зрелости. У модели TTS есть опубликованная таблица SLO, потому что она была выпущена как продукт с блог-постом, демо, API и ценой. У арабской модели ASR нет опубликованного диапазона рабочих характеристик, потому что она появилась как репозиторий с карточкой. Если вы сегодня подбираете конфигурацию парка систем для арабской транскрипции, нужного вам показателя пропускной способности пока не существует, и единственный способ его получить — запустить путь обслуживания vLLM на собственном оборудовании со своим аудио.
Именно здесь слой маршрутизации меняет облик развёртывания, а не только биллинг. OrcaRouter не маршрутизирует ни одну из этих моделей — мы не хостим ни один речевой эндпоинт Mistral, и эта статья не утверждает обратного — но слой языковых моделей между ними — это именно тот слой, которому идёт на пользу маршрутизация: один API-ключ для более чем 200 моделей по каталожной цене провайдера с 0% наценки, так что изменение цены вендором отражается у нас в тот же день, когда о нём объявляют, и автоматическое переключение при сбое, так что один неудачный день вышестоящего провайдера — это перенаправление, а не сбой в вашем голосовом цикле. Голосовой агент, собранный из двух самостоятельно размещённых моделей Mistral плюс одной хостируемой модели рассуждений, имеет три домена отказа; слой маршрутизации — это то, что делает средний из них скучным.
Стоимость, бок о бок, с оговоркой, что у одной стороны нет цены
• Voxtral 4B TTS — $0,016 за тысячу символов через API Mistral или стоимость GPU, если вы развёртываете модель самостоятельно на условиях, допускающих ваш сценарий использования. Для приблизительной оценки масштаба: тысяча символов — это пара сотен слов, поэтому минута озвученного вывода по прайс-листовой цене укладывается в доли цента, и это ещё без учёта возможного преимущества в параллелизме от самостоятельного запуска.
• Voxtral Mini 4B Realtime Arabic — опубликованной цены нет, хостингового сервиса нет, тарифной сетки нет. Затраты — это оборудование и загрузка. Модель 4,4B BF16 на одном современном ускорителе — это фиксированная ежемесячная стоимость, которую вы амортизируете на весь объём аудио, который машина способна обработать; это дёшево при постоянном объёме и чистая трата при эпизодическом.
Сравнение, которое, вероятно, имеет большее значение, — это с альтернативами, к которым вы бы обратились вместо него. В части распознавания речи арабский чекпойнт конкурирует с потоковыми API с почасовой оплатой, тарифы на которые опубликованы и невысоки: MAI-Transcribe-2-Streaming от Microsoft по вводной цене $0,54 за аудиочас, Grok Voice Transcribe 2.0 от xAI по $0,20 за аудиочас в потоковом режиме — а значит, сервис арабской транскрипции можно купить за несколько десятых цента в минуту, и аргументы в пользу открытых весов должны строиться на точности диалектов, резидентности данных или дообучении, а не на удельной стоимости. В части синтеза речи самостоятельно размещённая модель TTS с нулевыми предельными затратами — реальное преимущество перед API с оплатой за символ при больших объёмах, поэтому ограничивающим фактором является лицензия CC BY-NC, а не цена.
Одно структурное замечание для тех, кто закладывает бюджет на переключение, основанное на цене: роутер, который передаёт прайс-листовую цену провайдера без наценки — 0% — это та поверхность, на которой изменение тарифа поставщика проявляется в тот же день, когда о нём объявили, а не в следующем цикле пересмотра цен. Это важнее на стороне прослушивания, чем на стороне речи, потому что транскрипция тарифицируется за час аудио, а это цифра, которую поставщики меняют.
Как подходить к выбору между ними
Вы не выбираете между ними. Вопрос в том, какую половину цикла можно построить на открытых весах, и лицензия отвечает на него.
Если ваше требование — это автономный арабский голосовой агент, в котором аудио никогда не покидает вашу инфраструктуру, то компонент прослушивания доступен вам без каких-либо условий: Apache 2.0, загружаемый, допускающий дообучение, со списком диалектов, на котором можно тестировать, и опубликованным показателем ошибок для арабского. Ограничение возникает на компоненте речи, и у вас есть два честных варианта — перенести синтез речи в хостинговый сервис по коммерческому соглашению или исключить Voxtral 4B TTS из архитектуры и найти модель синтеза для арабского с разрешительной лицензией.
Если ваша задача — промышленный сервис транскрипции, а язык — арабский, выбор стоит между загружаемым чекпоинтом 4.4B с опубликованной таксономией диалектов и единой агрегированной частотой ошибок и хостинговым API потоковой передачи с опубликованным тарифом, опубликованной задержкой и сторонним лидербордом. Открытая модель выигрывает в контроле, резидентности и дообучении; хостинговые варианты выигрывают в доказательствах, поддержке и простоте эксплуатации. Через два дня после появления весов никто за пределами Mistral их не измерил, и это повод провести собственный бенчмарк, а не повод отвергать чекпоинт.
Больше всего эту картину изменил бы релиз арабского синтеза на условиях, допускающих коммерческое использование, — та же схема, которой уже придерживается сторона прослушивания. Пока этого не существует, цикл остаётся наполовину открытым, и практическая задача — решить, какую половину вы готовы арендовать.

Мы не размещаем ни одну из этих речевых моделей Mistral, и в этой статье не утверждается обратное; голосовому циклу поверх них нужен языковой слой, а его можно маршрутизировать — один API-ключ для более чем 200 моделей по прейскурантной цене провайдера с наценкой 0%, так что изменение тарифов вендором отражается на нашей стороне в тот же день, когда о нём объявляют.
Автоматическое переключение при сбое не позволяет центральному компоненту трёхкомпонентного голосового агента — одной внешней модели рассуждений между двумя самостоятельно размещёнными моделями Mistral — стать той частью, которая выводит продукт из строя.
