Сгенерирована hero-карточка с заголовком для сравнения Voxtral Mini 4B Realtime Arabic и Voxtral 4B TTS, с подзаголовком «два конца одного и того же арабского голосового цикла, две разные лицензии», бейджем «ввод речи против вывода речи» и тремя чипами статистики: 8,82% ошибок в арабских символах при 480 мс против 70 мс времени до первого аудио, 16 арабских диалектов против 9 языков, включая арабский, и веса Apache 2.0 против весов CC BY-NC 4.0, а логотип OrcaRouter наложен на белую полосу в правом нижнем углу.
Engineering & Research

Voxtral Mini 4B Realtime Arabic против Voxtral 4B TTS: два конца одного разговора

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эти две модели имеют общее название, число параметров и файл лицензии, который ведёт себя иначе, — и на этом сходство заканчивается. Voxtral Mini 4B Realtime Arabic, выложенная на Hugging Face 8 октября 2026 года без сопроводительного анонса, принимает аудио на вход и выдаёт арабский текст — это потоковая дообученная версия Voxtral-Mini-4B-Realtime-2602, созданная для современного стандартного арабского языка и пятнадцати названных диалектов, лицензия Apache 2.0, средняя частота ошибок в символах 8,82 % при задержке в 480 миллисекунд. Voxtral 4B TTS, анонсированная Mistral AI в марте 2026 года, делает обратное: текст на входе, речь на выходе, двадцать предустановленных голосов плюс адаптация по короткому эталонному фрагменту, девять языков, включая арабский, и лицензия — CC BY-NC 4.0 — запрещающая коммерческое использование самих весов. Они не альтернативы и не варианты. Это две половины голосового цикла, и причина рассматривать их вместе в том, что решения, которые вы принимаете относительно одного из них, ограничивают другой сильнее, чем ожидает большинство команд.

Большинство страниц со сравнениями скажут вам, что эти модели не связаны, потому что одна — это ASR, а другая — TTS, и на этом остановятся. Это верно, но бесполезно. На самом деле стоит знать, где они пересекаются: голосовому агенту нужны обе, две лицензии указывают в противоположных направлениях, аппаратные требования у них похожи, а характеристики пропускной способности — нет, и заявления о поддержке арабского языка имеют совершенно разную форму. Всё ниже — об этих четырёх точках пересечения.

Что представляет собой каждая модель — в терминах, важных для пайплайна

• Voxtral Mini 4B Realtime Arabic — потоковое автоматическое распознавание речи. Аудио 16 кГц на входе, текст на выходе, примерно 4,4 млрд параметров в BF16, обслуживается через vLLM с WebSocket по адресу /v1/realtime или нативно в Transformers начиная с версии 5.2.0. Каузальный аудиокодер и языковой декодер, настраиваемая задержка транскрипции, заявленная как 480 миллисекунд для опубликованного показателя точности, и поставляемый в комплекте модуль нормализации, чтобы частоту ошибок в арабских символах можно было пересчитать. Apache 2.0.

• Voxtral 4B TTS — потоковый и пакетный синтез речи. На входе текст, на выходе аудио 24 кГц в форматах WAV, PCM, FLAC, MP3, AAC или Opus, около 4 миллиардов параметров, с набором из 20 предустановленных голосов и адаптацией голоса по референсному клипу длительностью всего три секунды. Собственный бенчмарк Mistral на одном H200 под управлением vLLM-Omni 0.18.0 при входном тексте из 500 символов и десятисекундном референсном клипе сообщает: при параллелизме 1 задержка составляет 70 миллисекунд, а коэффициент реального времени — 0,103; при параллелизме 16 они возрастают до 331 миллисекунды и 0,237, а при параллелизме 32 задержка достигает 552 миллисекунд. Доступен как API по цене $0,016 за тысячу символов.

Первое наблюдение из этих двух абзацев: эта пара небольшая. Обе модели находятся в диапазоне 4 миллиардов параметров, и обе помещаются на одном ускорителе в BF16, а значит, арабоязычный голосовой агент, полностью построенный на открытых весах, — это развёртывание максимум на двух GPU и, вероятно, даже на одном GPU с квантованием обеих моделей. Именно поэтому их стоит рассматривать как единый набор, а не как два отдельных продуктовых решения.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Асимметрия лицензий — это вывод, а не сноска

Вот что удивляет людей, которые полагают, что модели из одной лаборатории с одинаковым соглашением об именовании имеют одинаковые условия.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Коммерческое использование, модификация, распространение и дообучение разрешены при условии соблюдения стандартного ограничения на нарушение прав третьих лиц.

• Voxtral 4B TTS — CC BY-NC 4.0, унаследованная от лежащих в его основе наборов данных эталонных голосов. Некоммерческая. В карточке Mistral прямо сказано, что модель наследует лицензию своих голосовых референсов, взятых из источников, включая EARS, CML-TTS, IndicVoices-R и набор арабского естественного аудио. Веса доступны для скачивания, а лицензия не является коммерческой.

Это жёсткое ограничение на ту самую архитектуру, к которой все обращаются в первую очередь. Если вы создаёте арабский голосовой агент, у которого ветвь распознавания речи — Voxtral Mini 4B Realtime Arabic, а ветвь синтеза речи — Voxtral 4B TTS, вы получаете конвейер, в котором половина компонентов свободна для коммерческого использования, а половина — нет, и ограничивающая половина определяет продукт. То, что модель ASR распространяется под Apache 2.0, не спасает ветвь TTS. Локальный запуск этой пары не меняет лицензию, и отказ от поставки весов тоже её не меняет — ограничение привязано к использованию, а не к распространению.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Коммерческий маршрут, который Mistral предлагает для речевой части, — это размещённый API по цене $0.016 за тысячу символов, что является соглашением об оказании услуг, а не предоставлением лицензии. Для продуктовой команды практическое следствие состоит в том, что свободно коммерциализируемая половина цикла — это половина, которая слушает, а половина, которая говорит, — либо зависимость от API, либо разговор о лицензировании. Это переворачивает то, что большинство команд предполагают, когда начинают строить открытый голосовой стек, и это стоит обнаружить до того, как вы напишете интеграцию, а не после.

Арабские заявления не согласуются между собой, и только одно из них — обещание покрытия.

Обе модели указывают арабский. Эти пункты списка означают разное.

• Voxtral Mini 4B Realtime Arabic — арабский язык — это весь охват. Шестнадцать разновидностей перечислены в качестве целей обучения: современный стандартный арабский, марокканский, ливийский, тунисский, алжирский и хассания, арабский Персидского залива, надждийский, оманский и санаанский арабский, египетский и суданский, месопотамский, а также южнолевантийский и северолевантийский, и чадский. Всё, что выходит за пределы этого набора, задокументировано как вне области охвата. Одна совокупная оценка точности, 8,82% CER, усреднённая по семи арабским бенчмаркам.

• Voxtral 4B TTS — арабский входит в число девяти поддерживаемых языков наряду с английским, французским, испанским, немецким, итальянским, португальским, нидерландским и хинди. В карточке упоминаются «разнообразные диалекты» в рамках этой поддержки, но они не перечисляются, и для арабского — как и для любого из остальных восьми — не опубликовано показателей качества по отдельным языкам.

Если читать их вместе, эта пара даёт подробное утверждение о том, насколько хорошо ваша система будет слышать арабский, и почти ничего не говорит о том, насколько хорошо она будет на нём говорить. Эта асимметрия имеет реальные последствия для голосового агента на дариже или арабском Персидского залива: у входной стороны есть опубликованный бенчмарк и список диалектов, по которым можно проводить оценку, а у выходной стороны — языковой значок и список голосов. Никто не публиковал измерение разборчивости диалектного арабского для Voxtral 4B TTS, и функция адаптации голоса этого не решает — адаптация голоса меняет то, на кого похожа речь, а не то, на каком диалекте она говорит.

Есть второй, более тонкий момент относительно собственного показателя точности модели ASR, который переносится и на сторону TTS. Mistral сообщает о 8,82% CER в потоковом режиме против 7,91% для офлайн-версии Voxtral Transcribe Arabic на тех же семи бенчмарках с той же нормализацией, так что потоковый режим стоит примерно один пункт. Эквивалентный компромисс на стороне TTS — во что обходится потоковый инференс по качеству вывода по сравнению с пакетным — в материале вообще не оценён количественно. Числа задержки есть; разницы в качестве нет.

Пропускная способность: одна модель создана для высоких нагрузок, а другая — нет.

Mistral опубликовала данные о пропускной способности ровно для одной из этих моделей, и цифры объясняют, почему.

• Voxtral 4B TTS — при измерении на одном H200 с vLLM-Omni, входе длиной 500 символов и 10-секундном аудиообразце пропускная способность составляет примерно от 119 символов в секунду времени GPU при параллелизме 1 до около 879 при параллелизме 16 и примерно 1 431 при параллелизме 32, а задержка растёт с 70 миллисекунд до 331, а затем до 552. Это кривая пропускной способности, по которой можно планировать мощности, и она имеет именно ту форму, которую следует ожидать от модели, созданной как производственный голосовой сервис.

• Voxtral Mini 4B Realtime Arabic — в карточке не приводится ни показателя пропускной способности, ни данных о поведении при параллельной работе, ни результатов аппаратного бенчмарка. Что в ней действительно указано, так это архитектура: причинный энкодер и схема внимания со скользящим окном как в энкодере, так и в декодере, описанная для базовой модели как поддерживающая фактически неограниченную потоковую обработку. Точка точности указана при задержке 480 миллисекунд, что подразумевает, что модель успевает за аудио в реальном времени на подходящем оборудовании, — и на этом опубликованные границы производительности исчерпываются.

Этот разрыв — не столько критика той или иной модели, сколько констатация уровня зрелости. У модели TTS есть опубликованная таблица SLO, потому что она была выпущена как продукт с блог-постом, демо, API и ценой. У арабской модели ASR нет опубликованного диапазона рабочих характеристик, потому что она появилась как репозиторий с карточкой. Если вы сегодня подбираете конфигурацию парка систем для арабской транскрипции, нужного вам показателя пропускной способности пока не существует, и единственный способ его получить — запустить путь обслуживания vLLM на собственном оборудовании со своим аудио.

Именно здесь слой маршрутизации меняет облик развёртывания, а не только биллинг. OrcaRouter не маршрутизирует ни одну из этих моделей — мы не хостим ни один речевой эндпоинт Mistral, и эта статья не утверждает обратного — но слой языковых моделей между ними — это именно тот слой, которому идёт на пользу маршрутизация: один API-ключ для более чем 200 моделей по каталожной цене провайдера с 0% наценки, так что изменение цены вендором отражается у нас в тот же день, когда о нём объявляют, и автоматическое переключение при сбое, так что один неудачный день вышестоящего провайдера — это перенаправление, а не сбой в вашем голосовом цикле. Голосовой агент, собранный из двух самостоятельно размещённых моделей Mistral плюс одной хостируемой модели рассуждений, имеет три домена отказа; слой маршрутизации — это то, что делает средний из них скучным.

Стоимость, бок о бок, с оговоркой, что у одной стороны нет цены

• Voxtral 4B TTS — $0,016 за тысячу символов через API Mistral или стоимость GPU, если вы развёртываете модель самостоятельно на условиях, допускающих ваш сценарий использования. Для приблизительной оценки масштаба: тысяча символов — это пара сотен слов, поэтому минута озвученного вывода по прайс-листовой цене укладывается в доли цента, и это ещё без учёта возможного преимущества в параллелизме от самостоятельного запуска.

• Voxtral Mini 4B Realtime Arabic — опубликованной цены нет, хостингового сервиса нет, тарифной сетки нет. Затраты — это оборудование и загрузка. Модель 4,4B BF16 на одном современном ускорителе — это фиксированная ежемесячная стоимость, которую вы амортизируете на весь объём аудио, который машина способна обработать; это дёшево при постоянном объёме и чистая трата при эпизодическом.

Сравнение, которое, вероятно, имеет большее значение, — это с альтернативами, к которым вы бы обратились вместо него. В части распознавания речи арабский чекпойнт конкурирует с потоковыми API с почасовой оплатой, тарифы на которые опубликованы и невысоки: MAI-Transcribe-2-Streaming от Microsoft по вводной цене $0,54 за аудиочас, Grok Voice Transcribe 2.0 от xAI по $0,20 за аудиочас в потоковом режиме — а значит, сервис арабской транскрипции можно купить за несколько десятых цента в минуту, и аргументы в пользу открытых весов должны строиться на точности диалектов, резидентности данных или дообучении, а не на удельной стоимости. В части синтеза речи самостоятельно размещённая модель TTS с нулевыми предельными затратами — реальное преимущество перед API с оплатой за символ при больших объёмах, поэтому ограничивающим фактором является лицензия CC BY-NC, а не цена.

Одно структурное замечание для тех, кто закладывает бюджет на переключение, основанное на цене: роутер, который передаёт прайс-листовую цену провайдера без наценки — 0% — это та поверхность, на которой изменение тарифа поставщика проявляется в тот же день, когда о нём объявили, а не в следующем цикле пересмотра цен. Это важнее на стороне прослушивания, чем на стороне речи, потому что транскрипция тарифицируется за час аудио, а это цифра, которую поставщики меняют.

Как подходить к выбору между ними

Вы не выбираете между ними. Вопрос в том, какую половину цикла можно построить на открытых весах, и лицензия отвечает на него.

Если ваше требование — это автономный арабский голосовой агент, в котором аудио никогда не покидает вашу инфраструктуру, то компонент прослушивания доступен вам без каких-либо условий: Apache 2.0, загружаемый, допускающий дообучение, со списком диалектов, на котором можно тестировать, и опубликованным показателем ошибок для арабского. Ограничение возникает на компоненте речи, и у вас есть два честных варианта — перенести синтез речи в хостинговый сервис по коммерческому соглашению или исключить Voxtral 4B TTS из архитектуры и найти модель синтеза для арабского с разрешительной лицензией.

Если ваша задача — промышленный сервис транскрипции, а язык — арабский, выбор стоит между загружаемым чекпоинтом 4.4B с опубликованной таксономией диалектов и единой агрегированной частотой ошибок и хостинговым API потоковой передачи с опубликованным тарифом, опубликованной задержкой и сторонним лидербордом. Открытая модель выигрывает в контроле, резидентности и дообучении; хостинговые варианты выигрывают в доказательствах, поддержке и простоте эксплуатации. Через два дня после появления весов никто за пределами Mistral их не измерил, и это повод провести собственный бенчмарк, а не повод отвергать чекпоинт.

Больше всего эту картину изменил бы релиз арабского синтеза на условиях, допускающих коммерческое использование, — та же схема, которой уже придерживается сторона прослушивания. Пока этого не существует, цикл остаётся наполовину открытым, и практическая задача — решить, какую половину вы готовы арендовать.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Мы не размещаем ни одну из этих речевых моделей Mistral, и в этой статье не утверждается обратное; голосовому циклу поверх них нужен языковой слой, а его можно маршрутизировать — один API-ключ для более чем 200 моделей по прейскурантной цене провайдера с наценкой 0%, так что изменение тарифов вендором отражается на нашей стороне в тот же день, когда о нём объявляют.

Автоматическое переключение при сбое не позволяет центральному компоненту трёхкомпонентного голосового агента — одной внешней модели рассуждений между двумя самостоятельно размещёнными моделями Mistral — стать той частью, которая выводит продукт из строя.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube