
Voxtral Mini 4B Realtime Arabic против MAI-Transcribe-2-Streaming: два октябрьских релиза, две проблемы с доказательствами
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Эти две модели распознавания речи в реальном времени разделяют семь дней, и появились они совершенно по-разному. MAI-Transcribe-2-Streaming — первая потоковая модель транскрибирования от Microsoft AI, анонсированная 1 октября 2026 года вместе с постом о запуске, страницей предварительного просмотра в Azure, вводной ценой $0,54 за час аудио, действующей до конца года, и заявлением о первом месте в потоковом рейтинге Artificial Analysis как по точности окончательной, так и промежуточной расшифровки при частоте ошибок в словах 2,5%, при этом финальный текст готов через 0,13 секунды после окончания речи. Voxtral Mini 4B Realtime Arabic — потоковая модель Mistral AI для арабских диалектов, опубликованная на Hugging Face 8 октября 2026 года вообще без анонса — ни поста в блоге, ни цены, ни сервиса, только веса под Apache 2.0 и карточка модели, сообщающая о средней частоте ошибок в символах 8,82% на семи арабских бенчмарках при задержке 480 миллисекунд. Модель Microsoft — готовый продукт с непроверяемым главным заявлением. Модель Mistral — проверяемый артефакт, вокруг которого нет продукта. Обе заслуживают того, чтобы в них разобраться, именно потому, что в обеих центральный вопрос — насколько хорошо они работают с арабским — получает ответ только от самого поставщика.
Сравнение в любом случае стоит провести, потому что эти две модели описывают одно и то же инженерное решение с противоположных концов. Microsoft продаёт широту охвата и управляемый сервис: 60 языков с автоматическим непрерывным определением языка, работающие внутри Azure AI Speech, с почасовой оплатой, в режиме предварительного просмотра. Mistral отдаёт глубину: шестнадцать названных арабских вариантов, достаточно компактных, чтобы работать на одном ускорителе, со скриптом нормализации, чтобы вы могли сами проверить систему оценки. Если вы в этом месяце разворачиваете конвейер транскрипции арабского языка, вы выбираете между этими двумя позициями, и выбор зависит от доказательств, которых у вас пока нет ни в том, ни в другом случае.
Что на самом деле сказал каждый вендор и что говорят форумы
Разрыв в доказательствах — важнейшая особенность этого противостояния, поэтому он идёт первым.
• MAI-Transcribe-2-Streaming — 2,5% ошибок в словах в итоговой расшифровке через 0,13 секунды после окончания речи и те же 2,5% на первых промежуточных результатах через 0,12 секунды; оба показателя представлены как первое место по точности в методологии AA-WER Streaming от Artificial Analysis. Это собственная формулировка Microsoft. На момент написания этой статьи на стриминговой панели трекера ещё не построена строка для модели, поэтому утверждение опирается на методологию трекера, но за ним нет опубликованного трекером числа.
• Voxtral Mini 4B Realtime Arabic — средняя частота ошибок в символах 8,82% по семи арабским бенчмаркам при настроенной задержке 480 миллисекунд. Собственная карточка Mistral, с предоставленным кодом оценки. Ни одна третья сторона не воспроизвела результат, а модели всего два дня.
Итак, две главные цифры в этой статье — это, соответственно, вендорское утверждение, измеренное чужой линейкой, и вендорское утверждение с прилагаемой собственной линейкой. Ни то, ни другое не является независимым измерением. Разница в том, что число Mistral поставляется вместе со скриптом нормализации, необходимым, чтобы пересчитать его самостоятельно, а число Microsoft — вместе с советом, который ещё не внёс его в график. Если вы принимаете решение о закупке, это различие важнее, чем разрыв между 2,5 и 8,82, который в любом случае бессмыслен: частота ошибок в словах и частота ошибок в символах не переводятся друг в друга, а арабская орфография значительно увеличивает разрыв между ними.
Единственное сравнение в карточке Mistral, которое действительно срабатывает, — это сравнение со своим собственным офлайн-аналогом: Voxtral Transcribe Arabic с 7,91% CER на тех же семи бенчмарках при той же нормализации, так что стриминг обходится этой модели в 0,91 процентного пункта. Microsoft опубликовала аналогичный показатель для своего семейства, когда 3 сентября 2026 года выпустила пакетную версию MAI-Transcribe-2 с частотой ошибок в словах 2,0% — стриминговая версия уступает пакетной модели полпункта, но добавляет доставку в реальном времени. Сопоставьте эти две внутривендорные дельты бок о бок — и вы получите единственное сопоставимое утверждение в этой статье: на своих собственных бенчмарках стриминговый SKU каждой лаборатории отстаёт от своего пакетного аналога — примерно на один пункт в одном случае и на полпункта в другом, — и при этом обе измеряют разные языки.

Языковое покрытие: 60 против 16, и один и тот же безымянный пробел с обеих сторон
• MAI-Transcribe-2-Streaming — 60 языков с автоматическим непрерывным определением языка, поэтому сеансу, который переключает языки в середине потока, не нужно заранее объявлять язык. В материалах Microsoft о запуске указано количество, а не список; именно в документации Azure о поддержке языков для семейства MAI-Transcribe приводится детализированный перечень, и в ней арабский указан среди поддерживаемых языков этого семейства.
• Voxtral Mini 4B Realtime Arabic — шестнадцать арабских разновидностей, названных по отдельности: современный стандартный арабский, марокканский, ливийский, тунисский, алжирский и хассания, заливный, наджди, оманский и санаани, египетский и суданский, месопотамский, а также южнолевантийский и северолевантийский, и чадский. За пределами этого набора модель задокументирована как выходящая за рамки, со ссылкой на общий Voxtral Mini 4B Realtime.
Ни одна из этих цифр не даёт того, что вам нужно. 60 у Microsoft — это показатель охвата, который включает арабский, но ничего не говорит о качестве работы с арабским; в публикации о запуске общее число языков упоминается один раз, и на этом всё. 16 у Mistral — это перечисление целей обучения с одной агрегированной частотой ошибок по семи наборам бенчмарков, а значит, разбивка по диалектам — то, что на самом деле определяет, будет ли транскрибироваться ваша аудиозапись звонка на марокканском диалекте, — тоже не публикуется. Две модели, два поставщика — и в обоих случаях честный ответ на вопрос «насколько хорошо она справляется именно с арабским Персидского залива» таков: не указано.
Что перечисление действительно даёт, так это априорную информацию. Модель с чадским арабским и хассанийским арабским в качестве указанных целевых языков была настроена на североафриканское распределение; Mistral совместно разработала её с марокканским Министерством цифрового перехода и административной реформы и создала два из семи бенчмарков вместе с этим министерством — ISMA и Darija in the Wild — специально для измерения сложных случаев. Общая 60-язычная модель в первую очередь улучшает современный стандартный арабский, поскольку именно там сосредоточен объём обучающего сигнала. Если ваше аудио — это дарижа или арабский Персидского залива, это другие задачи, и только один из этих двух вендоров привёл числовые данные хотя бы по одному из них.
Латентность и форма задержки
• MAI-Transcribe-2-Streaming — 0,13 секунды от окончания речи до финальной расшифровки, а первые промежуточные результаты — через 0,12 секунды, что достаточно быстро, чтобы задержка промежуточного и финального результата была фактически одинаковой. Заявление Microsoft, измеренное по методологии трекера.
• Voxtral Mini 4B Realtime Arabic — 480 миллисекунд настраиваемой задержки в опубликованной точке точности, причём задержку можно регулировать. Это примерно в три с половиной раза больше показателя Microsoft, и это параметр, который выбирает оператор, а не фиксированное свойство.
Три десятых секунды — это реальная разница для голосового агента, которому нужно отвечать посреди реплики, и почти незаметная для человека, читающего субтитры. Это также разница между регулятором и числом. Параметр задержки Mistral означает, что можно работать жёстче и мириться с большим числом ошибок или мягче и вернуть точность, — базовая модель, из которой был дообучен этот чекпойнт, заявляет диапазон от 240 миллисекунд до 2,4 секунды, — тогда как рабочая точка Microsoft — это то, что поставляет Azure. Благодаря этому показатель Microsoft легче осмыслить, а показатель Mistral — легче настраивать, и это означает, что любое сравнение двух показателей точности на самом деле является сравнением двух выбранных точек на одной кривой и одной фиксированной точки на другой.
Набор функций различается столь же резко, и стоит проверить его на соответствие требованиям вашего пайплайна, прежде чем обсуждение точности станет интересным.
• MAI-Transcribe-2-Streaming — поставляется через Azure AI Speech с задокументированным набором возможностей семейства: диаризация, временные метки на уровне слов, смещение с учётом ключевых слов и фраз, дословный и очищенный стили вывода, а также автоматическое определение языка. Собственная документация потокового SKU по диаризации и временным меткам скуднее, чем у пакетной модели, поэтому проверяйте их для каждой конечной точки, а не предполагайте паритет.

• Voxtral Mini 4B Realtime Arabic — в карточке описана транскрипция с каузальным аудиокодером, обслуживание через vLLM по WebSocket по адресу /v1/realtime, нативная поддержка Transformers начиная с версии 5.2.0 и модуль нормализации. В ней не описаны диаризация или пословные метки времени для этой контрольной точки.
Модель поставки: сервис предпросмотра вместо скачиваемых весов
• MAI-Transcribe-2-Streaming — предварительная версия Azure, а значит, без SLA и с рекомендацией вендора не полагаться на неё в продакшене. Цена — $0,54 за час аудио по вводному тарифу, действующему до конца 2026 года; стандартный тариф не опубликован; пакетный MAI-Transcribe-2 был запущен по цене $0,10 за час аудио в рамках того же ограниченного по времени предложения. Стриминг стоит в 5,4 раза дороже пакетного тарифа.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, около 4,4 млрд параметров в BF16, доступна для скачивания, дообучения и развёртывания на одном ускорителе. Ни цены, ни SLA, ни обязательств по поддержке, потому что за этим не стоит никакого сервиса.
В этих двух предложениях содержится решение. Сервис в режиме предварительной версии с вводным тарифом и нераскрытой стандартной ценой — это обязательство, срок действия которого истекает; 5,4-кратная надбавка за стриминг и окно до 2026 года включительно — и то и другое Microsoft вправе изменить, а соотношение пакетного и потокового режимов — это показатель, за которым стоит следить, когда появится стандартный тариф. Веса под Apache 2.0, выпущенные без объявления, — это противоположная ситуация: артефакт, который никто не может отозвать, привязанный к отношениям с вендором, о которых никто не рассказывал. Будет ли чекпойнт поддерживаться — неизвестно, но файл, который у вас есть сегодня, в любом случае продолжит работать.
Отраслевое ограничение обычно и решает такие вопросы на практике. Развёртывание арабоязычного колл-центра внутри регулируемого учреждения может вообще не иметь возможности отправлять аудио в облачную конечную точку предварительной версии; команда, уже стандартизировавшаяся на Azure AI Speech, может не хотеть второй локальный стек ради одной языковой семьи. Оба ограничения законны, и ни одно из них не связано с показателями 2,5% и 8,82%, которые вынесены в заголовки двух запусков.
Над слоем транскрипции тот же принцип применим к обоим. OrcaRouter не маршрутизирует ни одну из этих речевых моделей — это сравнение двух систем, которые мы не обслуживаем, — но суммаризатор, классификатор или агент, потребляющий транскрипт, можно маршрутизировать: более 200 моделей на одном API-ключе по прайс-листовой цене провайдера с наценкой 0%, поэтому изменение цены вендора доходит до нас в тот же день, а при деградации провайдера происходит автоматическое переключение при сбое. Что особенно помогает здесь, так это этап пробного использования: направить оба кандидата на транскрипцию в один общий пайплайн последующей обработки, за одним ключом, — именно так вы проводите сравнение один на один, не разворачивая две интеграции.
Тест, который бы это разрешил
Ни один из поставщиков не опубликовал показателей, относящихся specifically к арабскому языку, и ни один не был независимо оценён на диалектной речи. Таким образом, сравнение сводится к трём фактам и одной рекомендации.
Факты: Потоковая модель Microsoft быстрее — 0,13 секунды — и заявляет о лучшей совокупной точности на табло, которое ещё не отобразило её; модель Mistral публикует список диалектов, показатель ошибок для арабского языка и код нормализации для его повторного вычисления, при 480 миллисекундах; и эти два показателя точности нельзя сравнивать, потому что один — это показатель ошибок в словах, а другой — показатель ошибок в символах на другом корпусе.
Рекомендация: кто бы ни принимал это решение, ему следует прогнать оба решения на собственных аудиозаписях, потому что это единственное измерение, которое оба поставщика оставили открытым. Составьте набор для оценки из реальных записей — то смешение диалектов, которое вы действительно получаете, кодек, которым вы действительно пользуетесь, доменную лексику, которая вам действительно нужна, — и оцените оба с помощью нормализации Mistral относительно эталона, которому вы доверяете. Двухчасовой тест на собственных записях скажет вам больше, чем оба поста о запуске вместе взятые, и это единственный способ выяснить, стоит ли преимущество в 0,13 секунды зависимости от предварительной версии и 5,4-кратной надбавки за потоковую передачу, или же загружаемая модель на 4,4B с 480 миллисекундами уже достаточно хороша для этой задачи.

OrcaRouter не предоставляет ни одну из этих речевых моделей, и эта статья не утверждает обратного — она описывает языковой слой, который читает транскрипт: более 200 моделей за одним ключом по прейскурантной цене провайдера с наценкой 0%, так что изменение цены поставщика на модели ниже по цепочке доходит до вас в день его объявления.
Автоматическое переключение при сбое позволяет обоим кандидатам транскрипции передавать данные в один последующий конвейер вместо двух интеграций, что также является самым дешёвым способом провести прямое сравнение.
