
Voxtral Mini 4B Realtime Arabic против Grok Voice Transcribe 2.0: лидер таблицы лидеров встречает специалиста по диалектам
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Честная отправная точка для этого сравнения — то, что Voxtral Mini 4B Realtime Arabic и Grok Voice Transcribe 2.0 не решают одну и ту же задачу, и быстрее всего это увидеть, если посмотреть, что каждый вендор был готов опубликовать. Mistral AI выложила Voxtral Mini 4B Realtime Arabic на Hugging Face 8 октября 2026 года без анонса — веса Apache 2.0, карточку модели, в которой перечислены шестнадцать арабских разновидностей, и единственный показатель точности — средний Character Error Rate 8,82% по семи арабским бенчмаркам при задержке 480 миллисекунд. Grok Voice Transcribe 2.0 от xAI вышел 18 сентября 2026 года с постом о запуске, ценой и результатом в стороннем лидерборде: 2,7% доли ошибок в словах на финальных транскриптах, причём текст стабилизируется через 0,49 секунды после того, как говорящий замолкает, и первое место в таблице потокового распознавания речи Artificial Analysis на момент выхода. Одна модель точно сообщает, с какими диалектами она работает, и отказывается угадывать за их пределами. Другая сообщает, что поддерживает более 38 языков, и не перечисляет ни одного из них.
Эта асимметрия и есть всё сравнение. Если вы закупаете мощности для транскрипции в больших объёмах для аудио на смеси языков, модель xAI — с большим отрывом более полноценный продукт. Если ваше аудио — арабское, и в частности если это диалектный арабский, а не современный стандартный арабский в вещательном варианте, то чекпойнт Mistral нацелен на задачу, не измеряемую таблицей лидеров, которую возглавляет модель xAI, и было бы ошибкой воспринимать тот факт, что он занимает в этой таблице второе место, а не первое, как вердикт.
Арифметика цен, потому что здесь она необычно чиста
xAI публикует тариф. Mistral публикует загрузку. Это различие определяет всё дальнейшее, поэтому начните с числа, которое существует.
• Grok Voice Transcribe 2.0 — $0,10 за аудиочас через REST для записанных файлов, $0,20 за аудиочас через потоковый WebSocket. Это примерно $1,67 за тысячу минут для пакетной обработки и $3,33 за тысячу минут для потоковой передачи, без изменений по сравнению с Grok Voice Transcribe 1.0 при тех же ценах.
• Voxtral Mini 4B Realtime Arabic — опубликованной цены нет, потому что нет опубликованного сервиса. Веса доступны под лицензией Apache 2.0 и содержат примерно 4,4 млрд параметров в BF16, а значит, затраты — это GPU, который вы к нему подключите, и отдача, которую вы из него получите. При стабильном объёме это дёшево; при нулевом объёме это самый дорогой вариант в этой статье, потому что вы платите за простаивающее оборудование.
Точка безубыточности здесь не отличается тонкостью. Ставка за стриминг в $0.20 в час — это примерно треть цента в минуту. Любой ускоритель, на котором вы запускаете модель на 4,4 млрд параметров, стоит дороже этого в час, если только вы не прогоняете через него устойчивый трафик, а это значит, что путь открытых весов выигрывает только после того, как у вас появится объём арабского трафика, достаточный, чтобы загрузить машину, — и проигрывает по всем остальным осям, пока вы к этому идёте, потому что у API нет капитальных затрат, нет планирования мощностей и нет операционной нагрузки.

Единственное, где расклад меняется уже на старте, — это комплаенс. Чекпоинт Mistral обрабатывает аудио на оборудовании, которое вы контролируете, поэтому ничего не покидает вашу сеть, а карта поставляется с модулем нормализации, так что конвейер оценки арабского языка вы можете проверять сами. Grok Voice Transcribe 2.0 работает в регионах xAI и, согласно его документации, обрабатывает аудио в реальном времени, не сохраняя его и не используя для обучения, что подтверждается SOC 2 Type II и соответствием требованиям HIPAA. Обе версии защитимы; только одна из них позволяет регулятору проверить путь выполнения кода.
Что на самом деле можно купить за $0.20 в час, и модель Mistral не поставляется
Разрыв в функциональности здесь больше, чем разрыв в точности, и обсуждается он гораздо реже. Grok Voice Transcribe 2.0 — это продукт с интерфейсом; Voxtral Mini 4B Realtime Arabic — это чекпойнт, который выдаёт текст.
• Диаризация говорящих — включена в Grok Voice Transcribe 2.0, а также многоканальная транскрипция до восьми независимых каналов. В карточке Mistral возможность диаризации не указана; модель создаёт транскрипт, а не транскрипт с атрибуцией говорящих.
• Таймстемпы на уровне слов — Grok передаёт их вместе с прикреплёнными оценками уверенности, так что вы можете отсеивать фрагменты с низкой уверенностью, а не доверять всей транскрипции одинаково. Карточка Mistral не заявляет таймстемпы для этого чекпоинта.
• Смещение ключевых терминов — до 100 доменных терминов на запрос на эндпоинте Grok, именно так вы заставляете модель правильно распознавать названия продуктов, коды счетов и названия мест без дообучения. Путь Mistral к тому же результату — это дообучение на ваших собственных данных, что разрешает Apache 2.0, а хостируемый эндпоинт — нет.
• Обратная нормализация текста — Grok форматирует числа, даты, валюты, номера телефонов и адреса электронной почты в письменную форму на 25 языках. Карточка Mistral включает нормализацию, но её заявленная цель — оценка арабских бенчмарков, а не форматирование вывода для отображения.
• Интерфейс — REST для файлов до 500 МБ, потоковая передача через WebSocket по адресу wss://api.x.ai/v1/stt с промежуточными результатами примерно каждые 500 мс, задокументированные 10 запросов в секунду и 100 одновременных потоковых сессий, а также пока что один регион. На стороне Mistral — обслуживание через vLLM с WebSocket по адресу /v1/realtime либо нативные Transformers начиная с версии 5.2.0, без ограничений скорости, кроме возможностей вашего оборудования.
Если вам нужны диаризация и временные метки, сравнение заканчивается ещё до того, как дело доходит до точности. Это не упрёк в адрес модели Mistral — специализированная арабоязычная модель на 4B, обученная выдавать точный диалектный текст, имеет другую инженерную цель, чем универсальный сервис транскрибации, — но это означает, что они становятся взаимозаменяемыми только в том случае, если ваш пайплайн рассматривает транскрипт как сырьё для вашей собственной постобработки.
Проблема со списком языков
Оба поставщика описывают поддержку языков так, что один и тот же вопрос остаётся без ответа, причём с противоположных сторон.
• Grok Voice Transcribe 2.0 — более 38 языков, автоматическое определение языка с переключением языка во время записи за один проход, для 12 аудиоформатов от 8 кГц до 48 кГц. В документации указано количество, а не список. Арабский нигде в материалах не назван отдельно, а значит, поддержка арабского подразумевается из количества и не подтверждена поставщиком.
• Voxtral Mini 4B Realtime Arabic — шестнадцать арабских вариантов, названных явно: современный стандартный арабский; марокканский, ливийский, тунисский, алжирский и хассания из Магриба; заливный, наджди, оманский и санаани из Залива; египетский и суданский из долины Нила; месопотамский и южнолевантийский, и северолевантийский; и чадский арабский. Всё, что выходит за пределы этого набора, не входит в область охвата, и в карточке сказано использовать вместо этого общую модель реального времени.
Итак, вопрос «какая из этих моделей лучше справляется с арабским» имеет странную структуру. Модель Mistral — задокументированный специалист по арабскому языку с опубликованным показателем ошибок для арабского и без независимой проверки. Модель xAI — задокументированный лидер рейтинга, чей производитель вообще не подтвердил, что арабский входит в область охвата. Список из 38 языков, включающий арабский, и список из шестнадцати диалектов, включающий только арабский, оба отвечают на вопрос «умеет ли она работать с арабским», — но только один из них отвечает на вопрос «умеет ли она работать с дарижей».

Таблица лидеров здесь не помогает. Оценка преобразования речи в текст от Artificial Analysis — это фиксированная смесь с перекосом в сторону англоязычной речи агентов; это правильный дизайн для ранжирования общей транскрипции и неправильный для выявления победы в области диалектного арабского. Модель может быть действительно лучше на арабском Персидского залива и марокканском арабском, но на этой таблице выглядеть всего лишь хорошей. Это не критика таблицы; это причина не использовать её как единственный вход для регионального развёртывания.
Точность, в единицах, которые не конвертируются
• Grok Voice Transcribe 2.0 — частота ошибок в словах (WER) для финальной расшифровки составляет 2,7% при 0,49 секунды до финального результата и 3,4% на первых промежуточных результатах; оба показателя измерены на индексе AA-WER v2 от Artificial Analysis, который объединяет частный набор диалогов агентов с VoxPopuli и Earnings22. Показатель по первым промежуточным результатам — самый примечательный: он снизился с 18,3% в Grok Voice Transcribe 1.0, а это разница между промежуточной расшифровкой, которую можно использовать для маршрутизации, и той, которую можно только отображать.
• Voxtral Mini 4B Realtime Arabic — средняя частота ошибок в символах 8,82% по семи арабским бенчмаркам при задержке 480 миллисекунд, по собственной оценке производителя со скриптом нормализации, поставляемым вместе с ней. Mistral сообщает, что этот результат отстаёт всего на 0,91 процентного пункта от Voxtral Transcribe Arabic с 7,91% CER — офлайн-арабской модели из той же лаборатории; это сравнение ценнее, чем межвендорное, поскольку бенчмарки, нормализация и измерение идентичны с обеих сторон.
Поставить 2,7 % рядом с 8,82 % — это не сравнение; это категориальная ошибка. Частота ошибок в словах считает ошибочные слова относительно эталона, частота ошибок в символах считает ошибочные символы, а арабская орфография — где одно и то же слово допускает несколько законных написаний, а клитики свободно присоединяются — увеличивает разрыв между этими двумя метриками гораздо сильнее, чем это бывает в языках с латинской письменностью. Корпусы разные, нормализация разная, и только одна цифра получена от третьей стороны. Что эти два числа могут правомерно сказать вам: модель xAI — это измеренный, хорошо ранжированный универсальный транскрайбер, а модель Mistral — заявленная как специализированная для арабского. Они не могут сказать, какая из них лучше транскрибирует ваше аудио.
Сравнение, которое действительно убеждает, — это сравнение из собственной карточки Mistral: 8,82 % в потоковом режиме против 7,91 % в офлайн-режиме, те же семь бенчмарков, та же нормализация, та же лаборатория. Потоковый режим обходится примерно в один пункт точности на арабском по сравнению с пакетной моделью. Хороший ли это компромисс — решать вам, и теперь это решение можно принять осознанно.
Там, где выигрывает маленькая модель, и это не на табло
Три вещи в чекпойнте Mistral значат больше, чем предполагают цифры, и ни одна из них не фигурирует ни в одной таблице лидеров.
Первое — это сама таксономия диалектов. Обозначение шестнадцати разновидностей как отдельных целей обучения, включая хассания и чадский арабский, — это утверждение о том, где измерялись ошибки модели. Общая многоязычная модель, включающая арабский как один из 38 языков, в первую очередь улучшается на современном стандартном арабском, потому что именно там сосредоточена основная часть обучающего сигнала и веса бенчмарка. Модель, созданная для марокканского партнёрства совместно с североафриканским министерством, оптимизируется под другое распределение, и она была совместно разработана с двумя бенчмарками — ISMA и Darija in the Wild, — созданными специально для его измерения.
Второй момент — настраиваемая задержка. Показатель 8,82% указан при 480 миллисекундах, и задержка регулируемая, а не фиксированная, что превращает показатель точности в точку на кривой, которую выбирает оператор. Для задачи субтитрования в реальном времени её можно сократить и смириться с большим количеством ошибок; для конвейера записи звонков её можно удлинить и вернуть точность. Grok Voice Transcribe 2.0 задаёт фиксированную рабочую точку, и собственный путь обновления производителя показывает, почему это имеет последствия — переход с версии 1.0 на 2.0 обошёлся примерно в треть секунды как по задержке до первого промежуточного результата, так и по итоговой задержке, а доступное вам решение — закрепить старую модель, а не крутить регулятор.
Третье — предоставление прав по Apache 2.0 безусловно для имеющихся у вас весов. Что бы ни случилось с чекпоинтом на стороне поставщика — будет ли он анонсирован, получит цену, будет объявлен устаревшим или о нём больше никогда не упомянут, — артефакт остаётся доступным для скачивания, дообучения и поставки в составе вашего собственного продукта. И тарифную сетку хостируемой конечной точки, и график вывода модели из эксплуатации вправе менять поставщик, и xAI уже заявила о намерении сделать Grok Voice Transcribe 2.0 версией по умолчанию, а 1.0 — устаревшей, что разом переведёт все интеграции, которые никогда не передавали параметр модели, на новый профиль задержек.
На уровне маршрутизации над транскриптом — одно практическое замечание: ни одна из моделей не является распознаванием речи, которое размещаем мы, и эта статья не утверждает обратного. OrcaRouter охватывает уровень языковых моделей, который потребляет поток, — суммаризатор, классификатор, агент — за одним API-ключом для более чем 200 моделей по прайс-листовой цене провайдера с 0% наценки, так что изменение цены вендором отражается здесь в тот же день. Команды, работающие с двумя поставщиками распознавания речи ради языкового покрытия, уже тянут два контракта и два пути аутентификации; свести вторую половину пайплайна к одному ключу — это лёгкая победа.
Что с этим делать
Опирайтесь на Grok Voice Transcribe 2.0, если ваше аудио многоязычное, если вам нужны диаризация, таймстемпы или подстройка под ключевые термины из коробки, либо если вам нужен сервис с опубликованным тарифом и каналом поддержки уже сегодня. Это более полный продукт, он оценивается третьей стороной, а тариф на потоковую обработку — $0.20 за аудиочас — настолько низок, что аргумент о стоимости открытых весов не срабатывает, пока вы не выйдете на серьёзные объёмы.
Берите за основу Voxtral Mini 4B Realtime Arabic, если ваше аудио — арабское и именно диалектное, если вам нужна модель внутри собственной сети по причинам соответствия требованиям или если вы намерены выполнять дообучение — потому что только один из них это позволяет. Сначала примите три вещи: никакой диаризации, никаких временных меток и никакой независимой оценки, опубликованной кем-либо. Через два дня после появления весов последний пункт — не красный флаг; это просто текущее состояние доказательной базы.
Быстрее всего это сравнение изменила бы оценка, специфичная для арабского языка, на реальном диалектном аудио, проведённая вне обоих вендоров, с одинаковой нормализацией, применённой к обеим системам. Пока её не существует, решение опирается на собственный список диалектов одного вендора против собственного нераскрытого списка другого, и единственный надёжный тест — ваши записи.

Ни один из этих эндпоинтов не относится к тем, которые обслуживаем мы, — это сравнение двух систем вне нашего каталога, — но модели, которые обрабатывают транскрипт, доступны для маршрутизации: более 200 моделей на одном API-ключе по прайсовой цене провайдера с наценкой 0%, поэтому изменение тарифа на суммаризаторе или классификаторе вступает в силу в тот же день, когда о нём объявляют.
Автоматическое переключение при отказе — это то, что не даёт речевой системе от двух поставщиков протащить две единые точки отказа в языковой слой, который от неё питается.
