Сгенерированная главная титульная карточка для сравнения Voxtral Mini 4B Realtime Arabic и Grok Voice Transcribe 2.0, с подзаголовком «лидер таблицы лидеров по разметке встречает арабского специалиста по 16 диалектам», с бейджем «репозиторий Mistral, 8 октября 2026», с тремя плашками статистики, показывающими 8,82% ошибок в арабских символах при 480 мс против 2,7% ошибок в словах при 0,49 с, 16 названных диалектов против 38+ недокументированных языков и веса Apache 2.0 против $0,20 за аудиочас, а также логотип OrcaRouter, скомпонованный в белой полосе в правом нижнем углу.
Guides & Insights

Voxtral Mini 4B Realtime Arabic против Grok Voice Transcribe 2.0: лидер таблицы лидеров встречает специалиста по диалектам

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Честная отправная точка для этого сравнения — то, что Voxtral Mini 4B Realtime Arabic и G​rok Voice Transcribe 2.0 не решают одну и ту же задачу, и быстрее всего это увидеть, если посмотреть, что каждый вендор был готов опубликовать. Mistral AI выложила Voxtral Mini 4B Realtime Arabic на Hugging Face 8 октября 2026 года без анонса — веса Apache 2.0, карточку модели, в которой перечислены шестнадцать арабских разновидностей, и единственный показатель точности — средний Character Error Rate 8,82% по семи арабским бенчмаркам при задержке 480 миллисекунд. G​rok Voice Transcribe 2.0 от x​AI вышел 18 сентября 2026 года с постом о запуске, ценой и результатом в стороннем лидерборде: 2,7% доли ошибок в словах на финальных транскриптах, причём текст стабилизируется через 0,49 секунды после того, как говорящий замолкает, и первое место в таблице потокового распознавания речи Artificial Analysis на момент выхода. Одна модель точно сообщает, с какими диалектами она работает, и отказывается угадывать за их пределами. Другая сообщает, что поддерживает более 38 языков, и не перечисляет ни одного из них.

Эта асимметрия и есть всё сравнение. Если вы закупаете мощности для транскрипции в больших объёмах для аудио на смеси языков, модель xAI — с большим отрывом более полноценный продукт. Если ваше аудио — арабское, и в частности если это диалектный арабский, а не современный стандартный арабский в вещательном варианте, то чекпойнт Mistral нацелен на задачу, не измеряемую таблицей лидеров, которую возглавляет модель xAI, и было бы ошибкой воспринимать тот факт, что он занимает в этой таблице второе место, а не первое, как вердикт.

Арифметика цен, потому что здесь она необычно чиста

xAI публикует тариф. Mistral публикует загрузку. Это различие определяет всё дальнейшее, поэтому начните с числа, которое существует.

• Grok Voice Transcribe 2.0 — $0,10 за аудиочас через REST для записанных файлов, $0,20 за аудиочас через потоковый WebSocket. Это примерно $1,67 за тысячу минут для пакетной обработки и $3,33 за тысячу минут для потоковой передачи, без изменений по сравнению с Grok Voice Transcribe 1.0 при тех же ценах.

• Voxtral Mini 4B Realtime Arabic — опубликованной цены нет, потому что нет опубликованного сервиса. Веса доступны под лицензией Apache 2.0 и содержат примерно 4,4 млрд параметров в BF16, а значит, затраты — это GPU, который вы к нему подключите, и отдача, которую вы из него получите. При стабильном объёме это дёшево; при нулевом объёме это самый дорогой вариант в этой статье, потому что вы платите за простаивающее оборудование.

Точка безубыточности здесь не отличается тонкостью. Ставка за стриминг в $0.20 в час — это примерно треть цента в минуту. Любой ускоритель, на котором вы запускаете модель на 4,4 млрд параметров, стоит дороже этого в час, если только вы не прогоняете через него устойчивый трафик, а это значит, что путь открытых весов выигрывает только после того, как у вас появится объём арабского трафика, достаточный, чтобы загрузить машину, — и проигрывает по всем остальным осям, пока вы к этому идёте, потому что у API нет капитальных затрат, нет планирования мощностей и нет операционной нагрузки.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Единственное, где расклад меняется уже на старте, — это комплаенс. Чекпоинт Mistral обрабатывает аудио на оборудовании, которое вы контролируете, поэтому ничего не покидает вашу сеть, а карта поставляется с модулем нормализации, так что конвейер оценки арабского языка вы можете проверять сами. Grok Voice Transcribe 2.0 работает в регионах xAI и, согласно его документации, обрабатывает аудио в реальном времени, не сохраняя его и не используя для обучения, что подтверждается SOC 2 Type II и соответствием требованиям HIPAA. Обе версии защитимы; только одна из них позволяет регулятору проверить путь выполнения кода.

Что на самом деле можно купить за $0.20 в час, и модель Mistral не поставляется

Разрыв в функциональности здесь больше, чем разрыв в точности, и обсуждается он гораздо реже. Grok Voice Transcribe 2.0 — это продукт с интерфейсом; Voxtral Mini 4B Realtime Arabic — это чекпойнт, который выдаёт текст.

• Диаризация говорящих — включена в Grok Voice Transcribe 2.0, а также многоканальная транскрипция до восьми независимых каналов. В карточке Mistral возможность диаризации не указана; модель создаёт транскрипт, а не транскрипт с атрибуцией говорящих.

• Таймстемпы на уровне слов — Grok передаёт их вместе с прикреплёнными оценками уверенности, так что вы можете отсеивать фрагменты с низкой уверенностью, а не доверять всей транскрипции одинаково. Карточка Mistral не заявляет таймстемпы для этого чекпоинта.

• Смещение ключевых терминов — до 100 доменных терминов на запрос на эндпоинте Grok, именно так вы заставляете модель правильно распознавать названия продуктов, коды счетов и названия мест без дообучения. Путь Mistral к тому же результату — это дообучение на ваших собственных данных, что разрешает Apache 2.0, а хостируемый эндпоинт — нет.

• Обратная нормализация текста — Grok форматирует числа, даты, валюты, номера телефонов и адреса электронной почты в письменную форму на 25 языках. Карточка Mistral включает нормализацию, но её заявленная цель — оценка арабских бенчмарков, а не форматирование вывода для отображения.

• Интерфейс — REST для файлов до 500 МБ, потоковая передача через WebSocket по адресу wss://api.x.ai/v1/stt с промежуточными результатами примерно каждые 500 мс, задокументированные 10 запросов в секунду и 100 одновременных потоковых сессий, а также пока что один регион. На стороне Mistral — обслуживание через vLLM с WebSocket по адресу /v1/realtime либо нативные Transformers начиная с версии 5.2.0, без ограничений скорости, кроме возможностей вашего оборудования.

Если вам нужны диаризация и временные метки, сравнение заканчивается ещё до того, как дело доходит до точности. Это не упрёк в адрес модели Mistral — специализированная арабоязычная модель на 4B, обученная выдавать точный диалектный текст, имеет другую инженерную цель, чем универсальный сервис транскрибации, — но это означает, что они становятся взаимозаменяемыми только в том случае, если ваш пайплайн рассматривает транскрипт как сырьё для вашей собственной постобработки.

Проблема со списком языков

Оба поставщика описывают поддержку языков так, что один и тот же вопрос остаётся без ответа, причём с противоположных сторон.

• Grok Voice Transcribe 2.0 — более 38 языков, автоматическое определение языка с переключением языка во время записи за один проход, для 12 аудиоформатов от 8 кГц до 48 кГц. В документации указано количество, а не список. Арабский нигде в материалах не назван отдельно, а значит, поддержка арабского подразумевается из количества и не подтверждена поставщиком.

• Voxtral Mini 4B Realtime Arabic — шестнадцать арабских вариантов, названных явно: современный стандартный арабский; марокканский, ливийский, тунисский, алжирский и хассания из Магриба; заливный, наджди, оманский и санаани из Залива; египетский и суданский из долины Нила; месопотамский и южнолевантийский, и северолевантийский; и чадский арабский. Всё, что выходит за пределы этого набора, не входит в область охвата, и в карточке сказано использовать вместо этого общую модель реального времени.

Итак, вопрос «какая из этих моделей лучше справляется с арабским» имеет странную структуру. Модель Mistral — задокументированный специалист по арабскому языку с опубликованным показателем ошибок для арабского и без независимой проверки. Модель xAI — задокументированный лидер рейтинга, чей производитель вообще не подтвердил, что арабский входит в область охвата. Список из 38 языков, включающий арабский, и список из шестнадцати диалектов, включающий только арабский, оба отвечают на вопрос «умеет ли она работать с арабским», — но только один из них отвечает на вопрос «умеет ли она работать с дарижей».

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

Таблица лидеров здесь не помогает. Оценка преобразования речи в текст от Artificial Analysis — это фиксированная смесь с перекосом в сторону англоязычной речи агентов; это правильный дизайн для ранжирования общей транскрипции и неправильный для выявления победы в области диалектного арабского. Модель может быть действительно лучше на арабском Персидского залива и марокканском арабском, но на этой таблице выглядеть всего лишь хорошей. Это не критика таблицы; это причина не использовать её как единственный вход для регионального развёртывания.

Точность, в единицах, которые не конвертируются

• Grok Voice Transcribe 2.0 — частота ошибок в словах (WER) для финальной расшифровки составляет 2,7% при 0,49 секунды до финального результата и 3,4% на первых промежуточных результатах; оба показателя измерены на индексе AA-WER v2 от Artificial Analysis, который объединяет частный набор диалогов агентов с VoxPopuli и Earnings22. Показатель по первым промежуточным результатам — самый примечательный: он снизился с 18,3% в Grok Voice Transcribe 1.0, а это разница между промежуточной расшифровкой, которую можно использовать для маршрутизации, и той, которую можно только отображать.

• Voxtral Mini 4B Realtime Arabic — средняя частота ошибок в символах 8,82% по семи арабским бенчмаркам при задержке 480 миллисекунд, по собственной оценке производителя со скриптом нормализации, поставляемым вместе с ней. Mistral сообщает, что этот результат отстаёт всего на 0,91 процентного пункта от Voxtral Transcribe Arabic с 7,91% CER — офлайн-арабской модели из той же лаборатории; это сравнение ценнее, чем межвендорное, поскольку бенчмарки, нормализация и измерение идентичны с обеих сторон.

Поставить 2,7 % рядом с 8,82 % — это не сравнение; это категориальная ошибка. Частота ошибок в словах считает ошибочные слова относительно эталона, частота ошибок в символах считает ошибочные символы, а арабская орфография — где одно и то же слово допускает несколько законных написаний, а клитики свободно присоединяются — увеличивает разрыв между этими двумя метриками гораздо сильнее, чем это бывает в языках с латинской письменностью. Корпусы разные, нормализация разная, и только одна цифра получена от третьей стороны. Что эти два числа могут правомерно сказать вам: модель xAI — это измеренный, хорошо ранжированный универсальный транскрайбер, а модель Mistral — заявленная как специализированная для арабского. Они не могут сказать, какая из них лучше транскрибирует ваше аудио.

Сравнение, которое действительно убеждает, — это сравнение из собственной карточки Mistral: 8,82 % в потоковом режиме против 7,91 % в офлайн-режиме, те же семь бенчмарков, та же нормализация, та же лаборатория. Потоковый режим обходится примерно в один пункт точности на арабском по сравнению с пакетной моделью. Хороший ли это компромисс — решать вам, и теперь это решение можно принять осознанно.

Там, где выигрывает маленькая модель, и это не на табло

Три вещи в чекпойнте Mistral значат больше, чем предполагают цифры, и ни одна из них не фигурирует ни в одной таблице лидеров.

Первое — это сама таксономия диалектов. Обозначение шестнадцати разновидностей как отдельных целей обучения, включая хассания и чадский арабский, — это утверждение о том, где измерялись ошибки модели. Общая многоязычная модель, включающая арабский как один из 38 языков, в первую очередь улучшается на современном стандартном арабском, потому что именно там сосредоточена основная часть обучающего сигнала и веса бенчмарка. Модель, созданная для марокканского партнёрства совместно с североафриканским министерством, оптимизируется под другое распределение, и она была совместно разработана с двумя бенчмарками — ISMA и Darija in the Wild, — созданными специально для его измерения.

Второй момент — настраиваемая задержка. Показатель 8,82% указан при 480 миллисекундах, и задержка регулируемая, а не фиксированная, что превращает показатель точности в точку на кривой, которую выбирает оператор. Для задачи субтитрования в реальном времени её можно сократить и смириться с большим количеством ошибок; для конвейера записи звонков её можно удлинить и вернуть точность. Grok Voice Transcribe 2.0 задаёт фиксированную рабочую точку, и собственный путь обновления производителя показывает, почему это имеет последствия — переход с версии 1.0 на 2.0 обошёлся примерно в треть секунды как по задержке до первого промежуточного результата, так и по итоговой задержке, а доступное вам решение — закрепить старую модель, а не крутить регулятор.

Третье — предоставление прав по Apache 2.0 безусловно для имеющихся у вас весов. Что бы ни случилось с чекпоинтом на стороне поставщика — будет ли он анонсирован, получит цену, будет объявлен устаревшим или о нём больше никогда не упомянут, — артефакт остаётся доступным для скачивания, дообучения и поставки в составе вашего собственного продукта. И тарифную сетку хостируемой конечной точки, и график вывода модели из эксплуатации вправе менять поставщик, и xAI уже заявила о намерении сделать Grok Voice Transcribe 2.0 версией по умолчанию, а 1.0 — устаревшей, что разом переведёт все интеграции, которые никогда не передавали параметр модели, на новый профиль задержек.

На уровне маршрутизации над транскриптом — одно практическое замечание: ни одна из моделей не является распознаванием речи, которое размещаем мы, и эта статья не утверждает обратного. OrcaRouter охватывает уровень языковых моделей, который потребляет поток, — суммаризатор, классификатор, агент — за одним API-ключом для более чем 200 моделей по прайс-листовой цене провайдера с 0% наценки, так что изменение цены вендором отражается здесь в тот же день. Команды, работающие с двумя поставщиками распознавания речи ради языкового покрытия, уже тянут два контракта и два пути аутентификации; свести вторую половину пайплайна к одному ключу — это лёгкая победа.

Что с этим делать

Опирайтесь на Grok Voice Transcribe 2.0, если ваше аудио многоязычное, если вам нужны диаризация, таймстемпы или подстройка под ключевые термины из коробки, либо если вам нужен сервис с опубликованным тарифом и каналом поддержки уже сегодня. Это более полный продукт, он оценивается третьей стороной, а тариф на потоковую обработку — $0.20 за аудиочас — настолько низок, что аргумент о стоимости открытых весов не срабатывает, пока вы не выйдете на серьёзные объёмы.

Берите за основу Voxtral Mini 4B Realtime Arabic, если ваше аудио — арабское и именно диалектное, если вам нужна модель внутри собственной сети по причинам соответствия требованиям или если вы намерены выполнять дообучение — потому что только один из них это позволяет. Сначала примите три вещи: никакой диаризации, никаких временных меток и никакой независимой оценки, опубликованной кем-либо. Через два дня после появления весов последний пункт — не красный флаг; это просто текущее состояние доказательной базы.

Быстрее всего это сравнение изменила бы оценка, специфичная для арабского языка, на реальном диалектном аудио, проведённая вне обоих вендоров, с одинаковой нормализацией, применённой к обеим системам. Пока её не существует, решение опирается на собственный список диалектов одного вендора против собственного нераскрытого списка другого, и единственный надёжный тест — ваши записи.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Ни один из этих эндпоинтов не относится к тем, которые обслуживаем мы, — это сравнение двух систем вне нашего каталога, — но модели, которые обрабатывают транскрипт, доступны для маршрутизации: более 200 моделей на одном API-ключе по прайсовой цене провайдера с наценкой 0%, поэтому изменение тарифа на суммаризаторе или классификаторе вступает в силу в тот же день, когда о нём объявляют.

Автоматическое переключение при отказе — это то, что не даёт речевой системе от двух поставщиков протащить две единые точки отказа в языковой слой, который от неё питается.