
MAI-Transcribe-2 запущен: попытка Microsoft за $0,10 в час завладеть рынком распознавания речи
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 — это модель, на которую Microsoft AI делает ставку: она должна превратить распознавание речи из премиальной функции в товар массового потребления, и цифры, с которыми она вышла, созданы именно для того, чтобы подкрепить этот аргумент. Выпущенная 3 сентября 2026 года в виде публичной предварительной версии в Microsoft Foundry, MAI Playground и через собственные API Microsoft, MAI-Transcribe-2 стала третьей речевой моделью Microsoft за пять месяцев — после MAI-Transcribe-1 в апреле по цене $0,36 за аудио-час и MAI-Transcribe-1.5 в июне, — и первой, которая опережает всех перечисленных управляемых конкурентов по двум метрикам, на которые команды реально ориентируются при выборе. В нестриминговом рейтинге word-error-rate от Artificial Analysis она занимает второе место с показателем 2,0% AA-WER, а по скорости — примерно 411× real time, тоже второе. Вместе это ставит её на парето-границу точности и скорости: на этой доске лидеров нет ни одной модели, которая была бы одновременно точнее и быстрее. Стартовая цена примерно на 72% ниже, чем у её собственной предшественницы.
«Самая быстрая, самая точная и самая дешевая модель распознавания речи в мире» — так Microsoft сама озаглавила новость о релизе, и этот заголовок следует читать со всеми звездочками, которыми снабжен исходный материал. Это история запуска, как она происходила на самом деле: заявления вендора помечены, а те части, которые еще требуют доказательств, вынесены отдельно.
Что Microsoft на самом деле выпустила
MAI-Transcribe-2 — это пакетная модель транскрипции предварительно записанного аудио, ориентированная непосредственно на длинные аудиозаписи: совещания, звонки, медиаархивы, записи контакт-центров. Microsoft позиционирует её именно для тех нагрузок, где главную роль играют пропускная способность и стоимость за минуту. Она транскрибирует на 60 языках с автоматическим определением языка, включает диаризацию говорящих, которая относит слова к нужному человеку, выдаёт временные метки на уровне слов и поддерживает смещение по ключевым словам для имён, сокращений и отраслевой терминологии. Два настраиваемых стиля транскрипции охватывают привычное разделение: «verbatim» (дословный) — с сохранением слов-паразитов и обрывов фраз для транскриптов, отвечающих требованиям комплаенса, — и «clean» (чистый), который убирает запинки и оговорки для субтитров и заметок. Microsoft также отмечает переключение кодов в смешанной речи, такой как хинглиш и спанглиш, а также устойчивость к шумному реальному аудио.

История доступности важна не меньше, чем список функций. Microsoft не прячет эту модель за своим корпоративным речевым стеком: модель уже доступна для демонстрации в MAI Playground и обслуживается через Microsoft Foundry в публичной предварительной версии, а документация Foundry размещена в рамках службы Azure AI Speech. Это осознанный выбор по распространению — разместить передовую модель там, где разработчик может получить к ней доступ по ключу, а не там, где сначала требуется одобрение в цикле корпоративных продаж. Microsoft не публиковала веса модели, и ничто в материалах запуска не указывает на то, что публикация планируется.
Читая заголовок буквально
«Самый быстрый, самый точный и самый дешёвый в мире» — это три утверждения разной силы, и сам пост о запуске незаметно ослабляет два из них. Честная версия каждого:
• Точность — В рейтинге Artificial Analysis модель MAI-Transcribe-2 занимает второе место с показателем AA-WER 2,0%, а не первое; в собственном тексте Microsoft указано второе. Формулировка «самая точная» сохраняет смысл только в том случае, если читать её как «среди управляемых пакетных API, которые отслеживаются на этом уровне», и даже тогда это утверждение о модели, выпущенной четыре дня назад, а не устоявшийся титул. Microsoft отдельно сообщает, что модель занимает первое место в многоязычном бенчмарке FLEURS со средним WER 5,2% по 60 языкам, — эта цифра взята из анонса Microsoft и ещё не пересчитана независимо для каждого языка.
• Скорость — Согласно Artificial Analysis, MAI-Transcribe-2 работает примерно в 411 раз быстрее реального времени и занимает второе место в этой таблице. Любопытно, что в собственном анонсе Microsoft абсолютное число не приводится; вместо этого компания делает упор на более дружелюбные относительные множители — «обработка до 10 раз быстрее, чем у ведущих конкурентов, особенно для длинных аудиозаписей», а именно: в 10 раз быстрее, чем GPT-Transcribe от OpenAI, в 7 раз быстрее, чем Scribe v2 от ElevenLabs, и в 5 раз быстрее, чем Gemini 3.5 Transcribe. Эти соотношения — интерпретация Microsoft тех же данных Artificial Analysis, и базовые скорости имеют значение: «в 5 раз быстрее, чем Gemini 3.5 Transcribe» звучит как скромный разрыв, пока не переведёшь это в минуты вычислений на час аудио.
• Самый дешёвый — Это верно только внутри двух ограничений, которые Microsoft чётко обозначает. Тариф $0.10 — это «ограниченное по времени предложение до конца года», и нигде в анонсирующих материалах не указана стандартная цена после завершения акции. И это самый дешёвый вариант среди управляемых API с высокой точностью; самостоятельно размещённая открытая модель, такая как Whisper Large v3 Turbo, всё ещё транскрибирует практически по стоимости электроэнергии. Аргумент о коммодитизации реален — просто он уже, чем заголовок.

Что можно купить за $1,67 за 1 000 минут
При цене $0,10 за аудио-час MAI-Transcribe-2 обходится примерно в $1,67 за 1 000 минут аудио. Чтобы эта цифра стала наглядной, сравним его с другими управляемыми API транскрибации, конкурирующими по точности. GPT-Transcribe стоит $4,50 за 1 000 минут; тариф Gemini 3.5 Transcribe для предзаписанных файлов в пересчёте на токенную модель ценообразования Google составляет примерно $5 за 1 000 минут; прайс ElevenLabs Scribe v2 ещё выше. При 1 000 часах аудио в месяц — серьёзной, но не гигантской нагрузке контакт-центра или медиа-проекта — разница между MAI-Transcribe-2 по цене раннего доступа и GPT-Transcribe по прайсу составляет порядка $170 в месяц, и так каждый месяц, ещё до учёта разницы в точности. Именно такой ценовой разрыв превращает транскрибацию из статьи расходов, которую команды оптимизируют, в статью, на которую они просто не обращают внимания.
Две оговорки стоит произнести на одном дыхании. Во-первых, акционная цена — это ценовой эксперимент до тех пор, пока не перестаёт им быть: командам, которые строят продукт по ставке $0.10, стоит понимать, что стандартная ставка не раскрыта, а честная плановая цифра для бюджета на 2027 год находится где-то между запускным предложением и тем, что Microsoft назовёт по истечении акции. Во-вторых, формулировка «дешевле всего в этом классе точности» ничего не говорит о совокупной стоимости владения — модель доступна только через API, поэтому значимое сравнение для команд с большими объёмами — это $1.67 за 1,000 минут против полной стоимости запуска собственного стека с открытыми весами, а не просто против других API.
Сжато до табло, стартовая позиция выглядит так — каждая цифра ниже несёт на себе ярлык источника, прикреплённый к ней в тексте выше.

Что ещё не доказано
При всей конкретности заявлений о запуске три вещи действительно остаются открытыми. Первое — это потоковый режим: MAI-Transcribe-2 — пакетная модель, история Microsoft о скорости касается пропускной способности при обработке файлов, и ни один SKU для реального времени не был анонсирован или продемонстрирован — «411×» — это не показатель задержки транскрипции в реальном времени. Второе — качество диаризации: привязка реплик к говорящим входит в комплект, но Microsoft не публикует уровень ошибок диаризации, и именно эта функция, скорее всего, покажет себя хуже в независимом тестировании, чем WER. Третье — разбивка по языкам: одно среднее значение FLEURS по 60 языкам может скрыть большой разброс между отдельными языками, и Microsoft не опубликовала таблицу по каждому языку. Каждый из этих пунктов — причина, по которой история ещё не окончена на четвёртый день.
Где это оставляет ваш стек транскрипции
Ничто из этого не требует выбирать MAI-Transcribe-2 уже сегодня — и именно поэтому ценообразование заслуживает внимания команд, которые сейчас не ищут нового вендора. Распознавание речи редко бывает концом пайплайна: за расшифровками следуют суммаризация, превращение в задачи, поиск и маршрутизация, и именно на этом последующем слое мультимодельная схема окупается. Платформа вроде OrcaRouter существует как раз для этой половины стека: один API для более чем 200 моделей, цены провайдеров из прайс-листов передаются с нулевой наценкой, автоматический фейловер и DSL для маршрутизации, который позволяет в зависимости от рабочей нагрузки направлять расшифровку в разные модели — протоколы встреч одному суммаризатору, комплаенс-проверки другому — без второй интеграции. Самого MAI-Transcribe-2 в этом списке сегодня нет: он живёт в собственном API Microsoft и на сторонних платформах, перечисленных Microsoft. Но цена commodity-уровня, которую он только что установил, — лучший на сегодня аргумент в пользу того, чтобы слой поверх расшифровки строился независимым от модели.
Цена запуска говорит о многом. Microsoft пытается выиграть в распознавании речи не только за счёт функций — она пытается сделать высокую точность настолько дешёвой, что эта категория перестаёт быть отдельной статьёй расходов. MAI-Transcribe-2 заслуживает того внимания, которое к нему приковано; просто прочтите «самый быстрый, самый точный и самый дешёвый в мире» с тремя примечаниями-звёздочками: второе место по AA-WER, рекламная цена до конца года и история о потоковом распознавании, которую ещё не рассказали.
