
Ежедневный ИИ-брифинг, 19 сентября: Grok Voice Transcribe 2.0 запущен, а Meta открывает Muse для разработчиков
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 доступен в Grok Voice API с 18 сентября 2026 года по цене $0,10 за час аудио при транскрибировании записей и $0,20 за час в потоковом режиме — по тем же тарифам, которые SpaceXAI взимала за версию 1.0. На той же неделе Meta открыла платформу коннекторов Muse для сторонних разработчиков, позволив любому сервису открыть свой существующий API, чтобы агент Muse от Meta вызывал его от имени пользователя. Это выглядит как не связанные между собой заголовки от двух разных компаний о двух разных продуктах, и большую часть последних двух лет так оно и было бы. А вместе они рассказывают одну и ту же историю: транскрипция превращается во входные данные, а борьба переместилась к тому, кому принадлежит вызов, который их потребляет.
Начните с цен, потому что это та часть, по которой читатель может действовать уже сегодня. Затем точность, которая реальна, но уже, чем предполагает подача при запуске. Затем материал о Meta — тот, который будет иметь значение через полгода.
Фиксированная цена и что это значит, если вы уже платите за транскрипцию
Grok Voice Transcribe 2.0 стоит столько же, сколько 1.0. Не «начиная от» той же суммы, не промо-тариф, срок действия которого истекает, — а точно такая же цена: $0,10 за час аудио при пакетной обработке и $0,20 за час при потоковой, что составляет $1,67 и $3,33 за 1000 минут. Диаризация спикеров, метки времени на уровне слов с оценками уверенности, обратная нормализация текста, удаление слов-заполнителей и смещение в пользу ключевых терминов — всё это входит в указанную цену, а не продаётся отдельно как дополнения, что не является нормой для этой категории.
Практический эффект — это арифметика, а не драма. Команда, которая ежемесячно расшифровывает 5 000 часов аудио контакт-центра, в любом случае платит $500 за пакетную обработку, а новая модель обрабатывает тот же объём с существенно более низкой частотой ошибок. Миграция никак не меняет то, сколько вы платите, — именно поэтому её легко обосновать: решение о затратах принимать не нужно, есть только решение о качестве, и качество выросло.
Существующие интеграции переходят на новую версию, передавая grok-voice-transcribe-2.0 в качестве параметра model в /v1/stt или выбирая её при открытии сессии WebSocket для потоковой передачи. Никаких изменений схемы, никакого нового эндпоинта, никакого перекодирования вашего аудиоконвейера. SpaceXAI пока оставила 1.0 версией по умолчанию, поэтому интеграция, которая вообще не трогает параметр model, продолжает получать старую версию, пока компания не переключит её — по её словам, это произойдёт в ближайшие недели, одновременно с признанием 1.0 устаревшей. Это окно стоит использовать осознанно: направьте теневую копию вашего продакшен-аудио на 2.0 и сравните расшифровки с тем, что вы выдаёте сегодня, потому что после переключения версии по умолчанию вы будете использовать её независимо от того, тестировали вы её или нет.
Остальная часть спецификации по форме не изменилась, и её стоит знать, если вы подбираете конфигурацию развёртывания, а не просто оцениваете точность: 12 входных аудиоформатов — от телефонного аудио 8 кГц до 48 кГц, до восьми независимых аудиоканалов в одном запросе, 100 ключевых терминов на запрос для отраслевой лексики, автоматическое определение языка с переключением во время записи и обратная нормализация текста для 25 языков, чтобы произнесённые даты, суммы в валютах, номера телефонов и адреса электронной почты возвращались в том виде, в каком их написал бы человек. Ограничения сервиса — 10 запросов в секунду и 100 одновременных потоковых сессий на команду, а сам сервис работает в одном регионе — us-east-1; это единственная строка в спецификации, которая должна заставить производственную команду призадуматься, потому что API распознавания речи в одном регионе — это и сбой в одном регионе.
Где точность на самом деле сдвинулась
Заявление при запуске — «вдвое точнее», а лежащие в его основе цифры более конкретны и менее однородны, чем эта фраза. На табло AA-WER Streaming от Artificial Analysis, которое здесь является независимым измерением, две версии различаются так:
• Точность итоговой расшифровки — Grok Voice Transcribe 2.0 при частоте ошибок в словах 2,7% против Grok Voice Transcribe 1.0 при 3,9%; оба показателя измерены после остановки говорящего
• Точность первого частичного транскрипта — 3,4% WER против 18,3%, что со значительным отрывом является самым крупным единичным разрывом между двумя версиями
• Время до финальной расшифровки — 0,49 секунды против 0,37 секунды, так что 2.0 по этому показателю медленнее, а не быстрее
• Время до первого частичного исполнения — 0,49 секунды против 0,25 секунды, та же сделка в обратном направлении
Эта последняя пара — самое интересное на листе. Grok Voice Transcribe 2.0 купила свою точность примерно за четверть секунды задержки, в обоих направлениях. Для голосового агента это реальная цена — это разница между естественной паузой и паузой, которую замечает звонящий — а для пакетного конвейера она невидима. Улучшение первого промежуточного результата — это то, что меняет то, что вы можете построить, потому что промежуточная расшифровка — это текст, над которым агент может рассуждать, пока звонящий ещё говорит. Переход с 18,3% на 3,4% по этому показателю — это разница между тем, когда промежуточный результат является грубой подсказкой, и тем, когда промежуточный результат можно использовать. Финальная расшифровка, улучшившаяся с 3,9% до 2,7%, — хорошее улучшение, которого не заметит ни один пользователь.

SpaceXAI также опубликовала четыре внутренние оценки, и их стоит читать с учётом этой пометки — это собственные цифры компании по её собственному аудио, а не независимо воспроизведённые:
• Звонки в службу поддержки клиентов с частотой 8 кГц — WER с 10,6% в версии 1.0 снизился до 7,1% в версии 2.0
• Разговоры с Grok — снижение с 8,7% до 3,3%
• Учётные данные, произнесённые вслух, а именно имена, адреса электронной почты и сведения об учётной записи, прочитанные вслух — с 7,2% до 3,2%
• Короткие фразы на 19 языках — с 20,6% до 6,8%
Именно строку 8 кГц стоит запомнить. Телефонный звук — самый сложный из распространённых входных сигналов в этой категории и тот, с которым реально имеет дело большинство покупателей решений для контакт-центров, а снижение с 10,6% до 7,1% по нему для этих покупателей важнее, чем главный показатель в таблице.
Утверждение из таблицы лидеров, если прочитать его честно
SpaceXAI утверждает, что модель занимает первое место среди 32 потоковых моделей по точности. Таблица Artificial Analysis действительно ставит её на первое место и в рейтинге по финальной расшифровке, и в рейтинге по первому частичному результату — но на странице таблицы отображаются 27 из 33 моделей, так что «32» — это собственный подсчёт компании, а рейтинг охватывает набор, форму которого читателю стоит понимать. AA-WER Streaming — это взвешенная составная метрика из трёх англоязычных наборов: AA-AgentTalk с весом 50%, VoxPopuli с весом 25% и Earnings22 с весом 25%, в общей сложности примерно восемь часов аудио, и она сильно смещена в сторону разговорной речи в стиле агентов. Она не измеряет акценты, телефонные кодеки, лексику предметной области или многоканальное аудио колл-центров каким-либо структурированным образом.
Ничто из этого не делает этот показатель неверным. Это делает его конкретным. Модель, возглавляющая англоязычную таблицу лидеров с весами по разговорам агентов, — правильный выбор для англоязычного аудио, по форме напоминающего разговоры агентов, а честная причина доверять результату на 8 кГц — это внутренняя оценка поставщика, а не публичная таблица лидеров. Покупателям с другим профилем аудио следует тестировать на своём аудио, а не воспринимать рейтинг как общий вердикт — это было верно до этого запуска и будет верно после следующего запуска.

Meta открывает коннекторы Muse для разработчиков
Вторая история недели — от Meta. Muse, персональный агент, запущенный Meta 8 сентября на iOS, Android, muse.ai и WhatsApp, теперь принимает сторонние коннекторы: сервис открывает свой API, а Muse предоставляет агента, браузер и пользовательский контекст, которые превращают этот API в нечто, что человек может вызвать, просто попросив об этом. Meta описывает это как разделение труда — вы приносите API, мы — намерение и пользователя. Первыми названными коннекторами стали Notion и инструмент для заметок о встречах Granola — в дополнение к тем, что Meta выпустила сама.
Стоит точно понимать, чем это является, а чем — нет. Это не открытый межагентный протокол. Создание коннектора даёт распространение внутри собственной пользовательской базы Muse и нигде больше; разработка под открытый протокол даёт охват всех совместимых агентов и не даёт никакой конкретной пользовательской базы. Meta также не опубликовала те части, которые разработчику нужно было бы учитывать при планировании, — процесс проверки коннекторов, техническую поверхность интеграции, то, как Muse выбирает между двумя пересекающимися коннекторами, или то, как разработчик измеряет, действительно ли коннектор привёл к какому-либо использованию.
Что не вызывает сомнений, так это направление. Muse запускает агента каждого пользователя в собственной виртуальной машине с собственным браузером и отдельным слоем проверки перед исходящими действиями, а также хранит суррогатные токены вместо настоящих API-ключей. Такая архитектура имеет смысл только в том случае, если план состоит в том, чтобы агент вызывал множество разных вещей. API транскрипции входят в число того, что вызывает агент, и у Meta есть собственный — Muse Voice Transcribe, модель реального времени, выпущенная Meta в начале сентября по цене $0.18 за час аудио. У платформы, которой принадлежат и агент, и речевая модель, есть очевидная причина направлять собственный трафик в свою модель, и разработчикам, создающим решения на коннекторах, следует исходить из того, что это вариант по умолчанию, если только что-то не сделает так, что это перестанет быть вариантом по умолчанию.

Что на самом деле должна делать команда, выпускающая голосовой продукт в этом месяце
Обе истории указывают в одну сторону. Точность распознавания речи сближается — за три недели три модели на одном и том же лидерборде оказываются в пределах полутора пунктов друг от друга, — а из оставшихся различий есть только цена, задержка, лицензия и то, кто контролирует маршрутизацию. Поэтому выбор того, куда направляется ваш вызов транскрипции, имеет более серьёзные последствия, чем выбор того, какая модель на него отвечает, потому что в течение следующего года вы захотите менять этот ответ несколько раз.
Это тот уровень, на котором располагается OrcaRouter. Один API-ключ даёт доступ к более чем 200 моделям через OpenAI-совместимые эндпоинты с автоматическим переключением при сбое между провайдерами, так что неудачный день у речевого сервиса в одном регионе больше не становится вашим простоем. Мы передаём прайс-листовую цену провайдера с нулевой наценкой, а значит, снижение цены вендором или новая версия модели появляются у нас в тот же день, а не после ожидания пересмотра цен. А поскольку каждая модель доступна по одному договору, перенос нагрузки по транскрипции с одной модели на другую — это изменение строки модели, а не вторая закупка.
Три конкретных действия на эту неделю. Если вы работаете на Grok Voice Transcribe 1.0, прямо сейчас протестируйте 2.0 в теневом режиме на своих аудиозаписях, пока 1.0 всё ещё используется по умолчанию и переключатель всё ещё под вашим контролем. Если вы оцениваете потоковую речь для агента, измеряйте время до первого частичного результата исходя из собственного бюджета задержки, а не доверяйте чужой таблице лидеров: эти четверть секунды, которые эта модель потратила ради точности, — либо ничто, либо фатальный фактор, в зависимости от того, что ваш агент делает с текстом. И если вы создаёте что-то, к чему однажды может обратиться персональный агент, внимательно следите за Muse connector program, потому что аргумент о дистрибуции, который она продвигает, сильнее технической детали, с которой она вышла.
