
Grok Voice Think Fast 2.0: объясняем самый быстрый и дорогой голосовой агент xAI
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 201 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
xAI выпустила Grok Voice Think Fast 2.0 29 июля 2026 года — модель, которую сама xAI называет «самой производительной моделью преобразования речи в речь» и новым флагманом линейки голосовых агентов. Она отвечает быстрее любого конкурента из первой пятёрки (0,70 секунды до первого звука), лидирует в бенчмарке голосовых агентов и транскрибирует речь точнее, чем предыдущее поколение. Кроме того, она на 60 % дороже в пересчёте на минуту, чем модель, которую заменяет, тарифицируется поминутно, что незаметно увеличивает ваш счёт, и в комплекте идёт переключатель псевдонима версии, который сработает автоматически через неделю. В этом руководстве объясняется, что такое Think Fast 2.0 на самом деле, что xAI изменила под капотом, как история с бенчмарками распадается на независимые оценки и заявленные вендором показатели, сколько она реально стоит, если всё посчитать, и как её вызывать, — а также предостережения, которые стоит прочитать, прежде чем пропускать через неё производственный поток звонков.
Примечание о точности: детали запуска, цены, точность заголовков и бизнес-заявления взяты из объявления и документации xAI (2026-07-29). Сводные оценки Artificial Analysis являются независимыми и измерены третьей стороной. Заявленные xAI данные — результаты A/B-тестирования Starlink, коэффициенты транскрипции, «на 60% меньше токенов рассуждений» и формулировка «почти в 5 раз быстрее» — не имеют опубликованных исходных данных; относитесь к ним как к ориентировочным показателям производителя и проводите собственные оценки. Характеристики, цены и поведение псевдонимов могут измениться; проверяйте всё перед созданием.
Короче. Grok Voice Think Fast 2.0 — это сквозная модель xAI «речь-в-речь» для голосовых агентов: на входе аудио, на выходе аудио через WebSocket, без отдельного конвейера ASR→LLM→TTS. Она действительно быстрая (0,70 с до первого аудио — единственная модель из топ-5, укладывающаяся в секунду) и действительно сильна в агентной голосовой работе: занимает первое место в бенчмарке τ-Voice от Artificial Analysis (56,5%), а в общем индексе качества «речь-в-речь» — второе (82,9%), уступая Qwen Audio 3.0 Realtime Plus (84,1%). Она рассуждает, пока говорит — сокращая медианное использование токенов рассуждения примерно до 40% от прежней модели — и стоит $0,08 за минуту, подорожав с $0,05. Загвоздка в тарификации: голос оплачивается за минуту реального аудио, поэтому повышение цены на 60% на модели, которую обслуживать дешевле, бьёт прямо по вашему счёту. А с 5 августа алиас grok-voice-latest автоматически начинает направлять трафик на 2.0, так что командам на старой версии нужно осознанно зафиксировать её до этого срока.
Основные выводы
• Нативный режим «речь-в-речь»: одна модель от микрофона до динамика, без цепочки ASR→LLM→TTS — именно поэтому первый звук появляется за 0,70 секунды.
• Агентный лидер: #1 в бенчмарке τ-Voice от Artificial Analysis (56,5%), значительно опережая GPT-Realtime-2.1 (45,7%) и Gemini 3.1 Flash (37,7%).
• Не общий лидер: #2 по индексу качества речи-в-речь (82.9%), уступая Qwen Audio 3.0 Realtime Plus (84.1%); OpenAI по-прежнему побеждает в динамике разговора (95.7% против 95.1%).
• на 60% дороже: $0.08/мин (~$4.80/час) против $0.05/мин для Think Fast 1.0 — несмотря на то, что модель, как сообщается, использует примерно на 60% меньше токенов рассуждения.
• Смена алиаса 5 августа: grok-voice-latest автоматически будет направляться на 2.0; закрепите grok-voice-think-fast-1.0 до этого момента, чтобы остаться на более дешевой версии.
• Пометьте каждое утверждение: оценки Artificial Analysis независимы; Starlink A/B, множители транскрипции и подача скорости предоставлены xAI и не опубликованы.
Что такое Grok Voice Think Fast 2.0
Grok Voice — это семейство моделей xAI для преобразования речи в речь в реальном времени. «Think Fast» — линия быстрых ответов, изначально запущенная вместе с Voice Agent Builder в апреле 2026 года; Think Fast 2.0 — второе поколение этой линии, выпущенное 29 июля 2026 года. Модель является сквозной: она потребляет необработанный звук, рассуждает и выдаёт звук напрямую, а не выполняет конвейер из модели распознавания речи, подающей результат в текстовую LLM, которая, в свою очередь, подаёт результат в модель синтеза речи. Такое архитектурное решение лежит в основе её преимущества по задержке — здесь нет последовательных переходов и промежуточного текста, поэтому модель может начинать ответ, продолжая слушать.
xAI позиционирует его явно для голосовых ИИ-агентов: линии поддержки клиентов, телефонные продажи, ресепшн, телефонию и другие приложения, где система разговаривает с человеком в реальном времени и должна реально выполнять задачи — запланировать звонок, квалифицировать лид, обновить запись, поискать в интернете — а не просто болтать. Акцент на агентности, а не на простой транскрипции или синтезе, — это поле боя, на которое нацелен запуск.
Что нового по сравнению с Think Fast 1.0
Обновление с версии 1.0 — это не просто смена номера версии; xAI описывает три структурных изменения:
• Параллельное речевое рассуждение. Модель обдумывает запрос, пока говорит, а не сначала думает, а потом говорит. На практике вызовы инструментов могут срабатывать до того, как агент закончит свою первую фразу — это очень важно для голосовых потоков с низкой задержкой.
• Намного меньше токенов рассуждения. xAI сообщает, что медианное использование токенов рассуждения снизилось примерно до 0,4x от показателя предшественника (примерно на 60% меньше), что отчасти объясняет, почему, по словам компании, модель дешевле в обслуживании, несмотря на рост цены.
• Стиль разговора на основе обучения с подкреплением. RL изменило манеру речи: более короткие предложения, один вопрос за раз, без слов-паразитов — более лаконичный, более «человеческий» стиль звонков, который подходит для телефонной работы, где многословие сжигает минуты (а при поминутной тарификации — и деньги).
Что касается измеряемой скорости, время до первого звука снизилось с 1,25 с в версии 1.0 до 0,70 с в версии 2.0. Что касается транскрипции, xAI сообщает об улучшении примерно в 1,4 раза для 24 языков (по данным разработчика, ниже).

Бенчмарки, бенчмарк за бенчмарком
Запуск опирается на Artificial Analysis, независимую стороннюю бенчмарк-компанию. Это важно: в отличие от большинства других цифр в анонсе, эти показатели измерены нейтральной стороной, и именно их стоит сравнивать напрямую. Совокупная картина лучше, чем один заголовок.
Индекс качества «речь-в-речь»: 82,9% (второе место). Это общий сводный показатель «речь-в-речь», выросший с 75,7% у Think Fast 1.0. Он превосходит GPT-Realtime-2.1 (79,1%) и Gemini 3.1 Flash (69,5%) — но он не первый. Qwen Audio 3.0 Realtime Plus лидирует с 84,1%. Так что «лучшая голосовая модель в целом» — это преувеличение, которое данные не подтверждают; «самая быстрая агентная голосовая модель в высшем эшелоне» — это точно.
Бенчмарк τ-Voice для агентов: 56,5% (первое место). Это метрика, которая для xAI важнее всего, и рейтинг реален: 56,5% опережает Think Fast 1.0 (52,1%), GPT-Realtime-2.1 (45,7%) и Gemini 3.1 Flash (37,7%). τ-Voice измеряет производительность агентных голосовых систем — насколько хорошо модель выполняет задачи по голосовому каналу, включая использование инструментов в ходе разговора. По узкому критерию «может ли модель выполнить задачу» лидирует Grok. Маск продвигал именно этот рейтинг.
Big Bench Audio: 97,2%. Бенчмарк речевого рассуждения; сильный результат, хотя Qwen показал рекордные 99,2%.
Полнодуплексный бенчмарк: 95,1%. Динамика диалога — обработка прерываний, очередность реплик, перебивание. Это большой скачок по сравнению с 77,8% у версии 1.0, но OpenAI по-прежнему обходит его с 95,7%, а Qwen лидирует с 98,4%.
Время до первого аудио: 0,70 с. Самый значимый показатель для реальных голосовых продуктов. Он снизился с 1,25 с и является единственным значением меньше секунды среди пяти лучших моделей; независимые тесты в целом подтверждают ответ менее чем за секунду. Задержка первого токена в потоковом TTS составляет около 285 мс. Для телефонных звонков и использования в реальном времени задержка — это метрика, которую пользователи ощущают в каждом ходе, и именно здесь 2.0 явно лучше всех.
Читая по строкам, профиль конкретен: быстрее всех говорит, лучше всех справляется с задачами, второй в общем зачёте, третий по искусству ведения беседы. Это отличная модель голосового агента и посредственная претензия на звание «лучший голос чат-бота». Выбирайте её для задач, которым соответствует верхняя строка.
Точность транскрипции
Помимо разговоров, xAI заявляет о существенно более точной транскрибации. По сообщениям, внутренняя оценка xAI на 24 языках и тысячах фраз демонстрирует примерно в 1,4 раза более высокую точность, чем Think Fast 1.0, и в 1,5–2 раза более высокую, чем специализированные модели транскрибации, такие как Deepgram Nova 3 и ElevenLabs Scribe v2. В шумных условиях реального мира — фоновый шум, сжатие телефонного сигнала, звонки с низкой пропускной способностью — сообщаемый разрыв в точности по сравнению со специализированными STT-моделями увеличивается примерно до 10 раз.
Это как раз те утверждения, к которым стоит относиться с осторожностью. Они предоставлены xAI; оценочный инструментарий, наборы фраз и профили шума не опубликованы. Независимое тестирование транскрипции шумных телефонных разговоров версии 2.0 в сравнении с Deepgram или ElevenLabs было бы полезно, но на момент написания этого текста оно не опубликовано. С точки зрения направления, сквозные модели, усваивающие больше телефонных данных при обучении, — это вероятное реальное улучшение, но «10x» нужно проверять, а не повторять как факт.
Цены: $0.08 за минуту и вопрос о 60%
Вот где запуск становится спорным. Think Fast 2.0 стоит $0,08 за минуту аудио — около $4,80 в час — плюс $0,004 за каждое входящее текстовое сообщение. Think Fast 1.0 стоил $0,05 за минуту ($3,00 в час). Это рост на 60%, и он произошёл в том же месяце, когда OpenAI снизила цены на GPT-5.6 Luna на 80% и Terra на 20%, ссылаясь на те же падающие затраты на обслуживание, которые xAI называет причиной для этой модели.
Счётчик — вот и вся история. Текстовые модели тарифицируются за токен, поэтому когда модель становится эффективнее, счёт клиента автоматически уменьшается. Голосовые модели тарифицируются за минуту аудио в реальном времени, а длину разговора задаёт говорящий, а не модель. Выигрыш в эффективности в продукте с поминутной оплатой достаётся вендору, а не покупателю. Вот почему модель, которая, по сообщениям, использует примерно на 60% меньше токенов рассуждения — и поэтому обходится xAI дешевле в обслуживании — стоит на 60% дороже в аренде.
Выполните арифметику на реальном потоке вызовов. Четырёхминутный звонок по 1.0 стоит $0,20; тот же звонок по 2.0 — $0,32. Десять тысяч таких звонков в месяц — это 40 000 минут: $2 000 в месяц на 1.0 против $3 200 в месяц на 2.0, то есть разница в $1 200 в месяц, или примерно $14 400 в год, которая возникает только из-за изменения маршрутизации, а не из-за объёма звонков. Даже значительный выигрыш в скорости едва ли меняет картину: сокращение целых 10 секунд на каждом звонке экономит около $0,013, тогда как рост цены добавляет $0,12 — вы компенсируете примерно девятую часть увеличения. Любое бизнес-обоснование, которое предлагает 2.0 как более дешёвый вариант, перепутало «быстрее» с «дешевле».
Для контекста: 2.0 всё ещё примерно в 2,2 раза дешевле GPT-Realtime-2.1 High — около $10.75 в час. Так что в абсолютном выражении это недорого — это дорого относительно своего собственного предшественника и того направления, в котором двигались все остальные поставщики моделей в тот месяц.
Миграционная ловушка 5 августа
К этому привязан крайний срок. 5 августа 2026 года псевдоним grok-voice-latest автоматически начнёт маршрутизировать на Think Fast 2.0. Если вы работаете на Think Fast 1.0 через этот псевдоним, «ничего не делать» — и ваш счёт — переведёт вас на новую версию в эту дату. Чтобы остаться на 1.0, вы должны явно закрепить идентификатор модели grok-voice-think-fast-1.0 до 5 августа.
Обе оправданные позиции требуют действий до дедлайна: либо намеренно остаться на 1.0, потому что ваши скриптованные процессы отлично работали по $3.00 в час, либо намеренно перейти на 2.0 и пересмотреть прогноз по $4.80 в час, обосновав это качеством, а не экономией. Непростительно — обнаружить это изменение в сентябрьском счете. Хорошее правило: относиться к любому алиасу с суффиксом "latest" как к постоянному указанию принимать всё, что поставщик выпустит следующим, — включая цену.
Как получить доступ и использовать его
Think Fast 2.0 доступен через Speech-to-Speech API от xAI под идентификатором модели grok-voice-think-fast-2.0, с grok-voice-latest в качестве скользящего псевдонима. Это модель реального времени с полным дуплексом поверх WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, аутентификация выполняется с помощью заголовка Authorization: Bearer при рукопожатии. Для браузерных приложений создавайте эфемерные токены на стороне сервера через конечную точку realtime sessions, чтобы родительский API-ключ никогда не попадал к клиенту.
API совместим с OpenAI Realtime, поэтому существующему коду для realtime-voice обычно нужна лишь замена базового URL и ключа. Настройка сессии происходит через событие session.update: выберите предустановленный голос (eve, ara, rex, sal, leo), задайте формат входного и выходного аудио (по умолчанию PCM16 с частотой 24 кГц; для телефонии — μ-law), включите серверное обнаружение речевой активности и зарегистрируйте инструменты, включая встроенный инструмент веб-поиска, чтобы агент мог действовать в процессе разговора. Поток событий следует стандартному шаблону: клиент добавляет кадры аудиобуфера, сервер потоково передает дельты ответного аудио, а когда модель решает действовать, срабатывают события аргументов вызова инструмента, при этом результаты возвращаются как выходные данные вызова функции. Модель поддерживает более 25 языков и клонирование пользовательского голоса на основе примерно минуты речи.
Обратите внимание, чем это не является: это агентная модель «речь-в-речь» (speech-to-speech), а не универсальный сервис транскрибации или перевода. Если основная задача вашего продукта — дешёвое преобразование аудио в текст, специализированная модель STT — это другой инструмент, и при поминутной тарификации вы платите за весь разговор, так что нагрузка только на транскрибацию быстро становится дорогой.

Как это вписывается в стек голосового агента
Think Fast 2.0 — это специализированная голосовая модель реального времени, доступ к которой осуществляется через выделенный API xAI, а не универсальная LLM, которую хостит маршрутизатор моделей. Голосовой канал работает напрямую через WebSocket xAI — именно там обеспечивается субсекундная задержка, и она не переживает промежуточный переход.
Всё остальное вокруг голосового продукта — некритичная ко времени логика обработки естественного языка, резервные рассуждения, когда разговор выходит за рамки сценария, суммаризация, аналитика, последующее письмо, которое агент отправляет после звонка, — это универсальная текстовая и мультимодальная работа. Для этой части вендоронейтральная конечная точка вроде OrcaRouter предоставляет единый OpenAI-совместимый API для множества LLM, так что вы не привязаны к одному вендору для тех частей стека, которым не нужен голосовой канал реального времени. Чёткое разделение: специализированный API xAI — для самого стримингового голоса, OrcaRouter (или аналогичное решение) — для текстовых и мультимодальных рассуждений вокруг него.
Соревнование: агентная скорость против сырого интеллекта
Think Fast 2.0 выходит в самый разгар самого конкурентного рынка в ИИ прямо сейчас — голосовых агентов реального времени, — и таблица бенчмарков делает компромиссы необычно наглядными.
Qwen Audio 3.0 Realtime Plus — лидер по интеллекту: 84,1% по индексу качества «речь-в-речь» (первое место), рекордные 99,2% на Big Bench Audio и 98,4% на полном дуплексе. Но среднее время до первого аудио составляет около 4,02 секунды — примерно в 5,7 раза медленнее, чем у Grok (0,70 с). Для автомобилей, носимых устройств и телефонных разговоров эта разница — не «быстро против медленно», а «пригодно против непригодно». Qwen также разделяется на уровень Plus (качество) и уровень Flash (первый пакет около 300 мс) для разных сценариев, что является продуманным ответом на то же противоречие.
GPT-Realtime-2.1 занимает серединную позицию по большинству показателей (79,1% качество, 45,7% агентность) и выигрывает по динамике диалога (95,7%). Его тариф High примерно в 2,2 раза превышает почасовую цену Grok. Для команд, уже глубоко интегрированных в экосистему OpenAI, он остаётся самым простым вариантом по умолчанию.
Gemini 3.1 Flashотстает по качеству и агентным композитам (69.5%, 37.7%), но является частью более широкого голосового стека Gemini и экосистемы Google, которые многие команды предпочитают по другим причинам.
Практический вывод: выбирайте по нагрузке. Если ваш голосовой агент должен откликаться мгновенно и надёжно выполнять задачи с использованием инструментов (поддержка, квалификация, бронирование), Think Fast 2.0 — самый сильный вариант по измеренным показателям на сегодня. Если ваш приоритет — самое глубокое рассуждение и вы готовы принять многосекундную задержку, побеждает Qwen Plus. Если важнее всего качество разговорного взаимодействия и соответствие экосистеме, GPT-Realtime-2.1 остаётся действующим лидером, которого нужно превзойти.

Три сценария, в которых это применимо
1. Телефонная поддержка и телефония
Наиболее важна комбинация: первый звук менее чем за секунду, надёжная транскрипция при шумном телефоне (по данным вендора) и полнодуплексная обработка прерываний. Линия поддержки, где агент начинает говорить почти сразу и может найти информацию об аккаунте в середине реплики, — именно то, под что настраивали 2.0. Его более короткий стиль речи RL — по одному вопросу за раз — также хорошо подходит для телефонии, где минуты являются расчётной единицей — по счётчику любого вендора.
2. Квалификация лидов и последующие действия после звонка
Агентный голос — это область, где 2.0 действительно первый, а квалификация лидов — каноническая задача агентного голоса: квалифицировать, маршрутизировать и запускать последующие действия, пока намерение свежо. Его вызов инструментов может сработать до того, как закончится первое предложение, поэтому агент может создавать запись в CRM, всё ещё разговаривая с потенциальным клиентом. Планируйте атрибуцию на уровне сессии и строгие права доступа к инструментам — голосовой агент может ошибаться в реальном времени, и разбираться с этим придётся вам.
3. Продукты голосовых агентов в активной разработке
Для разработчиков, выпускающих собственных голосовых агентов — интеграции Tradecraft и GrokTerm, на которые ссылается xAI, выглядят именно так, — скорость 2.0 и OpenAI-совместимый API делают её простой заменой для кода GPT-Realtime. Зафиксируйте версию, проведите узкий пилот с чётким критерием успеха (например, «квалифицировать и направлять посетителей страницы с ценами») и измеряйте стоимость за завершённый результат, а не за минуту.
Ограничения и оговорки
Think Fast 2.0 на момент написания существует всего пять дней, и это заметно по оговоркам. Результаты A/B-теста Starlink (более высокая конверсия и сдерживание обращений в поддержку) приводятся самой xAI без опубликованных цифр; коэффициенты транскрибации и формулировка «почти в 5 раз быстрее» — тоже заявления вендора, а не независимые бенчмарки. Единственная статья, которую вы увидите и в которой утверждается о «деградации производительности и сфабрикованных отчётах об испытаниях», указывает на ту же самую непроверяемость: цифры, опубликованные xAI, не были независимо воспроизведены, и голосовое сообщество, чувствительное к надёжности, справедливо не доверяет неопубликованным метрикам вендора. Бенчмарки также не могут оценить ваш худший звонок: ответ за 0,70 с ничего не стоит, если агент уверенно направляет лида не в ту команду. Тарификация голоса поминутная, причём повышение цены уже заложено, так что расходы реальны. И как у любой новой модели реального времени, ожидайте изменений в API. Проверяйте заявления о точности на собственных аудиозаписях, фиксируйте версии в проде и настройте эскалацию и запись до первого живого звонка.
Часто задаваемые вопросы
Что такое Grok Voice Think Fast 2.0?
Флагманская модель xAI для преобразования речи в речь для голосовых агентов, выпущенная 29 июля 2026 года: нативная сквозная передача аудио в аудио через WebSocket, с временем до первого аудио 0,70 секунды и первым местом в агентивном бенчмарке τ-Voice.
Сколько стоит Grok Voice Think Fast 2.0?
$0.08 за минуту аудио (примерно $4.80/час) плюс $0.004 за входное текстовое сообщение — на 60% больше, чем $0.05/мин у Think Fast 1.0.
Является ли Think Fast 2.0 лучшей голосовой моделью?
Это самый быстрый и лучший в агентных задачах (56,5% τ-Voice, первое место) и второй в целом по индексу качества «речь-в-речь» (82,9%), уступая Qwen Audio 3.0 Realtime Plus (84,1%). «Лучший» зависит от рабочей нагрузки.
Что изменилось по сравнению с Think Fast 1.0?
Параллельное речевое рассуждение (думает, пока говорит), примерно на 60% меньше токенов рассуждения, более лаконичный стиль диалога, настроенный с помощью RL, улучшение транскрипции в 1,4 раза (по данным вендора) и сокращение времени до первого аудио с 1,25 с до 0,70 с.
Будет ли мой Think Fast 1.0 автоматически переключать трафик?
Да, 5 августа 2026 года, если вы используете алиас grok-voice-latest. Закрепите grok-voice-think-fast-1.0 до этого времени, чтобы остаться на версии 1.0, или осознанно перейдите на 2.0 и пересмотрите прогноз стоимости.
Как мне вызвать Grok Voice Think Fast 2.0?
Через Speech-to-Speech API от xAI — WebSocket в реальном времени (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0), совместимый с OpenAI Realtime API, с предустановленными голосами, серверным VAD и вызовом инструментов.
С какими голосовыми моделями он конкурирует?
Qwen Audio 3.0 Realtime Plus (более интеллектуальный, но гораздо медленнее — 4,02 с до первого аудио), GPT-Realtime-2.1 (лучшая динамика разговора, ~в 2,2 раза дороже на уровне High), и Gemini 3.1 Flash.
Надежны ли заявления о бенчмарках?
Оценки Artificial Analysis независимы и надежны. Результаты A/B-тестов Starlink, множители транскрипции и формулировки о скорости предоставлены xAI без опубликованных данных — относитесь к ним как к ориентировочным и проверяйте на собственном аудио.
Подходит ли Grok Voice для транскрипции?
Он транскрибирует в рамках разговора, и xAI заявляет о значительном превосходстве над специализированными моделями STT в условиях шума — но оплата взимается за минуту разговора, поэтому для специализированных задач транскрибации лучше подходит выделенная модель STT.
Суть
Grok Voice Think Fast 2.0 — самая сильная агентная голосовая модель из всех измеренных на сегодняшний день и самая быстрая в верхнем эшелоне с большим отрывом: 0,70 секунды до первого аудио — это настоящий, независимый, ориентированный на пользователя выигрыш, а первое место на τ-Voice — реальный рейтинг. Честное резюме конкретно: это лучший инструмент в своём классе для голосовых агентов реального времени с поддержкой инструментов, но не лучшая голосовая модель по каждому параметру — Qwen лидирует по интеллекту, а OpenAI по разговорному мастерству. Споры касаются не скорости. Они касаются метрики: повышение цены на 60% на модель, которую xAI, по её словам, обслуживать дешевле, автоматическая миграция алиасов с жёстким дедлайном и громкие заявления, основанные на неопубликованных данных вендора. Используйте её ради агентной скорости, зафиксируйте версию, помечайте заявления вендора и проверяйте точность на собственных вызовах — а универсальный текст и рассуждения вокруг вашего голосового продукта держите на нейтральном к вендору эндпоинте вроде OrcaRouter.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
