
Realtime-Venus против Grok Voice Think Fast 2.0: только у одного из них есть цена
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Поставьте Realtime-Venus и Grok Voice Think Fast 2.0 рядом друг с другом — и первое различие окажется не бенчмарком, а заказом на покупку. Grok Voice Think Fast 2.0 — это облачная модель преобразования речи в речь, поступившая в продажу 29 июля 2026 года по цене $0.08 за аудиоминуту, с опубликованным временем до первого аудио в 0,70 секунды и результатами бенчмарков от третьей стороны. Realtime-Venus — это полнодуплексная система на 9B от команды Venus из Ant Group и Университета Цинхуа, которая существует в виде весов Apache-2.0, технического отчёта от 12 сентября 2026 года — и ничего, что можно было бы вызвать. Одно из них можно подключить к телефонной линии до конца недели. Другое можно прочитать. Эта асимметрия оказывается гораздо более полезным сравнением, чем таблица результатов, потому что обе модели сделали почти одну и ту же архитектурную ставку, а затем полностью разошлись в том, что с ней делать.
Короткий ответ
Выбирайте Grok Voice Think Fast 2.0, если вам нужен работающий голосовой агент уже сейчас, в продакшене, с тарифной сеткой, которую можно заложить в бюджет, и гарантией задержки, которую можно проверить. Выбирайте Realtime-Venus, если вам нужно владеть стеком — если ваши данные не могут покидать вашу инфраструктуру, если вам нужно дообучить фронтенд или если вы оцениваете архитектуру, а не выпускаете продукт. Третьего случая, где они конкурируют, не существует, потому что у одного есть API, а у другого нет.
Они согласны насчёт трудной проблемы.
Интересно, насколько похож диагноз. Обе модели существуют из-за одного и того же противоречия: управление разговором должно работать с субсекундной гранулярностью, а рассуждение занимает секунды. Модель, которая останавливается, чтобы подумать, перестаёт восприниматься как присутствующая.
Grok Voice Think Fast 2.0 решает эту задачу, рассуждая прямо во время речи. Линейка Think Fast была построена на идее, что модель не должна сначала делать выводы, а затем генерировать речь; вместо этого она потоково передаёт речь и размышляет параллельно, так что вызов инструмента может сработать до того, как агент закончит первое предложение. xAI сообщает, что версия 2.0 использует примерно 0,4 от объёма токенов рассуждения своей предшественницы, что подаётся как улучшение затрат и задержки, а не качества.
Realtime-Venus решает эту проблему, вообще не решая её во фронтенде. Его среда выполнения с двумя циклами поддерживает работу цикла взаимодействия длительностью в одну секунду — восприятие, управление ходами, генерация речи — и передаёт всё дорогостоящее отдельному компоненту под названием Realtime-Venus-Harness через маркеры асинхронного делегирования, испускаемые в собственной скрытой последовательности модели. Диалог на переднем плане никогда не приостанавливается. Фоновые результаты реинтегрируются, когда поступают.
Это разные инженерные ответы на один и тот же вопрос, и у них разные режимы отказов. Рассуждение во время речи возлагает на модель бремя сохранения связности обеих нитей. Делегирование перекладывает это бремя на среду выполнения: она должна не давать двум циклам портить друг друга — именно поэтому каузальный захват задачи из статьи Realtime-Venus, изолированный снимок состояния для каждой делегированной задачи, и есть та деталь, на которой держится вся конструкция.
Единственная метрика, по которой их обоих можно измерить.
Полнодуплексные бенчмарки — единственное место, где эти двое пересекаются, и пересекаются они отнюдь не чисто.
• Обработка перебиваний — Realtime-Venus сообщает, что реагирует на 75% перебиваний пользователя в Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 набирает 95,1% в Full Duplex Bench по данным Artificial Analysis, по сравнению с 77,8% у версии 1.0.
• Продолжение при перекрытии — Realtime-Venus сообщает о 97% продолжения при бэкканалах, 88% при речи, направленной на других, и 86% при фоновой речи, и заявляет, что превосходит Gemini 3.1 Live и GPT-4o по всем трём показателям.
• Разные инструменты, разные авторы — показатели Realtime-Venus взяты из его собственного технического отчёта без внешнего воспроизведения. Показатели Grok взяты у третьей стороны, которая запускала модель. Сравнение самостоятельно заявленного числа с независимо измеренным — это не сравнение, и приведённый выше разрыв с равной вероятностью может быть как методологическим, так и реальным.
Честная оценка: по имеющимся данным, Grok Voice Think Fast 2.0 — единственный из двух, чьё полнодуплексное поведение было измерено кем-то, кто не имеет личной заинтересованности в результате.
Куда независимые цифры ставят Grok Voice Think Fast 2.0
Наиболее ясную актуальную картину даёт Speech Agent Arena от Artificial Analysis, где модели оцениваются по слепому предпочтению в живых голосовых разговорах при выполнении таких задач, как запись к стоматологу и заказ еды на вынос. По состоянию на 18 сентября 2026 года Grok Voice Think Fast 2.0 High занимает седьмое место из более чем двадцати участников с рейтингом Elo 1 011 на основе 552 образцов — уступая Gemini 3.1 Flash Live Minimal от Google с 1 096, Gemini 3.8 Live с 1 083 и GPT-Live-1 с 1 053, и значительно опережая своего собственного предшественника Grok Voice Think Fast 1.0 с 908.
Столбец рядом с Elo — интереснее. По показателю успешности выполнения задач Grok Voice Think Fast 2.0 показывает 94,6% — самый высокий показатель во всей видимой первой двадцатке: выше, чем 93,2% у Gemini 3.8 Live, 91,5% у GPT-Realtime-2.1 High и 90,9% у GPT-Live-1. Седьмой по предпочтению, первый по завершению задач — необычный и довольно специфичный профиль: слушателям не очень нравится голос, но он доводит дело до конца. Если ваш продукт выполняет действия, а не ведёт беседы, именно этот столбец предсказывает ваш результат, и это самое сильное независимое свидетельство, которое есть у любой из этих двух моделей.

Цифры, которые xAI опубликовала на запуске, — это другой инструмент, и читать их следует отдельно: 82,9% в индексе качества речи-в-речь от Artificial Analysis, первое место в агентном бенчмарке τ-Voice с результатом 56,5%, 97,2% в Big Bench Audio и 95,1% в Full Duplex Bench. Это были позиции на момент выпуска модели в конце июля 2026 года, а таблицы лидеров в этой категории обновляются ежемесячно — именно поэтому приведённая выше таблица арены, прочитанная сегодня, ценнее стартовых цифр.

Счёт, а также те его части, которых нет в счёте
Grok Voice Think Fast 2.0 стоит $0,08 за минуту аудио, примерно $4,80 в час, плюс $0,004 за каждое входное текстовое сообщение. Это на 60% больше, чем $0,05 за минуту, которые взимала версия 1.0 на момент запуска, и xAI перевела скользящий grok-voice-latest алиас на 2.0 автоматически 5 августа 2026 года, поэтому командам, которые хотели остаться на старой цене, пришлось закрепить явную версию до этой даты. Поминутная модель также означает, что улучшения эффективности достаются поставщику: если модель начнёт быстрее завершать звонки, ваш счёт за звонок снизится, но стоимость за минуту — нет.
У Realtime-Venus нет счёта, потому что у неё нет сервиса. Вместо этого у неё есть аппаратный минимум. Два чекпоинта 9B в BF16 — это примерно восемнадцать гигабайт весов каждый ещё до памяти под активации, а в карточке описан посекундный цикл потоковой передачи, который должен выполняться непрерывно. GPU-узел, способный на это, стоит определённую сумму в месяц, причём фиксированную — вы платите её независимо от того, поступают ли запросы. Для продукта со стабильным трафиком это дешевле, чем $4.80 в час. Для продукта с нерегулярным трафиком это значительно дороже, а точка перехода — единственный финансовый вопрос, который здесь имеет значение.
Веса, управление и что каждое из них позволяет изменить
Вот где две модели перестают быть сопоставимыми вообще.
• Тонкая настройка — Realtime-Venus поставляется с весами. Вы можете дообучать их, квантовать их, запускать их в изолированной от сети среде и проверять каждый слой. Grok Voice Think Fast 2.0 — это закрытая размещаемая модель; то, что вы можете изменить, — это промпт, выбор голоса и инструменты, которые вы регистрируете.
• Голос — Grok Voice Think Fast 2.0 поставляется с предустановленными голосами и поддерживает клонирование пользовательского голоса примерно по одной минуте речи. Realtime-Venus поставляется с эталонным голосом и встроенным декодером преобразования токенов в waveform, а всё остальное — ваша забота.
• Reach — Grok Voice Think Fast 2.0 поддерживает более 25 языков и по умолчанию передаёт PCM16 на частоте 24 кГц, а для телефонии — μ-law, через сессию WebSocket, совместимую с OpenAI Realtime. Эта совместимость — настоящее преимущество при миграции: большинству существующего кода для голосовой связи в реальном времени достаточно изменить базовый URL и ключ. Realtime-Venus документирует английский и китайский.
• Видео — Realtime-Venus-Omni принимает потоковое видео и изображения через кодировщик SigLIP2 и выполняет непрерывное визуальное восприятие. Grok Voice Think Fast 2.0 работает с аудио и текстом; путь для камеры отсутствует.
• Длинный контекст — Realtime-Venus поддерживает контекст в 40 960 токенов и не требующую обучения память для длинных видео, которую можно включить на сорокаминутном окне. Grok Voice Think Fast 2.0 — это сессионная модель без сопоставимой опубликованной функции памяти.

Где каждый из них ломается
Сбои, к которым стоит готовиться, — прямо противоположны. Уязвимость Grok Voice Think Fast 2.0 — это зависимость от одного вендора и непроверяемый маркетинг: результаты A/B-тестов Starlink от xAI, множители точности транскрипции и позиционирование по скорости — всё это заявлено самой компанией, без опубликованных исходных данных, а поминутная модель, меняющая цену на 60% между версиями, уже показала, что будет менять цену. Зафиксируйте свою версию и проведите собственные оценки на собственном аудио.
Слабое место Realtime-Venus заключается в том, что никто её не запускал. Её бенчмарки основаны на самоотчётах, её испытательный стенд не документирован в той мере, в какой он важен, а её задержка при реальном развёртывании неизвестна — в отчёте описывается односекундный ритм взаимодействия, который является параметром дизайна, а не измеренным временем до первого аудио. У модели без API и без воспроизведения нет послужного списка — только спецификация.
Есть промежуточный путь, о котором стоит сказать прямо, потому что именно так большинство команд и поступит. Если вы строите систему на основе делегирования — выбираете собственный интерфейс, передаёте дорогостоящую работу текстовой модели — интерфейс и часть рассуждений не обязаны происходить из одного места. OrcaRouter не предоставляет ни Realtime-Venus, ни Grok Voice Think Fast 2.0; оба голосовых слоя находятся вне того, что мы предоставляем, и мы говорим об этом прямо, а не намекаем на обратное. А вот делегированная часть — совсем другое дело. Почти 200 текстовых моделей доступны через один ключ по прайс-листовой цене провайдера без наценки, с автоматическим переключением при сбое, чтобы сбой на стороне вышестоящего провайдера не обрывал активный вызов, DSL-маршрутизацией для объединения нескольких моделей в один вызов и слиянием моделей для решений, которые заслуживают более одного мнения. Это та половина голосового агента, которой идёт на пользу возможность замены, и именно эту половину можно изменить, не трогая модель, которая ведёт разговор.
Какой выбрать?
Выберите Grok Voice Think Fast 2.0 в этом квартале. Он доступен, прошёл независимое тестирование по бенчмаркам, занимает первое место в агентной оценке, которая предсказывает, сможет ли ваш агент делать что-то полезное, а 0,70 секунды до первого аудио — это число, вокруг которого можно построить пользовательский опыт. Заложите в бюджет повышение цены на 60% по сравнению с 1.0 и зафиксируйте версию модели.
Выбирайте Realtime-Venus, только если ограничивающим фактором является владение. Если ваше развёртывание не может обращаться к внешнему API, если вам нужно дообучить разговорный фронтенд или если вам нужна камера — эти три случая исчерпывают весь аргумент, и они весомы, когда применимы.
Решать это должна не таблица бенчмарков, потому что её две стороны были получены разными людьми в разных условиях. Показатели Grok Voice Think Fast 2.0 были измерены кем-то другим. Показатели Realtime-Venus — нет. Пока это не изменится, реально доступное сравнение — это сравнение продукта и статьи.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
