
GPT-Live-1 против Grok Voice Think Fast 2.0: два голосовых API, цены которых движутся в противоположных направлениях
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Самый полезный факт об этом противостоянии — это направление, а не число. Когда xAI выпустила Grok Voice Think Fast 2.0 в конце июля 2026 года, она повысила поминутную ставку за аудио на 60% — с $0.05, которые взимала Think Fast 1.0, до $0.08. Шесть недель спустя, 10 сентября 2026 года, OpenAI добавила GPT-Live-1 в API для разработчиков ровно по той цене, от которой xAI только что отказалась. Это создаёт редкую ситуацию, когда два ведущих полнодуплексных голосовых API можно напрямую сравнить по цене и когда более новый участник оказывается дешевле, — тогда как более старая и более дорогая модель — это та, за которой стоят результаты сторонних бенчмарков.
Реестр, до любых бенчмарков.
Обе эти модели — модели «речь-в-речь», созданные для нагрузок телефонного формата: живой разговор с клиентом, перебивание, вызов инструмента и счёт, измеряемый в минутах. За этими пределами они быстро расходятся.
• Цена за минуту аудио — GPT-Live-1 $0,05 против Grok Voice Think Fast 2.0 $0,08
• Единица тарификации — GPT-Live-1 тарифицируется посекундно, без округления до следующей полной минуты; Grok Voice Think Fast 2.0 тарифицируется поминутно за аудио и составляет примерно $4,80 в час
• Релиз — GPT-Live-1 вышел в составе ChatGPT 8 июля 2026 года и стал доступен в API 10 сентября 2026 года; Grok Voice Think Fast 2.0 был анонсирован около 29–30 июля 2026 года, примерно через три месяца после Think Fast 1.0
• Эндпоинты — GPT-Live-1 поддерживает только Live Sessions, по адресу v1/live/sessions, через WebRTC; Grok Voice Think Fast 2.0 работает на Speech-to-Speech API от xAI как через WebSocket, так и через WebRTC
• Набор инструментов — GPT-Live-1 делегирует задачи бэкенд-модели рассуждений через Responses API; Grok Voice Think Fast 2.0 имеет доступ к веб-поиску, поиску по X, поиску по файлам, MCP-серверам и клиентским функциям внутри сессии
• Переносимость голоса — GPT-Live-1 использует ремастированный набор из двенадцати голосов OpenAI; Grok Voice Think Fast 2.0 поддерживает встроенные и пользовательские голоса
Направление WebSocket меньше, чем кажется, и значит больше, чем должно. Значительная часть инфраструктуры телефонии — медиапотоковая обвязка внутри большинства продуктов CPaaS — говорит на WebSocket, а не на WebRTC. Grok Voice Think Fast 2.0 встречает эту инфраструктуру там, где она есть; GPT-Live-1 — нет, и переход к WebRTC с пути вызовов, работающего только через WebSocket, — это настоящая инженерная задача, а не флаг конфигурации.

Асимметрия бенчмарка — вот в чём настоящая суть.
Вот здесь сравнение перестаёт быть ничейным, и именно здесь большинство обзоров переворачивают всё с ног на голову, трактуя оба набора чисел как доказательства одного и того же рода.
Основные показатели Grok Voice Think Fast 2.0 взяты из индекса Speech-to-Speech Quality Index от Artificial Analysis, стороннего измерения, которое оценивает модель в 82,9%, что выше 75,7% в версии 1.0, опережая GPT-Realtime-2.1 с 79,1% и Gemini 3.1 Flash с 69,5%. xAI также сообщает о первом месте в τ-voice Bench за агентное поведение с 56,5%, опережая GPT-Realtime-2.1 с 45,7%. Это внешние измерения модели xAI.
Основные показатели GPT-Live-1 — это собственные показатели OpenAI. Компания сообщает о полнодуплексной интерактивности на уровне 80,1% против 45,4% у GPT-Realtime-2.1, о сокращении задержки при передаче хода с 1,4 секунды до 0,8 и о повышении точности вызова инструментов с 60% до 87%. Каждая из этих цифр сообщена производителем, не воспроизведена независимой лабораторией и сравнивает новую модель OpenAI с предыдущей собственной моделью OpenAI, а не с конкурентом.
Это не повод отмахиваться от цифр — вектор движения согласуется с отзывами первых внедренцев, — но это означает, что единственное доступное сейчас сравнение между вендорами отдаёт предпочтение модели xAI по результатам независимо проведённых тестов, тогда как единственная доступная цифра о преимуществе OpenAI в задержке — это цифра самой OpenAI. Не воспринимайте 0,8 секунды и 0,70 секунды как настоящее состязание; только одну из этих двух цифр измерил кто-то, кто не заинтересован в результате.

Ловушка с псевдонимами, и почему рост цен застал людей врасплох
60%-ное повышение в большинстве примечаний к выпуску было бы погрешностью округления, если бы xAI не провела его ещё и через алиас. Приложения, указывавшие на алиас grok-voice-latest, автоматически унаследовали как новую модель, так и более высокий тариф 5 августа 2026 года, если только они явно не закрепили grok-voice-think-fast-1.0. Это проектное решение, которое стоит понять, а не жалоба: плавающие алиасы дают вам бесплатные обновления, а ещё они меняют вашу юнит-экономику, не спрашивая.
Очевидное средство слабее, чем кажется. Grok Voice Think Fast 1.0 — модель за $0,05 в минуту, выпущенная 23 апреля 2026 года, — теперь помечена как устаревшая в собственном списке моделей xAI. Закрепление этой модели защищает вас от автоматического обновления и выигрывает время, а не даёт постоянный более дешёвый путь, потому что у устаревшей модели где-то впереди есть дата вывода из эксплуатации. Планируйте миграцию по своему графику, а не по графику алиаса.
Саму тарифную страницу стоит внимательно изучить, прежде чем останавливаться на какой-то цифре. На странице моделей xAI явно перечислены тарифы по версиям — grok-voice-think-fast-2.0 по $0,08 за минуту аудио, $4,80 в час, плюс $0,004 за текстовый ввод, — тогда как отдельная карточка Voice API на той же странице рекламирует цену для агента «от $0,05 в минуту», что является стартовой ценой, а не тарифом, по которому выставляются счета для модели 2.0. Если ваше планирование мощностей опиралось на маркетинговую цифру, оно примерно на 60% занижено.
У модели OpenAI нет этой проблемы в том же виде, потому что здесь нет ничего, на что можно было бы переключиться. У GPT-Live-1 есть ровно один идентификатор модели, gpt-live-1, который также является её собственным снимком по умолчанию — нет датированных вариантов, которые можно было бы закрепить, и, следовательно, нет алиаса, способного незаметно изменить либо модель, либо цену. Обратная сторона в том, что вы также не можете заморозить проверенное поведение и пользоваться им, пока новое приживается.
Обе модели тарифицируют слой рассуждений отдельно от голосового слоя, и именно здесь заявленная ставка перестаёт быть полной стоимостью. Делегированные вызовы Responses у GPT-Live-1 тарифицируются по обычным ставкам за токен настроенной бэкенд-модели. xAI добавляет $0.004 за каждый текстовый ввод в голосовой сессии, плюс вызовы инструментов, выделенный телефонный номер примерно за $0.01 в минуту, если он нужен, телефонию и хранение — сверх поминутной ставки за аудио. Голосовой агент, который в основном слушает и изредка что-то ищет, будет близок к своей заявленной ставке; тот, что обращается к инструментам на каждом ходу, — нет, и расхождение у них будет не в одну и ту же сторону, потому что архитектура с делегированием на бэкенд и архитектура с инструментами внутри сессии сжигают токены в разных местах.
С нашей стороны причина, по которой изменения поминутных тарифов стоит внимательно отслеживать, заключается в том, что OrcaRouter передаёт прайс-листовую цену провайдера без наценки. Когда поставщик меняет опубликованный тариф, цифра на нашей стороне меняется в тот же день, а не в следующем контрактном цикле.

Во что вам обходится разделение делегирования в инженерном плане
Если вы выбираете между этими двумя по архитектуре, а не по цене, решающий вопрос — где пролегает шов.
Модель xAI держит инструменты внутри сессии. Это проще для понимания — одно соединение, один разговор, одно место, где происходит вызов функции — и это значит, что модель может посреди предложения решить, что ей нужно выполнить поиск, и продолжать говорить, пока ждёт.
Модель OpenAI выносит эту работу наружу. Голосовой слой поддерживает разговор и передаёт задачу отдельной модели рассуждений через Responses API, а значит, ваши определения инструментов, поиск и бизнес-логика находятся в обычной интеграции с текстовой моделью, а не внутри потока событий сеанса. Здесь больше движущихся частей, но и выше переносимость: делегированная половина — это обычный вызов API, который можно независимо от голосового слоя заменить, оценить по стоимости и переключить при сбое.
Это важно ровно по одной причине. Ни GPT-Live-1, ни Grok Voice Think Fast 2.0 не обслуживаются никем, кроме собственного вендора, — оба поставляются из единственного источника, и роутер не поможет вам с аудио-частью. Что роутер может сделать — так это консолидировать ту половину, которую вы действительно можете выбрать. GPT-5.6 Terra, бэкенд в собственном примере делегирования OpenAI, доступен через OrcaRouter по цене $2,00 за миллион входных токенов и $12,00 за миллион выходных с доступными как /v1/chat/completions, так и /v1/responses, наряду с примерно 190 другими моделями по одному ключу. Если ваш голосовой агент вызывает модель рассуждений на каждом ходу, это именно та статья расходов, в которой есть рычаг маршрутизации.
Вердикт с разбивкой по рабочей нагрузке
• Выбирайте GPT-Live-1, если ограничение — цена за минуту, если ваш путь вызова уже использует WebRTC или если вы хотите, чтобы рассуждающий мозг за голосом был заменяемой текстовой моделью, а не фиксированной частью сессии.
• Выберите Grok Voice Think Fast 2.0, если вам нужно, чтобы независимо подтверждённое качество было доступно до того, как вы примете решение, если ваш стек телефонии является WebSocket-нативным или если инструменты в рамках сессии — в частности поиск в X — играют в продукте ключевую роль, а не второстепенную.
• Следите за алиасом, если вы уже используете xAI. Закрепление версионированного ID модели — единственное, что отделяет вас от следующего автоматического изменения тарифа, и ту же дисциплину стоит применять везде, где встречается плавающий алиас.
Неудобный вывод состоит в том, что более дешёвая модель — это та, за которой нет сторонних подтверждений, а лучше документированная модель — та, которая только что подорожала на 60%. Если вы находитесь на достаточно раннем этапе разработки, когда ни одна из интеграций ещё не зафиксирована, наименее рискованный ход — сделать прототипы на обеих — аудиотракт в любом случае занимает несколько сотен строк — и позволить качеству вашей собственной транскрипции решить, потому что публичные данные на данный момент не позволяют сделать окончательный вывод.
