Главная титульная карточка с надписью «GPT-Live-1 vs Grok Voice Think Fast 2.0», подзаголовком «Два голосовых API, движущихся в противоположных ценовых направлениях», и строкой «$0.05 в минуту против $0.08 в минуту», над двумя панелями: слева — ценник со стрелкой вниз и подписью «$0.05», справа — ценник со стрелкой вверх и подписью «$0.08» и подпись «+60%», каждая с полосой визуализации звуковой волны полнодуплексного аудио, а в углу наложен логотип OrcaRouter.
Guides & Insights

GPT-Live-1 против Grok Voice Think Fast 2.0: два голосовых API, цены которых движутся в противоположных направлениях

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый полезный факт об этом противостоянии — это направление, а не число. Когда xAI выпустила Grok Voice Think Fast 2.0 в конце июля 2026 года, она повысила поминутную ставку за аудио на 60% — с $0.05, которые взимала Think Fast 1.0, до $0.08. Шесть недель спустя, 10 сентября 2026 года, OpenAI добавила GPT-Live-1 в API для разработчиков ровно по той цене, от которой xAI только что отказалась. Это создаёт редкую ситуацию, когда два ведущих полнодуплексных голосовых API можно напрямую сравнить по цене и когда более новый участник оказывается дешевле, — тогда как более старая и более дорогая модель — это та, за которой стоят результаты сторонних бенчмарков.

Реестр, до любых бенчмарков.

Обе эти модели — модели «речь-в-речь», созданные для нагрузок телефонного формата: живой разговор с клиентом, перебивание, вызов инструмента и счёт, измеряемый в минутах. За этими пределами они быстро расходятся.

• Цена за минуту аудио — GPT-Live-1 $0,05 против Gr​ok Voice Think Fast 2.0 $0,08

• Единица тарификации — GPT-Live-1 тарифицируется посекундно, без округления до следующей полной минуты; Gr​ok Voice Think Fast 2.0 тарифицируется поминутно за аудио и составляет примерно $4,80 в час

• Релиз — GPT-Live-1 вышел в составе ChatGPT 8 июля 2026 года и стал доступен в API 10 сентября 2026 года; Grok Voice Think Fast 2.0 был анонсирован около 29–30 июля 2026 года, примерно через три месяца после Think Fast 1.0

• Эндпоинты — GPT-Live-1 поддерживает только Live Sessions, по адресу v1/live/sessions, через WebRTC; Gr​ok Voice Think Fast 2.0 работает на Speech-to-Speech API от x​AI как через WebSocket, так и через WebRTC

• Набор инструментов — GPT-Live-1 делегирует задачи бэкенд-модели рассуждений через Responses API; Gro​k Voice Think Fast 2.0 имеет доступ к веб-поиску, поиску по X, поиску по файлам, MCP-серверам и клиентским функциям внутри сессии

• Переносимость голоса — GPT-Live-1 использует ремастированный набор из двенадцати голосов OpenAI; Grok Voice Think Fast 2.0 поддерживает встроенные и пользовательские голоса

Направление WebSocket меньше, чем кажется, и значит больше, чем должно. Значительная часть инфраструктуры телефонии — медиапотоковая обвязка внутри большинства продуктов CPaaS — говорит на WebSocket, а не на WebRTC. Gr​ok Voice Think Fast 2.0 встречает эту инфраструктуру там, где она есть; GPT-Live-1 — нет, и переход к WebRTC с пути вызовов, работающего только через WebSocket, — это настоящая инженерная задача, а не флаг конфигурации.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

Асимметрия бенчмарка — вот в чём настоящая суть.

Вот здесь сравнение перестаёт быть ничейным, и именно здесь большинство обзоров переворачивают всё с ног на голову, трактуя оба набора чисел как доказательства одного и того же рода.

Основные показатели Gr​ok Voice Think Fast 2.0 взяты из индекса Speech-to-Speech Quality Index от Artificial Analysis, стороннего измерения, которое оценивает модель в 82,9%, что выше 75,7% в версии 1.0, опережая GPT-Realtime-2.1 с 79,1% и Gemini 3.1 Flash с 69,5%. x​AI также сообщает о первом месте в τ-voice Bench за агентное поведение с 56,5%, опережая GPT-Realtime-2.1 с 45,7%. Это внешние измерения модели x​AI.

Основные показатели GPT-Live-1 — это собственные показатели Ope​nAI. Компания сообщает о полнодуплексной интерактивности на уровне 80,1% против 45,4% у GPT-Realtime-2.1, о сокращении задержки при передаче хода с 1,4 секунды до 0,8 и о повышении точности вызова инструментов с 60% до 87%. Каждая из этих цифр сообщена производителем, не воспроизведена независимой лабораторией и сравнивает новую модель Ope​nAI с предыдущей собственной моделью Ope​nAI, а не с конкурентом.

Это не повод отмахиваться от цифр — вектор движения согласуется с отзывами первых внедренцев, — но это означает, что единственное доступное сейчас сравнение между вендорами отдаёт предпочтение модели xAI по результатам независимо проведённых тестов, тогда как единственная доступная цифра о преимуществе OpenAI в задержке — это цифра самой OpenAI. Не воспринимайте 0,8 секунды и 0,70 секунды как настоящее состязание; только одну из этих двух цифр измерил кто-то, кто не заинтересован в результате.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Ловушка с псевдонимами, и почему рост цен застал людей врасплох

60%-ное повышение в большинстве примечаний к выпуску было бы погрешностью округления, если бы xAI не провела его ещё и через алиас. Приложения, указывавшие на алиас grok-voice-latest, автоматически унаследовали как новую модель, так и более высокий тариф 5 августа 2026 года, если только они явно не закрепили grok-voice-think-fast-1.0. Это проектное решение, которое стоит понять, а не жалоба: плавающие алиасы дают вам бесплатные обновления, а ещё они меняют вашу юнит-экономику, не спрашивая.

Очевидное средство слабее, чем кажется. Gr​ok Voice Think Fast 1.0 — модель за $0,05 в минуту, выпущенная 23 апреля 2026 года, — теперь помечена как устаревшая в собственном списке моделей x​AI. Закрепление этой модели защищает вас от автоматического обновления и выигрывает время, а не даёт постоянный более дешёвый путь, потому что у устаревшей модели где-то впереди есть дата вывода из эксплуатации. Планируйте миграцию по своему графику, а не по графику алиаса.

Саму тарифную страницу стоит внимательно изучить, прежде чем останавливаться на какой-то цифре. На странице моделей x​AI явно перечислены тарифы по версиям — grok-voice-think-fast-2.0 по $0,08 за минуту аудио, $4,80 в час, плюс $0,004 за текстовый ввод, — тогда как отдельная карточка Voice API на той же странице рекламирует цену для агента «от $0,05 в минуту», что является стартовой ценой, а не тарифом, по которому выставляются счета для модели 2.0. Если ваше планирование мощностей опиралось на маркетинговую цифру, оно примерно на 60% занижено.

У модели Ope​nAI нет этой проблемы в том же виде, потому что здесь нет ничего, на что можно было бы переключиться. У GPT-Live-1 есть ровно один идентификатор модели, gpt-live-1, который также является её собственным снимком по умолчанию — нет датированных вариантов, которые можно было бы закрепить, и, следовательно, нет алиаса, способного незаметно изменить либо модель, либо цену. Обратная сторона в том, что вы также не можете заморозить проверенное поведение и пользоваться им, пока новое приживается.

Обе модели тарифицируют слой рассуждений отдельно от голосового слоя, и именно здесь заявленная ставка перестаёт быть полной стоимостью. Делегированные вызовы Responses у GPT-Live-1 тарифицируются по обычным ставкам за токен настроенной бэкенд-модели. x​AI добавляет $0.004 за каждый текстовый ввод в голосовой сессии, плюс вызовы инструментов, выделенный телефонный номер примерно за $0.01 в минуту, если он нужен, телефонию и хранение — сверх поминутной ставки за аудио. Голосовой агент, который в основном слушает и изредка что-то ищет, будет близок к своей заявленной ставке; тот, что обращается к инструментам на каждом ходу, — нет, и расхождение у них будет не в одну и ту же сторону, потому что архитектура с делегированием на бэкенд и архитектура с инструментами внутри сессии сжигают токены в разных местах.

С нашей стороны причина, по которой изменения поминутных тарифов стоит внимательно отслеживать, заключается в том, что OrcaRouter передаёт прайс-листовую цену провайдера без наценки. Когда поставщик меняет опубликованный тариф, цифра на нашей стороне меняется в тот же день, а не в следующем контрактном цикле.

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

Во что вам обходится разделение делегирования в инженерном плане

Если вы выбираете между этими двумя по архитектуре, а не по цене, решающий вопрос — где пролегает шов.

Модель xAI держит инструменты внутри сессии. Это проще для понимания — одно соединение, один разговор, одно место, где происходит вызов функции — и это значит, что модель может посреди предложения решить, что ей нужно выполнить поиск, и продолжать говорить, пока ждёт.

Модель OpenAI выносит эту работу наружу. Голосовой слой поддерживает разговор и передаёт задачу отдельной модели рассуждений через Responses API, а значит, ваши определения инструментов, поиск и бизнес-логика находятся в обычной интеграции с текстовой моделью, а не внутри потока событий сеанса. Здесь больше движущихся частей, но и выше переносимость: делегированная половина — это обычный вызов API, который можно независимо от голосового слоя заменить, оценить по стоимости и переключить при сбое.

Это важно ровно по одной причине. Ни GPT-Live-1, ни Gr​ok Voice Think Fast 2.0 не обслуживаются никем, кроме собственного вендора, — оба поставляются из единственного источника, и роутер не поможет вам с аудио-частью. Что роутер может сделать — так это консолидировать ту половину, которую вы действительно можете выбрать. GPT-5.6 Terra, бэкенд в собственном примере делегирования Ope​nAI, доступен через OrcaRouter по цене $2,00 за миллион входных токенов и $12,00 за миллион выходных с доступными как /v1/chat/completions, так и /v1/responses, наряду с примерно 190 другими моделями по одному ключу. Если ваш голосовой агент вызывает модель рассуждений на каждом ходу, это именно та статья расходов, в которой есть рычаг маршрутизации.

Вердикт с разбивкой по рабочей нагрузке

• Выбирайте GPT-Live-1, если ограничение — цена за минуту, если ваш путь вызова уже использует WebRTC или если вы хотите, чтобы рассуждающий мозг за голосом был заменяемой текстовой моделью, а не фиксированной частью сессии.

• Выберите Grok Voice Think Fast 2.0, если вам нужно, чтобы независимо подтверждённое качество было доступно до того, как вы примете решение, если ваш стек телефонии является WebSocket-нативным или если инструменты в рамках сессии — в частности поиск в X — играют в продукте ключевую роль, а не второстепенную.

• Следите за алиасом, если вы уже используете x​AI. Закрепление версионированного ID модели — единственное, что отделяет вас от следующего автоматического изменения тарифа, и ту же дисциплину стоит применять везде, где встречается плавающий алиас.

Неудобный вывод состоит в том, что более дешёвая модель — это та, за которой нет сторонних подтверждений, а лучше документированная модель — та, которая только что подорожала на 60%. Если вы находитесь на достаточно раннем этапе разработки, когда ни одна из интеграций ещё не зафиксирована, наименее рискованный ход — сделать прототипы на обеих — аудиотракт в любом случае занимает несколько сотен строк — и позволить качеству вашей собственной транскрипции решить, потому что публичные данные на данный момент не позволяют сделать окончательный вывод.