
Gemini 3.8 Live против GPT-Live-1: полный дуплекс против модели, которая думает, пока говорит
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Около двух месяцев спор решался архитектурой. GPT-Live-1 — это по-настоящему полнодуплексная модель: она слушает, пока говорит, издаёт поддакивания вроде «мхм» и «понятно» и несколько раз в секунду решает, продолжать говорить или уступить. Gemini 3.8 Live, анонсированная 15 сентября 2026 года, — модель с поочерёдными репликами. В старой системе координат это делало сравнение простым, но теперь такой взгляд неверен.
Изменилось не то, что Google сравнялась по full-duplex. А то, что Google выпустила то, для компенсации чего использовался full-duplex: голосовую модель, способную поддерживать разговор, пока в фоне выполняется многошаговая задача, и второй вариант, который рассуждает вслух во время работы. Архитектурная разница реальна. Просто она больше не является осью, определяющей покупку.
Два способа поддерживать разговор
Ставка на полный дуплекс — это то, что качество разговора и есть продукт. GPT-Live-1 обрабатывает входной и выходной звук непрерывно и синхронно внутри одной модели, а не выстраивает цепочку «речь в текст» → языковая модель → «текст в речь». Это устраняет потерю информации между этапами и даёт то поведение, которое люди действительно замечают: можно перебить его на середине ответа — и он подстроится; он не принимает паузу или фоновый шум за конец вашей реплики; он молчит, пока к нему не обратятся.
Ставка Gemini 3.8 Live на режим с чередованием реплик заключается в том, что разговор — это строительные леса для работы. Его функции направлены на то, чтобы сеанс оставался продуктивным, а не на сохранение естественного ритма: обработка визуальных данных почти в реальном времени, автоматическое переключение между 97 поддерживаемыми языками прямо во время разговора и фоновое выполнение инструментов и API, которое подтверждает получение запроса и продолжает говорить, пока вызов завершается.
Обе модели отказываются сбросить ваш звонок, пока думают. Просто отказываются по-разному. GPT-Live-1 делает это, никогда не останавливая аудиопоток. Google делает это, говоря поверх работы.

Что на самом деле говорит индекс
Artificial Analysis поддерживает Speech to Speech Index — взвешенный сводный показатель, включающий речевое рассуждение, агентную производительность, предпочтения в арене и долю успешно выполненных задач. Внимательно изучите таблицу, зафиксированную 16 сентября 2026 года, потому что заголовок скрывает структуру:
• Gemini 3.8 Live Extended Thinking — 82.6 (первое место)
• GPT-Live-1 (бэкенд Astra, среднее усилие) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (бэкенд Sol, низкие усилия) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Из этой упорядоченности вытекают три вещи. Во-первых, у Google верхняя позиция, но занимает он её с дорогим вариантом, а не тем, который развернёт большинство людей. Во-вторых, GPT-Live-1 появляется дважды, потому что Artificial Analysis оценивает всю систему, а не голосовой фронтенд, — и разрыв в 1,4 балла между двумя его конфигурациями в семь раз больше, чем разрыв в 0,2 балла между первым и вторым местами. В-третьих, модель из названия этого противостояния, Gemini 3.8 Live, стоит на пятом месте, ниже обеих конфигураций GPT-Live-1.
Если сравнивать равное с равным — стандартный уровень со стандартным уровнем — GPT-Live-1 выигрывает это противостояние по композитному индексу, причём с большим отрывом. 82.6 принадлежит Gemini 3.8 Live Extended Thinking — это другой продукт, по другой цене и с другим развёртыванием.

Где GPT-Live-1 всё ещё впереди
Полный дуплекс — это не маркетинговое отличие, и разбивка по бенчмаркам показывает, где он превращается в реальное преимущество:
• Агентная производительность — GPT-Live-1 уверенно лидирует по τ-Voice с показателем 67,9% против 56,5% у Grok. Google не опубликовала сопоставимый показатель τ-Voice для Gemini 3.8 Live — есть только 68,6% для варианта Extended Thinking.
• Динамика разговора — полнодуплексное переключение реплик по-прежнему остаётся эталоном естественности, а модели с поочерёдными репликами исторически отставали по этому показателю.
• Глубина делегирования — GPT-Live-1 передаёт сложные запросы передовой текстовой модели, причём GPT-5.5 и GPT-6 Astra оба задокументированы как бэкенды, и предоставляет селекторы уровня вычислительных усилий для рассуждений.
• Поиск источников — голосовые расшифровки ChatGPT содержат ссылки на источники, что в целом редко встречается в голосовых взаимодействиях.
Контрдоводом служит то, что GPT-Live-1 отстаёт в чистом речевом рассуждении: 90,1% на Big Bench Audio против 97,2% у Grok. А его ключевой показатель задержки в 0,798 секунды на Full Duplex Bench — это другое измерение по сравнению с временем API до первого аудио, которое составляет 1,24–1,34 секунды.
Где Gemini 3.8 Live впереди
Преимущества Google не столько в разговоре, сколько в том, что может делать сессия:
• Зрение, на сегодняшний день — Gemini уже давно поддерживает ввод с камеры и демонстрацию экрана. GPT-Live-1 вышел без видео и демонстрации экрана; в OpenAI говорят, что они появятся, и в качестве временного решения указывают на более старый Advanced Voice Mode. Gemini 3.8 Live вдобавок добавляет обработку визуального ввода практически в реальном времени.
• Языковой охват — 97 поддерживаемых языков с автоматическим переключением прямо посреди разговора, тогда как на стороне OpenAI выбор гораздо уже.
• Стоимость — объявленный тариф составляет $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода. GPT-Live-1 тарифицируется по $0,05 за голосовую минуту только за фронтенд, а совокупная измеренная стоимость составляет примерно $4,47–$5,83 в час с учётом токенов бэкенда.
• Второй уровень, который рассуждает вслух — Gemini 3.8 Live Extended Thinking описывает ход работы с помощью фраз вроде «Дайте-ка проверю…», а это иной ответ на проблему тишины, чем полнодуплексный режим.
Сравнение затрат, которое имеет значение
Тарифы на входе выглядят как разгром — $0,018 против $0,05 за минуту, — а показатели за час ещё резче. На графике Artificial Analysis, отображающем стоимость часа входного аудио, Gemini 3.8 Live идёт по цене $1,50 в час против $4,14 у GPT-Realtime-2 High и $10,75 у GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 держится на уровне $4,80.
Подвох в том, что ни одна из этих цифр не отражает реальный счёт. $0,05 за минуту у GPT-Live-1 покрывают только голосовой фронтенд; серверная текстовая модель, которая выполняет собственно рассуждения, тарифицируется отдельно — именно так заявленные $0,05 превращаются в $4,47–$5,83 в час со всеми расходами. У Gemini 3.8 Live та же структурная схема — фоновое выполнение инструментов относится к работе текстовой модели — а Google не опубликовала, сколько это стоит.
Итак, честная интерпретация такова: Gemini 3.8 Live значительно дешевле на входе, а сравнение с учётом всех затрат неизвестно для обоих, пока вы не измерите собственную рабочую нагрузку. Это не уловка; таково фактическое положение дел с информацией.
Слой, которому делегируют оба из них
Вот структурный факт, который делает это противостояние менее похожим на решение о привязке, чем кажется. Обе модели делегируют. GPT-Live-1 по замыслу передаёт сложные запросы бэкендной текстовой модели, а выполнение инструментов в фоновом режиме на стороне Gemini сводится к обычным вызовам модели. В обоих случаях голосовой фронтенд — это тонкий слой над текстовой моделью, которая выполняет рассуждения, — и именно в этом текстовом слое живёт вариативность ваших затрат и где переключение обходится дёшево.
OrcaRouter предоставляет 190 моделей через один ключ по прайс-листовой цене провайдера без наценки, поэтому снижение цены у вышестоящего поставщика отражается на нашей стороне в тот же день, а не при следующем продлении контракта. Для голосового стека важны два свойства: цель делегирования можно переключать на живом трафике, не затрагивая голосовую интеграцию, и автоматическое переключение при сбое сохраняет вызов активным при ошибке или тайм-ауте бэкенда. Одно уточнение, поскольку легко невольно подразумевать обратное: мы не хостим голосовые эндпоинты Gemini 3.8 Live или GPT-Live-1 — они идут из собственных API вендоров. Текстовые модели, которым они обычно передают работу, как правило, находятся на роутере.

Как выбрать
Выбирайте GPT-Live-1, если качество разговора — это и есть продукт: естественная обработка перебиваний, поддакивания и ощущение, что вы разговариваете с чем-то, а не управляете им, — и если вы можете потянуть полные совокупные затраты, которые существенно выше, чем можно предположить по заявленному тарифу. Учтите, что его API стал доступен только в сентябре 2026 года, поэтому сторонние инструменты вокруг него ещё молоды.
Выбирайте Gemini 3.8 Live, если компьютерное зрение нужно вам уже сейчас, если вам требуется больше двух десятков языков или если экономика в расчёте на минуту определяет вашу модель. Примите тот факт, что вы покупаете стандартный уровень, который занимает пятое место в составном индексе, а не первое, и что 82,6, которые все будут цитировать, относятся к варианту Extended Thinking.
Выбирайте Gemini 3.8 Live Extended Thinking, если главное — рассуждения и вам нужен текущий лидер индекса, но сначала проверьте его внедрение, потому что путь распространения через Gemini Live, Docs, Gmail и Keep шире, чем у стандартной модели, а доступность для предприятий всё ещё находится в закрытом предварительном просмотре.
За следующим кварталом стоит следить за тем, останется ли полнодуплексный режим защитным рвом. Модели с поочерёдной передачей слова сокращают разрыв в разговорных возможностях другим путём — занимая аудиоканал повествованием, пока выполняется работа, — и если это выдержит реальную нагрузку, архитектурное различие, которое определяло эту категорию целый год, перестанет быть тем, о чём спрашивают покупатели.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
