
Gemini 3.8 Live Extended Thinking против GPT-Live-1: ничья с разницей в 1,1 пункта и два разных счёта
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
По совокупному баллу это ничья. Gemini 3.8 Live Extended Thinking находится на уровне 82,6 в Speech to Speech Index от Artificial Analysis; GPT-Live-1, с его бэкендом Astra при среднем уровне рассуждений, находится на уровне 81,5. Что касается агентного компонента в основе — выполнения задач τ-Voice — разрыв составляет 0,7 балла: 68,6% против 67,9%. Что касается компонента рассуждений, разрыв шире и идёт в другую сторону: 97,7% на Big Bench Audio у модели Gemini, 90,1% у GPT-Live-1. Ничто из этого разброса не сохранится при повторном запуске бенчмарка, и ничто из этого не должно быть основанием для вашего решения.
То, что разделяет эти два продукта, — не качество. Дело в том, что они расходятся в понимании того, что такое голосовой агент, кто выполняет мышление и — а это первым бьёт по бюджетной статье — как тарифицируется сессия. Gemini 3.8 Live Extended Thinking берёт плату за аудиотокены и рассуждает в той же модели, которая говорит. GPT-Live-1 берёт фиксированную ставку за время сессии, независимо от того, говорит ли кто-нибудь, и передаёт собственно мышление отдельной текстовой модели, которую вы выбираете и оплачиваете отдельно. Это два разных продукта с одинаковым показателем в бенчмарке, и какой из них подойдёт, зависит от вопроса, который таблица лидеров никогда не задаёт: как выглядит средний звонок на вашей линии?
Равенство в 1,1 пункта — и где оно на самом деле нарушается
Начните с цифр, ведь вся суть в скудости заголовка:
• Индекс Speech to Speech — Gemini 3.8 Live Extended Thinking (высокий) 82,6 против GPT-Live-1 (бэкенд Astra, средние усилия) 81,5
• Агентная производительность (выполнение задач τ-Voice) — 68,6% против 67,9%, при этом GPT-Live-1 показывает 59,3%, когда работает на бэкенде Sol с низким уровнем усилий
• Речевое рассуждение (Big Bench Audio) — 97,7% против 90,1%, единственный компонент, где разрыв не случаен
• Сложные банковские рабочие процессы (Sierra τ³-Banking, по данным поставщика) — 35,1 % против 32,0 %
• Время до первого аудио — 1,35 с против 1,24–1,34 с через API
• Измеренная стоимость в час — $3,50 против $5,83 для конфигурации Astra, оба по данным измерения входного аудио Artificial Analysis
Честная интерпретация такова: две модели неразличимы по совокупному показателю, различимы в речевом рассуждении, где модель Gemini лидирует почти на восемь пунктов, и различимы по стоимости, где она лидирует примерно на 40%. Где GPT-Live-1 вырывается вперёд — так это в тех частях опыта, которые бенчмарку трудно оценить: он действительно полнодуплексный, слушает, пока говорит, издаёт поддакивания, несколько раз в секунду решая, говорить или уступить. Gemini 3.8 Live Extended Thinking основан на чередовании реплик. Он решает ту же основную проблему — абонент остаётся в тишине, пока агент работает — вместо этого комментируя, рассуждая и говоря одновременно с такими репликами, как «Дайте-ка проверю…», пока выполняется задача.
Оба подхода поддерживают линию живой. Они ощущаются по-разному. Только один из них появляется в индексе.

Две модели биллинга, и почему тарифная карта вводит в заблуждение
Это раздел, который решает судьбу большинства развёртываний, и именно его пропускает покрытие.
Gemini 3.8 Live Extended Thinking тарифицируется так же, как токенная модель. Через Live API опубликованные тарифы составляют $3.00 за миллион входных аудиотокенов — примерно $0.005 за минуту аудиовхода — и $12.00 за миллион выходных аудиотокенов, примерно $0.018 за минуту, при этом токены размышления учитываются в этом выходном объёме. Вы платите за передаваемое аудио. Абонент, который делает паузу, размышляет или оказывается в режиме ожидания, пока молчит, не стоит вам ничего.
GPT-Live-1 тарифицируется так же, как тарифицируется телефонная линия. Это фиксированные $0,05 за минуту времени сессии, с оплатой посекундно, независимо от того, кто говорит или говорит ли вообще кто-либо. Бэкенд рассуждений не включён: текстовая модель, выполняющая мышление, и любые вызываемые ею инструменты тарифицируются отдельно сверху. Именно так заявленная цена $0,05 превращается в итоговую цифру примерно $4,47 в час на бэкенде Sol и $5,83 в час на Astra medium по измерениям Artificial Analysis.
Поставьте их рядом, и наивное сравнение — $0.018 против $0.05 в минуту, разрыв в 2.8× — неверно в обе стороны. Измеренные почасовые показатели дают реальный разрыв $3.50 против $5.83, ближе к 1.7×. Но модель с сессионным таймером также меняет форму вашего счёта, а не только его уровень: на GPT-Live-1 ваша стоимость отслеживает длительность звонка, поэтому линия с длинными, тихими, малосодержательными звонками — очередь поддержки, этап верификации, передача в IVR — платит столько же, сколько и линия с плотными звонками. На стороне Gemini стоимость привязана к аудио, поэтому тишина бесплатна, а многословность — нет. Прогоните арифметику на вашей собственной средней длительности звонка, прежде чем прогонять её на поминутной ставке, потому что именно это число решает, какой из этих вариантов дешевле для вас, и ответ не одинаков для линии бронирования и линии триажа.
Где происходит мышление
Второе структурное различие — это делегирование, и именно оно определяет, какую часть этого стека вы действительно можете заменить.
GPT-Live-1 — это фронтенд. Он обрабатывает дуплексное аудио, и когда запрос требует настоящего рассуждения, он передаёт работу отдельной бэкенд-модели — GPT-5.5 и GPT-6 Astra обе задокументированы как бэкенды — с селекторами усилий рассуждения, которые позволяют выбрать, какую часть этого бэкенда вы хотите купить. Именно поэтому в таблице GPT-Live-1 указан дважды с разными оценками: 81.5 на Astra при среднем усилии, 80.1 на Sol при низком. Этот разрыв в 1.4 пункта между двумя его собственными конфигурациями больше, чем разрыв в 1.1 пункта между двумя моделями в этом противостоянии, что говорит о том, что на стороне OpenAI выбранная вами конфигурация важнее, чем выбранный вами поставщик.
Gemini 3.8 Live Extended Thinkingрассуждает в той же модели, которая говорит. Нет отдельного бэкенда, который нужно выбирать, и нет отдельного счёта за него; компромисс в том, что глубина настраивается уровнями мышления — низким, средним и высоким — на одной и той же модели, а показатели 82,6 и 68,6 — это (High) конфигурация. Выполнение фоновых инструментов и запросов к API идёт асинхронно с обеих сторон, поэтому ни одна из моделей не зависает во время работы.
Одно практическое следствие: поскольку интеллект GPT-Live-1 — это приобретённая текстовая модель за голосовым интерфейсом, его потолок качества сдвигается, когда OpenAI выпускает текстовую модель, а не когда она выпускает голосовую модель. Потолок Gemini 3.8 Live Extended Thinking сдвигается, когда Google переобучает аудиомодель. Если вы делаете двухлетнюю ставку на голосовую платформу, эта разница в частоте обновлений заслуживает большего осмысления, чем 1,1 пункта индекса.
Каковы издержки переключения, каким бы путём вы ни пошли
Ни то, ни другое не является простой заменой ID модели, и команды, которые относятся к этому именно так, узнают об этом уже в продакшене. Переход на Gemini 3.8 Live Extended Thinking означает принятие другого контракта хода: вызовы функций всегда асинхронны, поэтому блокирующее объявление инструмента возвращает жёсткую ошибку, а не встаёт в очередь, и клиентам приходится читать interaction_status — поле, которое принимает значение IN_PROGRESS, пока идёт рассуждение или всё ещё выполняется инструмент, и IDLE — только когда вся задача завершена целиком — вместо того чтобы полагаться на turnComplete как на признак того, что работа выполнена. Переход на GPT-Live-1 означает принятие его инфраструктуры выбора бэкенда и второго биллингового контура, а также жизнь с API, который стал общедоступным для разработчиков лишь 10 сентября 2026 года, после дебюта в ChatGPT 8 июля — так что сторонние инструменты, SDK и средства наблюдаемости вокруг него насчитывают месяцы, а не годы. В какую бы сторону вы ни двигались, закладывайте работу по интеграции в бюджет рядом со счётом за токены. На зрелом голосовом стеке рефакторинг обычно оказывается большей из двух статей расходов.
Как провести такое сравнение, не делая на это ставку
Разумный способ решить вопрос о разнице в 1,1 пункта — прогнать оба варианта на собственном трафике, и загвоздка в том, что обычно это означает две интеграции, два контракта и два набора учётных данных. Но это не обязательно должно означать две архитектуры. В обеих этих системах голосовой фронтенд — это тонкий слой поверх обычных вызовов текстовых моделей — для GPT-Live-1 это выражено явно, а на стороне Gemini выполнение фоновых инструментов устроено так же — и именно в этом текстовом слое живёт разброс ваших затрат и именно там переключение действительно дёшево.
OrcaRouter предоставляет доступ к 190 моделям по одному ключу по прайс-листовой цене провайдера без наценки, поэтому изменение цены у вышестоящего поставщика становится актуальным у нас в тот же день, а не при следующем продлении контракта. Для голосового стека важны два свойства: цель делегирования можно переключать на живом трафике, не затрагивая голосовую интеграцию, и автоматическое переключение при сбое сохраняет вызов активным, когда бэкенд выдаёт ошибку или превышает тайм-аут — именно это позволяет опробовать непроверенную конфигурацию на реальном трафике, не направляя через неё продакшн-линию. Если говорить точнее о том, что мы хостим, а что нет: ни эндпоинт Gemini 3.8 Live Extended Thinking, ни эндпоинт GPT-Live-1 не находятся на нашем роутере — они предоставляются собственными API Google и OpenAI. Текстовые модели, которым они делегируют, очень часто есть на нашем роутере, включая Gemini 3.8 Flash.
Верхняя часть доски и то, как мало она оседает.
Приведённый ниже снимок был сделан 16 сентября 2026 года:
• Gemini 3.8 Live Extended Thinking (High) — 82.6, первое место
• GPT-Live-1 (бэкенд Astra, среднее усилие) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (бэкенд Sol, низкие усилия) — 80.1
• Gemini 3.8 Live — 76,0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Три вещи, на которые стоит обратить внимание. Во-первых, первое и третье места разделяют 1,3 балла, а первое и пятое — 6,6, так что верх этой таблицы — это плотная схватка, а не ранжирование. Во-вторых, модель в заголовке этого сравнения — не Gemini-запись, стоящая на пятом месте: та — это стандартный Gemini 3.8 Live, другой и гораздо более дешёвый продукт, который не следует путать с reasoning-вариантом, сравниваемым здесь. В-третьих, есть прецедент отношения к любой отдельной цифре индекса как к предварительной: xAI сообщила 82,9 для Grok Voice Think Fast 2.0 в июле, а на этой таблице эта модель показывает 81,3. Индексные оценки, заявленные производителем, не всегда выдерживают соприкосновение с живой таблицей лидеров. Числа τ-Voice 68,6% и 67,9% теперь находятся на публичной таблице, работающей на собственном тестовом стенде Artificial Analysis, так что они подтверждены, а не просто заявлены — но разница в 0,7 пункта между двумя моделями на одном и том же стенде — это не разница. Проверьте это на своём трафике или проигнорируйте.

Ещё одна цифра, которую стоит учесть при принятии решения, потому что это самое неуютное число в этом сравнении: Google сообщает о 35,1% для Gemini 3.8 Live Extended Thinking в таблице лидеров τ³-Banking от Sierra — против 32,0% у GPT-Live-1 Astra. Эти данные заявлены вендорами и не воспроизведены, и они описывают мир, в котором ведущий голосовой агент в этой таблице проваливает примерно две из каждых трёх попыток выполнения реалистичных банковских задач. Если вашему агенту приходится выполнять регулируемую многошаговую работу, ни одна из этих моделей не готова — и преимущество в 3,1 пункта в этом бенчмарке не является причиной выбирать вендора, это причина сохранить человека в контуре.

Итак: если естественность разговора — это продукт, а ваши звонки короткие и насыщенные, полнодуплексное поведение GPT-Live-1 — это реальное преимущество, которого индекс не видит, а тарификация по времени сессии при такой длительности звонка терпима. Если звонки длинные, тихие или переменной длительности либо если на первый план выходят рассуждения на основе речи и почасовая стоимость, Gemini 3.8 Live Extended Thinking опережает по значимым компонентам и при этом примерно на 40% дешевле в час — с оговоркой, что она работает по ходам, всё ещё находится в preview для корпоративных клиентов и требует рефакторинга клиента, прежде чем сможет запускать ваши инструменты. Но ничто из этого не оправдывает выбор одного из них на основании 1,1 пункта индекса. На основании имеющихся данных честная причина выбирать между этими двумя — это модель тарификации и лежащая в её основе архитектура, и то и другое можно измерить на собственном трафике уже на этой неделе.
В OrcaRouter автоматическое переключение при сбое сохраняет вызов, когда бэкенд выдаёт ошибку или превышает время ожидания.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
