Титульная карточка главного экрана для Gemini 3.8 Live Extended Thinking против Gemini 3.8 Live, показывающая две модели, разделённые 4-кратной разницей в почасовой стоимости аудио: $3.50 против $0.84.
Guides & Insights

Gemini 3.8 Live Extended Thinking против Gemini 3.8 Live: платить в 4 раза больше за те 38 пунктов, которые действительно важны

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две модели, один запуск, одна тарифная сетка — и решение, которое большинство обзоров ошибочно трактует в одну и ту же сторону. Gemini 3.8 Live Extended Thinking и Gemini 3.8 Live вышли одновременно 15 сентября 2026 года: обе построены на Gemini 3 Pro, обе работают с 97 языками с автоматическим переключением в середине разговора, обе принимают визуальный ввод почти в реальном времени, обе помечают сгенерированное аудио водяными знаками SynthID. В сводном индексе Speech to Speech Index, который публикует Artificial Analysis, их разделяют 6,6 балла — 82,6 против 76,0. А по часовой стоимости аудио, которую измеряет та же таблица, они различаются чуть более чем в четыре раза.

Ни одно из этих чисел не должно определять вашу архитектуру. Определять должно 38: разрыв между ними на τ-Voice — компоненте агентного выполнения задач, — где вариант с рассуждениями решает 68,6% воспроизведённых сценариев обслуживания клиентов, а стандартный вариант — 30,1%. Вы выбираете не между хорошей моделью и лучшей. Вы выбираете между разговорным интерфейсом и системой рассуждений, которая к тому же умеет говорить, и разница в цене — самое неинтересное в этом выборе.

Ценовая вилка — в тех единицах, в которых вам фактически выставляют счёт.

Начните со счёта, потому что именно эту часть люди понимают правильно, а затем придают ей слишком большой вес. Обе модели используют один и тот же опубликованный тариф через Live API: $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода, а на стороне Extended Thinking эти выходные токены включают размышления. Та же карточка, те же тарифы, без отдельного премиального уровня для рассуждений.

Расхождение проявляется, как только вы начинаете измерять работу, а не минуты. Колонка Artificial Analysis «стоимость часа входного аудио» — стоимость выполнения фиксированного подмножества Big Bench Audio из 40 вопросов, нормализованная к почасовому показателю, — относит две модели к совершенно разным категориям:

Gemini 3.8 Live Extended Thinking (High) — 3,50 $ в час за входящее аудио, по собственным измерениям Artificial Analysis

Gemini 3.8 Live — 0,84 доллара в час, самая низкая ставка оплаты на этой доске

• GPT-Live-1 (бэкенд Astra, средний уровень усилий) — $5,83 в час, так что вариант с рассуждениями всё ещё обходится примерно на 40% дешевле модели, которую превосходит

Grok Voice Think Fast 2.0 High — 4,80 $ в час

• GPT-Realtime-2.1 High — $10.75 в час

Вот в чём развилка: вчетверо больше почасовой стоимости аудио при том же опубликованном тарифе за минуту, потому что reasoning-вариант тратит больше токенов на тот же объём прослушивания. $0.84 у стандартной модели — это не скидка, это нижняя граница всей таблицы.

Что можно купить за 38 баллов

Разложите композит на составляющие — и две модели перестают выглядеть как пара:

Индекс преобразования речи в речь — Gemini 3.8 Live Extended Thinking (High) 82,6 против Gemini 3.8 Live 76,0

Агентная производительность (выполнение задач τ-Voice) — 68,6% против 30,1%

Речевое рассуждение (Big Bench Audio) — 98% против 92%

Динамика диалога — 91,9% против 96,1%

Предпочтение на арене (Elo) — 990 против 1083

Доля успешно выполненных задач — 89,1 % против 93,2 %

Время до первого звука — 1,35 с против 1,18 с

Стоимость за час входного аудио — $3,50 против $0,84

Прочитайте это честно, и более дешёвая модель выигрывает четыре из восьми строк. Она быстрее доходит до первого аудио, предпочитается ареной, чаще завершает поверхностную задачу и получает более высокую оценку за динамику разговора — причём последнее вовсе не утешительный приз, потому что именно динамику разговора замечает звонящий. Чего она не может — так это довести до конца работу, в которой есть шаги. Тридцать целых одна десятая процента против 68,6% — это самый большой единичный разрыв во всём этом релизе, и он приходится на ту единственную ось, которая отделяет агента от интерфейса.

Две оговорки по этим строкам. Показатель предпочтения на арене внутри индекса фиксируется на момент, когда модель допускается к публикации, поэтому это снимок, а не текущий Elo — воспринимайте его как рейтинг на определённый момент времени, а не как актуальный график Speech Agent Arena. А верхняя часть таблицы τ-Voice очень плотная: reasoning-вариант с 68,6 % опережает GPT-Live-1 с 67,9 % (бэкенд Astra, средний уровень усилий) на 0,7 пункта, при этом GPT-Live-1 (Sol, низкий уровень усилий) с 59,3 % и Grok Voice Think Fast 2.0 High с 56,5 % отстают. Преимущество в 0,7 пункта над GPT-Live-1 находится в пределах погрешности. А вот разрыв в 38 пунктов внутри этой пары — нет.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

Другие 4x: во что вам обходится уровень рассуждений в коде

В этом выпуске есть второй форк, и он не появляется ни в одном рейтинге. Эти две модели не являются взаимозаменяемыми без доработок, потому что вариант с рассуждениями меняет контракт, который должен соблюдать ваш клиент.

На стандартной модели Gemini 3.8 Live ведёт себя так, как ожидает клиент Live API: фоновые вызовы инструментов и API выполняются, пока модель продолжает говорить, а turnComplete: true по-прежнему обозначает конец хода. Здесь нет настройки уровня мышления, которую нужно выбирать, потому что отдельно настраивать нечего — модель отвечает, и когда она ответила, ход завершён.

В Gemini 3.8 Live Extended Thinking одновременно меняются три вещи:

Вызовы функций всегда асинхронны. Объявление блокирующего инструмента не встаёт вежливо в очередь — оно возвращает жёсткую ошибку. Любую схему инструмента, которую вы написали для стандартной модели, нужно переобъявить как неблокирующую.

Новое поле статуса содержит реальное состояние. Клиентам нужно читать interaction_status вместо того, чтобы доверять turnComplete: поле принимает значение IN_PROGRESS, пока модель всё ещё рассуждает или инструмент всё ещё выполняется, и переходит в IDLE только когда вся задача завершена. Ход может завершиться, хотя задача ещё не завершена.

Глубина мышления — это настраиваемый параметр.Модель предоставляет настраиваемые уровни рассуждений — низкий, средний и высокий, — а показатели 82,6 и 68,6 на табло — это (High)-конфигурация. Переключение на низкий уровень меняет и качество, и расход токенов, и ничто в индексе не говорит, во что обойдётся низкий уровень с точки зрения выполнения задачи.

Этот третий пункт — ловушка миграции. Поскольку Extended Thinking отвечает по сети так же, как стандартная модель, пока не задействован вызов инструмента, команда может заменить идентификатор модели, увидеть работающее демо и лишь в продакшене обнаружить асинхронный контракт, когда инструмент бронирования возвращает ошибку вместо результата. Заложите бюджет на рефакторинг клиента наряду с четырёхкратным тарифом на аудио; в зрелой интеграции это бо́льшая из двух затрат.

Какой из них на самом деле требует ваша рабочая нагрузка

Чистый способ решить — это спросить, для чего нужна сессия, а не насколько умной вы хотите её сделать.

Выбирайте Gemini 3.8 Live, когда результат — это сам разговор. Ответить, удержать нить беседы, принять сообщение, квалифицировать звонящего, быть приятной, быстрой и дешёвой. При $0,84 за час входного аудио это самая дешёвая из дееспособных голосовых моделей, которые кто-либо сейчас публикует; на арене её предпочитают, на поверхностных задачах она надёжнее, а до первого аудио она на 170 миллисекунд быстрее — эту разницу звонящий чувствует. Единственное, что нужно принять, — это потолок: 30,1% на выполнении многошаговых задач означают, что она не доведёт до конца работу, в которой есть шаги, и никакой промпт-инжиниринг это число не сдвинет.

Берите Gemini 3.8 Live Extended Thinking, когда у сессии есть задача. Бронирование, изменение, отмена, решение проблемы с аккаунтом, проведение звонящего через многошаговый процесс, пока он ждёт. Это та самая отметка в 38 баллов, и она стоит 3,50 доллара в час — что, заметьте, всё ещё дешевле обеих моделей, которые она обходит по композитному показателю. Вы также получаете поведение с озвучиванием, которое делает ожидание терпимым: эта модель рассуждает и говорит одновременно, поэтому вместо тишины, пока она что-то ищет, звонящий слышит «Сейчас проверю…» и сообщения о ходе работы. Это та же проблема, которую полнодуплексные архитектуры решают, никогда не останавливая аудио; ответ Google — продолжать говорить поверх работы.

Ещё две строки, которые стоит взвесить. Google также сообщает о 35,1% для модели Extended Thinking в таблице лидеров Sierra τ³-Banking против 32,0% у GPT-Live-1 Astra — это заявленный вендором показатель, не подкреплённый независимым измерением, и отрезвляющий в абсолютных значениях, поскольку 35,1% означают, что лучшая модель в этой таблице проваливает примерно две из каждых трёх попыток выполнения реалистичных банковских задач. А второе место стандартной модели в Speech Agent Arena, на которое Google ссылается в своих материалах, — это реальный результат в другой таблице, измеряющей предпочтения, а не выполнение задач. Оба утверждения справедливы. Вместе они говорят о том, что дешёвая модель очень хороша в роли собеседника, а дорогая — единственная из двух, которой можно поручать работу.

Запуск обоих, без двух интеграций

Практическое возражение против всего этого состоит в том, что выбор под каждую рабочую нагрузку означает поддержку двух путей. Это не обязательно. Оба варианта стоят перед одним и тем же классом бэкенда — фоновая работа инструментов и многошаговое планирование сводятся к обычным вызовам текстовых моделей, — и именно на этом слое живёт разброс ваших затрат и именно там переключение обходится дёшево.

OrcaRouter предоставляет 190 моделей из одного ключа по прайс-листовой цене провайдера без наценки, поэтому изменение цены поставщиком становится актуальным у нас в тот же день, а не при следующем продлении договора. Для стека, который маршрутизирует между дешёвым разговорным уровнем и дорогим уровнем рассуждений, важны два свойства: цель делегирования можно переключать на живом трафике, не затрагивая голосовую интеграцию, и автоматическое переключение при сбое поддерживает сессию активной, когда бэкенд выдаёт ошибку или истекает тайм-аут. Чтобы быть точными в том, что мы хостим, а что нет: эндпоинты Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking отсутствуют на нашем роутере — они идут из собственного API Google — в Gemini API, Live API и Google AI Studio. Текстовые модели, которым эти агенты очень часто передают свою работу, — среди них Gemini 3.8 Flash.

Где каждая модель находится на доске

Приведённый ниже снимок был сделан 16 сентября 2026 года, и верхняя часть Speech to Speech Index читается следующим образом:

Gemini 3.8 Live Extended Thinking (High) — 82.6, первое место

• GPT-Live-1 (бэкенд Astra, среднее усилие) — 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (бэкенд Sol, низкие усилия) — 80.1

Gemini 3.8 Live — 76.0, пятое место

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Одно замечание по названию, пока вы читаете этот список: (High) — это суффикс, прикреплённый к этой модели в материалах освещения, обозначающий конфигурацию уровня усилий рассуждения, а не отдельный релиз. Это то же соглашение, которое совет использует для Grok Voice Think Fast 2.0 High и GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Что ещё не закоммичено

Об одном в этой паре легко ошибиться при чтении, поэтому стоит сказать прямо: ни одна из моделей не является общедоступной в контрактном смысле, хотя для обеих указана цена и есть документация.

Разработчики получают Gemini 3.8 Live в Gemini API, Live API и Google AI Studio под ID gemini-3.8-live; предприятия получают закрытое превью в Gemini Enterprise, а Gemini Enterprise for Customer Experience указан как «скоро»; потребители получают его в Search Live. Gemini 3.8 Live Extended Thinking имеет тот же набор возможностей для разработчиков под gemini-3.8-live-extended-thinking, а также более широкий доступ для потребителей — Gemini Live, Docs Live для подписчиков Google AI Pro и Ultra, а также Gmail Live и Keep Live для всех подписчиков Google AI. Для бизнес-клиентов Workspace указано «скоро».

Чего не хватает — это того, что нужно предприятию, прежде чем закладывать это в статью доходов: обязательства по переходу в общую доступность, опубликованного показателя времени безотказной работы и тарифа, который Google обещал сохранить. Цены опубликованы, а цены на предварительные версии имеют свойство меняться. Создайте прототип сейчас, планируйте миграцию и не подписывайтесь на целевой показатель доступности, которого вам не предоставили.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Решение, которое на самом деле предлагает эта пара, уже, чем кажется по индексу, и это не лестница качества. Если задача вашего агента — разговаривать, дешёвая модель не компромисс: это лучший продукт по более низкой цене, а ставка в четыре раза ниже — бонус, а не аргумент. Если задача вашего агента — что-то завершить, вариант с рассуждениями — единственный из этих двух, которому вообще можно поручить задачу, и $3,50 в час — это ошибка округления по сравнению с бронью, которая иначе сорвётся. Ошибка, которой нужно избегать, — искать компромисс: платить за глубину рассуждений для рабочей нагрузки, которой всегда было достаточно хорошего разговора; именно это происходит, когда команда видит сводный разрыв в 6,6 пункта и не прокручивает вниз до 38,0.