
Gemini 3.8 Live Extended Thinking против Gemini 3.8 Live: платить в 4 раза больше за те 38 пунктов, которые действительно важны
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Две модели, один запуск, одна тарифная сетка — и решение, которое большинство обзоров ошибочно трактует в одну и ту же сторону. Gemini 3.8 Live Extended Thinking и Gemini 3.8 Live вышли одновременно 15 сентября 2026 года: обе построены на Gemini 3 Pro, обе работают с 97 языками с автоматическим переключением в середине разговора, обе принимают визуальный ввод почти в реальном времени, обе помечают сгенерированное аудио водяными знаками SynthID. В сводном индексе Speech to Speech Index, который публикует Artificial Analysis, их разделяют 6,6 балла — 82,6 против 76,0. А по часовой стоимости аудио, которую измеряет та же таблица, они различаются чуть более чем в четыре раза.
Ни одно из этих чисел не должно определять вашу архитектуру. Определять должно 38: разрыв между ними на τ-Voice — компоненте агентного выполнения задач, — где вариант с рассуждениями решает 68,6% воспроизведённых сценариев обслуживания клиентов, а стандартный вариант — 30,1%. Вы выбираете не между хорошей моделью и лучшей. Вы выбираете между разговорным интерфейсом и системой рассуждений, которая к тому же умеет говорить, и разница в цене — самое неинтересное в этом выборе.
Ценовая вилка — в тех единицах, в которых вам фактически выставляют счёт.
Начните со счёта, потому что именно эту часть люди понимают правильно, а затем придают ей слишком большой вес. Обе модели используют один и тот же опубликованный тариф через Live API: $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода, а на стороне Extended Thinking эти выходные токены включают размышления. Та же карточка, те же тарифы, без отдельного премиального уровня для рассуждений.
Расхождение проявляется, как только вы начинаете измерять работу, а не минуты. Колонка Artificial Analysis «стоимость часа входного аудио» — стоимость выполнения фиксированного подмножества Big Bench Audio из 40 вопросов, нормализованная к почасовому показателю, — относит две модели к совершенно разным категориям:
• Gemini 3.8 Live Extended Thinking (High) — 3,50 $ в час за входящее аудио, по собственным измерениям Artificial Analysis
• Gemini 3.8 Live — 0,84 доллара в час, самая низкая ставка оплаты на этой доске
• GPT-Live-1 (бэкенд Astra, средний уровень усилий) — $5,83 в час, так что вариант с рассуждениями всё ещё обходится примерно на 40% дешевле модели, которую превосходит
• Grok Voice Think Fast 2.0 High — 4,80 $ в час
• GPT-Realtime-2.1 High — $10.75 в час
Вот в чём развилка: вчетверо больше почасовой стоимости аудио при том же опубликованном тарифе за минуту, потому что reasoning-вариант тратит больше токенов на тот же объём прослушивания. $0.84 у стандартной модели — это не скидка, это нижняя граница всей таблицы.
Что можно купить за 38 баллов
Разложите композит на составляющие — и две модели перестают выглядеть как пара:
• Индекс преобразования речи в речь — Gemini 3.8 Live Extended Thinking (High) 82,6 против Gemini 3.8 Live 76,0
• Агентная производительность (выполнение задач τ-Voice) — 68,6% против 30,1%
• Речевое рассуждение (Big Bench Audio) — 98% против 92%
• Динамика диалога — 91,9% против 96,1%
• Предпочтение на арене (Elo) — 990 против 1083
• Доля успешно выполненных задач — 89,1 % против 93,2 %
• Время до первого звука — 1,35 с против 1,18 с
• Стоимость за час входного аудио — $3,50 против $0,84
Прочитайте это честно, и более дешёвая модель выигрывает четыре из восьми строк. Она быстрее доходит до первого аудио, предпочитается ареной, чаще завершает поверхностную задачу и получает более высокую оценку за динамику разговора — причём последнее вовсе не утешительный приз, потому что именно динамику разговора замечает звонящий. Чего она не может — так это довести до конца работу, в которой есть шаги. Тридцать целых одна десятая процента против 68,6% — это самый большой единичный разрыв во всём этом релизе, и он приходится на ту единственную ось, которая отделяет агента от интерфейса.
Две оговорки по этим строкам. Показатель предпочтения на арене внутри индекса фиксируется на момент, когда модель допускается к публикации, поэтому это снимок, а не текущий Elo — воспринимайте его как рейтинг на определённый момент времени, а не как актуальный график Speech Agent Arena. А верхняя часть таблицы τ-Voice очень плотная: reasoning-вариант с 68,6 % опережает GPT-Live-1 с 67,9 % (бэкенд Astra, средний уровень усилий) на 0,7 пункта, при этом GPT-Live-1 (Sol, низкий уровень усилий) с 59,3 % и Grok Voice Think Fast 2.0 High с 56,5 % отстают. Преимущество в 0,7 пункта над GPT-Live-1 находится в пределах погрешности. А вот разрыв в 38 пунктов внутри этой пары — нет.

Другие 4x: во что вам обходится уровень рассуждений в коде
В этом выпуске есть второй форк, и он не появляется ни в одном рейтинге. Эти две модели не являются взаимозаменяемыми без доработок, потому что вариант с рассуждениями меняет контракт, который должен соблюдать ваш клиент.
На стандартной модели Gemini 3.8 Live ведёт себя так, как ожидает клиент Live API: фоновые вызовы инструментов и API выполняются, пока модель продолжает говорить, а turnComplete: true по-прежнему обозначает конец хода. Здесь нет настройки уровня мышления, которую нужно выбирать, потому что отдельно настраивать нечего — модель отвечает, и когда она ответила, ход завершён.
В Gemini 3.8 Live Extended Thinking одновременно меняются три вещи:
• Вызовы функций всегда асинхронны. Объявление блокирующего инструмента не встаёт вежливо в очередь — оно возвращает жёсткую ошибку. Любую схему инструмента, которую вы написали для стандартной модели, нужно переобъявить как неблокирующую.
• Новое поле статуса содержит реальное состояние. Клиентам нужно читать interaction_status вместо того, чтобы доверять turnComplete: поле принимает значение IN_PROGRESS, пока модель всё ещё рассуждает или инструмент всё ещё выполняется, и переходит в IDLE только когда вся задача завершена. Ход может завершиться, хотя задача ещё не завершена.
• Глубина мышления — это настраиваемый параметр.Модель предоставляет настраиваемые уровни рассуждений — низкий, средний и высокий, — а показатели 82,6 и 68,6 на табло — это (High)-конфигурация. Переключение на низкий уровень меняет и качество, и расход токенов, и ничто в индексе не говорит, во что обойдётся низкий уровень с точки зрения выполнения задачи.
Этот третий пункт — ловушка миграции. Поскольку Extended Thinking отвечает по сети так же, как стандартная модель, пока не задействован вызов инструмента, команда может заменить идентификатор модели, увидеть работающее демо и лишь в продакшене обнаружить асинхронный контракт, когда инструмент бронирования возвращает ошибку вместо результата. Заложите бюджет на рефакторинг клиента наряду с четырёхкратным тарифом на аудио; в зрелой интеграции это бо́льшая из двух затрат.
Какой из них на самом деле требует ваша рабочая нагрузка
Чистый способ решить — это спросить, для чего нужна сессия, а не насколько умной вы хотите её сделать.
Выбирайте Gemini 3.8 Live, когда результат — это сам разговор. Ответить, удержать нить беседы, принять сообщение, квалифицировать звонящего, быть приятной, быстрой и дешёвой. При $0,84 за час входного аудио это самая дешёвая из дееспособных голосовых моделей, которые кто-либо сейчас публикует; на арене её предпочитают, на поверхностных задачах она надёжнее, а до первого аудио она на 170 миллисекунд быстрее — эту разницу звонящий чувствует. Единственное, что нужно принять, — это потолок: 30,1% на выполнении многошаговых задач означают, что она не доведёт до конца работу, в которой есть шаги, и никакой промпт-инжиниринг это число не сдвинет.
Берите Gemini 3.8 Live Extended Thinking, когда у сессии есть задача. Бронирование, изменение, отмена, решение проблемы с аккаунтом, проведение звонящего через многошаговый процесс, пока он ждёт. Это та самая отметка в 38 баллов, и она стоит 3,50 доллара в час — что, заметьте, всё ещё дешевле обеих моделей, которые она обходит по композитному показателю. Вы также получаете поведение с озвучиванием, которое делает ожидание терпимым: эта модель рассуждает и говорит одновременно, поэтому вместо тишины, пока она что-то ищет, звонящий слышит «Сейчас проверю…» и сообщения о ходе работы. Это та же проблема, которую полнодуплексные архитектуры решают, никогда не останавливая аудио; ответ Google — продолжать говорить поверх работы.
Ещё две строки, которые стоит взвесить. Google также сообщает о 35,1% для модели Extended Thinking в таблице лидеров Sierra τ³-Banking против 32,0% у GPT-Live-1 Astra — это заявленный вендором показатель, не подкреплённый независимым измерением, и отрезвляющий в абсолютных значениях, поскольку 35,1% означают, что лучшая модель в этой таблице проваливает примерно две из каждых трёх попыток выполнения реалистичных банковских задач. А второе место стандартной модели в Speech Agent Arena, на которое Google ссылается в своих материалах, — это реальный результат в другой таблице, измеряющей предпочтения, а не выполнение задач. Оба утверждения справедливы. Вместе они говорят о том, что дешёвая модель очень хороша в роли собеседника, а дорогая — единственная из двух, которой можно поручать работу.
Запуск обоих, без двух интеграций
Практическое возражение против всего этого состоит в том, что выбор под каждую рабочую нагрузку означает поддержку двух путей. Это не обязательно. Оба варианта стоят перед одним и тем же классом бэкенда — фоновая работа инструментов и многошаговое планирование сводятся к обычным вызовам текстовых моделей, — и именно на этом слое живёт разброс ваших затрат и именно там переключение обходится дёшево.
OrcaRouter предоставляет 190 моделей из одного ключа по прайс-листовой цене провайдера без наценки, поэтому изменение цены поставщиком становится актуальным у нас в тот же день, а не при следующем продлении договора. Для стека, который маршрутизирует между дешёвым разговорным уровнем и дорогим уровнем рассуждений, важны два свойства: цель делегирования можно переключать на живом трафике, не затрагивая голосовую интеграцию, и автоматическое переключение при сбое поддерживает сессию активной, когда бэкенд выдаёт ошибку или истекает тайм-аут. Чтобы быть точными в том, что мы хостим, а что нет: эндпоинты Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking отсутствуют на нашем роутере — они идут из собственного API Google — в Gemini API, Live API и Google AI Studio. Текстовые модели, которым эти агенты очень часто передают свою работу, — среди них Gemini 3.8 Flash.
Где каждая модель находится на доске
Приведённый ниже снимок был сделан 16 сентября 2026 года, и верхняя часть Speech to Speech Index читается следующим образом:
• Gemini 3.8 Live Extended Thinking (High) — 82.6, первое место
• GPT-Live-1 (бэкенд Astra, среднее усилие) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (бэкенд Sol, низкие усилия) — 80.1
• Gemini 3.8 Live — 76.0, пятое место
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Одно замечание по названию, пока вы читаете этот список: (High) — это суффикс, прикреплённый к этой модели в материалах освещения, обозначающий конфигурацию уровня усилий рассуждения, а не отдельный релиз. Это то же соглашение, которое совет использует для Grok Voice Think Fast 2.0 High и GPT-Realtime-2.1 High.

Что ещё не закоммичено
Об одном в этой паре легко ошибиться при чтении, поэтому стоит сказать прямо: ни одна из моделей не является общедоступной в контрактном смысле, хотя для обеих указана цена и есть документация.
Разработчики получают Gemini 3.8 Live в Gemini API, Live API и Google AI Studio под ID gemini-3.8-live; предприятия получают закрытое превью в Gemini Enterprise, а Gemini Enterprise for Customer Experience указан как «скоро»; потребители получают его в Search Live. Gemini 3.8 Live Extended Thinking имеет тот же набор возможностей для разработчиков под gemini-3.8-live-extended-thinking, а также более широкий доступ для потребителей — Gemini Live, Docs Live для подписчиков Google AI Pro и Ultra, а также Gmail Live и Keep Live для всех подписчиков Google AI. Для бизнес-клиентов Workspace указано «скоро».
Чего не хватает — это того, что нужно предприятию, прежде чем закладывать это в статью доходов: обязательства по переходу в общую доступность, опубликованного показателя времени безотказной работы и тарифа, который Google обещал сохранить. Цены опубликованы, а цены на предварительные версии имеют свойство меняться. Создайте прототип сейчас, планируйте миграцию и не подписывайтесь на целевой показатель доступности, которого вам не предоставили.

Решение, которое на самом деле предлагает эта пара, уже, чем кажется по индексу, и это не лестница качества. Если задача вашего агента — разговаривать, дешёвая модель не компромисс: это лучший продукт по более низкой цене, а ставка в четыре раза ниже — бонус, а не аргумент. Если задача вашего агента — что-то завершить, вариант с рассуждениями — единственный из этих двух, которому вообще можно поручить задачу, и $3,50 в час — это ошибка округления по сравнению с бронью, которая иначе сорвётся. Ошибка, которой нужно избегать, — искать компромисс: платить за глубину рассуждений для рабочей нагрузки, которой всегда было достаточно хорошего разговора; именно это происходит, когда команда видит сводный разрыв в 6,6 пункта и не прокручивает вниз до 38,0.
