Сгенерированная hero-карточка для статьи «Gemini 3.8 Live vs ElevenLabs», показывающая две скруглённые карточки по обе стороны от заголовка. На левой карточке написано «Gemini 3.8 Live» над иконкой облака и звуковой волны и строка «речь в речь, один проход, за минуту»; на правой карточке написано «ElevenLabs Agents» над иконкой трёхблочного конвейера с подписью «STT - LLM - TTS» и строка «собирается, за минуту агента». Подзаголовок гласит: «Компонент, который вы арендуете, против системы, которая арендует компоненты». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Gemini 3.8 Live против ElevenLabs: модель против пайплайна

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Откройте документацию ElevenLabs для её агентной платформы — и в самой её середине обнаружится модель Gemini. ElevenLabs Agents — это каскад: фронтенд распознавания речи, языковая модель и бэкенд синтеза речи, — а языковой моделью в опубликованном стеке является одна из Gemini. Именно с этого стоит начинать сравнение Gemini 3.8 Live и ElevenLabs, потому что сравниваемые вещи — не объекты одного и того же типа. Gemini 3.8 Live — это модель «речь-в-речь», выпущенная в Live API 15 сентября 2026 года, с ценой за минуту аудио. ElevenLabs Eleven v3 — флагманская модель синтеза голосовой платформы, которая также продаёт ElevenLabs Agents, и её цена рассчитывается за символ, а не за разговор. Одна — компонент, который можно арендовать. Другая — система, которая арендует компоненты, включая, по крайней мере в одной опубликованной конфигурации, компоненты модели Gemini.

Эта асимметрия снимает большинство вопросов, с которыми люди на самом деле приходят к этому сравнению. Если вы спрашиваете, какой из них вызывать, честный ответ таков: они не заменяют друг друга: один — это модель с тарифной сеткой и без телефонии, другой — продукт с телефонией, ограничениями на параллелизм и тремя счётчиками, работающими одновременно. Что из них дешевле, лучше или быстрее, полностью зависит от того, какую из этих двух форм уже представляет собой ваше приложение.

Одна модель или три модели последовательно

Gemini 3.8 Live — это нативная система преобразования речи в речь. Аудио поступает на вход, аудио выходит на выходе, а рассуждение происходит в том же прямом проходе, который порождает речь, — одна модель, один бюджет задержки, один счёт. Google выпустила её 15 сентября 2026 года в двух вариантах: gemini-3.8-live для разговорной работы в масштабе, и gemini-3.8-live-extended-thinking — тот же интерфейс, но с многошаговым рассуждением за ним. Оба поддерживают 97 языков с переключением в середине разговора, оба обрабатывают визуальный ввод почти в реальном времени, оба выполняют вызовы инструментов и API в фоне, пока разговор продолжается, и оба наносят водяной знак SynthID на каждую секунду сгенерированного аудио. Опубликованный тариф — $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода.

ElevenLabs Agents — это не то. Это конвейер, и конвейер и есть продукт. Модель распознавания речи в реальном времени расшифровывает речь звонящего, языковая модель решает, что сказать, а модель синтеза — Eleven Flash v2 в конфигурации, которую описывает ElevenLabs, — озвучивает ответ. Каждый этап тарифицируется отдельно, каждый этап можно заменить, а всё это работает через управляемый слой, который отвечает за телефонию, определение реплик и параллельные соединения. ElevenLabs Eleven v3, флагманская модель синтеза компании, — это уже совсем другой продукт: модель текст-в-речь по цене $100 за миллион символов, которую продают для озвучивания, дубляжа и дизайна голоса, а не для ведения разговора.

Итак, первое, что нужно правильно понять: «Gemini 3.8 Live vs ElevenLabs Eleven v3» — это не очная схватка двух речевых моделей. Eleven v3 не принимает аудиовход и не поддерживает разговор. Сравнение, которое имеет смысл, — это Gemini 3.8 Live против ElevenLabs Agents, где Eleven v3 присутствует лишь как потолок качества синтеза, вокруг которого построена платформа.

Где каждый из них на самом деле находится на доске

Не существует таблицы лидеров, в которой эти двое сравнивались бы друг с другом, и причина этого поучительна: они то и дело оказываются в разных таблицах, измеряющих разные вещи.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

В индексе Speech to Speech от Artificial Analysis — который объединяет речевое рассуждение, выполнение агентных задач, предпочтения в арене и успешность задач в одно число — Gemini 3.8 Live набирает 76,0, а вариант Extended Thinking — с 82,6 на первом месте. Это измерения, которые Artificial Analysis проводит с помощью собственного испытательного стенда, а не цифры, опубликованные Google, хотя в собственном анонсе Google приводятся показатели по тем же компонентам.

ElevenLabs вообще не фигурирует в этом лидерборде, потому что не выпускает модель «речь-в-речь», которую можно было бы измерить. Зато она появляется в Speech Agent Arena, где оцениваются собранные агенты, а не модели, и картина там действительно неоднозначная: ElevenLabs Agents показал 937 Elo при 90,5% успешного выполнения задач, против 1 046 Elo и 74,6% успешного выполнения задач у агента, построенного на предыдущем поколении Gemini Live, причём агент на Gemini достигает первого аудио за 0,96 секунды. Присмотритесь к этой паре внимательнее. Агент на базе Gemini выигрывает по предпочтениям и скорости; агент ElevenLabs выигрывает по выполнению задачи. То есть каскад обходит нативную модель по надёжности, а это не тот результат, который предсказали бы архитектурные схемы.

Две оговорки насчёт этих цифр, и обе важны. Сторона Gemini в этом сравнении использовала поколение Gemini Live начала 2026 года, а не 3.8 Live, поэтому это ничего не говорит о модели, которой посвящена эта статья. А третья таблица в игре — речевая арена Provider Voices от Artificial Analysis, которая ранжирует модели синтеза, — ставитElevenLabs Eleven v3 на 1,177 Elo, а разговорный вариант, ElevenLabs v3 Conversational, на 1,219 Elo, против 1,283 у лидера — Cartesia Sonic 3.6. Эта таблица измеряет, насколько хорошо звучит голос, а не насколько хорошо работает агент, и именно смешение этих двух вещей приводит к тому, что люди цитируют оценку синтеза как доказательство о разговорной системе.

Спек контраст

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Архитектура — Gemini 3.8 Live — это одна нативная модель речи-в-речь, а ElevenLabs Agents — это каскад распознавания речи, языковой модели и синтеза.

• Ввод и вывод — Gemini 3.8 Live принимает аудио и возвращает аудио за один проход, тогда как ElevenLabs пропускает аудио через Scribe v2 Realtime и возвращает его через Eleven Flash v2, а между ними — текстовая транскрипция

• Что можно заменить — в Gemini 3.8 Live — ничего: модель есть модель; в ElevenLabs — каждый этап независимо, включая языковую модель, которая в документированном стеке — от Google

• Языки — Gemini 3.8 Live 97 с переключением в середине разговора против ElevenLabs Eleven v3 74

• Цены на аудио — Gemini 3.8 Live: $0,005 за минуту на входе и $0,018 за минуту на выходе, тогда как ElevenLabs тарифицируется по минутам агента, а токены языковой модели учитываются отдельно сверху

• Телефония — Gemini 3.8 Live: собственного решения нет; вы подключаете своего оператора и управление сессиями, в отличие от ElevenLabs — управляемое собственное решение

• Конкурентность — Gemini 3.8 Live: сколько позволяет ваша квота Live API, в отличие от ElevenLabs, продаваемого по уровням конкурентности

• Инструментарий для агентов — фоновый инструмент Gemini 3.8 Live и выполнение API внутри модели против управляемого слоя агентов ElevenLabs с обнаружением реплик, рабочими процессами и библиотекой голосов

• Открытый артефакт — ни тот, ни другой. Оба — закрытые, исключительно облачные и проприетарные.

• Задержка — Gemini 3.8 Live: 1,18 секунды до первого аудио для стандартной модели и 1,35 — для Extended Thinking, по данным Artificial Analysis; у ElevenLabs этот показатель не опубликован как единое число, потому что задержка каскада — это сумма трёх этапов

Последняя строка объясняет выбор архитектуры лучше, чем любая другая. У нативной модели один бюджет задержки. У каскада их три, и причина, по которой команды всё ещё выбирают каскад, — всё, что стоит выше него: транскрипт, который можно логировать, этап, который можно заменить, и телефонный номер, который просто работает.

Сколько стоит минута, в обе стороны

Арифметика Gemini 3.8 Live необычно проста, потому что здесь только один счётчик. Минута разговора — это примерно минута аудио вызывающего абонента плюс минута аудио модели: $0,005 плюс $0,018, то есть около 2,3 цента в минуту по опубликованному тарифу. В колонке Artificial Analysis «стоимость в час», где цена выполнения фиксированного набора задач по аудио-рассуждению нормируется к почасовому показателю, стандартная модель оценивается в $0,84 за час входного аудио — самая дешёвая платная ставка в этой таблице — а вариант Extended Thinking — в $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

Арифметика ElevenLabs сложнее, и в этом суть, а не критика. Минута агента — это не одна цена: есть плата платформы за саму минуту агента, токены языковой модели, потребляемые на промежуточном участке, и минуты оператора связи в основе — три счётчика, в худшем случае три поставщика, и счёт, который меняется, когда меняется любой из них. Сторона синтеза более понятна: ElevenLabs Eleven v3 по цене $100 за миллион символов — это примерно $8 в час непрерывного озвучивания при обычном темпе речи, против примерно $2,70 у самого дешёвого конкурента с открытыми весами на той же арене. ElevenLabs берёт надбавку за голос, и на этой таблице лидеров надбавка реальна — он занимает четвёртое место в общем зачёте.

Что две эти структуры затрат означают на практике: Gemini 3.8 Live дешевле за минуту разговора и гораздо дешевле за час аудио, тогда как ElevenLabs дороже и гораздо более предсказуем в эксплуатации. Команда без ML-инженеров и с телефонным номером, который нужно поднять, в первый месяц потратит меньше на ElevenLabs, потому что альтернатива — построить то, что ElevenLabs уже построила. Команда, которая уже управляет своими сессиями и использует собственного оператора связи, потратит меньше на саму модель, потому что она не платит за конвейер, который у неё уже есть.

В чём ElevenLabs действительно лучше

Было бы легко истолковать разрыв в цене как приговор. Это не так, и причины — те, которые никогда не показывает прайс-лист.

• Телефония. ElevenLabs продаёт телефонные номера, SIP-транкинг и возможность одновременного ответа на несколько звонков. Google продаёт модель, которая умеет говорить. Если ваш продукт — телефонная линия, то пропасть между этими двумя предложениями измеряется месяцами инженерной работы.

• Голосовая идентичность. Библиотека голосов, конвейер клонирования и студия дубляжа — это зрелая продуктовая поверхность. Gemini 3.8 Live даёт вам модель; он не даёт вам каталог лицензированных голосов или рабочий процесс для локализации существующей записи на девять языков.

• Стенограмма по умолчанию. Поскольку каскад сначала транскрибирует, а затем рассуждает, вы бесплатно получаете текстовые журналы каждого вызова — полезные для соблюдения требований, для оценки и для неблагодарной работы по выяснению того, почему агент в чём-то ошибся. У нативной модели речь-в-речь такого артефакта нет, если только вы его не создадите.

• Взаимозаменяемые компоненты. Когда выходит более совершенная языковая модель, каскад ElevenLabs может перейти на неё, ничего не переобучая. Именно поэтому в документированном стеке посередине находится модель Google — и это самый сильный аргумент в пользу каскадной архитектуры.

Что вам даёт сырая модель

Контраргумент не в цене. Он в том, что может сделать один прямой проход, чего не могут три этапа.

Gemini 3.8 Live слышит просодию, тон и заминки напрямую, а не через расшифровку, которая уже отбросила их, — именно поэтому он может переключать языки посреди предложения и поэтому его оценка динамики разговора — 96,1% для стандартной модели, по данным Artificial Analysis — является тем единственным компонентом, в котором он превосходит своего ориентированного на рассуждения собрата. Он также выполняет вызовы инструментов и API в фоне, продолжая говорить, так что поиск не приводит к молчанию. А вариант Extended Thinking — это действительно иная возможность, а не более крупная версия той же самой: он решает 68,6% сценариев клиентского обслуживания τ-Voice против 30,1% у стандартной модели — разрыв в 38 пунктов, который является самым крупным отдельным числом в релизе и причиной, по которой Google разделил линейку на две.

Если задача вашего агента — завершить многошаговую задачу, а не вести приятную беседу, то этот разрыв в 38 пунктов решает всё, и это стоит $3.50 в час вместо $0.84 — всё ещё меньше, чем у каждой модели, которую он обходит в той таблице.

Средняя нога — это та, которую вы действительно можете двигать.

Вот шов, который стоит назвать, потому что именно здесь архитектурный вопрос превращается в вопрос закупки. В каскаде среднее звено — часть, которая решает, что сказать, вызывает инструменты и выполняет рассуждение, — представляет собой обычный текстовый инференс. Это также звено с наибольшим разбросом затрат, наибольшей вендорной привязкой и наименьшими причинами быть привязанным к какому-либо одному поставщику. В стеке, который описывает ElevenLabs, там случайно используется модель Gemini. Но это не обязательно.

OrcaRouter покрывает именно это звено, а не два внешних. Мы не размещаем у себя голосовые эндпоинты Gemini 3.8 Live — они предоставляются собственным Live API Google — и мы не размещаем ElevenLabs, чьи слои синтеза и агентов являются её собственным продуктом. Мы предоставляем текстовый слой под всем этим: более 200 моделей за одним ключом по каталожной цене провайдера, без наценки, так что снижение цены от вышестоящей лаборатории отражается в вашем счёте в тот же день, а не при следующем продлении. Применительно к голосовому стеку три из этих свойств оправдывают себя. Автоматическое переключение при сбое сохраняет звонок, когда бэкенд выдаёт ошибку или уходит в тайм-аут посреди фразы, — а такой сбой абонент замечает сразу. DSL маршрутизации объединяет несколько моделей в один вызов, поэтому дешёвая модель может обрабатывать реплики-подтверждения, а более сильная — проводить саму транзакцию. А фузия моделей позволяет панели моделей отвечать совместно на тех репликах, где суждения одной модели недостаточно, чтобы доверять ей в одиночку. Смена модели, стоящей в середине каскада, — это изменение конфигурации, а не пересборка, — и именно ради этого каскадная архитектура и существует.

Какой выбрать?

Выбирайте ElevenLabs, если вы запускаете телефонную линию и не хотите строить голосовой стек. Вы покупаете телефонию, каталог голосов, транскрипты, конкурентность и контракт на поддержку — и наценка за минуту как раз покрывает их стоимость. Вы также получаете возможность сменить модель на ходу, не меняя ничего другого, а это ценнее, чем кажется.

Выбирайте Gemini 3.8 Live, если голос — это функция чего-то, что вы уже эксплуатируете. Вы получаете самую низкую ставку за полноценный speech-to-speech, которую кто-либо сейчас публикует, 97 языков с переключением в середине разговора, выполнение инструментов, которое продолжается, пока модель говорит, и — если вашему агенту нужно выполнять задачи, а не просто разговаривать — 38-пунктовый разрыв в агентных возможностях, который вариант Extended Thinking обеспечивает примерно за четырёхкратную почасовую стоимость аудио. Вы предоставляете оператора связи, жизненный цикл сессии и логи.

За чем следить: опубликует ли ElevenLabs единый показатель задержки для минуты управляемого агента, потому что именно это число сделало бы это сравнение количественным, а не структурным; и подтвердится ли результат Speech Agent Arena, когда в ней измерят агента, построенного на 3.8 Live, потому что каскад, который сейчас превосходит нативную модель по успешности выполнения задач, — это самое интересное в этом противостоянии и наименее объяснённое.