Титульная карточка героя с надписью «GPT-Live-1 vs Gemini 3.5 Live Translate», подзаголовком «Выпущенный универсал против специалиста в предварительной версии» и строкой «GA за $0,05 в минуту против preview примерно за $0,037 в минуту», над двумя панелями: слева — полнодуплексная звуковая волна со стрелками, изгибающимися в обоих направлениях, и сплошным значком «GA», справа — глобус с двумя речевыми пузырями и контурным значком «PREVIEW», а в углу скомпонован логотип OrcaRouter.
Guides & Insights

GPT-Live-1 против Gemini 3.5 Live Translate: выпущенный универсал против специалиста в статусе превью

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эти две модели сравнивают потому, что обе дают доступ к речи в реальном времени через API, но сравнение разваливается, стоит вам прочитать карточки моделей. GPT-Live-1 — это универсальная полнодуплексная голосовая модель, которую Ope​nAI перевела в API для разработчиков 10 сентября 2026 года, через три месяца после её появления в ChatGPT 8 июля. Gem​ini 3.5 Live Translate — это узкоспециализированная модель перевода из аудио в аудио, выпущенная Goo​gle DeepMind 9 июня 2026 года, и в её идентификаторе модели всё ещё сохраняется слово preview. Одну из них можно уже сегодня предложить платящим клиентам по опубликованному тарифу. Другую Goo​gle может изменить у вас под ногами без уведомления об устаревании. Именно эта асимметрия, а не таблица бенчмарков, и должна определять выбор.

Две разные машины с одним и тем же ярлыком

Стоит без обиняков сказать, насколько мало они пересекаются. Gemini 3.5 Live Translate занимается переводом. Он принимает потоковое аудио на одном языке и возвращает потоковое аудио на другом, сохраняя голос и тон говорящего, для более чем 70 языков и более 2 000 языковых пар, с автоматическим определением языка и двусторонней работой. Он не ведёт разговор, не вызывает функции и не отвечает на вопросы. Это движок синхронного перевода.

GPT-Live-1 устроена наоборот. Это разговорная модель: она одновременно слушает и говорит, много раз в секунду решает, продолжать ли слушать, сделать паузу, прервать или вызвать инструмент, и передаёт тяжёлую работу — веб-поиск, более глубокие рассуждения, агентные задачи — отдельной модели рассуждений через Responses API, пока разговор продолжается. В опубликованном самим OpenAI примере WebRTC эта делегация подключена к GPT-5.6 Terra. Перевод — одна из вещей, которые она умеет; но у модели Google нет никакого эквивалента этой функции в обратном направлении.

Итак, практический вопрос уже, чем предполагает громкое сравнение из заголовков: если вы создаёте систему устного перевода, модель Google разработана специально для этого, а модель OpenAI — универсальная. Если же вы создаёте голосового агента, который иногда переводит, GPT-Live-1 — единственный из этих двух, который вообще относится к нужной категории продукта.

Сколько стоит каждый из них за минуту аудио

Именно здесь специалист оправдывает своё существование, и арифметика для Ope​nAI действительно неудобна.

• GPT-Live-1 — $0,05 за минуту голоса, с оплатой посекундно, а не с округлением вверх до следующей целой минуты. Рассуждения и вызовы инструментов, выполняемые делегированным бэкендом, тарифицируются отдельно по обычным тарифам этой модели.

• Gem​ini 3.5 Live Translate — $3,50 за миллион входных аудиотокенов и $21,00 за миллион выходных аудиотокенов, при этом оплата рассчитывается исходя из 25 токенов в секунду аудио. В совокупности это составляет примерно $0,037 за минуту переведённого аудио.

По чистым минутам перевода Google примерно на четверть дешевле. В масштабе это не разница из-за округления: 10 000 минут устного перевода в месяц стоят около $500 на голосовом слое GPT-Live-1 против примерно $368 на Gemini 3.5 Live Translate. И этот разрыв реален, а не является следствием изменения системы тарификации, потому что эти две модели выставляют счета по действительно разным единицам.

Есть подвох и в обратную сторону. Цифра $0.05 в заголовке для GPT-Live-1 — это цена только голосового слоя. Если ваш агент переводит и заодно что-то ищет или передаёт сложное предложение reasoning-модели, вы платите за это делегирование сверху — а делегированная модель тарифицируется по токенам, как любая другая передовая модель. Рабочая нагрузка только с переводом такого никогда не вызывает. А рабочая нагрузка «перевод плюс что угодно» — вызывает, и победитель в сравнении по цене за минуту перестаёт быть очевидным.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

Метка предварительного просмотра — это риск, который никто не закладывает в цену.

ID модели Gemini 3.5 Live Translate — gemini-3.5-live-translate-preview. Он был выпущен в Gemini Live API и Google AI Studio в виде публичной предварительной версии, а одновременно — в приложение Google Translate на Android и iOS и в виде закрытой предварительной версии в Google Meet для отдельных клиентов Workspace. Предварительная версия означает то же, что всегда означала в Google: никаких гарантий стабильности, никакого опубликованного срока прекращения поддержки, никаких обязательств, что тариф, который вы платите, сохранится в следующем релизе.

Для потребительского приложения это нормально. Для рабочих нагрузок, на которые эта модель на самом деле рассчитана — перевод в режиме реального времени в колл-центре, продукт для совещаний, туристический продукт, — это самый крупный интеграционный риск во всём стеке. Вы строите продакшен-зависимость от модели, по которой Google явно не взял на себя обязательств.

У GPT-Live-1 обратная проблема, и она меньше, но не равна нулю. Он общедоступен, по опубликованному тарифу, с документированным эндпоинтом, и он никуда не денется. Но его API-поверхность узка в том смысле, что удивляет команды, которые предполагают, что он легко встраивается в существующую интеграцию с OpenAI: существует ровно один ID модели, один эндпоинт, и нет пути через Chat Completions, Responses, Realtime, Batch, Assistants или fine-tuning. Единственный способ войти — это эндпоинт Live Sessions по адресу v1/live/sessions через WebRTC, с обработкой событий на канале данных. Это новая интеграция, а не изменение параметра.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Языки и где генералист действительно слабее

У Google — более 70 языков с сохранением голоса и тона. Собственная документация OpenAI заметно менее уверена в своём покрытии: в материалах запуска отмечается, что для некоторых языков модель может иметь неродной акцент или демонстрировать пробелы в беглости, и она не публикует количество языков, способное конкурировать с показателем Google.

Это не уклончивость вендора — так выглядит универсальная диалоговая модель рядом со специализированной, обученной на этой задаче. Если ценностное предложение вашего продукта — «мы хорошо интерпретируем 40 языков», честный выбор — специализированная модель, а универсальная подведёт вас на длинном хвосте. Если ваш продукт — голосовой агент для англоязычного рынка с прикрученной функцией перевода, языковые пробелы универсальной модели никогда не всплывут.

Обе модели помечают сгенерированное аудио водяным знаком SynthID — это важно, если вы подпадаете под юрисдикцию или клиентский договор, требующие подтверждения происхождения синтетической речи. По этому пункту — ничья.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Где архитектура делегирования изменяет сборку

Структурное различие между этими двумя состоит в том, что GPT-Live-1 — это на самом деле две модели со швом посередине. Голосовой слой поддерживает разговор живым; отдельная модель рассуждений выполняет мышление. Именно на этот шов уходят ваши инженерные усилия, и именно на нём модель затрат становится сложной.

Стоит знать, что делегированная половина — это обычная текстовая модель, которую можно маршрутизировать как любую другую. GPT-5.6 Terra, бэкенд из собственного примера OpenAI, предоставляется через OrcaRouter по цене $2.00 за миллион входных токенов и $12.00 за миллион выходных токенов, с окном контекста в 1 млн токенов и с доступными как /v1/chat/completions, так и /v1/responses. Если вы хотите заменить мозг рассуждений, стоящий за голосовым агентом, — на более дешёвую модель для простых звонков или на более сильную для эскалаций — у этой половины стека есть варианты, потому что это обычный вызов API, стоящий рядом с примерно 190 другими моделями на одном ключе.

А вот голосовая половина — нет. GPT-Live-1 нет в OrcaRouter, и Gemini 3.5 Live Translate тоже там отсутствует; оба доступны только у производителя, который их выпустил. В подобной архитектуре роутер оправдывает своё место всем, что находится после аудио: текстовыми моделями, выполняющими поиск, суммаризацию, обратную запись в CRM и эскалацию, — той половиной расходов, которую действительно можно объединить на одном ключе и в одном счёте.

Что на самом деле выбрать

• Выбирайте Gem​ini 3.5 Live Translate, если перевод — это и есть продукт, цена за минуту важнее стабильности контракта, и вы можете смириться с тем, что preview-модель меняется под вами. Заложите в бюджет примерно $0,037 за минуту и сохраните слой абстракции поверх вызова, чтобы GA-модель могла заменить её без переписывания.

• Выбирайте GPT-Live-1, если вам нужен разговорный агент, который заодно переводит, если вам нужны вызов функций и использование инструментов внутри голосового цикла, или если отдел закупок спросит, что произойдёт, когда модель выведут из эксплуатации, а вам нужен ответ лучше, чем «ничего, скорее всего».

• Не выбирайте ни один из них только потому, что он победил в бенчмарке. Бенчмарки обеих сторон несопоставимы — показатели Ope​nAI в полнодуплексном режиме — это её собственные данные, не воспроизведённые ни одной третьей стороной, а заявления Goo​gle о языковых возможностях не проверялись на одном и том же аудионаборе в сравнении с универсальной моделью.

Одно замечание на перспективу: эти две поверхности сближаются, а не сталкиваются. Модель перевода Google уже живёт внутри Gemini Live, а голосовой слой GPT-Live-1 явно спроектирован так, чтобы за ним можно было подключать новые фронтирные модели. Разумно ожидать, что через пару релизных циклов перевод у универсальной модели улучшится, а интеграционная история специализированной станет менее рискованной. Если вы создаёте продукт сегодня и решение почти принято, это аргумент в пользу более дешёвого и легче заменяемого варианта, а также в пользу того, чтобы в любом случае держать аудиотракт изолированным за интерфейсом.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно