
GPT-Live-1 против Gemini 3.5 Live Translate: выпущенный универсал против специалиста в статусе превью
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Эти две модели сравнивают потому, что обе дают доступ к речи в реальном времени через API, но сравнение разваливается, стоит вам прочитать карточки моделей. GPT-Live-1 — это универсальная полнодуплексная голосовая модель, которую OpenAI перевела в API для разработчиков 10 сентября 2026 года, через три месяца после её появления в ChatGPT 8 июля. Gemini 3.5 Live Translate — это узкоспециализированная модель перевода из аудио в аудио, выпущенная Google DeepMind 9 июня 2026 года, и в её идентификаторе модели всё ещё сохраняется слово preview. Одну из них можно уже сегодня предложить платящим клиентам по опубликованному тарифу. Другую Google может изменить у вас под ногами без уведомления об устаревании. Именно эта асимметрия, а не таблица бенчмарков, и должна определять выбор.
Две разные машины с одним и тем же ярлыком
Стоит без обиняков сказать, насколько мало они пересекаются. Gemini 3.5 Live Translate занимается переводом. Он принимает потоковое аудио на одном языке и возвращает потоковое аудио на другом, сохраняя голос и тон говорящего, для более чем 70 языков и более 2 000 языковых пар, с автоматическим определением языка и двусторонней работой. Он не ведёт разговор, не вызывает функции и не отвечает на вопросы. Это движок синхронного перевода.
GPT-Live-1 устроена наоборот. Это разговорная модель: она одновременно слушает и говорит, много раз в секунду решает, продолжать ли слушать, сделать паузу, прервать или вызвать инструмент, и передаёт тяжёлую работу — веб-поиск, более глубокие рассуждения, агентные задачи — отдельной модели рассуждений через Responses API, пока разговор продолжается. В опубликованном самим OpenAI примере WebRTC эта делегация подключена к GPT-5.6 Terra. Перевод — одна из вещей, которые она умеет; но у модели Google нет никакого эквивалента этой функции в обратном направлении.
Итак, практический вопрос уже, чем предполагает громкое сравнение из заголовков: если вы создаёте систему устного перевода, модель Google разработана специально для этого, а модель OpenAI — универсальная. Если же вы создаёте голосового агента, который иногда переводит, GPT-Live-1 — единственный из этих двух, который вообще относится к нужной категории продукта.
Сколько стоит каждый из них за минуту аудио
Именно здесь специалист оправдывает своё существование, и арифметика для OpenAI действительно неудобна.
• GPT-Live-1 — $0,05 за минуту голоса, с оплатой посекундно, а не с округлением вверх до следующей целой минуты. Рассуждения и вызовы инструментов, выполняемые делегированным бэкендом, тарифицируются отдельно по обычным тарифам этой модели.
• Gemini 3.5 Live Translate — $3,50 за миллион входных аудиотокенов и $21,00 за миллион выходных аудиотокенов, при этом оплата рассчитывается исходя из 25 токенов в секунду аудио. В совокупности это составляет примерно $0,037 за минуту переведённого аудио.
По чистым минутам перевода Google примерно на четверть дешевле. В масштабе это не разница из-за округления: 10 000 минут устного перевода в месяц стоят около $500 на голосовом слое GPT-Live-1 против примерно $368 на Gemini 3.5 Live Translate. И этот разрыв реален, а не является следствием изменения системы тарификации, потому что эти две модели выставляют счета по действительно разным единицам.
Есть подвох и в обратную сторону. Цифра $0.05 в заголовке для GPT-Live-1 — это цена только голосового слоя. Если ваш агент переводит и заодно что-то ищет или передаёт сложное предложение reasoning-модели, вы платите за это делегирование сверху — а делегированная модель тарифицируется по токенам, как любая другая передовая модель. Рабочая нагрузка только с переводом такого никогда не вызывает. А рабочая нагрузка «перевод плюс что угодно» — вызывает, и победитель в сравнении по цене за минуту перестаёт быть очевидным.

Метка предварительного просмотра — это риск, который никто не закладывает в цену.
ID модели Gemini 3.5 Live Translate — gemini-3.5-live-translate-preview. Он был выпущен в Gemini Live API и Google AI Studio в виде публичной предварительной версии, а одновременно — в приложение Google Translate на Android и iOS и в виде закрытой предварительной версии в Google Meet для отдельных клиентов Workspace. Предварительная версия означает то же, что всегда означала в Google: никаких гарантий стабильности, никакого опубликованного срока прекращения поддержки, никаких обязательств, что тариф, который вы платите, сохранится в следующем релизе.
Для потребительского приложения это нормально. Для рабочих нагрузок, на которые эта модель на самом деле рассчитана — перевод в режиме реального времени в колл-центре, продукт для совещаний, туристический продукт, — это самый крупный интеграционный риск во всём стеке. Вы строите продакшен-зависимость от модели, по которой Google явно не взял на себя обязательств.
У GPT-Live-1 обратная проблема, и она меньше, но не равна нулю. Он общедоступен, по опубликованному тарифу, с документированным эндпоинтом, и он никуда не денется. Но его API-поверхность узка в том смысле, что удивляет команды, которые предполагают, что он легко встраивается в существующую интеграцию с OpenAI: существует ровно один ID модели, один эндпоинт, и нет пути через Chat Completions, Responses, Realtime, Batch, Assistants или fine-tuning. Единственный способ войти — это эндпоинт Live Sessions по адресу v1/live/sessions через WebRTC, с обработкой событий на канале данных. Это новая интеграция, а не изменение параметра.

Языки и где генералист действительно слабее
У Google — более 70 языков с сохранением голоса и тона. Собственная документация OpenAI заметно менее уверена в своём покрытии: в материалах запуска отмечается, что для некоторых языков модель может иметь неродной акцент или демонстрировать пробелы в беглости, и она не публикует количество языков, способное конкурировать с показателем Google.
Это не уклончивость вендора — так выглядит универсальная диалоговая модель рядом со специализированной, обученной на этой задаче. Если ценностное предложение вашего продукта — «мы хорошо интерпретируем 40 языков», честный выбор — специализированная модель, а универсальная подведёт вас на длинном хвосте. Если ваш продукт — голосовой агент для англоязычного рынка с прикрученной функцией перевода, языковые пробелы универсальной модели никогда не всплывут.
Обе модели помечают сгенерированное аудио водяным знаком SynthID — это важно, если вы подпадаете под юрисдикцию или клиентский договор, требующие подтверждения происхождения синтетической речи. По этому пункту — ничья.

Где архитектура делегирования изменяет сборку
Структурное различие между этими двумя состоит в том, что GPT-Live-1 — это на самом деле две модели со швом посередине. Голосовой слой поддерживает разговор живым; отдельная модель рассуждений выполняет мышление. Именно на этот шов уходят ваши инженерные усилия, и именно на нём модель затрат становится сложной.
Стоит знать, что делегированная половина — это обычная текстовая модель, которую можно маршрутизировать как любую другую. GPT-5.6 Terra, бэкенд из собственного примера OpenAI, предоставляется через OrcaRouter по цене $2.00 за миллион входных токенов и $12.00 за миллион выходных токенов, с окном контекста в 1 млн токенов и с доступными как /v1/chat/completions, так и /v1/responses. Если вы хотите заменить мозг рассуждений, стоящий за голосовым агентом, — на более дешёвую модель для простых звонков или на более сильную для эскалаций — у этой половины стека есть варианты, потому что это обычный вызов API, стоящий рядом с примерно 190 другими моделями на одном ключе.
А вот голосовая половина — нет. GPT-Live-1 нет в OrcaRouter, и Gemini 3.5 Live Translate тоже там отсутствует; оба доступны только у производителя, который их выпустил. В подобной архитектуре роутер оправдывает своё место всем, что находится после аудио: текстовыми моделями, выполняющими поиск, суммаризацию, обратную запись в CRM и эскалацию, — той половиной расходов, которую действительно можно объединить на одном ключе и в одном счёте.
Что на самом деле выбрать
• Выбирайте Gemini 3.5 Live Translate, если перевод — это и есть продукт, цена за минуту важнее стабильности контракта, и вы можете смириться с тем, что preview-модель меняется под вами. Заложите в бюджет примерно $0,037 за минуту и сохраните слой абстракции поверх вызова, чтобы GA-модель могла заменить её без переписывания.
• Выбирайте GPT-Live-1, если вам нужен разговорный агент, который заодно переводит, если вам нужны вызов функций и использование инструментов внутри голосового цикла, или если отдел закупок спросит, что произойдёт, когда модель выведут из эксплуатации, а вам нужен ответ лучше, чем «ничего, скорее всего».
• Не выбирайте ни один из них только потому, что он победил в бенчмарке. Бенчмарки обеих сторон несопоставимы — показатели OpenAI в полнодуплексном режиме — это её собственные данные, не воспроизведённые ни одной третьей стороной, а заявления Google о языковых возможностях не проверялись на одном и том же аудионаборе в сравнении с универсальной моделью.
Одно замечание на перспективу: эти две поверхности сближаются, а не сталкиваются. Модель перевода Google уже живёт внутри Gemini Live, а голосовой слой GPT-Live-1 явно спроектирован так, чтобы за ним можно было подключать новые фронтирные модели. Разумно ожидать, что через пару релизных циклов перевод у универсальной модели улучшится, а интеграционная история специализированной станет менее рискованной. Если вы создаёте продукт сегодня и решение почти принято, это аргумент в пользу более дешёвого и легче заменяемого варианта, а также в пользу того, чтобы в любом случае держать аудиотракт изолированным за интерфейсом.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
