
GPT-Live-1 добирается до API: полнодуплексный голос за 0,05 доллара в минуту, без возможности простой замены с GPT-Realtime-2.1
GPT-Live-1 доступен в API с 10 сентября, и цифра, которая действительно изменит бюджеты, — это не бенчмарк, а единица тарификации. Полнодуплексная голосовая модель OpenAI теперь тарифицируется по фиксированной ставке $0.05 за минуту голоса, с посекундной оплатой, тогда как модель, с которой её сравнивают, GPT-Realtime-2.1, измерялась в аудиотокенах: $32 за миллион на входе и $64 за миллион на выходе. Сама модель не нова: GPT-Live-1 появилась в ChatGPT 8 июля 2026 года как замена Advanced Voice Mode. Новое в том, что разработчики наконец могут вызывать её — и в том, что такой вызов почти не похож на интеграцию с Realtime, которая уже есть у большинства команд. В собственной документации OpenAI голосовой слой идёт в паре с отдельным бэкендом рассуждений, и в опубликованном примере WebRTC этим бэкендом выступает GPT-5.6 Terra.
Что вышло 10 сентября, а что — нет
Поверхность API намеренно узкая. Есть ровно один ID модели — gpt-live-1, который также является её собственным снапшотом по умолчанию: никаких датированных вариантов, которые можно было бы закрепить. Есть ровно один эндпоинт — эндпоинт Live Sessions по адресу v1/live/sessions. Всё остальное на платформе OpenAI для этой модели отключено: нет ни Chat Completions, ни Responses, ни Realtime (включая варианты перевода и транскрипции), ни Assistants, ни Batch, ни дообучения, ни эмбеддингов, ни генерации изображений или видео, ни эндпоинтов синтеза речи или транскрипции аудио, ни модерации.
Входные и выходные данные — это аудио и текст. Потоковая передача и вызов функций поддерживаются; структурированные выходные данные, тонкая настройка и предсказанные выходные данные — нет. Ввод изображений и видео явно не поддерживается — поэтому возможность «голос с видео», на которую намекала OpenAIOpenAI, не входит в этот релиз. Бесплатный уровень вообще не может его вызывать, а ограничения скорости измеряются в одновременных сессиях, а не в запросах в минуту: 25 на уровне 1, возрастая до 50, 200, 300 и 500 на уровнях со 2 по 5.

Такая привязка к параллельности — первая подсказка, что это не замена, которую можно просто подключить. Ограничения скорости, выраженные в одновременных активных разговорах, говорят о том, какую единицу масштабирования ожидает OpenAIOpenAI: телефонную линию, а не запрос.
Изменение цен — это более тихая, но более значимая история.
Фиксированная поминутная оплата — это действительно иной подход. При тарификации по токенам вам приходилось моделировать расход аудиотокенов — сколько токенов стоит секунда тишины, как звонящий, который постоянно перебивает агента, меняет длину вывода — прежде чем спрогнозировать хотя бы один звонок. При $0.05 за минуту вся арифметика сводится к умножению:
• 5-минутный звонок в службу поддержки — $0.25 за голосовое время
• 10-минутный звонок — $0.50
• В среднем 4 минуты на 1 000 звонков в день — 200 долларов в день, примерно 6 000 долларов в месяц
• Один час непрерывной открытой линии — $3.00
Три детали делают эту картину точнее. Во-первых, длительность не округляется вверх до следующей целой минуты, поэтому 40-секундный звонок стоит около 3,3 цента, а не целых пять центов. Во-вторых, инициализация сессии тарифицирует 15 секунд голосовой длительности авансом — но эта сумма засчитывается в счёт последующих списаний за длительность, а не добавляется сверху, поэтому звонок короче 15 секунд всё равно тарифицируется как 15-секундный. В-третьих, голос — это лишь половина счёта. Модель рассуждений на бэкенде, её вызовы инструментов и любой веб-поиск тарифицируются отдельно по обычным тарифам этой модели; это значит, что «дешёвая голосовая модель» всё равно может обернуться дорогим звонком, если вы направляете делегирование на передовую модель рассуждений и позволяете ей искать на каждом ходу.
Эта двухметровая конструкция — как раз то место, где маршрутизация перестаёт быть просто приятным довеском. В OrcaRouter бэкенд-половина сессии GPT-Live-1 — это всего лишь ещё один вызов модели: примерно 190 моделей от одиннадцати вышестоящих провайдеров за одним ключом, по прайс-листовой цене провайдера, переданной без единой наценки, и с автоматическим переключением, если выбранный бэкенд выдаст ошибку или не ответит вовремя. Сам голосовой слой маршрутизировать нельзя — эндпоинт Live Sessions есть только у OpenAIOpenAI. А вот всё, что голосовой слой делегирует, маршрутизировать вполне можно, и именно эта половина масштабируется в зависимости от того, насколько напряжённо думают ваши звонящие.
Только WebRTC — почему ваш код Realtime не удастся портировать
Вот практическая цена перехода, и большинство материалов о запуске это упускают. Сессии GPT-Live-1 работают через WebRTC, а не через транспорт WebSocket, на котором построено множество существующих интеграций Realtime. Проверка старого пути с идентификатором модели GPT-Live возвращает ошибку, прямо сообщающую, что для сессий требуется WebRTC.
Рукопожатие, согласно руководству OpenAIOpenAI по WebRTC: ваш браузер открывает RTCPeerConnection, добавляет дорожки микрофона, открывает канал данных и регистрирует слушателей перед отправкой оффера, задаёт локальное описание, ждёт сбора ICE и отправляет оффер на ваш собственный сервер. Затем ваш сервер вызывает POST /v1/live/sessions с конфигурацией сессии и transport: { type: "webrtc", sdp: ... }. При успехе возвращается HTTP 201, содержащий session.id и transport.sdp, которое браузер применяет как удалённое описание. Медиа передаётся по согласованным дорожкам; канал данных — метка oai-events — переносит транскрипты, обновления сессии и делегированную работу. Чтобы завершить соединение, вы отправляете session.close и продолжаете читать, пока не придёт session.closed.
Два подводных камня, которые стоит приклеить к монитору. Сам HTTP-вызов запускает сессию, поэтому вы не должны также отправлять session.start по каналу данных. И не следует добавлять входное аудио или ждать дельт выходного аудио по этому каналу — оставьте audio.format вне конфигурации, и пусть SDP обрабатывает это. В примерах сервера тело запроса ограничено 64 КБ, сбор ICE завершается по тайм-ауту через 10 секунд, а финализация сессии — через 15.
Ничто из этого не сложно. Всё это — новый код. Если ваш продукт — это реалтайм-агент, работающий по ходам, то миграция на GPT-Live-1 — это переписывание транспорта плюс переписывание делегирования, а не замена идентификатора модели — на это стоит закладывать спринт, а не полдня.
Бенчмарки, и кто провёл каждый из них
Каждый приведённый ниже показатель принадлежит самой OpenAIOpenAI, опубликован вместе с релизом API и на момент написания никем независимо не воспроизводился. Эта оговорка здесь важнее, чем обычно, потому что различия достаточно велики и так и просятся, чтобы их процитировали как установленный факт.

• Полнодуплексное взаимодействие — GPT-Live-1 80.1% против 45.4% у GPT-Realtime-2.1
• Задержка смены реплик — 0,8 с против 1,4 с
• Точность вызова инструментов — 87% против 60%
• Бенчмарк голосовой поддержки в банковской сфере, доля успешных прохождений — 32% против 12.4%
Прочитайте последнюю строку дважды. Показатель успешного прохождения в 32% — это значительное улучшение по сравнению с 12,4%, но он всё ещё означает, что в той оценке система не справилась примерно с двумя третями задач. Именно скачки в интерактивности и вызовах инструментов описывают по-настоящему другой продукт; а банковская цифра — честная: она показывает, насколько голосовые агенты всё ещё далеки от самостоятельной обработки регулируемого рабочего процесса.
Доказательства от клиентов менее убедительны, чем таблица бенчмарков, и указывают в том же направлении. Yelp использует GPT-Live-1 для бронирования по телефону, а технического директора Алекса Леви цитируют в связи с улучшенной обработкой звонков. Платформа для изучения языков Speak сообщила, что число прерываний сократилось почти на 80% по сравнению с её предыдущей системой с чередованием реплик — это самостоятельно заявленный показатель компании, заинтересованной в результате, и всё же самая конкретная цифра по развёртыванию из доступных.
Голосовой слой — это фронтенд; мозг выбираете вы.
Архитектурная ставка — это делегирование, и именно в эту часть релиза естественно встраивается слой маршрутизации. GPT-Live-1 не занимается глубокими размышлениями. Когда вызывающая сторона запрашивает что-то, что требует рассуждений, поиска информации или инструмента, модель передаёт задачу через асинхронную границу отдельному бэкенду, который продолжает работать, пока идёт голосовой разговор, а затем встраивает ответ обратно, когда он готов.
Конфигурация задана явно, и пример из документации стоит прочитать внимательно. Наряду с model: "gpt-live-1" и инструкциями сессия содержит delegation — объект типа responses, внутренний блок responses которого называет бэкенд-модель, её собственные инструкции, её инструменты — в примере используется web_search — и tool_choice. В опубликованном примере WebRTC от OpenAIOpenAI эта бэкенд-модель — GPT-5.6 Terra.

Вот в чём настоящее заявление этого дизайна: замените бэкенд — и голосовой опыт станет умнее без переобучения речевой модели. Это также означает, что бэкенд делегирования переносим, а голосовой слой — нет. OrcaRouter не предоставляет gpt-live-1 — эндпоинт Live Sessions есть только у OpenAI, и мы его не маршрутизируем. Но половина, отвечающая за делегирование, говорит на языке Responses API, и эту половину вы полностью выбираете сами. GPT-5.6 Terra работает на OrcaRouter по цене из прайс-листа OpenAIOpenAI — 2,00 доллара за миллион входных токенов и 12,00 доллара за миллион выходных, при этом эндпоинт Responses открыт — так что точная модель из примера самой OpenAIOpenAI доступна в один вызов, без второго контракта или SDK.
На практике это превращает выбор бэкенда в настройку. Вы можете провести A/B-тестирование дешёвой reasoning-модели против передовой на живом трафике звонков, изменив одну строку и наблюдая за счётом за каждый звонок, или держать модель делегирования за автоматическим переключением при сбое, чтобы неудачный день у апстрим-провайдера не обрушил вместе с собой вашу телефонную линию. Голосовой слой, за который вы платите $0.05 в минуту, остаётся на месте; всё, что он делегирует, проходит через один ключ по примерно 190 моделям от одиннадцати апстрим-провайдеров, по цене из прайс-листа провайдера с нулевой наценкой.
Чего всё ещё не хватает
• Нет ввода изображений или видео — статические кадры и демонстрация экрана не входят в этот выпуск, поэтому мультимодальный голосовой интерфейс, который по-прежнему имеют старые режимы ChatGPT, остаётся нерешённым
• Никаких структурированных выходных данных — если вашему агенту нужны аргументы инструментов с валидацией по схеме, эта валидация должна выполняться в вашей бэкенд-модели, а не в голосовом слое
• Ни доступа к бесплатному тарифу, ни тонкой настройки — и расходы, и кастомизация начинаются с платных тарифов
• Ни для одного из ключевых показателей нет независимой оценки — все приведённые выше цифры получены от вендора.
Потолок одновременных сессий в 25 на уровне Tier 1 — щедро для пилотного проекта, но жёстко для колл-центра в первый же день работы
Кому следует двигаться, а кому — ждать
Действуйте сейчас, если вы создаёте телефонию — линии бронирования, запись на приём, поддержка первой линии — и ваш текущий стек представляет собой классический каскад ASR → LLM → TTS. Задержка и обработка перебиваний — именно то, что теряет этот конвейер; цену за минуту можно достаточно точно спрогнозировать, чтобы занести в таблицу; а в собственной документации OpenAIOpenAI теперь есть пример сервера в стиле Twilio, с которого можно скопировать. Действуйте сейчас и в том случае, если вы уже используете модель Realtime и ваш продукт действительно диалоговый, а не основан на чередовании реплик, потому что обработка перебиваний — это то, в чём GPT-Realtime-2.1 был хуже всего.
Подождите, если ваша интеграция основана на поочерёдных ходах и уже работает. Переписывание транспортного слоя — это реальная работа, эндпоинт не поддерживает ничего другого, и не существует пути миграции, который сохранил бы ваш существующий код WebSocket. Также подождите, если ваш сценарий использования зависит от структурированных выходных данных инструментов или видеовхода, — и того, и другого здесь нет.
За чем следить в ближайшие несколько недель: первое независимое воспроизведение показателя интерактивности в 80,1%, является ли цена $0,05 вводной, попадёт ли уменьшенная GPT-Live-1 mini в API так же, как она попала на потребительскую сторону, и закроют ли разрыв ввод изображений и экрана. Пока внешняя лаборатория не проведёт эту оценку, честный вывод таков: это самая мощная голосовая модель, которую кто-либо выпускал для разработчиков, а подтверждение этому утверждению написали люди, которые её продают.
