Главная титульная карточка с надписью «GPT-Live-1 выходит в API», подзаголовком «$0.05 в минуту за полнодуплексный голос» и строкой «Модель — от 8 июля 2026 года; API для разработчиков выпущен 10 сентября 2026 года», рядом две перекрывающиеся звуковые волны со стрелками, изгибающимися в обоих направлениях, а в углу наложен логотип OrcaRouter.
Guides & Insights

GPT-Live-1 добирается до API: полнодуплексный голос за 0,05 доллара в минуту, без возможности простой замены с GPT-Realtime-2.1

Автор

Magnus Corvin

Дата публикации

Назад ко всем статьям

GPT-Live-1 доступен в API с 10 сентября, и цифра, которая действительно изменит бюджеты, — это не бенчмарк, а единица тарификации. Полнодуплексная голосовая модель OpenAI теперь тарифицируется по фиксированной ставке $0.05 за минуту голоса, с посекундной оплатой, тогда как модель, с которой её сравнивают, GPT-Realtime-2.1, измерялась в аудиотокенах: $32 за миллион на входе и $64 за миллион на выходе. Сама модель не нова: GPT-Live-1 появилась в ChatGPT 8 июля 2026 года как замена Advanced Voice Mode. Новое в том, что разработчики наконец могут вызывать её — и в том, что такой вызов почти не похож на интеграцию с Realtime, которая уже есть у большинства команд. В собственной документации OpenAI голосовой слой идёт в паре с отдельным бэкендом рассуждений, и в опубликованном примере WebRTC этим бэкендом выступает GPT-5.6 Terra.

Что вышло 10 сентября, а что — нет

Поверхность API намеренно узкая. Есть ровно один ID модели — gpt-live-1, который также является её собственным снапшотом по умолчанию: никаких датированных вариантов, которые можно было бы закрепить. Есть ровно один эндпоинт — эндпоинт Live Sessions по адресу v1/live/sessions. Всё остальное на платформе OpenAI для этой модели отключено: нет ни Chat Completions, ни Responses, ни Realtime (включая варианты перевода и транскрипции), ни Assistants, ни Batch, ни дообучения, ни эмбеддингов, ни генерации изображений или видео, ни эндпоинтов синтеза речи или транскрипции аудио, ни модерации.

Входные и выходные данные — это аудио и текст. Потоковая передача и вызов функций поддерживаются; структурированные выходные данные, тонкая настройка и предсказанные выходные данные — нет. Ввод изображений и видео явно не поддерживается — поэтому возможность «голос с видео», на которую намекала OpenAIOpe​nAI, не входит в этот релиз. Бесплатный уровень вообще не может его вызывать, а ограничения скорости измеряются в одновременных сессиях, а не в запросах в минуту: 25 на уровне 1, возрастая до 50, 200, 300 и 500 на уровнях со 2 по 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Такая привязка к параллельности — первая подсказка, что это не замена, которую можно просто подключить. Ограничения скорости, выраженные в одновременных активных разговорах, говорят о том, какую единицу масштабирования ожидает OpenAIOpe​nAI: телефонную линию, а не запрос.

Изменение цен — это более тихая, но более значимая история.

Фиксированная поминутная оплата — это действительно иной подход. При тарификации по токенам вам приходилось моделировать расход аудиотокенов — сколько токенов стоит секунда тишины, как звонящий, который постоянно перебивает агента, меняет длину вывода — прежде чем спрогнозировать хотя бы один звонок. При $0.05 за минуту вся арифметика сводится к умножению:

• 5-минутный звонок в службу поддержки — $0.25 за голосовое время

• 10-минутный звонок — $0.50

• В среднем 4 минуты на 1 000 звонков в день — 200 долларов в день, примерно 6 000 долларов в месяц

• Один час непрерывной открытой линии — $3.00

Три детали делают эту картину точнее. Во-первых, длительность не округляется вверх до следующей целой минуты, поэтому 40-секундный звонок стоит около 3,3 цента, а не целых пять центов. Во-вторых, инициализация сессии тарифицирует 15 секунд голосовой длительности авансом — но эта сумма засчитывается в счёт последующих списаний за длительность, а не добавляется сверху, поэтому звонок короче 15 секунд всё равно тарифицируется как 15-секундный. В-третьих, голос — это лишь половина счёта. Модель рассуждений на бэкенде, её вызовы инструментов и любой веб-поиск тарифицируются отдельно по обычным тарифам этой модели; это значит, что «дешёвая голосовая модель» всё равно может обернуться дорогим звонком, если вы направляете делегирование на передовую модель рассуждений и позволяете ей искать на каждом ходу.

Эта двухметровая конструкция — как раз то место, где маршрутизация перестаёт быть просто приятным довеском. В OrcaRouter бэкенд-половина сессии GPT-Live-1 — это всего лишь ещё один вызов модели: примерно 190 моделей от одиннадцати вышестоящих провайдеров за одним ключом, по прайс-листовой цене провайдера, переданной без единой наценки, и с автоматическим переключением, если выбранный бэкенд выдаст ошибку или не ответит вовремя. Сам голосовой слой маршрутизировать нельзя — эндпоинт Live Sessions есть только у OpenAIOpe​nAI. А вот всё, что голосовой слой делегирует, маршрутизировать вполне можно, и именно эта половина масштабируется в зависимости от того, насколько напряжённо думают ваши звонящие.

Только WebRTC — почему ваш код Realtime не удастся портировать

Вот практическая цена перехода, и большинство материалов о запуске это упускают. Сессии GPT-Live-1 работают через WebRTC, а не через транспорт WebSocket, на котором построено множество существующих интеграций Realtime. Проверка старого пути с идентификатором модели GPT-Live возвращает ошибку, прямо сообщающую, что для сессий требуется WebRTC.

Рукопожатие, согласно руководству OpenAIOpe​nAI по WebRTC: ваш браузер открывает RTCPeerConnection, добавляет дорожки микрофона, открывает канал данных и регистрирует слушателей перед отправкой оффера, задаёт локальное описание, ждёт сбора ICE и отправляет оффер на ваш собственный сервер. Затем ваш сервер вызывает POST /v1/live/sessions с конфигурацией сессии и transport: { type: "webrtc", sdp: ... }. При успехе возвращается HTTP 201, содержащий session.id и transport.sdp, которое браузер применяет как удалённое описание. Медиа передаётся по согласованным дорожкам; канал данных — метка oai-events — переносит транскрипты, обновления сессии и делегированную работу. Чтобы завершить соединение, вы отправляете session.close и продолжаете читать, пока не придёт session.closed.

Два подводных камня, которые стоит приклеить к монитору. Сам HTTP-вызов запускает сессию, поэтому вы не должны также отправлять session.start по каналу данных. И не следует добавлять входное аудио или ждать дельт выходного аудио по этому каналу — оставьте audio.format вне конфигурации, и пусть SDP обрабатывает это. В примерах сервера тело запроса ограничено 64 КБ, сбор ICE завершается по тайм-ауту через 10 секунд, а финализация сессии — через 15.

Ничто из этого не сложно. Всё это — новый код. Если ваш продукт — это реалтайм-агент, работающий по ходам, то миграция на GPT-Live-1 — это переписывание транспорта плюс переписывание делегирования, а не замена идентификатора модели — на это стоит закладывать спринт, а не полдня.

Бенчмарки, и кто провёл каждый из них

Каждый приведённый ниже показатель принадлежит самой OpenAIOpe​nAI, опубликован вместе с релизом API и на момент написания никем независимо не воспроизводился. Эта оговорка здесь важнее, чем обычно, потому что различия достаточно велики и так и просятся, чтобы их процитировали как установленный факт.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Полнодуплексное взаимодействие — GPT-Live-1 80.1% против 45.4% у GPT-Realtime-2.1

• Задержка смены реплик — 0,8 с против 1,4 с

• Точность вызова инструментов — 87% против 60%

• Бенчмарк голосовой поддержки в банковской сфере, доля успешных прохождений — 32% против 12.4%

Прочитайте последнюю строку дважды. Показатель успешного прохождения в 32% — это значительное улучшение по сравнению с 12,4%, но он всё ещё означает, что в той оценке система не справилась примерно с двумя третями задач. Именно скачки в интерактивности и вызовах инструментов описывают по-настоящему другой продукт; а банковская цифра — честная: она показывает, насколько голосовые агенты всё ещё далеки от самостоятельной обработки регулируемого рабочего процесса.

Доказательства от клиентов менее убедительны, чем таблица бенчмарков, и указывают в том же направлении. Yelp использует GPT-Live-1 для бронирования по телефону, а технического директора Алекса Леви цитируют в связи с улучшенной обработкой звонков. Платформа для изучения языков Speak сообщила, что число прерываний сократилось почти на 80% по сравнению с её предыдущей системой с чередованием реплик — это самостоятельно заявленный показатель компании, заинтересованной в результате, и всё же самая конкретная цифра по развёртыванию из доступных.

Голосовой слой — это фронтенд; мозг выбираете вы.

Архитектурная ставка — это делегирование, и именно в эту часть релиза естественно встраивается слой маршрутизации. GPT-Live-1 не занимается глубокими размышлениями. Когда вызывающая сторона запрашивает что-то, что требует рассуждений, поиска информации или инструмента, модель передаёт задачу через асинхронную границу отдельному бэкенду, который продолжает работать, пока идёт голосовой разговор, а затем встраивает ответ обратно, когда он готов.

Конфигурация задана явно, и пример из документации стоит прочитать внимательно. Наряду с model: "gpt-live-1" и инструкциями сессия содержит delegation — объект типа responses, внутренний блок responses которого называет бэкенд-модель, её собственные инструкции, её инструменты — в примере используется web_search — и tool_choice. В опубликованном примере WebRTC от OpenAI​OpenAI эта бэкенд-модель — GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

Вот в чём настоящее заявление этого дизайна: замените бэкенд — и голосовой опыт станет умнее без переобучения речевой модели. Это также означает, что бэкенд делегирования переносим, а голосовой слой — нет. OrcaRouter не предоставляет gpt-live-1 — эндпоинт Live Sessions есть только у OpenAI, и мы его не маршрутизируем. Но половина, отвечающая за делегирование, говорит на языке Responses API, и эту половину вы полностью выбираете сами. GPT-5.6 Terra работает на OrcaRouter по цене из прайс-листа OpenAIOpe​nAI — 2,00 доллара за миллион входных токенов и 12,00 доллара за миллион выходных, при этом эндпоинт Responses открыт — так что точная модель из примера самой OpenAIOpe​nAI доступна в один вызов, без второго контракта или SDK.

На практике это превращает выбор бэкенда в настройку. Вы можете провести A/B-тестирование дешёвой reasoning-модели против передовой на живом трафике звонков, изменив одну строку и наблюдая за счётом за каждый звонок, или держать модель делегирования за автоматическим переключением при сбое, чтобы неудачный день у апстрим-провайдера не обрушил вместе с собой вашу телефонную линию. Голосовой слой, за который вы платите $0.05 в минуту, остаётся на месте; всё, что он делегирует, проходит через один ключ по примерно 190 моделям от одиннадцати апстрим-провайдеров, по цене из прайс-листа провайдера с нулевой наценкой.

Чего всё ещё не хватает

• Нет ввода изображений или видео — статические кадры и демонстрация экрана не входят в этот выпуск, поэтому мультимодальный голосовой интерфейс, который по-прежнему имеют старые режимы ChatGPT, остаётся нерешённым

• Никаких структурированных выходных данных — если вашему агенту нужны аргументы инструментов с валидацией по схеме, эта валидация должна выполняться в вашей бэкенд-модели, а не в голосовом слое

• Ни доступа к бесплатному тарифу, ни тонкой настройки — и расходы, и кастомизация начинаются с платных тарифов

• Ни для одного из ключевых показателей нет независимой оценки — все приведённые выше цифры получены от вендора.

Потолок одновременных сессий в 25 на уровне Tier 1 — щедро для пилотного проекта, но жёстко для колл-центра в первый же день работы

Кому следует двигаться, а кому — ждать

Действуйте сейчас, если вы создаёте телефонию — линии бронирования, запись на приём, поддержка первой линии — и ваш текущий стек представляет собой классический каскад ASR → LLM → TTS. Задержка и обработка перебиваний — именно то, что теряет этот конвейер; цену за минуту можно достаточно точно спрогнозировать, чтобы занести в таблицу; а в собственной документации OpenAIOpe​nAI теперь есть пример сервера в стиле Twilio, с которого можно скопировать. Действуйте сейчас и в том случае, если вы уже используете модель Realtime и ваш продукт действительно диалоговый, а не основан на чередовании реплик, потому что обработка перебиваний — это то, в чём GPT-Realtime-2.1 был хуже всего.

Подождите, если ваша интеграция основана на поочерёдных ходах и уже работает. Переписывание транспортного слоя — это реальная работа, эндпоинт не поддерживает ничего другого, и не существует пути миграции, который сохранил бы ваш существующий код WebSocket. Также подождите, если ваш сценарий использования зависит от структурированных выходных данных инструментов или видеовхода, — и того, и другого здесь нет.

За чем следить в ближайшие несколько недель: первое независимое воспроизведение показателя интерактивности в 80,1%, является ли цена $0,05 вводной, попадёт ли уменьшенная GPT-Live-1 mini в API так же, как она попала на потребительскую сторону, и закроют ли разрыв ввод изображений и экрана. Пока внешняя лаборатория не проведёт эту оценку, честный вывод таков: это самая мощная голосовая модель, которую кто-либо выпускал для разработчиков, а подтверждение этому утверждению написали люди, которые её продают.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube