Главная титульная карточка с надписью «GPT-Live-1 против SeedRealtime», подзаголовком «Более амбициозная модель, которую нельзя вызвать» и строкой «Общедоступна в API, а не только в приложении Doubao», над двумя панелями: слева — открытый дверной проём с глифом скобки API и значком «API», справа — тот же дверной проём с перекрывающим его навесным замком и значком «НЕТ API»; на каждой — иконка аудио и камеры, сочетающая звуковую волну с диафрагмой, а в углу скомпонован логотип OrcaRouter.
Guides & Insights

GPT-Live-1 против SeedRealtime: SeedRealtime — более амбициозная модель, и её нельзя купить

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сравнение GPT-Live-1 и SeedRealtime по возможностям даёт неудобный ответ, потому что эти две модели соревнуются не на равных условиях. GPT-Live-1 — это полнодуплексная голосовая модель OpenAI, появившаяся в ChatGPT 8 июля 2026 года и открытая для разработчиков через Live Sessions API 10 сентября 2026 года, с 12 голосами, опубликованной поминутной ставкой и одной существенной брешью: ввод изображений и видео явно не поддерживается. SeedRealtime, выпущенная командой Seed компании ByteDance 5 августа 2026 года, построена целиком вокруг этой бреши. Это нативная аудиовизуальная полнодуплексная модель, которая смотрит, слушает и говорит в рамках единой сквозной архитектуры — и она доступна только внутри потребительского приложения Doubao, без публичного API, без открытых весов, без технического отчёта и без опубликованного числа параметров.

Что каждый из них действительно может воспринимать

Самый наглядный способ увидеть этот разрыв — спросить, что каждая модель знает о комнате, в которой она находится.

GPT-Live-1 слышит. Это и есть вся поверхность ввода. Аудио и текст поступают на вход, аудио и текст выдаются на выходе, а в документации OpenAI изображения и видео указаны как неподдерживаемые. Он чрезвычайно хорошо справляется с разговорной механикой слушания — много раз в секунду решает, продолжать ли слушать, сделать паузу, прервать или вызвать инструмент, — и поддерживает полный дуплекс, поэтому продолжает обрабатывать входящее аудио, пока говорит. Ещё он возвращает транскрипты распознавания речи вместе с аудио — та самая неброская деталь, которая экономит неделю работы над интеграцией.

SeedRealtime слышит и видит — в одной модели, а не в конвейере. ByteDance описывает унифицированную архитектуру, которая обрабатывает аудио, видео и текст вместе, разрешая неоднозначность с помощью визуального контекста — различая омофоны, понимая, к чему относится «это», исходя из сцены, жеста, взгляда и предшествующего действия — и выполняя восприятие, понимание, принятие решений и выражение параллельно, а не последовательно. Опубликованные демонстрации ByteDance включают шумный ужин в компании, где модель должна соотнести голоса с личностями, посещение музея, исправление процесса приготовления эспрессо и подавление помех в аэропорту, одновременно удерживая в памяти информацию за кадром и выполняя поиск в интернете.

• Входные данные — GPT-Live-1: только аудио и текст, изображения и видео явно не поддерживаются, в отличие от SeedRealtime, где аудио, видео и текст объединены в одной модели

• Смена реплик — GPT-Live-1 решает это внутренне, много раз в секунду, тогда как SeedRealtime переносит смену реплик внутрь модели и полностью убирает внешний детектор голосовой активности.

• Проактивное поведение — GPT-Live-1 отвечает, делегирует задачи и вызывает инструменты, тогда как SeedRealtime описывается как подающий голос без запроса, когда в поле зрения появляется целевой объект

• Доступность — GPT-Live-1 общедоступен в API OpenAI за $0,05 в минуту, тогда как SeedRealtime доступен бесплатно внутри Doubao, при этом API отсутствует, и сроки его появления не объявлены

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

Качество доказательств идёт в противоположном направлении от амбиций.

Вот где сравнение перестаёт льстить ByteDance.

OpenAI публикует цифры. Они её собственные: в них GPT-Live-1 сравнивается с GPT-Realtime-2.1, а не с конкурентом, и ни одна независимая лаборатория их не воспроизвела — 80,1% в полнодуплексной интерактивности против 45,4%, задержка при передаче реплики сократилась с 1,4 секунды до 0,8, точность вызова инструментов — с 60% до 87%. Проведённые вендором и невоспроизведённые — это реальная оговорка, и это оговорка, которую вы, по крайней мере, можете привязать к цифре.

ByteDance почти ничего не публикует. Основное утверждение о SeedRealtime — это сквозная человеческая оценка, согласно которой он вдвое снижает проблемы с темпом аудиовизуального диалога по сравнению с каскадными системами ASR + компьютерное зрение + TTS — меньше обрывов на полуслове, меньше медленных ответов после паузы, меньше ложных срабатываний из-за фоновой болтовни. Нет ни размера выборки, ни методологии, ни точной цифры улучшения, и вообще нет числа задержки. Также нет ни количества параметров, ни технического отчёта.

В итоге модель с более интересной архитектурой — это та, которую сложнее всего оценить. Это не то же самое, что утверждать, будто она работает хуже: демонстрации действительно впечатляют, а техническое описание, посвящённое разбитому на фрагменты аудиовизуальному вводу и потоковой генерации, указывает на реальную систему, а не на демо. Но это означает, что любое сравнение этих двух моделей по качеству сейчас представляет собой сравнение между документированной моделью и впечатляющим видео.

Почему пробел в API — это не деталь

SeedRealtime полностью развёрнут внутри Doubao с 5 августа 2026 года — как в голосовом, так и в видеоформате, бесплатно. У него нет эндпоинта Volcano Engine или BytePlus, нет платного тарифа, нет опубликованной квоты и нет объявленных сроков открытия доступа для разработчиков. В дорожной карте ByteDance упоминаются более низкая задержка, более точное отслеживание говорящего и задачи с подключёнными инструментами; дата не упоминается.

Есть оговорка по доступу, которая усугубляет это. Doubao — продукт, ориентированный в первую очередь на материковый Китай, и для регистрации обычно требуется номер мобильного телефона материкового Китая, а локализованная английская версия не объявлена. Для команды за пределами Китая SeedRealtime не просто не выпущен как API — до него нельзя добраться и как до продукта.

Сопоставьте это с собственной интеграционной нагрузкой GPT-Live-1 — и компромисс становится конкретным. API OpenAI узок в некоторых отношениях, которые удивляют людей: один ID модели, один эндпоинт v1/live/sessions, транспорт WebRTC с обработкой событий в канале данных и никакого пути через Chat Completions, Responses, Realtime, Batch или эндпоинты тонкой настройки. Ограничения частоты выражаются в параллельных сессиях — 25 на Tier 1, затем 50, 200, 300 и 500 — а не в запросах в минуту, и уровень Free вообще не может вызывать модель. Это новая интеграция, и всё же это интеграция, которую можно начать уже сегодня днём.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Два ответа на одну и ту же проблему делегирования

Обе модели отвергают старую каскадную схему, в которой распознавание речи, языковая модель и синтез речи работают последовательно, с примерно 1,7 секунды мёртвой тишины между репликами. Они отвергают её по-разному, и эта разница говорит о том, какая из них создана для телефонного звонка, а какая — для комнаты.

GPT-Live-1 разделяет работу по вертикали. Быстрый голосовой слой ведёт разговор; всё, что тяжелее, — веб-поиск, более глубокие рассуждения, агентная работа — передаётся отдельной модели рассуждений через Responses API, пока разговор продолжается. Пример WebRTC, опубликованный Ope​nAI, подключает этот бэкенд к GPT-5.6 Terra. Следствие в том, что мыслящая половина — это обычный вызов текстовой модели, тарифицируемый по токенам, и поэтому то, что можно выбирать, заменять и маршрутизировать независимо от голосового слоя. Для линии поддержки это правильная схема: голос — это интерфейс, а рассуждения — продукт.

SeedRealtime хранит всё в одной сети — именно это позволяет ей наблюдать за жестом, пока предложение ещё не закончено. Это же делает декомпозицию невозможной: нельзя заменить половину, отвечающую за рассуждения, потому что никакой половины, отвечающей за рассуждения, нет, и нельзя запустить её где-либо, потому что запускать её негде.

Если вы создаёте голосового агента сегодня, это различие — и есть всё решение. Только один из этих двух — компонент, который можно поместить в архитектуру. GPT-5.6 Terra, бэкенд в примере делегирования Ope​nAI, обслуживается через OrcaRouter по цене $2.00 за миллион входных токенов и $12.00 за миллион выходных с контекстом в 1 млн токенов и доступными как /v1/chat/completions, так и /v1/responses — наряду с примерно 190 другими моделями на одном ключе, поэтому уровень рассуждений за голосовым агентом можно разделять, тарифицировать и переключать при отказе, не затрагивая аудиотракт. Ни GPT-Live-1, ни SeedRealtime не обслуживаются OrcaRouter; они поставляются исключительно их собственными вендорами, и никакой роутер не может это изменить.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

Что изменило бы ответ?

Три вещи, в порядке вероятности.

• API для разработчиков от ByteDance. Если SeedRealtime появится на Volcano Engine или BytePlus с опубликованным тарифом, он перестанет быть кейсом и станет по-настоящему дифференцированным продуктом — полнодуплексная аудиовизуальная связь, у которой нет хостингового конкурента на Западе. Вот за каким сигналом стоит следить, и он так и не появился.

• Появление визуальных возможностей в хостируемом голосовом API. В документации GPT-Live-1 прямо указано, что изображения и видео не поддерживаются, и это читается не столько как недосмотр, сколько как намеренная граница первого релиза. Если Ope​nAI выпустит видеофункцию, которую она демонстрировала в других частях ChatGPT, разрыв в возможностях, который делает SeedRealtime интересным, существенно сократится.

• Любое независимое измерение SeedRealtime. Показатель задержки от третьей стороны или количество параметров позволили бы сравнить их по чему-то иному, кроме амбиций.

Практический вывод для тех, кто создаёт сейчас, короток. GPT-Live-1 — единственный из этих двух, который вы можете развернуть, и при цене $0.05 в минуту с посекундной оплатой, с двенадцатью голосами и документированным эндпоинтом это разумный вариант по умолчанию для голосового общения. SeedRealtime — более интересная модель и вполне может оказаться более способной; но на данный момент это ещё и демонстрация того, как выглядит конвергентная аудиовизуальная архитектура, а не продукт, который можно предъявить клиенту. Отнесите её к тому, за чем стоит наблюдать, а не к тому, на чём стоит строить.