
GPT-Live-1 против SeedRealtime: SeedRealtime — более амбициозная модель, и её нельзя купить
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Сравнение GPT-Live-1 и SeedRealtime по возможностям даёт неудобный ответ, потому что эти две модели соревнуются не на равных условиях. GPT-Live-1 — это полнодуплексная голосовая модель OpenAI, появившаяся в ChatGPT 8 июля 2026 года и открытая для разработчиков через Live Sessions API 10 сентября 2026 года, с 12 голосами, опубликованной поминутной ставкой и одной существенной брешью: ввод изображений и видео явно не поддерживается. SeedRealtime, выпущенная командой Seed компании ByteDance 5 августа 2026 года, построена целиком вокруг этой бреши. Это нативная аудиовизуальная полнодуплексная модель, которая смотрит, слушает и говорит в рамках единой сквозной архитектуры — и она доступна только внутри потребительского приложения Doubao, без публичного API, без открытых весов, без технического отчёта и без опубликованного числа параметров.
Что каждый из них действительно может воспринимать
Самый наглядный способ увидеть этот разрыв — спросить, что каждая модель знает о комнате, в которой она находится.
GPT-Live-1 слышит. Это и есть вся поверхность ввода. Аудио и текст поступают на вход, аудио и текст выдаются на выходе, а в документации OpenAI изображения и видео указаны как неподдерживаемые. Он чрезвычайно хорошо справляется с разговорной механикой слушания — много раз в секунду решает, продолжать ли слушать, сделать паузу, прервать или вызвать инструмент, — и поддерживает полный дуплекс, поэтому продолжает обрабатывать входящее аудио, пока говорит. Ещё он возвращает транскрипты распознавания речи вместе с аудио — та самая неброская деталь, которая экономит неделю работы над интеграцией.
SeedRealtime слышит и видит — в одной модели, а не в конвейере. ByteDance описывает унифицированную архитектуру, которая обрабатывает аудио, видео и текст вместе, разрешая неоднозначность с помощью визуального контекста — различая омофоны, понимая, к чему относится «это», исходя из сцены, жеста, взгляда и предшествующего действия — и выполняя восприятие, понимание, принятие решений и выражение параллельно, а не последовательно. Опубликованные демонстрации ByteDance включают шумный ужин в компании, где модель должна соотнести голоса с личностями, посещение музея, исправление процесса приготовления эспрессо и подавление помех в аэропорту, одновременно удерживая в памяти информацию за кадром и выполняя поиск в интернете.
• Входные данные — GPT-Live-1: только аудио и текст, изображения и видео явно не поддерживаются, в отличие от SeedRealtime, где аудио, видео и текст объединены в одной модели
• Смена реплик — GPT-Live-1 решает это внутренне, много раз в секунду, тогда как SeedRealtime переносит смену реплик внутрь модели и полностью убирает внешний детектор голосовой активности.
• Проактивное поведение — GPT-Live-1 отвечает, делегирует задачи и вызывает инструменты, тогда как SeedRealtime описывается как подающий голос без запроса, когда в поле зрения появляется целевой объект
• Доступность — GPT-Live-1 общедоступен в API OpenAI за $0,05 в минуту, тогда как SeedRealtime доступен бесплатно внутри Doubao, при этом API отсутствует, и сроки его появления не объявлены

Качество доказательств идёт в противоположном направлении от амбиций.
Вот где сравнение перестаёт льстить ByteDance.
OpenAI публикует цифры. Они её собственные: в них GPT-Live-1 сравнивается с GPT-Realtime-2.1, а не с конкурентом, и ни одна независимая лаборатория их не воспроизвела — 80,1% в полнодуплексной интерактивности против 45,4%, задержка при передаче реплики сократилась с 1,4 секунды до 0,8, точность вызова инструментов — с 60% до 87%. Проведённые вендором и невоспроизведённые — это реальная оговорка, и это оговорка, которую вы, по крайней мере, можете привязать к цифре.
ByteDance почти ничего не публикует. Основное утверждение о SeedRealtime — это сквозная человеческая оценка, согласно которой он вдвое снижает проблемы с темпом аудиовизуального диалога по сравнению с каскадными системами ASR + компьютерное зрение + TTS — меньше обрывов на полуслове, меньше медленных ответов после паузы, меньше ложных срабатываний из-за фоновой болтовни. Нет ни размера выборки, ни методологии, ни точной цифры улучшения, и вообще нет числа задержки. Также нет ни количества параметров, ни технического отчёта.
В итоге модель с более интересной архитектурой — это та, которую сложнее всего оценить. Это не то же самое, что утверждать, будто она работает хуже: демонстрации действительно впечатляют, а техническое описание, посвящённое разбитому на фрагменты аудиовизуальному вводу и потоковой генерации, указывает на реальную систему, а не на демо. Но это означает, что любое сравнение этих двух моделей по качеству сейчас представляет собой сравнение между документированной моделью и впечатляющим видео.
Почему пробел в API — это не деталь
SeedRealtime полностью развёрнут внутри Doubao с 5 августа 2026 года — как в голосовом, так и в видеоформате, бесплатно. У него нет эндпоинта Volcano Engine или BytePlus, нет платного тарифа, нет опубликованной квоты и нет объявленных сроков открытия доступа для разработчиков. В дорожной карте ByteDance упоминаются более низкая задержка, более точное отслеживание говорящего и задачи с подключёнными инструментами; дата не упоминается.
Есть оговорка по доступу, которая усугубляет это. Doubao — продукт, ориентированный в первую очередь на материковый Китай, и для регистрации обычно требуется номер мобильного телефона материкового Китая, а локализованная английская версия не объявлена. Для команды за пределами Китая SeedRealtime не просто не выпущен как API — до него нельзя добраться и как до продукта.
Сопоставьте это с собственной интеграционной нагрузкой GPT-Live-1 — и компромисс становится конкретным. API OpenAI узок в некоторых отношениях, которые удивляют людей: один ID модели, один эндпоинт v1/live/sessions, транспорт WebRTC с обработкой событий в канале данных и никакого пути через Chat Completions, Responses, Realtime, Batch или эндпоинты тонкой настройки. Ограничения частоты выражаются в параллельных сессиях — 25 на Tier 1, затем 50, 200, 300 и 500 — а не в запросах в минуту, и уровень Free вообще не может вызывать модель. Это новая интеграция, и всё же это интеграция, которую можно начать уже сегодня днём.

Два ответа на одну и ту же проблему делегирования
Обе модели отвергают старую каскадную схему, в которой распознавание речи, языковая модель и синтез речи работают последовательно, с примерно 1,7 секунды мёртвой тишины между репликами. Они отвергают её по-разному, и эта разница говорит о том, какая из них создана для телефонного звонка, а какая — для комнаты.
GPT-Live-1 разделяет работу по вертикали. Быстрый голосовой слой ведёт разговор; всё, что тяжелее, — веб-поиск, более глубокие рассуждения, агентная работа — передаётся отдельной модели рассуждений через Responses API, пока разговор продолжается. Пример WebRTC, опубликованный OpenAI, подключает этот бэкенд к GPT-5.6 Terra. Следствие в том, что мыслящая половина — это обычный вызов текстовой модели, тарифицируемый по токенам, и поэтому то, что можно выбирать, заменять и маршрутизировать независимо от голосового слоя. Для линии поддержки это правильная схема: голос — это интерфейс, а рассуждения — продукт.
SeedRealtime хранит всё в одной сети — именно это позволяет ей наблюдать за жестом, пока предложение ещё не закончено. Это же делает декомпозицию невозможной: нельзя заменить половину, отвечающую за рассуждения, потому что никакой половины, отвечающей за рассуждения, нет, и нельзя запустить её где-либо, потому что запускать её негде.
Если вы создаёте голосового агента сегодня, это различие — и есть всё решение. Только один из этих двух — компонент, который можно поместить в архитектуру. GPT-5.6 Terra, бэкенд в примере делегирования OpenAI, обслуживается через OrcaRouter по цене $2.00 за миллион входных токенов и $12.00 за миллион выходных с контекстом в 1 млн токенов и доступными как /v1/chat/completions, так и /v1/responses — наряду с примерно 190 другими моделями на одном ключе, поэтому уровень рассуждений за голосовым агентом можно разделять, тарифицировать и переключать при отказе, не затрагивая аудиотракт. Ни GPT-Live-1, ни SeedRealtime не обслуживаются OrcaRouter; они поставляются исключительно их собственными вендорами, и никакой роутер не может это изменить.

Что изменило бы ответ?
Три вещи, в порядке вероятности.
• API для разработчиков от ByteDance. Если SeedRealtime появится на Volcano Engine или BytePlus с опубликованным тарифом, он перестанет быть кейсом и станет по-настоящему дифференцированным продуктом — полнодуплексная аудиовизуальная связь, у которой нет хостингового конкурента на Западе. Вот за каким сигналом стоит следить, и он так и не появился.
• Появление визуальных возможностей в хостируемом голосовом API. В документации GPT-Live-1 прямо указано, что изображения и видео не поддерживаются, и это читается не столько как недосмотр, сколько как намеренная граница первого релиза. Если OpenAI выпустит видеофункцию, которую она демонстрировала в других частях ChatGPT, разрыв в возможностях, который делает SeedRealtime интересным, существенно сократится.
• Любое независимое измерение SeedRealtime. Показатель задержки от третьей стороны или количество параметров позволили бы сравнить их по чему-то иному, кроме амбиций.
Практический вывод для тех, кто создаёт сейчас, короток. GPT-Live-1 — единственный из этих двух, который вы можете развернуть, и при цене $0.05 в минуту с посекундной оплатой, с двенадцатью голосами и документированным эндпоинтом это разумный вариант по умолчанию для голосового общения. SeedRealtime — более интересная модель и вполне может оказаться более способной; но на данный момент это ещё и демонстрация того, как выглядит конвергентная аудиовизуальная архитектура, а не продукт, который можно предъявить клиенту. Отнесите её к тому, за чем стоит наблюдать, а не к тому, на чём стоит строить.
