
GPT-Live-1 против Breeze TTS 2: голосовой лидер с открытыми весами, который нельзя выпустить
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Breeze TTS 2 — это получившая наивысший рейтинг модель преобразования текста в речь с открытыми весами в Provider Voices Speech Arena от Artificial Analysis: 1 205 баллов Elo и седьмое место в общем зачёте среди более чем сотни оценённых систем — опережая все коммерчески лицензируемые движки, публикующие свои веса. Её веса доступны для скачивания с 25 августа 2026 года. Кроме того, по лицензии, с которой поставляются эти веса, её нельзя использовать в продукте. GPT-Live-1 — это полная противоположность по всем параметрам: закрытая, размещаемая на хостинге, тарифицируемая по $0,05 за минуту голоса с момента появления в API для разработчиков OpenAI 10 сентября 2026 года, и единственная из двух, которая способна услышать, что звонящий перебивает её.
Поставьте эти два предложения рядом — и сравнение разрешится быстрее, чем большинство сопоставлений моделей. Это не спор о том, кто лучше синтезирует речь. Это спор о том, покупаете ли вы голос или разговор, и о том, означает ли «открытый» то, что вы предполагали.
Они не одного и того же рода, и в этом-то и суть.
Breeze TTS 2 от примерно пятнадцатиpersonного стартапа BreezeBlue — это модель синтеза речи с 3 миллиардами параметров. На входе текст, на выходе аудио. Она ничего не слышит. У неё нет мнения о том, когда должна заканчиваться реплика, потому что у неё нет понятия реплики. При потоковой передаче через WebSocket она начинает выдавать аудио ещё до того, как ваш текст закончит генерироваться, что действительно полезно для поддержания чёткого темпа голосового агента, — но решение о том, когда говорить, принял тот, кто написал текст.
GPT-Live-1 — это полнодуплексная модель речи в речь. Аудио и текст поступают на вход; аудио и текст выдаются на выходе; и модель много раз в секунду решает, продолжать ли слушать, сделать паузу, взять ход или уступить его. Собственные показатели OpenAI по Full Duplex Bench v1.5, опубликованные вместе с релизом и не воспроизведённые за пределами компании, оценивают её интерактивность в 80,1% против 45,4% у GPT-Realtime-2.1, а задержка смены хода составляет 0,798 секунды против 1,41.
Эта асимметрия — не упрёк Breeze TTS 2. Это предостережение о том, где каждому из них место в стеке. Если вы строите каскад — распознавание речи подаёт данные в языковую модель, а та — в синтезатор, — Breeze TTS 2 является кандидатом на последнюю его треть. Если вы покупаете GPT-Live-1, вы покупаете весь цикл и вместе с ним передаёте логику смены реплик.
Измерение за измерением
• Модель взаимодействия — GPT-Live-1: полный дуплекс, нативное перебивание, слушает, пока говорит, против Breeze TTS 2: потоковый синтез речи, вообще без аудиовхода
• Веса — GPT-Live-1: закрытая модель, доступна только через хостинг, один ID модели и никаких датированных снапшотов, против Breeze TTS 2: 3 млрд параметров на Hugging Face с 25 августа 2026 года, код инференса на PyTorch под Apache-2.0
• Лицензия — GPT-Live-1: коммерческие условия через API OpenAI, нечего проверять, в отличие от Breeze TTS 2: исследовательская и некоммерческая лицензия, охватывающая веса, файнтюны, LoRA, объединения, квантизации и результаты самостоятельного хостинга
• Единица цены — GPT-Live-1: $0.05 за голосовую минуту, тарифицируется посекундно, бэкенд рассуждений тарифицируется отдельно, в сравнении с Breeze TTS 2: $34 за миллион символов на размещённом эндпоинте, с понижением до $28 на высшем опубликованном тарифе
• Доказательства качества — GPT-Live-1: 70,3% в Artificial Analysis Speech to Speech Index, делит шестое место среди четырнадцати оценённых моделей; против Breeze TTS 2: 1 205 Elo на арене Provider Voices, седьмое место в общем зачёте и первое среди моделей с открытыми весами, по данным Artificial Analysis.
• Языки — GPT-Live-1: в материалах о запуске неизменно отмечается неравномерная беглость за пределами основных языков по сравнению с Breeze TTS 2: 50 языков, заявленных вендором, при этом в карточке модели указаны английский и китайский.
Управление голосом — GPT-Live-1: двенадцать голосов API, тон и темп задаются промптом, клонирование полностью отсутствует, в отличие от Breeze TTS 2: клонирование по эталонному аудио, создание голоса без эталона, управление голосом и встроенные вокальные события
• Пропускная способность — GPT-Live-1: измеряется по числу одновременных сессий, ограничена 25 на уровне 1 и 500 на уровне 5, без бесплатного уровня, против Breeze TTS 2: примерно 45 символов в секунду по измерению Artificial Analysis, что медленнее, чем у нескольких коммерческих конкурентов, и важно для работы с длинными текстами

Лицензия выполняет больше работы, чем таблица лидеров.
В собственной карточке модели BreezeBlue об этом говорится на удивление прямо, что делает честь компании. Код инференса распространяется под лицензией Apache-2.0. Веса и любые результаты, которые вы генерируете при их самостоятельном хостинге, предназначены для исследовательского использования, а для коммерческого развёртывания требуется либо платная подписка на хостинг, либо письменное разрешение. Это ограничение явно распространяется на производные модели, LoRA, слияния и квантования — что закрывает лазейку, к которой обычно прибегают люди.
Так что позиционированию «лидер по открытым весам» нужна оговорка, которой почти не бывает в заголовках. Breeze TTS 2 открыт в том смысле, что вы можете скачать его, изучить, прогнать бенчмарки и запустить на собственном оборудовании для оценки. Он не открыт в том смысле, который позволил бы стартапу построить на нём продукт, не платя BreezeBlue и не оплачивая юридическую проверку. Две из трёх вещей, которые люди подразумевают под открытыми весами — проверяемость и стоимость — вы получаете. Третью — свободу выпускать продукт — вы не получаете.
Это существенное отличие от такой модели, как GPT-Live-1, где вопрос о лицензии не «могу ли я», а «сколько». В обоих случаях в итоге выставляется счёт. Но только в одном из них сначала появляется заключение юриста.

Две ценовые единицы несопоставимы, так что вот арифметика.
$0,05 в минуту и $34 за миллион символов выглядят так, будто они из разных вселенных, — потому что так оно и есть. Чтобы их сравнить, нужно пересчитать. Речь звучит примерно со скоростью 150 слов в минуту, а в английском в среднем около пяти с половиной символов на слово с учётом пробелов, так что минута устной речи — это примерно 800–900 символов. При цене Breeze TTS 2 в $34 за миллион это около трёх центов за минуту синтеза — дешевле, чем пять центов у GPT-Live-1, если считать по чистой речи.
Сравнение тут же рассыпается, потому что пять центов GPT-Live-1 включают и прослушивание. Он также транскрибирует речь звонящего, определяет, когда заканчивается реплика, и управляет перебиванием — работу, которую каскаду приходится покупать на стороне: модель распознавания речи, модель определения конца реплики и языковую модель, создающую текст, который будет читать Breeze TTS 2. Добавьте их — и три цента за синтез в каскаде окажутся лишь статьёй в счёте, который обычно больше, чем у сквозной модели.
Честный итог таков: более дешёвый голос — это Breeze TTS 2, а более дешёвый разговор — GPT-Live-1, и разница между этими двумя утверждениями — это и есть всё, во что на самом деле обходится голосовой агент.

Где они действительно встретились бы
Команда, которая сегодня создаёт телефонного агента и не хочет привязываться к сквозному стеку одного поставщика, собрала бы именно такую цепочку: Breeze TTS 2 или сравнимый движок для «рта», что-то другое для «ушей» и маршрутизируемая языковая модель для «мышления». Последний из этих трёх компонентов меняется чаще всего — именно там качество растёт быстрее всего, затраты варьируются сильнее всего, и именно там модель, выигрывающая в этом квартале, редко выигрывает в следующем.
Этот слой — обычный вызов API, и именно эту часть всего стека стоит сохранять переносимой. Примерно 190 моделей от одиннадцати вышестоящих провайдеров доступны через единственный ключ OrcaRouter по прайс-листовой цене провайдера без наценки, так что замена модели рассуждений за голосовым агентом — это изменение конфигурации, а не проект по интеграции, а автоматическое переключение при сбое не даёт бэкенду с таймаутом сбросить звонок. Ни конечная точка Live Sessions у GPT-Live-1, ни хостинговый API Breeze TTS 2 недоступны таким способом — голосовые слои в этом сравнении находятся вне досягаемости слоя маршрутизации, и об этом стоит сказать прямо, а не намекать на обратное.
Какой выбрать?
Выбирайте GPT-Live-1, если разговор — это и есть продукт и вы готовы принять хостируемый закрытый интерфейс. Линии бронирования, первая линия поддержки — всё, где звонящий перебивает агента как обычное событие, а не исключение. Вы покупаете обработку прерываний и покупаете её по поминутной ставке, которая остаётся предсказуемой, тогда как логика, стоящая за этим, — это то, что вы настраиваете.
Выбирайте Breeze TTS 2, если вам нужен голос, который можно изучить, если вы создаёте продукт, где синтез — лишь один компонент из многих, или если вам нужны клонирование и дизайн голоса, которые GPT-Live-1 вообще не предлагает. Учитывайте, что веса предназначены для исследований, что заявление о 50 языках — это заявление поставщика, тогда как карточка помечена только для двух языков, и что показатели задержки — это собственные измерения BreezeBlue на прогретом быстром пути, а не независимый аудит.
Инстинкт относиться к этому как к соревнованию по качеству — неправильный инстинкт. Breeze TTS 2 находится почти на вершине той турнирной таблицы, в которой он соревнуется, а GPT-Live-1 соревнуется в совершенно другой турнирной таблице. Решение, которое действительно стоит денег, лежит в основе и того, и другого: какая модель выполняет мыслительную работу и можете ли вы передумать насчёт этого за полдня.
