Титульная карточка героя для «GPT-Live-1 против Breeze TTS 2» с подзаголовком «Разговор или голос — и только один из них — счёт», с тремя карточками, текст на которых гласит: «GPT-Live-1: $0.05 за голосовую минуту, без весов, слышит, пока говорит», «Breeze TTS 2: 3B открытых весов, 1 205 Elo, только исследовательская лицензия», «Здесь решает лицензия, а не Elo», над нижней полосой с надписью «Показатели арены Breeze TTS 2 по данным Artificial Analysis; показатели GPT-Live-1 по данным OpenAI». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

GPT-Live-1 против Breeze TTS 2: голосовой лидер с открытыми весами, который нельзя выпустить

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Breeze TTS 2 — это получившая наивысший рейтинг модель преобразования текста в речь с открытыми весами в Provider Voices Speech Arena от Artificial Analysis: 1 205 баллов Elo и седьмое место в общем зачёте среди более чем сотни оценённых систем — опережая все коммерчески лицензируемые движки, публикующие свои веса. Её веса доступны для скачивания с 25 августа 2026 года. Кроме того, по лицензии, с которой поставляются эти веса, её нельзя использовать в продукте. GPT-Live-1 — это полная противоположность по всем параметрам: закрытая, размещаемая на хостинге, тарифицируемая по $0,05 за минуту голоса с момента появления в API для разработчиков OpenAI 10 сентября 2026 года, и единственная из двух, которая способна услышать, что звонящий перебивает её.

Поставьте эти два предложения рядом — и сравнение разрешится быстрее, чем большинство сопоставлений моделей. Это не спор о том, кто лучше синтезирует речь. Это спор о том, покупаете ли вы голос или разговор, и о том, означает ли «открытый» то, что вы предполагали.

Они не одного и того же рода, и в этом-то и суть.

Breeze TTS 2 от примерно пятнадцатиpersonного стартапа BreezeBlue — это модель синтеза речи с 3 миллиардами параметров. На входе текст, на выходе аудио. Она ничего не слышит. У неё нет мнения о том, когда должна заканчиваться реплика, потому что у неё нет понятия реплики. При потоковой передаче через WebSocket она начинает выдавать аудио ещё до того, как ваш текст закончит генерироваться, что действительно полезно для поддержания чёткого темпа голосового агента, — но решение о том, когда говорить, принял тот, кто написал текст.

GPT-Live-1 — это полнодуплексная модель речи в речь. Аудио и текст поступают на вход; аудио и текст выдаются на выходе; и модель много раз в секунду решает, продолжать ли слушать, сделать паузу, взять ход или уступить его. Собственные показатели OpenAI по Full Duplex Bench v1.5, опубликованные вместе с релизом и не воспроизведённые за пределами компании, оценивают её интерактивность в 80,1% против 45,4% у GPT-Realtime-2.1, а задержка смены хода составляет 0,798 секунды против 1,41.

Эта асимметрия — не упрёк Breeze TTS 2. Это предостережение о том, где каждому из них место в стеке. Если вы строите каскад — распознавание речи подаёт данные в языковую модель, а та — в синтезатор, — Breeze TTS 2 является кандидатом на последнюю его треть. Если вы покупаете GPT-Live-1, вы покупаете весь цикл и вместе с ним передаёте логику смены реплик.

Измерение за измерением

• Модель взаимодействия — GPT-Live-1: полный дуплекс, нативное перебивание, слушает, пока говорит, против Breeze TTS 2: потоковый синтез речи, вообще без аудиовхода

• Веса — GPT-Live-1: закрытая модель, доступна только через хостинг, один ID модели и никаких датированных снапшотов, против Breeze TTS 2: 3 млрд параметров на Hugging Face с 25 августа 2026 года, код инференса на PyTorch под Apache-2.0

• Лицензия — GPT-Live-1: коммерческие условия через API OpenAI, нечего проверять, в отличие от Breeze TTS 2: исследовательская и некоммерческая лицензия, охватывающая веса, файнтюны, LoRA, объединения, квантизации и результаты самостоятельного хостинга

• Единица цены — GPT-Live-1: $0.05 за голосовую минуту, тарифицируется посекундно, бэкенд рассуждений тарифицируется отдельно, в сравнении с Breeze TTS 2: $34 за миллион символов на размещённом эндпоинте, с понижением до $28 на высшем опубликованном тарифе

• Доказательства качества — GPT-Live-1: 70,3% в Artificial Analysis Speech to Speech Index, делит шестое место среди четырнадцати оценённых моделей; против Breeze TTS 2: 1 205 Elo на арене Provider Voices, седьмое место в общем зачёте и первое среди моделей с открытыми весами, по данным Artificial Analysis.

• Языки — GPT-Live-1: в материалах о запуске неизменно отмечается неравномерная беглость за пределами основных языков по сравнению с Breeze TTS 2: 50 языков, заявленных вендором, при этом в карточке модели указаны английский и китайский.

Управление голосом — GPT-Live-1: двенадцать голосов API, тон и темп задаются промптом, клонирование полностью отсутствует, в отличие от Breeze TTS 2: клонирование по эталонному аудио, создание голоса без эталона, управление голосом и встроенные вокальные события

• Пропускная способность — GPT-Live-1: измеряется по числу одновременных сессий, ограничена 25 на уровне 1 и 500 на уровне 5, без бесплатного уровня, против Breeze TTS 2: примерно 45 символов в секунду по измерению Artificial Analysis, что медленнее, чем у нескольких коммерческих конкурентов, и важно для работы с длинными текстами

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Лицензия выполняет больше работы, чем таблица лидеров.

В собственной карточке модели BreezeBlue об этом говорится на удивление прямо, что делает честь компании. Код инференса распространяется под лицензией Apache-2.0. Веса и любые результаты, которые вы генерируете при их самостоятельном хостинге, предназначены для исследовательского использования, а для коммерческого развёртывания требуется либо платная подписка на хостинг, либо письменное разрешение. Это ограничение явно распространяется на производные модели, LoRA, слияния и квантования — что закрывает лазейку, к которой обычно прибегают люди.

Так что позиционированию «лидер по открытым весам» нужна оговорка, которой почти не бывает в заголовках. Breeze TTS 2 открыт в том смысле, что вы можете скачать его, изучить, прогнать бенчмарки и запустить на собственном оборудовании для оценки. Он не открыт в том смысле, который позволил бы стартапу построить на нём продукт, не платя BreezeBlue и не оплачивая юридическую проверку. Две из трёх вещей, которые люди подразумевают под открытыми весами — проверяемость и стоимость — вы получаете. Третью — свободу выпускать продукт — вы не получаете.

Это существенное отличие от такой модели, как GPT-Live-1, где вопрос о лицензии не «могу ли я», а «сколько». В обоих случаях в итоге выставляется счёт. Но только в одном из них сначала появляется заключение юриста.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

Две ценовые единицы несопоставимы, так что вот арифметика.

$0,05 в минуту и $34 за миллион символов выглядят так, будто они из разных вселенных, — потому что так оно и есть. Чтобы их сравнить, нужно пересчитать. Речь звучит примерно со скоростью 150 слов в минуту, а в английском в среднем около пяти с половиной символов на слово с учётом пробелов, так что минута устной речи — это примерно 800–900 символов. При цене Breeze TTS 2 в $34 за миллион это около трёх центов за минуту синтеза — дешевле, чем пять центов у GPT-Live-1, если считать по чистой речи.

Сравнение тут же рассыпается, потому что пять центов GPT-Live-1 включают и прослушивание. Он также транскрибирует речь звонящего, определяет, когда заканчивается реплика, и управляет перебиванием — работу, которую каскаду приходится покупать на стороне: модель распознавания речи, модель определения конца реплики и языковую модель, создающую текст, который будет читать Breeze TTS 2. Добавьте их — и три цента за синтез в каскаде окажутся лишь статьёй в счёте, который обычно больше, чем у сквозной модели.

Честный итог таков: более дешёвый голос — это Breeze TTS 2, а более дешёвый разговор — GPT-Live-1, и разница между этими двумя утверждениями — это и есть всё, во что на самом деле обходится голосовой агент.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Где они действительно встретились бы

Команда, которая сегодня создаёт телефонного агента и не хочет привязываться к сквозному стеку одного поставщика, собрала бы именно такую цепочку: Breeze TTS 2 или сравнимый движок для «рта», что-то другое для «ушей» и маршрутизируемая языковая модель для «мышления». Последний из этих трёх компонентов меняется чаще всего — именно там качество растёт быстрее всего, затраты варьируются сильнее всего, и именно там модель, выигрывающая в этом квартале, редко выигрывает в следующем.

Этот слой — обычный вызов API, и именно эту часть всего стека стоит сохранять переносимой. Примерно 190 моделей от одиннадцати вышестоящих провайдеров доступны через единственный ключ OrcaRouter по прайс-листовой цене провайдера без наценки, так что замена модели рассуждений за голосовым агентом — это изменение конфигурации, а не проект по интеграции, а автоматическое переключение при сбое не даёт бэкенду с таймаутом сбросить звонок. Ни конечная точка Live Sessions у GPT-Live-1, ни хостинговый API Breeze TTS 2 недоступны таким способом — голосовые слои в этом сравнении находятся вне досягаемости слоя маршрутизации, и об этом стоит сказать прямо, а не намекать на обратное.

Какой выбрать?

Выбирайте GPT-Live-1, если разговор — это и есть продукт и вы готовы принять хостируемый закрытый интерфейс. Линии бронирования, первая линия поддержки — всё, где звонящий перебивает агента как обычное событие, а не исключение. Вы покупаете обработку прерываний и покупаете её по поминутной ставке, которая остаётся предсказуемой, тогда как логика, стоящая за этим, — это то, что вы настраиваете.

Выбирайте Breeze TTS 2, если вам нужен голос, который можно изучить, если вы создаёте продукт, где синтез — лишь один компонент из многих, или если вам нужны клонирование и дизайн голоса, которые GPT-Live-1 вообще не предлагает. Учитывайте, что веса предназначены для исследований, что заявление о 50 языках — это заявление поставщика, тогда как карточка помечена только для двух языков, и что показатели задержки — это собственные измерения BreezeBlue на прогретом быстром пути, а не независимый аудит.

Инстинкт относиться к этому как к соревнованию по качеству — неправильный инстинкт. Breeze TTS 2 находится почти на вершине той турнирной таблицы, в которой он соревнуется, а GPT-Live-1 соревнуется в совершенно другой турнирной таблице. Решение, которое действительно стоит денег, лежит в основе и того, и другого: какая модель выполняет мыслительную работу и можете ли вы передумать насчёт этого за полдня.