
GPT-Live-1 возглавляет Speech to Speech Index с результатом 81,5 — но рейтинг принадлежит его бэкенду
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, полнодуплексная голосовая модель, впервые появившаяся внутри ChatGPT 8 июля 2026 года, теперь занимает первое место в индексе Speech to Speech от Artificial Analysis с результатом 81,5 — строка, которая существует лишь потому, что модель для выполнения мышления была направлена на GPT-6 Astra. Запустите тот же голосовой фронтенд с GPT-5.6 Sol в роли делегированного бэкенда при низком уровне усилий рассуждения, и он набирает 80,1, что даёт третье место. Второе место с результатом 81,3 принадлежит Grok Voice Think Fast 2.0 High.
Два честных признания, прежде чем перейти к цифрам. Модель не нова: GPT-Live-1 появилась в API для разработчиков 10 сентября 2026 года после двух месяцев в роли голоса ChatGPT по умолчанию. Новым по состоянию на 15 сентября является то, что внешний оценщик выставил ей оценку — то единственное, чего недоставало в каждом материале об этой модели на сегодня, включая наш собственный, где единственными доступными цифрами были те, что OpenAI опубликовала о себе. И преимущество в 0,2 балла над вторым местом меньше, чем разрыв в 1,4 балла между двумя собственными конфигурациями GPT-Live-1, а это самое полезное число на табло.
Итак, заголовок «GPT-Live-1 — лучшая голосовая модель» не совсем соответствует тому, что говорит индекс. В нём говорится, что GPT-Live-1 с GPT-6 Astra при среднем уровне усилий — лучшая, с перевесом в одну пятую пункта, и что выбор бэкенда влияет на результат сильнее, чем любая конкурирующая модель.
Что на самом деле измеряет индекс
Artificial Analysis составляет Индекс речи в речь как равновзвешенную композицию из четырёх частей: речевое рассуждение, измеряемое Big Bench Audio; агентная производительность, измеряемая τ-Voice; предпочтение на арене — попарный Elo на основе человеческих предпочтений; и доля успешных задач. Значение индекса получают только модели, для которых доступны все четыре компонента, — у всех остальных отображается прочерк, поэтому в таблице строк гораздо больше, чем оценок. Сам индекс был запущен 23 июня 2026 года и с тех пор дважды пересматривался, в последний раз — чтобы заменить Conversational Dynamics на Task Success, так что оценка из одной редакции не является строго сопоставимой с оценкой из другой.
При чтении рейтинга важны ещё две детали методологии. Arena Elo фиксируется на том значении, которое было, когда модель впервые стала пригодной для публикации, поэтому компонент предпочтений вознаграждает раннее появление, а не статус лучшей на сегодня. И индекс оценивает целую систему, а не отдельную модель: для GPT-Live-1 число охватывает голосовой фронтенд плюс ту бэкенд-модель, которой он передаёт работу. Это осознанное проектное решение, и именно поэтому одна и та же модель появляется дважды с разными оценками.
Лучшие в этой области, как опубликовано:
• GPT-Live-1 (Astra, средний) — индекс 81,5, первый
• Grok Voice Think Fast 2.0 High — индекс 81,3, второе место
• GPT-Live-1 (Sol, низкий) — индекс 80.1, третий
• GPT-Realtime-2.1 High — индекс 73.9, четвёртое место
• GPT-Realtime-2 High — индекс 73,6, пятое место
• Grok Voice Think Fast 1.0 — индекс 72,3, шестой
• Gemini 3.1 Flash Live High — индекс 71,5, седьмой

Для сравнения: модель, которую заменяет GPT-Live-1, находится на 7,6 пункта ниже неё. Это настоящий разрыв между поколениями, и это не оспаривается.
Победа с преимуществом в 0,2 балла обусловлена ровно одним компонентом.
Разложите композит на составляющие, и два лидера перестают выглядеть как модели одного и того же типа. Что касается компонентов, по данным Artificial Analysis:
• Агентная производительность (τ-Voice) — GPT-Live-1 67,9% против Grok Voice Think Fast 2.0 High 56,5%
• Речевое рассуждение (Big Bench Audio) — 90% против 97%
• Доля успешных задач — 87,4 % против 94,6 %
• Arena Elo — 1048 против 1011
• Время до первого аудио — 1,34 с против 0,70 с
• Стоимость за час с учётом бэкенда — $5.83 против $4.80

GPT-Live-1 выигрывает в двух из шести строк и проигрывает в четырёх, но при этом занимает первое место в индексе. Арифметика не загадка: разрыв в τ-Voice составляет 11,4 пункта, что намного больше любого другого разрыва в таблице, и при равном весе он вытягивает композитный показатель через черту. Проще говоря, GPT-Live-1 — лучший агент, а Grok Voice Think Fast 2.0 High — лучший слушатель и более быстрый, и так уж выходит, что индекс придаёт тому, в чём GPT-Live-1 хорош, настолько большой вес, что он оказывается первым.
Если ваш продукт — это голосовой агент, который бронирует, решает вопросы или проводит транзакции, то преимущество в 11,4 пункта по τ-Voice — это показатель, предсказывающий ваш опыт. Если ваш продукт — это разговор, который должен ощущаться мгновенным и никогда не перебивать пользователя, то 0,70 секунды до первого аудио — это показатель, предсказывающий ваш опыт, и Grok выигрывает по нему примерно в два раза. В выполнении регулируемых задач есть второе предупреждение: 94,6% успешно выполненных задач у Grok — самый высокий показатель в видимой таблице, а 87,4% у GPT-Live-1 означают, что примерно одна задача из восьми не завершается. Оба показателя — улучшение по сравнению с предыдущим поколением. Ни один из них не является решённой проблемой.
Строка №1 — это конфигурация маршрутизации, а не модель.
Вот часть, которая заслуживает большего внимания, чем позиция в таблице лидеров. GPT-Live-1 — это полнодуплексный голосовой слой, который сам обрабатывает прослушивание, речь, перебивание и смену реплик, а рассуждения, вызовы инструментов и поиск делегирует отдельной бэкенд-модели, пока разговор продолжается. Artificial Analysis оценила две из этих пар как отдельные записи. Astra при среднем уровне усилий показала 81.5. Sol при низком уровне усилий показала 80.1.
Этот разброс в 1,4 пункта — вот в чём суть. Разрыв между первым и вторым местом составляет 0,2 пункта. Разрыв между двумя оценёнными конфигурациями GPT-Live-1 в семь раз больше. В голосовой модели между этими строками не изменилось ничего — только то, какая модель думала и с каким уровнем усилий. Таблица лидеров, которая ранжирует системы, точно говорит вам: конфигурация — это и есть продукт.
Он также вносит изменения в наши собственные публикации. 11 сентября 2026 года мы зафиксировали GPT-Live-1 на уровне 69,8% в этом индексе — позади и GPT-Realtime-2.1, и Grok. Это было доступное на тот момент значение, и оно подкрепляло разумный вывод: OpenAI создала лучшую механику разговора, а не лучшего голосового агента. Теперь в индексе представлены две делегированные конфигурации GPT-Live-1 — с 81,5 и 80,1. Artificial Analysis не публикует журнал изменений, а в августе она пересмотрела компоненты индекса, поэтому мы не можем с уверенностью сказать, была ли более ранняя цифра неоценённой или частично оценённой конфигурацией либо запуском при старой схеме взвешивания; наблюдаемым является то, что делегированные пары теперь отображаются как отдельные полные строки, и что ответ изменился, когда они появились.
Практический вывод таков: «какая голосовая модель» — это неправильный вопрос, а «какая голосовая модель плюс какой бэкенд и при каких усилиях» — правильный. Это вопрос маршрутизации, и именно на него призван отвечать наш собственный продукт. OrcaRouter открывает доступ к делегирующему бэкенду GPT-Live-1, GPT-6 Astra, через ту же конечную точку, совместимую с OpenAI, что и 200+ других моделей, поэтому смена мыслящего слоя — это изменение идентификатора модели, а не интеграция. DSL маршрутизации объединяет несколько моделей в один вызов, а автоматическое переключение при сбое означает, что непроверенная пара — не ставка для продакшена: если бэкенд деградирует, запрос уйдёт в другое место, а не завершится ошибкой. Чтобы быть точными в том, чего мы не делаем: сам GPT-Live-1 отсутствует в нашем каталоге, и мы его не предоставляем. Бэкенд, которому он делегирует, — совсем другое дело.
Сколько стоит час этого?
Фронтенд GPT-Live-1 тарифицируется по $0,05 за минуту голоса с посекундной оплатой, что составляет $3,00 за час открытой линии. Это ещё не весь счёт: делегированные рассуждения, вызовы инструментов и веб-поиск тарифицируются отдельно по тарифам, которые взимает бэкенд-модель. Artificial Analysis измерила совокупный показатель, поэтому именно её столбец затрат и следует использовать:
• GPT-Live-1 (Sol, low) — $4.47 в час
• Grok Voice Think Fast 2.0 High — 4,80 $ в час
• GPT-Live-1 (Astra, средний) — 5,83 $ в час
• GPT-Realtime-2.1 High — $10.75 в час
Победитель рейтинга — самый дорогой из трёх текущих вариантов, и конфигурация, которая победила, стоит на 30% больше в час, чем конфигурация, занявшая третье место. Если посмотреть с другой стороны, разбивка поучительна: $3.00 из каждого часа — это голосовой слой, а остаток — $1.47 на Sol, $2.83 на Astra — это токены бэкенда. Слой мышления составляет где-то от трети до половины вашего счёта, а это большая доля для компонента, к которому в таблице лидеров относятся как к сноске.

Однако по сравнению с моделью, которую заменяет это семейство, всё оно стоит примерно вдвое дешевле — цена в $0.05 за минуту на фронтенде — это настоящее снижение, а не переупаковка. Поскольку токены бэкенда тарифицируются по тарифам бэкенда, стоимость развёртывания GPT-Live-1 в основном зависит от того, к какой модели рассуждений вы направляете запросы, а бэкендами могут быть как собственные модели OpenAI, так и сторонние. В OrcaRouter эти бэкенды передаются по прайс-листовой цене провайдера с наценкой 0%, поэтому изменение цены вендором на уровне рассуждений вступает в силу в тот же день, а не в следующем расчётном цикле.
Что индекс не решает
Три оговорки, указанные источником, а не выведенные нами. И обе записи GPT-Live-1, и Grok Voice Think Fast 2.0 High помечены как основанные на единственном прогоне — этого слишком мало для решения с разницей в 0,2 пункта: повторный прогон мог бы поменять первый и второй местами, хотя в самих моделях ничего бы не изменилось. Arena Elo, как отмечено, был заморожен на первом публикуемом измерении каждой модели. А в индексе нет пункта о том, как эти системы ведут себя при длинном звонке: компоненты по своей конструкции рассчитаны на короткий горизонт, тогда как режим отказа, который реально губит голосовых агентов в продакшене, — это дрейф в течение двадцатиминутного разговора.
Отдельно, и от вендора, а не из индекса: API GPT-Live-1 вышел без ввода изображений или видео, без структурированных выходных данных и без бесплатного тарифа, а его ограничения скорости измеряются в одновременных сессиях, а не в запросах в минуту. Это ограничения на момент запуска, которые, возможно, уже изменились; проверьте их, прежде чем проектировать с оглядкой на них.
Что с этим делать
Если на этой неделе вы выбираете архитектуру, а не модель, индекс вознаграждает делегированный паттерн в агентной работе и каскадный паттерн по задержке. GPT-Live-1 с 81,5 — самое сильное на сегодняшний день свидетельство того, что разделение разговора и рассуждения — правильная форма для голосовых агентов, выполняющих задачи. Grok Voice Think Fast 2.0 High с 81,3, при 0,70 секунды до первого аудио и 94,6% успешного выполнения задач, — самое сильное свидетельство того, что делегированная форма не единственная, которая работает, — и что она пока не самая быстрая.
Решение, которое следует из цифр, дешевле, чем кажется. И обе конфигурации GPT-Live-1, и модель, превзошедшая GPT-Live-1 в четырёх из шести компонентов, различаются по цене не более чем на $1,36 в час. При таком разбросе верный ход — перестать читать лидерборды и прогнать собственные транскрипты через обе. Индекс показывает форму компромисса; он не может сказать, на какой его стороне находятся ваши пользователи.
Вопросы, которые вызывает число
GPT-Live-1 — лучшая голосовая модель сейчас?
По сводному показателю — да, с преимуществом в 0,2 балла и всего одним испытанием за ним. По компонентам всё зависит от того, что вы создаёте: он лидирует по агентной производительности и предпочтениям в арене, но уступает по речевому рассуждению, доле успешно выполненных задач и времени до первого аудио. Преимущество в 0,2 балла по сводному показателю, опирающееся на одно преимущество по компоненту в 11,4 балла, — это защитимое первое место, но не решающее.
Обязательно ли использовать GPT-6 Astra, чтобы получить 81,5?
Для этой конкретной строки — да, 81,5 относится к GPT-Live-1, настроенной с Astra при среднем уровне усилий рассуждения. Sol при низком уровне усилий — задокументированная альтернатива с 80,1 и на $1,36 в час дешевле, а OpenAI поддерживает подключение сторонних моделей в качестве бэкенда, так что записи в таблице лидеров — это две точки на кривой, а не единственные варианты. Какое сочетание лучше всего подойдёт для вашей рабочей нагрузки, публичный индекс за вас не решит.
Почему одна и та же модель набрала 69,8 в нашем предыдущем обзоре, а сейчас — 81,5?
Две эти цифры относятся к разным вещам. В более раннем измерении GPT-Live-1 был представлен в индексе одной позицией; в текущей таблице его две делегированные конфигурации идут отдельными строками с полными оценками, причём связка с Astra имеет 81.5, а связка с Sol — 80.1. Artificial Analysis пересмотрела компоненты индекса в августе и не публикует список изменений, поэтому рассматривайте эту разницу как изменение того, что измерялось, а не как доказательство улучшения модели, — и рассматривайте любой единый сводный балл для делегирующей модели как утверждение о конфигурации.
