
Gemini 3.8 TTS против Sesame Preview: одно из них — загрузка, другое — приложение
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Поищите сравнение между Gemini 3.8 Flash TTS и Sesame Preview, и вы найдёте множество текстов, в которых их рассматривают как два продукта одной категории. Это не так, и разница не в формальности. Gemini 3.8 Flash TTS — это конечная точка API: у него есть идентификатор модели, опубликованный прайс-лист, строка в таблице лидеров на 2-м месте с Elo 1 260 по 1 999 образцам на Artificial Analysis Provider Voice Arena и документированный формат запросов. Sesame Preview — это бесплатное потребительское приложение-голосовой ассистент с именованными агентами, многоходовыми диалогами и ограничением звонка в 30 минут. У него нет API, нет ID модели, нет тарифного плана и нет оценки в этой таблице.
Единственный артефакт Sesame, на котором вы действительно можете что-то построить, — это снова совсем другое: CSM-1B, чекпоинт под Apache 2.0 на Hugging Face, который генерирует аудиокоды из текста с использованием основы Llama и аудиодекодера Mimi. Это не тот голос, о котором говорят люди, когда описывают, насколько человечно звучит приложение. Так что сравнение сводится к вопросу, на который можно ответить: вы хотите арендовать речевую модель или скачать её?

Две вещи под названием Sesame, и только одну из них можно собрать
Нейминг — источник большей части путаницы, поэтому отделите его, прежде чем идти дальше.
• Sesame Preview — приложение. Бесплатно; агенты по имени Майя, Майлз, Симона и Чарли; многоходовой диалог с контекстом, который сохраняется между ходами; веб-поиск и напоминания в качестве возможностей; только на английском; ограничение звонка — 30 минут. Интерфейса для разработчиков нет: не с чем проходить аутентификацию, нечего тарифицировать, нет эндпоинта для вызова.
• CSM-1B — чекпойнт. Опубликован на Hugging Face под именем sesame/csm-1b с лицензией Apache 2.0, на основе Llama и с меньшим декодером, который создаёт аудиокоды Mimi. Около 2 миллиардов параметров, английский язык, веса F32, и он работает через Hugging Face Transformers. В карточке модели указано, что вариант 1B вышел в марте 2025 года, а нативная поддержка Transformers появилась в мае 2025 года.
У этих двух общая компания и общее исследовательское происхождение, и примерно на этом их связь заканчивается. Приложение — это продукт; чекпойнт — это артефакт исследований, которые ему предшествовали. Рецензенты, которые хвалят разговорную память приложения, описывают систему с извлечением информации и управлением состоянием вокруг речевой модели, а не свойство 2B-чекпойнта, который можно скачать.
Что на самом деле находится в чекпоинте
CSM-1B — это модель преобразования текста в речь в том архитектурном смысле, который важен для всех, кто планирует её запускать: она принимает текст и аудиоконтекст на вход и выдаёт аудиокоды RVQ, которые декодер превращает в форму сигнала. Практические факты из карточки модели:
• Лицензия — Apache 2.0. Это самая значимая строка на странице. В отличие от лицензий на веса, предназначенных только для исследований, Apache 2.0 разрешает коммерческое использование без отдельного соглашения, что делает CSM-1B одной из немногих по-настоящему пригодных к использованию открытых речевых чекпоинтов.
• Размер — около 2 млрд параметров при F32. Достаточно большой, чтобы для любых параллельных задач требовалось настоящее оборудование, и достаточно малый, чтобы запускаться на одном ускорителе для разработки.
• Язык — английский, согласно карточке. Не многоязычная модель.
• Востребованность — 141 461 скачивание за последний месяц на момент написания, а также примерно 245 000 лайков в репозитории. По меркам открытых речевых моделей это широко используемый чекпойнт, и это самый сильный аргумент в пользу того, что у артефакта есть реальная пользовательская база независимо от освещения приложения в прессе.

Чего карточка вам не даёт — так это заявления о качестве, которое можно было бы с чем-либо сравнить. Нет ни строки в арене, ни воспроизведённого третьей стороной бенчмарка вендора, ни опубликованной оценки того, как выход чекпоинта соотносится с выходом приложения. Любой, кто говорит вам, что скачиваемая модель звучит как приложение, делает этот вывод из названия.
Почему нет прямого сравнения и почему это не пробел в исследованиях
На таблицах лидеров нет сравнения Gemini 3.8 TTS и Sesame Preview, потому что его не может быть. Арена ранжирует модели, заставляя слушателей сравнивать клипы, созданные размещённым эндпоинтом. У одной стороны этой пары нет эндпоинта, поэтому её нельзя включить в сравнение.
Здесь стоит быть точным, потому что «прямых сравнительных исследований не существует» часто описывают так, будто данные отсутствуют. Они не отсутствуют. Они не определены. У двух сравниваемых вещей нет общей измеримой поверхности:
• Gemini 3.8 Flash TTS оценивается по своим нативным голосам, размещённым на платформе. У Sesame Preview нет нативных голосов, которые можно было бы оценивать в этом смысле, — у него есть агенты.
• Gemini 3.8 Flash TTS публикует тарифную сетку в токенах. Sesame Preview бесплатен и ничего не публикует, потому что выставлять счёт не за что.
• Gemini 3.8 Flash TTS принимает сценарий и возвращает аудио. Sesame Preview принимает разговор и возвращает разговор, с теми механизмами поиска и памяти, которые приложение добавляет сверху.
Самое близкое к правомерному сравнению — это сравнение Gemini 3.8 Flash TTS и CSM-1B, и даже оно неравноценно: у одного есть независимый Elo и тарифная сетка вендора, у другого нет ни того, ни другого. Сравнивать можно форму обязательства — API с оплатой по факту использования против скачиваемого чекпоинта — и для такого сравнения таблица лидеров не нужна.
Единственная сторона этого, на которой есть числа
Всё количественное в этой паре — на стороне Google, и в этом-то как раз и суть.
В рейтинге Artificial Analysis Provider Voice Arena по данным на 24 сентября 2026 года Gemini 3.8 Flash TTS занимает 2-е место с рейтингом Elo 1 260 по 1 999 образцам и 8 голосам арены; релиз состоялся 23 сентября 2026 года. Её родственная модель Gemini 3.8 Flash-Lite TTS находится на 6-м месте с 1 235. Google выставляет Flash TTS по цене $0.50 за миллион входных текстовых токенов и $9.00 за миллион выходных аудиотокенов до 31 декабря 2026 года, затем $18.00; у Flash-Lite TTS — $0.50 и $6.00, затем $12.00. Artificial Analysis приводит эти значения к $16.50 и $11.00 за миллион символов, чтобы их можно было разместить в одном рейтинге с моделями, тарифицируемыми в других единицах. Эта нормализация — арифметика самого рейтинга, а не цитата Google.
В противовес этому, у CSM-1B нет цены, потому что у него нет счётчика. У него есть число загрузок, лицензия и число параметров. Если вашей системе принятия решений нужен Elo, это сравнение не даст его для стороны Sesame, и честный вывод состоит в том, что два варианта оцениваются по разным критериям, а не в том, что один из них не доказан.

Если вы хотели именно опыт использования приложения
Многие из тех, кто ищет это сравнение, вообще не выбирают модель. Они пользовались приложением Sesame, им понравилось, как ощущался разговор, и они хотят получить это в своём продукте. Это другая проблема, и скачивание её не решит.
То, каким приложение ощущается, в основном определяется не речевой моделью. Сохраняемый контекст между репликами, решение искать в интернете прямо во время разговора, момент, когда агент начинает говорить, — всё это оркестрация, и ничто из этого не живёт в 2B-чекпоинте. Загрузка CSM-1B даёт вам голос. Построение поведения приложения поверх него — это ваша инженерная работа, а 30-минутный лимит на звонок и отсутствие API означают, что готовую версию вы тоже не можете арендовать.
Если вы хотели речевую модель, которую можно вызвать, честный ответ таков: Gemini 3.8 Flash TTS — это вариант с документированным интерфейсом, опубликованной ценой, независимой оценкой и диалогом двух говорящих в одном запросе. Если вы хотели веса, которые можно оставить себе, CSM-1B под Apache 2.0 — это тот из двух, который вы действительно можете держать у себя, — а компромисс в том, что вы сами предоставляете аппаратное обеспечение, стек обслуживания и все гарантии качества.
OrcaRouter не предоставляет хостинг ни для одного из них. Модель Google вызывается через собственный API Google и поверхности, названные в объявлении Google от 23 сентября; CSM-1B — это чекпоинт, который вы запускаете. OrcaRouter же нужен как слой над этим выбором: более 200 моделей за одним ключом по цене из прайс-листа провайдера без наценки, поэтому изменение тарифов поставщика вступает в силу в тот же день, автоматическое переключение при сбое, чтобы экспериментальный маршрут не становился зависимостью для продакшена, а DSL маршрутизации объединяет модели в один вызов, когда одного голоса недостаточно для всей задачи.
Коротко говоря, это сравнение — на самом деле не сравнение. У одной стороны есть тарифная сетка и рейтинг Эло; у другой — лицензия и число загрузок. Выбирайте ту, чей столбец вы действительно можете заполнить.
