Сгенерированная главная карточка с заголовком для AuK: словесный логотип «AuK» вверху, под ним строки подзаголовка «Открытая речевая модель Tencent с 1,5 млрд параметров» и «Одна инструкция на естественном языке для любой аудиозадачи — клонирование, редактирование, улучшение, разделение», ниже — мягкая синяя форма волны, которую редактирует тонкий текстовый курсор, и четыре плоские иконки с подписями «Клонирование голоса», «Редактирование», «Улучшение» и «Разделение»; в правом нижнем углу размещён логотип OrcaRouter.
Guides & Insights

AuK: Tencent тихо открыл исходный код речевой модели 1.5B, которая обрабатывает каждую аудиозадачу как текстовую команду.

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот предложение, которое ни один из доступных сегодня для скачивания речевых инструментов не выполнит за один проход: взять эту запись, заменить слово «house» на «home», поднять высоту тона на полтона, убрать дыхание перед последней фразой, вычистить фоновый шум, а затем перечитать результат совершенно новым голосом, описанным лишь как «тёплый мужчина средних лет с лёгким кантонским акцентом». Ответ Tencent на эту задачу — AuK, «базовая модель для генерации и редактирования речи» с 1,5 миллиарда параметров, которая на этой неделе стала открытой без анонсирующего поста и без пресс-релиза, — а её дистиллированный собрат AuK-Flash теперь получил то, чего не хватало этой истории, когда мы впервые о ней писали: технический отчёт с цифрами. «AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing» (arXiv:2609.08936, cs.SD, подана 2026-09-08) теперь цитируется и на карточке модели Hugging Face, и в README на GitHub; в описании статьи указана дата 2026-09-08, а в новостной строке самого репозитория — 2026/09/09. Чего отчёт не делает — так это не решает вопрос, который имел значение: каждая цифра в нём получена самим Tencent, при сравнении с бейзлайнами, выбранными Tencent, и по состоянию на 2026-09-10 никто за пределами компании не воспроизвёл ни одной из них.

Это материал в формате «что нам известно на данный момент», пересмотренный один раз. Tencent по-прежнему не анонсировала AuK ни на одном из своих основных каналов, которые нам удалось найти, так что официально зафиксировано следующее: карточки моделей и репозитории Hugging Face для AuK и AuK-Flash, репозиторий кода в организации Tencent-Hunyuan, сайт проекта auk-project.github.io и теперь ещё и научная статья. Это последнее дополнение меняет то, что можно узнать: архитектура, методика обучения и численные результаты оценки впервые описаны подробно. При этом оно не меняет того, что уже подтверждено. Относитесь ко всем числовым данным ниже как к цифрам, предоставленным вендором, — именно так оно и есть — и учтите, что сравнения в отчёте проводятся исключительно с другими открытыми моделями, а не с закрытыми облачными речевыми платформами, с которыми AuK пришлось бы конкурировать в действительности.

Что на самом деле выпустили, и как тихо

Таймлайн по-прежнему остаётся самым честным резюме релиза, с одной поправкой к нашему первому проходу. Репозитории Hugging Face были созданы в середине августа — AuK 2026-08-18 — но оставались тёмными до этой недели. Когда мы читали карточку модели AuK 9 сентября 2026 года, её единственная строка новостей была датирована 2026-09-07; днём позже та же строка читается как 2026/09/09 и ведёт читателей к статье и демо-пространствам Spaces. Репозиторий GitHub, содержащий код для инференса и обучения, был создан 2026-08-19, а последний пуш был 2026-09-09. Иными словами: сначала веса, затем код, затем технический отчёт — три поэтапных публикации за четыре дня, и на момент написания объявлений от основных каналов Tencent по-прежнему нет.

• Веса находятся на Hugging Face в организации tencent и зеркалируются на ModelScope под Tencent-Hunyuan — два зеркала, одна и та же лицензия MIT.

• В каждом репозитории модели хранится один чекпойнт safetensors, а также конфиг и VAE: auk_base.safetensors размером 6.12 ГБ и vae.safetensors размером 0.64 ГБ для AuK; та же структура и для AuK-Flash. В карточке модели указано, что также нужно скачать Qwen/Qwen2.5-Omni-3B — текстовый энкодер, который AuK загружает отдельно во время выполнения.

Формулировка «никто не заметил» устарела, и быстро. Когда мы проверили репозиторий 2026-09-09, у него было ноль звёзд и ноль форков; к 2026-09-10 в нём уже 216 звёзд, 12 форков и первый открытый issue. Карточка AuK показывает около тридцати загрузок за последний месяц и 26 лайков. Что не изменилось: вкладки обсуждений пусты, а в карточке по-прежнему указано, что чекпоинт не развёрнут ни одним провайдером инференса.

• Обе карточки моделей, README и ссылка на статью ведут к демо-Spaces на Hugging Face и ModelScope. Когда мы проверяли, Space на Hugging Face не был публично доступен без входа в систему, поэтому считайте путь «попробуйте в браузере» неподтверждённым для анонимных пользователей.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

Карточка Hugging Face выше по-прежнему остаётся единственной публичной поверхностью устанавливаемого релиза: карточка модели, конфиг, два файла safetensors и лицензия. Всё, что было добавлено с тех пор, — это документационный слой вокруг неё: статья, таблица бенчмарков и блок цитирования, — и ничто из этого не меняет того факта, что за ней нет журнала изменений, ветки обсуждений и списка провайдеров инференса.

Суть: один интерфейс для инструкций, шестнадцать речевых задач.

Утверждение AuK не в том, что это лучшая модель синтеза речи из когда-либо выпущенных. Оно в том, что генерация — лишь одно из пяти семейств речевых задач, для которых модель обучалась через единый интерфейс на естественном языке, где запрос — это чат-сообщение, которое может содержать текст и необязательный эталонный аудиофайл. Статья формализует ровно ту таксономию, которую сайт проекта уже рекламировал:

• Генерация речи — zero-shot TTS (озвучивание заданного текста голосом из эталонной записи) и instruction TTS (генерация речи только на основе словесного описания голоса, без какого-либо эталонного аудио).

• Редактирование контента — переписывание сказанного: замена, вставка или удаление слов в существующей записи; а также редактирование текста песен, которое переписывает пропетые слова, сохраняя мелодию и голос.

• Акустическое редактирование — высота тона в полутонах, масштабирование скорости речи и громкость в децибелах.

• Паралингвистическое редактирование — изменение эмоциональной окраски, изменение тембра по описанию, устранение акцента, добавление или удаление невербальных звуков (вдохов, смеха, кашля), а также преобразование обычной речи в шёпот и обратно с сохранением голоса говорящего.

• Улучшение и разделение — подавление шума и устранение реверберации речи, разделение речи по очерёдности говорящих, разделение музыки и вокала, а также выделение целевого говорящего по произнесённой им фразе.

Кейс instruction-TTS — это то, что отличает данную версию от типичного релиза для клонирования голоса: AuK прочитает предложение голосом, который существует лишь как текстовое описание — в собственном примере документации указана женщина лет двадцати, говорящая с партнёром, только что вернувшимся домой, тепло, заботливо и слегка кокетливо, с мягким сладким тембром и чуть восходящей интонацией в конце предложения, и всё это без приложенного референс-клипа. Это устраняет необходимость в эталонной записи, которая обычно является основным ограничивающим фактором для клонирования. В отчёте впервые приводится числовая оценка этой задачи, и это одно из немногих мест, где AuK полностью обходит конкурентов, а не просто немного их опережает.

Внутри "1.5B": это число преуменьшает время выполнения.

Количество параметров AuK описывает диффузионный трансформер, а не весь конвейер, и в статье теперь подробно расписаны обе части. Базовой моделью является гибридный Transformer с rectified-flow — тридцать слоёв, состоящих из десяти двухпоточных блоков MMDiT, за которыми следуют двадцать объединённых однопоточных блоков DiT, скрытый размер 1536, 24 головы внимания размерности 64, промежуточная ширина SwiGLU 3072 — именно отсюда берётся цифра «примерно 1,5 миллиарда параметров». Вокруг неё располагаются два отдельно загружаемых компонента: мультимодальная LLM (Qwen/Qwen2.5-Omni-3B), которая преобразует инструкцию и любое референсное аудио в семантическое кондиционирование, и каузальный аудио-VAE на 24 кГц — в конфиге он называется BigVGANFlowVAE — который работает с 64-мерными латентными представлениями при частоте кадров 50 Гц, с шириной каналов энкодера до 768 и декодера до 1536. Таким образом, полный рантайм — это базовая модель на ~1,5 млрд параметров плюс энкодер на 3 млрд плюс VAE, а в инструкции по загрузке явно указано, что энкодер представляет собой отдельный чекпойнт с собственными условиями.

{{1}}Согласно отчёту, обучение проходило поэтапно и в масштабах, о которых сайт проекта лишь упоминал вскользь: разогрев только на генерации — 50 000 обновлений, затем 600 000 совместных обновлений генерации и редактирования, на примерно 3,03 миллиарда пар «инструкция–аудио», что соответствует около 1,95 миллиона часов эффективного обучения с учителем, на 256 GPU, плюс ещё 1,24 миллиона обновлений для VAE.{{/1}} {{2}}Пост-обучение объединяло оптимизацию предпочтений на основе человеческой обратной связи с обучением с подкреплением на основе вознаграждений; оно строилось на 818 информативных группах предпочтений и 9 080 оценённых кандидатах, пулах промптов для RL из 10 000 zero-shot и 5 000 промптов, следующих инструкциям, 30 000 примерах для стилевого оценщика и модели вознаграждения, дообученной из Qwen2.5-Omni-7B.{{/2}} {{3}}Это серьёзный стек пост-обучения для открытого релиза модели на 1,5 млрд параметров, и это также напоминание, что «открытые веса» описывают артефакт, а не вычисления, которые его создали, — момент, который стоит помнить, оценивая, можно ли воспроизвести такой результат.{{/3}}

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Каждая цифра в этом техническом описании взята из собственных репозиториев и веб-сайта Tencent, а не измерена нами, и статья этого не изменила — она лишь перевела больше этих строк из разряда «заявленных» в разряд «задокументированных». Единственный показатель, который действительно был проверен с момента нашей первой публикации, — это активность самого репозитория, которая выросла с нуля звёзд до нескольких сотен за день.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

Сайт проекта по-прежнему остаётся местом, где размещены схема архитектуры и академический кобрендинг, и это всё ещё самый простой способ увидеть форму модели: мультимодальная языковая модель для семантического обусловливания, VAE с частотой 50 Гц для акустики и гибридный трансформер, обучаемый по методу согласования потоков. Его раздел с бенчмарками, который при первом взгляде перечислял оценочный инструментарий без показателей, теперь отсылает к статье.

Технический отчёт публикуется, и цифры — собственные данные Tencent.

В этом суть обновления. В статье сообщается о результатах на семи оценочных наборах — том же списке, который сайт проекта приводил без цифр, — и по большинству осей генерации и редактирования контента AuK лидирует среди открытых моделей. Воспринимайте это как вендорскую таблицу бенчмарков, потому что так оно и есть: tencent провёл каждое сравнение, выбрал каждый бейзлайн и пока не опубликовал код для воспроизведения харнеса.

Zero-shot TTS на Seed-TTS-Eval: у AuK средний WER 2.65 при сходстве диктора 0.795, у Qwen3-TTS — 3.07 и 0.745, у Seed-TTS — 3.65 и 0.778, у VoxCPM2 — 3.65 и 0.767. AuK-Flash достигает 2.85 и 0.790. Лучшие отдельные подвыборки: 1.02 WER на английском тестовом наборе и 5.91 на сложном китайском наборе.

• Управляемый инструкциями TTS на InstructTTSEval: AuK набирает 83.37 на китайском и 81.60 на английском при следовании описаниям, тогда как Qwen3-TTS-VD показывает 81.10 и 82.40, а MOSS-VoiceGenerator — 80.00 и 82.00. AuK-Flash показывает 78.80 на китайском, но повторяет лучший английский результат в этой области — 82.40.

• Редактирование контента в SpeechEditBench: точность 91,83 против 76,46 у Ming-UniAudio, и 71,33 по просодии против 26,50 — два самых больших разрыва во всём отчёте.

• Инструкционно-управляемое редактирование в Ming-Freeform-Audio-Edit, полная конфигурация: ошибка слов снижается с 10,46 до 3,09 на китайском и с 14,28 до 3,96 на английском по сравнению с Ming-UniAudio, при этом точность редактирования возрастает с 79,62 до 91,47 и с 70,98 до 85,25. При акустическом редактировании то же сравнение показывает изменение ошибки слов с 5,01 до 2,02 для китайского и с 10,75 до 3,48 для английского.

Паралингвистическое редактирование на MMAE-Speech: показатель следования инструкциям 48.23 и переписывания контента 88.11 против Step-Audio-EditX с 43.52 и 77.27, и Ming-UniAudio с 34.13 и 76.01. AuK-Flash показывает лучший recall модели редактирования в таблице — 13.85.

• Восстановление, где модель конкурентоспособна, а не доминирует: DNS Challenge — десинхронизированная ошибка на словах 2.66 с схожестью диктора 0.99 против 3.31 у RE-USE; CHiME-4 — ошибка на словах 7.98 против 10.71 у RE-USE; Libri2Mix — ошибка на словах 9.12 против 9.34 у MossFormer2-SS; и VCTKSR — ошибка на словах 3.06 с схожестью 0.97.

• Сам VAE, оценённый отдельно: AuK-VAE достигает 4.143 PESQ на речи, 3.833 на обычном аудио и 3.884 на музыке, тогда как MiniMax-H3-AudioVAE — 3.633, 2.835 и 2.801 — чистый выигрыш, который значит больше, чем кажется, потому что потери в акустическом латентном пространстве ограничивают все задачи, построенные на его основе.

Закономерность, прослеживающаяся в этих пунктах, интереснее, чем громкие победы в заголовках. AuK далеко впереди во всём, что означает «изменить содержание сказанного или его звучание, сохранив всё остальное», — редактирование контента, просодия, акустические правки, реконструкция. Гораздо ближе к остальным он в редактировании эмоций и паралингвистики: его точность распознавания эмоций в SpeechEditBench — 9,94 — почти неотличима от 3,43 у Ming-UniAudio на бенчмарке, где обе модели слабы, а общий акустический балл 37,07 находится в том же диапазоне, что и у базовых моделей. Так что «одна модель для любой речевой задачи» — это формулировка Tencent; на самом деле отчёт показывает модель, которая отлично справляется с несколькими задачами, а на остальных просто присутствует.

Два чекпоинта: AuK и AuK-Flash

Tencent выпустила два варианта под одной и той же лицензией MIT. AuK — это базовая модель полного качества, и в отчёте её параметры сэмплирования зафиксированы на 32 вычислениях функции с масштабом классификатор-свободного управления 2.0. AuK-Flash — дистиллированная версия: консистентная инициализация и маршрутизируемая по задачам цель Decoupled DMD, формирующая результат за четыре фиксированных шага при полностью отключённом управлении; в статье это описывается как ускорение в 4,5 раза по настенному времени относительно полной модели в сопоставимых условиях. Собственные цифры статьи показывают, что Flash почти не уступает по большинству задач генерации — средняя ошибка по словам 2,85 и сходство 0,790 на Seed-TTS-Eval — именно поэтому заявление о скорости стоит проверять, а не отвергать: диффузия за четыре шага с качеством, близким к учителю, — это то, что сделало бы редактор речи на 1,5B параметров интерактивным на одной GPU. Тем не менее «сопоставимые условия» — это формулировка Tencent, описывающая бенчмарк Tencent, а показатель 4,5×, измеренный авторами, — ровно тот тип заявления, которому нужна третья сторона, прежде чем оно повлияет на какое-либо решение о закупке.

Что можно запустить сегодня

Практическая область применения здесь шире, чем при обычном тихом выпуске весов, потому что вместе с ним вышел и код. Установка ориентирована на Python 3.10 через uv или Conda, а в README предлагаются дополнительные сценарии установки, подключающие Gradio, ноды ComfyUI или стек тонкой настройки. Утилита командной строки auk-infer охватывает все задачи с единой формой сообщения: --instruction требуется всегда, а --audio опционален в зависимости от задачи. Сервер Gradio (auk-gradio) открывает доступ к моделям через селектор, а также есть пользовательские ноды ComfyUI с переиспользуемым воркфлоу, хотя в документации интеграции указано ограничение в 30 секунд на последовательность «источник + цель». Python API повторяет CLI, а легковесный пайплайн тонкой настройки обучается на JSONL с парами «инструкция-аудио», используя тот же формат сообщений, что и при инференсе. В README также описан Prompt Enhancer, который превращает свободные запросы в готовые к запуску команды auk-infer; он ожидает чат-эндпоинт, совместимый с OpenAI, и в качестве запасного варианта использует локальную модель SenseVoiceSmall для распознавания речи, когда не заданы облачные учётные данные ASR. Одно ограничение на текущий момент описано прямо: Qwen3-Omni пока не поддерживается в качестве пути энкодера, поэтому по-прежнему нужно скачивать чекпойнт Qwen2.5-Omni-3B.

Чего в документации по-прежнему нет — так это нижней границы по оборудованию. Для инференса не опубликовано ни одной цифры по объёму VRAM. В конфигурационных файлах есть примечание о градиентном чекпоинтинге: пик ~91 ГБ снижается до ~75 ГБ, но это описывает использование памяти при обучении, а не реалистичную цифру для однократного инференса. А эталонная команда, которая загружает AuK и AuK-Flash вместе, распределяет их по двум GPU — хотя в документации отмечается, что обе могут уместиться на одном. Учитывайте и сам загружаемый объём: примерно 6,8 ГБ на вариант плюс энкодер Qwen2.5-Omni-3B, а затем измеряйте память на своём GPU.

Что не подтверждено

Точность в отношении неизвестного по-прежнему остаётся сутью освещения модели на столь раннем этапе, и отчёт удалил ровно один пункт из этого списка, сохранив остальные без изменений:

• Не существует ни одного независимого запуска, который мы могли бы найти. Нет ни сторонних образцов голоса, ни воспроизведения бенчмарков, ни впечатлений в ветках обсуждений. Первый открытый issue в репозитории создан и остаётся без ответа, а количество загрузок на карточке модели всё ещё исчисляется десятками, так что разрыв между опубликованной таблицей и воспроизведённой — сейчас и есть вся история.

• Оценка проведена самостоятельно и узка в одном конкретном отношении. Каждый бейзлайн в отчёте — это другая модель с открытыми весами: Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Ни одной из закрытых облачных речевых платформ, с которыми покупатель реально сопоставлял бы AuK, в отчёте нет, так что «лидирует на рынке» здесь означает «лидирует среди открытых моделей, отобранных Tencent».

• Название «AuK» по-прежнему нигде не расшифровывается: ни в статье, ни на карточках, ни в коде, — и оно сильно пересекается в поиске с морской птицей, American University of Kuwait и посторонними репозиториями.

Команда теперь, по крайней мере, видна — статья насчитывает 33 автора под руководством Цзыяна Ма, представляющих организацию Tencent Hunyuan, Шанхайский университет Цзяотун, Шанхайский инновационный институт и Наньянский технологический университет, — но кто именно в Tencent отвечает за модель на ежедневной основе и является ли она частью линейки Hunyuan или отдельным академическим сотрудничеством, остаётся невыясненным.

• Охват языков всё ещё задокументирован лишь частично: карточка AuK-Flash указывает китайский и английский, а примеры кода смешивают оба языка, но у базовой модели нет формального списка языков. Лицензирование имеет ту же особенность — сам AuK распространяется под MIT, а отдельно загружаемый кодировщик Qwen имеет собственные условия, так что «модель MIT» и «MIT для всего, что нужно для её запуска» — это не одно и то же.

Почему важна единая речевая модель с открытыми весами

Если сопоставить список задач AuK с тем, что разработчик на самом деле делает сегодня, то ставка становится яснее, чем до появления цифр. Выполнение всех этих задач существующими инструментами означает либо соединение в цепочку нескольких специализированных моделей — один открытый чекпоинт для клонирования, другой — для улучшения, отдельный разделитель, а также ручное или модельно-ассистируемое редактирование контента, — либо аренду нескольких закрытых облачных API, каждый из которых тарифицируется за задачу и за минуту аудио, и ни один из них не редактируется так, как описано в AuK. Один открытый чекпоинт с публичными весами, который рассматривает всё это как единую задачу генерации, обусловленной текстом, — это принципиально иной объект, и отчёт теперь подтверждает более точную версию этого утверждения, чем маркетинговые материалы: часть, связанная с редактированием, реальна, а не амбициозна. За последний год клонирование голоса стало товаром, но редактирование контента и просодии по инструкциям — это та область, где закрытые облачные платформы по-прежнему зарабатывают свою маржу, и результат 91.83 против 76.46 в редактировании контента — первое свидетельство того, что открытая модель способна занять эту нишу.

Честная оговорка: это диффузионная модель с прикрученной для кондиционирования языковой моделью на 3B параметров, и она наследует издержки такой архитектуры. Качество по задачам неравномерно — отлично там, где задача сводится к «сохранить всё, кроме правки», слабее на эмоциях — и нет ни хостируемого эндпоинта, ни решения для пакетной обработки, ни опубликованных задержек, кроме внутреннего сравнения Flash-варианта. Для компонентов голосового конвейера вокруг неё — LLM, которая решает, что следует сказать, и OpenAI-совместимой конечной точки чата Prompt Enhancer — маршрутизирующий API естественно подходит, и OrcaRouter предоставляет доступ к 200+ моделям по прейскуранту провайдера без наценки, так что для половины стека нужен один ключ и не требуется второго контракта. Аудиополовина же — это по-прежнему GPU под вашим контролем и чекпоинт, который никто за пределами Tencent не проверял.

Кто должен смотреть сейчас, а кто — подождать?

Для исследователей речи, разработчиков инструментов и всех, чья работа — оценка новых голосовых моделей, аргументы в пользу того, чтобы скачать AuK на этой неделе, весомее, чем в день запуска, и по-прежнему сопровождаются той же оговоркой. Теперь у вас есть документированная архитектура, рецепт, который выглядит воспроизводимым, и полная таблица целевых показателей, которые предстоит побить, — а это как раз то, что делает непроверенное утверждение достойным того, чтобы его оспорить. Плата за ранний старт остаётся прежней: выходные на настройку и GPU. Для тех, кто выбирает голосовой стек для продакшена, отчёт меняет расклад, но не закрывает вопрос: теперь есть цифры, с которыми можно спорить, однако это цифры вендора, они не включают закрытые платформы, с которыми вы на самом деле стали бы сравнивать, и по-прежнему нет ни API, ни минимальных требований к VRAM, ни послужного списка. Следите, в таком порядке: за независимым воспроизведением строк Seed-TTS-Eval и SpeechEditBench; за опубликованными сэмплами или доступным демо Space; и за тем, как какой-нибудь инференс-провайдер или хостинговая API подхватит AuK, — и в этот момент наша сквозная цена станет ценой из прайс-листа провайдера, день в день, потому что именно это и означает наценка 0%. Интересный вопрос больше не в том, выпустила ли Tencent очередную TTS-модель, — а в том, способна ли одна открытая модель действительно покрывать сразу все пять этих семейств задач, и теперь, когда Tencent опубликовала собственный ответ, осталось лишь, чтобы кто-то другой его проверил.