Титульная карточка для сравнения AuK и AuK-Flash с надписью «AuK vs AuK-Flash — 32 шага сэмплирования или 4?» и подзаголовком «Генерация и редактирование речи — базовая модель против дистиллированной ученической модели», а также три плитки-иконки с подписями «24 кГц», «NFE 4 против 32» и «6.12 ГБ».
Guides & Insights

AuK против AuK-Flash: 32 шага сэмплирования или 4, и почему иногда выигрывает ученик

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Обе контрольные точки весят ровно 6,122 ГБ. Обе распространяются под лицензией MIT. Обе используют один и тот же отдельно загружаемый энкодер инструкций с 3 миллиардами параметров и один и тот же VAE на 637 МБ. AuK и AuK-Flash почти ничем не различаются в том, что вы выделяете, — и различаются в одном, что вы ощущаете при каждом вызове: сколько раз запускается сэмплер. AuK — базовая модель генерации и редактирования речи с открытыми весами объёмом 1,5B, которую команда Hunyuan из Tencent и академические соавторы из Shanghai Jiao Tong и NTU разместили на Hugging Face 9 сентября, — тратит 32 вычисления функции при бесклассификаторном управлении с коэффициентом 2.0. AuK-Flash, дистиллированная модель-ученик, тратит четыре, при полностью отключённом управлении, что даёт заявленное 4,5-кратное ускорение по фактическому времени выполнения. Очевидное прочтение: Flash — это эконом-вариант, к которому вы обращаетесь, когда задержка важнее качества. Это прочтение неверно, и ему противоречат собственные оценочные таблицы вендора: в сравнительных строках технического отчёта Flash получает высший балл по метрике edit-ratio в MMAE-Speech, по паралингвистическому столбцу SpeechEditBench, по следованию английским инструкциям, по сходству говорящего при акустическом редактировании и по всем четырём строкам оценки перцептуального качества улучшения. Это не понижение. Это другой компромисс, и то, какая его сторона вам нужна, зависит от того, какую из двух задач вы на самом деле выполняете.

Что на самом деле различается между ними?

Отбросьте маркетинг — и выбор сводится к файлу конфигурации. Среда выполнения AuK — это гибридный Transformer на основе rectified-flow: двухпоточные блоки MMDiT, питающие объединённые однопоточные блоки DiT, — работающий с решателем Эйлера в bfloat16 на частоте 24 кГц и 64-мерными латентными представлениями на 50 Гц. AuK-Flash использует ту же архитектуру с дополнительным дистиллированным сэмплером, созданным с помощью консистентной инициализации и маршрутизированного по задачам развязанного DMD. Все остальные компоненты общие.

Шаги сэмплирования — AuK: 32 вычисления функции, настраиваемо. AuK-Flash: 4, фиксировано.

Управление без классификатора — AuK: масштаб 2.0, настраиваемый. AuK-Flash: отсутствует (CFG=0).

Размер чекпоинта — AuK: auk_base.safetensors размером 6.122 ГБ. AuK-Flash: auk_flash.safetensors размером 6.122 ГБ. Идентичны до мегабайта.

Общий рантайм — это VAE размером 637 МБ плюс энкодер Qwen/Qwen2.5-Omni-3B, которые загружаются отдельно и используются обоими.

Заявленная скорость — AuK-Flash: в 4,5 раза быстрее по реальному времени, чем 32-NFE учитель, при одинаковом оборудовании, длительности и размере батча.

Лицензия — MIT для обоих, что на этот раз означает именно то, что написано.

Идентичный размер контрольной точки — вот та деталь, которая переворачивает всё сравнение. Дистиллированные варианты обычно платят за скорость меньшим размером. AuK-Flash не меньше. Вы не экономите место на диске, не экономите время передачи и — поскольку энкодер и VAE общие, а DiT имеет ту же ширину — не получаете значимой экономии VRAM, выбирая студента. Единственный ресурс, который Flash вам возвращает, — это время. В любом случае стоит назвать одну бюджетную ловушку: «1.5B» в названии модели описывает диффузионный бэкбон, а файл на диске весит 6.122 ГБ. Предусмотрите место для файла.

Где AuK-Flash действительно превосходит полную модель

Это та часть, где инстинкт «distilled = worse» даёт сбой, и это подтверждается на нескольких несвязанных семействах задач в таблицах отчёта. Начнём с восприятия. На наборе для улучшения речи DNS Challenge Flash получает UTMOS 4.05 против 3.86 у AuK; на CHiME-4 — 3.91 против 3.72; на Libri2Mix — 4.03 против 3.87; на VCTKSR — 4.05 против 3.93. Flash также выигрывает в столбце ошибок распознавания на двух из этих четырёх наборов: WER на CHiME-4 составляет 7.84 против 7.98, а на VCTKSR — 2.92 против 3.06. Естественность по оценкам людей — это единственная ось, по которой ученик стабильно впереди, и отчёт говорит об этом прямо: полная модель обеспечивает более высокую лингвистическую точность и точность редактирования, тогда как Flash «часто предлагает лучшее перцептивное качество».

Преимущества не ограничиваются улучшением речи. По метрике edit-ratio в MMAE-Speech — попадает ли правка в заданную величину — Flash набирает 13,85 против 12,44 у AuK. По паралингвистической колонке SpeechEditBench — 39,25 против 38,50. По задаче синтеза речи из английского описания в InstructTTSEval — 82,40 против 81,60, что повторяет лучший базовый результат в этой строке. По акустическому редактированию в наборе Ming-Freeform он показывает наивысшее сходство диктора в семействе: 0,79 для китайского и 0,75 для английского против 0,78 и 0,74 у базовой модели. Иными словами, сохранение идентичности диктора — одна из вещей, которые дают четыре шага; в собственном резюме отчёта указано, что полная модель даёт более низкую среднюю ошибку распознавания, тогда как Flash лучше сохраняет идентичность диктора. Если вы занимаетесь конверсией голоса, дубляжом или улучшением речи, где тембр важнее, чем ошибка слов, модель-«ученик» — лучший выбор.

A two-column scoreboard comparing AuK and AuK-Flash across six dimensions. AuK: 32 configurable sampling steps, CFG scale 2.0, Seed-TTS-Eval WER 2.65 average, editing accuracy 91.83, enhancement UTMOS 3.86, checkpoint size 6.122 GB. AuK-Flash: 4 fixed sampling steps, no guidance (CFG 0), Seed-TTS-Eval WER 2.85 average, editing accuracy 87.50, enhancement UTMOS 4.05, checkpoint size 6.122 GB. Footer reads "Vendor-reported figures, AuK technical report; no independent reproduction yet."

Где 32 шага всё ещё оправдывают своё существование

Преимущества базовой модели сосредоточены именно там, где вы ожидали бы от диффузионной модели с большим бюджетом выборки: во всём, где вывод должен быть лингвистически корректным.

На Seed-TTS-Eval средний WER у AuK составляет 2,65 против 2,85 у Flash, при этом сходство голоса — 0,795 против 0,790. Разброс внутри этого среднего значения информативнее, чем само среднее. На английском тестовом наборе они практически вровень — 1,02 и 1,03 — а на китайском расходятся: 1,02 против 1,10, и снова на сложном китайском поднаборе: 5,91 против 6,43. Именно на китайском дополнительные шаги окупаются.

Та же закономерность проявляется и в следовании инструкциям. В задаче преобразования описания в речь на китайском языке из InstructTTSEval разрыв значителен: 83.37 у AuK против 78.80 у Flash, и в отчёте отмечается, что базовая модель лидирует по всем трём китайским метрикам этого набора, в то время как «главное преимущество Flash — более сильный результат по английскому DSD». Разделяет их язык, а не архитектура.

Точность редактирования отличает их сильнее всего. Точность редактирования контента SpeechEditBench составляет 91.83 у AuK против 87.50 у Flash — это самый большой разрыв в сравнении. Акустическое редактирование почти столь же однобоко: 37.07 против 30.26. В наборе Ming-Freeform AuK показывает более низкий WER почти во всех значимых случаях: 3.09 против 3.34 при полном редактировании китайского текста и значительно более широкий разрыв 3.96 против 4.84 при полном редактировании английского. Если ваш продукт переписывает слова в чьей-то записи — правки текста песен, замена контента, вставка и удаление — именно 32-шаговая модель сохраняет достоверность транскрипта, и разница в 8× по числу шагов оправдывает затраты.

Обе модели, по цифрам самого отчёта, всё ещё слабы в эмоциональном редактировании: точность эмоций SpeechEditBench составляет 9.94 для AuK и 6.29 для Flash. Это не артефакт дистилляции. Это семейство задач, которое никто не решил, и выбор студента не сделает вас хуже в этом, чем вы уже есть.

4.5× — это число сэмплера, а не сквозное число.

Вот арифметика, которую скрывает громкое ускорение из заголовков, и это самое полезное, что нужно понять, прежде чем доверить свою архитектуру Flash.

AuK-Flash выполняет 4 шага сэмплирования, тогда как AuK — 32. Это в 8 раз меньше шагов. Вендор сообщает о 4,5× ускорении по времени выполнения. Разница между этими двумя показателями — это всё, что окружает цикл сэмплирования, и она в основном определяется энкодером: мультимодальной моделью Qwen2.5-Omni-3B, которую загружают обе контрольные точки и которую обе должны запускать на каждом запросе. Этот энкодер примерно вдвое больше диффузионной основы, и его стоимость фиксирована. Flash не может его ускорить, потому что Flash не является его частью.

Итак, честная формулировка этого утверждения такова: 4.5× — это то, что вы получаете на диффузионной части в сопоставимых условиях, а ваш сквозной выигрыш будет равен той доле реального времени выполнения, которую фактически занимает цикл сэмплирования. Если вы выполняете длительную генерацию, где доминируют 32 шага на множестве латентных кадров, вы окажетесь близко к опубликованной цифре. Если ваша нагрузка — короткие клипы с интенсивной предобработкой инструкций или пакетная обработка небольших запросов, большая часть каждого вызова приходится на общий энкодер, и ваше реальное ускорение будет существенно меньше 4.5×. Измерьте свой собственный состав нагрузки, прежде чем ставить бюджет задержки в зависимость от этого. Эту сквозную цифру пока никто не опубликовал — включая вендора, который вообще не приводит ни абсолютных показателей задержки, ни требований к видеопамяти.

Что стоит дистилляция, по словам самих авторов.

Технический отчет необычно откровенен о том, где ученик дает сбой, и эти режимы отказа более полезны специалисту по развертыванию, чем таблица бенчмарков.

Целевые ориентиры, задаваемые учителем, оказались проблемой. Использование CFG-целей в ветви согласованности «может подвергнуть малошагового студента пересыщенным предсказаниям», что, по словам авторов, вызывает перерегулирование и слышимый клиппинг. Отдельно единое расписание Decoupled DMD «ухудшает разделение речи нескольких говорящих и отделение вокала»: некоторые выходные данные студента регрессируют к необработанной смеси — дистилляция стирает разделение, которое модель должна была осуществлять. Task-routed DMD — это описанное решение, и именно поэтому отчёт аккуратно ограничивает эту конкретную слабость рамками единого варианта. Если разделение речи — ключевая часть вашего конвейера, именно этот абзац стоит проверить, прежде чем доверять ему.

Ещё два ограничения являются операционными, а не статистическими. Модуль Prompt Enhancer в конвейере сопоставляет разговорные формулировки о скорости, громкости и высоте тона с фиксированным набором поддерживаемых значений и отклоняет всё, что не может сопоставить, до запуска акустического вывода — поэтому неподдерживаемые запросы завершаются сбоем на раннем этапе, а не деградируют плавно. Кроме того, репозиторий принимает только Qwen/Qwen2.5-Omni-3B в качестве пути кодера; в README указано, что Qwen3-Omni в настоящее время не поддерживается, поэтому более новый кодер не является заменой без дополнительных изменений. Интеграция с ComfyUI имеет 30-секундное ограничение на последовательности «источник плюс цель».

Запуск обоих — это предусмотренная конфигурация.

Собственный мульти-GPU пример репозитория размещает AuK на одном устройстве, а AuK-Flash — на другом (cuda:0 и cuda:1), что служит верным признаком того, что Tencent ожидает их сосуществования, а не конкуренции. Это также правильное решение для большинства речевых стеков в продакшене, поскольку обе модели сильны в непересекающихся областях. Запросы с интенсивным редактированием и китайскоязычные запросы направляйте в AuK; улучшение, разделение, следование английским инструкциям и всё интерактивное — в AuK-Flash. Обе модели загружают один и тот же энкодер и один и тот же VAE, так что вы платите за этот общий рантайм один раз и переключаетесь между чекпоинтами за ним.

Это решение о маршрутизации на уровне модели, и оно имеет ту же форму, что и то, которое OrcaRouter применяет на уровне API для размещённых моделей. Место, где они сегодня пересекаются, — это стык в собственном конвейере AuK: Prompt Enhancer требует OpenAI-совместимый чат-эндпойнт, чтобы превратить черновую инструкцию в поддерживаемый моделью словарь, а необязательный резервный механизм ASR нуждается в пути транскрипции. Направьте любой из них на OpenAI-совместимый чат-эндпойнт — и вы получите один ключ для более чем 200 моделей, прейскурантную цену провайдера без наценки (0%) и автоматическое переключение при отказе бэкенда — что важно именно потому, что это релиз двухдневной давности без размещённого API и независимого воспроизведения, и вам не нужна непроверенная зависимость, сидящая на жёстко прописанном эндпойнте.

Впрочем, четко обозначьте, что недоступно. Ни AuK, ни AuK-Flash не обслуживаются ни одним хостинг-провайдером инференса — об этом прямо сказано на карточках Hugging Face — и ни один из них сегодня нельзя маршрутизировать через OrcaRouter. Это решение о самостоятельном хостинге от начала до конца.

A decision card headed "Which AuK checkpoint should you run?" with two columns. Pick AuK: content and lyric editing, Chinese speech generation, edit and transcript fidelity, best raw WER 2.65. Pick AuK-Flash: enhancement and separation, voice conversion and dubbing, English instruction TTS, 8x fewer sampling steps. A bar beneath both reads "Same encoder, same VAE, same 6.122 GB - run both."

Что еще неизвестно

Почти всё в этом релизе — данные со слов самого вендора. Ускорение в 4,5 раза, метрики WER, столбцы SpeechEditBench и строки UTMOS — всё это взято из собственного технического отчёта команды AuK (arXiv 2609.08936, подан 8 сентября): независимых воспроизведений нет, записей в сторонних лидербордах нет, результатов на нейтральном стенде нет. Сигнал о востребованности не менее слабый: по состоянию на 10 сентября два репозитория Hugging Face насчитывают 30 загрузок за последний месяц и примерно по два десятка лайков каждый, а репозиторий GitHub — 217 звёзд, 12 форков и трёх участников. Это исследовательский релиз, а не повальное увлечение.

img src="4.png" alt="Скриншот README-файла репозитория Tencent-Hunyuan AuK на GitHub, на котором показано уведомление об открытом исходном коде от 9 сентября 2026 года и таблица вариантов AuK и AuK-Flash"> p>Сам по себе релиз был тихим, и это стоит проговорить прямо, потому что в нём легко увидеть больше, чем есть на самом деле. Не было ни анонса Hunyuan, ни поста в блоге, ни страницы с ценами, ни мероприятия по запуску. Единственное датированное заявление вендора — одна строка в README репозитория: [2026/09/09] Мы открываем исходный код AuK. Метаданные репозитория на Hugging Face показывают, что Spaces были созданы раньше, в середине августа, а к весам последний раз обращались 9 и 10 сентября, так что упаковка произошла до анонса. Что известно из репозитория: веса обоих вариантов под лицензией MIT, технический отчёт, рабочие инструкции по загрузке для Hugging Face и ModelScope и документированный список задач. Что не подтверждено: переживут ли какие-либо из заявленных чисел независимую проверку, появится ли размещённый эндпоинт и останется ли чекпойнт Flash рекомендуемым по умолчанию после того, как его запустят другие люди.

Screenshot of the Tencent-Hunyuan/AuK repository on GitHub, captured September 10 2026, showing the README News entry dated 2026/09/09 reading "We open-source AuK. Code and model weights are publicly available.", the README headline "AuK: An Open-Source Foundational Model for Speech Generation and Editing", and repository counts of 217 stars, 12 forks and 3 contributors.

Какой выбрать?

Если вы создаёте контент, занимаетесь редактированием текстов песен или любым образом обеспечиваете речь на китайском языке, возьмите AuK и примите 32 шага. Его преимущества там значительны, стабильны в двух независимых редакторских комплектах и направлены как раз на ту ошибку корректности — неверное слово в транскрипте, — которую пользователи замечают сразу.

Если вы создаёте улучшение, разделение, преобразование голоса или что-либо, где результат ожидает человек, берите AuK-Flash. Он значительно быстрее в цикле сэмплирования, безоговорочно выигрывает по строкам перцептуального качества и лучше сохраняет идентичность говорящего, чем модель, из которой он был дистиллирован. Существующий разрыв в качестве сосредоточен в задачах, которые вы, вероятно, не запускаете.

Если вы создаёте речевой продукт, который охватывает оба варианта, запускайте оба. Тот же диск, тот же кодировщик, та же лицензия, одно отличие в конфигурации — и тот же шаблон развёртывания, который репозиторий уже демонстрирует. Единственное, чего стоит подождать, — это ваше собственное измерение сквозной задержки: 4.5× реален, но он относится к сэмплеру, и только ваша рабочая нагрузка подскажет, какая его часть дойдёт до ваших пользователей.