Титульная карточка для сравнения «AuK-Flash vs MathForm-8B» с подзаголовком «Два тихих специалиста на заимствованных мозгах Qwen», показывающая центральный чип с надписью «заимствованный мозг Qwen», от которого расходятся ветви к плитке вывода речи AuK-Flash и плитке вывода Lean-4 MathForm-8B, с логотипом OrcaRouter, вкомпонованным в углу.
Guides & Insights

AuK-Flash против MathForm-8B: два незаметных специалиста на заимствованных мозгах Qwen

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

AuK-Flash and MathForm-8B have more in common than either lab probably realizes, and none of it is the task they do. MathForm-8B is OpenBMB's 8B autoformalization model — an Apache-2.0 fine-tune of Qwen3-8B that turns natural-language mathematics into Lean 4 statements a compiler can check. AuK-Flash is Tencent's distilled speech model — an MIT-licensed diffusion generator for speech synthesis and editing that routes its instructions through a Qwen2.5-Omni-3B encoder before it makes sound. One converts prose math into proof-checkable formal text; the other converts text and instructions into audio. They share the same architectural strategy from opposite directions: neither trains a general language brain from scratch — each wraps an existing open model and spends the real effort on its output modality. Both shipped the same way too — weights quietly on Hugging Face, no press release — and both are exactly the kind of narrow, self-hosted release that a frontier-model benchmark cannot capture.У AuK-Flash и MathForm-8B больше общего, чем, вероятно, осознаёт любая из лабораторий, и всё это общее никак не связано с их задачами. MathForm-8B — это 8B-модель автоформализации от OpenBMB — Apache-2.0 дообучение Qwen3-8B, превращающее естественно-языковую математику в утверждения Lean 4, которые компилятор может проверить. AuK-Flash — это дистиллированная речевая модель от Tencent — диффузионный генератор с лицензией MIT для синтеза и редактирования речи, который перед генерацией звука пропускает свои инструкции через энкодер Qwen2.5-Omni-3B. Одна превращает математические тексты в формальный текст, проверяемый на корректность доказательств; другая превращает текст и инструкции в аудио. Их объединяет одна и та же архитектурная стратегия, применённая с противоположных сторон: ни одна из них не обучает универсальный языковой мозг с нуля — каждая оборачивает существующую открытую модель и вкладывает реальные усилия в свою выходную модальность. Выпущены они тоже одинаково — веса тихо выложены на Hugging Face, без пресс-релиза, — и обе представляют собой именно тот тип узких, самостоятельно хостируемых релизов, который не способен уловить ни один бенчмарк для frontier-моделей.

Паттерн, который их объединяет

Посмотрите на два процесса выпуска бок о бок — они почти зеркальны. Репозиторий Tencent AuK-Flash датирован 21 августа на Hugging Face (родственная база AuK — 18 августа); анонс открытого исходного кода — код, веса и ссылки на демо — появился только на этой неделе, с датой 7 сентября на карточке Hugging Face и 9 сентября в связанном репозитории GitHub. Репозиторий OpenBMB MathForm-8B появился 14 августа без какого-либо анонса. В обоих случаях карточка модели и есть запуск: веса находятся в открытом доступе под разрешающей лицензией, и нет размещённого API для ознакомления — вы скачиваете чекпойнт и запускаете его на оборудовании, которым владеете. Для читателя, решающего, что внедрять, такая общая форма важнее, чем различие в области: обе — ставки на то, что узкоспециализированная открытая модель может обслуживать нишу, с которой универсальная справляется плохо, и обе просят вас предоставить оценку, которую не предоставил вендор.

Честное табло

Поскольку две модели не пересекаются ни на одном бенчмарке, таблица результатов — портрет двух разных ставок, а не рейтинг. Источники важны в каждой строке: утверждения AuK-Flash — это заявления из карточки Tencent давностью несколько дней, не воспроизведённые; показатели MathForm-8B сообщены OpenBMB по данным arXiv 2608.14221 и не воспроизведены:

• Что это — AuK-Flash: модель Tencent для генерации и редактирования речи объёмом ~1.5B параметров, дистиллированная до 4-шагового диффузионного варианта. MathForm-8B: автоформализатор OpenBMB с 8B параметров, превращающий неформальную математику в Lean 4.

• Выход — AuK-Flash: аудио 24 кГц — речь, отредактированная речь, разделённые источники. MathForm-8B: утверждения на Lean 4 с заголовком и именованной теоремой.

• Архитектура — AuK-Flash: диффузионный трансформер, дистиллированный до фиксированных NFE 4 / CFG 0, с Qwen2.5-Omni-3B в качестве энкодера инструкций. MathForm-8B: Qwen3-8B, дообученный с SFT, затем RL на наборе данных FormalVerse (примерно 367K примеров).

• Входной язык — AuK-Flash: китайский и английский (согласно карточке модели). MathForm-8B: английский, в регистре формулировок математических задач.

• Релиз — AuK-Flash: репозитории 18/21 августа; открытый исходный код анонсирован 7–9 сентября. MathForm-8B: репозиторий 14 августа; на момент написания анонса нет.

• Доказательства — AuK-Flash: пока нет ничего, кроме списка возможностей карты. MathForm-8B: заявленные производителем 88,06% Pass@8 при проверке синтаксиса и 72,37% при проверке согласованности, с показателями FATE-H 63% и FATE-X 37% на сложных наборах на согласованность.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

Сводка в шесть строк: обе — специализированные модели с открытыми весами, заимствованными у Qwen мозгами и скудной независимой доказательной базой. Различаются они тем, что производят, а не тем, как их выпустили.

AuK-Flash: речь как результат работы специалиста

Утверждение о «заимствованном мозге» у AuK-Flash следует понимать буквально, а не как риторический приём. Публикуемая Tencent контрольная точка содержит диффузионный трансформер и веса слияния слоёв; модель, которая на самом деле понимает вашу инструкцию, — Qwen2.5-Omni-3B, — загружается отдельно и подключается во время выполнения; то же самое относится и к BigVGANFlowVAE, который превращает скрытое представление обратно в аудиосигнал с частотой 24 кГц. Таким образом, Tencent обучала не языковую модель как таковую, а условный генератор на основе flow-matching: получив семантический план от энкодера Qwen, он синтезирует аудио всего за несколько шагов. AuK-Flash — это дистиллированная версия такого генератора, работающая за четыре шага; его репозиторий — около 6,1 ГБ для контрольной точки Flash в формате BF16 плюс VAE на 637 МБ — поставляется с CLI, Python-движком, узлами для Gradio и ComfyUI, а также скриптом для тонкой настройки. Список возможностей для речевой модели широк: zero-shot и инструктивный TTS, редактирование контента и текста песен, изменение высоты тона, скорости, громкости, эмоций и тембра, снятие акцента, преобразование шёпота, улучшение качества и разделение источников — и всё это через единый интерфейс инструкций на естественном языке, китайском и английском. Проверено ли, что каждая функция работает так, как описано, — за пределами Tencent неизвестно; однако архитектурная схема — небольшой Qwen, который понимает, и дистиллированная диффузионная модель, которая создаёт звук, — видна в самом репозитории.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

Страница репозитория tencent/AuK-Flash — веса под лицензией MIT для дистиллированной 4-шаговой речевой модели, где энкодер Qwen2.5-Omni-3B и VAE загружаются из отдельных файлов во время выполнения.

MathForm-8B: формальное доказательство как результат работы специалиста

MathForm-8B — это тот же паттерн, перенесённый на соседнюю область. OpenBMB взял Qwen3-8B — универсальную модель, обученную на 119 языках, — и направил весь её потенциал на одну форму вывода: утверждение теоремы Lean 4, выводимое из задачи на естественном языке. Этап SFT на FormalVerse обучает сопоставлению неформального с формальным; затем этап RL оттачивает его по вердикту компилятора Lean, поэтому модель сообщает не расплывчатую оценку качества, а Pass@8 при синтаксической проверке и более строгий Pass при проверке семантической согласованности. Заявленные разработчиком цифры внушительны — 88.06% и 72.37% на шести бенчмарках, что превосходит специализированные базовые модели 7B–32B из статьи, — но столь же не воспроизведены независимо, как и утверждения AuK-Flash. Репозиторий доступен под лицензией Apache-2.0, развёртывается через Transformers, vLLM или SGLang и в обмен отдаёт практически всё, чем известен Qwen3-8B: никакого общего чата на 119 языках, бюджет вывода примерно в 16K токенов для Lean и никаких документированных возможностей вне формализации.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

Репозиторий openbmb/MathForm-8B — это веса Apache-2.0 для автоформализатора, базовой моделью которого указана Qwen3-8B. Это вся публичная поверхность MathForm-8B.

Верификация — это тема, которую не охватывает ни один из бенчмарков.

Если поставить два результата рядом, обнаруживается странная симметрия. Весь замысел MathForm-8B существует потому, что в математике на естественном языке нет сигнала корректности — компилятор Lean предоставляет такой сигнал, поэтому модель обучается на вердикте «прошло/не прошло», который она действительно может ощущать. У области AuK-Flash та же проблема, но другое решение: не существует компилятора для вопроса «звучит ли этот клип как голос диктора, шёпотом, без кашля», поэтому сигналом «прошло/не прошло» служит человеческое ухо. Ни один сводный бенчмарк этого не измеряет — ни Elo по тексту, ни оценка качества синтезированной речи мало что говорят о том, выполняется ли ключевое обещание специализированной модели (верифицированный Lean или редактируемая, клонируемая речь) в вашем рабочем процессе. Практическое следствие таково: обе модели нужно оценивать так, как это не смог сделать вендор, — MathForm-8B прогоном её вывода через Lean, AuK-Flash прослушиванием её вывода на ваших собственных данных. Пока кто-то этого не сделает, громкие заявления на обеих карточках — это направления, а не результаты.

Кому подходит каждый вариант, а кому стоит подождать

• Выбирайте MathForm-8B, если ваша рабочая нагрузка заканчивается на формализации — преобразование банков задач, создание корпусов Lean, подача в автоматизацию доказательств — и вам нужен самый сильный открытый специалист такого веса. Это не универсальная модель, поэтому используйте её в паре с той, которая закрывает всё остальное вокруг формального шага.

• Выбирайте AuK-Flash, когда у вас на выходе аудио — голос для озвучивания вашего текста, запись для редактирования или микс для разделения — и вам нужна открытая модель, рассматривающая генерацию и редактирование как одну операцию. Заложите в бюджет и сопутствующий ему кодировщик Qwen, и собственное прослушивание.

Повремените с обеими, если вам нужна проверенная и поддерживаемая инфраструктура: ни у одной нет независимых результатов, ни у одной нет размещённого API, и обе появились всего несколько дней или недель назад. Паттерн, который стоит перенять, — архитектурный: небольшой заимствованный языковой мозг плюс специализированная выходная голова — это гораздо дешевле в обучении и итерациях, чем полный генералист. И вы можете применить этот паттерн в собственной тонкой настройке, независимо от того, будете ли вы когда-либо запускать эти две контрольные точки.

Оба релиза также иллюстрируют, почему маршрутизирующий слой оправдывает себя в смешанном стеке: когда ваш пайплайн переходит с универсальной модели рассуждений на специализированную вроде этих, суть маршрутизатора в том, чтобы не привязывать архитектуру к единственному ответу. Один API на 200+ моделей, автоматическое переключение на резерв при деградации провайдера и передача прейскурантных цен провайдера без наценки (0%) позволяют держать универсальную модель на пути по умолчанию, вызывать специализированную только для того подмножества запросов, где она нужна, — и в день выхода более сильной модели просто заменить её.

Сравнение, которое стоит держать в уме, — это не AuK-Flash против MathForm-8B: за один и тот же запрос они не будут соперничать никогда. Сравнивать нужно их обеих — против допущения, что единственная модель, которую стоит запускать, — это передовая универсальная модель. Редактирование речи и верифицированная формализация — это области, в которых небольшая узкоспециализированная открытая модель с «заимствованным мозгом» может побить гораздо более крупную модель, которую никогда не нацеливали на эту задачу, — именно на такое пари только что поставили Tencent и OpenBMB, и именно оно всё ещё требует независимого подтверждения.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube