Karta tytułowa hero do porównania 'AuK-Flash vs MathForm-8B' z podtytułem 'Dwóch cichych specjalistów na pożyczonych mózgach Qwen', przedstawiająca centralny chip oznaczony 'pożyczony mózg Qwen', rozgałęziający się do kafelka wyjścia mowy AuK-Flash oraz kafelka wyjścia Lean-4 MathForm-8B, z logo OrcaRouter wkomponowanym w rogu.
Guides & Insights

AuK-Flash kontra MathForm-8B: Dwóch cichych specjalistów na zapożyczonych mózgach Qwen

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

AuK-Flash i MathForm-8B mają ze sobą więcej wspólnego, niż oba laboratoria prawdopodobnie zdają sobie sprawę, i żadna z tych rzeczy nie jest zadaniem, które wykonują. MathForm-8B to model autoformalizacji 8B od OpenBMB — dostrojona wersja Qwen3-8B na licencji Apache-2.0, która zamienia matematykę w języku naturalnym na wyrażenia w Lean 4, które kompilator może sprawdzić. AuK-Flash to destylowany model mowy Tencent — generator dyfuzyjny na licencji MIT do syntezy i edycji mowy, który kieruje swoje instrukcje przez enkoder Qwen2.5-Omni-3B, zanim wytworzy dźwięk. Jeden przekształca matematykę prozą w tekst formalny możliwy do zweryfikowania dowodowo; drugi przekształca tekst i instrukcje w audio. Łączy je ta sama strategia architektoniczna, realizowana z przeciwnych kierunków: żaden nie trenuje od zera ogólnego modelu językowego — każdy opakowuje istniejący otwarty model i wkłada prawdziwy wysiłek w swoją modalność wyjściową. Oba zostały też wydane w ten sam sposób — po cichu na Hugging Face, bez komunikatu prasowego — i oba są dokładnie tym rodzajem wąskiego, samodzielnie hostowanego wydania, którego benchmark dla modeli granicznych nie jest w stanie uchwycić.

Wzorzec, który ich łączy.

Porównaj oba wydania obok siebie, a zobaczysz, że to niemal lustrzane odbicia. Repozytorium AuK-Flash firmy Tencent ma datę 21 sierpnia na Hugging Face (bazowy model AuK – 18 sierpnia); ogłoszenie open-source – z kodem, wagami i linkami do demo – pojawiło się dopiero w tym tygodniu, z datą 7 września na karcie Hugging Face i 9 września w powiązanym repozytorium GitHub. Repozytorium MathForm-8B od OpenBMB pojawiło się 14 sierpnia i w ogóle nie zostało ogłoszone. W obu przypadkach karta modelu jest premierą, wagi są swobodnie dostępne na permsywnej licencji i nie ma hostowanego API do testów – pobierasz checkpoint i uruchamiasz go na sprzęcie, który kontrolujesz. Dla czytelnika decydującego, co wdrożyć, ten wspólny kształt liczy się bardziej niż różnica w domenie: oba projekty to zakłady, że wąsko ukierunkowany otwarty model może obsłużyć niszę, którą model ogólny obsługuje słabo, i oba wymagają, abyś sam dostarczył ewaluację, której dostawca nie wykonał.

Uczciwa tablica wyników

Ponieważ te dwa modele nie pokrywają się na żadnym benchmarku, tablica wyników jest portretem dwóch różnych zakładów, a nie rankingiem. Źródła mają znaczenie w każdym wierszu — twierdzenia AuK-Flash to oświadczenia z karty Tencent sprzed kilku dni i niezreprodukowane; wyniki MathForm-8B są raportowane przez OpenBMB z arXiv 2608.14221 i niezreprodukowane:

• Co to jest — AuK-Flash: model generowania i edycji mowy firmy Tencent (~1,5 mld parametrów), wydestylowany do wariantu dyfuzyjnego z 4 krokami. MathForm-8B: autoformalizator OpenBMB z 8 mld parametrów, który zamienia nieformalną matematykę na Lean 4.

• Wyjście — AuK-Flash: dźwięk 24 kHz — mowa, edytowana mowa, rozdzielone źródła. MathForm-8B: stwierdzenia Lean 4 z nagłówkiem i nazwanym twierdzeniem.

• Konstrukcja — AuK-Flash: dyfuzyjny transformer zdestylowany do ustalonego NFE 4 / CFG 0, z Qwen2.5-Omni-3B jako enkoderem instrukcji. MathForm-8B: Qwen3-8B dostrojony metodą SFT, a następnie RL na zbiorze danych FormalVerse liczącym ~367 tys. przykładów.

• Język wejściowy — AuK-Flash: chiński i angielski (zgodnie z kartą modelu). MathForm-8B: angielski, w rejestrze sformułowań problemów matematycznych.

• Wydanie — AuK-Flash: repozytoria 18/21 sierpnia; open-source ogłoszono 7–9 września. MathForm-8B: repozytorium 14 sierpnia; brak ogłoszenia na moment pisania.

• Dowody — AuK-Flash: jak dotąd żadnych poza listą możliwości karty. MathForm-8B: dostawca deklaruje 88,06% Pass@8 w teście składni oraz 72,37% w teście spójności, z wynikami FATE-H 63% i FATE-X 37% na trudnych zestawach spójności.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

Wynik na tablicy w sześciu wierszach: oba to specjaliści od otwartych wag z zapożyczonymi mózgami Qwena i cienkimi niezależnymi dowodami — różnią się tym, co tworzą, a nie tym, jak zostały wydane.

AuK-Flash: mowa jako wynik specjalisty

Stwierdzenie o „pożyczonym mózgu” AuK-Flash jest dosłowne, a nie retoryczne. Checkpoint publikowany przez Tencent zawiera wagi transformera dyfuzyjnego i fuzji warstw; model, który faktycznie rozumie twoją instrukcję — Qwen2.5-Omni-3B — jest pobierany osobno i ładowany w trakcie działania, podobnie zresztą jak BigVGANFlowVAE, który zamienia latent z powrotem w przebieg o częstotliwości próbkowania 24 kHz. To, co wytrenował Tencent, nie jest więc wcale modelem językowym, lecz warunkowym generatorem typu flow-matching: na podstawie planu semantycznego z enkodera Qwen generuje on audio w zaledwie kilku krokach. AuK-Flash to zdestylowana do czterech kroków wersja tego generatora, a jego repozytorium — około 6,1 GB na checkpoint Flash w BF16 plus 637 MB VAE — zawiera CLI, silnik w Pythonie, węzły Gradio i ComfyUI oraz skrypt do dostrajania. Lista możliwości jest jak na model mowy szeroka: TTS zero-shot i sterowany instrukcjami, edycja treści i tekstów piosenek, zmiany wysokości/tempa/głośności oraz emocji/barwy głosu, usuwanie obcego akcentu, zamiana na szept, poprawa jakości i separacja źródeł — wszystko za pośrednictwem jednego interfejsu do poleceń w języku naturalnym, po chińsku i po angielsku. To, czy każda z tych funkcji działa zgodnie z opisem, nie zostało przetestowane poza Tencentem; samo twierdzenie o architekturze — mały Qwen, który rozumie, oraz zdestylowany model dyfuzyjny, który generuje dźwięk — jest natomiast widoczne w samym repozytorium.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

Strona repozytorium tencent/AuK-Flash — wagi na licencji MIT dla zdestylowanego modelu mowy w 4 krokach, z enkoderem Qwen2.5-Omni-3B i VAE ładowanymi z osobnych plików w czasie działania.

MathForm-8B: formalny dowód jako wynik specjalisty

MathForm-8B to ten sam wzorzec w sąsiedniej dziedzinie. OpenBMB wziął Qwen3-8B – generalistę trenowanego na 119 językach – i poświęcił cały jego potencjał jednemu rodzajowi wyniku: sformułowaniu twierdzenia w Lean 4 wyprowadzanemu z problemu zapisanego językiem naturalnym. Etap SFT na FormalVerse uczy odwzorowania z języka nieformalnego na formalny; następnie etap RL doskonali je na podstawie werdyktu kompilatora Leana, dlatego model podaje nie niejasny wynik jakościowy, lecz Pass@8 przy sprawdzeniu składni oraz bardziej rygorystyczny wynik przy sprawdzeniu spójności semantycznej. Liczby producenta są wysokie – 88,06% i 72,37% w sześciu benchmarkach, przewyższające specjalistyczne modele bazowe o wielkości 7B–32B opisane w artykule – i tak samo niezweryfikowane jak twierdzenia AuK-Flash. Repozytorium jest na licencji Apache-2.0, udostępniane przez Transformers, vLLM lub SGLang, i w zamian oddaje w zasadzie wszystko, z czego znany jest Qwen3-8B: brak ogólnego czatu w 119 językach, budżet wyjściowy dla Leana wynoszący około 16 tys. tokenów oraz brak udokumentowanych możliwości poza formalizacją.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

Repozytorium openbmb/MathForm-8B — wagi Apache-2.0 dla autoformalizatora, wymieniające Qwen3-8B jako model bazowy. To cała publiczna obecność MathForm-8B.

Weryfikacja to temat, którego żaden z benchmarków nie obejmuje.

Gdy zestawimy oba wyniki obok siebie, ujawnia się dziwna symetria. Cała konstrukcja MathForm-8B istnieje dlatego, że matematyka w języku naturalnym nie ma sygnału poprawności — dostarcza go kompilator Lean, więc model jest trenowany względem werdyktu zaliczenia/niezaliczenia, który model może realnie odczuć. Dziedzina AuK-Flash mierzy się z tym samym problemem, tylko rozwiązuje go inaczej: nie istnieje kompilator, który odpowiedziałby na pytanie „czy ten klip brzmi jak mówca, szeptem, z usuniętym kaszlem”, więc sygnałem zaliczenia/niezaliczenia jest ludzkie ucho. Żaden zagregowany benchmark tego nie mierzy — Elo na tekście ani ocena jakości syntetycznej mowy niewiele mówią o tym, czy główna obietnica modelu specjalistycznego (wyniki zweryfikowane w Lean albo edytowalna, klonowalna mowa) sprawdza się w twoim przepływie pracy. Praktyczna konsekwencja jest taka, że oba modele trzeba oceniać tak, jak sam dostawca nie był w stanie ich ocenić: MathForm-8B przez przepuszczenie jego wyników przez Lean, a AuK-Flash przez odsłuchanie jego wyników na twoich własnych danych. Dopóki ktoś tego nie zrobi, deklaracje w nagłówkach obu kart są kierunkami, a nie wynikami.

Dla kogo jest każdy z nich, a kto powinien poczekać

• Wybierz MathForm-8B, gdy Twoja praca kończy się na formalizacji — konwersji banków zadań, budowaniu korpusów Lean, zasilaniu automatyzacji dowodów — i chcesz mieć najmocniejszego otwartego specjalistę w tej klasie wagowej. To nie jest model ogólnego przeznaczenia, więc połącz go z takim, który zajmie się wszystkim wokół etapu formalizacji.

• Wybierz AuK-Flash, gdy Twoje zadanie kończy się na audio — głos do odczytania tekstu, nagranie do edycji, miks do rozdzielenia — i chcesz otwartego modelu, który traktuje generowanie i edycję jako jedną operację. Zarezerwuj w budżecie miejsce także na enkoder Qwen i na własny test odsłuchowy.

• Poczekaj z obydwoma, jeśli potrzebujesz sprawdzonego, wspieranego elementu infrastruktury: żaden nie ma niezależnych wyników, żaden nie ma hostowanego API, a oba mają od kilku dni do kilku tygodni. Wzorzec, który warto ukraść, ma charakter architektoniczny — połączenie małego zapożyczonego mózgu językowego z wyspecjalizowaną głową wyjściową jest znacznie tańsze w trenowaniu i iterowaniu niż pełny generalista — i jest to wzorzec, który możesz zastosować we własnym fine-tuningu, niezależnie od tego, czy kiedykolwiek uruchomisz te dwa checkpointy.

Obie premiery ilustrują również, dlaczego warstwa routingu zasługuje na swoje miejsce w mieszanym stosie: gdy Twój potok przechodzi od ogólnego modelu rozumowania do specjalisty takiego jak jeden z tych, rolą rutera jest to, aby nie zobowiązywać architektury do jednej odpowiedzi. Jedno API obejmujące ponad 200 modeli, automatyczne przełączanie awaryjne w przypadku degradacji dostawcy oraz ceny listowe dostawców przekazywane z 0% marżą oznaczają, że możesz utrzymać model ogólny na domyślnej ścieżce i wywoływać specjalistę tylko dla tej podgrupy zapytań, która go potrzebuje — a w dniu, w którym pojawi się lepszy model, wymienić specjalistę na nowego.

Porównanie, które warto zachować, to nie AuK-Flash kontra MathForm-8B — one nigdy nie będą konkurować o to samo zapytanie. To oba te modele przeciwko założeniu, że graniczny model ogólny jest jedynym modelem, który warto uruchamiać. Edycja mowy i zweryfikowana formalizacja to dziedziny, w których mały, wyspecjalizowany, otwarty model z zapożyczonym mózgiem może pokonać znacznie większy model, którego nigdy nie skierowano na dany problem — co jest właśnie tym zakładem, który Tencent i OpenBMB właśnie opublikowali, i właśnie tym, co wciąż wymaga niezależnego dowodu.