
AuK-Flash kontra MathForm-8B: Dwóch cichych specjalistów na zapożyczonych mózgach Qwen
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
AuK-Flash i MathForm-8B mają ze sobą więcej wspólnego, niż oba laboratoria prawdopodobnie zdają sobie sprawę, i żadna z tych rzeczy nie jest zadaniem, które wykonują. MathForm-8B to model autoformalizacji 8B od OpenBMB — dostrojona wersja Qwen3-8B na licencji Apache-2.0, która zamienia matematykę w języku naturalnym na wyrażenia w Lean 4, które kompilator może sprawdzić. AuK-Flash to destylowany model mowy Tencent — generator dyfuzyjny na licencji MIT do syntezy i edycji mowy, który kieruje swoje instrukcje przez enkoder Qwen2.5-Omni-3B, zanim wytworzy dźwięk. Jeden przekształca matematykę prozą w tekst formalny możliwy do zweryfikowania dowodowo; drugi przekształca tekst i instrukcje w audio. Łączy je ta sama strategia architektoniczna, realizowana z przeciwnych kierunków: żaden nie trenuje od zera ogólnego modelu językowego — każdy opakowuje istniejący otwarty model i wkłada prawdziwy wysiłek w swoją modalność wyjściową. Oba zostały też wydane w ten sam sposób — po cichu na Hugging Face, bez komunikatu prasowego — i oba są dokładnie tym rodzajem wąskiego, samodzielnie hostowanego wydania, którego benchmark dla modeli granicznych nie jest w stanie uchwycić.
Wzorzec, który ich łączy.
Porównaj oba wydania obok siebie, a zobaczysz, że to niemal lustrzane odbicia. Repozytorium AuK-Flash firmy Tencent ma datę 21 sierpnia na Hugging Face (bazowy model AuK – 18 sierpnia); ogłoszenie open-source – z kodem, wagami i linkami do demo – pojawiło się dopiero w tym tygodniu, z datą 7 września na karcie Hugging Face i 9 września w powiązanym repozytorium GitHub. Repozytorium MathForm-8B od OpenBMB pojawiło się 14 sierpnia i w ogóle nie zostało ogłoszone. W obu przypadkach karta modelu jest premierą, wagi są swobodnie dostępne na permsywnej licencji i nie ma hostowanego API do testów – pobierasz checkpoint i uruchamiasz go na sprzęcie, który kontrolujesz. Dla czytelnika decydującego, co wdrożyć, ten wspólny kształt liczy się bardziej niż różnica w domenie: oba projekty to zakłady, że wąsko ukierunkowany otwarty model może obsłużyć niszę, którą model ogólny obsługuje słabo, i oba wymagają, abyś sam dostarczył ewaluację, której dostawca nie wykonał.
Uczciwa tablica wyników
Ponieważ te dwa modele nie pokrywają się na żadnym benchmarku, tablica wyników jest portretem dwóch różnych zakładów, a nie rankingiem. Źródła mają znaczenie w każdym wierszu — twierdzenia AuK-Flash to oświadczenia z karty Tencent sprzed kilku dni i niezreprodukowane; wyniki MathForm-8B są raportowane przez OpenBMB z arXiv 2608.14221 i niezreprodukowane:
• Co to jest — AuK-Flash: model generowania i edycji mowy firmy Tencent (~1,5 mld parametrów), wydestylowany do wariantu dyfuzyjnego z 4 krokami. MathForm-8B: autoformalizator OpenBMB z 8 mld parametrów, który zamienia nieformalną matematykę na Lean 4.
• Wyjście — AuK-Flash: dźwięk 24 kHz — mowa, edytowana mowa, rozdzielone źródła. MathForm-8B: stwierdzenia Lean 4 z nagłówkiem i nazwanym twierdzeniem.
• Konstrukcja — AuK-Flash: dyfuzyjny transformer zdestylowany do ustalonego NFE 4 / CFG 0, z Qwen2.5-Omni-3B jako enkoderem instrukcji. MathForm-8B: Qwen3-8B dostrojony metodą SFT, a następnie RL na zbiorze danych FormalVerse liczącym ~367 tys. przykładów.
• Język wejściowy — AuK-Flash: chiński i angielski (zgodnie z kartą modelu). MathForm-8B: angielski, w rejestrze sformułowań problemów matematycznych.
• Wydanie — AuK-Flash: repozytoria 18/21 sierpnia; open-source ogłoszono 7–9 września. MathForm-8B: repozytorium 14 sierpnia; brak ogłoszenia na moment pisania.
• Dowody — AuK-Flash: jak dotąd żadnych poza listą możliwości karty. MathForm-8B: dostawca deklaruje 88,06% Pass@8 w teście składni oraz 72,37% w teście spójności, z wynikami FATE-H 63% i FATE-X 37% na trudnych zestawach spójności.

Wynik na tablicy w sześciu wierszach: oba to specjaliści od otwartych wag z zapożyczonymi mózgami Qwena i cienkimi niezależnymi dowodami — różnią się tym, co tworzą, a nie tym, jak zostały wydane.
AuK-Flash: mowa jako wynik specjalisty
Stwierdzenie o „pożyczonym mózgu” AuK-Flash jest dosłowne, a nie retoryczne. Checkpoint publikowany przez Tencent zawiera wagi transformera dyfuzyjnego i fuzji warstw; model, który faktycznie rozumie twoją instrukcję — Qwen2.5-Omni-3B — jest pobierany osobno i ładowany w trakcie działania, podobnie zresztą jak BigVGANFlowVAE, który zamienia latent z powrotem w przebieg o częstotliwości próbkowania 24 kHz. To, co wytrenował Tencent, nie jest więc wcale modelem językowym, lecz warunkowym generatorem typu flow-matching: na podstawie planu semantycznego z enkodera Qwen generuje on audio w zaledwie kilku krokach. AuK-Flash to zdestylowana do czterech kroków wersja tego generatora, a jego repozytorium — około 6,1 GB na checkpoint Flash w BF16 plus 637 MB VAE — zawiera CLI, silnik w Pythonie, węzły Gradio i ComfyUI oraz skrypt do dostrajania. Lista możliwości jest jak na model mowy szeroka: TTS zero-shot i sterowany instrukcjami, edycja treści i tekstów piosenek, zmiany wysokości/tempa/głośności oraz emocji/barwy głosu, usuwanie obcego akcentu, zamiana na szept, poprawa jakości i separacja źródeł — wszystko za pośrednictwem jednego interfejsu do poleceń w języku naturalnym, po chińsku i po angielsku. To, czy każda z tych funkcji działa zgodnie z opisem, nie zostało przetestowane poza Tencentem; samo twierdzenie o architekturze — mały Qwen, który rozumie, oraz zdestylowany model dyfuzyjny, który generuje dźwięk — jest natomiast widoczne w samym repozytorium.

Strona repozytorium tencent/AuK-Flash — wagi na licencji MIT dla zdestylowanego modelu mowy w 4 krokach, z enkoderem Qwen2.5-Omni-3B i VAE ładowanymi z osobnych plików w czasie działania.
MathForm-8B: formalny dowód jako wynik specjalisty
MathForm-8B to ten sam wzorzec w sąsiedniej dziedzinie. OpenBMB wziął Qwen3-8B – generalistę trenowanego na 119 językach – i poświęcił cały jego potencjał jednemu rodzajowi wyniku: sformułowaniu twierdzenia w Lean 4 wyprowadzanemu z problemu zapisanego językiem naturalnym. Etap SFT na FormalVerse uczy odwzorowania z języka nieformalnego na formalny; następnie etap RL doskonali je na podstawie werdyktu kompilatora Leana, dlatego model podaje nie niejasny wynik jakościowy, lecz Pass@8 przy sprawdzeniu składni oraz bardziej rygorystyczny wynik przy sprawdzeniu spójności semantycznej. Liczby producenta są wysokie – 88,06% i 72,37% w sześciu benchmarkach, przewyższające specjalistyczne modele bazowe o wielkości 7B–32B opisane w artykule – i tak samo niezweryfikowane jak twierdzenia AuK-Flash. Repozytorium jest na licencji Apache-2.0, udostępniane przez Transformers, vLLM lub SGLang, i w zamian oddaje w zasadzie wszystko, z czego znany jest Qwen3-8B: brak ogólnego czatu w 119 językach, budżet wyjściowy dla Leana wynoszący około 16 tys. tokenów oraz brak udokumentowanych możliwości poza formalizacją.

Repozytorium openbmb/MathForm-8B — wagi Apache-2.0 dla autoformalizatora, wymieniające Qwen3-8B jako model bazowy. To cała publiczna obecność MathForm-8B.
Weryfikacja to temat, którego żaden z benchmarków nie obejmuje.
Gdy zestawimy oba wyniki obok siebie, ujawnia się dziwna symetria. Cała konstrukcja MathForm-8B istnieje dlatego, że matematyka w języku naturalnym nie ma sygnału poprawności — dostarcza go kompilator Lean, więc model jest trenowany względem werdyktu zaliczenia/niezaliczenia, który model może realnie odczuć. Dziedzina AuK-Flash mierzy się z tym samym problemem, tylko rozwiązuje go inaczej: nie istnieje kompilator, który odpowiedziałby na pytanie „czy ten klip brzmi jak mówca, szeptem, z usuniętym kaszlem”, więc sygnałem zaliczenia/niezaliczenia jest ludzkie ucho. Żaden zagregowany benchmark tego nie mierzy — Elo na tekście ani ocena jakości syntetycznej mowy niewiele mówią o tym, czy główna obietnica modelu specjalistycznego (wyniki zweryfikowane w Lean albo edytowalna, klonowalna mowa) sprawdza się w twoim przepływie pracy. Praktyczna konsekwencja jest taka, że oba modele trzeba oceniać tak, jak sam dostawca nie był w stanie ich ocenić: MathForm-8B przez przepuszczenie jego wyników przez Lean, a AuK-Flash przez odsłuchanie jego wyników na twoich własnych danych. Dopóki ktoś tego nie zrobi, deklaracje w nagłówkach obu kart są kierunkami, a nie wynikami.
Dla kogo jest każdy z nich, a kto powinien poczekać
• Wybierz MathForm-8B, gdy Twoja praca kończy się na formalizacji — konwersji banków zadań, budowaniu korpusów Lean, zasilaniu automatyzacji dowodów — i chcesz mieć najmocniejszego otwartego specjalistę w tej klasie wagowej. To nie jest model ogólnego przeznaczenia, więc połącz go z takim, który zajmie się wszystkim wokół etapu formalizacji.
• Wybierz AuK-Flash, gdy Twoje zadanie kończy się na audio — głos do odczytania tekstu, nagranie do edycji, miks do rozdzielenia — i chcesz otwartego modelu, który traktuje generowanie i edycję jako jedną operację. Zarezerwuj w budżecie miejsce także na enkoder Qwen i na własny test odsłuchowy.
• Poczekaj z obydwoma, jeśli potrzebujesz sprawdzonego, wspieranego elementu infrastruktury: żaden nie ma niezależnych wyników, żaden nie ma hostowanego API, a oba mają od kilku dni do kilku tygodni. Wzorzec, który warto ukraść, ma charakter architektoniczny — połączenie małego zapożyczonego mózgu językowego z wyspecjalizowaną głową wyjściową jest znacznie tańsze w trenowaniu i iterowaniu niż pełny generalista — i jest to wzorzec, który możesz zastosować we własnym fine-tuningu, niezależnie od tego, czy kiedykolwiek uruchomisz te dwa checkpointy.
Obie premiery ilustrują również, dlaczego warstwa routingu zasługuje na swoje miejsce w mieszanym stosie: gdy Twój potok przechodzi od ogólnego modelu rozumowania do specjalisty takiego jak jeden z tych, rolą rutera jest to, aby nie zobowiązywać architektury do jednej odpowiedzi. Jedno API obejmujące ponad 200 modeli, automatyczne przełączanie awaryjne w przypadku degradacji dostawcy oraz ceny listowe dostawców przekazywane z 0% marżą oznaczają, że możesz utrzymać model ogólny na domyślnej ścieżce i wywoływać specjalistę tylko dla tej podgrupy zapytań, która go potrzebuje — a w dniu, w którym pojawi się lepszy model, wymienić specjalistę na nowego.
Porównanie, które warto zachować, to nie AuK-Flash kontra MathForm-8B — one nigdy nie będą konkurować o to samo zapytanie. To oba te modele przeciwko założeniu, że graniczny model ogólny jest jedynym modelem, który warto uruchamiać. Edycja mowy i zweryfikowana formalizacja to dziedziny, w których mały, wyspecjalizowany, otwarty model z zapożyczonym mózgiem może pokonać znacznie większy model, którego nigdy nie skierowano na dany problem — co jest właśnie tym zakładem, który Tencent i OpenBMB właśnie opublikowali, i właśnie tym, co wciąż wymaga niezależnego dowodu.
