Ein Hero-Titelbild für den Vergleich ‚AuK-Flash vs. MathForm-8B‘ mit dem Untertitel ‚Zwei leise Spezialisten auf geliehenen Qwen-Gehirnen‘, das einen zentralen Chip mit der Beschriftung ‚geliehenes Qwen-Gehirn‘ zeigt, der zu einer AuK-Flash-Sprachausgabe-Kachel und einer MathForm-8B-Lean-4-Ausgabe-Kachel verzweigt, wobei das OrcaRouter-Logo in der Ecke eingefügt ist.
Guides & Insights

AuK-Flash vs. MathForm-8B: Zwei stille Spezialisten auf geliehenen Qwen-Gehirnen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

AuK-Flash und MathForm-8B haben mehr gemeinsam, als den beiden Laboren wahrscheinlich bewusst ist, und keine dieser Gemeinsamkeiten betrifft die Aufgabe, die sie erfüllen. MathForm-8B ist das 8B-Autoformalisierungsmodell von OpenBMB – eine Apache-2.0-Feinabstimmung von Qwen3-8B, die natürlichsprachliche Mathematik in Lean-4-Aussagen umwandelt, die ein Compiler überprüfen kann. AuK-Flash ist Tencents destilliertes Sprachmodell – ein unter MIT-Lizenz stehender Diffusionsgenerator für Sprachsynthese und -bearbeitung, der seine Anweisungen über einen Qwen2.5-Omni-3B-Encoder leitet, bevor er Klang erzeugt. Das eine wandelt Prosa-Mathematik in beweisprüfbaren formalen Text um; das andere wandelt Text und Anweisungen in Audio um. Sie teilen dieselbe Architekturstrategie aus entgegengesetzten Richtungen: Keines trainiert ein allgemeines Sprachgehirn von Grund auf – jedes umhüllt ein bestehendes offenes Modell und investiert die eigentliche Arbeit in seine Ausgabemodalität. Beide wurden auch auf dieselbe Weise veröffentlicht – Gewichte still auf Hugging Face, keine Pressemitteilung – und beide sind genau die Art von schmaler, selbst gehosteter Veröffentlichung, die ein Benchmark für Frontier-Modelle nicht erfassen kann.

Das Muster, das sie vereint

Betrachten Sie die beiden Veröffentlichungsverläufe nebeneinander, und sie sind beinahe Spiegelbilder. Tencent’s AuK-Flash-Repository ist auf Hugging Face auf den 21. August datiert (das Schwestermodell AuK base auf den 18. August); die Open-Source-Ankündigung – Code, Gewichte und Demo-Links – kam erst diese Woche, datiert auf den 7. September auf der Hugging-Face-Karte und auf den 9. September im verlinkten GitHub-Repository. OpenBMB’s MathForm-8B-Repository erschien am 14. August ohne jegliche Ankündigung. In beiden Fällen ist die Modellkarte der Startschuss, die Gewichte sind ohne Zugangsbeschränkung unter einer freizügigen Lizenz verfügbar, und es gibt keine gehostete API zum Ausprobieren – Sie laden den Checkpoint herunter und führen ihn auf Hardware aus, die Sie kontrollieren. Für eine Leserin oder einen Leser, der entscheidet, was übernommen werden soll, zählt diese gemeinsame Form mehr als der Unterschied im Anwendungsbereich: Beides sind Wetten darauf, dass ein eng zugeschnittenes offenes Modell eine Nische bedienen kann, die ein Generalist schlecht bedient, und beide verlangen von Ihnen, die Evaluierung selbst durchzuführen, die der Anbieter nicht geliefert hat.

Die ehrliche Anzeigetafel

Da sich die beiden Modelle bei keinem Benchmark überschneiden, ist die Ergebnistafel eher ein Porträt zweier verschiedener Wetten als eine Rangliste. In jeder Zeile kommt es auf die Quellenangabe an — die Behauptungen von AuK-Flash sind Tencent-Card-Angaben, die mehrere Tage alt und nicht reproduziert sind; die Zahlen von MathForm-8B werden von OpenBMB aus arXiv 2608.14221 gemeldet und sind ebenfalls nicht reproduziert:

• Was es ist — AuK-Flash: Tencents ~1,5B-Modell für Sprachsynthese und -bearbeitung, destilliert zu einer 4-Schritt-Diffusionsvariante. MathForm-8B: OpenBMBs 8B-Autoformalisierer, der informelle Mathematik in Lean 4 überführt.

• Ausgabe — AuK-Flash: 24-kHz-Audio — Sprache, bearbeitete Sprache, separierte Quellen. MathForm-8B: Lean-4-Aussagen mit einem Header und einem benannten Theorem.

• Konstruktion — AuK-Flash: Diffusionstransformer, destilliert auf feste NFE 4 / CFG 0, mit Qwen2.5-Omni-3B als Anweisungs-Encoder. MathForm-8B: Qwen3-8B, feinabgestimmt mit SFT und anschließendem RL auf dem ~367K-Beispiele umfassenden FormalVerse-Datensatz.

• Eingabesprache — AuK-Flash: Chinesisch und Englisch (laut Modellkarte). MathForm-8B: Englisch, im Register von Mathematik-Aufgabenstellungen.

• Veröffentlichung — AuK-Flash: Repos 18./21. August; Open-Source-Ankündigung 7.–9. September. MathForm-8B: Repo 14. August; zum Zeitpunkt der Erstellung keine Ankündigung.

• Belege — AuK-Flash: noch keine über die Fähigkeitenliste der Karte hinaus. MathForm-8B: vom Anbieter angegeben 88.06% Pass@8 unter Syntaxprüfung und 72.37% unter Konsistenzprüfung, mit FATE-H 63% und FATE-X 37% bei den schwierigen Konsistenz-Sets.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

The scoreboard in six rows: both are open-weights specialists with borrowed Qwen brains and thin independent evidence — they differ in what they make, not in how they were released.

AuK-Flash: Sprache als Ausgabe des Spezialisten

Die Behauptung des "geborgten Gehirns" für AuK-Flash ist wörtlich zu verstehen, nicht rhetorisch. Der Checkpoint, den Tencent veröffentlicht, enthält den Diffusion-Transformer und die Layer-Fusion-Gewichte; das Modell, das Ihre Anweisung tatsächlich versteht — Qwen2.5-Omni-3B — wird separat heruntergeladen und zur Laufzeit geladen, ebenso wie das BigVGANFlowVAE, das das Latent wieder in eine 24-kHz-Wellenform zurückverwandelt. Was Tencent trainiert hat, ist daher überhaupt kein Sprachmodell, sondern ein konditionaler Flow-Matching-Generator: Erhält es einen semantischen Plan vom Qwen-Encoder, erzeugt es Audio in wenigen Schritten. AuK-Flash ist die vierstufige destillierte Version dieses Generators, und sein Repository — etwa 6,1 GB für den Flash-Checkpoint in BF16 plus ein 637 MB großes VAE — wird mit einer CLI, einer Python-Engine, Gradio- und ComfyUI-Knoten sowie einem Feinabstimmungsskript ausgeliefert. Die Fähigkeitenliste ist für ein Sprachmodell umfangreich: Zero-Shot- und Instruction-TTS, Inhalts- und Lyrik-Bearbeitung, Tonhöhen-/Geschwindigkeits-/Lautstärke- sowie Emotions-/Klangfarbenänderungen, De-Akzentuierung, Flüsterkonvertierung, Verbesserung und Quellentrennung, alles hinter einer einzigen natürlichsprachlichen Befehlsschnittstelle auf Chinesisch und Englisch. Ob jede Funktion wie beschrieben funktioniert, ist außerhalb von Tencent ungetestet; die Architekturbehauptung — ein kleines Qwen, das versteht, ein destilliertes Diffusionsmodell, das Klang erzeugt — ist im Repository selbst sichtbar.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

Das tencent/AuK-Flash-Repository — MIT-lizenzierte Gewichte für das destillierte 4-Schritt-Sprachmodell, wobei der Qwen2.5-Omni-3B-Encoder und das VAE zur Laufzeit aus separaten Dateien geladen werden.

MathForm-8B: formaler Beweis als Ausgabe des Spezialisten

MathForm-8B ist dasselbe Muster, eine Domäne weiter. OpenBMB nahm Qwen3-8B — einen über 119 Sprachen trainierten Generalisten — und steckte dessen gesamte Leistungsfähigkeit in eine einzige Ausgabeform: eine Lean-4-Theoremaussage, die aus einem natürlichsprachlichen Problem abgeleitet wird. Die SFT-Phase auf FormalVerse vermittelt die Abbildung von informell auf formal; eine RL-Phase schärft sie anschließend am Urteil des Lean-Compilers — weshalb das Modell keinen vagen Qualitätswert angibt, sondern ein Pass@8 unter Syntaxprüfung und ein strengeres Bestehen unter semantischer Konsistenzprüfung. Die Zahlen des Anbieters sind stark — 88,06 % und 72,37 % über sechs Benchmarks, besser als die spezialisierten 7B–32B-Baselines des Papers — und genauso wenig unabhängig reproduziert wie die Behauptungen zu AuK-Flash. Das Repository ist Apache-2.0-lizenziert, wird über Transformers, vLLM oder SGLang bereitgestellt und gibt dafür im Wesentlichen alles auf, wofür Qwen3-8B bekannt ist: kein allgemeiner Chat in 119 Sprachen, ein Ausgabebudget von grob 16.000 Token für Lean und keine dokumentierte Fähigkeit außerhalb der Formalisierung.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

Das openbmb/MathForm-8B-Repository enthält Apache-2.0-Gewichte für den Autoformalizer und listet Qwen3-8B als Basismodell auf. Das ist die gesamte öffentliche Präsenz von MathForm-8B.

Verifikation ist das Thema, das keiner der beiden Benchmarks erfasst.

Stellt man die beiden Ausgaben nebeneinander, zeigt sich eine seltsame Symmetrie. Die gesamte Konzeption von MathForm-8B existiert, weil Mathematik in natürlicher Sprache kein Korrektheitssignal besitzt – der Lean-Compiler liefert eines, also wird das Modell gegen ein Bestehen/Nichtbestehen-Urteil trainiert, das es tatsächlich spüren kann. AuK-Flash hat in seiner Domäne dasselbe Problem mit einer anderen Lösung: Es gibt keinen Compiler für „klingt dieser Clip wie der Sprecher, flüsternd, mit entferntem Husten“, also ist das Bestehen/Nichtbestehen-Signal ein menschliches Ohr. Keiner der aggregierten Benchmarks misst das – eine Elo-Zahl für Text oder ein Qualitätswert für synthetisierte Sprache sagt wenig darüber aus, ob das zentrale Versprechen des Spezialisten (verifiziertes Lean oder bearbeitbare, klonbare Stimme) in Ihrem Workflow hält. Die praktische Konsequenz ist, dass beide Modelle so evaluiert werden müssen, wie der Anbieter sie nicht evaluieren konnte: MathForm-8B, indem man seine Ausgabe durch Lean laufen lässt; AuK-Flash, indem man sich seine Ausgabe auf den eigenen Daten anhört. Bis das jemand tut, sind die Schlagzeilenbehauptungen auf beiden Modellkarten Richtungen, keine Ergebnisse.

Für wen welches geeignet ist und wer warten sollte.

• Wählen Sie MathForm-8B, wenn Ihre Arbeitslast bei der Formalisierung endet – also beim Konvertieren von Aufgabenpools, Aufbauen von Lean-Korpora und Versorgen von Beweisautomatisierung – und Sie den stärksten offenen Spezialisten in dieser Gewichtsklasse suchen. Es ist kein allgemeines Modell, kombinieren Sie es also mit einem für alles rund um den formalen Schritt.

• Wählen Sie AuK-Flash, wenn Ihre Arbeitslast mit Audio endet — eine Stimme, die Ihren Text spricht, eine Aufnahme zum Bearbeiten, einen Mix zum Trennen — und Sie ein offenes Modell möchten, das Generierung und Bearbeitung als einen einzigen Vorgang behandelt. Kalkulieren Sie zusätzlich den Qwen-Encoder und Ihren eigenen Hörtest ein.

Warte auf beide, wenn du eine erprobte, unterstützte Infrastruktur brauchst: {{1}}Keines von beiden hat unabhängige Ergebnisse, keines hat eine gehostete API, und beide sind erst Tage bis Wochen alt.{{/1}} {{2}}Das Muster, das du übernehmen solltest, ist architektonischer Natur – ein kleines ausgeliehenes Sprachgehirn plus ein spezialisierter Ausgabekopf ist weitaus günstiger zu trainieren und zu iterieren als ein vollständiger Generalist – und es ist ein Muster, das du in deinem eigenen Fine-Tuning übernehmen kannst, egal ob du diese beiden Checkpoints jemals ausführst oder nicht.{{/2}}

Beide Veröffentlichungen veranschaulichen außerdem, warum sich eine Routing-Schicht ihren Platz in einem gemischten Stack verdient: Wenn Ihre Pipeline von einem allgemeinen Reasoning-Modell zu einem Spezialisten wie einem dieser Modelle wechselt, besteht der Zweck des Routers darin, dass Sie die Architektur nicht auf eine einzige Antwort festlegen. Eine einzige API für über 200 Modelle, automatisches Failover, wenn ein Anbieter nachlässt, und die Weitergabe der Listenpreise der Anbieter mit 0 % Aufschlag bedeuten, dass Sie den Generalisten auf dem Standardpfad belassen, den Spezialisten nur für die Teilmenge der Anfragen aufrufen, die ihn benötigen, und ihn an dem Tag austauschen können, an dem ein besseres Modell verfügbar ist.

Der Vergleich, an dem man festhalten sollte, ist nicht AuK-Flash gegen MathForm-8B – sie werden nie um dieselbe Anfrage konkurrieren. Es sind die beiden zusammen gegen die Annahme, dass ein Frontier-Generalist das einzige Modell ist, das es wert ist, betrieben zu werden. Speech-Editing und verifizierte Formalisierung sind beides Bereiche, in denen ein kleines, fokussiertes, offenes Modell mit einem geliehenen Gehirn ein viel größeres schlagen kann, das nie auf das Problem gerichtet war – genau das ist die Wette, die Tencent und OpenBMB gerade veröffentlicht haben, und genau das braucht noch einen unabhängigen Beweis.