Een hero-titelkaart voor de vergelijking 'AuK-Flash vs MathForm-8B' met de ondertitel 'Twee stille specialisten met geleende Qwen-hersenen', met een centrale chip gelabeld 'geleend Qwen-brein' die vertakt naar een AuK-Flash-spraakuitvoer-tegel en een MathForm-8B-Lean-4-uitvoer-tegel, met het OrcaRouter-logo gecomponeerd in de hoek.
Guides & Insights

AuK-Flash vs MathForm-8B: Twee stille specialisten op geleende Qwen-hersenen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

AuK-Flash en MathForm-8B hebben meer gemeen dan beide labs waarschijnlijk beseffen, en niets daarvan heeft te maken met de taak die ze uitvoeren. MathForm-8B is het 8B-autoformalisatiemodel van OpenBMB — een Apache-2.0-gelicentieerde finetune van Qwen3-8B die wiskunde in natuurlijke taal omzet in Lean 4-formuleringen die een compiler kan controleren. AuK-Flash is het gedistilleerde spraakmodel van Tencent — een MIT-gelicentieerde diffusiegenerator voor spraaksynthese en -bewerking die zijn instructies door een Qwen2.5-Omni-3B-encoder leidt voordat hij geluid produceert. Het ene zet wiskundig proza om in formeel bewijscontroleerbare tekst; het andere zet tekst en instructies om in audio. Ze delen dezelfde architectuurstrategie vanuit tegengestelde richtingen: geen van beide traint een algemeen taalbrein vanaf nul — elk bouwt voort op een bestaand open model en steekt de echte moeite in zijn eigen uitvoermodaliteit. Beide zijn ook op dezelfde manier verschenen — gewichten stilletjes op Hugging Face, geen persbericht — en beide zijn precies het soort smalle, zelf-gehoste release dat een benchmark voor frontiermodellen niet kan vastleggen.

Het patroon dat hen verenigt

Bekijk de twee releasetrajecten naast elkaar en ze zijn bijna elkaars spiegelbeeld. Het AuK-Flash-repository van Tencent dateert op Hugging Face van 21 augustus (het zuster-basismodel AuK van 18 augustus); de open-source-aankondiging — code, gewichten en demo-links — verscheen pas deze week, gedateerd 7 september op de Hugging Face-kaart en 9 september op de gekoppelde GitHub-repository. Het MathForm-8B-repository van OpenBMB verscheen op 14 augustus zonder enige aankondiging. In beide gevallen is de modelkaart de lancering, zijn de gewichten vrij toegankelijk onder een permissieve licentie, en is er geen gehoste API om uit te proberen: je downloadt de checkpoint en draait die op hardware die je zelf beheert. Voor een lezer die moet kiezen wat hij adopteert, weegt die gedeelde vorm zwaarder dan het verschil in domein: beide zijn weddenschappen dat een strak afgebakend open model een niche kan bedienen waarin een generalist tekortschiet, en beide vragen je om de evaluatie aan te leveren die de leverancier niet leverde.

Het eerlijke scorebord

Omdat de twee modellen elkaar op geen enkele benchmark overlappen, is het scorebord een portret van twee verschillende weddenschappen in plaats van een ranglijst. De herkomst doet er op elke rij toe — de beweringen van AuK-Flash zijn Tencent-kaartverklaringen, dagen oud en niet gereproduceerd; de cijfers van MathForm-8B zijn OpenBMB-gerapporteerd, afkomstig uit arXiv 2608.14221 en niet gereproduceerd:

• Wat het is — AuK-Flash: het ~1.5B-model van Tencent voor spraakgeneratie en -bewerking, gedistilleerd tot een 4-staps diffusievariant. MathForm-8B: de 8B-autoformalisator van OpenBMB die informele wiskunde omzet naar Lean 4.

• Uitvoer — AuK-Flash: 24 kHz-audio — spraak, bewerkte spraak, gescheiden bronnen. MathForm-8B: Lean 4-beweringen met een koptekst en een benoemde stelling.

• Opbouw — AuK-Flash: diffusietransformer gedistilleerd tot vaste NFE 4 / CFG 0, met Qwen2.5-Omni-3B als instructie-encoder. MathForm-8B: Qwen3-8B verfijnd met SFT en vervolgens RL op de FormalVerse-dataset met ~367K voorbeelden.

• Invoertaal — AuK-Flash: Chinees en Engels (volgens de modelkaart). MathForm-8B: Engels, in het register van wiskundige probleemstellingen.

• Release — AuK-Flash: repos 18/21 augustus; open source aangekondigd 7–9 september. MathForm-8B: repo 14 augustus; geen aankondiging op moment van schrijven.

• Bewijs — AuK-Flash: nog geen, behalve de mogelijkhedenlijst van de kaart. MathForm-8B: door leverancier gerapporteerd 88,06% Pass@8 bij syntaxcontrole en 72,37% bij consistentiecontrole, met FATE-H 63% en FATE-X 37% op de moeilijke consistentiesets.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

Het scorebord in zes rijen: beide zijn open-gewichten-specialisten met geleende Qwen-hersenen en dun onafhankelijk bewijs — ze verschillen in wat ze maken, niet in hoe ze werden uitgebracht.

AuK-Flash: spraak als output van de specialist

De claim dat AuK-Flash een “geleend brein” heeft, is letterlijk, niet retorisch. De checkpoint die Tencent publiceert bevat de diffusietransformer en de laagfusiegewichten; het model dat je instructie daadwerkelijk begrijpt — Qwen2.5-Omni-3B — wordt afzonderlijk gedownload en tijdens runtime geladen, net als de BigVGANFlowVAE, die de latente representatie weer omzet in een 24 kHz-golfvorm. Wat Tencent heeft getraind is dus helemaal geen taalmodel, maar een conditionele flow-matchinggenerator: op basis van een semantisch plan van de Qwen-encoder wordt in een handvol stappen audio gegenereerd. AuK-Flash is de gedestilleerde vierstapsversie van die generator. De repo daarvan — ongeveer 6,1 GB voor de Flash-checkpoint in BF16 plus een VAE van 637 MB — wordt geleverd met een CLI, een Python-engine, Gradio- en ComfyUI-nodes en een fine-tuningscript. Voor een spraakmodel is de lijst met mogelijkheden breed: zero-shot- en instructie-TTS, inhouds- en songtekstbewerking, wijziging van toonhoogte/snelheid/volume en emotie/timbre, accentverwijdering, fluisterconversie, spraakverbetering en bronafscheiding — allemaal via één natuurlijke-taalinterface voor instructies in het Chinees en het Engels. Of elke functie werkt zoals beschreven, is buiten Tencent niet getest; de bewering over de architectuur — een kleine Qwen die begrijpt, een gedestilleerd diffusiemodel dat geluid genereert — is in de repo zelf te zien.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

De repositorypagina van tencent/AuK-Flow — MIT-gelicenseerde gewichten voor het gedestilleerde 4-staps spraakmodel, waarbij de Qwen2.5-Omni-3B-encoder en VAE tijdens runtime uit afzonderlijke bestanden worden geladen.

MathForm-8B: formeel bewijs als output van de specialist

MathForm-8B is hetzelfde patroon, één domein verderop. OpenBMB nam Qwen3-8B — een generalist getraind in 119 talen — en besteedde diens volledige capaciteit aan één outputvorm: een Lean 4-stelling afgeleid van een probleem in natuurlijke taal. De SFT-fase op FormalVerse leert de omzetting van informeel naar formeel; een RL-fase scherpt die vervolgens aan tegen het oordeel van de Lean-compiler. Daarom rapporteert het model geen vage kwaliteitsscore, maar een Pass@8 onder syntaxcontrole en een strengere pass onder controle van semantische consistentie. De cijfers van de leverancier zijn sterk — 88,06% en 72,37% op zes benchmarks, waarmee de gespecialiseerde baselines van 7B–32B uit het paper worden verslagen — en net zo min gereproduceerd als de beweringen van AuK-Flash. De repository is Apache-2.0, beschikbaar via Transformers, vLLM of SGLang, en levert daarvoor in ruil vrijwel alles in waarvoor Qwen3-8B bekendstaat: geen algemene chat in 119 talen, een outputbudget van ongeveer 16K-tokens voor Lean, en geen gedocumenteerde capaciteit buiten formalisatie.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

De openbmb/MathForm-8B-repository — Apache-2.0-gewichten voor de autoformalizer, met Qwen3-8B als basismodel. Dit is het volledige publieke gezicht van MathForm-8B.

Verificatie is het thema dat geen van beide benchmarks dekt.

Zet de twee outputs naast elkaar en er verschijnt een vreemde symmetrie. Het hele ontwerp van MathForm-8B bestaat omdat wiskunde in natuurlijke taal geen correctheidssignaal kent — de Lean-compiler levert dat, dus het model wordt getraind op een geslaagd/mislukt-oordeel dat het daadwerkelijk kan voelen. Het domein van AuK-Flash heeft hetzelfde probleem met een andere oplossing: er is geen compiler voor 'klinkt dit fragment als de spreker, fluisterend, met de hoest verwijderd', dus het geslaagd/mislukt-signaal is een menselijk oor. Geen van beide geaggregeerde benchmarks meet dat — een Elo op tekst of een kwaliteitsscore voor gesynthetiseerde spraak zegt weinig over of de kernbelofte van de specialist (geverifieerd Lean, of bewerkbare, kloonbare spraak) standhoudt in jouw workflow. De praktische consequentie is dat beide modellen geëvalueerd moeten worden op de manier waarop de leverancier ze niet kon evalueren: MathForm-8B door de output door Lean te halen, AuK-Flash door naar de output op je eigen data te luisteren. Tot iemand dat doet, zijn de kopclaims op beide kaarten richtingen, geen resultaten.

Voor wie elk bedoeld is, en wie moet wachten

• Kies MathForm-8B wanneer je werkzaamheden eindigen bij formalisatie — het converteren van vragenbanken, het bouwen van Lean-corpora, het voeden van bewijsautomatisering — en je de sterkste open specialist in deze gewichtsklasse wilt. Het is geen algemeen model, dus combineer het met een model voor alles rond de formele stap.

• Kies voor AuK-Flash wanneer uw workload resulteert in audio — een stem om uw tekst voor te lezen, een opname om te bewerken, een mix om te scheiden — en u een open model wilt dat generatie en bewerken als één bewerking behandelt. Houd rekening met budget voor de Qwen-encoder ernaast en voor uw eigen luistertest.

Wacht op beide als je een bewezen, ondersteund stuk infrastructuur nodig hebt: geen van beide heeft onafhankelijke resultaten, geen van beide heeft een gehoste API, en beide zijn pas dagen tot weken oud. Het patroon om over te nemen is architectonisch — een klein geleend taalbrein plus een specialistische output-head is veel goedkoper om te trainen en te itereren dan een volledige generalist — en het is een patroon dat je kunt toepassen in je eigen fine-tuning, of je deze twee checkpoints nu ooit draait of niet.

Beide releases illustreren ook waarom een routinglaag zijn plek verdient in een gemengde stack: wanneer je pipeline overgaat van een algemeen redeneermodel naar een specialist zoals een van deze, is het punt van de router dat je de architectuur niet vastlegt op één enkel antwoord. Eén API voor 200+ modellen, automatische failover als een provider verslechtert, en lijstprijzen van providers die worden doorberekend tegen 0% opslag betekenen dat je de generalist op het standaardpad kunt houden en de specialist alleen kunt aanroepen voor de subset van verzoeken die dat nodig heeft — en de specialist kunt vervangen op de dag dat er een betere verschijnt.

De vergelijking die je moet vasthouden is niet AuK-Flash tegen MathForm-8B — ze zullen nooit concurreren om dezelfde aanvraag. Het gaat om die twee samen tegen de aanname dat een frontier-generalist het enige model is dat de moeite waard is om te draaien. Spraakbewerking en geverifieerde formalisering zijn beide domeinen waarin een klein, gefocust, open model met een geleende hersens een veel groter model kan verslaan dat nooit op het probleem was gericht — dat is precies de weddenschap die zowel Tencent als OpenBMB zojuist hebben gepubliceerd, en precies wat nog steeds onafhankelijk bewijs nodig heeft.