Ett hero-titelkort för jämförelsen 'AuK-Flash vs MathForm-8B' med undertexten 'Två tysta specialister på lånade Qwen-hjärnor', som visar ett centralt chip märkt 'lånad Qwen-hjärna' som förgrenar sig till en AuK-Flash-ruta för talutmatning och en MathForm-8B-ruta för Lean-4-utmatning, med OrcaRouter-logotypen inkomponerad i hörnet.
Guides & Insights

AuK-Flash vs MathForm-8B: Två tysta specialister på lånade Qwen-hjärnor

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

AuK-Flash och MathForm-8B har mer gemensamt än vad något av labben förmodligen inser, och inget av det rör de uppgifter de utför. MathForm-8B är OpenBMB:s 8B-autoformaliseringsmodell — en Apache-2.0-finanjustering av Qwen3-8B som omvandlar matematik på naturligt språk till Lean 4-satser som en kompilator kan kontrollera. AuK-Flash är Tencents destillerade talmodell — en MIT-licensierad diffusionsgenerator för talsyntes och talredigering som dirigerar sina instruktioner genom en Qwen2.5-Omni-3B-kodare innan den skapar ljud. Den ena omvandlar matematisk prosa till formell, verifierbar text; den andra omvandlar text och instruktioner till ljud. De delar samma arkitektoniska strategi från motsatta håll: ingen av dem tränar en allmän språkhjärna från grunden — var och en bygger kring en befintlig öppen modell och lägger ner det verkliga arbetet på sin utdatamodalitet. Båda släpptes också på samma sätt — vikterna lades tyst upp på Hugging Face, utan pressmeddelande — och båda är precis den typen av smala, självhostade släpp som ett benchmark för frontmodeller inte kan fånga.

Mönstret som förenar dem

Titta på de två släppsekvenserna sida vid sida – de är nästan varandras spegelbilder. Tencents AuK-Flash-repo är daterat 21 augusti på Hugging Face (syskonmodellen AuK base den 18 augusti); meddelandet om öppen källkod – kod, vikter och demolänkar – kom först denna vecka, daterat 7 september på Hugging Face-kortet och 9 september på det länkade GitHub-repot. OpenBMB:s MathForm-8B-repo dök upp den 14 augusti utan något tillkännagivande alls. I båda fallen är modellkortet själva lanseringen, vikterna är fritt tillgängliga under en permissiv licens, och det finns inget värdbaserat API att prova – du laddar ner checkpointen och kör den på hårdvara du kontrollerar. För en läsare som ska bestämma vad den ska använda väger den gemensamma formen tyngre än skillnaden i domän: båda är satsningar på att en snävt avgränsad öppen modell kan betjäna en nisch som en generalist betjänar dåligt, och båda kräver att du själv utför den utvärdering som leverantören inte utförde.

Den ärliga resultattavlan

Eftersom de två modellerna inte överlappar på något benchmark, är resultattavlan en skildring av två olika satsningar snarare än en rankning. Källorna spelar roll på varje rad — AuK-Flash:s påståenden är uppgifter från Tencent-modellkortet, dagar gamla och ej reproducerade; MathForm-8B:s siffror är rapporterade av OpenBMB från arXiv 2608.14221 och ej reproducerade:

• Vad det är — AuK-Flash: Tencents ~1,5B-modell för talgenerering och -redigering, destillerad till en 4-stegs diffusionvariant. MathForm-8B: OpenBMB:s 8B-autoformaliserare som omvandlar informell matematik till Lean 4.

• Output — AuK-Flash: 24 kHz-ljud — tal, redigerat tal, separerade källor. MathForm-8B: Lean 4-påståenden med rubrik och namngiven sats.

• Konstruktion — AuK-Flash: en diffusionstransformator destillerad till fast NFE 4 / CFG 0, med Qwen2.5-Omni-3B som instruktionskodare. MathForm-8B: en Qwen3-8B finjusterad med SFT och sedan med RL på FormalVerse-datasetet med ~367 000 exempel.

• Inmatningsspråk — AuK-Flash: kinesiska och engelska (enligt modellkortet). MathForm-8B: engelska, i matematikproblemens språkregister.

• Lansering — AuK-Flash: repos den 18 augusti 2021; öppen källkod tillkännagavs 7–9 september. MathForm-8B: repo den 14 augusti; inget tillkännagivande i skrivande stund.

• Bevis — AuK-Flash: inga ännu utöver kortets kapabilitetslista. MathForm-8B: leverantörsrapporterade 88,06% Pass@8 under syntaxkontroll och 72,37% under konsistenskontroll, med FATE-H 63% och FATE-X 37% på de svåra konsistensseten.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

Resultattavlan i sex rader: båda är specialister med öppna vikter, lånade Qwen-hjärnor och tunn oberoende evidens — de skiljer sig åt i vad de producerar, inte i hur de släpptes.

AuK-Flash: tal som specialistens utdata

Påståendet om en "lånad hjärna" för AuK-Flash är bokstavligt, inte retoriskt. Checkpointen som Tencent publicerar innehåller diffusionstransformatorn och vikterna för lagerfusion; modellen som faktiskt förstår din instruktion — Qwen2.5-Omni-3B — laddas ner separat och läses in vid körning, och det gör även BigVGANFlowVAE, som omvandlar den latenta representationen tillbaka till en 24 kHz-vågform. Det Tencent tränade är därför inte alls en språkmodell utan en villkorad flow-matching-generator: givet en semantisk plan från Qwen-kodaren återger den ljud i ett fåtal steg. AuK-Flash är den fyrstegs destillerade versionen av den generatorn, och dess repo — cirka 6,1 GB för Flash-checkpointen i BF16 plus en 637 MB VAE — levereras med ett CLI, en Python-motor, Gradio- och ComfyUI-noder samt ett finjusteringsskript. Kapacitetslistan är bred för en talmodell: zero-shot- och instruktions-TTS, innehålls- och sångtextsredigering, ändringar av tonhöjd/tempo/volym och känsla/klangfärg, accentborttagning, viskningskonvertering, ljudförbättring och källseparering — allt samlat bakom ett naturligt språkligt instruktionsgränssnitt på kinesiska och engelska. Huruvida varje funktion fungerar som beskrivits är oprövat utanför Tencent; arkitekturpåståendet — en liten Qwen som förstår, en destillerad diffusionsmodell som skapar ljud — syns i själva repot.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

Repository-sidan för tencent/AuK-Flash — MIT-licensierade vikter för den destillerade 4-stegs talmodellen, med Qwen2.5-Omni-3B-kodaren och VAE laddade från separata filer vid körning.

MathForm-8B: formellt bevis som specialistens utdata

MathForm-8B är samma mönster i en annan domän. OpenBMB tog Qwen3-8B – en generalist tränad på 119 språk – och ägnade hela dess kapacitet åt en enda utdataform: en Lean 4-satsformulering härledd från ett problem på naturligt språk. SFT-steget på FormalVerse lär ut kartläggningen från informellt till formellt; ett RL-steg skärper sedan upp den mot Lean-kompilatorns utslag, vilket är anledningen till att modellen inte rapporterar ett vagt kvalitetsbetyg utan Pass@8 under syntaxkontroll och en strängare godkänd nivå under semantisk konsistenskontroll. Tillverkarens siffror är starka – 88,06 % och 72,37 % över sex benchmarks, vilket slår artikelns specialiserade baslinjer på 7B–32B – och är precis lika lite oberoende reproducerade som AuK-Flash's påståenden. Repositoryt är Apache-2.0, serveras via Transformers, vLLM eller SGLang, och ger i utbyte upp i princip allt som Qwen3-8B är känt för: ingen allmän chatt på 119 språk, en utdatabudget på cirka 16K-token för Lean och ingen dokumenterad förmåga utanför formalisering.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

openbmb/MathForm-8B-arkivet — Apache-2.0-vikter för autoformaliseraren, där Qwen3-8B anges som basmodell. Detta är MathForm-8B:s hela publika avtryck.

Verifiering är temat som inget av benchmarks fångar.

Placerar man de två utmatningarna bredvid varandra framträder en märklig symmetri. Hela MathForm-8B:s konstruktion finns till eftersom matematik på naturligt språk saknar en korrekthetssignal – Lean-kompilatorn tillhandahåller en, så modellen tränas mot ett godkänt/underkänt-besked som den faktiskt kan känna av. AuK-Flash:s domän har samma problem men en annan lösning: det finns ingen kompilator för "låter det här klippet som talaren, viskande, med hostningen borttagen", så godkänt/underkänt-signalen är ett mänskligt öra. Inget av de sammanvägda riktmärkena mäter det – en Elo-poäng på text eller ett kvalitetsbetyg på syntetiskt tal säger dig lite om huruvida specialistens kärnlöfte (verifierad Lean, eller redigerbart, klonbart tal) håller i ditt arbetsflöde. Den praktiska konsekvensen är att båda modellerna måste utvärderas på det sätt som leverantören inte kunde utvärdera dem: MathForm-8B genom att köra dess utdata genom Lean, AuK-Flash genom att lyssna på dess utdata på dina egna data. Tills någon gör det är rubrikpåståendena på båda korten riktningar, inte resultat.

Vem var och en är till för, och vem som bör vänta

• Välj MathForm-8B när dina arbetsuppgifter slutar vid formalisering — att konvertera problembanker, bygga Lean-korpora, mata bevisautomatisering — och du vill ha den starkaste öppna specialisten i denna viktklass. Det är inte en generell modell, så para ihop den med en för allt omkring det formella steget.

• Välj AuK-Flash när ditt arbetsflöde slutar i ljud – en röst som läser upp din text, en inspelning att redigera, en mix att separera – och du vill ha en öppen modell som behandlar generering och redigering som en enda operation. Budgetera för Qwen-encodern bredvid den, och för ditt eget lyssningstest.

• Vänta med båda om du behöver en beprövad, understödd infrastrukturkomponent: ingen av dem har oberoende resultat, ingen har ett hostat API, och båda är dagar till veckor gamla. Mönstret att ta fasta på är arkitektoniskt — en liten inlånad språkhjärna plus ett specialiserat utmatningshuvud är långt billigare att träna och iterera på än en fullständig generalist — och det är ett mönster du kan tillämpa i din egen finjustering, oavsett om du någonsin kör dessa två checkpoints.

Båda releaserna illustrerar också varför ett routningslager förtjänar sin plats i en blandad stack: när din pipeline går från en generell resonemangsmodell till en specialist som en av dessa, är poängen med routern att du inte binder arkitekturen till ett enda svar. Ett API för 200+ modeller, automatisk failover om en leverantör försämras och leverantörernas listpriser som skickas vidare med 0 % påslag innebär att du kan behålla generalisten på standardvägen och anropa specialisten endast för den delmängd av förfrågningar som behöver den — och byta ut specialisten den dag en bättre sådan släpps.

Jämförelsen att hålla fast vid är inte AuK-Flash mot MathForm-8B — de kommer aldrig att konkurrera om samma förfrågan. Det är de två mot antagandet att en frontlinjegeneralist är den enda modellen som är värd att köra. Talredigering och verifierad formalisering är båda domäner där en liten, fokuserad, öppen modell med en lånad hjärna kan besegra en mycket större modell som aldrig riktades mot problemet — vilket är precis vad både Tencent och OpenBMB just publicerade, och precis vad som fortfarande behöver oberoende bevis.