
AuK-Flash vs MathForm-8B : deux spécialistes discrets sur des cerveaux Qwen empruntés
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
AuK-Flash et MathForm-8B ont plus en commun que ne le soupçonne probablement aucun des deux laboratoires — et ces points communs n’ont rien à voir avec la tâche qu’ils accomplissent. MathForm-8B est le modèle d’autoformalisation 8B d’OpenBMB — une version affinée de Qwen3-8B, sous licence Apache-2.0, qui transforme les mathématiques rédigées en langage naturel en énoncés Lean 4 vérifiables par un compilateur. AuK-Flash est le modèle de parole distillé de Tencent — un générateur à diffusion sous licence MIT pour la synthèse et l’édition de la parole, qui fait transiter ses instructions par un encodeur Qwen2.5-Omni-3B avant de produire le son. L’un convertit des mathématiques rédigées en prose en un texte formel dont la preuve peut être vérifiée ; l’autre convertit texte et instructions en audio. Ils appliquent la même stratégie d’architecture depuis des directions opposées : aucun des deux n’entraîne de cerveau de langage général à partir de zéro — chacun enveloppe un modèle ouvert existant et concentre l’essentiel de ses efforts sur sa modalité de sortie. Tous deux ont d’ailleurs été diffusés de la même manière — des poids déposés en toute discrétion sur Hugging Face, sans communiqué de presse — et sont exactement le genre de version étroite et auto-hébergeable qu’un benchmark destiné aux modèles de pointe ne peut pas saisir.
Le schéma qui les unit.
Regardez les deux parcours de lancement côte à côte : ils sont presque en miroir. Le dépôt AuK-Flash de Tencent est daté du 21 août sur Hugging Face (le dépôt frère AuK base, du 18 août) ; l’annonce open source — code, poids et liens de démonstration — n’est arrivée que cette semaine, datée du 7 septembre sur la fiche Hugging Face et du 9 septembre sur le dépôt GitHub lié. Le dépôt MathForm-8B d’OpenBMB est apparu le 14 août sans aucune annonce. Dans les deux cas, la fiche du modèle tient lieu de lancement, les poids sont en accès libre sous une licence permissive, et il n’y a pas d’API hébergée pour essayer — vous téléchargez le checkpoint et l’exécutez sur le matériel que vous contrôlez. Pour un lecteur qui décide quoi adopter, cette forme partagée importe plus que la différence de domaine : les deux sont des paris qu’un modèle ouvert au périmètre étroit peut servir une niche qu’un généraliste dessert mal, et les deux vous demandent de fournir l’évaluation que le fournisseur n’a pas réalisée.
Le tableau d'affichage honnête
Comme les deux modèles ne se recoupent sur aucun benchmark, ce tableau de résultats est un portrait de deux paris différents plutôt qu'un classement. La provenance des données importe sur chaque ligne — les affirmations d'AuK-Flash proviennent de relevés de cartes Tencent vieux de plusieurs jours et non reproduits ; les chiffres de MathForm-8B sont rapportés par OpenBMB depuis l'arXiv 2608.14221 et non reproduits :
• Ce que c'est — AuK-Flash : le modèle de génération et d'édition de parole de Tencent, d'environ 1,5B paramètres, distillé en une variante de diffusion en 4 étapes. MathForm-8B : l'autoformaliseur 8B d'OpenBMB qui transforme les mathématiques informelles en Lean 4.
• Sortie — AuK-Flash : audio 24 kHz — parole, parole éditée, sources séparées. MathForm-8B : énoncés Lean 4 avec un en-tête et un théorème nommé.
• Construction — AuK-Flash : transformer de diffusion distillé pour un NFE fixé à 4 et une CFG à 0, avec Qwen2.5-Omni-3B comme encodeur d’instructions. MathForm-8B : Qwen3-8B affiné par SFT puis RL sur le jeu de données FormalVerse, qui compte environ 367 000 exemples.
Langue d'entrée — AuK-Flash : chinois et anglais (selon la fiche du modèle). MathForm-8B : anglais, dans le registre des énoncés de problèmes mathématiques.
• Publication — AuK-Flash : dépôt le 18/21 août ; open-source annoncé du 7 au 9 septembre. MathForm-8B : dépôt le 14 août ; aucune annonce à ce jour.
• Preuves — AuK-Flash : rien d'autre pour l'instant que la liste des capacités de la fiche. MathForm-8B : 88,06 % de Pass@8 rapporté par le fournisseur sous vérification syntaxique et 72,37 % sous vérification de cohérence, avec FATE-H à 63 % et FATE-X à 37 % sur les ensembles de cohérence difficiles.

Le tableau comparatif en six lignes : ce sont deux modèles spécialisés à poids ouverts, avec des cerveaux empruntés à Qwen et peu de preuves indépendantes — ils diffèrent par ce qu’ils produisent, pas par la façon dont ils ont été diffusés.
AuK-Flash : la parole comme production du spécialiste
L'affirmation du « cerveau emprunté » pour AuK-Flash est littérale, pas rhétorique. Le checkpoint que Tencent publie contient les poids du transformer de diffusion et de la fusion de couches ; le modèle qui comprend réellement votre instruction — Qwen2.5-Omni-3B — est téléchargé séparément et chargé à l'exécution, tout comme le BigVGANFlowVAE qui reconvertit le latent en forme d'onde de 24 kHz. Ce que Tencent a entraîné n'est donc pas du tout un modèle de langage, mais un générateur conditionnel par appariement de flux : à partir d'un plan sémantique fourni par l'encodeur Qwen, il rend l'audio en quelques étapes. AuK-Flash est la version distillée en quatre étapes de ce générateur, et son dépôt — environ 6,1 Go pour le checkpoint Flash en BF16 plus un VAE de 637 Mo — est fourni avec une CLI, un moteur Python, des nœuds Gradio et ComfyUI, ainsi qu'un script de fine-tuning. La liste des capacités est large pour un modèle vocal : TTS zero-shot et par instruction, édition du contenu et des paroles, modifications de hauteur/vitesse/volume et d'émotion/timbre, désaccentuation, conversion de chuchotements, amélioration et séparation de sources, le tout derrière une interface d'instructions en langage naturel en chinois et en anglais. Que chacune fonctionne comme décrit n'a pas été testé hors de Tencent ; l'affirmation d'architecture — un petit Qwen qui comprend, un modèle de diffusion distillé qui produit du son — est visible dans le dépôt lui-même.

La page du dépôt tencent/AuK-Flash — des poids sous licence MIT pour le modèle de parole distillé en 4 étapes, avec l'encodeur Qwen2.5-Omni-3B et le VAE chargés à partir de fichiers séparés au moment de l'exécution.
MathForm-8B : la preuve formelle comme sortie du spécialiste
MathForm-8B suit le même schéma, un domaine plus loin. OpenBMB a pris Qwen3-8B — un modèle généraliste entraîné sur 119 langues — et a consacré l'intégralité de ses capacités à un seul format de sortie : un énoncé de théorème Lean 4 dérivé d'un problème en langage naturel. L'étape de SFT sur FormalVerse enseigne la correspondance informel-vers-formel ; une étape de RL l'affine ensuite face au verdict du compilateur Lean, ce qui explique que le modèle ne rapporte pas un vague score de qualité mais un Pass@8 sous vérification syntaxique et un pass plus strict sous vérification de cohérence sémantique. Les chiffres du fournisseur sont solides — 88,06 % et 72,37 % sur six benchmarks, surpassant les baselines spécialisées de 7B à 32B de l'article — et tout aussi non reproduits que les affirmations d'AuK-Flash. Le dépôt est sous licence Apache-2.0, servi via Transformers, vLLM ou SGLang, et abandonne en échange pratiquement tout ce pour quoi Qwen3-8B est connu : pas de chat généraliste en 119 langues, un budget de sortie d'environ 16K tokens pour Lean, et aucune capacité documentée en dehors de la formalisation.

Le dépôt openbmb/MathForm-8B — des poids sous licence Apache-2.0 pour l'autoformaliseur, avec Qwen3-8B comme modèle de base. C'est toute la surface publique de MathForm-8B.
La vérification est le thème qu'aucun des deux benchmarks ne capture.
Placez les deux sorties côte à côte et une étrange symétrie apparaît. Toute la conception de MathForm-8B vient du fait que les mathématiques en langage naturel n’ont aucun signal de correction — le compilateur Lean en fournit un, donc le modèle est entraîné contre un verdict de réussite/échec qu’il peut réellement ressentir. Le domaine d’AuK-Flash présente le même problème avec une solution différente : il n’existe pas de compilateur pour « est-ce que ce clip semble bien être le locuteur, en chuchotement, une fois la toux supprimée », donc le signal de réussite/échec est une oreille humaine. Aucun benchmark agrégé ne mesure cela — un score Elo sur du texte ou un score de qualité sur de la parole synthétisée ne vous apprend guère si la promesse centrale du spécialiste (Lean vérifié, ou parole éditable et clonable) tient dans votre flux de travail. Il en résulte que les deux modèles doivent être évalués comme le fournisseur n’a pas pu le faire : MathForm-8B en soumettant sa sortie à Lean, AuK-Flash en écoutant sa sortie sur vos propres données. Jusqu’à ce que quelqu’un fasse cela, les affirmations mises en avant sur les deux fiches sont des pistes, pas des résultats.
À qui chacun s'adresse, et qui devrait attendre
• Choisissez MathForm-8B lorsque votre charge de travail s'arrête à la formalisation — conversion de banques de problèmes, construction de corpus Lean, alimentation de l'automatisation de preuves — et que vous voulez le spécialiste open source le plus performant à ce poids. Ce n'est pas un modèle général, alors associez-le à un modèle pour tout ce qui entoure l'étape formelle.
• Choisissez AuK-Flash lorsque votre charge de travail aboutit à de l'audio — une voix pour lire votre texte, un enregistrement à éditer, un mix à séparer — et que vous souhaitez un modèle ouvert qui traite la génération et l'édition comme une seule opération. Prévoyez un budget pour l'encodeur Qwen en complément, et pour votre propre test d'écoute.
• Si vous avez besoin d'un élément d'infrastructure éprouvé et pris en charge, attendez avant d'utiliser l'un ou l'autre : ni l'un ni l'autre n'a de résultats indépendants ni d'API hébergée, et tous deux datent de quelques jours à quelques semaines. Le schéma à copier est architectural — un petit cerveau linguistique emprunté, surmonté d'une tête de sortie spécialisée, est bien moins coûteux à entraîner et à faire évoluer qu'un généraliste complet — et c'est un schéma que vous pouvez adopter dans votre propre fine-tuning, que vous utilisiez ou non ces deux checkpoints.
Ces deux versions illustrent également pourquoi une couche de routage gagne sa place dans une stack mixte : lorsque votre pipeline passe d'un modèle de raisonnement généraliste à un spécialiste de ce type, tout l'intérêt du routeur est de ne pas contraindre l'architecture à une réponse unique. Une API unique pour plus de 200 modèles, un basculement automatique en cas de dégradation d'un fournisseur et la répercussion des prix catalogue des fournisseurs à 0 % de marge signifient que vous pouvez garder le généraliste sur le chemin par défaut, n'appeler le spécialiste que pour le sous-ensemble de requêtes qui en ont besoin — et remplacer ce spécialiste le jour où une meilleure version sort.
La comparaison à retenir n’est pas AuK-Flash contre MathForm-8B — ils ne seront jamais en concurrence pour la même requête. C’est eux deux contre l’hypothèse selon laquelle un modèle généraliste de pointe est le seul modèle qui vaille la peine d’être exécuté. L’édition vocale et la formalisation vérifiée sont deux domaines où un petit modèle ouvert, spécialisé et doté d’un cerveau emprunté peut battre un modèle bien plus grand qui n’a jamais été orienté vers le problème — c’est précisément le pari que viennent de publier Tencent et OpenBMB, et précisément ce qui exige encore une preuve indépendante.
