
AuK-Flash vs MathForm-8B: Dos especialistas discretos con cerebros Qwen prestados
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
AuK-Flash y MathForm-8B tienen más en común de lo que cualquiera de los dos laboratorios probablemente reconoce, y nada de eso es la tarea que realizan. MathForm-8B es el modelo de autoformalización de 8B de OpenBMB — un ajuste fino bajo licencia Apache-2.0 de Qwen3-8B que convierte matemáticas en lenguaje natural en afirmaciones de Lean 4 que un compilador puede verificar. AuK-Flash es el modelo de voz destilado de Tencent — un generador de difusión con licencia MIT para síntesis y edición de voz que enruta sus instrucciones a través de un codificador Qwen2.5-Omni-3B antes de producir sonido. Uno convierte matemáticas en prosa en texto formal verificable mediante pruebas; el otro convierte texto e instrucciones en audio. Comparten la misma estrategia arquitectónica desde direcciones opuestas: ninguno entrena un cerebro de lenguaje general desde cero — cada uno envuelve un modelo abierto existente y dedica el esfuerzo real a su modalidad de salida. Ambos se lanzaron también de la misma manera — pesos publicados silenciosamente en Hugging Face, sin comunicado de prensa — y ambos son exactamente el tipo de lanzamiento estrecho y autoalojado que un punto de referencia de modelos frontera no puede capturar.
El patrón que los une
Mira las dos trayectorias de lanzamiento una al lado de la otra y son casi espejos. El repositorio AuK-Flash de Tencent está fechado el 21 de agosto en Hugging Face (la base AuK hermana, el 18 de agosto); el anuncio de código abierto — código, pesos y enlaces de demostración — llegó solo esta semana, con fecha del 7 de septiembre en la tarjeta de Hugging Face y del 9 de septiembre en el repositorio de GitHub vinculado. El repositorio MathForm-8B de OpenBMB apareció el 14 de agosto sin anuncio alguno. En ambos casos, la tarjeta del modelo es el lanzamiento, los pesos no están restringidos bajo una licencia permisiva, y no hay una API alojada para probar: descargas el checkpoint y lo ejecutas en hardware que controlas. Para un lector que decide qué adoptar, esa forma compartida importa más que la diferencia de dominio: ambas son apuestas a que un modelo abierto de alcance limitado puede atender un nicho que un generalista atiende mal, y ambas te piden que aportes la evaluación que el proveedor no hizo.
El marcador honesto
Debido a que los dos modelos no se superponen en ningún benchmark, la tabla de resultados es un retrato de dos apuestas diferentes más que una clasificación. La fuente de los datos importa en cada fila — las afirmaciones de AuK-Flash son declaraciones de tarjeta de Tencent de hace días y no reproducidas; las cifras de MathForm-8B son reportadas por OpenBMB desde arXiv 2608.14221 y no reproducidas:
• Qué es — AuK-Flash: el modelo de ~1.5B de Tencent para generación y edición de voz, destilado a una variante de difusión de 4 pasos. MathForm-8B: el autoformalizador de 8B de OpenBMB que convierte matemáticas informales en Lean 4.
• Salida — AuK-Flash: audio de 24 kHz — voz, voz editada, fuentes separadas. MathForm-8B: enunciados de Lean 4 con un encabezado y un teorema nombrado.
• Construcción — AuK-Flash: transformador de difusión destilado a un NFE fijo de 4 / CFG 0, con Qwen2.5-Omni-3B como codificador de instrucciones. MathForm-8B: Qwen3-8B ajustado con SFT y luego RL en el conjunto de datos FormalVerse de ~367K ejemplos.
• Idioma de entrada — AuK-Flash: chino e inglés (según la tarjeta del modelo). MathForm-8B: inglés, en el registro de los enunciados de problemas matemáticos.
• Lanzamiento — AuK-Flash: repos del 18/21 de agosto; código abierto anunciado del 7 al 9 de septiembre. MathForm-8B: repo del 14 de agosto; sin anuncio hasta el momento de redactar esto.
• Evidencia — AuK-Flash: ninguna aún más allá de la lista de capacidades de la tarjeta. MathForm-8B: reportado por el proveedor, 88.06% Pass@8 bajo comprobación de sintaxis y 72.37% bajo comprobación de consistencia, con FATE-H 63% y FATE-X 37% en los conjuntos de consistencia difíciles.

El marcador en seis filas: ambos son especialistas en pesos abiertos con cerebros prestados de Qwen y escasa evidencia independiente — se diferencian en lo que crean, no en cómo fueron lanzados.
AuK-Flash: el habla como resultado del especialista
La afirmación del "cerebro prestado" para AuK-Flash es literal, no retórica. El checkpoint que publica Tencent contiene el transformer de difusión y los pesos de fusión de capas; el modelo que realmente entiende tu instrucción —Qwen2.5-Omni-3B— se descarga por separado y se carga en tiempo de ejecución, y lo mismo ocurre con el BigVGANFlowVAE que convierte el latente de vuelta en una forma de onda de 24 kHz. Lo que Tencent entrenó no es, por tanto, un modelo de lenguaje en absoluto, sino un generador condicional de emparejamiento por flujo (flow-matching): dado un plan semántico del codificador Qwen, produce audio en unos pocos pasos. AuK-Flash es la versión destilada de cuatro pasos de ese generador, y su repositorio —unos 6.1 GB para el checkpoint Flash en BF16 más un VAE de 637 MB— incluye una CLI, un motor en Python, nodos para Gradio y ComfyUI, y un script de ajuste fino. La lista de capacidades es amplia para un modelo de voz: TTS zero-shot y por instrucción, edición de contenido y letras, cambios de tono/velocidad/volumen y de emoción/timbre, eliminación de acento, conversión a susurro, mejora y separación de fuentes, todo detrás de una única interfaz de instrucción en lenguaje natural en chino e inglés. Que cada una funcione como se describe no ha sido probado fuera de Tencent; la afirmación arquitectónica —un Qwen pequeño que entiende, un modelo de difusión destilado que produce sonido— es visible en el propio repositorio.

La página del repositorio tencent/AuK-Flash: pesos con licencia MIT para el modelo de voz destilado en 4 pasos, con el codificador Qwen2.5-Omni-3B y el VAE cargados desde archivos separados en tiempo de ejecución.
MathForm-8B: prueba formal como salida del especialista
MathForm-8B sigue el mismo patrón, un dominio más allá. OpenBMB tomó Qwen3-8B — un modelo generalista entrenado en 119 idiomas — y dedicó toda su capacidad a una única forma de salida: un enunciado de teorema en Lean 4 derivado de un problema en lenguaje natural. La etapa de SFT en FormalVerse enseña el mapeo de lo informal a lo formal; una etapa posterior de RL lo refina contrastándolo con el veredicto del compilador de Lean, motivo por el que el modelo no reporta una vaga puntuación de calidad, sino un Pass@8 bajo verificación de sintaxis y una aprobación más estricta bajo verificación de consistencia semántica. Las cifras del proveedor son sólidas — 88.06% y 72.37% en seis benchmarks, superando las líneas base especializadas de 7B a 32B del artículo — y, al igual que las afirmaciones de AuK-Flash, carecen de reproducción independiente. El repositorio tiene licencia Apache-2.0; el modelo puede servirse con Transformers, vLLM o SGLang y, a cambio, renuncia a prácticamente todo aquello por lo que Qwen3-8B es conocido: nada de chat general en 119 idiomas, un presupuesto de salida de unos 16K tokens para Lean y ninguna capacidad documentada fuera de la formalización.

El repositorio openbmb/MathForm-8B — pesos Apache-2.0 para el autoformalizador, que indica Qwen3-8B como su modelo base. Esta es toda la superficie pública de MathForm-8B.
La verificación es el tema que ninguno de los dos benchmarks captura.
Pon las dos salidas una al lado de la otra y aparece una extraña simetría. Todo el diseño de MathForm-8B existe porque las matemáticas en lenguaje natural no tienen ninguna señal de corrección: el compilador Lean aporta una, así que el modelo se entrena contra un veredicto de aprobado/reprobado que de verdad puede percibir. El dominio de AuK-Flash tiene el mismo problema con una solución distinta: no hay un compilador para «¿este clip suena como el hablante, en un susurro, sin la tos?», así que la señal de aprobado/reprobado es un oído humano. Ningún benchmark agregado mide eso — un Elo sobre texto o una puntuación de calidad sobre voz sintetizada te dice poco sobre si la promesa central del especialista (Lean verificado, o voz editable y clonable) se cumple en tu flujo de trabajo. La consecuencia práctica es que ambos modelos deben evaluarse de la forma en que el proveedor no pudo: MathForm-8B, pasando su salida por Lean; AuK-Flash, escuchando su salida sobre tus propios datos. Hasta que alguien haga eso, las afirmaciones principales de ambas fichas son orientaciones, no resultados.
Para quién es cada uno, y quién debería esperar
• Elija MathForm-8B cuando su carga de trabajo termine en la formalización — convertir bancos de problemas, construir corpus de Lean, alimentar la automatización de demostraciones — y quiera el especialista abierto más potente en este peso. No es un modelo general, así que acompáñelo con uno para todo lo que rodea al paso formal.
• Elige AuK-Flash cuando tu carga de trabajo termine en audio — {{1}}una voz para leer tu texto, una grabación para editar, una mezcla para separar{{/1}} — y quieras un modelo abierto que trate la generación y la edición como una sola operación. Reserva presupuesto para el {{2}}codificador Qwen{{/2}} junto a él, y para tu propia prueba de escucha.
• Espera con ambos si necesitas una infraestructura probada y con soporte: ninguno tiene resultados independientes, ninguno tiene una API alojada, y ambos tienen entre días y semanas de antigüedad. El patrón a imitar es arquitectónico — un pequeño cerebro de lenguaje prestado más una cabeza de salida especializada es mucho más barato de entrenar e iterar que un generalista completo — y es un patrón que puedes adoptar en tu propio ajuste fino, tanto si ejecutas estos dos checkpoints como si no.
Ambos lanzamientos también ilustran por qué una capa de enrutamiento se gana su lugar en una pila mixta: cuando tu pipeline pasa de un modelo de razonamiento general a un especialista como uno de estos, el propósito del enrutador es que no comprometas la arquitectura con una única respuesta. Una API con más de 200 modelos, conmutación automática por error si un proveedor se degrada, y precios de lista de los proveedores transmitidos con un margen del 0 % significan que puedes mantener al generalista en la ruta predeterminada y llamar al especialista solo para el subconjunto de solicitudes que lo necesiten — y cambiar al especialista el día que se lance uno mejor.
La comparación que hay que tener presente no es AuK-Flash frente a MathForm-8B: nunca competirán por la misma solicitud. Es ambos contra la suposición de que un generalista de frontera es el único modelo que merece la pena ejecutar. La edición de voz y la formalización verificada son dos ámbitos en los que un modelo abierto, pequeño y centrado, con un cerebro prestado, puede vencer a uno mucho más grande que nunca estuvo apuntado al problema, que es precisamente la apuesta que acaban de publicar tanto Tencent como OpenBMB, y precisamente lo que aún necesita una prueba independiente.
