
AuK-Flash 대 MathForm-8B: 차용한 Qwen 두뇌를 지닌 조용한 두 전문가
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
AuK-Flash와 MathForm-8B는 두 연구소가 서로 알고 있는 것보다 더 많은 공통점을 가지고 있으며, 그 공통점 중 어느 것도 그들이 수행하는 작업과는 관련이 없다. MathForm-8B는 OpenBMB의 8B 자동 형식화 모델로, 자연어 수학을 컴파일러가 검증할 수 있는 Lean 4 명제로 변환하는 Qwen3-8B의 Apache-2.0 파인튠이다. AuK-Flash는 Tencent의 증류 음성 모델로, 음성 합성 및 편집을 위한 MIT 라이선스 확산 생성기이며, 소리를 만들기 전에 Qwen2.5-Omni-3B 인코더를 통해 명령을 라우팅한다. 하나는 산문 수학을 증명 가능한 형식 텍스트로 변환하고, 다른 하나는 텍스트와 명령을 오디오로 변환한다. 두 모델은 반대 방향에서 동일한 아키텍처 전략을 공유한다. 즉, 둘 다 일반 언어 두뇌를 처음부터 훈련하지 않고 각각 기존의 오픈 모델을 감싼 다음 출력 양식에 실제 노력을 쏟는다. 두 모델 모두 같은 방식으로 출시되었다. Hugging Face에 가중치를 조용히 공개했으며 보도자료도 없었다. 그리고 둘 다 프론티어 모델 벤치마크로는 포착할 수 없는 좁고 자체 호스팅된 릴리스 유형에 정확히 해당한다.
그것들을 하나로 묶는 패턴
두 릴리스 경로를 나란히 놓고 보면 거의 거울처럼 비슷합니다. Tencent의 AuK-Flash 저장소는 Hugging Face에서 8월 21일 날짜로 올라와 있고, 형제 모델인 AuK base는 8월 18일입니다. 오픈소스 발표(코드, 가중치, 데모 링크)는 이번 주에야 이뤄졌으며 Hugging Face 카드에는 9월 7일, 연결된 GitHub 저장소에는 9월 9일로 날짜가 적혀 있습니다. OpenBMB의 MathForm-8B 저장소는 8월 14일에 나타났지만 발표는 전혀 없었습니다. 두 경우 모두 모델 카드가 곧 출시이며, 가중치는 허용적 라이선스 아래에서 별다른 게이트 없이 공개되어 있고, 시도해 볼 호스팅 API는 없습니다. 체크포인트를 직접 내려받아 자신이 통제하는 하드웨어에서 실행해야 합니다. 무엇을 채택할지 결정하는 독자에게는 도메인의 차이보다 이러한 공통된 형태가 더 중요합니다. 둘 다 좁게 범위가 정해진 오픈 모델이 범용 모델이 제대로 서비스하지 못하는 틈새를 충족할 수 있다는 베팅이며, 둘 다 공급업체가 제공하지 않은 평가를 직접 수행하도록 요구합니다.
정직한 점수판
두 모델이 어떤 벤치마크에서도 겹치지 않기 때문에, 스코어보드는 순위가 아니라 서로 다른 두 가지 내기의 초상이다. 모든 행에서 소싱이 중요하다 — AuK-Flash의 주장은 며칠 된 Tencent 카드 명세서에 근거하며 재현되지 않았고, MathForm-8B의 수치는 arXiv 2608.14221에 보고된 OpenBMB의 자료이나 재현되지 않았다:
• 它是什么 — {{1}}AuK-Flash:腾讯的约1.5B语音生成与编辑模型,被蒸馏为4步扩散变体。{{/1}} {{2}}MathForm-8B:OpenBMB的8B自动形式化工具,将非正式数学转化为Lean 4。{{/2}}
• 출력 — AuK-Flash: 24kHz 오디오 — 음성, 편집된 음성, 분리된 소스. MathForm-8B: 헤더와 명명된 정리가 있는 Lean 4 문장.
• 구축 — AuK-Flash: 고정 NFE 4 / CFG 0으로 증류된 확산 트랜스포머로, Qwen2.5-Omni-3B를 지시 인코더로 사용. MathForm-8B: 약 367K개 예제로 구성된 FormalVerse 데이터셋에서 SFT 후 RL로 미세 조정된 Qwen3-8B.
• 입력 언어 — AuK-Flash: 중국어 및 영어(모델 카드 기준). MathForm-8B: 수학 문제 서술문체의 영어.
• 릴리스 — AuK-Flash: 저장소 8월 18/21; 오픈소스 발표 9월 7–9. MathForm-8B: 저장소 8월 14; 작성 시점 기준 발표 없음.
• 증거 — AuK-Flash: 아직 카드의 기능 목록 외에는 없음. MathForm-8B: 공급업체가 보고한 구문 검사에서 Pass@8 88.06%, 일관성 검사에서 72.37%를 기록했으며, 하드 일관성 세트에서 FATE-H 63%, FATE-X 37%를 기록함.

6개 행의 점수판: 둘 다 오픈 가중치 전문 모델로, Qwen의 두뇌를 빌려 쓰고 독자적 증거는 빈약하다 — 둘의 차이는 출시 방식이 아니라 무엇을 만드느냐에 있다.
AuK-Flash: 전문가의 산출물로서의 음성
AuK-Flash에 대한 "차용된 두뇌"라는 주장은 비유가 아니라 문자 그대로다. Tencent가 공개한 체크포인트에는 diffusion transformer와 layer-fusion 가중치가 들어 있고, 실제로 사용자의 지시를 이해하는 모델인 Qwen2.5-Omni-3B는 별도로 다운로드되어 런타임에 로드된다. 잠재 표현을 24kHz 파형으로 되돌리는 BigVGANFlowVAE도 마찬가지다. 따라서 Tencent가 학습시킨 것은 언어 모델이 전혀 아니며, 조건부 flow-matching 생성기다. 즉, Qwen 인코더가 만들어 낸 의미적 계획(semantic plan)을 입력받아 수 단계 만에 오디오를 렌더링한다. AuK-Flash는 그 생성기를 4단계 증류(distillation)로 압축한 버전이며, 해당 저장소는 Flash 체크포인트 기준 약 6.1GB(BF16)에 637MB VAE를 포함하고 CLI, Python 엔진, Gradio 및 ComfyUI 노드, 파인튜닝 스크립트를 함께 제공한다. 기능 목록은 음성 모델로서는 폭넓다: 제로샷 및 지시 기반 TTS, 콘텐츠 및 가사 편집, 피치/속도/음량 및 감정/음색 변경, 외국어 억양 제거, 속삭임 변환, 음질 향상, 음원 분리까지, 이 모든 것이 중국어와 영어로 된 하나의 자연어 지시 인터페이스 뒤에 구현되어 있다. 각 기능이 설명대로 작동하는지는 Tencent 외부에서 검증되지 않았으며, "이해하는 소형 Qwen + 소리를 만드는 증류 diffusion 모델"이라는 아키텍처 주장은 저장소 자체에서 확인할 수 있다.

tencent/AuK-Flash 저장소 페이지 — 런타임 시 Qwen2.5-Omni-3B 인코더와 VAE를 별도의 파일에서 로드하는, 증류된 4-step 음성 모델용 MIT 라이선스 가중치입니다.
MathForm-8B: 전문가의 산출물로서의 형식 증명
MathForm-8B는 도메인만 하나 다를 뿐 동일한 패턴입니다. OpenBMB는 119개 언어로 학습된 범용 모델인 Qwen3-8B를 가져와 그 전체 역량을 단 하나의 출력 형태, 즉 자연어 문제에서 도출된 Lean 4 정리 문장에 쏟아부었습니다. FormalVerse에서의 SFT 단계는 비공식(informal)에서 공식(formal)으로의 매핑을 가르치고, 이후 RL 단계는 Lean 컴파일러의 판정을 기준으로 이를 다듬습니다. 그래서 이 모델은 막연한 품질 점수가 아니라 구문 검사에서의 Pass@8과 의미 일관성 검사에서의 더 엄격한 통과 기준을 보고하는 것입니다. 공급업체 수치는 강력합니다 — 여섯 개 벤치마크에서 88.06%와 72.37%를 기록하며 논문의 7B–32B 전용 기준선들을 능가하지만, AuK-Flash의 주장과 마찬가지로 재현되지 않았습니다. 저장소는 Apache-2.0이며 Transformers, vLLM 또는 SGLang을 통해 제공됩니다. 그 대가로 Qwen3-8B가 알려진 모든 것을 본질적으로 포기합니다. 즉, 119개 언어 일반 채팅이 없고, Lean용 출력 예산은 약 16K 토큰이며, 형식화 외의 문서화된 능력이 없습니다.

openbmb/MathForm-8B 저장소 — 자동형식화기(autoformalizer)를 위한 Apache-2.0 가중치로, 기본 모델로 Qwen3-8B를 명시합니다. 이것이 MathForm-8B의 공개된 전체 표면입니다.
검증은 어느 벤치마크도 포착하지 못하는 주제입니다.
두 출력을 나란히 놓으면 기묘한 대칭이 드러난다. MathForm-8B의 전체 설계가 존재하는 이유는 자연어 수학에는 정확성 신호가 없기 때문이다. Lean 컴파일러가 그 신호를 제공하므로, 모델은 실제로 체감할 수 있는 합격/불합격 판정을 기준으로 훈련된다. AuK-Flash의 영역도 같은 문제를 지니되 해결책은 다르다. "이 클립이 화자처럼 들리는가, 그것도 기침을 뺀 귀속말로?"라고 검사해 줄 컴파일러는 없으므로, 합격/불합격 신호는 인간의 귀다. 두 종합 벤치마크 모두 그런 것을 측정하지 못한다. 텍스트의 Elo 점수나 합성 음성의 품질 점수는, 검증된 Lean 또는 편집·복제 가능한 음성이라는 전문가 모델의 핵심 약속이 실제 작업 흐름에서 유효한지에 대해 거의 알려주지 못한다. 실질적인 귀결은 두 모델 모두 공급업체가 평가하지 못했던 방식으로 평가되어야 한다는 것이다. MathForm-8B는 출력을 Lean으로 돌려보고, AuK-Flash는 자체 데이터에서 출력을 들어봐야 한다. 누군가 그렇게 하기 전까지, 두 모델 카드의 헤드라인 주장은 결과가 아니라 방향일 뿐이다.
각각이 누구를 위한 것인지, 그리고 누가 기다려야 하는지
• 워크로드가 형식화(formalization)에서 끝나는 경우 — 문제 은행 변환, Lean 코퍼스 구축, 증명 자동화 입력 — 그리고 이 규모에서 가장 강력한 오픈 전문가 모델을 원한다면 MathForm-8B를 선택하세요. 이는 일반 모델이 아니므로, 형식적 단계를 둘러싼 모든 작업에는 다른 모델과 함께 사용하세요.
워크로드의 결과물이 오디오로 끝나는 경우—텍스트를 읽어 줄 음성, 편집할 녹음, 분리할 믹스 등—그리고 생성과 편집을 하나의 작업으로 처리하는 오픈 모델을 원한다면 AuK-Flash를 선택하세요. 그와 함께 사용할 Qwen 인코더와 직접 수행할 청취 테스트를 위한 예산도 책정하세요.
• 검증되고 지원되는 인프라가 필요하다면 둘 다 기다리세요. 둘 다 독립적인 결과도 없고, 호스팅된 API도 없으며, 둘 다 며칠에서 몇 주밖에 안 된 것입니다. 훔쳐 쓸 패턴은 아키텍처적인 것입니다 — 작게 빌린 언어 두뇌에 전문 출력 헤드를 결합한 것이 완전한 범용 모델보다 훈련과 반복 비용이 훨씬 저렴합니다 — 그리고 이 패턴은 이 두 체크포인트를 실제로 실행하든 그렇지 않든 자신의 파인튜닝에 적용할 수 있는 패턴입니다.
두 릴리스 모두 라우팅 계층이 혼합 스택에서 자리 잡을 만한 이유를 보여줍니다. 파이프라인이 일반 추론 모델에서 이와 같은 전문 모델로 전환될 때, 라우터의 요점은 아키텍처를 단일 답변에 고정하지 않는다는 것입니다. 200개 이상의 모델에 걸친 하나의 API, 공급자가 성능 저하를 보일 때의 자동 장애 조치(failover), 그리고 공급자 목록 가격을 0% 마크업으로 그대로 전달한다는 점은 기본 경로에는 범용 모델을 유지하고, 전문 모델이 필요한 요청의 하위 집합에 대해서만 전문 모델을 호출하며, 더 나은 모델이 출시되는 날 전문 모델을 교체할 수 있음을 의미합니다.
기억해야 할 비교 구도는 AuK-Flash 대 MathForm-8B가 아니다 — 둘은 결코 같은 요청을 두고 경쟁하지 않을 테니까. 비교 구도는 바로 이 둘과, 프런티어 범용 모델만이 실행할 가치가 있는 유일한 모델이라는 가정 사이의 대결이다. 음성 편집과 검증된 형식화는 모두 작고 집중된 개방형 모델이 빌린 지능으로 문제를 겨냥한 적 없는 훨씬 더 큰 모델을 이길 수 있는 영역이다 — 이것이 바로 Tencent와 OpenBMB가 방금 발표한 그 베팅이며, 바로 독립적인 증명이 여전히 필요한 부분이다.
