
AuK-Flash vs MathForm-8B:借用 Qwen 大腦的兩位低調專家
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
AuK-Flash 與 MathForm-8B 之間的共通點,可能比兩個實驗室各自意識到的還要多——而這些共通點與它們各自執行的任務無關。MathForm-8B 是 OpenBMB 的 8B 自動形式化模型——以 Apache-2.0 授權對 Qwen3-8B 微調而成,能將自然語言數學轉換為編譯器可檢查的 Lean 4 語句。AuK-Flash 是騰訊的蒸餾語音模型——採用 MIT 授權的擴散生成器,負責語音合成與編輯;在發出聲音之前,它會將指令路由至 Qwen2.5-Omni-3B 編碼器。前者將散文式數學轉換為可驗證證明的形式化文本;後者則將文本與指令轉換為音訊。兩者從相反方向採用了相同的架構策略:皆非從零訓練通用語言大腦——而是各自包覆一個既有的開放模型,並將真正的功夫花在其輸出模態上。兩者的發布方式也如出一轍——權重悄悄地放上 Hugging Face,沒有新聞稿——而兩者正是那種狹窄、可自行託管的發布,是前沿模型基準測試無法捕捉的。
聯繫它們的模式
並排檢視這兩個釋出軌跡,幾乎是彼此的鏡像。騰訊的 AuK-Flash 儲存庫在 Hugging Face 上的日期是 8 月 21 日(同系列 AuK 基礎版為 8 月 18 日);而開源公告——包含程式碼、權重與 demo 連結——直到本週才發布,Hugging Face 卡片上標示 9 月 7 日,所連結的 GitHub 儲存庫則為 9 月 9 日。OpenBMB 的 MathForm-8B 儲存庫在 8 月 14 日出現,完全沒有任何公告。在兩種情況中,模型卡本身就是發布動作;權重以寬鬆授權開放、不需審核即可取得;也都沒有提供託管 API 可供試用——你必須自行下載 checkpoint,並在你掌控的硬體上執行。對於正在決定該採用哪一個的讀者來說,這種共同的釋出型態比領域差異更重要:兩者都是同樣的賭注,認為一個範圍收斂的開放模型能服務好通用模型做不好的利基市場;而兩者也都要你補上開發者沒有提供的評測。
誠實的記分板
由於這兩個模型在任何基準上都沒有重疊,記分板所呈現的是兩種不同賭注的寫照,而非排名。每一行的來源都至關重要——AuK-Flash 的主張是騰訊卡片上數天前的陳述,且未經重現;MathForm-8B 的數據則由 OpenBMB 取自 arXiv 2608.14221 並轉述,也未被重現:
• {{1}}它是什麼 — AuK-Flash:騰訊約15億參數的語音生成與編輯模型,蒸餾為4步擴散變體。MathForm-8B:OpenBMB的80億參數自動形式化器,可將非正式數學轉換為 Lean 4。{{/1}}
• 輸出 — AuK-Flash:24 kHz 音訊 — 語音、經編輯的語音、分離出的音源。MathForm-8B:帶有標頭及具名定理的 Lean 4 陳述。
• 建構 — AuK-Flash:擴散Transformer蒸餾至固定NFE 4 / CFG 0,以Qwen2.5-Omni-3B作為指令編碼器。MathForm-8B:Qwen3-8B在約367K筆範例的FormalVerse資料集上,先以SFT再以RL進行微調。
• 輸入語言 — AuK-Flash:中文和英文(根據模型卡)。MathForm-8B:英文,屬數學問題陳述的語域。
• 發布 — AuK-Flash:儲存庫於8月18/21日;開源宣布於9月7–9日。MathForm-8B:儲存庫於8月14日;截至撰寫本文時未有宣布。
• 證據 — AuK-Flash:目前除了卡片上的能力清單外,尚無其他證據。MathForm-8B:供應商回報在語法檢查下的 Pass@8 為 88.06%,在一致性檢查下為 72.37%;在困難一致性測試集上,FATE-H 為 63%,FATE-X 為 37%。

計分板分為六行:兩者皆為開放權重的專家模型,借用了 Qwen 的大腦,且獨立證據薄弱——它們的差異在於製造的內容,而非發布的方式。
AuK-Flash:語音作為專家的輸出
所謂「借用大腦」對 AuK-Flash 而言是字面上的說法,而非修辭。騰訊發布的檢查點包含擴散 Transformer 與層融合權重;真正理解你指令的模型——Qwen2.5-Omni-3B——是另外下載並在執行時載入的,而負責把潛在表示還原成 24 kHz 波形的 BigVGANFlowVAE 也是如此。因此,騰訊訓練的根本不是語言模型,而是一個條件式 flow-matching 生成器:在收到 Qwen 編碼器提供的語意計畫後,它只需少數幾個步驟就能渲染出音訊。AuK-Flash 是該生成器的四步驟蒸餾版本,其儲存庫——Flash 檢查點約 6.1 GB(BF16 格式),外加 637 MB 的 VAE——附帶 CLI、Python 引擎、Gradio 與 ComfyUI 節點,以及一套微調腳本。就語音模型而言,其功能清單相當廣泛:零樣本與指令式 TTS、內容與歌詞編輯、音高/速度/音量與情緒/音色調整、去口音、耳語轉換、增強,以及音源分離,全部整合在一個支援中文與英文的自然語言指令介面之後。各項功能是否如所述般運作,在騰訊之外尚未經過測試;但架構主張——一個負責理解的小型 Qwen,加上一個負責產生聲音的蒸餾擴散模型——在儲存庫中一目了然。

tencent/AuK-Flash 儲存庫頁面 — 採用 MIT 授權的權重,適用於蒸餾後的 4 步語音模型,其中 Qwen2.5-Omni-3B 編碼器和 VAE 會在執行階段從各自的檔案載入。
MathForm-8B:形式化證明作為專家的輸出
MathForm-8B 是同一模式在另一個領域的體現。OpenBMB 取用 Qwen3-8B(一個以 119 種語言訓練的通用模型),將其全部能力投入單一輸出形態:由自然語言問題推導出 Lean 4 定理陳述。FormalVerse 上的 SFT(監督式微調)階段教會模型從非正式語言到正式語言的映射;隨後 RL(強化學習)階段則以 Lean 編譯器的判定來打磨這項能力,因此模型回報的不是模糊的品質分數,而是通過語法檢查的 Pass@8,以及在語意一致性檢查下更嚴格的通過率。廠商數據相當亮眼——六項基準測試分別達 88.06% 與 72.37%,勝過論文中 7B–32B 的專用基線——但就跟 AuK-Flash 的主張一樣,尚未被重現。該儲存庫以 Apache-2.0 授權,可透過 Transformers、vLLM 或 SGLang 使用,而換取這些能力的代價,是基本上放棄 Qwen3-8B 為人所知的一切:沒有 119 種語言的通用對話,Lean 輸出預算大約只有 16K token,而且在形式化之外沒有任何有紀錄的能力。

openbmb/MathForm-8B 儲存庫 — 自動形式化器的 Apache-2.0 權重,並將 Qwen3-8B 列為其基礎模型。這就是 MathForm-8B 所有對外公開的內容。
驗證是這兩個基準測試都未能捕捉的主題
把這兩個輸出並排放在一起,就會浮現一種奇特的對稱性。MathForm-8B 的整體設計之所以存在,是因為自然語言數學本來就沒有正確性訊號——Lean 編譯器提供了這個訊號,所以模型是針對它能實際感受到的「通過/失敗」判定來訓練。AuK-Flash 的領域有同樣的問題,但用了不同的解方:並不存在一個能判斷「這個片段聽起來是否像該說話者在低語,而且咳嗽聲已被移除」的編譯器,因此它的通過/失敗訊號來自人耳。但這兩種總體基準都無法衡量那一點——文字的 Elo 評分或合成語音的品質分數,都很難告訴你該專業模型的核心承諾(經 Lean 驗證,或可編輯、可複製的語音)在你的工作流程中是否真的成立。實際的後果是:這兩個模型都必須以廠商無法做到的方式來評估——MathForm-8B 是把輸出送入 Lean 執行,AuK-Flash 則是在你自己的資料上聆聽它的輸出。在有人真正這樣做之前,兩張卡片上的標題式宣稱都只是方向,而不是結果。
分別適用於哪些人,以及哪些人應等待
• 當您的工作止於形式化階段——轉換題庫、構建 Lean 語料庫、為證明自動化提供輸入——且您希望在這一參數量級下獲得最強大的開放專用模型時,請選擇 MathForm-8B。它不是通用模型,因此請將它與另一個模型搭配使用,以處理形式化步驟以外的所有事務。
• 當你的工作負載最終產出是音訊——例如用語音朗讀文字、編輯錄音、分離混音——且你希望有一個開放模型能將生成與編輯視為單一操作時,請選擇 AuK-Flash。請一併為其搭配的 Qwen 編碼器,以及你自己的聆聽測試,預留預算。
• 若你需要一套經過驗證、有支援的基礎設施,那兩者都還請再等等:兩者皆無獨立成果,皆無代管 API,且都僅有數天到數週的歷史。真正值得借鏡的模式在於架構——以一顆小型借用語言腦,加上特化輸出頭,比起完整通用模型,訓練與迭代的成本遠低得多——而且無論你是否曾經運行這兩個檢查點,都能在自身的微調流程中採用此模式。
這兩個版本也說明了路由層在混合技術棧中何以佔有一席之地:當你的流程從通用推理模型跨入像其中之一那樣的專業模型時,路由器的重點在於你不必讓架構承諾單一答案。一個 API 涵蓋 200 多種模型、供應商服務降級時自動故障轉移,以及供應商列表價格以 0% 加價原樣傳遞,這意味著你可以讓通用模型維持在預設路徑上,僅針對需要它的那部分請求呼叫專業模型——而當更好的專業模型推出當天,就可以立即替換。
真正值得緊記的比較,不是 AuK-Flash 對決 MathForm-8B——它們永遠不會爭奪同一個請求。而是這兩者共同對抗「只有前沿通用模型才值得運行」的假設。語音編輯與驗證式形式化,都是這樣一個領域:一個小巧、專注、開放,且擁有「借用的大腦」的模型,可以擊敗一個從未瞄準該問題的更大模型——這正是騰訊與 OpenBMB 剛剛公開押注的方向,也正是仍需要獨立證明的地方。
