
AuK-Flash đấu với MathForm-8B: Hai chuyên gia thầm lặng trên bộ não Qwen đi mượn
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
AuK-Flash và MathForm-8B có nhiều điểm chung hơn những gì mà hai phòng nghiên cứu có lẽ nhận ra, và điểm chung đó không nằm ở tác vụ mà cả hai đảm nhiệm. MathForm-8B là mô hình tự động hình thức hóa 8B của OpenBMB — bản tinh chỉnh Apache-2.0 của Qwen3-8B, chuyển toán học ngôn ngữ tự nhiên thành các phát biểu Lean 4 mà trình biên dịch có thể kiểm tra. AuK-Flash là mô hình giọng nói chưng cất của Tencent — bộ tạo khuếch tán theo giấy phép MIT dùng để tổng hợp và chỉnh sửa giọng nói, đưa các chỉ dẫn qua bộ mã hóa Qwen2.5-Omni-3B trước khi tạo ra âm thanh. Một mô hình chuyển toán văn xuôi thành văn bản hình thức có thể kiểm chứng bằng chứng minh; mô hình còn lại chuyển văn bản và chỉ dẫn thành âm thanh. Hai mô hình có chung một chiến lược kiến trúc nhưng đi theo hai hướng ngược nhau: không mô hình nào huấn luyện một bộ não ngôn ngữ tổng quát từ đầu — mỗi mô hình bao quanh một mô hình mở có sẵn và dồn nỗ lực thực sự vào phương thức đầu ra của mình. Cả hai cũng được phát hành theo cùng một cách — trọng số âm thầm xuất hiện trên Hugging Face, không có thông cáo báo chí — và cả hai đều đúng là loại bản phát hành hẹp, tự lưu trữ mà một benchmark cho mô hình tiên phong không thể nắm bắt được.
Khuôn mẫu gắn kết chúng lại với nhau
Nhìn vào hai chuỗi phát hành đặt cạnh nhau, có thể thấy chúng gần như là hình ảnh phản chiếu của nhau. Kho lưu trữ AuK-Flash của Tencent mang ngày 21 tháng 8 trên Hugging Face (kho AuK cơ sở cùng dòng là ngày 18 tháng 8); còn thông báo mã nguồn mở — mã nguồn, trọng số và liên kết demo — chỉ mới xuất hiện trong tuần này, với ngày 7 tháng 9 trên thẻ Hugging Face và ngày 9 tháng 9 trên kho GitHub được liên kết. Kho lưu trữ MathForm-8B của OpenBMB xuất hiện ngày 14 tháng 8 mà không hề có thông báo nào. Trong cả hai trường hợp, thẻ mô hình chính là sự ra mắt, trọng số được truy cập tự do theo giấy phép permissive, và không có API lưu trữ sẵn nào để dùng thử — bạn tải checkpoint về và tự chạy trên phần cứng bạn kiểm soát. Với một độc giả đang cân nhắc nên áp dụng gì, hình thức trùng khớp này quan trọng hơn sự khác biệt về lĩnh vực: cả hai đều là canh bạc rằng một mô hình mở có phạm vi hẹp có thể phục vụ một phân khúc ngách mà mô hình đa năng phục vụ kém, và cả hai đều yêu cầu bạn tự cung cấp phần đánh giá mà nhà phát hành đã không thực hiện.
Bảng điểm trung thực
Vì hai mô hình không trùng lặp trên bất kỳ chuẩn đánh giá nào, bảng điểm là bức chân dung về hai lựa chọn khác nhau chứ không phải một thứ hạng. Nguồn gốc đều có ý nghĩa ở mọi hàng — các tuyên bố của AuK-Flash là những báo cáo thẻ Tencent đã cũ vài ngày và chưa được tái lập; số liệu của MathForm-8B do OpenBMB công bố từ arXiv 2608.14221 và chưa được tái lập:
• Nó là gì — AuK-Flash: mô hình tạo và chỉnh sửa giọng nói ~1.5B của Tencent, được chưng cất thành biến thể khuếch tán 4 bước. MathForm-8B: trình tự động hình thức hóa 8B của OpenBMB, chuyển đổi toán học phi chính thức thành Lean 4.
• Đầu ra — AuK-Flash: âm thanh 24 kHz — giọng nói, giọng nói đã chỉnh sửa, các nguồn đã tách. MathForm-8B: các phát biểu Lean 4 có tiêu đề và định lý được đặt tên.
• Xây dựng — AuK-Flash: transformer khuếch tán được chưng cất xuống NFE cố định 4 / CFG 0, với Qwen2.5-Omni-3B làm bộ mã hóa hướng dẫn. MathForm-8B: Qwen3-8B được tinh chỉnh bằng SFT rồi RL trên tập dữ liệu FormalVerse gồm ~367K mẫu.
• Ngôn ngữ đầu vào — AuK-Flash: tiếng Trung và tiếng Anh (theo bảng thông tin mô hình). MathForm-8B: tiếng Anh, ở văn phong của các bài toán.
• Phát hành — AuK-Flash: kho mã nguồn 18/21 tháng 8; mã nguồn mở được công bố từ 7–9 tháng 9. MathForm-8B: kho mã nguồn ngày 14 tháng 8; chưa có thông báo nào tính đến thời điểm viết bài.
• Bằng chứng — AuK-Flash: chưa có gì ngoài danh sách khả năng của thẻ. MathForm-8B: nhà cung cấp báo cáo 88.06% Pass@8 khi kiểm tra cú pháp và 72.37% khi kiểm tra tính nhất quán, với FATE-H 63% và FATE-X 37% trên các bộ kiểm tra nhất quán khó.

Bảng xếp hạng trong sáu hàng: cả hai đều là chuyên gia về trọng số mở với bộ não Qwen mượn và bằng chứng độc lập mỏng manh — chúng khác nhau ở những gì chúng tạo ra, không phải ở cách chúng được phát hành.
AuK-Flash: lời nói như đầu ra của chuyên gia
Khẳng định "mượn bộ não" cho AuK-Flash là theo nghĩa đen, không phải lối nói bóng bẩy. Checkpoint mà Tencent công bố chứa diffusion transformer và trọng số hợp nhất tầng (layer-fusion); mô hình thực sự hiểu chỉ dẫn của bạn — Qwen2.5-Omni-3B — được tải riêng và nạp vào lúc chạy, và BigVGANFlowVAE — bộ phận biến latent trở lại thành dạng sóng 24 kHz — cũng tương tự. Vậy thứ Tencent huấn luyện không phải là một mô hình ngôn ngữ mà là một trình tạo flow-matching có điều kiện: nhận kế hoạch ngữ nghĩa từ bộ mã hóa Qwen, nó dựng âm thanh chỉ trong vài bước. AuK-Flash là phiên bản chưng cất bốn bước của trình tạo đó, và kho lưu trữ của nó — khoảng 6,1 GB cho checkpoint Flash ở định dạng BF16 cộng thêm VAE 637 MB — đi kèm CLI, một công cụ Python, các node Gradio và ComfyUI, cùng tập lệnh tinh chỉnh. Danh sách khả năng khá rộng cho một mô hình tiếng nói: TTS zero-shot và theo chỉ dẫn, chỉnh sửa nội dung và lời bài hát, thay đổi cao độ/tốc độ/âm lượng và cảm xúc/âm sắc, khử giọng địa phương, chuyển đổi giọng thì thầm, tăng cường âm thanh và tách nguồn — tất cả nằm sau một giao diện điều khiển bằng ngôn ngữ tự nhiên duy nhất bằng tiếng Trung và tiếng Anh. Liệu từng khả năng có hoạt động đúng như mô tả hay không vẫn chưa được kiểm chứng bên ngoài Tencent; luận điểm về kiến trúc — một Qwen nhỏ biết hiểu, một mô hình khuếch tán đã chưng cất tạo ra âm thanh — có thể thấy ngay trong chính kho lưu trữ.

Trang kho lưu trữ tencent/AuK-Flash — trọng số được cấp phép MIT của mô hình giọng nói 4 bước đã được chưng cất, với bộ mã hóa Qwen2.5-Omni-3B và VAE được tải từ các tệp riêng biệt khi chạy.
MathForm-8B: chứng minh hình thức là đầu ra của chuyên gia
MathForm-8B cũng theo cùng một khuôn mẫu, chỉ chuyển sang một lĩnh vực khác. OpenBMB đã lấy Qwen3-8B — một mô hình đa năng được huấn luyện trên 119 ngôn ngữ — và dồn toàn bộ năng lực vào một dạng đầu ra duy nhất: phát biểu định lý Lean 4 được suy ra từ bài toán bằng ngôn ngữ tự nhiên. Giai đoạn SFT trên FormalVerse dạy ánh xạ từ phi hình thức sang hình thức; giai đoạn RL sau đó mài giũa kết quả dựa trên phán quyết của trình biên dịch Lean — chính vì vậy mô hình báo cáo không phải một điểm chất lượng mơ hồ mà là Pass@8 khi kiểm tra cú pháp và một mức pass nghiêm ngặt hơn khi kiểm tra tính nhất quán ngữ nghĩa. Số liệu từ nhà cung cấp rất mạnh — 88,06% và 72,37% trên sáu benchmark, vượt qua các baseline chuyên biệt 7B–32B của bài báo — nhưng cũng chưa được tái lập giống như các tuyên bố của AuK-Flash. Kho mã nguồn được cấp phép Apache-2.0, phục vụ qua Transformers, vLLM hoặc SGLang, và đánh đổi gần như toàn bộ những gì Qwen3-8B vốn nổi tiếng: không còn chat đa năng 119 ngôn ngữ, ngân sách đầu ra khoảng 16K token cho Lean, và không có năng lực nào được ghi nhận ngoài hình thức hóa.

Kho lưu trữ openbmb/MathForm-8B — bộ trọng số Apache-2.0 cho công cụ tự động hình thức hóa, liệt kê Qwen3-8B làm mô hình cơ sở. Đây là toàn bộ bề mặt công khai của MathForm-8B.
Xác minh là chủ đề mà cả hai benchmark đều không nắm bắt được.
Đặt hai đầu ra cạnh nhau, một sự đối xứng kỳ lạ sẽ hiện ra. Toàn bộ thiết kế của MathForm-8B tồn tại vì toán học bằng ngôn ngữ tự nhiên không có tín hiệu đúng/sai — trình biên dịch Lean cung cấp một tín hiệu như vậy, nên mô hình được huấn luyện dựa trên phán quyết đạt/không đạt mà nó thực sự có thể cảm nhận được. Lĩnh vực của AuK-Flash gặp cùng vấn đề đó nhưng với một giải pháp khác: không có trình biên dịch cho câu hỏi "đoạn clip này có nghe giống người nói không, trong tiếng thì thầm, khi tiếng ho đã được loại bỏ", nên tín hiệu đạt/không đạt là tai người. Không một chuẩn đánh giá tổng hợp nào đo lường được điều đó — điểm Elo trên văn bản hay điểm chất lượng trên giọng nói tổng hợp cho bạn biết rất ít về việc lời hứa cốt lõi của chuyên gia (Lean đã được xác minh, hoặc giọng nói có thể chỉnh sửa và nhân bản) có giữ vững trong quy trình làm việc của bạn hay không. Hệ quả thực tế là cả hai mô hình phải được đánh giá theo cách mà nhà cung cấp không thể thực hiện được: MathForm-8B bằng cách chạy đầu ra của nó qua Lean, AuK-Flash bằng cách nghe đầu ra của nó trên dữ liệu của chính bạn. Cho đến khi ai đó làm được điều đó, những tuyên bố chính trên cả hai thẻ mô hình chỉ là định hướng, chứ không phải là kết quả.
Mỗi loại dành cho ai, và ai nên chờ đợi
• Hãy chọn MathForm-8B khi khối lượng công việc của bạn dừng lại ở bước hình thức hóa — chuyển đổi ngân hàng bài toán, xây dựng kho ngữ liệu Lean, cung cấp dữ liệu cho tự động hóa chứng minh — và bạn muốn một chuyên gia mã nguồn mở mạnh nhất ở mức này. Đây không phải là mô hình đa năng, vì vậy hãy kết hợp nó với một mô hình khác cho mọi thứ xung quanh bước hình thức hóa.
• Hãy chọn AuK-Flash khi công việc của bạn cho ra âm thanh — {{1}}giọng nói đọc văn bản của bạn, bản ghi để chỉnh sửa, bản phối để tách{{/1}} — và bạn muốn {{2}}một mô hình mở xử lý việc tạo sinh và chỉnh sửa như một thao tác duy nhất{{/2}}. Hãy dự trù ngân sách cho {{3}}bộ mã hóa Qwen{{/3}} đi kèm và cho {{4}}bài kiểm tra nghe của riêng bạn{{/4}}.
• Hãy chờ cả hai nếu bạn cần một hạ tầng đã được kiểm chứng và được hỗ trợ chính thức: không bên nào có kết quả độc lập, không bên nào có API được lưu trữ, và cả hai mới chỉ tồn tại từ vài ngày đến vài tuần. Điều đáng học hỏi là một mẫu hình kiến trúc — một bộ não ngôn ngữ nhỏ được mượn kết hợp với một đầu ra chuyên biệt sẽ rẻ hơn nhiều để huấn luyện và lặp lại so với một mô hình đa năng hoàn chỉnh — và đó là mẫu hình bạn có thể áp dụng trong quá trình tinh chỉnh của riêng mình, dù bạn có chạy hai checkpoint này hay không.
Cả hai bản phát hành cũng cho thấy vì sao một tầng định tuyến xứng đáng có chỗ đứng trong một kiến trúc hỗn hợp: khi pipeline của bạn chuyển từ một mô hình suy luận tổng quát sang một mô hình chuyên biệt như một trong số này, điểm mấu chốt của bộ định tuyến là bạn không phải ràng buộc kiến trúc vào một câu trả lời duy nhất. Một API duy nhất cho hơn 200 mô hình, tự động chuyển dự phòng nếu một nhà cung cấp suy giảm hiệu năng, và giá niêm yết của nhà cung cấp được chuyển qua với mức chênh lệch 0% — tất cả nghĩa là bạn có thể giữ mô hình tổng quát trên luồng mặc định và chỉ gọi mô hình chuyên biệt cho tập con các yêu cầu cần đến nó — và thay mô hình chuyên biệt đó ngay khi một mô hình tốt hơn ra mắt.
Điểm so sánh cần giữ không phải là AuK-Flash đối đầu MathForm-8B — chúng sẽ không bao giờ cạnh tranh cho cùng một yêu cầu. Mà là cả hai cùng chống lại giả định rằng một mô hình đa năng tiên phong là mô hình duy nhất đáng vận hành. Chỉnh sửa giọng nói và hình thức hóa có kiểm chứng đều là những lĩnh vực mà một mô hình mã nguồn mở nhỏ, tập trung, với bộ não đi vay, có thể đánh bại một mô hình lớn hơn nhiều nhưng chưa bao giờ được hướng vào bài toán — đó chính xác là canh bạc mà cả Tencent lẫn OpenBMB vừa công bố, và cũng chính xác là điều vẫn cần được kiểm chứng một cách độc lập.
