Một thẻ tiêu đề chính cho video giải thích 'What Is MathForm-8B?' với phụ đề 'The 8B model turning math into Lean 4', thể hiện một phương trình ngôn ngữ tự nhiên chuyển đổi thành các ký hiệu mã Lean 4 chính thức, với logo OrcaRouter được ghép ở góc.
Guides & Insights

MathForm-8B là gì? Bản phát hành Autoformalization thầm lặng của OpenBMB biến Toán học thành Lean 4

Tác giả

Rowan Sterling

Ngày đăng

Quay lại tất cả bài viết

openbmb/MathForm-8B là một mô hình tự động hình thức hóa (autoformalization) mới từ OpenBMB, chuyên chuyển các phát biểu toán học bằng ngôn ngữ tự nhiên sang Lean 4, và mô hình này được phát hành gần như không kèm thông báo nào: các trọng số, bộ dữ liệu và bài báo đều xuất hiện trên Hugging Face và arXiv trong cùng một ngày — 2026-08-14 — dưới tiêu đề chung "MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement." Sự ra mắt âm thầm đó ẩn chứa một kết quả bất thường: một mô hình 8B tham số báo cáo điểm Pass@8 trung bình là 88.06% trong bài kiểm tra cú pháp và 72.37% trong bài kiểm tra tính nhất quán khắt khe hơn, trên sáu benchmark; bài báo khẳng định kết quả này vượt qua một số bộ tự động hình thức hóa chuyên dụng 32B tham số. Đây là bài viết dạng "những gì chúng ta biết cho đến nay": mọi nội dung phía dưới được gắn nhãn "from the repo" đều trích trực tiếp từ model card, dataset card và bài báo, còn bất cứ điều gì chưa được xác minh độc lập đều được đánh dấu rõ ràng như vậy.

Những điểm chính rút ra

• MathForm-8B là một mô hình tự động hình thức hóa 8B, theo giấy phép Apache-2.0: mô hình này đọc một bài toán không hình thức và viết ra một phát biểu định lý Lean 4 với tiêu đề có tên, sẵn sàng cho việc chứng minh sau đó.

Mô hình được tinh chỉnh từ Qwen3-8B trên FormalVerse, một bộ dữ liệu Lean 4 đã được xác minh gồm khoảng 367.000 ví dụ do OpenBMB xây dựng bằng truy hồi tri thức và hoàn thiện được kiểm tra bằng trình biên dịch, sau đó được huấn luyện bằng học tăng cường sử dụng phản hồi từ quá trình biên dịch Lean và tính nhất quán ngữ nghĩa.

• Các con số được báo cáo (do nhà cung cấp báo cáo, chưa được tái lập): trung bình 88,06% Pass@8 trong Kiểm tra Cú pháp, 72,37% trong Kiểm tra Tính nhất quán, vượt qua các công cụ tự động hóa chuyên biệt từ 7B đến 32B trong bảng của chính bài báo.

• Chưa được công bố, chưa nằm trên API trả phí lớn khi ra mắt, và chưa được benchmark độc lập — ba khoảng trống quan trọng đối với việc áp dụng trong sản xuất.

• Việc phục vụ được tự lưu trữ: Transformers, vLLM hoặc SGLang, tất cả đều cung cấp điểm cuối tương thích OpenAI.

Bản phát hành thực sự chứa những gì

{{1}}Ba artifact được đăng tải cách nhau chỉ vài phút vào ngày 2026-08-14, đây chính là hình ảnh điển hình của một đợt phát hành có phối hợp nhưng không được công bố trước:{{/1}}

• Kho lưu trữ mô hình, openbmb/MathForm-8B — một mô hình ngôn ngữ nhân quả 8B ở định dạng BF16 với mẫu trò chuyện, bốn phân đoạn safetensors, giấy phép Apache 2.0.

• Kho dữ liệu, openbmb/FormalVerse — một tập dữ liệu tự động hình thức hóa Lean 4 với khoảng 367.000 ví dụ đã được xác minh, cũng theo Apache 2.0.

• Bài báo, arXiv 2608.14221 — 25 trang mô tả quy trình xây dựng dữ liệu, công thức huấn luyện và đánh giá trên sáu điểm chuẩn.

Liên kết mã GitHub trong README vẫn chỉ là chỗ giữ chỗ tại thời điểm viết, vì vậy quy trình đánh giá và các tập lệnh Pass@k đã được hứa hẹn nhưng chưa được công khai. README có nói rằng các kiểm tra biên dịch yêu cầu một Kimina Lean Server đang chạy và các thử nghiệm sử dụng Lean 4.21.0.

A single-column scoreboard for MathForm-8B listing: task is natural-language math to Lean 4 formalization, average Pass@8 of 88.06% under syntax check and 72.37% under consistency check, FATE-H and FATE-X consistency checks of 63% and 37%, base model Qwen3-8B, Apache 2.0 license, and serving via vLLM or SGLang, with a footer noting all figures are vendor-reported and unreproduced from arXiv 2608.14221.A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card titled 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the text-generation and transformers tags, and the Apache-2.0 license.

Trang repository ở trên hiện là toàn bộ bề mặt công khai của bản phát hành: một thẻ mô hình, bốn phân đoạn safetensors, một mẫu chat và một README đồng thời là tài liệu duy nhất. Không có bài đăng blog công bố nào tại thời điểm viết bài này.

MathForm-8B làm gì — và tại sao nó là một công việc có phạm vi hẹp

Autoformal hóa là bước trước khi chứng minh định lý: với một bài toán được phát biểu bằng tiếng Anh thông thường ("Chứng minh rằng với mọi số thực x, x² là không âm"), mô hình phải tạo ra một phát biểu đúng về mặt hình thức trong Lean 4 — các import, kiểu dữ liệu, và tiêu đề định lý — mà con người hoặc một trình chứng minh có thể tiếp tục xử lý. Đây là một kỹ năng thực sự khác với việc giải toán, vì mô hình phải ánh xạ các khái niệm ngôn ngữ tự nhiên lên hệ thống phân cấp chính xác các định nghĩa và kiểu dữ liệu của Mathlib. Một phát biểu kiểm tra kiểu thành công nhưng âm thầm làm yếu đi phát biểu gốc ("(2^5) ∣ (13^4 − 11^4)" thay vì khẳng định đầy đủ về tính chia hết) là kiểu lỗi kinh điển, và đó là lý do bài báo phân biệt Syntax Check (kiểm tra cú pháp — có biên dịch được không) với Consistency Check (kiểm tra tính nhất quán — về mặt ngữ nghĩa có phải là cùng một phát biểu không).

Thẻ mô hình cho thấy cách sử dụng dự kiến: bạn đưa cho nó một lời nhắc với bài toán không chính thức và một tên định lý mong muốn, nó sẽ trả về một câu lệnh Lean 4 với code>theorem my_favorite_theorem : ... := by sorry/code> — từ khóa code>sorry/code> để lại nghĩa vụ chứng minh còn bỏ ngỏ. Sự phân chia nhiệm vụ đó rất quan trọng: MathForm-8B là một công cụ hình thức hóa, không phải một công cụ chứng minh. Các nhóm phát triển công cụ Lean dùng nó để chuyển các ngân hàng bài toán thành dạng có thể kiểm tra bằng máy.

Cách nó được huấn luyện

Quy trình trong bài báo gồm hai giai đoạn. Đầu tiên, OpenBMB xây dựng FormalVerse bằng một quy trình xử lý để ({{1}}truy xuất các định nghĩa liên quan và các hình thức hóa hiện có từ Mathlib trước khi tạo sinh{{/1}}, {{2}}tạo sinh các phát biểu ứng viên{{/2}}, {{3}}tinh chỉnh chúng bằng cách sử dụng chẩn đoán của trình biên dịch Lean và phản hồi về tính nhất quán ngữ nghĩa{{/3}}, và {{4}}chỉ giữ lại các mẫu vượt qua cả hai kiểm tra{{/4}}). Kho ngữ liệu đã được xác minh đó sau đó được sử dụng để tinh chỉnh có giám sát, tiếp theo là học tăng cường với các tín hiệu phần thưởng từ quá trình biên dịch Lean và tính nhất quán ngữ nghĩa.

Thẻ tập dữ liệu mang lại cái nhìn cụ thể về dữ liệu: mỗi mục ghép một phát biểu thông thường với một phát biểu hình thức đã được xác minh, được gắn thẻ theo nguồn (ví dụ: AceReason-Math) và nhãn chủ đề (Lý thuyết số, v.v.). Vì mọi ví dụ đều đã vượt qua kiểm tra trình biên dịch thực tế trước khi được đưa vào huấn luyện, mô hình học từ các phát biểu được biết là đúng thay vì từ đầu ra thô của một mô hình.

A screenshot of the Hugging Face dataset page for openbmb/FormalVerse, the verified Lean 4 autoformalization dataset used to train MathForm-8B, showing the dataset card and its text-generation and mathematics tags.

Bảng benchmark, được ghi nhãn trung thực

Tất cả các con số trong phần này đều do nhà cung cấp báo cáo từ bài báo (arXiv 2608.14221) và chưa được tái lập một cách độc lập. Pass@8 nghĩa là mô hình có tám lần thử cho mỗi bài toán và lần chạy được tính nếu bất kỳ lần thử nào vượt qua; đây là chỉ số dễ chịu hơn pass@1 và nên được hiểu là "mô hình có thể tạo ra câu trả lời đúng thường xuyên đến mức nào trong giới hạn ngân sách cho phép."

• Điểm trung bình của MathForm-8B — Kiểm tra cú pháp 88.06%, Kiểm tra nhất quán 72.37%.

• Theo benchmark, SC rồi CC: FormalIMATH 100.00 / 95.06, ProverBench 100.00 / 94.83, CombiBench 93.00 / 47.00, FATE-M 99.33 / 97.33, FATE-H 82.00 / 63.00, FATE-X 54.00 / 37.00.

Các bộ dữ liệu khó là những bộ trung thực: FATE-H CC 63% và FATE-X CC 37% cho thấy trần năng lực của mô hình trên các tập con khó nhất, so với mức CC 95%+ trên các bộ dễ hơn là FormalIMATH và ProverBench.

• Các baseline 8B tốt nhất mà bài báo liệt kê — ReForm-8B 81.76 / 66.21, Goedel-Formalizer-V2-8B 78.24 / 60.08 — và các baseline 32B tốt nhất — ReForm-32B 81.61 / 68.41, Goedel-Formalizer-V2-32B 78.28 / 63.74, StepFun-Formalizer-32B 63.65 / 44.47 — đều thua kém chỉ số 88.06 / 72.37 của MathForm-8B.

Checkpoint chỉ SFT (trước giai đoạn RL) đạt 84.38 / 66.53, nên lượt học tăng cường có giá trị khoảng +3.7 SC và +5.8 CC trung bình, với mức tăng lớn nhất nằm ở các bộ khó.

Những tuyên bố mạnh nhất cần hoài nghi: điểm SC 100.00 trên FormalIMATH và ProverBench (tỷ lệ compile 100% trên các bộ dễ là một dấu hiệu cảnh báo rằng các bộ đó đã hội tụ), và việc so sánh với các mô hình 32B không được chạy lại trong các điều kiện giống hệt nhau. Các con số Consistency Check trên FATE-H và FATE-X là những chỉ số có khả năng sống sót cao nhất qua kiểm tra độc lập.

Điều gì chưa được xác nhận

• Không có đánh giá độc lập nào tồn tại. Tính đến thời điểm viết bài, chưa có bên thứ ba nào đưa MathForm-8B qua một bộ đánh giá công khai, và mã đánh giá vẫn chưa được phát hành.

• Không có thông báo ra mắt. OpenBMB chưa đăng blog giới thiệu, trang giá, hoặc endpoint API. Cách nói "âm thầm phát hành" là theo nghĩa đen.

Trọng số phần thưởng RL, ngân sách huấn luyện và phần cứng không có trong model card; chúng chỉ được nêu trong bài báo.

• Việc mô hình 8B có tổng quát hóa được sang Lean 4.21.1+ hoặc các import không phải Mathlib hay không vẫn chưa được kiểm tra.

Cách chạy nó

Tự lưu trữ là con đường duy nhất hiện nay. README mô tả ba cách tiếp cận, tất cả đều có endpoint chat tương thích OpenAI tại code>localhost:8000/v1/chat/completions/code>:

• Transformers — code>AutoModelForCausalLM.from_pretrained("openbmb/MathForm-8B", torch_dtype=torch.bfloat16)/code>, sau đó tạo sinh bằng chat template.

• vLLM — code>vllm serve openbmb/MathForm-8B --served-model-name MathForm-8B --dtype bfloat16 --max-model-len 16384/code>.

• SGLang — code>python -m sglang.launch_server --model-path openbmb/MathForm-8B --served-model-name MathForm-8B --dtype bfloat16 --context-length 16384/code>.

README khuyến nghị temperature 0.6, top_p 0.95 và tối đa 16384 token mới — các phát biểu trang trọng thường rất dài, vì vậy cửa sổ sinh văn bản rộng rãi chính là yêu cầu hệ thống thực tế mà bạn cần tính toán ngân sách.

Tại sao phần "8B đánh bại 32B" lại quan trọng

Nếu các con số đứng vững, MathForm-8B là bằng chứng mạnh mẽ nhất cho đến nay rằng điểm nghẽn của quá trình tự động hình thức hóa nằm ở chất lượng dữ liệu và khâu xác minh, chứ không phải số tham số thô. Bảng số liệu trong chính bài báo cho thấy các mô hình chuyên dụng 32B (ReForm-32B, Goedel-Formalizer-V2-32B, StepFun-Formalizer-32B) xếp dưới một mô hình 8B được huấn luyện trên kho ngữ liệu đã qua trình biên dịch kiểm tra. Đối với các nhóm hiện đang chạy một formalizer 32B, đây là một thay đổi chi phí đáng kể — một mô hình 8B ở BF16 chạy vừa trên một GPU duy nhất mà phần lớn các mô hình 32B không chạy nổi, và nó phục vụ nhanh hơn trên mỗi token.

Điều này cũng tạo ra sự lựa chọn trung thực mà phần còn lại của bối cảnh mô hình tiếp tục mang lại: một chuyên gia hẹp thực hiện rất tốt một nhiệm vụ đã được xác minh, so với một mô hình tổng quát có thể thử nhiều nhiệm vụ mà không có bất kỳ sự đảm bảo xác minh nào. Đối với formalization nói riêng, chuyên gia là mô hình có trình biên dịch kiểm tra đầu ra — chính xác là đặc tính khiến cho việc đặt một bộ định tuyến có khả năng chuyển đổi dự phòng tự động ở phía trước trở nên thoải mái. Một lớp định tuyến như OrcaRouter chạy trên hơn 200 mô hình, với giá chuyển tiếp theo giá niêm yết của nhà cung cấp, cho phép bạn trỏ một đường thử nghiệm vào một mô hình trọng số mở mới ra mắt vài ngày như thế này, rồi chuyển về một mô hình đã được kiểm chứng ngay khi nó trục trặc — bạn có thể áp dụng một bản phát hành yên tĩnh mà không đặt cược đường production của mình vào nó, và không có phụ phí nào trên giá token nếu sau này nhà cung cấp niêm yết nó.

Xem gì tiếp theo

Ba điều sẽ biến dự án này từ "kho mã thú vị" thành "công cụ đáng tin cậy": mã đánh giá GitHub thực sự xuất hiện; một lần kiểm tra độc lập đầu tiên với FATE-H và FATE-X theo pass@1 thay vì pass@8; và bất kỳ thông báo nào từ OpenBMB bổ sung đường dẫn lưu trữ hoặc phiên bản paper v2 kèm số liệu ablation. Cho đến khi ít nhất một trong những điều đó thành hiện thực, hãy coi các điểm số tiêu đề chỉ mang tính định hướng — kiến trúc và ý tưởng dữ liệu huấn luyện mới là tin bền vững, không phải con số phần trăm chính xác.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube