Một thẻ tiêu đề được tạo có tiêu đề 'TwIL-LM3-Pro MathForm 8B', phụ đề 'Phát biểu vs Hệ quả logic', với hai thẻ bo tròn ghi 'MathForm 8B - đưa ra phát biểu Lean 4' và 'TwIL-LM3-Pro - đánh giá phát biểu'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

TwIL-LM3-Pro so với MathForm 8B: Phát biểu và Hệ quả logic là hai nửa khác nhau của việc hình thức hóa

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

TwIL-LM3-Pro và MathForm-8B cùng hướng tới một vấn đề rộng lớn — làm sao để máy tạo ra văn bản hình thức, có thể kiểm chứng được thay vì những câu chữ nghe có vẻ hợp lý — và chúng đang giải quyết hai nửa khác nhau của vấn đề đó. MathForm-8B là mô hình tự hình thức hóa 8 tỷ tham số của OpenBMB, ra mắt vào tháng 8 năm 2026: khi nhận một bài toán bằng ngôn ngữ thông thường, nó đưa ra phát biểu Lean 4 của bài toán đó, để ngỏ nghĩa vụ chứng minh cho trình biên dịch kiểm tra. TwIL-LM3-Pro là mô hình logic hình thức 3,66 tỷ tham số của webAI từ tháng 9 năm 2026, với đầu ra mục tiêu là các nhãn kéo theo, bản dịch sang logic bậc nhất, phân tích ngữ nghĩa và phê bình chứng minh Lean. Một mô hình tạo ra thứ cần được kiểm tra. Mô hình kia cho bạn biết liệu thứ bạn đang có có kéo theo điều bạn khẳng định hay không.

Vì hai thứ chỉ trùng nhau đúng một mảng — hình thức hóa bằng Lean — nên một trang so sánh vừa hấp dẫn lại vừa gây nhầm lẫn. Câu hỏi hữu ích hơn là mỗi thứ được huấn luyện để được thưởng vì điều gì, bởi tín hiệu phần thưởng mới là nơi hai thiết kế khác biệt gay gắt nhất và cũng là nơi lựa chọn thông minh hơn thực sự nằm ở đó.

Phát biểu so với sự kéo theo

MathForm-8B được huấn luyện trên FormalVerse, một kho ngữ liệu Lean 4 mà bài báo của OpenBMB mô tả là khoảng 367.000 ví dụ đã được kiểm chứng, thông qua tinh chỉnh có giám sát sau đó là học tăng cường. Quy trình xung quanh nó truy xuất các định nghĩa liên quan và các hình thức hóa hiện có từ Mathlib trước khi sinh, sau đó tinh chỉnh bằng chẩn đoán của trình biên dịch và kiểm tra tính nhất quán ngữ nghĩa. Đầu ra của nó là một phát biểu hình thức — các import, kiểu, tiêu đề định lý — mà một trình biên dịch bên ngoài chấp nhận hoặc từ chối. Thẻ mô hình nói rõ rằng nó không giải quyết bài toán và không tuyên bố làm được; việc chứng minh là công việc của người khác.

TwIL-LM3-Pro tiếp cận cùng một lĩnh vực từ phía logic. Pipeline của nó nhắm tới sáu mục tiêu: dịch logic bậc nhất, gán nhãn quan hệ kéo theo, phân tích cú pháp ngữ nghĩa, hình thức hoá trong Lean, phê bình chứng minh Lean, và quy nạp luật. Trong khi MathForm được xây dựng để đưa ra một phát biểu, TwIL-LM3-Pro được xây dựng để đưa ra phán đoán về các phát biểu — liệu phát biểu này có được kéo theo không, cách phân tích này có đúng không, nỗ lực chứng minh này có vững chắc không. Nó cũng hình thức hoá, và đó là điểm duy nhất mà hai mô hình thực sự có thể so sánh được với nhau chứ không chỉ đơn thuần là gần nhau.

Phần thưởng từ trình biên dịch so với phần thưởng từ bộ chấm điểm

Đây chính là điểm khác biệt về thiết kế đáng quan tâm, và cả hai nhà cung cấp đều ghi lại điều này.

Phần thưởng huấn luyện của MathForm đến từ việc biên dịch bằng Lean và phản hồi về tính nhất quán ngữ nghĩa. Trình biên dịch là một oracle: nó hoặc chấp nhận bản hình thức hóa, hoặc không, và không có điểm từng phần cũng chẳng có gì để tranh cãi. Đó là tín hiệu phần thưởng sạch sẽ nhất trong góc này của học máy, và đó là lý do các benchmark autoformalization được báo cáo dưới dạng tỷ lệ đạt — thước đo nằm ở hạ nguồn của một chương trình không quan tâm bất kỳ ai tin điều gì.

Giai đoạn cuối của TwIL-LM3-Pro là một lượt chạy GRPO được đánh trọng số theo entropy dựa trên một bộ xác minh lập trình, với thẻ của chính mô hình mô tả điểm một phần cho các kết quả khớp lỏng và token-F1 để những nhóm prompt mà mọi thứ đều thất bại vẫn tạo ra gradient. Cổng macro chủ đạo của nó là trung bình có trọng số bằng nhau của bốn làn phân loại có giới hạn cộng với suy diễn luật, và trong cổng đó, các làn trắc nghiệm và thủ tục được tính là `max(exact_match, loose_match)` — một quy tắc mà thẻ nêu rõ ràng, bởi vì một câu trả lời đúng được định dạng khác đi là một tạo tác định dạng chứ không phải là một thất bại trong suy luận.

Không thiết kế nào tệ hơn. Chúng được tinh chỉnh cho những hệ quả khác nhau. Phần thưởng do trình biên dịch chấm tạo ra một mô hình mà bạn có thể giao cho một bài toán hình thức hóa khó và tin tưởng vào đầu ra của nó, bởi vì đầu ra có thể kiểm chứng được. Phần thưởng do bộ chấm điểm chấm với điểm từng phần tạo ra một mô hình có thể được huấn luyện trên những phán đoán mờ hơn — suy diễn, phê bình, quy nạp luật — nơi không tồn tại trình biên dịch nào để phân xử và giải pháp thay thế là không huấn luyện trên những hướng đó chút nào. Cái giá phải trả là những con số thu được chỉ tốt ngang với hệ thống đánh giá, và webAI cũng nói vậy: dòng strict-7 của nó, vốn loại bỏ mọi dấu vết của điểm khớp lỏng, tồn tại chính xác để người đọc có thể thấy con số khắt khe hơn bên cạnh con số tiêu đề.

Các điểm số không nằm trên cùng một thang đo.

Cả hai mô hình đều công bố những con số liên quan đến Lean và không thể trừ chúng cho nhau. Bài báo của MathForm báo cáo Pass@8 trung bình là 88,06% trong Kiểm tra cú pháp và 72,37% trong Kiểm tra tính nhất quán trên sáu benchmark Lean, với tỷ lệ vượt qua kiểm tra tính nhất quán là 63% và 37% trên các tập con FATE-H và FATE-X khó hơn, đồng thời tuyên bố vượt trội so với một số autoformalizer chuyên biệt 32B. Model card của TwIL-LM3-Pro báo cáo token-F1 của `lean_formalize` là 0,5092 và độ chính xác của `lean_critic` là 0,7950 trên harness Track A của riêng nó.

Pass@8 trong một kiểm tra trình biên dịch và token-F1 so với một chuỗi tham chiếu đo những thứ khác nhau. Pass@8 cho mô hình tám lần thử và hỏi liệu có một lần biên dịch thành công và vẫn nhất quán; token-F1 đánh giá mức độ khớp của một lần sinh duy nhất với một tham chiếu. Một mô hình có thể đạt điểm cao ở cái này và thấp ở cái kia, và không có gì trong cả hai tài liệu cho phép đọc hai kết quả cạnh nhau.

Tóm tắt trung thực về hồ sơ đánh giá chuẩn là bằng chứng của MathForm-8B đến từ một bài báo có trình biên dịch trong vòng lặp, còn của TwIL-LM3-Pro đến từ một harness của nhà cung cấp với bộ chấm điểm trong vòng lặp, và chưa có bên thứ ba nào chạy cả hai qua cùng một thang đánh giá. Hãy coi bất kỳ trang nào đặt "88.06%" cạnh "0.5092" như thể chúng là một tỷ số là một trang chưa đọc các định nghĩa.

Thông số kỹ thuật, so sánh song song

• Tham số — TwIL-LM3-Pro 3.66B dense so với MathForm-8B 8B, kích thước lớn hơn khoảng 2,2 lần.

• Mô hình cơ sở — `ibm-granite/granite-4.2-3b` so với `Qwen/Qwen3-8B`.

• Dữ liệu huấn luyện — một kho ngữ liệu logic hình thức tổng hợp bao gồm sáu mục tiêu so với FormalVerse, khoảng 367.000 ví dụ Lean 4 đã được kiểm chứng.

• Phần thưởng — một bộ xác minh theo chương trình với điểm một phần và dung sai khớp lỏng, so với biên dịch Lean và phản hồi về tính nhất quán ngữ nghĩa.

• Đầu ra chính — nhãn kéo theo, bản dịch FOL, phân tích cú pháp ngữ nghĩa, phát biểu Lean và phê bình chứng minh đối chiếu với một phát biểu Lean 4 để trình biên dịch kiểm tra.

• Cửa sổ ngữ cảnh — 131.072 token cho TwIL-LM3-Pro, được đo trong phạm vi 8.192 token; MathForm-8B được cung cấp với ngân sách sinh lên tới 16.384 token trong ví dụ sử dụng của chính nó.

• Giấy phép — webAI Non-Commercial License ver. 1.0 so với Apache 2.0.

• Dấu chân lượng tử hóa — TwIL-LM3-Pro cung cấp GGUF Q4_K_M 2.09 GiB cho CPU hoặc 4 GB VRAM; MathForm-8B không phát hành GGUF nào trong kho lưu trữ riêng của mình.

Giấy phép lại quyết định vấn đề sản xuất.

MathForm-8B là Apache 2.0. Bạn có thể tinh chỉnh nó, phân phối lại nó và phục vụ nó trong một sản phẩm thương mại. TwIL-LM3-Pro là phi thương mại: nghiên cứu và sử dụng cá nhân được phép, và việc triển khai tạo doanh thu yêu cầu một thỏa thuận riêng với webAI, đơn vị có con đường thương mại là một dàn xếp dành cho doanh nghiệp thay vì một bảng giá được công bố.

Đối với một nhóm nghiên cứu hay một sinh viên, sự khác biệt đó không quan trọng — cả hai đều là các bản tải xuống không bị chặn trên Hugging Face. Đối với một công ty, điều đó mang tính quyết định, và nó chỉ ra MathForm-8B cho mọi công việc tự động hình thức hóa trong sản xuất, bất kể mô hình nào đạt điểm cao hơn trên một hạng mục mà không nhà cung cấp nào đo lường theo cùng một cách.

Vị trí của bộ định tuyến trong quy trình này

Cả TwIL-LM3-Pro lẫn MathForm-8B đều không phải là một route trong danh mục OrcaRouter, và lý do thì khác nhau: một cái được cấp phép phi thương mại và không có endpoint được host sẵn, cái còn lại được công bố dưới dạng checkpoint mở để tự host. Câu hỏi định tuyến trong một pipeline hình thức hóa nằm ở lớp bao quanh chúng. Xây dựng một corpus kiểu FormalVerse nghĩa là tạo ra hàng nghìn bài toán phi hình thức, lọc chúng theo tính hợp lệ về hình thức, và viết các kiểm tra nhất quán ngữ nghĩa để chấm điểm đầu ra — tất cả đều là các lệnh gọi văn bản, và tất cả đều thuộc loại công việc mà bạn muốn đổi mô hình tạo dữ liệu hàng loạt sang mô hình đánh giá nó mà không cần hợp đồng thứ hai. Trên một endpoint tương thích OpenAI đứng trước hơn 200 mô hình với giá niêm yết của nhà cung cấp, cộng thêm 0% markup, việc hoán đổi đó chỉ là một thay đổi cấu hình, và một đợt giảm giá từ nhà cung cấp đối với mô hình tạo dữ liệu sẽ đến ngay trong cùng ngày. Tự động chuyển đổi dự phòng là yếu tố then chốt trong một đợt xây dựng corpus, cụ thể là vì một tác vụ chết ở hai phần ba chặng đường của một lượt tạo dữ liệu sẽ làm tốn cả lần chạy.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Sự phân công lao động

Nếu công việc là biến toán học trong sách giáo khoa thành các câu lệnh Lean có thể biên dịch ở quy mô lớn, và kết quả phải được đưa vào một sản phẩm thương mại, thì MathForm-8B là công cụ và giấy phép Apache 2.0 là lý do. Nếu công việc là quyết định liệu một khối văn bản có kéo theo một khẳng định hay không, gán nhãn quan hệ kéo theo, phân tích ngữ nghĩa, hay phê bình một nỗ lực chứng minh, thì TwIL-LM3-Pro bao quát phạm vi mà MathForm chưa từng nhắm tới — và giấy phép phi thương mại của nó là một ranh giới về nơi có thể sử dụng năng lực đó, chứ không phải là điểm trừ đối với chính năng lực đó.

Sự kết hợp hợp lý là một pipeline hai giai đoạn chứ không phải một lựa chọn: một mô hình xuất ra phát biểu hình thức, mô hình kia đánh giá nó. Cả hai đều đã công bố pipeline đã tạo ra chúng, điều bất thường ở quy mô này và là lý do khiến việc so sánh này có thể được thực hiện.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.