Một thẻ tiêu đề hero được tạo với nội dung 'Solar Mini 4 vs MathForm 8B', phụ đề 'Một bên trả lời câu hỏi, bên kia khiến nó có thể kiểm chứng được' và hai huy hiệu ghi 'Một mô hình tổng quát đối đầu với một hệ tự động hình thức hóa' và 'Biên dịch Lean 4 trong vòng lặp'.
Guides & Insights

Solar Mini 4 vs MathForm 8B: Một mô hình trả lời câu hỏi, mô hình kia làm cho nó có thể kiểm chứng được

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Solar Mini 4 cạnh MathForm 8B và bạn đang so sánh hai mô hình không tranh nhau cùng một token. Solar Mini 4 là mô hình mixture-of-experts thưa 35 tỷ tham số của Upstage, ra mắt ngày 22 tháng 9 năm 2026 với khoảng 3 tỷ tham số hoạt động mỗi token, và nó trả lời các câu hỏi: đọc một tài liệu dài, suy luận trên đó, trả về một kết quả bằng văn bản. MathForm 8B là autoformalizer 8 tỷ tham số của OpenBMB, công bố ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0, và nó làm được điều mà không mô hình suy luận nào làm được — nó nhận một phát biểu toán học bằng ngôn ngữ tự nhiên và viết lại thành một định lý Lean 4 mà trình biên dịch của trợ lý chứng minh sẽ kiểm tra kiểu. Một cái tạo ra câu trả lời. Cái kia tạo ra những câu hỏi có thể kiểm chứng bằng máy, và cái sau mới là thứ hiếm có hơn.

Dù sao thì việc so sánh vẫn đáng để thực hiện, bởi vì cả hai rốt cuộc đều nằm trong cùng một loại pipeline, và bởi vì hai mô hình có những thế mạnh trái ngược nhau theo cách khiến cho việc lựa chọn trở nên rõ ràng một cách bất thường. Mô hình của Upstage mạnh về tài liệu dài, yếu về suy luận khó, và tốn kém cho mỗi tác vụ hoàn thành. Mô hình của OpenBMB thì hẹp đến mức vô dụng ngoài lĩnh vực chuyên biệt của nó, chưa từng được bất kỳ đơn vị đánh giá độc lập nào chấm điểm, và không tốn gì để chạy một khi bạn đã có GPU.

Cạnh nhau, về những điểm khác biệt

• Đây là gì — Solar Mini 4 là một mô hình suy luận tổng quát với ngữ cảnh 1M token (512K theo tài liệu của chính Upstage) và đạt 24,1 trên Chỉ số Trí tuệ của Artificial Analysis. MathForm 8B là một autoformalizer đơn nhiệm, không có điểm chỉ số nào được công bố, không có đánh giá độc lập và không có tuyên bố nào về năng lực tổng quát.

• Tham số — 35B tổng / 3B hoạt động, thưa, dành cho Solar Mini 4; 8.19B dày đặc cho MathForm 8B, được tinh chỉnh từ Qwen3-8B trên kho ngữ liệu FormalVerse của OpenBMB gồm khoảng 367.000 ví dụ Lean 4 đã được xác minh.

• Giấy phép và phân phối — Solar Mini 4 là độc quyền, được truy cập thông qua API của Upstage và các nền tảng bên thứ ba. MathForm 8B là trọng số Apache-2.0 với một chat template, bốn shard safetensors, và một lộ trình triển khai Transformers, vLLM hoặc SGLang phía sau một endpoint tương thích OpenAI.

• Giá — Solar Mini 4 ở mức $0.10 / $0.01 cho phần đã lưu đệm / $0.40 mỗi triệu token, hiện đang giảm 50% đến hết ngày 22 tháng 10 năm 2026. MathForm 8B không có bảng giá; chi phí của nó chính là chiếc GPU mà bạn đặt bên dưới.

• Tốc độ — 204 token đầu ra mỗi giây đối với Solar Mini 4 trên bộ khung đánh giá của Artificial Analysis, với 88.300 token đầu ra cho mỗi tác vụ lập chỉ mục và khoảng 430 giây làm việc cho mỗi tác vụ. Đầu ra của MathForm 8B chỉ là một tiêu đề định lý Lean 4, nhiều lắm là vài trăm token.

• Tính độc lập của các con số — Solar Mini 4 đã được một bên thứ ba chạy đánh giá. MathForm 8B thì chưa: mọi số liệu trong bài báo của nó đều do chính các tác giả đưa ra, và mô hình này còn quá mới và quá chuyên biệt nên chưa thu hút được một lượt chạy độc lập nào.

Nơi hai mô hình gặp nhau, và nơi chúng không gặp nhau

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Các kiểu thất bại chính là điều khiến sự ghép cặp này trở nên thú vị, bởi chúng hoàn toàn đối lập nhau. Kết quả công bố yếu nhất của Solar Mini 4 là Terminal-Bench 4.0 ở mức 1%, còn AutomationBench-AA ở mức 22,3% — nó kém trong việc tự xác minh công việc của mình trong một môi trường đưa ra phản hồi. Toàn bộ tiền đề thiết kế của MathForm 8B là xác minh: OpenBMB phân biệt Kiểm tra Cú pháp, vốn hỏi liệu phát biểu Lean 4 có biên dịch được hay không, với Kiểm tra Tính nhất quán, vốn hỏi liệu phát biểu mà nó đã biên dịch có thực sự mang cùng ý nghĩa như bài toán phi hình thức hay không. Kiểu thất bại kinh điển mà nó tồn tại để ngăn chặn là một phát biểu vượt qua kiểm tra kiểu nhưng lại âm thầm làm yếu khẳng định.

Đó là một sự khác biệt thực sự và đáng để nói cho chính xác. Một mô hình suy luận tạo ra một chứng minh có một vấn đề tự kiểm chứng nổi tiếng: không có gì trong quá trình sinh ra cho bạn biết liệu câu trả lời có đúng hay không. Một trình biên dịch thì có. Nếu quy trình làm việc của bạn là "chuyển một ngân hàng bài toán thành thứ mà máy có thể kiểm tra," thì MathForm 8B đang làm một nửa công việc mà Solar Mini 4 hoàn toàn không thể làm được, và phần còn lại không phải là vấn đề về mức độ.

Những con số của nhà cung cấp, được ghi nhãn đúng như vậy: bài báo của OpenBMB báo cáo Pass@8 trung bình đạt 88,06% trong Syntax Check và 72,37% trong Consistency Check trên sáu benchmark, đồng thời khẳng định chúng đánh bại một số autoformalizer 32B chuyên dụng. Chưa có phần nào trong số đó được bên thứ ba tái lập. Mức giảm 16 điểm giữa hai kiểm tra mới là con số mang nhiều thông tin hơn — nó đo tần suất một câu lệnh đã được biên dịch không hẳn đúng là bài toán bạn đã hỏi, và đó là lý do Consistency Check tồn tại như một cột riêng.

Tại sao một nhóm lại chạy cả hai

Bởi vì quy trình tự nhiên có một giai đoạn rẻ, khối lượng lớn và một giai đoạn đắt, khối lượng thấp. MathForm 8B chạy trên phần cứng của chính bạn và chuyển các bài toán phi hình thức thành phần đầu của Lean 4, với một trình biên dịch sẵn sàng từ chối đầu ra kém trước khi con người nhìn thấy nó. Solar Mini 4 xử lý những gì diễn ra xung quanh đó: đọc bài báo hỗ trợ, trích xuất các giả định, tóm tắt kết quả bằng tiếng Hàn hoặc tiếng Anh, và điều phối công việc. Hai mô hình không bao giờ cạnh tranh cho cùng một yêu cầu, và mô hình nhỏ hơn là mô hình đảm nhận phần công việc có tín hiệu đạt/không đạt khách quan.

Cả hai mô hình đều không phải thứ chúng tôi có thể định tuyến đến bạn — các mô hình của Upstage không có trên OrcaRouter và của OpenBMB cũng vậy — nên nếu bạn muốn Solar Mini 4 thì nó đến từ API riêng của Upstage, còn nếu bạn muốn MathForm 8B thì nó đến từ Hugging Face và GPU của chính bạn. Điều chúng tôi có thể làm là đặt phần còn lại của pipeline đó sau một khóa duy nhất: hơn 200 mô hình với mức chênh 0% so với giá niêm yết của nhà cung cấp, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và một DSL định tuyến cho phép bạn nối chuỗi các mô hình vào một lệnh gọi duy nhất. Trong một quy trình mà một mô hình chuyên biệt nhỏ đảm nhận bước hình thức hóa và một mô hình tổng quát lớn đảm nhận mọi thứ xung quanh nó, việc có thể thay đổi mô hình tổng quát chỉ bằng cách sửa một chuỗi mô hình — thay vì phải tung ra một tích hợp mới — chính là khác biệt giữa một thay đổi mất hai tuần và một buổi chiều.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Điều cần rút ra

Nếu câu hỏi của bạn là “trong số này tôi nên dùng cái nào,” thì câu trả lời trung thực là nó phụ thuộc vào việc bạn cần một câu trả lời hay một sự hình thức hóa, và không có benchmark nào phân xử được điều đó. Nếu câu hỏi của bạn là “MathForm 8B có đáng để tải về không,” thì câu trả lời là có cho một công việc hẹp duy nhất và không cho bất cứ thứ gì khác — nó là một công cụ hình thức hóa, không phải một công cụ chứng minh, và nghĩa vụ chứng minh vẫn để ngỏ trong đầu ra mà nó tạo ra. Nếu câu hỏi của bạn là “Solar Mini 4 có đáng $0.36 mỗi tác vụ không,” thì câu trả lời là có cho các tài liệu dài với khối lượng lớn và không cho bất cứ thứ gì đòi hỏi nó phải tự kiểm tra công việc của chính mình.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Về nguồn dẫn, để khép lại. Mọi số liệu của Solar Mini 4 ở trên đều là đo lường độc lập do Artificial Analysis thực hiện, ngoại trừ cửa sổ ngữ cảnh, vốn là số liệu của chính Upstage và không khớp với số liệu của họ. Mọi số liệu của MathForm 8B đều do nhà cung cấp báo cáo từ arXiv 2608.14221 và chưa được tái lập, và việc phát hành nó đã không được thông báo trước — trọng số, bộ dữ liệu FormalVerse và bài báo đều xuất hiện vào ngày 14 tháng 8 năm 2026, không có bài đăng blog nào từ nhà cung cấp và cho đến nay vẫn chưa có lần chạy đánh giá độc lập nào.