
Solar Mini 4 vs MathForm 8B: Một mô hình trả lời câu hỏi, mô hình kia làm cho nó có thể kiểm chứng được
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 trên 1 triệu token
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 trên 1 triệu token · 159 tok/s
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 220 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Solar Mini 4 cạnh MathForm 8B và bạn đang so sánh hai mô hình không tranh nhau cùng một token. Solar Mini 4 là mô hình mixture-of-experts thưa 35 tỷ tham số của Upstage, ra mắt ngày 22 tháng 9 năm 2026 với khoảng 3 tỷ tham số hoạt động mỗi token, và nó trả lời các câu hỏi: đọc một tài liệu dài, suy luận trên đó, trả về một kết quả bằng văn bản. MathForm 8B là autoformalizer 8 tỷ tham số của OpenBMB, công bố ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0, và nó làm được điều mà không mô hình suy luận nào làm được — nó nhận một phát biểu toán học bằng ngôn ngữ tự nhiên và viết lại thành một định lý Lean 4 mà trình biên dịch của trợ lý chứng minh sẽ kiểm tra kiểu. Một cái tạo ra câu trả lời. Cái kia tạo ra những câu hỏi có thể kiểm chứng bằng máy, và cái sau mới là thứ hiếm có hơn.
Dù sao thì việc so sánh vẫn đáng để thực hiện, bởi vì cả hai rốt cuộc đều nằm trong cùng một loại pipeline, và bởi vì hai mô hình có những thế mạnh trái ngược nhau theo cách khiến cho việc lựa chọn trở nên rõ ràng một cách bất thường. Mô hình của Upstage mạnh về tài liệu dài, yếu về suy luận khó, và tốn kém cho mỗi tác vụ hoàn thành. Mô hình của OpenBMB thì hẹp đến mức vô dụng ngoài lĩnh vực chuyên biệt của nó, chưa từng được bất kỳ đơn vị đánh giá độc lập nào chấm điểm, và không tốn gì để chạy một khi bạn đã có GPU.
Cạnh nhau, về những điểm khác biệt
• Đây là gì — Solar Mini 4 là một mô hình suy luận tổng quát với ngữ cảnh 1M token (512K theo tài liệu của chính Upstage) và đạt 24,1 trên Chỉ số Trí tuệ của Artificial Analysis. MathForm 8B là một autoformalizer đơn nhiệm, không có điểm chỉ số nào được công bố, không có đánh giá độc lập và không có tuyên bố nào về năng lực tổng quát.
• Tham số — 35B tổng / 3B hoạt động, thưa, dành cho Solar Mini 4; 8.19B dày đặc cho MathForm 8B, được tinh chỉnh từ Qwen3-8B trên kho ngữ liệu FormalVerse của OpenBMB gồm khoảng 367.000 ví dụ Lean 4 đã được xác minh.
• Giấy phép và phân phối — Solar Mini 4 là độc quyền, được truy cập thông qua API của Upstage và các nền tảng bên thứ ba. MathForm 8B là trọng số Apache-2.0 với một chat template, bốn shard safetensors, và một lộ trình triển khai Transformers, vLLM hoặc SGLang phía sau một endpoint tương thích OpenAI.
• Giá — Solar Mini 4 ở mức $0.10 / $0.01 cho phần đã lưu đệm / $0.40 mỗi triệu token, hiện đang giảm 50% đến hết ngày 22 tháng 10 năm 2026. MathForm 8B không có bảng giá; chi phí của nó chính là chiếc GPU mà bạn đặt bên dưới.
• Tốc độ — 204 token đầu ra mỗi giây đối với Solar Mini 4 trên bộ khung đánh giá của Artificial Analysis, với 88.300 token đầu ra cho mỗi tác vụ lập chỉ mục và khoảng 430 giây làm việc cho mỗi tác vụ. Đầu ra của MathForm 8B chỉ là một tiêu đề định lý Lean 4, nhiều lắm là vài trăm token.
• Tính độc lập của các con số — Solar Mini 4 đã được một bên thứ ba chạy đánh giá. MathForm 8B thì chưa: mọi số liệu trong bài báo của nó đều do chính các tác giả đưa ra, và mô hình này còn quá mới và quá chuyên biệt nên chưa thu hút được một lượt chạy độc lập nào.
Nơi hai mô hình gặp nhau, và nơi chúng không gặp nhau

Các kiểu thất bại chính là điều khiến sự ghép cặp này trở nên thú vị, bởi chúng hoàn toàn đối lập nhau. Kết quả công bố yếu nhất của Solar Mini 4 là Terminal-Bench 4.0 ở mức 1%, còn AutomationBench-AA ở mức 22,3% — nó kém trong việc tự xác minh công việc của mình trong một môi trường đưa ra phản hồi. Toàn bộ tiền đề thiết kế của MathForm 8B là xác minh: OpenBMB phân biệt Kiểm tra Cú pháp, vốn hỏi liệu phát biểu Lean 4 có biên dịch được hay không, với Kiểm tra Tính nhất quán, vốn hỏi liệu phát biểu mà nó đã biên dịch có thực sự mang cùng ý nghĩa như bài toán phi hình thức hay không. Kiểu thất bại kinh điển mà nó tồn tại để ngăn chặn là một phát biểu vượt qua kiểm tra kiểu nhưng lại âm thầm làm yếu khẳng định.
Đó là một sự khác biệt thực sự và đáng để nói cho chính xác. Một mô hình suy luận tạo ra một chứng minh có một vấn đề tự kiểm chứng nổi tiếng: không có gì trong quá trình sinh ra cho bạn biết liệu câu trả lời có đúng hay không. Một trình biên dịch thì có. Nếu quy trình làm việc của bạn là "chuyển một ngân hàng bài toán thành thứ mà máy có thể kiểm tra," thì MathForm 8B đang làm một nửa công việc mà Solar Mini 4 hoàn toàn không thể làm được, và phần còn lại không phải là vấn đề về mức độ.
Những con số của nhà cung cấp, được ghi nhãn đúng như vậy: bài báo của OpenBMB báo cáo Pass@8 trung bình đạt 88,06% trong Syntax Check và 72,37% trong Consistency Check trên sáu benchmark, đồng thời khẳng định chúng đánh bại một số autoformalizer 32B chuyên dụng. Chưa có phần nào trong số đó được bên thứ ba tái lập. Mức giảm 16 điểm giữa hai kiểm tra mới là con số mang nhiều thông tin hơn — nó đo tần suất một câu lệnh đã được biên dịch không hẳn đúng là bài toán bạn đã hỏi, và đó là lý do Consistency Check tồn tại như một cột riêng.
Tại sao một nhóm lại chạy cả hai
Bởi vì quy trình tự nhiên có một giai đoạn rẻ, khối lượng lớn và một giai đoạn đắt, khối lượng thấp. MathForm 8B chạy trên phần cứng của chính bạn và chuyển các bài toán phi hình thức thành phần đầu của Lean 4, với một trình biên dịch sẵn sàng từ chối đầu ra kém trước khi con người nhìn thấy nó. Solar Mini 4 xử lý những gì diễn ra xung quanh đó: đọc bài báo hỗ trợ, trích xuất các giả định, tóm tắt kết quả bằng tiếng Hàn hoặc tiếng Anh, và điều phối công việc. Hai mô hình không bao giờ cạnh tranh cho cùng một yêu cầu, và mô hình nhỏ hơn là mô hình đảm nhận phần công việc có tín hiệu đạt/không đạt khách quan.
Cả hai mô hình đều không phải thứ chúng tôi có thể định tuyến đến bạn — các mô hình của Upstage không có trên OrcaRouter và của OpenBMB cũng vậy — nên nếu bạn muốn Solar Mini 4 thì nó đến từ API riêng của Upstage, còn nếu bạn muốn MathForm 8B thì nó đến từ Hugging Face và GPU của chính bạn. Điều chúng tôi có thể làm là đặt phần còn lại của pipeline đó sau một khóa duy nhất: hơn 200 mô hình với mức chênh 0% so với giá niêm yết của nhà cung cấp, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và một DSL định tuyến cho phép bạn nối chuỗi các mô hình vào một lệnh gọi duy nhất. Trong một quy trình mà một mô hình chuyên biệt nhỏ đảm nhận bước hình thức hóa và một mô hình tổng quát lớn đảm nhận mọi thứ xung quanh nó, việc có thể thay đổi mô hình tổng quát chỉ bằng cách sửa một chuỗi mô hình — thay vì phải tung ra một tích hợp mới — chính là khác biệt giữa một thay đổi mất hai tuần và một buổi chiều.

Điều cần rút ra
Nếu câu hỏi của bạn là “trong số này tôi nên dùng cái nào,” thì câu trả lời trung thực là nó phụ thuộc vào việc bạn cần một câu trả lời hay một sự hình thức hóa, và không có benchmark nào phân xử được điều đó. Nếu câu hỏi của bạn là “MathForm 8B có đáng để tải về không,” thì câu trả lời là có cho một công việc hẹp duy nhất và không cho bất cứ thứ gì khác — nó là một công cụ hình thức hóa, không phải một công cụ chứng minh, và nghĩa vụ chứng minh vẫn để ngỏ trong đầu ra mà nó tạo ra. Nếu câu hỏi của bạn là “Solar Mini 4 có đáng $0.36 mỗi tác vụ không,” thì câu trả lời là có cho các tài liệu dài với khối lượng lớn và không cho bất cứ thứ gì đòi hỏi nó phải tự kiểm tra công việc của chính mình.

Về nguồn dẫn, để khép lại. Mọi số liệu của Solar Mini 4 ở trên đều là đo lường độc lập do Artificial Analysis thực hiện, ngoại trừ cửa sổ ngữ cảnh, vốn là số liệu của chính Upstage và không khớp với số liệu của họ. Mọi số liệu của MathForm 8B đều do nhà cung cấp báo cáo từ arXiv 2608.14221 và chưa được tái lập, và việc phát hành nó đã không được thông báo trước — trọng số, bộ dữ liệu FormalVerse và bài báo đều xuất hiện vào ngày 14 tháng 8 năm 2026, không có bài đăng blog nào từ nhà cung cấp và cho đến nay vẫn chưa có lần chạy đánh giá độc lập nào.
