
Clef vs MathForm-8B: Một bên trả lời câu hỏi của bạn, bên kia viết một chứng minh
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Lý do để đặt Cloudflare/clef bên cạnh openbmb/MathForm-8B là hiện nay chúng là hai thứ dễ bị nhầm lẫn nhất trong lĩnh vực trọng số mở, và nhầm lẫn chúng sẽ khiến tốn một lần chạy huấn luyện. Cả hai đều là các bản tinh chỉnh được xây dựng lần lượt trên các checkpoint Qwen3.8-27B và Qwen3-8B. Cả hai đều theo Apache-2.0. Cả hai đều được công bố trong mười tuần qua. Cả hai đều có phạm vi hẹp, được xây dựng cho mục đích cụ thể, và được nhà sản xuất mô tả là chuyên biệt thay vì tổng quát. Và chúng chẳng có chút liên quan nào với nhau, bởi vì một cái tạo ra một con số được chọn từ danh sách bạn đã cung cấp, còn cái kia tạo ra mã nguồn Lean 4, từng token một, để một trợ lý chứng minh kiểm tra.
Clef là mô hình quyết định đa phương thức 27 tỷ tham số của Cloudflare: bạn đưa cho nó một trạng thái và một lược đồ gồm các câu hỏi có kiểu, và nó trả về xác suất đã hiệu chỉnh cho mọi câu trả lời được phép trong một lượt truyền không tự hồi quy duy nhất, không có bất kỳ sinh văn bản nào trong toàn bộ đường đi. MathForm-8B, từ OpenBMB, là một mô hình tự hình thức hóa — một phát biểu toán học bằng ngôn ngữ tự nhiên đi vào, Lean 4 đi ra, và quy trình đã huấn luyện nó được mô tả trong một bản tiền in arXiv công bố cùng với trọng số vào ngày 14 tháng 8 năm 2026. Mức trần của một mô hình là kích thước danh sách lựa chọn của bạn. Mức trần của mô hình kia là độ mạnh của lý thuyết kiểu của Lean. Hỏi mô hình nào tốt hơn là một lỗi phạm trù, và việc cả hai đều là những bản tinh chỉnh trọng số mở Apache-2.0 với tám đến hai mươi bảy tỷ tham số chính là điều khiến lỗi đó dễ mắc phải.
Điều mà giao diện của mỗi mô hình cấm về mặt vật lý
Cách nhanh nhất để thấy sự tách biệt là đọc xem mỗi cái là gì.
• Đầu vào — Clef nhận một trạng thái (văn bản, JSON, hình ảnh hoặc khung video) cùng với 1 đến 64 câu hỏi có tên và kiểu dữ liệu; MathForm-8B nhận một phát biểu toán học bằng ngôn ngữ tự nhiên.
• Đầu ra — Clef trả về một xác suất cho mỗi tùy chọn được phép, được softmax theo từng câu hỏi. MathForm-8B trả về mã nguồn Lean 4.
• Các loại câu hỏi — Của Clef gồm noul (đúng/sai, kèm xác suất đúng), choice (từ 2 đến 26 lựa chọn có tên) và score (từ 2 đến 26 mức có thứ tự); MathForm-8B hoàn toàn không có khái niệm câu hỏi nào.
• Hiệu chuẩn — Clef công bố một trường độ tin cậy cho mỗi câu trả lời; MathForm-8B công bố tỷ lệ Pass@8 theo các kiểm tra cú pháp và tính nhất quán.
• Phục vụ — Clef được phục vụ thông qua một POST /v1/systemone body tương thích Jev/SystemOne, được triển khai trên máy chủ hoặc tự vận hành; MathForm-8B đi kèm hướng dẫn cho Transformers, vLLM và SGLang, tất cả đều cung cấp endpoint completion tương thích OpenAI với ngữ cảnh 16.384 token, với max_new_tokens được đặt thành 16.384.
Hệ quả thực tiễn lộ ra ngay lập tức. Nếu bạn cần một phán đoán có/không về một đoạn văn bản, Clef là cái duy nhất trong hai cái có thể tạo ra nó — không có cách nào để hỏi MathForm-8B một câu hỏi mà không phải là "viết Lean 4 cho cái này." Nếu bạn cần Lean 4, Clef là cái duy nhất trong hai cái tuyệt đối không thể tạo ra nó, và không phải vì yếu kém: yêu cầu một bộ chấm điểm ràng buộc theo lược đồ hình thức hóa một định lý không phù hợp với hợp đồng của nó, nên yêu cầu đó bị từ chối theo thiết kế thay vì được trả lời tồi.

Pipeline mà cả hai đều thuộc về
Có một kiến trúc thực tế trong đó hai mô hình này nằm cạnh nhau, và đáng để điểm qua vì nó biến sự tách biệt thành cụ thể thay vì trừu tượng. Hãy xem xét một dịch vụ hình thức hóa toán học cho các nhà nghiên cứu và sinh viên.
Các phát biểu đến dưới dạng ngôn ngữ tự nhiên, không giới hạn về chủng loại. Trước khi bất cứ điều gì có thể được hình thức hóa, phải có thứ gì đó quyết định cái gì đã đến. Đây là một định lý cần chứng minh, một định nghĩa cần thêm vào, một yêu cầu kiểm tra một chứng minh đã có, hay một câu hỏi cần được làm rõ trước khi bất kỳ ai chạm vào Lean? Nó có tự chứa không, hay nó dựa vào ngữ cảnh mà người dùng không cung cấp? Các ký hiệu có theo quy ước không, hay đây là ký hiệu mà hệ thống chưa từng thấy? Mỗi một trong số đó là một câu hỏi có giới hạn với một tập lựa chọn nhỏ — đúng hình dạng của Clef — và xác suất đã hiệu chỉnh gắn với mỗi câu trả lời chính là thứ cho phép dịch vụ xử lý hợp lý với những câu trả lời không chắc chắn: chuyển bất cứ thứ gì dưới một ngưỡng nào đó cho con người thay vì đoán.
Bước thứ hai thuộc về MathForm-8B. Hãy lấy một phát biểu đã được phân loại là định lý tự chứa với ký hiệu đã biết và xuất ra Lean 4. Đó là một bài toán sinh, và câu hỏi chất lượng là đầu ra biên dịch được bao thường xuyên và nó mang cùng ý nghĩa như bản gốc bao thường xuyên — chính xác là điều mà hai trục đánh giá của nhà cung cấp đo lường. Đây là mẫu tổng quát đáng rút ra từ việc ghép cặp: một bộ phân loại rẻ, có giới hạn đặt trước một bộ sinh chuyên biệt đắt đỏ thường rẻ hơn và đáng tin cậy hơn so với việc nhắc bộ sinh tự quyết định liệu nó có nên chạy hay không.
Các con số ở mỗi bên thực sự đo lường điều gì
Tóm tắt trên arXiv của OpenBMB báo cáo rằng MathForm-8B đạt tỷ lệ Pass@8 trung bình là 88,06% trong Syntax Check và 72,37% trong Consistency Check trên sáu bộ đánh giá, và rằng trên các tập con FATE-H và FATE-X, mô hình đạt tỷ lệ vượt qua nhất quán lần lượt là 63% và 37%, đều cao hơn các baseline chuyên biệt mạnh nhất mà bài báo so sánh. Phần thú vị của tuyên bố này nằm ở quy trình huấn luyện: một retrieval planner rút ra các định nghĩa liên quan và những hình thức hóa hiện có từ Mathlib trước khi sinh, rồi các phát biểu được sinh ra sẽ được chỉnh sửa bằng chẩn đoán của trình biên dịch và phản hồi nhất quán ngữ nghĩa, đó là cách bộ dữ liệu FormalVerse gồm khoảng 367.000 ví dụ Lean 4 đã được kiểm chứng được xây dựng trước khi tinh chỉnh có giám sát và học tăng cường. Đây là những con số do nhà cung cấp tự báo cáo từ một bài báo và một model card. Chưa có bên độc lập nào chạy lại chúng.
Các con số của Clef đo lường một thứ hoàn toàn khác và không thể so sánh được. Lần chạy Decision Index của Cloudflare báo cáo macro-F1 cho ý định BANKING77 là 94,2, CLINC150 với xử lý ngoài phạm vi ở mức 97,4, GPQA Diamond ở mức 48,0 — trong khi Jev cũ hơn đạt 78,3 — và độ trễ yêu cầu trung vị là 209,3 ms. Đó là một bảng về phân loại và định tuyến, được nhà cung cấp tạo ra trên bộ đánh giá của chính nhà cung cấp, được lưu trữ trên bảng xếp hạng của chính nhà cung cấp, và chưa được tái lập.
Câu trung thực duy nhất để viết về hai cột này là chúng không chia sẻ cùng một chuẩn đánh giá, cùng một đơn vị hay cùng một triết lý đánh giá. Con số 37% của MathForm-8B trên một tập con hình thức hóa khó và 97,4 của Clef trên việc phát hiện ý định ngoài phạm vi đều là những tuyên bố có thật của nhà sản xuất về những công việc khác nhau, và một người đọc đặt chúng cạnh nhau thì chẳng học được gì ngoài việc cả hai con số đều tồn tại.
Bạn sẽ chạy những gì, và nó tốn bao nhiêu
Cả hai mô hình đều không phải là một route trên OrcaRouter, và bài viết này không đưa ra tuyên bố nào về tính khả dụng — danh mục trả về 404 đối với cloudflare/clef và đối với MathForm-8B. Kho lưu trữ MathForm có dung lượng khoảng 16,4 GB, và cả hai mô hình đều là Apache-2.0, nên cả hai đều có thể được tự host vào ngày mai bởi bất kỳ ai có phần cứng.
• Clef trên Cloudflare — 0,24 USD cho mỗi triệu token đầu vào trên Workers AI, với độ trễ được công bố đo trên một H200.
• MathForm-8B tự triển khai — không phụ thuộc vào dịch vụ lưu trữ của nhà cung cấp, không có mức giá theo token, và ngữ cảnh 16.384 token đã được ghi rõ trong tài liệu, đây là một ràng buộc đáng chú ý: một phần dài của bài báo sẽ không vừa trong một lượt.
• Phương án thay thế được định tuyến cho nửa phân loại — Jev 1.13 của TypeSafe với giá 0,042 USD cho mỗi triệu token đầu vào trên ngữ cảnh 65.536 token, được cung cấp thông qua cùng POST /v1/systemone phần thân mà Clef sử dụng, khiến nó trở thành lựa chọn thay thế trực tiếp cho bước đầu tiên của pipeline ở trên.
Đó chính là chỗ mà một lớp định tuyến khẳng định được vai trò của mình trong sự kết hợp cụ thể này. Mô hình ở đây gồm một bộ quyết định và một bộ tạo sinh, và chính nửa "bộ quyết định" mới là phần có phương án thay thế trực tiếp — một endpoint duy nhất đứng trước hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm phụ phí theo token, và cơ chế tự động chuyển đổi dự phòng để một buổi chiều trục trặc của nhà cung cấp không làm tắc nghẽn cửa trước của pipeline bạn. Còn nửa "bộ tạo sinh" là một tệp 16.4 GB mà bạn tự chạy, và không endpoint nào thay đổi được điều đó.

Còn một điều nữa.
Số lượng tham số dễ gợi ra một phép so sánh không hề hợp lệ. Clef có 27B còn MathForm-8B có 8B, nên ta dễ cho rằng mô hình lớn hơn là mô hình mạnh hơn và mô hình nhỏ hơn là mô hình chuyên biệt. Xét về bản chất, mọi chuyện lại ngược lại. Clef lớn vì nó mang một backbone đa phương thức đóng băng mà nó cần để đọc ảnh chụp màn hình và hóa đơn; phần được huấn luyện ở trên cùng chỉ là một schema head nhỏ với các adapter rank-256. MathForm-8B nhỏ vì Lean 4 là một mục tiêu hẹp và nền tảng Qwen3-8B đã đủ để đạt được nó, với phần kỹ thuật thực sự nằm ở pipeline truy hồi và kiểm chứng đã tạo ra dữ liệu huấn luyện của nó chứ không phải ở số lượng tham số.
Kích thước, nói cách khác, cho bạn biết mỗi mô hình phải mang theo những gì, chứ không phải vấn đề mà nó giải khó đến mức nào. Một mô hình 27B đọc hóa đơn và trả về “billing, 0.98” cùng một mô hình 8B xuất ra mã Lean biên dịch được đều đang làm đúng chính xác những gì chúng được tạo ra để làm, và việc tám tỷ so với hai mươi bảy tỷ sẽ dẫn bạn đến mô hình sai trong khoảng một nửa số lần.

Quyết định, và câu hỏi mà cả hai nhà cung cấp đều chưa trả lời
Nếu bạn có một pipeline tiếp nhận ngôn ngữ tự nhiên không giới hạn và cần định tuyến nó trước khi tiêu tốn tài nguyên tính toán cho nó, bước đầu tiên là một bộ phân loại có giới hạn — Clef khi đầu vào đa phương thức của nó quan trọng và các con số của nó trông ổn trên dữ liệu của bạn, hoặc Jev 1.13 khi bạn muốn cùng dạng yêu cầu với mức giá niêm yết thấp hơn và không ràng buộc kiến trúc của mình vào một nhà cung cấp mà đánh giá của họ chưa từng được ai tái lập. Bước thứ hai là một bộ sinh chuyên biệt, và nếu bộ sinh đó là Lean 4, thì MathForm-8B là mô hình mở được xây dựng đúng cho mục đích đó, với một pipeline đã công bố và một kho ngữ liệu đằng sau nó.
Điều còn thiếu ở cả hai phía là cùng một loại bằng chứng. Lượt chạy Decision Index của Clef là của chính Cloudflare và chưa từng được lặp lại một cách độc lập; các số liệu Pass@8 của MathForm-8B đến từ chính bài báo của nó. Cả hai đều là những tuyên bố đầy tham vọng trong một lĩnh vực mà phép thử trung thực thì rẻ để mô tả và đắt để thực hiện — lấy dữ liệu mà cả hai nhà cung cấp đều chưa huấn luyện trên đó, áp dụng cùng một pipeline, và công bố kết quả. Cho đến khi ai đó làm điều đó cho một trong hai mô hình, điều hữu ích mà so sánh này có thể cho bạn biết là một hình dạng: một trong số này thuộc về đầu pipeline của bạn để quyết định thứ gì sẽ đến, còn cái kia thuộc về phía sau nó để làm công việc khó và hẹp, và không cái nào thay thế được cái kia ở bất kỳ số lượng tham số nào.
