Đã tạo thẻ hero cho Kolibri vs MathForm 8B, có tiêu đề 'Kolibri vs MathForm 8B' cùng dòng phụ đề 'một mô hình tổng quát đối đầu với một autoformalizer Lean 4', một biểu tượng chim ruồi ở bên trái và một biểu tượng hình vuông chứng minh ở bên phải, nằm hai bên của một đường phân cách mảnh. Logo OrcaRouter nằm trong dải bên dưới phần đồ họa.
Guides & Insights

Kolibri vs MathForm-8B: Một trong những tuyên bố về độ chính xác này có thể được kiểm tra bằng trình biên dịch

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kolibri và MathForm-8B dùng chung một giấy phép và gần như không có gì khác giống nhau. Cả hai đều theo Apache 2.0, đều là mô hình trọng số mở, đều được phát hành trong ba tháng qua — Kolibri của Aleph Alpha vào ngày 3 tháng 10 năm 2026, MathForm-8B của OpenBMB vào ngày 14 tháng 8 năm 2026 — và cả hai đều dành một phần lớn thẻ mô hình của mình cho toán học. Điểm giống nhau chỉ dừng ở đó. Kolibri là một mô hình hỗn hợp chuyên gia tiếng Đức và tiếng Anh 78,1 tỷ tham số, kích hoạt 3,46 tỷ tham số mỗi token và được thiết kế để nằm trong một quy trình tài liệu được quản lý chặt chẽ. MathForm-8B là một mô hình dense 8 tỷ tham số, được tinh chỉnh từ Qwen3-8B với một nhiệm vụ duy nhất: nhận một bài toán viết bằng tiếng Anh thông thường và xuất ra một phát biểu Lean 4 đúng về mặt hình thức của bài toán đó. Điều khác biệt thực sự quan trọng đối với bất kỳ ai đánh giá một trong hai mô hình không phải là số lượng tham số. Mà là ở chỗ tuyên bố về độ chính xác của MathForm-8B có thể thực thi được. Bạn có thể kiểm tra đầu ra của nó bằng một trình biên dịch. Còn tuyên bố của Kolibri thì không thể được kiểm chứng bằng bất cứ thứ gì ngoài một lần chạy benchmark khác.

Sự bất đối xứng đó chính là toàn bộ bài viết, và nó khái quát hóa vượt xa hai mô hình này. Một bảng đánh giá chuẩn của nhà cung cấp là một lời tuyên bố. Một trợ lý chứng minh chấp nhận một bản hình thức hóa là một kết quả. Khi toàn bộ không gian đầu ra của một mô hình là thứ mà máy có thể xác minh, lớp tiếp thị biến mất — hoặc trình biên dịch Lean chấp nhận phát biểu đó, hoặc không, và không cách diễn đạt nào trong bài đăng ra mắt có thể thay đổi điều đó.

MathForm-8B thực sự tạo ra gì

Tự động hình thức hóa là một nhiệm vụ hẹp, không hào nhoáng và thực sự khó, và thẻ mô hình lại cụ thể một cách sảng khoái về thiết lập.

• Đầu vào và đầu ra — một phát biểu toán học bằng ngôn ngữ tự nhiên đưa vào, một bản hình thức hóa bằng Lean 4 đưa ra, hoàn chỉnh với phần tiêu đề định lý.

• Mô hình cơ sở — Qwen/Qwen3-8B, đã được tinh chỉnh; Apache 2.0 cùng với phần còn lại trong bản phát hành của OpenBMB.

• Huấn luyện — tinh chỉnh có giám sát, tiếp nối bằng học tăng cường trên tập dữ liệu FormalVerse, với việc biên dịch Lean và phản hồi về tính nhất quán ngữ nghĩa đóng vai trò tín hiệu tăng cường.

• Quy trình dữ liệu — truy xuất tri thức Mathlib, biên dịch và xác minh ngữ nghĩa, tinh chỉnh lặp lại, rồi tái dựng quỹ đạo. Sơ đồ quy trình trên thẻ mô hình là thứ giàu thông tin nhất trong bản phát hành.

• Đánh giá — Tỷ lệ đạt Pass@8 theo hai kiểm tra riêng biệt, Syntax Check và Consistency Check, trên sáu bộ đánh giá, được báo cáo dưới dạng trung bình macro có trọng số bằng nhau trong một hình trên thẻ thay vì dưới dạng một bảng mà chúng ta có thể trích dẫn theo từng hàng.

• Bộ công cụ — một Kimina Lean Server đang chạy để kiểm tra biên dịch, Lean 4.21.0 cho các thí nghiệm, và chuỗi tối đa 16.384 token với nhiệt độ 0,6 và top-p 0,95.

• Phục vụ — vLLM hoặc SGLang với ngữ cảnh 16.384 token, được cung cấp qua giao diện trò chuyện tương thích với OpenAI. Chi tiết cuối cùng đó quan trọng hơn vẻ ngoài của nó, vì điều đó nghĩa là mô hình có thể được đưa vào một pipeline hiện có như một endpoint thông thường.

Lưu ý hai kiểm tra riêng biệt. Syntax Check là việc câu lệnh Lean có phân tích cú pháp và kiểm tra kiểu được hay không. Consistency Check là việc phát biểu hình thức có cùng ý nghĩa với bài toán ngôn ngữ tự nhiên hay không — một thuộc tính khó hơn nhiều, bởi vì một phát biểu Lean hợp lệ về mặt cú pháp nhưng hình thức hóa sai định lý thì còn tệ hơn một lỗi biên dịch. OpenBMB báo cáo cả hai, đó chính xác là cách đúng đắn để làm điều đó và là lý do nhiệm vụ này có một cơ chế xác minh mà suy luận đa dụng không có.

Kolibri làm gì với toán học, và vì sao nó là một loại số khác biệt

Kolibri giỏi toán theo nghĩa điểm chuẩn. Trên bộ khung hậu huấn luyện của chính Aleph Alpha, ở mức nỗ lực suy luận cao, nó đạt 96,9 trên AIME 2025 bằng tiếng Anh và 87,5 bằng tiếng Đức, 96,0 và 90,0 trên AIME 2026, cùng mức trung bình tiếng Anh 96,5 trên toàn bộ bộ bài kiểm tra toán của nó, so với 88,8 bằng tiếng Đức. Để làm bối cảnh trên cùng bảng đó, mức 96,9 của Kolibri trên AIME 2025 tiếng Anh nằm trên Nemotron 3 Super 120B-A12B ở 91,7 và Qwen3.6 35B-A3B ở 84,6, và chỉ dưới Qwen3.8 27B ở 97,9.

Mỗi một con số trong đó đều do nhà cung cấp tự báo cáo, trên một bộ khung kiểm thử của nhà cung cấp, không có bản tái lập độc lập, và không có trang Artificial Analysis nào cho Kolibri để đối chiếu chéo. Đó không phải là lời chỉ trích các con số; đó là một phát biểu về việc chúng là loại đối tượng gì. Điểm AIME là tỷ lệ phần trăm câu trả lời cuối cùng đúng trong một kỳ thi trắc nghiệm. Nó cho bạn biết mô hình có thể đạt tới một số nguyên. Nó không cho bạn biết gì về việc lập luận đã tạo ra con số đó có chặt chẽ hay không, và không có dấu vết nào còn lại để bên thứ ba có thể kiểm tra.

Đặt bên cạnh đầu ra của MathForm-8B, sự khác biệt đó là hết sức rõ rệt. Câu trả lời của Kolibri cho một bài toán AIME là một con số. Đầu ra của MathForm-8B là một phát biểu định lý Lean 4 mà hoặc biên dịch được với Mathlib, hoặc không. Nếu bạn đang xây dựng một hệ thống trong đó một khẳng định toán học phải có thể bảo vệ được — một pipeline xác minh hình thức, một quy trình trợ lý chứng minh, một dấu vết kiểm toán — thì sản phẩm thứ hai đáng giá hơn đáng kể so với sản phẩm thứ nhất, và không có dòng benchmark nào diễn đạt được điều đó.

Generated two-column scoreboard for Kolibri and MathForm-8B. Left column Kolibri: purpose 'general reasoning', output 'free-form text', checkable 'no, benchmark only', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', licence Apache 2.0. Right column MathForm-8B: purpose 'Lean 4 autoformalization', output 'Lean 4 theorem statements', checkable 'yes, a compiler checks it', parameters '8B dense', context 16,384, licence Apache 2.0. The footer reads 'Kolibri figures vendor-reported; MathForm-8B Pass@8 per its model card.'

Nơi cả hai thực sự sẽ gặp nhau

Được đóng khung như một cuộc đối đầu, màn so tài này thật chẳng thú vị: một chuyên gia 8B đánh bại một mô hình tổng quát 78B ở việc hình thức hóa toán học và thua ở mọi thứ khác, bao gồm văn xuôi hành chính tiếng Đức, suy luận tài liệu ngữ cảnh dài và gọi công cụ xuyên suốt một quỹ đạo tác tử hàng trăm bước. Nhưng hai mô hình này không phải là thứ thay thế cho nhau, và câu hỏi hữu ích là một pipeline được xây dựng từ cả hai sẽ trông như thế nào.

Cách kết hợp tự nhiên ở đây là định tuyến. Một mô hình tổng quát với khả năng suy luận mạnh và gọi công cụ sẽ đảm nhận việc nạp dữ liệu, phân giải nhập nhằng và truy xuất; một mô hình chuyên biệt được gọi đến cho hai phần trăm trường hợp cần một sản phẩm đầu ra chính quy. Làm việc đó bằng tay nghĩa là hai nhà cung cấp, hai hợp đồng, hai SDK, hai bộ thông tin xác thực và một lớp điều phối mà ai đó phải bảo trì. Đây chính là trường hợp mà một endpoint duy nhất chứng minh được giá trị của mình: một khoá tương thích OpenAI, một quy tắc định tuyến đưa các yêu cầu mang hình dạng toán học đến endpoint chuyên hình thức hoá và mọi thứ khác đến mô hình tổng quát, cùng cơ chế chuyển đổi dự phòng khi một trong hai chậm. Đó là việc của DSL định tuyến — kết hợp nhiều mô hình vào một lời gọi thay vì cố định lựa chọn ngay từ lúc phát triển — và khi một nhóm mô hình cùng trả lời là hữu ích, model fusion sẽ đảm nhiệm. Cả Kolibri lẫn MathForm-8B đều không có trên OrcaRouter hiện nay; chúng tôi đã dò danh mục cho cả hai dưới mọi cách viết nhà cung cấp và mô hình mà không có cái nào. Lập luận về kết hợp nói về hình dạng của bài toán, chứ không phải về hai endpoint cụ thể này.

Thứ có trên danh mục là nửa tổng quát của mô hình đó với mức giá bạn có thể đo được. Qwen3.8-27B được niêm yết ở mức $0.33 mỗi triệu token đầu vào và $2.40 đầu ra với cửa sổ 262,144 token, còn Qwen3.8-Max ở mức $2.00 và $6.00 với cửa sổ 1M token. Đối với một nhóm đang tìm hiểu liệu có đáng thêm một bước hình thức hóa vào quy trình xử lý tài liệu hay không, thử nghiệm rẻ là định tuyến công việc đa dụng đến đó, đo khối lượng yêu cầu thực sự cần một sản phẩm Lean, rồi chỉ sau đó mới quyết định liệu có đáng cấp một endpoint chuyên dụng 16,384 token hay không. Giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm gì trên mỗi token, nên các con số thay đổi ngay ngày nhà cung cấp thay đổi chúng.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the 256K-token context badge, fine-tuning with self-serve deployment, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 1.88 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-13', the description as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure, with a dedicated vision tower, the pricing tiles $0.33 and $2.40, and the pricing block listing $0.330 per million input tokens and $2.40 per million output tokens.

Giấy phép là dòng duy nhất mà chúng giống hệt nhau

Cả hai đều dùng Apache 2.0, và trong một lĩnh vực mà các giấy phép nghiên cứu riêng biệt cùng những điều khoản bổ sung về sử dụng được chấp nhận là chuyện phổ biến, thì đó thực sự là một điểm tương đồng đáng để gọi tên — nghĩa là không mô hình nào trong hai đòi hỏi phải rà soát pháp lý trước khi có thể được dùng cho mục đích thương mại, chỉnh sửa hoặc phân phối lại.

Các nghĩa vụ ràng buộc lại khác nhau ở những điểm khác. Kolibri mang theo dung lượng trọng số ~78 GB và mức tối thiểu về phần cứng là hai thẻ A100 80 GB, hai thẻ H100 SXM5, một H200, một B200 hoặc một B300, cùng với gói aleph-alpha-inference và plugin vLLM của nhà cung cấp. MathForm-8B ở định dạng bfloat16 có khoảng 16 GB trọng số và phục vụ trên một accelerator hiện đại duy nhất với ngữ cảnh 16.384 token; các phụ thuộc của nó là một bộ công cụ Lean và, đối với pipeline đánh giá, một Kimina Lean Server đang chạy. Một trong hai cách triển khai đó vừa vặn trong một máy trạm. Cái còn lại thì không.

Các con số về ngữ cảnh lại cho thấy điều ngược lại, và với khoảng cách rất lớn. Cửa sổ gốc của Kolibri là 262,144 token, đã được kiểm chứng tới 1,048,576, và chính điều đó khiến nó trở thành một mô hình tài liệu: một hồ sơ quản lý đầy đủ của Đức hay một sách hướng dẫn bảo trì hàng không vũ trụ vừa vặn trong một lần gọi. MathForm-8B bị giới hạn ở 16,384 token theo thiết kế, bởi vì một yêu cầu hình thức hóa chỉ là một phát biểu bài toán đơn lẻ và không có lý do gì để nó dài hơn. Cả hai con số đều không phải là khiếm khuyết. Chúng chỉ đơn thuần mô tả những công việc khác nhau.

Screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the apache-2.0 licence badge, the pipeline figure caption describing Mathlib knowledge retrieval, compilation and semantic verification, iterative refinement, trajectory reconstruction and training, and the start of the Results table with the MATHFORM-8B-SFT and MATHFORM-8B rows above the specialist autoformalizers including Goedel-Formalizer-V2-8B, StepFun-Formalizer-7B and Kimina-Autoformalizer-7B.

Chọn, và câu hỏi xác minh ở bên dưới

• Hãy chọn MathForm-8B nếu đầu ra của bạn phải có thể kiểm chứng được. Nếu một hệ thống hạ nguồn tiêu thụ Lean 4, hoặc nếu toàn bộ mục đích là để một trợ lý chứng minh phê duyệt kết quả, thì không có mô hình tổng quát nào thay thế được nó, và các con số Pass@8 trong Syntax Check và Consistency Check mới là thứ cần tra vấn, chứ không phải bất kỳ dòng AIME nào.

• Hãy chọn Kolibri nếu bạn cần một mô hình duy nhất đọc được tài liệu tiếng Đức và tiếng Anh ở ngữ cảnh dài, suy luận xuyên suốt các tài liệu đó, gọi công cụ, không đưa ra câu trả lời khi ngữ cảnh không hỗ trợ, và có thể được triển khai bên trong vành đai của riêng bạn theo một giấy phép mà bạn có thể nêu trong một dòng. Toán học là một năng lực mà nó có, không phải một sản phẩm mà nó là.

• Hãy cân nhắc cả hai nếu bạn đang xây dựng một quy trình hình thức hóa. Không phải như những lựa chọn thay thế, mà là hai điểm cuối phía sau một quy tắc định tuyến, với chuyên gia được gọi đến cho một lát cắt hẹp các yêu cầu cần đến nó.

Và nếu bạn đang đánh giá một trong hai chỉ dựa trên sức mạnh của một con số benchmark, hãy áp dụng một phép thử trước tiên: hãy hỏi con số đó để lại hiện vật gì. Với MathForm-8B, có một tệp Lean và một trình biên dịch hoặc chấp nhận nó hoặc không, và bạn có thể tự chạy cả hai vào chiều nay. Với Kolibri, có một tỷ lệ phần trăm trong bảng công bố khi ra mắt, do nhà cung cấp báo cáo, chưa được tái lập, không có trang chỉ mục độc lập để đối chiếu — và cách duy nhất để bác bỏ nó là tải 78 GB trọng số, thuê phần cứng, và chạy lại bộ kiểm thử. Sự bất đối xứng đó đáng giá hơn cả điểm số khi bạn đang quyết định đưa gì vào môi trường vận hành thực tế.