
Kolibri vs MathForm-8B: Một trong những tuyên bố về độ chính xác này có thể được kiểm tra bằng trình biên dịch
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 218 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Kolibri và MathForm-8B dùng chung một giấy phép và gần như không có gì khác giống nhau. Cả hai đều theo Apache 2.0, đều là mô hình trọng số mở, đều được phát hành trong ba tháng qua — Kolibri của Aleph Alpha vào ngày 3 tháng 10 năm 2026, MathForm-8B của OpenBMB vào ngày 14 tháng 8 năm 2026 — và cả hai đều dành một phần lớn thẻ mô hình của mình cho toán học. Điểm giống nhau chỉ dừng ở đó. Kolibri là một mô hình hỗn hợp chuyên gia tiếng Đức và tiếng Anh 78,1 tỷ tham số, kích hoạt 3,46 tỷ tham số mỗi token và được thiết kế để nằm trong một quy trình tài liệu được quản lý chặt chẽ. MathForm-8B là một mô hình dense 8 tỷ tham số, được tinh chỉnh từ Qwen3-8B với một nhiệm vụ duy nhất: nhận một bài toán viết bằng tiếng Anh thông thường và xuất ra một phát biểu Lean 4 đúng về mặt hình thức của bài toán đó. Điều khác biệt thực sự quan trọng đối với bất kỳ ai đánh giá một trong hai mô hình không phải là số lượng tham số. Mà là ở chỗ tuyên bố về độ chính xác của MathForm-8B có thể thực thi được. Bạn có thể kiểm tra đầu ra của nó bằng một trình biên dịch. Còn tuyên bố của Kolibri thì không thể được kiểm chứng bằng bất cứ thứ gì ngoài một lần chạy benchmark khác.
Sự bất đối xứng đó chính là toàn bộ bài viết, và nó khái quát hóa vượt xa hai mô hình này. Một bảng đánh giá chuẩn của nhà cung cấp là một lời tuyên bố. Một trợ lý chứng minh chấp nhận một bản hình thức hóa là một kết quả. Khi toàn bộ không gian đầu ra của một mô hình là thứ mà máy có thể xác minh, lớp tiếp thị biến mất — hoặc trình biên dịch Lean chấp nhận phát biểu đó, hoặc không, và không cách diễn đạt nào trong bài đăng ra mắt có thể thay đổi điều đó.
MathForm-8B thực sự tạo ra gì
Tự động hình thức hóa là một nhiệm vụ hẹp, không hào nhoáng và thực sự khó, và thẻ mô hình lại cụ thể một cách sảng khoái về thiết lập.
• Đầu vào và đầu ra — một phát biểu toán học bằng ngôn ngữ tự nhiên đưa vào, một bản hình thức hóa bằng Lean 4 đưa ra, hoàn chỉnh với phần tiêu đề định lý.
• Mô hình cơ sở — Qwen/Qwen3-8B, đã được tinh chỉnh; Apache 2.0 cùng với phần còn lại trong bản phát hành của OpenBMB.
• Huấn luyện — tinh chỉnh có giám sát, tiếp nối bằng học tăng cường trên tập dữ liệu FormalVerse, với việc biên dịch Lean và phản hồi về tính nhất quán ngữ nghĩa đóng vai trò tín hiệu tăng cường.
• Quy trình dữ liệu — truy xuất tri thức Mathlib, biên dịch và xác minh ngữ nghĩa, tinh chỉnh lặp lại, rồi tái dựng quỹ đạo. Sơ đồ quy trình trên thẻ mô hình là thứ giàu thông tin nhất trong bản phát hành.
• Đánh giá — Tỷ lệ đạt Pass@8 theo hai kiểm tra riêng biệt, Syntax Check và Consistency Check, trên sáu bộ đánh giá, được báo cáo dưới dạng trung bình macro có trọng số bằng nhau trong một hình trên thẻ thay vì dưới dạng một bảng mà chúng ta có thể trích dẫn theo từng hàng.
• Bộ công cụ — một Kimina Lean Server đang chạy để kiểm tra biên dịch, Lean 4.21.0 cho các thí nghiệm, và chuỗi tối đa 16.384 token với nhiệt độ 0,6 và top-p 0,95.
• Phục vụ — vLLM hoặc SGLang với ngữ cảnh 16.384 token, được cung cấp qua giao diện trò chuyện tương thích với OpenAI. Chi tiết cuối cùng đó quan trọng hơn vẻ ngoài của nó, vì điều đó nghĩa là mô hình có thể được đưa vào một pipeline hiện có như một endpoint thông thường.
Lưu ý hai kiểm tra riêng biệt. Syntax Check là việc câu lệnh Lean có phân tích cú pháp và kiểm tra kiểu được hay không. Consistency Check là việc phát biểu hình thức có cùng ý nghĩa với bài toán ngôn ngữ tự nhiên hay không — một thuộc tính khó hơn nhiều, bởi vì một phát biểu Lean hợp lệ về mặt cú pháp nhưng hình thức hóa sai định lý thì còn tệ hơn một lỗi biên dịch. OpenBMB báo cáo cả hai, đó chính xác là cách đúng đắn để làm điều đó và là lý do nhiệm vụ này có một cơ chế xác minh mà suy luận đa dụng không có.
Kolibri làm gì với toán học, và vì sao nó là một loại số khác biệt
Kolibri giỏi toán theo nghĩa điểm chuẩn. Trên bộ khung hậu huấn luyện của chính Aleph Alpha, ở mức nỗ lực suy luận cao, nó đạt 96,9 trên AIME 2025 bằng tiếng Anh và 87,5 bằng tiếng Đức, 96,0 và 90,0 trên AIME 2026, cùng mức trung bình tiếng Anh 96,5 trên toàn bộ bộ bài kiểm tra toán của nó, so với 88,8 bằng tiếng Đức. Để làm bối cảnh trên cùng bảng đó, mức 96,9 của Kolibri trên AIME 2025 tiếng Anh nằm trên Nemotron 3 Super 120B-A12B ở 91,7 và Qwen3.6 35B-A3B ở 84,6, và chỉ dưới Qwen3.8 27B ở 97,9.
Mỗi một con số trong đó đều do nhà cung cấp tự báo cáo, trên một bộ khung kiểm thử của nhà cung cấp, không có bản tái lập độc lập, và không có trang Artificial Analysis nào cho Kolibri để đối chiếu chéo. Đó không phải là lời chỉ trích các con số; đó là một phát biểu về việc chúng là loại đối tượng gì. Điểm AIME là tỷ lệ phần trăm câu trả lời cuối cùng đúng trong một kỳ thi trắc nghiệm. Nó cho bạn biết mô hình có thể đạt tới một số nguyên. Nó không cho bạn biết gì về việc lập luận đã tạo ra con số đó có chặt chẽ hay không, và không có dấu vết nào còn lại để bên thứ ba có thể kiểm tra.
Đặt bên cạnh đầu ra của MathForm-8B, sự khác biệt đó là hết sức rõ rệt. Câu trả lời của Kolibri cho một bài toán AIME là một con số. Đầu ra của MathForm-8B là một phát biểu định lý Lean 4 mà hoặc biên dịch được với Mathlib, hoặc không. Nếu bạn đang xây dựng một hệ thống trong đó một khẳng định toán học phải có thể bảo vệ được — một pipeline xác minh hình thức, một quy trình trợ lý chứng minh, một dấu vết kiểm toán — thì sản phẩm thứ hai đáng giá hơn đáng kể so với sản phẩm thứ nhất, và không có dòng benchmark nào diễn đạt được điều đó.

Nơi cả hai thực sự sẽ gặp nhau
Được đóng khung như một cuộc đối đầu, màn so tài này thật chẳng thú vị: một chuyên gia 8B đánh bại một mô hình tổng quát 78B ở việc hình thức hóa toán học và thua ở mọi thứ khác, bao gồm văn xuôi hành chính tiếng Đức, suy luận tài liệu ngữ cảnh dài và gọi công cụ xuyên suốt một quỹ đạo tác tử hàng trăm bước. Nhưng hai mô hình này không phải là thứ thay thế cho nhau, và câu hỏi hữu ích là một pipeline được xây dựng từ cả hai sẽ trông như thế nào.
Cách kết hợp tự nhiên ở đây là định tuyến. Một mô hình tổng quát với khả năng suy luận mạnh và gọi công cụ sẽ đảm nhận việc nạp dữ liệu, phân giải nhập nhằng và truy xuất; một mô hình chuyên biệt được gọi đến cho hai phần trăm trường hợp cần một sản phẩm đầu ra chính quy. Làm việc đó bằng tay nghĩa là hai nhà cung cấp, hai hợp đồng, hai SDK, hai bộ thông tin xác thực và một lớp điều phối mà ai đó phải bảo trì. Đây chính là trường hợp mà một endpoint duy nhất chứng minh được giá trị của mình: một khoá tương thích OpenAI, một quy tắc định tuyến đưa các yêu cầu mang hình dạng toán học đến endpoint chuyên hình thức hoá và mọi thứ khác đến mô hình tổng quát, cùng cơ chế chuyển đổi dự phòng khi một trong hai chậm. Đó là việc của DSL định tuyến — kết hợp nhiều mô hình vào một lời gọi thay vì cố định lựa chọn ngay từ lúc phát triển — và khi một nhóm mô hình cùng trả lời là hữu ích, model fusion sẽ đảm nhiệm. Cả Kolibri lẫn MathForm-8B đều không có trên OrcaRouter hiện nay; chúng tôi đã dò danh mục cho cả hai dưới mọi cách viết nhà cung cấp và mô hình mà không có cái nào. Lập luận về kết hợp nói về hình dạng của bài toán, chứ không phải về hai endpoint cụ thể này.
Thứ có trên danh mục là nửa tổng quát của mô hình đó với mức giá bạn có thể đo được. Qwen3.8-27B được niêm yết ở mức $0.33 mỗi triệu token đầu vào và $2.40 đầu ra với cửa sổ 262,144 token, còn Qwen3.8-Max ở mức $2.00 và $6.00 với cửa sổ 1M token. Đối với một nhóm đang tìm hiểu liệu có đáng thêm một bước hình thức hóa vào quy trình xử lý tài liệu hay không, thử nghiệm rẻ là định tuyến công việc đa dụng đến đó, đo khối lượng yêu cầu thực sự cần một sản phẩm Lean, rồi chỉ sau đó mới quyết định liệu có đáng cấp một endpoint chuyên dụng 16,384 token hay không. Giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm gì trên mỗi token, nên các con số thay đổi ngay ngày nhà cung cấp thay đổi chúng.

Giấy phép là dòng duy nhất mà chúng giống hệt nhau
Cả hai đều dùng Apache 2.0, và trong một lĩnh vực mà các giấy phép nghiên cứu riêng biệt cùng những điều khoản bổ sung về sử dụng được chấp nhận là chuyện phổ biến, thì đó thực sự là một điểm tương đồng đáng để gọi tên — nghĩa là không mô hình nào trong hai đòi hỏi phải rà soát pháp lý trước khi có thể được dùng cho mục đích thương mại, chỉnh sửa hoặc phân phối lại.
Các nghĩa vụ ràng buộc lại khác nhau ở những điểm khác. Kolibri mang theo dung lượng trọng số ~78 GB và mức tối thiểu về phần cứng là hai thẻ A100 80 GB, hai thẻ H100 SXM5, một H200, một B200 hoặc một B300, cùng với gói aleph-alpha-inference và plugin vLLM của nhà cung cấp. MathForm-8B ở định dạng bfloat16 có khoảng 16 GB trọng số và phục vụ trên một accelerator hiện đại duy nhất với ngữ cảnh 16.384 token; các phụ thuộc của nó là một bộ công cụ Lean và, đối với pipeline đánh giá, một Kimina Lean Server đang chạy. Một trong hai cách triển khai đó vừa vặn trong một máy trạm. Cái còn lại thì không.
Các con số về ngữ cảnh lại cho thấy điều ngược lại, và với khoảng cách rất lớn. Cửa sổ gốc của Kolibri là 262,144 token, đã được kiểm chứng tới 1,048,576, và chính điều đó khiến nó trở thành một mô hình tài liệu: một hồ sơ quản lý đầy đủ của Đức hay một sách hướng dẫn bảo trì hàng không vũ trụ vừa vặn trong một lần gọi. MathForm-8B bị giới hạn ở 16,384 token theo thiết kế, bởi vì một yêu cầu hình thức hóa chỉ là một phát biểu bài toán đơn lẻ và không có lý do gì để nó dài hơn. Cả hai con số đều không phải là khiếm khuyết. Chúng chỉ đơn thuần mô tả những công việc khác nhau.

Chọn, và câu hỏi xác minh ở bên dưới
• Hãy chọn MathForm-8B nếu đầu ra của bạn phải có thể kiểm chứng được. Nếu một hệ thống hạ nguồn tiêu thụ Lean 4, hoặc nếu toàn bộ mục đích là để một trợ lý chứng minh phê duyệt kết quả, thì không có mô hình tổng quát nào thay thế được nó, và các con số Pass@8 trong Syntax Check và Consistency Check mới là thứ cần tra vấn, chứ không phải bất kỳ dòng AIME nào.
• Hãy chọn Kolibri nếu bạn cần một mô hình duy nhất đọc được tài liệu tiếng Đức và tiếng Anh ở ngữ cảnh dài, suy luận xuyên suốt các tài liệu đó, gọi công cụ, không đưa ra câu trả lời khi ngữ cảnh không hỗ trợ, và có thể được triển khai bên trong vành đai của riêng bạn theo một giấy phép mà bạn có thể nêu trong một dòng. Toán học là một năng lực mà nó có, không phải một sản phẩm mà nó là.
• Hãy cân nhắc cả hai nếu bạn đang xây dựng một quy trình hình thức hóa. Không phải như những lựa chọn thay thế, mà là hai điểm cuối phía sau một quy tắc định tuyến, với chuyên gia được gọi đến cho một lát cắt hẹp các yêu cầu cần đến nó.
Và nếu bạn đang đánh giá một trong hai chỉ dựa trên sức mạnh của một con số benchmark, hãy áp dụng một phép thử trước tiên: hãy hỏi con số đó để lại hiện vật gì. Với MathForm-8B, có một tệp Lean và một trình biên dịch hoặc chấp nhận nó hoặc không, và bạn có thể tự chạy cả hai vào chiều nay. Với Kolibri, có một tỷ lệ phần trăm trong bảng công bố khi ra mắt, do nhà cung cấp báo cáo, chưa được tái lập, không có trang chỉ mục độc lập để đối chiếu — và cách duy nhất để bác bỏ nó là tải 78 GB trọng số, thuê phần cứng, và chạy lại bộ kiểm thử. Sự bất đối xứng đó đáng giá hơn cả điểm số khi bạn đang quyết định đưa gì vào môi trường vận hành thực tế.
