Một thẻ tiêu đề hero ghi 'Intern-Decision-0.8B vs MathForm 8B' với phụ đề 'Một trong hai có thể tự kiểm tra công việc của mình', mang các huy hiệu 'đầu ra Lean 4 đã được trình biên dịch xác minh' và 'độ tin cậy tự báo cáo', với OrcaRouter được ghép ở góc.
Guides & Insights

Intern-Decision-0.8B so với MathForm 8B: Một trong hai có thể tự kiểm tra công việc của chính mình

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu hỏi hữu ích nhất bạn có thể đặt về bất kỳ mô hình chuyên biệt nhỏ nào là ai kiểm tra nó. Intern-Decision-0.8B và MathForm 8B đều tồn tại vì một mô hình tổng quát đã được tinh chỉnh thành một mô hình hẹp, cả hai đều là dẫn xuất Apache-2.0 từ trọng số Qwen, và cả hai đều được đưa lên Hugging Face mà không có chiến dịch tiếp thị — nhưng chúng nằm ở hai phía đối lập của một ranh giới quyết định cách bạn sẽ triển khai chúng. MathForm 8B là mô hình tự động hình thức hóa 8B của OpenBMB, phát hành ngày 14 tháng 8 năm 2026, dịch toán học ngôn ngữ tự nhiên sang Lean 4 và giao kết quả cho một trình biên dịch, và trình biên dịch này hoặc chấp nhận nó hoặc không. Intern-Decision-0.8B là đầu quyết định 852.985.920 tham số của InternLM, được tải lên ngày 26 tháng 9 năm 2026, trả về một phân phối xác suất đã hiệu chỉnh trên các tùy chọn bạn đã cung cấp trước — và không có gì trên đời xác minh độc lập liệu nhãn nó trả về có đúng hay không. Một trong hai mô hình này tạo ra đầu ra kèm một chứng minh. Mô hình còn lại tạo ra đầu ra kèm một điểm tin cậy, và sự khác biệt về những gì bạn có thể làm với hai thứ đó chính là toàn bộ bài viết.

Cách diễn giải đó cũng lý giải tại sao khoảng cách kích thước — 8B so với 0,8B, gấp mười lần — lại là con số ít thú vị nhất trong phép so sánh. Không mô hình nào đang cố gắng làm tốt việc mà mô hình kia làm, và đánh giá của mô hình này cũng không cho bạn biết gì về mô hình kia. Điểm chung của chúng là một kiểu phát hành và cùng dòng dõi Qwen, và cả hai điều đó đều ít quan trọng hơn câu hỏi xác minh.

Thực tế mỗi thứ là gì

MathForm 8B là sản phẩm đã phát hành từ một công thức hai giai đoạn được mô tả trong bài báo MathForm: Mở rộng quy mô tự động hình thức hóa toán học bằng truy xuất tri thức và tinh chỉnh dẫn dắt bởi xác minh (arXiv 2608.14221). Một bộ lập kế hoạch truy xuất sẽ lấy các định nghĩa liên quan và các hình thức hóa hiện có từ Mathlib trước khi trình tạo chạy; các phát biểu được tạo sau đó được chỉnh sửa bằng chẩn đoán của trình biên dịch và phản hồi nhất quán ngữ nghĩa; kho ngữ liệu thu được, FormalVerse, chứa khoảng 367.000 ví dụ Lean 4 đã được xác minh; và MathForm 8B được huấn luyện trên đó thông qua tinh chỉnh có giám sát, tiếp theo là học tăng cường sử dụng tín hiệu biên dịch Lean và nhất quán ngữ nghĩa làm phần thưởng. Đây là mô hình chỉ văn bản dựa trên Qwen3-8B, được phục vụ qua Transformers, vLLM hoặc SGLang với API tương thích OpenAI, với độ dài ngữ cảnh khuyến nghị 16.384 token và ngân sách sinh tối đa 16.384 token. Quy trình đánh giá, tệp benchmark và script Pass@k của nó đều nằm trong kho GitHub OpenBMB, và bộ dữ liệu huấn luyện là công khai.

Intern-Decision-0.8B là sản phẩm được phát hành từ một công thức mà chưa ai mô tả. Thẻ mô hình chỉ nói rằng đây là "một mô hình quyết định có cấu trúc đa phương thức được tinh chỉnh từ Qwen3.5-0.8B" và dừng ở đó — không có mô tả dữ liệu, không có quy trình huấn luyện, không có bài báo, không có kho mã nguồn. Điều được ghi chép đầy đủ lại là hợp đồng suy luận. Engine đi kèm ánh xạ các lựa chọn của mỗi câu hỏi thành các ký hiệu đơn token, kết xuất một bộ khung với một <decision> placeholder cho mỗi trường, chạy một lượt lan truyền xuôi nhân quả, đọc logits tại vị trí trước mỗi placeholder, áp dụng softmax chỉ trên các ký hiệu được phép của trường đó, áp dụng một hiệu chuẩn đã được khớp, rồi ánh xạ các ký hiệu trở lại giá trị lựa chọn của bạn. Không hề có lệnh gọi generate() và không hề có lấy mẫu ở bất kỳ đâu trên đường đi này. Nó nhận văn bản cùng tối đa tám hình ảnh, xử lý từ một đến mười sáu câu hỏi với tối đa 62 lựa chọn mỗi câu, và từ chối các đầu vào vượt quá 8.192 token thay vì cắt bớt chúng. Nhiệt độ hiệu chuẩn mặc định là 2.747760550703, được khớp cho từng checkpoint bằng cách tối thiểu hoá NLL trên 1.728 trường hợp.

Đọc hai đoạn văn đó cạnh nhau và sự bất đối xứng thật rõ rệt. MathForm 8B đi kèm với một bài báo, một bộ dữ liệu, một quy trình đánh giá và một kho mã nguồn. Intern-Decision-0.8B chỉ đi kèm với một mô tả API và một bảng benchmark.

Sự bất đối xứng trong xác minh, đó mới là câu chuyện thực sự

Đầu ra của MathForm 8B có thể được kiểm chứng bởi một thứ khác ngoài con người. Nó phát ra Lean 4, và Lean 4 hoặc là biên dịch được, hoặc là không. Các con số của OpenBMB được báo cáo theo hai chế độ chính vì lý do này: Pass@8 đạt 88,06% theo Syntax Check, nghĩa là đầu ra biên dịch được, và 72,37% theo Consistency Check, nghĩa là nó biên dịch được và một kiểm tra nhất quán ngữ nghĩa đồng ý rằng phát biểu hình thức mang đúng ý nghĩa mà phát biểu phi hình thức đã nêu. Cả hai con số đều là mức trung bình trên sáu bộ đánh giá, và bài báo cũng báo cáo tỉ lệ đạt CC là 63% trên FATE-H và 37% trên các tập con FATE-X khó hơn, kèm theo tuyên bố rằng con số này vượt qua các autoformalizer chuyên dụng 32B. Đây là những con số do nhà cung cấp báo cáo — OpenBMB tự chạy chúng — nhưng đặc tính quan trọng là mang tính cấu trúc, chứ không phải thống kê: một hệ thống hạ nguồn tiêu thụ đầu ra của MathForm 8B có thể loại bỏ một bản hình thức hóa tồi mà không cần nhờ một mô hình phán xét nó. Trình biên dịch chính là nhà tiên tri.

Intern-Decision-0.8B có một hợp đồng kiểu và không có oracle. Hình dạng đầu ra được đảm bảo — một trường được khai báo choice trả về một phân phối trên các giá trị tùy chọn mà bạn đã liệt kê, một score trả về một giá trị kỳ vọng có trọng số theo xác suất trên rubric của bạn, một noul trả về một xác suất "có". Không có gì bên ngoài mô hình có thể cho bạn biết liệu argmax có đúng hay không. Giá trị độ tin cậy là ước lượng của chính mô hình về tính đúng đắn của chính nó, và công việc hiệu chuẩn của card là một nỗ lực trung thực nhằm làm cho ước lượng đó có ý nghĩa — một nhiệt độ được khớp để giữ nguyên argmax trong khi làm sắc nét hoặc làm mềm các xác suất, được kiểm chứng trên các trường hợp held-out — nhưng một câu trả lời sai được hiệu chuẩn tốt vẫn là một câu trả lời sai. Nếu pipeline của bạn cần biết một nhãn có đúng hay không, bạn cần dữ liệu có nhãn, và bạn cần tự đo lường điều đó.

Đó không phải là khiếm khuyết riêng của Intern-Decision-0.8B. Đó là tình trạng chung của mọi bộ phân loại, và là vấn đề chưa được giải quyết trong toàn bộ nhóm mô hình ra quyết định, bao gồm Jev của TypeSafe và Laya của Convai. Cần nói rõ điều này vì một bảng benchmark có cột điểm Brier có thể tạo cảm giác rằng hiệu chuẩn chính là xác minh. Không phải vậy. Hiệu chuẩn cho bạn biết rằng khi mô hình này nói 80%, thì trên phân phối được đánh giá, nó đúng khoảng 80% số lần — điều này thực sự hữu ích để đặt ngưỡng và tính giá trị kỳ vọng, và không phải là bảo đảm đúng đắn cho từng mục.

Bảng điểm, trên những hàng mà cả hai mô hình đều có

• Tham số — Intern-Decision-0.8B: 852.985.920 trải rộng trên một phân đoạn ngôn ngữ 1,50 GB, một phân đoạn thị giác 176 MB và một projector 25 MB. MathForm 8B: 8B dày đặc, dựa trên Qwen3-8B.

• Mô hình cơ sở — Intern-Decision-0.8B: Qwen3.5-0.8B, ra mắt tháng 2 năm 2026. MathForm 8B: Qwen3-8B.

• Nhiệm vụ — Intern-Decision-0.8B: các quyết định có kiểu dữ liệu trên một schema do bạn viết — lựa chọn, điểm số, nhị phân. MathForm 8B: toán học ngôn ngữ tự nhiên sang hình thức hóa Lean 4.

• Đầu ra — Intern-Decision-0.8B: phân phối đã hiệu chỉnh cùng argmax theo từng trường, không sinh văn bản. MathForm 8B: sinh mã nguồn Lean 4, thường dài.

• Xác minh — Intern-Decision-0.8B: không có bên ngoài nào; độ tin cậy do hệ thống tự báo cáo. MathForm 8B: trình biên dịch Lean 4, cùng với kiểm tra tính nhất quán ngữ nghĩa.

• Bằng chứng đã công bố — Intern-Decision-0.8B: một bảng benchmark của nhà cung cấp trên bảy bộ benchmark, chưa được tái lập, không có bài báo. MathForm 8B: một bài báo, một bộ dữ liệu công khai gồm khoảng 367.000 mẫu, một quy trình đánh giá và kho lưu trữ, do nhà cung cấp vận hành.

• Giấy phép — Cả hai đều dùng Apache 2.0, và Intern-Decision-0.8B còn đi kèm tệp giấy phép Qwen được giữ nguyên cho các trọng số thượng nguồn của nó.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Chi phí và độ trễ không thể so sánh với nhau, và đó không phải là một cách né tránh

InternLM đo Intern-Decision-0.8B ở mức trung bình 33,98 ms và p95 37,50 ms mỗi truy vấn trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, với mô hình anh em 2B của nó đạt trung bình 33,28 ms. Thẻ mô hình của chính MathForm 8B khuyến nghị tối đa 16.384 token mới cho mỗi lần hình thức hóa ở temperature 0.6 và top_p 0.95. Hai phép đo đó không phải cùng một đại lượng. Một cái là một lượt truyền xuôi duy nhất qua một prompt; cái kia là sinh tự hồi quy có thể chạy hàng nghìn token. Nhân ngân sách hình thức hóa với một quyết định 34 ms chẳng cho bạn biết gì về hiệu quả tương đối, vì các mô hình không làm cùng một khối lượng công việc — một cái đọc và chấm điểm, cái kia đọc và viết một script chứng minh. Nếu thông lượng là ràng buộc của bạn, những dữ kiện liên quan đơn giản hơn một tỷ lệ. MathForm 8B hình thức hóa một câu lệnh mỗi lần sinh, và ở 16K token mỗi đầu ra trên một mô hình dense 8B, đó là khối lượng công việc làm bão hòa GPU và là ứng viên cho việc gom lô qua vLLM hoặc SGLang, cả hai đều được OpenBMB ghi trong tài liệu. Intern-Decision-0.8B trả lời mười sáu câu hỏi bao quát toàn bộ một bản ghi trong một lượt, nên đơn vị công việc là một bản ghi chứ không phải một trường, và ngân sách bản ghi là giới hạn đầu vào 8.192 token — con số này đến nhanh hơn mức một người đọc có thể mong đợi khi bạn đang nhồi vào một trạng thái dài, một schema phong phú và tối đa tám hình ảnh.

Nơi mỗi thứ là công cụ phù hợp

MathForm 8B thuộc về một quy trình mà điểm nghẽn là việc con người đánh giá toán học. Tự động hình thức hóa tồn tại vì việc viết Lean chậm hơn việc đọc nó, và vì một phát biểu có thể kiểm tra bằng máy là thứ mà một trợ lý chứng minh sau đó có thể tấn công. Thuộc tính khiến nó đáng tin cậy — đầu ra được trình biên dịch xác minh — cũng là thuộc tính khiến nó hẹp: nó hình thức hóa, chứ không chứng minh, và thẻ mô hình nói rõ rằng các kiểm tra biên dịch yêu cầu một Kimina Lean Server đang chạy và rằng các thí nghiệm đã dùng Lean 4.21.0. Bất kỳ ai áp dụng nó đều đang áp dụng ngăn xếp đó. Như với bất kỳ mô hình trọng số mở mới được vài ngày hoặc vài tuần nào, việc trỏ một đường kiểm thử vào nó và chuyển dự phòng sang một mô hình đã được kiểm chứng khi nó bị treo là cách ít rủi ro để đánh giá nó, đó chính là việc mà một gateway với tính năng tự động chuyển đổi dự phòng xuyên suốt một chuỗi dự phòng dùng để làm — các lần thử lại diễn ra trước khi phản hồi bắt đầu, để một quá trình hình thức hóa bị treo không bao giờ đến được bên gọi của bạn.

Intern-Decision-0.8B thuộc về bất cứ nơi nào tồn tại một tập câu trả lời đóng và chi phí sinh văn bản để khôi phục câu trả lời là hoàn toàn lãng phí. Phân loại, định tuyến, chấm điểm theo rubric, phân xử một bản ghi dựa trên một chính sách bằng văn bản — đó là những trường hợp mà một mô hình sinh được dùng như một cách tốn kém để chọn từ một danh sách. Ưu điểm của nó là nó có tính xác định, rằng nó trả về một xác suất dùng được thay vì một chuỗi mà bạn phải phân tích cú pháp, và rằng ở mức 1.73 GB trên đĩa, nó chạy thoải mái dưới mức tiêu tốn bộ nhớ của một trình duyệt trên máy tính xách tay. Nhược điểm của nó là tài liệu chỉ dừng ở bề mặt API, rằng chưa có ai ngoài InternLM công bố một kết quả về nó, và rằng một benchmark duy nhất gợi ý một vấn đề an toàn — điểm WildJailBreak 64.48 so với 96 của Jev — vẫn chưa được giải thích. Đừng đặt nó trước đầu vào đối kháng mà không tự chạy bài kiểm tra đó.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Cả hai mô hình đều có chung một nguồn gốc đáng lưu ý vì nó thay đổi những gì mà "mở" mang lại cho bạn. Mỗi mô hình là một bản tinh chỉnh từ một checkpoint Qwen, và mỗi bản đều giữ đúng giấy phép thượng nguồn: MathForm 8B theo Apache 2.0 với nguồn gốc Qwen3-8B được ghi trên card, Intern-Decision-0.8B theo Apache 2.0 với một tệp LICENSE-QWEN riêng trong kho lưu trữ. Cả hai đều không có ngưỡng doanh thu hay hạn chế lĩnh vực sử dụng — khác với LFM Open License v1.0 của Liquid AI, vốn đặt điều kiện cho quyền thương mại là thực thể của bạn phải nằm dưới mức doanh thu hằng năm 10 triệu đô la. Nếu bạn đang xây dựng cho mục đích thương mại, đó là một điểm khác biệt giúp tách hai bản phát hành này khỏi một phần của hệ sinh thái mô hình nhỏ, và nó áp dụng cho cả hai như nhau.

Nếu bạn muốn có lớp quyết định mà không cần checkpoint chưa được ghi lại thành tài liệu

Khoảng cách giữa “một decision head là hình dạng phù hợp cho bài toán này” và “decision head cụ thể này là thứ bạn có thể bảo vệ trước người phản biện” chính là điều mà một phương án thay thế dạng hosted khép lại. Jev 1.13 của TypeSafe là mô hình mà InternLM đã lấy làm chuẩn đối sánh cho dòng mô hình của mình trên Jevbench, trên Typed Decision và trên ToolACE, và hiện nó có thể được gọi ngay hôm nay qua một endpoint duy nhất tương thích OpenAI với mức $0.042 mỗi token đầu vào, còn token đầu ra được tính phí bằng không — mức giá niêm yết của nhà cung cấp, được chuyển nguyên vẹn không cộng thêm phụ phí thay vì bị đội giá lên trong quá trình. Với một độc giả muốn đo xem liệu một decision head có giúp ích được chút nào không trước khi cam kết với một checkpoint 0.8B đang thiếu kho lưu trữ, thì đó là thí nghiệm đầu tiên rẻ tiền, và chính các đánh giá bên thứ ba dành cho Jev mang lại cho nó một thành tích được ghi nhận mà Intern-Decision-0.8B hiện chưa có.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Câu trả lời ngắn gọn

Hai mô hình này không phải là phương án thay thế cho nhau. MathForm 8B là một mô hình chuyên biệt mà chương trình có thể kiểm chứng đầu ra, hướng đến một tác vụ nơi khâu kiểm chứng mới là phần khó, và đi kèm bài báo, bộ dữ liệu và khung đánh giá để chứng minh tuyên bố đó. Intern-Decision-0.8B là một mô hình chuyên biệt mà chỉ bạn mới có thể kiểm chứng đầu ra, hướng đến những tác vụ mà đáp án đã được ghi sẵn và phần khó là đạt tới chúng một cách nhanh chóng và rẻ, và đi kèm một mô-đun suy luận cùng một bảng. Nếu bạn cần một phép hình thức hóa, chỉ có một trong hai thứ này để cân nhắc. Nếu bạn cần một nhãn và sẵn sàng xây dựng ground truth để đối chiếu, thì 0.8B là bản tải xuống thú vị hơn — nhanh, tất định, Apache 2.0, và đủ nhỏ để chi phí tìm hiểu xem nó có tốt hay không chỉ là một buổi chiều thay vì một khoản mục ngân sách.