Một thẻ tiêu đề được tạo có nội dung 'Intern-Decision-2B vs Laya', với phụ đề '2.21B đối đầu 421M, không bên nào viết một token nào', cùng các huy hiệu 'một bên phát hành gói pip' và 'một bên phát hành bộ công cụ tái tạo', với logo OrcaRouter được ghép vào góc.
Guides & Insights

Intern-Decision-2B vs Laya: 2,2 tỷ tham số so với 421 triệu, cả hai đều từ chối viết câu trả lời

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

internlm/Intern-Decision-2B và convaiinnovations/laya là hai mô hình giống nhau nhất trong ngách nhỏ các mô hình ra quyết định, và sự thật hữu ích nhất về phép so sánh này là cả hai đạt tới đó bằng những con đường trái ngược nhau. Checkpoint 2.213.241.664 tham số của InternLM đọc logit tại một vị trí cố định trước một placeholder và không bao giờ gọi generate(). Checkpoint 421 triệu tham số của Convai đưa các câu hỏi đã được định kiểu vào một đầu ra quyết định nằm trên xương sống ModernBERT-large và trả về xác suất đã hiệu chỉnh trong một lượt lan truyền xuôi duy nhất. Cả hai đều không ghi ra token nào, cả hai đều hứa hẹn xác suất, cả hai đều giới hạn ở mức gần tám nghìn token đầu vào, và mô hình nhỏ hơn thì nhỏ hơn năm lần và phổ biến hơn khoảng một nghìn lần. Điều phân biệt chúng không phải là năng lực cho lắm mà là cách đóng gói, và khoảng cách về đóng gói quyết định việc mua hàng đối với hầu hết độc giả.

Intern-Decision-2B xuất hiện trên Hugging Face lúc 05:36 UTC ngày 26 tháng 9 năm 2026, là kích thước ở giữa trong ba kích thước mà InternLM đã tải lên trong bốn mươi giây mà không có thông báo nào, được tinh chỉnh từ Qwen/Qwen3.5-2B theo Apache-2.0. Laya được đẩy lần đầu vào ngày 18 tháng 9 năm 2026 và kể từ đó đã tích lũy được hơn 3.700 lượt thích, một gói pip, một máy chủ HTTP tương thích Jev, các tích hợp ONNX và LangChain cùng một sổ tay tinh chỉnh. Sự tương phản về độ trưởng thành chính là bài viết.

Tiền đề mà chúng cùng chia sẻ, và những cơ chế khác biệt

Cả hai thẻ đều lập luận rằng nếu vấn đề của bạn là chọn lựa giữa những câu trả lời đã biết, thì việc sinh văn xuôi là thao tác sai. Cách diễn đạt của Laya là "nó không bao giờ sinh văn bản, nên không có gì để phân tích cú pháp và không có gì để ảo giác". Còn của Intern-Decision-2B là API của nó "thực hiện chấm điểm có cấu trúc cho các ứng viên. Nó không gọi generate() hay lấy mẫu văn bản tự do".

Các cơ chế chính là chỗ mà chúng tách ra.

Laya là một bộ phân loại. Một bộ mã hóa ModernBERT-large (395M, hai chiều, được tinh chỉnh hoàn toàn) cấp dữ liệu cho một đầu quyết định được huấn luyện từ đầu — hai lớp transformer, một bộ chấm điểm dấu tùy chọn, và một đầu act/escalate — tổng cộng 421M. Các tùy chọn chia sẻ một ngân sách token cố định (head_max_len, 192 token trên checkpoint tiếng Anh, 256 trên đa ngôn ngữ), và bộ định tuyến phát hiện hệ chữ và ngôn ngữ trong chưa đầy nửa mili-giây trước lượt xử lý.

Intern-Decision-2B là một mô hình next-token đã bị cấm trở thành mô hình sinh. Nó ánh xạ các lựa chọn của mỗi câu hỏi thành các ký hiệu đơn-token A–Z, a–z, 0–9; dựng một bộ khung JSON assistant đầy đủ với một placeholder <decision> cho mỗi trường; chạy một lượt lan truyền xuôi nhân quả; đọc logits ngay trước mỗi placeholder; thực hiện softmax trên các ký hiệu hợp lệ của trường đó; và áp dụng nhiệt độ đã khớp là 2.100509348278. Bên dưới là một Qwen3_5ForConditionalGeneration tiêu chuẩn — 24 lớp, ba lớp attention tuyến tính trên một lớp attention đầy đủ, một lớp dự đoán đa token được giữ lại, giới hạn embedding 262.144 vị trí — cùng một tháp thị giác và bộ chiếu.

Hệ quả thực tiễn của sự khác biệt nằm ở dung lượng tùy chọn. Ngân sách cố định trên mỗi tùy chọn của Laya sụp đổ trên các không gian nhãn rộng; thẻ của chính nó ghi lại một câu hỏi có 77 nhãn đạt 0.425 so với 0.870 của TypeSafe Jev trên cùng một tác vụ, vì 77 tùy chọn chỉ nhận được khoảng ba hoặc bốn token mỗi tùy chọn. Intern-Decision-2B nhận tối đa 62 tùy chọn mỗi câu hỏi và tối đa mười sáu câu hỏi, và 62 không phải là một sở thích mà là số lượng chính xác các ký hiệu một token mà hợp đồng của nó có thể xử lý. Cả hai đều không thoải mái khi vượt quá vài chục tùy chọn; các hình thái thất bại thì khác nhau.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Bảng điểm

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Tham số — Intern-Decision-2B 2.213.241.664 ở BF16 cùng với một vision tower và projector, khoảng 4,46 GB trên đĩa; Laya 421M, một tệp safetensors 842 MB duy nhất, cùng một checkpoint đa ngôn ngữ 644 MB riêng.

• Trần đầu vào — 8.192 token cho cả hai, cả hai đều từ chối thay vì cắt bớt; lưu ý rằng mức 8.192 của Laya áp dụng cho laya-multilingual và yêu cầu max_len=8192, vì giá trị mặc định đi kèm là 1.024.

• Hình ảnh — tối đa tám cho Intern-Decision-2B, được tính vào cùng ngân sách token; không có đường xử lý đa phương thức cho Laya.

• Tốc độ — trung bình 33.28 ms, P50 33.15 ms, P95 33.55 ms mỗi yêu cầu trên một RTX 4090 đối với Intern-Decision-2B; Laya báo cáo khoảng 33 ms mỗi yêu cầu và 103–332 câu hỏi mỗi giây khi chạy theo lô trên một T4.

• Ngôn ngữ — Intern-Decision-2B không đưa ra tuyên bố đa ngôn ngữ nào cả; Laya định tuyến qua hơn 100 ngôn ngữ, báo cáo 45 trong số 51 ngôn ngữ được đánh giá là có thể sử dụng được với mức cao hơn ba lần so với ngẫu nhiên, và đạt 0,451 trên MASSIVE intent trên mười ba ngôn ngữ không phải tiếng Anh so với 0,306 cho checkpoint chỉ tiếng Anh của nó.

• Độ chính xác zero-shot — Intern-Decision-2B đạt 84,68, trung bình trên bảy bộ của nhà cung cấp, với Brier 0,437 và ECE 0,100, tất cả đều chưa được tái lập; checkpoint tiếng Anh cơ sở của Laya đạt 0,362 trên benchmark typed-decisions gồm 2.000 quyết định, mà chính thẻ mô hình của nó đánh dấu là dưới mốc 0,461 của lớp đa số.

• Đóng gói — một checkpoint, một inference.py và một kho GitHub mới được công khai với mã huấn luyện và đánh giá, so với pip install laya, một máy chủ HTTP tương thích Jev, các đường dẫn nhanh ONNX Runtime và TileLang, tích hợp MCP và LangChain, và một notebook tinh chỉnh chạy trên GPU ở gói miễn phí.

Phép so sánh công bằng nhất không phải là phép so sánh mà bảng thông số kỹ thuật tạo ra.

Đặt 84.68 bên cạnh 0.362 là gần như không trung thực, và đáng để nói rõ lý do thay vì để những con số đó tự đứng một mình.

0,362 của Laya là một checkpoint cơ sở được đo zero-shot trên một bộ đánh giá mà nó không được tinh chỉnh cho. Model card của chính nó rút ra kết luận một cách rõ ràng: “Laya là một base nhanh để chuyên biệt hóa, không phải một engine ra quyết định zero-shot.” Khi được tinh chỉnh trên chính tập huấn luyện của bộ đánh giá đó, nó đạt 0,766, vượt qua mức trần 0,735 của teacher và đánh bại mức 0,727 đã công bố của TypeSafe Jev trên cùng các quyết định. Trong khi đó, 84,68 của Intern-Decision-2B là điểm trung bình bảy suite của nhà cung cấp, với các tập kiểm tra không phải là những tập mà Laya trích dẫn, được tạo ra bởi chính phòng thí nghiệm đã xây dựng mô hình, và chưa có bên thứ ba nào chạy nó — checkpoint chỉ hiển thị một lượt thích và không có lượt tải xuống nào. So sánh một kết quả đã tinh chỉnh với một kết quả zero-shot, hay so sánh điểm trung bình của nhà cung cấp với một bảng xếp hạng độc lập, không phải là so sánh. Đó là hai phép đo khác nhau dùng chung một kiểu chữ.

Điều thực sự có thể so sánh được: cả hai đều nhỏ, cả hai đều rẻ khi vận hành, và cả hai đều không thể tinh chỉnh (fine-tune) vào miền của bạn. Kho lưu trữ mà InternLM công bố sáng nay khiến phần cuối đó trở nên dễ dàng hơn đáng kể so với hôm qua, vì nó cung cấp trình khởi chạy huấn luyện, mục tiêu masked-next-token, một gói 10.751 hàng kiểm thử đã được xác minh bằng hash trên bảy bộ, cùng các script temperature và replay. Một phòng thí nghiệm cung cấp trình tạo hiệu chuẩn tất định và khẳng định replay không làm thay đổi quyết định nào đang mời gọi đúng kiểu thích ứng mà thẻ của Laya khuyến nghị.

Cách bạn thực sự sẽ gọi một trong hai

Cả hai mô hình đều không có trên OrcaRouter. Trang mô hình của OrcaRouter cho Intern-Decision-2B trả về 404 và cũng không có tuyến Laya nào; không có gì ở đây là tuyên bố về tính khả dụng. Intern-Decision-2B có nghĩa là tải checkpoint và chạy engine đi kèm của nó trên GPU của riêng bạn. Laya có nghĩa là pip install laya và, nếu bạn muốn giao diện tương thích Jev, thì chạy laya-serve trên POST /v1/systemone.

Câu hỏi mang dáng dấp Orchestrator ở bên dưới là liệu bạn có muốn một bề mặt vận hành thứ hai cho một scorer hay không. Laya được thiết kế để nhúng — cùng hình dạng request và response như TypeSafe Jev, nên một client hiện có chỉ cần đổi base URL và không cần thay đổi gì khác. Intern-Decision-2B được thiết kế để tái tạo, và hiện nay cần khoảng một ngày làm việc thiết lập môi trường trước khi đưa ra quyết định đầu tiên. Nếu quyết định trên tập đóng mà bạn đang đưa ra có hình dạng gần giống một trong hai lựa chọn này, thì phương án thay thế dạng hosted mà cả hai card đều đối chiếu là TypeSafe Jev 1.13, vốn có một route: 0,042 USD cho mỗi triệu token đầu vào, ngữ cảnh 65K và P50 thời gian đến token đầu tiên là 178 ms, truy cập được bằng cùng key như hơn 200 model khác với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức markup 0%.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Nơi mỗi cái chiến thắng

Laya thắng ở mọi phương diện vận hành. Một gói pip đối lại với việc tải xuống checkpoint. Một router chạy trên hơn một trăm ngôn ngữ đối lại với việc không có tuyên bố đa ngôn ngữ nào. Thông lượng theo lô được đo bằng hàng trăm câu hỏi mỗi giây đối lại với một con số tính theo từng yêu cầu riêng lẻ và không hề có giải pháp xử lý theo lô. Hai năm tích lũy sức mạnh hệ sinh thái — ONNX, TileLang, LangChain, MCP — đối lại với một repository mới công khai được hai giờ.

Intern-Decision-2B thắng ở ba khía cạnh hẹp. Nó nhận đầu vào là hình ảnh, điều mà Laya không làm được. Nó không mang món nợ tinh chỉnh nào: mức 84.68 của nó là tuyên bố zero-shot từ nhà cung cấp, trong khi con số 0.766 được Laya nhấn mạnh lại thuộc về một checkpoint được tinh chỉnh trên chính tập huấn luyện của bộ đánh giá. Và nó được tài liệu hóa bằng một bộ công cụ tái lập — một gói đánh giá có thể kiểm chứng và một ngăn xếp huấn luyện công khai — thứ đáng giá hơn một dòng trên bảng xếp hạng đối với bất kỳ ai phải biện minh cho mô hình với người khác.

Việc hòa nhau là tiền đề. Cả hai đều từ chối tạo sinh, cả hai đều cho bạn xác suất để bạn có thể đặt ngưỡng, và cả hai đều thấp hơn độ dài đầu vào mà hầu hết tài liệu thực tế thường có. Nếu trạng thái của bạn là một ticket, một email hay một biểu mẫu, dùng cái nào cũng được và Laya sẽ đưa bạn tới đó nhanh hơn. Nếu trạng thái của bạn có kèm ảnh chụp màn hình hoặc tổ chức của bạn cần việc tái tạo có thể kiểm toán được, checkpoint giữa của InternLM là thứ giải đáp phản đối cụ thể đó — và theo chính các con số của InternLM, nó là cái được hiệu chuẩn kém nhất trong ba người anh em của mình, ở mức ECE 0.100 so với 0.066 và 0.065, nên hãy fit temperature của riêng bạn trước khi tin vào độ tự tin mà nó báo cáo.