Một thẻ tiêu đề được tạo có nội dung 'Intern-Decision-4B vs Laya', phụ đề 'hai mô hình trả lời mà không sinh ra token nào', cùng ba chip ghi '4.54B vs 421M', 'cả hai chỉ một lượt truyền xuôi' và 'cả hai đều Apache-2.0'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Engineering & Research

Intern-Decision-4B vs Laya: Hai mô hình từ chối viết câu trả lời, chênh lệch nhau gấp mười lần về kích thước

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một dòng trong thẻ mô hình Intern-Decision-4B ghi "Laya — 57.77". Bất kỳ ai đã đọc tài liệu của chính Laya sẽ nhận ra ý nghĩa của con số này: convaiinnovations/laya là một mô hình ra quyết định phi tự hồi quy có 421 triệu tham số, và 57.77 là điểm trung bình mà nó đạt được khi được dùng zero-shot trên benchmark của người khác. Thẻ của chính nó nói điều tương tự một cách thẳng thừng hơn — các checkpoint gốc nằm dưới mức cơ sở lớp đa số trên benchmark typed-decisions, ở mức 0.362 so với 0.461. Trong khi đó internlm/Intern-Decision-4B là một mô hình 4.54 tỷ tham số được xây dựng cho đúng cùng một công việc: nhận một trạng thái và một tập câu hỏi có kiểu, chạy một lượt truyền xuôi, trả về xác suất đã hiệu chỉnh, không bao giờ sinh ra một token. Cùng một canh bạc kiến trúc, cùng dạng đầu ra, cùng giấy phép Apache-2.0, gấp mười lần tham số — và một trong hai là bản nền để tinh chỉnh trong khi cái còn lại tự nhận là một cỗ máy zero-shot hoàn chỉnh.

Họ đồng ý về tiền đề, đó mới là điểm hiếm thấy.

Cả hai thẻ đều lập luận cùng một quan điểm, và điều đó đáng được nói ra vì phần lớn ngành lại lập luận điều ngược lại. Nếu vấn đề của bạn là chọn một đáp án trong một tập đáp án đã biết, thì việc sinh văn xuôi là sai thao tác: bạn phải trả tiền cho những token rồi vứt đi, bạn cần một trình phân tích cú pháp, và thay vì một xác suất để bạn có thể đặt ngưỡng, bạn lại nhận được một lời giải thích mà mình không hề yêu cầu. Thẻ của Laya diễn đạt điều đó rằng "nó không bao giờ sinh văn bản, nên chẳng có gì để phân tích cú pháp và chẳng có gì để ảo giác." Thẻ của Intern-Decision-4B nói rằng API của nó "thực hiện việc chấm điểm ứng viên có cấu trúc. Nó không gọi generate() hay lấy mẫu văn bản tự do."

Các cơ chế khác nhau theo một cách đầy gợi mở. Laya đưa các câu hỏi có kiểu vào một đầu phân loại và trả về các câu trả lời có kiểu với xác suất đã hiệu chỉnh trong một lượt truyền xuôi duy nhất, với một lớp định tuyến phát hiện hệ chữ viết và ngôn ngữ trong dưới nửa mili giây trước lượt truyền. Intern-Decision-4B ánh xạ các lựa chọn của mỗi câu hỏi sang các ký hiệu đơn token, dựng một khung JSON trợ lý với một placeholder cho mỗi trường, đọc các logit ngay trước mỗi placeholder, và chỉ thực hiện softmax trên các ký hiệu được phép của trường đó. Cách của Laya là một bài toán phân loại; cách của InternLM là một bài toán token kế tiếp mà nó không chịu để biến thành một bài toán sinh.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

Khoảng cách về kích thước, và những gì nó mang lại

Khi yêu cầu hai mô hình thực hiện cùng một tác vụ với 421M và 4,54B tham số, kết quả tạo ra đúng như bạn dự đoán, rồi đến một bất ngờ.

Phần được dự đoán là khả năng xử lý các câu hỏi khó. Intern-Decision-4B đạt trung bình 90,02 trên bảy bộ đánh giá với điểm Brier là 0,347 và sai số hiệu chuẩn kỳ vọng là 0,065 trong phép đo của chính InternLM, và nó chạy trung bình 44,16 ms mỗi truy vấn trên một RTX 4080. Checkpoint cơ sở của Laya có độ chính xác 0,362 trên bộ đánh giá typed-decisions gồm 2.000 quyết định, mà thẻ của chính nó nói là dưới ngưỡng 0,461 của lớp đa số và chỉ nhỉnh hơn một chút so với đường cơ sở ngẫu nhiên 0,318. Khi cùng checkpoint đó được tinh chỉnh trên tập huấn luyện của chính bộ đánh giá đó, con số nhảy lên 0,766. Thẻ của Laya tự rút ra kết luận: "Laya là một nền tảng nhanh để chuyên biệt hóa, không phải là một cỗ máy ra quyết định zero-shot."

Điều bất ngờ là mô hình nhỏ hơn thắng áp đảo ở hai khía cạnh. Tốc độ: Laya trả lời 103 đến 332 câu hỏi mỗi giây khi chạy theo lô trên một T4, và thẻ thông số của nó cho thấy nó nhanh hơn TypeSafe Jev khoảng sáu đến tám lần dựa trên con số p50 236–276 ms được đo độc lập mà nó trích dẫn. Gấp mười lần tham số không mua được gấp mười lần thông lượng theo chiều ngược lại — 44,16 ms của Intern-Decision-4B là tính trên mỗi truy vấn trên một 4090 mà không có thông tin xử lý theo lô nào được công bố. Và ngôn ngữ: Laya báo cáo 45 trong 51 ngôn ngữ được đánh giá là dùng được với hiệu năng cao hơn mức ngẫu nhiên trên ba lần, với kết quả định tuyến 0,451 trên MASSIVE intent ở mười ba ngôn ngữ không phải tiếng Anh, so với 0,306 đối với checkpoint chỉ tiếng Anh của nó. Intern-Decision-4B hoàn toàn không đưa ra tuyên bố đa ngôn ngữ nào.

Bảng điểm

• Số tham số — 4,54B BF16 cho Intern-Decision-4B, tháp văn bản cộng tháp thị giác cộng bộ chiếu; 421M cho Laya, một ngăn xếp nhỏ gọn duy nhất thuộc lớp bộ mã hóa.

• Giới hạn đầu vào — 8.192 token cho cả hai, và cả hai từ chối thay vì cắt ngắn; lưu ý rằng 8.192 của Laya áp dụng cho checkpoint đa ngôn ngữ, với mặc định khi phát hành là 1.024.

• Tính đa dạng — Intern-Decision-4B nhận từ 1 đến 16 câu hỏi và tối đa 62 lựa chọn mỗi câu, và 62 không phải là con số tùy ý: nó chính xác là số lượng ký hiệu đơn token mà hợp đồng suy luận của nó có thể xử lý. Laya cũng nhận nhiều câu hỏi có kiểu, nhưng thẻ của nó ghi lại sự sụp đổ mạnh mẽ khi vượt quá khoảng 50 lựa chọn, nơi một câu hỏi 77 nhãn chỉ nhận được ba hoặc bốn token ngân sách cho mỗi nhãn và độ chính xác giảm xuống 0.425.

• Hình ảnh — tối đa tám ảnh cho Intern-Decision-4B, được tính vào ngân sách 8.192 token; không có đường dẫn đa phương thức cho Laya.

• Hiệu chuẩn — Intern-Decision-4B phát hành kèm một temperature đã fit là 1.99241824, được chọn bằng cách tối thiểu hóa NLL trên 1,728 trường hợp, và báo cáo ECE 0.065 trên bộ kiểm thử riêng; Laya lại được phát hành với độ tự tin quá cao, và model card của nó cho biết rằng việc fit lại một temperature cho mỗi loại câu hỏi và số lượng lựa chọn đưa ECE trung bình từ 0.466 xuống 0.081.

• Tư thế zero-shot — một checkpoint đã hoàn tất huấn luyện, tự nhận đạt mức trung bình 90.02 so với một baseline đã được ghi nhận vốn chỉ đạt điểm dưới ngưỡng của lớp chiếm đa số.

• Độ trễ — trung bình 44,16 ms, trung vị 44,03 ms trên một RTX 4090 so với 103 đến 332 câu hỏi mỗi giây khi chạy theo lô trên một T4.

• Ngôn ngữ — không có con số được công bố về việc có bao nhiêu ngôn ngữ có thể sử dụng được khi {{1}}Do Not Translate (DNT){{/1}}.

• Giấy phép — Apache-2.0 với giấy phép Qwen thượng nguồn được giữ nguyên so với Apache-2.0 được gắn thẻ rõ ràng cho mục đích thương mại.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Hai tấm thẻ, hai quan niệm rất khác nhau về việc tiết lộ

Đây là lúc so sánh không còn là bảng thông số kỹ thuật nữa mà trở thành một quyết định đánh giá, bởi vì hai nhà cung cấp ghi lại các mô hình của họ theo phong cách trái ngược nhau.

Thẻ của Laya công bố chi tiết các thất bại của chính mình. Nó báo cáo rằng checkpoint tiếng Anh đạt độ chính xác 0.000 trên tiếng Khmer ở độ tin cậy 0.952 — tự tin trong khi sai, khiến việc chặn theo độ tin cậy trở nên vô dụng ở đó. Nó báo cáo rằng action.act_probability không mang tín hiệu hữu ích nào, cho giá trị 1.0 với gần như mọi đầu vào cùng AUROC 0.30 trên 396 quyết định đã gán nhãn, và khuyên bạn nên chặn theo độ tin cậy thay vào đó, vốn đạt 0.77 trên cùng những mục đó. Nó gọi các câu hỏi điểm thứ tự là "thành phần nguyên thủy yếu nhất", dẫn ra 0.372 trên SST-5. Một thẻ cho bạn biết nên bỏ qua đầu ra nào của chính nó đang làm điều mà hầu hết nhà cung cấp không thử làm.

Thẻ của Intern-Decision-4B công bố một bảng gọn gàng và không có ca thất bại nào. Những lưu ý của nó là có thật và có sức nặng — phần hiệu chỉnh đặc biệt rõ ràng một cách bất thường rằng cột “trước” trong thử nghiệm thí điểm của nó không phải là điều bất kỳ người dùng nào sẽ thấy, và rằng nhãn của bộ kiểm thử đã không được dùng để chọn temperature — nhưng phần đánh giá thì bảy chiến thắng và không có lời thừa nhận nào. Nó cũng có các hàng cho năm hệ thống cạnh tranh mà InternLM đã chạy trên harness của InternLM, bao gồm hàng Laya mở đầu bài viết này. Đó không phải là các con số của chính những dự án đó, và đọc chúng như vậy sẽ là một sai lầm.

Vậy nên luận điểm về nguồn gốc cho cuộc đối đầu này bất đối xứng theo hướng có lợi cho mô hình nhỏ hơn: bằng chứng của Laya bao gồm những khiếm khuyết do chính nó tự ghi nhận, còn bằng chứng của Intern-Decision-4B chưa từng gặp một tập kiểm thử nào không do chính các tác giả của nó chọn.

Mỗi cái phù hợp với dạng vấn đề nào

Với một trạng thái ngắn, có cấu trúc bằng tiếng Anh, một tập câu trả lời đóng và nhu cầu về một xác suất đáng tin cậy, Intern-Decision-4B là đối tượng có năng lực hơn trên lý thuyết và là lựa chọn đắt đỏ hơn trên thực tế — bốn shard safetensors, PyTorch 2.9.1 và Transformers 5.14.1 trên Python 3.12, một engine thường trú, và một wrapper bạn tự viết nếu muốn có endpoint HTTP. Với quyết định định tuyến hoặc guardrail khối lượng lớn trên hàng chục ngôn ngữ, nơi thông lượng là ràng buộc then chốt, Laya là hình thái phù hợp hơn: pip install laya, một mô hình 421M, và một thẻ mô hình đã nói với bạn rằng hãy tinh chỉnh trước khi tin vào các xác suất.

Điều duy nhất mà cả hai thẻ mô hình đều đồng tình là không nên tin tưởng mô hình nào ở chế độ zero-shot mà không kiểm tra hiệu chuẩn trên dữ liệu của chính bạn — Laya vì các checkpoint cơ sở của nó chỉ ở mức gần ngẫu nhiên với những loại quyết định không quen thuộc, còn Intern-Decision-4B vì ECE 0,065 của nó đến từ một bộ kiểm thử do chính các tác giả của nó tập hợp.

Những gì router thay đổi và không thay đổi ở đây

Không mô hình nào trong hai mô hình này nằm trong danh mục OrcaRouter, và cần nói thẳng điều đó thay vì ám chỉ ngược lại: các trang mô hình của chúng tôi trả về 404 cho cả Intern-Decision-4B lẫn Laya, và cả hai đều không phải là tuyến mà bạn có thể gọi ngay hôm nay. Ý nghĩa của điều đó đối với hai dự án là không giống nhau. Giấy phép Apache-2.0 của Laya với nhãn cho phép sử dụng thương mại nghĩa là trở ngại thuần túy nằm ở khâu đóng gói — đây là một gói Python cục bộ có dung lượng nhỏ, kiểu thứ hoàn toàn có thể được phục vụ. Trở ngại của Intern-Decision-4B cũng nằm ở khâu đóng gói, nhưng trọng số BF16 4,54B và mức trần từ chối 8.192 token khiến nó trở thành một thành phần hơn là một dịch vụ.

Điểm mà OrcaRouter thực sự hữu ích nằm ở phía bên kia của quyết định. Nếu vấn đề quyết định có cấu trúc của bạn hóa ra lại cần một bước suy luận, thì những mô hình tổng quát có thể làm được điều đó đều nằm trong một khóa duy nhất cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức tăng giá 0% và tự động chuyển đổi dự phòng giữa các nhà cung cấp — vì vậy mô hình bạn ghép với bộ chấm điểm chỉ cách một endpoint, chứ không phải một hợp đồng thứ hai.

Phiên bản ngắn

Hai dự án này đã đi đến cùng một kết luận về cách đưa ra quyết định, rồi sau đó khác nhau ở gần như mọi thứ còn lại. Laya đặt cược rằng 421M tham số, định tuyến ngôn ngữ chặt chẽ và sự trung thực không khoan nhượng về những khiếm khuyết của chính nó tạo nên một nền tảng nhanh để bạn chuyên biệt hóa. Intern-Decision-4B đặt cược rằng lượng tham số gấp mười lần cùng một hợp đồng chấm điểm một token được thiết kế kỹ lưỡng tạo nên một cỗ máy zero-shot hoàn chỉnh. Thí nghiệm mang tính quyết định là thí nghiệm mà cả hai đều chưa từng chạy công khai: lấy một tập hợp các quyết định có đáp án tính toán được, chạy cả hai, và kiểm tra xem các xác suất có thực sự mang ý nghĩa gì không. Laya đã công bố một nửa thí nghiệm đó và cho bạn thấy nó thất bại ở đâu. Intern-Decision-4B thì chưa công bố nó chút nào.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.