
Laya vs Decider: Bộ mã hóa 421M đối đầu với hỗn hợp 35B
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Laya và Decider đều là những mô hình quyết định trọng số mở, phi tự hồi quy, trả lời các câu hỏi có kiểu — một lựa chọn từ danh sách được cung cấp, một điểm số trên thang đánh giá có thứ tự, một xác suất có/không — chỉ trong một lượt truyền xuôi, và chúng nằm ở hai đầu đối lập của phổ kích thước. Convai Innovations phát hành Laya vào ngày 18 tháng 9 năm 2026 theo Apache 2.0: một bộ mã hóa ModernBERT-large 421M cho tiếng Anh với cửa sổ 512 token, một checkpoint đa ngôn ngữ mmBERT-base 322M với cửa sổ 1.024 token bao phủ hơn 100 ngôn ngữ, và một bộ định tuyến phát hiện hệ chữ rồi chuyển đến đúng mô hình. Dòng Decider của Mapika trải từ decider-0.8b và decider-2b trên các nền tảng sinh nhỏ đến decider-35b-a3b, một hỗn hợp chuyên gia 35B với khoảng 3B tham số hoạt động. Cả hai đều miễn phí tải về và cả hai đều trả về xác suất thay vì văn bản. Lý do chúng không thể thay thế cho nhau không phải là con số độ chính xác mà hầu hết các bài viết nhấn mạnh.
Hai dòng sản phẩm, một canh bạc kiến trúc

Canh bạc chung là một quyết định không cần vòng lặp giải mã. Một mô hình sinh khi được hỏi "vé này có phải là yêu cầu hoàn tiền không?" phải phát ra các token, và ngay khi nó phát ra token, bạn phải tự lo việc phân tích cú pháp, xác thực lược đồ và một đường dẫn thử lại cho một lần trong hai trăm lần nó quên một dấu ngoặc nhọn. Laya và Decider đều bỏ qua điều đó bằng cách đọc câu trả lời trực tiếp ra từ một lượt truyền xuôi duy nhất — Laya từ một bộ mã hóa hai chiều, Decider từ logits của các token tùy chọn có chữ cái tại một khe trả lời chuyên dụng trong câu lệnh.
Đó là nơi sự tương đồng kết thúc. Laya là hai bộ mã hóa nhỏ đằng sau một bộ định tuyến ngôn ngữ, và chính điều đó mang lại cho nó cửa sổ tiếng Anh 512 token và cửa sổ đa ngôn ngữ 1.024 token với số lượng tham số 421M và 322M. Decider giữ lại một xương sống sinh tạo và thêm một đầu đọc lên trên: decider-2b là một bản tinh chỉnh có giám sát của Qwen3.5-2B-Base, tiếp nối bằng một lượt tăng cường có nhận biết hiệu chuẩn trên các tác vụ trình duyệt trực tiếp và các trò chơi chính xác, trong khi decider-35b-a3b đóng băng các chuyên gia đã định tuyến và huấn luyện các ma trận khối bằng Muon. Hệ quả thực tế là Decider thừa hưởng kiến thức thế giới của một mô hình ngôn ngữ còn Laya thì không. Hệ quả còn lại là Decider thừa hưởng dấu chân của một mô hình ngôn ngữ.

Tài liệu của chính Mapika cho thấy decider-2b đạt mức trung vị 18ms mỗi quyết định trên B300 ở bf16, batch bằng một, không dùng CUDA graphs hay biên dịch, và decider-35b-a3b ở 41ms trên cùng thiết lập. Trên GH200 với ngữ cảnh ticket hỗ trợ khoảng 230 token và ba đến năm câu hỏi được nhập, cùng dự án đó báo cáo 49ms ở chế độ eager, 4,0ms với CUDA graphs và torch.compile, và khoảng 1.370 quyết định mỗi giây ở batch 32. Đó là những số liệu do nhà cung cấp công bố từ bài viết của chính dự án, không phải một phép đo độc lập. Con số nổi bật của Laya cũng do nhà cung cấp công bố: 32,8ms p50 mỗi quyết định trên Tesla T4, và 7,2ms mỗi câu hỏi ở kích thước batch 10.
Câu hỏi về hiệu chuẩn, thứ mà hai dự án trả lời trên những quy mô khác nhau
Độ hiệu chuẩn là chỉ số quan trọng nhất đối với một mô hình ra quyết định, vì toàn bộ mục đích của việc trả về một xác suất là ở chỗ ai đó ở phía sau sẽ đặt một ngưỡng trên nó. Đây cũng là chỗ mà việc so sánh trực tiếp Laya và Decider sẽ đánh lừa bạn.
Laya được phát hành với lỗi hiệu chuẩn kỳ vọng là 0,466 trên chính thẻ mô hình của nó, và thẻ này nói thẳng rằng việc khớp lại temperature cho từng loại câu hỏi sẽ đưa con số đó tới 0,081. Đó là một sự tiết lộ trung thực đến mức bất thường, và nó cũng có nghĩa checkpoint được phát hành không phải là artifact đã được hiệu chuẩn. Con số bạn nhận được khi dùng mặc định là 0,466.
Decider được báo cáo trên một công cụ đo lường hoàn toàn khác. Decision Index — một bảng xếp hạng mở đã chạy mọi bản tái tạo mở của Jev trên 132.422 yêu cầu — xếp decider-35b-a3b ở vị trí thứ tư chung cuộc với 54,3, sau 59,5 của Jev, và báo cáo nó là mục được hiệu chỉnh tốt nhất trong số 32 mục với sai số hiệu chỉnh 3,1 điểm và 0,4% câu trả lời sai ở độ tin cậy công bố từ 95% trở lên. decider-2b báo cáo 8,8 điểm và 0,9%. Đó là những con số do bảng xếp hạng công bố, và 3,1 điểm trên ECE mười bin của Index không phải là cùng một phép đo như 0,466 của Laya trên đánh giá riêng của nó. Đặt chúng cạnh nhau trong một bảng sẽ là một lỗi so sánh khập khiễng được khoác áo chặt chẽ. Điều có thể nói là tác giả của Decider đã chọn được đo trên một bảng xếp hạng bên thứ ba, còn tác giả của Laya đã chọn tự công bố con số hiệu chỉnh yếu nhất của nó; không bên nào được kiểm toán bởi harness của bên kia.
Nơi mỗi bên chiếm ưu thế, xét theo từng khía cạnh
• Backbone — Laya: bộ mã hóa ModernBERT-large 421M, hai chiều. Bộ quyết định: các mô hình nền tảng tạo sinh Qwen3.5, từ 0.8B đến 35B-A3B.
• Ngôn ngữ — Laya: hơn 100 thông qua một checkpoint đa ngôn ngữ 322M phía sau một bộ định tuyến. Decider: chỉ tiếng Anh, được nêu rõ là một hạn chế.
• Cửa sổ ngữ cảnh — Laya: 512 token tiếng Anh, 1,024 đa ngôn ngữ. Decider: chấp nhận đầu vào lên đến 32k, được huấn luyện đến 16k trên thế hệ v6, được thăm dò đến 30k.
• Trần tập tùy chọn — Laya: suy giảm mạnh khi vượt qua khoảng 20 tùy chọn, 0,425 trên Banking77 so với 0,870 của Jev. Decider: Choice trên 2 đến 255 tùy chọn có tên, Score trên 2 đến 10 mức được mô tả.
• Độ chính xác zero-shot — Laya: 0.362 trên benchmark typed-decisions, thấp hơn mức cơ sở lớp đa số là 0.461. Decider: không được công bố dưới dạng số zero-shot; thay vào đó, dự án báo cáo kết quả theo từng tác vụ.
• Hiệu chuẩn — Laya: ECE 0,466 như khi phát hành, 0,081 sau khi tái khớp nhiệt độ theo từng loại câu hỏi. Decider: 3,1 điểm trên Chỉ số Quyết định cho 35B, tốt nhất trong 32 mục.
• Suy luận — Laya: không có, theo thiết kế. Decider: không có, được nêu rõ ràng — nó là một đầu ra đối sánh mẫu, không phải một bộ suy luận.
• Giấy phép — Apache 2.0 cho cả hai.
Một chi tiết nữa về Decider đáng biết trước khi bạn chọn nó: dự án cảnh báo rằng việc chọn một bản ghi từ một mảng JSON dài theo vị trí là một trường hợp yếu, và khuyến nghị truy cập bản ghi bằng khóa. Đó là kiểu hạn chế mà bạn chỉ biết được khi chạy nó.
Bạn phải tốn bao nhiêu để vận hành một trong hai
Hồ sơ chi phí của Laya là một dự án tinh chỉnh. Mô hình đủ nhỏ để chạy trên CPU của một chiếc laptop cho các tác vụ thông lượng thấp, nhưng điểm zero-shot của checkpoint tiếng Anh được phát hành lại nằm dưới baseline tầm thường, nghĩa là chấp nhận Laya cũng là chấp nhận công việc xây dựng một tập dữ liệu có gán nhãn, tinh chỉnh, và hiệu chỉnh lại temperature theo từng loại câu hỏi. Phần thưởng nằm ở chỗ sau khi bạn làm xong, thành phẩm chỉ có 421M tham số và trả lời trong vài chục mili giây trên một chiếc T4. Bản tinh chỉnh của chính Convai laya-typed-decisions đạt 0,766 trên tập huấn luyện của bộ đánh giá — một con số nói lên nhiều điều về việc tinh chỉnh hơn là về mô hình nền tảng, và thẻ mô hình cũng ghi rõ như vậy.
Chi phí của Decider là một quyết định về serving. Bạn đang chọn thuê bao nhiêu GPU, và dòng sản phẩm này cho bạn một nút điều chỉnh thực sự: 18ms trên mô hình 2B so với 41ms trên 35B-A3B, trong đó mô hình lớn hơn đổi lấy dư địa về kiến thức và suy luận trên GPQA, GSM8K, CRUXEval và MMLU mà các mô hình nhỏ không có. Nếu tác vụ của bạn hẹp và nhãn của bạn cố định, decider-2b là cỗ máy rẻ hơn. Nếu tác vụ của bạn cần mô hình biết nhiều thứ, bạn phải trả giá cho phần mixture.
OrcaRouter phù hợp ở đâu — và ở đâu thì không
Cả Laya lẫn Decider đều không phải là model được host trên OrcaRouter. Bạn tải trọng số về và tự chạy chúng, và không có gì ở đây thay đổi điều đó. Thứ thay đổi là nửa còn lại của mô hình. Một model ra quyết định có kiểu hầu như không bao giờ là toàn bộ ứng dụng: phải có thứ gì đó đọc ticket, tóm tắt luồng thảo luận, hoặc soạn phản hồi mà phần ra quyết định kiểm soát. Nửa đó là một lệnh gọi sinh tạo, và đó chính là nửa mà OrcaRouter được xây dựng để phục vụ — hơn 200 model sau một key tương thích OpenAI với giá niêm yết của nhà cung cấp được chuyển thẳng qua với 0% markup, nhờ đó việc nhà cung cấp giảm giá sẽ đến trên hóa đơn của bạn ngay trong cùng ngày thay vì phải đợi đến lần gia hạn hợp đồng tiếp theo. Nếu bạn đang fine-tune một checkpoint Laya dựa trên đầu ra của một frontier model, hoặc định tuyến giữa decider-2b để phân loại và một model lớn cho 4% ca khó, thì việc giữ phía sinh tạo trên một endpoint nghĩa là phía ra quyết định và phía sinh tạo không cần hai hợp đồng và hai SDK. Tự động chuyển đổi dự phòng bao phủ trường hợp model lớn chính là phần bị sập.
Chọn cái nào?
Chọn Laya nếu đầu vào của bạn mang tính đa ngôn ngữ, nhãn của bạn ít, ngân sách độ trễ của bạn chỉ vài chục mili giây trên phần cứng khiêm tốn, và bạn sẵn sàng tinh chỉnh — vì bạn sẽ phải làm thế. Chọn Decider nếu đầu vào của bạn là tiếng Anh, bạn cần mô hình mang một chút kiến thức thế giới vào quyết định, và bạn thà chọn kích thước mô hình còn hơn chạy một pipeline huấn luyện. Nếu tập lựa chọn của bạn vượt quá hai mươi nhãn, hãy đọc con số Banking77 của Laya trước khi cam kết; nếu đầu vào của bạn là các tài liệu JSON dài mà bạn truy cập theo vị trí, hãy đọc giới hạn đã nêu của Decider trước khi cam kết.
Phép so sánh thực sự có thể phân định điều này — cả hai mô hình trên cùng đầu vào giống hệt từng byte, cùng prompt, cùng thứ tự tùy chọn, cùng quét ngưỡng — vẫn chưa tồn tại. Cho đến khi nó tồn tại, lập trường trung thực là Laya có đường cong chi phí tốt hơn và Decider có bằng chứng hiệu chuẩn tốt hơn, và rằng cả hai đều còn đủ sớm để bài đánh giá bạn xây dựng trên dữ liệu của chính mình sẽ có giá trị hơn các con số đã công bố của cả hai dự án.

