Thẻ tiêu đề được tạo tự động cho phần so sánh Laya với Kev, mang phụ đề của chính bài viết này và một dòng chân trang nêu rõ bên nào có số liệu do nhà cung cấp báo cáo và bên nào là bên thứ ba.
Engineering & Research

Laya vs Kev: Hai công thức cho một mô hình quyết định cục bộ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Con số hữu ích nhất trong so sánh giữa Laya và Kev là một biên lai. Jared Palmer đã huấn luyện họ Kev với chi phí khoảng 95 đô la cho thời gian H100 trên Modal, cộng thêm khoảng ba xu tiền gọi API cho dữ liệu đánh giá, và công bố công thức huấn luyện cùng với trọng số. Convai Innovations đi theo con đường khác với Laya: phát hành ngày 18 tháng 9 năm 2026, ba ngày sau Jev của TypeSafe AI, giấy phép Apache 2.0, trọng số trên Hugging Face, một điểm truy cập pip install laya, và không có pipeline huấn luyện — một checkpoint tiếng Anh ModernBERT-large 421M, một checkpoint đa ngôn ngữ mmBERT-base 322M, và một router chọn giữa hai mô hình đó. Kev là một họ gồm ba mô hình nhỏ với 0,8B, 4B và 9B, mỗi mô hình là một base đóng băng cộng với một adapter LoRA hạng 16 và một pointer head nhỏ. Cả hai đều trả lời các câu hỏi có kiểu trong một lượt lan truyền xuôi duy nhất và cả hai đều không sinh văn bản. Việc lựa chọn giữa chúng thực chất là quyết định xem bạn muốn sở hữu tạo tác nào: một checkpoint hay một công thức.

Những gì mỗi dự án thực sự đang tung ra

Laya cung cấp năng lực suy luận. Checkpoint tiếng Anh là một bộ mã hóa hai chiều với cửa sổ 512 token; bản đa ngữ bao phủ hơn 100 ngôn ngữ với cửa sổ 1.024 token và chạy nhanh gấp khoảng hai lần; bộ định tuyến phát hiện hệ chữ trong chưa đầy nửa mili giây. Nó trả lời choice, scorenoul — một lựa chọn từ danh sách, một mức dự kiến trên thang đánh giá có thứ tự, và một xác suất đã hiệu chỉnh cho biết một khẳng định là đúng. Có một checkpoint thứ ba, laya-typed-decisions, chính là cùng bộ khung 421M được tinh chỉnh trên tập huấn luyện của bộ đánh giá typed-decisions. Thẻ mô hình của chính Convai có câu nên chi phối cách bạn đọc mọi con số về Laya: "Laya là một nền tảng nhanh để chuyên biệt hóa, không phải một cỗ máy ra quyết định zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev cung cấp một phương thức. Kho lưu trữ ghi lại tài liệu về decision-v7: hai epoch trên 10.000 ví dụ được lấy từ mười bộ dữ liệu công khai, 896 ví dụ chính sách được sinh ra, và 1.680 ví dụ được xây dựng từ 60 cấu trúc quy tắc được sinh ra. Phần head chấm điểm từng lựa chọn được đưa ra dựa trên token decide của câu hỏi và thực hiện softmax trên kết quả. Vì các checkpoint Qwen3.5 kết hợp attention với các lớp Gated DeltaNet hồi tiếp vốn bỏ qua mặt nạ attention, mỗi câu hỏi chạy như một hàng riêng với trạng thái chia sẻ được tính một lần rồi lưu vào bộ nhớ đệm — đó là cách mô hình giữ các câu hỏi tách biệt khỏi nhau mà không phải trả giá cho một lần prefill mới cho mỗi câu hỏi. Kev phản chiếu hợp đồng /v1/systemone công khai của TypeSafe, nên một client TypeSafe SDK hiện có thể trỏ tới một máy chủ Kev cục bộ chỉ bằng cách thay đổi base URL. README nêu rõ rằng không có đầu ra Jev nào được dùng trong huấn luyện.

Hai kiểu thất bại là khác nhau, và đó mới là câu chuyện thật sự.

Cả hai mô hình đều thua Jev ở những tác vụ đòi hỏi phải biết nhiều thứ, nhưng chúng thua theo những cách đòi hỏi các biện pháp giảm thiểu khác nhau.

Những điểm yếu đã được công bố của Laya liên quan đến hình dạng của dữ liệu đầu vào. Trên bộ đánh giá typed-decisions của TypeSafe, nó đạt 0.362 zero-shot, so với 0.318 cho đoán ngẫu nhiên và 0.461 cho baseline lớp đa số — gần với ngẫu nhiên hơn là với câu trả lời tầm thường. Vượt qua khoảng hai mươi lựa chọn, nó sụp đổ: 0.425 trên Banking77 so với 0.870 của Jev. Nó nhạy cảm với thứ tự đến mức một lần đảo ngược thứ tự lựa chọn thuần túy đã làm giảm độ chính xác 13.75 điểm trong một bài kiểm tra của bên thứ ba, để lại tỷ lệ cùng câu trả lời là 42.5%. Và các checkpoint được phát hành đi kèm với nhiệt độ không hợp lệ — thư viện cảnh báo khi import, nghĩa là con số hiệu chuẩn trên thẻ, sai số hiệu chuẩn kỳ vọng là 0.466, chính là con số bạn thực sự nhận được trước khi bạn hiệu chỉnh lại. Việc hiệu chỉnh lại theo từng loại câu hỏi đưa nó xuống 0.081, nhưng đó là công việc bạn làm, không phải công việc mà bản tải xuống tự làm. Có một thất bại đa ngôn ngữ đã được công bố đáng để đọc toàn bộ: trên các hệ chữ viết không phải Latinh, checkpoint tiếng Anh cực kỳ tự tin quá mức một cách thảm khốc, với một ví dụ tiếng Khmer cho thấy độ chính xác 0.000 ở độ tự tin trung bình 0.952.

Những điểm yếu đã được công bố của Kev liên quan đến kiến thức và số học. Kev-9B đạt 0.837 trên bài kiểm tra nguồn mới bị khóa của riêng nó — 0.832 đối với bản 4B và 0.668 đối với bản 0.8B — và khoảng 0.822 ngoài miền trên tập dev so với 0.857 của Jev. Khoảng cách mở ra ở những chỗ đòi hỏi kiến thức thế giới: MMLU khoảng 70% so với 90% của Jev, MMLU-Pro 0.515 so với 0.840, và số học ngày tháng chính xác đến ngày 60% so với 93%. Trên một tập định tuyến hẹp có nhãn cố định, nó thắng — một đánh giá định tuyến phiếu hỗ trợ đặt Kev-9B ở 0.952 so với 0.897 của Jev — nhưng tác giả nói rõ rằng đây là bộ khung đánh giá của chính ông, rằng dữ liệu huấn luyện của Jev không được tiết lộ, và do đó không thể xây dựng được một so sánh có kiểm soát. Kev cũng vẫn quá tự tin trên các nguồn mới; việc đặt KEV_TEMPERATURE=2.0 đã giảm lỗi do quá tự tin từ 8.7% xuống 4.4% trong thử nghiệm của chính dự án, điều này cho thấy thiết lập mặc định không phải là thiết lập an toàn.

Cách hiểu thực tế: Lỗi của Laya được kích hoạt bởi tập lựa chọn và cách định dạng prompt của bạn, và bạn khắc phục nó bằng tinh chỉnh và refit. Lỗi của Kev được kích hoạt bởi những câu hỏi cần dữ kiện thực tế, và bạn khắc phục nó bằng cách giới hạn phạm vi mô hình vào định tuyến và phân loại, đồng thời đặt những lệnh gọi phụ thuộc kiến thức ở nơi khác. Không cách khắc phục nào là một dòng cấu hình.

Cần những gì để phục vụ họ

• Phần cứng — Laya: bộ mã hóa 421M/322M, khả thi trên CPU cho thông lượng thấp và chiếm dưới một gigabyte bộ nhớ thường trú đối với bản chuyển MLX trên chip Apple. Kev: 0.8B đến 9B, cần GPU CUDA BF16 cho bản 9B, với kiến trúc Qwen3.5 đòi hỏi flash-linear-attention trên CUDA và ROCm.

• Độ trễ — Laya: 32.8ms p50 mỗi quyết định trên Tesla T4, 7.2ms mỗi câu hỏi ở batch 10. Kev: khoảng 300ms cho năm câu hỏi được gõ từ một mô hình 4B trên máy Mac 32GB ở bf16, khoảng 40ms trên H100.

• Mức trần — Laya: cửa sổ tiếng Anh 512 token, 1.024 đa ngôn ngữ. Kev: lựa chọn trong khoảng 1–255 tùy chọn, điểm trong khoảng 2–255 mức, 384 token trạng thái huấn luyện với 8.192 khi phục vụ.

• Máy chủ — Laya: Python trong tiến trình, cùng với các bản chuyển cộng đồng cho ONNX, Go và Apple MLX. Kev: một máy chủ cục bộ gắn với 127.0.0.1 không có xác thực, một SDK npm, và các bộ điều hợp LangChain và LlamaIndex.

• Giấy phép — Apache 2.0 cho cả hai.

Hai lưu ý vận hành không xuất hiện trong những con số nổi bật. Máy chủ của Kev được thiết kế để chỉ phục vụ một yêu cầu mỗi lần và không yêu cầu xác thực — nó là một sidecar cục bộ, không phải thứ bạn đem phơi ra ngoài. Và độ trễ trên máy Mac của Kev tệ hơn đáng kể so với độ trễ trên H100 vì các kernel DeltaNet nhanh vẫn chưa tồn tại cho MLX, đúng kiểu chi tiết biến một tuyên bố "chạy cục bộ" thành tuyên bố "chạy cục bộ trên đúng phần cứng".

Nửa tạo sinh của mẫu

Cả hai mô hình này tồn tại để thay thế một lệnh gọi cụ thể: lệnh gọi LLM mà bạn đã thực hiện chỉ để nhận lại một nhãn hoặc một xác suất. Chúng không thay thế các lệnh gọi mà bạn thực sự cần văn xuôi. Một hệ thống hỗ trợ sử dụng Kev-9B để định tuyến một ticket vẫn cần một mô hình để tóm tắt luồng hội thoại và soạn thảo câu trả lời, và mô hình đó sẽ không phải là một LoRA 9B với một đầu con trỏ.

Đó chính là đường nối mà OrcaRouter nằm trong đó, chứ không phải một tuyên bố về việc lưu trữ một trong hai thứ này. Cả Laya lẫn Kev đều không có trong danh sách mô hình của chúng tôi — chúng là các trọng số bạn tự tải về — và bài viết sẽ gây hiểu lầm nếu ám chỉ điều ngược lại. Thứ có trong danh sách là hơn 200 mô hình sinh nằm sau một khóa tương thích OpenAI với giá niêm yết của nhà cung cấp được chuyển tiếp với 0% lợi nhuận chênh lệch. Nếu bạn đang dùng Kev để quyết định một yêu cầu thuộc tầng tóm tắt nào trong ba tầng, hoặc dùng Laya để chấm điểm xem một câu trả lời nháp có chấp nhận được không, thì phần sinh của cả hai vòng lặp chỉ là một endpoint với khả năng chuyển đổi dự phòng tự động, thay vì một hợp đồng thứ hai và một SDK thứ hai. Routing DSL là mảnh ghép phù hợp một cách tự nhiên nhất với kiến trúc mô hình quyết định: kết hợp một mô hình rẻ và một mô hình đắt vào một lệnh gọi duy nhất rồi để đầu ra của mô hình quyết định chọn nhánh.

Xem gì tiếp theo

Khoảng trống trong bằng chứng là như nhau đối với cả hai, và nó sẽ không được lấp đầy bởi bất kỳ dự án nào. Chưa ai chạy Laya và Kev trên các đầu vào giống hệt nhau từng byte với cùng lời nhắc, cùng thứ tự tùy chọn và cùng đợt quét ngưỡng tin cậy. Những chiến thắng nổi bật của Laya đến từ bộ kiểm thử của chính nó; các tuyên bố gần ngang bằng của Kev đến từ bộ kiểm thử của tác giả nó; cuộc kiểm toán hiệu chuẩn phát hiện rằng độ hiệu chuẩn của Jev thay đổi mạnh theo tác vụ — độ chính xác 44,7% và sai số hiệu chuẩn kỳ vọng 0,325 trên một tác vụ ưu tiên với chính sách ẩn — là của một bên thứ ba, và cả Laya lẫn Kev đều chưa từng được đối xử như vậy. Cho đến khi ai đó làm điều đó, những con số ở trên là tốt nhất hiện có và chúng không thể so sánh với nhau.

Nếu hôm nay bạn đang cân nhắc: hãy chọn Kev nếu bạn muốn có một mô hình định tuyến hoạt động được trong tuần này trên một GPU bạn đã thuê sẵn, và chấp nhận rằng nó sẽ không biết mọi thứ. Hãy chọn Laya nếu đầu vào của bạn là đa ngôn ngữ hoặc ngân sách phần cứng của bạn chỉ là một chiếc laptop, và hãy tính luôn việc tinh chỉnh như một phần của dự án thay vì coi đó là một bước tối ưu về sau. Dù chọn cách nào, hãy đo lường trên dữ liệu có nhãn của chính bạn trước khi đặt ngưỡng tin cậy trước lưu lượng production — cả hai dự án, trong tài liệu riêng của họ, đều khuyên bạn làm vậy.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."