
Jev vs Laya: 33 mili giây trên T4 và một đường cơ sở ngẫu nhiên
Thẻ mô hình của Laya chứa câu quyết định phép so sánh này, và câu đó do chính những người tạo ra Laya viết. "Laya là một nền tảng nhanh để chuyên biệt hóa, không phải một cỗ máy ra quyết định zero-shot." Convai Innovations phát hành Laya vào ngày 18 tháng 9 năm 2026, ba ngày sau khi TypeSafe AI ra mắt Jev, theo giấy phép Apache 2.0, với trọng số trên Hugging Face và một điểm truy cập pip install laya. Nó trả lời các câu hỏi có kiểu chỉ trong một lượt lan truyền xuôi duy nhất mà không cần giải mã từng token, đây cũng chính là canh bạc kiến trúc mà Jev đặt cược. Tuyên bố đáng chú ý nhất là độ trễ p50 32,8 mili giây cho mỗi quyết định trên một chiếc Tesla T4, được mô tả là nhanh hơn khoảng 7,8 lần so với mức p50 236–276ms mà Jev công bố qua API được lưu trữ của mình. Tuyên bố này là thật, và nó cũng đang đo lường hai thứ khác nhau — một GPU cục bộ so với một lệnh gọi qua mạng — còn bức tranh độ chính xác bên dưới mới là phần nên quyết định việc bạn có tải nó về hay không. Ở chế độ zero-shot, Laya đạt 0,362 trên bộ đánh giá typed-decisions của TypeSafe. Đoán ngẫu nhiên đạt 0,318. Đường cơ sở theo lớp đa số đạt 0,461. Laya, khi dùng ngay từ đầu, còn gần với mức đoán ngẫu nhiên hơn là với đường cơ sở tầm thường đó.
Laya thực sự là gì

Laya được phát hành dưới dạng hai checkpoint nằm sau một bộ định tuyến tích hợp, vốn định tuyến mỗi đầu vào tới checkpoint phù hợp. Checkpoint tiếng Anh là ModernBERT-large với 421M tham số và ngữ cảnh 512 token. Biến thể đa ngôn ngữ là mmBERT-base với 322M tham số và cửa sổ 1.024 token, bao phủ hơn 100 ngôn ngữ. Cả hai đều phi tự hồi quy: một lượt lan truyền xuôi duy nhất trả về câu trả lời, nên không có vòng lặp giải mã, không có JSON cần phân tích, và không có chỗ nào để phát sinh văn bản nằm ngoài kiểu đã khai báo. Thuộc tính cuối cùng đó chính là bảo đảm mang tính cấu trúc mà Jev cung cấp, đạt được từ một hướng khác, và nó thực sự có giá trị với bất kỳ ai từng viết logic thử lại quanh một mô hình đôi khi quên đóng dấu ngoặc nhọn.
Jev là đối trọng đóng: mô hình System One đầu tiên của TypeSafe AI, ra mắt ngày 15 tháng 9 năm 2026, được host và ở chế độ truy cập sớm, với ba primitive có kiểu — Choice từ một danh sách do bạn cung cấp, Score trên một rubric có thứ tự, và Noul, một tuyên bố có/không với xác suất đã hiệu chỉnh. Mọi câu hỏi đều được đánh giá song song dựa trên một lần đọc trạng thái dùng chung, đầu ra miễn phí vì không có token đầu ra, và đầu vào là $0,042 mỗi triệu token. Kiến trúc, số lượng tham số và compute huấn luyện của nó không được tiết lộ, và TypeSafe cho biết các chi tiết đang được giữ kín, có thể sẽ có một bài báo sau.
Tuyên bố về độ trễ, được đo lường đúng cách
p50 32,8 ms của Laya trên T4 là một con số thật và là một con số tốt. Phép so sánh gấp 7,8 lần với 236–276 ms của Jev là chỗ cần phải cẩn thận, và card của chính Laya lại trung thực một cách bất thường về lý do: các con số của Jev là số liệu do bên thứ ba công bố mà Convai chưa từng tự đo, và phép so sánh đặt một lượt forward pass trên GPU cục bộ đối đầu với một lệnh gọi API được host, vốn bao gồm vòng khứ hồi qua mạng và xếp hàng. Bỏ yếu tố mạng ra thì so sánh kiến trúc là giữa hai mô hình single-pass, một mô hình 421M tham số và một mô hình có kích thước không được tiết lộ mà TypeSafe chưa từng công bố.
Cũng có một con số về batch đáng để biết: ở batch mười, Laya báo cáo 7.2ms mỗi câu hỏi. Đó chính là hình hài của sản phẩm. Laya được xây dựng để chạy cục bộ với khối lượng lớn, và các bản chuyển cộng đồng trên thiết bị như laya-mlx mở rộng điều đó sang Apple Silicon. Những tuyên bố lan truyền rằng “nhanh hơn Jev 50 lần” không được các benchmark đã công bố của chính dự án hậu thuẫn, và cách diễn đạt trung thực là một khoảng cách lớn giữa cục bộ và đám mây — một phần mang tính kiến trúc, một phần chỉ là khác biệt giữa GPU của bạn và API của người khác.
Những con số độ chính xác nói lên điều gì, theo thứ tự
Đây là lúc phép so sánh không còn tâng bốc nữa, và đáng để trình bày theo trình tự bởi vì thứ tự rất quan trọng.
• Zero-shot trên bộ đánh giá typed-decisions của TypeSafe — Laya 0.362, ngẫu nhiên 0.318, lớp đa số 0.461, Jev 0.727. Laya cao hơn mức ngẫu nhiên và thấp hơn đường cơ sở tầm thường.
• Được tinh chỉnh trên chính tập huấn luyện của benchmark — Laya 0.766 so với 0.727 của Jev. Laya thắng, và chiến thắng này đến từ một checkpoint đã từng thấy dữ liệu huấn luyện của benchmark, điều đó khiến nó là một nhận định về việc tinh chỉnh, chứ không phải về mô hình nền tảng.
• Phân loại ý định Banking77, nơi tập tùy chọn lớn — Laya 0.425 so với Jev's 0.870. Laya suy giảm mạnh khi vượt quá khoảng 20 tùy chọn, và theo tài liệu, các trường Choice của Jev xử lý được tới 255 trước khi cần đến mẫu chấm điểm hai giai đoạn.
• Hiệu chuẩn — Laya đi kèm với sai số hiệu chuẩn kỳ vọng trung bình là 0,466, chỉ cải thiện xuống 0,081 sau khi tái khớp nhiệt độ theo từng loại câu hỏi. Jev được huấn luyện bằng một phương pháp mà TypeSafe gọi là RLCD, Học tăng cường cho các Quyết định đã Hiệu chuẩn, và đưa ra mọi câu trả lời kèm một phân phối xác suất — mặc dù TypeSafe cũng khuyên người dùng xác thực các ngưỡng trên dữ liệu có nhãn của riêng họ, và một cuộc kiểm toán độc lập nhận thấy hiệu chuẩn của Jev thay đổi mạnh theo từng tác vụ.
Mô thức này rõ ràng không thể nhầm lẫn. Laya là một nền tảng mạnh để tinh chỉnh nhưng là một bộ máy ra quyết định zero-shot yếu, và bản thân nó cũng nói như vậy. Jev là một bộ máy ra quyết định zero-shot mạnh, nhưng độ hiệu chuẩn của nó vẫn phải được kiểm tra theo từng lần triển khai. Đó là những sản phẩm khác nhau với cấu trúc giá khác nhau, và việc lựa chọn giữa chúng chủ yếu là vấn đề liệu bạn có dữ liệu đã gán nhãn và một vòng lặp huấn luyện hay không.
Phép toán chi phí không có cùng dạng như của Jev.
Jev có giá $0,042 cho mỗi triệu token đầu vào với đầu ra miễn phí, tức $42 mỗi tỷ token, và một lệnh gọi kích thước tối đa ở ngân sách yêu cầu ~32.000 token như tài liệu ghi tốn chưa đến một xu. Bài kiểm tra độc lập của Every cho thấy 777 phán đoán trên 37 tài liệu chỉ tốn khoảng một phần tư xu.
Chi phí mỗi lượt gọi của Laya bằng không ở cận biên và khác không khi tính tổng, mà tổng cộng lại không hề nhỏ. Một mô hình 421 triệu tham số trên T4 thì chạy rẻ, nhưng vẫn ngốn của bạn một GPU, và bước tinh chỉnh khiến Laya có sức cạnh tranh mới là nơi khoản chi thực sự nằm ở đó — việc gán nhãn dữ liệu, lần chạy huấn luyện, khung đánh giá, và việc tái hiệu chỉnh temperature theo từng loại câu hỏi, thứ đưa sai số hiệu chỉnh của nó từ 0,466 xuống 0,081. Với một danh mục phân loại cố định không bao giờ thay đổi, đó là chi phí một lần và sẽ được hoàn vốn khi đạt khối lượng lớn. Với một danh mục phân loại bị trôi, nó là chi phí định kỳ, và đường cơ sở zero-shot 0,727 của Jev trở thành một lựa chọn hời hơn nhiều.
Có một chi phí thứ ba dễ bị bỏ sót: checkpoint tiếng Anh của Laya có cửa sổ ngữ cảnh 512 token. Đó không phải là một mô hình ra quyết định với ngân sách ngữ cảnh nhỏ — mà là một mô hình ra quyết định được thiết kế chỉ vừa cho một đoạn văn. Ngân sách yêu cầu khoảng 32.000 token của Jev lớn hơn sáu mươi lần, và ngay cả mức đó vẫn thấp hơn một bậc độ lớn so với các mô hình sinh mà cả hai đang được định giá so với. Nếu trạng thái của bạn là một luồng hỗ trợ thay vì một tin nhắn hỗ trợ, thì cửa sổ của cả hai mô hình đều không phải là ràng buộc mà bạn nên lấy làm cơ sở để tối ưu hóa.
Câu hỏi về triển khai mới chính là sự khác biệt thực sự.

Lập luận mạnh nhất của Laya không phải là độ trễ. Mà là việc trọng số Apache 2.0 trên Hugging Face đồng nghĩa quyết định không bao giờ rời khỏi hạ tầng của bạn và endpoint không bao giờ có giới hạn tốc độ. Đối với một quyết định định tuyến được đưa ra dựa trên hồ sơ y tế, tài liệu pháp lý, hay lịch sử tài khoản của khách hàng, đó không phải là sở thích — mà là yếu tố quyết định, và không endpoint được lưu trữ nào ở bất kỳ mức giá nào thắng được lập luận đó. Jev của TypeSafe đang ở dạng truy cập sớm và có danh sách chờ, và tài liệu của chính nó ghi chú rằng giới hạn tốc độ có thể thay đổi mà không cần thông báo.
Lập luận phản bác nằm ở điều bạn phải đánh đổi. Kiến trúc lớn hơn chưa được tiết lộ của Jev đang làm phần việc mà 421M tham số của Laya không thể làm được: khoảng cách zero-shot 0,727 so với 0,362 và khoảng cách Banking77 0,870 so với 0,425 đều là thước đo lượng kiến thức nằm sẵn trong mô hình trước khi bạn huấn luyện nó. Câu trả lời của Laya là bạn tự cung cấp kiến thức đó thông qua tinh chỉnh, và trên một miền hẹp cố định, câu trả lời đó có hiệu quả — kết quả tinh chỉnh 0,766 là bằng chứng.
Lớp quyết định nằm ở đâu trong một stack thực tế
Cả hai mô hình đều không sinh văn bản, nên không mô hình nào là toàn bộ của bất kỳ quy trình nào. Kiến trúc mà cả hai được thiết kế để phục vụ là hai mô hình: một lớp ra quyết định đưa ra lệnh gọi có kiểu, và một mô hình sinh xử lý phần cần văn xuôi, mã hoặc giải thích. OrcaRouter không phục vụ Jev hay Laya — Jev là endpoint truy cập sớm của TypeSafe còn Laya là trọng số bạn tự chạy — nhưng nửa sinh của kiến trúc đó chính là thứ chúng tôi đáp ứng: hơn 200 mô hình sau một khóa tương thích OpenAI với giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0%, nên khi giá của nhà cung cấp thay đổi thì bên chúng tôi cập nhật ngay trong cùng ngày. Kiến trúc hai mô hình có thể kiểm thử mà không cần thêm hợp đồng với nhà cung cấp thứ hai, và nhờ cơ chế chuyển đổi dự phòng tự động, đường sinh không trở thành điểm hỏng duy nhất trong khi bạn quyết định liệu lớp ra quyết định rẻ tiền có được hiệu chỉnh đủ tốt để tự động hóa dựa trên nó hay không.
Phán quyết
Nếu bạn có một taxonomy cố định, hẹp, các ví dụ được gán nhãn, và yêu cầu về quyền riêng tư hoặc độ trễ loại trừ API được host, thì Laya là lựa chọn dễ biện minh hơn và các con số sau tinh chỉnh ủng hộ điều đó. Nếu bạn cần quyết định hoạt động ngay khi dùng, nếu các tập lựa chọn của bạn vượt quá hai mươi danh mục, hoặc nếu trạng thái dài hơn một đoạn văn, thì chính model card của Laya cho bạn biết đó không phải là sản phẩm dành cho công việc đó — và điểm zero-shot 0,362 so với baseline đa số 0,461 là con số cần lưu tâm khi ai đó trích dẫn con số độ trễ gấp 7,8 lần với bạn.
Điểm chung của cả hai hữu ích hơn điểm khác biệt giữa chúng. Cả hai đều loại bỏ nhóm lỗi đến từ định dạng đầu ra và không làm gì với nhóm lỗi đến từ phán đoán. Cả hai đều cung cấp xác suất, và không bên nào có một biểu đồ độ tin cậy được công bố mà bạn có thể tin dùng ngay mà không cần kiểm tra. Hãy kiểm tra hiệu chuẩn trên các trường hợp có nhãn của riêng bạn trước khi bạn tự động hóa dựa trên một trong hai — độ trễ vốn đã trở thành hàng hóa phổ thông, còn giá trị độ tin cậy mới là phần phải được chứng minh theo từng triển khai.

