
RSI-Jev Laya: Hai mô hình quyết định mở, hai canh bạc trái ngược
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.
Canh bạc đầu tiên xoay quanh quy mô. Checkpoint tiếng Anh của Laya là ModernBERT-large với 421M tham số và ngữ cảnh 512 token, còn checkpoint đa ngôn ngữ của nó là mmBERT-base với 322M cùng cửa sổ 1.024 token, có thể đạt tới 8.192 khi bộ mã hóa được thiết lập ở chế độ rộng. RSI-Jev v6.1-VL vận hành cả một tháp Qwen3.5-4B-Base — 4,69B tham số, 3,57B trong số đó nằm ở 32 lớp giải mã, cộng thêm một tháp thị giác và ba đầu quyết định tại các lớp 16, 20 và 32. Laya là mô hình mà bạn có thể tải trước ba bản chỉ trong vài gigabyte; RSI-Jev là một checkpoint bf16 9,7 GB. Canh bạc thứ hai tiếp nối canh bạc thứ nhất: Laya gần như không tốn gì cho mỗi lần gọi và mong bạn dạy nó lĩnh vực của bạn, trong khi RSI-Jev tiêu tốn bốn tỷ rưỡi tham số để cố trả lời câu hỏi của bạn mà không cần huấn luyện gì cả.
Mỗi cái thực sự được dùng để làm gì
Model card của chính Laya chứa câu diễn đạt phép so sánh này tốt hơn bất kỳ người đánh giá nào có thể: “Laya là một nền tảng nhanh để chuyên biệt hóa, chứ không phải một cỗ máy ra quyết định zero-shot.” Trên bộ đánh giá typed-decisions — 2.000 quyết định trải khắp bốn workflow — checkpoint cơ sở tiếng Anh đạt 0,362, so với 0,318 khi đoán ngẫu nhiên và 0,461 khi luôn chọn lớp đa số. Trên cùng những quyết định đó, checkpoint Convai được tinh chỉnh trên chính split huấn luyện của bộ đánh giá ấy đạt 0,766, vượt qua ngưỡng trần đồng thuận với teacher là 0,735. Khoảng cách đó chính là sản phẩm: Laya là một encoder 421M mà bạn tinh chỉnh trên một taxonomy hẹp, còn Convai cung cấp một notebook Kaggle chạy toàn bộ vòng lặp — xây dựng tập dữ liệu, huấn luyện, khớp nhiệt độ hiệu chuẩn, đánh giá — trên hai GPU T4 miễn phí.
RSI-Jev là lựa chọn còn lại. Bản phát hành v6.1-VL của nó đạt 50,98 trên Decision Index 0.3 công khai của chính nó, một lượt chạy 140.178 yêu cầu với cấu hình mặc định; trên bảng xếp hạng của dự án đề ngày 2026-10-06, thành tích này ngang bằng với mô hình 4B tốt nhất ở đó và đứng thứ 27 trong tổng số 113. Bộ mười lăm benchmark của nó đạt 0,793 và tập held-out của nó đạt 0,729. Đó là những con số zero-shot — dù dự án rất cẩn thận khi nói rằng mười trong số mười lăm benchmark có đóng góp dữ liệu huấn luyện dưới một hình thức nào đó, nên “zero-shot” áp dụng cho hoạt động tìm kiếm của bản phát hành, chứ không phải cho mọi con số trên trang. Điều những con số này thực sự mang lại cho bạn là một mô hình có thể trả lời câu hỏi về một tài liệu mà bạn chưa từng cho nó xem và không cần chạy huấn luyện trước.
• Kích thước — Laya 421M tiếng Anh / 322M đa ngôn ngữ so với RSI-Jev 4.69B, chạy toàn bộ tower Qwen3.5-4B-Base.
• Độ chính xác zero-shot — Laya đạt 0.362 trên typed-decisions, thấp hơn mức cơ sở đa số 0.461, so với RSI-Jev 50.98 trên Decision Index 0.3 của riêng nó, ngang bằng với mục 4B tốt nhất ở đó.
• Độ chính xác sau tinh chỉnh — Laya 0.766 với một checkpoint được huấn luyện trên chính tập chia của benchmark, so với các số liệu của RSI-Jev vốn ở cấp bản phát hành, chứ không phải theo từng lĩnh vực.
• Ngôn ngữ — Laya 45 trong 51 ngôn ngữ có thể dùng được cao hơn ba lần so với định tuyến phía máy chủ ngẫu nhiên so với văn bản thiên về tiếng Anh của RSI-Jev.
• Phương thức — Laya chỉ văn bản so với RSI-Jev văn bản cộng tối đa bốn hình ảnh mỗi yêu cầu.
• Ngữ cảnh — Laya 512 token tiếng Anh, 1.024 token đa ngôn ngữ và tối đa 8.192 cho tài liệu dài so với RSI-Jev 32.768 token, từ chối thay vì cắt ngắn.
• Độ trễ — Laya 32.8 ms p50 trên T4, 7.2 ms mỗi câu hỏi ở batch mười so với RSI-Jev 22.5 ms ở mức nỗ lực thấp và khoảng 40 ms ở độ sâu đầy đủ, trên H200.
Sự sụt giảm dốc đứng về số lượng tùy chọn là khác biệt rõ rệt nhất.
Cả hai mô hình đều định nghĩa không gian đáp án ngay tại thời điểm yêu cầu, nên một schema mới không cần huấn luyện lại — đó là lợi thế cấu trúc chung của cả dòng họ này. Nhưng chúng phân bổ không gian đáp án theo cách khác nhau, và khác biệt ấy thể hiện đúng ở những tác vụ mà định tuyến doanh nghiệp thường gặp. Laya chấm điểm từng lựa chọn tại token bị che riêng của nó, và các lựa chọn cùng chia sẻ một ngân sách đầu cố định: 192 token trên checkpoint tiếng Anh, 256 trên bản đa ngôn ngữ. Trên Banking77, với 77 ý định, con số đó tương đương khoảng ba hoặc bốn token cho mỗi nhãn, và độ chính xác giảm xuống 0,425. Thẻ (card) của chính Convai ghi nhận vực thẳm này và đưa ra cách khắc phục — hãy nâng head_max_len lên 512 và ngữ cảnh lên 1.024 hoặc hơn để mỗi nhãn có đủ chỗ, hoặc tách một tập lựa chọn lớn thành lựa chọn hai bước từ thô đến tinh.
Luồng phục vụ của RSI-Jev cho phép tối đa 5.120 lựa chọn mỗi câu hỏi. Đó không phải là một phép đối sánh cùng điều kiện với 0,425 của Laya — hai bên được đo trên các bộ khung khác nhau, và mức trần lựa chọn là một giới hạn cấu hình, chứ không phải điểm số. Đây là một phát biểu về việc mô hình nào sẽ không bị sập khi hệ phân loại của bạn có hàng trăm mục. Nếu các câu hỏi lựa chọn của bạn là "thanh toán / kỹ thuật / kinh doanh / khác", thì cả hai đều dùng được. Nếu chúng là hơn một trăm nhãn ý định, thì một trong hai mô hình này cần được tinh chỉnh trước khi dùng được, còn mô hình kia thì không.

Độ trễ, vấn đề ngôn ngữ và hình ảnh
Tuyên bố về độ trễ của Laya là điểm ồn ào nhất, và đó là sự thật: 32,8 ms ở mức p50 cho một câu hỏi duy nhất trên Tesla T4, 72,3 ms cho một lô mười câu, và 337 ms cho năm mươi câu — từ 103 đến 332 câu mỗi giây trên một GPU khiêm tốn. Số liệu của chính RSI-Jev, đo trên H200, là 22,5 ms ở mức nỗ lực thấp, 26,8 ms ở mức trung bình, 39,9 ms theo mặc định và 40,4 ms ở độ sâu tối đa. Đó là cùng một bậc độ lớn, và cả hai đều là lượt truyền xuôi cục bộ chứ không phải lời gọi qua mạng, đây mới là phép so sánh thực sự quan trọng khi một endpoint được lưu trữ đã không còn nằm trong bức tranh. Hãy để ý hai bên dùng thời gian vào việc gì: RSI-Jev có thể chủ động dừng ở lớp 16 để đổi lấy 22,5 ms đó và chạy đủ cả 32 lớp khi câu hỏi khó, còn Laya không có nút điều chỉnh như vậy — nó luôn chạy toàn bộ encoder (nhỏ) của mình.
Câu chuyện ngôn ngữ lại diễn ra theo hướng ngược lại và mang tính quyết định đối với bất kỳ ai ngoài tiếng Anh. Laya cung cấp một router phát hiện hệ chữ viết trong chưa đầy một mili giây và chuyển tiếp đến checkpoint đa ngôn ngữ, và bảng công bố của nó cho thấy 45 trong số 51 ngôn ngữ dùng được ở mức cao hơn ba lần mức ngẫu nhiên, so với 23 đối với chỉ mình checkpoint tiếng Anh. Thẻ của nó cũng trung thực về lý do điều đó quan trọng: checkpoint tiếng Anh sụp đổ trên các hệ chữ viết không phải Latinh — tiếng Khmer đạt độ chính xác 0.000 với độ tin cậy 0.952 — nên cơ chế chặn theo độ tin cậy không thể cứu được một tuyến sai. RSI-Jev không có câu chuyện ngôn ngữ kiểu này; nó là một mô hình văn bản lấy tiếng Anh làm trung tâm mà tình cờ đọc được hình ảnh.
Hình ảnh là hình ảnh phản chiếu. RSI-Jev nhận một đến bốn ảnh mỗi yêu cầu dưới dạng URL dữ liệu base64 và đạt 0.834 trên tập ảnh giữ lại của nó trong bản phát hành này; các checkpoint đã phát hành của Laya là bộ phân loại văn bản, và trong khi các bản port cộng đồng như laya-vision tồn tại trên Hub, chúng không phải là sản phẩm của nhà cung cấp. Nếu quyết định của bạn được đưa ra về một bức ảnh, một biểu đồ hay một ảnh chụp màn hình, thì đó là cột của một mô hình chứ không phải của mô hình kia.
Chưa cái nào trong hai được đo hiệu năng so với cái còn lại.
Đây là phần mà một so sánh theo từng thông số kỹ thuật âm thầm che giấu: không có cuộc đối đầu trực tiếp nào giữa hai mô hình này. Điều tồn tại là cuộc đối đầu trực tiếp giữa từng mô hình trong số chúng với cùng một mô hình đóng — Jev 1.13 của TypeSafe — và không mô hình nào có thể được đặt cạnh mô hình kia.
Convai đã công bố một kết quả: trên typed-decisions, Jev 1.13.0 đạt 0,727 so với 0,766 của Laya được định tuyến; trên Banking77, Jev đạt 0,870 so với 0,425 của Laya; về hiệu chuẩn, Jev đạt 0,246 so với 0,081 của Laya sau khi sửa temperature. Convai tự nêu rõ các giới hạn của mình trong cùng bảng đó — những con số của Jev là do bên thứ ba công bố, họ chưa từng có quyền truy cập API để đo nó, và kích thước mẫu cùng các prompt đều khác nhau. Phép so sánh của RSI-Jev là Decision Index, vốn là bảng công khai của chính RSI-Jev và không hề có mục nào dành cho Jev. Vậy nên những con số bên ngoài duy nhất chạm tới cả hai mô hình này đều đến từ các bộ khung đánh giá do chính những bên bán chúng dựng nên, và cách hiểu hợp lý cho bất kỳ con số đơn lẻ nào ở trên là “đây là những gì nhà sản xuất đo được, trên tác vụ của nhà sản xuất.”
Điều mà cả hai dự án làm tốt, và hiếm khi làm, là công bố những điểm yếu của chính mình. RSI-Jev nêu tên năm nguồn ảnh phi thương mại đứng sau các bản phát hành vision của mình và nói thẳng rằng liệu các trọng số được huấn luyện trên chúng có kế thừa những điều khoản đó hay không vẫn chưa ngã ngũ; dự án báo cáo một hồi quy hiệu chuẩn trong bản phát hành mới nhất và gọi ngưỡng thoát mặc định của mình là chưa được xác nhận. Laya ghi nhận rằng các checkpoint cơ sở của mình nằm dưới mức cơ sở đa số, rằng các câu hỏi điểm số thứ bậc là thành phần cơ bản yếu nhất của nó, rằng noul của nó có thể bám theo nhãn lựa chọn của chính nó thay vì trạng thái, và rằng một trong các trường phản hồi của nó không mang tín hiệu nào dùng được. Sự trung thực đó là thứ hữu ích nhất để kế thừa từ một trong hai dự án: hãy kiểm tra các giá trị độ tin cậy trên những trường hợp có dán nhãn của riêng bạn trước khi bạn tự động hóa dựa trên chúng.

Nơi hợp đồng mà họ sao chép thực sự nằm ở
Cả hai mô hình này tồn tại là vì có một định dạng truyền tải đáng để sao chép. Jev của TypeSafe định nghĩa dạng thức của yêu cầu — state, questions, ba primitive có kiểu — và dạng thức của câu trả lời, và cả Laya lẫn RSI-Jev đều triển khai nó để một client sẵn có có thể hoạt động chỉ bằng cách đổi base URL. Mô hình tham chiếu đó, typesafe/jev-1.13, là mô hình duy nhất trong ba mô hình mà chúng tôi phục vụ: nó nằm trong danh mục của chúng tôi trên endpoint systemone chuyên dụng, một POST tới /v1/systemone, không streaming, với ngữ cảnh 65.536 token, ở mức 0,042 USD cho mỗi triệu token đầu vào và token đầu ra được tính phí bằng không. Cả Laya lẫn RSI-Jev đều không có trong danh mục của chúng tôi — cả hai đều là bản tải xuống, và đó chính là mục đích của chúng.
Phiên bản thực tiễn của điều đó quan trọng hơn bản so sánh. Các lớp quyết định hầu như không bao giờ đứng một mình trong một stack; chúng nằm cạnh một mô hình tạo sinh, thứ viết câu trả lời, bản tóm tắt hoặc mã nguồn. Việc có hợp đồng tham chiếu trên cùng một khóa với hơn 200 mô hình khác, với giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nghĩa là thay đổi giá từ nhà cung cấp đến với bạn ngay trong ngày, và failover tự động nghĩa là nửa tạo sinh của cặp đó không phải điểm lỗi duy nhất trong khi bạn xác định xem nửa quyết định rẻ đó có đủ tốt hay không. Nếu bạn quyết định rằng một bộ mã hóa 421M tự host hoặc một checkpoint 4.69B là lựa chọn đúng, bạn vẫn muốn hợp đồng mà nó sử dụng có thể truy cập được từ cùng một nơi — và nếu bạn không muốn chạy cả hai, mô hình mà cả hai đều sao chép chỉ cách một yêu cầu.
Tải cái nào
Chọn Laya nếu bạn có dữ liệu đã gán nhãn, một hệ thống phân loại ít thay đổi, và một hỗn hợp ngôn ngữ không chỉ toàn tiếng Anh. Nó đủ nhỏ để chạy nhiều bản, đủ nhanh để đặt trước mọi yêu cầu, và được thiết kế ngay từ đầu để tinh chỉnh — điểm tinh chỉnh 0,766 so với 0,362 zero-shot chính là toàn bộ lý lẽ. Hãy dự trù ngân sách cho lần chạy huấn luyện, việc gán nhãn và việc tái khớp temperature theo từng loại câu hỏi, thứ đưa sai số hiệu chuẩn của nó từ 0,466 xuống 0,081, và giữ các tập lựa chọn dưới khoảng hai mươi nhãn hoặc tăng ngân sách cho head trước khi bạn tin vào một bài toán phân loại quy mô lớn.
Chọn RSI-Jev v6.1-VL nếu bạn muốn một quyết định hoạt động mà không cần huấn luyện trước, nếu câu hỏi của bạn đôi khi liên quan đến một hình ảnh, nếu các tập tùy chọn của bạn lớn, hoặc nếu bạn muốn đánh đổi độ trễ để lấy độ sâu cho mỗi yêu cầu. Hãy mong đợi phải chạy một checkpoint 9.7 GB thay vì một checkpoint 400M, hãy mong đợi một dự án đã phát hành tám bản phát hành trong mười ba ngày và có thể phát hành thêm một bản nữa trong khi bạn đang đánh giá bản này, và hãy mong đợi phải tự kiểm tra hiệu chuẩn của nó — card của chính bản phát hành này nói rằng nó đã trở nên tệ hơn, chứ không phải tốt hơn.
Dù bạn chọn cái nào, hai điều sau vẫn đúng. Cả hai mô hình đều không sinh văn bản, nên cả hai không thể thất bại bằng việc phát ra một trường sai định dạng; cả hai đều trả về xác suất, và xác suất chính là phần phải được kiểm chứng theo từng triển khai thay vì lấy từ một card. Và cả hai đều đã chuyển câu hỏi thú vị về một lớp quyết định từ "API của ai" sang "trọng số của ai" — một câu hỏi hay hơn để đặt ra, và là câu hỏi mà cặp này trả lời rất khác nhau.

