
Laya so với Nimble: Dữ liệu tương phản so với một bộ mã hóa nhanh hơn
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Laya và Nimble là hai mô hình quyết định trọng số mở mà tác giả của chúng đã làm nhiều nhất để giải thích cách chúng được xây dựng, và những lời giải thích của họ bất đồng về việc khó khăn nằm ở đâu. Convai Innovations phát hành Laya vào ngày 18 tháng 9 năm 2026 theo Apache 2.0 — một checkpoint tiếng Anh ModernBERT-large 421M, một checkpoint đa ngôn ngữ mmBERT-base 322M bao phủ hơn 100 ngôn ngữ, một bộ định tuyến dưới một mili giây giữa chúng, và công bố p50 32,8ms cho mỗi quyết định trên Tesla T4. Bespoke Labs xây dựng Nimble như một bản tinh chỉnh LoRA trên Qwen3.5-9B, Apache 2.0, và mô tả nó là "Jev mã nguồn mở" — lấy cảm hứng từ Jev của TypeSafe AI nhưng không dùng trọng số, kiến trúc, cũng không dùng bản chưng cất từ đầu ra của nó. Câu trả lời của Convai cho vấn đề độ chính xác là tốc độ và một nền tảng có thể tinh chỉnh. Câu trả lời của Bespoke là dữ liệu huấn luyện. Sự khác biệt đó đáng được chú ý hơn khoảng cách độ chính xác ba điểm xuất hiện trong các bảng kết quả chính.
Tuyên bố mà mỗi dự án thực sự đang đưa ra
Tuyên bố của Laya mang tính kiến trúc. Nó phi tự hồi quy theo nghĩa chặt chẽ — một bộ mã hóa hai chiều, không có vòng lặp giải mã, không có JSON để phân tích cú pháp, không có khoảng trống để phát sinh văn bản nằm ngoài kiểu đã khai báo. Bảo đảm cấu trúc đó cũng chính là bảo đảm mà Jev đưa ra, nhưng đạt được từ một hướng khác, và nó thực sự có giá trị đối với bất kỳ ai từng viết logic thử lại xung quanh một mô hình đôi khi quên đóng dấu ngoặc nhọn. Cái giá phải trả là một bộ mã hóa 421M với cửa sổ 512 token và không có tiền huấn luyện tạo sinh phía sau thì không biết được nhiều lắm. Convai nói đúng như vậy trên thẻ mô hình: "Laya là một nền tảng nhanh để chuyên biệt hóa, không phải một cỗ máy quyết định zero-shot."


Luận điểm của Nimble là về dữ liệu. Phương pháp của Bespoke là tuyển chọn tương phản, được chuyển thể từ công trình Bespoke-MiniCheck trước đó của nhóm: viết hai ví dụ gần như giống hệt nhau nhưng khác ở một “sự kiện trọng tâm”, sao cho nhãn đúng bị đảo ngược. Quy trình có bốn bước được nêu — kiểm tra xem các quy tắc quyết định có thực sự có thể dẫn đến những câu trả lời khác nhau không, xây dựng cặp bằng cách thay đổi tối đa tám từ, xác minh cả hai ví dụ bằng các lệnh gọi mô hình riêng biệt cùng với kiểm tra loại bỏ từng câu, và tạo nhãn bằng mã trong khi chỉ giữ lại những cặp mà nhãn thực sự khác nhau. Mục tiêu không phải là nhiều ví dụ hơn mà là những ví dụ sắc bén hơn: buộc mô hình học xem bằng chứng nào nên thay đổi quyết định. Đó là một lý thuyết khác về lý do vì sao các mô hình quyết định nhỏ thất bại, và nó thú vị hơn so với việc có thêm một điểm độ chính xác.
Những gì mà các số liệu đã công bố thực sự ủng hộ
Nimble báo cáo mức đồng thuận 90,12% với nhãn tham chiếu trên 324 mẫu giữ lại, so với 93,21% của Jev, 66,36% của Qwen3.5-9B base chưa tinh chỉnh, và 84,88% của một Qwen3.8 27B chưa tinh chỉnh. Nó báo cáo trung vị khoảng 106ms trên H100 và trung vị 444ms trên M5 Pro với 64GB. Đó là các số liệu harness của chính Bespoke. Tập đánh giá 324 mẫu là phần cần cân nhắc kỹ lưỡng, và chính dự án đã nói rõ lý do: các mẫu trải dài trên sáu trong số mười họ nguồn huấn luyện, chúng được tạo và xác thực bởi các mô hình mà không có sự rà soát của con người, và do đó khả năng tổng quát hóa sang các danh mục chưa từng thấy là chưa được chứng minh. Khi một mô hình được huấn luyện bằng một phương pháp tuyển chọn dữ liệu và sau đó được đánh giá trên một tập chia giữ lại của chính phân phối đã được tuyển chọn đó, con số độ chính xác là một phát biểu về tính nhất quán nội tại của phương pháp, chứ không phải về lưu lượng của bạn.
Các con số của Laya lại đến từ thái cực đối lập. Trên benchmark typed-decisions của TypeSafe, nó đạt 0,362 ở chế độ zero-shot — mức ngẫu nhiên là 0,318, baseline lớp đa số là 0,461 — và 0,766 khi được tinh chỉnh trên chính tập huấn luyện của benchmark. Trên Banking77, với 77 nhãn, nó đạt 0,425 so với 0,870 của Jev, đây là minh họa rõ nét nhất cho mức trần nhiều lựa chọn của nó. Trên AG News với bốn nhãn, nó đạt 0,950 so với 0,910 của Jev; trên DAIR Emotion với sáu nhãn, 0,595 so với 0,480. Lỗi hiệu chuẩn của nó khi phát hành là 0,466 và giảm xuống 0,081 sau khi tái hiệu chỉnh temperature theo từng loại câu hỏi. Một bài kiểm thử của bên thứ ba với 100 tin nhắn khẩn cấp Mars-base cho thấy Jev đạt 100/100 và Laya đạt 53/100. Và trong một đánh giá agent-tool-call độc lập, Laya đạt recall từ chối 100% đối với các cuộc gọi nguy hiểm nhưng chỉ bằng cách gắn cờ mọi thứ, một thất bại về precision được ngụy trang thành thắng lợi về an toàn.
Đặt hai bộ số cạnh nhau và cách diễn giải trung thực là chúng được đo trên những thứ khác nhau. 90,12% của Nimble là tỷ lệ đồng thuận với các nhãn tham chiếu do chính nó tuyển chọn. 0,362 của Laya là một benchmark mà nó không tự xây dựng. Không con số nào có thể suy rộng.
Hiệu chuẩn: nơi duy nhất cả hai dự án đều thẳng thắn một cách bất thường.
Đây là nơi hai dự án gần nhau nhất về tinh thần và xa nhau nhất về kết quả.
README của Bespoke cảnh báo rõ rằng xác suất của Nimble là các logit được chuẩn hóa bằng softmax trên các ứng viên được cung cấp, không phải tỷ lệ đúng đã được hiệu chuẩn — mức 0,9 không có nghĩa là đúng 90%. Nó khuyến nghị thêm một tùy chọn "không có lựa chọn nào ở trên", vì nếu câu trả lời đúng không nằm trong số các ứng viên thì một trong số chúng vẫn giành chiến thắng. Trong một đánh giá mới hơn gồm 3.880 bản ghi trải rộng 13 tập con, Jev có lỗi hiệu chuẩn được báo cáo thấp hơn ở 11 trong 13 tập con và điểm Brier thấp hơn ở 10 trong 13. Vì vậy, mức đồng thuận nhãn tương tự không hàm ý chất lượng xác suất tương tự, và Bespoke cũng nói như vậy.
Công bố của Convai là hình ảnh phản chiếu: sai số hiệu chuẩn kỳ vọng 0,466 nằm trên thẻ mô hình, bên cạnh mức 0,081 mà việc tái khớp nhiệt độ theo từng loại câu hỏi tạo ra. Không dự án nào phát hành một mô hình mà bạn có thể hành động dựa trên độ tin cậy của nó mà không cần làm gì thêm. Cả hai đều nói với bạn điều đó bằng văn bản. Nếu bạn đang xây dựng một ngưỡng tin cậy — tự động phát hành khi trên 0,95, chuyển lên cấp trên khi dưới 0,7 — thì tài liệu từ cả hai tác giả đều đang nói với bạn cùng một điều: trước tiên hãy khớp ngưỡng trên dữ liệu gán nhãn của riêng bạn.
So sánh, theo từng khía cạnh
• Backbone — Laya: bộ mã hóa ModernBERT-large 421M, hai chiều, không tiền huấn luyện tạo sinh. Nimble: Qwen3.5-9B với tinh chỉnh LoRA, giữ nguyên nền tảng tạo sinh.
• Ngôn ngữ — Laya: 100+ thông qua checkpoint đa ngôn ngữ 322M. Nimble: Tiếng Anh.
• Ngân sách prompt — Laya: 512 token tiếng Anh, 1.024 đa ngôn ngữ. Nimble: tối đa 2.048 token mỗi prompt, chỉ dùng lược đồ phẳng, enum giới hạn ở 26 tùy chọn mỗi trường.
• Tốc độ — Laya: 32,8ms p50 trên T4, 7,2ms mỗi câu hỏi khi gộp lô 10. Nimble: trung vị khoảng 106ms trên H100, 444ms trên M5 Pro 64GB.
• Phần cứng — Laya: CPU, CUDA và Apple MPS; dưới một gigabyte thường trú trên bản chuyển MLX. Nimble: GPU CUDA BF16 cho các số liệu đã nêu, với các đường MLX và CUDA được hỗ trợ.
• Độ chính xác được báo cáo — Laya: 0,362 zero-shot, 0,766 sau tinh chỉnh, 0,425 trên Banking77. Nimble: 90,12% trên 324 mẫu held-out được tuyển chọn, so với 93,21% của Jev.
• Phương pháp — Laya: kiến trúc trước, tinh chỉnh theo từng triển khai. Nimble: tuyển chọn dữ liệu đối chiếu, công bố dưới dạng công thức.
• Giấy phép — Apache 2.0 cho cả hai.
Hai ràng buộc trong danh sách đó đáng để đọc lại hai lần trước khi bạn quyết định. Giới hạn 26 tùy chọn mỗi enum và mức trần prompt 2.048 token của Nimble là những giới hạn schema cứng, không phải sự suy giảm hiệu năng — nếu taxonomy của bạn có bốn mươi nhãn hoặc prompt của bạn mang theo một tài liệu dài, thì Nimble là công cụ không phù hợp bất kể độ chính xác của nó. Và Nimble chấm điểm từng trường một cách độc lập, nên bất kỳ quy tắc nhất quán giữa các trường nào — "nếu A đúng thì B phải sai" — đều phải nằm trong mã của bạn, chứ không phải trong mô hình.
Vì sao công thức dữ liệu là tạo tác có tính di động cao hơn
Đây là lập luận dành cho Nimble mà các bảng độ chính xác bỏ sót. Bespoke đã công bố quy trình tuyển chọn, chứ không chỉ các trọng số. Nếu bài toán quyết định của bạn có một hệ phân loại cố định và bạn có thể viết các quy tắc ra, thì phương pháp tương phản là thứ bạn có thể chạy trên dữ liệu của chính mình với các dữ kiện trọng tâm của chính mình, trên nền bất kỳ mô hình cơ sở nào bạn muốn. 9B LoRA là một minh chứng cho phương pháp này cũng như là một sản phẩm.
Tính khả chuyển của Laya thì khác và mang tính bổ trợ. Vì nó nhỏ, vì nó chạy trên CPU, và vì các bản chuyển sang ONNX và MLX tồn tại, Laya là mô hình mà bạn có thể đặt bên trong một tiến trình không có GPU và không có mạng. Trong một bài đánh giá chuẩn về tác nhân trình duyệt của bên thứ ba, Laya đã hoàn thành 0 trong số 50 nhiệm vụ và tuyên bố hoàn thành sớm trong 33 lần thử — nhưng các tác giả của bài đánh giá lưu ý rằng nó được huấn luyện cho công việc phán đoán như phiếu hỗ trợ, hóa đơn và đánh giá dấu vết tác nhân, chứ không phải điều hướng. Hãy đọc kết quả đó như một tuyên bố về phạm vi hơn là một phán quyết, và nó nhất quán với cách định hình của cả hai dự án: đây là các thành phần cho một lớp quyết định cụ thể, chứ không phải các tác nhân tổng quát.
Cả Laya lẫn Nimble đều không phải là mô hình được lưu trữ trên OrcaRouter. Cả hai đều là các trọng số mà bạn tự chạy, và không có gì trong bài viết này nên được hiểu là lời khẳng định rằng chúng tôi cung cấp chúng. Lý do sản phẩm định tuyến được nhắc đến xét cho cùng cũng chính là lý do nó xuất hiện trong bất kỳ kiến trúc mô hình quyết định nào: mô hình quyết định trả lời một lệnh gọi, còn ứng dụng xung quanh nó vẫn cần văn bản. Một pipeline dùng Nimble để chấm điểm xem một bản nháp có tuân thủ hay không và dùng Laya để định tuyến ngoại lệ vẫn sẽ cần một mô hình sinh để viết bản nháp. Việc giữ nửa phần sinh đó trên một endpoint tương thích OpenAI — hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với 0% markup nên việc nhà cung cấp giảm giá có hiệu lực ngay trong cùng ngày, tự động chuyển đổi dự phòng giữa các nhà cung cấp — nghĩa là lớp quyết định có thể được thay thế mà không cần đụng đến hợp đồng của lớp sinh.
Phán quyết, và thí nghiệm có thể thay đổi nó
Chọn Nimble nếu taxonomy của bạn cố định và hẹp, đầu vào là tiếng Anh và ngắn, bạn có GPU, và bạn muốn công thức dữ liệu nhiều như mô hình. Chọn Laya nếu bạn cần đầu vào đa ngôn ngữ, ngân sách dưới 40ms, hoặc một quy trình không có GPU nào cả — và hãy tính luôn chi phí tinh chỉnh ngay từ đầu, vì checkpoint zero-shot thấp hơn cả baseline tầm thường và thẻ mô hình cũng nói vậy.
Thí nghiệm có thể giải quyết chuyện này là một đánh giá theo cặp trên lưu lượng thực: cùng đầu vào, cùng tập tùy chọn, cùng ngưỡng độ tin cậy, được đánh giá dựa trên nhãn do con người gán, kèm một biểu đồ độ tin cậy cho mỗi bên. Tài liệu của chính Nimble cảnh báo rằng xác suất của nó không phải là tỷ lệ đúng, và thẻ mô hình của Laya báo cáo sai số hiệu chuẩn là 0,466 trước khi tái khớp, nên biểu đồ đó chính là thứ sẽ thực sự cho bạn biết nên đưa mô hình nào ra trước vận hành thực tế. Không dự án nào đã công bố một biểu đồ như vậy, và cũng không dự án nào công bố biểu đồ của dự án kia. Hãy tạo nó trên dữ liệu của chính bạn trước khi bạn đặt ngưỡng.

