Một thẻ tiêu đề được tạo cho so sánh Laya với von, mang phụ đề của chính bài viết này và một dòng chân trang nêu rõ số liệu của bên nào là do nhà cung cấp báo cáo và bên nào là của bên thứ ba.
Engineering & Research

Laya vs von: Khi chuẩn đối sánh nhà cung cấp không chuyển giao được

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một tác vụ phân loại loại commit với sáu nhãn khả dĩ, trong đó đoán mò được 8.3% và von đạt 26.7%. Một tác vụ định tuyến tệp trong đó cùng mô hình đạt 8.8%, chỉ nhỉnh hơn mức ngẫu nhiên. Một tác vụ nhị phân về độ rộng thay đổi với AUC 0.513, tức là như tung đồng xu. Những con số đó đến từ đánh giá của bên thứ ba về von — mô hình System One mã nguồn mở của wfzyx, một bộ mã hóa ModernBERT-Large 395M được phát hành theo Apache 2.0 vào ngày 18 tháng 9 năm 2026, cùng ngày với Laya của Convai Innovations. Trên chuẩn đánh giá jabr v2 của chính von, bức tranh lại ngược lại: độ chính xác macro 71.5% trên 49 tác vụ và 869 trường hợp, định tuyến lựa chọn đạt 83.4%, và kết quả ViZDoom là 9.38 mạng hạ trung bình ở dưới 18ms, so với Jev của TypeSafe AI với 5.62 mạng hạ và khoảng 115ms. Cả hai bộ số đều là thật. Khoảng cách giữa chúng là điều hữu ích nhất mà bất kỳ ai đã công bố về nhóm mô hình này, và nó cũng áp dụng cho Laya.

Hai mô hình, hai backbone, một kiểu thất bại chung

von và Laya gần như là hàng xóm về mặt kiến trúc, đó là lý do bài toán chuyển đổi chính là lăng kính phù hợp để so sánh hai bên. Cả hai đều là encoder phi tự hồi quy xây dựng trên ModernBERT: von với 395M tham số, checkpoint tiếng Anh của Laya với 421M. Cả hai đều phơi ra cùng ba primitive — choice từ một danh sách được cung cấp, score trên một rubric có thứ tự, noul như một xác suất "có" đã được hiệu chỉnh — và cả hai đều hiện thực định dạng truyền tải /v1/systemone để một client viết cho Jev của TypeSafe có thể trỏ tới một server cục bộ thay thế. Cả hai đều dùng Apache 2.0. Cả hai trả về xác suất thay vì văn bản, và không bên nào có vòng lặp giải mã để mà ảo giác.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Sự khác biệt nằm ở câu chuyện huấn luyện. von được tiền huấn luyện trên 2 nghìn tỷ token văn bản web tổng quát, tài liệu kỹ thuật và mã, sau đó được tinh chỉnh trên kho ngữ liệu đa miền cân bằng gồm khoảng 290.000 ví dụ bao gồm quy trình vận hành và doanh nghiệp, bảo mật và DevOps, an toàn và kiểm duyệt chính sách, ngôn ngữ học, phân loại ưu tiên, và lập luận đối kháng. Hậu huấn luyện sử dụng Học tăng cường với Phân phối Hiệu chuẩn, tối thiểu hóa một tổ hợp của entropy chéo và điểm Brier với lambda bằng 0.5, và chia tỷ lệ nhiệt độ hội tụ tại T=1.1692. Checkpoint tiếng Anh của Laya là ModernBERT-large được tinh chỉnh cho dạng quyết định có kiểu, với cửa sổ 512 token, cùng với một checkpoint đa ngôn ngữ mmBERT-base 322M bao phủ hơn 100 ngôn ngữ đằng sau một bộ định tuyến, và một p50 32.8ms được công bố cho mỗi quyết định trên Tesla T4.

Kiểu thất bại chung là cả hai đều là bộ mã hóa để tạo ra một đầu đọc, chứ không phải bộ suy luận. README của chính von nói rõ rằng nó nhắm tới các pipeline nhạy cảm với độ trễ, nơi các mô hình tự hồi quy gây ra độ trễ 500–2.000 ms và các lỗi phân tích cú pháp lược đồ không tất định. Cách đóng khung đó cho bạn biết nó dùng để làm gì: phân loại nhanh, tất định, được hiệu chỉnh về mặt thống kê. Nó không cho bạn biết rằng nó sẽ hoạt động trên bài toán phân loại của bạn, và benchmark độc lập chính là điều xảy ra khi có người kiểm tra.

Đọc một cách trung thực bài benchmark của chính von

Kết quả jabr v2 do chủ sở hữu công bố và chưa được kiểm toán độc lập, và cấu trúc của benchmark quan trọng ngang với điểm số. Bốn mươi chín tác vụ và 869 ca là độ bao quát hợp lý cho một đánh giá mô hình ra quyết định, và độ chính xác macro 71,5% là một con số mạnh đối với một encoder 395M. Phần phân tích theo từng lĩnh vực mới là nơi thông tin trở nên hữu ích: phân loại ưu tiên triệu chứng đạt 100,0%, dịch vụ tại nhà đạt 95,7%, định tuyến thành phố đạt 94,7%, định tuyến lựa chọn nói chung đạt 83,4%. Đó là những tác vụ mà kho ngữ liệu huấn luyện được xây dựng xoay quanh — README mô tả dữ liệu tinh chỉnh là các quy trình vận hành và doanh nghiệp, bảo mật và DevOps, an toàn và kiểm duyệt chính sách, ngôn ngữ học, phân loại ưu tiên và suy luận đối kháng. Điểm cao ở phân loại ưu tiên triệu chứng là một lời khẳng định rằng mô hình đã học được miền phân loại ưu tiên, chứ không phải rằng nó đã học cách phân loại.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

Kết quả ViZDoom là kết quả được trích dẫn nhiều nhất, và nó xứng đáng được đọc kỹ. Trung bình 9,38 mạng hạ gục trong “Defend the Center,” tám seed, zero-shot từ văn bản cảnh có cấu trúc, ở độ trễ dưới 18ms, so với 5,62 mạng hạ gục của Jev ở khoảng 115ms — một cải thiện +66,9%. Đây là một kết quả ấn tượng và nó cũng là một môi trường trò chơi được điều khiển bởi văn bản có cấu trúc, nơi một chính sách phản xạ nhanh chính xác là hình dạng phù hợp. Cách dự án đóng khung mô thức System One — phản xạ, song song, tất định, được hiệu chỉnh về mặt thống kê — là một mô tả thỏa đáng về những gì nhiệm vụ đó thưởng cho.

Sau đó, đánh giá của bên thứ ba đã chạy von trên phân loại loại commit, định tuyến tệp, phát hiện tính năng và chấm điểm độ rộng thay đổi, và nó thua các baseline từ khóa cùng regex ở một số hạng mục. AUC 0,513 trên tác vụ nhị phân là con số đáng chú ý nhất: một cú tung đồng xu, từ một mô hình mà hiệu chỉnh của nó được tinh chỉnh ở T=1.1692 và README của nó tuyên bố sai số hiệu chỉnh kỳ vọng gần lý tưởng. Cả hai điều đều có thể đúng. Một mô hình có thể được hiệu chỉnh tốt trên phân phối mà nó được huấn luyện và vô dụng trên một phân phối nó chưa từng thấy — và thực tế, hiệu chỉnh tốt trên sai phân phối còn tệ hơn hiệu chỉnh dở rõ ràng, vì các con số độ tin cậy trông đáng tin.

Cùng một bài kiểm tra được áp dụng cho Laya

Laya đã từng được áp dụng một phiên bản của cách xử lý này, và các kết quả nhất quán với kết quả của von. Trên bài kiểm chuẩn typed-decisions của TypeSafe, Laya đạt 0,362 zero-shot so với 0,318 của ngẫu nhiên và 0,461 của đường cơ sở lớp đa số — gần với mức ngẫu nhiên hơn là với câu trả lời tầm thường. Thẻ mô hình của chính nó nêu kết luận: "Laya là một nền tảng nhanh để chuyên biệt hóa, không phải là một cỗ máy ra quyết định zero-shot." Vượt quá khoảng hai mươi lựa chọn, nó suy giảm mạnh, đạt 0,425 trên Banking77 so với 0,870 của Jev. Trên 100 tin nhắn khẩn cấp Mars-base trong một bài kiểm tra của bên thứ ba, Jev đạt 100/100 và Laya đạt 53/100. Trong một bài kiểm chuẩn tác nhân trình duyệt, nó hoàn thành 0 trong 50 nhiệm vụ, tuyên bố hoàn thành sớm trong 33 lần thử, 17 trong số đó là trước khi thực hiện bất kỳ hành động nào — mặc dù các tác giả bài kiểm chuẩn lưu ý rằng nó được huấn luyện cho công việc phán đoán như phiếu hỗ trợ và hóa đơn, chứ không phải điều hướng, điều này là một tuyên bố về phạm vi hơn là một phán quyết.

Điểm khác biệt giữa Laya và von nằm ở những gì nó tự nhận về mình. Convai đã công bố con số zero-shot không mấy đẹp và sai số hiệu chuẩn kỳ vọng 0.466 trên card, bên cạnh 0.081 mà việc tái khớp nhiệt độ theo từng loại câu hỏi tạo ra. README của von công bố con số jabr v2 đẹp đẽ và chiến thắng ViZDoom. Cả hai dự án đều trung thực về những gì họ đã làm; chỉ một trong hai dẫn đầu bằng một benchmark nơi mô hình làm kém. Đó là một quan sát về nguồn dẫn, không phải một lời buộc tội — nhưng nếu bạn đang chọn giữa hai dự án dựa trên bằng chứng đã công bố, hãy lưu ý rằng bạn đang so sánh một dự án đã cho bạn thấy con số yếu của nó với một dự án mà bạn phải tìm con số yếu của nó ở nơi khác.

Đối chiếu thông số kỹ thuật, theo từng khía cạnh

• Backbone — Laya: ModernBERT-large 421M tiếng Anh, mmBERT-base 322M đa ngôn ngữ. từ: ModernBERT-Large 395M.

• Ngôn ngữ — Laya: hơn 100 thông qua checkpoint đa ngôn ngữ và một router. von: tiếng Anh, không có checkpoint đa ngôn ngữ nào được công bố.

• Cửa sổ ngữ cảnh — Laya: 512 token tiếng Anh, 1.024 đa ngôn ngữ. von: không được công bố theo cùng các điều khoản; các ca jabr v2 là những quyết định có cấu trúc ngắn gọn.

• Độ trễ — Laya: 32,8ms p50 trên T4, 7,2ms mỗi câu hỏi ở batch 10. von: được cho là từ dưới 15ms đến dưới 25ms, dưới 18ms trong lần chạy ViZDoom.

• Độ chính xác được báo cáo — Laya: 0,362 zero-shot, 0,766 sau tinh chỉnh trên phân chia của chính benchmark, 0,425 trên Banking77. von: 71,5% macro trên 49 tác vụ của jabr v2, 83,4% định tuyến lựa chọn, và 26,7% ở loại commit trong một bài kiểm tra độc lập.

• Hiệu chuẩn — Laya: ECE 0,466 khi phát hành, 0,081 sau khi tinh chỉnh lại nhiệt độ theo từng loại câu hỏi. von: nhiệt độ được điều chỉnh tỷ lệ thành T=1,1692 trong quá trình hậu huấn luyện RLCD, tuyên bố ECE gần lý tưởng trên phân phối của chính nó.

• Phục vụ — Laya: pip install laya, cùng với các bản chuyển port cộng đồng cho ONNX, Go và Apple MLX. von: các SDK Python và TypeScript, máy chủ HTTP qua von serve, các preset đóng gói sẵn cho phân loại ticket, bảo mật email, kiểm duyệt và phân loại sự kiện bảo mật.

• Phần cứng — Laya: CPU, CUDA và Apple MPS. của: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS và CPU đa luồng.

• Giấy phép — Apache 2.0 cho cả hai.

Phần của von thực sự đặc biệt

Các mẫu kết hợp của von là thứ ít được bàn đến nhất trong kho của nó. Confidence gating, route dispatch, composite scoring và two-stage routing được cung cấp dưới dạng các mẫu có tên gọi, song hành cùng các preset — phân loại ticket, bảo mật email, kiểm duyệt, phân loại sự kiện bảo mật — và chúng mã hoá kiến trúc mà một mô hình ra quyết định thực sự cần trong môi trường production. Một lệnh gọi choice đơn lẻ hiếm khi là toàn bộ hệ thống; hình dạng hữu ích là một router giai đoạn đầu rẻ tiền, chuyển tiếp đến một giai đoạn hai chuyên biệt, với một cổng tin cậy giúp leo thang các trường hợp không chắc chắn. von cung cấp điều đó như một mẫu đã được tài liệu hoá thay vì để bạn tự lo liệu.

Điều đó khớp gọn gàng với những gì OrcaRouter làm ở phía tạo sinh, và điều này đáng nói thẳng ra vì hai nửa của mô hình này thường do các nhóm khác nhau xây dựng. Cả von lẫn Laya đều không được lưu trữ trên OrcaRouter — cả hai đều là các trọng số mà bạn tự tải về và chạy — và không có gì ở đây nên được hiểu như một tuyên bố rằng chúng tôi cung cấp chúng. Thứ nằm trong danh sách của chúng tôi là nửa còn lại: hơn 200 mô hình tạo sinh nằm sau một khóa duy nhất tương thích với OpenAI, với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn với mức markup 0%, nên khi nhà cung cấp giảm giá, hóa đơn của bạn nhận được mức giá mới ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn. Nếu cổng độ tin cậy của von quyết định rằng 4% số yêu cầu cần đến một mô hình tiên tiến, thì routing DSL chính là thứ kết hợp quyết định đó thành một lệnh gọi duy nhất thay vì hai hợp đồng và hai SDK, và cơ chế chuyển đổi dự phòng tự động chính là thứ giữ cho nhánh đắt đỏ không trở thành một điểm lỗi duy nhất.

Làm gì với hai mô hình đều thất bại ngoài phân phối huấn luyện của chúng

Kết luận thực tiễn từ việc đánh giá von không phải là von là một mô hình tồi. Mà là độ chính xác được công bố của một mô hình ra quyết định là một tuyên bố về phân phối huấn luyện của nó, và cách duy nhất để biết liệu vấn đề của bạn có nằm trong phân phối đó hay không là kiểm thử nó. Bảng benchmark trong README của chính von so sánh nó với GLiNER2, một Qwen3.5 4B được tinh chỉnh, Laya, và Jev của TypeSafe về kích thước, độ chính xác, độ trễ và hosting — một bảng hữu ích, và cũng là một bảng mà mọi mục độ chính xác ngoại trừ một mục đều đến từ khung đánh giá của chính tác giả.

Giữa hai lựa chọn: hãy chọn von nếu bạn muốn một tập hợp các domain đã công bố rộng hơn, dấu chân (footprint) nhỏ hơn một chút, các mẫu phục vụ dựng sẵn cho phân loại ưu tiên và kiểm duyệt, cùng bằng chứng ViZDoom rằng nó xử lý tốt các quyết định trên văn bản có cấu trúc một cách nhanh chóng. Hãy chọn Laya nếu bạn cần đầu vào đa ngôn ngữ — von không có checkpoint đa ngôn ngữ và biến thể mmBERT 322M của Laya bao phủ hơn 100 ngôn ngữ — hoặc nếu con số 32.8ms trên T4 và cửa sổ tiếng Anh 512 token phù hợp với khối lượng công việc của bạn. Đừng chọn cả hai mà không dành một buổi chiều để gán nhãn vài trăm ví dụ từ lưu lượng của chính bạn và chạy cả hai đối chiếu với chúng. Tài liệu của chính cả hai dự án đều chỉ bạn đến thử nghiệm đó, và kết quả từ bên thứ ba về von chính là điều xảy ra khi không ai chạy nó.

Điều duy nhất có thể thay đổi so sánh này là một đánh giá theo cặp trên cùng dữ liệu đầu vào với biểu đồ độ tin cậy cho từng mô hình. Điều đó không tồn tại. Cho đến khi nó tồn tại, cách xếp hạng trung thực là theo chất lượng bằng chứng chứ không phải theo điểm số: Laya đã công bố con số tệ nhất của mình, von đã công bố con số tốt nhất của mình, và bài kiểm tra độc lập về von là thứ gần nhất mà cả hai có được với một kiểm chứng từ bên ngoài.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."