Một thẻ tiêu đề được tạo cho Microsoft-Decision-1 so với L, có phụ đề 'mức độ bao phủ ngôn ngữ so với độ dài ngữ cảnh', với các chip ghi 25 ngôn ngữ được hỗ trợ so với hơn 100 ngôn ngữ, ngữ cảnh 32.768 token so với cửa sổ 1.024 token, chỉ API được lưu trữ so với trọng số Apache-2.0, và phần chân trang ghi chú rằng số liệu của cả hai nhà cung cấp đều do họ tự báo cáo.
Engineering & Research

Microsoft-Decision-1 so với Laya: 25 ngôn ngữ đằng sau một API, hơn 100 ngôn ngữ đằng sau bản tải xuống 322MB

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đếm số ngôn ngữ thì cuộc so sánh xem như đã ngã ngũ. Microsoft-Decision-1, được cung cấp rộng rãi trên Microsoft Foundry kể từ ngày 8 tháng 10 năm 2026, liệt kê 25 ngôn ngữ được hỗ trợ và nói thẳng rằng độ bao phủ, chất lượng và độ hiệu chuẩn "có thể thay đổi tùy theo ngôn ngữ", đồng thời nêu rõ các ngôn ngữ phi tiếng Anh và đặc biệt là những ngôn ngữ ít tài nguyên là một lĩnh vực hoạt động kém. Laya, do Convai Innovations công bố ngày 18 tháng 9 năm 2026 theo giấy phép Apache 2.0, tự mô tả là đa ngôn ngữ với hơn 100 ngôn ngữ và báo cáo rằng 45 trong số 51 ngôn ngữ được kiểm thử vẫn dùng được khi có định tuyến, so với 23 trong số 51 ở người anh em chỉ hỗ trợ tiếng Anh của nó. Một bên là mô hình 9B nằm sau một endpoint Azure với ngữ cảnh 32.768 token; bên kia là bộ phân loại 421 triệu tham số chạy ở tốc độ 32,8 mili giây mỗi quyết định trên một chiếc Tesla T4 duy nhất, miễn phí. Cả hai đều không chịu viết ra một token nào và cả hai đều trả về xác suất trên các lựa chọn do bạn định nghĩa.

Nhưng hãy đọc trọn vẹn cả hai model card, và số lượng ngôn ngữ sẽ không còn là con số thú vị nữa. Thứ đáng chú ý là câu chuyện hiệu chuẩn đằng sau nó, và hai dự án kể câu chuyện đó theo những hướng trái ngược nhau.

Laya công bố con số khiến hoạt động tiếp thị của chính mình trở nên khó xử.

Thẻ mô hình Laya nêu rõ, trong phần giới hạn của chính nó, rằng các checkpoint cơ sở đạt 0,362 zero-shot trên benchmark typed-decisions — thấp hơn mức cơ sở 0,461 của lớp đa số. Đó là một thẻ đang nói với bạn rằng mô hình của nó còn tệ hơn cả việc đoán "câu trả lời phổ biến nhất" trong bài kiểm tra đó. Nó cũng nêu rằng các checkpoint cơ sở gần như chỉ ở mức ngẫu nhiên khi zero-shot, rằng con số 0,766 được nhấn mạnh cho typed-decisions đòi hỏi phải tinh chỉnh trên chính split của benchmark đó, rằng thứ tự điểm câu hỏi là tác vụ nguyên thủy yếu nhất (SST-5 0,372), rằng các câu hỏi lựa chọn có cardinality cao bị ảnh hưởng vì 77 lựa chọn chỉ còn khoảng ba hoặc bốn token mỗi lựa chọn, rằng noul có thể tuân theo nhãn của chính nó, và rằng action.act_probability trường "chưa mang tín hiệu nào có thể dùng được" ở AUROC 0,30. Câu tóm tắt của chính Convai là câu cần mang vào mọi đánh giá: Laya là một mô hình cơ sở nhanh để chuyên biệt hóa, không phải một cỗ máy ra quyết định zero-shot.

Sự thẳng thắn đó có giá trị hơn vẻ bề ngoài, vì nó cho bạn biết chính xác Laya dùng để làm gì. Đây là một encoder mà bạn tinh chỉnh trên nhãn của riêng mình — toàn bộ kiến trúc được xây dựng sao cho các schema mới không cần huấn luyện lại, nhưng để đạt hiệu suất tốt trên một tác vụ thì có. Dùng theo cách đó, các con số đã công bố rất mạnh: 0.766 so với 0.727 của Jev trên các quyết định có kiểu sau fine-tuning, AG News 0.950 so với 0.910, DAIR Emotion 0.595 so với 0.480, và ECE 0.081 so với 0.246 của Jev — kèm ghi chú trung thực rằng nó xuất xưởng với độ tự tin quá cao và cần hiệu chỉnh lại temperature, điều này đưa ECE trung bình từ 0.466 xuống 0.081.

Microsoft công bố phương pháp luận và giữ kín kết quả.

Trang Foundry của Microsoft-Decision-1 thực hiện cùng một bài kiểm tra theo hướng ngược lại. Nó mô tả chi tiết quá trình đánh giá — các chuẩn đánh giá quyết định công khai và cộng đồng cùng với các tập nội bộ được giữ lại, các chỉ số bao gồm độ chính xác và sai số hiệu chuẩn, thứ tự lựa chọn được thay đổi, các kiểm định thống kê theo cặp, cùng một khung đánh giá cho các mô hình được so sánh — và báo cáo rằng mô hình "hoạt động ngang tầm với các mô hình quyết định hàng đầu và vượt trước các mô hình quyết định mở khác được đánh giá bằng cùng một phương pháp." Nó nêu tên các lĩnh vực mạnh của mình (lập luận, áp dụng quy tắc, khả năng chống chịu với định dạng lời nhắc) và các lĩnh vực yếu (kiến thức chuyên ngành, phi tiếng Anh).

Và sau đó nó không in ra gì cả. Không có con số độ chính xác, không có lỗi hiệu chuẩn, không có bảng theo từng benchmark. Những hạn chế tự báo cáo là có thật và hữu ích — điểm số thay đổi theo cách diễn đạt và thứ tự lựa chọn, một câu hỏi được đặt vấn đề kém vẫn trả về điểm, hiệu chuẩn mạnh nhất ở các loại tác vụ quen thuộc, không có giải thích nào được tạo ra — nhưng một danh sách hạn chế không phải là một phép đo. Vậy nên sự đánh đổi này rõ ràng một cách bất thường: Laya cho bạn những con số mà bạn có thể cố gắng bác bỏ bằng dữ liệu của chính mình, còn Microsoft cho bạn một tư thế tuân thủ và một ngữ cảnh 32K mà bạn có thể đưa một tài liệu dài vào.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Sự khác biệt về kích thước thực sự mang lại điều gì

Sự nhỏ gọn của Laya ở đây không phải là một sự thỏa hiệp, mà chính là thiết kế. Bởi vì mỗi lựa chọn được chấm điểm tại token [MASK] riêng của nó và được softmax trên các lựa chọn của câu hỏi đó, không gian câu trả lời được lắp ráp tại thời điểm yêu cầu thay vì được tích hợp sẵn vào một đầu từ vựng — đó là lý do vì sao một lược đồ bạn phát minh ra vào chiều nay không cần huấn luyện lại, và vì sao mô hình nằm gọn trong 322 đến 421 triệu tham số. Checkpoint đa ngôn ngữ chạy nhanh hơn khoảng 2,2 lần so với bản tiếng Anh, bộ định tuyến phát hiện hệ chữ trong chưa đầy nửa mili giây, và thông lượng theo lô đạt 103 đến 332 câu hỏi mỗi giây trên một T4. Với một khối lượng công việc chấm điểm mọi ticket, mọi tài liệu được truy xuất hoặc mọi hành động được đề xuất, thông lượng đó mới là tính năng, chứ không phải số lượng tham số.

Những chi phí của thiết kế đó cũng cụ thể không kém và đáng được nêu ra khi đặt cạnh phương án thay thế của Microsoft. Checkpoint tiếng Anh có cửa sổ 512 token; bản đa ngôn ngữ là 1.024, có thể mở rộng tới 8K. Microsoft-Decision-1 dùng 32.768. Một chuỗi hỗ trợ dài, một hợp đồng trọn vẹn hay một tài liệu chính sách nhiều trang hoàn toàn không vừa với cửa sổ của Laya, và tốc độ nhanh đến đâu cũng không bù đắp được cho việc bị cắt ngắn. Laya trả lời một bộ câu hỏi cho mỗi lượt truyền xuôi (forward pass) với ngân sách token được ghi rõ cho từng tùy chọn; Microsoft ghi nhận một lần gọi duy nhất trên tối đa 32K token mà không có giới hạn trần cho từng câu hỏi. Và điểm yếu cạnh tranh của Laya với tư cách một bộ phân loại cũng đáng để biết: nó đạt 0,425 trên Banking77 so với 0,870 của Jev, đây đúng là kiểu bài toán ý định có độ chi tiết cao, số lượng lớp lớn, nơi một lượt chuyên biệt hóa có ý nghĩa quan trọng nhất.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

So sánh chi phí không theo token

Laya miễn phí tại thời điểm sử dụng — tự vận hành (self-hosted), Apache 2.0, được niêm yết với chi phí tự vận hành là "$0" — và cái giá thực sự của nó là lần chạy tinh chỉnh mà bạn phải bỏ ra trước khi nó giỏi ở tác vụ của bạn. Microsoft-Decision-1 là một Foundry API được lưu trữ với mức giá theo token không được ghi trên trang mô hình, không có trọng số để tải về, không có lộ trình tinh chỉnh, và suy luận theo lô bị vô hiệu hóa. Một bên là một dự án gán nhãn dữ liệu trả trước, bên kia là một lệnh gọi tính theo mức dùng. Cái nào rẻ hơn phụ thuộc hoàn toàn vào khối lượng, và điểm giao nhau thì cao: một encoder 421M đạt 300 mục mỗi giây trên một chiếc T4 thuê được thì rất khó bị đánh bại tính theo mỗi quyết định một khi nó đã được huấn luyện.

Đây là chỗ OrcaRouter khẳng định vị trí của mình trong một pipeline được xây dựng trên một trong hai mô hình, và chỉ ở phía sinh tạo. Chúng tôi không host Microsoft-Decision-1 lẫn Laya: cả hai đều trả về xác suất thay vì văn bản, không mô hình nào nằm trong danh mục của chúng tôi, và một endpoint chấm điểm không phải là đích chat-completions. Thứ chúng tôi thực sự cung cấp là mô hình tạo ra đối tượng được chấm điểm — bản trả lời nháp, lệnh gọi công cụ được đề xuất, câu trả lời ứng viên mà đầu tinh chỉnh của Laya sau đó đánh giá. Đó là hơn 200 mô hình đằng sau một khóa API tương thích OpenAI duy nhất theo giá niêm yết của nhà cung cấp, chuyển thẳng với 0% markup, với tự động chuyển đổi dự phòng khi một đường phục vụ suy giảm. Trong một vòng lặp chấm điểm mọi thứ nó tạo ra, lệnh gọi sinh tạo là phần có thể gặp sự cố, và chuyển đổi dự phòng là thứ giữ cho hàng đợi chấm điểm luôn được cấp việc.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Chọn cái nào?

Hãy chọn Laya nếu các quyết định của bạn đến bằng nhiều ngôn ngữ, nếu khối lượng của bạn đủ lớn để việc tính giá theo token trở nên quan trọng, nếu bạn có nhãn và một tuần để tinh chỉnh, hoặc nếu bạn cần chạy chấm điểm trên phần cứng nằm trong ranh giới của riêng bạn. Hãy chấp nhận cửa sổ 512 đến 1.024 token và thực tế rằng checkpoint cơ sở sẽ gần như ngẫu nhiên cho đến khi bạn chuyên biệt hóa nó, và bạn sẽ có một mô hình ra quyết định trung thực về việc chỉ là một điểm khởi đầu.

Hãy chọn Microsoft-Decision-1nếu đầu vào của bạn là các tài liệu dài thay vì ticket, nếu cổng triển khai của bạn là xác thực Azure, hóa đơn hợp nhất và một gói Responsible AI thay vì một bản tải xuống, nếu 25 ngôn ngữ đủ bao phủ lưu lượng của bạn, hoặc nếu bạn không muốn tự sở hữu mô hình. Hãy chấp nhận rằng bạn sẽ phải tự vẽ đường cong hiệu chuẩn đầu tiên của nó, và dành ra một buổi chiều trên một mẫu đã gán nhãn để làm việc đó — bởi vì khác với Laya, cái này sẽ không đưa sẵn cho bạn một con số ECE để mà tranh cãi.