
Laya được giải thích: Một mô hình quyết định trả lời mà không viết một token nào
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Điều thú vị nhất ở Laya không phải là tốc độ của nó. Mà là việc mỗi tùy chọn bạn đưa cho nó đều được chấm điểm tại token [MASK] riêng của nó, rồi xác suất sau đó được đưa qua softmax trên các tùy chọn của chính câu hỏi đó. Convai Innovations đã công bố trọng số của Laya trên Hugging Face vào ngày 18 tháng 9 năm 2026, theo Apache 2.0 — ba checkpoint, một kho lưu trữ, 421 triệu tham số cho mô hình tiếng Anh. Không có token đầu ra. Không có vòng lặp giải mã, không có JSON để phân tích cú pháp, không có dấu ngoặc nhọn nào để quên đóng. Bạn đưa cho nó một trạng thái và một tập câu hỏi có kiểu, và sau một lượt truyền xuôi, bạn nhận được một lựa chọn giữa các tùy chọn có tên, một điểm thứ tự kèm mức dự kiến, hoặc một xác suất rằng một phát biểu là đúng. Thiết kế đó có một hệ quả mà người ta thường bỏ sót: vì không gian đáp án được lắp ghép theo từng yêu cầu thay vì cố định trong một đầu ra từ vựng, nên một schema bạn nghĩ ra chiều nay không cần huấn luyện lại. Nó cũng có một giới hạn, và dự án nói thẳng điều đó trên chính thẻ mô hình của mình: các checkpoint cơ sở đạt 0,362 trên bộ đánh giá typed-decisions, so với 0,318 khi đoán ngẫu nhiên và 0,461 khi luôn trả lời lớp đa số. Câu của chính Convai là câu bạn nên giữ trong đầu — "Laya là một mô hình nền nhanh để chuyên biệt hóa, không phải một cỗ máy ra quyết định zero-shot." Điểm so sánh hiển nhiên là Jev của TypeSafe AI, một mô hình System One dạng dịch vụ, không công bố trọng số, không công bố số tham số và không công bố mô hình cơ sở. Laya là câu trả lời trọng số mở cho nó. Việc câu trả lời đó có hữu ích với bạn hay không phụ thuộc gần như hoàn toàn vào việc bạn đang cố thay thế nửa nào của pipeline.
Laya thực sự là gì, và không phải là gì
Hãy bắt đầu với điều phủ định, vì đó là chỗ mà hầu hết các bài viết mắc sai. Laya không phải là một LLM. Nó phi tự hồi quy: một lượt lan truyền xuôi duy nhất tạo ra câu trả lời, và mô hình không bao giờ phát ra văn bản. So sánh độ trễ của nó với số token mỗi giây của một mô hình trò chuyện là so sánh hai thao tác khác nhau — một cái phân loại, cái kia tạo sinh. Nếu bạn cần một đoạn văn, một bản tóm tắt, một kế hoạch, hay một chuỗi lập luận, Laya không thể đưa cho bạn và cũng không cố làm vậy.
Nó là gì: một bộ mã hóa hai chiều với một đầu quyết định gắn thêm lên trên. Checkpoint tiếng Anh là ModernBERT-large — 395M tham số, được tinh chỉnh hoàn toàn — cộng với một đầu được huấn luyện từ đầu gồm hai lớp transformer, một bộ chấm điểm dấu tùy chọn, và một đầu act/escalate, tổng cộng 421M. Checkpoint đa ngôn ngữ thay thế xương sống bằng mmBERT-base, 22 lớp và từ vựng 256k, tổng cộng 322M. Ba checkpoint được cung cấp trong cùng một kho lưu trữ, và chỉ cái bạn yêu cầu được tải xuống:
• convaiinnovations/laya — ModernBERT-large, 421 triệu tham số, ngữ cảnh 512 token, tiếng Anh, khoảng 808 MB trên đĩa.
• convaiinnovations/laya-multilingual — mmBERT-base, 322M tham số, ngữ cảnh 1.024 token (bộ mã hóa hỗ trợ tới 8.192 token với RoPE), hơn 100 ngôn ngữ, nhanh hơn khoảng 2,2 lần, khoảng 647 MB.
• convaiinnovations/laya-typed-decisions — ModernBERT-large, 421 triệu tham số, ngữ cảnh 1.024 token, và là mô hình duy nhất trong ba mô hình mang con số 0,766 mà bạn sẽ thấy được trích dẫn ở khắp mọi nơi.
Một Router nằm ở phía trước và chọn checkpoint cho từng yêu cầu bằng cách phát hiện hệ chữ và ngôn ngữ trong chưa đầy nửa mili giây, bằng Python thuần, trước khi bất kỳ lượt lan truyền xuôi nào diễn ra. Đó không phải là một tính năng tiện lợi. Đó là một tính năng đảm bảo tính đúng đắn, và chính bằng chứng của dự án cho thấy lý do: checkpoint tiếng Anh đạt độ chính xác 0.000 trên tiếng Khmer trong khi báo cáo độ tự tin 0.952. Một mô hình vẫn giữ độ tự tin trong khi hoàn toàn sai chính là trường hợp mà việc chặn theo độ tự tin không thể cứu bạn, vì vậy quyết định định tuyến phải được đưa ra trước khi mô hình nhìn thấy đầu vào. Qua một đợt quét 51 ngôn ngữ, bộ định tuyến đã khiến 45 trong số 51 ngôn ngữ trở nên hữu dụng — được định nghĩa là vượt gấp ba lần mức ngẫu nhiên — so với 23 trên 51 đối với chỉ riêng checkpoint tiếng Anh.

Sự thật thiết kế đáng để hiểu: một token [MASK] cho mỗi tùy chọn
Nếu bạn chỉ rút ra một điều từ bài viết này, hãy rút ra điều này. Trong một đầu phân loại thông thường, tập nhãn được cố định tại thời điểm huấn luyện: lớp cuối cùng có một đầu ra cho mỗi lớp, và thêm một lớp nghĩa là phải huấn luyện lại. Laya không làm như vậy. Nó kết xuất mỗi lựa chọn dưới dạng văn bản kèm một dấu đánh dấu, và bộ chấm điểm dấu-lựa-chọn đọc ra điểm số từ chính vị trí [MASK] của lựa chọn đó. Sau đó nó softmax trên các lựa chọn thuộc về câu hỏi đó.
Do đó, không gian đáp án được định nghĩa tại thời điểm yêu cầu. Bạn viết các lựa chọn, mô hình chấm điểm chúng. Một lược đồ mới không cần huấn luyện lại và không cần tinh chỉnh, bởi vì không có gì trong các trọng số mã hóa "billing" hay "technical" như một lớp — chỉ có bộ máy để so sánh một lựa chọn đã được kết xuất với một lựa chọn khác trong ngữ cảnh của trạng thái.
Hai ngân sách chi phối mức độ hiệu quả của cách đó, và chúng được chia sẻ. Mỗi chuỗi được chia thành một ngân sách prompt tùy chọn (head_max_len, 192 token trên checkpoint tiếng Anh và 256 trên hai checkpoint còn lại) và một ngân sách tài liệu (phần còn lại của max_len). Mọi câu hỏi trong một lần gọi đều được trả lời trong cùng một lượt truyền xuôi duy nhất đó, nên một lần gọi có sáu câu hỏi không phải là sáu lần gọi mô hình. Nhưng các tùy chọn dùng chung ngân sách tùy chọn, đó là lý do một câu hỏi có 77 tùy chọn như Banking77 phân bổ khoảng ba đến bốn token cho mỗi nhãn và độ chính xác lao dốc — 0.425 so với 0.870 đã công bố của Jev. Cách khắc phục được ghi lại thay vì bị ẩn đi: hãy tăng head_max_len và max_len, hoặc chia một tập tùy chọn lớn thành lựa chọn hai bước từ thô đến tinh.
Ba nguyên thủy
Mọi thứ Laya làm đều thuộc một trong ba loại câu hỏi, và mỗi loại trả về một dạng khác nhau:
• choice — xác suất cho từng tùy chọn được đặt tên, cùng với nhãn đứng đầu và độ tin cậy. Đây là nguyên thủy dùng cho định tuyến và phân loại ý định.
• điểm số — một phân phối trên một thang đánh giá có thứ tự cùng với một mức kỳ vọng. Đây là kiểu nguyên thủy thứ tự: mức độ khẩn cấp, sự bực bội, mức độ nghiêm trọng.
• noul — xác suất đã hiệu chỉnh cho việc một phát biểu là đúng, từ 0.0 đến 1.0. Lừa đảo trực tuyến, rủi ro rời bỏ, tiêm nhiễm prompt.
Các kiểu dữ liệu nghiêm ngặt theo cách quan trọng về mặt vận hành. Một câu hỏi lựa chọn không thể trả về một tùy chọn mà bạn không cung cấp, vì những tùy chọn duy nhất nó có thể chấm điểm là những tùy chọn bạn đã kết xuất. Điều đó loại bỏ toàn bộ một nhóm lỗi trong môi trường production — giá trị enum được bịa ra, JSON bị cắt ngắn, vòng lặp thử lại quanh một parser. Nó không loại bỏ lỗi ngữ nghĩa. Một mô hình trả về billing: 0.94 cho một ticket lẽ ra phải được chuyển đến bộ phận hỗ trợ kỹ thuật là sai, và nó sai một cách tự tin. Đầu ra có kiểu đảm bảo hình dạng của câu trả lời, chứ không bao giờ đảm bảo tính đúng đắn của nó.
RLCD, hay vì sao các xác suất đáng lẽ phải có ý nghĩa
Hầu hết các bộ phân loại được huấn luyện để đúng. Laya được huấn luyện để trung thực về mức độ đúng của mình, và công thức huấn luyện chính là nguồn gốc của điều đó.
Phương pháp này được gọi là RLCD — Học tăng cường cho các quyết định được hiệu chỉnh. Chính sách phát ra một phân phối thay vì một argmax; việc khám phá thêm nhiễu Gaussian có trung bình bằng 0 vào các logit; và phần thưởng là một quy tắc cho điểm strictly proper — log cộng spherical, với điểm xác suất xếp hạng được cộng thêm cho các câu hỏi thứ bậc. Từ “proper” đó đang gánh phần việc quan trọng. Một quy tắc cho điểm strictly proper chỉ đạt cực đại về kỳ vọng khi bạn báo cáo niềm tin thật của mình, nên việc né tránh hay tuyên bố quá mức sẽ mất phần thưởng do cấu trúc chứ không phải do chỉ dẫn. Các cập nhật là REINFORCE với baseline trung bình nhóm, kiểu GRPO, và các cuộc hội thoại nhiều lượt sử dụng TD(λ=1.0) trên các lát cắt tiền tố.
Hệ quả thực tiễn là ngưỡng tin cậy là một thứ có ý nghĩa để xây dựng logic ứng dụng dựa trên — một khẳng định mà bạn không thể đưa ra đối với một softmax từ một bộ phân loại được huấn luyện bằng cross-entropy. Đó cũng là một khẳng định kèm theo lưu ý mà dự án nói rõ ngay từ đầu: các checkpoint được phát hành bị quá tự tin, và bạn được kỳ vọng sẽ tái hiệu chỉnh một temperature trên dữ liệu của riêng mình trước khi tin vào các con số. Việc tái hiệu chỉnh một temperature cho mỗi loại câu hỏi và số lượng lựa chọn đã đưa ECE trung bình từ 0,466 xuống 0,081 trên checkpoint tiếng Anh và từ 0,314 xuống 0,106 trên checkpoint đa ngữ. Ngưỡng khởi đầu được dự án đề xuất cho việc tự động chấp thuận so với con người xem xét là khoảng 0,85.
Chi phí để vận hành
Các số liệu về độ trễ là của chính dự án, được đo trên Tesla T4, với mọi checkpoint trả lời những câu hỏi giống hệt nhau từng byte trong cùng một lần chạy:
• Một câu hỏi — 39.5 ms trên laya, 32.8 ms trên laya-multilingual.
• Năm câu hỏi — 84,5 ms và 40,1 ms.
• Mười câu hỏi được xử lý theo lô — 158,6 ms (15,9 ms mỗi câu hỏi) và 72,3 ms (7,2 ms mỗi câu hỏi).
• Năm mươi câu hỏi — 771 ms và 337 ms, hoặc 6,8 ms mỗi câu hỏi trên checkpoint đa ngôn ngữ.
• Thông lượng theo lô trên một T4 — 103 đến 332 câu hỏi mỗi giây.
Nếu bạn từng thấy một tuyên bố kiểu "nhanh hơn Jev 50 lần" đang lan truyền, thì đó không phải là con số của dự án, và bộ đo hiệu năng của chính dự án cũng không ủng hộ con số đó. So sánh được Convai công bố là 7,8 lần ở độ trễ p50 cho một câu hỏi: 32,8 ms so với 236–276 ms. Đây cũng chính là phép so sánh cần đọc kỹ, bởi thẻ của Laya ghi phần phía Jev là những số liệu đã công bố từ bên thứ ba mà Convai chưa từng đo — họ không có quyền truy cập TypeSafe API — và bởi nó đặt một lượt chạy tiến trên GPU cục bộ đối chiếu với một lệnh gọi API được lưu trữ bao gồm cả vòng khứ hồi mạng lẫn hàng đợi. Phần kiến trúc của khoảng cách đó là có thật. Còn phần hạ tầng thì không phải là thuộc tính của mô hình.
Về bộ nhớ, dấu chân là vài trăm megabyte cho mỗi checkpoint, và bảng triển khai đáng để biết trước khi bạn định cỡ một máy chủ. Mặc định lazy giữ hai checkpoint thường trú (tiếng Anh và đa ngôn ngữ, chỉ hai cái mà router tự động chọn giữa chúng), nên sau lần tải đầu tiên của mỗi ngôn ngữ, một lần chuyển chỉ tốn công đoạn phát hiện. Router(max_loaded=1) trên một máy bị hạn chế bộ nhớ sẽ tải lại mỗi khi chuyển ngôn ngữ, đo được trung vị 7.4 giây trên CPU và 10.3 giây trên T4. Router(preload=True) là cấu hình máy chủ: không có gì tải lại, và độ trễ mỗi yêu cầu là con số 32.8 ms trên GPU hoặc 193–464 ms trên CPU.
Nửa trung thực
Đây chính là chỗ mà tác phẩm này chứng tỏ được giá trị của nó, bởi vì bề mặt xung quanh Laya thì ồn ào và những hạn chế thì rất cụ thể.
Đầu tiên, con số nổi bật là một con số đã được tinh chỉnh. Độ chính xác 0.766 thuộc về laya-typed-decisions, checkpoint được tinh chỉnh trên chính tập huấn luyện của benchmark đó. Các checkpoint gốc đạt 0.362 và 0.342 ở chế độ zero-shot, so với đường cơ sở ngẫu nhiên 0.318 và đường cơ sở lớp đa số 0.461 — nói cách khác, thấp hơn cả đường cơ sở tầm thường. Dự án tự nêu rõ điều này trong danh sách hạn chế của mình thay vì che giấu, và checkpoint đã tinh chỉnh vượt qua trần tự đồng thuận 0.735 của teacher, một kết quả thực sự mạnh mẽ đối với một encoder 421M trên bốn quy trình hẹp (xử lý hóa đơn 0.804, sự cố bảo mật 0.766, chăm sóc khách hàng 0.764, khả năng quan sát vết agent 0.730). Nhưng đó là kết quả về chuyên môn hóa, không phải về mô hình gốc, và bất kỳ ai trích dẫn 0.766 như một năng lực tổng quát đều đang đọc sai model card.
Thứ hai, các primitive không tốt như nhau. Xét độ chính xác trên checkpoint đã fine-tune: noul 0.857, choice 0.733, score 0.723. Dự án gọi thẳng ordinal score là "primitive yếu nhất", với SST-5 ở mức 0.372. Nếu bề mặt quyết định của bạn là thang đánh giá mức độ nghiêm trọng từ 1 đến 5, thì đó chính là primitive mà bạn ít có lý do để tin tưởng nhất khi dùng ngay từ đầu.
Thứ ba, hai hành vi được ghi nhận là lỗi trong trình theo dõi vấn đề của chính dự án, và cả hai sẽ thiêu rụi bạn trong môi trường production nếu bạn không đọc chúng. action.act_probability chưa mang tín hiệu nào dùng được — issue #185 — vì đầu ra của decision head chưa được chuẩn hoá, ở mức khoảng gấp 300 lần thang đo của encoder, khiến act head bị bão hoà nên nó đọc ra 1.0 với gần như mọi đầu vào. Logit thô của nó đi ngược lại tính đúng đắn, với AUROC 0.30 trên 396 quyết định đã gán nhãn. Hãy gate theo confidence thay vào đó, vốn đạt AUROC 0.77 trên cùng những mục đó. Riêng noul có thể đi theo các nhãn lựa chọn của chính nó thay vì state — issue #156 — vì render_options hardcode nhãn của noul thành false: / true:, và cặp nhãn đó có thể lấn át câu trả lời, trả về một câu "no" đầy tự tin cho đầu vào rõ ràng là tích cực. Cách xử lý đã được ghi nhận là hỏi cùng câu hỏi đó dưới dạng một lựa chọn hai phương án với các khoá trung tính và phần mô tả chính là cách diễn đạt yes/no của bạn.
Thứ tư, một chi tiết hiệu chuẩn dễ bị bỏ sót và đáng được nói chính xác. Checkpoint này đi kèm một nhiệt độ đã khớp là 0.1006 cho choice:11+ bucket, và trình tải kẹp mọi nhiệt độ vào [0.5, 5.0]. Việc kẹp đó đang giúp bạn đấy. Một nhiệt độ sắc như vậy có thể lấy một phân phối thực sự bị chia tách và báo cáo nó như gần chắc chắn; việc kẹp có nghĩa là trường hợp xấu nhất là một câu trả lời mềm hơn so với mức mà phép khớp dự định, và trình tải phát ra cảnh báo nêu tên bucket bị ảnh hưởng và bảo bạn coi độ tin cậy đó là chưa hiệu chuẩn. Hãy đọc các cảnh báo khi tải thay vì chặn chúng.
Thứ năm, chỉ dùng tiếng Anh tại gốc repo, và kiểu thất bại ngoài tiếng Anh không hề êm ái — vì thế mới có router, và vì thế mới có khuyến nghị dùng laya-multilingual cho bất cứ thứ gì không phải văn xuôi tiếng Anh.
Bức tranh độc lập, ở những nơi nó tồn tại, hẹp hơn bức tranh của nhà cung cấp và không mâu thuẫn với nó. Một phép so sánh trực tiếp độc lập — sysone-bench, 751 trạng thái trên chín bộ kiểm thử, ngày 2026-09-21, chạy trên các đầu vào giống hệt nhau từng byte với mã băm câu hỏi được xác minh là trùng khớp trước khi so sánh — cho thấy Jev dẫn trước ở phân loại sự cố, rào chắn an toàn, kiểm duyệt, banking77 và ý định đa ngôn ngữ, còn Laya dẫn trước ở AG News (0,940 so với 0,910) và MNLI (0,983 so với 0,867). Kết quả về cổng chặn theo độ tin cậy là thứ tôi thực sự sẽ dựa vào để lập kế hoạch: chặn ở ngưỡng tin cậy 0,85 giữ lại 58% lưu lượng của Laya với độ chính xác 0,878, so với 78% lưu lượng của Jev với độ chính xác 0,917. Đó chính là hình dạng của sự đánh đổi — Laya tự động hóa ít lưu lượng hơn với độ chính xác thấp hơn trên phần lưu lượng mà nó giữ lại, và lượt chạy bộ định tuyến của chính nó nâng ý định đa ngôn ngữ từ 0,360 lên 0,840.
Bề mặt xung quanh nó, vốn rộng một cách bất thường
Đối với một dự án mà trọng số chỉ mới vài ngày tuổi, bề mặt tích hợp lại là phần gây bất ngờ. Tất cả những điều này đều nằm trong kho lưu trữ thượng nguồn tại NandhaKishorM/laya, nơi có 19.871 sao trên GitHub vào thời điểm bài viết này được thực hiện, và toàn bộ đều theo giấy phép Apache 2.0:
• laya-serve — một HTTP server hiển thị Router với cùng hình dạng request và response POST /v1/systemone như Jev API được host của TypeSafe, nên một client TypeSafe hiện có chỉ cần đổi base URL là chuyển sang được. Lưu ý thẳng thắn về mặc định bảo mật: nó bind 0.0.0.0 mà không có xác thực trừ khi LAYA_API_KEY được đặt, khi đó nó yêu cầu bearer token. Có một biến thể module NixOS đã được tăng cường, chạy dưới một unit systemd DynamicUser và truyền token qua LoadCredential thay vì đặt nó trong store.
• Bản chuyển đổi TypeScript đầy đủ trong laya-ts/ dành cho Node và trình duyệt, cùng với một luồng agent ONNX (laya.onnx_agent.ONNXAgent) để chạy mô hình đã xuất trên ONNX Runtime mà không cần PyTorch khi chạy.
• Một máy chủ MCP nằm sau một gói bổ sung tùy chọn, cung cấp laya_predict, laya_route, laya_preset và laya_status dưới dạng các công cụ.
• Tích hợp LangChain và LangGraph — LayaRouter để định tuyến cạnh có điều kiện với ngưỡng tin cậy và phương án dự phòng, cùng với LayaGuardrail.
• Một Nix flake với nix run .#laya-serve và một mô-đun services.laya-serve, bốn tệp compose, một đường dẫn image Docker với hướng dẫn nhanh đã được ghi tài liệu, và một notebook Kaggle chạy toàn bộ vòng lặp tinh chỉnh RLCD trên GPU 2xT4 miễn phí trong bốn đến năm giờ với khoảng 30k câu hỏi.

Apache 2.0 là chi tiết giấy phép quyết định liệu bạn có thể đưa nó vào một sản phẩm để phát hành hay không: giấy phép này cho phép sử dụng thương mại, sửa đổi và phân phối lại, đồng thời không yêu cầu bạn công bố các thay đổi hoặc trọng số đã tinh chỉnh của mình. Nghĩa vụ ở đây là nghĩa vụ ghi công và giữ nguyên thông báo thông thường, cộng với việc rõ ràng không có cấp phép bằng sáng chế hay nhãn hiệu nào ngoài những gì giấy phép quy định. Đối với một lớp quyết định nằm trước lưu lượng khách hàng, đó là một đề xuất khác biệt về bản chất so với một endpoint được lưu trữ dạng truy cập sớm mà trọng số, kiến trúc và công thức huấn luyện đều không được tiết lộ — đó chính là Jev hiện nay, ở mức 0,042 USD cho mỗi triệu token đầu vào, với đầu ra miễn phí và bề mặt đầu vào chỉ có văn bản.
Vị trí thực sự phù hợp: một decision head ở phía trước, một LLM được định tuyến ở phía sau
Mô thức đáng để khắc sâu vào tâm trí không phải là “mô hình quyết định thay vì LLM”. Đó là một pipeline hai giai đoạn, và cả hai giai đoạn đều tồn tại vì giai đoạn còn lại kém ở một việc gì đó.
Đặt Laya lên trước cho những phán đoán khối lượng lớn, hẹp, dành cho máy tiêu thụ: định tuyến ticket, phân loại ý định, chấm điểm mức độ khẩn cấp, quyết định xem tài liệu này có liên quan đến truy vấn hay không, kiểm tra xem bản nháp này có vi phạm chính sách hay không. Những lệnh gọi đó có một tập câu trả lời cố định, chúng diễn ra hàng nghìn lần mỗi giờ, và một lượt chuyển tiếp cục bộ 33 mili-giây với không token đầu ra phù hợp hơn với chúng so với một vòng khứ hồi sinh tạo. Sau đó đặt một mô hình sinh tạo phía sau nó cho những lệnh gọi thực sự cần văn xuôi, tổng hợp hoặc suy luận trên một ngữ cảnh dài — việc soạn thảo, giải thích, tóm tắt leo thang.
Đó là vị trí của OrcaRouter, và cần phải chính xác về ranh giới. Chúng tôi không phục vụ Laya; đó là bộ mã hóa 421M do bạn tự chạy, và toàn bộ mục đích của nó là chạy ngay tại nơi dữ liệu của bạn đã ở đó. Chúng tôi cũng không phục vụ Jev — đó là endpoint truy cập sớm của TypeSafe. Điều chúng tôi bao phủ là phần tạo sinh của cùng pipeline đó: hơn 200 mô hình đằng sau một khóa tương thích OpenAI, tại giá niêm yết của nhà cung cấp được chuyển nguyên với 0% markup, cùng khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp. Lý do thực tế khiến điều này quan trọng ở đây là mối nối giữa hai nửa. Ngay khi bạn bắt đầu định tuyến các quyết định tới một mô hình tạo sinh cho những trường hợp mà đầu quyết định đã từ chối, bạn có thêm một tích hợp thứ hai, một hóa đơn thứ hai và một chế độ lỗi thứ hai. Một khóa cho phía tạo sinh, với chuyển đổi dự phòng nếu một nhà cung cấp suy giảm, có nghĩa là đường leo thang của lớp quyết định sẽ là một thay đổi cấu hình thay vì một quan hệ nhà cung cấp thứ hai. Đó là một khẳng định nhỏ, và đó là khẳng định đúng.
Ai nên áp dụng nó, và ai nên chờ đợi
Hãy áp dụng Laya ngay nếu bạn có dữ liệu đã gán nhãn và một vòng lặp huấn luyện, cùng một bề mặt quyết định đủ ổn định để đáng để chuyên biệt hóa. Notebook Kaggle tồn tại chính xác để bước tinh chỉnh không phải là một dự án nghiên cứu, các checkpoint cơ sở tải trong khoảng hai giây trên CPU, và giấy phép cho phép bạn phát hành kết quả cho mục đích thương mại mà không cần công bố trọng số của mình. Các tác vụ phù hợp nhất là những tác vụ mà dự án đã đánh giá chuẩn: sàng lọc ticket, xử lý hóa đơn, phân loại sự cố bảo mật, rào chắn và kiểm duyệt, và khả năng quan sát dấu vết agent. Hãy giữ các câu hỏi lựa chọn dưới khoảng 20 phương án, hiệu chỉnh temperature trên dữ liệu giữ lại của riêng bạn trước khi đưa một ngưỡng vào sản xuất, và chỉ cho qua dựa trên độ tin cậy, không bao giờ dựa trên act_probability.
Hãy chờ nếu quyết định của bạn cần chính xác ngay khi triển khai mà không có dữ liệu gán nhãn. Một base checkpoint nằm dưới mốc cơ sở lớp đa số trên benchmark mà nó được công bố cùng không phải là một engine zero-shot, và cách diễn giải trung thực các con số nhà cung cấp so với bên độc lập là một API quyết định được host, được vận hành tốt, hiện là lựa chọn zero-shot mạnh hơn. Cũng hãy chờ nếu tập lựa chọn của bạn lớn và bạn không sẵn sàng tinh chỉnh ngân sách head, nếu điểm số thứ bậc của bạn cần đáng tin cậy ngay lập tức, hoặc nếu bạn cần đầu vào hình ảnh, âm thanh hay tài liệu dài — Laya chỉ hỗ trợ văn bản và ngân sách ngữ cảnh của nó mặc định là 512 đến 1.024 token, tức là một tập trích chọn bằng chứng chứ không phải toàn bộ tài liệu.
Điều sẽ quyết định hạng mục này không phải là các con số độ trễ, vốn đã đủ tốt để không còn là lý lẽ tranh cãi nữa. Mà là liệu một mô hình nhỏ đưa ra xác suất trung thực trên một bề mặt quyết định do bạn định nghĩa, và có thể được huấn luyện lại trên nhãn của chính bạn, có đánh bại việc gọi một mô hình sinh lớn và phân tích đầu ra của nó hay không. Laya là một nỗ lực nghiêm túc đầu tiên đáng tin cậy cho phiên bản trọng số mở của câu hỏi đó — và nó mới ra đời nhiều nhất vài ngày, đó là cách đúng để đọc mọi điều ở trên. Bản base là điểm khởi đầu, không phải sản phẩm.

