
Giải thích Jev 1.13: Tại sao mô hình trả lời bằng nhãn thay vì câu
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 349 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 208 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Jev 1.13 (typesafe/jev-1.13) không phải là một mô hình trò chuyện, và cách nhanh nhất để hiểu nó là ngừng đọc bảng thông số kỹ thuật của nó theo cách bạn đọc mọi bảng khác. TypeSafe đã phát hành nó vào 2026-09-15 với tư cách là thành viên đầu tiên của một lớp mà công ty gọi là mô hình System One: bạn đưa cho nó một mẩu trạng thái và một tập câu hỏi có tên, và nó trả lại một câu trả lời có kiểu cho mỗi câu hỏi — một nhãn từ danh sách bạn cung cấp, một mức trên thang đo bạn xác định, hoặc một đúng/sai kèm theo xác suất. Không văn xuôi, không mã, không giải thích. Đây không phải là bài viết về ra mắt. Bản thân mô hình có từ 2026-09-15, đã mười lăm ngày tuổi và nằm ngoài cửa sổ bảy ngày mà blog này viết tới, nên nó không được một trang riêng nhân dịp phát hành. Điều đã xảy ra trong cửa sổ đó là OrcaRouter đã thêm typesafe/jev-1.13 vào danh mục riêng của mình vào 2026-09-24 và mở thẻ mô hình Jev 1.13 tại https://www.orcarouter.ai/models/typesafe/jev-1.13 — lần đầu tiên Jev có thể được gọi qua một cổng bên thứ ba thay vì chỉ qua endpoint riêng của TypeSafe, và là dữ liệu phục vụ trực tiếp đầu tiên mà bất kỳ ai bên ngoài TypeSafe công bố về nó. Đó là thay đổi đáng đọc: mô hình đã trở nên có thể chạy ở nơi trước đây nó không thể.
Hình dạng thực tế của thay đổi đó thì nhỏ và cụ thể. Trước 2026-09-24, việc áp dụng Jev đồng nghĩa với một mối quan hệ nhà cung cấp thứ hai — một tài khoản TypeSafe, một khóa TypeSafe, một hóa đơn TypeSafe và một dạng yêu cầu riêng để viết mã dựa theo. Sau đó, Jev nằm trên cùng khóa với phần còn lại của stack: một API cho 200+ mô hình, mức markup 0% (giá niêm yết của nhà cung cấp được truyền nguyên, nên việc nhà cung cấp giảm giá có hiệu lực tại đây ngay trong cùng ngày), và mô hình có thể truy cập tại typesafe/jev-1.13 trên POST /v1/systemone. Bạn vẫn gọi nó theo dạng riêng của nó — endpoint không phải là tuyến chat-completions của OpenAI, và giả vờ điều ngược lại sẽ tạo ra lỗi 404 thay vì một quyết định — nhưng hợp đồng bạn ký và khóa bạn xoay vẫn chính là những cái bạn đã có.
Jev là loại người mẫu gì?
Bài đăng ra mắt của TypeSafe nói điều đó trong một câu: “Mô hình công khai đầu tiên của chúng tôi là Jev, có sẵn ngay hôm nay trong chế độ truy cập sớm.” Sau đó, bài đăng định vị mô hình này là “một lệnh gọi hàm của trí tuệ tiên phong: đầu vào là trạng thái phi cấu trúc, đầu ra là các quyết định xác suất có kiểu.” Đó là một mô tả công bằng về giao diện và cũng là một mô tả quan trọng, bởi vì gần như mọi kỳ vọng sai lệch về Jev đều đến từ việc đánh giá nó như một mô hình ngôn ngữ nhỏ. Nó không phải là một mô hình ngôn ngữ nhỏ. Nó là một mô hình quyết định với ngữ pháp đầu ra cố định, và ngữ pháp chính là sản phẩm.
Giao diện có đúng hai đầu vào. Trạng thái là tài liệu cần được đánh giá: một email, một ticket hỗ trợ, một dòng log, một bản ghi JSON, một mảng tọa độ trò chơi. Câu hỏi là một map gồm các mục được đặt tên, mỗi mục mang một kiểu, hướng dẫn riêng của nó, và — đối với hai kiểu có cấu trúc — tiêu chí của nó. Mọi câu hỏi đều được đánh giá dựa trên cùng một trạng thái đó, và các câu trả lời được trả về dưới dạng một payload JSON có cấu trúc duy nhất. Tài liệu của TypeSafe mô tả các câu hỏi chạy đồng thời và độc lập, đồng thời đưa ra hai khẳng định xuất phát từ chính thiết kế đó chứ không phải từ việc tinh chỉnh: thêm câu hỏi hầu như không thay đổi thời gian phản hồi, và thêm câu hỏi không tạo ra tình trạng suy thoái ngữ cảnh (context rot), bởi vì mỗi câu hỏi được đánh giá một cách tách biệt thay vì nằm sau các câu hỏi trước đó.
Hướng dẫn thiết kế của chính TypeSafe đáng được nhắc lại vì đó là tuyên bố rõ ràng nhất về mục đích của mô hình. Hãy giữ mỗi câu hỏi ở dạng nguyên tử và có phạm vi rõ ràng — "loại phán đoán mà một người hiểu biết sâu rộng có thể đưa ra trong vài giây." Nếu một quyết định cần lý luận mở rộng hoặc thực sự kết hợp nhiều yếu tố độc lập, hãy tách nó thành các câu hỏi riêng biệt và kết hợp chúng lại trong mã của bạn. Ví dụ của họ: thay vì một lời nhắc "đánh giá bài chào hàng khởi nghiệp này", hãy hỏi riêng về quy mô thị trường, tính khả thi kỹ thuật và sự khác biệt, rồi áp dụng trọng số của bạn. Lý do điều đó quan trọng là vì trọng số khi đó nằm trong một hệ số mà bạn có thể thay đổi, thay vì một lời nhắc mà bạn phải viết lại.
Mô hình này đóng kín theo mọi nghĩa quan trọng đối với một kỹ sư đang suy luận về rủi ro. Kiến trúc, số lượng tham số, khối lượng tính toán huấn luyện và trọng số của Jev đều không được công bố. Không có kho lưu trữ trọng số nào trong tổ chức TypeSafe trên GitHub — mười một kho lưu trữ công khai ở đó là công cụ, SDK, quy trình làm việc và ba bản fork không liên quan, và không có kho nào trong số đó là mô hình.
"Typed" là toàn bộ sản phẩm
Thẻ mô hình OrcaRouter công bố ba primitive và, quan trọng hơn, các giới hạn của từng cái. Mỗi câu hỏi bạn đặt cho Jev đều thuộc đúng một trong ba dạng:
• noul — một phán đoán đúng/sai, được trả về kèm xác suất đã hiệu chỉnh thay vì một giá trị boolean trần, để "có thể đúng" và "chắc chắn đúng" là những giá trị có thể phân biệt được.
• choice — chọn một trong tối đa 255 tùy chọn được gắn nhãn, mỗi tùy chọn có văn bản tiêu chí riêng để mô hình biết điều gì phân biệt các nhãn của bạn.
• điểm — đánh giá theo thang có thứ tự gồm 2–10 mức, với các định nghĩa mức được cung cấp làm tiêu chí.
Hệ quả của hạn chế đó là không có gì để trích xuất ra từ văn xuôi và cũng không có gì để xác thực dựa trên một schema mà bạn hy vọng mô hình đã tuân theo. Bài đăng ra mắt của TypeSafe đặc biệt thẳng thắn về sự đảm bảo này: con số không khớp schema "0%" trong các biểu đồ của họ "không mang tính thực nghiệm. Việc khớp schema được đảm bảo, do đó chúng ta có thể tự tin thêm 0% vào các biểu đồ." Khi không gian câu trả lời của bạn là một tập đóng do bạn cung cấp, một giá trị được trả về hoặc nằm trong tập đó, hoặc nó không đến từ mô hình — không có kết cục thứ ba nào mà ở đó mô hình viết ra thứ gì đó có vẻ hợp lý nhưng sai cấu trúc, còn regex của bạn lại lặng lẽ chấp nhận nó.
Ba loại này cũng là lý do khiến một người đánh giá không thể đánh giá Jev theo cách họ đánh giá một mô hình trò chuyện. Không có điểm MMLU-Pro để so sánh, không có mẫu văn bản để đọc, không có dấu vết lập luận để kiểm tra. Câu hỏi duy nhất có ý nghĩa là liệu câu trả lời được nhập có đúng hay không, và liệu xác suất gắn với nó có trung thực hay không. Cả hai điều đó đều có thể đo lường được, nhưng chỉ dựa trên dữ liệu và nhãn của bạn.
Một khác biệt đã được ghi nhận đáng để nêu ra hơn là giải quyết: tài liệu của chính TypeSafe cho thấy một ví dụ Score được đánh chỉ mục từ 0, trong khi thẻ OrcaRouter công bố thang điểm là 2–10 mức. Nhà cung cấp ghi tài liệu các mức; thẻ của chúng tôi công bố 2–10. Nếu bạn đang xây dựng một rubric dựa trên Score, hãy đọc các định nghĩa mức trong phản hồi của chính bạn thay vì giả định một chỉ mục.
Tại sao không có token đầu ra nào để tính phí
Cách tính giá là biểu hiện rõ ràng nhất của kiến trúc. Jev có giá $0.042 cho mỗi triệu token đầu vào trên OrcaRouter, và mức giá đầu ra là $0.000000 mỗi triệu — không phải giảm giá, không phải khuyến mãi ra mắt, mà là sự vắng mặt của một đại lượng có thể đo đếm được. Một mô hình tạo sinh được tính phí cho văn bản mà nó viết; Jev không viết văn bản nào. Nó trả về một nhãn, một mức độ và một xác suất. Không có gì để đếm ở phía đầu ra, vì vậy không có gì được tính phí ở đó.
TypeSafe nêu cùng con số đó từ chiều ngược lại trên trang chủ của mình — "42 USD cho mỗi tỷ token đầu vào" — và gắn kèm một tuyên bố so sánh: "Giá đầu vào thấp hơn 238 lần so với Claude Fable 5.1". Tuyên bố so sánh đó, cũng như mọi thứ khác trên trang chủ, là của chính nhà cung cấp, không ai khác tái lập được. Nhưng phép tính mà nó dựa vào thì người đọc rất dễ đối chiếu với hoá đơn của chính mình, và đó mới là phần hữu ích. Khối lượng của một workload ra quyết định gần như hoàn toàn được quyết định bởi lượng trạng thái bạn đưa vào, mà trạng thái thì rẻ theo một cách mà các token được sinh ra không có được.
Các con số hàng đầu của nhà cung cấp lớn hơn dòng giá và xứng đáng được ghi nhãn tương tự. TypeSafe quảng cáo "Nhanh hơn 193,6 lần, Rẻ hơn 444,6 lần" kèm chú thích giới hạn ở "các quy trình công việc cho tác vụ System One", và công bố một ví dụ minh họa bên dưới: TypeSafe AI ở mức $0,000081 hoàn thành trong 0,114 giây so với các LLM ở mức $0,013880 hoàn thành trong 8,566 giây. Bản thân bài đăng ra mắt thừa nhận rủi ro về cách trình bày — các mức 193,6 lần và 444,6 lần được mô tả là có khả năng nằm "ở mức cao hơn trong các lợi ích thực tế" — và lưu ý rằng bản demo so sánh song song đã sử dụng một truy vấn "được đơn giản hóa cao độ" với các khóa dễ đọc đối với con người do nhà cung cấp chọn để "tô vẽ mô hình của chúng tôi theo hướng có lợi." Không con số nào trong số này được tái lập một cách độc lập, và thẻ benchmark của chính nhà cung cấp vẫn được đánh dấu là đang chờ xử lý.
"calibrated" nghĩa là gì, và RLCD là gì
TypeSafe tự đặt tên cho phương pháp huấn luyện của mình: "Reinforcement Learning for Calibrated Decisions (RLCD)". RLCD là thuật ngữ riêng của TypeSafe, không phải một từ viết tắt học máy chung đã có trước công ty, và mục tiêu tối ưu hóa của nó được nêu trong bảng so sánh của bài đăng ra mắt là "các quyết định được hiệu chuẩn: câu trả lời với xác suất trung thực về mặt nhận thức luận trên các tác vụ System One". Sự tương phản mà cùng bảng đó vạch ra là với RLHF, vốn tối ưu hóa cho sở thích của con người — những bài viết và phản hồi trò chuyện mà người đánh giá ưa thích — và RLVR, vốn tối ưu hóa cho các đầu ra có thể được xác minh bằng chương trình. RLCD tối ưu hóa cho điều thứ ba: xác suất gắn với việc một câu trả lời là một phát biểu chính xác về sự bất định của chính mô hình.
Trên thực tế, "được hiệu chuẩn" là một tuyên bố về các độ tin cậy, chứ không phải sự bảo đảm rằng các câu trả lời đúng. Một mô hình được hiệu chuẩn nói 0,8 trên một tập câu hỏi thì sẽ đúng khoảng 80% số lần trên tập đó; nó vẫn có thể sai ở bất kỳ câu riêng lẻ nào. Sự phân biệt đó là cách đọc trung thực dòng trên trang chủ của TypeSafe: "Không ảo giác — Mỗi quyết định của Jev đều đi kèm một ước lượng độ tin cậy, để phần mềm của bạn có thể hành động khi độ tin cậy cao và chuyển lên cấp cao hơn khi độ tin cậy không cao." Đó là một tuyên bố về ước lượng độ tin cậy, không phải bằng chứng về việc không có lỗi, và đối trọng là dữ liệu của chính chúng tôi: trong bảy ngày kết thúc ngày 2026-09-30, thẻ của chúng tôi đo được tỷ lệ lỗi 0,49% trên lưu lượng Jev qua OrcaRouter — một con số từng đọc là 0,57% trước đó trong cùng khoảng thời gian, vì nó được tính trên bảy ngày cuốn chiếu của lưu lượng playground trực tiếp thay vì một tập kiểm thử cố định. Cả hai sự thật đều thuộc cùng một đoạn: các độ tin cậy là điểm cốt yếu của mô hình, và mô hình vẫn thất bại khoảng một cuộc gọi trong hai trăm cuộc gọi trên lưu lượng của chúng tôi.
Câu chuyện hiệu chuẩn cũng giải thích một hành vi độ trễ mà nếu không sẽ trông giống như một lỗi. Bài đăng ra mắt của TypeSafe cho biết: "Với các lựa chọn có bản số cao hơn, chúng tôi thực hiện hệ thống 2 giai đoạn: chấm điểm độc lập rồi đưa ra lựa chọn rõ ràng, do đó đôi khi sẽ chậm." Một lựa chọn 255 tùy chọn không phải là một so sánh trực tiếp; nhà cung cấp chấm điểm rồi sau đó chọn. Nếu bạn thấy một yêu cầu đối với một tập nhãn lớn mất thời gian lâu hơn đáng kể so với một noul, thì đó là cơ chế đã được ghi nhận, không phải tắc nghẽn.
Hôm nay bạn gọi nó là gì?

Trên OrcaRouter, model này có định danh typesafe/jev-1.13, được đặt tên là "TypeSafe: Jev 1.13" trong danh mục, với context_length là 65.536 token và đúng một loại endpoint được hỗ trợ: systemone. Bạn gọi nó bằng POST /v1/systemone với khóa OrcaRouter của mình, gửi một trường model, một trường state (chuỗi, đối tượng hoặc mảng), và một map questions trong đó mỗi mục mang một type (noul, choice hoặc score), các instructions và các criteria của nó. Phản hồi là một payload JSON có cấu trúc duy nhất và không được truyền theo luồng — không có chế độ streaming nào để bạn chọn tham gia.
Cách diễn đạt của chính thẻ đối với hợp đồng là “đầu vào văn bản, đầu ra JSON có cấu trúc”, và các giới hạn được công bố là những giới hạn cần thiết kế hướng tới: không truyền phát, tối đa khoảng 64K token đầu vào trên tổng hợp trạng thái và câu hỏi, với các yêu cầu vượt quá giới hạn đó bị từ chối trước khi đến mô hình. Mục trong danh mục liệt kê giá niêm yết là $0,042 cho mỗi triệu token đầu vào và hiển thị tỷ lệ hoàn thành là 0. Đó là các con số của nhà cung cấp được truyền nguyên vẹn — dạng tỷ lệ thuận của cách chúng tôi định giá: mức cộng thêm 0% trên giá niêm yết của nhà cung cấp.
Có hai ngân sách token đang lưu hành cho mô hình này và chúng không xung đột, nên hãy tách chúng ra. Con số 65.536 là context_length của card và được ghi trong tài liệu là khoảng 64K đầu vào trên cả trạng thái lẫn các câu hỏi cộng lại. Con số "khoảng 32.000 token" mà các bài viết OrcaRouter trước đây trích dẫn chỉ là riêng ngân sách trạng thái — khoảng dành cho tài liệu của bạn trước khi các câu hỏi lấy phần của chúng. Nếu bạn đang lập ngân sách cho một yêu cầu, ngân sách trạng thái là con số giới hạn payload mà bạn xây dựng; con số tổng hợp là mức trần cho toàn bộ lần gọi.
Những gì Jev không thể làm, nói thẳng
Nó không thể viết văn xuôi, tóm tắt, dịch hoặc trò chuyện. Đó là thiết kế, không phải một hạn chế để phải xin lỗi: bài đăng ra mắt nói Jev "từ bỏ việc sinh chuỗi", và trang jaggedness của chính TypeSafe liệt kê "Generation" như một dạng lỗi được đặt tên, với hướng dẫn "Hãy dùng một mô hình sinh" bên cạnh. Việc sinh cưỡng bức thì chậm và kém chất lượng. Nếu pipeline của bạn cần một bản tóm tắt bằng văn bản thì Jev là thành phần sai, và dù bạn có khéo léo đến đâu trong việc viết prompt cũng không thay đổi được điều đó.
Nó không phải là sự thay thế cho một mô hình sinh. Quy trình mà Jev thuộc về có hai mô hình: một mô hình sinh đọc, viết và lập luận bằng văn bản, và Jev ngồi bên cạnh nó, thực hiện các lệnh gọi có kiểu trong vài mili giây. Đó là cách diễn đạt trung thực cho mọi so sánh chi phí trên trang chủ của nhà cung cấp — cột “LLMs” không phải là một đối thủ đang bị thay thế, mà là nửa còn lại của cùng một hệ thống, và lý do sự ghép đôi này thú vị là nửa quyết định giờ nằm trên cùng một khóa với nửa sinh, thay vì nằm sau hợp đồng riêng của nó.
Và “được hiệu chỉnh” không có nghĩa là đúng. Nó có nghĩa là con số gắn với một câu trả lời phải đọc được như một xác suất. Mức 0,62 trên một noul là mô hình đang nói với bạn rằng nó không chắc, thông tin hữu ích mà một câu trả lời có/không đơn thuần sẽ phá hủy mất — và đó không phải là lời hứa rằng câu “có” là đúng. Logic leo thang được xây dựng dựa trên độ tin cậy chính là mô thức dự kiến; còn coi câu trả lời là ground truth thì không phải.
Đọc các con số một cách trung thực

Mọi chỉ số phục vụ trên thẻ của chúng tôi đều đến từ lưu lượng của chính chúng tôi qua playground của OrcaRouter trong một cửa sổ trượt bảy ngày, chứ không phải từ benchmark của nhà cung cấp, và cửa sổ đã dịch chuyển trong lúc bài viết này đang được viết — hãy coi đó là một kết quả đo, không phải một đặc tả. Trong bảy ngày kết thúc vào ngày 30-09-2026: thời gian trung vị đến token đầu tiên là 151 ms, p95 là 247 ms, thông lượng đầu ra khoảng 349 token mỗi giây, tỷ lệ lỗi 0,49%, và 76,2 triệu token được phục vụ. p50 hằng ngày trong cửa sổ lần lượt là 175, 170, 163, 161, 170, 147 và 143 ms — một đường cải thiện nhẹ nhàng. Mức p95 2.448 ms của ngày 28-09 là một điểm ngoại lai thực sự của một ngày nằm trong chuỗi đó, và việc trích dẫn nó như mức chuẩn sẽ sai y như việc loại bỏ nó hoàn toàn sẽ là không trung thực.
Một lưu ý nữa về con số lưu lượng: 349 token đầu ra mỗi giây nghe có vẻ như thông lượng của một mô hình sinh, cho đến khi bạn nhớ ra rằng Jev không sinh ra văn bản nào. Đồng hồ đo đang đo bất cứ thứ gì playground của chúng tôi đếm ở phía phản hồi cho một payload có cấu trúc, và nó hữu ích để phát hiện sự suy giảm giữa các ngày hơn là để so sánh Jev với một mô hình chat.
Đó là những con số của chúng tôi. Còn số của nhà cung cấp là 193.6x, 444.6x, ví dụ đã tính $0.000081 và so sánh 238x với Claude Fable 5.1 — tất cả đều là của TypeSafe, không có cái nào được tái lập độc lập, tất cả đều bị giới hạn bởi chính các chú thích của họ chỉ dành riêng cho quy trình công việc System One. Tuyên bố hiệu năng duy nhất mà TypeSafe đưa ra không hề là một phép đo chuẩn nào cả, và đáng giá hơn các hệ số nhân, là một tuyên bố mang tính cấu trúc: vì các câu trả lời được định kiểu, tích hợp không có bước phân tích cú pháp và không có bước xác thực lược đồ, và đó là một chi phí không xuất hiện trong bất kỳ bảng độ trễ nào.
Cái gì đang mở, và cái gì thì không
Khi kiểm tra vào ngày 2026-09-30, tổ chức TypeSafe trên GitHub đã công bố mười một kho lưu trữ. Không kho nào chứa Jev. Những kho quan trọng đối với nhà phát triển đang tích hợp mô hình đều là MIT hoặc Apache-2.0: skills (MIT), system-one-adapter-python (MIT, được mô tả là "bản thay thế TypeSafeClient dùng ngay, được hỗ trợ bởi API LLM"), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, với mã workflow được công bố tại evals.typesafe.ai), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io và pulumi-clickhouse. Số lượng sao và ngày push có thể thay đổi, nên nếu bạn đọc bài này sau đó, hãy kiểm tra lại thay vì tin vào danh sách.
Ba trong số mười một là các bản fork của những dự án không liên quan và không chứng minh được gì về cách Jev hoạt động: một bản fork vLLM được đẩy lần cuối vào tháng 5 năm 2025, một bản fork LLaDA từ tháng 6 năm 2025 — LLaDA là một bản phát hành mô hình ngôn ngữ khuếch tán không liên quan — và một nhà cung cấp Pulumi cho ClickHouse Cloud. Thật dễ bị cám dỗ để đọc kiến trúc từ một danh sách fork. Đừng làm vậy: không có gì về thiết kế của Jev suy ra từ ba cái đó, và đặc biệt Jev không phải là một mô hình khuếch tán, cho dù sự hiện diện của một bản fork LLaDA có thể gợi ý điều đó đến mức nào.
Câu trả lời trung thực trong một dòng cho câu hỏi “Jev có phải là mã nguồn mở không” là: bộ công cụ thì mở, còn mô hình thì không. Đó là một cách bố trí bình thường đối với một mô hình tiên tiến được cung cấp dưới dạng dịch vụ, và đó là cách bố trí bạn nên mặc định khi lập kế hoạch xoay quanh Jev: một API với mức giá được công bố, một hợp đồng được ghi rõ và một số lượng tham số không được công bố.
Nơi nhà cung cấp nói Jev không đáng tin cậy
TypeSafe công bố trang về tính không đồng đều của riêng mình cho jev-1.13, được xem xét lần cuối vào 2026-09-17, nêu rõ những chỗ mô hình thất bại. Trang này thẳng thắn một cách bất thường và là nơi thích hợp để bắt đầu một mục về các hạn chế, vì đó là danh sách của chính nhà cung cấp chứ không phải của một đối thủ cạnh tranh:
• Cách đọc theo nghĩa đen — nó tiếp nhận câu chữ theo đúng nghĩa bề mặt. Các từ giới hạn phạm vi, phủ định và điều kiện ngầm không được suy ra; nó “trả lời câu hỏi bạn đã viết, chứ không phải câu bạn muốn hỏi”. Cách khắc phục của nhà cung cấp là viết chính xác điều kiện và tiêu chí cho mọi lựa chọn.
• Toán học và các con số — nó không phải là máy tính bỏ túi, và nó không đếm một cách đáng tin cậy. Hãy để các phép tính số học trong mã.
• So sánh ngày và giờ — ngày được đọc dưới dạng văn bản, không phải đại lượng có thứ tự, nên việc sắp xếp, khoảng trống và cửa sổ thời gian không đáng tin cậy, càng tệ hơn với các định dạng hỗn hợp.
• Tính gián tiếp — phủ định kép và suy luận nhiều bước làm giảm độ chính xác. Hãy giảm số bước và chỉ thẳng vào trạng thái liên quan.
• Trạng thái lớn chứa đầy chi tiết không liên quan — nội dung không liên quan đóng vai trò gây nhiễu và độ chính xác giảm khi trạng thái tăng lên. Hãy lọc trước.
• Nội dung đối kháng — trạng thái không được coi là thù địch, nên các chỉ dẫn được chèn vào hoặc cách định khung gây nhầm lẫn có thể làm thay đổi câu trả lời.
• Hướng dẫn và tiêu chí mâu thuẫn — khi hai bên yêu cầu những điều khác nhau, mô hình "có thể bị nhầm lẫn."
• Các bất biến cấu trúc theo lẽ thường — P(noul) và 1 − P(not noul) không được đảm bảo là nhất quán. Hãy hỏi từng quyết định theo một cách và thực thi các đẳng thức trong mã.
• Tạo sinh — đã được đề cập, và chính nhà cung cấp cũng khuyên nên dùng mô hình tạo sinh.
Hai trong số này đáng được nhấn mạnh. Cái mang tính đối kháng quan trọng vì toàn bộ đề xuất giá trị của Jev là đánh giá tài liệu không đáng tin cậy, và một trạng thái chứa chỉ dẫn có thể làm thay đổi câu trả lời; nếu trạng thái của bạn đến từ người dùng, thì đó là một bề mặt tiêm nhắc lệnh có cùng hình dạng như bất kỳ bề mặt nào khác. Cái về các bất biến cấu trúc quan trọng vì một mô hình "đã hiệu chỉnh" mời gọi bạn thực hiện số học trên các xác suất của nó, và nhà cung cấp đang nói với bạn rằng đừng giả định rằng số học đó khép kín.
Những gì bài đăng ra mắt cam kết, và những gì nó không cam kết

Gần như mọi tuyên bố của nhà cung cấp được trích dẫn trong bài viết này đều truy ngược về một trang: thông báo của chính TypeSafe, được đăng trong mục Tin tức Công ty và đề ngày 2026-09-15, có chữ ký của nhà sáng lập Diogo Almeida. Đọc trực tiếp nó đáng để bỏ ra hai phút, bởi vì cách diễn đạt của một dòng đã đặt ra các điều kiện cho mọi thứ kể từ đó. “Mô hình công khai đầu tiên của chúng tôi là Jev, hiện có sẵn hôm nay trong chế độ truy cập sớm.” Truy cập sớm là cách nhà cung cấp tự mô tả về tính khả dụng trên nền tảng của chính nhà cung cấp, và đó là một tuyên bố hẹp hơn vẻ ngoài của nó — nó ràng buộc TypeSafe phải cung cấp mô hình cho những người dùng đã được phê duyệt, và không nói gì về việc ai khác có thể cung cấp nó. Đó chính xác là khoảng trống mà việc bổ sung vào danh mục ngày 2026-09-24 đã lấp đầy, và là lý do thẻ mô hình quan trọng hơn bài đăng đối với bất kỳ ai đang đánh giá Jev ngày nay.
Cùng trang đó cũng nói rõ không kém về những giới hạn của chính nó, đó là lý do ở trên nó được trích dẫn nguyên văn thay vì diễn giải. Nó không công bố số lượng tham số, không mô tả kiến trúc nào ngoài "một kiến trúc mô hình mới", không nêu khối lượng tính toán huấn luyện và không có kho trọng số, đồng thời không đưa ra ngày hay điều kiện để có sẵn rộng rãi. Những khoảng trống đó chính là các ràng buộc lập kế hoạch: một bên là API có giá được công bố, bên kia là một stack mà bạn không thể soi vào bên trong. Bài đăng cũng mô tả mô hình đủ trung thực để hữu ích như một bản đặc tả — "một lệnh gọi hàm trí tuệ tiên phong: đầu vào là trạng thái phi cấu trúc, đầu ra là các quyết định xác suất có kiểu" — và đó là câu duy nhất trong bài mô tả giao diện thay vì tham vọng.
Những câu hỏi mà giao diện này đặt ra
Điều gì xảy ra khi một tập lựa chọn lớn hơn 255 tùy chọn? Nó bị giới hạn — 255 tùy chọn có nhãn là mức trần cho một câu hỏi lựa chọn, và cách tiếp cận hai giai đoạn chấm điểm rồi chọn của nhà cung cấp chính là cách nó xử lý khi số lượng tăng dần, đây cũng là nguyên nhân được ghi nhận gây ra những lần chậm chạp thỉnh thoảng xảy ra với các tập nhãn lớn. Nếu hệ thống phân loại của bạn lớn hơn mức đó, câu trả lời về mặt thiết kế là hãy phân tách nó thành nhiều câu hỏi và tái kết hợp trong mã, đây cũng chính là lời khuyên mà TypeSafe đưa ra cho các phán đoán phức hợp.
Ngữ cảnh 65.536 token có nghĩa là 65.536 token trạng thái không? Không. Ngân sách được công bố là khoảng 64K token tính trên tổng thể trạng thái và tất cả các câu hỏi cộng lại, còn con số "khoảng 32.000 token" xuất hiện trong các bài viết cũ chỉ là ngân sách dành riêng cho trạng thái. Hãy tính toán khối lượng dữ liệu bạn gửi dựa trên con số trạng thái, chứ không phải con số tổng hợp, và hãy nhớ rằng các yêu cầu vượt quá giới hạn sẽ bị từ chối trước khi đến được mô hình.
Làm gì với cái này
Jev 1.13 đáng để xem xét vì một lý do cụ thể, chứ không phải vì một lý do chung chung. Nếu bạn có một bước trong pipeline của mình hiện đang là một mô hình chat được yêu cầu trả về một nhãn và được tin tưởng là sẽ trả về đúng định dạng — một router, một grader, một bước kiểm tra chính sách, một điểm rubric áp dụng cho hàng nghìn bản ghi — thì bước đó chính là thứ mà mô hình này thay thế, với mức $0.042 mỗi triệu token đầu vào và không tính phí gì ở phía đầu ra. Nếu bạn có một bước cần một câu trả lời bằng văn bản, Jev không phải là công cụ dành cho việc đó, và chính nhà cung cấp của nó cũng nói vậy.
Điều đã thay đổi trong tuần qua không phải là mô hình. Mà là việc dùng thử nó không còn đòi hỏi một mối quan hệ nhà cung cấp thứ hai. Tám ngày trước, một đánh giá Jev đồng nghĩa với một tài khoản riêng và một tích hợp riêng; hôm nay, nó chỉ là một model id trên một khóa đã kết nối tới hơn 200 mô hình, với giá niêm yết của nhà cung cấp được giữ nguyên và các câu trả lời dạng văn bản quay về từ cùng một nơi như mọi thứ khác. Với một mô hình kỳ lạ đến vậy, khả năng thử nghiệm nó dựa trên nhãn của chính bạn mà không phải cam kết một hợp đồng mới chiếm phần lớn quyết định.
