
Jev so với Kev: Một bản tinh chỉnh trị giá $95 đánh bại Jev trên các phiếu hỗ trợ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 578 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Jared Palmer đã phát hành Kev vào ngày 20 tháng 9 năm 2026, năm ngày sau khi TypeSafe AI ra mắt Jev, và con số quan trọng không nằm trong bảng benchmark. Nó nằm trong README: toàn bộ công việc này tốn khoảng 95 USD cho thời gian H100 trên Modal, cộng thêm ba xu cho các lệnh gọi API Jev dùng để tạo dữ liệu đánh giá. Kev là Apache-2.0, có thể tự host, và có ba kích cỡ được xây dựng trên trọng số nền Qwen3.5 — khoảng 0.8B, 4B và 9B — với một bộ chuyển đổi LoRA rank-16 và một pointer head được gắn thêm vào nền đóng băng thay vì một mô hình ra quyết định xây từ đầu. Nó phản chiếu chính xác API quyết định có kiểu của Jev: Choice, Score và Noul, đủ gần để tương thích với Python SDK của chính TypeSafe. Về phần mình, Jev ra mắt ngày 15 tháng 9 năm 2026 với tư cách là mô hình System One đóng, được host của TypeSafe AI, trả về các câu trả lời có kiểu với độ tin cậy đã hiệu chỉnh và không có văn bản nào cả, và chưa từng công bố kiến trúc, số tham số, khối lượng tính toán huấn luyện hay trọng số của mình. Do đó, so sánh này thực ra không hẳn là so sánh mô hình. Đây là phép thử xem bao nhiêu giá trị của Jev còn trụ lại khi được tái tạo trong một buổi chiều với mức giá của một chiếc laptop đã qua sử dụng.
Các benchmark thực sự nói lên điều gì

Điểm đáng chú ý là Kev tiến rất gần, và ở một tác vụ hẹp, nó giành chiến thắng. Trên bộ kiểm thử nguồn mới đã khóa của Kev, Kev-9B đạt 0.837 so với 0.857 của Jev. Trong việc định tuyến phiếu hỗ trợ trên 900 phiếu — bộ scienthoon — Kev-9B đạt 0.952 so với 0.897 của Jev, đây là kết quả đã công bố duy nhất mà bản tái tạo mở vượt qua mô hình mà nó tái tạo. Kev cũng nhỉnh hơn ở một số tác vụ nhận dạng logic. Trên các bộ quyết định SemiF, một bộ có cấu trúc gồm 144 câu hỏi, Jev thắng với tỷ số 0.965 so với 0.917 của Kev-9B.
Những chỗ Kev thua, nó thua thảm hại. Độ chính xác ngoài miền: Kev-8B đạt 79,6% so với 85,7% của Jev. MMLU: 70% so với 90%. MMLU-Pro: 0,515 so với 0,840. Tính toán ngày ở độ chính xác đến ngày: 60% so với 93%. Mô thức này nhất quán — Kev cạnh tranh được ở định tuyến và phân loại hẹp, nơi tập nhãn nhỏ và miền cố định, nhưng nó sụp đổ với bất cứ thứ gì cần kiến thức thế giới hoặc số học nhiều bước, bởi vì một adapter hạng 16 trên một mô hình nền nhỏ đóng băng không phải là nơi kiến thức thế giới trú ngụ.
Mỗi con số trong đó đều đến từ khung đánh giá của chính Kev hoặc từ các trình theo dõi của bên thứ ba, và README của Palmer nói thẳng rằng đây không phải là một so sánh có kiểm soát — dữ liệu huấn luyện của Jev không được công bố, nên không có cách nào để tạo ra một so sánh như thế. README cũng nêu rõ rằng không có đầu ra nào của Jev được dùng để huấn luyện. Cả hai lời miễn trừ trách nhiệm này đều thuộc loại khiến các con số trở nên đáng tin cậy hơn, chứ không phải ít hơn: người công bố so sánh chính là người đang nói cho bạn biết nó không thể chứng minh được điều gì.
Những gì bạn nhận được với $95 mà bạn không thể nhận được từ Jev ở bất kỳ mức giá nào

Việc so sánh chi phí là lúc hai sản phẩm không còn có thể so sánh được với nhau nữa. Jev có giá $0.042 cho mỗi triệu token đầu vào với đầu ra miễn phí, rẻ theo cách thực sự khó đánh bại trên cơ sở mỗi lần gọi — nhưng đó là một API được lưu trữ, truy cập sớm với danh sách chờ, và TypeSafe đã nói rằng giới hạn tốc độ có thể thay đổi mà không báo trước. Kev là các trọng số bạn tải về. Chi phí biên của lần phân loại thứ mười triệu là điện năng của chính bạn.
Có bốn điều suy ra từ đó, và không điều nào trong số chúng liên quan đến điểm benchmark.
• Không có dữ liệu nào rời khỏi hạ tầng của bạn. Jev là một endpoint được lưu trữ; mọi trạng thái bạn gửi đến nó — phiếu hỗ trợ, dòng log, hồ sơ y tế — đều đi đến TypeSafe. Kev chạy trên GPU của chính bạn, điều mà đối với các khối lượng công việc chịu quy định không phải là một sở thích mà là yếu tố quyết định.
• Không giới hạn tần suất, không danh sách chờ, không rủi ro ngừng hỗ trợ. Tài liệu của chính TypeSafe lưu ý rằng giới hạn tần suất có thể thay đổi mà không cần thông báo. Một checkpoint cục bộ không có điều khoản như vậy.
• Bạn có thể tinh chỉnh nó. Kev là một nền tảng để chuyên biệt hóa, và công thức LoRA đã tạo ra nó là công khai. Nếu taxonomy định tuyến của bạn có 40 lớp mà không mô hình tổng quát nào xử lý tốt, bạn có thể huấn luyện trên nhãn của riêng mình — đúng như Palmer đã làm, với chi phí chỉ vài chục đô la thay vì cần cả một đội ML.
• Trần ngữ cảnh là thứ bạn có thể thay đổi. Ngân sách yêu cầu được ghi nhận của Jev là khoảng 32.000 token và các trường Choice tối đa 255 tùy chọn. Kev kế thừa cửa sổ của Qwen3.5, vốn lớn hơn nhiều, và giới hạn tùy chọn chỉ là một chi tiết triển khai trong chính ngăn xếp phục vụ của bạn chứ không phải giới hạn của nhà cung cấp.
Điều mà Jev vẫn có mà Kev không có
Tuyên bố về hiệu chuẩn là tuyên bố không chuyển giao một cách trọn vẹn, và đó là trọng tâm trong lời chào hàng của TypeSafe. Jev được huấn luyện bằng một phương pháp mà TypeSafe gọi là RLCD — Học tăng cường cho các Quyết định được Hiệu chuẩn — phương pháp này tối ưu hóa để giá trị độ tin cậy trung thực thay vì để câu trả lời được ưa thích. Mỗi câu trả lời của Jev đều đi kèm với một phân phối xác suất trên các lựa chọn, vì vậy mã của bạn có thể đặt các ngưỡng: hành động tự động ở dải trên cùng, gắn cờ ở giữa, chuyển lên cấp cao hơn ở dưới cùng.
Kev tạo ra cùng dạng thức được định kiểu và cùng các đầu ra xác suất, vì API được thiết kế có chủ đích để tương thích. Việc những xác suất đó có được hiệu chỉnh hay không lại là một câu hỏi khác, và câu trả lời trung thực là chưa ai công bố biểu đồ độ tin cậy cho cả hai mô hình. Một đánh giá hiệu chỉnh riêng đã báo cáo rằng Jev đạt độ chính xác 44.7% với sai số hiệu chỉnh kỳ vọng là 0.325 trên một tác vụ ưu tiên theo chính sách ẩn, điều này cho thấy việc hiệu chỉnh trên Jev thay đổi rõ rệt tùy theo từng tác vụ chứ không phải là một thuộc tính phổ quát — và chính TypeSafe cũng khuyên người dùng nên kiểm tra các ngưỡng độ tin cậy với những ví dụ đã được gán nhãn của riêng họ thay vì tin vào hành vi được công bố.
Điều khác mà Jev có là nó không được huấn luyện trên Qwen3.5. Một mô hình 9B với adapter hạng 16 có một trần kiến thức, và khoảng cách MMLU-Pro 0.515 so với 0.840 chính là trần đó được hữu hình hóa. Nếu quyết định định tuyến của bạn đôi khi đòi hỏi phải biết một thứ là gì, thì kiến trúc lớn hơn chưa được tiết lộ của Jev đang làm công việc mà adapter của Kev không thể làm được.
Độ trễ và hình thái triển khai
Độ trễ đầu-cuối được ghi nhận của Jev là 70–500ms so với 3–329 giây cho các lệnh gọi LLM tiên tiến trong so sánh của chính TypeSafe, và việc thêm câu hỏi vào một lệnh gọi hầu như không làm thay đổi con số đó vì mọi câu hỏi được đánh giá song song dựa trên một lần đọc trạng thái dùng chung. Kev-9B trên H100 sẽ nằm trong cùng bậc độ lớn đối với một lượt forward pass, nhưng so sánh này không phải là so sánh cùng loại theo cả hai chiều: một 9B tự lưu trữ trên GPU dùng chung khi chịu tải không có cùng độ trễ như một endpoint được host, và một endpoint được host cũng không giống một chiếc máy trong rack của chính bạn. Điều có thể nói mà không cần nước đôi là cả hai đều đủ nhanh để dùng theo từng lượt trong một vòng lặp agent, và độ trễ của Kev là một hàm của phần cứng bạn kiểm soát chứ không phải mức dịch vụ mà bạn được hứa.
Góc nhìn trung thực về bản tái tạo
Việc Kev tồn tại, dù chỉ là vậy, cũng là bằng chứng về Jev, và điều đó đáng được gọi tên. Một mô hình đóng có hành vi có thể được xấp xỉ trong năm ngày với $95, bởi một người, trên các trọng số nền công khai, đang cho bạn biết điều gì đó về việc bao nhiêu lợi thế của nó đến từ kiến trúc và bao nhiêu đến từ dữ liệu huấn luyện và phục vụ. Không vì thế mà suy ra rằng Jev dễ xây dựng — bề mặt API thì dễ sao chép, còn việc hiệu chỉnh thì không. Nhưng điều đó có nghĩa là hào bảo vệ không phải là giao diện, và bất kỳ ai đang đánh giá Jev cho một lộ trình sản xuất nên tính đến khả năng rằng một bản tinh chỉnh của một mô hình nền mở sẽ đưa họ đi phần lớn chặng đường với một phần nhỏ cam kết.
Đây cũng là lý lẽ để chưa đặt cược lộ trình sản xuất vào một trong hai. Nếu bạn đang đánh giá Jev, thái độ hợp lý là dùng thử mà không cam kết với nó — và OrcaRouter không phục vụ Jev, vì mô hình của TypeSafe đang ở giai đoạn truy cập sớm và nói theo dạng yêu cầu riêng của nó. Thứ chúng tôi bao phủ là nửa tạo sinh của quy trình mà các mô hình quyết định này nằm bên trong: 200+ mô hình phía sau một khóa tương thích OpenAI duy nhất, ở giá niêm yết của nhà cung cấp được chuyển qua với mức markup 0%, với khả năng chuyển đổi dự phòng tự động. Một kiến trúc hai mô hình, trong đó một lớp quyết định chi phí thấp phân loại lưu lượng và một mô hình tạo sinh xử lý phần còn lại, có thể kiểm thử ở phía chúng tôi mà không cần hợp đồng với nhà cung cấp thứ hai, và nếu thành phần quyết định hóa ra bị hiệu chỉnh kém trên dữ liệu của bạn, đường dự phòng chính là thứ ngăn điều đó trở thành một sự cố.
Phán quyết
Nếu tác vụ quyết định của bạn hẹp, miền cố định, khối lượng lớn và nhạy cảm về quyền riêng tư, thì Kev là lựa chọn dễ biện minh hơn ở thời điểm hiện tại và khoảng cách không hề nhỏ — bạn sở hữu trọng số, bạn kiểm soát luồng dữ liệu, bạn có thể tinh chỉnh trên nhãn của chính mình, và ở bài toán định tuyến phiếu hỗ trợ, checkpoint 9B đã đánh bại Jev theo chính những con số đã công bố của Jev. Nếu tác vụ quyết định của bạn cần kiến thức thế giới, số học nhiều bước, hoặc một giá trị độ tin cậy mà bạn định tự động hóa dựa vào, thì mô hình lớn hơn chưa được tiết lộ của Jev và quá trình huấn luyện RLCD của nó đang thực sự làm việc, còn adapter của Kev không thể thay thế cho cả hai.
Điều duy nhất mà cả hai so sánh đều không giải quyết được là hiệu chuẩn, vì chưa ai công bố biểu đồ độ tin cậy cho mô hình nào trong hai mô hình. Hãy kiểm tra điều đó trên chính các trường hợp đã gán nhãn của bạn trước khi bạn tự động hóa dựa trên một trong hai — giá trị độ tin cậy là phần của cả hai sản phẩm phải được giành lấy theo từng lần triển khai, còn tốc độ là phần đã trở thành hàng hóa phổ thông.

