
TypeSafe AI là gì? Phòng thí nghiệm đằng sau Jev 1.13 đưa ra quyết định, không phải câu chữ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 349 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 208 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
TypeSafe AI là một phòng lab nhỏ ở San Francisco chuyên bán một mô hình không thể viết nổi một câu, và Jev 1.13 (typesafe/jev-1.13) là mô hình đang được nhắc tới. Nó nhận một mẩu trạng thái — một email, một dòng log, một ticket hỗ trợ, một blob JSON — cùng một tập các câu hỏi có tên, và trả về một câu trả lời đã được định kiểu cho mỗi câu hỏi, mỗi câu trả lời có giá trị độ tin cậy riêng. Không văn xuôi, không mã, không giải thích, và không có ô chat. Bản thân mô hình đã ra mắt vào 2026-09-15, nên nó không mới và không có gì ở đây là câu chuyện ra mắt: trang này tồn tại vì một thay đổi nhỏ hơn, có thể ghi ngày cụ thể. Vào 2026-09-24, OrcaRouter đã thêm typesafe/jev-1.13 vào danh mục của mình và mở thẻ mô hình tại địa chỉ riêng, đây là lần đầu tiên Jev có thể được gọi qua một gateway của bên thứ ba thay vì chỉ qua endpoint của chính TypeSafe. Đó là sự kiện, tính đến 2026-09-30 thì nó mới được sáu ngày, và đó là lý do một độc giả chưa có hợp đồng với TypeSafe giờ đây có thể đặt một mô hình System One trên cùng khóa với những mô hình sinh mà nó được thiết kế để đứng cạnh. Mọi thứ khác trên trang này là thông tin nền về công ty đã tạo ra nó.
Cách diễn giải trung thực về thời điểm, vì nó quan trọng đối với mức độ xác minh của phần này: Jev đã ra mắt hơn hai tuần trước và đã được cung cấp rộng rãi kể từ 2026-09-21, khi TypeSafe gỡ bỏ danh sách chờ. Điều nằm trong cửa sổ bảy ngày là thay đổi định tuyến, không phải mô hình. Nếu bạn đến đây với mong đợi một bài đánh giá ra mắt, thì buổi ra mắt đã diễn ra rồi và một vài bài viết khác đã đưa tin về nó.
Một trang công ty có bản tuyên ngôn và không có sơ đồ kiến trúc
TypeSafe tự mô tả mình, trong phần mô tả meta của chính mình, là “một phòng thí nghiệm AI xây dựng hạ tầng trí tuệ gốc máy cho tự động hóa”, với các hệ thống “được thiết kế để đưa ra quyết định trong phần mềm”. Trang chủ của nó được đóng dấu Version 0.01 và phần chân trang ghi “Made in SF.” Có một tuyên ngôn lập luận rằng con đường ngắn nhất dẫn tới một sự chuyển dịch kinh tế mang hình hài AI đi qua việc làm cho trí tuệ có thể tổ hợp được, để phần mềm có thể gọi phán đoán ngữ nghĩa giống như cách nó gọi một hàm; bản tóm tắt kế hoạch của chính công ty là tung ra dạng AI tổ hợp gốc máy, rồi làm cho nó đủ đáng tin cậy cho tự động hóa thực sự, rồi cung cấp các trừu tượng hóa cấp cao hơn đủ ổn định để xếp lớp lên trên. Khẩu hiệu của nó là “Chúng tôi đang xây dựng prod, không phải Chúa.” Trang đội ngũ nêu tên ba nhà sáng lập — Diogo Almeida là CEO, Sasha Sheng là COO và Erik Gafni là CTO. Đó là toàn bộ những gì công ty nói về chính mình: một lập trường, một sản phẩm, ba cái tên và không có con số nào về chính công ty.
Điều mà trang web không cung cấp lại chính là thứ mà một kỹ sư đánh giá một phụ thuộc mới tìm đến đầu tiên. Không có trang kiến trúc, không có số lượng tham số, không có công bố về tài nguyên tính toán huấn luyện, và không có thẻ mô hình theo nghĩa học thuật. Bảng điều khiển benchmark của chính TypeSafe vẫn đang được đánh dấu là đang chờ xử lý. Đối với một công ty mà lời chào hàng dựa trên độ tin cậy, mức độ công bố thông tin là mỏng, và đó là một thực tế về những gì đã được công bố chứ không phải một cáo buộc về những gì đang bị che giấu.

System One: hạng mục, và lý do cái tên được vay mượn
Jev là mô hình đầu tiên trong cái mà TypeSafe gọi là các mô hình System One. Cái tên bắt nguồn từ sự phân chia của Daniel Kahneman giữa tư duy System 1 nhanh, trực giác và lập luận System 2 chậm rãi, có chủ đích, và bài đăng ra mắt của công ty nói trực tiếp như vậy — bài viết cũng thừa nhận rằng “tư duy System 1” vốn mang sắc thái dễ mắc lỗi, đồng thời lập luận rằng có thể làm cho những mô hình này đáng tin cậy hơn các phương án thay thế. TypeSafe không đặt ra thuật ngữ này và không sở hữu nó.
Nội dung thực tiễn của hạng mục là sự phân chia lao động có chủ đích: một mô hình quyết định và một mô hình viết. Bạn nên giữ số học, sắp xếp ngày tháng, đếm và so sánh chuỗi trong mã thông thường, nơi chúng chính xác, và giao phán đoán ngữ nghĩa cho Jev. Ba loại câu hỏi mà nó có thể trả lời là:
• noul — một phán đoán đúng/sai, được trả về kèm xác suất đã hiệu chỉnh
• lựa chọn — chọn một trong tối đa 255 tùy chọn có nhãn
• điểm — đánh giá trên một thang có thứ tự; thẻ của chúng tôi công bố các mức 2-10, và tài liệu của chính TypeSafe cho thấy một ví dụ bắt đầu từ chỉ số 0, nên hãy coi các mức của nhà cung cấp là định nghĩa và 2-10 là những gì thẻ công bố
Mỗi câu hỏi có hướng dẫn riêng, và đối với lựa chọn và điểm số, có tiêu chí riêng. Các yêu cầu vượt quá khoảng 64K token đầu vào sẽ bị từ chối trước khi chúng đến được mô hình, và các phản hồi không được truyền theo luồng. Nhà cung cấp ghi tài liệu riêng về ngân sách trạng thái — trạng thái cộng với câu hỏi dài nhất đơn lẻ — ở mức 32K token, một con số hẹp hơn so với ngữ cảnh 65,536 token trên thẻ và không mâu thuẫn với nó.
Luận điểm của họ, bằng chính lời của họ
TypeSafe nêu luận điểm ấy rõ hơn bất kỳ bản tóm tắt nào, nên đây là nguyên văn: "LLM tạo ra từ ngữ cho con người. Jev đưa ra các quyết định có kiểu và giống mã hơn: đáng tin cậy, nhanh, tự nhất quán và an toàn về kiểu." Phương pháp huấn luyện đằng sau đó cũng là của họ, và đây là một thuật ngữ đáng được ghi nguồn chính xác vì nó đã được tiếp nhận ở nơi khác như thể là thuật ngữ chung. TypeSafe gọi nó là Reinforcement Learning for Calibrated Decisions, hay RLCD, và đối chiếu nó với RLHF và RLVR: trong khi những phương pháp kia tối ưu hóa sở thích của con người hoặc phần thưởng có thể kiểm chứng bằng chương trình, RLCD nhắm tới, theo cách diễn đạt của công ty, "các câu trả lời với xác suất trung thực về mặt nhận thức luận trên các tác vụ System One." Hãy coi RLCD là thuật ngữ do chính TypeSafe đặt ra, không phải một từ viết tắt đã được thiết lập trong tài liệu.
Những con số họ mở đầu, và ai đã chọn khối lượng công việc
Trang chủ mở đầu bằng "Nhanh hơn 193,6 lần, Rẻ hơn 444,6 lần", với chú thích cuối trang dẫn đến các quy trình dành cho tác vụ của System One. Bên dưới là một ví dụ minh họa: TypeSafe AI với chi phí 0,000081 đô la và 0,114 giây, so với các LLM ở mức 0,013880 đô la và 8,566 giây. Xuống thấp hơn nữa là "42 đô la mỗi tỷ token đầu vào. Giá đầu vào thấp hơn 238 lần so với Claude Fable 5.1." Và một mục có tiêu đề "Zero Hallucinations", mà khi xem xét kỹ thì đó là một tuyên bố về các ước lượng độ tin cậy chứ không phải một bằng chứng về việc không có lỗi: mọi quyết định của Jev đều đi kèm một ước lượng độ tin cậy, để phần mềm có thể hành động khi độ tin cậy cao và chuyển lên cấp xử lý khi độ tin cậy không cao. Cả bốn con số đều là số liệu của TypeSafe, trên những khối lượng công việc do TypeSafe lựa chọn, và không con số nào trong đó đã được tái lập một cách độc lập. Bản thân bài đăng ra mắt nói rằng đội ngũ kỳ vọng các mức 193,6 lần và 444,6 lần của mình nằm ở đầu cao của dải cải thiện trong thực tế, đồng thời lưu ý rằng các quy trình này do đội năng lực của chính họ xây dựng, với các câu trả lời tham chiếu do những mô hình đối thủ tạo ra. Dữ liệu phục vụ trong bảy ngày của chúng tôi trên cùng mô hình đó cho thấy tỷ lệ lỗi là 0,49%, đây là một phép đo khác trên một khối lượng công việc khác và là đối trọng trung thực cho cách đọc chữ "zero" như một giá trị tuyệt đối.
Những gì họ chưa công bố
Kiến trúc, số lượng tham số, compute huấn luyện và trọng số của Jev đều chưa được công bố, và không có kho trọng số nào trong tổ chức GitHub của công ty. Kiểm tra vào ngày 2026-09-30, tổ chức đó có mười một kho lưu trữ công khai; những kho đáng kể là công cụ, tất cả đều theo MIT hoặc Apache-2.0 — một repo kỹ năng agent, một SDK Python, một SDK TypeScript, một adapter client drop-in được hỗ trợ bởi các API LLM khác, một bộ sưu tập module Dagger, một số mã đánh giá workflow đã công bố, một node n8n, và trang web của chính tổ chức. Số sao và ngày push thay đổi, nên hãy đọc chúng vào đúng ngày thay vì đọc từ trang này.
Ba trong số mười một là các bản fork của những dự án không liên quan: vLLM, LLaDA, và một provider Pulumi cho ClickHouse Cloud. Chúng là bản fork từ công việc của người khác và không nói lên điều gì về cách Jev được xây dựng — đặc biệt, không nói gì về việc Jev dựa trên khuếch tán. Câu trả lời một dòng cho câu hỏi liệu Jev có mã nguồn mở hay không là: bộ công cụ thì mở còn mô hình thì không.
Điều họ tự thừa nhận
Hai lời thừa nhận trong bài đăng ra mắt có giá trị hơn hầu hết những lưu ý của nhà cung cấp, vì chúng chỉ đích danh những chỗ mà bằng chứng còn yếu. Về giá: "Chúng tôi không thể chứng minh rằng nó không được trợ giá; chúng tôi sẽ cần thời gian dài hạn để chứng minh tính bền vững của mức giá của mình (mà chúng tôi kỳ vọng sẽ giảm, chứ không tăng)." Về tốc độ: "các đánh giá được công bố của chúng tôi thường được chạy từ laptop của chúng tôi ở Bờ Tây (đây là nơi dịch vụ của chúng tôi hiện đặt trụ sở)." Có một điểm thứ ba, hữu ích hơn cho bất kỳ ai đang xây dựng dựa trên nó: với những tập lựa chọn có số lượng lớn, Jev vận hành một hệ thống hai giai đoạn chấm điểm độc lập rồi sau đó đưa ra lựa chọn tường minh, "do đó đôi khi có sự chậm lại." Đó là việc nhà cung cấp giải thích vì sao độ trễ không đồng đều giữa các loại câu hỏi, và đó là kiểu thông tin mà bạn thường chỉ biết được từ một luồng hỗ trợ.
Nơi bạn thực sự có thể gọi nó, tính đến hôm nay
Qua API riêng của TypeSafe, nơi mô hình đã được cung cấp rộng rãi và trang chủ vẫn dùng cụm từ của chính nhà cung cấp là "early access" — cách diễn đạt đó vẫn hiện hành và đáng giữ lại, trong khi "waitlisted" đã bị ngừng dùng: tài liệu công bố các giới hạn vận hành cụ thể (100K token mỗi giây, 40 yêu cầu mỗi giây, 429 kèm backoff của SDK khi vượt một trong hai) và hoàn toàn không có ngôn từ nào về danh sách chờ. Và, kể từ 2026-09-24, qua OrcaRouter.
Điều chúng tôi cung cấp đáng được nói rõ, vì dạng gọi là phần khác biệt. Mục trong danh mục là typesafe/jev-1.13, tên là TypeSafe: Jev 1.13, với loại endpoint được hỗ trợ là "systemone" — vì vậy nó được truy cập qua POST /v1/systemone thay vì dạng chat-completions của OpenAI, không streaming, đầu vào là văn bản và đầu ra là JSON có cấu trúc, tối đa khoảng 64K token đầu vào tính gộp cả state và câu hỏi. Đầu vào là $0.042 mỗi triệu token và đầu ra được tính phí bằng không, vì không có token đầu ra để đo: một quyết định có kiểu không phải là văn xuôi. Đó là giá niêm yết của nhà cung cấp được chuyển tiếp, với mức markup 0%, trên cùng key như hơn 200 mô hình khác trong danh mục — một API cho hơn 200 mô hình, markup 0% (giá niêm yết của nhà cung cấp được chuyển tiếp, nên mức giảm giá từ nhà cung cấp có hiệu lực ở đây ngay trong cùng ngày). Nếu lý do bạn đang đọc về TypeSafe AI là bạn muốn tìm hiểu xem khả năng hiệu chỉnh của Jev có đứng vững trên dữ liệu của chính bạn trước khi bạn cam kết đưa nó vào một luồng sản xuất hay không, thì việc chạy nó bên cạnh một mô hình sinh mà bạn đã tin cậy là cách rẻ để tìm ra; chuyển đổi dự phòng sang mô hình đó khi độ tin cậy của Jev trả về thấp là cách rẻ để đưa nó vào vận hành.
Số liệu phục vụ bảy ngày của chính chúng tôi cho giai đoạn kết thúc ngày 2026-09-30, đây là số liệu từ lưu lượng truy cập của chính chúng tôi chứ không phải từ chuẩn đối sánh của nhà cung cấp: p50 151 ms, p95 247 ms, khoảng 349 token đầu ra mỗi giây, tỷ lệ lỗi 0,49% và 76,2M token đã phục vụ. p50 hằng ngày trong giai đoạn đó lần lượt là 175, 170, 163, 161, 170, 147, 143 ms, vì vậy trung vị đã giảm nhẹ. Một ngày trong chuỗi, 09-28, có p95 là 2.448 ms — một điểm ngoại lệ thực sự trong dữ liệu, không phải mức thông thường và không phải con số để lập ngân sách độ trễ dựa trên đó. Những số liệu này cập nhật hằng ngày; thẻ là nguồn.

Nơi mô hình còn yếu, theo TypeSafe
Nhà cung cấp công bố một trang về tính lởm chởm cho Jev 1.13, được đánh giá lần cuối vào 2026-09-17, trong đó nêu tên các kiểu thất bại thẳng thắn hơn hầu hết tài liệu ra mắt. Đây là trang thích hợp để đọc trước khi xây dựng dựa trên mô hình, và danh sách của chính trang đó như sau. Jev trả lời câu hỏi bạn viết ra chứ không phải câu hỏi bạn muốn hỏi, nên các từ giới hạn phạm vi, phủ định và điều kiện ngầm cần được nói rõ. Nó không phải là một máy tính: nó làm kém hơn với các câu hỏi toán học so với câu hỏi ngữ nghĩa. Nó đọc ngày tháng như văn bản chứ không phải như các đại lượng có thứ tự, nên thứ tự, khoảng trống và việc thuộc cửa sổ là không đáng tin cậy, và còn tệ hơn với các định dạng hỗn hợp. Phủ định kép và suy luận gián tiếp nhiều bước làm giảm độ chính xác. Độ chính xác giảm khi trạng thái tăng lên với chi tiết không liên quan — trang này nói nó "bị thối rữa ngữ cảnh" — nên lọc trong mã trước là cách khắc phục. Trạng thái được coi là dữ liệu, không mặc nhiên bị coi là thù địch, nên các chỉ dẫn được chèn vào có thể làm thay đổi câu trả lời. Chỉ dẫn và tiêu chí không khớp khiến nó bối rối. Các bất biến cấu trúc không được đảm bảo: đầu ra noul và đầu ra lựa chọn không nhất thiết phải tương ứng, và một câu hỏi cộng với phủ định của nó không nhất thiết phải cộng lại bằng một, nên không nên chuyển ngưỡng giữa hai loại. Và nó không được huấn luyện để sinh văn bản — ép nó đi qua các lựa chọn chuỗi "sẽ không hoạt động tốt và sẽ rất chậm."

Cách đọc hiểu TypeSafe AI sáu ngày sau khi thay đổi định tuyến
Công ty đang đưa ra một tuyên bố mạnh mẽ, cụ thể, có thể phản bác: rằng một mô hình quyết định hẹp có thể nhanh hơn, rẻ hơn và đáng tin cậy hơn một mô hình tổng quát trên tập hợp công việc mà ở đó bạn cần một phán đoán thay vì một đoạn văn. Tuyên bố này hợp lý và phần nào tự chứng minh — các ước lượng độ tin cậy là một khác biệt thiết kế thực sự, mức giá là thật, và độ trễ chúng tôi đo trên lưu lượng của chính mình nằm cùng bậc với độ trễ của nhà cung cấp. Điều còn thiếu là phần có thể cho phép người ngoài kiểm tra phần còn lại: không có kiến trúc, không có tham số, không có trọng số, không có đánh giá chuẩn độc lập, và một mức giá mà chính công ty nói rằng họ không thể chứng minh là bền vững. Các chế độ thất bại đã được ghi lại, điều mà hầu hết các phòng thí nghiệm không làm, và là lý do tốt nhất duy nhất để xem xét mô hình này một cách nghiêm túc.
Nếu bạn đang cân nhắc xem có nên để tâm hay không: hãy chạy Jev trên dữ liệu đầu vào mà bạn đã gán nhãn sẵn, với các nhãn được ẩn đi, rồi xem liệu những con số độ tin cậy của nó có phân tách được những trường hợp nó làm đúng với những trường hợp nó làm sai hay không. Bài kiểm tra đó gần như chẳng tốn kém gì, chỉ $0.042 cho mỗi triệu token đầu vào, và đây là cách duy nhất trả lời được câu hỏi mà bạn thực sự đang có. Nếu bạn đang cân nhắc xem có nên tin tưởng công ty hay không: những thông tin công bố thì vẫn là như thế, và câu trả lời trung thực là bằng chứng hiện tại chỉ là lời của nhà cung cấp cộng với bất cứ thứ gì bạn tự tạo ra mà thôi.
