Một thẻ hero được tạo có tiêu đề 'TypeSafe AI là gì?' với phụ đề 'Phòng thí nghiệm đứng sau Jev 1.13 - quyết định có kiểu, không phải văn xuôi', trên ba dòng có nhãn: 'Công ty: TypeSafe AI, San Francisco', 'Mô hình: Jev 1.13 (typesafe/jev-1.13), ra mắt 2026-09-15' và 'Được định tuyến trên OrcaRouter từ 2026-09-24'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

TypeSafe AI là gì? Phòng thí nghiệm đằng sau Jev 1.13 đưa ra quyết định, không phải câu chữ

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

TypeSafe AI là một phòng lab nhỏ ở San Francisco chuyên bán một mô hình không thể viết nổi một câu, và Jev 1.13 (typesafe/jev-1.13) là mô hình đang được nhắc tới. Nó nhận một mẩu trạng thái — một email, một dòng log, một ticket hỗ trợ, một blob JSON — cùng một tập các câu hỏi có tên, và trả về một câu trả lời đã được định kiểu cho mỗi câu hỏi, mỗi câu trả lời có giá trị độ tin cậy riêng. Không văn xuôi, không mã, không giải thích, và không có ô chat. Bản thân mô hình đã ra mắt vào 2026-09-15, nên nó không mới và không có gì ở đây là câu chuyện ra mắt: trang này tồn tại vì một thay đổi nhỏ hơn, có thể ghi ngày cụ thể. Vào 2026-09-24, OrcaRouter đã thêm typesafe/jev-1.13 vào danh mục của mình và mở thẻ mô hình tại địa chỉ riêng, đây là lần đầu tiên Jev có thể được gọi qua một gateway của bên thứ ba thay vì chỉ qua endpoint của chính TypeSafe. Đó là sự kiện, tính đến 2026-09-30 thì nó mới được sáu ngày, và đó là lý do một độc giả chưa có hợp đồng với TypeSafe giờ đây có thể đặt một mô hình System One trên cùng khóa với những mô hình sinh mà nó được thiết kế để đứng cạnh. Mọi thứ khác trên trang này là thông tin nền về công ty đã tạo ra nó.

Cách diễn giải trung thực về thời điểm, vì nó quan trọng đối với mức độ xác minh của phần này: Jev đã ra mắt hơn hai tuần trước và đã được cung cấp rộng rãi kể từ 2026-09-21, khi TypeSafe gỡ bỏ danh sách chờ. Điều nằm trong cửa sổ bảy ngày là thay đổi định tuyến, không phải mô hình. Nếu bạn đến đây với mong đợi một bài đánh giá ra mắt, thì buổi ra mắt đã diễn ra rồi và một vài bài viết khác đã đưa tin về nó.

Một trang công ty có bản tuyên ngôn và không có sơ đồ kiến trúc

TypeSafe tự mô tả mình, trong phần mô tả meta của chính mình, là “một phòng thí nghiệm AI xây dựng hạ tầng trí tuệ gốc máy cho tự động hóa”, với các hệ thống “được thiết kế để đưa ra quyết định trong phần mềm”. Trang chủ của nó được đóng dấu Version 0.01 và phần chân trang ghi “Made in SF.” Có một tuyên ngôn lập luận rằng con đường ngắn nhất dẫn tới một sự chuyển dịch kinh tế mang hình hài AI đi qua việc làm cho trí tuệ có thể tổ hợp được, để phần mềm có thể gọi phán đoán ngữ nghĩa giống như cách nó gọi một hàm; bản tóm tắt kế hoạch của chính công ty là tung ra dạng AI tổ hợp gốc máy, rồi làm cho nó đủ đáng tin cậy cho tự động hóa thực sự, rồi cung cấp các trừu tượng hóa cấp cao hơn đủ ổn định để xếp lớp lên trên. Khẩu hiệu của nó là “Chúng tôi đang xây dựng prod, không phải Chúa.” Trang đội ngũ nêu tên ba nhà sáng lập — Diogo Almeida là CEO, Sasha Sheng là COO và Erik Gafni là CTO. Đó là toàn bộ những gì công ty nói về chính mình: một lập trường, một sản phẩm, ba cái tên và không có con số nào về chính công ty.

Điều mà trang web không cung cấp lại chính là thứ mà một kỹ sư đánh giá một phụ thuộc mới tìm đến đầu tiên. Không có trang kiến trúc, không có số lượng tham số, không có công bố về tài nguyên tính toán huấn luyện, và không có thẻ mô hình theo nghĩa học thuật. Bảng điều khiển benchmark của chính TypeSafe vẫn đang được đánh dấu là đang chờ xử lý. Đối với một công ty mà lời chào hàng dựa trên độ tin cậy, mức độ công bố thông tin là mỏng, và đó là một thực tế về những gì đã được công bố chứ không phải một cáo buộc về những gì đang bị che giấu.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: hạng mục, và lý do cái tên được vay mượn

Jev là mô hình đầu tiên trong cái mà TypeSafe gọi là các mô hình System One. Cái tên bắt nguồn từ sự phân chia của Daniel Kahneman giữa tư duy System 1 nhanh, trực giác và lập luận System 2 chậm rãi, có chủ đích, và bài đăng ra mắt của công ty nói trực tiếp như vậy — bài viết cũng thừa nhận rằng “tư duy System 1” vốn mang sắc thái dễ mắc lỗi, đồng thời lập luận rằng có thể làm cho những mô hình này đáng tin cậy hơn các phương án thay thế. TypeSafe không đặt ra thuật ngữ này và không sở hữu nó.

Nội dung thực tiễn của hạng mục là sự phân chia lao động có chủ đích: một mô hình quyết định và một mô hình viết. Bạn nên giữ số học, sắp xếp ngày tháng, đếm và so sánh chuỗi trong mã thông thường, nơi chúng chính xác, và giao phán đoán ngữ nghĩa cho Jev. Ba loại câu hỏi mà nó có thể trả lời là:

• noul — một phán đoán đúng/sai, được trả về kèm xác suất đã hiệu chỉnh

• lựa chọn — chọn một trong tối đa 255 tùy chọn có nhãn

• điểm — đánh giá trên một thang có thứ tự; thẻ của chúng tôi công bố các mức 2-10, và tài liệu của chính TypeSafe cho thấy một ví dụ bắt đầu từ chỉ số 0, nên hãy coi các mức của nhà cung cấp là định nghĩa và 2-10 là những gì thẻ công bố

Mỗi câu hỏi có hướng dẫn riêng, và đối với lựa chọn và điểm số, có tiêu chí riêng. Các yêu cầu vượt quá khoảng 64K token đầu vào sẽ bị từ chối trước khi chúng đến được mô hình, và các phản hồi không được truyền theo luồng. Nhà cung cấp ghi tài liệu riêng về ngân sách trạng thái — trạng thái cộng với câu hỏi dài nhất đơn lẻ — ở mức 32K token, một con số hẹp hơn so với ngữ cảnh 65,536 token trên thẻ và không mâu thuẫn với nó.

Luận điểm của họ, bằng chính lời của họ

TypeSafe nêu luận điểm ấy rõ hơn bất kỳ bản tóm tắt nào, nên đây là nguyên văn: "LLM tạo ra từ ngữ cho con người. Jev đưa ra các quyết định có kiểu và giống mã hơn: đáng tin cậy, nhanh, tự nhất quán và an toàn về kiểu." Phương pháp huấn luyện đằng sau đó cũng là của họ, và đây là một thuật ngữ đáng được ghi nguồn chính xác vì nó đã được tiếp nhận ở nơi khác như thể là thuật ngữ chung. TypeSafe gọi nó là Reinforcement Learning for Calibrated Decisions, hay RLCD, và đối chiếu nó với RLHF và RLVR: trong khi những phương pháp kia tối ưu hóa sở thích của con người hoặc phần thưởng có thể kiểm chứng bằng chương trình, RLCD nhắm tới, theo cách diễn đạt của công ty, "các câu trả lời với xác suất trung thực về mặt nhận thức luận trên các tác vụ System One." Hãy coi RLCD là thuật ngữ do chính TypeSafe đặt ra, không phải một từ viết tắt đã được thiết lập trong tài liệu.

Những con số họ mở đầu, và ai đã chọn khối lượng công việc

Trang chủ mở đầu bằng "Nhanh hơn 193,6 lần, Rẻ hơn 444,6 lần", với chú thích cuối trang dẫn đến các quy trình dành cho tác vụ của System One. Bên dưới là một ví dụ minh họa: TypeSafe AI với chi phí 0,000081 đô la và 0,114 giây, so với các LLM ở mức 0,013880 đô la và 8,566 giây. Xuống thấp hơn nữa là "42 đô la mỗi tỷ token đầu vào. Giá đầu vào thấp hơn 238 lần so với Claude Fable 5.1." Và một mục có tiêu đề "Zero Hallucinations", mà khi xem xét kỹ thì đó là một tuyên bố về các ước lượng độ tin cậy chứ không phải một bằng chứng về việc không có lỗi: mọi quyết định của Jev đều đi kèm một ước lượng độ tin cậy, để phần mềm có thể hành động khi độ tin cậy cao và chuyển lên cấp xử lý khi độ tin cậy không cao. Cả bốn con số đều là số liệu của TypeSafe, trên những khối lượng công việc do TypeSafe lựa chọn, và không con số nào trong đó đã được tái lập một cách độc lập. Bản thân bài đăng ra mắt nói rằng đội ngũ kỳ vọng các mức 193,6 lần và 444,6 lần của mình nằm ở đầu cao của dải cải thiện trong thực tế, đồng thời lưu ý rằng các quy trình này do đội năng lực của chính họ xây dựng, với các câu trả lời tham chiếu do những mô hình đối thủ tạo ra. Dữ liệu phục vụ trong bảy ngày của chúng tôi trên cùng mô hình đó cho thấy tỷ lệ lỗi là 0,49%, đây là một phép đo khác trên một khối lượng công việc khác và là đối trọng trung thực cho cách đọc chữ "zero" như một giá trị tuyệt đối.

Những gì họ chưa công bố

Kiến trúc, số lượng tham số, compute huấn luyện và trọng số của Jev đều chưa được công bố, và không có kho trọng số nào trong tổ chức GitHub của công ty. Kiểm tra vào ngày 2026-09-30, tổ chức đó có mười một kho lưu trữ công khai; những kho đáng kể là công cụ, tất cả đều theo MIT hoặc Apache-2.0 — một repo kỹ năng agent, một SDK Python, một SDK TypeScript, một adapter client drop-in được hỗ trợ bởi các API LLM khác, một bộ sưu tập module Dagger, một số mã đánh giá workflow đã công bố, một node n8n, và trang web của chính tổ chức. Số sao và ngày push thay đổi, nên hãy đọc chúng vào đúng ngày thay vì đọc từ trang này.

Ba trong số mười một là các bản fork của những dự án không liên quan: vLLM, LLaDA, và một provider Pulumi cho ClickHouse Cloud. Chúng là bản fork từ công việc của người khác và không nói lên điều gì về cách Jev được xây dựng — đặc biệt, không nói gì về việc Jev dựa trên khuếch tán. Câu trả lời một dòng cho câu hỏi liệu Jev có mã nguồn mở hay không là: bộ công cụ thì mở còn mô hình thì không.

Điều họ tự thừa nhận

Hai lời thừa nhận trong bài đăng ra mắt có giá trị hơn hầu hết những lưu ý của nhà cung cấp, vì chúng chỉ đích danh những chỗ mà bằng chứng còn yếu. Về giá: "Chúng tôi không thể chứng minh rằng nó không được trợ giá; chúng tôi sẽ cần thời gian dài hạn để chứng minh tính bền vững của mức giá của mình (mà chúng tôi kỳ vọng sẽ giảm, chứ không tăng)." Về tốc độ: "các đánh giá được công bố của chúng tôi thường được chạy từ laptop của chúng tôi ở Bờ Tây (đây là nơi dịch vụ của chúng tôi hiện đặt trụ sở)." Có một điểm thứ ba, hữu ích hơn cho bất kỳ ai đang xây dựng dựa trên nó: với những tập lựa chọn có số lượng lớn, Jev vận hành một hệ thống hai giai đoạn chấm điểm độc lập rồi sau đó đưa ra lựa chọn tường minh, "do đó đôi khi có sự chậm lại." Đó là việc nhà cung cấp giải thích vì sao độ trễ không đồng đều giữa các loại câu hỏi, và đó là kiểu thông tin mà bạn thường chỉ biết được từ một luồng hỗ trợ.

Nơi bạn thực sự có thể gọi nó, tính đến hôm nay

Qua API riêng của TypeSafe, nơi mô hình đã được cung cấp rộng rãi và trang chủ vẫn dùng cụm từ của chính nhà cung cấp là "early access" — cách diễn đạt đó vẫn hiện hành và đáng giữ lại, trong khi "waitlisted" đã bị ngừng dùng: tài liệu công bố các giới hạn vận hành cụ thể (100K token mỗi giây, 40 yêu cầu mỗi giây, 429 kèm backoff của SDK khi vượt một trong hai) và hoàn toàn không có ngôn từ nào về danh sách chờ. Và, kể từ 2026-09-24, qua OrcaRouter.

Điều chúng tôi cung cấp đáng được nói rõ, vì dạng gọi là phần khác biệt. Mục trong danh mục là typesafe/jev-1.13, tên là TypeSafe: Jev 1.13, với loại endpoint được hỗ trợ là "systemone" — vì vậy nó được truy cập qua POST /v1/systemone thay vì dạng chat-completions của OpenAI, không streaming, đầu vào là văn bản và đầu ra là JSON có cấu trúc, tối đa khoảng 64K token đầu vào tính gộp cả state và câu hỏi. Đầu vào là $0.042 mỗi triệu token và đầu ra được tính phí bằng không, vì không có token đầu ra để đo: một quyết định có kiểu không phải là văn xuôi. Đó là giá niêm yết của nhà cung cấp được chuyển tiếp, với mức markup 0%, trên cùng key như hơn 200 mô hình khác trong danh mục — một API cho hơn 200 mô hình, markup 0% (giá niêm yết của nhà cung cấp được chuyển tiếp, nên mức giảm giá từ nhà cung cấp có hiệu lực ở đây ngay trong cùng ngày). Nếu lý do bạn đang đọc về TypeSafe AI là bạn muốn tìm hiểu xem khả năng hiệu chỉnh của Jev có đứng vững trên dữ liệu của chính bạn trước khi bạn cam kết đưa nó vào một luồng sản xuất hay không, thì việc chạy nó bên cạnh một mô hình sinh mà bạn đã tin cậy là cách rẻ để tìm ra; chuyển đổi dự phòng sang mô hình đó khi độ tin cậy của Jev trả về thấp là cách rẻ để đưa nó vào vận hành.

Số liệu phục vụ bảy ngày của chính chúng tôi cho giai đoạn kết thúc ngày 2026-09-30, đây là số liệu từ lưu lượng truy cập của chính chúng tôi chứ không phải từ chuẩn đối sánh của nhà cung cấp: p50 151 ms, p95 247 ms, khoảng 349 token đầu ra mỗi giây, tỷ lệ lỗi 0,49% và 76,2M token đã phục vụ. p50 hằng ngày trong giai đoạn đó lần lượt là 175, 170, 163, 161, 170, 147, 143 ms, vì vậy trung vị đã giảm nhẹ. Một ngày trong chuỗi, 09-28, có p95 là 2.448 ms — một điểm ngoại lệ thực sự trong dữ liệu, không phải mức thông thường và không phải con số để lập ngân sách độ trễ dựa trên đó. Những số liệu này cập nhật hằng ngày; thẻ là nguồn.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Nơi mô hình còn yếu, theo TypeSafe

Nhà cung cấp công bố một trang về tính lởm chởm cho Jev 1.13, được đánh giá lần cuối vào 2026-09-17, trong đó nêu tên các kiểu thất bại thẳng thắn hơn hầu hết tài liệu ra mắt. Đây là trang thích hợp để đọc trước khi xây dựng dựa trên mô hình, và danh sách của chính trang đó như sau. Jev trả lời câu hỏi bạn viết ra chứ không phải câu hỏi bạn muốn hỏi, nên các từ giới hạn phạm vi, phủ định và điều kiện ngầm cần được nói rõ. Nó không phải là một máy tính: nó làm kém hơn với các câu hỏi toán học so với câu hỏi ngữ nghĩa. Nó đọc ngày tháng như văn bản chứ không phải như các đại lượng có thứ tự, nên thứ tự, khoảng trống và việc thuộc cửa sổ là không đáng tin cậy, và còn tệ hơn với các định dạng hỗn hợp. Phủ định kép và suy luận gián tiếp nhiều bước làm giảm độ chính xác. Độ chính xác giảm khi trạng thái tăng lên với chi tiết không liên quan — trang này nói nó "bị thối rữa ngữ cảnh" — nên lọc trong mã trước là cách khắc phục. Trạng thái được coi là dữ liệu, không mặc nhiên bị coi là thù địch, nên các chỉ dẫn được chèn vào có thể làm thay đổi câu trả lời. Chỉ dẫn và tiêu chí không khớp khiến nó bối rối. Các bất biến cấu trúc không được đảm bảo: đầu ra noul và đầu ra lựa chọn không nhất thiết phải tương ứng, và một câu hỏi cộng với phủ định của nó không nhất thiết phải cộng lại bằng một, nên không nên chuyển ngưỡng giữa hai loại. Và nó không được huấn luyện để sinh văn bản — ép nó đi qua các lựa chọn chuỗi "sẽ không hoạt động tốt và sẽ rất chậm."

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Cách đọc hiểu TypeSafe AI sáu ngày sau khi thay đổi định tuyến

Công ty đang đưa ra một tuyên bố mạnh mẽ, cụ thể, có thể phản bác: rằng một mô hình quyết định hẹp có thể nhanh hơn, rẻ hơn và đáng tin cậy hơn một mô hình tổng quát trên tập hợp công việc mà ở đó bạn cần một phán đoán thay vì một đoạn văn. Tuyên bố này hợp lý và phần nào tự chứng minh — các ước lượng độ tin cậy là một khác biệt thiết kế thực sự, mức giá là thật, và độ trễ chúng tôi đo trên lưu lượng của chính mình nằm cùng bậc với độ trễ của nhà cung cấp. Điều còn thiếu là phần có thể cho phép người ngoài kiểm tra phần còn lại: không có kiến trúc, không có tham số, không có trọng số, không có đánh giá chuẩn độc lập, và một mức giá mà chính công ty nói rằng họ không thể chứng minh là bền vững. Các chế độ thất bại đã được ghi lại, điều mà hầu hết các phòng thí nghiệm không làm, và là lý do tốt nhất duy nhất để xem xét mô hình này một cách nghiêm túc.

Nếu bạn đang cân nhắc xem có nên để tâm hay không: hãy chạy Jev trên dữ liệu đầu vào mà bạn đã gán nhãn sẵn, với các nhãn được ẩn đi, rồi xem liệu những con số độ tin cậy của nó có phân tách được những trường hợp nó làm đúng với những trường hợp nó làm sai hay không. Bài kiểm tra đó gần như chẳng tốn kém gì, chỉ $0.042 cho mỗi triệu token đầu vào, và đây là cách duy nhất trả lời được câu hỏi mà bạn thực sự đang có. Nếu bạn đang cân nhắc xem có nên tin tưởng công ty hay không: những thông tin công bố thì vẫn là như thế, và câu trả lời trung thực là bằng chứng hiện tại chỉ là lời của nhà cung cấp cộng với bất cứ thứ gì bạn tự tạo ra mà thôi.