
Jev 拒絕寫下任何一個字:TypeSafe AI 的決策模型做了什麼,以及迄今無人驗證的事
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
Jev 是 TypeSafe AI 的第一個模型,讀者很可能會透過成本表而不是聊天框來認識它,因為它根本沒有聊天框。Jev 由 Diogo Almeida 於 2026 年 9 月 15 日推出——他是 InstructGPT 論文的共同作者,該論文讓 ChatGPT 表現得像個助理——它完全不生成文字。它接收一段狀態(一封電子郵件、一行日誌、一張支援工單、一份遊戲座標的 JSON 資料),加上一串有型別的問題,然後回傳有型別的答案:從你提供的選項中選一個、依評分規準給出分數,或是是/否的機率,每個答案都各自帶有信心值。沒有敘述文字、沒有程式碼、沒有解釋。TypeSafe 的推銷重點是,這種狹隘性就是產品本身,因為它換來了生成式模型無法匹敵的速度與價格——根據該公司自家的發布資料,比「可相比的 LLM」快 20 到 200 倍、便宜 40 到 400 倍,每百萬個輸入 token 收費 0.042 美元,輸出則完全不計費。
最初 48 小時內公布的最有用數字,並不在其中。它來自 Every:其評測負責人讓 Jev 跑過 27 篇已發表的 Every 文章,外加 10 篇 AI 風格仿作,一次對全部 37 份文件提出 21 個問題——不到 0.7 秒內完成 777 次判斷,成本約四分之一美分。第二項測試由 Every 的執行長操刀,以 12 段合成段落——六段乾淨、六段刻意植入缺陷——對上四項寫作檢查。Jev 的結果是每段中位數 0.35 秒,而 Claude Fable 5.1 在高強度模式下為 8.83 秒:速度快約 25 倍,成本約為其 1/580。它抓到了七個植入缺陷中的六個。Claude Fable 5.1 則七個全數抓到。Every 的評語是「不錯,但不完美」,而這正是目前任何人發表過的唯一獨立測試中,對 Jev 最誠實的一句總結——速度與成本的宣稱經得起第三方檢驗,準確度的宣稱則比前沿水準低了一階,而樣本規模之小,任誰都不該據此得出可用於正式生產的結論。
關於這篇報導所依據的證據類型,有幾點需要說明,因為對一款這麼新的模型來說,各層級之間的差距異常懸殊。Jev 是真實存在且可調用的:有已記錄的端點、一套 Python SDK、一個模型別名,以及已公布的價格。這次發布是由廠商宣布的,不是外洩,也沒有人在猜測它是否存在。但 TypeSafe 開頭提出的每一項效能聲明,都是 TypeSafe 自家的說法,架構尚未公開,權重也還沒釋出,而支撐 20-200x 這個標題數字的基準測試儀表板,是一組內部工作流程評估,而非公開排行榜。有一個外部單位測試過它。本文刻意將廠商數字、獨立數字和未解問題明顯區分開來,而不是把它們平均成一個根本不存在的共識。
TypeSafe 實際上推出了什麼
Jev 是 TypeSafe 所謂 System One 模型中的第一個——這個名稱借自 Daniel Kahneman 認知中快速、直覺的那一半,相對於聊天機器人所模仿的較慢、審慎的模式。TypeSafe 所對比的是標準做法:強迫文字生成器輸出結構化輸出,然後再把那段文字解析回程式碼能信任的東西。Jev 完全跳過文字。TypeSafe 自家的文件直言不諱地指出:「大型語言模型(LLMs)是為了產出供人類閱讀的文字而設計。當你需要模型做出一個將由你的程式碼取用的判斷時,這就造成了不匹配。」
輸出表面就是三個基元,沒有其他東西。你提出的每個問題都必須是其中一個:
• 選擇 — 從你提供的清單中挑選一個選項,回傳所選選項,以及每個候選項的機率和一個信心值。每個欄位的選項上限為 255 個;超過此數時,TypeSafe 記載了一種兩階段模式:先獨立為候選項評分,再進行選擇。
• 評分 — 將狀態置於有序評分量表上,傳回等級、每個等級的機率,以及信心度。文件中以 0-1 尺度的流失風險為例。
• Noul ——「no」與「null」的混成詞——一個單一的是/否主張,回傳其為真的校準後機率。

有趣的特性不在於任何單一基本元件,而在於它們如何組合。三者都能混在單一 API 呼叫中,而每個問題都會針對同一份狀態的單次讀取並行評估。TypeSafe 的文件指出,加入問題「幾乎不改變回應時間」,而獨立測試也在實務上印證了這一點——橫跨 37 份文件的 21 個問題,落在同樣的 0.7 秒內。這就是讓每次判斷的成本驟降的原因:你付的不是更長的生成,而是一趟處理。
依據文件記載以及早期使用者的回報,實際的適用範圍大致如下:請求預算約為 32,000 個 token,TypeSafe 的文件將其描述為約 150,000 個英文字元;推出時不支援圖片或音訊輸入;而且請求和回應的格式並非 OpenAI chat-completions 的慣例,因此呼叫它需要專門打造的用戶端,而非單純替換 base URL。使用方式是早期存取候補名單加上瀏覽器遊樂場,模型別名為code>jev-latest/code>。
RLCD 指的是校準,而非偏好
TypeSafe 用一種它稱之為 RLCD——Reinforcement Learning for Calibrated Decisions(校準決策強化學習)——的方法來訓練 Jev,根據該公司自家的文件。這個縮寫還很新,早期報導對它的展開並不一致,因此值得確切釐清它實際上命名的究竟是什麼,因為這個區別正是整項研究主張的核心。
RLHF 針對人類偏好的輸出進行最佳化。RLVR 針對可驗證的正確性進行最佳化,也就是測試案例能通過的那種正確性。RLCD 最佳化的則是校準度:一個自稱有 70% 信心的模型,應該大約有 70% 的時候是對的。這與「答對」是不同的目標,而這正是每個 Jev 答案都附帶機率分布、而不只是單純一個答案的原因。它預設的失效模式,是一個知道自己何時不知道的模型,讓你的程式碼能決定該如何應對。
那實際上為你換來的是一個控制介面。文件所記載的模式是三段信心區間——頂端自動執行、中段標記或確認、底端轉由真人處理——而閾值存在於你的程式碼中,而非模型裡。這些區間是否誠實,是一個關於你資料的實證問題,而這正是 TypeSafe 明確要你自己回答的問題,並指出信心閾值因使用情境而異,應以你自己標註的範例來測試。那段指示是整份文件中最重要的一句話,也是下一節之所以存在的原因。
這些數字,依產出者排序。
這正是大多數關於 Jev 的報導開始含糊其辭的地方,因此值得明確交代其來源。以下是來自廠商的內容、來自獨立測試者的內容,以及單純仍未知的部分。
• 廠商自述、未經重現——那些重點速度與成本宣稱。相較於前沿 LLM 呼叫的 3-329 秒,端到端延遲為 70-500 毫秒;快 20-200 倍、便宜 40-400 倍;單一最佳情況工作流程結果宣稱快 193.6 倍、便宜 444.6 倍。TypeSafe 承認這些是最佳情況,而非普遍數據。
• 供應商回報,且可在價目表上查核——每百萬個輸入符元 0.042 美元,也就是每十億個 42 美元,而輸出免費。輸出之所以免費,原因在於機制而非促銷:沒有自迴歸解碼需要計量,因此沒有輸出符元可計費。作為規模對照,同一份發布資料將典型前沿模型的輸入價格定在每百萬個 0.20 至 10 美元,而輸出通常是輸入價格的五倍左右。
• 廠商自行提報,來自內部基準測試——TypeSafe 自家的工作流程儀表板,涵蓋四項任務共 711 個案例,參考答案是根據 GPT-6 Astra 與 Claude Fable 5.1 的平均判斷推導而來,而非真實基準。在該儀表板上,Jev 總體為 67.8%,最佳比較對象則為 74.1%。分項來看:安全事件 61.7%,Opus 5 為 66.2%;代理追蹤可觀測性 71.6%,對手為 76.6%;發票處理 61.8%,對手為 79.1%;客戶服務 76.0%,對手為 78.3%。Jev 在該圖表的成本與延遲欄位勝出,但在準確度欄位落敗。儀表板本身註明可能存在測試框架偏誤,而 TypeSafe 表示他們刻意略過公開排行榜,轉而採用與產品更新綁定的單次評估。
• 獨立量測、小樣本——上述的 Every 測試:777 次判斷在不到 0.7 秒內完成,成本約四分之一美分;11 項實驗共 1,709 次判斷,總成本不到一美分;在 12 段文本分類任務上,速度約快 25 倍,成本僅為 Claude Fable 5.1 的 1/580,但漏掉了比較對象所抓到的七個植入缺陷中的一個。Every 自己的結論是,在投入生產之前,會希望進行更徹底許多的準確性檢查。
• 未知——架構。發佈時沒有論文、沒有參數量、沒有訓練算力揭露、沒有權重。TypeSafe 表示,細節「目前暫且保密」,論文可能之後才發布。

這些層級之間的模式是一致的,而且它不是 200 倍標題所暗示的那種模式。每一項獨立數據與廠商數據都一致認為,Jev 明顯更便宜、也明顯更快。任何地方都沒有數字——包括 TypeSafe 自家的數字——顯示它比同價位對標的前沿模型更準確。在廠商自家的儀表板上,它大致落在優質中階模型的水準。真正站得住腳的比較不是「以百分之一的價格,聰明如前沿模型」——而是「每次呼叫只需幾分之一美分,判斷力就接近中階模型,且快到能在每一個回合都執行」。
「零幻覺」代表什麼,又不代表什麼
TypeSafe 的發布資料中有一張圖表,顯示 Jev 的工具呼叫錯誤率為 0%,而比較模型的錯誤率則非零;此外,「抗幻覺」這個說法也伴隨該模型流傳。這兩者都屬實,但也都比字面上讀來得更狹隘。
這項保證是結構性的。每個可能的答案都在模型執行之前就被列舉出來——你提供了選項清單、評分規準,或是真/假陳述——因此不存在任何空間可以輸出宣告型別之外的值。格式錯誤的工具呼叫不是 Jev 能產生的東西。這是貨真價實的工程特性,而對任何曾花上一整週圍繞 JSON 解析失敗撰寫重試邏輯的人來說,它值真金白銀。
這並不是一項關於正確性的主張。一個符合 schema 的答案仍可能是錯的:Jev 可以很有自信地把一筆帳務投訴轉到技術佇列,而輸出會完美地符合格式,卻毫無用處。Almeida 自己也說過同樣的話,承認有可能自信滿滿地犯錯。要同時掌握這兩項事實,有用的解讀方式是:Jev 消除了源自輸出格式的那一類錯誤,而對於源自判斷的那一類錯誤則完全無能為力。這意味著,準確度的問題完全是校準的問題,而校準正是你必須自己去衡量的那件事。
如何用自己的資料檢驗校準主張
校準是少數你能用幾百個範例、且無需任何 ML 基礎設施就能妥善檢查的模型屬性之一,也是在 Jev 碰觸正式環境路徑之前唯一重要的測試。程序很短。
拿幾百個你已經有標籤的案例。問 Jev 那個真正重要的問題——路由決策、風險分數、缺陷檢查——然後依照它回報的信心水準,把答案分到不同桶子裡。接著檢查 0.9 信心桶是否大約 90% 的時間是對的,0.7 桶大約 70%,以此類推。校準良好的模型會描出一條對角線。一個只是有信心的模型會把所有東西都集中在 0.9 以上,卻只有 70% 的時間是對的,而這就是那種會悄悄弄壞自動化流程的形狀。
同一個測試會告訴你該用哪些閾值。如果 0.9 這個分桶在你的資料上真的準確率達 90%,你就可以把它自動化。如果你的中間區間一團模糊,你就把它轉給人工,或交給生成式模型,讓昂貴的路徑處理這種模糊性。這種拆分——用便宜模型處理有信心的大多數,用昂貴模型處理不確定的其餘部分——正是 Jev 所主張的實際架構,而這也是為什麼最好把這個模型理解為一個元件,而不是替代方案。
費用幾何,逐一拆解
這套定價簡單到可以輕鬆推算,而這很少見。輸入為每百萬個 token 0.042 美元。輸出免費。在文件記載約 150,000 個字元的請求額度下,單次最大規模的呼叫成本遠低於一美分。
兩個被報導的數字讓人感受到規模。一位早期使用者執行了約 5,000 次請求,花費大約 $2。Doom 示範——Jev 使用遊戲狀態的文字描述而非原始像素來操控機器人——以每秒約 10 次呼叫運行,每小時約 $7。而 Every 在 37 份文件中的 777 次判斷,成本約為四分之一美分,這個數字讓有趣的用例變得清晰可辨:在那樣的價格下,檢查代理迴圈的每一個回合不再是成本考量,而成為預設做法。
這才是支持 Jev 的真正論據。每一輪都做一次驗證檢查——這次工具呼叫是否與上一次矛盾、這項輸出是否與使用者表明的意圖一致、這是否該發出警示——若用前沿模型,技術上向來可行,但大規模執行時在經濟上荒謬至極。在每百萬個 token 收費 0.042 美元且不收取輸出費用的情況下,同樣的檢查在每一輪都變得負擔得起。這裡的價值不在於 Jev 比前沿模型思考得更好,因為它並沒有。價值在於它思考得夠便宜、夠快,因此可以不斷被諮詢。
值得直說,因為這是顯而易見的下一個問題:OrcaRouter 並不提供 Jev。TypeSafe 的模型屬於早期存取、需排入候補名單,而且使用自家的請求格式,因此任何想測試它的人都得直接透過 TypeSafe。路由層真正適合的位置,是工作流程的另一半。Jev 所設計針對的模式是兩個模型,而非一個——Jev 做出具型別的決策,而生成式模型則負責需要文句、程式碼或解釋的部分。生成式的那一半,正是 OrcaRouter 所涵蓋的範圍:橫跨 15 家供應商的 197 個模型,透過一組與 OpenAI 相容的金鑰即可使用,並以供應商定價原價轉供、0% 加價,因此廠商一降價,當天就會反映在我們這邊。Jev 式工作流程的兩半都能在無須第二份合約的情況下測試,而當決策元件尚未經過驗證時,容錯移轉路徑正是避免糟糕的校準結果演變成生產事故的關鍵。

Jev 不適合的地方
供應商異常清楚地說明了這些限制,這讓本節很容易誠實地撰寫。Jev 無法生成自由文字。它無法撰寫程式碼。它無法進行對話。它沒有聊天介面、沒有圖像輸入,上下文預算約為 32,000 個 token——比它在價格上被拿來比較的長上下文模型低了一個數量級。選擇欄位上限為 255 個選項。而如上所述,「不產生幻覺」的特性關乎輸出格式,而非真實性。
這張網的適用範圍相當狹窄。擅長:大量分類與路由、護欄與驗證流程、延遲至關重要的決策、平行為大量文件集評分,以及任何正確答案確實是選項、尺度上的數值或布林值的情況。不擅長:任何形式的開放式生成、長脈絡推理、多輪對話,或任何正確答案是一句話的任務。如果你的問題無法化約為一個具型別的提問,Jev 並不是解決它的更便宜方式——它根本不是解決它的方式。
對於這種論述框架,也有一個值得繼續保留的合理批評。把 Jev 稱為前沿模型,是借用了這個模型尚未掙得的可信度:它不會寫程式、不會對話,甚至寫不出一句話,而那些比較圖表以前沿模型作為基準,但準確度那一欄說的卻是另一回事。更站得住腳、也是證據真正支持的說法是:TypeSafe 已把結構化決策的速度與成本前沿大幅向外推展。能做到這點已經很不簡單,但那與打造出一個足以和 GPT-6 Astra 或 Claude Fable 5.1 匹敵的模型,是兩回事。
什麼會改變這幅景象?
三件事,大致依其重要程度排列。
• 一篇已發表的架構論文或開放權重。關於 Jev 如何達到其速度的一切目前都是黑箱,而平行評估是該機制的說法——Almeida 所繪製的類比是取代序列計算,就像 Transformer 取代遞迴神經網路一樣——是一種斷言,而非已證實的結果。在設計被發表之前,速度是事實,而解釋則是行銷。
• 一項樣本數更大的第二次獨立評估。Every 的測試是目前可取得的最強證據,而且涵蓋了 12 段文字,針對具決定性的準確度問題。再進行一次獨立測試,針對數百個已標註案例,就能確定每七個缺陷中漏掉一個究竟是雜訊,還是真正的錯誤率。
• 針對真實、雜亂輸入的校準稽核。迄今發表的一切都採用乾淨的測試框架。對於一個全部價值主張都建立在可信賴信心分數上的模型而言,懸而未決的問題是:這些分數在真正模稜兩可的案例上表現如何——也就是人類審核者同樣會猶豫的那些案例。這個數字決定了能否安全地以 Jev 進行自動化,而沒有人發表過它。
在那之前,合理的立場是具體而非籠統。Jev 是一個真實、已推出、異常便宜的模型,在輸出可靠性上具有真正的結構性優勢,準確度表現大致位於中階,而其校準主張看似合理、由其自家供應商明確建議進行自我測試,且僅在小型樣本上經過獨立驗證。如果你的工作流程中有某個步驟可化約為某種類型的問題,且這個問題被問得足夠頻繁,以致動用前沿模型會很浪費,那麼這就是提出該問題最便宜的方式之一——而它回傳的信心值才是你在信任之前該測試的部分,不是速度。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
