「TypeSafe AIとは何か?」というタイトルの生成ヒーローカード。サブタイトルは「Jev 1.13を生み出したラボ — 散文ではなく型付きの意思決定」で、ラベル付きの3行:「企業:TypeSafe AI、サンフランシスコ」「モデル:Jev 1.13(typesafe/jev-1.13)、2026-09-15リリース」「2026-09-24よりOrcaRouter上でルーティング」。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

TypeSafe AIとは何か?Jev 1.13を支えるラボは、文章ではなく意思決定を行う

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

TypeSafe AIは、一文も書けないモデルを販売するサンフランシスコの小さなラボであり、Jev 1.13(typesafe/jev-1.13)がそのモデルです。これは、状態の断片——メール、ログ行、サポートチケット、JSONブロブ——と、名前付きの質問の集合を受け取り、質問ごとに型付きの回答を1つずつ、それぞれ独自の信頼度付きで返します。散文もコードも説明もチャットボックスもありません。モデル自体は2026-09-15にローンチされたので、新しいものではなく、ここにあるのはローンチの話ではありません。このページが存在するのは、より小さく、日付を特定できる変更があったからです。2026-09-24に、OrcaRouterはtypesafe/jev-1.13をカタログに追加し、独自のアドレスでモデルカードを公開しました。これにより、JevはTypeSafe自身のエンドポイントだけでなく、サードパーティのゲートウェイを通じても呼び出せるようになった最初の事例となりました。これがその出来事であり、2026-09-30時点で6日前の話です。そして、まだTypeSafeの契約を持っていない読者でも、System Oneモデルを、それが隣に並ぶように設計されている生成モデルと同じキーに載せられるようになった理由でもあります。このページの他のすべては、それを作った会社についての背景説明です。

タイミングについて正直に位置づけると、これはどれだけが検証済みかに関わるので重要だ。Jev は2週間以上前にローンチし、TypeSafe がウェイトリストを解除した 2026-09-21 から一般提供されている。7日間のウィンドウ内にあるのはルーティング変更であって、モデルではない。ローンチレビューを期待してここに来たなら、ローンチはすでに起こっており、いくつかの他の記事がそれを扱っている。

マニフェストはあるがアーキテクチャ図がない企業ページ

TypeSafeは、自社のメタディスクリプションで自らを「自動化のための機械ネイティブなインテリジェンス基盤を構築するAIラボ」と説明しており、そのシステムは「ソフトウェア内で意思決定を行うように設計されている」という。ホームページには Version 0.01 と刻印され、フッターには「Made in SF」とある。AIが形作る経済変革への最短経路は、インテリジェンスをコンポーザブルにすること、つまりソフトウェアが関数を呼び出すのと同じように意味的判断を呼び出せるようにすることを通ると主張するマニフェストがある。同社自身による計画の要約は、機械ネイティブなコンポーザブルAIの形を提供し、次にそれを実際の自動化に十分使えるほど信頼できるものにし、その後、その上に積み重ねられるほど安定した高水準の抽象化を提供することだ。キャッチコピーは「私たちは神ではなくprodを構築している」。チームページには3人の創業者——CEOのDiogo Almeida、COOのSasha Sheng、CTOのErik Gafni——が挙げられている。これが、この会社が自らについて語っているすべてだ。立場、製品、3つの名前、そして会社自体に関する数字は何もない。

サイトに載っていないのは、新しい依存関係を評価するエンジニアが最初に手を伸ばすものだ。アーキテクチャのページはなく、パラメータ数もなく、学習計算量の開示もなく、学術的な意味でのモデルカードもない。TypeSafe自身のベンチマークダッシュボードは、依然として保留中と表示されている。信頼性を売り文句の土台にしている企業にしては、開示されている情報は薄い。そしてこれは、何かが隠されているという非難ではなく、何が公表されているかについての事実である。

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One:そのカテゴリーと、名前が借用された理由

Jevは、TypeSafeが「System One」モデルと呼ぶものの第一弾です。この名称は、ダニエル・カーネマンが提唱した、速く直感的なシステム1の思考と、遅く熟慮的なシステム2の推論という区分に由来しており、同社のローンチ記事もそう明言しています。その記事はまた、「システム1の思考」が誤りを起こしやすいという含みを帯びてきたことも認めたうえで、これらのモデルは代替となるものよりも信頼性を高められると論じています。TypeSafeがこの用語を生み出したわけでも、所有しているわけでもありません。

このカテゴリの実用的な中身は、意図的な分業である。判断するモデルと、書くモデル。算術、日付の順序付け、カウント、文字列比較は、それらが正確に扱える通常のコードに任せ、意味的な判断は Jev に委ねることを想定している。答えられる質問タイプは3つある。

• noul — 真偽の判定。較正された確率とともに返されます

• choice — 最大255個のラベル付きオプションから1つを選ぶ

• スコア — 順序尺度で評価する。当社のカードは2~10レベルを公開しており、TypeSafe自身のドキュメントでは0始まりの例が示されている。したがって、ベンダーのレベルを定義として扱い、2~10はカードが公開しているものとして扱う。

各質問にはそれぞれ独自の指示があり、選択とスコアについては独自の基準がある。約64K入力トークンを超えるリクエストはモデルに到達する前に拒否され、応答はストリーミングされない。ベンダーは、状態予算——状態と単一の最長の質問を合わせたもの——を32Kトークンと別途記載しており、これはカード上の65,536トークンのコンテキストより狭い数値だが、それと矛盾するものではない。

彼らの主張を、彼ら自身の言葉で

TypeSafeはこの主張をどんな要約よりも的確に述べているので、ここに逐語で引用する。「LLMは人間のために言葉を生み出す。Jevは型付きの決定を生み出し、よりコードに近い。信頼でき、高速で、自己整合的で、型安全である。」その背後にある学習手法も同社のものであり、それが一般的なものかのように他所で取り上げられているからこそ、正確に出典を帰属させる価値のある用語だ。TypeSafeはこれをReinforcement Learning for Calibrated Decisions、略してRLCDと呼び、RLHFやRLVRと対比している。それらが人間の選好やプログラムによって検証可能な報酬を最適化するのに対し、RLCDが狙うのは、同社の言い回しでは「System Oneタスクにおいて認識論的に正直な確率を伴う回答」である。RLCDはTypeSafe独自の造語として扱うべきであり、文献で定着した頭字語と見なすべきではない。

彼らが真っ先に示す数字、そして誰がその作業量を選んだのか

ホームページのトップには「193.6倍高速、444.6倍安価」が掲げられ、System Oneタスク向けのワークフローに脚注が付いている。その下には実例が示されている:TypeSafe AIが0.000081ドル、0.114秒であるのに対し、LLMは0.013880ドル、8.566秒。さらに下には「入力トークン10億個あたり42ドル。Claude Fable 5.1より入力価格が238倍低い」とある。そして「ハルシネーションゼロ」と題されたセクションがあるが、よく見るとこれはエラーゼロの証明ではなく、信頼度推定に関する主張である。すべてのJevの判断には信頼度推定が付随するため、ソフトウェアは信頼度が高いときには行動し、そうでないときにはエスカレーションできる。これら4つはすべてTypeSafeの数値であり、TypeSafeが選んだワークロードによるもので、いずれも独立に再現されたものではない。ローンチ投稿自体も、チームは193.6倍と444.6倍が実世界での向上の上限近くに位置すると予想しており、ワークフローは自社のケイパビリティチームによって構築され、参照回答は競合モデルによって生成されたと注記している。同じモデルに関する当社自身の7日間の提供データでは、エラー率は0.49%であり、これは異なるワークロードでの異なる測定であり、「ゼロ」を絶対的なものとして読むことに対する正直な対抗指標である。

彼らが公表していないもの

Jevのアーキテクチャ、パラメータ数、トレーニング計算量、重みは非公開であり、同社のGitHub組織に重みリポジトリは存在しない。2026-09-30時点で確認したところ、その組織には11の公開リポジトリがある。実質的なものはツール類で、すべてMITまたはApache-2.0 — エージェントスキルリポジトリ、Python SDK、TypeScript SDK、他のLLM APIをバックエンドとするドロップインクライアントアダプター、Daggerモジュール集、公開されたワークフロー評価コード、n8nノード、および組織自身のサイト。スター数とプッシュ日は変動するため、このページからではなくその日に確認すること。

11個のうち3つは、無関係なプロジェクトのフォークである。vLLM、LLaDA、そしてClickHouse Cloud向けのPulumiプロバイダーだ。それらは他者の成果物のフォークであり、Jevがどのように構築されているかについては何も語っていない。特に、Jevが拡散ベースであることについては何も。Jevがオープンソースかどうかへの一行の答えは、ツールはオープンで、モデルはそうではない、というものだ。

彼らが自らに認めるもの

ローンチ記事にある2つの告白は、ほとんどのベンダーの注意書きよりも価値がある。なぜなら、証拠が弱いまさにその箇所を名指ししているからだ。価格について:「それが補助金で支えられていないことは証明できない。我々の価格設定の持続可能性を証明するには長期が必要だ(価格は上がるのではなく下がると見込んでいる)。」速度について:「我々が公開している評価は、通常、西海岸にある我々のラップトップから実行されている(現在サービスが拠点を置いているのはここだ)。」さらに3つ目があり、その上に何かを作ろうとする人にとってはより有用だ。高カーディナリティの選択セットでは、Jevは独立にスコアリングしてから明示的な選択を行う2段階システムを実行しており、「そのため時折速度低下が起こる」。これは、質問タイプによってレイテンシが一定でない理由をベンダー自身が説明しているものであり、普通ならサポートスレッドから知るような種類の情報だ。

今日現在、実際に電話をかけられる場所

TypeSafe自身のAPIを通じて、そこではモデルは一般提供されており、ホームページでは依然としてベンダー自身のフレーズ「early access」が使われている——この表現は現在も有効で、維持する価値がある。一方、「waitlisted」は廃止されている。ドキュメントには具体的な運用上限(毎秒100Kトークン、毎秒40リクエスト、いずれかを超えるとSDKのバックオフ付きで429)が記載されており、ウェイトリストに関する文言は一切ない。そして、2026-09-24以降は、OrcaRouter経由でも利用できる。

当社が提供する内容は正確に述べておく価値があります。というのも、異なるのは呼び出しの形式だからです。カタログ項目は typesafe/jev-1.13、名称は TypeSafe: Jev 1.13、対応エンドポイント種別は「systemone」です。そのため、OpenAI の chat-completions 形式ではなく、POST /v1/systemone 経由で到達します。非ストリーミングで、テキストを入力し、構造化 JSON を出力し、状態と質問を合わせて最大約 64K 入力トークンです。入力は 100 万トークンあたり $0.042、出力はゼロで課金されます。計量すべき出力トークンが存在しないからです。型付きの決定は散文ではありません。これはプロバイダーの定価をそのまま渡したもので、マークアップ 0%、カタログ内の他の 200 以上のモデルと同じキーで — 200 以上のモデルに対応する 1 つの API、マークアップ 0%(プロバイダーの定価をそのまま渡すため、ベンダーの値下げは同日中にここでも反映されます)。TypeSafe AI について読んでいる理由が、本番経路をそれにコミットする前に Jev のキャリブレーションが自分のデータで通用するかどうかを確かめたいからなら、すでに信頼している生成モデルの隣で動かすのが、安価に確かめる方法です。Jev の信頼度が低く返ってきたときにそのモデルへフェイルオーバーするのが、安価に本番投入する方法です。

2026-09-30 を終端とする期間の当社独自の7日間のサービング実績(ベンダーのベンチマークではなく、当社自身のトラフィックから得た数値)は、p50 151 ms、p95 247 ms、出力トークン数は毎秒約 349、エラー率 0.49%、提供トークン数 76.2M です。その期間の日次 p50 は 175、170、163、161、170、147、143 ms と推移したため、中央値は緩やかに低下傾向にあります。この系列の 09-28 の1日は p95 が 2,448 ms で、データ内の真の外れ値であり、通常値ではなく、レイテンシ予算を計画する際の基準にすべき数値でもありません。これらは毎日更新され、カードが情報源です。

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

TypeSafeによれば、モデルが弱いのはどこか

ベンダーは Jev 1.13 のジャギネスページを公開しており、最終レビューは 2026-09-17 で、ほとんどの発表資料よりも率直に失敗モードを挙げている。このモデルを基盤に何かを作る前に読むべきページであり、そのページ自身のリストは次のとおりだ。Jev は、あなたが意図した質問ではなく、あなたが書いた質問に答える。そのため、範囲を限定する語、否定、暗黙の条件は明示する必要がある。電卓ではない。数学的な質問では、意味論的な質問よりも性能が悪い。日付を順序付けられた数量ではなくテキストとして読むため、順序付け、間隔、ウィンドウへの所属は信頼できず、形式が混在しているとさらに悪い。二重否定とマルチホップの間接参照は精度を損なう。無関係な詳細によって状態が大きくなるにつれて精度が下がる — ページはそれが「コンテキストロットに悩まされる」と述べている — そのため、先にコードでフィルタリングするのが解決策だ。状態はデフォルトでは敵対的なものではなくデータとして扱われるため、注入された指示が回答を動かしうる。指示と基準が食い違うと、Jev は混乱する。構造的不変条件は保証されない。noul と choice の出力は対応している必要はなく、質問とその否定の合計が 1 になる必要もない。したがって、両者の間で閾値を移植すべきではない。また、テキストを生成するようには訓練されていない。連鎖する選択肢を通して無理に生成させても「うまく機能せず、非常に遅くなる」。

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

ルーティングから6日目にTypeSafe AIをどう読み解くか

その企業は、強く、具体的で、反証可能な主張をしている。狭い意思決定モデルは、段落ではなく判断を要する仕事の部分集合において、汎用モデルより速く、安く、信頼できるという主張だ。この主張はもっともらしく、一部は自己証明的でもある——信頼度推定は実際の設計上の違いであり、価格も実在し、自社トラフィックで測るレイテンシはベンダーのものと同じ桁だ。欠けているのは、部外者が残りを検証できるようにする部分だ。アーキテクチャも、パラメータも、重みも、独立したベンチマークもなく、しかもその企業自身が持続可能だと証明できないと認める価格だ。故障モードは文書化されている。これはほとんどのラボが行っていることを上回っており、このモデルを真剣に受け止めるべき唯一最大の理由である。

注意を払うべきかどうかを判断しているなら、すでにラベル付けした入力に対して、ラベルを伏せた状態で Jev を実行し、その信頼度の数値が、正しく答えたケースと間違えたケースを分けているかを見るといい。このテストは入力トークン100万あたり0.042ドルでほとんど費用がかからず、あなたが実際に抱えている問いに答える唯一のものである。その会社を信頼すべきかどうかを判断しているなら、開示されている内容はそのままであり、正直な答えは、現時点で根拠となるのはベンダーの言い分に、あなた自身が生成するものすべてを加えたものにすぎない、ということだ。