Una hero card generata intitolata 'Che cos'è TypeSafe AI?' con il sottotitolo 'Il laboratorio dietro Jev 1.13 - decisioni tipizzate, non prosa', su tre righe etichettate: 'Azienda: TypeSafe AI, San Francisco', 'Modello: Jev 1.13 (typesafe/jev-1.13), lanciato il 2026-09-15' e 'Instradato su OrcaRouter dal 2026-09-24'. Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Che cos'è TypeSafe AI? Il laboratorio dietro Jev 1.13 prende decisioni, non frasi

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

TypeSafe AI è un piccolo laboratorio di San Francisco che vende un modello che non è in grado di scrivere una frase, e Jev 1.13 (typesafe/jev-1.13) è il modello in questione. Prende un pezzo di stato — un'email, una riga di log, un ticket di supporto, un blob JSON — più un insieme di domande con nome, e restituisce una risposta tipizzata per ogni domanda, ciascuna con il proprio valore di confidenza. Niente prosa, niente codice, niente spiegazioni e niente casella di chat. Il modello stesso è stato lanciato il 2026-09-15, quindi non è nuovo e qui non c'è nessuna storia di lancio: questa pagina esiste per un cambiamento più piccolo e databile. Il 2026-09-24, OrcaRouter ha aggiunto typesafe/jev-1.13 al suo catalogo e ha aperto la scheda del modello al proprio indirizzo, ed è stata la prima volta che Jev poteva essere chiamato tramite un gateway di terze parti anziché solo tramite l'endpoint di TypeSafe. Questo è l'evento, ha sei giorni al 2026-09-30, ed è il motivo per cui un lettore che non ha già un contratto TypeSafe può ora mettere un modello System One sulla stessa chiave dei modelli generativi accanto ai quali è progettato per stare. Tutto il resto in questa pagina è contesto sull'azienda che l'ha creato.

L'inquadramento onesto della tempistica, perché conta per quanto di tutto questo sia verificato: Jev è stato lanciato più di due settimane fa ed è generalmente disponibile dal 2026-09-21, quando TypeSafe ha rimosso la sua lista d'attesa. Ciò che rientra nella finestra di sette giorni è il cambiamento di routing, non il modello. Se sei arrivato qui aspettandoti una recensione del lancio, il lancio è già avvenuto e alcuni altri pezzi lo hanno trattato.

Una pagina aziendale con un manifesto e senza diagramma di architettura.

TypeSafe si descrive, nella propria meta descrizione, come "un laboratorio di IA che costruisce infrastrutture di intelligenza machine-native per l'automazione", con sistemi "progettati per prendere decisioni all'interno del software". La sua homepage è contrassegnata con Versione 0.01 e reca in calce "Made in SF". C'è un manifesto che sostiene che la via più breve verso una trasformazione economica di stampo IA passi dal rendere l'intelligenza componibile, così che il software possa invocare un giudizio semantico nello stesso modo in cui invoca una funzione; il riassunto che l'azienda stessa dà del proprio piano è: rilasciare la forma di IA componibile machine-native, poi renderla abbastanza affidabile per l'automazione reale, quindi offrire astrazioni di livello superiore abbastanza stabili da poterci costruire sopra. Il suo slogan è "Stiamo costruendo prod, non Dio". La pagina del team nomina tre fondatori — Diogo Almeida come CEO, Sasha Sheng come COO ed Erik Gafni come CTO. Questo è tutto ciò che l'azienda dice di sé: una posizione, un prodotto, tre nomi e nessun numero sull'azienda stessa.

Ciò che il sito non riporta è la cosa a cui un ingegnere che valuta una nuova dipendenza ricorre per prima. Non c'è una pagina sull'architettura, nessun conteggio dei parametri, nessuna informativa sul compute di addestramento e nessuna model card nel senso accademico. La dashboard di benchmark di TypeSafe stessa è ancora contrassegnata come in sospeso. Per un'azienda il cui pitch si fonda sull'affidabilità, la superficie informativa è esile, e questo è un fatto su ciò che è stato pubblicato, non un'accusa su ciò che viene nascosto.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: la categoria, e perché il nome è preso in prestito

Jev è il primo di quelli che TypeSafe chiama modelli System One. Il nome deriva dalla distinzione di Daniel Kahneman tra il pensiero veloce e intuitivo del Sistema 1 e quello lento e deliberato del Sistema 2, e il post di lancio dell'azienda lo dice direttamente — ammette anche che "System 1 thinking" ha assunto una connotazione di tendenza all'errore, e sostiene che questi modelli possono essere resi più affidabili delle alternative. Type non ha coniato il termine e non ne è proprietaria.

Il contenuto pratico della categoria è una deliberata divisione del lavoro: un modello che decide e un modello che scrive. Dovresti mantenere l'aritmetica, l'ordinamento delle date, il conteggio e il confronto tra stringhe nel codice ordinario, dove sono esatti, e affidare il giudizio semantico a Jev. I tipi di domanda a cui può rispondere sono tre:

• noul — un giudizio vero/falso, restituito con una probabilità calibrata

• Scelta — seleziona una tra un massimo di 255 opzioni etichettate

• punteggio — valutare su una scala ordinata; la nostra scheda pubblica livelli da 2 a 10, e la documentazione di TypeSafe stessa mostra un esempio con indice 0, quindi considera i livelli del fornitore come la definizione e il 2-10 come ciò che la scheda pubblica

Ogni domanda ha le proprie istruzioni e, per scelta e punteggio, i propri criteri. Le richieste superiori a circa 64K token di input vengono rifiutate prima di raggiungere il modello, e le risposte non sono trasmesse in streaming. Il fornitore documenta separatamente il budget di stato — lo stato più la singola domanda più lunga — a 32K token, una cifra più ristretta rispetto ai 65.536 token di contesto indicati sulla scheda e non in contraddizione con essa.

La loro tesi, nelle loro stesse parole

TypeSafe enuncia la tesi meglio di quanto farebbe qualsiasi riassunto, quindi eccola testualmente: "Gli LLM producono parole per le persone. Jev produce decisioni tipizzate ed è più simile al codice: affidabile, veloce, autoconsistente e type-safe." Anche il metodo di addestramento che vi sta dietro è loro, ed è un termine che vale la pena attribuire con precisione, proprio perché è stato ripreso altrove come se fosse generico. TypeSafe lo chiama Reinforcement Learning for Calibrated Decisions, o RLCD, e lo contrappone a RLHF e RLVR: mentre quelli ottimizzano le preferenze umane o ricompense verificabili a livello programmatico, RLCD punta, secondo la formulazione dell'azienda, a "risposte con probabilità epistemicamente oneste sui compiti System One". Considera RLCD un conio di TypeSafe, non un acronimo consolidato nella letteratura.

I numeri con cui aprono, e chi ha scelto il carico di lavoro

La homepage si apre con "193,6 volte più veloce, 444,6 volte più economico", con nota a piè di pagina riferita ai workflow per le attività di System One. Sotto c'è un esempio pratico: TypeSafe AI a $0,000081 e 0,114 secondi contro LLM a $0,013880 e 8,566 secondi. Più in basso, "$42 per miliardo di token di input. Prezzo di input 238 volte inferiore a Claude Fable 5.1." E una sezione intitolata "Zero allucinazioni", che a un esame più attento è un'affermazione sulle stime di confidenza anziché una prova di zero errori: ogni decisione di Jev porta con sé una stima di confidenza, così il software può agire quando la confidenza è alta e passare la questione a un livello superiore quando non lo è. Tutti e quattro sono dati di TypeSafe, su carichi di lavoro scelti da TypeSafe, e nessuno di essi è stato replicato in modo indipendente. Il post di lancio stesso afferma che il team si aspetta che i suoi 193,6x e 444,6x si collochino all'estremità alta dei guadagni nel mondo reale, e osserva che i workflow sono stati creati dal suo stesso team delle capacità, con risposte di riferimento prodotte da modelli concorrenti. I nostri dati di serving di sette giorni sullo stesso modello indicano un tasso di errore dello 0,49%, che è una misurazione diversa su un carico di lavoro diverso ed è il contrappeso onesto a leggere "zero" come un assoluto.

Quello che non hanno pubblicato

L'architettura di Jev, il numero di parametri, la potenza di calcolo per l'addestramento e i pesi non sono pubblicati, e non esiste un repository dei pesi nell'organizzazione GitHub dell'azienda. Verificato il 2026-09-30, quell'organizzazione ha undici repository pubblici; quelli sostanziali sono tooling, tutti MIT o Apache-2.0 — un repository agent-skills, un SDK Python, un SDK TypeScript, un adattatore client drop-in basato su altre API LLM, una raccolta di moduli Dagger, del codice workflow-eval pubblicato, un nodo n8n e il sito dell'organizzazione stessa. Il numero di stelle e le date di push cambiano, quindi leggili il giorno stesso anziché da questa pagina.

Tre degli undici sono fork di progetti non correlati: vLLM, LLaDA e un provider Pulumi per ClickHouse Cloud. Sono fork del lavoro di qualcun altro e non dicono nulla su come è costruito Jev — in particolare, nulla sul fatto che Jev sia basato sulla diffusione. La risposta in una riga alla domanda se Jev sia open source è che gli strumenti sono aperti e il modello no.

Ciò che concedono a se stessi

Due ammissioni dal post di lancio valgono più di gran parte delle avvertenze dei fornitori, perché indicano i punti esatti in cui le prove sono deboli. Sul prezzo: «Non possiamo dimostrare che non sia sovvenzionato; ci servirà il lungo termine per dimostrare la sostenibilità del nostro prezzo (che prevediamo scenda, non salga).» Sulla velocità: «le nostre valutazioni pubblicate sono generalmente eseguite dai nostri portatili sulla costa occidentale (è qui che il nostro servizio è attualmente basato).» Ce n'è una terza, più utile per chiunque ci costruisca sopra: per insiemi di scelte ad alta cardinalità, Jev esegue un sistema a due fasi che assegna punteggi in modo indipendente e poi compie una scelta esplicita, «da cui il rallentamento occasionale». È il fornitore che spiega perché la latenza non è uniforme tra i tipi di domanda, ed è il genere di cosa che normalmente si scopre da un thread di supporto.

Dove puoi effettivamente chiamarlo, a oggi

Tramite l'API di TypeSafe stessa, dove il modello è disponibile a livello generale e la homepage usa ancora la dicitura "early access" del fornitore — tale dicitura è attuale e vale la pena mantenerla, mentre "waitlisted" è stato ritirato: la documentazione pubblica limiti operativi concreti (100K token al secondo, 40 richieste al secondo, 429 con backoff dell'SDK al superamento di una delle due soglie) e non contiene alcun riferimento a liste d'attesa. E, dal 2026-09-24, tramite OrcaRouter.

Vale la pena dichiarare con precisione ciò che offriamo, perché la forma della chiamata è la parte che differisce. La voce di catalogo è typesafe/jev-1.13, denominata TypeSafe: Jev 1.13, con tipo di endpoint supportato "systemone" — quindi si raggiunge tramite POST /v1/systemone anziché con la forma chat-completions di OpenAI, non in streaming, input testuale e output JSON strutturato, fino a circa 64K token di input tra stato e domande combinati. L'input costa $0.042 per milione di token e l'output viene fatturato a zero, perché non ci sono token di output da misurare: una decisione tipizzata non è prosa. Questo è il prezzo di listino del fornitore passato così com'è, con 0% di markup, sulla stessa chiave degli altri 200+ modelli nel catalogo — una API per 200+ modelli, 0% di markup (prezzo di listino del fornitore passato così com'è, quindi i tagli di prezzo dei venditori sono attivi qui lo stesso giorno). Se il motivo per cui stai leggendo di TypeSafe AI è che vuoi scoprire se la calibrazione di Jev regge sui tuoi dati prima di impegnare un percorso di produzione su di esso, eseguirlo accanto a un modello generativo di cui ti fidi già è il modo economico per scoprirlo; il failover su quel modello quando la confidenza di Jev risulta bassa è il modo economico per rilasciarlo.

I nostri dati di erogazione di sette giorni per la finestra che termina il 2026-09-30, che sono i nostri numeri dal nostro traffico anziché il benchmark del fornitore: p50 151 ms, p95 247 ms, circa 349 token di output al secondo, un tasso di errore dello 0,49% e 76,2 M di token erogati. Il p50 giornaliero in quella finestra è stato di 175, 170, 163, 161, 170, 147, 143 ms, quindi la mediana è andata calando moderatamente. Un giorno della serie, il 09-28, ha un p95 di 2.448 ms — un vero outlier nei dati, non la norma, e non un numero su cui pianificare un budget di latenza. Questi si aggiornano quotidianamente; la card è la fonte.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Dove il modello è debole, secondo TypeSafe

Il fornitore pubblica una pagina sulla jaggedness per Jev 1.13, revisionata l'ultima volta il 2026-09-17, che descrive le modalità di errore con più franchezza della maggior parte del materiale di lancio. È la pagina giusta da leggere prima di costruire sul modello, e il suo stesso elenco si presenta così. Jev risponde alla domanda che hai scritto, non a quella che intendevi, quindi parole che delimitano l'ambito, negazioni e condizioni implicite vanno esplicitate. Non è una calcolatrice: ha prestazioni peggiori sulle domande matematiche che su quelle semantiche. Legge le date come testo anziché come quantità ordinate, quindi ordinamento, lacune e appartenenza a finestre non sono affidabili, e va ancora peggio con formati misti. Le doppie negazioni e l'indirezione a più passaggi riducono l'accuratezza. L'accuratezza cala man mano che lo stato cresce con dettagli irrilevanti — la pagina dice che "soffre di context rot" — quindi filtrare prima nel codice è la soluzione. Lo stato viene trattato come dati, non come ostile per impostazione predefinita, quindi le istruzioni iniettate possono spostare le risposte. Istruzioni e criteri non allineati lo confondono. Gli invarianti strutturali non sono garantiti: un noul e un output di scelta possono non corrispondere, e una domanda più la sua negazione possono non sommare a uno, quindi le soglie non dovrebbero essere trasferite tra i due. E non è addestrato a generare testo — forzarlo attraverso scelte concatenate "non funzionerà bene e sarà molto lento."

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Come interpretare TypeSafe AI a sei giorni dal cambio di routing

L'azienda avanza un'affermazione forte, specifica e falsificabile: che un modello decisionale ristretto possa essere più veloce, più economico e più affidabile di uno generale sul sottoinsieme di lavoro in cui serve un giudizio anziché un paragrafo. L'affermazione è plausibile e in parte autoevidente — le stime di confidenza sono una vera differenza progettuale, il prezzo è reale, e la latenza che misuriamo sul nostro traffico è dello stesso ordine di quella del fornitore. Manca la parte che consentirebbe a un esterno di verificare il resto: nessuna architettura, nessun parametro, nessun peso, nessun benchmark indipendente, e un prezzo che l'azienda stessa dice di non poter dimostrare sostenibile. Le modalità di fallimento sono documentate, il che è più di quanto faccia la maggior parte dei laboratori ed è la migliore ragione in assoluto per prendere sul serio il modello.

Se stai decidendo se prestare attenzione: esegui Jev su input che hai già etichettato, con le etichette nascoste, e guarda se i suoi numeri di confidenza separano i casi che azzecca da quelli che sbaglia. Quel test costa quasi nulla a $0,042 per milione di token di input ed è l'unico che risponde alla domanda che hai davvero. Se stai decidendo se fidarti dell'azienda: le informazioni divulgate sono quelle che sono, e la risposta onesta è che attualmente le prove sono la parola del fornitore più qualunque cosa tu generi da solo.