
Dove Jev 1.13 si rompe: l'elenco dei limiti di TypeSafe stesso
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 349 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 208 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Jev 1.13 (typesafe/jev-1.13) è stato rilasciato il 2026-09-15, il che lo colloca due settimane al di fuori degli ultimi sette giorni, quindi il suo lancio non è la notizia. L'evento datato è il 2026-09-24: quello è il giorno in cui OrcaRouter ha aggiunto typesafe/jev-1.13 al suo catalogo e ha aperto una scheda del modello — il primo supporto di serving per Jev in un gateway di terze parti, dopo due settimane in cui l'unico modo per chiamarlo era l'endpoint di TypeSafe stesso. Questo è importante qui per una ragione specifica. Jev è insolito in quanto il suo fornitore pubblica un elenco dei modi in cui fallisce, e un elenco che si può solo leggere è molto più facile da ignorare rispetto a un modello che si può effettivamente chiamare.
Questa pagina è quella lista, limitata a ciò che dice TypeSafe stessa, più i limiti operativi e il conto.
TypeSafe pubblica il proprio elenco di irregolarità

docs.typesafe.ai contiene una pagina intitolata Spigolosità di Jev 1.13. Si applica esplicitamente a jev-1.13, riporta una data di revisione 2026-09-17 e si apre con la formulazione del fornitore stesso: "Jev non è perfetto. Ecco alcuni spigoli vivi di cui siamo a conoscenza con jev-1.13. Molti di questi saranno corretti nelle versioni successive." Seguono nove modalità denominate, ciascuna con un caso concreto e un rimedio "Instead:". Nulla di quanto segue è dedotto, e nulla è ammorbidito — la formulazione è di TypeSafe, e dove l'azienda fornisce il proprio esempio, i numeri in esso contenuti sono i suoi.
Lettura letterale: risponde alla domanda che hai scritto
Le parole di definizione dell'ambito, le negazioni e le condizioni implicite vengono lette alla lettera. Si risponde a una domanda in base alle parole contenute nell'istruzione, "laddove una persona avrebbe potuto leggere l'intento dietro le istruzioni".
La diagnostica del fornitore è la parte utile: quando esamini una risposta sbagliata e ti ritrovi a spiegare ciò che intendevi davvero, quella spiegazione è la metà mancante dell'istruzione. I rimedi sono indicare la condizione esatta nelle istruzioni, inserire i casi limite nei criteri e, dove l'interpretazione è davvero inevitabile, suddividere la domanda in due domande letterali e combinarle nel codice.
Matematica e numeri: non è una calcolatrice
TypeSafe dice chiaramente di implementare la logica matematica nel codice. Tre fallimenti specifici sono alla base di questo:
• Il conteggio non è affidabile. Questo riguarda i caratteri in una parola, le occorrenze di un termine in un passaggio e gli elementi in un lungo elenco. "Il modello riconosce la forma di una risposta invece di conteggiare, e l'errore cresce con la dimensione della cosa che viene contata." Il test dello stesso fornitore per stabilire se valga la pena chiedere: se un'espressione regolare o un parser riescono a trovare l'unità, il conteggio appartiene al codice e il modello non aggiunge nulla.
• Le rappresentazioni numeriche sono meno efficaci di quelle semantiche. Le domande sui colori che usano valori esadecimali sono peggiori delle stesse domande che usano i nomi dei colori in inglese; se si forniscono terne RGB o valori esadecimali, Jev non è in grado di giudicare in modo affidabile se due valori sono vicini tra loro. Lo stesso divario si manifesta sul codice di basso livello — assembly o istruzioni codificate in binario — rispetto ai linguaggi di alto livello. Converti o raggruppa in bucket nel codice, e mantieni il modello per la parte che è davvero un giudizio.
• Gli output di punteggio non portano con sé grandezze esatte. Il fornitore afferma che i livelli di punteggio di Jev sono deboli in termini di calibrazione numerica. Un'aspettativa può essere usata per verificare se qualcosa supera una soglia; non può essere usata per ricostruire il numero interpolando tra i due livelli più vicini. Questo è un no categorico a un'intera classe di usi impropri — leggere un punteggio come una misurazione.
Data e ora: le date vengono lette come testo, non come quantità
Ordinare due date, misurarne la distanza o stabilire se una cade all'interno di una finestra non è affidabile, e peggiora ulteriormente con formati misti, riferimenti relativi e confini di dominio quali trimestri, finestre di liquidazione e periodi di maturazione.
La separazione consigliata è netta. L'estrazione è un giudizio, quindi affidala al modello. Ogni componente di una data è un piccolo insieme chiuso — dodici mesi, trentuno giorni possibili, un intervallo limitato di anni — il che trasforma l'estrazione in una scelta tra opzioni enumerate anziché in un parsing libero, e ti dà un posto dove inserire un esplicito "non specificato", così che una parte mancante venga segnalata invece di essere indovinata. Il codice assembla le parti e possiede tutto ciò che viene dopo, inclusi ordinamento, durata, offset e giorno della settimana.
Indirettezza: le doppie negazioni e i passaggi extra costano accuratezza.
Le istruzioni che comportano una doppia indirezione o indirezione a più livelli ricevono risposte meno affidabili. Una domanda su una proprietà di una proprietà, o che richiede diversi passaggi di ragionamento, ha un costo elevato. Il rimedio è scrivere le istruzioni nel modo più diretto possibile e nominare le parti rilevanti dello stato invece di descriverle.
Uno stato grande pieno di dettagli irrilevanti penalizza l'accuratezza
L'accuratezza diminuisce man mano che lo stato cresce con contenuti non correlati alla decisione. I dettagli non correlati agiscono da distrattore e uno stato ampio rende più difficile capire quale parte dell'input ha prodotto una risposta errata. Il promemoria di TypeSafe nella nota conclusiva è schietto: «Jev soffre di degrado del contesto, quindi il materiale non correlato nello stato costa.»
Recupera e filtra prima nel codice, e invia solo i campi di cui la domanda ha bisogno. Dove filtrare prima della richiesta non è possibile, il fornitore suggerisce di usare un noul per filtrare per rilevanza, poi giudicare i sopravvissuti.
Il contenuto avversariale nello stato sposta la risposta
Lo stato è un dato, e jev-1.13 non lo tratta come ostile per impostazione predefinita. Un'istruzione iniettata, un inquadramento deliberatamente fuorviante o un testo che sostiene la propria classificazione possono modificare il risultato. Questa è l'unica modalità in cui il fornitore inquadra esplicitamente la correzione come lavoro futuro — "Ci aspettiamo di migliorare questo aspetto in futuro" — e il consiglio provvisorio è di essere espliciti nei criteri e di testare accuratamente l'integrazione prima di metterla davanti a molti utenti.
Istruzioni e criteri contraddittori lo confondono.
Quando le istruzioni e i criteri chiedono cose diverse, il modello può confondersi. L'esempio di TypeSafe è un noul in cui vero viene mappato su no e falso su sì, il che funziona peggio della stessa domanda formulata in modo coerente. L'istruzione consiste nel trattare i criteri come un'estensione dell'istruzione e nell'allineare i due in un linguaggio che una persona comune possa leggere e comprendere.
Invarianti strutturali che non garantisce
Questa è la modalità che più probabilmente manda in crisi un sistema costruito su un presupposto che nessuno ha messo per iscritto. Jev è estremamente coerente nel senso comune — input semanticamente simili producono output quantitativamente simili — ma non è garantito che valgano le identità strutturali che potresti aspettarti. Il fornitore pubblica due casi pratici.
• Una domanda, due tipi di domanda. "Il cliente sta chiedendo un rimborso?" posta come noul e posta come scelta sì/no, sul ticket "Non sono soddisfatto della vestibilità. Quali sono le mie opzioni?" restituisce un noul di 0,22, e una scelta di sì 0,01, no 0,99, confidenza 0,97. Queste sono risposte alla stessa domanda.
• Una domanda e la sua negazione. "Il cliente sta chiedendo un rimborso?" e "Il cliente sta chiedendo qualcosa di diverso da un rimborso?", poste come due nouls sul ticket "Mi è stato addebitato due volte lo stesso ordine. Qualcuno può verificare?", restituiscono 0,72 e 0,47. La loro somma è 1,19.
I rimedi sono operativi, non retorici: non fare affidamento sull'invarianza strutturale attesa, non trasferire a una scelta una soglia tarata su un noul e non pretendere che il modello rispetti identità aritmetiche tra domande separate. Il motivo è che una scelta è relativa — stabilisce quale opzione — mentre ogni noul è assoluto e può risultare basso per tutte quante.
Generazione: non è stata addestrata a scrivere
jev-1.13 non è addestrato a generare testo. Puoi forzare l'output concatenando scelte, e TypeSafe dice direttamente che questo "non funzionerà bene e sarà molto lento". Per l'estrazione, la guida è estrarre i valori candidati con un'espressione regolare o un modello generativo e lasciare che Jev scelga quello corretto, oppure — quando lo spazio delle risposte è limitato — trasformare l'estrazione in una scelta tra le opzioni invece di chiedere il valore stesso.
Il tetto di 255 opzioni per le domande a scelta

Una domanda di scelta: un'integrazione Jev non è un bordo frastagliato, è la forma del prodotto. Vale la pena separarle, perché nessuna quantità di lavoro sul prompt le cambia:
• Nessuna generazione di testo. Restituisce una decisione, non prosa. Questa è la scelta progettuale, non un difetto.
• Nessuna conversazione. Jev è un modello decisionale strutturato, non un modello di chat. Si invia uno stato e un insieme di domande con nome; restituisce una risposta strutturata per ogni domanda. Non c'è alcuna alternanza di turni da tenere in considerazione in fase di progettazione.
• Nessun input multimodale. L'input è solo testo — stringa, oggetto JSON o array di valori testuali, senza immagini, audio o video. Il materiale non testuale deve essere pre-elaborato in testo o campi strutturati prima di diventare parte dello stato.
• Risposte non in streaming. Esiste un'unica risposta strutturata e nessuna modalità di streaming. Il motivo per cui questa non ha importanza è lo stesso motivo per cui vale la pena affermarlo: non c'è nulla da trasmettere in streaming. Una decisione tipizzata — un booleano con una probabilità, un'etichetta tra un insieme, o un livello su una scala — non ha una forma parziale che valga la pena rivelare token per token.
• L'inglese è la lingua principale. Altre lingue, comprese le scritture CJK, vengono gestite ma non altrettanto bene. Il consiglio di TypeSafe è di testare sui propri contenuti prima di fare affidamento su Jev per un carico di lavoro non in inglese, e di affidarsi alla confidenza durante il routing.
Il tetto di 255 opzioni per le domande a scelta
Una domanda a scelta seleziona una tra un massimo di 255 opzioni etichettate, e quel tetto è invalicabile. TypeSafe spiega anche perché i grandi insiemi di scelte sono più lenti, con le parole stesse del fornitore: "Per scelte a cardinalità più elevata, adottiamo un sistema a 2 fasi: valutiamo in modo indipendente e poi operiamo una scelta esplicita, da cui il rallentamento occasionale." Quindi il costo di latenza di un grande insieme di opzioni è strutturale anziché incidentale, ed è il fornitore stesso a dirti da dove deriva.
La nostra finestra di servizio per typesafe/jev-1.13, letta dalla model card il 2026-09-30, mostra come ciò si traduce in pratica su sette giorni del nostro traffico: una mediana di 151 ms e un p95 di 247 ms, 348 token di output al secondo e un tasso di errore dello 0,49% su 76,2 milioni di token serviti. Le mediane giornaliere si muovono in una banda stretta — 175, 170, 163, 161, 170, 147 e 143 ms dal 2026-09-24 al 2026-09-30 — ma il p95 giornaliero del 2026-09-28 è di 2.448 ms, circa dieci volte quello dei giorni immediatamente precedenti e successivi. Non possiamo attribuire quell'outlier di un singolo giorno alla cardinalità delle scelte, e non lo faremo; la lettura onesta è che la coda esiste, e un flusso di lavoro sensibile alla latenza dovrebbe essere progettato tenendo conto della coda anziché della mediana.
La fattura inserita è l'intera fattura
Su Jev l'output viene fatturato a zero, il che a volte viene interpretato come «Jev è gratuito». Non lo è, perché l'input è a consumo e uno stato di grandi dimensioni non è gratuito solo perché non c'è nulla sul lato output. Il prezzo del fornitore è 0,042 $ per milione di token di input — lo stesso numero che TypeSafe indica come 42 $ per miliardo — e OrcaRouter applica il prezzo di listino del provider con uno 0% di ricarico, quindi un taglio del prezzo del fornitore arriva qui lo stesso giorno.
Ecco cosa fa a una forma realistica, usando la tariffa del fornitore stesso:
• Una piccola richiesta. Un ticket di supporto da 1.200 token più circa 300 token di rubrica e domande fa 1.500 token di input, ovvero $0,000063 per chiamata.
• Una richiesta grande. Un contratto da 55.000 token più domande che portano la richiesta a 60.000 token è 40 volte i token, quindi $0,0025 per chiamata — comunque poco per chiamata, e 40 volte più grande del primo caso per la stessa singola risposta.
• Su larga scala. 60.000 token per chiamata e 10.000 chiamate al giorno equivalgono a 600 milioni di token di input al giorno, cioè 0,6 miliardi, quindi 25,20 $ al giorno e circa 756 $ nell'arco di un mese di 30 giorni. Lo stesso numero di chiamate con la richiesta da 1.500 token è 15 milioni di token al giorno: 0,63 $ al giorno, circa 18,90 $ al mese.
Il divario tra quelle ultime due righe non è un trucco di prezzo, è lo stato a consumo. Ecco perché il consiglio sul filtraggio nella sezione sul deterioramento del contesto non è solo una misura di accuratezza — sfoltire lo stato è anche l'unica leva che muove la bolletta.
I limiti operativi pubblicati, così nessuno deve indovinare

La pagina dei modelli di TypeSafe pubblica numeri concreti, quindi un pianificatore non deve dedurli:
• Throughput e frequenza. 100K token al secondo e 40 richieste al secondo, come indicato in docs.typesafe.ai/models.md. Una richiesta che supera uno dei due limiti restituisce 429 Too Many Requests; gli SDK client del fornitore riprovano con backoff per impostazione predefinita e rispettano l'header retry-after quando la risposta ne contiene uno.
• I limiti si spostano. Il fornitore dichiara che i limiti di frequenza vengono adeguati dinamicamente e "possono cambiare senza preavviso" man mano che nuova capacità entra in funzione, con limiti più elevati disponibili sui piani custom ed enterprise. Considera 100K/40 come il valore attuale, non come un impegno contrattuale.
• Budget di contesto. Il budget della richiesta è di circa 64.000 token considerando insieme lo stato combinato e tutte le domande — la scheda del modello ne pubblica 65.536 — e la pagina dei modelli del fornitore limita separatamente lo stato più la singola domanda più lunga a 32.000 token. Quel secondo dato è il budget dello stato, non una versione più piccola del primo; entrambi sono reali e nessuno dei due contraddice l'altro.
• Gli alias si spostano sotto di te. jev-latest e jev-preview puntano entrambi a jev-1.13.0 oggi, e il fornitore segnala che al momento non è disponibile alcuna build di anteprima. Un alias si sposta quando viene rilasciata una nuova versione, quindi se hai calibrato le soglie di confidenza su una versione specifica, fissa l'ID versionato e procedi secondo i tuoi tempi.
Che aspetto deve avere il tuo caso d'uso
Letto dall'inizio alla fine, l'elenco del fornitore stesso descrive uno strumento limitato e utile. Jev è adatto quando il giudizio è circoscritto e l'aritmetica non è compito del modello: questo record rientra nella policy, quale di queste quaranta etichette si applica, come si colloca su una scala a cinque livelli — poste su uno stato che hai filtrato tu stesso, con un'istruzione letterale e criteri che concordano con essa, e con ogni conteggio, confronto e misurazione di date eseguiti nel codice attorno ad esso.
Non è adatto quando il compito richiede conteggio, ordinamento o aritmetica delle date, quando richiede diversi passaggi di ragionamento, quando il materiale di input non è testo, quando lo stato è un pagliaio e la domanda è un ago, o quando qualsiasi aspetto della fonte è ostile. Non sono lacune in un prompt; sono punti in cui il modello non funziona, e TypeSafe è la parte che lo dice.
Un'ultima cosa che vale la pena sapere prima di configurarlo: la differenza sostanziale nel modo in cui Jev viene chiamato. Su OrcaRouter il catalogo raggiunge Jev tramite l'endpoint dedicato systemone, POST /v1/systemone, anziché tramite il formato OpenAI chat-completions. È una vera differenza nella richiesta che scrivi, ed è la versione corretta della vecchia affermazione secondo cui Jev «parla con un formato di richiesta tutto suo». Tutto il resto è uguale a qualsiasi altro modello sull'account — una sola chiave per oltre 200 modellinessun costo per token da parte nostra, e failover automatico se una rotta si guasta. TypeSafe ha rimosso la lista d'attesa il 2026-09-21; la homepage del fornitore descrive ancora Jev come accesso anticipato, e la sua pagina dei benchmark è ancora contrassegnata come in sospeso, quindi gli unici dati sulle prestazioni in questa pagina sono i numeri di serving che abbiamo misurato noi stessi e le dichiarazioni del fornitore stesso, etichettate come tali.
