
Dónde falla Jev 1.13: la propia lista de límites de TypeSafe
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Jev 1.13 (typesafe/jev-1.13) se publicó el 15 de septiembre de 2026, lo que lo sitúa dos semanas fuera de los últimos siete días, así que su lanzamiento no es la noticia. El evento con fecha es el 24 de septiembre de 2026: ese es el día en que OrcaRouter añadió typesafe/jev-1.13 a su catálogo y abrió una ficha de modelo para él —el primer soporte de servicio para Jev en una pasarela de terceros, después de una quincena en la que la única forma de llamarlo era el endpoint propio de TypeSafe. Eso importa aquí por una razón concreta. Jev es inusual porque su proveedor publica una lista de las formas en que falla, y una lista que solo se puede leer es mucho más fácil de omitir que un modelo que realmente se puede llamar.
Esta página es esa lista, ceñida a lo que el propio TypeSafe dice, más los límites operativos y la factura.
TypeSafe publica su propia lista de irregularidades

docs.typesafe.ai alberga una página titulada Asperezas de Jev 1.13. Se aplica explícitamente a jev-1.13, tiene una fecha de revisión del 2026-09-17 y comienza con el propio encuadre del proveedor: «Jev no es perfecto. Estas son algunas asperezas de las que somos conscientes en jev-1.13. Muchas de ellas se corregirán en versiones posteriores». A continuación se describen nueve modos con nombre, cada uno con un caso concreto y una solución del tipo «En su lugar:». Nada de lo que sigue se infiere y nada se suaviza: la redacción es de TypeSafe y, cuando la empresa da su propio ejemplo, los números que contiene son suyos.
Lectura literal: responde a la pregunta que escribiste.
Las palabras delimitadoras, las negaciones y las condiciones implícitas se leen al pie de la letra. Una pregunta se responde según las palabras de la instrucción, «mientras que una persona podría haber leído la intención detrás de las instrucciones».
La parte útil es el diagnóstico del proveedor: cuando examinas una respuesta incorrecta y te descubres explicando lo que realmente querías decir, esa explicación es la mitad que falta de la instrucción. Los remedios son enunciar la condición exacta en las instrucciones, incluir los casos límite en los criterios y, cuando la interpretación sea verdaderamente inevitable, dividir la pregunta en dos preguntas literales y combinarlas en el código.
Matemáticas y números: no es una calculadora
TypeSafe dice claramente que se implemente la lógica matemática en el código. Tres fallos concretos subyacen a eso:
• Contar no es fiable. Esto abarca los caracteres de una palabra, las apariciones de un término en un pasaje y los elementos de una lista larga. «El modelo reconoce la forma de una respuesta en lugar de contar, y el error aumenta con el tamaño de lo que se cuenta». La propia prueba del proveedor para determinar si conviene preguntar siquiera: si una expresión regular o un analizador puede encontrar la unidad, el conteo pertenece al código y el modelo no aporta nada.
• Las representaciones numéricas tienen un rendimiento inferior al de las semánticas. Las preguntas sobre colores que usan valores hexadecimales son peores que las mismas preguntas que usan nombres de colores en inglés; dados triples RGB o hexadecimales, Jev no puede juzgar de manera fiable si dos valores están cerca entre sí. La misma brecha se observa en código de bajo nivel —ensamblador o instrucciones codificadas en binario— frente a lenguajes de alto nivel. Convierte o agrupa en código, y reserva el modelo para la parte que es genuinamente un juicio.
• Las salidas de puntuación no conllevan magnitudes exactas. El proveedor afirma que los niveles de puntuación de Jev tienen una calibración numérica deficiente. Una expectativa puede usarse para comprobar si algo supera un umbral; no puede usarse para reconstruir el número interpolando entre los dos niveles más cercanos. Eso es un no rotundo a toda una clase de uso indebido — interpretar una puntuación como una medición.
Fecha y hora: las fechas se leen como texto, no como cantidades
Ordenar dos fechas, medir la distancia entre ellas o decidir si una cae dentro de una ventana no es fiable, y se degrada aún más con formatos mixtos, referencias relativas y límites de dominio como trimestres, ventanas de liquidación y periodos de devengo.
La división recomendada es limpia. La extracción es un juicio, así que déjasela al modelo. Cada componente de una fecha es un conjunto cerrado y pequeño —doce meses, treinta y un días posibles, un rango acotado de años—, lo que convierte la extracción en una elección entre opciones enumeradas en lugar de un parseo de formato libre, y te da un lugar donde poner un "no especificado" explícito para que una parte faltante se informe en lugar de adivinarse. El código ensambla las partes y se encarga de todo lo posterior, incluidos el orden, la duración, el desfase y el día de la semana.
Indirección: las negaciones dobles y los saltos adicionales cuestan precisión.
Las instrucciones que contienen dobles negaciones o indirección por capas se responden con menos fiabilidad. Una pregunta sobre una propiedad de una propiedad, o una que requiere varios saltos de razonamiento, cuesta precisión. El remedio es escribir las instrucciones de la forma más directa posible y nombrar las partes relevantes del estado en lugar de describirlas.
Un estado grande lleno de detalles irrelevantes cuesta precisión
La precisión disminuye a medida que el estado crece con contenido no relacionado con la decisión. Los detalles no relacionados actúan como distractores, y un estado grande dificulta saber qué parte de la entrada produjo una respuesta incorrecta. El propio recordatorio de TypeSafe en la nota final es tajante: "Jev sufre de deterioro del contexto, por lo que el material no relacionado en el estado te cuesta precisión."
Recupere y filtre primero en el código, y envíe solo los campos que la pregunta necesita. Cuando no sea posible filtrar antes de la solicitud, el proveedor sugiere usar un noul para filtrar por relevancia y luego evaluar a los que sobrevivan.
El contenido adversarial en el estado mueve la respuesta
El estado son datos, y jev-1.13 no lo trata como hostil de forma predeterminada. Una instrucción inyectada, un encuadre deliberadamente engañoso o un texto que aboga por su propia clasificación pueden alterar el resultado. Este es el único modo en el que el proveedor enmarca explícitamente la corrección como trabajo futuro —"Esperamos mejorar esto en el futuro"— y el consejo provisional es ser explícito en los criterios y probar la integración a fondo antes de ponerla delante de muchos usuarios.
Las instrucciones y criterios contradictorios lo confunden.
Cuando las instrucciones y los criterios piden cosas diferentes, el modelo puede confundirse. El ejemplo de TypeSafe es un noul donde verdadero se asigna a no y falso se asigna a sí, lo que tiene un rendimiento peor que la misma pregunta formulada de forma consistente. La instrucción es tratar los criterios como una extensión de la instrucción y alinear ambos en un lenguaje que una persona promedio pueda leer y entender.
Invariantes estructurales que no garantiza
Este es el modo con mayor probabilidad de romper un sistema que se construyó sobre una suposición que nadie dejó por escrito. Jev es extremadamente consistente en el sentido ordinario —entradas semánticamente similares producen salidas cuantitativamente similares—, pero no se garantiza que se cumplan las identidades estructurales que podrías esperar. El proveedor publica dos casos prácticos.
• Una pregunta, dos tipos de pregunta. "¿El cliente está pidiendo un reembolso?" planteada como un noul y planteada como una elección de sí/no, en el ticket "No estoy satisfecho con el ajuste. ¿Cuáles son mis opciones aquí?" devuelve un noul de 0.22, y una elección de sí 0.01, no 0.99, confianza 0.97. Esas son respuestas a la misma pregunta.
• Una pregunta y su negación. «¿El cliente está pidiendo un reembolso?» y «¿El cliente está pidiendo algo que no sea un reembolso?», formuladas como dos nouls en el ticket «Me cobraron dos veces por el mismo pedido. ¿Alguien puede revisarlo?», devuelven 0.72 y 0.47. Suman 1.19.
Los remedios son operativos, no retóricos: no te fíes de una invariancia estructural esperada, no traslades a una elección un umbral calibrado sobre un noul, y no obligues al modelo a cumplir identidades aritméticas entre preguntas separadas. La razón es que una elección es relativa —determina qué opción—, mientras que cada noul es absoluto y puede resultar bajo para todos ellos.
Generación: no fue entrenado para escribir.
jev-1.13 no está entrenado para generar texto. Puedes forzar la salida encadenando opciones, y TypeSafe dice directamente que esto "no funcionará bien y será muy lento". Para la extracción, la recomendación es extraer valores candidatos con una expresión regular o un modelo generativo y dejar que Jev elija el correcto o —cuando el espacio de respuestas está acotado— convertir la extracción en una elección entre las opciones en lugar de pedir el valor en sí.
El límite de 255 opciones en las preguntas de elección

Una pregunta de elección: una integración de Jev no es un borde irregular, es la forma del producto. Vale la pena separarlas porque ninguna cantidad de trabajo de prompt las cambia:
• Sin generación de texto. Devuelve una decisión, no prosa. Eso es el diseño, no un defecto.
• Sin conversación. Jev es un modelo de decisión estructurado, no un modelo de chat. Usted envía un estado y un conjunto de preguntas con nombre; este devuelve una respuesta estructurada por pregunta. No hay turnos de conversación que diseñar.
• Sin entrada multimodal. La entrada es solo texto: cadena, objeto JSON o arreglo de valores de texto, sin imagen, audio ni video. El material que no sea texto debe preprocesarse a texto o campos estructurados antes de formar parte del estado.
• Respuestas sin streaming. Hay una única respuesta estructurada y no hay modo de streaming. La razón por la que este caso no importa es la misma por la que vale la pena señalarlo: no hay nada que transmitir en streaming. Una decisión tipada —un booleano con una probabilidad, una etiqueta de un conjunto o un nivel en una escala— no tiene ninguna forma parcial que merezca la pena revelar token a token.
• El inglés es el idioma principal. Otros idiomas, incluidas las escrituras CJK, se manejan, pero no igual de bien. El consejo de TypeSafe es que pruebes con tu propio contenido antes de depender de Jev para una carga de trabajo que no sea en inglés, y que te apoyes en la confianza al enrutar.
El límite de 255 opciones en las preguntas de elección
Una pregunta de elección elige una de hasta 255 opciones etiquetadas, y ese techo es un límite absoluto. TypeSafe también explica por qué los conjuntos de opciones grandes se ejecutan más lentamente, en palabras del propio proveedor: "Para opciones de mayor cardinalidad, aplicamos un sistema de 2 etapas que consiste en puntuar de forma independiente y luego tomar una decisión explícita; de ahí la ralentización ocasional." Así que el coste de latencia de un conjunto grande de opciones es estructural y no incidental, y es el proveedor quien te dice de dónde procede.
Nuestra propia ventana de servicio para typesafe/jev-1.13, leída en la tarjeta del modelo el 30 de septiembre de 2026, muestra cómo se ve esto en la práctica a lo largo de siete días de nuestro propio tráfico: una mediana de 151 ms y un p95 de 247 ms, 348 tokens de salida por segundo, y una tasa de errores del 0,49 % en 76,2 millones de tokens servidos. Las medianas diarias se mueven en una banda estrecha —175, 170, 163, 161, 170, 147 y 143 ms del 24 al 30 de septiembre de 2026—, pero el p95 diario del 28 de septiembre de 2026 es de 2.448 ms, aproximadamente diez veces más que los días a ambos lados. No podemos atribuir ese valor atípico de un solo día a la cardinalidad de las opciones, y no vamos a hacerlo; la lectura honesta es que la cola existe, y un flujo de trabajo sensible a la latencia debería diseñarse en función de la cola y no de la mediana.
La factura de entrada es la factura completa
La salida se factura a cero en Jev, lo que a veces se interpreta como «Jev es gratis». No lo es, porque la entrada se mide y un estado grande no es gratis simplemente porque no haya nada en el lado de la salida. El precio del proveedor es de $0,042 por millón de tokens de entrada —la misma cifra que TypeSafe indica como $42 por mil millones— y OrcaRouter transfiere el precio de lista del proveedor con un 0% de margen, por lo que una rebaja de precio del proveedor llega aquí el mismo día.
Esto es lo que eso le hace a una forma realista, usando la propia tasa del proveedor:
• Una pequeña petición. Un ticket de soporte de 1.200 tokens más unos 300 tokens de rúbrica y preguntas equivalen a 1.500 tokens de entrada, lo que cuesta $0,000063 por llamada.
• Una solicitud grande. Un contrato de 55,000 tokens más preguntas que llevan la solicitud a 60,000 tokens es 40 veces la cantidad de tokens, por lo que cuesta $0.0025 por llamada — sigue siendo poco por llamada, y 40 veces mayor que el primer caso para la misma única respuesta.
• A escala. 60.000 tokens por llamada y 10.000 llamadas al día son 600 millones de tokens de entrada al día, es decir, 0,6 mil millones, así que 25,20 $ al día y unos 756 $ a lo largo de un mes de 30 días. El mismo número de llamadas con la solicitud de 1.500 tokens asciende a 15 millones de tokens al día: 0,63 $ al día, unos 18,90 $ al mes.
La diferencia entre esas dos últimas líneas no es un truco de precios, es el estado medido. Por eso el consejo de filtrado en la sección sobre el deterioro del contexto no es solo una medida de precisión: recortar el estado también es la única palanca que mueve la factura.
Los límites operativos publicados, para que nadie tenga que adivinar

La página de modelos de TypeSafe publica cifras concretas, así que quien planifica no tiene que inferirlas:
• Rendimiento y tasa. 100 000 tokens por segundo y 40 solicitudes por segundo, según docs.typesafe.ai/models.md. Una solicitud que supere cualquiera de esos límites devuelve 429 Too Many Requests; los SDK de cliente del proveedor reintentan con retroceso (backoff) de forma predeterminada y respetan la cabecera retry-after cuando la respuesta incluye una.
• Los límites cambian. El proveedor afirma que los límites de velocidad se ajustan dinámicamente y "pueden cambiar sin previo aviso" a medida que la capacidad entra en servicio, con límites más altos disponibles en planes personalizados y empresariales. Considere 100K/40 como la cifra actual en lugar de un contrato.
• Presupuesto de contexto. El presupuesto de la solicitud es de aproximadamente 64.000 tokens para el conjunto del estado y todas las preguntas —la tarjeta del modelo publica 65.536—, y la página de modelos del proveedor limita por separado a 32.000 tokens el estado más la única pregunta más larga. Esa segunda cifra es el presupuesto del estado, no una versión más pequeña de la primera; ambas son reales y ninguna contradice a la otra.
• Los alias se mueven junto con las versiones. jev-latest y jev-preview apuntan ambos a jev-1.13.0 hoy, y el proveedor señala que no hay ninguna compilación de vista previa disponible en este momento. Un alias se desplaza cuando se publica una nueva versión, así que si has ajustado los umbrales de confianza con respecto a una versión específica, fija el ID de esa versión y avanza según tu propio calendario.
Cómo debe verse tu caso de uso
Leída de principio a fin, la propia lista del proveedor describe una herramienta de alcance limitado y útil. Jev es para cuando el juicio está acotado y la aritmética no es tarea del modelo: ¿está este registro dentro de la política?, ¿cuál de estas cuarenta etiquetas corresponde?, ¿cómo se lee esto en una escala de cinco niveles? —formuladas sobre un estado que tú mismo filtraste, con una instrucción literal y criterios que concuerden con ella, y con cada recuento, comparación y medición de fechas hechos en código a su alrededor.
No es adecuado cuando la tarea requiere contar, ordenar o aritmética de fechas, cuando necesita varios saltos de razonamiento, cuando el material de entrada no es texto, cuando el estado es un pajar y la pregunta es una aguja, o cuando algo acerca de la fuente es hostil. Esos no son vacíos en un prompt; son lugares donde el modelo no funciona, y TypeSafe es quien lo dice.
Una cosa más que conviene saber antes de conectarlo: la diferencia real y honesta en cómo se llama a Jev. En OrcaRouter, el catálogo llega a Jev a través del endpoint dedicado systemone, POST /v1/systemone, en lugar de mediante la forma de chat-completions de OpenAI. Esa es una diferencia real en la solicitud que escribes, y es la versión correcta de la antigua afirmación de que Jev «habla su propia forma de solicitud». Todo lo demás es igual que en cualquier otro modelo de la cuenta —una clave para más de 200 modelos, sin tarifas por token de nuestra parte, y conmutación por error automática si una ruta falla. TypeSafe eliminó la lista de espera el 2026-09-21; la propia página de inicio del proveedor todavía describe a Jev como acceso anticipado, y su propia página de benchmarks sigue marcada como pendiente, así que las únicas cifras de rendimiento en esta página son las cifras de servicio que medimos nosotros mismos y las afirmaciones del propio proveedor, etiquetadas como suyas.
