Um cartão de destaque gerado intitulado 'O que é o TypeSafe AI?' com o subtítulo 'O laboratório por trás do Jev 1.13 - decisões tipadas, não prosa', sobre três linhas rotuladas: 'Empresa: TypeSafe AI, San Francisco', 'Modelo: Jev 1.13 (typesafe/jev-1.13), lançado em 2026-09-15' e 'Roteado no OrcaRouter desde 2026-09-24'. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

O que é a TypeSafe AI? O laboratório por trás do Jev 1.13 toma decisões, não frases

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

TypeSafe AI é um pequeno laboratório de São Francisco que vende um modelo que não consegue escrever uma frase, e Jev 1.13 (typesafe/jev-1.13) é o modelo em questão. Ele recebe um fragmento de estado — um e-mail, uma linha de log, um ticket de suporte, um blob JSON — mais um conjunto de perguntas nomeadas, e retorna uma resposta tipada por pergunta, cada uma com seu próprio valor de confiança. Sem prosa, sem código, sem explicação e sem caixa de chat. O próprio modelo foi lançado em 2026-09-15, então não é novo, e nada aqui é uma história de lançamento: esta página existe por causa de uma mudança menor e datável. Em 2026-09-24, a OrcaRouter adicionou typesafe/jev-1.13 ao seu catálogo e abriu a ficha do modelo em seu próprio endereço, o que foi a primeira vez que Jev pôde ser chamado por meio de um gateway de terceiros, em vez de apenas pelo próprio endpoint da TypeSafe. Esse é o evento, ele tem seis dias em 2026-09-30, e é a razão pela qual um leitor que ainda não tem um contrato com a TypeSafe agora pode colocar um modelo System One na mesma chave que os modelos generativos ao lado dos quais ele foi projetado para ficar. Todo o resto nesta página é contexto sobre a empresa que o criou.

O enquadramento honesto do timing, porque ele importa para saber o quanto disto está verificado: a Jev foi lançada há mais de duas semanas e está disponível de forma geral desde 2026-09-21, quando a TypeSafe removeu sua lista de espera. O que está dentro da janela de sete dias é a mudança de roteamento, não o modelo. Se você veio aqui esperando uma análise de lançamento, o lançamento já aconteceu e um punhado de outros textos já o cobriu.

Uma página de empresa com um manifesto e sem diagrama de arquitetura

A TypeSafe descreve-se, em sua própria metadescrição, como "um laboratório de IA que constrói infraestrutura de inteligência nativa de máquina para automação", com sistemas "projetados para tomar decisões dentro do software". Sua página inicial traz o selo Versão 0.01 e, no rodapé, "Feito em SF". Há um manifesto que argumenta que o caminho mais curto para uma transformação econômica moldada pela IA passa por tornar a inteligência composável, de modo que o software possa invocar julgamento semântico da mesma forma como invoca uma função; o próprio resumo do plano da empresa é entregar a forma de IA composável nativa de máquina, depois torná-la confiável o suficiente para automação real e, em seguida, oferecer abstrações de nível mais alto estáveis o suficiente para se construir camadas sobre elas. Seu slogan é "Estamos construindo produção, não Deus". A página da equipe nomeia três fundadores — Diogo Almeida como CEO, Sasha Sheng como COO e Erik Gafni como CTO. Isso é tudo o que a empresa diz sobre si mesma: uma posição, um produto, três nomes e nenhum número sobre a própria empresa.

O que o site não traz é justamente aquilo a que um engenheiro que avalia uma nova dependência recorre primeiro. Não há página de arquitetura, contagem de parâmetros, divulgação dos recursos computacionais de treinamento nem model card no sentido acadêmico. O próprio painel de benchmarks da TypeSafe ainda está marcado como pendente. Para uma empresa cujo argumento de venda se baseia na confiabilidade, a divulgação é escassa, e isso é um fato sobre o que foi publicado, não uma acusação sobre o que está sendo escondido.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: a categoria, e por que o nome é emprestado

Jev é o primeiro daquilo que a TypeSafe chama de modelos System One. O nome vem da divisão feita por Daniel Kahneman entre o pensamento rápido e intuitivo do Sistema 1 e o raciocínio lento e deliberado do Sistema 2, e o post de lançamento da empresa diz isso diretamente — ele também admite que o "pensamento do Sistema 1" tem tido uma conotação de propensão a erros, e argumenta que esses modelos podem se tornar mais confiáveis do que as alternativas. A TypeSafe não cunhou o termo nem é proprietária dele.

O conteúdo prático da categoria é uma divisão deliberada do trabalho: um modelo que decide e um modelo que escreve. Você deve manter aritmética, ordenação de datas, contagem e comparação de strings no código comum, onde são exatas, e entregar o julgamento semântico ao Jev. Três tipos de pergunta são o que ele consegue responder:

• noul — um julgamento verdadeiro/falso, retornado com uma probabilidade calibrada

• escolha — escolha uma entre até 255 opções rotuladas

• pontuação — avaliar numa escala ordenada; o nosso cartão publica 2 a 10 níveis, e a documentação da própria TypeSafe mostra um exemplo indexado a 0, portanto, considere os níveis do fornecedor como a definição e os 2 a 10 como o que o cartão publica

Cada pergunta traz suas próprias instruções e, para escolha e pontuação, seus próprios critérios. Solicitações acima de aproximadamente 64 mil tokens de entrada são rejeitadas antes de chegarem ao modelo, e as respostas não são transmitidas em streaming. O fornecedor documenta separadamente o orçamento de estado — o estado mais a pergunta individual mais longa — em 32 mil tokens, que é um número menor do que o contexto de 65.536 tokens indicado no cartão e não uma contradição dele.

A tese deles, em suas próprias palavras

A TypeSafe enuncia a tese melhor do que qualquer resumo faria, então aqui está, literalmente: "LLMs produzem palavras para pessoas. Jev produz decisões tipadas e é mais como código: confiável, rápido, autoconsistente e com segurança de tipos." O método de treinamento por trás disso também é deles, e é um termo que vale atribuir com precisão justamente porque foi adotado em outros lugares como se fosse genérico. A TypeSafe o chama de Reinforcement for Calibrated Decisions, ou RLCD, e o contrasta com RLHF e RLVR: enquanto esses otimizam preferência humana ou recompensas verificáveis programaticamente, o RLCD tem como alvo, na formulação da empresa, "respostas com probabilidades epistemicamente honestas em tarefas do Sistema 1." Trate o RLCD como cunhagem da própria TypeSafe, não como um termo estabelecido na literatura.

Os números com que eles abrem, e quem escolheu a carga de trabalho

A página inicial abre com "193,6x mais rápido, 444,6x mais barato", com nota de rodapé remetendo a fluxos de trabalho para tarefas do System One. Abaixo, há um exemplo resolvido: TypeSafe AI a US$ 0,000081 e 0,114 segundos, contra LLMs a US$ 0,013880 e 8,566 segundos. Mais abaixo: "US$ 42 por bilhão de tokens de entrada. Preço de entrada 238x menor que o Claude Fable 5.1." E uma seção intitulada "Zero Alucinações", que, quando examinada, é uma alegação sobre estimativas de confiança, e não uma prova de zero erros: toda decisão do Jev carrega uma estimativa de confiança, de modo que o software pode agir quando a confiança é alta e encaminhar para uma instância superior quando não é. Todos os quatro são números da TypeSafe, em cargas de trabalho escolhidas pela TypeSafe, e nenhum deles foi replicado de forma independente. O próprio post de lançamento diz que a equipe espera que seus 193,6x e 444,6x fiquem no extremo superior dos ganhos no mundo real, e observa que os fluxos de trabalho foram criados pela sua própria equipe de capacidades, com respostas de referência produzidas por modelos rivais. Nossos próprios dados de serviço de sete dias no mesmo modelo situam a taxa de erro em 0,49%, o que é uma medição diferente em uma carga de trabalho diferente e é o contrapeso honesto para ler "zero" como algo absoluto.

O que eles não publicaram

A arquitetura do Jev, a contagem de parâmetros, a computação de treino e os pesos não são publicados, e não existe um repositório de pesos na organização GitHub da empresa. Verificado em 2026-09-30, essa organização tem onze repositórios públicos; os substanciais são ferramentas, todos MIT ou Apache-2.0 — um repositório de competências de agente, um SDK Python, um SDK TypeScript, um adaptador de cliente drop-in suportado por outras APIs de LLM, uma coleção de módulos Dagger, algum código publicado de avaliação de fluxos de trabalho, um nó n8n e o próprio site da organização. As contagens de estrelas e as datas de push mudam, por isso consulte-as no próprio dia em vez de as ler nesta página.

Três dos onze são forks de projetos não relacionados: vLLM, LLaDA e um Pulumi para ClickHouse Cloud. Eles são forks do projeto de outra pessoa e não dizem nada sobre como o Jev é construído — em particular, nada sobre ser baseado em difusão. A resposta em uma frase para saber se o Jev é aberto é que o ferramental é, mas o modelo não.

O que eles concedem a si mesmos

Dois reconhecimentos do post de lançamento valem mais do que a maioria das ressalvas de fornecedores, porque nomeiam os lugares exatos onde a evidência é fraca. Sobre o preço: "Não podemos provar que não é subsidiado; precisaremos do longo prazo para provar a sustentabilidade do nosso preço (que esperamos que diminua, não aumente)." Sobre a velocidade: "nossas avaliações publicadas geralmente são executadas a partir de nossos laptops na Costa Oeste (é onde nosso serviço está atualmente baseado)." Há um terceiro, mais útil para quem está construindo sobre ele: para conjuntos de escolha de alta cardinalidade, o Jev executa um sistema de dois estágios que opera de forma independente e então faz uma escolha explícita, "daí a lentidão ocasional." Isso é o fornecedor explicando por que a latência não é uniforme entre os tipos de pergunta, e é o tipo de coisa que você normalmente aprende em uma thread de suporte.

Onde você pode realmente ligar para ele, a partir de hoje

Por meio da própria API da TypeSafe, onde o modelo está em disponibilidade geral e a página inicial ainda usa a frase do próprio fornecedor "early access" — essa redação é atual e vale a pena manter, ao passo que "waitlisted" foi aposentado: a documentação publica limites operacionais concretos (100K tokens por segundo, 40 requisições por segundo, 429 com backoff do SDK ao ultrapassar qualquer um dos dois) e não contém absolutamente nenhuma menção a lista de espera. E, desde 24/09/2026, por meio do OrcaRouter.

Vale a pena declarar com precisão o que servimos, porque o formato da chamada é a parte que difere. A entrada no catálogo é typesafe/jev-1.13, chamada TypeSafe: Jev 1.13, com tipo de endpoint suportado "systemone" — por isso é acessada via POST /v1/systemone, e não pelo formato chat-completions, sem streaming, texto na entrada e JSON estruturado na saída, até cerca de 64K tokens de entrada somando estado e perguntas. A entrada custa $0.042 por milhão de tokens e a saída é cobrada a zero, porque não há tokens de saída a medir: uma decisão tipada não é prosa. Esse é o preço de tabela do provedor repassado, com 0% de markup, namesma chave dos outros 200+ modelos do catálogo — uma API para 200+ modelos, 0% de markup (preço de tabela do provedor repassado, então cortes de preço do fornecedor entram no ar aqui no mesmo dia). Se o motivo pelo qual você está lendo sobre a TypeSafe AI é querer descobrir se a calibração do Jev se sustenta nos seus próprios dados antes de comprometer um caminho de produção com ele, executá-lo ao lado de um modelo generativo em que você já confia é a forma barata de descobrir; fazer failover para esse modelo quando a confiança do Jev vier baixa é a forma barata de colocá-lo em produção.

Nossos próprios números de serviço de sete dias para a janela que termina em 2026-09-30, que são nossos números do nosso próprio tráfego, e não do benchmark do fornecedor: p50 151 ms, p95 247 ms, cerca de 349 tokens de saída por segundo, uma taxa de erro de 0,49% e 76,2M de tokens servidos. O p50 diário nessa janela foi 175, 170, 163, 161, 170, 147, 143 ms, então a mediana vem caindo de forma modesta. Um dia da série, 09-28, tem um p95 de 2.448 ms — um verdadeiro outlier nos dados, não a norma, e não um número em torno do qual planejar um orçamento de latência. Esses números são atualizados diariamente; o card é a fonte.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Onde o modelo é fraco, segundo o TypeSafe

O fornecedor publica uma página sobre irregularidades para o Jev 1.13, revisada pela última vez em 2026-09-17, que nomeia os modos de falha com mais franqueza do que a maioria do material de lançamento. É a página certa para ler antes de construir sobre o modelo, e a própria lista dela é assim. O Jev responde à pergunta que você escreveu, e não à que você quis dizer, portanto palavras de escopo, negações e condições implícitas precisam ser explicitadas. Ele não é uma calculadora: tem desempenho pior em perguntas matemáticas do que em semânticas. Ele lê datas como texto, e não como quantidades ordenadas, portanto ordenação, lacunas e pertencimento a janelas não são confiáveis, e pioram com formatos mistos. Negativas duplas e indireção de múltiplos saltos custam precisão. A precisão cai à medida que o estado cresce com detalhes irrelevantes — a página diz que ele "sofre de deterioração de contexto" — então filtrar primeiro no código é a solução. O estado é tratado como dados, não como hostil por padrão, portanto instruções injetadas podem alterar respostas. Instruções e critérios incompatíveis o confundem. Invariantes estruturais não são garantidos: uma saída nula e uma saída de escolha não precisam corresponder, e uma pergunta e sua negação não precisam somar um, portanto limiares não devem ser transferidos entre as duas. E ele não é treinado para gerar texto — forçá-lo por meio de escolhas encadeadas "não funcionará bem e será muito lento."

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Como interpretar o TypeSafe AI seis dias após a mudança de roteamento

A empresa está a fazer uma afirmação forte, específica e falsificável: a de que um modelo de decisão restrito pode ser mais rápido, mais barato e mais fiável do que um modelo geral no subconjunto de trabalho em que é preciso um juízo e não um parágrafo. A afirmação é plausível e em parte comprovada pelos próprios dados — as estimativas de confiança são uma diferença de conceção real, o preço é real e a latência que medimos no nosso próprio tráfego é da mesma ordem que a do fornecedor. O que falta é a parte que permitiria a alguém de fora verificar o resto: não há arquitetura, nem parâmetros, nem pesos, nem benchmark independente, e há um preço que a própria empresa diz não poder provar que é sustentável. Os modos de falha estão documentados, o que é mais do que a maioria dos laboratórios faz e é a melhor razão isolada para levar o modelo a sério.

Se você está decidindo se deve prestar atenção: execute o Jev em entradas que você já rotulou, com os rótulos ocultos, e observe se os números de confiança dele separam os casos em que ele acerta dos casos em que ele erra. Esse teste custa quase nada a US$ 0,042 por milhão de tokens de entrada, e é o único que responde à pergunta que você realmente tem. Se você está decidindo se deve confiar na empresa: as divulgações são o que são, e a resposta honesta é que as evidências atualmente são a palavra do fornecedor mais aquilo que você mesmo gerar.