
Jev 1.13 Explicado: Por que o modelo responde com rótulos em vez de frases
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 208 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Jev 1.13 (typesafe/jev-1.13) não é um modelo de chat, e a maneira mais rápida de entendê-lo é parar de ler sua ficha técnica como você lê qualquer outra. A TypeSafe o lançou em 2026-09-15 como o primeiro membro de uma classe que a empresa chama de modelos System One: você entrega a ele um pedaço de estado e um conjunto de perguntas nomeadas, e ele retorna uma resposta tipada por pergunta — um rótulo de uma lista que você forneceu, um nível em uma escala que você definiu, ou um verdadeiro/falso com uma probabilidade anexada. Sem prosa, sem código, sem explicação. Esta não é uma peça de lançamento. O modelo em si é de 2026-09-15, quinze dias de idade e fora da janela de sete dias para a qual este blog escreve, então ele não ganha uma página por seu próprio lançamento. O que aconteceu dentro da janela é que a OrcaRouter adicionou typesafe/jev-1.13 ao seu próprio catálogo em 2026-09-24 e abriu o cartão do modelo Jev 1.13 em https://www.orcarouter.ai/models/typesafe/jev-1.13 — a primeira vez que o Jev pode ser chamado por meio de um gateway de terceiros, em vez de apenas pelo endpoint próprio da TypeSafe, e os primeiros dados de serviço ao vivo que alguém fora da TypeSafe publicou sobre ele. Essa é a mudança que vale a pena ler: o modelo se tornou executável onde não era.
A forma prática dessa mudança é pequena e específica. Antes de 2026-09-24, adotar o Jev significava uma segunda relação com fornecedor — uma conta TypeSafe, uma chave TypeSafe, uma fatura TypeSafe e um formato de requisição sob medida contra o qual desenvolver. Depois disso, o Jev fica na mesma chave que o resto de uma pilha: uma única API para 200+ modelos, 0% de markup (preço de tabela do provedor repassado, então cortes de preço do fornecedor entram em vigor aqui no mesmo dia), e o modelo acessível em typesafe/jev-1.13 em POST /v1/systemone. Você ainda o chama em seu próprio formato — o endpoint não é a rota de chat-completions da OpenAI, e fingir o contrário produziria um 404 em vez de uma decisão —, mas o contrato que você assina e a chave que você rotaciona são os mesmos que você já tem.
Que tipo de modelo é o Jev
A postagem de lançamento da TypeSafe declara isso em uma frase: "Nosso primeiro modelo público é o Jev, disponível hoje em acesso antecipado." A postagem então caracteriza o modelo como "uma chamada de função de inteligência de fronteira: estado não estruturado entra, decisões probabilísticas tipadas saem." Essa é uma descrição justa da interface e uma descrição importante, porque quase toda expectativa equivocada sobre o Jev vem de avaliá-lo como um pequeno modelo de linguagem. Ele não é um pequeno modelo de linguagem. É um modelo de decisão com uma gramática de saída fixa, e a gramática é o produto.
A interface tem exatamente duas entradas. O estado é o material a ser julgado: um e-mail, um ticket de suporte, uma linha de log, um registro JSON, um array de coordenadas de jogo. As perguntas são um mapa de itens nomeados, cada um com um tipo, suas próprias instruções e — para os dois tipos estruturados — seus critérios. Cada pergunta é avaliada em relação a esse estado, e as respostas retornam como um único payload JSON estruturado. A documentação da TypeSafe descreve as perguntas como executadas simultaneamente e de forma independente, e faz duas afirmações que decorrem disso, e não de ajustes: adicionar perguntas quase não altera o tempo de resposta, e adicionar perguntas não cria degradação de contexto, porque cada pergunta é julgada isoladamente, e não a jusante das anteriores.
A própria orientação de design da TypeSafe vale a pena ser repetida, porque é a declaração mais clara de para que serve o modelo. Mantenha cada pergunta atômica e bem delimitada — “o tipo de julgamento que uma pessoa altamente conhecedora conseguiria fazer em poucos segundos”. Se uma decisão exige raciocínio estendido ou combina genuinamente vários fatores independentes, divida-a em perguntas separadas e recombine-as no seu próprio código. O exemplo deles: em vez de um único prompt de “avalie este pitch de startup”, pergunte separadamente sobre tamanho de mercado, viabilidade técnica e diferenciação; depois, aplique sua própria ponderação. A razão pela qual isso importa é que a ponderação passa a estar em um coeficiente que você pode mudar, em vez de em um prompt que você precisa reescrever.
O modelo é fechado em todos os sentidos que importam para um engenheiro que raciocina sobre risco. A arquitetura do Jev, o número de parâmetros, a computação de treinamento e os pesos não são divulgados. Não há repositório de pesos na organização TypeSafe no GitHub — os onze repositórios públicos ali são ferramentas, SDKs, fluxos de trabalho e três forks não relacionados, e nenhum deles é o modelo.
"{{1}}Typed{{/1}}" é o produto inteiro
O cartão de modelo do OrcaRouter publica as três primitivas e, mais importante, os limites de cada uma. Toda pergunta que você faz a Jev tem exatamente uma de três formas:
• noul — um julgamento verdadeiro/falso, retornado com uma probabilidade calibrada em vez de um booleano puro, de modo que "provavelmente verdadeiro" e "certamente verdadeiro" sejam valores distinguíveis.
• escolha — selecione uma entre até 255 opções rotuladas, cada opção com seu próprio texto de critério, para que o modelo saiba o que distingue seus rótulos.
• pontuação — avaliar numa escala ordenada de 2 a 10 níveis, com as definições dos níveis fornecidas como critérios.
A consequência dessa restrição é que não há nada para extrair de texto em prosa e nada para validar em relação a um esquema que você esperava que o modelo tivesse seguido. O post de lançamento da TypeSafe é incomumente direto sobre a garantia: a cifra de incompatibilidade de esquema de "0%" em seus gráficos "não é empírica. A correspondência de esquema é garantida, portanto podemos adicionar 0% com confiança aos gráficos." Quando seu espaço de respostas é um conjunto fechado que você forneceu, um valor retornado ou está no conjunto ou não veio do modelo — não há um terceiro resultado em que o modelo escreveu algo plausível na forma errada e seu regex o aceitou silenciosamente.
Os três tipos também são a razão pela qual um revisor não consegue avaliar o Jev como avalia um modelo de chat. Não há uma pontuação no MMLU-Pro para comparar, nenhuma amostra de escrita para ler, nenhum traço de raciocínio para inspecionar. A única pergunta que importa é se a resposta tipada está correta e se a probabilidade associada a ela é honesta. Ambas são mensuráveis, mas apenas em relação aos seus dados e aos seus rótulos.
Uma diferença documentada merece ser sinalizada, em vez de resolvida: a própria documentação da TypeSafe mostra um exemplo de Score indexado a partir de zero, enquanto o card do OrcaRouter publica a escala como 2–10 níveis. O fornecedor documenta níveis; nosso card publica 2–10. Se você estiver construindo uma rubrica com base no Score, leia as definições dos níveis na sua própria resposta em vez de presumir um índice.
Por que não há tokens de saída para cobrar
A precificação é a expressão mais clara da arquitetura. O Jev custa US$ 0,042 por milhão de tokens de entrada na OrcaRouter, e a taxa de saída é US$ 0,000000 por milhão — não um desconto, não uma promoção de lançamento, mas a ausência de uma quantidade mensurável. Um modelo generativo é cobrado pelo texto que escreve; o Jev não escreve texto algum. Ele retorna um nível e uma probabilidade. Não há nada a contar no lado da saída, então nada é cobrado no lado da saída.
A TypeSafe declara o mesmo número pela direção oposta em sua página inicial — "US$ 42 por bilhão de tokens de entrada" — e atrela a ele uma alegação comparativa: "preço de entrada 238x menor que o do Claude Fable 5.1". Essa comparação, como tudo o mais na página inicial, é do próprio fornecedor, sem replicação por ninguém. Mas a aritmética em que ela se baseia é fácil de um leitor conferir com a própria fatura, e é essa a parte útil. O volume de uma carga de trabalho de decisão é definido quase inteiramente por quanto estado você injeta, e estado é barato de um modo que tokens gerados não são.
Os números de destaque do fornecedor são maiores que a linha de preço e merecem a mesma rotulagem. A TypeSafe anuncia "193,6x Mais Rápido, 444,6x Mais Barato" com uma nota de rodapé que a restringe a "fluxos de trabalho para tarefas do System One", e publica um exemplo prático abaixo dele: TypeSafe AI a $0,000081 concluído em 0,114s contra LLMs a $0,013880 concluídos em 8,566s. O próprio post de lançamento reconhece o risco de enquadramento — os 193,6x e 444,6x são descritos como provavelmente situando-se "na extremidade superior dos ganhos do mundo real" — e observa que a demonstração lado a lado usou uma consulta "altamente simplificada" com chaves legíveis por humanos escolhidas pelo fornecedor para "apresentar nosso modelo sob uma luz vantajosa". Nenhum desses números foi replicado de forma independente, e o próprio cartão de benchmark do fornecedor ainda está marcado como pendente.
O que significa "calibrado" e o que é o RLCD
A TypeSafe nomeia seu próprio método de treinamento: "Reinforcement Learning for Calibrated Decisions (RLCD)". RLCD é um termo próprio da TypeSafe, não um acrônimo geral de aprendizado de máquina que antecede a empresa, e seu objetivo de otimização é declarado na tabela comparativa do post de lançamento como "decisões calibradas: respostas com probabilidades epistemicamente honestas em tarefas do Sistema 1". O contraste que a mesma tabela estabelece é com o RLHF, que otimiza para a preferência humana — textos e respostas de chat de que os avaliadores gostam — e o RLVR, que otimiza para saídas que podem ser verificadas programaticamente. O RLCD otimiza para uma terceira coisa: a probabilidade associada a uma resposta ser uma declaração precisa da própria incerteza do modelo.
Na prática, "calibrado" é uma afirmação sobre os valores de confiança, não uma garantia de que as respostas estejam corretas. Um modelo calibrado que diz 0,8 em um conjunto de perguntas deve estar certo cerca de 80% das vezes nesse conjunto; ainda pode estar errado em qualquer uma delas individualmente. Essa distinção é a maneira honesta de ler a frase da página inicial da TypeSafe: "Zero Alucinações — Toda decisão do Jev vem com uma estimativa de confiança, para que seu software possa agir quando a confiança for alta e escalar quando não for." É uma afirmação de estimativa de confiança, não uma prova de zero erros, e o contrapeso são os nossos próprios dados: nos sete dias terminados em 30/09/2026, nosso card mede uma taxa de erro de 0,49% no tráfego do Jev pelo OrcaRouter — um valor que indicava 0,57% no início da mesma janela, porque é calculado ao longo de sete dias móveis de tráfego ao vivo do playground, em vez de um conjunto de testes fixo. Os dois fatos pertencem ao mesmo parágrafo: os valores de confiança são o ponto do modelo, e o modelo ainda falha em aproximadamente uma chamada a cada duzentas no nosso tráfego.
A história de calibração também explica um comportamento de latência que, de outra forma, pareceria um bug. O post de lançamento da TypeSafe diz: "Para escolhas de maior cardinalidade, fazemos um sistema de 2 estágios: pontuamos de forma independente e depois fazemos uma escolha explícita, daí a lentidão ocasional." Uma escolha de 255 opções não é uma única comparação direta; o fornecedor pontua e depois escolhe. Se você vir uma requisição contra um grande conjunto de rótulos levar significativamente mais tempo do que um noul, esse é o mecanismo documentado, não congestionamento.
Como você chama isso hoje

No OrcaRouter, o modelo é typesafe/jev-1.13, chamado "TypeSafe: Jev 1.13" no catálogo, com um context_length de 65,536 tokens e exatamente um tipo de endpoint suportado: systemone. Você o chama com POST /v1/systemone na sua chave OrcaRouter, enviando um campo model, um campo state (string, objeto ou array) e um mapa questions em que cada entrada contém um type (noul, choice ou score), suas instructions e seus criteria. As respostas são um único payload JSON estruturado e não são transmitidas em streaming — não há modo de streaming a que possa aderir.
A redação do próprio card para o contrato é "texto de entrada, JSON estruturado de saída", e os limites publicados são aqueles que devem orientar o projeto: sem streaming, até aproximadamente 64K tokens de entrada somando o estado e as perguntas, com requisições acima desse limite rejeitadas antes de chegarem ao modelo. A entrada do catálogo apresenta o preço de tabela como $0,042 por milhão de tokens de entrada e mostra a taxa de conclusão como zero. Esses são os números do fornecedor repassados sem alteração — a forma proporcional de como precificamos: 0% de markup sobre as tarifas de tabela do provedor.
Dois orçamentos de tokens circulam para este modelo e não estão em conflito, então mantenha-os separados. O número 65.536 é o context_length da ficha do modelo e está documentado como aproximadamente 64K de entrada, somando estado e perguntas. Os "aproximadamente 32.000 tokens" citados por artigos anteriores do OrcaRouter correspondem apenas ao orçamento de estado — o espaço que seu material recebe antes de as perguntas ocuparem a parte delas. Se você estiver fazendo o orçamento de uma requisição, o orçamento de estado é o número que limita a carga útil que você monta; o número combinado é o teto da chamada inteira.
O que Jev não consegue fazer, dito claramente
Ele não consegue escrever prosa, resumir, traduzir ou conversar. Isso é o projeto, não uma limitação pela qual se desculpar: o post de lançamento diz que o Jev "abre mão da geração de strings", e a própria página de jaggedness da TypeSafe lista "Generation" como um modo de falha nomeado, com a instrução "Use um modelo generativo" ao lado. A geração forçada é lenta e ruim. Se o seu pipeline precisa de um resumo escrito, o Jev é o componente errado, e nenhuma quantidade de habilidade com prompts muda isso.
Não é um substituto para um modelo generativo. O fluxo de trabalho ao qual o Jev pertence tem dois modelos: um generativo, que lê, escreve e raciocina em texto, e o Jev ao lado dele, fazendo as chamadas tipadas em milissegundos. Essa é a forma honesta de enquadrar toda comparação de custos na página inicial do fornecedor — a coluna "LLMs" não é um concorrente sendo deslocado, é a outra metade do mesmo sistema, e a razão pela qual o pareamento é interessante é que a metade de decisão agora está na mesma chave que a metade generativa, em vez de ficar atrás de seu próprio contrato.
E "calibrado" não significa correto. Significa que o número associado a uma resposta deve ser lido como uma probabilidade. Um 0,62 em um "não" é o modelo dizendo que não tem certeza, o que é uma informação útil que um simples sim/não teria destruído — e não é uma promessa de que o "sim" está certo. A lógica de escalonamento construída sobre a confiança é o padrão pretendido; tratar a resposta como verdade absoluta não é.
Lendo os números honestamente

Todos os valores de serviço em nosso cartão vêm do nosso próprio tráfego através do playground do OrcaRouter em uma janela deslizante de sete dias, e não do benchmark do fornecedor, e a janela mudou enquanto este artigo estava sendo escrito — trate isso como uma leitura, não como uma especificação. Para os sete dias terminados em 2026-09-30: tempo mediano até o primeiro token de 151 ms, p95 de 247 ms, vazão de saída em torno de 349 tokens por segundo, taxa de erro de 0,49% e 76,2 milhões de tokens servidos. O p50 diário ao longo da janela é de 175, 170, 163, 161, 170, 147 e 143 ms — uma linha com melhoria suave. O p95 de 2.448 ms de 28/09 é um outlier genuíno de um único dia dentro dessa série, e citá-lo como a norma estaria errado da mesma forma que omiti-lo por completo seria desonesto.
Mais uma ressalva sobre o número de tráfego: 349 tokens de saída por segundo parece a taxa de transferência de um modelo generativo, até você se lembrar de que o Jev não produz texto gerado. O medidor está medindo o que quer que nosso playground conte no lado da resposta para um payload estruturado, e é útil para detectar degradação entre dias, e não para comparar o Jev com um modelo de chat.
Esses são os nossos números. Os números do fornecedor são o exemplo prático de 193,6x, 444,6x e US$ 0,000081, além da comparação de 238x com o Claude Fable 5.1 — todos da própria TypeSafe, nenhum replicado de forma independente, todos restritos pelas próprias notas de rodapé especificamente a fluxos de trabalho de tarefas do System One. A única alegação de desempenho que a TypeSafe faz que não é um benchmark de forma alguma, e que vale mais do que os multiplicadores, é estrutural: como as respostas são tipadas, a integração não tem etapa de parsing nem etapa de validação de esquema, e esse é um custo que não aparece em nenhuma tabela de latência.
O que está aberto, e o que não está
Verificado em 2026-09-30, a organização TypeSafe no GitHub publicou onze repositórios. Nenhum deles contém Jev. Os que importam para um desenvolvedor que está integrando o modelo são todos MIT ou Apache-2.0: skills (MIT), system-one-adapter-python (MIT, descrito como um "substituto direto do TypeSafeClient respaldado por APIs de LLM"), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, com código de workflow publicado em evals.typesafe.ai), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io e pulumi-clickhouse. As contagens de estrelas e as datas de push mudam, então, se você estiver lendo isto mais tarde, verifique novamente em vez de confiar na lista.
Três dos onze são forks de projetos não relacionados e não provam nada sobre como o Jev funciona: um fork do vLLM com último push em maio de 2025, um fork do LLaDA de junho de 2025 — LLaDA é um lançamento de modelo de linguagem de difusão não relacionado — e um provedor Pulumi para o ClickHouse Cloud. É tentador inferir a arquitetura a partir de uma lista de forks. Não o faça: nada sobre o design do Jev decorre desses três e, em particular, o Jev não é um modelo de difusão, por mais que a presença de um fork do LLaDA possa sugerir isso.
A resposta honesta e direta a "o Jev é de código aberto" é que as ferramentas são abertas e o modelo não. Essa é uma configuração normal para um modelo de fronteira hospedado, e é a configuração que você deve presumir ao planejar em torno do Jev: uma API com preço publicado, contrato documentado e contagem de parâmetros não publicada.
Onde o fornecedor diz que Jev não é confiável
A TypeSafe publica sua própria página de jaggedness para o jev-1.13, revisada pela última vez em 2026-09-17, apontando onde o modelo falha. Ela é excepcionalmente honesta e é o lugar certo para começar uma seção de limitações, porque é a própria lista do fornecedor, e não a de terceiros:
• Leitura literal — interpreta o texto ao pé da letra. Palavras de escopo, negações e condições implícitas não são inferidas; ele "responde à pergunta que você escreveu, e não à que você quis fazer." A correção do fornecedor é escrever a condição exata e os critérios para cada opção.
• Matemática e números — não é uma calculadora e não conta de forma confiável. Mantenha a aritmética no código.
• Comparação de data e hora — datas são lidas como texto, não como quantidades ordenadas, portanto ordenação, lacunas e janelas não são confiáveis, pior ainda com formatos mistos.
• Indireção — negativas duplas e raciocínio com múltiplos saltos reduzem a precisão. Reduza os saltos e aponte para o estado relevante.
• Estado grande cheio de detalhes irrelevantes — conteúdo não relacionado atua como distrator e a precisão cai à medida que o estado cresce. Filtre primeiro.
• Conteúdo adversarial — o estado não é tratado como hostil, portanto instruções injetadas ou enquadramentos enganosos podem alterar as respostas.
• Instruções e critérios contraditórios — quando os dois pedem coisas diferentes, o modelo "pode ficar confuso".
• Invariantes estruturais de senso comum — P(noul) e 1 − P(não noul) não são garantidamente consistentes. Pergunte cada decisão de uma única forma e imponha as identidades no código.
• Geração — já abordada, e a própria recomendação do fornecedor é usar um modelo generativo.
Dois desses merecem ênfase. O adversarial importa porque toda a proposta de valor do Jev é julgar material não confiável, e um estado que contém instruções pode alterar uma resposta; se o seu estado chega vindo dos usuários, isso é uma superfície de prompt injection com o mesmo formato que qualquer outra. O das invariantes estruturais importa porque um modelo "calibrado" convida você a fazer aritmética com suas probabilidades, e o fornecedor está dizendo para você não presumir que a aritmética fecha.
A que a publicação de lançamento se compromete, e a que não se compromete

Quase todas as alegações do fornecedor citadas neste artigo remontam a uma única página: o próprio anúncio da TypeSafe, arquivado em Notícias da Empresa e datado de 2026-09-15, assinado pelo fundador Diogo Almeida. Ler o anúncio diretamente vale os dois minutos, porque a redação de uma linha define os termos de tudo desde então. "Nosso primeiro modelo público é o Jev, disponível hoje em acesso antecipado." Acesso antecipado é a própria descrição do fornecedor sobre a disponibilidade na plataforma do próprio fornecedor, e é uma declaração mais restrita do que parece — ela compromete a TypeSafe a servir o modelo para usuários aprovados, e não diz nada sobre quem mais pode servi-lo. É exatamente essa lacuna que a inclusão no catálogo de 2026-09-24 fechou, e a razão pela qual o cartão do modelo importa mais do que a publicação para qualquer pessoa que avalie o Jev hoje.
A mesma página é igualmente clara sobre seus próprios limites, e é por isso que ela foi citada em vez de parafraseada acima. Ela não publica contagem de parâmetros, nenhuma descrição de arquitetura além de "uma nova arquitetura de modelo", nenhuma computação de treinamento e nenhum repositório de pesos, e não informa data nem condições para disponibilidade geral. Essas ausências são as restrições de planejamento: uma API com preço publicado de um lado, e uma pilha cujos detalhes internos você não pode inspecionar do outro. O post também enquadra o modelo com honestidade suficiente para ser útil como especificação — "uma chamada de função de inteligência de fronteira: estado não estruturado na entrada, decisões probabilísticas tipadas na saída" —, que é a única frase nele que descreve a interface em vez da ambição.
Questões que esta interface levanta
O que acontece quando um conjunto de opções é maior que 255 opções? Ele é limitado — 255 opções rotuladas é o teto em uma pergunta de escolha, e a abordagem de duas etapas do fornecedor, pontuar e depois escolher, é o que ele faz conforme a cardinalidade aumenta, o que também é a fonte documentada de lentidões ocasionais em grandes conjuntos de rótulos. Se sua taxonomia for maior que isso, a resposta de design é decompô-la em várias perguntas e recombiná-las no código, que é o mesmo conselho que a TypeSafe dá para julgamentos compostos.
Os 65.536 tokens significam 65.536 tokens de estado?O orçamento publicado é de aproximadamente 64K tokens somando o estado e todo o resto, e o número de "aproximadamente 32.000 tokens" que aparece em textos mais antigos é apenas o orçamento de estado. Dimensione seu payload com base no estado, e não no valor combinado, e lembre-se de que o que ultrapassa o limite é rejeitado antes de chegar ao estado.
O que fazer com isto
Vale a pena dar uma olhada no Jev 1.13 por um motivo específico, e não por um motivo geral. Se você tem uma etapa no seu pipeline que atualmente é um modelo de chat ao qual se pede que retorne um rótulo e no qual se confia para retorná-lo no formato certo — um roteador, um avaliador, uma verificação de política, uma pontuação de rubrica aplicada a milhares de registros — essa etapa é o que este modelo substitui, a US$ 0,042 por milhão de tokens de entrada, sem nada medido no lado da saída. Se você tem uma etapa que precisa de uma resposta escrita, o Jev não é a ferramenta, e o próprio fornecedor dele diz isso.
A coisa que mudou na última semana não é o modelo. É que experimentá-lo deixou de exigir uma segunda relação com fornecedor. Há oito dias, uma avaliação do Jev significava uma conta separada e uma integração separada; hoje, é um único id de modelo numa chave que já alcança mais de 200 modelos, com o preço de tabela do fornecedor repassado sem alterações e as respostas digitadas voltando do mesmo lugar que todo o resto. Para um modelo tão incomum, a possibilidade de testá-lo com os seus próprios rótulos sem se comprometer com um novo contrato é a maior parte da decisão.
