
RSI-Jev vs Laya: Dois Modelos Abertos de Decisão, Apostas Opostas
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.
A primeira aposta diz respeito à escala. O checkpoint em inglês da Laya é o ModernBERT-large, com 421 milhões de parâmetros e um contexto de 512 tokens, e seu checkpoint multilíngue é o mmBERT-base, com 322 milhões e uma janela de 1.024 tokens que chega a 8.192 quando o encoder é configurado para uma janela ampla. O RSI-Jev v6.1-VL roda uma torre Qwen3.5-4B-Base inteira — 4,69 bilhões de parâmetros, 3,57 bilhões deles nas 32 camadas de decodificador, além de uma torre de visão e três cabeças de decisão nas camadas 16, 20 e 32. A Laya é um modelo do qual você pode pré-carregar três em alguns gigabytes; o RSI-Jev é um checkpoint bf16 de 9,7 GB. A segunda aposta decorre da primeira: a Laya gasta quase nada por chamada e espera que você lhe ensine o seu domínio, enquanto o RSI-Jev gasta quatro bilhões e meio de parâmetros tentando responder à sua pergunta sem nenhum treinamento.
Para que cada um realmente serve
A própria ficha do modelo da Laya contém a frase que enquadra esta comparação melhor do que qualquer avaliador conseguiria: "A Laya é uma base rápida para especializar, não um motor de decisão zero-shot." No benchmark de decisões tipadas — 2.000 decisões em quatro fluxos de trabalho — o checkpoint base em inglês obtém 0,362, contra 0,318 para palpite aleatório e 0,461 para sempre escolher a classe majoritária. Nas mesmas decisões, o checkpoint que a Convai ajustou com fine-tuning na própria divisão de treino desse benchmark obtém 0,766, ultrapassando o teto de 0,735 de concordância com o professor. Essa diferença é o produto: a Laya é um encoder de 421M que você ajusta com fine-tuning em uma taxonomia estreita, e a Convai disponibiliza um notebook do Kaggle que executa todo o ciclo — construir o conjunto de dados, treinar, ajustar temperaturas de calibração, avaliar — em duas T4s gratuitas.
RSI-Jev é a outra aposta. Seu lançamento v6.1-VL marca 50,98 no seu próprio Decision Index 0.3 público, uma execução de 140.178 requisições da configuração padrão, que no quadro do projeto datado de 2026-10-06 empata com o melhor modelo 4B de lá e fica em 27º de 113 no geral. Sua suíte de quinze benchmarks é 0,793 e seu conjunto reservado é 0,729. Esses são números zero-shot — embora o projeto faça questão de dizer que dez dos quinze benchmarks contribuem com dados de treinamento de alguma forma, então "zero-shot" se aplica à busca do lançamento, não a todos os números da página. O que esses números lhe garantem é um modelo que responde a uma pergunta sobre um documento que você nunca lhe mostrou e não precisa de uma execução de treinamento antes.
• Tamanho — Laya 421M inglês / 322M multilíngue vs RSI-Jev 4,69B, executando toda a torre Qwen3.5-4B-Base.
• Precisão zero-shot — Laya 0,362 em decisões tipadas, abaixo da linha de base de maioria de 0,461 vs. RSI-Jev 50,98 no seu próprio Índice de Decisão 0,3, igualando ali a melhor entrada 4B.
• Precisão com ajuste fino — Laya 0,766 com um checkpoint treinado na própria divisão do benchmark, enquanto os números do RSI-Jev são de nível de release, não por domínio.
• Idiomas — Laya 45 de 51 idiomas utilizáveis acima de três vezes o roteamento aleatório do lado do servidor vs. texto centrado no inglês do RSI-Jev.
• Modalidade — Laya somente texto vs RSI-Jev texto mais até quatro imagens por solicitação.
• Contexto — Laya 512 tokens em inglês, 1.024 multilíngue e até 8.192 para documentos longos vs RSI-Jev 32.768 tokens, recusado em vez de truncado.
• Latência — Laya 32,8 ms p50 em uma T4, 7,2 ms por pergunta com lote de dez vs. RSI-Jev 22,5 ms com esforço baixo e cerca de 40 ms em profundidade total, em um H200.
A queda abrupta na contagem de opções é a diferença mais acentuada.
Ambos os modelos definem o espaço de respostas no momento da requisição, então um novo esquema não precisa de retreinamento — essa é a vantagem estrutural compartilhada de toda esta família. Mas eles alocam o espaço de respostas de forma diferente, e a diferença aparece exatamente nas tarefas que o roteamento empresarial costuma envolver. O Laya pontua cada opção em seu próprio token mascarado, e as opções compartilham um orçamento fixo de head: 192 tokens no checkpoint em inglês, 256 no multilíngue. No Banking77, com 77 intenções, isso equivale a cerca de três ou quatro tokens por rótulo, e a acurácia cai para 0,425. O próprio card da Convai documenta o penhasco e oferece a correção — aumente head_max_len para 512 e o contexto para 1.024 ou mais, para que cada rótulo tenha espaço, ou divida um grande conjunto de opções em uma escolha de duas etapas, do grosso para o fino.
O caminho de serving do RSI-Jev aceita até 5.120 opções por pergunta. Isso não é um benchmark comparável ao 0,425 do Laya — os dois foram medidos em harnesses diferentes, e o teto de opções é um limite de configuração, não uma pontuação. É uma afirmação sobre qual modelo não vai quebrar quando sua taxonomia tiver cem entradas. Se suas perguntas de escolha forem "cobrança / técnico / vendas / outros", qualquer um funciona. Se forem cerca de cem rótulos de intenção, um desses dois precisa de ajuste antes de ser utilizável, e o outro não.

Latência, a questão do idioma e as imagens
A alegação de latência da Laya é a sua mais chamativa, e é real: 32,8 ms p50 para uma única pergunta em uma Tesla T4, 72,3 ms para um lote de dez e 337 ms para cinquenta — 103 a 332 perguntas por segundo em uma única GPU modesta. Os próprios números do RSI-Jev, medidos em uma H200, são 22,5 ms com esforço baixo, 26,8 ms com esforço médio, 39,9 ms por padrão e 40,4 ms em profundidade total. Esses são da mesma ordem de magnitude, e ambos são passagens diretas locais em vez de chamadas de rede, que é a comparação que realmente importa quando um endpoint hospedado está fora de cena. Observe o que os dois estão fazendo com o tempo: o RSI-Jev pode parar deliberadamente na camada 16 para ganhar esses 22,5 ms e executar todas as 32 quando a pergunta é difícil, e a Laya não tem esse controle — ela sempre executa todo o seu codificador (pequeno).
A história linguística segue o sentido oposto e é decisiva para quem está fora do inglês. A Laya disponibiliza um roteador que detecta o sistema de escrita em bem menos de um milissegundo e encaminha para o checkpoint multilíngue, e sua tabela publicada mostra 45 de 51 línguas utilizáveis acima de três vezes o aleatório, contra 23 do checkpoint apenas em inglês. Sua ficha também é honesta quanto à razão por que isso importa: o checkpoint inglês colapsa em escritas não latinas — o khmer obtém 0,000 de exatidão com 0,952 de confiança —, então o controle por confiança não consegue salvar uma rota errada. O RSI-Jev não tem uma história linguística desse tipo; é um modelo de texto centrado no inglês que, por acaso, lê imagens.
No caso de imagens, a situação é espelhada. O RSI-Jev aceita de uma a quatro imagens por solicitação como URLs de dados base64 e obteve 0,834 em seu conjunto de imagens reservado nesta versão; os checkpoints fornecidos pela Laya são classificadores de texto e, embora haja portes da comunidade como laya-vision no Hub, eles não são o produto do fornecedor. Se a sua decisão for tomada com base em uma foto, um gráfico ou uma captura de tela, essa é a coluna de um modelo, e não a do outro.
Nenhum dos dois foi avaliado em benchmark em relação ao outro.
Esta é a parte que uma comparação especificação por especificação esconde discretamente: não há um confronto direto entre esses dois modelos. O que existe é um confronto direto entre cada um deles e o mesmo modelo fechado — o Jev 1.13 da TypeSafe — e nenhum dos dois pode ser colocado ao lado do outro.
A Convai publicou uma: em typed-decisions, o Jev 1.13.0 com 0.727 contra o 0.766 roteado da Laya; no Banking77, o Jev 0.870 contra o 0.425 da Laya; na calibração, o Jev 0.246 contra o 0.081 da Laya após a correção de temperatura. A Convai assinala os seus próprios limites na mesma tabela — os números do Jev são publicados por terceiros, eles nunca tiveram acesso à API para medi-lo, e os tamanhos de amostra e os prompts diferem. A comparação do RSI-Jev é o Decision Index, que é o quadro público da própria RSI-Jev e não contém nenhuma entrada do Jev. Portanto, os únicos números externos que dizem respeito a ambos os modelos vêm de bancadas de avaliação construídas pelas partes que os vendem, e a leitura sensata de qualquer número isolado acima é "isto é o que o criador mediu, na tarefa do criador."
O que ambos os projetos fazem bem, e raramente fazem, é publicar suas próprias fraquezas. RSI-Jev nomeia as cinco fontes de imagens não comerciais por trás de seus lançamentos de visão e diz claramente que não está definido se os pesos treinados nelas herdam esses termos; ele relata uma regressão de calibração em seu lançamento mais recente e considera seu limiar de saída padrão não confirmado. Laya documenta que seus checkpoints base ficam abaixo da linha de base da maioria, que suas perguntas de pontuação ordinais são sua primitiva mais fraca, que seu noul pode seguir seus próprios rótulos de opção em vez do estado, e que um de seus campos de resposta não carrega nenhum sinal utilizável. Essa honestidade é a coisa mais útil a herdar de qualquer um dos projetos: verifique os valores de confiança em seus próprios casos rotulados antes de automatizar com base neles.

Onde o contrato que eles copiam realmente fica
Ambos estes modelos existem porque valia a pena copiar um formato de transmissão. O Jev da TypeSafe define a forma do pedido — estado, perguntas, três primitivas tipadas — e a forma da resposta, e tanto Laya como RSI-Jev implementam-no, de modo que um cliente existente funciona alterando uma URL base. Esse modelo de referência, typesafe/jev-1.13, é o único dos três que servimos: está no nosso catálogo no endpoint systemone dedicado, um POST para /v1/systemone, sem streaming, contra um contexto de 65.536 tokens, a $0,042 por milhão de tokens de entrada, com a saída faturada a zero. Nem Laya nem RSI-Jev estão no nosso catálogo — ambos são downloads, e é esse o ponto deles.
A versão prática disso importa mais do que a comparação. Camadas de decisão quase nunca estão sozinhas em uma stack; elas ficam ao lado de um modelo generativo que escreve a resposta, o resumo ou o código. Ter o contrato de referência na mesma chave que mais de 200 outros modelos, a preço de lista do provedor repassado com 0% de margem, significa que uma mudança de tarifa do fornecedor chega até você no mesmo dia, e o failover automático significa que a metade generativa desse par não é um ponto único de falha enquanto você avalia se a metade barata de decisão é boa o suficiente. Se você decidir que um encoder 421M auto-hospedado ou um checkpoint 4.69B é a escolha certa, você ainda quer que o contrato com o qual ele fala seja acessível do mesmo lugar — e se você preferir não executar nenhum dos dois, o modelo que ambos copiam está a uma requisição de distância.
Qual deles baixar
Escolha Laya se você tiver dados rotulados, uma taxonomia que não muda muito e uma mistura de idiomas que não seja apenas inglês. Ela é pequena o suficiente para rodar muitas instâncias, rápida o suficiente para colocar na frente de cada requisição e foi projetada desde o início para ajuste fino — a pontuação de 0,766 com ajuste fino contra 0,362 zero-shot é todo o argumento. Reserve orçamento para a execução de treinamento, a rotulagem e o reajuste de temperatura por tipo de pergunta, que leva seu erro de calibração de 0,466 para 0,081, e mantenha os conjuntos de opções abaixo de aproximadamente vinte rótulos ou aumente o orçamento do head antes de confiar em uma classificação com muitas classes.
Escolha o RSI-Jev v6.1-VL se quiser que uma decisão funcione sem nenhum treinamento prévio, se suas perguntas às vezes envolverem uma imagem, se seus conjuntos de opções forem grandes ou se quiser trocar latência por profundidade por requisição. Espere executar um checkpoint de 9,7 GB em vez de um de 400M, espere um projeto que publicou oito versões em treze dias e que pode publicar outra enquanto você avalia esta, e espere verificar a calibração por conta própria — o próprio cartão desta versão diz que ela piorou, não melhorou.
Independentemente do que escolher, as mesmas duas coisas continuam verdadeiras. Nenhum dos modelos gera texto, portanto nenhum pode falhar ao emitir um campo malformado; ambos retornam probabilidades, e a probabilidade é a parte que tem de ser validada a cada implantação, em vez de ser retirada de uma ficha. E ambos deslocaram a questão interessante de uma camada de decisão de "de quem é a API" para "de quem são os pesos" — o que é uma pergunta melhor de se fazer, e uma à qual este par responde de forma muito diferente.

