
Decision 3.0 Está no Hugging Face: Seis Modelos de Decisão Multimodais Abertos, Anunciados Apenas no X
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 71 tok/s
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Decisão 3.0existe numa forma que pode descarregar agora mesmo, e quase ninguém a escreveu. Seis checkpoints — d3, d3-flash, d3-mini, d3-nano, d3-lightse d3 — chegaram à vllm-srorganização no Hugging Face a 10 de outubro de 2026, do mais recente para o mais antigo, começando às 09:38 UTC e terminando com o d3-edge às 23:49 UTC. Estão sob licença Apache-2.0, são construídos sobre as bases Qwen3.5 e Qwen3.8, respondem a perguntas de escolha, sim/não e pontuação com uma probabilidade por opção em vez de gerarem um token, e cinco dos seis leem agora imagens e vídeo. Cada cartão de modelo descreve-se como "o modelo de decisão multimodal de fundação de 27B da Decisão 3.0, os modelos de decisão do vLLM Semantic Router", que é a camada de decisão aberta do projeto vLLM.
O que falta é o anúncio. A conta do projeto vLLM no X parabenizou a equipe do vLLM-SR pelo lançamento em 11 de outubro, citando a própria thread de apresentação do mantenedor — esse é todo o registro público. O índice do blog do projeto ainda termina em 10 de outubro com um post sobre modelos de decisão de roteamento, não sobre estes. A página de releases do GitHub de vllm-project/semantic-router ainda tem como versão mais recente a v0.4.0, de 27 de setembro. Os pesos foram publicados; a nota de lançamento, não.
Essa distinção importa para a forma como você lê tudo o que vem abaixo. Todos os números de desempenho neste artigo vêm das próprias fichas de modelo da vLLM-SR, medidos com o harness deles, no hardware deles. Nada aqui foi reproduzido por terceiros, e o placar em que eles publicam é mantido por eles mesmos. Esta é uma leitura inicial e honesta de um artefato que é real e de uma alegação que ainda não foi auditada.
O que realmente está no Hugging Face
Os seis repositórios são simples, completos e consistentes entre si. Cada um contém pesos safetensors, um template de chat, um decision_config.json que fixa a revisão do modelo base, código de modelagem personalizado (modeling_d3.py, d3_engine.py, d3_server.py), uma cabeça de leitura em seu próprio readout.safetensors, e um MODEL_MANIFEST.json com um SHA-256 por arquivo. Um sétimo repositório, a página de coleção, lista todos os seis.
A família, na ordem em que os tamanhos aparecem:
• d3 — 26,09B de parâmetros, incluindo um codificador de visão de 0,46B, construído sobre Qwen/Qwen3.8-27B. Carregado a 10 de outubro, 09:38 UTC.
• d3-flash — 8,39B, incluindo um codificador de visão de 0,46B, baseado em Qwen/Qwen3.5-9B.
• d3-mini — 4,54B, incluindo um codificador de visão de 0,33B, construído sobre Qwen/Qwen3.5-4B.
• d3-nano — 2,21B incluindo um codificador de visão de 0,33B, construído sobre Qwen/Qwen3.5-2B.
• d3-lite — 0,85B incluindo um codificador de visão de 0,10B, construído sobre Qwen/Qwen3.5-0.8B.
• d3-edge — 0,59B, incluindo um codificador de visão de 0,10B, também construído sobre Qwen/Qwen3.5-0.8B. Carregado por último, 23:49 UTC.
Todos os seis carregam o mesmo contrato de requisição: um estado (texto ou JSON, opcionalmente com imagens e vídeos) mais um dicionário de perguntas nomeadas, e uma resposta de distribuições de probabilidade tipadas. Existem três tipos de pergunta — Choice, Noul (sim/não), Score — e o modelo responde a todas elas em uma única chamada, executando uma passagem direta por pergunta sobre a mesma entrada, sem qualquer loop de decodificação.

Os números, e a quem pertencem
A vLLM-SR publica um leaderboard que chama Jev Decision Index 0.3.1 e coloca o d3 no topo dele. As linhas de destaque, todas reportadas pelos fornecedores:
• d3 — Índice 64,7, suíte pública 65,5, testes de mesma habilidade 62,8, tarefas de novo domínio 56,6.
• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.
• Fastino GLiDE no-thinking (28B) — 60,2, 59,1, 59,5, 52,9.
• Jev — 60,1, 58,0, 58,0, 55,0.
• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.
• Decision 2.0 (27B), a geração anterior — 55,9, 57,0, 55,7, 47,9.
Uma nota de rodapé no cartão do d3 afirma claramente que a própria linha do d3 é uma avaliação interna, enquanto as linhas de comparação são dados de placar ao vivo lidos em 10 de outubro. Essa é a divulgação correta a ser feita, e vale a pena lê-la duas vezes: os números dos concorrentes foram extraídos de um placar, e o número do modelo avaliado foi produzido pela equipe que construiu o modelo. O cartão também afirma que todas as 140.178 solicitações públicas foram respondidas, sem nenhuma sem suporte — uma alegação de cobertura, não de precisão, e incomum de se publicar.

Os checkpoints menores relatam estar marchando em passo sincronizado. Cada card traz um número da suíte pública e um delta em relação ao tamanho equivalente no Decision 2.0: d3-flash 57,79, alta de 11,0 em relação ao 9B anterior; d3-mini 54,90, alta de 10,7; d3-nano 42,22, alta de 12,2; d3-lite 36,93, alta de 16,4; d3-edge 28,82, alta de 12,1. Os ganhos relativos são maiores na parte inferior da faixa, que é o que se esperaria se a receita de pré-treinamento multimodal estivesse fazendo mais diferença para modelos pequenos do que para grandes — e também o que se obteria ao ajustar os modelos pequenos com mais intensidade. Não há como distinguir qual é qual a partir de fora.
A parte multimodal é a verdadeira mudança
Os modelos do Decision 2.0 leem texto. Os do Decision 3.0 leem texto, imagens e vídeo, e essa é a diferença substancial entre as gerações — não o movimento do índice. Cada cartão lista a entrada de imagem como PNG, JPEG ou WebP, fornecida como caminhos, URLs, imagens PIL ou URLs de dados base64, com várias por solicitação, a até 1,6 megapixels cada; e vídeo como MP4, WebM, MOV ou MKV, ou como arrays de quadros, lido a 2 quadros por segundo, com no máximo 32 quadros distribuídos por todo o clipe e cada quadro a até 0,2 megapixels. Cada pergunta em uma solicitação vê todas as imagens e todos os vídeos anexados a ela.
As evidências de apoio para vídeo são um resultado do Perception Test em todas as 19.140 perguntas de validação: d3 em 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, contra um piso de acaso documentado de 33,3 em perguntas de três opções. A vLLM-SR classifica isto como uma avaliação interna. O d3 também possui um quadro de visão que o coloca em 71,6 no geral, à frente do Perplexity Decider v1.1, com 70,6, e do JEV-27B-VL, com 69,6, com as linhas de comparação mais uma vez extraídas de dados do quadro, em vez de executadas pelos autores.
Os números de throughput referem-se a pedido único e GPU única, e são apresentados como tal: o d3 responde a um pedido de texto numa mediana de 55 ms, a um pedido com uma imagem em 273 ms e a um pedido com um vídeo de dez segundos em 553 ms, numa única AMD Instinct MI325X. O d3-edge faz o mesmo em 6,7 ms, 41,9 ms e 308,3 ms. Estas são medianas por pergunta num modelo concebido para ser chamado muitas vezes dentro de um mesmo fluxo de trabalho, e é esse o número que importa para a arquitetura para a qual estes modelos foram criados — vinte decisões sequenciais com 100 ms adicionais cada uma custam dois segundos, como a Microsoft salientou este mês em relação ao seu próprio modelo de decisão.
O que os repositórios não dizem
Vale a pena nomear três lacunas antes que alguém planeje em torno disso.
O primeiro é o orçamento de entrada. decision_config.json para os maiores conjuntos de modelos define max_length como null, e nenhum card declara um teto de tokens para estado mais perguntas mais descrições de opções. Os cards de Decision 1.0 publicaram orçamentos explícitos — 1.024 tokens para o ramo do codificador, 16.384 para o ramo do decodificador — e esses números são uma restrição real de planejamento. A ausência deles aqui é notável, e é a coisa mais útil que um commit de acompanhamento poderia adicionar.
O segundo é a calibração. O número mais importante de um modelo de decisão não é a acurácia, mas se um 0,9 retornado significa nove vezes em cada dez. Os índices de visão e texto não dizem nada sobre isso. Não há pontuação de Brier, nem valor de erro de calibração esperado, nem temperatura em nenhum dos seis cartões. A InternLM publicou ambos em seu próprio modelo de decisão em setembro; a vLLM-SR não o fez, para nenhum membro desta família.
O terceiro é a independência. Os modelos do Decision 2.0 tiveram duas semanas de uso externo; os do Decision 3.0 têm horas. As contagens de downloads em 11 de outubro — 130 para d3, 83 para d3-lite, 82 para d3-nano — são a pegada de um upload, não de adoção. Trate cada número do índice acima como uma hipótese com um repositório anexado.
Onde isto se encaixa em uma stack que você pode chamar hoje
A questão prática sobre um modelo de decisão é se ele se encaixa em um pipeline que já existe, e aqui o ecossistema está mais adiantado do que os modelos. O formato de requisição System One que esses modelos usam não é proprietário do vLLM-SR: é o mesmo contrato de estado e perguntas nomeadas com o qual os modelos Jev hospedados são chamados, e é por isso que "Jev" aparece tanto como o nome do índice no cartão de modelo do d3 quanto como uma linha em seu leaderboard.
O OrcaRouter carrega esse lado da família. typesafe/jev-1.13 está no nosso catálogo e é servido através de POST /v1/systemone — o mesmo contrato, a $0.042 por milhão de tokens de entrada sem cobrança de conclusão porque não há conclusão, até aproximadamente 64K tokens de entrada, texto de entrada e JSON estruturado de saída, sem streaming. É o tipo de modelo que uma camada de decisão chama hoje. Duas coisas que não afirmamos: d3 e o resto do Decision 3.0 não estão em nosso catálogo, e o caminho de inferência local do Decision 3.0 é uma classe Python em um repositório Hugging Face, não um endpoint que poderíamos rotear mesmo se quiséssemos. O que um roteador realmente oferece a você aqui está do outro lado do loop — o modelo generativo que age sobre uma decisão, roteado através de uma única chave em mais de 200 modelos com failover automático quando um provedor oscila, de modo que adicionar uma etapa de pontuação na frente de um fluxo de trabalho não signifique também adicionar um segundo relacionamento com fornecedor.
O que mudaria esta imagem
Quatro coisas, em ordem aproximada de quanto elas lhe diriam. Um post de blog do projeto declarando o orçamento de entrada e o formato de implantação pretendido, o que confirmaria que se trata de um lançamento, e não de um push. Uma pontuação Brier ou um número de ECE em qualquer checkpoint. Um terceiro executando a suíte pública nos pesos lançados em vez de ler o índice. E um runtime — o repositório semantic-router recebeu dois commits em 11 de outubro que integram d3 e d3-edge ao seu runtime de modelos, incluindo entrada de vídeo, o que sugere que a estratégia de serving está sendo construída agora e será o que torna esses modelos baratos de experimentar.
Até que pelo menos o primeiro deles chegue, o resumo honesto é este: há uma família completa de modelos de decisão, Apache-2.0, genuinamente multimodal, disponível no Hugging Face, de 0,6B a 27B, publicada com uma proveniência incomumente boa — hashes de arquivos, revisões de base fixadas, um alvo de hardware declarado — e com uma quantidade incomumente pequena da documentação ao redor que lhe permitiria decidir se deve usá-la. Baixá-la não custa nada. Acreditar no índice deve esperar.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
