
TwIL-LM3-Pro: Um modelo de lógica formal de 3,66B enviado mediante solicitação por e-mail
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
TwIL-LM3-Pro é um modelo de raciocínio de 3,66 bilhões de parâmetros da webAI, criado especificamente para lógica formal, e não para conversação geral, e está no Hugging Face desde 3 de setembro de 2026. Não é um lançamento novo, e o enquadramento que circula em torno dele esta semana — de que a webAI "lançou um modelo de 3,66B" — chega aos pesos com um mês de atraso. O que de fato mudou nos últimos dias é menor e mais útil: o checkpoint foi revisado em 30 de setembro, e em 1º de outubro a webAI publicou uma build LiteRT-LM do modelo para inferência on-device em Android e iOS. Portanto, a pergunta interessante não é o que é o TwIL-LM3-Pro, mas se você consegue obtê-lo, e a resposta depende de em qual de três canais de distribuição você está — porque um deles é um formulário.
Essa distinção importa mais do que normalmente importaria, porque o TwIL-LM3-Pro não é um produto que você possa simplesmente chamar. É um checkpoint que você baixa, executa no seu próprio hardware e aceita os termos de uma licença que proíbe o uso comercial. A comparação que o próprio cartão do modelo convida — contra o Qwen3-8B, um modelo com mais que o dobro dos parâmetros — é real, mas é uma comparação de benchmarks executados pelo fornecedor em uma estrutura construída pelo fornecedor, e o cartão do modelo diz isso em mais lugares do que a maioria. Este artigo lê esse cartão de perto e separa o que a webAI mediu daquilo que qualquer outra pessoa tem.
O que o modelo realmente é
` preserve. Need Portuguese. Let's translate carefully. Original: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads against 8 key-value heads — derived from IBM's `granite-4.2-3b`. The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Translate: TwIL-LM3-Pro é um decodificador Granite denso — `GraniteForCausalLM`, 40 camadas, tamanho oculto 2.560, 40 cabeças de atenção contra 8 cabeças de chave-valor — derivado do `granite-4.2-3b` da IBM. A contagem de parâmetros de 3,66B é o total real, 3.659.737.600, e a janela de contexto é a de 131.072 tokens do modelo base, mantida sem alterações. Ele emite um bloco `<think>…</think>` antes de responder e foi avaliado com decodificação greedy com um orçamento de 2.048 tokens. Need consider number formatting in Portuguese: 2.560, 3,66B, 3.659.737.600, 131.072, 2.048. "dense" maybe "denso". "decoder" decodificador. "hidden size" tamanho oculto. "attention heads against key-value heads" cabeças de atenção em relação a 8 cabeças de chave-valor? "contra" okay, "para" maybe. "greedy decoding" decodificação greedy (or decodificação gulosa). Common "greedy" maybe "greedy". "budget" orçamento. "carried through unchanged" mantida sem alterações. "base model's" do modelo base. Good. Need ensure no markers. Output ONLY translated text. No preamble. Backticks preserved. `<think>…</think>` in backticks? Original: `<think>…</think>` block. It has backticks around `<think>…</think>`. Keep code exactly. We can keep backticks. Need maybe preserve "IBM's" to "da IBM". Brand "IBM" preserve. "Granite" brand preserve. "TwIL-LM3-Pro" preserve. "GraniteForCausalLM", "granite-4.2-3b", "3.66B"? It says parameter count 3.66B maybe preserve? In Portuguese decimal comma. The instruction says preserve brand/product names and URLs. Numeric formatting can localize. However "3.66B" maybe product? It is count. We can write 3,66B. But if they expect exact? Probably okay. But maybe safer preserve "3.66B"? Portuguese uses comma. We can write "3,66B". "3,659,737,600" -> "3.659.737.600". "131,072" -> "131.072". "2,048" -> "2.048". "2,560" -> "2.560". That's appropriate. Potential issue: "40 attention heads against 8 key-value heads" maybe "40 cabeças de atenção contra 8 cabeças de chave-valor" sounds okay. "key-value heads" maybe "cabeças de chave-valor" or "cabeças de valor-chave". In transformers, "key-value heads" = "cabeças de chave-valor". Good. "dense Granite decoder" could be "decodificador Granite denso" (dense architecture). Good. "derived from IBM's `granite-4.2-3b`" -> "derivado do `granite-4.2-3b` da IBM". Good. "The 3.66B parameter count is the real total" -> "A contagem de parâmetros de 3,66B é o total real". Good. "context window is the base model's 131,072 tokens carried through unchanged." -> "a janela de contexto é a de 131.072 tokens do modelo base, mantida sem alterações." Maybe "a janela de contexto é a do modelo base, de 131.072 tokens, mantida sem alterações." Better: "a janela de contexto é a do modelo base, de 131.072 tokens, mantida inalterada." That's clear. "It emits a `<think>…</think>` block before answering" -> "Ele emite um bloco `<think>…</think>` antes de responder". Good. "was evaluated with greedy decoding at a 2,048-token budget." -> "foi avaliado com decodificação greedy em um orçamento de 2.048 tokens." or "com um orçamento de 2.048 tokens." Good. "decodificação gulosa" maybe more Portuguese. But "greedy decoding" technical term often "decodificação greedy". Could use "decodificação gulosa" and maybe "greedy" in parentheses? Instruction says translate. I'd use "decodificação greedy" because common in PT ML. But "gulosa" is translation. Which is better? "decodificação greedy" preserves term. They asked translate into Portuguese. "greedy" is English; "gulosa" is Portuguese. Maybe "decodificação gulosa" is standard. Let's think: In Portuguese NLP, "greedy decoding" often translated as "decodificação greedy" or "decodificação gulosa". Both. I can write "decodificação gulosa" to fully translate. But "greedy" might be considered technical and okay. The instruction preserve brand/product names only, not technical terms. So "decodificação gulosa" is fine. But "greedy decoding" specific algorithm. "gulosa" may be understood. I'll use "decodificação greedy" maybe more recognizable. The target is Portuguese. Hmm. Maybe "com decodificação greedy, com um orçamento de 2.048 tokens." Good. Need maybe maintain em dash. Portuguese can use travessão. Use "—". Good. Final only translated text. Ensure no extra. Let's output.TwIL-LM3-Pro é um decodificador Granite denso — `GraniteForCausalLM`, 40 camadas, tamanho oculto 2.560, 40 cabeças de atenção contra 8 cabeças de chave-valor — derivado do `granite-4.2-3b` da IBM. A contagem de parâmetros de 3,66B é o total real, 3.659.737.600, e a janela de contexto é a do modelo base, de 131.072 tokens, mantida sem alterações. Ele emite um bloco `<think>…</think>` antes de responder e foi avaliado com decodificação greedy em um orçamento de 2.048 tokens.
A pilha de pós-treinamento é a parte que a webAI realmente quer que você examine, e ela é incomumente bem documentada para um modelo desse tamanho: um ajuste fino supervisionado com LoRA de rank 64 em um corpus sintético de lógica formal, destilação multicaminho para produzir vários traços de raciocínio por prompt, fusão de checkpoints no espaço de parâmetros em vez de pegar o checkpoint final, uma interpolação WiSE-FT em α = 0,15 mesclada de volta em direção à base pré-treinada com TIES e DARE-SLERP e, por fim, um estágio GRPO ponderado por entropia — a webAI o chama de MGPO — contra um verificador programático, executado até o passo 2580, que é o checkpoint que foi lançado.
O artefato publicado é a política mesclada, e não um adaptador LoRA, o que é o detalhe prático: você pode executá-lo como um modelo autônomo, em bf16 a 6,82 GiB, ou como um Q4_K_M GGUF a 2,09 GiB em uma CPU ou 4 GB de VRAM. Essa é a alegação de que "roda em um laptop", e é a única alegação em toda a ficha que é trivialmente verificável e, portanto, digna de confiança.
A comparação do Qwen3-8B, leia com atenção.
A manchete que a webAI coloca no modelo é que o TwIL-LM3-Pro alcança o topo das suas próprias linhas de resumo do Track A com 3,66B de parâmetros. As quatro linhas de resumo são um macro gate de 0,5539, strict-7 de 0,2879, uma média de seis faixas de 0,5389 e macro_primary de 0,5875. Contra o Qwen3-8B, o macro gate é 0,5539 versus 0,5336 — e a própria ficha do modelo escreve a frase que uma página de marketing teria excluído: "a vantagem do gate sobre o Qwen3-8B é de 0,020 — menor que o ruído de amostragem em n = 200 por faixa — então interprete esse resultado como paridade, não como uma vitória."
Essa é a linha mais importante da página. O próprio enquadramento da webAI sobre o resultado principal é o de que se trata de um empate. Onde a comparação não é um empate:
• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, e esta linha não usa crédito de correspondência flexível em lugar nenhum, portanto não pode ser produzida por sorte de formatação.
• MCQ estrito — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, a maior lacuna de faixa entre as onze linhas reportadas.
• Indução de regras — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.
• Ajuste ao corpus — a menor perplexidade de `lm_corpus` entre todos os braços, em 2.3130, com o Qwen3-8B em 2.5478.
• Parâmetros — 3,66B vs aproximadamente 8B, que é a base inteira da alegação de "menos da metade dos parâmetros".
Dois avisos pesam sobre essa tabela, e a webAI declara ambos. As gerações do Track A do TwIL-LM3-Pro têm em média 1.902 tokens e 24,2% delas atingem o limite de comprimento, contra 564 tokens do seu próprio antecessor, o TwIL-LM3; a palavra da ficha para a diferença resultante é "indicativa, não exata". E os números de throughput da tabela foram medidos numa sessão posterior, com uma versão mais recente do vLLM (0.19.1) do que as colunas de comparação (0.11.2), de modo que as linhas de tokens por segundo são comparáveis entre si e apenas aproximadamente comparáveis com o restante.
Onde não vence
No conjunto de avaliação reservado, o cartão do modelo é direto: "TwIL-LM3-Pro não lidera." A média macro de 10 conjuntos de dados é 0,7901, estatisticamente em linha com seu próprio modelo base em 0,7942, e bem atrás do Qwen3-8B em 0,8493 e do gpt-oss-120b em 0,8689. Sua média macro de 14 conjuntos de dados, de 0,7425, supera a do modelo base em 0,0093, e todo esse ganho vem do BBH-logic (0,9540 contra 0,9013 do base) — remova essa única linha e o modelo passa a ter média de 0,7263 nos treze restantes, abaixo do VibeThinker-3B, de 0,7350.
Há três pontos genuinamente fracos dentro da especialização, todos divulgados: correspondência exata da tradução de FOL em 0,0100, `procedural` em 0,1200 estrito, e correspondência exata de análise semântica em 0,0000. A indução de regras analisa apenas 56,5% das suas saídas. E o modelo é verboso por construção — cerca de 792 tokens por resposta do Track B, contra 482 do seu antecessor — o que é um custo, não uma capacidade.
Nada disso é uma crítica ao lançamento. É assim que um model card bem escrito se parece, e é por isso que os números aqui podem ser citados.
Três maneiras de obtê-lo, e uma delas é um formulário
A situação da distribuição é a verdadeira notícia da semana e vale a pena declará-la com precisão.
Os pesos estão no Hugging Face, sem restrições de acesso, sob a webAI Non-Commercial License ver. 1.0 — que permite pesquisa e uso pessoal e exige um acordo separado com a webAI para implantação que gere receita. Essa licença é a restrição vinculante de todo o lançamento, e é por isso que o TwIL-LM3-Pro não é um modelo que a maioria das equipes de produto possa simplesmente adotar.
A webAI afirma que a família ultrapassou meio milhão de downloads em um mês, número que a empresa publicou em seu próprio anúncio e que não foi auditado de forma independente. Downloads de um checkpoint gratuito e não comercial não são um proxy para uso em produção, e a webAI não os apresenta como tal.
A plataforma do próprio fornecedor, por sua vez, não é um endpoint público. A webAI descreve-se como uma plataforma empresarial que traz IA para os seus dados, com uma aplicação de modelo local-first, e a sua via comercial é um acordo empresarial, em vez de uma tabela de preços publicada por token. O TwIL-LM3-Pro também está ausente das grandes plataformas de inferência de terceiros que indexam checkpoints abertos — nós verificamos, e ele também não está no catálogo do OrcaRouter — então a resposta prática para "onde eu chamo isso a partir de uma API" é que, no momento, na maioria das vezes, você não o chama; você o baixa.
O terceiro canal é o novo. O repositório `TwIL-LM3-Pro-LiteRT-LM` surgiu em 1 de outubro de 2026, trazendo artefatos `.litertlm` e etiquetado para Android e iOS — o próprio empacotamento de runtime LiteRT-LM da webAI, com os mesmos pesos. Se essa build herda a licença não comercial é a pergunta que precisa ser respondida antes de planejar em torno dela, porque o repositório pai a herda.
Por que um especialista em lógica formal deste porte vale a pena acompanhar
A razão pela qual este lançamento continua a ressurgir não é a tabela de benchmarks. É que a webAI publicou todo o pipeline, executou a receita idêntica em cinco modelos base diferentes e relatou o que aconteceu. A tabela de comparação da família regista um movimento do macro-gate do Track A de +0,012 a +0,145, dependendo do modelo base, com a suíte held-out a manter-se dentro de ±0,013 — a versão documentada de «isto generaliza». O único coeficiente escolhido por modelo é o peso de merge, ajustado com base no desempenho held-out: 0,15 para o SmolLM3, 0,20 para o Granite e a base TwIL, 0,50 para o VibeThinker-3B.
Essa é uma receita reutilizável para transformar um pequeno modelo generalista em um especialista restrito sem destruir o que ele já sabia, publicada com os resultados negativos anexados. Para quem precisa de rótulos de implicação textual, formalização de enunciados em Lean ou análises semânticas em vez de prosa fluente, um GGUF de 2,09 GiB que roda offline, sem taxa por chamada e sem dependência de rede, é uma proposta diferente de qualquer modelo hospedado, independentemente do que diga a tabela Elo.
A questão em aberto é se os pesos alguma vez surgirão sob uma licença que permita uso comercial, e se o port para LiteRT-LM será lançado com a mesma restrição. Até lá, o TwIL-LM3-Pro é um artefato de pesquisa com um cartão de modelo incomumente honesto — o que não é pouca coisa.

Se você precisar desse recurso em produção hoje
Num contexto de implementação comercial, o obstáculo é a licença e não os benchmarks, e o substituto prático é um modelo alojado para o qual pode encaminhar pedidos. É essa a camada em que a OrcaRouter opera: um endpoint compatível com a OpenAI à frente de mais de 200 modelos, ao preço de tabela do fornecedor e sem qualquer margem acrescentada, de modo que um corte de preço do fornecedor entra em vigor no próprio dia, e não após um ciclo de contratação. Para os poucos casos em que um pequeno checkpoint de lógica formal encaixa verdadeiramente — etiquetagem em lote offline, uma passagem de inferência em ambiente isolado, um passo de pré-processamento cujo resultado é um rótulo e não texto corrido —, a divisão honesta é executar o modelo local onde a tarefa é texto-para-rótulo e encaminhar o raciocínio envolvente, a expansão de prompts e o controlo de qualidade para modelos alojados com a mesma chave.
Uma ressalva que vale a pena repetir especificamente nesta seção: com failover automático, você também pode apontar para um modelo antes de confiar nele em um caminho de produção, e fazer rollback editando uma regra de roteamento em vez de reimplantar. Esse é o padrão que se encaixa em um modelo como este quando seu status comercial ainda não está definido.

O que assistir
Três coisas mudariam esta história. Uma mudança de licença, ou um porte claramente licenciado do LiteRT-LM, moveria o TwIL-LM3-Pro de artefato de pesquisa para componente implantável. A aparição em uma grande plataforma de inferência hospedada lhe daria uma API real. E uma avaliação independente — qualquer pessoa além da webAI executando o harness do Track A — nos diria se a vantagem de strict-7 sobre o Qwen3-8B sobrevive ao ser medida por alguém que não construiu o harness. Nenhuma das três aconteceu ainda, e o cartão do modelo é honesto o suficiente para que você veja exatamente o que precisaria se manter para que elas importassem.

