Um cartão de título gerado com o cabeçalho "TwIL-LM3-Pro vs Qwen 3.8", subtítulo "A Comparação que o Cartão Realmente Executou", com dois cartões arredondados lendo "TwIL-LM3-Pro - 3,66B, local, não comercial" e "Qwen3.8-Max - hospedado, contexto de 1M, $2 / $6". Uma linha de rodapé diz "webAI medido em relação ao Qwen3-8B, não ao Qwen3.8-Max." O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: Uma incompatibilidade, e a comparação que realmente importa

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

TwIL-LM3-Pro e Qwen3.8-Max não pertencem à mesma página, e o motivo não é que um seja melhor. É que o argumento publicado a favor do modelo de lógica formal de 3,66B da webAI se baseia numa comparação com um modelo Qwe​n — e o modelo Qwe​n em questão não é aquele que a manchete nomeia. As tabelas Track A e Track B da webAI comparam TwIL-LM3-Pro com Qwen3-8B, um modelo denso de 8B com pesos abertos de uma geração anterior, e não dão atenção alguma a Qwen3.8-Max: não porque TwIL-LM3-Pro venceria, mas porque Qwen3.8-Max é o sistema hospedado carro-chefe da Aliba​ba, um modelo esparso de mistura de especialistas reportado com 2,4 trilhões de parâmetros e cerca de 95 bilhões ativos por token, uma janela de contexto multimodal de um milhão de tokens, e uma tabela de preços de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. Colocar um GGUF de laptop de 2,09 GiB ao lado disso é um erro de categoria disfarçado de página de comparação.

Então, este texto faz duas coisas. Ele corrige a comparação que os resultados de busca interpretam mal e, em seguida, responde à versão da pergunta que um leitor provavelmente realmente tem: dado que um modelo de fronteira está a uma chamada de API de distância e um especialista em lógica formal roda na sua própria máquina, quando cada um merece o seu lugar?

O modelo que a placa realmente mediu

A comparação relevante é com o Qwen3-8B, e o próprio resumo da webAI sobre isso é mais modesto do que os relatos de segunda mão sugerem. O gate in-macro do TwIL-LM3-Pro é 0,5539 contra 0,5336 do Qwen3-8B, e o card do modelo contém a frase que uma página de marketing teria removido: a vantagem no gate é de 0,020, "menor que o ruído de amostragem em n = 200 por lane — então leia esse como paridade, uma vitória."

Onde a comparação não é cara ou coroa: strict-7, 0,2879 contra 0,2093, uma linha que não usa crédito de correspondência flexível em lugar nenhum e, portanto, não pode ser fabricada por formatação. Múltipla escolha estrita, 0,4100 contra 0,0000. Indução de regras, 0,4195 contra 0,3680. E a proporção de parâmetros — 3,66B contra cerca de 8B — que é toda a alegação de "menos da metade do tamanho".

No conjunto de testes hold-out, webAI é ainda mais direto: "TwIL-LM3-Pro não o lidera." A macro de dez conjuntos de dados é 0,7901, igual à sua própria base Granite e atrás do 0,8493 do Qwen3-8B. Um pequeno especialista que empata com um modelo geral duas vezes maior em lógica formal e perde para ele em capacidade geral é o formato esperado, e reportá-lo dessa forma é o que torna o número strict-7 credível.

O que o Qwen3.8-Max realmente é

O Qwen3.8-Max não é uma iteração do Qwen3-8B. É o nível premium da Alibaba e, na página de catálogo do OrcaRouter, aparece como `qwen/qwen3.8-max` com data de lançamento em 3 de agosto de 2026, uma janela de contexto de um milhão de tokens, entrada de texto, imagem e vídeo, saída de texto e suporte total a modo de pensamento, chamada de funções, ferramentas integradas e saídas estruturadas. Ele é disponibilizado em painéis compatíveis com OpenAI, compatíveis com Anthropic e nativos em cinco regiões, e o modo de pensamento é alternado com o parâmetro `enable_thinking`. A tarifa é de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída.

Um snapshot datado, `qwen/qwen3.8-max-0902`, foi publicado em 2 de setembro de 2026 com as mesmas capacidades e o mesmo preço, publicado especificamente para que o comportamento possa ser fixado em execuções reproduzíveis. Se você está desenvolvendo com o Qwen3.8-Max para algo de longa duração, esse identificador de snapshot é o que deve ser colocado na configuração, em vez do alias móvel.

Observe o que está ausente nessa descrição: uma contagem de parâmetros que você possa baixar, um arquivo de licença e qualquer caminho para executá-lo por conta própria. O Qwen3.8-Max é um produto hospedado. A cobertura jornalística no lançamento informou pesos abertos prometidos para a semana seguinte, e o enquadramento da techsy — "2,4T de parâmetros, contexto de 1M, ainda sem pesos" — é o estado que um leitor deve verificar em vez de presumir, porque uma promessa noticiada no lançamento não é um checkpoint publicado.

Quatro dimensões, e nenhuma delas chega perto.

• Parâmetros — TwIL-LM3-Pro 3,66B denso, todos ativos vs. Qwen3.8-Max reportado em 2,4T no total em um design esparso de mistura de especialistas com cerca de 95B ativos por token. Três ordens de magnitude no total, duas nos ativos.

• Onde é executado — TwIL-LM3-Pro é baixado como bf16, com 6,82 GiB, ou como um Q4_K_M GGUF de 2,09 GiB para CPU ou 4 GB de VRAM vs Qwen3.8-Max, que existe apenas como endpoint hospedado.

• Contexto — TwIL-LM3-Pro 131.072 tokens, herdado de sua base Granite e nunca validado além de 8.192 em sua própria avaliação versus Qwen3.8-Max a 1.000.000 tokens.

• Modalidades — texto como entrada, texto como saída vs. texto, imagem e vídeo como entrada, texto como saída.

• Licença — Licença Não Comercial webAI ver. 1.0, com um acordo separado exigido para uso que gera receita, versus uma API comercial hospedada sem pesos para licenciar.

• Custo — TwIL-LM3-Pro: sem taxa por token e sem endpoint hospedado, em comparação com os US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída do Qwen3.8-Max, com uma taxa de entrada em cache de cerca de US$ 0,25 por milhão.

Um modelo de 3,66B é barato porque é pequeno, e é pequeno porque faz uma só coisa. O Qwen3.8-Max é caro porque é geral e porque é hospedado. Nenhum dos dois preços é um veredito.

A pergunta por trás da pergunta

Remova a confusão de nomenclatura e resta uma questão de engenharia, e é uma boa questão: se um modelo hospedado de fronteira consegue raciocinar sobre lógica formal, por que sequer rodar um especialista restrito?

Três razões se sustentam. A primeira é a licença e a rede: um grupo de pesquisa não comercial, um ambiente isolado da rede (air-gapped), ou uma passagem de rotulagem em lote que tem de correr num portátil sem conectividade não pode chamar um endpoint alojado, e um GGUF de 2,09 GiB responde diretamente a essa restrição. A segunda é a estrutura de custos em função do volume — um trabalho de rotulagem de lógica formal sobre um milhão de entradas curtas paga por token num modelo de fronteira alojado e não paga nada além do tempo de execução num modelo local. A terceira é a forma da saída: o TwIL-LM3-Pro foi ajustado para emitir estruturas verificáveis por máquina em vez de prosa, e para rótulos de acarretamento e análises semânticas isso é um pipeline menor do que pedir a um modelo geral e analisar a sua resposta.

Em contrapartida, o caso do Qwen3.8-Max é simples. Ele vê imagens e vídeos, comporta um milhão de tokens, lida com ferramentas e saída estruturada por meio de uma API documentada, e tem benchmarks publicados e avaliação independente por trás. Nada em um especialista restrito ameaça isso; os dois respondem a conjuntos de restrições diferentes.

A stack que usa ambos

O padrão que sobrevive ao contato com um pipeline real é de dois níveis, e não é exótico. Um modelo hospedado de fronteira lê a entrada bagunçada — uma página de livro didático digitalizada, uma fonte de modalidade mista, uma especificação longa — e a transforma em texto estruturado limpo. Esse texto vai para um modelo local de lógica formal cujo trabalho inteiro é emitir um rótulo, um parse ou uma crítica em Lean no hardware que você possui. O veredito sobre se esse segundo nível vale seu custo de manutenção é a comparação no estilo strict-7, não o gate, porque um especialista conquista seu lugar nas faixas em que a métrica não tem espaço para pontuação generosa.

Também há uma pista que vale a pena extrair do próprio card do webAI: o pipeline foi executado em cinco modelos base diferentes, com apenas o coeficiente de merge variando por modelo, e o webAI relata o resultado para cada um, inclusive os que menos se moveram. Isso é uma afirmação mais forte sobre uma receita do que qualquer linha isolada de benchmark, e é o tipo de evidência que indica que um método generaliza, em vez de que um checkpoint específico teve sorte.

O que é roteável aqui, e o que não é

Este é o único lugar onde os dois modelos aparecem honestamente na mesma frase. O Qwen3.8-Max é uma rota: é servido através do OrcaRouter como `qwen/qwen3.8-max`, e porque a plataforma repassa o preço de tabela do provedor com 0% de margem adicionada, a tarifa de $2,00/$6,00 é do próprio fornecedor e um corte de preço do fornecedor entra em vigor no mesmo dia, em vez de após um ciclo de contrato. O snapshot datado `qwen/qwen3.8-max-0902` é roteável ao lado dele, então fixar um id de modelo reproduzível é uma escolha de configuração, e não um relacionamento separado com o fornecedor.

TwIL-LM3-Pro não é uma rota, e seria desonesto insinuar o contrário. Ele tem licença não comercial, sem endpoint hospedado publicado, e a forma atual de usá-lo é baixar o checkpoint e executá-lo por conta própria. O que o roteador faz por um pipeline construído em torno dele é o trabalho de texto ao redor — a expansão do prompt, a geração do corpus, a etapa de filtragem — que roda no mesmo endpoint compatível com OpenAI para mais de 200 modelos, então trocar o modelo que gera dados de avaliação pelo modelo que os avalia não custa nada além de uma edição de configuração, com failover automático para manter um lote longo ativo quando um provedor falha temporariamente.

O uso mais defensável dos dois em conjunto é exatamente esse: uma camada de fronteira roteável a fazer raciocínio geral e extração estruturada, um especialista baixado a fazer o julgamento de lógica formal, e uma única chave para tudo o que fica pelo meio.

Qual modelo comparar e quando

Se você está avaliando pequenos modelos de lógica formal, o Qwe​n que vale a pena colocar ao lado do TwIL-LM3-Pro é o Qwen3-8B, e a webAI já publicou essa comparação com as ressalvas anexadas. Se você está escolhendo onde executar uma carga de trabalho de produção, o Qwen3.8-Max é uma decisão totalmente diferente — um sistema de fronteira hospedado, com tabela de preços e sem download — e a pergunta certa não é qual é melhor, mas qual restrição é vinculante: conectividade e licença de um lado, contexto, modalidade e escala do outro. A maioria dos sistemas reais acaba precisando das duas respostas.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente