Uma cartela de título gerada para uma comparação entre Perceptron Mk1.5 e Qwen 3.8, com o título "Perceptron Mk1.5 vs Qwen 3.8" e o subtítulo "Os olhos e o planejador não são o mesmo modelo", e três cartões com os dizeres "Mk1.5: 36.864 tokens, coordenadas na saída", "Qwen 3.8: MoE de 2,4T, AA Index 40" e "A costura: frames para um, planos para o outro", com a nota de rodapé "Índice do Qwen 3.8 segundo a Artificial Analysis."
Guides & Insights

Perceptron Mk1.5 vs Qwen 3.8: O robô precisa dos dois, e nenhum deles é um substituto

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um robô que precisa pegar algo precisa de duas coisas de um modelo, e nenhum modelo isolado nesta combinação oferece ambas. O Perceptron Mk1.5 retorna geometria: dados quadros de vídeo, ele consegue devolver um ponto, uma caixa, um polígono ou um elemento <track> com marcação temporal, e sua janela de contexto é de 36.864 tokens. Qwe​n 3.8 — o nome que corresponde ao núcleo Qwen3.8-2.4T-A95B de pesos abertos do fornecedor — é um modelo de raciocínio de mistura de especialistas com 2,4 trilhões de parâmetros, com uma janela nativa de 262K que se estende rumo a um milhão, e é somente texto, então não consegue olhar para os quadros de forma alguma. Um deles é uma camada de percepção que custa US$ 0,15 e US$ 1,50 por milhão de tokens; o outro é um núcleo de raciocínio que custa cerca de treze vezes mais na entrada e quatro vezes mais na saída, e tem uma pontuação independente de 40 no Artificial Analysis Intelligence Index, enquanto o modelo de percepção não tem pontuação independente em lugar nenhum.

Colocados lado a lado como produtos concorrentes, eles perdem um para o outro em direções opostas e a comparação não produz nada de útil. Colocados lado a lado como as duas metades de um único pipeline, eles explicam quase todas as decisões de custo e confiabilidade em uma pilha corporificada: onde os frames são interpretados, onde o plano é traçado e o que acontece com a sua conta quando a metade de raciocínio escreve mais tokens do que a tarefa exige.

A divisão que faz com que esse emparelhamento faça sentido

O Perceptron Mk1.5 foi lançado em 25 de setembro de 2026 como sucessor do Perceptron Mk1, e sua função é definida de forma restrita. Ele aceita texto, imagens, vídeo e áudio, e retorna texto mais anotação estruturada opcional — pontos, caixas delimitadoras, polígonos, clipes e rastreamentos. A saída <track> carrega tanto uma observação espacial quanto o carimbo de data/hora ao qual pertence, de modo que um clipe de 60 segundos volta como posições ao longo do tempo, em vez de um único palpite médio. Um campo asset_idx permite que uma única requisição trate várias imagens ou vídeos separadamente, que é o que uma comparação entre quadro de referência e quadro ao vivo precisa. Respostas restritas vêm em duas variedades, JSON Schema e regex, e o ponto principal de ambas é que a saída seja tipada.

Qwen 3.8 é o tipo oposto de instrumento. O núcleo de 2,4T é um MoE de granularidade fina — 92 camadas, 512 especialistas por camada, com 10 roteados mais um compartilhado, e 69 dessas 92 camadas em atenção linear — e é assim que uma arquitetura desse tamanho alcança seu contexto longo. Onde ele é forte é no raciocínio ao longo de muito texto: análise complexa em várias etapas, derivações longas, planejamento agêntico. Onde ele é incapaz é no lado da entrada. O núcleo aberto é somente texto, e seu raciocínio não pode ser desligado: toda resposta começa com um bloco de pensamento, quer você quisesse um ou não.

Isso não é uma deficiência de um modelo de raciocínio; é uma deficiência de um modelo de percepção, e o Qwen 3.8 não é um modelo de percepção. Coloque os dois em sequência e o desenho fica óbvio — o Mk1.5 responde “onde está a empilhadeira e quando ela se moveu”, o Qwen 3.8 responde “dado isso, o que o braço deve fazer”. Nenhuma das perguntas pode ser respondida pelo outro modelo.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Qwen 3.8 - the scoreboard', comparing six dimensions: role in a stack (perception, frames to geometry vs reasoning, text to plans); scale (hosted perception API vs 2.4T total / 95B active MoE); context (36,864 tokens vs 262K native, to roughly 1M); input (text, image, video, audio vs text only on the open core); price ($0.15 in / $1.50 out per 1M tokens vs $2.00 in / $6.00 out); and independent score ('none yet' vs AA Index 40 of 115). Footnoted that the Qwen 3.8 index is per Artificial Analysis and that all Mk1.5 figures are vendor-reported.

Quanto custa cada metade, às tarifas que realmente são cobradas

• Entrada — Perceptron Mk1.5 $0,15 por milhão de tokens. Qwen 3.8 $2,00 por milhão na build hospedada que o harness independente mede, com um desconto de cache de 88% aplicado, o que leva um acerto de cache a aproximadamente $0,24.

• Saída — Mk1.5 US$ 1,50 por milhão. Qwen 3.8 US$ 6,00 por milhão.

• Cache — a entrada em cache do Mk1.5 custa US$ 0,0375 por milhão, um quarto fixo de sua tarifa padrão de entrada. O desconto do Qwen 3.8 é percentual, mas maior, de 88%, então sua tarifa em cache é a mais barata das duas em termos absolutos, e sua tarifa sem cache é mais de dez vezes a do Mk1.5.

• Custo por tarefa concluída — é aqui que a classificação se inverte. A Artificial Analysis estima o custo por tarefa do Índice de Inteligência do Qwen 3.8 em US$ 2,16, o 32.º entre 115 na sua categoria e avaliado com quatro de quatro unidades no quesito custo — barato por tarefa concluída, apesar de tokens caros, porque o modelo gerou 170M tokens de saída ao longo das execuções do índice, contra uma concorrência que divaga ainda mais. O Mk1.5 não tem nenhum valor equivalente publicado por ninguém.

• Contexto — 36.864 tokens para o Mk1.5, em comparação com 262K nativos para o núcleo Qwen, extensível para um milhão com a configuração de serving correta.

• Controle de raciocínio — Mk1.5 expõe reasoning_effort como high, medium, low, minimal ou none e o padrão é high. O Qwen 3.8 mantém o pensamento sempre ativado, então você paga pelos tokens de pensamento em cada chamada.

Leia essa lista duas vezes, porque os dois modelos se invertem em termos de custo. Por token, o Mk1.5 é drasticamente mais barato. Por tarefa concluída em um benchmark independente, o Qwen 3.8 é medido como barato e o Mk1.5 não é medido. Essas duas afirmações só são contraditórias se você presumir que eles estão executando o mesmo trabalho, e não estão.

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning via reasoning_effort, function calling on chat completions, and constrained JSON Schema and regex responses) and the Pricing table below it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Aqui, as evidências apontam no sentido contrário.

Na maioria das comparações deste lote, o lado dos pesos abertos é o que traz uma pilha de números divulgados pelo fornecedor, e a API fechada é a que traz uma página de terceiros. Aqui a situação se inverte, e vale enunciar essa inversão justamente porque ela muda o que você pode e o que não pode verificar.

Qwen 3.8 tem medição independente. O Artificial Analysis Intelligence Index coloca o núcleo de 2,4T em 40, classificado em 5º lugar entre 115 modelos de sua categoria no momento em que este texto foi escrito, com uma velocidade de saída de 39,6 tokens por segundo — 56º de 115, o que fica no meio do pelotão e vale a pena saber antes que alguém planeje um loop interativo em torno dele. As revisões do índice mudam entre snapshots, e a forma honesta de interpretar qualquer um desses números é como indicativos, mas o ponto continua de pé: alguém fora da Alibaba rodou esse modelo e publicou um número.

O Perceptron Mk1.5 não tem nada disso. Não há registro na Artificial Analysis nem pontuação de arena para o Mk1.5 ou seu antecessor, então todos os números de capacidade existentes foram produzidos pela Perceptron sobre o modelo da própria Perceptron. Esse conjunto é excepcionalmente específico, o que é um ponto a seu favor — 0,9433 em hand_box egocêntrico contra 0,4467 do Gemini 3.1 Pro na própria execução do fabricante; EgoSchema 80,40 contra 81,20 do mesmo concorrente, uma derrota apertada no benchmark de compreensão ampla, ao lado de uma vantagem declarada de 12% no subconjunto mais difícil do EgoSchema, em 63,75; 0,647 de centre-F1 e 0,628 de point-HOTA no Molmo2-Track — mas ser específico e ser verificado de forma independente são propriedades diferentes, e somente a segunda lhe diz o que acontecerá com as suas gravações.

Duas ressalvas ao ler a tabela do Perceptron, ambas aplicáveis a qualquer citação dela. O valor de 56,0 do LiveVQA-W com ferramentas ativadas vem de uma votação majoritária de quatro amostras, enquanto o valor de 53,2 com o qual é comparado para o Gemini 3.8 Flash com grounding do Google Search não vem de uma votação majoritária; a técnica é legítima e favorece uma pontuação em relação a uma única passagem greedy. E a linha de rastreamento lista o Qwen3-VL-8B com 0,180 centre-F1, extraído do artigo desse modelo, na mesma coluna que números medidos para uma família de checkpoints diferente. Uma cifra de artigo em uma coluna de valores medidos não é uma linha comparável em igualdade de condições, e é exatamente o tipo de linha que acaba sendo citada sem sua proveniência.

O 2.4T core não é algo que você possa chamar a partir de nós — mas sua arquitetura é.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the breadcrumb Home > Models > Qwen, the model id qwen/qwen3.8-max with text, image and video input, the $2.00 and $6.00 per million token rates and the 1,000,000-token context window stated on the page, the capabilities row covering vision, tools, JSON and reasoning, and the Qwen-published benchmark section dated 2026-08-03.

Esta é a parte da comparação em que a resposta honesta difere daquilo que a fama do modelo sugere. Qwen 3.8, como nome, é amplamente usado para designar o núcleo aberto, e o núcleo aberto é um download, não um endpoint: 2,4 TB de pesos BF16 sob a licença personalizada Qwen3.8-Max da Alibaba, publicada em agosto de 2026. Nós não o servimos, e não há nenhum provedor que o sirva do nosso lado da cerca hoje — a entrada no catálogo existe como uma página de acompanhamento anunciada, ainda não disponível, em vez de uma rota ativa.

O que servimos é a API principal, construída sobre a mesma arquitetura 2,4T. Está no ar como qwen/qwen3.8-max a US$ 2,00 e US$ 6,00 por milhão de tokens, a própria tarifa da Alibaba repassada diretamente, com nada acrescentado por token, trazendo a janela multimodal de 1M de tokens — entrada de texto, imagem e vídeo — e o mesmo design de atenção híbrida do núcleo aberto. Se a sua metade de raciocínio precisar ver alguma coisa, é essa a rota, e também é a rota em que uma mudança de tarifa do fornecedor repercute do nosso lado no mesmo dia, em vez de no seu próximo ciclo de cobrança. Ao lado dela, servimos o irmão denso da Alibaba qwen/qwen3.8-27b em nossa própria infraestrutura a US$ 0,33 e US$ 2,40 por milhão, com uma janela de 262.144 tokens e entrada de texto, imagem e vídeo, para os casos em que um raciocinador de 27B é suficiente e o índice de 40 do 2,4T é mais do que a tarefa precisa.

Conectando as duas metades sem um segundo contrato

A razão prática pela qual este emparelhamento importa mais do que o argumento do benchmark é que uma stack incorporada já é dois modelos, e o custo de integração de um terceiro é aquilo que mata silenciosamente o design. O Mk1.5 não está no nosso catálogo, por isso alcançá-lo implica a própria API do fornecedor — pip install "perceptron>=0.4.0", chave em PERCEPTRON_API_KEY, endpoint api.perceptron.inc. A metade Qwen está a uma chave de distância.

Onde um gateway conquista seu lugar é na junção. Uma regra de roteamento que envia cada quadro-com-uma-pergunta ao modelo de percepção e cada plano somente-texto ao modelo de raciocínio é uma linha de configuração quando ambos ficam atrás de um endpoint compatível com OpenAI, e o failover automático significa que um incidente de provedor em qualquer um dos lados degrada para um fallback em vez de um robô parado. Uma única API cobrindo mais de 200 modelos, com preços de tabela repassados com 0% de markup, também é a maneira mais barata de responder à pergunta que este artigo não consegue: se sua tarefa de rastreamento de objetos precisa mesmo das coordenadas do Mk1.5, ou se um modelo de visão geral com uma janela muito maior e uma pontuação independente teria sido suficiente. Rotear uma parcela do tráfego real entre candidatos e medir nos seus próprios frames custa menos do que qualquer estudo de benchmark que você poderia encomendar.

O que fazer com isto, concretamente

Se você está criando percepção em um sistema físico, o Perceptron Mk1.5 é o único modelo deste par que responde em coordenadas, e isso é uma capacidade, não uma pontuação — teste a alegação da caixa delimitadora de mão no seu próprio vídeo, defina reasoning_effort deliberadamente em vez de aceitar o padrão alto, e dimensione a janela de 36.864 tokens como uma restrição rígida, e não flexível. Se você está criando a camada de raciocínio acima dele, o Qwen 3.8 é medido onde o Mk1.5 não é, e seu custo por tarefa concluída é o número a usar como base de planejamento, e não o valor de manchete de US$ 2,00 — com a ressalva de que seu raciocínio não pode ser desativado, então uma tarefa que não precisa de uma cadeia de pensamento está pagando por uma de qualquer forma.

As equipes que erram nisso são as que tentam fazer um único modelo dar conta das duas coisas. Um especialista em percepção de 36.864 tokens não vai reter o histórico operacional, e um modelo de raciocínio de 2,4T apenas de texto nunca verá o frame. O pareamento não é um meio-termo entre dois produtos. É a verdadeira divisão do trabalho, e a pergunta útil é apenas de que lado dela fica cada uma das suas chamadas.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente