
Perceptron Mk1.5 vs Gemma 4 12B: Um responde em frases, o outro responde em coordenadas
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Aqui está o número que deveria te fazer parar primeiro: o Perceptron Mk1.5 é um modelo criado para vídeo e agentes incorporados, e sua janela de contexto é de 36.864 tokens. O Gemma 4 12B é um generalista de pesos abertos de 12B com uma janela de 256K. No eixo que a maioria das pessoas usa para comparar modelos de visão — quanta filmagem posso entregar a ele —, o modelo menor, fechado e de propósito específico perde por um fator de sete para o que pode ser baixado. Essa inversão não é um defeito de nenhum dos dois produtos. Ela diz para que cada um foi realmente criado, e as duas tarefas estão mais distantes do que sugere a linha "entrada multimodal" compartilhada em suas fichas técnicas.
O Perceptron Mk1.5 é o modelo de raciocínio corporificado que a Perceptron lançou em 25 de setembro de 2026, o sucessor do Perceptron Mk1 de maio, recebendo texto, imagens, vídeo e áudio e devolvendo texto mais geometria interpretável por máquina. O Gemma 4 12B é o modelo multimodal de pesos abertos sem encoder, com 11,96B, do Google DeepMind, lançado em 3 de junho de 2026 sob Apache 2.0, que recebe texto, imagem, áudio e vídeo e devolve texto. Ambos são baratos, ambos leem um fluxo de câmera, e apenas um deles entregará ao seu controlador uma caixa delimitadora sem uma segunda etapa de parsing. A escolha entre eles é uma escolha sobre o que tem de retornar.
O que cada um foi feito para retornar
Coloque os dois lado a lado e a diferença não é a precisão. É o tipo de saída. Pergunte ao Gemma 4 12B onde está a empilhadeira e você recebe uma frase e, na maioria das aplicações, essa frase é o produto — uma descrição, um resumo, uma resposta a uma pergunta sobre uma foto. Pergunte ao Perceptron Mk1.5 e, junto com sua prosa, você pode pedir um ponto, uma caixa delimitadora, um polígono, um clipe, ou um <track> elemento que carrega uma observação espacial e o carimbo de data/hora ao qual pertence. Um clipe de 60 segundos retorna como uma sequência de posições ao longo do tempo, em vez de um único palpite médio sobre a cena.
Esse é todo o argumento para a existência do Mk1.5, e vale a pena ser preciso sobre por que isso importa. Uma descrição de uma cena é um artefato finalizado. Uma coordenada é uma entrada para outra coisa — um planejador de preensão, uma verificação de defeitos, uma trilha de auditoria com carimbo de data e hora. Se o seu código downstream tiver de ler prosa e inferir a posição a partir dela, você construiu um parser entre dois modelos, e esse parser agora é sua superfície de falha. A proposta do Mk1.5 é que a geometria chega tipada.
O contra-argumento do Gemma 4 12B não é que ele também faz isso. É que você pode ter os pesos. Apache 2.0, 11,96 bilhões de parâmetros, publicado em variantes pré-treinadas e ajustadas por instrução, rodando em hardware que você controla, com um cartão de avaliação publicado e um índice de terceiros por trás dele. Esses são tipos diferentes de ativo, e nenhum dos dois substitui o outro.
Onde os dois realmente se alinham
Menos lugares do que o rótulo “multimodal 2026” sugere, mas o terreno comum é real e vale a pena afirmá-lo precisamente porque é onde a lista de verificação de um comprador costuma começar.
• Modalidade de entrada — ambos são genuinamente de quatro modalidades. O Perceptron Mk1.5 aceita texto, imagens, vídeo e áudio (WAV, MP3, FLAC). O Gemma 4 12B aceita texto, imagem, áudio e vídeo por meio de um único caminho unificado sem encoder.
• Modalidade de saída — nenhum gera áudio ou imagens. Ambos produzem apenas texto. A diferença é que o texto do Mk1.5 pode carregar anotações espaciais estruturadas, enquanto o do Gemma 4 12B não.
• Chamada de funções — ambos oferecem suporte. O Mk1.5 expõe chamada de funções nas completaçãos de chat e aceita respostas restritas via JSON Schema e regex. O Gemma 4 12B vem com chamada de funções em sua versão ajustada por instruções e modo de pensamento configurável.
• Controle de raciocínio — o Mk1.5 substitui o antigo vision_config.enable_thinking booleano por um campo reasoning_effort que aceita high, medium, low, minimal ou none, e o padrão é high. O Gemma 4 12B expõe variantes de raciocínio e sem raciocínio que obtêm pontuações diferentes no mesmo harness porque realizam quantidades diferentes de trabalho.
• Contexto — 36.864 tokens para o Mk1.5 contra 256K para o Gemma 4 12B. Esta é a maior diferença da lista e a próxima seção é sobre isso.
• Pesos e licença — Mk1.5 é um modelo hospedado fechado com um SDK, não um download. O Gemma 4 12B é Apache 2.0, então o preço da versão hospedada é uma opção entre várias, e não a única forma de executá-lo.

A janela de 36K é uma decisão de design, não uma deficiência
Um modelo corporificado com uma janela de 36.864 tokens parece um erro até você ver o que a Perceptron construiu junto. O Mk1.5 aceita um asset_idx campo, então uma única requisição pode referenciar várias imagens ou vídeos e endereçar cada um separadamente. Ele limita o áudio a 16.384 tokens por item — a documentação da Perceptron estima isso em cerca de 21,8 minutos de fala a aproximadamente 750 tokens por minuto. E o motivo pelo qual a janela pode permanecer pequena é que a tarefa é restrita: encontrar e rastrear coisas específicas em quadros, responder sobre elas, parar.
Isso é um formato de trabalho diferente daquele do Gemma 4 12B. Uma janela de 256K serve para comportar um documento, um repositório ou uma conversa longa e raciocinar ao longo de tudo isso. A janela do Mk1.5 é um orçamento para uma única tarefa de percepção com uma resposta estruturada, e a Perceptron a dimensionou para essa tarefa, e não para um ranking. Onde a diferença pesa é no momento em que sua tarefa é "assistir a este vídeo de inspeção de 40 minutos na íntegra e me contar tudo" — uma janela de 36K não vai comportar a transcrição, os quadros e a resposta ao mesmo tempo, e a janela do Gemma 4 12B, somada à sua pontuação de recall de contexto longo, é o instrumento honesto para isso.
A segunda metade desse trade-off é a velocidade. A Perceptron relata até 4,7× mais rápido de ponta a ponta a partir da mediana de três execuções em uma única H100, com a ressalva de que 4,7× é a melhor de três medições e não o caso típico: respostas de chat passaram de 5,2 segundos para 1,1, o QA de imagem passou de 1,7 segundo para 0,51 (cerca de 3,3×), e um vídeo de 60 segundos com concorrência de oito vias passou de 19 segundos para 9,1 (cerca de 2,1×). Na carga de trabalho de vídeo que um agente incorporado realmente executa, o múltiplo honesto é cerca de dois.
Um destes foi medido por outra pessoa.

Esta é a assimetria mais clara do confronto, e não é nem de perto.
O Gemma 4 12B tem uma ficha de avaliação do fornecedor e um índice de terceiros. A ficha traz números divulgados pelo fornecedor — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 sem ferramentas 77,5, Tau2 com média de três execuções 69,0 — e um ponto fraco honesto no MRCR v2 8-needle a 128k, que fica em 43,4 e é a linha que se deve ler antes de assumir que uma janela de 256K se comporta como uma janela no extremo final. Além disso, soma-se uma medição independente: a Artificial Analysis coloca o Gemma 4 12B com um Intelligence Index de 14, classificado em 22º entre 142 modelos de sua classe, a 113,7 tokens de saída por segundo — 20º de 142 em velocidade — com preço de tabela de US$ 0,10 para entrada e US$ 0,30 para saída por milhão de tokens.
O Perceptron Mk1.5 não tem nada disso. Não há entrada no índice da Artificial Analysis nem pontuação de arena para o Mk1.5 ou para o Mk1, pelo que todos os números de capacidade que existem para este modelo foram produzidos pela empresa que o vende. Esse conjunto é específico, e não vago, e vale a pena analisá-lo: 0,9433 em hand_box egocêntrico, contra 0,4467 do Gemini 3.1 Pro e 0,6179 do melhor Gemini na própria execução da Perceptron; EgoSchema 80,40 contra 81,20 do mesmo concorrente, uma perda de 0,80 ponto no benchmark de compreensão ampla, com uma alegada vantagem de 12% no subconjunto EgoSchema-hard, em 63,75; 0,647 de centre-F1 e 0,628 de point-HOTA no Molmo2-Track; DailyOmni 74,67 e AVHBench 80,56 no lado do áudio. O padrão nesses números — decisivo em geometria refinada, praticamente empatado ou ligeiramente atrás na compreensão geral de vídeo — é coerente e corresponde à história do produto. Mas um benchmark de um fornecedor sobre o seu próprio modelo é uma alegação, e os dois modelos deste artigo não são descritos com o mesmo tipo de evidências.
Uma linha nessa tabela merece um aviso específico. A comparação de tracking do Perceptron lista o Qwen3-VL-8B com 0,180 de centre-F1, com origem no artigo desse modelo, ao lado de números medidos para o seu próprio modelo, e o emparelha com o Qwen3.5-27B em 0,530 e 0,476 em diferentes checkpoints e configurações de avaliação. Um número de artigo numa coluna de números medidos não é uma linha comparável em pé de igualdade, e é o tipo de linha que acaba sendo citada sem a sua proveniência. O mesmo cuidado se aplica, inversamente, aos posts do Mk1.5 com 56,0 no LiveVQA-W com ferramentas ativadas — esse número vem de uma votação por maioria de quatro amostras, enquanto o 53,2 com o qual ele é comparado para o Gemini 3.8 Flash com grounding de busca não vem disso, e a votação por maioria sobre quatro amostras é uma técnica legítima que favorece uma pontuação em relação a uma única passagem greedy.
Calcular o custo de uma carga de trabalho real
As tabelas de preços estão mais próximas entre si do que os produtos. O Perceptron Mk1.5 custa US$ 0,15 por milhão de tokens de entrada e US$ 1,50 por milhão de tokens de saída, com entrada em cache a US$ 0,0375 — exatamente um quarto da tarifa padrão de entrada, e mais barato por token em cache do que os US$ 0,10 de entrada padrão do Gemma 4 12B. O Gemma 4 12B está listado a US$ 0,10 e US$ 0,30 no harness de terceiros que o mede, e é Apache 2.0, então a auto-hospedagem elimina totalmente o custo marginal se você tiver o hardware.
Duas coisas complicam uma comparação direta e apontam em direções opostas. Primeiro, no Mk1.5, o reasoning_effort tem como padrão high, o que significa que cada chamada que você não configura está comprando o caminho de raciocínio mais caro que o modelo oferece; reduzir para medium ou low é uma mudança de uma linha com efeito direto na fatura, e é o experimento mais barato do lançamento. Segundo, o Gemma 4 12B permite desativar completamente a etapa de pensamento, o que muda tanto a fatura quanto a latência, e em uma tarefa fixa como classificação em nível de quadro, uma passada sem raciocínio costuma ser a correta.
Faça as contas com algo real: um pipeline de visão processando 40.000 quadros por dia, a cerca de mil tokens de entrada de imagem cada. Isso dá 40M de tokens de entrada por dia. Com a taxa de entrada de $0.15 do Mk1.5, com quadros em cache quando a mesma cena se repete, você fica na casa dos poucos dólares por dia com entrada — barato por qualquer padrão. O Gemma 4 12B, a $0.10 de entrada, é ainda mais barato, e gratuito na margem se você hospedar por conta própria. Nenhum dos modelos é caro. A decisão aqui não é uma decisão de orçamento; é uma questão de saber se você precisa de coordenadas, de uma janela de 256K, ou de ambos.
Chamando ambos sem uma segunda integração

O obstáculo prático para realizar esta comparação não é o preço — é que o Perceptron Mk1.5 e o Gemma 4 12B não estão no mesmo catálogo. Nenhum dos dois está roteado no OrcaRouter hoje: as entradas do Gemma 4 que servimos são as variantes 31B Instruct e 26B-A4B, e o Mk1.5 não tem rota alguma, então a orientação honesta é acessar o Mk1.5 pela própria API do fornecedor em api.perceptron.inc — pip install "perceptron>=0.4.0", chave em PERCEPTRON_API_KEY — e o Gemma 4 12B, seja por meio de um host de terceiros ou servindo você mesmo os pesos Apache-2.0.
O que uma camada de roteamento realmente faz nesta situação é a decisão que você ainda não tomou. Se a saída estruturada do Mk1.5 é o que sua aplicação precisa e a janela do Gemma 4 12B é o que sua outra carga de trabalho precisa, essas são duas integrações e dois domínios de falha; colocá-las atrás de um endpoint compatível com OpenAI com failover automático significa que um soluço de um provedor em qualquer um dos lados se degrada em um fallback em vez de um job com falha, e uma regra de roteamento pode enviar o trabalho de geometria e o trabalho de contexto longo para modelos diferentes sem que sua aplicação saiba qual é qual. Quando um fornecedor muda sua tabela de preços, um roteador pass-through cobra o preço de tabela do provedor com nada adicionado por token, então a mudança entra em vigor no mesmo dia, em vez de no seu próximo ciclo de cobrança. A DSL de roteamento também é como você montaria uma comparação — uma parcela do tráfego real para cada modelo, medida nos seus próprios frames, em vez de um argumento de benchmark.
Qual deles você realmente quer
Use o Perceptron Mk1.5 se a resposta precisar ser legível por máquina. Se você estiver conduzindo algo, ou registrando algo em que a posição e o tempo são o ponto central, nenhuma quantidade de janela de contexto extra substitui uma coordenada tipada, e o Mk1.5 é o único modelo deste par que produz uma. Vá com os olhos abertos para três coisas: o alto padrão predefinido de raciocínio, e o fato de que cada número de capacidade atribuído a ele é do próprio fornecedor.
A maneira mais barata de resolver isso é encaminhar uma parcela do tráfego real para cada um e medir nos seus próprios frames; ambos ficam atrás de um endpoint compatível com OpenAI no OrcaRouter, que é o que faz um teste lado a lado ser uma linha de configuração em vez de uma segunda integração.
Escolha o Gemma 4 12B se precisar reter muito material, se precisar dos pesos, ou se precisar justificar a escolha a alguém que não aceita benchmarks de fornecedores pela fé. Ele tem um índice independente, uma ficha de avaliação publicada, licenciamento Apache 2.0 e uma janela sete vezes maior — e vai descrever uma cena em vez de medi-la. Essa última oração é a decisão inteira. Um desses modelos é um generalista que você pode possuir e auditar; o outro é um especialista que você aluga porque devolve geometria, e o fato de o especialista ter a janela menor e nenhuma pontuação de terceiros não é uma contradição. É assim que uma ferramenta construída de forma restrita se parece vista de fora.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
