Um cartão de título principal para o Perceptron Mk1.5 com o subtítulo 'Saída espacial estruturada para agentes corporificados' e três ícones de linha planos acima do título: uma caixa delimitadora desenhada ao redor de um pequeno objeto, uma trajetória de movimento pontilhada com dois pontos de passagem e uma onda sonora. O logotipo OrcaRouter fica no canto inferior direito.
Guides & Insights

Perceptron Mk1.5 traz saída espacial estruturada para agentes corporificados — e aposenta o Isaac no mesmo dia

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Perceptron Mk1.5 está agora disponível em geral, e o interessante nele não é a tabela de benchmarks — é o que volta no corpo da resposta. Pergunte a um modelo de visão-linguagem comum onde está a empilhadeira e você recebe uma frase. Pergunte ao Perceptron Mk1.5 em um quadro de vídeo e, junto com sua prosa, você pode obter geometria interpretável por máquina: um ponto, uma caixa delimitadora, um polígono, um clipe, ou um <track> elemento que carrega observações espaciais com carimbo de data/hora ao longo de todo o arquivo. Essa é a diferença entre um modelo que descreve uma cena e um modelo que um controlador de robô pode consumir sem uma segunda etapa de análise. É o sucessor direto do Perceptron Mk1, o primeiro lançamento da empresa em maio de 2026, e foi lançado em 25 de setembro, junto com a descontinuação dos checkpoints Isaac 0.1 e 0.2 que o precederam.

O que o Mk1.5 realmente retorna

O modelo é um sistema de raciocínio corporificado para agentes físicos. Do lado da entrada, ele aceita texto, imagens, vídeo e áudio. Do lado da saída, ele produz texto mais anotações estruturadas opcionais: pontos, caixas, polígonos, clipes e rastreamentos. A saída de rastreamento é a parte que vale a pena detalhar. A documentação da Perceptron descreve um bloco <track> cujas entradas carregam tanto uma observação espacial quanto o carimbo de data/hora a que ela pertence, de modo que um clipe de 60 segundos retorna como uma sequência de posições de objetos ao longo do tempo, em vez de uma única estimativa média sobre a cena.

Um segundo detalhe que importa para quem for integrar isto num pipeline com mais de um recurso: o Mk1.5 suporta um campo asset_idx, pelo que um único pedido pode referenciar várias imagens ou vídeos e endereçá-los separadamente. Se a sua tarefa é comparar uma foto de referência com um fotograma de câmara ao vivo — um ciclo de verificação de defeitos, uma etapa de verificação de montagem — isso pertence a uma só chamada, não a duas.

O modelo também oferece suporte a respostas restritas, tanto com JSON Schema quanto com regex, que é como você transforma "mais ou menos isso" em um esquema que seu código downstream pode validar. A chamada de funções é suportada em chat completions, e o servidor MCP hospedado da Perceptron agora usa por padrão o perceptron-mk1.5; ao passar model: "perceptron-mk1" explicitamente, você fixa o padrão anterior.

A ficha técnica, e quanto custa

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

Os números aqui merecem ser ditos sem rodeios, porque são modestos em pontos que um leitor talvez não espere. A janela de contexto é de 36.864 tokens — não um milhão, não 256K. A saída máxima é de 8.192 tokens. Este não é um modelo ao qual você entrega um vídeo de duas horas e um manual de 300 páginas. Ele foi dimensionado para uma tarefa de percepção delimitada com uma resposta estruturada.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Contexto — 36,864 tokens, contra a janela de 32K com que o Perceptron Mk1 foi lançado
• Saída máxima — 8.192 tokens
• Entrada — texto, imagens, vídeo, áudio (WAV, MP3, FLAC)
• Entrada em cache — $0.0375/M, um quarto da tarifa padrão de entrada de $0.15/M
• Saída — $1.50/M
• Controle de raciocínio — reasoning_effort em high, medium, low, minimal ou none, com padrão high

Essa última linha é uma mudança que quebra compatibilidade disfarçada. O Mk1.5 substitui o antigo vision_config.enable_thinking booleano por reasoning_effort, então qualquer requisição que você criou para o modelo anterior precisa ser editada em vez de apenas redirecionada. O padrão de high merece atenção por um motivo diferente: se você não definir o campo, estará comprando o caminho de raciocínio mais caro em cada chamada.

Áudio e vídeo que traz sua própria trilha sonora

A entrada de áudio é genuinamente nova aqui. O Perceptron aceita isso de três formas — inline input_audio, uma audio_url ou um audio_file_id — com um limite máximo de 16.384 tokens de áudio por item. A documentação estima isso em cerca de 21,8 minutos de fala a aproximadamente 750 tokens por minuto, o que é um orçamento razoável para uma gravação de passagem de turno ou um registro de manutenção.

Mais incomum é o caminho de vídeo. Por padrão, o Mk1.5 lê o vídeo como quadros e ignora a faixa de áudio. Definir vision_config.enable_audio_in_video: true reativa a trilha sonora, que é a configuração que você quer para qualquer coisa em que o ruído é o sinal — uma máquina que soa errada antes de parecer errada, uma instrução falada emitida fora da câmera, um alarme ao fundo durante uma inspeção do local. Ela vem desativada por padrão, então um vídeo com uma falha audível será analisado silenciosamente como um filme mudo, a menos que você peça o contrário.

O panorama de referência, com as fontes explicitadas

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Todos os números abaixo vêm do próprio anúncio da Perceptron e foram medidos pela Perceptron. Não há entrada no índice da Artificial Analysis nem pontuação de arena, seja para o Mk1.5, seja para seu antecessor, portanto não há nenhum número de terceiros em lugar algum desta comparação para contrapor a eles. Trate os números como uma alegação de um fornecedor sobre seu próprio produto, não como um resultado neutro.

No rastreamento egocêntrico de mãos, a diferença é ampla e específica: o Mk1.5 obtém 0,9433 em hand_box contra 0,4467 do Gemini 3.1 Pro e 0,6179 do melhor Gemini na rodada do Perceptron, que o anúncio identifica como Gemini 3.8 Flash. Esses são os +111% e +53% que a postagem de lançamento destaca, e é o número isolado mais forte do lançamento.

Na compreensão geral de vídeo egocêntrico, o cenário é bem mais equilibrado. A Perceptron relata EgoSchema em 80,40 para o Mk1.5 contra 81,20 para o Gemini 3.8 Flash — uma perda de 0,80 ponto — enquanto alega uma vantagem de 12% no subconjunto EgoSchema-hard, com 63,75. Um modelo que vence de forma decisiva em geometria detalhada das mãos e perde por pouco no benchmark amplo de compreensão é um tipo específico de ferramenta, e está sendo vendido como tal.

A segmentação de objetos em vídeo atinge 0.647 center-F1 e 0.628 point-HOTA no Molmo2-Track. O Perceptron diz que isso lidera o Molmo2-Track, o Ref-DAVIS17 e o ReasonVOS, enquanto fica atrás do MolmoPoint-8B no MeViS valid_u. Em relação à linha de visão Qwen, a comparação de rastreamento merece uma leitura cuidadosa: o anúncio lista o Qwen3-VL-8B com 0.180 center-F1 de seu artigo, e o Qwen3.5-27B com 0.530 e 0.476 — checkpoints diferentes, configurações de avaliação diferentes e um número de artigo na mesma coluna que números medidos. Essa não é uma linha comparável em pé de igualdade.

Os resultados de áudio são relatados como DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 e AVHBench 80,56, sem nenhuma linha de comparação associada. Na busca multimodal com ferramentas ativadas, o Mk1.5 registra 56,0 no LiveVQA-W a partir de uma votação majoritária de quatro amostras, contra 53,2 do Gemini 3.8 Flash com Google Search grounding, 51,0 do GPT-6 sol com busca na web da OpenAI e 33,2 do GPT-5.2 online. A Perceptron também afirma um ganho de 36,1 pontos no MMSearch assim que as ferramentas são ativadas. A votação majoritária sobre quatro amostras é uma técnica legítima e favorece a pontuação em relação a uma única passagem greedy, de modo que 56,0 e 53,2 não são medidos da mesma forma.

Latência, e como o 4,7× foi medido

A afirmação de velocidade é a que tem maior probabilidade de ser citada sem o seu contexto, então aqui está o contexto. A Perceptron relata até 4,7× mais rápido de ponta a ponta, a partir da mediana de três execuções em uma única H100, usando prompts do LMArena limitados a respostas de 256 tokens, além de MIA-Bench e Video-MME com Perception Test. O 4,7× é o caso de chat: de 5,2 segundos para 1,1. A resposta a perguntas sobre imagens passa de 1,7 segundo para 0,51, o que dá cerca de 3,3×. Um vídeo de 60 segundos processado oito de cada vez passa de 19 segundos para 9,1, aproximadamente 2,1×.

Então, o múltiplo de manchete é o melhor dos três, não o caso típico. Em um único H100, em respostas curtas, o caminho de chat é realmente 4,7× mais rápido. Na carga de trabalho de vídeo que um agente incorporado realmente executaria, fica mais próximo de 2×. Ambos são bons números; apenas um deles é a manchete.

Isaac 0.1 e 0.2 foram descontinuados no mesmo dia.

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

O changelog do Mk1.5 traz uma segunda entrada datada de 25 de setembro, e é a que tem impacto para quem já está em produção. Os IDs de modelo isaac-0.1, isaac-0.2-1b e isaac-0.2-2b-preview foram retirados da API Perceptron. Eles não aparecem mais em GET /v1/models, não estão mais no servidor MCP hospedado, e requisições que os nomeiam agora falham com HTTP 404 model_not_found.

Há uma segunda mudança de comportamento embutida na mesma entrada que vai afetar código que nunca mencionou os modelos Isaac: IDs de modelo desconhecidos agora retornam 404 em vez do 400 anterior. Qualquer lógica de novas tentativas, ramificação de erro ou regra de alerta que correspondia a um 400 para um nome de modelo inválido agora não corresponde a nada. O caminho de migração que a Perceptron oferece é perceptron-mk1.5.

Aposentar uma família de modelos no mesmo dia em que você lança sua substituta é uma história de migração limpa e também dura. Se você fixou o Isaac porque ele funcionava, você tem um prazo que já passou.

Onde executá-lo, e como experimentá-lo sem apostar nele

A disponibilidade é através da própria API do fornecedor e de várias plataformas de terceiros. O OrcaRouter não encaminha atualmente o Perceptron Mk1.5 — o modelo não está no nosso catálogo — por isso a orientação honesta é ir diretamente para api.perceptron.inc para isso, que é exatamente para o que servem o SDK e aPERCEPTRON_API_KEY variável de ambiente.

O que vale a pena dizer de qualquer forma, porque se aplica à decisão e não ao modelo: um checkpoint de dois dias de idade numa janela de 36.864 tokens com o padrão de raciocínio definido como alto é exatamente o perfil de algo que você não deveria colocar num caminho de produção sem antes inspecionar. Rode-o primeiro contra seus próprios frames, e meça duas coisas especificamente — se as saídas estruturadas sobrevivem aos seus casos extremos reais, e quanto reasoning_effort: "high" te custa por chamada versus baixar para médio ou baixo. O segundo é uma mudança de uma linha com efeito direto na sua fatura, e é o experimento mais barato deste lançamento.

O padrão mais amplo no qual isso se encaixa — modelos de percepção retornando geometria em vez de adjetivos — é algo que o OrcaRouter foi criado para absorver. Uma única API cobre mais de 200 modelos, com os preços de tabela dos provedores repassados com 0% de margem, portanto, uma mudança de preço de um fornecedor em qualquer um deles entra em vigor do nosso lado no mesmo dia, e o failover automático significa que uma chamada de percepção pode recorrer a um segundo modelo em vez de falhar a solicitação. Se o Mk1.5 é a única coisa que atende ao seu padrão de precisão, nada disso ajuda você hoje. Se ele for um candidato entre vários, fazer a comparação por meio de um único endpoint é mais barato do que configurar um segundo SDK para descobrir.

O que esta versão é e o que não é

O Perceptron Mk1.5 é uma ferramenta focada, com um conjunto de limites incomumente honesto atrelado a ela. Ele retorna coordenadas, não apenas descrição. Ele lê áudio, incluindo a trilha sonora de um vídeo, se você ativá-lo. É rápido em respostas curtas de chat. Também é um modelo de 36.864 tokens com um teto de saída de 8.192 tokens, precificado em $0,15 e $1,50, avaliado em benchmarks inteiramente pelo próprio fornecedor e vendido por uma empresa que aposentou a geração anterior na mesma entrada de changelog.

Se o seu problema é "encontrar a mão, rastreá-la ao longo do clipe, me diga para onde ela foi e quando", o número da hand-box é o que deve ser testado. Se o seu problema é compreensão ampla de vídeo contra um generalista de ponta, a linha do EgoSchema — 80,40 contra 81,20 — sugere que você está comprando um especialista em paridade aproximada, e o argumento para trocar tem de vir da saída estruturada e da latência, não da acurácia.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente