Um cartão de título hero para o Apodex 1.1, intitulado 'Apodex 1.1', com o subtítulo '44 no Índice de Inteligência - força agêntica, alta verbosidade e um acervo de conhecimento', emblemas em formato de pílula com os dizeres 'AA Index 44', '#11 de 177', 'contexto de 256K', e uma linha de rodapé 'Lançado em 24 de agosto de 2026 - primeiro modelo Apodex na Artificial Analysis', com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Apodex 1.1, explicado: um 44 no Índice de Inteligência, força agêntica real — e uma ressalva sobre a confiabilidade do conhecimento

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Apodex 1.1 tem uma semana de existência, é proprietário e, até esta semana, era pouco mais que uma curiosidade de laboratório. Aí a Artificial Analysis publicou sua primeira avaliação independente do modelo — a primeira do Apodex na plataforma — e o placar fez algo incomum: o Apodex 1.1 marcou 44 no Artificial Analysis Intelligence Index, ficando em #11 entre 177, ao mesmo tempo em que apresentou pontuações em trabalhos agênticos que superaram todos os modelos em seu nível de inteligência, incluindo DeepSeek V4 Pro, Qwen3.7 Max e Kimi K2.6. O mesmo relatório trouxe à tona um segundo número, mais feio: um histórico de confiabilidade do conhecimento fraco o suficiente para mudar a decisão de rodar trabalho real nele. Seu irmão de pesos abertos, o Apodex 1.1 Mini, é o modelo que a maioria das pessoas consegue rodar de fato. Eis o que a avaliação diz, o que ela não diz e quem deveria se importar.

A Apodex, empresa de IA fundada por Chen Tianqiao, lançou a família em 24 de agosto de 2026, juntamente com um artigo no arXiv assinado por 70 autores, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). O carro-chefe é proprietário — cerca de 397B de parâmetros, segundo o relatório do fornecedor — construído em torno da tese de que o verdadeiro gargalo dos agentes não é a inteligência bruta, mas o ambiente em que eles atuam. Por isso, o Apodex 1.1 foi treinado para trabalhar diretamente com arquivos, busca e código em horizontes longos, com um harness de execução compartilhado ("AgentOS") que coordena até 150 subagentes em paralelo e mantém um registro de procedência de cada etapa. A parte aberta é a irmã: Apodex 1.1 Mini, uma MoE de classe 35B ajustada a partir da Qwen3.5-35B-A3B da Alibaba, lançada sob Apache-2.0 com um harness de agente complementar chamado FrontierAgent. O modelo completo só chega até você pela API e pelo workbench online da própria Apodex; a Mini é self-hosted ou nada.

O que significa um 44 no Índice de Inteligência

{{1}}O Índice de Inteligência da Artificial Analysis é um agregado ponderado do conjunto de benchmarks da plataforma — incluindo avaliações agênticas como GDPval-AA v2 e Terminal-Bench, além de componentes de raciocínio, matemática e conhecimento.{{/1}} {{2}}Uma pontuação de 44 coloca o Apodex 1.1 na posição #11 de 177 modelos, bem acima da mediana de 18.{{/2}} {{3}}Isso também coloca o modelo em um nível concorrido e interessante: Kimi K2.6 (45), MiniMax-M3 (45) e Inkling (42) estão todos a três pontos de distância, e o Apodex 1.1 é o único desse grupo cujo nome era desconhecido para a maioria dos usuários de IA há uma semana.{{/3}} {{4}}A Artificial Analysis observa que a página cobre a versão de raciocínio do modelo e que uma variante sem raciocínio também pode existir.{{/4}}

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

A pontuação do índice principal não é onde este modelo se torna interessante. Ele é interessante por causa de onde seus pontos fortes e fracos se situam em relação a essa pontuação — e é isso que a comparação de níveis torna concreto.

Onde se sai melhor do que seu nível sugere: avaliações de agentes e de trabalho do conhecimento.

Nos dois componentes do Índice que medem trabalho agêntico no mundo real, o Apodex 1.1 supera seus vizinhos de 44 pontos. No GDPval-AA v2 — um benchmark que avalia a capacidade de um agente concluir tarefas realistas de escritório de ponta a ponta — o Apodex 1.1 registra um Elo de 1348, à frente do DeepSeek V4 Pro (1333), do Qwen3.7 Max (1308) e do Kimi K2.6 (1202). No TerminalBench v2.1, que testa um agente trabalhando em um terminal, ele pontua 70%, à frente do Kimi K2.6 (66%) e logo atrás do Qwen3.7 Max (75%). Esses são números independentes, calculados pela Artificial Analysis, e são a evidência mais forte no relatório de que o treinamento com foco no ambiente funciona.

As afirmações de benchmark do próprio fornecedor vão além e devem ser lidas como relatos do fornecedor até que alguém as reproduza: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% com ferramentas, DeepSearchQA 92.4%, FrontierFinance 54.3 e FrontierScience-Research 63.3. O que torna o perfil agêntico crível, e não mero exagero, é a arquitetura por trás dele: escalabilidade de ambiente (expandindo a diversidade de ambientes de arquivos executáveis, busca e código usados no treinamento) e escalabilidade de coordenação agêntica (treinando o modelo para decompor tarefas de longo horizonte, delegar trabalho paralelo, integrar resultados assíncronos e replanejar). O modo "Agent Team" gera até 150 subagentes em tarefas de recuperação e síntese, e uma etapa de verificação integrada ("Statement Review") confere as conclusões antes de entregá-las. Em outras palavras: este é um modelo projetado para errar, verificar a si mesmo e corrigir as coisas — não para recitar fatos de memória.

O custo oculto de toda essa agência: verbosidade

Esse design aparece na tabela de custo-benefício da Artificial Analysis como a fraqueza mais clara do modelo depois do conhecimento: ele é muito verboso. Executar o Índice de Inteligência completo consumiu 180 milhões de tokens de saída — contra uma mediana de 67 milhões — e aproximadamente 17.000 tokens de saída por tarefa de benchmark, em comparação com cerca de 9.400 para Qwen3.7 Max e 8.100 para MiniMax-M3. No total, a avaliação completa custou US$ 618,41 em gastos de API, de acordo com a Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

O preço que gera essa conta: US$ 0,30 por milhão de tokens de entrada e US$ 3,00 por milhão de saída — um preço de US$ 0,03 para cache hit em entrada em cache, um desconto de 90% — o que resulta em cerca de US$ 0,38 por milhão em uma mistura típica de 7:2:1 de cache/entrada/saída. Ambos os preços por token ficam acima das medianas da plataforma (US$ 0,25 para entrada, US$ 0,90 para saída). No entanto, a estimativa de custo por tarefa da Artificial Analysis ainda coloca o Apodex 1.1 em cerca de US$ 0,05 por tarefa de benchmark, mais barato que o Qwen3.7 Max (~US$ 0,07) e o Kimi K2.6 (~US$ 0,06). A conciliação é importante para o orçamento: seus tokens são baratos o suficiente para que até mesmo uma verbosidade alta continue competitiva por tarefa — o risco de custo é o volume, não a taxa. Se você colocar um agente de longa duração nele, a conta é determinada por quanto ele fala, e ele fala muito.

Uma observação sobre preços antes de você fazer o orçamento: $0.30/$3.00 é a lista de preços do próprio fornecedor. Uma plataforma de roteamento que repassa os preços de tabela do provedor com margem de 0% cobra exatamente esse valor, e qualquer redução de preço futura da Apodex aparece no mesmo dia em que é anunciada.

O problema: um histórico fraco de confiabilidade do conhecimento

Aqui está o número que a cobertura do lançamento quase sempre ignora. No AA-Omniscience, o teste de confiabilidade de conhecimento da Artificial Analysis, o Apodex 1.1 pontua -21,9. Ele tenta responder 87% das perguntas em vez de recusar, mas acerta apenas 32%, e sua taxa de alucinação é de 78,4%. Para um modelo posicionado como um solucionador de alta exigência, isso é uma grave dupla personalidade: forte em execução agêntica, fraco em conhecimento fundamentado.

Os dois fatos estão conectados, não são contraditórios. Benchmarks agênticos recompensam atuar em um ambiente — {{1}}emitir chamadas de ferramentas, iterar, se recuperar — então um modelo pode pontuar bem ali enquanto tem recall fraco, porque o ambiente é quem faz o lembrar{{/1}}. O design inclusive pressupõe isso: o Statement Review existe para verificar saídas, e a bancada de trabalho é construída em torno de verificação, não em torno de o modelo acertar de memória. A leitura prática é direta: não aponte o Apodex 1.1 para tarefas que dependam de ele recuperar fatos dos próprios pesos. Aponte-o para tarefas de horizonte longo em que o trabalho dele possa ser conferido contra arquivos, código e fontes — e verifique a entrega.

O irmão aberto: Apodex 1.1 Mini e FrontierAgent

Se a porta fechada do carro-chefe é um problema, a metade aberta da família é o contrapeso. O Apodex 1.1 Mini é um MoE de ~35B no total / ~3B ativos, com fine-tuning a partir do Qwen3.5-35B-A3B (uma base da Alibaba lançada como código aberto em fevereiro de 2026), lançado sob Apache-2.0 com janela de contexto de 262K e variantes FP8, FP4 e GPTQ-Int4 no Hugging Face. {{1}}O principal número divulgado pelo fornecedor é 50.2 no FrontierFinance {{2}}(primeiro na própria comparação da Apodex){{/2}} e 27.7 no APEX-Agents com o harness Agent Team habilitado.{{/1}} {{3}}E o FrontierAgent — o runtime de código aberto que vem com ele — é genuinamente o artefato interessante:{{/3}} um harness baseado em terminal com modos ReAct e Agent Team, trabalho com arquivos em sandbox, portões de aprovação, checkpoints e rastros, tudo se comunicando com qualquer endpoint compatível com OpenAI.

Duas coisas que valem a pena saber antes de você fazer self-hosting. Primeiro, o Mini é um fine-tune, não um modelo de fronteira — leia os números de benchmark dele da mesma forma que você lê a tabela do fornecedor do carro-chefe: comparações não reproduzidas, com harness incluído, escolhidas pelo fornecedor. Segundo, seu comportamento herda o do modelo base: se você quiser testar se o Qwen3.5-35B-A3B subjacente já faz a sua tarefa, você não precisa de uma GPU nem de uma stack de serving para descobrir — o modelo base está a uma chamada de API.

Quem deve usar o Apodex 1.1 hoje

O carro-chefe é inicial, fechado e, por enquanto, está disponível apenas na API própria do fornecedor e no workbench online; a Apodex afirma que uma disponibilidade mais ampla da API virá por meio das principais plataformas, mas os pesos não são abertos. Isso limita quem pode agir no placar desta semana: equipes que já estão no workbench da Apodex, ou dispostas a se inscrever para uma chave de API de primeira parte. O Mini é o caminho mais acessível, mas significa auto-hospedagem.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Onde o modelo realmente merece seu lugar: pipelines agentivos de longo horizonte em que as saídas são verificadas a jusante — bancadas de pesquisa, tarefas de múltiplas etapas envolvendo arquivos e ferramentas, trabalho em terminal — e onde o perfil de custo de ~US$ 0,05 por tarefa sobrevive à verbosidade. Onde ainda não pertence: qualquer coisa que dependa da confiabilidade do conhecimento do próprio modelo, ou um caminho de produção que não possa tolerar o mau comportamento de um modelo de sete dias ainda não comprovado. Exatamente para essa situação, uma camada de roteamento é o wrapper certo. Uma API para 200+ modelos significa que o Qwen3.5-35B-A3B base já pode ser chamado ao preço de tabela, um Mini auto-hospedado pode ficar atrás do mesmo roteador com failover automático, e um novato instável não pode derrubar um caminho de produção — quando ele apresenta desempenho insatisfatório, a solicitação é redirecionada para um provedor saudável.

O que assistir em seguida

Esta avaliação é uma primeira leitura, não um veredito. Três coisas decidirão se a Apodex 1.1 importa daqui a um mês: a reprodução independente das afirmações do fornecedor sobre capacidades agênticas (os números do GDPval e do TerminalBench conduzidos pela Artificial Analysis são os únicos não produzidos pela própria Apodex); se a lacuna na confiabilidade do conhecimento diminui em uma variante sem raciocínio ou em uma versão subsequente; e se o modelo aparece em mais APIs e em mais rankings independentes, ponto em que o 44 e o -21.9 tornam-se problema de outra pessoa para bater. Para um modelo de sete dias com esse tipo de perfil dividido, é praticamente tudo o que se pode pedir: uma vantagem agêntica real, um preço honesto e uma fraqueza que você conhece antes de se inscrever.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente