
Apodex 1.1, explicado: um 44 no Índice de Inteligência, força agêntica real — e uma ressalva sobre a confiabilidade do conhecimento
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O Apodex 1.1 tem uma semana de existência, é proprietário e, até esta semana, era pouco mais que uma curiosidade de laboratório. Aí a Artificial Analysis publicou sua primeira avaliação independente do modelo — a primeira do Apodex na plataforma — e o placar fez algo incomum: o Apodex 1.1 marcou 44 no Artificial Analysis Intelligence Index, ficando em #11 entre 177, ao mesmo tempo em que apresentou pontuações em trabalhos agênticos que superaram todos os modelos em seu nível de inteligência, incluindo DeepSeek V4 Pro, Qwen3.7 Max e Kimi K2.6. O mesmo relatório trouxe à tona um segundo número, mais feio: um histórico de confiabilidade do conhecimento fraco o suficiente para mudar a decisão de rodar trabalho real nele. Seu irmão de pesos abertos, o Apodex 1.1 Mini, é o modelo que a maioria das pessoas consegue rodar de fato. Eis o que a avaliação diz, o que ela não diz e quem deveria se importar.
A Apodex, empresa de IA fundada por Chen Tianqiao, lançou a família em 24 de agosto de 2026, juntamente com um artigo no arXiv assinado por 70 autores, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). O carro-chefe é proprietário — cerca de 397B de parâmetros, segundo o relatório do fornecedor — construído em torno da tese de que o verdadeiro gargalo dos agentes não é a inteligência bruta, mas o ambiente em que eles atuam. Por isso, o Apodex 1.1 foi treinado para trabalhar diretamente com arquivos, busca e código em horizontes longos, com um harness de execução compartilhado ("AgentOS") que coordena até 150 subagentes em paralelo e mantém um registro de procedência de cada etapa. A parte aberta é a irmã: Apodex 1.1 Mini, uma MoE de classe 35B ajustada a partir da Qwen3.5-35B-A3B da Alibaba, lançada sob Apache-2.0 com um harness de agente complementar chamado FrontierAgent. O modelo completo só chega até você pela API e pelo workbench online da própria Apodex; a Mini é self-hosted ou nada.
O que significa um 44 no Índice de Inteligência
{{1}}O Índice de Inteligência da Artificial Analysis é um agregado ponderado do conjunto de benchmarks da plataforma — incluindo avaliações agênticas como GDPval-AA v2 e Terminal-Bench, além de componentes de raciocínio, matemática e conhecimento.{{/1}} {{2}}Uma pontuação de 44 coloca o Apodex 1.1 na posição #11 de 177 modelos, bem acima da mediana de 18.{{/2}} {{3}}Isso também coloca o modelo em um nível concorrido e interessante: Kimi K2.6 (45), MiniMax-M3 (45) e Inkling (42) estão todos a três pontos de distância, e o Apodex 1.1 é o único desse grupo cujo nome era desconhecido para a maioria dos usuários de IA há uma semana.{{/3}} {{4}}A Artificial Analysis observa que a página cobre a versão de raciocínio do modelo e que uma variante sem raciocínio também pode existir.{{/4}}

A pontuação do índice principal não é onde este modelo se torna interessante. Ele é interessante por causa de onde seus pontos fortes e fracos se situam em relação a essa pontuação — e é isso que a comparação de níveis torna concreto.
Onde se sai melhor do que seu nível sugere: avaliações de agentes e de trabalho do conhecimento.
Nos dois componentes do Índice que medem trabalho agêntico no mundo real, o Apodex 1.1 supera seus vizinhos de 44 pontos. No GDPval-AA v2 — um benchmark que avalia a capacidade de um agente concluir tarefas realistas de escritório de ponta a ponta — o Apodex 1.1 registra um Elo de 1348, à frente do DeepSeek V4 Pro (1333), do Qwen3.7 Max (1308) e do Kimi K2.6 (1202). No TerminalBench v2.1, que testa um agente trabalhando em um terminal, ele pontua 70%, à frente do Kimi K2.6 (66%) e logo atrás do Qwen3.7 Max (75%). Esses são números independentes, calculados pela Artificial Analysis, e são a evidência mais forte no relatório de que o treinamento com foco no ambiente funciona.
As afirmações de benchmark do próprio fornecedor vão além e devem ser lidas como relatos do fornecedor até que alguém as reproduza: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% com ferramentas, DeepSearchQA 92.4%, FrontierFinance 54.3 e FrontierScience-Research 63.3. O que torna o perfil agêntico crível, e não mero exagero, é a arquitetura por trás dele: escalabilidade de ambiente (expandindo a diversidade de ambientes de arquivos executáveis, busca e código usados no treinamento) e escalabilidade de coordenação agêntica (treinando o modelo para decompor tarefas de longo horizonte, delegar trabalho paralelo, integrar resultados assíncronos e replanejar). O modo "Agent Team" gera até 150 subagentes em tarefas de recuperação e síntese, e uma etapa de verificação integrada ("Statement Review") confere as conclusões antes de entregá-las. Em outras palavras: este é um modelo projetado para errar, verificar a si mesmo e corrigir as coisas — não para recitar fatos de memória.
O custo oculto de toda essa agência: verbosidade
Esse design aparece na tabela de custo-benefício da Artificial Analysis como a fraqueza mais clara do modelo depois do conhecimento: ele é muito verboso. Executar o Índice de Inteligência completo consumiu 180 milhões de tokens de saída — contra uma mediana de 67 milhões — e aproximadamente 17.000 tokens de saída por tarefa de benchmark, em comparação com cerca de 9.400 para Qwen3.7 Max e 8.100 para MiniMax-M3. No total, a avaliação completa custou US$ 618,41 em gastos de API, de acordo com a Artificial Analysis.

O preço que gera essa conta: US$ 0,30 por milhão de tokens de entrada e US$ 3,00 por milhão de saída — um preço de US$ 0,03 para cache hit em entrada em cache, um desconto de 90% — o que resulta em cerca de US$ 0,38 por milhão em uma mistura típica de 7:2:1 de cache/entrada/saída. Ambos os preços por token ficam acima das medianas da plataforma (US$ 0,25 para entrada, US$ 0,90 para saída). No entanto, a estimativa de custo por tarefa da Artificial Analysis ainda coloca o Apodex 1.1 em cerca de US$ 0,05 por tarefa de benchmark, mais barato que o Qwen3.7 Max (~US$ 0,07) e o Kimi K2.6 (~US$ 0,06). A conciliação é importante para o orçamento: seus tokens são baratos o suficiente para que até mesmo uma verbosidade alta continue competitiva por tarefa — o risco de custo é o volume, não a taxa. Se você colocar um agente de longa duração nele, a conta é determinada por quanto ele fala, e ele fala muito.
Uma observação sobre preços antes de você fazer o orçamento: $0.30/$3.00 é a lista de preços do próprio fornecedor. Uma plataforma de roteamento que repassa os preços de tabela do provedor com margem de 0% cobra exatamente esse valor, e qualquer redução de preço futura da Apodex aparece no mesmo dia em que é anunciada.
O problema: um histórico fraco de confiabilidade do conhecimento
Aqui está o número que a cobertura do lançamento quase sempre ignora. No AA-Omniscience, o teste de confiabilidade de conhecimento da Artificial Analysis, o Apodex 1.1 pontua -21,9. Ele tenta responder 87% das perguntas em vez de recusar, mas acerta apenas 32%, e sua taxa de alucinação é de 78,4%. Para um modelo posicionado como um solucionador de alta exigência, isso é uma grave dupla personalidade: forte em execução agêntica, fraco em conhecimento fundamentado.
Os dois fatos estão conectados, não são contraditórios. Benchmarks agênticos recompensam atuar em um ambiente — {{1}}emitir chamadas de ferramentas, iterar, se recuperar — então um modelo pode pontuar bem ali enquanto tem recall fraco, porque o ambiente é quem faz o lembrar{{/1}}. O design inclusive pressupõe isso: o Statement Review existe para verificar saídas, e a bancada de trabalho é construída em torno de verificação, não em torno de o modelo acertar de memória. A leitura prática é direta: não aponte o Apodex 1.1 para tarefas que dependam de ele recuperar fatos dos próprios pesos. Aponte-o para tarefas de horizonte longo em que o trabalho dele possa ser conferido contra arquivos, código e fontes — e verifique a entrega.
O irmão aberto: Apodex 1.1 Mini e FrontierAgent
Se a porta fechada do carro-chefe é um problema, a metade aberta da família é o contrapeso. O Apodex 1.1 Mini é um MoE de ~35B no total / ~3B ativos, com fine-tuning a partir do Qwen3.5-35B-A3B (uma base da Alibaba lançada como código aberto em fevereiro de 2026), lançado sob Apache-2.0 com janela de contexto de 262K e variantes FP8, FP4 e GPTQ-Int4 no Hugging Face. {{1}}O principal número divulgado pelo fornecedor é 50.2 no FrontierFinance {{2}}(primeiro na própria comparação da Apodex){{/2}} e 27.7 no APEX-Agents com o harness Agent Team habilitado.{{/1}} {{3}}E o FrontierAgent — o runtime de código aberto que vem com ele — é genuinamente o artefato interessante:{{/3}} um harness baseado em terminal com modos ReAct e Agent Team, trabalho com arquivos em sandbox, portões de aprovação, checkpoints e rastros, tudo se comunicando com qualquer endpoint compatível com OpenAI.
Duas coisas que valem a pena saber antes de você fazer self-hosting. Primeiro, o Mini é um fine-tune, não um modelo de fronteira — leia os números de benchmark dele da mesma forma que você lê a tabela do fornecedor do carro-chefe: comparações não reproduzidas, com harness incluído, escolhidas pelo fornecedor. Segundo, seu comportamento herda o do modelo base: se você quiser testar se o Qwen3.5-35B-A3B subjacente já faz a sua tarefa, você não precisa de uma GPU nem de uma stack de serving para descobrir — o modelo base está a uma chamada de API.
Quem deve usar o Apodex 1.1 hoje
O carro-chefe é inicial, fechado e, por enquanto, está disponível apenas na API própria do fornecedor e no workbench online; a Apodex afirma que uma disponibilidade mais ampla da API virá por meio das principais plataformas, mas os pesos não são abertos. Isso limita quem pode agir no placar desta semana: equipes que já estão no workbench da Apodex, ou dispostas a se inscrever para uma chave de API de primeira parte. O Mini é o caminho mais acessível, mas significa auto-hospedagem.

Onde o modelo realmente merece seu lugar: pipelines agentivos de longo horizonte em que as saídas são verificadas a jusante — bancadas de pesquisa, tarefas de múltiplas etapas envolvendo arquivos e ferramentas, trabalho em terminal — e onde o perfil de custo de ~US$ 0,05 por tarefa sobrevive à verbosidade. Onde ainda não pertence: qualquer coisa que dependa da confiabilidade do conhecimento do próprio modelo, ou um caminho de produção que não possa tolerar o mau comportamento de um modelo de sete dias ainda não comprovado. Exatamente para essa situação, uma camada de roteamento é o wrapper certo. Uma API para 200+ modelos significa que o Qwen3.5-35B-A3B base já pode ser chamado ao preço de tabela, um Mini auto-hospedado pode ficar atrás do mesmo roteador com failover automático, e um novato instável não pode derrubar um caminho de produção — quando ele apresenta desempenho insatisfatório, a solicitação é redirecionada para um provedor saudável.
O que assistir em seguida
Esta avaliação é uma primeira leitura, não um veredito. Três coisas decidirão se a Apodex 1.1 importa daqui a um mês: a reprodução independente das afirmações do fornecedor sobre capacidades agênticas (os números do GDPval e do TerminalBench conduzidos pela Artificial Analysis são os únicos não produzidos pela própria Apodex); se a lacuna na confiabilidade do conhecimento diminui em uma variante sem raciocínio ou em uma versão subsequente; e se o modelo aparece em mais APIs e em mais rankings independentes, ponto em que o 44 e o -21.9 tornam-se problema de outra pessoa para bater. Para um modelo de sete dias com esse tipo de perfil dividido, é praticamente tudo o que se pode pedir: uma vantagem agêntica real, um preço honesto e uma fraqueza que você conhece antes de se inscrever.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
