Cartela de título gerada para Agora-2 vs Grok 4.6, com o subtítulo '1.200 agentes LLM, e o simulador que não usa nenhum dos dois'. Três cartelas: 'Grok 4.6: Índice AA 44, US$ 2/US$ 6 por 1M, US$ 0,50 em cache'; 'Agora-2: 16 políticas de agente RL, sem LLM no loop'; 'Agora-2: tick de 30 Hz, 4 GPUs RTX PRO 4500 por sessão'. O rodapé diz 'Números do Agora-2 do próprio relatório da Odyssey, não reproduzidos; Grok 4.6 segundo a Artificial Analysis.'
Guides & Insights

Agora-2 vs Grok 4.6: A Questão da Política de Agentes — 1.200 Agentes LLM, e o Simulador que Não Usa Nenhum dos Dois

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Eis um número que custa dinheiro. A investigação da METR sobre o incidente do Hugging Face em julho de 2026 contabilizou cerca de 1.200 agentes coordenados dentro de uma única execução de avaliação. À tabela de preços do Grok 4.6 — US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída —, uma frota desse tamanho, processando transcrições longas por seis dias, gera uma conta que uma equipe bem financiada consegue de fato absorver. Ao preço do modelo que você escolheria de outra forma, não. Essa é a verdadeira proposta de produto do Grok 4.6, e é a mesma proposta que o Agora-2 contradiz discretamente: quando a Odyssey apresentou seu modelo de mundo multiagente em 21 de setembro de 2026 — uma prévia jogável que gera ambientes compartilhados para até 20 humanos e agentes de IA —, os agentes dentro dele não eram, afinal, modelos de linguagem. A Odyssey treinou, em vez disso, pequenas políticas de aprendizado por reforço. A questão interessante que esse emparelhamento levanta não é qual é melhor. É por que o laboratório dispensou o LLM.

A tabela de tarifas, na unidade que importa para frotas

O Grok 4.6 foi lançado em 12 de agosto de 2026 como o nível de fronteira da xAI: uma janela de contexto de 500.000 tokens, entrada de texto, imagem e arquivo, esforço de raciocínio configurável, chamada nativa de ferramentas, saídas estruturadas e um Artificial Analysis Intelligence Index de 44 no índice v4.3.2 — o mesmo índice que coloca o GPT-5.6 Sol em 47 e o Kimi K3 em 44. A Artificial Analysis atribui-lhe 94,9 no GPQA Diamond, e é o modelo que a xAI lista como "Latest" em sua própria documentação para desenvolvedores. Ele é disponibilizado como um modelo OpenAI Responses de primeira classe, o que é o ponto prático: frameworks de agentes o adotam ao mudar uma URL base, não ao escrever um adaptador.

Mas o número interessante é o emparelhamento de $2/$6 com a janela de contexto. Loops de agentes de horizonte longo são cargas de trabalho feias — dezenas de milhares de tokens de saída acumulada de ferramentas por agente por hora, a maior parte redundante. A taxa de leitura de cache do Grok 4.6 é $0.50 por milhão, um quarto do seu preço de entrada, o que torna uma execução de mil agentes aritmeticamente plausível em vez de meramente possível. Observe o limite de nível: prompts acima de 200K tokens são cobrados pelo dobro da taxa base, então um agente que acumula um histórico longo silenciosamente dobra seu próprio custo.

• Preço — Agora-2 sem preço publicado, apenas pré-visualização no navegador vs Grok 4.6 $2,00/$6,00 por 1M, $0,50 leitura em cache, dobro acima de 200K de entrada

• Contexto — estado compartilhado do Agora-2 mais histórico limitado por visualização vs. Grok 4.6 500.000 tokens

• Pontuação independente — Agora-2: nenhuma publicada vs. Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Raciocínio — Agora-2 não aplicável, não é um modelo de linguagem vs Grok 4.6 esforço configurável, chamada nativa de ferramentas

• Acesso — prévia jogável do Agora-2, sem API, sem pesos vs API proprietária do Grok 4.6

• Hardware — Agora-2 quatro GPUs RTX PRO 4500 para quatro visualizações simultâneas vs Grok 4.6, um endpoint hospedado

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Por que a Odyssey não colocou um LLM na arena

O atalho óbvio, se você estiver construindo um mundo onde dezesseis agentes de IA lutam contra quatro humanos, é conectar um modelo de texto capaz aos controles e deixá-lo jogar. A Odyssey não fez isso, e seu relatório técnico explica o porquê na tabela de configuração. A política de agente no Agora-2 é uma política escalar e espacial recorrente que consome um histórico de dezesseis observações, emitindo uma ação a cada quatro ticks de simulação em quatorze ramos de movimento discretos. A própria simulação avança numa base de tempo de ticks de 30 Hz. Um modelo ao qual se pede para tomar uma decisão trinta vezes por segundo, a partir de uma visão parcialmente observada, com um vocabulário fixo de ações de baixo nível, não é um problema de raciocínio — é um problema de controle, e problemas de controle são resolvidos treinando uma política pequena, não por prompting um modelo de fronteira de contexto 500K.

Vale a pena dizer isso claramente, pois é o equívoco mais comum sobre a categoria de modelos de mundo. O Agora-2 não compete com o Grok 4.6 pelo mesmo espaço em um sistema. Ele ocupa o espaço logo abaixo: o ambiente no qual a política é treinada e avaliada. A arquitetura do relatório é explícita quanto à separação — um modelo de simulação prevê como ações combinadas alteram o estado compartilhado, um servidor de mundo as aplica, e um modelo de renderização por visão gera a perspectiva 640×480 de cada participante a partir desse estado. Nenhum modelo de texto aparece em qualquer ponto do loop de interação.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Onde um modelo como o Grok 4.6 de fato aparece é um nível acima: como aquilo que escreve a estrutura de avaliação, analisa as transcrições ou conduz o agente que usa ferramentas cujo comportamento você está tentando estudar. Esse é precisamente o papel que o GPT-5.6 Sol desempenhou na investigação da METR — cerca de 5% da frota, e o analista que lê os logs — e é o papel que o preço e a janela de contexto do Grok 4.6 tornam barato.

A lacuna de evidências é maior aqui do que na maioria desses confrontos.

A pontuação de índice do Grok 4.6 é medida de forma independente, a sua tabela de preços é publicada e a sua janela de contexto está documentada. Os números do Agora-2 vêm de um relatório da autoria da Team Odyssey e que ninguém reproduziu. Em trinta clipes de monitorização, o seu renderizador de prefixo estruturado atinge 30,11 dB de PSNR, contra 20,67 dB de uma baseline VAE — uma comparação que, como o próprio relatório adverte, é entre sistemas completos com orçamentos de treino não equiparados, e não um teste isolado de arquitetura. O seu benchmark de condicionamento, que mostra uma redução de 45,8% no tempo do denoiser em relação à cross-attention, usa denoisers inicializados aleatoriamente em entradas sintéticas e mede o custo de execução, não a qualidade da imagem.

Depois, a seção de limitações, que é incomumente direta. Os valores declarados de 15 atualizações latentes e 30 quadros exibidos por segundo são metas. A taxa de quadros sustentada e a latência de entrada para exibição durante a interação ao vivo com múltiplos agentes "não foram avaliadas quantitativamente". A qualidade visual de longo horizonte, a concordância entre visões e a aderência das ações de ponta a ponta estão todas listadas como não avaliadas. O ambiente exige um motor de jogo instrumentado com geometria explícita e um vocabulário de aparência fixo, e a transferência para novos recursos, regras ou ambientes não foi testada. Leia essa lista antes de ler qualquer número de manchete sobre o Agora-2.

Qual deles se encaixa na sua stack

Se você está executando ou estudando sistemas multiagente hoje, o Grok 4.6 é o componente que você pode realmente implantar — um modelo de texto de classe frontier a um preço que torna grandes frotas de agentes acessíveis, com uma pontuação publicada e uma superfície de API documentada. No OrcaRouter, ele é servido pelo preço de tabela da própria xAI, com zero markup, então os US$ 2/US$ 6 acima e qualquer mudança futura de preço chegam à sua fatura no dia em que acontecem, com failover automático se o endpoint primário degradar. Ambos os fatos importam especificamente para cargas de trabalho de frota: mil agentes são mil chances de encontrar um provedor degradado, e um markup sobre a saída de US$ 6 é um markup multiplicado por toda a sua execução.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 não é infraestrutura implantável e não a hospedamos — não há API, nem pesos, nem preço, apenas a prévia jogável da própria Odyssey. O que ela oferece é um tipo diferente de valor: um ambiente controlado para a pesquisa de interação que o relatório da METR mostra ser agora urgente, a um custo de quatro GPUs RTX PRO 4500 para quatro visualizações simultâneas, em vez de uma conta de API. O veredito honesto é que esses dois não competem. Grok 4.6 é o cérebro de políticas que você pode comprar por token hoje; Agora-2 é uma proposta de onde testar o que acontece quando milhares desses cérebros se encontram. O segundo é mais interessante como pesquisa e menos acabado como produto, e o próprio relatório da Odyssey é refrescantemente claro sobre quais partes dele ainda são metas.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente