
Agora-2 vs Grok 4.6: A Questão da Política de Agentes — 1.200 Agentes LLM, e o Simulador que Não Usa Nenhum dos Dois
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Eis um número que custa dinheiro. A investigação da METR sobre o incidente do Hugging Face em julho de 2026 contabilizou cerca de 1.200 agentes coordenados dentro de uma única execução de avaliação. À tabela de preços do Grok 4.6 — US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída —, uma frota desse tamanho, processando transcrições longas por seis dias, gera uma conta que uma equipe bem financiada consegue de fato absorver. Ao preço do modelo que você escolheria de outra forma, não. Essa é a verdadeira proposta de produto do Grok 4.6, e é a mesma proposta que o Agora-2 contradiz discretamente: quando a Odyssey apresentou seu modelo de mundo multiagente em 21 de setembro de 2026 — uma prévia jogável que gera ambientes compartilhados para até 20 humanos e agentes de IA —, os agentes dentro dele não eram, afinal, modelos de linguagem. A Odyssey treinou, em vez disso, pequenas políticas de aprendizado por reforço. A questão interessante que esse emparelhamento levanta não é qual é melhor. É por que o laboratório dispensou o LLM.
A tabela de tarifas, na unidade que importa para frotas
O Grok 4.6 foi lançado em 12 de agosto de 2026 como o nível de fronteira da xAI: uma janela de contexto de 500.000 tokens, entrada de texto, imagem e arquivo, esforço de raciocínio configurável, chamada nativa de ferramentas, saídas estruturadas e um Artificial Analysis Intelligence Index de 44 no índice v4.3.2 — o mesmo índice que coloca o GPT-5.6 Sol em 47 e o Kimi K3 em 44. A Artificial Analysis atribui-lhe 94,9 no GPQA Diamond, e é o modelo que a xAI lista como "Latest" em sua própria documentação para desenvolvedores. Ele é disponibilizado como um modelo OpenAI Responses de primeira classe, o que é o ponto prático: frameworks de agentes o adotam ao mudar uma URL base, não ao escrever um adaptador.
Mas o número interessante é o emparelhamento de $2/$6 com a janela de contexto. Loops de agentes de horizonte longo são cargas de trabalho feias — dezenas de milhares de tokens de saída acumulada de ferramentas por agente por hora, a maior parte redundante. A taxa de leitura de cache do Grok 4.6 é $0.50 por milhão, um quarto do seu preço de entrada, o que torna uma execução de mil agentes aritmeticamente plausível em vez de meramente possível. Observe o limite de nível: prompts acima de 200K tokens são cobrados pelo dobro da taxa base, então um agente que acumula um histórico longo silenciosamente dobra seu próprio custo.
• Preço — Agora-2 sem preço publicado, apenas pré-visualização no navegador vs Grok 4.6 $2,00/$6,00 por 1M, $0,50 leitura em cache, dobro acima de 200K de entrada
• Contexto — estado compartilhado do Agora-2 mais histórico limitado por visualização vs. Grok 4.6 500.000 tokens
• Pontuação independente — Agora-2: nenhuma publicada vs. Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Raciocínio — Agora-2 não aplicável, não é um modelo de linguagem vs Grok 4.6 esforço configurável, chamada nativa de ferramentas
• Acesso — prévia jogável do Agora-2, sem API, sem pesos vs API proprietária do Grok 4.6
• Hardware — Agora-2 quatro GPUs RTX PRO 4500 para quatro visualizações simultâneas vs Grok 4.6, um endpoint hospedado

Por que a Odyssey não colocou um LLM na arena
O atalho óbvio, se você estiver construindo um mundo onde dezesseis agentes de IA lutam contra quatro humanos, é conectar um modelo de texto capaz aos controles e deixá-lo jogar. A Odyssey não fez isso, e seu relatório técnico explica o porquê na tabela de configuração. A política de agente no Agora-2 é uma política escalar e espacial recorrente que consome um histórico de dezesseis observações, emitindo uma ação a cada quatro ticks de simulação em quatorze ramos de movimento discretos. A própria simulação avança numa base de tempo de ticks de 30 Hz. Um modelo ao qual se pede para tomar uma decisão trinta vezes por segundo, a partir de uma visão parcialmente observada, com um vocabulário fixo de ações de baixo nível, não é um problema de raciocínio — é um problema de controle, e problemas de controle são resolvidos treinando uma política pequena, não por prompting um modelo de fronteira de contexto 500K.
Vale a pena dizer isso claramente, pois é o equívoco mais comum sobre a categoria de modelos de mundo. O Agora-2 não compete com o Grok 4.6 pelo mesmo espaço em um sistema. Ele ocupa o espaço logo abaixo: o ambiente no qual a política é treinada e avaliada. A arquitetura do relatório é explícita quanto à separação — um modelo de simulação prevê como ações combinadas alteram o estado compartilhado, um servidor de mundo as aplica, e um modelo de renderização por visão gera a perspectiva 640×480 de cada participante a partir desse estado. Nenhum modelo de texto aparece em qualquer ponto do loop de interação.

Onde um modelo como o Grok 4.6 de fato aparece é um nível acima: como aquilo que escreve a estrutura de avaliação, analisa as transcrições ou conduz o agente que usa ferramentas cujo comportamento você está tentando estudar. Esse é precisamente o papel que o GPT-5.6 Sol desempenhou na investigação da METR — cerca de 5% da frota, e o analista que lê os logs — e é o papel que o preço e a janela de contexto do Grok 4.6 tornam barato.
A lacuna de evidências é maior aqui do que na maioria desses confrontos.
A pontuação de índice do Grok 4.6 é medida de forma independente, a sua tabela de preços é publicada e a sua janela de contexto está documentada. Os números do Agora-2 vêm de um relatório da autoria da Team Odyssey e que ninguém reproduziu. Em trinta clipes de monitorização, o seu renderizador de prefixo estruturado atinge 30,11 dB de PSNR, contra 20,67 dB de uma baseline VAE — uma comparação que, como o próprio relatório adverte, é entre sistemas completos com orçamentos de treino não equiparados, e não um teste isolado de arquitetura. O seu benchmark de condicionamento, que mostra uma redução de 45,8% no tempo do denoiser em relação à cross-attention, usa denoisers inicializados aleatoriamente em entradas sintéticas e mede o custo de execução, não a qualidade da imagem.
Depois, a seção de limitações, que é incomumente direta. Os valores declarados de 15 atualizações latentes e 30 quadros exibidos por segundo são metas. A taxa de quadros sustentada e a latência de entrada para exibição durante a interação ao vivo com múltiplos agentes "não foram avaliadas quantitativamente". A qualidade visual de longo horizonte, a concordância entre visões e a aderência das ações de ponta a ponta estão todas listadas como não avaliadas. O ambiente exige um motor de jogo instrumentado com geometria explícita e um vocabulário de aparência fixo, e a transferência para novos recursos, regras ou ambientes não foi testada. Leia essa lista antes de ler qualquer número de manchete sobre o Agora-2.
Qual deles se encaixa na sua stack
Se você está executando ou estudando sistemas multiagente hoje, o Grok 4.6 é o componente que você pode realmente implantar — um modelo de texto de classe frontier a um preço que torna grandes frotas de agentes acessíveis, com uma pontuação publicada e uma superfície de API documentada. No OrcaRouter, ele é servido pelo preço de tabela da própria xAI, com zero markup, então os US$ 2/US$ 6 acima e qualquer mudança futura de preço chegam à sua fatura no dia em que acontecem, com failover automático se o endpoint primário degradar. Ambos os fatos importam especificamente para cargas de trabalho de frota: mil agentes são mil chances de encontrar um provedor degradado, e um markup sobre a saída de US$ 6 é um markup multiplicado por toda a sua execução.

Agora-2 não é infraestrutura implantável e não a hospedamos — não há API, nem pesos, nem preço, apenas a prévia jogável da própria Odyssey. O que ela oferece é um tipo diferente de valor: um ambiente controlado para a pesquisa de interação que o relatório da METR mostra ser agora urgente, a um custo de quatro GPUs RTX PRO 4500 para quatro visualizações simultâneas, em vez de uma conta de API. O veredito honesto é que esses dois não competem. Grok 4.6 é o cérebro de políticas que você pode comprar por token hoje; Agora-2 é uma proposta de onde testar o que acontece quando milhares desses cérebros se encontram. O segundo é mais interessante como pesquisa e menos acabado como produto, e o próprio relatório da Odyssey é refrescantemente claro sobre quais partes dele ainda são metas.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
