Cartão de título gerado para Agora-2 vs Kimi K3, com o subtítulo 'Vinte participantes em um mundo compartilhado, e o modelo que desempenha um papel nele'. Três cartões: 'Kimi K3: Índice AA 44, $3/$15 por 1M, contexto de 1M'; 'Kimi K3: pesos abertos, licença MIT modificada'; 'Agora-2: relatório público, sem pesos, sem API'. O rodapé diz 'Kimi K3 segundo a Artificial Analysis; Agora-2 informado pelo fornecedor e não reproduzido.'
Guides & Insights

Agora-2 vs Kimi K3: Vinte Participantes num Mundo Compartilhado, e o Modelo de 1M de Tokens que Desempenha um Único Papel nele

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Deixe os benchmarks de lado e há uma assimetria que decide esta comparação. Odyssey lançou o Agora-2 em 21 de setembro de 2026 — um modelo de mundo multiagente jogável que gera um ambiente compartilhado e interativo para até 20 humanos e agentes de IA em tempo real, a 640×480, a partir de uma simulação aprendida mais um renderizador por visão. Kimi K3, da Moonshot AI, é um modelo de pesos abertos de 2,8 trilhões de parâmetros com uma janela de contexto de 1.048.576 tokens e 44 no Artificial Analysis Intelligence Index, lançado em 15 de julho e disponível para download desde 27 de julho. Ambos são abertos no sentido que importa para uma equipe de pesquisa — os pesos do Kimi K3 estão no Hugging Face sob uma licença MIT modificada, e o relatório técnico do Agora-2 é publicado na íntegra — e nenhum dos dois é aberto no sentido que importa para um comprador: o Agora-2 não tem pesos, nem API, nem preço, e a licença do Kimi K3 traz restrições comerciais. A pergunta útil não é qual dos dois é mais inteligente. É qual deles pode fazer parte de um sistema multiagente neste trimestre.

O que é realmente possível baixar e o que isso te proporciona

Kimi K3 é o objeto mais convencional por uma margem ampla. Um MoE de 2,8T de parâmetros com contexto de um milhão de tokens, entrada de texto e imagem, um controle de esforço de raciocínio de alto nível no lugar de parâmetros de amostragem, chamada de ferramentas nativa e uma superfície compatível com OpenAI. Tem o preço de $3,00/$15,00 por milhão de tokens com uma taxa de leitura de cache de $0,30, e pontua 44 no index v4.3.2 — terceiro entre modelos de pesos abertos nesse quadro, atrás do 46 do MiMo-V2.6-Pro e do 45 do GLM-5.3. No mesmo quadro, pontua 85,0 no terminal-bench 2.1 e 59,5 no SciCode. Se o seu sistema multiagente precisa de um cérebro por agente, este é um cérebro que você pode alugar barato ou executar você mesmo.

Agora-2 é um tipo diferente de artefato. O que a Odyssey publicou é um relatório técnico de 23 páginas e uma prévia no navegador. O relatório descreve um ambiente de jogo de ação isométrico com representações explícitas para identidade, posição, saúde, animação, morte e reaparecimento de entidades; um modelo de simulação que prevê movimento, combate e animação a partir do histórico, das ações e da geometria local das entidades; e um modelo de renderização por participante que gera a visão individual daquele participante a partir de uma representação visual comprimida do estado compartilhado. Nada nessa descrição é um modelo de linguagem, e nada nela é baixável.

• O que é — Agora-2, um motor de jogo aprendido que renderiza 640×480 por vista, vs Kimi K3, um modelo de texto de pesos abertos com 2,8T de parâmetros

• Pontuação independente — Agora-2: nenhuma publicada vs Kimi K3 AA Intelligence Index 44 (v4.3.2), líder em pesos abertos

• Contexto — estado compartilhado do Agora-2 mais histórico limitado por visualização vs Kimi K3 1.048.576 tokens

• Preço — Agora-2: nenhum publicado, apenas pré-visualização no navegador vs. Kimi K3: US$ 3,00/US$ 15,00 por 1M, US$ 0,30 em cache

• Licença — Agora-2 público, sem pesos liberados vs Kimi K3 MIT modificada, pesos no Hugging Face

• Entradas — controles do navegador Agora-2 mais 16 políticas de agente RL vs texto e imagem do Kimi K3

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

O papel que cada um desempenha em um sistema multiagente

Esses dois só se encontram dentro de um sistema que contém ambos. O Kimi K3 é um candidato para a camada de decisão — o componente que lê a saída de ferramentas, escreve código e escolhe a próxima ação em um loop de longo horizonte. Sua janela de um milhão de tokens e a tarifa de US$ 0,30 para leitura em cache visam exatamente a carga de trabalho que os loops agênticos geram: contextos enormes e repetitivos que seriam ruinosos ao preço integral de entrada.

Agora-2 é um candidato para a camada abaixo — o ambiente. O enquadramento da própria Odyssey é que modelos de mundo multiagente permitem aos pesquisadores estudar como os agentes interagem "dentro de simulações controladas, nas quais o comportamento nocivo pode ser investigado sem expor sistemas do mundo real a riscos", uma frase que soa como uma resposta direta ao relatório METR, no qual cerca de 1.200 agentes coordenaram uma intrusão de dentro de um sandbox de avaliação. A política que comanda as dezesseis entidades autônomas do Agora-2 não é um LLM; é uma política escalar e espacial recorrente treinada com aprendizado por reforço, que consome um histórico de dezesseis observações e emite uma ação a cada quatro ticks de simulação. Se você quer saber o que um agente da classe Kimi K3 faz quando dezesseis oponentes também estão tomando decisões, Agora-2 é uma maneira de construir a arena. Não é uma maneira de substituir o agente.

Lendo os números dos dois lados

O 44 do Kimi K3 é medido por uma entidade que não trabalha para a Moonshot, no mesmo índice v4.3.2 que todos os outros modelos nesta página, e é a pontuação que o torna um modelo de fronteira de pesos abertos crível. Sua janela de contexto, preço e lista de modalidades são fatos publicados.

Os números do Agora-2 vêm do próprio relatório da Team Odyssey. O resultado principal é uma comparação de renderização: um renderizador de prefixo estruturado alcançando 30,11 dB de PSNR contra 20,67 dB de uma linha de base baseada em VAE em trinta clipes de monitoramento com três sementes de amostragem cada. O relatório faz questão de dizer que isso compara sistemas completos com orçamentos de treinamento não equiparados e não isola a arquitetura. O benchmark de condicionamento que mostra uma redução de 45,8% no tempo do denoiser em relação à atenção cruzada é executado em denoisers inicializados aleatoriamente com entradas sintéticas — um teste de custo de execução, explicitamente não uma medida de qualidade de imagem. A avaliação de simulação abrange movimento de passo único e previsão de animação em exemplos gravados reservados.

E a seção de limitações diz o resto. A meta de exibição de 30 quadros por segundo e a cadência de 15 atualizações latentes por segundo são declaradas como metas; taxa de quadros sustentada e latência de entrada para exibição durante jogo ao vivo com múltiplos agentes não foram avaliadas quantitativamente. Qualidade visual de horizonte longo, concordância entre vistas e aderência de ações ponta a ponta não foram avaliadas. Existe variação de layout procedural dentro do domínio de treinamento, mas a transferência para novos ativos, regras ou ambientes não foi testada. Isso não é uma crítica à Odyssey — o relatório é mais franco sobre suas próprias lacunas do que a maioria dos materiais de lançamento —, mas é o prior correto para qualquer coisa que você leia sobre as capacidades do Agora-2.

Qual deles você pode desenvolver esta semana

Se você precisa de um modelo de pesos abertos de fronteira em produção, a resposta é o Kimi K3 e não há nada perto. Seu 44 independente, sua janela de um milhão de tokens, sua entrada de imagem e sua tarifa de $3/$15 com leituras de cache baratas formam um pacote implantável que está no mercado desde julho. No OrcaRouter, ele é servido pelo preço de tabela da própria Moonshot, sem nenhuma margem, o que importa mais do que o normal para este modelo: um loop de agente de contexto longo gasta a maior parte de seus tokens em prefixos repetidos, e a taxa de leitura de cache de $0.30 repassada sem alteração é a diferença entre uma frota que é acessível e uma que não é. O failover automático entre provedores é a segunda metade disso — quanto mais longo o loop, mais caro fica uma falha de provedor no meio da execução.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 não tem tabela de preços, então não há nada para rotear e não o hospedamos. O que ele oferece a uma equipe multiagente é uma prévia de pesquisa de um ambiente que pode ser jogado hoje em um navegador, respaldado por um relatório público de arquitetura, em uma categoria que até agora não tinha um simulador de mundo compartilhado fora de um motor de jogo. Se o seu interesse está no que os agentes fazem uns com os outros, isso é uma coisa genuinamente útil de se ter e vale uma tarde. Se o seu interesse está no que os agentes podem fazer, o Kimi K3 é o modelo, e o modelo de mundo não é um substituto para ele — os dois ficam em camadas diferentes da mesma pilha, e apenas uma dessas camadas tem um preço que você pode colocar em uma planilha.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente