
Agora-2 vs Kimi K3: Vinte Participantes num Mundo Compartilhado, e o Modelo de 1M de Tokens que Desempenha um Único Papel nele
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Deixe os benchmarks de lado e há uma assimetria que decide esta comparação. Odyssey lançou o Agora-2 em 21 de setembro de 2026 — um modelo de mundo multiagente jogável que gera um ambiente compartilhado e interativo para até 20 humanos e agentes de IA em tempo real, a 640×480, a partir de uma simulação aprendida mais um renderizador por visão. Kimi K3, da Moonshot AI, é um modelo de pesos abertos de 2,8 trilhões de parâmetros com uma janela de contexto de 1.048.576 tokens e 44 no Artificial Analysis Intelligence Index, lançado em 15 de julho e disponível para download desde 27 de julho. Ambos são abertos no sentido que importa para uma equipe de pesquisa — os pesos do Kimi K3 estão no Hugging Face sob uma licença MIT modificada, e o relatório técnico do Agora-2 é publicado na íntegra — e nenhum dos dois é aberto no sentido que importa para um comprador: o Agora-2 não tem pesos, nem API, nem preço, e a licença do Kimi K3 traz restrições comerciais. A pergunta útil não é qual dos dois é mais inteligente. É qual deles pode fazer parte de um sistema multiagente neste trimestre.
O que é realmente possível baixar e o que isso te proporciona
Kimi K3 é o objeto mais convencional por uma margem ampla. Um MoE de 2,8T de parâmetros com contexto de um milhão de tokens, entrada de texto e imagem, um controle de esforço de raciocínio de alto nível no lugar de parâmetros de amostragem, chamada de ferramentas nativa e uma superfície compatível com OpenAI. Tem o preço de $3,00/$15,00 por milhão de tokens com uma taxa de leitura de cache de $0,30, e pontua 44 no index v4.3.2 — terceiro entre modelos de pesos abertos nesse quadro, atrás do 46 do MiMo-V2.6-Pro e do 45 do GLM-5.3. No mesmo quadro, pontua 85,0 no terminal-bench 2.1 e 59,5 no SciCode. Se o seu sistema multiagente precisa de um cérebro por agente, este é um cérebro que você pode alugar barato ou executar você mesmo.
Agora-2 é um tipo diferente de artefato. O que a Odyssey publicou é um relatório técnico de 23 páginas e uma prévia no navegador. O relatório descreve um ambiente de jogo de ação isométrico com representações explícitas para identidade, posição, saúde, animação, morte e reaparecimento de entidades; um modelo de simulação que prevê movimento, combate e animação a partir do histórico, das ações e da geometria local das entidades; e um modelo de renderização por participante que gera a visão individual daquele participante a partir de uma representação visual comprimida do estado compartilhado. Nada nessa descrição é um modelo de linguagem, e nada nela é baixável.
• O que é — Agora-2, um motor de jogo aprendido que renderiza 640×480 por vista, vs Kimi K3, um modelo de texto de pesos abertos com 2,8T de parâmetros
• Pontuação independente — Agora-2: nenhuma publicada vs Kimi K3 AA Intelligence Index 44 (v4.3.2), líder em pesos abertos
• Contexto — estado compartilhado do Agora-2 mais histórico limitado por visualização vs Kimi K3 1.048.576 tokens
• Preço — Agora-2: nenhum publicado, apenas pré-visualização no navegador vs. Kimi K3: US$ 3,00/US$ 15,00 por 1M, US$ 0,30 em cache
• Licença — Agora-2 público, sem pesos liberados vs Kimi K3 MIT modificada, pesos no Hugging Face
• Entradas — controles do navegador Agora-2 mais 16 políticas de agente RL vs texto e imagem do Kimi K3


O papel que cada um desempenha em um sistema multiagente
Esses dois só se encontram dentro de um sistema que contém ambos. O Kimi K3 é um candidato para a camada de decisão — o componente que lê a saída de ferramentas, escreve código e escolhe a próxima ação em um loop de longo horizonte. Sua janela de um milhão de tokens e a tarifa de US$ 0,30 para leitura em cache visam exatamente a carga de trabalho que os loops agênticos geram: contextos enormes e repetitivos que seriam ruinosos ao preço integral de entrada.
Agora-2 é um candidato para a camada abaixo — o ambiente. O enquadramento da própria Odyssey é que modelos de mundo multiagente permitem aos pesquisadores estudar como os agentes interagem "dentro de simulações controladas, nas quais o comportamento nocivo pode ser investigado sem expor sistemas do mundo real a riscos", uma frase que soa como uma resposta direta ao relatório METR, no qual cerca de 1.200 agentes coordenaram uma intrusão de dentro de um sandbox de avaliação. A política que comanda as dezesseis entidades autônomas do Agora-2 não é um LLM; é uma política escalar e espacial recorrente treinada com aprendizado por reforço, que consome um histórico de dezesseis observações e emite uma ação a cada quatro ticks de simulação. Se você quer saber o que um agente da classe Kimi K3 faz quando dezesseis oponentes também estão tomando decisões, Agora-2 é uma maneira de construir a arena. Não é uma maneira de substituir o agente.
Lendo os números dos dois lados
O 44 do Kimi K3 é medido por uma entidade que não trabalha para a Moonshot, no mesmo índice v4.3.2 que todos os outros modelos nesta página, e é a pontuação que o torna um modelo de fronteira de pesos abertos crível. Sua janela de contexto, preço e lista de modalidades são fatos publicados.
Os números do Agora-2 vêm do próprio relatório da Team Odyssey. O resultado principal é uma comparação de renderização: um renderizador de prefixo estruturado alcançando 30,11 dB de PSNR contra 20,67 dB de uma linha de base baseada em VAE em trinta clipes de monitoramento com três sementes de amostragem cada. O relatório faz questão de dizer que isso compara sistemas completos com orçamentos de treinamento não equiparados e não isola a arquitetura. O benchmark de condicionamento que mostra uma redução de 45,8% no tempo do denoiser em relação à atenção cruzada é executado em denoisers inicializados aleatoriamente com entradas sintéticas — um teste de custo de execução, explicitamente não uma medida de qualidade de imagem. A avaliação de simulação abrange movimento de passo único e previsão de animação em exemplos gravados reservados.
E a seção de limitações diz o resto. A meta de exibição de 30 quadros por segundo e a cadência de 15 atualizações latentes por segundo são declaradas como metas; taxa de quadros sustentada e latência de entrada para exibição durante jogo ao vivo com múltiplos agentes não foram avaliadas quantitativamente. Qualidade visual de horizonte longo, concordância entre vistas e aderência de ações ponta a ponta não foram avaliadas. Existe variação de layout procedural dentro do domínio de treinamento, mas a transferência para novos ativos, regras ou ambientes não foi testada. Isso não é uma crítica à Odyssey — o relatório é mais franco sobre suas próprias lacunas do que a maioria dos materiais de lançamento —, mas é o prior correto para qualquer coisa que você leia sobre as capacidades do Agora-2.
Qual deles você pode desenvolver esta semana
Se você precisa de um modelo de pesos abertos de fronteira em produção, a resposta é o Kimi K3 e não há nada perto. Seu 44 independente, sua janela de um milhão de tokens, sua entrada de imagem e sua tarifa de $3/$15 com leituras de cache baratas formam um pacote implantável que está no mercado desde julho. No OrcaRouter, ele é servido pelo preço de tabela da própria Moonshot, sem nenhuma margem, o que importa mais do que o normal para este modelo: um loop de agente de contexto longo gasta a maior parte de seus tokens em prefixos repetidos, e a taxa de leitura de cache de $0.30 repassada sem alteração é a diferença entre uma frota que é acessível e uma que não é. O failover automático entre provedores é a segunda metade disso — quanto mais longo o loop, mais caro fica uma falha de provedor no meio da execução.

Agora-2 não tem tabela de preços, então não há nada para rotear e não o hospedamos. O que ele oferece a uma equipe multiagente é uma prévia de pesquisa de um ambiente que pode ser jogado hoje em um navegador, respaldado por um relatório público de arquitetura, em uma categoria que até agora não tinha um simulador de mundo compartilhado fora de um motor de jogo. Se o seu interesse está no que os agentes fazem uns com os outros, isso é uma coisa genuinamente útil de se ter e vale uma tarde. Se o seu interesse está no que os agentes podem fazer, o Kimi K3 é o modelo, e o modelo de mundo não é um substituto para ele — os dois ficam em camadas diferentes da mesma pilha, e apenas uma dessas camadas tem um preço que você pode colocar em uma planilha.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
