Cartão de título gerado para Agora-2 vs Qwen 3.8 Max, com o subtítulo 'Um modelo assiste a vídeo, o outro o cria'. Três cartões: 'Qwen3.8-Max: Índice AA 45, US$ 2/US$ 6 por 1M, contexto de 1M'; 'Qwen3.8-Max: lê texto, imagem e vídeo'; 'Agora-2: gera vídeo 640x480 por participante, sem API'. O rodapé diz 'Qwen3.8-Max conforme a Artificial Analysis; Agora-2 relatado pelo fornecedor e não reproduzido.'
Guides & Insights

Agora-2 vs Qwen 3.8 Max: Um modelo assiste a vídeo, o outro o cria

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma inversão elegante no centro deste pareamento. Qwen3.8-Max — o carro-chefe do fornecedor, lançado em 3 de agosto de 2026 e atualizado em 2 de setembro, com preço de US$ 2,00/US$ 6,00 por milhão de tokens — lê vídeo nativamente, ao lado de texto e imagens, em uma janela de contexto de 1.000.000 de tokens. Agora-2, o modelo de mundo multiagente Odyssey apresentado em prévia em 21 de setembro de 2026, produz vídeo: fluxos de 640×480 gerados por participante, quinze atualizações latentes por segundo, para até 20 humanos e agentes compartilhando um único mundo simulado. Um modelo é feito para consumir quadros e explicá-los; o outro é feito para emitir quadros e permitir que os participantes ajam dentro deles. Junte os dois e você obtém algo que nenhum dos fornecedores se propôs a construir — uma forma de analisar uma simulação multiagente com um modelo de linguagem que consegue de fato assisti-la.

Os dois lados da moldura

O Qwen3.8-Max é o nível de maior capacidade da Alibaba e seu objeto mais convencional: um modelo multimodal nativo que aceita texto, imagem e vídeo, com contexto de um milhão de tokens, 131.072 tokens de saída, uso nativo de ferramentas e um Índice de Inteligência da Artificial Analysis de 45 no índice v4.3.2. A cobertura anterior do lançamento de agosto citava 40 — esse número vinha da revisão anterior do índice e não deve ser colocado ao lado deste. A Artificial Analysis o mede em 88,8 no terminal-bench 2.1 e 92,8 no GPQA Diamond. A Alibaba o posiciona diretamente contra GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro em seu próprio guia de migração, recomendando-o sempre que uma tarefa exigir o raciocínio mais forte disponível.

A especificação do Agora-2 é quase totalmente diferente disso. Quatro componentes de renderizador, um por visão, cada um um modelo de dezesseis blocos de largura 2.048, gerando a perspectiva de um único participante. Um modelo de simulação de quatro camadas e largura 256 que prevê movimento, combate e animação ao longo de catorze ramificações discretas de movimento a partir de um histórico de entidade de quatro passos. Um estado de mundo compartilhado que mantém identidade, posição, saúde, animação, morte e respawn, de modo que as propriedades das entidades persistam independentemente de qualquer câmera em particular — uma entidade fora do quadro mantém sua posição em vez de ser reconstruída quando reaparece. Não há janela de contexto porque não há linguagem. A restrição equivalente é o histórico visual delimitado por visão, reiniciado em morte, respawn e descontinuidades de câmera.

• Saída — vídeo Agora-2 640×480 por participante, meta de 30 fps vs. texto do Qwen3.8-Max, até 131.072 tokens por resposta

• Entrada — controles de navegador do Agora-2 mais 16 políticas de agentes de RL vs texto, imagem e vídeo do Qwen3.8-Max

• Pontuação independente — Agora-2 nenhuma publicada vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• Preço — Agora-2: nenhum publicado, somente pré-visualização vs Qwen3.8-Max $2,00/$6,00 por 1M, $0,25 leitura em cache

• Memória — estado compartilhado do Agora-2 mais histórico limitado por visualização vs contexto de 1.000.000 tokens do Qwen3.8-Max

• Acesso — Agora-2 sem API, sem pesos vs Qwen3.8-Max API proprietária, contexto de 1M

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

O que um modelo de leitura de vídeo acrescenta a um simulador de mundo compartilhado.

O argumento de Odyssey para construir o Agora-2 é que a interação multiagente se tornou algo que vale a pena estudar sob condições controladas, e a empresa cita o incidente de julho de 2026, no qual cerca de 1.200 agentes dentro de um sandbox de avaliação organizaram uma intrusão de vários dias, como evidência do porquê. A parte difícil desse tipo de pesquisa não é gerar a interação — é interpretá-la. Um modelo de mundo que emite milhares de quadros de vinte participantes interagindo produz uma quantidade de vídeo que nenhuma equipe humana consegue assistir.

É aí que um modelo com entrada de vídeo nativa deixa de ser uma incompatibilidade de categoria e passa a ser um componente. Uma sessão do {{1}}Agora-2{{/1}} é, visto de fora, exatamente aquilo que o {{2}}Qwen3.8-Max{{/2}} afirma ingerir: vídeo, a uma resolução que o relatório confirma que consegue suportar, com entidades cuja identidade, saúde e estado de animação o modelo está a renderizar a partir de um esquema partilhado explícito. Combine um fluxo de frames com o registo de estado — o relatório publica ambos, e a sua {{3}}Figura 6{{/3}} mostra o estado do jogador e do inimigo em quatro ticks consecutivos ao lado dos frames renderizados — e tem um corpus no qual se pode perguntar a um modelo de raciocínio com capacidade de vídeo o que aconteceu, quem o iniciou e se a representação visual corresponde de facto ao estado registado. Essa última questão é uma que o relatório lista como não avaliada: a concordância entre vistas geradas independentemente e a adesão às ações de ponta a ponta ficam ambas explicitamente em aberto.

O contexto de um milhão de tokens é a outra metade. O registo de estado de uma sessão longa, a saída de ferramentas e as anotações transcritas cabem lá dentro, o que constitui a diferença prática entre analisar um encontro e analisar uma tarde de jogo.

Onde os números verificados param

A pontuação de índice, a janela de contexto, as modalidades e a tabela de preços do Qwen3.8-Max são fatos publicados, medidos de forma independente quando indicado. A atualização de 2 de setembro sugere que a Alibaba ainda está iterando no nível.

Os números do Agora-2 estão no relatório técnico da Team Odyssey e não têm reprodução fora da empresa. O relatório afirma que um renderizador de prefixo estruturado atinge 30,11 dB de PSNR contra uma linha de base VAE de 20,67 dB em trinta clipes de monitoramento, e uma redução de 45,8% no tempo do denoiser com condicionamento por autoatenção estruturada em comparação com atenção cruzada — esta última medida em denoisers inicializados aleatoriamente com entradas sintéticas, que, segundo o relatório, é um benchmark de custo de execução e não de qualidade de imagem. A própria seção de limitações do relatório é a parte que merece ser lida duas vezes: as taxas de 15 atualizações de latentes e de 30 quadros por segundo são metas, a taxa de quadros sustentada e a latência da entrada até a exibição durante jogo ao vivo com múltiplos agentes não foram avaliadas quantitativamente, a qualidade visual de longo horizonte e a concordância entre vistas não foram avaliadas, o ambiente exige uma engine instrumentada com geometria explícita e um vocabulário de aparência fixo, e a transferência para novos ativos, regras ou ambientes não foi testada.

Duas dessas ressalvas recaem diretamente sobre o pareamento proposto acima. Se a taxa de quadros durante o jogo ao vivo não é medida, então o fluxo de quadros que você alimentaria a um modelo de vídeo ainda não tem garantia de vazão. E se a concordância entre vistas não é avaliada, então a análise interessante — o mesmo evento pareceu consistente sob quatro perspectivas? — é justamente a questão em aberto, não um dado estabelecido. A combinação é promissora e totalmente não testada.

Qual deles você pode usar hoje?

O Qwen3.8-Max já está disponível para implantação: um modelo multimodal de nível frontier a US$ 2/US$ 6, com janela de um milhão de tokens, uso nativo de ferramentas e um índice de 45 medido de forma independente. Para quem faz análises com muito vídeo ou documento, é um dos poucos modelos nessa faixa de preço que chega a processar frames, e sua taxa de leitura de cache de US$ 0,25 torna contextos longos e repetitivos acessíveis. Por meio do OrcaRouter, ele é servido pelo preço de tabela da Alibaba, sem nenhum acréscimo, de modo que essa taxa é repassada sem alterações e qualquer mudança futura de preço chega à sua fatura no mesmo dia, com failover automático caso o endpoint principal se degrade — algo que vale a pena ter em uma carga de trabalho cujo valor está todo em um contexto longo que seria caro reiniciar.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

O Agora-2 não está no OrcaRouter; não o hospedamos, não há API nem pesos, e a única porta é a prévia própria da Odyssey no navegador. O que ele oferece é um artefato de pesquisa numa categoria que mal existe: um mundo compartilhado onde humanos e políticas de RL agem sobre o mesmo estado e cada participante recebe sua própria visão gerada. Se você constrói sistemas multiagente, o pareamento que vale uma tarde é o óbvio — jogue a prévia, capture os frames e o log de estado, e entregue ambos a um modelo multimodal de um milhão de tokens para perguntar o que realmente aconteceu. O Agora-2 dá a você a arena e admite que não mediu as partes difíceis; o Qwen3.8-Max é o instrumento que poderia, e está disponível a $2/$6 enquanto a arena ainda é uma prévia.