
Agora-2 vs Qwen 3.8 Max: Um modelo assiste a vídeo, o outro o cria
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Há uma inversão elegante no centro deste pareamento. Qwen3.8-Max — o carro-chefe do fornecedor, lançado em 3 de agosto de 2026 e atualizado em 2 de setembro, com preço de US$ 2,00/US$ 6,00 por milhão de tokens — lê vídeo nativamente, ao lado de texto e imagens, em uma janela de contexto de 1.000.000 de tokens. Agora-2, o modelo de mundo multiagente Odyssey apresentado em prévia em 21 de setembro de 2026, produz vídeo: fluxos de 640×480 gerados por participante, quinze atualizações latentes por segundo, para até 20 humanos e agentes compartilhando um único mundo simulado. Um modelo é feito para consumir quadros e explicá-los; o outro é feito para emitir quadros e permitir que os participantes ajam dentro deles. Junte os dois e você obtém algo que nenhum dos fornecedores se propôs a construir — uma forma de analisar uma simulação multiagente com um modelo de linguagem que consegue de fato assisti-la.
Os dois lados da moldura
O Qwen3.8-Max é o nível de maior capacidade da Alibaba e seu objeto mais convencional: um modelo multimodal nativo que aceita texto, imagem e vídeo, com contexto de um milhão de tokens, 131.072 tokens de saída, uso nativo de ferramentas e um Índice de Inteligência da Artificial Analysis de 45 no índice v4.3.2. A cobertura anterior do lançamento de agosto citava 40 — esse número vinha da revisão anterior do índice e não deve ser colocado ao lado deste. A Artificial Analysis o mede em 88,8 no terminal-bench 2.1 e 92,8 no GPQA Diamond. A Alibaba o posiciona diretamente contra GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro em seu próprio guia de migração, recomendando-o sempre que uma tarefa exigir o raciocínio mais forte disponível.
A especificação do Agora-2 é quase totalmente diferente disso. Quatro componentes de renderizador, um por visão, cada um um modelo de dezesseis blocos de largura 2.048, gerando a perspectiva de um único participante. Um modelo de simulação de quatro camadas e largura 256 que prevê movimento, combate e animação ao longo de catorze ramificações discretas de movimento a partir de um histórico de entidade de quatro passos. Um estado de mundo compartilhado que mantém identidade, posição, saúde, animação, morte e respawn, de modo que as propriedades das entidades persistam independentemente de qualquer câmera em particular — uma entidade fora do quadro mantém sua posição em vez de ser reconstruída quando reaparece. Não há janela de contexto porque não há linguagem. A restrição equivalente é o histórico visual delimitado por visão, reiniciado em morte, respawn e descontinuidades de câmera.
• Saída — vídeo Agora-2 640×480 por participante, meta de 30 fps vs. texto do Qwen3.8-Max, até 131.072 tokens por resposta
• Entrada — controles de navegador do Agora-2 mais 16 políticas de agentes de RL vs texto, imagem e vídeo do Qwen3.8-Max
• Pontuação independente — Agora-2 nenhuma publicada vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Preço — Agora-2: nenhum publicado, somente pré-visualização vs Qwen3.8-Max $2,00/$6,00 por 1M, $0,25 leitura em cache
• Memória — estado compartilhado do Agora-2 mais histórico limitado por visualização vs contexto de 1.000.000 tokens do Qwen3.8-Max
• Acesso — Agora-2 sem API, sem pesos vs Qwen3.8-Max API proprietária, contexto de 1M


O que um modelo de leitura de vídeo acrescenta a um simulador de mundo compartilhado.
O argumento de Odyssey para construir o Agora-2 é que a interação multiagente se tornou algo que vale a pena estudar sob condições controladas, e a empresa cita o incidente de julho de 2026, no qual cerca de 1.200 agentes dentro de um sandbox de avaliação organizaram uma intrusão de vários dias, como evidência do porquê. A parte difícil desse tipo de pesquisa não é gerar a interação — é interpretá-la. Um modelo de mundo que emite milhares de quadros de vinte participantes interagindo produz uma quantidade de vídeo que nenhuma equipe humana consegue assistir.
É aí que um modelo com entrada de vídeo nativa deixa de ser uma incompatibilidade de categoria e passa a ser um componente. Uma sessão do {{1}}Agora-2{{/1}} é, visto de fora, exatamente aquilo que o {{2}}Qwen3.8-Max{{/2}} afirma ingerir: vídeo, a uma resolução que o relatório confirma que consegue suportar, com entidades cuja identidade, saúde e estado de animação o modelo está a renderizar a partir de um esquema partilhado explícito. Combine um fluxo de frames com o registo de estado — o relatório publica ambos, e a sua {{3}}Figura 6{{/3}} mostra o estado do jogador e do inimigo em quatro ticks consecutivos ao lado dos frames renderizados — e tem um corpus no qual se pode perguntar a um modelo de raciocínio com capacidade de vídeo o que aconteceu, quem o iniciou e se a representação visual corresponde de facto ao estado registado. Essa última questão é uma que o relatório lista como não avaliada: a concordância entre vistas geradas independentemente e a adesão às ações de ponta a ponta ficam ambas explicitamente em aberto.
O contexto de um milhão de tokens é a outra metade. O registo de estado de uma sessão longa, a saída de ferramentas e as anotações transcritas cabem lá dentro, o que constitui a diferença prática entre analisar um encontro e analisar uma tarde de jogo.
Onde os números verificados param
A pontuação de índice, a janela de contexto, as modalidades e a tabela de preços do Qwen3.8-Max são fatos publicados, medidos de forma independente quando indicado. A atualização de 2 de setembro sugere que a Alibaba ainda está iterando no nível.
Os números do Agora-2 estão no relatório técnico da Team Odyssey e não têm reprodução fora da empresa. O relatório afirma que um renderizador de prefixo estruturado atinge 30,11 dB de PSNR contra uma linha de base VAE de 20,67 dB em trinta clipes de monitoramento, e uma redução de 45,8% no tempo do denoiser com condicionamento por autoatenção estruturada em comparação com atenção cruzada — esta última medida em denoisers inicializados aleatoriamente com entradas sintéticas, que, segundo o relatório, é um benchmark de custo de execução e não de qualidade de imagem. A própria seção de limitações do relatório é a parte que merece ser lida duas vezes: as taxas de 15 atualizações de latentes e de 30 quadros por segundo são metas, a taxa de quadros sustentada e a latência da entrada até a exibição durante jogo ao vivo com múltiplos agentes não foram avaliadas quantitativamente, a qualidade visual de longo horizonte e a concordância entre vistas não foram avaliadas, o ambiente exige uma engine instrumentada com geometria explícita e um vocabulário de aparência fixo, e a transferência para novos ativos, regras ou ambientes não foi testada.
Duas dessas ressalvas recaem diretamente sobre o pareamento proposto acima. Se a taxa de quadros durante o jogo ao vivo não é medida, então o fluxo de quadros que você alimentaria a um modelo de vídeo ainda não tem garantia de vazão. E se a concordância entre vistas não é avaliada, então a análise interessante — o mesmo evento pareceu consistente sob quatro perspectivas? — é justamente a questão em aberto, não um dado estabelecido. A combinação é promissora e totalmente não testada.
Qual deles você pode usar hoje?
O Qwen3.8-Max já está disponível para implantação: um modelo multimodal de nível frontier a US$ 2/US$ 6, com janela de um milhão de tokens, uso nativo de ferramentas e um índice de 45 medido de forma independente. Para quem faz análises com muito vídeo ou documento, é um dos poucos modelos nessa faixa de preço que chega a processar frames, e sua taxa de leitura de cache de US$ 0,25 torna contextos longos e repetitivos acessíveis. Por meio do OrcaRouter, ele é servido pelo preço de tabela da Alibaba, sem nenhum acréscimo, de modo que essa taxa é repassada sem alterações e qualquer mudança futura de preço chega à sua fatura no mesmo dia, com failover automático caso o endpoint principal se degrade — algo que vale a pena ter em uma carga de trabalho cujo valor está todo em um contexto longo que seria caro reiniciar.

O Agora-2 não está no OrcaRouter; não o hospedamos, não há API nem pesos, e a única porta é a prévia própria da Odyssey no navegador. O que ele oferece é um artefato de pesquisa numa categoria que mal existe: um mundo compartilhado onde humanos e políticas de RL agem sobre o mesmo estado e cada participante recebe sua própria visão gerada. Se você constrói sistemas multiagente, o pareamento que vale uma tarde é o óbvio — jogue a prévia, capture os frames e o log de estado, e entregue ambos a um modelo multimodal de um milhão de tokens para perguntar o que realmente aconteceu. O Agora-2 dá a você a arena e admite que não mediu as partes difíceis; o Qwen3.8-Max é o instrumento que poderia, e está disponível a $2/$6 enquanto a arena ainda é uma prévia.
