
Agora-2 vs Qwen 3.8 Max: Un modelo ve vídeo, el otro lo crea
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Hay una elegante inversión en el centro de este emparejamiento. Qwen3.8-Max —el producto estrella del proveedor, lanzado el 3 de agosto de 2026 y actualizado el 2 de septiembre, con un precio de 2,00 $/6,00 $ por millón de tokens— lee vídeo de forma nativa, junto con texto e imágenes, a lo largo de una ventana de contexto de 1.000.000 de tokens. Agora-2, el modelo de mundo multiagente Odyssey, presentado el 21 de septiembre de 2026, produce vídeo: flujos de 640×480 generados por participante, quince actualizaciones latentes por segundo, para hasta 20 humanos y agentes que comparten un mismo mundo simulado. Un modelo está diseñado para consumir fotogramas y explicarlos; el otro está diseñado para emitir fotogramas y permitir que los participantes actúen dentro de ellos. Si los juntas, obtienes algo que ningún proveedor se propuso construir: una forma de analizar una simulación multiagente con un modelo de lenguaje que realmente pueda verla.
Los dos lados del marco
Qwen3.8-Max es el nivel de mayor capacidad de Alibaba y su objeto más convencional: un modelo multimodal nativo que acepta texto, imagen y video, con un contexto de un millón de tokens, 131.072 tokens de salida, uso nativo de herramientas y un Artificial Analysis Intelligence Index de 45 en el índice v4.3.2. La cobertura anterior del lanzamiento de agosto citaba 40; esa cifra provenía de la revisión previa del índice y no debe compararse con esta. Artificial Analysis lo mide en 88,8 en terminal-bench 2.1 y 92,8 en GPQA Diamond. Alibaba lo posiciona directamente frente a GPT-5.5, Claude Opus 4.7 y Gemini 3.1 Pro en su propia guía de migración, recomendándolo siempre que una tarea requiera el razonamiento más potente disponible.
La especificación de Agora-2 es casi completamente distinta de eso. Cuatro componentes de renderizado, uno por vista, cada uno un modelo de dieciséis bloques de ancho 2.048 que genera la perspectiva de un único participante. Un modelo de simulación de cuatro capas y 256 de ancho que predice movimiento, combate y animación a través de catorce ramas de movimiento discretas a partir de un historial de entidad de cuatro pasos. Un estado de mundo compartido que contiene identidad, posición, salud, animación, muerte y reaparición, de modo que las propiedades de la entidad persisten independientemente de cualquier cámara en particular — una entidad fuera de cuadro conserva su posición en lugar de ser reconstruida cuando reaparece. No hay ventana de contexto porque no hay lenguaje. La restricción equivalente es el historial visual delimitado por vista, que se restablece en muerte, reaparición y discontinuidades de cámara.
• Salida — vídeo Agora-2 de 640×480 por participante, objetivo de 30 fps frente a texto de Qwen3.8-Max, hasta 131.072 tokens por respuesta
• Entrada — controles del navegador Agora-2 más 16 políticas de agentes RL vs texto, imagen y video de Qwen3.8-Max
• Puntuación independiente — Agora-2: ninguna publicada frente a Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Precio — Agora-2: ninguno publicado, solo vista previa vs Qwen3.8-Max $2.00/$6.00 por 1M, $0.25 lectura en caché
• Memoria — estado compartido de Agora-2 más historial acotado por vista frente al contexto de 1,000,000 de tokens de Qwen3.8-Max
• Acceso — Agora-2 sin API ni pesos frente a la API propietaria de Qwen3.8-Max, contexto de 1M


Qué aporta un modelo de lectura de video a un simulador de mundo compartido
El argumento de Odyssey para construir Agora-2 es que la interacción multiagente se ha convertido en algo que vale la pena estudiar bajo condiciones controladas, y la empresa cita el incidente de julio de 2026, en el que aproximadamente 1.200 agentes dentro de un sandbox de evaluación organizaron una intrusión de varios días, como evidencia de por qué. La parte difícil de ese tipo de investigación no es generar la interacción, sino interpretarla. Un modelo del mundo que emite miles de fotogramas de veinte participantes interactuando produce una cantidad de metraje que ningún equipo humano puede ver.
Ahí es donde un modelo con entrada de video nativa deja de ser una categoría incompatible y se convierte en un componente. Una sesión de Agora-2 es, desde fuera, exactamente lo que Qwen3.8-Max afirma ingerir: video, a una resolución que el informe confirma que puede manejar, con entidades cuya identidad, salud y estado de animación el modelo está renderizando a partir de un esquema compartido explícito. Empareja un flujo de fotogramas con el registro de estado —el informe publica ambos, y su Figura 6 muestra el estado del jugador y del enemigo en cuatro ticks consecutivos junto a los fotogramas renderizados— y tienes un corpus donde a un modelo de razonamiento capaz de procesar video se le puede preguntar qué ocurrió, quién lo inició y si la representación visual realmente coincide con el estado registrado. Esa última pregunta es una que el informe enumera como no evaluada: tanto la concordancia entre vistas generadas de forma independiente como la adherencia de las acciones de extremo a extremo quedan explícitamente abiertas.
El contexto de un millón de tokens es la otra mitad. El registro de estado de una sesión larga, la salida de las herramientas y las anotaciones transcritas caben en él, lo cual supone la diferencia práctica entre analizar un encuentro y analizar una tarde de juego.
Donde terminan los números verificados
La puntuación de índice de Qwen3.8-Max, su ventana de contexto, sus modalidades y su tarjeta de tarifas son datos publicados, medidos de forma independiente donde se indica. Su actualización del 2 de septiembre sugiere que Alibaba sigue iterando en el nivel.
Las cifras de Agora-2 figuran en el informe técnico de Team Odyssey y no tienen reproducción fuera de la empresa. El informe afirma que un renderizador de prefijo estructurado alcanza 30,11 dB de PSNR frente a una línea base de VAE de 20,67 dB en treinta clips de monitorización, y una reducción del 45,8 % en el tiempo del denoiser gracias al condicionamiento de autoatención estructurada frente a la atención cruzada; esto último se midió con denoisers inicializados aleatoriamente y entradas sintéticas, lo cual, según indica el informe, es una referencia de coste de ejecución y no de calidad de imagen. Su propia sección de limitaciones es la parte que hay que leer dos veces: las tasas de 15 actualizaciones de latentes y 30 fotogramas por segundo son objetivos, la tasa de fotogramas sostenida y la latencia de entrada a pantalla durante el juego en vivo con múltiples agentes no se han evaluado cuantitativamente, la calidad visual a largo plazo y la concordancia entre vistas no se han evaluado, el entorno requiere un motor instrumentado con geometría explícita y un vocabulario de apariencia fijo, y la transferencia a nuevos activos, reglas o entornos no se ha probado.
Dos de esas salvedades recaen directamente sobre el emparejamiento propuesto arriba. Si la tasa de fotogramas durante el juego en vivo no se mide, entonces el flujo de fotogramas que alimentaría a un modelo de vídeo aún no tiene ninguna garantía de caudal. Y si no se evalúa la concordancia entre vistas, entonces el análisis interesante —¿el mismo evento se veía de forma consistente desde cuatro perspectivas?— es precisamente la cuestión abierta, no un dato de entrada ya resuelto. La combinación es prometedora y totalmente sin probar.
¿Cuál puedes usar hoy?
Qwen3.8-Max ya se puede desplegar: un modelo multimodal de clase frontera a $2/$6 con una ventana de un millón de tokens, uso nativo de herramientas y un índice de 45 medido de forma independiente. Para cualquiera que haga análisis con mucho vídeo o documentos, es uno de los pocos modelos de ese rango de precio que ingiere fotogramas, y su tarifa de $0.25 por lectura de caché hace asequibles los contextos largos y repetitivos. A través de OrcaRouter se sirve al precio de lista de Alibaba sin ningún margen, por lo que esa tarifa se traslada sin cambios y cualquier movimiento de precio futuro llega a tu factura el mismo día, con conmutación por error automática si el endpoint principal se degrada — algo que conviene tener en una carga de trabajo cuyo valor reside por completo en un contexto largo que sería caro reiniciar.

Agora-2 no está en OrcaRouter; no lo alojamos, no hay API ni pesos, y la única puerta es la propia vista previa en el navegador de Odyssey. Lo que ofrece es un artefacto de investigación en una categoría que apenas existe: un mundo compartido donde los humanos y las políticas de RL actúan sobre el mismo estado y cada participante obtiene su propia vista generada. Si construyes sistemas multiagente, la combinación que merece una tarde es la obvia: juega la vista previa, captura los fotogramas y el registro de estado, y entrégale ambos a un modelo multimodal de un millón de tokens para preguntar qué ocurrió realmente. Agora-2 te da la arena y admite que no ha medido las partes difíciles; Qwen3.8-Max es el instrumento que podría hacerlo, y está disponible a $2/$6 mientras la arena sigue siendo una vista previa.
