Сгенерированная титульная карточка для Agora-2 против Qwen 3.8 Max с подзаголовком «Одна модель смотрит видео, другая его создаёт». Три карточки: «Qwen3.8-Max: AA Index 45, $2/$6 за 1 млн, контекст 1 млн»; «Qwen3.8-Max: читает текст, изображения и видео»; «Agora-2: генерирует видео 640x480 для каждого участника, без API». В нижнем колонтитуле указано: «Qwen3.8-Max по данным Artificial Analysis; Agora-2 — заявлено производителем и не воспроизведено».
Guides & Insights

Agora-2 против Qwen 3.8 Max: одна модель смотрит видео, другая — создаёт его

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В центре этого сопоставления есть изящная инверсия. Qwen3.8-Max — флагманская модель вендора, выпущенная 3 августа 2026 года и обновлённая 2 сентября, по цене $2.00/$6.00 за миллион токенов — нативно читает видео наряду с текстом и изображениями в контекстном окне на 1 000 000 токенов. Agora-2, мультиагентная мировая модель, которую Odyssey представила 21 сентября 2026 года, порождает видео: потоки 640×480, генерируемые для каждого участника, пятнадцать латентных обновлений в секунду, для вплоть до 20 человек и агентов, совместно использующих один симулированный мир. Одна модель создана для того, чтобы потреблять кадры и объяснять их; другая — чтобы порождать кадры и позволять участникам действовать внутри них. Соедините их вместе — и получите нечто такое, что не собирался создавать ни один из вендоров: способ анализировать мультиагентную симуляцию с помощью языковой модели, которая действительно способна за ней наблюдать.

Две стороны рамки

Qwen3.8-Max — самый мощный уровень Alibaba и её самый обычный объект: нативная мультимодальная модель, принимающая текст, изображения и видео, с контекстом в миллион токенов, объёмом вывода в 131 072 токена, нативным использованием инструментов и индексом интеллекта Artificial Analysis, равным 45 в версии индекса v4.3.2. В более ранних публикациях об августовском запуске приводилась цифра 40 — она взята из предыдущей редакции индекса, и её не следует ставить рядом с этой. Artificial Analysis оценивает её в 88,8 по terminal-bench 2.1 и 92,8 по GPQA Diamond. Alibaba позиционирует её напрямую против GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro в собственном руководстве по миграции, рекомендуя её всякий раз, когда задаче требуется самое сильное доступное рассуждение.

Спецификация Agora-2 почти полностью не похожа на это. Четыре компонента рендеринга, по одному на вид, каждый — модель из шестнадцати блоков шириной 2 048, генерирующая перспективу одного участника. Модель симуляции из четырёх слоёв шириной 256, которая предсказывает движение, бой и анимацию по четырнадцати дискретным ветвям движения на основе истории сущности из четырёх шагов. Общее состояние мира, хранящее идентичность, позицию, здоровье, анимацию, смерть и возрождение, так что свойства сущности сохраняются независимо от конкретной камеры — сущность за пределами кадра сохраняет свою позицию, а не реконструируется, когда снова появляется. Контекстного окна нет, потому что нет языка. Эквивалентное ограничение — это ограниченная визуальная история по каждому виду, сбрасываемая при смерти, возрождении и разрывах камеры.

• Выход — видео Agora-2 640×480 на каждого участника, целевые 30 кадр/с против текста Qwen3.8-Max, до 131 072 токенов на ответ

• Ввод — браузерные элементы управления Agora-2 плюс 16 политик RL-агентов против текста, изображения и видео Qwen3.8-Max

• Независимая оценка — Agora-2: не опубликована, в сравнении с Qwen3.8-Max: AA Intelligence Index 45 (v4.3.2)

• Цена — Agora-2: не опубликована, только предварительный просмотр; в сравнении с Qwen3.8-Max — $2,00/$6,00 за 1 млн, $0,25 за чтение из кэша

• Память — общее состояние Agora-2 плюс ограниченная история по каждому представлению в сравнении с контекстом Qwen3.8-Max на 1 000 000 токенов

• Доступ — Agora-2: без API, без весов, в отличие от проприетарного API Qwen3.8-Max, контекст 1M

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Что модель чтения видео добавляет к симулятору общего мира

Аргумент Odyssey в пользу создания Agora-2 состоит в том, что взаимодействие нескольких агентов стало чем-то, что стоит изучать в контролируемых условиях, и компания ссылается на инцидент в июле 2026 года, когда примерно 1200 агентов внутри песочницы для оценки организовали многодневное вторжение, как доказательство того, почему. Сложная часть такого рода исследований — не генерирование взаимодействия, а его интерпретация. Модель мира, которая выдаёт тысячи кадров с двадцатью взаимодействующими участниками, создаёт такой объём видеоматериала, который не под силу просмотреть ни одной команде людей.

Именно здесь модель с нативным видеовходом перестаёт быть категориальным несоответствием и становится компонентом. Сессия Agora-2 с внешней стороны — это ровно то, что Qwen3.8-Max заявляет как принимаемое: видео, с разрешением, которое отчёт подтверждает как обрабатываемое, с сущностями, чьи идентичность, здоровье и состояние анимации модель отрисовывает из явной общей схемы. Сопоставьте поток кадров с журналом состояний — отчёт публикует и то, и другое, а его рисунок 6 показывает состояние игрока и врага на четырёх последовательных тактах рядом с отрисованными кадрами — и вы получите корпус, в котором рассуждающую модель, способную работать с видео, можно спросить, что произошло, кто это инициировал и действительно ли визуальное изображение соответствует записанному состоянию. Этот последний вопрос отчёт перечисляет как неоценённый: согласованность между независимо сгенерированными представлениями и сквозное соблюдение действий — и то, и другое явно оставлены открытыми.

Контекст размером в миллион токенов — это вторая половина. Журнал состояния длинной сессии, вывод инструментов и расшифрованные аннотации помещаются в него, и это практическая разница между анализом одной встречи и анализом целого дня игры.

Где заканчиваются проверенные числа

Оценка Qwen3.8-Max в индексе, контекстное окно, модальности и тарифная сетка — это опубликованные факты, независимо измеренные там, где это отмечено. Его обновление от 2 сентября позволяет предположить, что Alibaba всё ещё дорабатывает этот уровень.

Показатели Agora-2 содержатся в техническом отчёте Team Odyssey и за пределами компании не воспроизводятся. В отчёте утверждается, что рендерер со структурированным префиксом достигает 30,11 дБ PSNR против базового уровня VAE в 20,67 дБ на тридцати клипах мониторинга, а также сокращение времени работы денойзера на 45,8% благодаря обусловливанию структурированным самовниманием по сравнению с перекрёстным вниманием — причём последнее измерено на случайно инициализированных денойзерах с синтетическими входными данными, и отчёт указывает, что это бенчмарк стоимости выполнения, а не качества изображения. Его собственный раздел ограничений — это то, что стоит перечитать: показатели в 15 обновлений латентного представления и 30 кадров в секунду являются целевыми, устойчивая частота кадров и задержка от ввода до отображения во время живой игры с несколькими агентами не оценивались количественно, долгосрочное визуальное качество и согласованность между ракурсами не оценены, среда требует инструментированного движка с явной геометрией и фиксированным словарём внешнего вида, а перенос на новые ассеты, правила или среды не проверен.

Два из этих предостережений бьют прямо по предложенной выше паре. Если частота кадров во время игры в реальном времени не измеряется, то у потока кадров, который вы бы подали видеомодели, пока нет гарантии пропускной способности. А если согласованность между ракурсами не оценивается, то интересный анализ — выглядело ли одно и то же событие согласованно с четырёх точек зрения — как раз и есть открытый вопрос, а не установленный вход. Это сочетание перспективно и совершенно не проверено.

Какой из них вы можете использовать сегодня

Qwen3.8-Max уже доступна для развертывания: мультимодальная модель передового класса за $2/$6 с окном в миллион токенов, встроенной поддержкой инструментов и независимо измеренным индексом 45. Для тех, кто выполняет интенсивный анализ видео или документов, это одна из немногих моделей в этой ценовой категории, которая вообще обрабатывает кадры, а ее тариф на чтение из кэша в $0.25 делает длинные повторяющиеся контексты доступными. Через OrcaRouter она предоставляется по каталожной цене Alibaba без наценки, так что этот тариф передается без изменений, и любое будущее изменение цены отражается в вашем счете в тот же день, при этом автоматическое переключение при деградации основного эндпоинта — стоит иметь для рабочей нагрузки, вся ценность которой заключается в длинном контексте, который было бы дорого перезапускать.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 нет на OrcaRouter; мы его не размещаем, API и весов не существует, и единственная дверь — собственный браузерный предпросмотр Odyssey. То, что он предлагает, — это исследовательский артефакт в категории, которая едва существует: общий мир, где люди и RL-политики действуют на одном и том же состоянии и каждый участник получает собственное сгенерированное представление. Если вы строите мультиагентные системы, очевидное сочетание, ради которого стоит потратить день, — это запустить предпросмотр, зафиксировать кадры и журнал состояний и передать и то и другое мультимодальной модели на миллион токенов, чтобы спросить, что на самом деле произошло. Agora-2 даёт вам арену и признаёт, что не измерил самые трудные аспекты; Qwen3.8-Max — инструмент, который мог бы это сделать, и он доступен за $2/$6, пока арена всё ещё в режиме предпросмотра.