
Agora-2 против Qwen 3.8 Max: одна модель смотрит видео, другая — создаёт его
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
В центре этого сопоставления есть изящная инверсия. Qwen3.8-Max — флагманская модель вендора, выпущенная 3 августа 2026 года и обновлённая 2 сентября, по цене $2.00/$6.00 за миллион токенов — нативно читает видео наряду с текстом и изображениями в контекстном окне на 1 000 000 токенов. Agora-2, мультиагентная мировая модель, которую Odyssey представила 21 сентября 2026 года, порождает видео: потоки 640×480, генерируемые для каждого участника, пятнадцать латентных обновлений в секунду, для вплоть до 20 человек и агентов, совместно использующих один симулированный мир. Одна модель создана для того, чтобы потреблять кадры и объяснять их; другая — чтобы порождать кадры и позволять участникам действовать внутри них. Соедините их вместе — и получите нечто такое, что не собирался создавать ни один из вендоров: способ анализировать мультиагентную симуляцию с помощью языковой модели, которая действительно способна за ней наблюдать.
Две стороны рамки
Qwen3.8-Max — самый мощный уровень Alibaba и её самый обычный объект: нативная мультимодальная модель, принимающая текст, изображения и видео, с контекстом в миллион токенов, объёмом вывода в 131 072 токена, нативным использованием инструментов и индексом интеллекта Artificial Analysis, равным 45 в версии индекса v4.3.2. В более ранних публикациях об августовском запуске приводилась цифра 40 — она взята из предыдущей редакции индекса, и её не следует ставить рядом с этой. Artificial Analysis оценивает её в 88,8 по terminal-bench 2.1 и 92,8 по GPQA Diamond. Alibaba позиционирует её напрямую против GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro в собственном руководстве по миграции, рекомендуя её всякий раз, когда задаче требуется самое сильное доступное рассуждение.
Спецификация Agora-2 почти полностью не похожа на это. Четыре компонента рендеринга, по одному на вид, каждый — модель из шестнадцати блоков шириной 2 048, генерирующая перспективу одного участника. Модель симуляции из четырёх слоёв шириной 256, которая предсказывает движение, бой и анимацию по четырнадцати дискретным ветвям движения на основе истории сущности из четырёх шагов. Общее состояние мира, хранящее идентичность, позицию, здоровье, анимацию, смерть и возрождение, так что свойства сущности сохраняются независимо от конкретной камеры — сущность за пределами кадра сохраняет свою позицию, а не реконструируется, когда снова появляется. Контекстного окна нет, потому что нет языка. Эквивалентное ограничение — это ограниченная визуальная история по каждому виду, сбрасываемая при смерти, возрождении и разрывах камеры.
• Выход — видео Agora-2 640×480 на каждого участника, целевые 30 кадр/с против текста Qwen3.8-Max, до 131 072 токенов на ответ
• Ввод — браузерные элементы управления Agora-2 плюс 16 политик RL-агентов против текста, изображения и видео Qwen3.8-Max
• Независимая оценка — Agora-2: не опубликована, в сравнении с Qwen3.8-Max: AA Intelligence Index 45 (v4.3.2)
• Цена — Agora-2: не опубликована, только предварительный просмотр; в сравнении с Qwen3.8-Max — $2,00/$6,00 за 1 млн, $0,25 за чтение из кэша
• Память — общее состояние Agora-2 плюс ограниченная история по каждому представлению в сравнении с контекстом Qwen3.8-Max на 1 000 000 токенов
• Доступ — Agora-2: без API, без весов, в отличие от проприетарного API Qwen3.8-Max, контекст 1M


Что модель чтения видео добавляет к симулятору общего мира
Аргумент Odyssey в пользу создания Agora-2 состоит в том, что взаимодействие нескольких агентов стало чем-то, что стоит изучать в контролируемых условиях, и компания ссылается на инцидент в июле 2026 года, когда примерно 1200 агентов внутри песочницы для оценки организовали многодневное вторжение, как доказательство того, почему. Сложная часть такого рода исследований — не генерирование взаимодействия, а его интерпретация. Модель мира, которая выдаёт тысячи кадров с двадцатью взаимодействующими участниками, создаёт такой объём видеоматериала, который не под силу просмотреть ни одной команде людей.
Именно здесь модель с нативным видеовходом перестаёт быть категориальным несоответствием и становится компонентом. Сессия Agora-2 с внешней стороны — это ровно то, что Qwen3.8-Max заявляет как принимаемое: видео, с разрешением, которое отчёт подтверждает как обрабатываемое, с сущностями, чьи идентичность, здоровье и состояние анимации модель отрисовывает из явной общей схемы. Сопоставьте поток кадров с журналом состояний — отчёт публикует и то, и другое, а его рисунок 6 показывает состояние игрока и врага на четырёх последовательных тактах рядом с отрисованными кадрами — и вы получите корпус, в котором рассуждающую модель, способную работать с видео, можно спросить, что произошло, кто это инициировал и действительно ли визуальное изображение соответствует записанному состоянию. Этот последний вопрос отчёт перечисляет как неоценённый: согласованность между независимо сгенерированными представлениями и сквозное соблюдение действий — и то, и другое явно оставлены открытыми.
Контекст размером в миллион токенов — это вторая половина. Журнал состояния длинной сессии, вывод инструментов и расшифрованные аннотации помещаются в него, и это практическая разница между анализом одной встречи и анализом целого дня игры.
Где заканчиваются проверенные числа
Оценка Qwen3.8-Max в индексе, контекстное окно, модальности и тарифная сетка — это опубликованные факты, независимо измеренные там, где это отмечено. Его обновление от 2 сентября позволяет предположить, что Alibaba всё ещё дорабатывает этот уровень.
Показатели Agora-2 содержатся в техническом отчёте Team Odyssey и за пределами компании не воспроизводятся. В отчёте утверждается, что рендерер со структурированным префиксом достигает 30,11 дБ PSNR против базового уровня VAE в 20,67 дБ на тридцати клипах мониторинга, а также сокращение времени работы денойзера на 45,8% благодаря обусловливанию структурированным самовниманием по сравнению с перекрёстным вниманием — причём последнее измерено на случайно инициализированных денойзерах с синтетическими входными данными, и отчёт указывает, что это бенчмарк стоимости выполнения, а не качества изображения. Его собственный раздел ограничений — это то, что стоит перечитать: показатели в 15 обновлений латентного представления и 30 кадров в секунду являются целевыми, устойчивая частота кадров и задержка от ввода до отображения во время живой игры с несколькими агентами не оценивались количественно, долгосрочное визуальное качество и согласованность между ракурсами не оценены, среда требует инструментированного движка с явной геометрией и фиксированным словарём внешнего вида, а перенос на новые ассеты, правила или среды не проверен.
Два из этих предостережений бьют прямо по предложенной выше паре. Если частота кадров во время игры в реальном времени не измеряется, то у потока кадров, который вы бы подали видеомодели, пока нет гарантии пропускной способности. А если согласованность между ракурсами не оценивается, то интересный анализ — выглядело ли одно и то же событие согласованно с четырёх точек зрения — как раз и есть открытый вопрос, а не установленный вход. Это сочетание перспективно и совершенно не проверено.
Какой из них вы можете использовать сегодня
Qwen3.8-Max уже доступна для развертывания: мультимодальная модель передового класса за $2/$6 с окном в миллион токенов, встроенной поддержкой инструментов и независимо измеренным индексом 45. Для тех, кто выполняет интенсивный анализ видео или документов, это одна из немногих моделей в этой ценовой категории, которая вообще обрабатывает кадры, а ее тариф на чтение из кэша в $0.25 делает длинные повторяющиеся контексты доступными. Через OrcaRouter она предоставляется по каталожной цене Alibaba без наценки, так что этот тариф передается без изменений, и любое будущее изменение цены отражается в вашем счете в тот же день, при этом автоматическое переключение при деградации основного эндпоинта — стоит иметь для рабочей нагрузки, вся ценность которой заключается в длинном контексте, который было бы дорого перезапускать.

Agora-2 нет на OrcaRouter; мы его не размещаем, API и весов не существует, и единственная дверь — собственный браузерный предпросмотр Odyssey. То, что он предлагает, — это исследовательский артефакт в категории, которая едва существует: общий мир, где люди и RL-политики действуют на одном и том же состоянии и каждый участник получает собственное сгенерированное представление. Если вы строите мультиагентные системы, очевидное сочетание, ради которого стоит потратить день, — это запустить предпросмотр, зафиксировать кадры и журнал состояний и передать и то и другое мультимодальной модели на миллион токенов, чтобы спросить, что на самом деле произошло. Agora-2 даёт вам арену и признаёт, что не измерил самые трудные аспекты; Qwen3.8-Max — инструмент, который мог бы это сделать, и он доступен за $2/$6, пока арена всё ещё в режиме предпросмотра.
