
Agora-2 kontra Qwen 3.8 Max: Jeden model ogląda wideo, drugi je tworzy
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
W centrum tej pary tkwi zgrabna inwersja. Qwen3.8-Max — flagowy model dostawcy, wydany 3 sierpnia 2026 r. i odświeżony 2 września, w cenie 2,00/6,00 USD za milion tokenów — natywnie odczytuje wideo obok tekstu i obrazów, w oknie kontekstu liczącym 1 000 000 tokenów. Agora-2, wieloagentowy model świata, który Odysseyzapowiedział 21 września 2026 r., generuje wideo: strumienie 640×480 tworzone dla każdego uczestnika, piętnaście aktualizacji ukrytych na sekundę, dla maksymalnie 20 ludzi i agentów dzielących jeden symulowany świat. Jeden model powstał po to, by pochłaniać klatki i je objaśniać; drugi — by emitować klatki i pozwalać uczestnikom działać w ich wnętrzu. Połącz je ze sobą, a otrzymasz coś, czego nie zamierzał zbudować żaden z dostawców — sposób na analizowanie symulacji wieloagentowej za pomocą modelu językowego, który naprawdę potrafi ją oglądać.
Dwie strony ramy
Qwen3.8-Max to najwyższy poziom możliwości Alibaby i jej najbardziej konwencjonalny obiekt: natywny model multimodalny przyjmujący tekst, obrazy i wideo, z kontekstem miliona tokenów, 131 072 tokenami wyjściowymi, natywnym użyciem narzędzi oraz wskaźnikiem Artificial Analysis Intelligence Index wynoszącym 45 w indeksie v4.3.2. Wcześniejsze relacje z sierpniowej premiery podawały 40 — ta liczba pochodziła z poprzedniej wersji indeksu i nie należy stawiać jej obok tej. Artificial Analysis mierzy go na 88,8 w terminal-bench 2.1 i 92,8 w GPQA Diamond. Alibaba pozycjonuje go bezpośrednio przeciwko GPT-5.5, Claude Opus 4.7 i Gemini 3.1 Pro w swoim własnym przewodniku migracyjnym, zalecając go, gdy zadanie wymaga najsilniejszego dostępnego rozumowania.
Specyfikacja Agory-2 jest prawie całkowicie odmienna. Cztery komponenty renderujące, po jednym na widok, każdy jest szesnastoblokowym modelem o szerokości 2048 generującym perspektywę pojedynczego uczestnika. Model symulacji o czterech warstwach i szerokości 256, który przewiduje ruch, walkę i animację w czternastu dyskretnych gałęziach ruchu na podstawie czteroetapowej historii encji. Wspólny stan świata przechowujący tożsamość, pozycję, zdrowie, animację, śmierć i odrodzenie, tak aby właściwości encji były trwałe niezależnie od konkretnej kamery — encja poza kadrem zachowuje swoją pozycję, zamiast być rekonstruowana, gdy pojawi się ponownie. Nie ma okna kontekstu, ponieważ nie ma języka. Równoważnym ograniczeniem jest ograniczona historia wizualna dla każdego widoku, resetowana przy śmierci, odrodzeniu i nieciągłościach kamery.
• Wyjście — wideo Agora-2 640×480 na uczestnika, docelowo 30 fps vs tekst Qwen3.8-Max, do 131 072 tokenów na odpowiedź
Dane wejściowe — elementy sterujące przeglądarki Agora-2 oraz 16 polityk agentów RL vs Qwen3.8-Max: tekst, obraz i wideo
• Niezależny wynik — Agora-2: brak opublikowanego vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Cena — Agora-2: brak opublikowanych danych, tylko wersja zapoznawcza vs Qwen3.8-Max 2,00 USD/6,00 USD za 1 mln, 0,25 USD za odczyt z pamięci podręcznej
• Pamięć — współdzielony stan Agora-2 plus ograniczona historia dla każdego widoku vs kontekst 1 000 000 tokenów Qwen3.8-Max
• Dostęp — Agora-2 bez API i wag w porównaniu z Qwen3.8-Max z własnościowym API i kontekstem 1M


Co model czytający wideo wnosi do symulatora współdzielonego świata
Argument Odyssey'a za zbudowaniem Agora-2 jest taki, że interakcja wieloagentowa stała się czymś, co warto badać w kontrolowanych warunkach, a firma powołuje się na incydent z lipca 2026 r., w którym około 1200 agentów wewnątrz piaskownicy ewaluacyjnej zorganizowało wielodniową intruzję, jako dowód na to dlaczego. Najtrudniejszą częścią tego rodzaju badań nie jest generowanie interakcji — lecz jej interpretacja. Model świata, który emituje tysiące klatek przedstawiających interakcję dwudziestu uczestników, generuje ilość materiału filmowego, której żaden ludzki zespół nie jest w stanie obejrzeć.
Tu właśnie model z natywnym wejściem wideo przestaje być kategorią, a staje się komponentem. Sesja Agora-2 jest z zewnątrz dokładnie tym, co Qwen3.8-Max twierdzi, że przyjmuje na wejście: wideo, w rozdzielczości, którą – jak potwierdza raport – jest w stanie obsłużyć, z encjami, których tożsamość, stan zdrowia i stan animacji model renderuje na podstawie jawnego, współdzielonego schematu. Połącz strumień klatek z dziennikiem stanu — raport publikuje oba, a jego Rysunek 6 pokazuje stan gracza i przeciwnika w czterech kolejnych taktach obok wyrenderowanych klatek — a otrzymasz korpus, w którym model rozumujący zdolny do przetwarzania wideo można zapytać, co się wydarzyło, kto to zainicjował i czy przedstawienie wizualne rzeczywiście odpowiada zapisanemu stanowi. To ostatnie pytanie raport wymienia jako niepoddane ocenie: zarówno zgodność między niezależnymi widokami, jak i przestrzeganie działań end-to-end są wyraźnie pozostawione otwarte.
Kontekst miliona tokenów to druga połowa. Dziennik stanu długiej sesji, dane wyjściowe narzędzi i transkrybowane adnotacje mieszczą się w nim, co stanowi praktyczną różnicę między analizą pojedynczego spotkania a analizą popołudnia rozgrywki.
Gdzie kończą się zweryfikowane liczby
Wynik Qwen3.8-Max w indeksie, okno kontekstowe, modalności i cennik to opublikowane fakty, niezależnie zmierzone tam, gdzie to zaznaczono. Jego aktualizacja z 2 września sugeruje, że Alibaba wciąż dopracowuje ten poziom.
Wyniki liczbowe Agora-2 znajdują się w raporcie technicznym Team Odyssey i nie zostały odtworzone poza firmą. Raport twierdzi, że renderer z ustrukturyzowanym prefiksem osiąga 30,11 dB PSNR w porównaniu z bazową linią VAE na poziomie 20,67 dB na trzydziestu klipach monitorujących oraz 45,8% redukcji czasu działania odszumiacza dzięki ustrukturyzowanemu warunkowaniu self-attention w porównaniu z cross-attention — przy czym tę ostatnią wartość zmierzono na losowo zainicjalizowanych odszumiaczach z syntetycznymi danymi wejściowymi, co raport określa jako benchmark kosztu wykonania, a nie jakości obrazu. Jego własna sekcja ograniczeń to część, którą warto przeczytać dwa razy: częstotliwości 15 aktualizacji latentów i 30 klatek na sekundę są wartościami docelowymi, utrzymywana liczba klatek na sekundę i opóźnienie od wejścia do wyświetlenia podczas rozgrywki wieloagentowej na żywo nie zostały ocenione ilościowo, jakość wizualna w długim horyzoncie i zgodność między widokami nie zostały ocenione, środowisko wymaga instrumentowanego silnika z jawną geometrią i stałym słownikiem wyglądu, a transfer do nowych zasobów, reguł lub środowisk nie został przetestowany.
Dwie z tych zastrzeżeń dotyczą bezpośrednio proponowanego powyżej zestawienia. Jeśli liczba klatek na sekundę podczas rozgrywki na żywo nie jest mierzona, to strumień klatek, który zasilałby model wideo, nie ma jeszcze gwarancji przepustowości. A jeśli zgodność między widokami nie jest oceniana, to interesująca analiza — czy to samo zdarzenie wyglądało spójnie z czterech perspektyw — jest właśnie pytaniem otwartym, a nie ustalonym wejściem. To połączenie jest obiecujące i całkowicie niesprawdzone.
Którego z nich możesz dzisiaj użyć?
Qwen3.8-Max jest już dostępny we wdrożeniach: model multimodalny klasy frontier w cenie $2/$6, z oknem miliona tokenów, natywnym korzystaniem z narzędzi i niezależnie zmierzonym indeksem wynoszącym 45. Dla każdego, kto zajmuje się analizą wideo lub dokumentów, to jeden z nielicznych modeli w tym przedziale cenowym, który w ogóle przyjmuje klatki, a stawka $0,25 za odczyt z pamięci podręcznej sprawia, że długie, powtarzalne konteksty stają się opłacalne. Przez OrcaRouter jest udostępniany w cenie katalogowej Alibaby bez żadnej marży, więc ta stawka jest przekazywana bez zmian, a każda przyszła zmiana ceny trafia na Twój rachunek tego samego dnia, z automatycznym przełączeniem awaryjnym, jeśli główny endpoint ulegnie pogorszeniu — warto mieć to w obciążeniu, którego cała wartość tkwi w długim kontekście, którego ponowne uruchomienie byłoby kosztowne.

Agora-2 nie znajduje się w OrcaRouter; nie hostujemy jej, nie ma API ani wag, a jedynym wejściem jest własny podgląd w przeglądarce Odyssey. To, co oferuje, to artefakt badawczy w kategorii, która ledwie istnieje: wspólny świat, w którym ludzie i polityki RL działają na tym samym stanie, a każdy uczestnik otrzymuje własny generowany widok. Jeśli budujesz systemy wieloagentowe, połączenie warte poświęcenia popołudnia jest oczywiste — zagraj w podglądzie, przechwyć klatki i dziennik stanu, a następnie przekaż jedno i drugie multimodalnemu modelowi o milionie tokenów, by zapytać, co się faktycznie stało. Agora-2 daje ci arenę i przyznaje, że nie zmierzyła trudnych części; Qwen3.8-Max to instrument, który mógłby to zrobić, i jest dostępny w cenie $2/$6, dopóki arena wciąż jest podglądem.
