Karta hero multimodalnego modelu Claude Opus 5.5: nazwa modelu na wygenerowanej karcie tytułowej.
Guides & Insights

Claude Opus 5.5 Multimodal: renderuje wideo z kodu, a nie potrafi obejrzeć żadnego

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Poproś Claude Opus 5.5 o wideo, a możesz je otrzymać — program wywołań HTML, CSS lub canvas, który maluje każdą klatkę, a następnie go uruchamiasz. Daj mu wideo i zapytaj, co się na nim dzieje, a nie dostaniesz zupełnie nic, bo nie ma wejścia wideo. Ta asymetria to cała powierzchnia modalności tego modelu i jest identyczna we wszystkich jedenastu modelach Anthropic w naszym zestawieniu, więc warto powiedzieć to wprost: Claude Opus 5.5 czyta tekst, obrazy i pliki, pisze tekst — i na tym koniec. Reszta zestawienia wokół niego jest znacznie mniej jednolita. MiniMax H3 generuje wideo wprost, OrcaDub 1.0 przyjmuje wideo i zwraca wideo z dubbingiem, a Qwen3.8-Max obejrzy klip za dwa dolary za milion tokenów wejściowych — połowę tego, co Claude Opus 5.5 pobiera za ten sam milion, i to z możliwością, której tamten nie ma.

To odczyt linii modalności w takiej postaci, w jakiej OrcaRouter rejestruje ją 2026-09-29, obejmujący wszystkie 204 modele w katalogu. Podane niżej liczby to deklaracje katalogowe, a nie nasze benchmarki — pole modalności odzwierciedla to, co podaje karta modelu, a karty modeli się zmieniają.

Co tak naprawdę rejestruje katalog

Spośród 204 modeli 182 deklaruje powierzchnię wejściową. Pozostałe 22 pozostawiają ją pustą, co jest stwierdzeniem o rekordzie, a nie o modelu — osiem modeli wideo Kling, cztery metamodele OrcaRouter i garść modeli z darmowej warstwy oraz podglądowych wśród nich.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Przez te 182:

• 131 odczytanych obrazów

• 77 odczytuje pliki — a każdy z tych 77 odczytuje również obrazy, więc wejście plikowe jest wzmocnieniem wejścia obrazowego w tym rankingu, a nigdy nie jest osobną szóstą modalnością

• 49 przeczytanych wideo

• 19 posłuchaj audio

• 50 weź tekst i nic więcej

Claude Opus 5.5 znajduje się na linii obrazów i plików, a nie na linii wideo. Nasza własna strona modelu mówi to w jednym zdaniu, pod nagłówkiem „Kontekst, modalności i myślenie”: dane wejściowe multimodalne — tekst, obrazy i pliki — z wyjściem tekstowym, oknem kontekstowym 1 mln tokenów i maksymalnie 128 tys. tokenów wyjściowych. To pełny zakres danych wejściowych. Nie ma piątego wpisu ukrytego w podmenu.

Pięćdziesiąt to większa liczba, niż większość ludzi się spodziewa. Ponad jedna czwarta modeli, które w ogóle coś deklarują, przyjmuje wyłącznie tekst, co oznacza, że pipeline zbudowany na założeniu, że można załączyć zrzut ekranu i zostanie on zrozumiany, zawiedzie w przypadku jednej czwartej tej tablicy.

Dlaczego „wideo z kodem” nie jest modalnością wideo

Dema, które krążyły, są prawdziwe, podobnie jak efekt: Claude Opus 5.5 jest wyjątkowo dobry w pisaniu programu, który rysuje ruch — samodzielnego renderera, który generuje klatki, gdy go uruchomisz. To autentyczna i użyteczna umiejętność. Nie jest natomiast modalnością wyjściową. Katalog odnotowuje dokładnie jedno wyjście dla tego modelu i jest to tekst. Wideo jest wytwarzane na dalszym etapie, przez kod, który napisał model, na twojej maszynie, za pomocą twojego renderera.

Praktyczna konsekwencja działa w obie strony, a ta druga połowa to właśnie ta, którą ludzie przeoczają.

Na wyjściu to Ty odpowiadasz za etap renderowania. Wideo oparte na kodzie da się poddać inspekcji, porównać, uruchomić ponownie w innej rozdzielczości, a jego koszt jest tak niski, jak koszt odpowiedzi tekstowej — kilka dolarów za tokeny zamiast licznika rozliczającego za sekundę. Odpowiadasz też za każdą awarię: brakujący font, błędny budżet klatek, renderer, który nie zgadza się z kodem, jaki otrzymał.

Na wejściu nie ma czego mu przekazać. Jeśli twoim materiałem źródłowym jest nagranie ekranu, klip produktowy, dwugodzinny webinar albo film z premierą produktu konkurencji, Claude Opus 5.5nie może na nie spojrzeć. Możesz przesłać transkrypcję, slajdy jako stopklatki albo opis napisany przez kogoś innego. To właśnie to ograniczenie w rzeczywistości decyduje o architekturze, a w materiale demonstracyjnym pozostaje niewidoczne.

Dwa obozy: 60 modeli przyjmuje dokument, 29 przyjmuje klip

Pogrupuj 182 modele według ich dokładnego zestawu wejściowego, a tablica rozdzieli się na dwie grupy, które ledwo się pokrywają.

Obóz A — dokumenty i obrazy, bez wideo: 60 modeli. Mediana ceny wejściowej 2,00 USD za milion tokenów. To tutaj Claude Opus 5.5 znajduje się obok wszystkich jedenastu modeli Anthropic, trzech z pięciu wierszy Grok oraz rozumującej części katalogu OpenAI — każdego wiersza GPT-4.1 i GPT-6, a w rodzinach GPT-4o i GPT-5 wszystkiego poza wariantami voice, codex, search i chat-latest. Obóz A obejmuje też szczyt tabeli cen: openai/gpt-5.5-pro i openai/gpt-5.4-pro przy 30 USD za milion tokenów wejściowych. To najwyższa cena wejściowa w całej tabeli, dzielona z dwoma wierszami OpenAI GPT-4 i dwoma punktami końcowymi zamiany tekstu na mowę, z których żaden nie odczytuje dokumentu. Ani jeden z tych ośmiu nie potrafi oglądać wideo.

Obóz B — tekst, obrazy i wideo, bez plików: 29 modeli. Mediana ceny wejściowej 0,25 USD za milion tokenów. Dwadzieścia dwa z dwudziestu dziewięciu mają prefiks Qwen; pozostałe to MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B oraz dwa warianty Qwen dostrojone przez Obsidian. Jego pułap to Qwen3.8-Max przy 2,00 USD za milion — co oznacza, że najdroższy model czytający wideo w tym obozie kosztuje dokładnie połowę ceny Claude Opus 5.5.

Mediana różnicy między obozami wynosi 8×. Różnica w liczbie członków jest jeszcze wyraźniejsza. Spośród 182 modeli, które deklarują obszar danych wejściowych, 60 przyjmuje dokumenty, ale nie wideo, 32 przyjmuje wideo, ale nie dokumenty, 73 nie przyjmuje żadnego z nich, a tylko 17 przyjmuje oba. Pokrywanie się jest na tyle niewielkie, że obie grupy dają się odczytać jako niemal rozłączne produkty, a te 17 pośrodku to niemal wyłącznie najwyższa półka Google'a — piętnaście z siedemnastu — plus dwa modele Muse Spark firmy Meta.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Istnieje prawdopodobny powód takiego kształtu. Rozumienie dokumentów i rozumienie wideo to różne problemy inżynieryjne o różnych krzywych kosztów, a dostawcy, którzy jako pierwsi rozwiązali problem wideo, to w większości ci, którzy sprzedają tanie tokeny w setkach milionów. Dostawcy, którzy jako pierwsi rozwiązali problem dokumentów, to ci, którzy sprzedają rozumowanie za wysoką cenę. Nikt jeszcze nie został zmuszony do robienia obu rzeczy w tej samej cenie, więc rynek podzielił się na dwa produkty i odpowiednio je wycenił.

Dziewiętnaścioro, które zabiera wszystko

Dziewiętnaście modeli obsługuje wszystkie cztery typy danych wejściowych — tekst, obraz, wideo i dźwięk. Szesnaście to Google, dwa to Meta, jeden to MiniMax. Własny zakres Google w tej grupie rozciąga się od 0,10 USD za milion dla gemini-2.5-flash-lite do 4,00 USD dla gemini-pro-latest, więc „czyta wszystko” nie jest poziomem cenowym; to decyzja, którą Google podjął na każdym poziomie cenowym. Wkład Meta to para modeli Muse Spark — Muse Spark 1.1 i Muse Spark 1.2, identycznych w katalogu w cenie 1,25 USD za milion na wejściu i 4,25 USD na wyjściu, z kontekstem 1M tokenów.

To jest obóz, który formułuje zasadniczą tezę artykułu: pipeline świadomy wideo nie wymaga modelu flagowego. Wymaga wybrania z listy dziewiętnastu, z których dziesięć kosztuje mniej niż dolara za milion tokenów wejściowych.

Pięć modeli na tej tablicy emituje coś innego niż tekst.

Odczytywanie wideo i tworzenie go to różne sztuczki, a ta druga jest rzadsza. Spośród 204 modeli 139 deklaruje powierzchnię wyjściową; pięć z nich wymienia coś innego niż tekst.

Trzy to generatory obrazów: Nano Banana (Gemini 2.5 Flash Image) po $0.30 za wejście i $30.00 za wyjście za milion tokenów, Nano Banana Pro (Gemini 3 Pro Image Preview) po $0.24 za żądanie, oraz Nano Banana 2 (Gemini 3.1 Flash Image Preview) po $0.151 za żądanie. Dwa generują wideo: MiniMax H3, rozliczany za sekundę wygenerowanego materiału — $0.08 za sekundę przy 768P i $0.13 przy 2K, za klipy od czterech do piętnastu sekund z natywnym dźwiękiem stereofonicznym — oraz OrcaDub 1.0, rozliczany po $0.60 za minutę wideo źródłowego, obsługujący 28 języków i klonujący osobny głos dla każdego mówcy.

Należy tu uniknąć dwóch ujęć. Po pierwsze, pozostałe 65 wierszy pozostawiają pole wyjściowe puste; puste oznacza, że katalog nie rejestruje powierzchni wyjściowej i nie jest dowodem na to, że model emituje wyłącznie tekst. Po drugie, odczytywanie wideo i tworzenie wideo to oddzielne osie, które na tej tablicy niemal się nie pokrywają — OrcaDub 1.0 przyjmuje wideo i zwraca wideo, co czyni go jedynym modelem tutaj, który prawdopodobnie znajduje się na obu końcach potoku, podczas gdy MiniMax H3 przyjmuje cztery typy danych wejściowych, aby wytworzyć pojedynczy typ danych wyjściowych, który nie jest tekstem.

Co gdzie kierować

Ze spisu wynikają cztery zasady, a ich zastosowanie jest tanie.

• Jeśli twoje dane wejściowe to klip, nie sięgaj najpierw po flagowy model z czołówki. Grupa, która odczytuje wideo bez potrzeby dokumentów, liczy 29 modeli, z czego dwadzieścia dwa to Qwen, a jej mediana wynosi ćwierć za milion. Zamiast tego prześlij flagowcowi klatki i transkrypcję i pozwól mu zająć się rozumowaniem.

• Jeśli Twoje dane wejściowe to plik PDF, umowa lub długi dokument, obóz wideo to niewłaściwy obóz.Tylko 17 modeli deklaruje jednocześnie wejście plikowe i wideo, a każdy model, który deklaruje wejście plikowe, deklaruje także wejście obrazowe, więc te dwie funkcje idą w parze. Claude Opus 5.5za 4,00 USD za milion daje dostęp do dokumentów plus okno 1 mln tokenów — i właśnie na taką transakcję się decydujesz.

• Jeśli potrzebujesz mediów wyjściowych, wybierasz spośród pięciu modeli, a nie z tablicy. Trzy generują obrazy statyczne, a dwa generują wideo, przy czym te dwa rozliczają się za sekundę i za minutę, a nie za token — więc kosztorys oparty na cenach wejściowych będzie błędny z samego założenia.

• Jeśli potrzebujesz wyjścia wideo, a twoim źródłem jest scenariusz, generowanie kodu pozostaje najtańszą drogą na tej tablicy. Claude Opus 5.5 pisze renderer za cenę tekstu; MiniMax H3 renderuje go za osiem centów na sekundę. Połączenie obu kosztuje mniej niż każda z alternatyw i zostawia ci plik, który możesz edytować.

Najczęściej zadawane pytania

Czy Claude Opus 5.5 może oglądać wideo?

Nie. Jej zadeklarowane tryby wejściowe to tekst, obraz i plik. Wideo do nich nie należy, podobnie jak audio. Nagranie ekranu lub klip produktowy trzeba najpierw przekonwertować — na wybrane klatki, transkrypcję albo jedno i drugie — zanim będzie można go wysłać.

Czy Claude Opus 5.5 generuje wideo bezpośrednio?

Nie jako modalność. Zwraca tekst, a ten tekst jest często samodzielnym programem, który renderuje ruch, gdy go uruchomisz. Renderowanie należy do ciebie; model nigdy nie emituje ani jednego piksela. Jeśli chcesz model na tej tablicy, który sam zwraca wideo, MiniMax H3 i OrcaDub 1.0 to te dwa.

Czy „multimodal” to poziom cenowy?

Nie, a tabela pokazuje dlaczego w obu kierunkach. Google dostarcza pełną multimodalność czterech typów danych wejściowych od 0,10 USD za milion tokenów wejściowych do 4,00 USD, podczas gdy najwyższa ex aequo cena danych wejściowych w tabeli — openai/gpt-5.5-pro przy 30 USD za milion — obsługuje dokumenty i obrazy, ale nie wideo. Płacisz za poziom rozumowania, a nie za liczbę modalności.

Dlaczego tak niewiele modeli czyta dokumenty, skoro tak wiele czyta obrazy?

Ponieważ pliki i obrazy idą w tym zestawieniu w parze: wszystkie 77 modeli czytających pliki odczytuje także obrazy, więc wejście plikowe jest rozszerzeniem wejścia obrazowego, a nie niezależną możliwością. Liczba, którą warto zapamiętać, to 60 z 182 modeli deklarujących obsługę wejścia, które przyjmują dokumenty i obrazy, a w ogóle nie wideo — jedna trzecia zestawienia i zarazem miejsce, w którym plasuje się segment flagowy.

Jak powinienem wycenić pipeline wideo?

Według jednostki, w której model się rozlicza. Modele odczytujące wideo są rozliczane za token, jak każdy model czatu. Generatory wideo na tej tablicy są rozliczane za sekundę materiału wyjściowego (MiniMax H3: 0,08 USD przy 768P, 0,13 USD przy 2K) lub za minutę materiału źródłowego (OrcaDub 1.0: 0,60 USD). Mieszanie obu tych jednostek w jednym szacunku to najczęstsza przyczyna błędnego budżetu na wideo.

Linijka do zapamiętania

W przypadku Claude Opus 5.5 ciekawe nie jest to, że jest multimodalny. Większość modeli na rynku jest. Ciekawe jest to, że granica modalności przebiega w nietypowym miejscu — dokumenty i nieruchome obrazy na wejściu, tekst na wyjściu, wideo w żadnym kierunku — podczas gdy dema, które go rozsławiły, są wideo. Te dwa fakty nie stoją ze sobą w sprzeczności, a odczytywanie ich jako sprzeczności sprawia, że opowieść o kodzie wideo staje się myląca. Model pisze renderer; renderer tworzy film. To, co można modelowi przekazać, to scenariusz, dokument i zrzut ekranu.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Wszystko powyżej to migawka katalogu OrcaRouter z 2026-09-29 oraz zawartych w nim deklaracji modalności. Specyfikacje dostawców się zmieniają, a lista modalności w karcie modelu to pierwsza rzecz do ponownego sprawdzenia, zanim oprzesz się na jakiejś liczbie. Jeśli któreś z podanych tu twierdzeń ma znaczenie dla decyzji, otwórz stronę modelu — pola znajdują się na niej.