
Claude Opus 5.5 Multimodal: Den renderar video från kod, men kan inte titta på en
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 1009 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Be Claude Opus 5.5 om en video och du kan få en — ett program med HTML-, CSS- eller canvas-anrop som målar varje bildruta, som du sedan kör. Ge den en video och fråga vad som händer i den, och du får ingenting alls, eftersom det inte finns någon videoinmatning. Den asymmetrin utgör hela den här modellens modalitetsyta, och den är identisk för alla elva Anthropic-modeller på vår resultattavla, så det är värt att säga rakt ut: Claude Opus 5.5 läser text, bilder och filer, skriver text och stannar där. Resultattavlan runt den är långt mindre enhetlig. MiniMax H3 genererar video direkt, OrcaDub 1.0 tar emot en video och returnerar en dubbad version, och Qwen3.8-Max kommer att titta på ett klipp för två dollar per miljon indatatoken — hälften av vad Claude Opus 5.5 tar betalt för samma miljon, och med en förmåga som den inte har.
Detta är en avläsning av modalitetslinjen så som OrcaRouter registrerar den 2026-09-29, för samtliga 204 modeller i katalogen. Siffrorna nedan är katalogdeklarationer, inte våra benchmarks — ett modalitetsfält är vad modellkortet säger, och modellkort ändras.
Vad katalogen faktiskt registrerar
Av de 204 modellerna deklarerar 182 en indatayta. De övriga 22 lämnar den tom, vilket säger något om posten snarare än om modellen – bland dem åtta Kling-videomodeller, fyra OrcaRouter-metamodeller och en spridning av gratisnivå- och förhandsvisningsändpunkter.

Bland dessa 182:
• 131 lästa bilder
• 77 läser filer — och var och en av dessa 77 läser även bilder, så filinmatning är en förstärkning av bildinmatning på detta kort, aldrig en separat sjätte modalitet
• 49 lästa videor
• 19 hör ljud
• 50 ta text och inget annat
Claude Opus 5.5 ligger på bild- och fil-linjen och inte på videolinjen. Vår egen modellsida säger det i en enda mening, under rubriken "Kontext, modaliteter och tänkande": multimodal indata – text, bilder och filer – med textutdata, ett kontextfönster på 1M tokens och upp till 128K utdatatokens. Det är hela indataytan. Det finns ingen femte post som gömmer sig i en undermeny.
Femtio är ett större tal än vad de flesta förväntar sig. Mer än en fjärdedel av de modeller som överhuvudtaget deklarerar något tar bara text, vilket innebär att en pipeline som bygger på antagandet att den kan bifoga en skärmbild och få den förstådd kommer att gå sönder på en fjärdedel av den här boarden.
Varför "video med kod" inte är en videomodalitet
Demona som har cirkulerat är verkliga, och detsamma gäller effekten: Claude Opus 5.5 är ovanligt bra på att skriva ett program som ritar rörelse – en fristående renderare som producerar bildrutor när du kör den. Det är en genuin förmåga och en användbar sådan. Vad det inte är är en utdatamodalitet. Katalogen registrerar exakt en utdata för den här modellen, och det är text. Videon framställs nedströms, av koden som modellen skrev, på din maskin, med din renderare.
Den praktiska konsekvensen slår åt båda hållen, och den andra halvan är den halva som folk missar.
På vägen ut äger du renderingssteget. Kodbaserad video är granskningsbar, diffbar, kan köras om i en annan upplösning och är billig på samma sätt som ett textsvar är billigt – några dollar i tokens i stället för en debiteringsmätare per sekund. Du äger också varje fel: ett saknat typsnitt, en dålig bildrutebudget, en renderare som inte stämmer med koden den fick.
På vägen in finns det inget att ge den. Om ditt källmaterial är en skärminspelning, ett produktklipp, en två timmar lång webbsändning eller en konkurrents lanseringsfilm, Claude Opus 5.5 kan inte titta på det. Du får skicka transkriptionen, bilderna som stillbilder, eller en beskrivning som någon annan har skrivit. Det är begränsningen som faktiskt avgör arkitekturer, och den är osynlig i en demoreel.
Två läger: 60 modeller tar dokumentet, 29 tar klippet
Gruppera de 182 modellerna efter deras exakta indatamängd och i två grupper som knappt överlappar varandra.
Läger A – dokument och bilder, ingen video: 60 modeller. Medianpris för indata $2,00 per miljon tokens. Det är här Claude Opus 5.5 ligger, tillsammans med alla elva Anthropic-modeller, tre av de fem Grok-raderna och resonemangsdelen av OpenAI-katalogen – varje rad för GPT-4.1 och GPT-6, och i GPT-4o- och GPT-5-familjerna allt utom varianterna voice, codex, search och chat-latest. Läger A har också pristabellens tak: openai/gpt-5.5-pro och openai/gpt-5.4-pro på $30 per miljon indatatoken. Det är det högsta indatapriset någonstans på tavlan, och det är ett pris de delar med två OpenAI GPT-4-rader och två text-till-tal-slutpunkter, varav ingen läser ett dokument. Inte en enda av de åtta kan titta på en video.
Läger B — text, bilder och video, inga filer: 29 modeller. Medianpris för indata $0,25 per miljon tokens. Tjugotvå av de tjugonio har prefixet Qwen; resten är MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B och två Obsidian-finjusterade Qwen-byggen. Dess tak är Qwen3.8-Max på $2,00 per miljon — vilket vill säga att den dyraste videoläsande modellen i detta läger kostar exakt hälften av Claude Opus 5.5.
Medianavståndet mellan lägren är 8×. Medlemskapsgapet är ännu tydligare. Av de 182 modeller som deklarerar en indatayta, 60 tar emot dokument och inte video, 32 tar emot video och inte dokument, 73 tar emot ingendera och endast 17 tar emot båda. Överlappningen är tillräckligt liten för att de två grupperna ska framstå som nästan helt åtskilda produkter, och de 17 i mitten utgörs nästan helt och hållet av Googles övre skikt — femton av de sjutton — plus Metas två Muse Spark-versioner.

Det finns en rimlig förklaring till formen. Dokumentförståelse och videoförståelse är olika ingenjörsproblem med olika kostnadskurvor, och de leverantörer som löste video först är, mestadels, de som säljer billiga tokens i hundramiljonersvolymer. De leverantörer som löste dokument först är de som säljer resonemang till ett premiumpris. Ingen har ännu tvingats göra båda till samma pris, så marknaden har delats upp i två produkter och prissatt dem därefter.
De nitton som tar allt
Nitton modeller accepterar alla fyra indatatyper – text, bild, video och ljud. Sexton är Google, två är Meta, en är MiniMax. Googles eget utbud inom den gruppen sträcker sig från 0,10 USD per miljon för gemini-2.5-flash-lite till 4,00 USD för gemini-pro-latest, så "läser allt" är inte en prisnivå; det är ett beslut som Google fattade vid varje prispunkt. Metas bidrag är de två Muse Spark-versionerna – Muse Spark 1.1 och Muse Spark 1.2, identiska i katalogen till 1,25 USD per miljon för indata och 4,25 USD för utdata, med en kontext på 1 miljon tokens.
Det här är lägret som gör artikelns avgörande poäng: en videomedveten pipeline kräver inte en flaggskeppsmodell. Den kräver att man väljer från en lista på nitton, varav tio kostar mindre än en dollar per miljon indatatokens.
Fem modeller på det här kortet avger något annat än text
Att läsa av video och att skapa den är olika konster, och den andra är ovanligare. Av de 204 modellerna deklarerar 139 en utdatayta; fem av dem anger något annat än text.
Tre är bildgeneratorer: Nano Banana (Gemini 2.5 Flash Image) till $0.30 in och $30.00 ut per miljon tokens, Nano Banana Pro (Gemini 3 Pro Image Preview) till $0.24 per anrop och Nano Banana 2 (Gemini 3.1 Flash Image Preview) till $0.151 per anrop. Två genererar video: MiniMax H3, faktureras per sekund av genererad utdata — $0.08 per sekund vid 768P och $0.13 vid 2K, för klipp på fyra till femton sekunder med inbyggt stereoljud — och OrcaDub 1.0, faktureras till $0.60 per minut av källvideo, täcker 28 språk och klonar en separat röst per talare.
Två synsätt att undvika här. För det första lämnar de återstående 65 raderna utdatafältet tomt; tomt betyder att katalogen inte registrerar någon utdatayta, och det är inte bevis för att en modell endast avger text. För det andra är att läsa video och att skapa video separata axlar med nästan ingen överlappning i den här tabellen — OrcaDub 1.0tar emot video och ger video tillbaka, vilket gör den till den enda modellen här som rimligen befinner sig i båda ändarna av en pipeline, medan MiniMax H3tar fyra indatatyper för att producera en enda utdatatyp som inte är text.
Vad som ska routas vart
Fyra regler följer av folkräkningen, och de är billiga att tillämpa.
• Om din indata är ett klipp ska du inte först ta till ett flaggskepp i framkanten. Gruppen som läser video utan att behöva dokument består av 29 modeller, varav tjugotvå är Qwen, och dess median är en fjärdedel per miljon. Skicka i stället bildrutorna och transkriptionen till flaggskeppet och låt det göra resonemanget.
Om din indata är en PDF, ett avtal eller ett långt dokument är videolägret fel läger. Endast 14 modeller deklarerar både fil- och videoindata, och varje modell som deklarerar filindata deklarerar även bildindata, så de två följs åt. Claude Opus 5.5 för 4,00 USD per miljon köper dokumentsytan plus ett fönster på 1 miljon token, vilket är avvägningen du gör.
Om du har medier som utdata väljer du bland fem modeller, inte från panelen. Tre skapar stillbilder och två skapar video, och de två debiterar per sekund och per minut – inte per token – så en kostnadsuppskattning som bygger på indatapriser blir fel redan från början.
• Om du behöver få ut video och din källa är ett skript förblir kodgenerering den billigaste vägen på den här fronten. Claude Opus 5.5 skriver renderaren till textpris; MiniMax H3 renderar den för åtta cent per sekund. Att kedja ihop de två kostar mindre än något av alternativen och lämnar dig med en fil du kan redigera.
Vanliga frågor
Kan Claude Opus 5.5 titta på en video?
Nej. Dess deklarerade indatamodaliteter är text, bild och fil. Video är inte bland dem, och inte heller ljud. En skärminspelning eller ett produktklipp måste konverteras – samplade bildrutor, en transkription eller båda – innan det kan skickas.
Genererar Claude Opus 5.5 video direkt?
Inte som en modalitet. Den returnerar text, och den texten är ofta ett fristående program som renderar rörelse när du kör det. Renderingen är din; modellen avger aldrig en pixel. Om du vill ha en modell på den här tavlan som själv returnerar video, MiniMax H3 och OrcaDub 1.0 är de två.
Är "multimodal" en prisnivå?
Nej, och översikten visar varför i båda riktningarna. Google levererar full fyraingångs-multimodalitet från 0,10 USD per miljon indatatokens till 4,00 USD, medan det delat högsta indatapriset i översikten – openai/gpt-5.5-pro till 30 USD per miljon – läser dokument och bilder men inte video. Det du betalar för är resonemangsnivån, inte antalet modaliteter.
Varför läser så få modeller dokument om så många läser bilder?
Eftersom filer och bilder hänger ihop på den här tavlan: alla 77 fil-läsande modeller läser även bilder, så filinmatning är en förlängning av bildinmatning snarare än en oberoende förmåga. Siffran att komma ihåg är att 60 av de 182 modeller som deklarerar en indatayta tar emot dokument och bilder och ingen video alls — en tredjedel av tavlan, och där flaggskeppsnivån ligger.
Hur bör jag prissätta en videopipeline?
Beroende på vilken enhet modellen fakturerar i. Videoläsare prissätts per token, precis som alla chattmodeller. Videogeneratorer på den här tavlan prissätts per sekund av utdata (MiniMax H3: 0,08 USD vid 768P, 0,13 USD vid 2K) eller per minut av källmaterial (OrcaDub 1.0: 0,60 USD). Att blanda de två enheterna i en och samma uppskattning är det vanligaste sättet som en videobudget blir fel på.
Raden att komma ihåg
Det intressanta med Claude Opus 5.5 är inte att den är multimodal. De flesta på listan är det. Det är att modalitetslinjen hamnar på en ovanlig plats – dokument och stillbilder in, text ut, ingen video i någon riktning – medan demonstrationerna som gjorde den berömd är videoklipp. Dessa två fakta står inte i konflikt med varandra, och att läsa dem som en konflikt är det som gör kodvideo-berättelsen förvirrande. Modellen skriver en renderare; renderaren skapar filmen. Det som kan lämnas till modellen är ett manus, ett dokument och en skärmbild.

Allt ovan är en ögonblicksbild av OrcaRouter-katalogen den 2026-09-29 och de modalitetsdeklarationer som finns i den. Leverantörsspecifikationer ändras, och ett modellkorts modalitetslista är det första du bör kontrollera igen innan du bygger på en siffra. Om ett påstående här har betydelse för ett beslut, öppna modellsidan – fälten finns där.
