
Claude Opus 5.5 Multimodaal: het rendert video uit code, en kan er geen bekijken
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 1009 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Vraag Claude Opus 5.5 om een video en je kunt er een krijgen — een programma van HTML-, CSS- of canvas-aanroepen dat elk frame schildert, dat je vervolgens uitvoert. Geef het een video en vraag wat erin gebeurt, en je krijgt helemaal niets, want er is geen video-invoer. Die asymmetrie vormt het volledige modaliteitsoppervlak van dit model, en ze is identiek op alle elf Anthropic-modellen op ons leaderboard, dus het loont om het ronduit te zeggen: Claude Opus 5.5 leest tekst, afbeeldingen en bestanden, schrijft tekst, en daar houdt het op. Het leaderboard eromheen is veel minder uniform. MiniMax H3 genereert zonder meer video, OrcaDub 1.0 neemt een video in en levert een nagesynchroniseerde versie terug, en Qwen3.8-Max kijkt naar een clip voor twee dollar per miljoen inputtokens — de helft van wat Claude Opus 5.5 voor datzelfde miljoen aanrekent, en met een capaciteit die het niet heeft.
Dit is een weergave van de modaliteitsregel zoals OrcaRouter die op 2026-09-29 registreert, voor alle 204 modellen in de catalogus. De onderstaande cijfers zijn catalogusdeclaraties, niet onze benchmarks — een modaliteitsveld is wat de modelkaart zegt, en modelkaarten kunnen wijzigen.
Wat de catalogus daadwerkelijk registreert
Van de 204 modellen geven er 182 een invoeroppervlak op. De overige 22 laten het leeg, wat iets zegt over het record en niet over het model — acht Kling-videomodellen, vier OrcaRouter-meta-modellen en een handvol verspreide free-tier- en preview-endpoints daaronder.

Over die 182:
• 131 gelezen afbeeldingen
• 77 gelezen bestanden — en elk van die 77 leest ook afbeeldingen, dus bestandsinvoer is een versterking van beeldinvoer op dit board, nooit een afzonderlijke zesde modaliteit
• 49 gelezen video
• 19 audio beluisteren
• 50 neem tekst en niets anders
Claude Opus 5.5 staat op de regel voor afbeeldingen en bestanden, niet op de regel voor video. Onze eigen modelpagina zegt het in één zin, onder de kop "Context, modaliteiten en denken": multimodale input — tekst, afbeeldingen en bestanden — met tekstoutput, een contextvenster van 1M tokens en tot 128K outputtokens. Dat is het volledige invoeroppervlak. Er is geen vijfde vermelding die zich in een submenu verstopt.
Vijftig is een groter getal dan de meeste mensen verwachten. Meer dan een kwart van de modellen die überhaupt iets aangeven, accepteert alleen tekst, wat betekent dat een pipeline die is gebouwd op de veronderstelling dat er een screenshot aan kan worden toegevoegd en dat die wordt begrepen, stukloopt op een kwart van dit board.
Waarom "video met code" geen videomodaliteit is
De demo's die de ronde deden zijn echt, en het effect ook: Claude Opus 5.5 is ongewoon goed in het schrijven van een programma dat beweging tekent — een op zichzelf staande renderer die frames produceert wanneer je het uitvoert. Dat is een echte capaciteit en een nuttige. Wat het niet is, is een uitvoermodaliteit. De catalogus registreert precies één uitvoer voor dit model, en dat is tekst. De video wordt stroomafwaarts vervaardigd, door de code die het模型 heeft geschreven, op jouw machine, met jouw renderer.
Het praktische gevolg snijdt aan twee kanten, en de tweede helft is de helft die mensen over het hoofd zien.
Aan de uitgang is de renderstap jouw verantwoordelijkheid. Op code gebaseerde video is inspecteerbaar, te diffen, opnieuw uit te voeren in een andere resolutie, en goedkoop op de manier waarop een tekstreactie goedkoop is — een paar dollar aan tokens in plaats van een facturatiemeter per seconde. Je bent ook verantwoordelijk voor elke fout: een ontbrekend lettertype, een slecht framebudget, een renderer die afwijkt van de code die hem is gegeven.
Aan de invoerkant is er niets om het te geven. Als je bronmateriaal een schermopname, een productclip, een webinar van twee uur of de lanceringsfilm van een concurrent is, Claude Opus 5.5 kan er niet naar kijken. Je kunt het transcript, de slides als stilstaande beelden of een beschrijving die iemand anders heeft geschreven, sturen. Dat is de beperking die architecturen daadwerkelijk bepaalt, en die is onzichtbaar in een demo-reel.
Twee kampen: 60 modellen nemen het document, 29 nemen de clip
Groepeer de 182 modellen op basis van hun exacte invoerset en het bord valt uiteen in twee groepen die elkaar nauwelijks overlappen.
Kamp A — documenten en afbeeldingen, geen video: 60 modellen. Mediane invoerprijs $2,00 per miljoen tokens. Dit is waar Claude Opus 5.5 zich bevindt, naast alle elf Anthropic-modellen, drie van de vijf Grok-rijen, en het reasoning-deel van de OpenAI-catalogus — elke GPT-4.1- en GPT-6-rij, en in de GPT-4o- en GPT-5-families alles behalve de voice-, codex-, search- en chat-latest-varianten. Kamp A bevat ook het plafond van de prijstabel: openai/gpt-5.5-pro en openai/gpt-5.4-pro tegen $30 per miljoen invoertokens. Dat is de hoogste invoerprijs op het hele bord, en het is een prijs die ze delen met twee OpenAI GPT-4-rijen en twee text-to-speech-endpoints, waarvan geen enkele een document leest. Geen van de acht kan een video bekijken.
Kamp B — tekst, afbeeldingen en video, geen bestanden: 29 modellen. Mediane invoerprijs $0,25 per miljoen tokens. Tweeëntwintig van de negenentwintig hebben een Qwen-prefix; de rest zijn MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B en twee op Obsidian afgestemde Qwen-builds. Het plafond is Qwen3.8-Max tegen $2,00 per miljoen — wat wil zeggen dat het duurste videolezende model in dit kamp precies de helft kost van Claude Opus 5.5.
Het mediane verschil tussen de kampen is 8×. Het verschil in lidmaatschap is nog scherper. Van de 182 modellen die een invoeroppervlak aangeven, 60 verwerken documenten en geen video, 32 verwerken video en geen documenten, 73 verwerken geen van beide, en slechts 17 verwerken beide. De overlap is klein genoeg dat de twee groepen gelezen worden als vrijwel disjuncte producten, en de 17 in het midden zijn vrijwel volledig Google's bovenste segment — vijftien van de zeventien — plus Meta's twee Muse Spark-builds.

Er is een plausibele reden voor deze vorm. Documentbegrip en videobegrip zijn verschillende technische problemen met verschillende kostencurves, en de aanbieders die video als eerste onder de knie hadden, zijn grotendeels degenen die goedkope tokens per honderd miljoen verkopen. De aanbieders die documenten als eerste onder de knie hadden, zijn degenen die redeneervermogen tegen een premie verkopen. Niemand is tot nu toe gedwongen om beide tegen dezelfde prijs te doen, dus de markt is uiteengevallen in twee producten en heeft die dienovereenkomstig geprijsd.
De negentien die alles nemen
Negentien modellen accepteren alle vier invoertypen — tekst, afbeelding, video en audio. Zestien zijn van Google, twee van Meta, één van MiniMax. Het eigen aanbod van Google binnen die groep loopt van $0,10 per miljoen voor gemini-2.5-flash-lite tot $4,00 voor gemini-pro-latest, dus "leest alles" is geen prijsklasse; het is een beslissing die Google op elk prijspunt heeft genomen. Meta's bijdrage is het paar Muse Spark-builds — Muse Spark 1.1 en Muse Spark 1.2, identiek in de catalogus tegen $1,25 per miljoen in en $4,25 uit, met een context van 1M tokens.
Dit is het kamp dat het beslissende punt van het artikel maakt: een video-bewuste pipeline heeft geen vlaggenschip nodig. Het vereist een keuze uit een lijst van negentien, waarvan er tien minder dan een dollar per miljoen inputtokens kosten.
Vijf modellen op dit bord produceren iets anders dan tekst.
Video lezen en het maken ervan zijn verschillende trucs, en de tweede is zeldzamer. Van de 204 modellen, 139 geven een outputoppervlak aan; vijf daarvan noemen iets anders dan tekst.
Drie zijn beeldgeneratoren: Nano Banana (Gemini 2.5 Flash Image) tegen $0,30 voor invoer en $30,00 voor uitvoer per miljoen tokens, Nano Banana Pro (Gemini 3 Pro Image Preview) tegen $0,24 per aanvraag, en Nano Banana 2 (Gemini 3.1 Flash Image Preview) tegen $0,151 per aanvraag. Twee genereren video: MiniMax H3, gefactureerd per seconde van de gegenereerde output — $0,08 per seconde bij 768P en $0,13 bij 2K, voor clips van vier tot vijftien seconden met native stereoaudio — en OrcaDub 1.0, gefactureerd tegen $0,60 per minuut bronvideo, met ondersteuning voor 28 talen en het klonen van een afzonderlijke stem per spreker.
Twee manieren van framen die hier vermeden moeten worden. Ten eerste: de resterende 65 rijen laten het uitvoerveld leeg; leeg betekent dat de catalogus geen uitvoeroppervlak registreert, en het is geen bewijs dat een model alleen tekst produceert. Ten tweede: het lezen van video en het maken van video zijn afzonderlijke assen met bijna geen overlap op deze ranglijst — OrcaDub 1.0 accepteert video als invoer en geeft video terug, waardoor het het enige model hier is dat aannemelijk aan beide uiteinden van een pijplijn zit, terwijl MiniMax H3 vier invoertypen nodig heeft om één enkel uitvoertype te produceren dat geen tekst is.
Wat waar naartoe routeren
Vier regels vloeien voort uit de telling, en ze zijn goedkoop toe te passen.
Als je invoer een is, grijp dan niet eerst naar een frontier-vlaggenschip. De groep die video leest zonder documenten nodig te hebben, telt 29 modellen, waarvan tweeëntwintig Qwen, en de mediaan is een kwart per miljoen. Stuur in plaats daarvan de frames en het transcript, en laat het het werk doen.
• Als je invoer een pdf, een contract of een lang document is, dan is het videokamp het verkeerde kamp. Slechts 17 modellen declareren zowel bestands- als video-invoer, en elk model dat bestandsinvoer declareert, declareert ook beeldinvoer, dus die twee gaan samen. Claude Opus 5.5 kost $4,00 per miljoen en biedt het documentoppervlak plus een venster van 1M tokens, en dat is de afweging die je maakt.
• Als je media-output nodig hebt, kies je uit vijf modellen, niet van het bord. Drie maken stilstaande beelden en twee maken video, en die twee factureren per seconde en per minuut in plaats van per token — dus een kostenraming die op invoerprijzen is gebaseerd, zal per definitie onjuist zijn.
• Als je video-uitvoer nodig hebt en je bron een script is, blijft codegeneratie de goedkoopste route op dit board. Claude Opus 5.5 schrijft de renderer voor de prijs van tekst; MiniMax H3 rendert het voor acht cent per seconde. Het koppelen van de twee kost minder dan elk van beide alternatieven en laat je een bestand achter dat je kunt bewerken.
Veelgestelde vragen
Kan Claude Opus 5.5 een video bekijken?
Nee. De opgegeven invoermodaliteiten zijn tekst, afbeelding en bestand. Video hoort er niet bij, en audio ook niet. Een schermopname of een productclip moet worden omgezet — gesamplede frames, een transcript, of beide — voordat die kan worden verzonden.
Genereert Claude Opus 5.5 rechtstreeks video?
Niet als modaliteit. Het geeft tekst terug, en die tekst is vaak een op zichzelf staand programma dat beweging weergeeft wanneer je het uitvoert. Het weergeven is aan jou; het model zendt nooit een pixel uit. Als je een model op dit board wilt dat zelf video teruggeeft, dan zijn MiniMax H3 en OrcaDub 1.0 de twee.
Is "multimodal" een prijsklasse?
Nee, en het overzicht laat in beide richtingen zien waarom. Google levert volledige vier-inputmultimodaliteit van $0,10 per miljoen inputtokens tot $4,00, terwijl de gedeeld hoogste inputprijs op het overzicht — openai/gpt-5.5-pro tegen $30 per miljoen — documenten en afbeeldingen leest, maar geen video. Waarvoor je betaalt, is het redeneerniveau, niet het aantal modaliteiten.
Waarom lezen zo weinig modellen documenten, terwijl zo veel modellen afbeeldingen lezen?
Omdat bestanden en afbeeldingen op dit bord samen voorkomen: alle 77 bestandslezende modellen lezen ook afbeeldingen, dus bestandsinvoer is een uitbreiding van beeldinvoer in plaats van een zelfstandige capaciteit. Het getal om te onthouden is dat 60 van de 182 modellen die een invoeroppervlak aangeven, documenten en afbeeldingen aannemen en helemaal geen video — een derde van het bord, en waar de topklasse zich bevindt.
Hoe moet ik de prijs van een videopipeline bepalen?
Per eenheid waarin het model factureert. Video-readers worden per token geprijsd, zoals elk chatmodel. Videogeneratoren op dit board worden geprijsd per seconde output (MiniMax H3: $0,08 bij 768P, $0,13 bij 2K) of per minuut bronmateriaal (OrcaDub 1.0: $0,60). Het mengen van de twee eenheden in één schatting is de meest voorkomende manier waarop een videobudget verkeerd uitpakt.
De regel om te onthouden
Het interessante aan Claude Opus 5.5 is niet dat het multimodaal is. Het grootste deel van het bord is dat wel. Het is dat de modaliteitsgrens op een ongebruikelijke plek ligt — documenten en stilstaande beelden erin, tekst eruit, geen video in beide richtingen — terwijl de demo's die het beroemd hebben gemaakt video zijn. Die twee feiten zijn niet met elkaar in tegenspraak, en ze als een tegenstelling lezen is juist wat het code-videoverhaal verwarrend maakt. Het model schrijft een renderer; de renderer maakt de film. Wat het model aangereikt kan krijgen, is een script, een document en een screenshot.

Alles hierboven is een momentopname van de OrcaRouter-catalogus op 2026-09-29 en de modaliteitsverklaringen daarin. Specificaties van leveranciers veranderen, en de modaliteitenlijst van een modelkaart is het eerste dat je opnieuw moet controleren voordat je op een getal voortbouwt. Als een bewering hier van belang is voor een beslissing, open dan de modelpagina — de velden staan erop.
