Claude Opus 5.5 multimodale Hero-Card: der Modellname über einer generierten Titelkarte.
Guides & Insights

Claude Opus 5.5 Multimodal: Es rendert Video aus Code und kann sich selbst keines ansehen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Bitten Sie Claude Opus 5.5 um ein Video, kann am Ende ein solches dabei herauskommen – ein Programm aus HTML-, CSS- oder Canvas-Aufrufen, das jedes Einzelbild zeichnet und das Sie dann ausführen. Geben Sie ihm ein Video und fragen Sie, was darin passiert, erhalten Sie überhaupt nichts, weil es keine Videoeingabe gibt. Diese Asymmetrie macht die gesamte Modalitätsoberfläche dieses Modells aus, und sie ist bei allen elf Anthropic-Modellen auf unserem Board identisch, deshalb lohnt es sich, es klar zu sagen: Claude Opus 5.5 liest Text, Bilder und Dateien, schreibt Text und hört damit auf. Das Board um es herum ist weit weniger einheitlich. MiniMax H3 erzeugt direkt Videos, OrcaDub 1.0 nimmt ein Video entgegen und gibt eine synchronisierte Fassung zurück, und Qwen3.8-Max wird sich einen Clip für zwei Dollar pro Million Eingabe-Tokens ansehen – die Hälfte dessen, was Claude Opus 5.5 für dieselbe Million berechnet, und das mit einer Fähigkeit, die es nicht hat.

Dies ist eine Auslesung der Modalitätszeile, wie OrcaRouter sie am 2026-09-29 erfasst – über alle 204 Modelle im Katalog hinweg. Die Zahlen unten sind Katalogangaben, nicht unsere Benchmarks – ein Modalitätsfeld ist das, was auf der Modellkarte steht, und Modellkarten ändern sich.

Was der Katalog tatsächlich verzeichnet

Von den 204 Modellen deklarieren 182 eine Eingabeoberfläche. Die übrigen 22 lassen sie leer, was eine Aussage über den Datensatz und nicht über das Modell ist – darunter acht Kling-Videomodelle, vier OrcaRouter-Meta-Modelle und eine Handvoll verstreuter Free-Tier- und Preview-Endpunkte.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Über diese 182:

• 131 gelesene Bilder

• 77 gelesene Dateien — und jede dieser 77 liest auch Bilder, daher ist Dateieingabe auf diesem Board eine Stärkung der Bildeingabe, niemals eine separate sechste Modalität

• 49 gelesenes Video

• 19 Audio anhören

• 50 Nimm Text und sonst nichts

Claude Opus 5.5 ist bei Bildern und Dateien dabei, nicht bei Videos. Unsere eigene Modellseite sagt es in einem Satz, unter der Überschrift „Kontext, Modalitäten und Denken“: multimodale Eingabe – Text, Bilder und Dateien – mit Textausgabe, einem Kontextfenster von 1 Mio. Tokens und bis zu 128K Ausgabe-Tokens. Das ist die vollständige Eingabeoberfläche. Es gibt keinen fünften Eintrag, der sich in einem Untermenü versteckt.

Fünfzig ist eine größere Zahl, als die meisten Menschen erwarten. Mehr als ein Viertel der Modelle, die überhaupt etwas deklarieren, akzeptiert nur Text, was bedeutet, dass eine Pipeline, die auf der Annahme aufbaut, dass sie einen Screenshot anhängen kann und dieser verstanden wird, bei einem Viertel dieses Boards scheitern wird.

Warum „Video mit Code" keine Video-Modalität ist

Die Demos, die die Runde gemacht haben, sind echt, und der Effekt ist es auch: Claude Opus 5.5 ist ungewöhnlich gut darin, ein Programm zu schreiben, das Bewegung zeichnet – ein in sich geschlossener Renderer, der Einzelbilder erzeugt, wenn man ihn ausführt. Das ist eine echte und nützliche Fähigkeit. Was es nicht ist, ist eine Ausgabemodalität. Der Katalog verzeichnet genau eine Ausgabe für dieses Modell, und sie ist Text. Das Video wird nachgelagert erzeugt, durch den Code, den das Modell geschrieben hat, auf Ihrem Rechner, mit Ihrem Renderer.

Die praktische Konsequenz wirkt in beide Richtungen, und die zweite Hälfte ist die, die die Leute übersehen.

Beim Ausstieg gehört Ihnen der Render-Schritt. Codebasiertes Video ist inspizierbar, diffbar, mit einer anderen Auflösung erneut ausführbar und günstig in der Art, wie eine Textantwort günstig ist – ein paar Dollar an Tokens statt eines Abrechnungszählers pro Sekunde. Aber Sie verantworten auch jeden Fehler: eine fehlende Schriftart, ein schlechtes Frame-Budget, einen Renderer, der sich mit dem Code, den er bekommen hat, nicht einig ist.

Am Eingang gibt es nichts, was man ihm übergeben kann. Wenn Ihr Ausgangsmaterial eine Bildschirmaufnahme, ein Produktclip, ein zweistündiges Webinar oder der Launch-Film eines Wettbewerbers ist, Claude Opus 5.5 kann es sich nicht ansehen. Sie können das Transkript, die Folien als Standbilder oder eine Beschreibung, die jemand anderes geschrieben hat, senden. Das ist die Einschränkung, die tatsächlich über Architekturen entscheidet, und in einem Demo-Reel ist sie unsichtbar.

Zwei Lager: 60 Modelle nehmen das Dokument, 29 nehmen das

Gruppiere die 182 Modelle nach ihrer exakten Eingabemenge, und das Board teilt sich in zwei Gruppen, die sich kaum überschneiden.

Camp A — Dokumente und Bilder, kein Video: 60 Modelle. Median-Eingabepreis 2,00 $ pro Million Tokens. Hier ist die Stelle, an der Claude Opus 5.5 sitzt, zusammen mit allen elf Anthropic-Modellen, drei der fünf Grok-Zeilen und dem Reasoning-Ende des OpenAI-Katalogs — jeder GPT-4.1- und GPT-6-Zeile, und in den GPT-4o- und GPT-5-Familien alles außer den Varianten voice, codex, search und chat-latest. Camp A hält außerdem die Obergrenze der Preistabelle: openai/gpt-5.5-pro und openai/gpt-5.4-pro bei 30 $ pro Million Eingabe-Tokens. Das ist der höchste Eingabepreis auf dem gesamten Board, und es ist ein Preis, den sie mit zwei OpenAI-GPT-4-Zeilen und zwei Text-to-Speech-Endpunkten teilen, von denen keiner ein Dokument liest. Keiner der acht kann ein Video ansehen.

Camp B — Text, Bilder und Video, keine Dateien: 29 Modelle. Median-Eingabepreis $0,25 pro Million Token. Zweiundzwanzig der neunundzwanzig tragen ein Qwen-Präfix; der Rest sind MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B und zwei auf Obsidian abgestimmte Qwen-Builds. Seine Obergrenze ist Qwen3.8-Max bei $2,00 pro Million — das heißt, das teuerste videolesende Modell in diesem Camp kostet genau die Hälfte von Claude Opus 5.5.

Der Median-Abstand zwischen den Lagern beträgt 8×. Der Unterschied bei der Mitgliedschaft ist noch krasser. Von den 182 Modellen, die eine Eingabeoberfläche angeben, nehmen 60 Dokumente und kein Video, 32 nehmen Video und keine Dokumente, 73 nehmen weder noch, und nur 17 nehmen beides. Die Überschneidung ist so gering, dass die beiden Gruppen wie nahezu disjunkte Produkte wirken, und die 17 in der Mitte sind fast vollständig Googles obere Kategorie – fünfzehn der siebzehn – plus Metas zwei Muse-Spark-Builds.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Es gibt einen plausiblen Grund für diese Form. Dokumentenverständnis und Videoverständnis sind unterschiedliche technische Probleme mit unterschiedlichen Kostenkurven, und die Anbieter, die zuerst Video gelöst haben, sind größtenteils diejenigen, die billige Tokens in Hundertmillionen verkaufen. Die Anbieter, die zuerst Dokumente gelöst haben, sind diejenigen, die Reasoning zu einem Premiumpreis verkaufen. Niemand wurde bislang gezwungen, beides zum selben Preis anzubieten, daher hat sich der Markt in zwei Produkte aufgeteilt und sie entsprechend bepreist.

Die Neunzehn, die alles nehmen

Neunzehn Modelle akzeptieren alle vier Eingabetypen – Text, Bild, Video und Audio. Sechzehn sind von Google, zwei von Meta, eines von MiniMax. Googles eigene Spanne innerhalb dieser Gruppe reicht von 0,10 $ pro Million für gemini-2.5-flash-lite bis 4,00 $ für gemini-pro-latest, also ist „liest alles“ keine Preisklasse; es ist eine Entscheidung, die Google bei jedem Preis getroffen hat. Metas Beitrag ist das Paar der Muse-Spark-Builds – Muse Spark 1.1 und Muse Spark 1.2, im Katalog identisch bei 1,25 $ pro Million Eingabe und 4,25 $ Ausgabe, mit einem Kontext von 1 Mio. Tokens.

Das ist das Lager, das den ausschlaggebenden Punkt des Artikels verdeutlicht: Eine videobewusste Pipeline benötigt kein Flaggschiff. Sie erfordert die Auswahl aus einer Liste von neunzehn, von denen zehn weniger als einen Dollar pro Million Eingabe-Tokens kosten.

Fünf Modelle auf diesem Board geben etwas anderes als Text aus.

Videos lesen und Videos erzeugen sind zwei unterschiedliche Kunststücke, und Letzteres ist seltener.deklarieren 139 eine Ausgabeoberfläche; fünf davon nennen etwas anderes als Text.

Drei sind Bildgeneratoren: Nano Banana (Gemini 2.5 Flash Image) für 0,30 $ Eingabe und 30,00 $ Ausgabe pro Million Token, Nano Banana Pro (Gemini 3 Pro Image Preview) für 0,24 $ pro Anfrage, und Nano Banana 2 (Gemini 3.1 Flash Image Preview) für 0,151 $ pro Anfrage. Zwei erzeugen Video: MiniMax H3, abgerechnet pro Sekunde erzeugter Ausgabe — 0,08 $ pro Sekunde bei 768P und 0,13 $ bei 2K, für Clips von vier bis fünfzehn Sekunden mit nativem Stereo-Audio — und OrcaDub 1.0, abgerechnet mit 0,60 $ pro Minute des Quellvideos, mit Abdeckung von 28 Sprachen und Klonen einer separaten Stimme pro Sprecher.

Zwei Betrachtungsweisen sind hier zu vermeiden. Erstens lassen die verbleibenden 65 Zeilen das Ausgabefeld leer; leer bedeutet, dass der Katalog keine Ausgabeoberfläche verzeichnet, und es ist kein Beleg dafür, dass ein Modell ausschließlich Text ausgibt. Zweitens sind das Lesen von Video und das Erzeugen von Video getrennte Achsen mit nahezu keiner Überschneidung auf diesem Board — OrcaDub 1.0 nimmt Video entgegen und gibt Video zurück, was es zum einzigen Modell hier macht, das plausibel an beiden Enden einer Pipeline sitzt, während MiniMax H3 vier Eingabetypen benötigt, um einen einzigen Ausgabetyp zu erzeugen, der kein Text ist.

Was wohin leiten

Aus der Zählung ergeben sich vier Regeln, und sie sind kostengünstig anzuwenden.

• Wenn Ihre Eingabe ein Clip ist, greifen Sie nicht zuerst zu einem Frontier-Flaggschiff. Das Lager, das Video liest, ohne Dokumente zu benötigen, umfasst 29 Modelle, zweiundzwanzig davon Qwen, und sein Median liegt bei einem Viertel pro Million. Schicken Sie dem Flaggschiff stattdessen die Frames und das Transkript, und lassen Sie es das Reasoning übernehmen.

• Wenn es sich bei Ihrer Eingabe um ein PDF, einen Vertrag oder ein langes Dokument handelt, sind Sie im Video-Lager falsch. Nur 17 Modelle deklarieren sowohl Datei- als auch Videoeingabe, und jedes Modell, das Dateieingabe deklariert, deklariert auch Bildeingabe, sodass die beiden gemeinsam auftreten. Claude Opus 5.5 bietet für 4,00 $ pro Million die Dokumentenoberfläche plus ein 1-Mio.-Token-Fenster, was der Kompromiss ist, den Sie eingehen.

• Wenn Sie Medienausgabe benötigen, wählen Sie aus fünf Modellen, nicht aus dem Board. Drei erzeugen Standbilder und zwei erzeugen Videos, und diese beiden rechnen pro Sekunde und pro Minute ab statt pro Token – eine Kostenschätzung auf Basis der Eingabepreise ist damit zwangsläufig falsch.

• Wenn Sie Videoausgabe benötigen und Ihre Quelle ein Skript ist, bleibt die Codegenerierung der günstigste Weg auf dieser Platine. Claude Opus 5.5 schreibt den Renderer zum Preis von Text; MiniMax H3 rendert es für acht Cent pro Sekunde. Die beiden zu verketten kostet weniger als jede der Alternativen und hinterlässt Ihnen eine Datei, die Sie bearbeiten können.

FAQ

Kann Claude Opus 5.5 ein Video ansehen?

Nein. Seine deklarierten Eingabemodalitäten sind Text, Bild und Datei. Video gehört nicht dazu, ebenso wenig Audio. Eine Bildschirmaufnahme oder ein Produktclip muss konvertiert werden – abgetastete Einzelbilder, ein Transkript oder beides –, bevor dies gesendet werden kann.

Generiert Claude Opus 5.5 Video direkt?

Nicht als Modalität. Es gibt Text zurück, und dieser Text ist häufig ein eigenständiges Programm, das Bewegung rendert, wenn du es ausführst. Das Rendering übernimmst du; das Modell gibt kein Pixel aus. Wenn du ein Modell auf diesem Board willst, das selbst Video zurückgibt,MiniMax H3 und OrcaDub 1.0 sind die beiden.

Ist „multimodal" eine Preisstufe?

Nein, und die Übersicht zeigt in beide Richtungen, warum. Google liefert vollständige Multimodalität mit vier Eingaben von 0,10 $ pro Million Eingabe-Tokens bis 4,00 $, während der gemeinsam höchste Eingabepreis auf der Übersicht – openai/gpt-5.5-probei 30 $ pro Million – Dokumente und Bilder liest, aber kein Video. Wofür man bezahlt, ist die Reasoning-Stufe, nicht die Anzahl der Modalitäten.

Warum lesen so wenige Modelle Dokumente, wenn doch so viele Bilder lesen?

Da Dateien und Bilder auf diesem Board gemeinsam auftreten: Alle 77 Modelle, die Dateien lesen, lesen auch Bilder, sodass die Dateieingabe eine Erweiterung der Bildeingabe und keine eigenständige Fähigkeit ist. Die Zahl, die man sich merken sollte, ist, dass 60 der 182 Modelle, die eine Eingabeoberfläche angeben, Dokumente und Bilder akzeptieren und überhaupt kein Video – ein Drittel des Boards und der Bereich, in dem die Flaggschiff-Klasse angesiedelt ist.

Wie sollte ich eine Video-Pipeline bepreisen?

Nach der Einheit, in der das Modell abrechnet. Video-Reader werden pro Token abgerechnet, wie jedes Chat-Modell. Video-Generatoren auf diesem Board werden pro Sekunde Ausgabe abgerechnet (MiniMax H3: $0.08 bei 768P, $0.13 bei 2K) oder pro Minute der Quelle (OrcaDub 1.0: $0.60). Die beiden Einheiten in eine Schätzung zu mischen, ist die häufigste Ursache dafür, dass ein Videobudget falsch ausfällt.

Die Zeile, die man sich merken sollte

Das Interessante an Claude Opus 5.5 ist nicht, dass es multimodal ist. Beim Großteil der Modellpalette ist das der Fall. Es ist, dass die Modalitätsgrenze an einer ungewöhnlichen Stelle verläuft – Dokumente und Standbilder hinein, Text hinaus, kein Video in beide Richtungen –, während die Demos, die es berühmt gemacht haben, Video sind. Diese beiden Fakten stehen nicht im Widerspruch, und sie als Widerspruch zu lesen, ist genau das, was die Code-Video-Geschichte verwirrend macht. Das Modell schreibt einen Renderer; der Renderer erzeugt den Film. Was man dem Modell übergeben kann, sind ein Drehbuch, ein Dokument und ein Screenshot.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Alles oben ist eine Momentaufnahme des OrcaRouter-Katalogs vom 2026-09-29 und der darin enthaltenen Modalitätsdeklarationen. Anbieterspezifikationen ändern sich, und die Modalitätsliste einer Modellkarte ist das Erste, was man erneut prüfen sollte, bevor man auf einer Zahl aufbaut. Wenn eine Aussage hier für eine Entscheidung von Bedeutung ist, öffnen Sie die Modellseite – die Felder stehen darauf.