
Claude Opus 5.5 und Gemini 3.8 Flash TTS produzierten ein Nachrichtenvideo mit Erzählstimme: Das Briefing, die beiden Tarifkarten und was die Stimme kostet
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 217 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Zwei Modelle, zwei Anbieter, ein fertiges Video und ein Prompt, kurz genug, um in eine Chatbox eingefügt zu werden. Am 2. Oktober 2026 veröffentlichte der chinesischsprachige KI-Autor 宝玉 (X/@dotey) zwei Renderings derselben Klatsch-Zusammenfassung – eines auf Englisch, eines auf Chinesisch – und sagte, beide seien von Claude Opus 5.5 vollständig erstellt worden, das sein eigenes Material fand und seinen eigenen Sprechertext schrieb, wobei die Stimme von Gemini 3.8 Flash TTS unter Verwendung eines vom Autor bereitgestellten API-Schlüssels bereitgestellt wurde. Keines der Modelle ist neu: Anthropic brachte Claude Opus 5.5 am 22. September 2026 heraus, und Googles Versionshinweise datieren die Gemini-3.8-Text-to-Speech-Modelle auf denselben Tag. Was erst wenige Tage alt ist, ist das Packaging – das Producer-Briefing selbst und eine Reihe von Repositories, die zwischen dem 30. September und dem 3. Oktober erstellt wurden und dieses Briefing in einen installierbaren Claude-Code-Skill verwandeln. Dies ist ein Beitrag über den Workflow, nicht über einen Launch.
Was das Briefing tatsächlich vorgibt
Die Vorlage ist ein einziger Satz mit drei Leerstellen. Aus dem chinesischen Original ins Englische übertragen lautet sie: Erstelle mir ein Gossip-Video über {Thema} (Zusatzmaterial: {Links/Screenshots, optional}; de-identifizierte Version: {Name der Person} entfernen, optional). Alles Interessante am Format ist in diesen drei Leerstellen verborgen, denn ein so kurzes Briefing lässt sich nur delegieren, wenn der Empfänger drei Dinge tun kann, ohne dass es ihm gesagt wird: eigenes Quellenmaterial finden, entscheiden, was die Geschichte ist, und ein fertiges Artefakt statt eines Plans abliefern.
Das Thema ist eine Freitext-Zeichenkette, das Modell trifft also eine redaktionelle Auswahl — was als Geschichte zählt, welche Beats enthalten sind, in welcher Reihenfolge sie stehen. Das ist eine andere Aufgabe als das Zusammenfassen, und es ist der Teil der Pipeline, über den der Bediener am wenigsten Kontrolle hat. Das optionale Zusatzmaterial ist der Rettungsanker: Fügen Sie einen Link oder einen Screenshot ein, und das Modell arbeitet mit einer festen Quelle statt zu suchen — das ist der Unterschied zwischen einem reproduzierbaren Rendering und einem jedes Mal anderen Video. Der dritte Slot, Desensibilisierung, ist der, über den es sich lohnt, nachzudenken, und darauf kommen wir zurück.
Liest man das Briefing als Spezifikation, verrät es, was es über das Harness voraussetzt. Es setzt voraus, dass das Modell die Außenwelt erreichen kann – der Discovery-Schritt wird delegiert, nicht beschrieben –, und was das Modell erreichen kann, ist eine Eigenschaft der Tools, die der Betreiber einbindet, nicht von Claude Opus 5.5 selbst. Es setzt einen Bild- oder Rendering-Stack voraus, denn das gelieferte Artefakt ist ein Video, und Claude Opus 5.5 gibt kein Video aus. Und es setzt eine Stimme voraus.
Die Arbeitsteilung ist das Entscheidende
Diese letzte Annahme ist die strukturelle Tatsache dieses Workflows. Unser eigener Katalogeintrag für anthropic/claude-opus-5.5 führt seine Eingabemodalitäten als Text, Bild und Datei auf und seine Ausgabemodalität als Text – eine einzige Ausgabemodalität. Das Modell kann keine Sprache synthetisieren und kann eine Tonspur nicht hören, sobald diese existiert. Jedes auf diese Weise erstellte Video mit Erzählstimme hat daher mindestens zwei Modellabhängigkeiten mit zwei Preislisten, zwei Anbietern und zwei Zugangsdaten, und die zweite muss von einem Menschen bereitgestellt werden. Opus 5.5 kann das Skript schreiben und das Rendering verdrahten; es kann kein Google-Konto eröffnen oder einen Schlüssel bereitstellen. Der Autor des Beitrags vom 2. Oktober sagt genau das: Der Gemini-Schlüssel stammte von ihm.
Die Einschränkung hat eine zweite Kehrseite, die leicht zu übersehen ist, bis man ausliefert. Weil Claude Opus 5.5 kein Audio entgegennimmt, kann das Modell, das die Erzählung geschrieben hat, die Erzählung nicht überprüfen. Falsch ausgesprochene Namen, seltsame Betonung, ein Satz, den der Synthesizer flach wiedergibt – nichts davon erreicht das Modell, das ihn verfasst hat. Die Qualitätskontrolle der Stimme besteht jedes Mal darin, dass ein Mensch die Ausgabe anhört, und das ist der Schritt, der verhindert, dass dies eine vollständig unbeaufsichtigte Pipeline wird, egal wie gut das Skript ist. Wo die eigene Ausgabe des Modells ein Programm ist, ist die Überprüfung ein Anhören, kein Diff.

Was die Stimme kostet – und sie ist nicht der teure Teil
Googles Preisseite gibt die Umrechnung an, die diese Arithmetik sauber macht: Audio-Token entsprechen 25 Token pro Sekunde Ausgabe. Die beiden Renderings im Beitrag vom 2. Oktober dauern 351 Sekunden bzw. 332 Sekunden, ausgelesen aus den Medien-Metadaten des Tweets selbst – ungefähr fünf Minuten einundfünfzig und fünf Minuten zweiunddreißig. Bei 25 Token pro Sekunde sind das 8.775 und 8.300 Audio-Token, und beim aktuellen Audio-Tarif von Flash TTS von 9,00 $ pro Million Token sind das etwa acht Cent für die Erzählung pro Video und rund fünfzehn Cent für beide Sprachversionen zusammen.
Stell das neben die Reasoning-Seite desselben Jobs. Der Listenpreis von Claude Opus 5.5 beträgt 4 $ pro Million Input-Tokens und 20 $ pro Million Output-Tokens, wobei Thinking-Tokens als Output abgerechnet werden, und Cache-Reads liegen bei 0,20 $ pro Million. Die Erzählung eines sechsminütigen Videos ist ein Rundungsfehler gegenüber den Tokens, die das Modell dafür aufwendet, zu entscheiden, was die Geschichte ist, Quellen zu lesen und das Skript zu schreiben, das die Stimme vorliest. Die praktische Schlussfolgerung lautet nicht „TTS ist billig“ – sie lautet, dass in dieser Pipeline die Stimme der eine Posten ist, den man nicht optimieren muss, und die Anstrengung gehört in den Teil, der Dollars kostet.
Zwei Details der Tarifkarte werden diese Kalkulation verändern, also berücksichtigen Sie sie jetzt in Ihrer Planung:
• Das Aktionsfenster endet – Flash TTS standard kostet bis zum 31. Dezember 2026 0,50 $ pro Million eingegebener Text-Tokens und 9,00 $ pro Million ausgegebener Audio-Tokens, danach 1,00 $ und 18,00 $. Die Erzählstimme desselben Videos kostet im Januar etwa sechzehn Cent, genau das Doppelte.
• Es gibt eine günstigere Stufe mit einem echten Kompromiss – Gemini 3.8 Flash-Lite TTS stellt $0.50 und $6.00 nach demselben Schema in Rechnung, steigend auf $1.00 und $12.00, und deckt 101 Sprachen ab gegenüber 130 bei Flash TTS. Für einen englischsprachigen Erklärfilm mit einem einzigen Sprecher kostet Lite nur zwei Drittel des Audio-Tarifs, und die Sprachobergrenze ist irrelevant; für die zweisprachige Ausgabe im Beitrag vom 2. Oktober ist sie nicht offensichtlich irrelevant, und genau diese Entscheidung verlangt die Tarifaufteilung von Ihnen.
Der Batch- und Flex-Tarif von Google kostet 0,25 $ für Eingaben und 4,50 $ für Ausgaben, und Priority kostet 0,90 $ und 16,20 $ – gut zu wissen, wenn Ihre Renderings in die Warteschlange gestellt werden statt interaktiv zu sein, denn nichts an einer Klatsch-Zusammenfassung erfordert die Antwort in Echtzeit.

Diese Woche wurde das Briefing kurz.
Ein Prompt in einem Tweet ist eine Demonstration; ein Repository ist etwas, das man installieren kann. Die Repositories, die rund um dieses Format aufgetaucht sind, sind der Teil, der wirklich in den letzten sieben Tagen liegt, und es lohnt sich, sie einzeln statt als Gruppe zu lesen, weil jedes einzelne eine andere Wette darüber eingeht, wie viel von der Pipeline im Code festgeschrieben werden sollte.
• hoangduong92/idea-to-film-skill — erstellt am 30. September 2026, MIT-lizenziert und die beste Übereinstimmung mit dem Beitrag vom 2. Oktober: ein Claude-Code-Skill, der eine Idee in eine erzählte Kurzfilm-MP4 mit codegezeichneter Animation, Musik, Soundeffekten, einer Gemini-TTS-Stimme und Untertiteln verwandelt. Die Stimme wird in der Beschreibung genannt, was die ehrliche Art ist, dies auszuliefern: Der zweite Anbieter ist eine deklarierte Abhängigkeit, keine versteckte.
• samuelstroschein/opus-video-generator — erstellt am 2. Oktober, MIT-lizenziert und am meinungsstärksten, was Zugangsdaten betrifft: Er erstellt Launch-Videos in deinem Browser über dein eigenes Claude-Abonnement, ausgeführt über npx. Das ist eine andere Antwort auf das oben genannte Kernproblem — die bestehende Berechtigung des Menschen weiterhin einzubeziehen, statt einen neuen API-Schlüssel für einen Agenten auszustellen.
• makevoid/motion-graphics-music-video-skill-noimage — erstellt am 2. Oktober, MIT-lizenziert, und dasjenige mit einer Disziplin, die es wert ist, kopiert zu werden: In seiner eigenen Beschreibung steht, dass es weder ein Bildmodell noch ein Videomodell verwendet und Motion Graphics aus einem Musikstück und einem Prompt erzeugt. Wenn der einzige generative Schritt Code ist, ist die Ausgabe reproduzierbar, und jede Asset-Lizenz im fertigen Werk kannst du selbst beurteilen.
• RohanRatwani/explainer-video-opus-5.5 — erstellt am 2. Oktober, MIT-lizenziert, richtet sich eher auf das 16:9- und Shorts-Erklärvideo als auf die Klatsch-Zusammenfassung, und es benennt das Timing-Problem ausdrücklich: jede Animation auf die Erzählung abgestimmt. Diese Reihenfolge ist entscheidend, denn sie bedeutet, dass das Audio gerendert wird, bevor die Visuals platziert werden.
• zhuyansen/awesome-opus-5.5-video — erstellt am 27. September, keine Lizenz angegeben und mit 67 Sternen mit Abstand das sichtbarste Projekt der Gruppe, während die übrigen im einstelligen Bereich oder bei null liegen. Es ist eher ein Index als ein Werkzeug, auf Englisch und Chinesisch, und seine Existenz ist ein nützliches Signal für die Form des Interesses: Was die Leute zuerst wollen, ist ein Katalog dessen, was andere behaupten, gemacht zu haben, und das Tooling folgt.
Nichts davon ist eine stabile Abhängigkeit. Sie sind erst wenige Tage alt, stammen von einem einzelnen Autor, und ihre Lizenzbedingungen sind das Einzige, was zwischen Ihnen und einem Stück Filmmaterial steht, das Sie nicht verwenden können. Aber die Richtung ist das Entscheidende: Der Prompt im Tweet ist der Prototyp, und der Skill im Repository ist das, was ein Team tatsächlich übernehmen würde.
Zwei Sprachversionen, eine Geschichte
Der Beitrag vom 2. Oktober ist bewusst zweisprachig – eine englische Fassung und eine chinesische zum selben Thema. Das ist ungewöhnlich für eine Demo, und es legt etwas Wahres über dieses Format offen: dass Klatsch nicht durch Übersetzung reist. Die Elemente, die eine Geschichte in einem Markt tragen (wer wem was gesagt hat, welches Dementi veröffentlicht wurde, wie die Zeitleiste aussieht), sind nicht die Elemente, die sie in einem anderen tragen, weshalb die zweite Fassung eine Neufassung mit einem anderen redaktionellen Urteil ist, kein Übersetzungsdurchgang. Was sich überträgt, ist das Skelett: dieselbe Geschichtenstruktur, derselbe Rendering-Stack, dieselbe Stimme.
Die Kostenauswirkung ist gering und geht in die richtige Richtung. Nach der obigen Rechnung kostet das Hinzufügen der zweiten Sprache etwa acht Cent zusätzliches Audio, gemessen an einer Story, die das Modell bereits einmal recherchiert hat. Wenn der teure Teil einer Pipeline das Reasoning und der günstige Teil die Ausgabe ist, ist die Erstellung einer zweiten Version in einer anderen Sprache nahezu kostenlos – was dafür spricht, Lokalisierung als erstklassige Ausgabe des Workflows zu behandeln statt als separates Projekt.
Deidentifizierung ist eine Bearbeitung, kein Löschen.
Die dritte Position im Briefing ist die, die Sie zum Innehalten bringen sollte. 去敏 — de-sensitise, eine de-identifizierte Version, die eine namentlich genannte Person entfernt — wird als optionaler Parameter angeboten, als wäre das Löschen eines Namens ein Filter, den man einfach einschaltet. Das ist es nicht. Eine Klatsch-Zusammenfassung über ein identifizierbares Ereignis handelt, auch wenn der Name entfernt wurde, meist immer noch von dieser Person: Der Leser ergänzt den Namen aus dem Kontext, und alles von der Überschrift bis zum Vorschaubild kann den Identifikator tragen. Das Entfernen der Zeichenkette ändert, worüber das Video zu handeln vorgibt, ohne zu ändern, von wem es handelt, und wenn Ihr Grund für das Entfernen des Namens ein rechtlicher oder reputationsbezogener ist, ist die Zeichenkette nicht der Teil, der das Risiko erzeugte.
Zwei Dinge ergeben sich für alle, die dieses Format ausliefern. Erstens verlagert sich die Pflicht zur Quellenangabe nicht von dir weg, nur weil der Präsentator synthetisch ist: Eine generierte Rundschau, die sich aus der Berichterstattung anderer speist, erbt die Verpflichtung, anzugeben, woher die Berichterstattung stammt, und das Briefing im Beitrag vom 2. Oktober enthält überhaupt keinen Slot für Quellenangaben – das ist eine Lücke, die der Betreiber von Hand füllen muss. Zweitens ist das Artefakt tatsächlich synthetisch, und einem Zuhörer wird das nicht gesagt, es sei denn, du sagst es ihm. Ein Label ist eine Zeile Text, und es ist der Unterschied zwischen einer Demo und einem Inhalt, der einen Zuschauer darüber täuscht, was er gerade ansieht. Wenn du möchtest, dass die Parameter dieses Gewicht tragen, nimm die Offenlegung ins Briefing auf und behandle sie als nicht optional, so wie der Anbieter der Stimme genannt und nicht verborgen werden sollte.

Es auf einem Schlüssel laufen zu lassen, und der eine Schlüssel, den es noch nicht abdeckt
Wenn Sie diese Pipeline aufbauen, sind die Integrationskosten nicht die Modellaufrufe – es ist die zweite Anmeldeinformation. Claude Opus 5.5 ist heute routbar als anthropic/claude-opus-5.5 zum Listenpreis von Anthropic selbst von 4 $ und 20 $ pro Million Token, durchgereicht mit 0 % Aufschlag, sodass eine Preisänderung des Anbieters Ihre Rechnung noch am selben Tag erreicht und nicht erst bei der nächsten Vertragsüberprüfung. Es zusammen mit dem Rest Ihres Stacks über einen einzigen OpenAI-kompatiblen Endpunkt zu routen, ist das, was das zweite SDK überflüssig macht, und automatisches Failover ist das, was Ihnen ermöglicht, ein neueres oder weniger erprobtes Modell bei einem internen Render auszuprobieren, ohne den Produktionspfad dahinterzustellen.
Die ehrliche Grenze ist die Stimme. Googles Gemini 3.8 Flash TTS- und Flash-Lite TTS-Endpunkte sind heute nicht in unserem Katalog – die öffentliche Modell-API liefert ein Not-found für google/gemini-3.8-flash-tts –, sodass der Workflow im Beitrag vom 2. Oktober wirklich den eigenen Google-Schlüssel des Autors benötigt, und das ist eine echte Einschränkung und nicht etwas Vorübergehendes, das wir einfach abtun können. Der TTS-Endpunkt, den wir tatsächlich anbieten, ist der ältere google/gemini-3.1-flash-tts-preview, zu 1,00 $ pro Million Text-Token Eingabe und 20,00 $ pro Million Audio-Token Ausgabe: in derselben Pipeline-Struktur einsetzbar, auf die ältere Generation zugeschnitten und nicht das Modell, auf dem dieser Workflow aufgebaut wurde. Entscheide dich bewusst für deinen Weg – ein Schlüssel für den Reasoner und ein zweiter für die Stimme oder ein Schlüssel und die ältere TTS.
Was zu sehen
Das, was dieses Format langweilig machen würde – im guten Sinne –, ist eine Audio-Modalität beim produzierenden Modell. Solange Claude Opus 5.5 – oder was auch immer es ersetzt – den Track, den es in Auftrag gegeben hat, nicht hören und anpassen kann, bleibt die Stimme ein manuell geprüfter Schritt, und diese Pipelines bleiben human-in-the-loop durch Konstruktion statt durch Richtlinie. Beobachten Sie in den nächsten zwei Wochen die Skill-Repositories statt der Demos: Die, die überleben, werden diejenigen sein, die ihre Anbieter nennen, eine Lizenz tragen und es Ihnen erlauben, dasselbe Briefing erneut auszuführen und dasselbe Video zu bekommen. Der Prompt im Beitrag vom 2. Oktober wird wie der leichte Teil aussehen, weil er es war.
Für eine Pipeline, die bereits über ihr eigenes Material und Skript verfügt, ermitteln Sie Ihre eigene Zahl, statt eine von X zu übernehmen: Bei 25 Tokens pro Sekunde entfallen auf jede Minute fertiggestellter Erzählung 1.500 Audio-Tokens und etwa 1,35 Cent zum heutigen Flash-TTS-Tarif – eine Zahl, die Sie mit einer Tarifkarte abgleichen können, bevor Sie einen Produktionsslot an einen synthetischen Host vergeben.
