
Claude Opus 5.5 i Gemini 3.8 Flash TTS wyprodukowały wideo informacyjne z narracją: Podsumowanie, dwie karty stawek i ile kosztuje głos
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa modele, dwóch dostawców, jedno gotowe wideo i prompt wystarczająco krótki, by wkleić go do okna czatu. 2 października 2026 chińskojęzyczny autor piszący o AI 宝玉 (X/@dotey) opublikował dwie wersje tego samego podsumowania plotek — jedną po angielsku, jedną po chińsku — i stwierdził, że obie zostały zbudowane od początku do końca przez Claude Opus 5.5, który samodzielnie znalazł materiał i napisał własną narrację, a głos dostarczył Gemini 3.8 Flash TTS przy użyciu klucza API dostarczonego przez autora. Żaden z modeli nie jest nowy: Anthropic udostępniło Claude Opus 5.5 22 września 2026, a notatki wydania Google datują modele zamiany tekstu na mowę Gemini 3.8 na ten sam dzień. Tym, co ma zaledwie kilka dni, jest opakowanie — sam brief producenta i szereg repozytoriów utworzonych między 30 września a 3 października, które zamieniają ten brief w umiejętność Claude Code, którą można zainstalować. To tekst o workflow, nie o premierze.
Co tak naprawdę określa brief
Szablon to jedno zdanie z trzema miejscami do wypełnienia. Przetłumaczony na angielski z oryginału chińskiego brzmi ono: zrób mi plotkarski film o {temat} (materiały uzupełniające: {linki/zrzuty ekranu, opcjonalnie}; wersja zanonimizowana: usuń {imię osoby}, opcjonalnie). Wszystko, co w tym formacie interesujące, kryje się w tych trzech miejscach, bo tak krótkie zlecenie można komuś przekazać tylko wtedy, gdy odbiorca potrafi zrobić trzy rzeczy bez instrukcji: samodzielnie znaleźć materiał źródłowy, zdecydować, na czym polega historia, i oddać gotowy produkt, a nie plan.
Temat jest dowolnym ciągiem tekstowym, więc model dokonuje selekcji redakcyjnej — co uznaje się za historię, które wątki uwzględnić i w jakiej kolejności mają wystąpić. To inne zadanie niż streszczanie i to część potoku, nad którą operator ma najmniejszą kontrolę. Opcjonalny materiał uzupełniający to furtka: wklej link albo zrzut ekranu, a model pracuje na stałym źródle zamiast wyszukiwać — to różnica między odtwarzalnym renderem a innym filmem przy każdym uruchomieniu. Trzecie pole, deidentyfikacja, jest tym, nad którym warto się zatrzymać, i jeszcze do niego wrócimy.
Przeczytaj brief jak specyfikację, a dowiesz się, co zakłada o harnessie. Zakłada, że model może sięgnąć do świata zewnętrznego — krok odkrywania jest delegowany, a nie opisany — a to, do czego model ma dostęp, jest właściwością narzędzi podłączanych przez operatora, a nie samego Claude Opus 5.5. Zakłada stos obrazowania lub renderowania, ponieważ dostarczanym artefaktem jest wideo, a Claude Opus 5.5 nie generuje wideo. I zakłada głos.
Podział pracy to historia
To ostatnie założenie jest faktem strukturalnym tego workflow. Nasz własny wpis w katalogu dla anthropic/claude-opus-5.5 wymienia jego modalności wejściowe jako tekst, obraz i plik, a modalność wyjściową jako tekst — jedną modalność na wyjściu. Model nie potrafi syntetyzować mowy ani nie potrafi usłyszeć ścieżki, gdy już istnieje. Każde narracyjne wideo zbudowane w ten sposób ma zatem co najmniej dwie zależności od modeli — z dwoma cennikami, dwoma dostawcami i dwoma poświadczeniami — a tę drugą musi zapewnić człowiek. Opus 5.5 potrafi napisać scenariusz i podłączyć render; nie potrafi jednak założyć konta Google ani zaaprowizować klucza. Autor wpisu z 2 października mówi dokładnie to: klucz Gemini był jego.
To ograniczenie ma drugie ostrze, które łatwo przeoczyć, dopóki nie wdrożysz rozwiązania. Ponieważ Claude Opus 5.5 nie przyjmuje audio na wejściu, model, który napisał narrację, nie może sprawdzić narracji. Błędnie wymawiane nazwy, dziwne akcentowanie, zdanie, które syntezator odtwarza bez wyrazu — nic z tego nie dociera do modelu, który to stworzył. Kontrola jakości głosu polega za każdym razem na tym, że człowiek słucha wyniku, i to właśnie ten krok sprawia, że niezależnie od tego, jak dobry jest scenariusz, nie jest to w pełni bezobsługowy pipeline. Tam, gdzie wynik samego modelu jest programem, przegląd polega na słuchaniu, a nie na analizie diffa.

Ile kosztuje głos — a to nie jest ta droga część
Cennik Google’a ujmuje przelicznik, który sprawia, że ta arytmetyka jest przejrzysta: tokeny audio odpowiadają 25 tokenom na sekundę wyniku. Dwa rendery w poście z 2 października trwają 351 sekund i 332 sekundy — odczytane z metadanych multimediów samego tweeta — czyli około pięciu minut i pięćdziesięciu jeden sekund oraz pięciu minut i trzydziestu dwóch sekund. Przy 25 tokenach na sekundę daje to 8 775 i 8 300 tokenów audio, a przy obecnej stawce za audio Flash TTS wynoszącej 9,00 USD za milion tokenów to około ośmiu centów audio za render i około piętnastu centów za obie wersje językowe razem.
Zestaw to ze stroną rozumowania tego samego zadania. Stawka katalogowa Claude Opus 5.5 wynosi 4 USD za milion tokenów wejściowych i 20 USD za milion tokenów wyjściowych, przy czym tokeny myślenia są rozliczane jak tokeny wyjściowe, a odczyty z pamięci podręcznej — 0,20 USD za milion. Narracja do sześciominutowego filmu to błąd zaokrąglenia w porównaniu z tokenami, które model zużywa, decydując, jaka jest historia, czytając źródła i pisząc scenariusz, który czyta głos. Praktyczny wniosek nie brzmi: „TTS jest tani” — brzmi: w tym potoku głos jest jedyną pozycją, której nie musisz optymalizować, a wysiłek należy skierować na tę część, która kosztuje dolary.
Dwa szczegóły cennika zmienią tę arytmetykę, więc zaplanuj z myślą o nich już teraz:
• Okno promocyjne zamyka się — Flash TTS standard kosztuje 0,50 USD za milion tokenów tekstowych na wejściu i 9,00 USD za milion tokenów audio na wyjściu do 31 grudnia 2026 r., a następnie 1,00 USD i 18,00 USD. Narracja tego samego filmu kosztuje w styczniu około szesnastu centów, czyli dokładnie dwa razy tyle.
• Istnieje tańszy poziom z prawdziwym kompromisem — Gemini 3.8 Flash-Lite TTS rozlicza 0,50 USD i 6,00 USD według tego samego harmonogramu, rosnąc do 1,00 USD i 12,00 USD, obejmując 101 języków w porównaniu z 130 językami Flash TTS. W przypadku angielskiego materiału wyjaśniającego z jednym narratorem Lite ma dwie trzecie stawki za audio, a limit językowy nie ma znaczenia; w przypadku dwujęzycznego renderu z wpisu z 2 października nie jest on oczywiście nieistotny — i to jest decyzja, do której podjęcia skłania cię podział na poziomy.
Poziom Batch i Flex w Google to $0.25 za wejście i $4.50 za wyjście, a Priority — $0.90 i $16.20 — warto o tym wiedzieć, jeśli Twoje rendery trafiają do kolejki, a nie są interaktywne, bo nic w podsumowaniu plotek nie wymaga odpowiedzi w czasie rzeczywistym.

W tym tygodniu brief stał się umiejętnością.
Prompt w tweecie to demonstracja; repozytorium to coś, co można zainstalować. Repozytoria, które pojawiły się wokół tego formatu, to część, która naprawdę należy do ostatnich siedmiu dni, i warto je czytać osobno, a nie jako zbiór, ponieważ każde z nich stawia inny zakład co do tego, jak duża część pipeline'u powinna być utrwalona w kodzie.
• hoangduong92/idea-to-film-skill — utworzony 30 września 2026, licencja MIT i najbliższe dopasowanie do wpisu z 2 października: umiejętność Claude Code, która prowadzi od pomysłu do krótkometrażowego filmu MP4 z narracją, animacją rysowaną kodem, muzyką, efektami dźwiękowymi, głosem Gemini TTS i napisami. Głos jest wymieniony w opisie, co jest uczciwym sposobem dostarczania czegoś takiego: drugi dostawca jest zadeklarowaną zależnością, a nie ukrytą.
• samuelstroschein/opus-video-generator — utworzone 2 października, na licencji MIT, i najbardziej stanowcze w kwestii poświadczeń: tworzy filmy promocyjne w Twojej przeglądarce na Twojej własnej subskrypcji Claude, uruchamiane przez npx. To inna odpowiedź na kluczowy problem powyżej — zachowaj istniejące uprawnienia człowieka w pętli, zamiast tworzyć nowy klucz API dla agenta.
• makevoid/motion-graphics-music-video-skill-noimage — utworzony 2 października, na licencji MIT, i ten, którego dyscyplinę warto kopiować: w swoim własnym opisie stwierdza, że nie używa żadnego modelu obrazu ani modelu wideo, tworząc grafikę ruchomą ze ścieżki muzycznej i promptu. Gdy jedynym krokiem generatywnym jest kod, wynik jest powtarzalny, a każdą licencję na zasób w gotowym dziele możesz samodzielnie przeanalizować.
• RohanRatwani/explainer-video-opus-5.5 — utworzony 2 października, na licencji MIT, skierowany do filmów objaśniających w formacie 16:9 i Shorts, a nie do przeglądu plotek, i wprost nazywa problem z synchronizacją: każda animacja jest zsynchronizowana z narracją. Ta kolejność ma znaczenie, ponieważ oznacza, że dźwięk jest renderowany, zanim zostaną umieszczone elementy wizualne.
• zhuyansen/awesome-opus-5.5-video — utworzony 27 września, bez zadeklarowanej licencji i zdecydowanie najbardziej widoczny z całej grupy z 67 gwiazdkami, podczas gdy pozostałe mają jednocyfrową liczbę gwiazdek albo zero. To indeks, a nie narzędzie, w języku angielskim i chińskim, a jego istnienie jest użytecznym sygnałem dotyczącym charakteru tego zainteresowania: ludzie chcą najpierw katalogu tego, co inni twierdzą, że mają, a narzędzia pojawiają się w następnej kolejności.
Żadna z nich nie jest stabilną zależnością. Mają zaledwie kilka dni, mają jednego autora, a ich warunki licencyjne to jedyna rzecz, która stoi między tobą a materiałem filmowym, którego nie możesz użyć. Ale liczy się kierunek: prompt w tweecie jest prototypem, a umiejętność w repozytorium to coś, co zespół rzeczywiście by przyjął.
Dwie wersje językowe, jedna historia
Post z 2 października jest celowo dwujęzyczny — angielska i chińska wersja tego samego tematu. To nietypowe jak na demo i odsłania coś prawdziwego o tym formacie: plotka nie podróżuje przez tłumaczenie. Elementy, które niosą historię na jednym rynku (kto co komu powiedział, jakie zaprzeczenie wydano, jak wygląda chronologia), nie są tymi elementami, które niosą ją na innym, więc druga wersja jest przepisaniem z innym osądem redakcyjnym, a nie przejściem tłumaczeniowym. To, co się przenosi, to szkielet: ta sama struktura historii, ten sam stos renderowania, ten sam głos.
Konsekwencja kosztowa jest niewielka i idzie w dobrym kierunku. Zgodnie z powyższą arytmetyką dodanie drugiego języka kosztuje około ośmiu centów dodatkowego audio w porównaniu z historią, którą model już raz przeanalizował. Gdy drogą częścią procesu jest rozumowanie, a tanią częścią — wynik, tworzenie drugiej wersji w innym języku jest niemal darmowe — co jest argumentem za traktowaniem lokalizacji jako pełnoprawnego wyniku przepływu pracy, a nie osobnego projektu.
Deidentyfikacja to edycja, a nie usunięcie
Trzecie pole w briefie to właśnie to, które powinno cię spowolnić. 去敏 — de-sensytyzacja, wersja zdeidentyfikowana, która usuwa osobę wymienioną z nazwiska — jest oferowana jako opcjonalny parametr, jakby usunięcie nazwiska było filtrem, który się włącza. Nie jest. Przegląd plotek o możliwym do zidentyfikowania zdarzeniu, z usuniętym nazwiskiem, zwykle nadal dotyczy tej osoby: czytelnik uzupełnia nazwisko z kontekstu, a wszystko od nagłówka po miniaturę może nieść identyfikator. Usunięcie ciągu znaków zmienia deklarowany temat wideo, nie zmieniając tego, kogo ono dotyczy, a jeśli powodem usunięcia nazwiska jest wzgląd prawny lub wizerunkowy, ciąg znaków nie jest tym, co tworzyło narażenie.
Dwie rzeczy z tego wynikają dla każdego, kto wdraża ten format. Po pierwsze, obowiązek wskazania źródeł nie znika z ciebie tylko dlatego, że prezenter jest syntetyczny: wygenerowany przegląd, który czerpie z doniesień innych osób, dziedziczy obowiązek powiedzenia, skąd pochodzą te doniesienia, a brief we wpisie z 2 października nie zawiera w ogóle pola na wskazanie źródeł — tę lukę operator musi wypełnić ręcznie. Po drugie, artefakt jest zgodnie z prawdą syntetyczny, a słuchacz nie dowie się o tym, jeśli mu nie powiesz. Etykieta to jedna linijka tekstu i stanowi różnicę między demem a treścią, która wprowadza widza w błąd co do tego, co ogląda. Jeśli chcesz, aby parametry dźwigały ten ciężar, umieść ujawnienie w briefie i traktuj je jako obowiązkowe — tak jak dostawcę głosu należy wymienić, a nie ukrywać.

Uruchamianie tego na jednym kluczu i ten jeden klucz, którego jeszcze nie obejmuje
Jeśli budujesz ten potok, koszt integracji to nie wywołania modeli — to drugi zestaw poświadczeń. Claude Opus 5.5 można dziś kierować jako anthropic/claude-opus-5.5 w cenie katalogowej samego Anthropic wynoszącej 4 i 20 USD za milion tokenów, przekazywanej z 0% narzutem, dzięki czemu zmiana ceny u dostawcy trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym przeglądzie umowy. Kierowanie go wraz z resztą Twojego stacku przez jeden punkt końcowy zgodny z OpenAI usuwa drugi SDK, a automatyczne przełączanie awaryjne pozwala wypróbować nowszy lub mniej sprawdzony model na wewnętrznym renderze, nie stawiając za nim ścieżki produkcyjnej.
Uczciwą granicą jest głos. Endpointy Google Gemini 3.8 Flash TTS i Flash-Lite TTS nie są dziś w naszym katalogu — publiczne API modeli zwraca „not found” dla google/gemini-3.8-flash-tts — więc workflow z wpisu z 2 października naprawdę wymaga własnego klucza Google autora, a to jest realne ograniczenie, a nie tymczasowe, które możemy zbyć machnięciem ręki. Endpoint TTS, który faktycznie mamy w ofercie, to starszy google/gemini-3.1-flash-tts-preview, w cenie 1,00 USD za milion tokenów tekstowych na wejściu i 20,00 USD za milion tokenów audio na wyjściu: użyteczny w tym samym kształcie pipeline'u, wyceniony dla starszej generacji i nie jest to model, na którym zbudowano ten workflow. Wybierz swoją ścieżkę świadomie — jeden klucz dla reasonera i drugi dla głosu albo jeden klucz i starszy TTS.
Co obejrzeć
Tym, co uczyniłoby ten format nudnym — w dobrym tego słowa znaczeniu — byłaby modalność audio w modelu generującym. Dopóki Claude Opus 5.5 — czy cokolwiek go zastąpi — nie będzie mógł usłyszeć zleconej przez siebie ścieżki i jej dostroić, głos pozostanie etapem wymagającym ręcznej weryfikacji, a te potoki pozostaną z człowiekiem w pętli z samej konstrukcji, a nie z polityki. Przez najbliższe dwa tygodnie obserwuj raczej repozytoria skili niż dema: przetrwają te, które ujawniają swoich dostawców, mają licencję i pozwalają ponownie uruchomić ten sam brief i otrzymać to samo wideo. Prompt z posta z 2 października będzie wyglądał na łatwą część, bo nią był.
W przypadku pipeline'u, który ma już własny materiał i skrypt, użyj własnego wyliczenia, a nie pożyczaj go od X: przy 25 tokenach na sekundę każda minuta gotowej narracji to 1500 tokenów audio i około 1,35 centa przy dzisiejszej stawce Flash TTS — wartość, którą możesz zweryfikować w cenniku, zanim przydzielisz slot produkcyjny syntetycznemu prowadzącemu.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
