Сгенерированная hero-карточка заголовка с надписью ОДИН БРИФ, ДВЕ МОДЕЛИ, ОДНО ВИДЕО С ОЗВУЧИВАНИЕМ, разделённая на две колонки. В левой колонке, озаглавленной Claude Opus 5.5, написано: пишет сценарий; выпущена 22 сентября 2026; 4,00 доллара за вход и 20,00 долларов за выход за миллион токенов. В правой колонке, озаглавленной Gemini 3.8 Flash TTS, написано: читает его вслух; общедоступна 22 сентября 2026; 9,00 долларов за миллион аудиотокенов. В нижней строке: рендер длительностью 5 мин 51 с — это около 8 775 аудиотокенов, примерно 8 центов за озвучивание.
Guides & Insights

Claude Opus 5.5 и Gemini 3.8 Flash TTS создали озвученное новостное видео: краткая сводка, две тарифные карты и сколько стоит голос

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две модели, два вендора, одно готовое видео и промпт, достаточно короткий, чтобы просто вставить его в окно чата. 2 октября 2026 года пишущий на китайском AI-автор 宝玉 (X/@dotey) опубликовал два рендера одной и той же подборки сплетен — один на английском, один на китайском — и заявил, что оба были сделаны от начала до конца Claude Opus 5.5, который сам нашёл материал и сам написал текст озвучки, а голос предоставил Gemini 3.8 Flash TTS с использованием API-ключа, который указал автор. Ни одна из моделей не нова: Anthropic выпустила Claude Opus 5.5 22 сентября 2026 года, а в примечаниях к выпуску Google модели синтеза речи Gemini 3.8 датированы тем же днём. А вот чему всего несколько дней — так это упаковке: сам продюсерский бриф и череда репозиториев, созданных между 30 сентября и 3 октября, которые превращают этот бриф в навык Claude Code, который можно установить. Это материал о рабочем процессе, а не о запуске.

Что на самом деле указывает бриф

Шаблон — это одно предложение с тремя слотами. В переводе с исходного китайского на английский оно звучит так: сделай мне видео со сплетнями про {тема} (дополнительные материалы: {ссылки/скриншоты, необязательно}; обезличенная версия: удалить {имя человека}, необязательно)Всё интересное в этом формате скрыто в этих трёх слотах, потому что такой короткий бриф можно делегировать только в том случае, если получатель способен без указаний сделать три вещи: найти собственный исходный материал, решить, в чём заключается история, и вернуть готовый артефакт, а не план.

Тема — это произвольная текстовая строка, поэтому модель выполняет редакционный отбор — что считается историей, какие моменты включить, в каком порядке они идут. Это другая задача, нежели суммирование, и это та часть пайплайна, над которой оператор имеет наименьший контроль. Необязательный дополнительный материал — это аварийный выход: вставьте ссылку или скриншот, и модель работает с фиксированным источником вместо поиска, что и есть разница между воспроизводимым рендером и другим видео при каждом запуске. Третий слот, 去敏, — тот, на котором стоит остановиться, и мы вернёмся к нему.

Прочитайте бриф как спецификацию, и он скажет вам, что предполагает о харнессе. Он предполагает, что модель может получить доступ к внешнему миру — этап обнаружения делегирован, а не описан, — и то, к чему модель имеет доступ, является свойством инструментов, которые подключает оператор, а не самого Claude Opus 5.5. Он предполагает стек обработки изображений или рендеринга, потому что поставляемый артефакт — это видео, а Claude Opus 5.5 не выдаёт видео. И он предполагает наличие голоса.

Разделение труда — это и есть история.

Это последнее допущение — структурный факт данного рабочего процесса. В нашей собственной записи каталога для anthropic/claude-opus-5.5 входными модальностями указаны текст, изображение и файл, а выходной — текст, то есть одна модальность на выходе. Модель не умеет синтезировать речь и не может услышать дорожку после её создания. Поэтому каждое озвученное видео, созданное таким способом, имеет как минимум две зависимости от моделей — с двумя тарифными планами, двумя поставщиками и двумя учётными данными, — а второй набор должен предоставить человек. Opus 5.5 может написать сценарий и настроить рендеринг; но он не может открыть аккаунт Google или создать ключ. Автор поста от 2 октября говорит именно это: ключ Gemini принадлежал ему.

У этого ограничения есть вторая грань, которую легко упустить, пока не выпустишь продукт. Поскольку Claude Opus 5.5 не принимает аудио на вход, модель, написавшая текст озвучки, не может проверить озвучку. Неправильно произнесённые имена, странные ударения, предложение, которое синтезатор произносит монотонно, — ничего из этого не доходит до модели, которая это создала. Контроль качества голоса — это человек, слушающий результат, каждый раз, и именно этот шаг не позволяет процессу стать полностью автоматизированным пайплайном, каким бы хорошим ни был сценарий. Там, где собственный вывод модели — это программа, проверка — это прослушивание, а не diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Сколько стоит голос — и это не дорогая часть

Страница цен Google публикует конверсию, которая делает эту арифметику простой: аудиотокены соответствуют 25 токенам в секунду вывода. Два рендера в посте от 2 октября длятся 351 секунду и 332 секунды, согласно метаданным медиа самого твита — примерно пять минут пятьдесят одна секунда и пять минут тридцать две секунды. При 25 токенах в секунду это 8 775 и 8 300 аудиотокенов, а при текущем тарифе Flash TTS за аудио в $9.00 за миллион токенов это около восьми центов за озвучивание одного видео и примерно пятнадцать центов за обе языковые версии вместе.

Сопоставьте это с той частью той же задачи, что отвечает за рассуждения. Прайс-лист Claude Opus 5.5 — 4 доллара за миллион входных токенов и 20 долларов за миллион выходных, при этом токены размышлений тарифицируются как выходные, а чтение из кэша — 0,20 доллара за миллион. Озвучка шестиминутного видео — это погрешность округления на фоне токенов, которые модель тратит на то, чтобы решить, в чём заключается история, изучить источники и написать сценарий, который читает голос. Практический вывод не в том, что «TTS — это дёшево», а в том, что в этом конвейере голос — единственная статья расходов, которую не нужно оптимизировать, и усилия стоит вкладывать в ту часть, которая стоит долларов.

Две детали тарифной сетки изменят этот расчёт, так что учитывайте их заранее:

• Акционный период заканчивается — стандартный Flash TTS стоит $0.50 за миллион входных текстовых токенов и $9.00 за миллион выходных аудиотокенов до 31 декабря 2026 года, а затем — $1.00 и $18.00. Озвучивание того же видео в январе обойдётся примерно в шестнадцать центов — ровно вдвое дороже.

• Есть более дешёвый тариф с реальным компромиссом — Gemini 3.8 Flash-Lite TTS тарифицируется по $0.50 и $6.00 по тому же графику, повышаясь до $1.00 и $12.00, охватывая 101 язык против 130 у Flash TTS. Для объясняющего видео с одним диктором на английском у Lite ставка за аудио составляет две трети, а потолок по языкам не имеет значения; для двуязычного рендера в посте от 2 октября он не выглядит столь уж неважным — и именно это решение предлагает принять разделение на тарифы.

Уровни Batch и Flex от Google стоят $0,25 за вход и $4,50 за выход, а Priority — $0,90 и $16,20 — это стоит знать, если ваши рендеры стоят в очереди, а не выполняются интерактивно, потому что ничто в дайджесте сплетен не требует ответа в реальном времени.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

На этой неделе бриф стал навыком.

Промпт в твите — это демонстрация; репозиторий — это то, что можно установить. Репозитории, появившиеся вокруг этого формата, — это та часть, которая действительно относится к последним семи дням, и их стоит читать по отдельности, а не как набор, потому что каждый из них делает свою ставку на то, насколько большая часть пайплайна должна быть зафиксирована в коде.

• hoangduong92/idea-to-film-skill — создан 30 сентября 2026 года, под лицензией MIT, и наиболее близкое совпадение с постом от 2 октября: навык Claude Code, который превращает идею в озвученный короткометражный фильм MP4 с нарисованной кодом анимацией, музыкой, звуковыми эффектами, голосом Gemini TTS и субтитрами. Голос назван в описании — это честный способ выпустить такое: второй поставщик является заявленной зависимостью, а не скрытой.

• samuelstroschein/opus-video-generator — создан 2 октября, под лицензией MIT и самый категоричный в вопросах учётных данных: он делает видео о запуске прямо в вашем браузере на вашей собственной подписке Claude и запускается через npx. Это другой ответ на ключевую проблему выше — сохранить существующее право доступа человека в цепочке вместо выпуска нового API-ключа для агента.

• makevoid/motion-graphics-music-video-skill-noimage — создан 2 октября, под лицензией MIT, и у него есть дисциплина, которую стоит перенять: в собственном описании сказано, что он не использует ни модель изображений, ни видеомодель, а создаёт моушн-графику из музыкальной дорожки и промпта. Когда единственный генеративный этап — это код, результат воспроизводим, и лицензию на каждый актив в готовой работе можно осмыслить самостоятельно.

• RohanRatwani/explainer-video-opus-5.5 — создан 2 октября, под лицензией MIT, ориентирован на объясняющее видео в формате 16:9 и Shorts, а не на подборку сплетен, и в нём прямо обозначена проблема синхронизации: каждая анимация синхронизирована с озвучкой. Этот порядок важен, потому что означает, что аудио рендерится до размещения визуальных элементов.

• zhuyansen/awesome-opus-5.5-video — создан 27 сентября, лицензия не указана, и он, безусловно, самый заметный в группе с 67 звёздами, тогда как у остальных — однозначные числа или ноль. Это индекс, а не инструмент, на английском и китайском, и само его существование — полезный сигнал о характере интереса: людям в первую очередь нужен каталог того, что другие утверждают, будто сделали, а инструменты появляются следом.

Ничто из этого не является стабильной зависимостью. Им всего несколько дней, у них один автор, и их условия лицензии — единственное, что стоит между вами и фрагментом видеоматериала, который вы не можете использовать. Но важна сама направленность: промпт в твите — это прототип, а навык в репозитории — это то, что команда действительно внедрила бы.

Две языковые версии, одна история

Пост от 2 октября намеренно двуязычен — английский и китайский варианты одной и той же темы. Для демо это необычно, и это вскрывает кое-что реальное насчёт такого формата: сплетни не распространяются через перевод. Те смысловые акценты, которые «несут» историю на одном рынке (кто кому что сказал, какое опровержение было выпущено, как выглядит хронология), — это не те акценты, которые несут её на другом, поэтому вторая версия — это переписывание с другим редакторским суждением, а не этап перевода. Передаётся же скелет: та же структура истории, тот же стек рендеринга, тот же голос.

Последствие для затрат — в правильном направлении. Судя по приведённой выше арифметике, добавление второго языка стоит около восьми центов дополнительного аудио по сравнению с историей, которую модель уже один раз исследовала. Когда дорогая часть конвейера — это исследование, а дешёвая — вывод, создание второй версии на другом языке почти ничего не стоит — а это аргумент в пользу того, чтобы рассматривать локализацию как полноценный результат рабочего процесса, а не как отдельный проект.

Деидентификация — это редактирование, а не удаление.

Третий слот в брифе — тот, который должен заставить вас притормозить. 去敏 — десенсибилизация, обезличенная версия, убирающая имя конкретного человека, — предлагается как необязательный параметр, как будто удаление имени — это фильтр, который можно включить. Это не так. Подборка сплетен о событии, позволяющем установить личность, с удалённым именем обычно всё ещё о том человеке: читатель восстанавливает имя из контекста, и всё — от заголовка до миниатюры — может нести идентификатор. Удаление строки меняет заявленную тему видео, но не меняет того, о ком оно, и если вы удаляете имя по юридическим причинам или из соображений репутации, то строка — не та часть, которая создавала риск.

Для всех, кто выпускает этот формат, из этого следуют две вещи. Во-первых, обязанность указывать источники не снимается с вас из-за того, что ведущий синтетический: сгенерированная подборка, которая черпает из чужих репортажей, наследует обязанность сообщать, откуда взяты эти материалы, а в брифе из поста от 2 октября вообще нет слота для указания источников — это пробел, который оператору приходится заполнять вручную. Во-вторых, артефакт по праву является синтетическим, и слушателю об этом не сообщают, если вы не скажете сами. Метка — это одна строка текста, и она определяет разницу между демо и контентом, который вводит зрителя в заблуждение относительно того, что он смотрит. Если вы хотите, чтобы эту нагрузку несли параметры, включите раскрытие в бриф и считайте его обязательным — так же, как поставщика голоса следует называть, а не скрывать.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Запуская его на одном ключе, и тот единственный ключ, который он пока не охватывает

Если вы строите этот пайплайн, затраты на интеграцию — это не вызовы модели, а вторые учётные данные. Claude Opus 5.5 уже можно маршрутизировать какanthropic/claude-opus-5.5 по собственной прайс-листовой цене Anthropic — $4 и $20 за миллион токенов, передаваемой с наценкой 0%, так что изменение цены вендором отразится в вашем счёте в тот же день, а не на следующем пересмотре контракта. Именно маршрутизация его вместе с остальным вашим стеком через одну конечную точку, совместимую с OpenAI, избавляет от второго SDK, а автоматическое переключение при сбое — это то, что позволяет попробовать более новую или менее проверенную модель на внутреннем рендере, не ставя за ней производственный путь.

Честная граница — это голос. Конечные точки Google Gemini 3.8 Flash TTS и Flash-Lite TTS сегодня отсутствуют в нашем каталоге — публичный API моделей возвращает not-found для google/gemini-3.8-flash-tts — поэтому рабочему процессу из публикации от 2 октября действительно нужен собственный ключ Google автора, и это реальное ограничение, а не временное, от которого можно отмахнуться. Конечная точка TTS, которую мы всё же предлагаем, — это более старая google/gemini-3.1-flash-tts-preview, по цене $1.00 за миллион входных текстовых токенов и $20.00 за миллион выходных аудиотокенов: её можно использовать в той же конфигурации пайплайна, цена соответствует более старому поколению, и это не та модель, на которой был построен этот рабочий процесс. Выбирайте путь осознанно — один ключ для рассуждающей модели и второй для голоса, или один ключ и более старая TTS.

Что посмотреть

То, что сделало бы этот формат скучным — в хорошем смысле, — это аудиомодальность у производящей модели. Пока Claude Opus 5.5 — или что бы его ни заменило — не сможет услышать заказанный им трек и скорректировать его, голос остаётся этапом, проверяемым вручную, а эти пайплайны остаются с человеком в контуре по самой своей конструкции, а не по политике. Следите в ближайшие две недели за репозиториями навыков, а не за демо: выживут те, которые заявляют своих поставщиков, имеют лицензию и позволяют повторно запустить тот же бриф и получить то же видео. Промпт из поста от 2 октября будет выглядеть лёгкой частью — потому что он и был ею.

Для конвейера, в котором уже есть собственный материал и сценарий, посчитайте своё число, а не заимствуйте его у X: при 25 токенах в секунду каждая минута готовой озвучки — это 1 500 аудиотокенов и около 1,35 цента по сегодняшнему тарифу Flash TTS — цифра, которую можно сверить с тарифной картой, прежде чем выделять производственный слот синтетическому ведущему.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно