생성된 히어로 타이틀 카드에는 "하나의 브리프, 두 개의 모델, 하나의 내레이션 영상"이라는 문구가 적혀 있으며, 두 개의 열로 나뉩니다. Claude Opus 5.5라는 제목의 왼쪽 열은 다음과 같이 표시됩니다: 대본을 작성합니다; 2026년 9월 22일 출시; 백만 토큰당 입력 4.00달러, 출력 20.00달러. Gemini 3.8 Flash TTS라는 제목의 오른쪽 열은 다음과 같이 표시됩니다: 소리 내어 읽습니다; 2026년 9월 22일 정식 출시; 백만 오디오 토큰당 9.00달러. 바닥글에는 다음과 같이 적혀 있습니다: 5분 51초짜리 렌더는 약 8,775 오디오 토큰, 대략 8센트어치의 내레이션입니다.
Guides & Insights

Claude Opus 5.5와 Gemini 3.8 Flash TTS가 내레이션 뉴스 영상을 제작했다: 브리핑, 두 개의 요금표, 그리고 음성에 드는 비용

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 개의 모델, 두 개의 벤더, 완성된 영상 하나, 그리고 채팅 상자에 붙여 넣을 수 있을 만큼 짧은 프롬프트. 2026년 10월 2일, 중국어 AI 라이터 宝玉(X/@dotey)는 같은 가십 라운드업을 렌더링한 두 편의 영상 — 하나는 영어, 하나는 중국어 — 을 공개하며, 둘 다 처음부터 끝까지 Claude Opus 5.5가 만들었다고 말했다. 이 모델은 스스로 소재를 찾고 내레이션도 직접 썼으며, 음성은 저자가 제공한 API 키를 사용한 Gemini 3.8 Flash TTS가 공급했다. 어느 모델도 새로운 것이 아니다. Anthropic은 2026년 9월 22일에 Claude Opus 5.5를 출시했고, Google의 릴리스 노트는 Gemini 3.8 텍스트 음성 변환 모델의 날짜를 같은 날로 기록한다. 겨우 며칠 된 것은 패키징이다 — 프로듀서 브리프 자체, 그리고 그 브리프를 설치 가능한 Claude Code 스킬로 바꿔 주는, 9월 30일부터 10월 3일 사이에 생성된 일련의 저장소들. 이것은 출시에 관한 글이 아니라 워크플로에 관한 글이다.

브리프가 실제로 명시하는 것

그 템플릿은 세 개의 슬롯이 있는 한 문장이다. 원래 중국어에서 영어로 옮기면 이렇게 읽힌다: {topic}에 관한 가십 영상 만들어 줘 (보충 자료: {links/screenshots, 선택 사항}; 익명화 버전: {person's name} 삭제, 선택 사항). 이 형식의 흥미로운 점은 모두 그 세 개의 슬롯 안에 숨어 있다. 그렇게 짧은 브리프는 받는 사람이 따로 설명을 듣지 않고도 세 가지를 해낼 수 있을 때에만 위임할 수 있기 때문이다. 즉 스스로 소재를 찾고, 무엇이 이야기인지 정하고, 계획이 아니라 완성된 결과물을 돌려주는 것이다.

주제는 자유 텍스트 문자열이므로, 모델이 편집적 선택을 합니다 — 무엇이 이야기로 간주되는지, 어떤 비트를 포함할지, 어떤 순서로 배치할지. 이는 요약과는 다른 작업이며, 운영자가 가장 통제하기 어려운 파이프라인 부분입니다. 선택적 보충 자료는 탈출구입니다: 링크나 스크린샷을 붙여 넣으면 모델이 검색하는 대신 고정된 출처를 바탕으로 작업하는데, 이는 재현 가능한 렌더와 실행할 때마다 달라지는 영상의 차이입니다. 세 번째 슬롯인 去敏은 곱씹어 볼 만한 항목이며, 이 부분은 다시 다루겠습니다.

브리프를 명세서처럼 읽어 보면, 그것이 하네스에 대해 무엇을 전제하는지 알 수 있다. 그것은 모델이 외부 세계에 닿을 수 있다고 전제한다 — 발견 단계는 위임된 것이지, 서술된 것이 아니다 — 그리고 모델이 무엇에 닿을 수 있는지는 Claude Opus 5.5 자체의 속성이 아니라 운영자가 마운트하는 도구들의 속성이다. 그것은 이미지 또는 렌더링 스택을 전제한다. 왜냐하면 전달되는 산출물은 영상인데 Claude Opus 5.5는 영상을 내보내지 않기 때문이다. 그리고 그것은 목소리를 전제한다.

분업이 바로 그 이야기다.

그 마지막 가정은 이 워크플로의 구조적 사실이다. anthropic/claude-opus-5.5에 대한 우리 자체 카탈로그 항목은 입력 모달리티를 텍스트, 이미지, 파일로, 출력 모달리티를 텍스트로 나열한다 — 하나의 모달리티만 출력하는 셈이다. 이 모델은 음성을 합성할 수 없고, 트랙이 일단 존재하면 들을 수도 없다. 따라서 이런 방식으로 제작된 모든 내레이션 영상은 두 개의 요금표, 두 개의 공급업체, 두 개의 인증 정보를 가진 최소 두 개의 모델 의존성을 지니며, 두 번째 것은 사람이 제공해야 한다. Opus 5.5는 대본을 쓰고 렌더를 연결할 수 있지만, Google 계정을 개설하거나 키를 발급받을 수는 없다. 10월 2일 게시물의 작성자는 바로 그렇게 말한다: Gemini 키는 그의 것이었다.

이 제약에는 출시하기 전까지는 놓치기 쉬운 두 번째 측면이 있다. Claude Opus 5.5는 오디오를 입력받지 않기 때문에, 나레이션을 작성한 모델이 그 나레이션을 확인할 수 없다. 잘못 발음된 이름, 어색한 강조, 합성기가 밋밋하게 읽어 버리는 문장 — 그 어느 것도 이를 작성한 모델에게는 도달하지 않는다. 음성 품질 관리는 매번 사람이 출력을 듣는 일이며, 이것이 대본이 아무리 좋아도 이 공정을 완전한 무인 파이프라인으로 만들지 못하게 하는 단계다. 모델 자체의 출력이 프로그램인 경우, 검토는 diff가 아니라 듣기다.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

음성에 드는 비용 — 그리고 그것은 비싼 부분이 아니다

Google의 요금 페이지에는 이 계산을 깔끔하게 만들어 주는 환산 기준이 공개되어 있습니다. 오디오 토큰은 출력 1초당 25개 토큰에 해당합니다. 10월 2일 게시물의 두 렌더링은 각각 351초와 332초이며, 이는 트윗 자체의 미디어 메타데이터에서 읽은 값으로 대략 5분 51초와 5분 32초입니다. 초당 25토큰 기준으로 이는 8,775개와 8,300개의 오디오 토큰이고, 현재 Flash TTS 오디오 요금이 백만 토큰당 $9.00이므로 비디오당 약 8센트의 내레이션, 두 언어 버전을 합쳐 대략 15센트입니다.

그것을 같은 작업의 추론 쪽과 나란히 놓아 보세요. Claude Opus 5.5의 정가 요율은 입력 토큰 백만 개당 $4, 출력 토큰 백만 개당 $20이며, 사고 토큰은 출력으로 청구되고, 캐시 읽기는 백만 개당 $0.20입니다. 6분짜리 영상의 내레이션은 모델이 이야기가 무엇인지 정하고, 출처를 읽고, 음성이 읽을 대본을 쓰는 데 소비하는 토큰에 비하면 반올림 오차에 불과합니다. 실용적인 결론은 "TTS는 싸다"가 아니라, 이 파이프라인에서 음성은 최적화하지 않아도 되는 단 하나의 비용 항목이며, 노력은 달러가 드는 부분에 쏟아야 한다는 것입니다.

요율표의 두 가지 세부 사항이 그 계산을 바꿀 테니, 지금 그에 대비해 계획하세요:

• 프로모션 기간이 종료됩니다 — Flash TTS standard는 2026년 12월 31일까지 텍스트 토큰 백만 개당 입력 $0.50, 오디오 토큰 백만 개당 출력 $9.00이며, 이후에는 $1.00과 $18.00입니다. 같은 영상의 내레이션 비용은 1월에 약 16센트로, 정확히 두 배입니다.

• 실질적인 트레이드오프가 있는 더 저렴한 티어가 있습니다 — Gemini 3.8 Flash-Lite TTS는 동일한 요금 체계에서 $0.50와 $6.00를 청구하며 $1.00와 $12.00으로 인상되고, Flash TTS의 130개 언어에 비해 101개 언어를 지원합니다. 영어 단일 내레이터 설명 영상이라면 Lite는 오디오 요율의 3분의 2이고 언어 상한은 무관합니다. 10월 2일 게시물의 이중 언어 렌더의 경우에는 언어 상한이 명백히 무관한 것은 아니며, 이는 티어 분할이 여러분에게 내리라고 요구하는 결정입니다.

Google의 Batch 및 Flex 티어는 입력 $0.25, 출력 $4.50이고, Priority는 $0.90과 $16.20입니다 — 렌더링이 대화형이 아니라 대기열에 들어가는 경우라면 알아둘 만합니다. 가십 요약에는 답변이 실시간일 필요가 전혀 없으니까요.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

이번 주, 브리프는 스킬이 되었습니다

트윗에 있는 프롬프트는 데모이고, 리포지토리는 설치할 수 있는 것이다. 이 형식을 전후해 등장한 리포지토리들은 정말로 지난 7일 이내에 속하는 부분이며, 하나의 세트로 읽기보다 개별적으로 읽을 가치가 있다. 왜냐하면 각각이 파이프라인의 얼마나 많은 부분을 코드로 고정해야 하는지에 대해 서로 다른 베팅을 하기 때문이다.

• hoangduong92/idea-to-film-skill — 2026년 9월 30일에 생성되었고 MIT 라이선스이며, 10월 2일 게시물과 가장 잘 맞는 항목입니다: 아이디어를 코드로 그린 애니메이션, 음악, 음향 효과, Gemini TTS 음성 및 자막이 있는 내레이션 단편 영화 MP4로 만들어 주는 Claude Code 스킬. 그 음성은 설명에 명시되어 있는데, 이것이 이를 배포하는 정직한 방식입니다: 두 번째 벤더는 숨겨진 의존성이 아니라 선언된 의존성입니다.

• samuelstroschein/opus-video-generator — 10월 2일 공개, MIT 라이선스, 그리고 자격 증명에 관해 가장 단호한 입장을 취한다: npx를 통해 실행되며, 자신의 Claude 구독으로 브라우저에서 런치 영상을 만든다. 이는 위의 핵심 문제에 대한 또 다른 해답이다 — 에이전트를 위해 새 API 키를 발급하는 대신, 사람의 기존 권한을 루프 안에 유지한다.

• makevoid/motion-graphics-music-video-skill-noimage — 10월 2일 제작, MIT 라이선스이며, 본받을 만한 원칙이 있는 항목입니다: 자체 설명에 이미지 모델과 비디오 모델을 사용하지 않는다고 밝히고, 음악 트랙과 프롬프트로 모션 그래픽을 생성합니다. 유일한 생성 단계가 코드일 때 결과물은 재현 가능하며, 완성된 작품의 모든 에셋 라이선스는 직접 따져볼 수 있는 당신의 몫입니다.

• RohanRatwani/explainer-video-opus-5.5 — 10월 2일 제작, MIT 라이선스, 가십 요약이 아니라 16:9 및 Shorts 설명 영상을 겨냥하며, 타이밍 문제를 명시적으로 언급한다: 모든 애니메이션이 내레이션에 맞춰 타이밍이 잡힌다. 이러한 순서가 중요한데, 이는 뷰가 배치되기 전에 오디오가 렌더링된다는 의미이기 때문이다.

• zhuyansen/awesome-opus-5.5-video — 9월 27일 생성되었고 라이선스는 명시되지 않았으며, 67개의 스타를 받아 이 그룹에서 단연 가장 눈에 띈다. 나머지는 한 자릿수이거나 0이다. 이것은 도구라기보다는 색인이며, 영어와 중국어로 되어 있고, 그 존재 자체가 관심의 형태에 관한 유용한 신호다. 사람들이 가장 먼저 원하는 것은 다른 이들이 만들었다고 주장하는 것들의 목록이고, 도구는 그 뒤를 따른다.

이 중 어느 것도 안정적인 의존성은 아니다. 나온 지 며칠밖에 안 됐고, 단일 작성자가 만들었으며, 그들의 라이선스 조건이 당신이 사용할 수 없는 영상 소재 한 조각과 당신 사이를 가로막는 유일한 것이다. 하지만 중요한 건 방향성이다: 트윗에 있는 프롬프트는 프로토타입이고, 저장소에 있는 스킬은 팀이 실제로 도입할 만한 것이다.

두 개의 언어 버전, 하나의 이야기

10월 2일 게시물은 의도적으로 이중언어로 되어 있다 — 같은 주제를 영어로 표현한 것과 중국어로 표현한 것. 이는 데모에서는 이례적인 일이며, 이 형식에 관한 실질적인 무언가를 드러낸다. 즉 가십은 번역을 통해 이동하지 않는다는 것이다. 한 시장에서 이야기를 끌고 가는 비트(누가 누구에게 무엇을 말했는지, 어떤 부인이 나왔는지, 타임라인이 어떻게 보이는지)는 다른 시장에서 그 이야기를 끌고 가는 비트가 아니다. 그래서 두 번째 버전은 번역 작업이 아니라 다른 편집 판단에 따른 재작성이다. 전이되는 것은 뼈대다: 동일한 이야기 구조, 동일한 렌더링 스택, 동일한 목소리.

비용상의 결과는 올바른 방향으로 작다. 위의 계산대로라면, 두 번째 언어를 추가하는 데는 모델이 이미 한 번 조사한 스토리에 대해 약 8센트의 추가 오디오 비용이 든다. 파이프라인에서 비싼 부분이 추론이고 저렴한 부분이 출력이라면, 다른 언어로 두 번째 버전을 만드는 것은 거의 무료에 가깝다 — 이는 현지화를 별도 프로젝트가 아니라 워크플로의 일급 출력으로 취급해야 한다는 근거가 된다.

비식별화는 편집이지, 삭제가 아닙니다

브리프의 세 번째 항목은 당신의 속도를 늦춰야 하는 항목이다. 去敏 — 비식별화, 즉 특정 인물의 이름을 제거한 비식별 버전 — 은 마치 이름을 지우는 것이 켜고 끄는 필터인 것처럼 선택적 매개변수로 제시된다. 그렇지 않다. 식별 가능한 사건에 관한 가십 모음에서 이름을 지운다고 해도, 그것은 대개 여전히 그 사람에 관한 것이다. 독자는 문맥에서 이름을 채워 넣고, 헤드라인부터 썸네일까지 모든 것이 그 식별자를 담을 수 있다. 문자열을 제거하는 것은 그 영상이 무엇에 관한 것이라고 말하는지는 바꾸지만 누구에 관한 것인지는 바꾸지 않으며, 이름을 제거하는 이유가 법적 또는 평판상의 이유라면 노출을 만들어내는 부분은 그 문자열이 아니다.

이 형식을 내놓는 사람이라면 누구에게나 두 가지가 따른다. 첫째, 발표자가 합성이라 해서 출처 표시 의무가 당신에게서 사라지는 것은 아니다. 다른 사람들의 보도를 읽어 만든 생성형 요약은 그 보도가 어디서 왔는지 밝힐 의무를 물려받는다. 그리고 10월 2일 게시물의 브리프에는 출처 표기 슬롯이 전혀 없다 — 그것은 운영자가 직접 손으로 메워야 하는 빈틈이다. 둘째, 그 결과물은 합법적으로 합성물인데, 당신이 알려주지 않으면 청취자는 그 사실을 듣지 못한다. 라벨은 한 줄의 텍스트이며, 그것은 데모와 시청자가 무엇을 보고 있는지에 대해 오해하게 만드는 콘텐츠 사이의 차이다. 그 무게를 파라미터가 지게 하려면, 공개 문구를 브리프에 넣고 선택 사항이 아닌 것으로 다뤄라. 마치 음성의 공급업체를 숨기지 않고 이름을 밝혀야 하는 것처럼.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

하나의 키로 실행하는 것, 그리고 아직 그것이 포괄하지 못하는 그 하나의 키

이 파이프라인을 구축하고 있다면, 통합 비용은 모델 호출이 아니라 두 번째 자격 증명입니다. Claude Opus 5.5는 오늘날 라우팅할 수 있습니다: anthropic/claude-opus-5.5가 Anthropic 자체 정가인 백만 토큰당 $4 및 $20에, 0% 마크업으로 그대로 전달됩니다. 따라서 공급업체의 가격 변동이 다음 계약 검토 때가 아니라 같은 날 청구서에 반영됩니다. 이를 나머지 스택과 함께 하나의 OpenAI 호환 엔드포인트를 통해 라우팅하는 것이 두 번째 SDK를 제거하는 일이며, 자동 장애 조치 덕분에 프로덕션 경로를 뒤에 두지 않고도 내부 렌더에서 더 새롭거나 검증이 덜 된 모델을 시험해 볼 수 있습니다.

솔직한 경계는 음성입니다. Google의 Gemini 3.8 Flash TTS 및 Flash-Lite TTS 엔드포인트는 오늘 우리 카탈로그에 없습니다 — 공개 모델 API는 google/gemini-3.8-flash-tts에 대해 not-found를 반환합니다 — 따라서 10월 2일 게시물의 워크플로는 정말로 작성자 본인의 Google 키가 필요하며, 이는 우리가 손사래 치며 넘길 수 있는 일시적 제약이 아니라 실제 제약입니다. 우리가 실제로 제공하는 TTS 엔드포인트는 더 오래된 google/gemini-3.1-flash-tts-preview이며, 입력 텍스트 토큰 100만 개당 $1.00, 출력 오디오 토큰 100만 개당 $20.00입니다: 동일한 파이프라인 형태로 사용할 수 있지만, 이전 세대에 맞춰 가격이 책정되었고, 이 워크플로가 기반으로 삼은 모델은 아닙니다. 현명하게 경로를 선택하세요 — 추론기용 키 하나와 음성용 키 하나, 또는 키 하나와 더 오래된 TTS입니다.

볼 만한 것

이 형식을 좋은 의미에서 지루하게 만들 것은 생성 모델의 오디오 모달리티다. Claude Opus 5.5 — 아니면 그것을 대체할 무엇이든 — 가 자신이 의뢰한 트랙을 듣고 조정할 수 있게 되기 전까지, 음성은 수동 검토 단계로 남고, 이러한 파이프라인은 정책이 아니라 구조상 인간 개입(human-in-the-loop)으로 남는다. 다음 2주 동안은 데모가 아니라 스킬 저장소들을 지켜보라: 살아남는 것들은 자신의 공급업체를 밝히고, 라이선스를 갖추며, 같은 브리프를 다시 실행해도 같은 영상을 얻게 해주는 것들이 될 것이다. 10월 2일 글의 프롬프트는 쉬운 부분처럼 보일 텐데, 실제로 쉬웠기 때문이다.

이미 자체 자료와 스크립트를 보유한 파이프라인이라면, X에서 숫자를 빌려오기보다 직접 계산하세요. 초당 25토큰 기준으로 완성된 내레이션 1분은 오디오 토큰 1,500개이며, 오늘날 Flash TTS 요율로 약 1.35센트입니다 — 합성 진행자에게 제작 슬롯을 배정하기 전에 요율표와 대조해 확인할 수 있는 수치입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트