Một thẻ tiêu đề hero được tạo ghi MỘT BẢN BRIEF, HAI MÔ HÌNH, MỘT VIDEO CÓ THUYẾT MINH, chia thành hai cột. Cột bên trái, có tiêu đề Claude Opus 5.5, ghi: viết kịch bản; phát hành ngày 22 tháng 9 năm 2026; 4,00 đô-la đầu vào và 20,00 đô-la đầu ra mỗi triệu token. Cột bên phải, có tiêu đề Gemini 3.8 Flash TTS, ghi: đọc thành tiếng; có sẵn rộng rãi từ ngày 22 tháng 9 năm 2026; 9,00 đô-la mỗi triệu token âm thanh. Dòng chân trang ghi: một bản render 5 phút 51 giây tốn khoảng 8.775 token âm thanh, tương đương khoảng 8 xu tiền thuyết minh.
Guides & Insights

Claude Opus 5.5 và Gemini 3.8 Flash TTS đã tạo một video tin tức có thuyết minh: bản tóm tắt, hai bảng giá, và giọng nói tốn bao nhiêu chi phí

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình, hai nhà cung cấp, một video hoàn chỉnh, và một câu lệnh ngắn đến mức có thể dán thẳng vào ô chat. Vào ngày 2 tháng 10 năm 2026, cây bút AI viết bằng tiếng Trung 宝玉 (X/@dotey) đã đăng hai bản dựng của cùng một bản tổng hợp tin đồn — một bản tiếng Anh, một bản tiếng Trung — và cho biết cả hai đều được tạo ra từ đầu đến cuối bởi Claude Opus 5.5, mô hình này tự tìm tư liệu và tự viết lời bình, với giọng đọc do Gemini 3.8 Flash TTS cung cấp, sử dụng khóa API do chính tác giả đưa vào. Cả hai mô hình đều không mới: Anthropic phát hành Claude Opus 5.5 vào ngày 22 tháng 9 năm 2026, và ghi chú phát hành của Google cũng ghi ngày ra mắt các mô hình chuyển văn bản thành giọng nói Gemini 3.8 là cùng ngày hôm đó. Thứ chỉ mới vài ngày tuổi chính là phần đóng gói — bản đề bài của nhà sản xuất, cùng một loạt kho mã được tạo ra từ ngày 30 tháng 9 đến ngày 3 tháng 10, biến bản đề bài đó thành một kỹ năng Claude Code mà bạn có thể cài đặt. Đây là bài viết về quy trình làm việc, không phải về một buổi ra mắt.

Những gì bản brief thực sự quy định

Mẫu này chỉ là một câu với ba chỗ trống. Khi chuyển sang tiếng Anh từ bản gốc tiếng Trung, nó có dạng: hãy làm cho tôi một video buôn chuyện về {topic} (tài liệu bổ sung: {links/screenshots, optional}; phiên bản ẩn danh hóa: xóa {person's name}, optional). Mọi điều thú vị về định dạng này đều nằm ẩn trong ba chỗ trống đó, bởi một đề bài ngắn gọn đến vậy chỉ có thể giao phó được nếu người nhận làm được ba việc mà không cần ai phải nói: tự tìm nguồn tư liệu của chính mình, tự quyết định câu chuyện là gì, và trả về một sản phẩm hoàn chỉnh thay vì một bản kế hoạch.

Chủ đề là một chuỗi văn bản tự do, nên mô hình đang thực hiện việc chọn lọc biên tập — điều gì được tính là câu chuyện, những nhịp nào cần đưa vào, chúng đi theo thứ tự nào. Đó là một công việc khác với tóm tắt, và đó là phần của pipeline mà người vận hành ít kiểm soát nhất. Tài liệu bổ sung tùy chọn là lối thoát hiểm: dán một liên kết hoặc ảnh chụp màn hình và mô hình làm việc từ một nguồn cố định thay vì tìm kiếm, đó là sự khác biệt giữa một bản render có thể tái lập và một video khác nhau mỗi lần bạn chạy nó. Khe thứ ba, 去敏, là khe đáng để bàn kỹ và chúng ta sẽ quay lại với nó.

Hãy đọc bản brief như một bản đặc tả, và nó cho bạn biết những gì nó giả định về harness. Nó giả định rằng mô hình có thể vươn ra thế giới bên ngoài — bước khám phá được giao phó, chứ không được mô tả — và những gì mô hình có thể tiếp cận là thuộc tính của những công cụ mà người vận hành gắn vào, chứ không phải của bản thân Claude Opus 5.5. Nó giả định có một ngăn xếp hình ảnh hoặc kết xuất, bởi vì sản phẩm được bàn giao là video và Claude Opus 5.5 không tạo ra video. Và nó giả định có một giọng nói.

Sự phân công lao động chính là câu chuyện

Giả định cuối cùng đó chính là sự thật mang tính cấu trúc của quy trình này. Mục trong danh mục của chính chúng tôi cho anthropic/claude-opus-5.5 liệt kê các phương thức đầu vào của nó là văn bản, hình ảnh và tệp, còn phương thức đầu ra là văn bản — thiếu mất một phương thức. Mô hình không thể tổng hợp giọng nói và cũng không thể nghe một track sau khi nó đã tồn tại. Do đó, mọi video có thuyết minh được tạo theo cách này đều có ít nhất hai phụ thuộc mô hình, với hai bảng giá, hai nhà cung cấp và hai thông tin xác thực, và cái thứ hai phải do con người cung cấp. Opus 5.5 có thể viết kịch bản và kết nối khâu render; nó không thể mở một tài khoản Google hay cấp phát một khóa. Tác giả của bài đăng ngày 2 tháng 10 nói chính xác điều đó: khóa Gemini là của ông ấy.

Ràng buộc này có một khía cạnh thứ hai dễ bị bỏ sót cho đến khi bạn phát hành. Vì Claude Opus 5.5 không nhận âm thanh đầu vào, mô hình đã viết lời thuyết minh không thể kiểm tra lời thuyết minh. Tên bị phát âm sai, trọng âm kỳ lạ, một câu mà bộ tổng hợp đọc phẳng lì — không điều nào trong số đó đến được với mô hình đã tạo ra chúng. Kiểm soát chất lượng giọng đọc là việc một con người nghe thành phẩm, mỗi lần như vậy, và đó chính là bước khiến quy trình này không thể trở thành một pipeline hoàn toàn không cần người giám sát, cho dù kịch bản có tốt đến đâu. Khi đầu ra của chính mô hình là một chương trình, việc đánh giá là nghe, chứ không phải đối chiếu diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Giọng nói tốn bao nhiêu — và đó không phải là phần đắt đỏ.

Trang định giá của Google công bố tỷ lệ quy đổi khiến phép tính này trở nên gọn gàng: token âm thanh tương ứng với 25 token mỗi giây đầu ra. Hai bản kết xuất trong bài đăng ngày 2 tháng 10 chạy trong 351 giây và 332 giây, đọc từ siêu dữ liệu phương tiện của chính tweet đó — khoảng năm phút năm mươi mốt giây và năm phút ba mươi hai giây. Với 25 token một giây, đó là 8.775 và 8.300 token âm thanh, và với mức giá âm thanh Flash TTS hiện tại là 9,00 USD cho mỗi triệu token, thì đó là khoảng tám xu tiền thuyết minh cho mỗi video và khoảng mười lăm xu cho cả hai phiên bản ngôn ngữ cộng lại.

Đặt nó cạnh phần suy luận của cùng một công việc. Đơn giá niêm yết của Claude Opus 5.5 là 4 đô-la cho mỗi triệu token đầu vào và 20 đô-la cho mỗi triệu token đầu ra, với token suy nghĩ được tính như đầu ra, và đọc từ cache ở mức 0,20 đô-la mỗi triệu. Lời thuyết minh của một video sáu phút chỉ là một sai số làm tròn so với số token mà mô hình tiêu tốn để quyết định câu chuyện là gì, đọc các nguồn và viết ra kịch bản mà giọng đọc đọc lên. Kết luận thực tế không phải là "TTS rẻ" — mà là trong quy trình này, giọng đọc là khoản mục duy nhất bạn không cần phải tối ưu, và công sức nên dồn vào phần thực sự tốn tiền.

Hai chi tiết trong bảng giá sẽ làm thay đổi phép tính đó, vì vậy hãy lên kế hoạch đối phó với chúng ngay từ bây giờ:

• Thời gian khuyến mãi kết thúc — Flash TTS standard có giá $0.50 cho mỗi triệu token văn bản đầu vào và $9.00 cho mỗi triệu token âm thanh đầu ra đến hết ngày 31 tháng 12 năm 2026, sau đó là $1.00 và $18.00. Phần thuyết minh cho cùng video đó tốn khoảng mười sáu xu vào tháng Một, đúng gấp đôi.

• Có một gói rẻ hơn với sự đánh đổi thực sự — Gemini 3.8 Flash-Lite TTS tính phí $0.50 và $6.00 theo cùng lịch, tăng lên $1.00 và $12.00, bao phủ 101 ngôn ngữ so với 130 của Flash TTS. Đối với video giải thích một người dẫn bằng tiếng Anh, Lite chỉ bằng hai phần ba mức giá âm thanh và giới hạn ngôn ngữ không thành vấn đề; còn với bản render song ngữ trong bài đăng ngày 2 tháng 10, giới hạn ngôn ngữ không hẳn là không liên quan, và đó chính là quyết định mà việc phân chia gói đang yêu cầu bạn đưa ra.

Gói Batch và Flex của Google có giá 0,25 đô-la cho đầu vào và 4,50 đô-la cho đầu ra, còn gói Priority là 0,90 và 16,20 đô-la — điều đáng biết nếu các bản render của bạn được xếp hàng đợi thay vì chạy tương tác, bởi vì chẳng có gì trong một bản tổng hợp tin đồn lại cần câu trả lời theo thời gian thực.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Tuần này, brief đã trở thành một kỹ năng.

Một prompt trong một tweet là một bản trình diễn; một repository là thứ bạn có thể cài đặt. Những repository xuất hiện quanh định dạng này chính là phần thực sự nằm trong bảy ngày qua, và chúng đáng được đọc riêng lẻ thay vì như một nhóm, bởi vì mỗi cái đưa ra một đặt cược khác nhau về việc bao nhiêu phần của pipeline nên được cố định trong mã.

• hoangduong92/idea-to-film-skill — được tạo ngày 30 tháng 9 năm 2026, theo giấy phép MIT, và là kết quả khớp gần nhất với bài đăng ngày 2 tháng 10: một skill của Claude Code biến một ý tưởng thành phim ngắn MP4 có thuyết minh với hoạt hình vẽ bằng mã, nhạc, hiệu ứng âm thanh, giọng đọc Gemini TTS và phụ đề. Giọng đọc được nêu tên trong phần mô tả, và đó là cách trung thực để phát hành thứ này: nhà cung cấp thứ hai là một phụ thuộc được công bố, chứ không phải bị ẩn đi.

• samuelstroschein/opus-video-generator — được tạo ngày 2 tháng 10, cấp phép MIT, và là công cụ có quan điểm rõ rệt nhất về thông tin xác thực: nó tạo video ra mắt ngay trong trình duyệt của bạn trên gói đăng ký Claude của chính bạn, chạy qua npx. Đó là một câu trả lời khác cho vấn đề then chốt ở trên — giữ quyền lợi hiện có của con người trong vòng lặp thay vì tạo một API key mới cho một agent.

• makevoid/motion-graphics-music-video-skill-noimage — được tạo ngày 2 tháng 10, theo giấy phép MIT, và là bản có một kỷ luật đáng để noi theo: nó nêu rõ trong phần mô tả của chính mình rằng nó không dùng mô hình hình ảnh và không dùng mô hình video, mà tạo đồ họa chuyển động từ một bản nhạc và một prompt. Khi bước tạo sinh duy nhất là mã, đầu ra có thể tái tạo được và mọi giấy phép tài nguyên trong thành phẩm đều là điều bạn cần tự cân nhắc.

• RohanRatwani/explainer-video-opus-5.5 — được tạo vào ngày 2 tháng 10, theo giấy phép MIT, hướng tới dạng video giải thích 16:9 và Shorts thay vì bản tổng hợp tin đồn, và nó nêu rõ vấn đề về thời gian: mọi hoạt ảnh đều được căn thời gian theo lời thuyết minh. Thứ tự đó rất quan trọng, vì nó có nghĩa là âm thanh được kết xuất trước khi hình ảnh được đặt vào.

• zhuyansen/awesome-opus-5.5-video — được tạo vào ngày 27 tháng 9, không công bố giấy phép, và nổi bật nhất trong nhóm với 67 sao, trong khi những mục khác chỉ ở mức một chữ số hoặc bằng không. Nó là một chỉ mục chứ không phải một công cụ, bằng tiếng Anh và tiếng Trung, và sự tồn tại của nó là một tín hiệu hữu ích về hình dạng của mối quan tâm: điều mọi người muốn đầu tiên là một danh mục những gì người khác tuyên bố đã tạo ra, và các công cụ sẽ theo sau.

Không cái nào trong số này là một phụ thuộc ổn định. Chúng mới chỉ vài ngày tuổi, chỉ do một tác giả duy nhất, và các điều khoản giấy phép của chúng là thứ duy nhất đứng giữa bạn và một đoạn phim mà bạn không thể sử dụng. Nhưng hướng đi mới là điểm mấu chốt: câu lệnh trong tweet là nguyên mẫu, còn kỹ năng trong kho chứa mới là thứ một nhóm thực sự sẽ áp dụng.

Hai phiên bản ngôn ngữ, một câu chuyện

Bài đăng ngày 2 tháng 10 được cố ý viết song ngữ — một bản tiếng Anh và một bản tiếng Trung về cùng một chủ đề. Điều đó là bất thường đối với một bản demo và nó phơi bày một điều có thật về định dạng này, rằng tin đồn không lan truyền bằng dịch thuật. Những điểm nhấn giúp câu chuyện lan truyền ở thị trường này (ai nói gì với ai, lời phủ nhận nào đã được đưa ra, dòng thời gian trông ra sao) không phải là những điểm nhấn giúp nó lan truyền ở thị trường khác, cho nên phiên bản thứ hai là một bản viết lại với phán đoán biên tập khác, chứ không phải một lượt dịch. Thứ thực sự được truyền tải là bộ khung: cùng cấu trúc câu chuyện, cùng ngăn xếp kết xuất, cùng giọng điệu.

Hệ quả về chi phí là nhỏ và theo đúng hướng. Theo phép tính ở trên, việc thêm ngôn ngữ thứ hai tốn khoảng tám xu chi phí âm thanh bổ sung so với một câu chuyện mà mô hình đã nghiên cứu một lần. Khi phần tốn kém của một quy trình là khâu suy luận và phần rẻ là đầu ra, việc tạo một phiên bản thứ hai bằng ngôn ngữ khác gần như miễn phí — đây là lý do để coi bản địa hóa là đầu ra hạng nhất của quy trình làm việc thay vì một dự án riêng.

Khử nhận dạng là thao tác chỉnh sửa, không phải thao tác xóa.

Vị trí thứ ba trong bản brief là vị trí đáng lẽ phải khiến bạn chậm lại. 去敏 — khử nhạy cảm, một phiên bản đã khử nhận dạng, loại bỏ một người được nêu tên — được đưa ra như một tham số tùy chọn, cứ như thể xóa tên là một bộ lọc bạn chỉ cần bật lên. Không phải vậy. Một bản tổng hợp chuyện phiếm về một sự kiện có thể nhận dạng, dù đã gỡ tên, thường vẫn nói về chính người đó: người đọc tự suy ra cái tên từ ngữ cảnh, và mọi thứ từ tiêu đề đến ảnh thu nhỏ đều có thể mang dấu nhận dạng. Việc gỡ bỏ chuỗi ký tự làm thay đổi chủ đề mà video tự nhận là đang nói tới, nhưng không thay đổi người mà nó đang nói tới; và nếu lý do bạn gỡ tên là pháp lý hay danh tiếng, thì chuỗi ký tự không phải là phần tạo ra rủi ro phơi bày.

Hai điều rút ra cho bất kỳ ai phát hành định dạng này. Thứ nhất, nghĩa vụ dẫn nguồn không được chuyển khỏi bạn chỉ vì người dẫn là tổng hợp: một bản tổng hợp được tạo ra lấy từ các bài đưa tin của người khác sẽ thừa hưởng nghĩa vụ phải nói rõ thông tin đến từ đâu, và bản brief trong bài đăng ngày 2 tháng 10 hoàn toàn không có chỗ để dẫn nguồn — đó là khoảng trống mà người vận hành phải tự điền. Thứ hai, sản phẩm này đúng là tổng hợp và người nghe sẽ không được cho biết điều đó trừ khi bạn nói với họ. Một nhãn chỉ là một dòng chữ và nó tạo ra khác biệt giữa bản demo và một nội dung khiến người xem hiểu sai về thứ họ đang xem. Nếu bạn muốn các tham số mang sức nặng đó, hãy đưa phần công bố vào brief và coi đó là bắt buộc, giống như nhà cung cấp giọng nói nên được nêu tên thay vì bị che giấu.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Chạy nó trên một phím, và phím duy nhất mà nó chưa bao phủ

Nếu bạn đang xây dựng pipeline này, chi phí tích hợp không nằm ở các lệnh gọi mô hình — mà nằm ở thông tin xác thực thứ hai. Claude Opus 5.5 hiện đã có thể định tuyến dưới dạng anthropic/claude-opus-5.5 với mức giá niêm yết của chính Anthropic là 4 và 20 đô la cho mỗi triệu token, được chuyển tiếp với mức chênh lệch 0%, nhờ đó mọi thay đổi giá từ nhà cung cấp đều đến hóa đơn của bạn ngay trong cùng ngày thay vì phải chờ đến kỳ xem xét hợp đồng tiếp theo. Định tuyến nó cùng với phần còn lại của hệ thống qua một endpoint tương thích OpenAI chính là điều loại bỏ SDK thứ hai, và chuyển đổi dự phòng tự động chính là điều cho phép bạn thử một mô hình mới hơn hoặc chưa được kiểm chứng trên một bản render nội bộ mà không đặt đường chạy production phía sau nó.

Ranh giới trung thực nằm ở phần giọng nói. Các endpoint TTS của Google Gemini 3.8 Flash và Flash-Lite TTS hiện không có trong danh mục của chúng tôi — API model công khai trả về not-found đối với google/gemini-3.8-flash-tts — nên quy trình trong bài đăng ngày 2 tháng 10 thực sự cần khóa Google riêng của tác giả, và đó là một hạn chế có thật chứ không phải tạm thời để chúng ta xua tay cho qua. Endpoint TTS mà chúng tôi thực sự cung cấp là google/gemini-3.1-flash-tts-preview, một phiên bản cũ hơn, với giá 1,00 USD mỗi triệu token văn bản đầu vào và 20,00 USD mỗi triệu token âm thanh đầu ra: dùng được trong cùng dạng pipeline, được định giá theo thế hệ cũ hơn, và không phải model mà quy trình này được xây dựng dựa trên. Hãy chọn con đường của mình một cách có hiểu biết — một khóa cho phần suy luận và một khóa thứ hai cho giọng nói, hoặc một khóa và TTS cũ hơn.

Xem gì

Điều khiến định dạng này trở nên nhàm chán, theo nghĩa tốt, là một phương thức âm thanh trên mô hình sản xuất. Cho đến khi Claude Opus 5.5 — hay bất cứ thứ gì thay thế nó — có thể nghe được bản nhạc mà nó đã đặt làm và điều chỉnh nó, phần giọng nói vẫn là một bước được con người kiểm duyệt thủ công, và những pipeline này vẫn đưa con người vào vòng lặp do cấu trúc chứ không phải do chính sách. Hãy theo dõi các repository kỹ năng trong hai tuần tới thay vì các bản demo: những cái tồn tại được sẽ là những cái công bố nhà cung cấp của mình, có giấy phép, và cho phép bạn chạy lại cùng một brief và nhận được cùng một video. Câu lệnh trong bài đăng ngày 2 tháng 10 sẽ trông như phần dễ, bởi vì nó vốn đã dễ.

Đối với một pipeline đã có sẵn tư liệu và kịch bản của riêng mình, hãy tự tính con số của bạn thay vì mượn một con số từ X: ở tốc độ 25 token mỗi giây, mỗi phút lời dẫn hoàn chỉnh là 1.500 token âm thanh và khoảng 1,35 xu theo mức giá Flash TTS hiện nay — một con số bạn có thể đối chiếu với bảng giá trước khi dành một suất sản xuất cho người dẫn tổng hợp.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày