Kartu judul hero yang dihasilkan bertuliskan SATU BRIEF, DUA MODEL, SATU VIDEO BERNARASI, terbagi menjadi dua kolom. Kolom kiri, berjudul Claude Opus 5.5, berbunyi: menulis naskahnya; dirilis 22 September 2026; 4,00 dolar untuk input dan 20,00 dolar untuk output per juta token. Kolom kanan, berjudul Gemini 3.8 Flash TTS, berbunyi: membacakannya dengan lantang; tersedia secara umum 22 September 2026; 9,00 dolar per juta token audio. Baris footer berbunyi: render berdurasi 5 menit 51 detik sekitar 8.775 token audio, kira-kira 8 sen untuk narasi.
Guides & Insights

Claude Opus 5.5 dan Gemini 3.8 Flash TTS Menghasilkan Video Berita Bernarasi: Ringkasan, Dua Kartu Tarif, dan Berapa Biaya Suaranya

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model, dua vendor, satu video jadi, dan prompt yang cukup singkat untuk ditempel ke kotak obrolan. Pada 2 Oktober 2026, penulis AI berbahasa Mandarin 宝玉 (X/@dotey) menerbitkan dua render dari rangkuman gosip yang sama — satu dalam bahasa Inggris, satu dalam bahasa Mandarin — dan mengatakan keduanya dibuat dari awal hingga akhir oleh Claude Opus 5.5, yang menemukan materinya sendiri dan menulis narasinya sendiri, dengan suara yang disediakan oleh Gemini 3.8 Flash TTS menggunakan kunci API yang disediakan penulis. Tidak ada model yang baru: Anthropic merilis Claude Opus 5.5 pada 22 September 2026, dan catatan rilis Google memberi tanggal model text-to-speech Gemini 3.8 pada hari yang sama. Yang baru beberapa hari adalah pengemasannya — brief produser itu sendiri, dan sederet repositori yang dibuat antara 30 September dan 3 Oktober yang mengubah brief itu menjadi skill Claude Code yang dapat Anda pasang. Ini adalah tulisan tentang alur kerja, bukan tentang peluncuran.

Apa yang sebenarnya ditetapkan oleh brief

Templat ini adalah satu kalimat dengan tiga slot. Jika diterjemahkan ke bahasa Inggris dari bahasa Mandarin aslinya, bunyinya: Buatkan aku video gosip tentang {topic} (materi tambahan: {links/screenshots, optional}; versi tanpa identitas: hapus {person's name}, opsional). Semua hal menarik tentang format ini tersembunyi di ketiga slot tersebut, karena brief sependek itu hanya dapat didelegasikan jika penerimanya dapat melakukan tiga hal tanpa diberi tahu: menemukan materi sumbernya sendiri, memutuskan apa ceritanya, dan menyerahkan kembali artefak yang sudah jadi, bukan rencana.

Topiknya adalah string teks bebas, jadi model melakukan seleksi editorial — apa yang dianggap sebagai cerita, bagian mana yang dimasukkan, dan urutannya seperti apa. Itu pekerjaan yang berbeda dari peringkasan, dan itulah bagian dari pipeline yang paling sedikit dikendalikan oleh operator. Materi pelengkap opsional adalah jalan keluarnya: tempelkan tautan atau tangkapan layar dan model bekerja dari sumber tetap alih-alih mencari, yang merupakan perbedaan antara render yang dapat direproduksi dan video yang berbeda setiap kali Anda menjalankannya. Slot ketiga, 去敏, adalah yang layak dibahas dan kita akan kembali ke sana.

Baca brief itu sebagai spesifikasi dan itu akan memberi tahu Anda apa yang diasumsikannya tentang harness. Itu mengasumsikan bahwa model dapat menjangkau dunia luar — langkah penemuan didelegasikan, bukan dijelaskan — dan apa yang dapat dijangkau model adalah properti dari alat yang dipasang operator, bukan dari Claude Opus 5.5 itu sendiri. Itu mengasumsikan stack gambar atau rendering, karena artefak yang dikirimkan adalah video dan Claude Opus 5.5 tidak menghasilkan video. Dan itu mengasumsikan adanya suara.

Pembagian kerja adalah inti ceritanya.

Asumsi terakhir itu adalah fakta struktural dari alur kerja ini. Entri katalog kami sendiri untuk anthropic/claude-opus-5.5 mencantumkan modalitas inputnya sebagai teks, gambar, dan berkas, serta modalitas outputnya sebagai teks — satu modalitas keluaran. Model tidak dapat menyintesis ucapan, dan tidak dapat mendengar trek setelah trek itu ada. Setiap video bernarasi yang dibuat dengan cara ini karena itu memiliki setidaknya dua dependensi model dengan dua kartu tarif, dua vendor, dan dua kredensial, dan yang kedua harus disediakan oleh manusia. Opus 5.5 dapat menulis skrip dan merangkai render; ia tidak dapat membuka akun Google atau menyediakan kunci. Penulis pos 2 Oktober mengatakan persis itu: kunci Gemini adalah miliknya.

Batasan ini memiliki sisi kedua yang mudah terlewat sampai Anda merilisnya. Karena Claude Opus 5.5 tidak menerima audio masuk, model yang menulis narasi tidak dapat memeriksa narasi tersebut. Nama yang salah dilafalkan, penekanan yang aneh, kalimat yang dirender datar oleh sintesiser — tidak ada satu pun dari itu yang sampai ke model yang menuliskannya. Kontrol kualitas pada suara adalah manusia yang mendengarkan keluaran, setiap kali, dan itulah langkah yang mencegah ini menjadi pipeline yang sepenuhnya tanpa pengawasan, tidak peduli seberapa bagus naskahnya. Ketika keluaran model sendiri adalah sebuah program, tinjauannya adalah mendengarkan, bukan diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Berapa biaya suara itu — dan itu bukan bagian yang mahal

Halaman harga Google mempublikasikan konversi yang membuat aritmetika ini rapi: token audio setara dengan 25 token per detik keluaran. Dua render dalam posting 2 Oktober berdurasi 351 detik dan 332 detik, yang dibaca dari metadata media tweet itu sendiri — kira-kira lima menit lima puluh satu detik dan lima menit tiga puluh dua detik. Pada 25 token per detik, itu berarti 8.775 dan 8.300 token audio, dan pada tarif audio Flash TTS saat ini sebesar $9,00 per juta token, itu sekitar delapan sen narasi per video dan kira-kira lima belas sen untuk kedua versi bahasa jika digabungkan.

Sandingkan itu dengan sisi penalaran dari pekerjaan yang sama. Tarif daftar Claude Opus 5.5 adalah $4 per juta token masukan dan $20 per juta token keluaran, dengan token berpikir ditagih sebagai keluaran, dan pembacaan cache $0,20 per juta. Narasi video enam menit hanyalah kesalahan pembulatan dibandingkan token yang dihabiskan model untuk memutuskan apa ceritanya, membaca sumber, dan menulis naskah yang dibacakan suara. Kesimpulan praktisnya bukanlah "TTS itu murah" — melainkan bahwa dalam pipeline ini, suara adalah satu-satunya pos biaya yang tidak perlu Anda optimalkan, dan upaya seharusnya diarahkan ke bagian yang benar-benar menghabiskan dolar.

Dua detail kartu tarif akan mengubah perhitungan itu, jadi rencanakan sekarang untuk mengantisipasinya:

• Masa promosi berakhir — Flash TTS standar adalah $0,50 per juta token teks masuk dan $9,00 per juta token audio keluar hingga 31 Desember 2026, lalu $1,00 dan $18,00. Narasi video yang sama biayanya sekitar enam belas sen pada Januari, tepat dua kali lipat.

• Ada tier yang lebih murah dengan trade-off nyata — Gemini 3.8 Flash-Lite TTS menagih $0.50 dan $6.00 pada jadwal yang sama, naik menjadi $1.00 dan $12.00, mencakup 101 bahasa dibandingkan 130 bahasa pada Flash TTS. Untuk penjelasan bernarator tunggal dalam bahasa Inggris, Lite hanya dua pertiga tarif audio dan batas bahasanya tidak relevan; untuk render bilingual pada pos 2 Oktober, hal itu tidak jelas-jelas tidak relevan, dan itulah keputusan yang diminta oleh pemisahan tier ini.

Tier Batch dan Flex Google adalah $0.25 untuk input dan $4.50 untuk output, dan Priority adalah $0.90 dan $16.20 — perlu diketahui jika render Anda diantrekan, bukan interaktif, karena tidak ada bagian dari rangkuman gosip yang memerlukan jawaban secara real-time.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Minggu ini, brief itu menjadi sebuah keterampilan.

Prompt di tweet adalah demonstrasi; repositori adalah sesuatu yang bisa Anda pasang. Repositori-repositori yang muncul seputar format ini adalah bagian yang benar-benar termasuk dalam tujuh hari terakhir, dan layak dibaca secara terpisah, bukan sebagai satu kumpulan, karena masing-masing membuat taruhan yang berbeda tentang seberapa banyak pipeline yang harus dipatok dalam kode.

• hoangduong92/idea-to-film-skill — dibuat pada 30 September 2026, berlisensi MIT, dan paling cocok dengan posting 2 Oktober: skill Claude Code yang mengubah sebuah ide menjadi MP4 film pendek bernarasi dengan animasi yang digambar melalui kode, musik, efek suara, suara Gemini TTS, dan subtitle. Suara tersebut disebutkan namanya dalam deskripsi, yang merupakan cara jujur untuk merilis ini: vendor kedua adalah dependensi yang dideklarasikan, bukan dependensi tersembunyi.

• samuelstroschein/opus-video-generator — dibuat pada 2 Oktober, berlisensi MIT, dan paling berpendirian soal kredensial: ia membuat video peluncuran di browser Anda menggunakan langganan Claude Anda sendiri, dijalankan melalui npx. Itu adalah jawaban yang berbeda untuk masalah kunci di atas — tetap libatkan hak akses yang sudah dimiliki manusia, alih-alih membuat kunci API baru untuk agen.

• makevoid/motion-graphics-music-video-skill-noimage — dibuat 2 Oktober, berlisensi MIT, dan yang punya disiplin yang layak ditiru: dalam deskripsinya sendiri dinyatakan bahwa ia tidak menggunakan model gambar maupun model video, melainkan menghasilkan motion graphics dari trek musik dan sebuah prompt. Ketika satu-satunya langkah generatif adalah kode, hasilnya dapat direproduksi dan setiap lisensi aset dalam karya jadinya menjadi milik Anda untuk dipertimbangkan.

• RohanRatwani/explainer-video-opus-5.5 — dibuat pada 2 Oktober, berlisensi MIT, menyasar video explainer 16:9 dan Shorts alih-alih rangkuman gosip, dan menyebutkan masalah penentuan waktu itu secara eksplisit: setiap animasi diselaraskan dengan narasi. Urutan itu penting, karena berarti audio dirender sebelum visual ditempatkan.

• zhuyansen/awesome-opus-5.5-video — dibuat pada 27 September, tidak ada lisensi yang dinyatakan, dan jauh paling menonjol di antara kelompoknya dengan 67 bintang, sementara yang lain hanya satu digit atau nol. Ini adalah indeks, bukan alat, dalam bahasa Inggris dan Tionghoa, dan keberadaannya merupakan sinyal berguna tentang bentuk minat: yang pertama diinginkan orang adalah katalog tentang apa yang diklaim telah dibuat orang lain, dan perkakasnya menyusul.

Tak satu pun dari ini adalah dependensi yang stabil. Usianya baru beberapa hari, hanya dikerjakan oleh satu orang, dan ketentuan lisensinya adalah satu-satunya hal yang menghalangi Anda dan rekaman yang tidak dapat Anda gunakan. Tapi arahnya itulah intinya: prompt di tweet adalah prototipe, dan skill di repositori adalah yang sebenarnya akan diadopsi oleh sebuah tim.

Dua versi bahasa, satu cerita

Tulisan 2 Oktober itu sengaja dibuat dwibahasa — sebuah rendisi bahasa Inggris dan satu versi bahasa Mandarin dari topik yang sama. Itu tidak biasa untuk sebuah demo dan mengungkap sesuatu yang nyata tentang format ini, yaitu bahwa gosip tidak menyebar lewat terjemahan. Elemen-elemen yang membawa sebuah cerita di satu pasar (siapa mengatakan apa kepada siapa, penyangkalan mana yang dikeluarkan, bagaimana kronologinya terlihat) bukanlah elemen yang membawanya di pasar lain, jadi versi kedua adalah penulisan ulang dengan pertimbangan editorial yang berbeda, bukan proses terjemahan. Yang berpindah adalah kerangkanya: struktur cerita yang sama, stack rendering yang sama, suara yang sama.

Konsekuensi biayanya kecil dan bergerak ke arah yang benar. Berdasarkan aritmetika di atas, menambahkan bahasa kedua memerlukan biaya sekitar delapan sen audio tambahan untuk cerita yang sudah diteliti sekali oleh model. Ketika bagian mahal dari sebuah pipeline adalah penalaran dan bagian murahnya adalah keluaran, menghasilkan versi kedua dalam bahasa lain hampir gratis — yang menjadi argumen untuk memperlakukan lokalisasi sebagai keluaran kelas satu dari alur kerja, bukan proyek terpisah.

Deidentifikasi adalah penyuntingan, bukan penghapusan

Slot ketiga dalam brief adalah slot yang seharusnya membuat Anda berhenti dan berpikir. 去敏 — de-sensitisasi, versi tanpa identitas yang menghapus orang yang namanya disebut — ditawarkan sebagai parameter opsional, seolah menghapus nama adalah filter yang tinggal Anda nyalakan. Tidak demikian. Rangkuman gosip tentang peristiwa yang dapat diidentifikasi, dengan nama yang dihilangkan, biasanya tetap tentang orang tersebut: pembaca mengisi nama itu dari konteks, dan segala hal dari judul sampai thumbnail dapat membawa penanda identitas. Menghapus string tersebut mengubah apa yang dikatakan video itu sebagai topiknya tanpa mengubah siapa yang sebenarnya menjadi topiknya, dan jika alasan Anda menghapus nama itu adalah alasan hukum atau reputasi, string itu bukan bagian yang menciptakan eksposur tersebut.

Dua hal yang perlu diperhatikan bagi siapa pun yang merilis format ini. Pertama, kewajiban menyebutkan sumber tidak beralih dari Anda hanya karena presenter-nya sintetis: ringkasan yang dihasilkan dan membaca dari liputan orang lain mewarisi kewajiban untuk menyebut dari mana liputan itu berasal, dan brief dalam posting 2 Oktober sama sekali tidak memuat slot penyebutan sumber — itu celah yang harus diisi operator secara manual. Kedua, artefaknya memang sintetis dan pendengar tidak diberi tahu kecuali Anda memberi tahu mereka. Label hanyalah satu baris teks dan itulah pembeda antara demo dan konten yang menyesatkan penonton tentang apa yang sedang mereka tonton. Jika Anda ingin parameter-parameternya memikul beban itu, cantumkan pengungkapannya dalam brief dan perlakukan sebagai wajib, seperti halnya vendor suara harus disebutkan, bukan disembunyikan.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Menjalankannya pada satu kunci, dan satu kunci yang belum dicakupinya

Jika Anda sedang membangun pipeline ini, biaya integrasinya bukanlah pemanggilan model — melainkan kredensial kedua. Claude Opus 5.5 dapat dirutekan hari ini sebagai anthropic/claude-opus-5.5 dengan harga daftar Anthropic sendiri sebesar $4 dan $20 per juta token, diteruskan dengan markup 0%, sehingga perubahan harga dari vendor sampai ke tagihan Anda di hari yang sama, bukan pada peninjauan kontrak berikutnya. Merutekannya bersama seluruh stack Anda melalui satu endpoint yang kompatibel dengan OpenAI adalah yang menghilangkan SDK kedua, dan failover otomatis adalah yang memungkinkan Anda mencoba model yang lebih baru atau belum terbukti pada render internal tanpa menaruh jalur produksi di belakangnya.

Batas yang jujur terletak pada suaranya. Endpoint TTS Gemini 3.8 Flash dan Flash-Lite TTS milik Google tidak ada di katalog kami saat ini — API model publik mengembalikan not-found untuk google/gemini-3.8-flash-tts — jadi alur kerja di postingan 2 Oktober benar-benar memerlukan kunci Google milik penulisnya sendiri, dan itu adalah kendala nyata, bukan kendala sementara yang bisa kami kesampingkan. Endpoint TTS yang kami sediakan adalah google/gemini-3.1-flash-tts-preview yang lebih lama, dengan harga $1,00 per juta token teks masuk dan $20,00 per juta token audio keluar: bisa dipakai dalam bentuk pipeline yang sama, dihargai untuk generasi lama, dan bukan model yang menjadi dasar alur kerja ini. Pilih jalur Anda dengan sadar — satu kunci untuk reasoner dan satu lagi untuk suara, atau satu kunci dan TTS yang lebih lama.

Apa yang harus ditonton

Hal yang akan membuat format ini membosankan, dalam arti yang baik, adalah modalitas audio pada model yang memproduksi. Sampai Claude Opus 5.5 — atau apa pun yang menggantikannya — dapat mendengar trek yang dipesannya dan menyesuaikannya, bagian suara tetap menjadi langkah yang ditinjau secara manual, dan pipeline ini tetap human-in-the-loop secara konstruksi, bukan secara kebijakan. Perhatikan repositori skill selama dua minggu ke depan, bukan demonya: yang bertahan adalah yang mencantumkan vendor mereka, menyertakan lisensi, dan memungkinkan Anda menjalankan ulang brief yang sama dan mendapatkan video yang sama. Prompt dalam pos 2 Oktober akan tampak sebagai bagian yang mudah, karena memang begitu.

Untuk pipeline yang sudah memiliki materi dan skripnya sendiri, hitunglah angka Anda sendiri alih-alih meminjam dari X: pada 25 token per detik, setiap menit narasi jadi adalah 1.500 token audio dan sekitar 1,35 sen pada tarif Flash TTS saat ini — angka yang dapat Anda periksa terhadap kartu tarif sebelum Anda menetapkan slot produksi untuk host sintetis.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari