
Claude Opus 5.5 e Gemini 3.8 Flash TTS hanno prodotto un video di notizie con narrazione: il brief, i due tariffari e quanto costa la voce
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli, due fornitori, un video finito e un prompt abbastanza breve da incollare in una chat. Il 2 ottobre 2026, lo scrittore AI di lingua cinese 宝玉 (X/@dotey) ha pubblicato due render della stessa rassegna di gossip — uno in inglese, uno in cinese — e ha dichiarato che entrambi sono stati realizzati dall'inizio alla fine da Claude Opus 5.5, che ha trovato da sé il proprio materiale e scritto la propria narrazione, con la voce fornita da Gemini 3.8 Flash TTS tramite una chiave API fornita dall'autore. Nessuno dei due modelli è nuovo: Anthropic ha rilasciato Claude Opus 5.5 il 22 settembre 2026, e le note di rilascio di Google datano i modelli text-to-speech Gemini 3.8 allo stesso giorno. Ciò che ha pochi giorni è il packaging — il brief del produttore stesso, e una serie di repository creati tra il 30 settembre e il 3 ottobre che trasformano quel brief in una skill di Claude Code che puoi installare. Questo è un articolo sul flusso di lavoro, non su un lancio.
Cosa specifica effettivamente il brief
Il template è una frase con tre slot. Tradotto in inglese dall'originale cinese, si legge: creami un video di gossip su {topic} (materiale supplementare: {link/screenshot, opzionale}; versione de-identificata: rimuovi {nome della persona}, opzionale). Tutto ciò che c'è di interessante nel formato è nascosto in quei tre slot, perché un brief così breve è delegabile solo se il destinatario può fare tre cose senza che gli vengano dette: trovare da sé il proprio materiale di partenza, decidere qual è la storia e restituire un artefatto finito anziché un piano.
Il topic è una stringa di testo libero, quindi il modello compie una selezione editoriale — cosa conta come storia, quali momenti includere, in quale ordine metterli. È un lavoro diverso dal riassunto, ed è la parte della pipeline su cui l'operatore ha meno controllo. Il materiale supplementare opzionale è la via di fuga: incolla un link o uno screenshot e il modello lavora da una fonte fissa invece di cercare, che è la differenza tra un render riproducibile e un video diverso ogni volta che lo esegui. Il terzo slot, 去敏, è quello su cui vale la pena soffermarsi e ci torneremo.
Leggi il brief come una specifica e ti dice cosa presuppone sull'harness. Presuppone che il modello possa raggiungere il mondo esterno — il passo di discovery è delegato, non descritto — e ciò che il modello può raggiungere è una proprietà degli strumenti che l'operatore monta, non di Claude Opus 5.5 stesso. Presuppone uno stack di immagini o di rendering, perché l'artefatto consegnato è un video e Claude Opus 5.5 non emette video. E presuppone una voce.
La divisione del lavoro è la storia
Quell'ultima presupposizione è il fatto strutturale di questo flusso di lavoro. La nostra stessa scheda di catalogo per anthropic/claude-opus-5.5 elenca le sue modalità di input come testo, immagine e file, e la sua modalità di output come testo — una sola modalità in uscita. Il modello non può sintetizzare il parlato e non può ascoltare una traccia una volta che esiste. Ogni video narrato costruito in questo modo ha quindi almeno due dipendenze da modelli, con due listini tariffari, due fornitori e due credenziali, e la seconda deve essere fornita da un essere umano. Opus 5.5 può scrivere il copione e cablare il rendering; non può aprire un account Google né procurarsi una chiave. L'autore del post del 2 ottobre dice esattamente questo: la chiave Gemini era sua.
Il vincolo ha un secondo lato che è facile trascurare finché non arrivi al rilascio. Poiché Claude Opus 5.5 non accetta audio in ingresso, il modello che ha scritto la narrazione non può verificarla. Nomi pronunciati male, enfasi strana, una frase che il sintetizzatore rende piatta: nulla di tutto ciò arriva al modello che l'ha scritta. Il controllo qualità sulla voce è un umano che ascolta l'output, ogni volta, ed è il passaggio che impedisce che questa diventi una pipeline completamente senza intervento umano, per quanto sia buono il copione. Laddove l'output del modello stesso è un programma, la revisione è un ascolto, non un diff.

Quanto costa la voce — e non è la parte costosa
La pagina dei prezzi di Google pubblica la conversione che rende pulita questa aritmetica: i token audio corrispondono a 25 token per secondo di output. I due render nel post del 2 ottobre durano 351 secondi e 332 secondi, letti dai metadati multimediali del tweet stesso — all'incirca cinque minuti e cinquantuno secondi e cinque minuti e trentadue secondi. A 25 token al secondo, sono 8.775 e 8.300 token audio, e all'attuale tariffa audio Flash TTS di $9,00 per milione di token, si tratta di circa otto centesimi di narrazione per video e all'incirca quindici centesimi per entrambe le versioni linguistiche insieme.
Metti questo accanto al lato di ragionamento dello stesso lavoro. La tariffa di listino di Claude Opus 5.5 è di 4 $ per milione di token in input e 20 $ per milione in output, con i token di pensiero fatturati come output, e le letture dalla cache a 0,20 $ per milione. La narrazione di un video di sei minuti è un errore di arrotondamento rispetto ai token che il modello spende per decidere qual è la storia, leggere le fonti e scrivere il copione che la voce legge. La conclusione pratica non è "il TTS è economico" — è che in questa pipeline la voce è l'unica voce di costo che non devi ottimizzare, e lo sforzo va concentrato sulla parte che costa dollari.
Due dettagli della scheda tariffaria cambieranno questi calcoli, quindi pianifica tenendone conto fin da ora:
• La finestra promozionale si chiude: Flash TTS standard costa $0,50 per milione di token di testo in ingresso e $9,00 per milione di token audio in uscita fino al 31 dicembre 2026, poi $1,00 e $18,00. La narrazione dello stesso video costa circa sedici centesimi a gennaio, esattamente il doppio.
• Esiste un livello più economico con un vero compromesso: Gemini 3.8 Flash-Lite TTS fattura 0,50 $ e 6,00 $ sullo stesso piano, salendo a 1,00 $ e 12,00 $, coprendo 101 lingue rispetto alle 130 di Flash TTS. Per un video esplicativo in inglese con un solo narratore, Lite è ai due terzi della tariffa audio e il tetto linguistico è irrilevante; per il rendering bilingue nel post del 2 ottobre non è ovviamente irrilevante, ed è la decisione che la suddivisione dei livelli ti chiede di prendere.
Il tier Batch e Flex di Google costa $0.25 in input e $4.50 in output, mentre Priority costa $0.90 e $16.20 — vale la pena saperlo se i tuoi render sono in coda anziché interattivi, perché niente in una rassegna di gossip richiede la risposta in tempo reale.

Questa settimana il brief è diventato una skill
Un prompt in un tweet è una dimostrazione; un repository è qualcosa che puoi installare. I repository comparsi attorno a questo formato sono la parte che appartiene davvero agli ultimi sette giorni, e vale la pena leggerli separatamente invece che come un insieme, perché ciascuno fa una scommessa diversa su quanto della pipeline dovrebbe essere fissato nel codice.
• hoangduong92/idea-to-film-skill — creato il 30 settembre 2026, con licenza MIT, e la corrispondenza più vicina al post del 2 ottobre: una skill di Claude Code che porta un'idea a un cortometraggio MP4 narrato con animazione disegnata via codice, musica, effetti sonori, una voce Gemini TTS e sottotitoli. La voce è nominata nella descrizione, che è il modo onesto di distribuire questo: il secondo fornitore è una dipendenza dichiarata, non nascosta.
• samuelstroschein/opus-video-generator — creato il 2 ottobre, con licenza MIT, e il più schierato in materia di credenziali: crea video di lancio nel tuo browser sul tuo abbonamento Claude, eseguito tramite npx. Questa è una risposta diversa al problema chiave di cui sopra — mantenere nel ciclo il diritto esistente dell'utente invece di coniare una nuova chiave API per un agente.
• makevoid/motion-graphics-music-video-skill-noimage — creato il 2 ottobre, con licenza MIT, e quello con una disciplina che vale la pena copiare: dichiara nella propria descrizione di non usare alcun modello per immagini né alcun modello video, producendo motion graphics da una traccia musicale e un prompt. Quando l'unico passo generativo è il codice, l'output è riproducibile e ogni licenza degli asset nell'opera finita è tua da valutare.
• RohanRatwani/explainer-video-opus-5.5 — creato il 2 ottobre, con licenza MIT, pensato per l'explainer in 16:9 e per gli Shorts anziché per il riepilogo di gossip, e nomina esplicitamente il problema delle tempistiche: ogni animazione sincronizzata con la narrazione. Quest'ordine è importante, perché significa che l'audio viene renderizzato prima che vengano posizionati gli elementi visivi.
• zhuyansen/awesome-opus-5.5-video — creato il 27 settembre, nessuna licenza dichiarata, e di gran lunga il più visibile del gruppo con 67 stelle, mentre gli altri sono a una cifra o a zero. È un indice più che uno strumento, in inglese e cinese, e la sua esistenza è un segnale utile sulla forma dell'interesse: ciò che le persone vogliono per prima cosa è un catalogo di ciò che altri affermano di aver creato, e gli strumenti seguono.
Nessuna di queste è una dipendenza stabile. Hanno pochi giorni, sono opera di un solo autore, e le loro condizioni di licenza sono l'unica cosa che si frappone tra te e un filmato che non puoi usare. Ma è la direzione che conta: il prompt nel tweet è il prototipo, e la skill nel repository è ciò che un team adotterebbe davvero.
Due versioni linguistiche, una storia
Il post del 2 ottobre è volutamente bilingue — una resa in inglese e una in cinese dello stesso argomento. È insolito per una demo e rivela qualcosa di reale su questo formato, cioè che il gossip non viaggia tramite traduzione. Gli elementi che sorreggono una storia in un mercato (chi ha detto cosa a chi, quale smentita è stata diffusa, com'è la cronologia) non sono quelli che la sorreggono in un altro, quindi la seconda versione è una riscrittura con un diverso giudizio editoriale, non una passata di traduzione. Ciò che invece si trasferisce è lo scheletro: la stessa struttura della storia, lo stesso stack di rendering, la stessa voce.
La conseguenza sui costi è contenuta e va nella direzione giusta. In base ai calcoli sopra, aggiungere la seconda lingua costa circa otto centesimi di audio aggiuntivo rispetto a una storia che il modello ha già analizzato una volta. Quando la parte costosa di una pipeline è il ragionamento e quella economica è l’output, produrre una seconda versione in un’altra lingua è quasi gratuito — il che è un argomento a favore del trattare la localizzazione come un output di prima classe del flusso di lavoro anziché come un progetto separato.
La de-identificazione è una modifica, non una cancellazione
Il terzo slot nel brief è quello che dovrebbe rallentarti. 去敏 — de-sensibilizzare, una versione de-identificata che rimuove una persona nominata — è offerto come parametro opzionale, come se eliminare un nome fosse un filtro che si attiva. Non lo è. Un riepilogo di gossip su un evento identificabile, con il nome rimosso, di solito riguarda ancora quella persona: il lettore ricava il nome dal contesto, e tutto, dal titolo alla miniatura, può portare l'identificatore. Eliminare la stringa cambia ciò di cui il video dice di parlare senza cambiare di chi parla, e se il tuo motivo per eliminare il nome è legale o reputazionale, la stringa non è la parte che creava l'esposizione.
Due cose ne conseguono per chiunque distribuisca questo formato. Primo, il dovere di citare le fonti non si trasferisce via da te perché il presentatore è sintetico: una rassegna generata che legge dai resoconti altrui eredita l'obbligo di dire da dove provengono le informazioni, e il brief nel post del 2 ottobre non contiene affatto uno spazio per le fonti — è una lacuna che l'operatore deve colmare a mano. Secondo, l'artefatto è legittimamente sintetico e a chi ascolta non viene detto, a meno che non glielo dica tu. Un'etichetta è una riga di testo ed è la differenza tra una demo e un contenuto che induce in errore chi guarda su ciò che sta guardando. Se vuoi che siano i parametri a farsi carico di questo peso, metti la dichiarazione nel brief e trattala come non opzionale, così come il fornitore della voce dovrebbe essere nominato anziché nascosto.

Eseguendolo su un tasto, e l'unico tasto che non copre ancora
Se stai costruendo questa pipeline, il costo di integrazione non sta nelle chiamate al modello — sta nella seconda credenziale. Claude Opus 5.5 è instradabile oggi come anthropic/claude-opus-5.5 al prezzo di listino di Anthropic stesso, $4 e $20 per milione di token, trasferito con markup dello 0%, quindi una variazione di prezzo del fornitore arriva sulla tua fattura lo stesso giorno anziché alla prossima revisione del contratto. Instradarlo insieme al resto del tuo stack attraverso un unico endpoint compatibile con OpenAI è ciò che elimina il secondo SDK, e il failover automatico è ciò che ti consente di provare un modello più recente o meno collaudato su un render interno senza far dipendere da esso il percorso di produzione.
Il confine onesto è la voce. Gli endpoint Gemini 3.8 Flash TTS e Flash-Lite TTS di Google oggi non sono nel nostro catalogo — l'API pubblica dei modelli restituisce un not-found per google/gemini-3.8-flash-tts — quindi il workflow del post del 2 ottobre richiede davvero la chiave Google dell'autore, e questo è un vincolo reale, non una limitazione temporanea che possiamo liquidare con un gesto. L'endpoint TTS che invece offriamo è il più vecchio google/gemini-3.1-flash-tts-preview, a $1,00 per milione di token di testo in input e $20,00 per milione di token audio in output: utilizzabile nella stessa forma di pipeline, con un prezzo da generazione precedente, e non il modello su cui è stato costruito questo workflow. Scegli il tuo percorso con consapevolezza — una chiave per il reasoner e una seconda per la voce, oppure una sola chiave e il TTS più vecchio.
Cosa guardare
La cosa che renderebbe questo formato noioso, nel senso buono, è una modalità audio sul modello che lo produce. Finché Claude Opus 5.5 — o qualunque cosa lo sostituirà — non sarà in grado di ascoltare la traccia che ha commissionato e di ritoccarla, la voce resta un passaggio revisionato manualmente, e queste pipeline restano human-in-the-loop per costruzione anziché per policy. Tenete d'occhio i repository di skill nelle prossime due settimane, più che le demo: quelli che sopravvivranno saranno quelli che dichiarano i propri fornitori, hanno una licenza e vi permettono di rieseguire lo stesso brief e ottenere lo stesso video. Il prompt nel post del 2 ottobre sembrerà la parte facile, perché lo era.
Per una pipeline che dispone già del proprio materiale e del proprio copione, fai il tuo calcolo invece di prenderne in prestito uno da X: a 25 token al secondo, ogni minuto di narrazione finita equivale a 1.500 token audio e a circa 1,35 centesimi alla tariffa odierna di Flash TTS — un dato che puoi verificare su un tariffario prima di destinare uno slot di produzione a un conduttore sintetico.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
