Sottotitoli automatici con l'AI: guida pratica
Come generare sottotitoli automatici con l'AI: formati SRT e VTT, regole di leggibilità, errori da evitare e perché servono anche per la SEO dei video.
La maggior parte dei video sui social viene guardata senza audio. Aggiungici chi è sordo o ipoudente, chi guarda in un ambiente rumoroso e chi segue in una lingua che non è la sua, e i sottotitoli smettono di essere un accessorio. Generarli automaticamente oggi costa pochi minuti — ma tra il file grezzo che esce da uno strumento e sottotitoli fatti bene c'è una differenza che si vede. In questo articolo ti spiego come colmarla.
Come si generano
Il processo ha tre fasi, e conviene distinguerle perché è nella seconda che si gioca la qualità.
1. Trascrizione. L'audio viene convertito in testo con un sistema di speech-to-text.
2. Segmentazione e sincronizzazione. Il testo viene spezzato in blocchi e associato agli istanti in cui viene pronunciato. È qui che si decide se i sottotitoli saranno leggibili o faticosi, ed è la parte che gli strumenti automatici gestiscono peggio.
3. Esportazione. Il risultato diventa un file in un formato standard.
I formati
| Formato | Uso |
|---|---|
| SRT | Il più diffuso e compatibile. Testo semplice, nessuna formattazione |
| VTT | Standard per il web (HTML5). Supporta posizionamento e stili |
| ASS/SSA | Formattazione avanzata, tipico dell'ambito amatoriale e dell'animazione |
Un file SRT è leggibile a occhio nudo, ed è utile saperlo perché le correzioni si possono fare in un editor di testo qualsiasi:
1
00:00:02,400 --> 00:00:05,120
Oggi vediamo come funziona
la trascrizione automatica.
Numero progressivo, intervallo temporale, testo. Nient'altro.
C'è poi una distinzione importante tra sottotitoli aperti (impressi nel video, sempre visibili) e chiusi (file separato, attivabile). I chiusi sono preferibili quasi sempre: si correggono senza riesportare il video, sono leggibili dai motori di ricerca e l'utente può disattivarli. I sottotitoli impressi hanno senso soprattutto sui social, dove spesso il player non supporta i file esterni.
Le regole che fanno la differenza
Sono convenzioni consolidate nel sottotitolaggio professionale, e sono la ragione per cui l'output automatico grezzo si riconosce sempre.
Massimo due righe per volta. Tre righe coprono l'immagine e non si leggono.
Circa 37-42 caratteri per riga. Oltre, l'occhio deve percorrere troppo spazio.
Velocità di lettura sostenibile: indicativamente 15-20 caratteri al secondo per un pubblico adulto. Un blocco troppo denso mostrato per un secondo è illeggibile anche se il testo è corretto.
Durata minima di circa un secondo, massima intorno ai sei.
Spezza il testo dove ha senso. Questo è il punto su cui gli strumenti automatici sbagliano di più: tagliano a metà di un sintagma, separando l'articolo dal nome o il verbo dal suo oggetto. Meglio due righe di lunghezza diversa ma spezzate bene, che due righe pareggiate e tagliate a caso.
Sincronizza con la voce, non con la frase intera: il sottotitolo deve comparire quando la persona inizia a parlare.
Non far attraversare i cambi di inquadratura a un sottotitolo, quando puoi evitarlo.
Cosa correggere sempre
L'output automatico va riletto. I punti dove si concentrano gli errori sono prevedibili:
Nomi propri e marchi. Il punto debole numero uno. Se lo strumento permette un vocabolario personalizzato, fornirlo in anticipo risparmia gran parte del lavoro.
Termini tecnici e sigle. "SEO" trascritto a lettere, acronimi resi come parole.
Numeri, date e importi. Le convenzioni di scrittura vanno normalizzate.
Punteggiatura. Quella automatica è migliorata molto ma resta approssimativa, e cambia il senso.
Le frasi inventate. È il rischio serio: nei punti di silenzio o di audio confuso, il modello può produrre testo mai pronunciato. Controlla sempre i passaggi in cui l'audio era difficile, perché lì l'errore è invisibile — scorre bene proprio perché è inventato.
Intercalari e ripetizioni. Nel parlato ci sono "ehm", false partenze, ripetizioni. Nei sottotitoli si tolgono: si trascrive il senso, non ogni suono. È una differenza sostanziale rispetto a una trascrizione integrale.
Sottotitoli, didascalie e traduzioni
Tre cose diverse che spesso si confondono:
Sottotitoli — riportano il parlato, per chi sente ma non capisce la lingua o non può attivare l'audio.
Didascalie per non udenti (SDH/CC) — includono anche le informazioni sonore non verbali: [musica inquietante], [porta che sbatte], e l'identificazione di chi parla quando non è visibile. È questa la versione che serve davvero per l'accessibilità, e gli strumenti automatici non la producono: va integrata a mano.
Traduzioni — sottotitoli in un'altra lingua. La traduzione automatica di sottotitoli generati automaticamente accumula gli errori di due passaggi: se il contenuto conta, va rivista da qualcuno che conosce la lingua. È lo stesso problema di accumulo che descrivo in doppiaggio AI, dove i passaggi sono addirittura quattro.
Perché contano anche per la SEO
Un motore di ricerca non ascolta un video: legge. Senza testo associato, il contenuto è opaco.
Pubblicare i sottotitoli — meglio ancora, una trascrizione completa nella pagina — rende il video indicizzabile per le parole che contiene. Su un contenuto di venti minuti significa decine di argomenti trattati che diventano ricercabili, e vale lo stesso ragionamento che faccio in come scrivere un articolo SEO.
C'è anche il risvolto pratico sui social: nei feed, i video sottotitolati trattengono l'attenzione più a lungo semplicemente perché sono fruibili senza audio.
Un flusso di lavoro sensato
- Registra audio pulito. Vale qui quanto vale per la trascrizione: un microfono decente migliora il risultato più di qualsiasi software.
- Genera la trascrizione con timestamp.
- Correggi il testo prima di occuparti del tempismo.
- Sistema la segmentazione — è la parte che l'automatismo fa peggio.
- Verifica guardando il video, non leggendo il file. Molti problemi di ritmo si vedono solo così.
- Esporta in SRT o VTT e tieni il file separato dal video.
Il passaggio 5 è quello che salta chi ha fretta, ed è quello che si nota di più.
In sintesi
I sottotitoli automatici partono da una trascrizione e la segmentano nel tempo. La trascrizione oggi è buona; la segmentazione è la parte che gli strumenti fanno peggio, ed è quella che determina la leggibilità.
Le regole che li rendono professionali sono poche e concrete: due righe al massimo, circa 40 caratteri per riga, tagli che rispettano la sintassi, sincronia con la voce.
E vanno sempre riletti, con un'attenzione particolare ai punti di audio difficile — dove il modello tende a inventare testo che scorre benissimo e non è mai stato detto.
Servono per accessibilità, per fruizione senza audio e per rendere ricercabile un contenuto che altrimenti resta invisibile ai motori. Sono probabilmente il ritorno più alto per il tempo speso, tra tutte le lavorazioni su un video.