È uscito il Corso Java Completo
Torna al blog

Sottotitoli automatici con l'AI: guida pratica

Come generare sottotitoli automatici con l'AI: formati SRT e VTT, regole di leggibilità, errori da evitare e perché servono anche per la SEO dei video.

Edoardo Midali

Edoardo Midali

Developer · Content Creator

6 min di lettura

La maggior parte dei video sui social viene guardata senza audio. Aggiungici chi è sordo o ipoudente, chi guarda in un ambiente rumoroso e chi segue in una lingua che non è la sua, e i sottotitoli smettono di essere un accessorio. Generarli automaticamente oggi costa pochi minuti — ma tra il file grezzo che esce da uno strumento e sottotitoli fatti bene c'è una differenza che si vede. In questo articolo ti spiego come colmarla.

Come si generano

Il processo ha tre fasi, e conviene distinguerle perché è nella seconda che si gioca la qualità.

1. Trascrizione. L'audio viene convertito in testo con un sistema di speech-to-text.

2. Segmentazione e sincronizzazione. Il testo viene spezzato in blocchi e associato agli istanti in cui viene pronunciato. È qui che si decide se i sottotitoli saranno leggibili o faticosi, ed è la parte che gli strumenti automatici gestiscono peggio.

3. Esportazione. Il risultato diventa un file in un formato standard.

I formati

FormatoUso
SRTIl più diffuso e compatibile. Testo semplice, nessuna formattazione
VTTStandard per il web (HTML5). Supporta posizionamento e stili
ASS/SSAFormattazione avanzata, tipico dell'ambito amatoriale e dell'animazione

Un file SRT è leggibile a occhio nudo, ed è utile saperlo perché le correzioni si possono fare in un editor di testo qualsiasi:

1
00:00:02,400 --> 00:00:05,120
Oggi vediamo come funziona
la trascrizione automatica.

Numero progressivo, intervallo temporale, testo. Nient'altro.

C'è poi una distinzione importante tra sottotitoli aperti (impressi nel video, sempre visibili) e chiusi (file separato, attivabile). I chiusi sono preferibili quasi sempre: si correggono senza riesportare il video, sono leggibili dai motori di ricerca e l'utente può disattivarli. I sottotitoli impressi hanno senso soprattutto sui social, dove spesso il player non supporta i file esterni.

Le regole che fanno la differenza

Sono convenzioni consolidate nel sottotitolaggio professionale, e sono la ragione per cui l'output automatico grezzo si riconosce sempre.

Massimo due righe per volta. Tre righe coprono l'immagine e non si leggono.

Circa 37-42 caratteri per riga. Oltre, l'occhio deve percorrere troppo spazio.

Velocità di lettura sostenibile: indicativamente 15-20 caratteri al secondo per un pubblico adulto. Un blocco troppo denso mostrato per un secondo è illeggibile anche se il testo è corretto.

Durata minima di circa un secondo, massima intorno ai sei.

Spezza il testo dove ha senso. Questo è il punto su cui gli strumenti automatici sbagliano di più: tagliano a metà di un sintagma, separando l'articolo dal nome o il verbo dal suo oggetto. Meglio due righe di lunghezza diversa ma spezzate bene, che due righe pareggiate e tagliate a caso.

Sincronizza con la voce, non con la frase intera: il sottotitolo deve comparire quando la persona inizia a parlare.

Non far attraversare i cambi di inquadratura a un sottotitolo, quando puoi evitarlo.

Cosa correggere sempre

L'output automatico va riletto. I punti dove si concentrano gli errori sono prevedibili:

Nomi propri e marchi. Il punto debole numero uno. Se lo strumento permette un vocabolario personalizzato, fornirlo in anticipo risparmia gran parte del lavoro.

Termini tecnici e sigle. "SEO" trascritto a lettere, acronimi resi come parole.

Numeri, date e importi. Le convenzioni di scrittura vanno normalizzate.

Punteggiatura. Quella automatica è migliorata molto ma resta approssimativa, e cambia il senso.

Le frasi inventate. È il rischio serio: nei punti di silenzio o di audio confuso, il modello può produrre testo mai pronunciato. Controlla sempre i passaggi in cui l'audio era difficile, perché lì l'errore è invisibile — scorre bene proprio perché è inventato.

Intercalari e ripetizioni. Nel parlato ci sono "ehm", false partenze, ripetizioni. Nei sottotitoli si tolgono: si trascrive il senso, non ogni suono. È una differenza sostanziale rispetto a una trascrizione integrale.

Sottotitoli, didascalie e traduzioni

Tre cose diverse che spesso si confondono:

Sottotitoli — riportano il parlato, per chi sente ma non capisce la lingua o non può attivare l'audio.

Didascalie per non udenti (SDH/CC) — includono anche le informazioni sonore non verbali: [musica inquietante], [porta che sbatte], e l'identificazione di chi parla quando non è visibile. È questa la versione che serve davvero per l'accessibilità, e gli strumenti automatici non la producono: va integrata a mano.

Traduzioni — sottotitoli in un'altra lingua. La traduzione automatica di sottotitoli generati automaticamente accumula gli errori di due passaggi: se il contenuto conta, va rivista da qualcuno che conosce la lingua. È lo stesso problema di accumulo che descrivo in doppiaggio AI, dove i passaggi sono addirittura quattro.

Perché contano anche per la SEO

Un motore di ricerca non ascolta un video: legge. Senza testo associato, il contenuto è opaco.

Pubblicare i sottotitoli — meglio ancora, una trascrizione completa nella pagina — rende il video indicizzabile per le parole che contiene. Su un contenuto di venti minuti significa decine di argomenti trattati che diventano ricercabili, e vale lo stesso ragionamento che faccio in come scrivere un articolo SEO.

C'è anche il risvolto pratico sui social: nei feed, i video sottotitolati trattengono l'attenzione più a lungo semplicemente perché sono fruibili senza audio.

Un flusso di lavoro sensato

  1. Registra audio pulito. Vale qui quanto vale per la trascrizione: un microfono decente migliora il risultato più di qualsiasi software.
  2. Genera la trascrizione con timestamp.
  3. Correggi il testo prima di occuparti del tempismo.
  4. Sistema la segmentazione — è la parte che l'automatismo fa peggio.
  5. Verifica guardando il video, non leggendo il file. Molti problemi di ritmo si vedono solo così.
  6. Esporta in SRT o VTT e tieni il file separato dal video.

Il passaggio 5 è quello che salta chi ha fretta, ed è quello che si nota di più.

In sintesi

I sottotitoli automatici partono da una trascrizione e la segmentano nel tempo. La trascrizione oggi è buona; la segmentazione è la parte che gli strumenti fanno peggio, ed è quella che determina la leggibilità.

Le regole che li rendono professionali sono poche e concrete: due righe al massimo, circa 40 caratteri per riga, tagli che rispettano la sintassi, sincronia con la voce.

E vanno sempre riletti, con un'attenzione particolare ai punti di audio difficile — dove il modello tende a inventare testo che scorre benissimo e non è mai stato detto.

Servono per accessibilità, per fruizione senza audio e per rendere ricercabile un contenuto che altrimenti resta invisibile ai motori. Sono probabilmente il ritorno più alto per il tempo speso, tra tutte le lavorazioni su un video.