È uscito il Corso Java Completo
Torna al blog

Speech-to-text: come funziona la trascrizione automatica

Come funziona la trascrizione automatica dell'audio, quanto è accurata davvero in italiano, cosa la manda in crisi e come ottenere risultati migliori.

Edoardo Midali

Edoardo Midali

Developer · Content Creator

6 min di lettura

Trascrivere un'ora di registrazione a mano richiede circa quattro ore di lavoro. Con la trascrizione automatica ci vogliono pochi minuti, e il risultato è spesso a un livello di accuratezza che fino a poco tempo fa non era immaginabile. Ma "spesso" non è "sempre", e sapere quando fidarsi fa la differenza. In questo articolo ti spiego come funziona, quanto è affidabile davvero in italiano e come ottenere risultati migliori.

Cos'è lo speech-to-text

Lo speech-to-text (STT, o ASR — automatic speech recognition) converte l'audio parlato in testo scritto. È l'operazione inversa del text-to-speech, che trasforma il testo in voce.

Come funziona

Il salto di qualità degli ultimi anni ha una spiegazione precisa, e vale la pena capirla perché spiega anche i limiti.

I sistemi vecchi funzionavano a strati separati: un modello acustico riconosceva i suoni, un dizionario fonetico li mappava a parole, un modello linguistico sceglieva la sequenza più probabile. Ogni pezzo andava addestrato e messo a punto, e gli errori si accumulavano lungo la catena.

I sistemi attuali sono addestrati da un capo all'altro: entra audio, esce testo, senza stadi intermedi. Sotto c'è l'architettura Transformer, la stessa degli LLM, applicata a una sequenza sonora invece che testuale.

La conseguenza pratica più importante è che il modello usa il contesto. Non riconosce parole isolate: interpreta ogni parola alla luce di quelle che la circondano. È così che distingue omofoni — "l'ago" da "lago", "a posto" da "apposto" — e ricostruisce parole pronunciate male basandosi sul senso della frase.

Ed è anche la radice del suo difetto più insidioso, di cui parlo tra poco.

Quanto è accurato davvero

L'accuratezza si misura in WER (word error rate), la percentuale di parole sbagliate. Ma il numero dichiarato nei benchmark riguarda audio pulito, e nella realtà cambia parecchio:

CondizioneAccuratezza tipica
Studio, un parlante, italiano standardMolto alta, quasi pari all'umano
Registrazione da telefono decenteBuona
Riunione con più personeMedia, con errori di attribuzione
Audio con rumore di fondoVariabile
Accento marcato o dialettoCala sensibilmente
Termini tecnici e nomi propriPunto debole ricorrente
Sovrapposizione di vociIl caso peggiore

Due precisazioni sull'italiano. La qualità è buona ma generalmente inferiore all'inglese, perché i dati di addestramento in inglese sono molto più abbondanti. E sui dialetti o sugli accenti regionali marcati il calo è netto.

Il difetto da conoscere: le allucinazioni

Questo è il punto che quasi nessuno racconta, ed è il più importante.

Un sistema moderno di trascrizione, quando non capisce, non lascia un buco: inventa testo plausibile. Su un silenzio prolungato, su un rumore ambiguo, su una frase inudibile, può produrre frasi complete e grammaticalmente corrette che nessuno ha mai pronunciato.

È lo stesso meccanismo delle allucinazioni dell'AI: il modello ottimizza la plausibilità della sequenza, non la fedeltà a ciò che ha sentito.

Il pericolo sta nel fatto che l'errore non si vede. Una trascrizione con una parola sbagliata la noti; una frase inventata che scorre bene, no.

Le conseguenze pratiche:

  • Rileggi sempre, soprattutto i punti dove l'audio era difficile
  • Diffida delle porzioni troppo scorrevoli in corrispondenza di passaggi confusi
  • Su materiale che conta — verbali, interviste giornalistiche, atti, documentazione clinica — la trascrizione automatica è una bozza, mai un documento finale

A cosa serve

Sottotitoli. Il caso d'uso più diffuso, e quello con il ritorno migliore: rende i contenuti accessibili e fruibili senza audio.

Verbali di riunione. Con l'avvertenza sopra: ottima base, da rivedere.

Interviste e ricerca. Trascrivere per poi analizzare, senza fare tutto a mano.

Archivi audio ricercabili. Trascrivere podcast e registrazioni li rende cercabili per parola — spesso il vero valore dell'operazione.

Riutilizzo dei contenuti. Da un video a un articolo, da un podcast a una newsletter.

Dettatura. Scrivere parlando, con revisione successiva.

SEO sui contenuti audio e video. I motori non ascoltano: leggono. Una trascrizione pubblicata rende indicizzabile un contenuto che altrimenti sarebbe opaco — vale la pena tenerlo presente quando si ragiona di contenuti e posizionamento.

Le funzioni che contano nella scelta

Al di là dell'accuratezza grezza, sono queste a determinare se uno strumento ti serve davvero:

Diarizzazione — identificare chi parla, separando gli interventi. Indispensabile per riunioni e interviste, ed è la funzione con la qualità più variabile tra un servizio e l'altro.

Timestamp — marcatori temporali per parola o per frase. Necessari per i sottotitoli.

Vocabolario personalizzato — poter fornire in anticipo nomi propri, marchi e termini tecnici. È spesso ciò che sposta di più il risultato su contenuti specialistici.

Punteggiatura automatica — un muro di testo senza punti è quasi inutilizzabile.

Riconoscimento della lingua e gestione del cambio di lingua a metà discorso.

Esecuzione in locale — esistono modelli aperti eseguibili sul proprio hardware, con la stessa logica descritta in far girare un LLM in locale. Rilevante quando l'audio contiene dati riservati.

Come ottenere risultati migliori

Lavora sulla qualità dell'audio, prima di tutto il resto. È l'intervento con il rapporto costo-beneficio più alto in assoluto: un microfono decente a venti centimetri dalla bocca migliora la trascrizione più di qualunque scelta di software.

Un microfono per persona, nelle riunioni. Le voci sovrapposte sono il caso peggiore, e nessun modello le risolve bene.

Riduci il rumore prima, se l'audio è già registrato.

Fornisci il vocabolario specifico se lo strumento lo permette: nomi dei partecipanti, terminologia del settore, sigle.

Indica la lingua esplicitamente. Il riconoscimento automatico sbaglia soprattutto sulle prime frasi o su audio con termini stranieri.

Rileggi con l'audio a fianco, almeno nei punti critici.

Una nota sulla privacy

L'audio di una riunione contiene le voci e le parole di persone che non hanno necessariamente acconsentito a farle passare da un servizio esterno.

Due cose da considerare: la registrazione richiede il consenso dei partecipanti, e caricare quell'audio su un servizio di terze parti è un trattamento di dati che va valutato — a maggior ragione se si parla di clienti, dipendenti o dati sensibili. Su materiale riservato, un modello eseguito in locale risolve il problema alla radice.

In sintesi

Lo speech-to-text converte parlato in testo, e i sistemi attuali — addestrati da un capo all'altro e capaci di usare il contesto — hanno raggiunto un'accuratezza che rende la trascrizione manuale difficile da giustificare.

Resta però un limite da non ignorare: quando non capisce, il modello inventa testo plausibile invece di segnalare un buco. Su materiale che conta, la trascrizione automatica è un punto di partenza da rileggere, non un documento finale.

E la leva più efficace per migliorare i risultati non è il software: è la qualità dell'audio in ingresso. Un buon microfono vale più di qualsiasi confronto tra servizi.