Ricevere una nota vocale concitata da un collega o una telefonata da un familiare che chiede denaro urgente non è più garanzia di autenticità. Oggi bastano pochi secondi di campionamento vocale per addestrare modelli text-to-speech capaci di clonare timbro e inflessioni.
Per capire se un audio o una voce sono generati con l’IA bisogna analizzare anomalie nella respirazione, sfasature di frequenza nelle consonanti sibilanti e cadenze innaturali. Di fronte a telefonate sospette, il riscontro decisivo non è tecnologico: basta interrompere la chiamata e ricontattare la persona su un canale verificato o fare una domanda personale a trabocchetto.

Gli indizi acustici: dove falliscono i modelli text-to-speech
I motori di clonazione neurale (da ElevenLabs a Vall-E) ricostruiscono la forma d’onda assemblando frammenti statistici. Questa sintesi lascia quasi sempre micro-difetti sonori percepibili con un buon paio di cuffie da studio.
- ChatGPT: conversazione troppo lunga, cosa fare per sbloccarla e non perdere il lavoro
- L’effetto “recensione perfetta”: perché continuiamo a fidarci dei commenti online (anche quando sospettiamo di essere ingannati)
- Stiamo usando l’AI per evitare piccole decisioni quotidiane?
Il primo elemento da ascoltare sono gli atti respiratori. Una persona reale prende fiato a intervalli legati alla lunghezza della frase e alla tensione emotiva; l’audio sintetico spesso inserisce respiri a volume piatto prima di ogni virgola, oppure produce frasi di quaranta parole senza un singolo consumo d’aria.
Un altro punto debole riguarda le consonanti fricative e sibilanti (s, z, sc) e le labiali esplosive (p, b). Nei file sintetizzati tendono a manifestarsi con un leggero sibilo metallico o con troncature nette, note come artefatti di fase. Chi ascolta distrattamente da uno smartphone li scambia per disturbi della linea telefonica, ma a un ascolto isolato la voce appare priva del calore tipico delle armoniche basse della cavità toracica.
Analisi tecnica: spettrogramma e compressione del file
Quando l’ascolto a orecchio lascia dubbi, il controllo visivo della traccia rivela ciò che l’algoritmo ha mascherato:
- Taglio netto delle frequenze superiori: molti modelli di clonazione operano a una frequenza di campionamento di 22.050 Hz o 24.000 Hz per ridurre il costo computazionale. In uno spettrogramma (visualizzabile con software gratuiti come Audacity), questo si traduce in un blocco orizzontale netto sopra gli 11-12 kHz, anomalo per un microfono moderno.
- Silenzio digitale assoluto: nelle pause tra una parola e l’altra, una registrazione dal vivo contiene rumore di fondo della stanza (room tone). L’audio generato presenta spesso tratti a -infinito dB, cioè silenzio digitale puro, a meno che chi ha generato la traccia non abbia aggiunto artificialmente un fruscio di sottofondo per simulare realismo.
- Micro-intonazione piatta: il parlato umano presenta oscillazioni involontarie del tono (jitter) e del volume (shimmer). La voce generata tende a una regolarità statistica che il nostro cervello percepisce istintivamente come finta o priva di presenza fisica.
Nella pratica, il problema nasce quando il truffatore applica compressioni pesanti o fa passare l’audio attraverso una chiamata GSM o un vocale WhatsApp a 16 kbit/s. La compressione distruttiva cancella gli artefatti di sintesi insieme ai dettagli acustici originali, rendendo i software automatici di rilevamento poco affidabili e soggetti a falsi positivi.
Protocolli operativi contro le truffe del finto familiare o dirigente
Se l’audio ricevuto contiene una richiesta insolita di denaro, codici di verifica bancari o cambi di coordinate IBAN, affidarsi solo all’analisi del timbro è un errore grave. I protocolli di sicurezza non si basano sulla perizia fonica in tempo reale, ma sulla gestione del canale:
- La domanda di controllo contestuale: chiedi un dettaglio non reperibile online (né su social, né su archivi pubblici), ad esempio: “Qual è il nome del ristorante dove siamo stati sabato?” oppure “Cosa abbiamo regalato a Marco per i suoi trent’anni?”. I bot vocali che operano in tempo reale non sanno gestire deviazioni improvvise dal copione senza mostrare latenze di risposta visibili (oltre 1,5-2 secondi di vuoto).
- La riagganciata strategica: chiudi la telefonata sostenendo che la linea è disturbata. Richiama il numero reale salvato in rubrica, non il numero dal quale è arrivata la chiamata (spesso frutto di spoofing dell’ID chiamante).
- La parola d’ordine di famiglia o aziendale: concordare una frase segreta per validare disposizioni urgenti o insolite azzera il rischio di clonazione vocale, rendendo irrilevante quanto fedele sia il timbro replicato.
Domande frequenti
Esistono app affidabili per riconoscere una voce creata con l’IA?
I tool online di rilevamento vocale non offrono garanzie assolute. Se la traccia è compressa o registrata tramite telefono, il tasso di falsi positivi e falsi negativi è elevato; non devono mai essere usati come unica prova per decisioni legali o finanziarie.
Quanti secondi di registrazione servono per clonare una voce?
Ai modelli moderni basati su architetture zero-shot bastano tra i 3 e i 10 secondi di parlato pulito per catturare le caratteristiche timbriche essenziali di un individuo ed emettere nuove frasi a comando.
Come distinguere una voce IA durante una telefonata dal vivo?
Fai attenzione a pause anomale superiori a un secondo prima di risposte banali, all’assenza di sovrapposizioni naturali del parlato e all’incapacità dell’interlocutore di replicare a interruzioni brusche o battute fuori contesto.
La corsa tra algoritmi di sintesi vocale e strumenti di detection è persa in partenza se ci si affida solo all’orecchio: man mano che i modelli integrano respiro adattivo e armoniche credibili, l’unica vera protezione consiste nell’introdurre procedure di validazione secondaria per qualsiasi azione critica.
Fonti consultate:

