Radio Blinko Blanko All articles
Podcast & Audio

La tua voce non è più tua: il lato oscuro dei cloni vocali nell'era dell'IA

Radio Blinko Blanko
La tua voce non è più tua: il lato oscuro dei cloni vocali nell'era dell'IA

Photo: After Katsushika Hokusai, Public domain, via Wikimedia Commons

C'è un esperimento mentale che facciamo spesso qui a Radio Blinko Blanko durante le riunioni di redazione (sì, le facciamo davvero, non siamo solo un gatto che cammina su una tastiera). L'esperimento è questo: se sentissi la voce di Lucio Battisti cantare una canzone inedita, con quel timbro inconfondibile, quella pronuncia leggermente nasale, quella malinconia appiccicata alle vocali — la riconosceresti come falsa?

La risposta onesta, nel 2024, è: probabilmente no.

E questo dovrebbe tenerci svegli la notte.

Cos'è esattamente un deepfake audio

Il termine deepfake è nato nel mondo dell'immagine — quei video manipolati dove il volto di una persona viene sovrapposto a quello di un'altra con risultati inquietanti. Ma la versione audio è, per certi versi, ancora più insidiosa. Perché la voce è qualcosa di profondamente intimo. È il modo in cui riconosciamo le persone al telefono nel buio, è quello che ci manca dei morti, è la firma biologica che portiamo dentro dalla nascita.

La sintesi vocale basata su intelligenza artificiale generativa funziona così: prendi campioni audio di una voce reale — possono essere anche pochi minuti di registrazione — e li usi per addestrare un modello che impara a riprodurre quella voce su qualsiasi testo o melodia. Il risultato è una copia che non è un'imitazione artigianale: è una replica statistica, costruita sui pattern profondi del parlato originale.

Strumenti come ElevenLabs, Vall-E di Microsoft o RVC (Retrieval-based Voice Conversion) sono già accessibili al grande pubblico. Alcuni sono gratuiti. Alcuni richiedono competenze tecniche minime. Alcuni, semplicemente, spaventano.

I casi che hanno fatto discutere (anche in Italia)

Non siamo nel territorio dell'ipotetico. I casi reali si moltiplicano.

A livello internazionale, il caso più clamoroso è stato quello del brano Heart on My Sleeve pubblicato nel 2023, che usava voci sintetizzate di Drake e The Weeknd in modo così convincente da raggiungere milioni di stream prima di essere rimosso. La Universal Music Group ha reagito con una lettera aperta alle piattaforme. Ma la canzone era già nell'orecchio di tutti.

In Italia il fenomeno è meno documentato pubblicamente, ma chi lavora nel mondo dell'audio — speaker radiofonici, doppiatori, podcaster — ha già iniziato ad alzare la voce. Ci sono stati casi di voci di speaker italiani usate senza consenso per spot pubblicitari generati automaticamente, di imitazioni vocali di artisti italiani circolate su TikTok come se fossero materiale ufficiale, di account fake che usano voci sintetizzate per impersonare creator reali.

"Ho sentito una versione di me stesso che diceva cose che non avrei mai detto," ci ha raccontato — off the record — un noto podcaster italiano. "La cosa più strana non era la voce in sé. Era che suonava come me. Come se mi stessi ascoltando da fuori."

Il problema etico: chi possiede una voce?

Qui si apre un baratro giuridico e filosofico di proporzioni bibliche.

Dal punto di vista legale, in Italia e in Europa, la situazione è nebulosa. Il GDPR tutela i dati personali, e la voce può essere considerata un dato biometrico — ma le interpretazioni variano. Il Regolamento europeo sull'IA (AI Act), approvato nel 2024, introduce alcune tutele, ma l'applicazione concreta richiederà anni.

Dal punto di vista etico, la questione è ancora più spinosa. Se un artista è morto, chi può autorizzare l'uso della sua voce sintetizzata? Gli eredi? La casa discografica? Nessuno? E se è vivo ma non vuole essere clonato digitalmente — ha diritto a non esserlo? (La risposta intuitiva è sì. La risposta tecnica è: dipende da quanti campioni audio pubblici esistono di lui.)

C'è poi il problema del consenso informato degli ascoltatori. Se ascolti una canzone e non sai che la voce è sintetica, stai vivendo un'esperienza autentica? Stai connettendo con un artista reale? O stai semplicemente reagendo a un pattern acustico ben costruito?

L'industria musicale tra terrore e opportunità

Le major discografiche sono in una posizione paradossale: da un lato temono la clonazione non autorizzata dei loro artisti, dall'altro stanno investendo massicciamente nelle stesse tecnologie per creare nuovi prodotti, risuscitare cataloghi vintage, ridurre i costi di produzione.

Sony, Universal e Warner hanno tutte divisioni dedicate all'IA applicata alla musica. Alcune hanno già sperimentato con voci sintetizzate di artisti deceduti — con risultati commercialmente interessanti e moralmente discutibili.

Il rischio concreto, come lo vedono i sindacati dei musicisti e i collettivi di artisti indipendenti, è una doppia corsia: da un lato le grandi aziende che monetizzano l'IA con il consenso (pagato) degli artisti famosi; dall'altro una proliferazione caotica di cloni non autorizzati che erode il valore della voce come strumento di identità e lavoro.

Cosa significa per chi ascolta

Per noi, ascoltatori comuni, la domanda pratica è: come facciamo a sapere cosa è reale?

Al momento, non esiste uno standard universale di certificazione per i contenuti audio. Non c'è equivalente dell'etichetta "biologico" per la musica generata dall'IA. Alcune piattaforme stanno iniziando a introdurre tag di disclosure, ma l'adozione è frammentata e volontaria.

La soluzione, paradossalmente, potrebbe venire proprio da quella cultura dell'ascolto umano e curato di cui parlavamo nell'altro articolo. Una radio indipendente che conosci, un podcaster di cui segui il percorso da anni, una community dove le persone si responsabilizzano reciprocamente: questi sono contesti dove la fiducia è costruita nel tempo, non delegata a un sistema di verifica automatica.

Il futuro dell'autenticità sonora

Non siamo pessimisti, qui a Radio Blinko Blanko. Le tecnologie sono strumenti, e gli strumenti dipendono da chi li usa e come.

Ma siamo convinti che l'autenticità — quella vera, quella che senti quando una voce ti arriva dritta allo stomaco — non sia riproducibile algoritmicamente. Non ancora. Forse mai del tutto. Perché la voce umana non è solo frequenze e pattern: è storia, è corpo, è una vita intera compressa in pochi millisecondi di suono.

Quando Morgan canta stonato in diretta, quando Fiorella Mannoia incrinates la voce su una nota difficile, quando un podcaster ride di una cosa stupida che ha appena detto — quello non è un bug. È la prova che dall'altra parte c'è qualcuno.

Tenetelo a mente la prossima volta che ascoltate qualcosa e vi chiedete: ma è vero?

Probabilmente è la domanda più importante che possiamo farci, adesso.

All Articles

Related Articles

Cuffie e buio totale: i podcast horror che fanno tremare i muri (e non solo)

Cuffie e buio totale: i podcast horror che fanno tremare i muri (e non solo)

Basta algoritmi, torna l'umano: i giovani italiani che ascoltano musica senza essere spiati

Basta algoritmi, torna l'umano: i giovani italiani che ascoltano musica senza essere spiati

Il ronzio che ha conquistato il mondo: come l'ASMR è passato da fenomeno di nicchia a ossessione collettiva

Il ronzio che ha conquistato il mondo: come l'ASMR è passato da fenomeno di nicchia a ossessione collettiva