I numeri di The Atlantic spingono colossi come Meta e YouTube verso la legalizzazione totale dei modelli di addestramento.
L'indagine firmata da Alex Reisner svela i dati precisi dei dataset protetti da copyright: nel mirino il catalogo di oltre 180.000 libri e milioni di canzoni utilizzati senza licenza.
Nel cuore della rivoluzione digitale che sta rimodellando la creazione sonora e testuale, il dibattito si è spostato dai laboratori di ricerca alle aule di tribunale, toccando il fulcro stesso della proprietà intellettuale. A fare luce su questa complessa area è stata una monumentale inchiesta giornalistica condotta da Alex Reisner per The Atlantic. L'indagine ha analizzato un dataset specifico e massiccio, rivelando come i modelli di intelligenza artificiale generativa di aziende leader come Meta, Bloomberg ed EleutherAI siano stati addestrati su una mole impressionante di opere protette, gettando le basi per le storiche cause legali che oggi vedono contrapposte le major della musica (tra cui Universal Music Group, Sony Music e Warner Music) e le tech firm.
Questo lavoro giornalistico non mette in discussione l'innovazione tecnologica, che rimane una delle frontiere più entusiasmanti per il futuro dell'intrattenimento, ma squarcia il velo sulla necessità di stabilire regole chiare attraverso dati incontrovertibili.
I dati dell'opacità: 183.000 opere nel database "Books3"
L'analisi dettagliata condotta da The Atlantic si è concentrata su una componente fondamentale del mega-dataset di addestramento chiamato The Pile: il sotto-insieme denominato Books3. I dati estratti da Reisner hanno rivelato la presenza di ben 183.000 libri di autori contemporanei, tutti protetti da copyright e inclusi illegalmente nel database pirata Bibliotik, da cui gli sviluppatori hanno attinto a piene mani.
Accanto al testo, l'indagine ha evidenziato l'inclusione di sterminati cataloghi di testi di canzoni, spartiti e trascrizioni musicali, quantificabili in milioni di stringhe di dati e tracce commerciali. Questo immenso archivio digitale ha permesso agli algoritmi di mappare non solo la struttura del linguaggio umano, ma anche le metriche, le armonie, le frequenze e le progressioni di accordi della musica pop, rock e indipendente globale. Secondo le stime incrociate con i dati della RIAA (Recording Industry Association of America), l'estensione di questi dataset copre una quota che varia tra l'1% e il 10% dell'intero patrimonio musicale digitale registrato.
La linea sottile tra apprendimento e violazione finanziaria
Il dibattito legale sollevato dall'indagine si gioca su un'interpretazione economica cruciale delle normative vigenti, in particolare sul concetto di Fair Use (uso legittimo) previsto dall'ordinamento statunitense. Da un lato, i difensori dei modelli di intelligenza artificiale sostengono che il software non esegua una copia atta alla pirateria. L'algoritmo analizza i pattern sonori e testuali per imparare i meccanismi della composizione, esattamente come farebbe uno studente di conservatorio.
Dall'altro lato, le major e le associazioni di categoria portano avanti i dati finanziari: l'utilizzo di questi milioni di opere senza il pagamento di una licenza preventiva configura, secondo le accuse, un danno economico miliardario. Per l'industria discografica ed editoriale, se un software genera un valore commerciale multimilionario partendo dal lavoro altrui, quel valore deve essere riconosciuto e ridistribuito all'origine ai legittimi creatori.
Verso un ecosistema collaborativo e sostenibile
Il merito principale dell'inchiesta di The Atlantic è l'aver accelerato una transizione che era comunque inevitabile, dimostrando che il futuro della tecnologia generativa risiede negli accordi alla luce del sole. Il mercato si sta muovendo rapidamente per sanare queste zone grigie: colossi come YouTube, Google e Meta hanno progressivamente avviato la stipula di accordi di licenza dal valore stimato di centinaia di milioni di dollari con i titolari dei diritti, creando canali legali per l'utilizzo dei cataloghi.
Parallelamente, l'industria sta assistendo alla nascita di modelli definiti "etici per design", addestrati esclusivamente su archivi di musica di pubblico dominio o su cataloghi i cui autori hanno espresso un consenso preventivo attraverso sistemi di opt-in. Come già accaduto in passato con l'avvento dello streaming, la definizione di nuove regole e la trasparenza sui dati non freneranno l'innovazione, ma permetteranno di costruire un mercato più equo, sicuro e sostenibile per tutti i suoi protagonisti.
Articolo di Manuel Cuda