Dados Sintéticos
Inteligência Artificial
Machine Learning
Dados
Governança

Dati sintetici per l'addestramento all'intelligenza artificiale: vantaggi reali e rischio di collasso del modello

Quando e come utilizzare i dati sintetici per addestrare e migliorare i modelli di intelligenza artificiale, con attenzione ai pregiudizi ereditati e al collasso del modello che impara dalla propria imitazione.

Dati sintetici per l'addestramento all'intelligenza artificiale: vantaggi reali e rischio di collasso del modello

Quasi tutti i progetti di intelligenza artificiale ad un certo punto si scontrano con lo stesso muro: dati mancanti. Mancano esempi dei rari casi che contano di più. Mancano le etichette perché l’etichettatura è costosa e lenta. Mancanza di volume per la classe sottorappresentata su cui il modello sbaglia proprio perché non ha visto abbastanza. I dati esistono in teoria, ma non nella quantità e qualità che il problema richiede.

I dati sintetici arrivano come un modo per alleviare questa carenza. Invece di aspettare che il mondo produca più esempi, generi esempi che seguono la struttura di quelli reali. L’idea è seducente e, in molti casi, funziona. Ma comporta un rischio specifico, e coloro che guidano l’intelligenza artificiale devono comprendere questo rischio prima di scommettere su di esso sulle prestazioni del modello.

Perché mancano i dati e in che modo i dati sintetici aiutano

Ci sono tre carenze che appaiono frequentemente.

Il primo è il volume. I modelli moderni richiedono molti esempi e non tutti i problemi hanno una lunga storia. Un nuovo prodotto, un piccolo mercato, una lingua specifica, tutto questo inizia con pochi dati.

La seconda è l'etichetta. Hai anche i dati, ma non scritti. Sapere quali immagini contengono un difetto, quali testi sono reclami, quali transazioni sono frodi, dipende da un costoso lavoro umano. Il dato sintetico può nascere già etichettato, perché sai cosa ha generato.

Il terzo è l'equilibrio. In molti problemi, la classe che conta di più è la più rara. La frode è rara, i guasti alle apparecchiature sono rari, le malattie specifiche sono rare. Il modello impara male ciò che vede poco. La generazione di esempi sintetici della classe rara aiuta a bilanciare la formazione.

I dati sintetici li attaccano tutti e tre. Generi volume, generi con un'etichetta conosciuta e generi più esempi dove ne hai bisogno. In ambiti come la visione artificiale, è comune addestrare parte del modello con scene generate artificialmente, controllando l'illuminazione, l'angolazione e la variazione in un modo che il mondo reale non offre gratuitamente. I dati sono artificiali, ma ciò che il modello apprende da essi può essere trasferito alla realtà.

Le vincite che giustificano la scommessa

Quando funziona, il ritorno si manifesta su fronti concreti.

Riduci il tempo di inizio. Invece di aspettare mesi per accumulare dati reali, inizia ad allenarti con una base sintetica e migliora man mano che arrivano i dati reali.

Copri il caso raro. Lo scenario che non appare quasi mai, ma che quando appare è costoso, può essere generato appositamente, in volume, in modo che il modello possa imparare a riconoscerlo.

Aggiri la barriera della privacy. Laddove i dati reali sono troppo sensibili per alimentare la formazione, una versione sintetica apre la strada, un argomento che affronto in dati sintetici come strumento per la privacy.

Ottieni il controllo su ciò che vede il modello. Invece di accettare le distorsioni nei dati raccolti, in teoria puoi generare un insieme più equilibrato che sia più rappresentativo di ciò che vuoi che il modello impari.

Quest’ultimo vantaggio, il controllo, è anche il luogo in cui si trova la trappola. Perché controllare ciò che vede il modello aiuta solo se lo controlli nella giusta direzione.

Il rischio centrale: il collasso del modello

C’è un fenomeno che ogni leader dell’IA dovrebbe conoscere per nome: il collasso del modello. Succede quando i modelli iniziano ad essere addestrati, ciclo dopo ciclo, con dati generati da altri modelli, invece che con dati reali.

La logica del problema è semplice. Ogni generatore è un'approssimazione imperfetta della realtà. Cattura bene il centro della distribuzione, i casi comuni, e coglie male i margini, i casi rari e la vera varietà dei dati. Quando addestri un nuovo modello con l'output di uno precedente, apprende questa versione già impoverita. Generare di nuovo, allenarsi di nuovo e con ogni ciclo la diversità si riduce. I bordi scompaiono per primi. Nel corso del tempo, il modello converge in una versione ristretta e fiduciosa di se stesso, sempre più lontana dalla ricchezza del mondo reale.

Il sintomo è insidioso perché, in un primo momento, i parametri potrebbero addirittura sembrare buoni. Il modello colpisce con facilità l'ordinario. Ma perde la coda, perde il caso raro, perde la capacità di affrontare l'imprevisto. E il caso raro è di solito proprio ciò che conta nella produzione.

Questo rischio non richiede uno scenario estremo “solo dati sintetici” per manifestarsi. Basta che il sintetico domini la formazione, o sia generato da un modello che ha ereditato i difetti di un altro, perché il degrado cominci ad accumularsi.

Bias ereditato: il sintetico amplifica ciò che riceve

Anche prima del collasso, c’è un problema più immediato: i pregiudizi. Un generatore impara da dati reali. Se i dati reali sono distorti, e quasi tutti i dati reali lo sono, il generatore apprende tale distorsione e la riproduce in ciò che crea.

Peggio ancora: può amplificare. Se una base sottorappresenta un gruppo, il modello generatore tende a rappresentarlo ancora peggio, perché ha visto meno esempi per apprenderne la variazione. I dati sintetici risultanti appaiono neutrali, appaiono "puliti", ma portano con sé lo stesso squilibrio dell'originale, ora con l'apparenza di qualcosa di nuovo e controllato.

Questo è un rischio ben nascosto. I dati sintetici sembrano oggettivi. Nessuno vede lì il CPF di una persona reale, quindi la falsa sensazione è che il problema dei pregiudizi sia alle nostre spalle. Non è rimasto. Addestrare l’intelligenza artificiale con dati sintetici distorti sta insegnando al modello a commettere errori sistematicamente, con il vantaggio perverso di apparire più pulito di quello che è.

##Come usarlo senza commettere errori

La regola che ripeto al team è che il dato sintetico integra il reale, non lo sostituisce in chiusura. Alcune pratiche che supportano questo.

Mantieni i dati reali nel loop. Usa il sintetico per aumentare e bilanciare l'allenamento, ma convalidalo e calibralo sempre rispetto ai dati reali. Il reale è l'ancora che impedisce al modello di andare alla deriva verso la propria imitazione.

Mescolare con proporzione consapevole. Trattare la frazione di dati sintetici nella formazione come un parametro decisionale, e non come un dettaglio, aiuta a evitare che prevalga senza che nessuno abbia deciso.

Valutare nel reale, non nel sintetico. La prestazione che conta è quella che appare quando il modello si confronta con i dati di produzione reali. Buoni parametri in un insieme sintetico potrebbero semplicemente confermare la parzialità del generatore.

Guarda la coda. Guarda in particolare ai casi rari e ai gruppi minoritari. È qui che il collasso e la parzialità colpiscono per primi, ed è qui che il monitoraggio deve essere più attento. La stessa cautela nel non fidarsi ciecamente dell'output del modello si applica al codice, come discusso in fidarsi del codice generato dall'intelligenza artificiale.

Documentare l'origine dei dati. Sapere quale parte della formazione era reale e quale sintetica, e tramite quale generatore, è ciò che ti permette di indagare quando qualcosa va storto. Senza tracciabilità, non è possibile distinguere un problema relativo ai dati da un problema relativo al modello.

La decisione di chi guida

I dati sintetici per la formazione dell’intelligenza artificiale sono una leva legittima e, in molti casi, fanno la differenza tra un progetto fattibile e un progetto frenato dalla mancanza di dati. Ma è una leva che richiede mano ferma.

La domanda che il leader deve porsi non è “possiamo generare dati?”, ma piuttosto “convalidiamo che questi dati migliorano il modello nel mondo reale, senza ereditare pregiudizi o impoverire la diversità?”. Se la risposta arriva con misurazioni e dati reali nel circuito, il sintetico è un alleato. Se arriva con entusiasmo e senza prove, è un debito che scade in produzione, nel momento peggiore possibile.

Inizia a trattare i dati sintetici come parte dell'esperimento, non come una scorciatoia. Definire l'ipotesi, misurarla con la realtà e solo dopo decidere di espanderla. Il modello che metti in produzione porta con sé tutto ciò che gli hai insegnato, compreso ciò che non ti rendevi conto di avergli insegnato.

Leggi anche