WEBINAR / 8 Ottobre
Cybersicurezza e Intelligenza Artificiale: le richieste della Vigilanza


Comunicazioni BCE, ESAs, Banca d’Italia e IVASS

ZOOM MEETING
Offerte per iscrizioni entro il 18/09


WEBINAR / 8 Ottobre
Cybersicurezza e Intelligenza Artificiale: le richieste della Vigilanza
www.dirittobancario.it
Flash News

Banca d’Italia: microdati sintetici per dati panel

22 Settembre 2026
Di cosa si parla in questo articolo

La Banca d’Italia ha pubblicato lo studio intitolato “Generating and validating synthetic unbalanced panel data: evidence from Italian firm microdata“, all’interno della collana Questioni di Economia e Finanza, n. 1056, che sviluppa e valuta un articolato quadro metodologico orientato alla generazione di microdati sintetici (synthetic microdata).

Tali dati sono destinati all’Indagine sulle imprese industriali e dei servizi (INVIND), un ampio dataset di imprese italiane osservate nell’arco temporale compreso tra il 1993 e il 2024.

L’obiettivo primario della ricerca risiede nell’estendere le metodologie di generazione dei dati sintetici — tradizionalmente concepite e sviluppate per contesti d’analisi di tipo trasversale (cross-sectional) — alle strutture di dati panel, affrontando direttamente la gestione delle dinamiche longitudinali e della natura non bilanciata delle rilevazioni.

Al fine di gestire orizzonti temporali eterogenei, la procedura adottata dallo studio distingue la popolazione aziendale tra storie aziendali brevi e lunghe. L’operazione di sintetizzazione riguarda alcune variabili chiave della rilevazione:

  • l’area geografica di insediamento dell’impresa
  • il settore di attività economica
  • il livello di occupazione aziendale
  • il fatturato complessivo prodotto.

Sotto il profilo della tecnica di stima, lo studio della Banca d’Italia mette a confronto due diverse strategie per la generazione dei dati sintetici:

  • un approccio di modellazione sequenziale basato su alberi di classificazione e regressione (Classification and Regression TreesCART);
  • una strategia di modellazione congiunta che impiega il metodo delle copule gaussiane (Gaussian copulas).

La valutazione della qualità del dataset sintetico risultante viene condotta tenendo conto di molteplici dimensioni analitiche:

  • la capacità di riproduzione delle distribuzioni univariate e condizionate
  • la stabilità delle relazioni strutturali multivariate
  • la quantificazione del rischio di ri-identificazione (re-identification risk) delle singole imprese.

Dalle evidenze emerse nello studio si rileva che sia gli approcci basati su alberi CART sia quelli basati su copule gaussiane riproducono con elevata fedeltà le distribuzioni empiriche e le relazioni multivariate dei dati originali.

Sotto il profilo della mitigazione dei rischi di riservatezza, viene evidenziato che l’iniezione di un errore di misurazione controllato (controlled measurement error) aumenta la protezione contro il pericolo di ri-identificazione. In tale contesto, il metodo di modellazione sequenziale basato su alberi (CART) si dimostra il più robusto nel preservare la validità analitica dei dati.

Di cosa si parla in questo articolo

WEBINAR / 8 Ottobre
Cybersicurezza e Intelligenza Artificiale: le richieste della Vigilanza


Comunicazioni BCE, ESAs, Banca d’Italia e IVASS

ZOOM MEETING
Offerte per iscrizioni entro il 18/09


WEBINAR / 15 Ottobre
Conto di base: le nuove aspettative di Vigilanza


Prossime scadenze 30 novembre 2026

ZOOM MEETING
Offerte per iscrizioni entro il 25/09

Iscriviti alla nostra Newsletter