This research contributes to the emerging topic of Responsible AI by assessing the possibility that explainability via Shapley values can help improve the fairness assessment process in credit risk models. Previous studies have mostly concentrated on the use of group-based performance metrics to measure fairness. However, such approaches may be insufficient in providing a deeper understanding of the reasons behind discriminatory outcomes. In this research, Shapley values are used to investigate not only the existence of discrimination between various groups but also what features cause it. Moreover, the effect of using the Propensity Score Matching method as one of the techniques of reducing discrimination is assessed, thus allowing for the comparison of model behavior before and after the intervention. Using Logistic Regression, Random Forest, and Neural Network models on the HMDA data set, this research contributes to the overall goals of responsible AI by increasing transparency, promoting fair lending practices, and other considerations.

Questa ricerca contribuisce al crescente ambito della Responsible AI (Intelligenza Artificiale Responsabile) valutando se l'utilizzo dell'explainability attraverso i valori di Shapley possa migliorare il processo di valutazione dell'equità nei modelli di rischio di credito. Gli studi precedenti si sono concentrati principalmente sull'impiego di metriche di performance basate su gruppi per misurare l'equità. Tuttavia, tali approcci potrebbero non essere sufficienti a fornire una comprensione più approfondita delle cause alla base degli esiti discriminatori. In questa ricerca, i valori di Shapley vengono utilizzati non solo per individuare l'eventuale presenza di discriminazione tra diversi gruppi, ma anche per identificare le caratteristiche che la determinano. Inoltre, viene valutato l'effetto dell'impiego del metodo del Propensity Score Matching (PSM) come tecnica per ridurre la discriminazione, consentendo di confrontare il comportamento dei modelli prima e dopo l'intervento. Attraverso l'applicazione dei modelli di Regressione Logistica, Random Forest e Reti Neurali al dataset HMDA, questa ricerca contribuisce agli obiettivi dell'Intelligenza Artificiale Responsabile, promuovendo una maggiore trasparenza, pratiche di concessione del credito più eque e un utilizzo più responsabile dei sistemi di intelligenza artificiale.

Can Shapley – Value – Based Explainability Be Used To Assess Fairness In Credit Risk Models using the HMDA Dataset?

ZAKARIA, JANA
2025/2026

Abstract

This research contributes to the emerging topic of Responsible AI by assessing the possibility that explainability via Shapley values can help improve the fairness assessment process in credit risk models. Previous studies have mostly concentrated on the use of group-based performance metrics to measure fairness. However, such approaches may be insufficient in providing a deeper understanding of the reasons behind discriminatory outcomes. In this research, Shapley values are used to investigate not only the existence of discrimination between various groups but also what features cause it. Moreover, the effect of using the Propensity Score Matching method as one of the techniques of reducing discrimination is assessed, thus allowing for the comparison of model behavior before and after the intervention. Using Logistic Regression, Random Forest, and Neural Network models on the HMDA data set, this research contributes to the overall goals of responsible AI by increasing transparency, promoting fair lending practices, and other considerations.
2025
Can Shapley – Value – Based Explainability Be Used To Assess Fairness In Credit Risk Models using the HMDA Dataset?
Questa ricerca contribuisce al crescente ambito della Responsible AI (Intelligenza Artificiale Responsabile) valutando se l'utilizzo dell'explainability attraverso i valori di Shapley possa migliorare il processo di valutazione dell'equità nei modelli di rischio di credito. Gli studi precedenti si sono concentrati principalmente sull'impiego di metriche di performance basate su gruppi per misurare l'equità. Tuttavia, tali approcci potrebbero non essere sufficienti a fornire una comprensione più approfondita delle cause alla base degli esiti discriminatori. In questa ricerca, i valori di Shapley vengono utilizzati non solo per individuare l'eventuale presenza di discriminazione tra diversi gruppi, ma anche per identificare le caratteristiche che la determinano. Inoltre, viene valutato l'effetto dell'impiego del metodo del Propensity Score Matching (PSM) come tecnica per ridurre la discriminazione, consentendo di confrontare il comportamento dei modelli prima e dopo l'intervento. Attraverso l'applicazione dei modelli di Regressione Logistica, Random Forest e Reti Neurali al dataset HMDA, questa ricerca contribuisce agli obiettivi dell'Intelligenza Artificiale Responsabile, promuovendo una maggiore trasparenza, pratiche di concessione del credito più eque e un utilizzo più responsabile dei sistemi di intelligenza artificiale.
File in questo prodotto:
File Dimensione Formato  
Final Thesis.pdf

accesso aperto

Descrizione: Using 2017 HMDA mortgage loan data, this study investigates whether fairness in credit risk models may be evaluated using Shapley-value-based explainability. Logistic Regression, Random Forest, and Neural Network models are compared in the analysis, with
Dimensione 13.49 MB
Formato Adobe PDF
13.49 MB Adobe PDF Visualizza/Apri

È consentito all'utente scaricare e condividere i documenti disponibili a testo pieno in UNITESI UNIPV nel rispetto della licenza Creative Commons del tipo CC BY NC ND.
Per maggiori informazioni e per verifiche sull'eventuale disponibilità del file scrivere a: [email protected].

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.14239/36840