Aprendizaje federado para estimar ingresos de prestatarios con datos limitados
Resumen
El documento presenta un enfoque de aprendizaje federado para estimar los ingresos de los prestatarios cuando los prestamistas no pueden combinar los registros originales de los solicitantes. Las instituciones entrenan un modelo compartido mientras mantienen los datos localmente. La evaluación simula un consorcio de clientes por estado que usa registros históricos de préstamos y compara las estimaciones federadas con modelos agrupados y modelos entrenados solo localmente en observaciones posteriores.
En conjunto, el rendimiento federado se acerca al referente agrupado, y en este contexto los clientes con pocos datos superan ese referente en promedio. El estudio también concluye que el aprendizaje federado supera al entrenamiento solo local en todos los grupos por tamaño de cliente, con las mayores mejoras para quienes tienen menos datos. Combina estimaciones de ingresos con límites de deuda sobre ingresos específicos por estado e ingresos en un análisis retrospectivo de aprobaciones, y comunica más aprobaciones simuladas con cambios modestos en los impagos observados. Los resultados dependen de este conjunto de datos, la división de clientes y el diseño de la evaluación; el análisis no demuestra que los cambios en las aprobaciones se mantendrían en préstamos reales o en otras poblaciones.
Ideas clave
- El aprendizaje federado permite que las instituciones entrenen un estimador de ingresos compartido mientras conservan localmente los registros de los prestatarios.
- La evaluación compara modelos federados con modelos agrupados y con modelos entrenados en cada institución.
- Los clientes con pocos datos obtienen los beneficios más claros frente a la estimación solo local.
- Las estimaciones federadas se combinan con límites de deuda sobre ingresos adaptados en un análisis retrospectivo de aprobaciones.
- Los resultados comunicados corresponden a los datos históricos y al consorcio simulado.
Etiquetas
Texto completo
# FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints # FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints Verified income is often unavailable in digital loan applications, forcing lenders to rely on reported income and potentially leading to over-lending, overly conservative offers, or rejection of creditworthy applicants. Cross-institutional data-sharing constraints make this problem especially difficult for smaller lenders with limited training data. We introduce FedIncome, a federated learning framework for income estimation that enables institutions to train a shared model without pooling raw borrower records. Using more than one million LendingClub loans partitioned into $50$ state-level clients, we simulate a heterogeneous lending consortium. The best federated model achieves out-of-time $R^2=0.608$, compared with $0.619$ for a pooled centralised benchmark. Small-sample clients obtain an average out-of-time $R^2$ improvement of $3.8$ percentage points relative to the pooled centralised benchmark, while the fitted client-level relationship places the empirical crossover at approximately $4,790$ training observations in this setting. When pooling is infeasible and the relevant alternative is local-only training, federation improves out-of-time performance across all sample-size groups, with the largest gains for data-scarce clients. We also combine federated income estimates with state- and income-specific debt-to-income thresholds. In a retrospective decision analysis, replacing reported income with the federated estimate increases simulated approval rates with only modest changes in observed default rates. FedIncome supports collaborative learning under data-locality constraints with little aggregate loss relative to pooled training and larger gains relative to local-only estimation.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.