Aprendizado federado para estimar renda de tomadores de crédito com dados restritos
Resumo
O documento apresenta uma abordagem de aprendizado federado para estimar a renda de tomadores de crédito quando os credores não podem combinar registros brutos de solicitantes. As instituições treinam um modelo compartilhado enquanto mantêm os dados localmente. A avaliação simula um consórcio de clientes estaduais que usa registros históricos de crédito e compara as estimativas federadas com modelos agregados e modelos treinados apenas localmente em observações posteriores.
No geral, o desempenho federado fica próximo da referência agregada, e os clientes com poucos dados superam essa referência em média neste cenário. O estudo também conclui que o treinamento federado supera o treinamento apenas local em todos os grupos de tamanho de cliente, com as maiores melhorias para aqueles com menos dados. Ele combina estimativas de renda com limites de endividamento em relação à renda específicos por estado e faixa de renda em uma análise retrospectiva de aprovações, relatando mais aprovações simuladas com mudanças modestas na inadimplência observada. Os resultados dependem desse conjunto de dados, da divisão dos clientes e do desenho da avaliação; a análise não demonstra que as mudanças nas aprovações ocorreriam em operações reais de concessão de crédito ou em outras populações.
Ideias principais
- O aprendizado federado permite que instituições treinem um estimador de renda compartilhado enquanto mantêm os registros dos tomadores de crédito localmente.
- A avaliação compara modelos federados com treinamento agregado e treinamento local em cada instituição.
- Clientes com poucos dados têm os benefícios mais claros em relação à estimação apenas local.
- Estimativas federadas são combinadas com limites de endividamento em relação à renda personalizados em uma análise retrospectiva de aprovações.
- Os resultados relatados são específicos dos dados históricos e do consórcio simulado.
Tags
Texto completo
# FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints # FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints Verified income is often unavailable in digital loan applications, forcing lenders to rely on reported income and potentially leading to over-lending, overly conservative offers, or rejection of creditworthy applicants. Cross-institutional data-sharing constraints make this problem especially difficult for smaller lenders with limited training data. We introduce FedIncome, a federated learning framework for income estimation that enables institutions to train a shared model without pooling raw borrower records. Using more than one million LendingClub loans partitioned into $50$ state-level clients, we simulate a heterogeneous lending consortium. The best federated model achieves out-of-time $R^2=0.608$, compared with $0.619$ for a pooled centralised benchmark. Small-sample clients obtain an average out-of-time $R^2$ improvement of $3.8$ percentage points relative to the pooled centralised benchmark, while the fitted client-level relationship places the empirical crossover at approximately $4,790$ training observations in this setting. When pooling is infeasible and the relevant alternative is local-only training, federation improves out-of-time performance across all sample-size groups, with the largest gains for data-scarce clients. We also combine federated income estimates with state- and income-specific debt-to-income thresholds. In a retrospective decision analysis, replacing reported income with the federated estimate increases simulated approval rates with only modest changes in observed default rates. FedIncome supports collaborative learning under data-locality constraints with little aggregate loss relative to pooled training and larger gains relative to local-only estimation.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.